4 Application à la SDR
Iván A. Carrillo et Alan F. Karr
Précédent | Suivant
Nous
utilisons pour l'application le jeu de données restreint de la SDR, aux termes
d'un accord de licence conclu avec la NSF. La SDR collecte des données sur,
entre autres, la situation d'emploi, l'employeur principal, l'emploi principal,
les emplois antérieurs, les études récentes, les caractéristiques
démographiques et l'incapacité, qui varient d'une vague à l'autre. Nous
n'utilisons que l'information recueillie durant toutes les vagues d'intérêt, à
savoir 1995, 1997, 1999, 2001, 2003, 2006 et 2008.
Pour
illustrer notre méthodologie, nous avons construit un modèle du salaire des
individus au fil du temps. La réponse est le logarithme du salaire (dans
l'emploi principal), avec une fonction de lien identité et plusieurs
covariables; la modélisation du logarithme du salaire (par opposition au
salaire) est une pratique courante. Le modèle contient des covariables
indépendantes du temps (comme le sexe) ainsi que des covariables dépendant du temps
(tel que le secteur d'emploi). Nous avons quatre grandes catégories de
covariables. Les variables relatives au
diplôme sont le domaine du diplôme, le nombre d'années écoulées depuis
l'obtention du diplôme et l'âge au moment de l'obtention du diplôme. Les variables relatives à l'emploi sont le
domaine ou la catégorie d'emploi, le secteur, l'indicateur d'études
postdoctorales, l'indicateur de membre auxiliaire du corps professoral, le
nombre d'heures travaillées par semaine dans l'emploi principal, le nombre de
semaines par année dans l'emploi principal, le lien entre l'emploi et le
diplôme de doctorat, le travail à temps partiel pour différentes raisons, le
nombre de mois depuis le début de l'emploi principal, le mois de début de
l'emploi principal, le fait que l'employeur/le type d'emploi a changé ou non
depuis la vague précédente et le fait que le changement d'employeur/de type
d'emploi depuis la vague précédente était dû ou non à une mise à pied ou à une
cessation d'emploi. Les caractéristiques
démographiques de la personne sont le sexe, la citoyenneté, la
race/ethnicité, la présence d'enfants dans la famille, l'état matrimonial, la
situation de travail du (de la) conjoint(e). Enfin, les variables d'« environnement » sont le nombre d'années
écoulées depuis 1995, l'État (d'emploi) et l'indice des prix à la consommation
(de la région d'emploi). La liste complète des variables, des interactions et
des catégories figure dans Carrillo et Karr (2011). Pour les variables
catégoriques, la catégorie de référence est celle pour laquelle la fréquence
est la plus élevée.
Le jeu
de données pour notre modèle comprend 59 346 sujets et
190 693 observations, réparties comme il suit : 30 234, 30 652, 26 732, 26 778, 24 956, 25 910 et 25 431. Ces données correspondent à des salaires non manquants
compris entre 5 000 $ et 999 995 $, pour les personnes dont
l'âge est cohérent d'une vague à l'autre et pour lesquelles ne manque pas la
valeur de la variable indiquant si l'employeur (établissement d'enseignement
postsecondaire) était un établissement public ou privé. Les poids de sondage
(transversaux) moyens pour chacune de ces vagues sont : 15,37, 16,28, 19,96, 20,74, 22,71, 22,93 et 24,88.
Les
poids de sondage que nous utilisons pour chaque vague sont les poids corrigés
finaux. Ces poids correspondent aux poids de sondage originaux corrigés pour la
non-réponse et la poststratification. Cependant, la théorie que nous avons élaborée
à la section 3 repose sur l'hypothèse que les poids sont les inverses des
probabilités de sélection; autrement dit, les poids de sondage originaux. Il
s'agit d'une disparité dont nous prévoyons étudier les effets dans l'avenir.
Par ailleurs, les calculs de la dernière partie de l'annexe (qui ne reposent
sur aucune hypothèse concernant les poids) donnent à penser que l'effet de
cette disparité est faible.
Les
covariables et les interactions que nous avons prises en considération ont été
choisies parce qu'elles étaient suggérées par les analyses exploratoires ou par
les spécialistes du domaine de la NSF. Carrillo et Karr (2011) présentent les
coefficients estimés
du modèle où comprend
l'ordonnée à l'origine ainsi que les autres covariables. Ce correspond à celui du modèle dans la
formule (3.1), dont les propriétés sont discutées à la section 3. La
matrice de covariance de travail est estimée être avec où et 208 est le nombre de covariables dans est le
poids transversal pour le sujet à la
vague à
condition que et zéro
autrement. L'estimation contient
les autocorrélations estimées pour 1995, 1997, 1999, 2001, 2003, 2006, 2008, et pour
tout Les
valeurs estimées forment la matrice d'autocorrélation :
Nous
présentons maintenant certaines conclusions concernant les salaires de la
population active possédant un doctorat fondées sur les coefficients estimés,
qui figurent dans Carrillo et Karr (2011). Avant tout, une estimation
raisonnable du salaire moyen prend en considération l'ordonnée à l'origine, le
nombre d'heures travaillées par semaine (dont la moyenne est 47) et le nombre
d'années écoulées depuis l'obtention du diplôme (en moyenne 15), de sorte
qu'une estimation de la moyenne globale est pour un
sujet pour lequel toutes les autres covariables continues sont égales à zéro et
dans la catégorie de référence pour toutes les variables catégoriques.
Toutes
choses étant constantes par ailleurs, les salaires des femmes sont environ
égaux à 93,4 % de ceux des hommes, tandis que la race ne semble pas avoir
d'effet sur les salaires. L'effet du terme d'interaction du sexe et du nombre
d'années écoulées depuis 1995 n'est pas significatif; par conséquent, cette
différence de salaire ne varie pas au cours du temps. Soulignons qu'en
n'utilisant que les données pour une seule année, nous ne serions pas capables
d'évaluer l'effet du temps. Fait encore plus important, en utilisant uniquement
les données d'une seule vague, disons 2008, nous ne serions pas capables de
déterminer si l'effet d'être de sexe féminin varie au cours du temps.
Les
titulaires d'un doctorat ayant un emploi de gestionnaire sont ceux dont les
salaires sont les plus élevés, suivis par ceux appartenant aux professions du
secteur de la santé; par ailleurs, ceux dont les salaires sont les plus faibles
sont ceux employés dans les « autres » professions, suivis de ceux
travaillant dans le domaine des sciences politiques.
Parmi
les secteurs d'emploi, les salaires les plus élevés sont observés dans le
secteur à but lucratif (20 % plus élevés que pour la catégorie de
référence correspondant à professeur permanent dans les établissements publics
offrant des programmes de quatre années), suivi, dans l'ordre, par
l'administration fédérale, le secteur du travail autonome et le secteur sans
but lucratif, qui offrent tous des salaires plus élevés que celui de la
catégorie de référence. Les salaires les plus faibles sont ceux offerts par les
collèges avec programmes de deux ans et les établissements avec programmes
de deux et de quatre ans pour lesquels la permanence ne s'applique pas.
L'effet
négatif le plus important sur les salaires est également observé dans le
secteur de l'enseignement. Les personnes ayant un poste de membre auxiliaire du
corps professoral ont des salaires qui correspondent environ à 59 % des
salaires de titulaires d'un doctorat comparable. Fait qui n'est pas étonnant,
les salaires postdoctoraux ne correspondent qu'à environ 74 % des salaires
de personnes comparables occupant d'autres types de poste.
Le
secteur d'emploi est aussi un facteur qui contribue à la dépendance, difficile
à interpréter, du salaire à l'égard du mois où a débuté l'occupation du poste
courant : les salaires sont plus faibles pour les mois de début correspondant
à août et à septembre. Des analyses supplémentaires montrent que l'effet du
mois ne s'observe que dans le secteur de l'enseignement, où, comme nous l'avons
vu, les salaires sont plus faibles que dans l'industrie ou l'administration
publique, et où il est fréquent que les emplois débutent en août ou en
septembre. Par conséquent, le secteur d'emploi donne partiellement, mais pas
entièrement la réponse. Une ventilation plus fine du secteur de l'enseignement,
en utilisant les classifications de Carnegie, réduit, mais ne supprime pas le
caractère significatif de l'effet du mois. La SDR ne semble pas fournir
suffisamment de données pour éliminer entièrement les effets du mois, de sorte
que nous avons gardé la définition des secteurs d'emploi de la SDR.
Les
personnes titulaires d'un diplôme en informatique et en sciences de
l'information sont celles dont les salaires sont les plus élevés (environ
20 % plus élevés que pour les sciences biologiques), suivies par celles
titulaires d'un diplôme en génie électrique et informatique et en économie
(environ 16 % plus élevés). Les titulaires d'un doctorat en sciences
agricoles et alimentaires, en sciences de l'environnement et de la vie, en
sciences de la terre, de l'atmosphère et des océans, et en « autres »
sciences sociales reçoivent les salaires les plus faibles. Les
« autres » sciences sociales sont les sciences sociales à l'exclusion
des sciences économiques et politiques.
Les
personnes mariées sont celles dont les salaires sont les plus élevés, suivies
par les personnes dans une relation de type mariage, les personnes veuves, les
personnes séparées, les personnes divorcées et les personnes jamais mariées.
Ces dernières ont des salaires de l'ordre de 89 % seulement de celui des
personnes mariées; on pourrait soutenir qu'il existe une certaine association
entre le fait de n'avoir jamais été marié et l'âge. La présence d'enfants de
plus de deux ans est associée à des salaires plus élevés, mais la présence
d'enfants plus jeunes ne l'est pas.
Les
titulaires d'un doctorat occupant un emploi qui n'est relié que dans une
certaine mesure au domaine de leur diplôme gagnent environ 93 % de ce que
les personnes possédant un emploi étroitement associé à leur domaine d'études
(la catégorie de référence) gagnent. Si l'emploi n'est pas relié au diplôme de
doctorat à cause d'un changement de carrière ou d'intérêt professionnel, le
salaire est de l'ordre de 82 % de ce gagnent les personnes occupant un
emploi étroitement associé à leur domaine d'études. Par ailleurs, les personnes
dont l'emploi n'est pas relié à leur domaine d'études pour d'autres raisons ne
gagnent qu'environ 76 % du salaire de celles appartenant à la catégorie de
référence.
On
observe une augmentation de salaire d'environ 3 % pour chaque année
supplémentaire depuis l'obtention du diplôme de doctorat, mais il existe un
effet de diminution pour les nombres d'années élevés. Nous interprétons cela
comme l'effet de l'expérience. Une petite pénalité est associée à l'obtention
du doctorat plus tard dans la vie; pour chaque année d'âge supplémentaire au
moment de l'obtention du diplôme, le salaire est réduit de 1 %.
Nous
avons également constaté que l'indice des prix à la consommation (IPC) régional
a un effet significatif. Le salaire est d'autant plus élevé que l'IPC est élevé.
Nous n'avons pas pu utiliser l'IPC associé au marché du travail auquel
appartient l'emploi parce que les données de la SDR n'indiquent pas
l'emplacement géographique de manière plus précise que l'État. Nous avons
inclus l'État dans le modèle comme mesure de substitution du coût de la vie;
l'effet de l'État est fortement significatif et les coefficients de certains
États comptent parmi les plus élevés dans l'ensemble. Les salaires les plus
élevés sont offerts en Californie, à Washington D.C. et ses faubourgs, ainsi
que dans la ville de New York et ses faubourgs. Par ailleurs, les salaires
les plus faibles sont observés à Puerto Rico, dans le Vermont, au Montana,
dans le Maine, dans l'Idaho, dans le Dakota du Sud, dans le Dakota du Nord, et
dans les territoires/à l'étranger.
Le fait
d'avoir un emploi à temps partiel en raison de la retraite ou d'une
semi-retraite a un effet significatif et figure dans plusieurs termes
d'interaction significatifs. Étant donné ces résultats, nous ne pensons pas que
les données à notre disposition à l'heure actuelle brossent le tableau complet
de la retraite, par exemple, en ce qui concerne les personnes qui sont (semi)
retraitées et continuent d'avoir un emploi à temps plein.
Enfin,
nous avons analysé les résidus; les figures 4.1 et 4.2 montrent un graphique en
boîtes à moustaches des résidus standardisés par année et un graphique
spaghetti des résidus standardisés, respectivement.
La
figure 4.1 montre que l'ajustement du modèle est raisonnablement bon pour
toutes les années de référence, car la plupart des résidus standardisés sont
compris entre -2 et 2. En outre, les distributions des résidus ne semblent pas
différer fortement d'une année à l'autre.

Figure 4.1 Boîtes à moustaches des résidus
standardisés par année
La
figure 4.2 nous permet également de conclure que l'ajustement du modèle est
assez bon pour la plupart des personnes, car la plupart des lignes fluctuent
entre -2 et 2. Néanmoins, pour quelques personnes, le modèle semble prédire de
façon excessivement élevé fortement en 2003, ainsi qu'en 2006. Nous avons
inclus plusieurs termes dans le modèle pour corriger ce problème, mais
manifestement aucun ne semble le faire complètement.

Figure 4.2 Graphique spaghetti des résidus standardisés
En
dernier lieu, nous avons tenté de produire des arbres de classification
exploratoires pour ces anomalies résiduelles. Nous avons constaté que, pour
l'ensemble de données disponible, le seul élément relié à ces anomalies était
le mode d'enquête. En 2003, les anomalies sont disproportionnellement
importantes pour les réponses en ligne, et en 2006, elles sont
disproportionnellement importantes pour les réponses par ITAO. Nous concluons
qu'il existe un effet de mode de collecte pour ces deux années bien que, ces
années-là, les répondants présentaient une caractéristique différente qui n'est
pas incluse dans les variables existantes.
Enfin,
la représentation graphique des valeurs prédites en fonction des valeurs
observées (que l'on peut consulter dans Carrillo et Karr [2011]) montre la même
chose. Pour la plupart des observations, le modèle donne de bons résultats,
sauf pour ces quelques cas en 2003 et en 2006 pour lesquels il produit une
surestimation importante.
Précédent | Suivant