Programme de recherche et développement en méthodologie : réalisations, 2021-2022
4. Problèmes d’estimation dans les enquêtes

SOUS-PROJET : Estimation de la variance bootstrap pour un échantillonnage à plusieurs degrés avec application à la non-réponse

Le bootstrap sert fréquemment à l’estimation de la variance dans les enquêtes avec un plan de sondage stratifié à plusieurs degrés. Il est souvent mis en œuvre par la production d’un ensemble de poids bootstrap qui est mis à la disposition des utilisateurs et qui tient compte de la complexité du plan de sondage. La méthode de Rao, Wu et Yue (1992) sert dans bien des cas à produire les poids bootstrap requis. Elle est valide pour un échantillonnage stratifié avec remise au premier degré ou un échantillonnage de taille fixe sans remise si les fractions de sondage au premier degré sont négligeables. Certaines enquêtes reposent sur des plans qui ne satisfont pas à ces conditions. Le but du projet était de proposer une méthode bootstrap qui tient compte de cette limite des poids bootstrap de Rao, Wu et Yue (1992).

Progrès :

Au cours des dernières années, nous avons élaboré une méthode bootstrap simple et unifiée qui s’applique à tout plan de sondage stratifié à plusieurs degrés dans la mesure où des poids bootstrap valides peuvent être produits pour chaque degré distinct d’échantillonnage. Notre méthode s’applique aussi aux plans de sondage à deux phases à condition que l’échantillonnage de poisson soit utilisé à la deuxième phase. Nous utilisons ce plan pour modéliser la non-réponse aux enquêtes et dériver des poids bootstrap qui tiennent compte de la pondération pour la non-réponse.

Pendant l’année en cours, nous avons mené trois études de simulation limitées pour évaluer les propriétés de notre méthode bootstrap, et nous avons terminé la rédaction d’un article qui a été accepté et publié dans un numéro spécial de Stats sur les méthodes de rééchantillonnage (Beaumont et Émond, 2022).

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Beaumont, J. F., et Émond, N. (2022). A bootstrap variance estimation method for multistage sampling and two-phase sampling when Poisson sampling is used at the second phase. Stats, 5, 339–357.

Rao, J.N.K., Wu, C.F.J. et Yue, K. (1992). Quelques travaux récents sur les méthodes de rééchantillonnage applicables aux enquêtes complexes. Techniques d’enquête, 18, 2, 225-234. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/fr/pub/12-001-x/1992002/article/14486-fra.pdf.

SOUS-PROJET : Estimation bootstrap du biais conditionnel pour mesurer l’influence dans les enquêtes complexes

Dans les enquêtes qui visent à recueillir des données sur des variables asymétriques, il est souvent souhaitable d’évaluer l’influence des unités de l’échantillon sur l’erreur d’échantillonnage des estimateurs pondérés des paramètres de population finie. Le biais conditionnel est une mesure attrayante de l’influence qui tient compte du plan de sondage et de la méthode d’estimation. Il se définit comme l’espérance par rapport au plan de sondage de l’erreur d’échantillonnage conditionnellement à ce qu’une unité donnée soit sélectionnée dans l’échantillon. L’estimation de ce biais conditionnel est relativement simple pour les plans de sondage et les estimateurs simples. Pour les plans ou les estimateurs complexes, en revanche, il peut être fastidieux de dégager une expression explicite du biais conditionnel. Dans ces enquêtes complexes, l’estimation de la variance s’obtient fréquemment par des méthodes de répliques comme le bootstrap. Les méthodes bootstrap d’estimation de la variance s’appliquent normalement par la production d’un ensemble de poids bootstrap qui est mis à la disposition des utilisateurs avec les données d’enquête. Dans le projet, notre objectif était de montrer la façon d’utiliser ces poids bootstrap pour obtenir un estimateur du biais conditionnel. Cet estimateur peut alors servir à construire des estimateurs robustes des paramètres de population finie, qui sont moins négativement affectés par les unités influentes que les estimateurs pondérés ordinaires.

Progrès :

La théorie a été élaborée dans des travaux de recherche antérieurs, et notre estimateur bootstrap a été évalué dans une étude par simulations. Cette année, nous avons révisé un article et ajouté une illustration à l’aide de données tirées de l’Enquête canadienne sur les dépenses des ménages. Notre article a été accepté et publié en ligne dans le Journal of Survey Statistics and Methodology (Beaumont, Bocci et St-Louis, 2021).

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Beaumont, J.-F., Bocci, C. et St-Louis, M. (2021). Bootstrap estimation of the conditional bias for measuring influence in complex surveys. Journal of Survey Statistics and Methodology.

SOUS-PROJET : Élaboration d’un prototype de système pour réaliser une estimation robuste

Dans de nombreuses enquêtes économiques et dans quelques enquêtes sociales, des variables aux distributions asymétriques sont recueillies, ce qui peut donner lieu à la présence de valeurs aberrantes et d’unités influentes dans l’échantillon. Les méthodes classiques d’estimation peuvent produire des estimateurs hautement inefficaces dans de tels scénarios. L’objectif de l’estimation robuste est de réduire l’effet des unités influentes de l’échantillon sur les estimations. Le biais conditionnel est utilisé comme mesure de l’influence des unités de l’échantillon. Les estimations classiques sont réduites par une fonction du biais conditionnel des unités de l’échantillon. La notion de biais conditionnel a d’abord été avancée par Moreno-Rebollo, Munoz-Reyez et Munoz-Pichardo (1999); elle a ensuite été utilisée par Beaumont, Haziza et Ruiz-Gazen (2013) pour concevoir un estimateur robuste. Ce travail est pertinent pour un grand nombre d’enquêtes économiques et sociales de Statistique Canada.

Progrès :

Un prototype SAS efficace incluant les spécifications d’estimation robuste formulées dans Beaumont (2017) a été mis en œuvre et évalué. Il s’agit d’un groupe de neuf macros pour les diverses fonctions liées à la production d’estimations de totaux, de ratios et de moyennes d’un domaine. Des renseignements auxiliaires peuvent être utilisés dans de nombreuses fonctions pour accroître l’efficacité des estimations.

Le prototype comprend une macro pour le calcul d’estimations classiques et d’estimations robustes pour les domaines. Les estimations robustes au niveau des domaines n’ont pas la propriété d’additivité des estimations classiques. Il y a donc une autre macro qui crée des estimations cohérentes au niveau des domaines à partir des estimations robustes en modifiant légèrement leurs valeurs. Une autre macro produit ensuite des poids par recalage pour les unités de l’échantillon qui reproduisent les estimations cohérentes au niveau des domaines et les totaux connus de variables auxiliaires.

Une méthode bootstrap pour l’estimation de la variance a été incluse pour produire des estimations de la variance pour les estimations robustes au niveau des domaines.

Un guide de l’utilisateur dans lequel figurent des exemples exposant les neuf fonctions du prototype est disponible (voir Estevao, 2022). Chaque macro du prototype effectue une validation complète des entrées spécifiées; elle affiche des renseignements sur les erreurs et les problèmes potentiels liés aux ensembles de données d’entrée et aux options sélectionnées.

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca) ou
Victor Estevao (613-863-9038, victor.estevao@statcan.gc.ca).

Bibliographie

Beaumont, J.-F., Haziza, D. et Ruiz-Gazen, J.M. (2013). A unified approach to robust estimation in finite population sampling. Biometrika, 100, 555-569.

Beaumont, J.-F. (2017). Robust Estimation Prototype, Methodology Specifications. Rapport interne, Statistique Canada.

Estevao, V.M. (2022). Robust Estimation – Parameter Description and User Guide, Methodology Specifications. Document interne, Statistique Canada.

Moreno-Rebollo, J.L., Munoz-Reyez, A.M. et Munoz-Pichardo, J.M. (1999). Influence diagnostics in survey sampling: Conditional bias. Biometrika, 86, 923-928.

SOUS-PROJET : Degrés de liberté liés à l’estimation du questionnaire long du recensement

Récemment, Statistique Canada a décidé de publier des intervalles de confiance afin d’exprimer la qualité des estimations. En autant que la couverture annoncée est respectée, la longueur d’un intervalle de confiance témoigne de la qualité de l’estimation. Un paramètre qui joue un rôle important dans le calcul des intervalles de confiance est le nombre de degrés de liberté. En pratique, cette valeur est généralement déterminée à l’aide d’une règle approximative (règle du pouce). Il est connu que, dans le cas de petits domaines, cette règle approximative n’estime pas adéquatement le nombre de degrés de liberté réel. Ceci engendre des intervalles de confiance qui ne donnent pas toujours la couverture attendue de 95 %.

Dans ce projet, on cherche à savoir dans quelle mesure la couverture des intervalles de confiance peut être améliorée par l’utilisation d’un nombre de degrés de liberté approprié. Celui-ci est obtenu en utilisant l’approximation de Satterthwaite. Le projet se situe dans le contexte de l’estimation du questionnaire long du recensement de la population. Dans ce cas, la variance est estimée selon la méthode « Partial Balanced Replicated Replications epsilon » (PBRR-epsilon) telle que décrite par Devin et Verret (2016). De plus, le projet cherche à obtenir une meilleure compréhension des facteurs qui influencent le nombre de degrés de liberté dans le but d’améliorer la règle approximative.

Progrès :

Une formule des degrés de liberté a été obtenue dans un contexte d’estimation d’un total sur un domaine du questionnaire long du recensement de la population. On a considéré un plan aléatoire stratifié avec une fraction de sondage d’un sur quatre, dont les unités primaires d’échantillonnage sont les ménages et lorsque la variance est estimée par la méthode PBRR-epsilon. La formule des degrés de liberté nous apprend que ceux-ci sont influencés par le coefficient d’aplatissement (Kurtosis) et la variance des totaux des ménages sur le domaine. Une étude par simulations a été réalisée pour l’estimation du total de variables continues et du total de variables dichotomiques (effectifs). Le but étant de comparer la couverture résultante des intervalles de confiance calculés avec la règle approximative et avec la formule explicite. Deux types d’intervalles de confiance, soient de Student dans le cas continu et Wilson modifié dans le cas discret, ont été considérés. Les résultats suggèrent qu’en utilisant le nombre de degrés de liberté adéquat, la couverture est rehaussée et on atteint souvent le seuil nominal dans le cas problématique de petits domaines. L’écriture d’un article en vue d’une soumission à un journal scientifique a déjà été entreprise et se conclura dans l’année financière 2022-2023.

Pour obtenir plus de renseignements, communiquez avec :
Marie-Hélène Toupin (marie-helene.toupin@statcan.gc.ca).

Bibliographie

Devin, N., et Verret, F. (2016). The development of a variance estimation methodology for large-scale dissemination of quality indicators for the 2016 Canadian census long form sample. Dans Proceedings of the Survey Research Methods Section, American Statistical Association, Alexandrie, Virginie.

SOUS-PROJET : Une revue des approches d’inférence fréquentistes et bayésiennes pour des données d’enquête

Dans les enquêtes par sondage, les données sont obtenues sur un sous-ensemble d’une population finie, habituellement par des procédures d’échantillonnage probabiliste. Ces données permettent de calculer des estimations ponctuelles des paramètres de la population finie ainsi que les estimations de la variance et les intervalles de confiance associés. Les méthodes permettant de faire des inférences et d’évaluer les propriétés des procédures d’échantillonnage et d’estimation ont fait l’objet de discussions et de débats dans la seconde moitié du 20e siècle. Dans le cadre de ce projet, nous cherchons à produire une revue critique de trois approches inférentielles dans un contexte de population finie : l’approche fondée sur le plan de sondage, l’approche fréquentiste fondée sur un modèle et l’approche bayésienne.

Progrès :

Nous avons rédigé un article qui a été accepté dans un numéro spécial célébrant le 50anniversaire de la Revue canadienne de la statistique (Beaumont et Haziza, 2022).

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Beaumont, J.-F., et Haziza, D. (2022). Statistical inference from finite population samples: A critical review of frequentist and Bayesian approaches. Accepté pour publication dans The Canadian Journal of Statistics.

SOUS-PROJET : Sondage indirect double de type plusieurs à un et sondage indirect simple

Dans les enquêtes sociales et économiques, il peut être difficile de joindre directement des unités de la population cible, et le sondage indirect est souvent préconisé comme solution au problème. Dans le sondage indirect, l’échantillon est tiré de la base de sondage qui est liée à la population cible, et l’estimation des paramètres de la population cible est habituellement réalisée au moyen de la méthode généralisée de partage des poids. Cette méthode donne un poids, pour chaque unité de la population cible, qui dépend des poids d’échantillonnage dans la base de sondage et des poids de lien entre la population de la base de sondage et la population cible. Dans ce projet, nous mettons l’accent sur la situation dans laquelle les unités de la population de la base de sondage sont liées à une et une seule unité de la population cible (cas « plusieurs à un »). Une telle situation se produit au service postal français, où l’échantillon est tiré d’une population d’adresses, mais les unités de la population cible correspondent à des tournées de facteurs. Nous cherchons à comprendre l’incidence des poids de lien sur l’efficacité des estimateurs obtenus par la méthode généralisée du partage des poids.

Progrès :

Nous avons dérivé des expressions de la variance et des résultats d’optimalité pour une grande classe de plans de sondage. De plus, nous avons constaté que le cas « plusieurs à un » pourrait nécessiter l’observation d’un grand nombre de liens. Nous atténuons le problème en ajoutant une population intermédiaire et un sondage indirect double. Nous avons élaboré une théorie et mené des études empiriques pour évaluer la perte de précision résultant de l’utilisation d’un sondage indirect double. Ces constatations nous aident à expliquer la perte de précision des estimateurs par la double méthode généralisée du partage des poids observée au service postal français. Nous avons rédigé un article qui présente nos résultats théoriques et empiriques (Medous, Goga, Ruiz-Gazen, Beaumont, Dessertaine et Puech, 2022b), et l’article a été accepté dans les Annals of Applied Statistics.

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Medous, E., Goga, C., Ruiz-Gazen, A., Beaumont, J.-F., Dessertaine, A. et Puech, P. (2022b). Many-to-one indirect sampling with application to the French postal traffic estimation. Accepté pour publication dans The Annals of Applied Statistics.


Date de modification :