Programme de recherche et développement en méthodologie : réalisations, 2024-2025
3.  Problèmes d’estimation dans les enquêtes

PROJET : Calcul des degrés de liberté théoriques pour les intervalles de confiance de Wilson modifiés dans le contexte du questionnaire détaillé du recensement de la population canadienne

Pour les utilisateurs des données des recensements de la population au Canada, les intervalles de confiance peuvent être utilisés pour mesurer la précision d’une estimation et pour la prise de décision. Pour produire ces intervalles, on suppose une certaine distribution, dans notre cas, la loi de Student. Cette distribution prend comme paramètre un degré de liberté qui, normalement, est estimé par le nombre de répliques de poids dans l’échantillon. Cette approximation peut mener à de la sous-couverture des intervalles de confiance, habituellement observée dans les petits domaines. L’objectif du projet est de mettre en œuvre la formule théorique qui a été élaborée dans l’article de Toupin et Martin (2025), c’est-à-dire de trouver une approximation ou un estimateur à partir des développements théoriques, qui permettrait la mise en œuvre dans un système automatisé utilisé dans les différentes diffusions du programme du recensement.

Progrès :

Dans la dernière année, des développements algébriques de plusieurs approximations ont été faits dans le but d’évaluer leur performance. Un environnement de simulations Monte Carlo a été élaboré dans le logiciel SAS pour évaluer les différentes approximations. On a trouvé que plusieurs d’entre-elles amélioraient la couverture des intervalles de confiance pour l’estimation des chiffres à partir du questionnaire détaillé, en comparaison de la valeur fixe présentement mise en œuvre dans le système, mais rarement suffisamment pour atteindre le taux nominal visé. L’approximation la plus performante offre des gains trop limités pour justifier la complexité de son intégration dans le système de diffusion.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Samer Farfour (samer.farfour@statcan.gc.ca).

Bibliographie

Toupin, M.-H. et Martin, V. (2025). Améliorer la couverture des intervalles de confiance au niveau des degrés de liberté: application à l’estimation du questionnaire détaillé du recensement canadien. Techniques d’enquête (en cours de révision).

PROJET : Estimation bootstrap de la variance pour des estimateurs par calage avec contraintes sur l’étendue des poids

Les estimations d’enquête sont souvent calées pour qu’elles correspondent à des totaux connus de la population, appelés totaux de contrôle. L’estimateur par la régression généralisée est un estimateur par calage fréquemment utilisé qui suppose une relation linéaire entre la variable d’enquête et les variables auxiliaires. La théorie qui sous-tend l’estimateur par la régression généralisée est bien établie et il existe des estimateurs de la variance par linéarisation. Deville et Särndal (1992) ont montré que, pour une famille d’estimateurs par calage, tous les membres de la famille sont asymptotiquement équivalents à l’estimateur par la régression généralisée. Cela suggère l’utilisation de l’estimateur de variance de l’estimateur par la régression généralisée, ou une adaptation de ce dernier, pour d’autres estimateurs par calage. C’est ce type d’estimateur de variance qui est généralement mis en œuvre en pratique.

Certaines méthodes de calage, telles que le calage ridge, comportent des contraintes sur l’étendue des poids. La linéarisation en présence de bornes sur les poids n’est pas toujours simple, et l’estimateur de la variance standard de l’estimateur par la régression généralisée peut ne pas convenir. L’objectif de la présente recherche était de trouver un autre estimateur de la variance dans cette situation.

Ce projet a débuté au cours de l’année 2023-2024 où nous avons élaboré un estimateur de la variance bootstrap qui tient correctement compte des bornes sur les poids et des totaux de contrôle.

Progrès :

Nous avons élaboré et terminé une nouvelle étude par simulation dans laquelle nous comparons quatre approches bootstrap pour estimer la variance d’un estimateur par calage ridge. Nous avons examiné deux populations différentes et quatre tailles d’échantillon. Les résultats de cette étude montrent l’importance d’utiliser des contraintes ajustées et de correctement tenir compte des totaux de contrôle pour obtenir la version bootstrap de l’estimateur par calage ridge, et ainsi des estimateurs approximativement sans biais de la variance de l’estimateur par calage ridge.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Keven Bosa (keven.bosa@statcan.gc.ca).

Bibliographie

Deville, J.-C. et Särndal, C.-E. (1992). Calibration estimators in survey sampling. Journal of the American Statistical Association, 87, 376-382.

PROJET : Étude sur les effets de méthodes de sélection des variables et du réglage de paramètres sur la méthode Cubist avec et sans prétraitement

Au sein de la Division des méthodes de la statistique économique (DMSE), et en particulier du Programme intégré de la statistique des entreprises (PISE), des méthodes d’imputation classiques sont actuellement utilisées pour imputer la non-réponse partielle et totale. Malgré la simplicité des méthodes individuelles, comme l’imputation par donneur ou par quotient, des dizaines, voire des centaines, de ces méthodes sont superposées pour créer des stratégies complexes de vérification et d’imputation qui deviennent difficiles à mettre en œuvre, à tenir à jour et à dépanner. En 2023-2024, dans le cadre du Programme d’accélération des processus méthodologiques (MethAx2023-24), nous avons mené des recherches exploratoires dans le cadre desquelles le rendement de méthodes de régression linéaire, de forêt aléatoire et Cubist a été examiné à la suite des résultats d’études par simulation menées par Dagdoug, Goga et Haziza (2023), où les auteurs ont déclaré, entre autres résultats, que la méthode Cubist (Kuhn et Johnson, 2016 et Kuhn, 2022) fonctionnait bien dans diverses situations et que la méthode de la forêt aléatoire fonctionnait bien dans des environnements à dimensions élevées. Nos recherches sur MethAx2023-24 ont également indiqué que les méthodes Cubist permettaient d’obtenir de bons résultats parmi les méthodes susmentionnées. Dans le cadre de cette recherche, nous avons comparé le rendement de la méthode d’imputation Cubist selon différents scénarios afin de déterminer les processus qui pourraient améliorer leur rendement.

Progrès :

Pour comprendre le rendement de la méthode d’imputation Cubist, nous avons mené une étude visant à comprendre les effets des méthodes de sélection de caractéristiques, comme l’élimination de variables de variance proches de zéro, de variables qui sont une combinaison linéaire d’autres variables, de variables hautement corrélées et de variables sujettes à la multicolinéarité, ce qui a donné quatre scénarios différents. Pour chaque scénario, nous avons étudié l’impact du réglage des paramètres avec et sans sélection de caractéristiques, avec et sans tolérance à l’amélioration. Cela a donné 16 scénarios différents (configurations). De plus, nous avons adapté la méthode Cubist à l’aide de deux fonctions R différentes, à savoir caret et tidymodels, ce qui a donné 32 configurations différentes. De plus, pour comprendre si le prétraitement des données améliore le rendement, nous avons appliqué ces scénarios à des ensembles de données non normalisés et normalisés, où toutes les variables sont normalisées, et à des ensembles de données ne contenant que les variables importantes produites par l’algorithme Cubist ajusté précédemment.

Nous avons sélectionné quelques variables cibles à partir de trois enquêtes économiques différentes de Statistique Canada de différentes tailles. Les prédicteurs sont des variables de la base de sondage de l’année en cours et toutes les variables de l’année précédente. L’ensemble de données définitif contenait les répondants de l’année en cours et de l’année précédente. Les résultats ont été obtenus dans le cadre d’une validation croisée à 10 groupes. Notre programme R reproductible produit en sortie les valeurs prédites, l’erreur quadratique moyenne, le biais, la variance, l’erreur absolue moyenne et médiane, le pourcentage d’erreur absolue moyenne, le coefficient de détermination, le temps de calcul, le nombre de comités et de voisins, le cas échéant, selon la configuration et le groupe pour différents ensembles de données prétraités. Nos résultats indiquent que procéder à certaines activités de nettoyage des données à l’aide des méthodes de sélection des variables énumérées ci-dessus, en combinaison avec le réglage des paramètres (mais pas la variation des tolérances), et/ou aux activités de prétraitement des données susmentionnées ont amélioré le rendement des modèles Cubist pour certaines variables.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Ahalya Sivathayalan (ahalya.sivathayalan@statcan.gc.ca).

Bibliographie

Dagdoug, M., Goga, C. et Haziza, D. (2023). Imputation procedures in surveys using nonparametric and machine learning methods: an empirical comparison. Journal of Survey Statistics and Methodology, 11, 141-188.

Kuhn, M. et Johnson, K. (2016). Applied Predictive Modelling. Springer, 69-71.

Kuhn, M. (2022). caret: Classification and Regression Training. R package version 6.0-93, https://cran.r-project.org/package=caret.

PROJET : Méthodes bayésiennes non paramétriques pour des données d’enquête

L’application de méthodes non paramétriques bayésiennes est un domaine de recherche important pour les organismes statistiques. Dans le cadre de notre travail, nous étudions l’application de techniques fondées sur des processus de Dirichlet à des données d’enquête complexes. Nous proposons une nouvelle approche qui combine des méthodes existantes, utilisées par Statistique Canada, pour la dérivation de poids d’enquête pour des plans d’échantillonnage probabilistes stratifiés à plusieurs degrés avec probabilités inégales et la souplesse des méthodes bayésiennes non paramétriques fondées sur des processus de Dirichlet.

Nous avons développé des logiciels et appliqué de tels modèles à certains des ensembles de données recueillis au cours du sixième cycle de l’Enquête canadienne sur les mesures de la santé et avons mené plusieurs études de simulation pour montrer la robustesse de nos modèles dans divers scénarios ainsi que l’applicabilité de ces modèles à une production éventuelle de statistiques officielles.

Progrès :

Le projet est terminé. Les résultats obtenus indiquent que la méthode proposée présente un potentiel important de recherches supplémentaires. Des logiciels ont été élaborés et appliqués à des modèles pratiques. Un article (Volkov, 2025) a été publié dans The Survey_Statistician.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Oleksii Volkov (oleksii.volkov@statcan.gc.ca).

Bibliographie

Volkov, O. (2025). Bayesian nonparametric methods for survey data. The Survey Statistician, 91, 34-43, https://isi-iass.org/home/wp-content/uploads/Survey_Statistician_2025_January_N91.pdf.

PROJET : Sous-échantillonnage pour le suivi des cas de non-réponse dans les enquêtes sociales

Dans le contexte des défis que posent la baisse des taux de réponse et le coût élevé du suivi facilité par un intervieweur, il est important de tenir compte de l’ampleur du suivi des cas de non-réponse requis et de la façon de l’utiliser efficacement. Sélectionner uniquement un sous-échantillon d’un plus grand échantillon principal pour réaliser un suivi plus approfondi (complet) des cas de non-réponse, tout en effectuant un suivi moindre (réduit) pour les autres, offre l’occasion de réduire les sommes dépensées pour le suivi facilité par un intervieweur, puis de réallouer ce budget, ou, du moins une partie de celui-ci, à un suivi plus approfondi des cas de non-réponse de la partie de suivi complète de l’échantillon. Cela peut aider à gérer le potentiel accru de biais associé à de faibles taux de réponse ou peut viser à le faire sans compromettre la qualité des estimations. Ce type de plan d’enquête nécessite des ajustements du processus de pondération; l’estimateur multimodal concomitant (EMC) simultané a été élaboré expressément pour ce contexte (Mather, Boulet et Brennan, 2024). Ce projet vise à approfondir les travaux théoriques antérieurs en permettant d’étudier ses propriétés de façon empirique au moyen d’études pilotes et en évaluant les applications potentielles au moyen de simulations.

Progrès :

L’approche consistant à sélectionner un sous-échantillon aléatoire pour un suivi complet, puis à appliquer l’EMC a été étudiée au moyen d’un essai empirique et de simulations (Boulet et Mather, 2025). Un projet pilote a été mené dans le cadre de l’Enquête sociale canadienne. Une vague habituelle de cette enquête comporte un échantillon de 20 000 unités, toutes admissibles au suivi des cas de non-réponse par téléphone; dans le projet pilote, le nombre d’unités admissibles à ce suivi a été réduit à 17 000, mais la taille globale de l’échantillon a été augmentée pour passer à 34 000. Comme pour une vague habituelle, toutes les unités étaient admissibles au suivi des cas de non-réponse au moyen de rappels par la poste, de courriels et de messages texte. De par sa conception, le coût global relatif à la collecte était à peu près le même qu’une vague habituelle. Il en a résulté une augmentation de la précision par rapport à une vague habituelle (taille d’échantillon réelle plus grande, erreur-type plus faible pour les variables communes et augmentation du nombre de domaines répondant aux lignes directrices en matière de diffusion). De plus, malgré les signes indiquant que l’approche du sous-échantillonnage aléatoire et de l’application de l’EMC introduisent un certain biais, l’ampleur de ce biais potentiel est faible et est jugée comme se situant dans des intervalles acceptables, particulièrement en ce qui concerne les gains de précision.

De plus, une série de feuilles de travail de planification a été élaborée pour modéliser les coûts et les rendements de divers contextes d’enquête. Selon les hypothèses provenant de résultats empiriques et de simulations, le modèle tient compte des relations entre les taux de rendement attendus pour les sous-échantillons avec suivi complet et réduit, les coûts relatifs associés à un suivi complet et réduit et l’augmentation de l’effet de plan attribuable au sous-échantillonnage et à l’application de l’EMC. Les résultats portent à croire que cette approche pourrait être efficace dans certains contextes, afin d’accroître la précision en conservant les mêmes coûts de collecte ou de réduire les coûts de collecte pour un même niveau de précision. Cette approche semble particulièrement applicable aux enquêtes présentant des différences modérées, mais non extrêmes, tant en ce qui concerne le coût que le taux de réponse entre un suivi complet et réduit. C’est le cas pour de nombreuses enquêtes de Statistique Canada, comme celles dont le suivi réduit est effectué par courrier et par courriel et dont le suivi complet inclut des tentatives d’appel. Le modèle et les feuilles de travail de planification connexes sont prêts à être utilisés pour évaluer l’applicabilité de l’approche du sous-échantillonnage et de l’EMC à des enquêtes particulières pour lesquelles on souhaiterait mettre en œuvre cette idée.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Cilanne Boulet (cilanne.boulet@statcan.gc.ca) ou
Anne Mather (anne.mather@statcan.gc.ca).

Bibliographie

Boulet, C. et Mather, A. (2025). Methodology Acceleration Initiative Research Project: Subsampling for Non-Response Follow-Up in Social Surveys. Document interne, Statistique Canada.

Mather, A., Boulet, C. et Brennan, A. (2024). An estimator for concurrent use of full and reduced collection effort on random subsamples. Article présenté au Comité consultatif sur les méthodes statistiques, 78, Statistique Canada.

PROJET : Panels Web probabilistes à Statistique Canada

En 2020, Statistique Canada a commencé à utiliser des panels Web probabilistes comme autre méthode de collecte de statistiques officielles. Dans le cadre d’un panel Web, les répondants à de grandes enquêtes sociales probabilistes sont invités à fournir leurs coordonnées pour participer à de futures petites enquêtes (« enquêtes par recrutement »). Les panels Web peuvent servir à recueillir rapidement des renseignements et sont donc un outil utile pour fournir des données en temps opportun. Toutefois, les faibles taux de réponse cumulés associés à cette méthode limitent la précision des estimations des panels Web et soulèvent des préoccupations au sujet d’un biais potentiel. Ce projet a permis d’examiner cinq ans d’expérience de panels à Statistique Canada pour obtenir des renseignements sur le recrutement, la collecte et les estimations des panels.

Progrès :

La première composante du projet consistait à examiner des façons de recruter efficacement des participants aux panels et, par la suite, de recueillir des données à l’aide d’enquêtes par panel. La façon dont les questions de recrutement sont présentées peut entraîner des taux de participation très différents. Un test des présentations différentes des questions a montré que la présence d’une question de consentement explicite avait une grande incidence; 26 % des répondants fournissaient leurs coordonnées (courriel ou numéro de téléphone ou les deux) lorsqu’on leur demandait explicitement, sur un premier écran, de consentir à participer à de futurs panels avant d’avoir l’occasion de fournir leurs coordonnées, comparativement à 88 % des répondants qui fournissaient leurs coordonnées sans la question de consentement. De plus, la mine de renseignements auxiliaires disponibles dans le cadre de l’enquête par recrutement peut être utilisée pour gérer activement les opérations de collecte par panel, en prédisant la probabilité de réponse et en utilisant cette information pour cibler les efforts de suivi. Lors de son utilisation, cette approche a permis de réduire la fourchette de taux de réponse entre les groupes ayant initialement des taux de réponse plus faibles (par exemple les groupes d’âge plus jeunes ou ceux ayant des niveaux de scolarité plus faibles) et les groupes ayant des taux de réponse plus élevés. Pour obtenir de plus amples renseignements sur ces travaux, consultez MacIsaac, Boulet et Thomas (2024).

Les renseignements auxiliaires provenant des enquêtes par recrutement peuvent également servir à élaborer de riches modèles qui peuvent être utilisés dans le processus de pondération pour les panels. La deuxième composante de ce projet portait sur l’efficacité de cette approche pour réduire le biais potentiel associé aux faibles taux de réponse obtenus par panel. Les estimations des variables de l’enquête par recrutement ont été calculées à l’aide de poids d’enquête par recrutement et de poids de panel Web et ont été comparées; les différences indiquent la possibilité d’un biais résiduel qui n’a pas été corrigé par le processus de pondération du panel Web. Cette enquête a révélé plus de différences significatives que ce à quoi on s’attendrait si l’estimateur par panel Web corrigeait entièrement le biais résultant du processus de réponse par panel Web. Il s’est avéré que les questions liées à certains sujets, comme la politique et le vote, le sentiment d’appartenance et la consommation de médias, présentaient les différences les plus significatives entre les estimations des panels Web et les estimations des enquêtes par recrutement. Pour obtenir de plus amples renseignements sur ces travaux, consultez Mather et Boulet (2024) et Mather, Boulet et Ra (2024).

Les résultats de ce projet ont été présentés au Symposium international de 2024 sur les questions de méthodologie dont le thème est « L’avenir des statistiques officielles ».

Pour obtenir plus de renseignements, veuillez communiquer avec :
Cilanne Boulet (cilanne.boulet@statcan.gc.ca).

Bibliographie

MacIsaac, K., Boulet, C. et Thomas, M. (2024). Recrutement et collecte de panels Web à Statistique Canada. Recueil : Symposium 2024, Le futur des statistiques officielles, Statistique Canada, Ottawa, Canada.

Mather, A. et Boulet, C. (2024). Analysis of Residual Bias on Web Panels. Document de travail de la Direction de la méthodologie (SSMD-2024-002E), Statistique Canada.

Mather, A., Boulet, C. et Ra, Y. (2024). Évaluation des biais liés aux panels Web probabilistes de Statistique Canada. Recueil : Symposium 2024, Le futur des statistiques officielles, Statistique Canada, Ottawa, Canada.

PROJET : Évolution de la quantité et de la qualité des données recueillies pour l’Enquête sur les dépenses des ménages au fil des ans

Les taux de réponse aux enquêtes sociales ont considérablement diminué au cours des 25 dernières années, tendance encore accélérée par la pandémie de COVID-19 et l’abandon des interviews en personne. Alors que cette baisse est bien documentée, les initiatives récentes sont principalement axées sur la compréhension et la gestion des taux de réponse. Toutefois, l’incidence du désengagement croissant du public à l’égard des programmes statistiques peut s’étendre au-delà d’une simple participation plus faible; cela pourrait également avoir une incidence sur la quantité et la qualité des renseignements fournis par ceux qui répondent toujours et compromettre la validité et l’exactitude des résultats publiés, si les mesures de sécurité méthodologiques ne sont pas suffisamment robustes.

Contrairement à la non-réponse globale, cet aspect du désengagement est plus difficile à mesurer, ce qui nécessite une enquête plus approfondie. La présente recherche vise à évaluer les variations de quantité et de qualité des données fournies dans les enquêtes-ménages, en mettant l’accent sur l’Enquête sur les dépenses des ménages (EDM). En comparant les indicateurs clés au fil du temps, la présente étude vise à établir un cadre que d’autres enquêtes auprès des ménages peuvent adopter, ce qui permettrait en fin de compte d’obtenir des renseignements plus généraux sur les défis en évolution de la collecte et du traitement des données d’enquête.

Progrès :

La quantité et la qualité des renseignements fournis par les répondants ont été évaluées à l’aide de divers indicateurs provenant de multiples cycles de l’Enquête sur les dépenses des ménages (2015 à 2023). Dans la mesure du possible, les indicateurs ont été ventilés par mode de collecte, afin d’évaluer l’incidence des changements dans la stratégie de collecte.

Cette étude n’a révélé aucune tendance claire à la hausse ou à la baisse de la quantité et de la qualité des données au cours des cinq derniers cycles de l’EDM. Bien que le désengagement croissant des répondants ait joué un rôle dans la non-réponse aux enquêtes, cela n’a manifestement pas eu d’incidence sur la non-réponse partielle ou l’exhaustivité et l’exactitude des réponses. Dans l’ensemble, les indicateurs indiquent que les répondants ont maintenu des tendances constantes en matière de réponses au fil du temps. Toutefois, ces constatations peuvent s’appliquer plus particulièrement à l’EDM; d’autres enquêtes sociales devraient mener leurs propres analyses, en utilisant cette étude comme modèle, afin de déterminer si le désengagement des répondants a eu une incidence sur la qualité de leurs propres données.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Yves Lafortune (yves.lafortune@statcan.gc.ca).

Bibliographie

Lafortune, Y. et Mayer, E. (2025). The Evolution of the Quantity and Quality of the Data Collected for the Survey of Household Spending Through the Years. Document de recherche, Statistique Canada.


Date de modification :