Programme de recherche et développement en méthodologie : réalisations, 2021-2022
1. Intégration des données
1.1 Intégration des données d’échantillons probabilistes et d’échantillons non probabilistes
SOUS-PROJET : Traitement d’échantillons non probabilistes par pondération de probabilité inverse
Statistique Canada et d’autres organismes nationaux de statistique étudient de plus en plus la possibilité d’utiliser des échantillons non probabilistes en complément des échantillons probabilistes. Il est cependant bien connu que l’utilisation d’un échantillon non probabiliste seulement peut produire des estimations présentant un biais important en raison de la nature inconnue du mécanisme de sélection sous-jacent. Pour que ce biais soit réduit, les données d’un échantillon non probabiliste peuvent être intégrées aux données d’un échantillon probabiliste qui présente des variables auxiliaires communes à l’échantillon non probabiliste.
Dans le cadre de cette étude, nous nous sommes concentrés sur les méthodes de pondération de probabilité inverse, lesquelles consistent à modéliser la probabilité de participation à l’échantillon non probabiliste. Comme point de départ, nous avons examiné un modèle logistique ainsi que la méthode du pseudo maximum de vraisemblance de Chen, Li et Wu (2020). Nous avons proposé une procédure de sélection de variables basée sur un critère d’information d’Akaike modifié qui tient compte de la structure des données et du plan de sondage probabiliste. Nous avons également proposé une méthode simple fondée sur le rang pour former des strates a posteriori homogènes. De plus, nous avons étendu l’algorithme des arbres de classification et de régression (CART) à ce scénario d’intégration des données, tout en tenant compte, encore une fois, du plan de sondage probabiliste. Notre version modifiée de l’algorithme CART s’appelle nppCART. Enfin, nous avons proposé un estimateur de la variance bootstrap, qui reflète deux sources de variabilité: le plan de sondage probabiliste et le modèle de participation.
Progrès :
Nous avons terminé la rédaction du progiciel R pour le nppCART et nous avons poursuivi nos travaux empiriques en utilisant les données de l’approche participative comme échantillon non probabiliste et celles de l’Enquête sur la population active ou de la Série d’enquêtes sur les perspectives canadiennes comme échantillon probabiliste. Une des principales conclusions tirées à la suite de nos expériences est que toutes les méthodes examinées ont permis de réduire les biais, mais qu’un biais persiste. Nous avons aussi observé l’importance de former des groupes homogènes. L’algorithme nppCART a bien fonctionné avec ces données. La régression logistique avec effets principaux seulement constitue également une option raisonnable à condition que les probabilités de participation estimées du modèle logistique soient utilisées pour former des groupes homogènes.
Le projet a été présenté lors de la Morris Hansen Memorial Lecture de 2022 (Beaumont, Bosa, Brennan, Charlebois et Chu, 2022). Nous prévoyons terminer la rédaction d’un article qui sera présenté à une revue statistique à comité de lecture.
Pour obtenir
plus de renseignements, communiquez avec :
Jean-François
Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).
Bibliographie
Beaumont, J.-F., Bosa, K., Brennan, A., Charlebois, J. et Chu, K. (2022). Reducing the bias of non-probability sample estimators through inverse probability weighting with an application to Statistics Canada’s crowdsourcing data. Présentation à la 2022 Morris Hansen Memorial Lecture, le 1er mars 2022.
Chen, Y., Li, P. et Wu, C. (2020). Doubly robust inference with non-probability survey samples. Journal of the American Statistical Association, 115, 2011-2021.
SOUS-PROJET : Analyse de sensibilité pour évaluer le biais plausible de non-réponse ou de participation dans les données d’échantillons
Les enquêtes à faible taux de réponse et les échantillons non probabilistes peuvent présenter des biais. Les biais peuvent être atténués par l’utilisation de modèles, comme ceux utilisés dans les ajustements pour la non-réponse, lorsque de bons renseignements auxiliaires sont disponibles. Ces modèles sont toutefois sensibles au manque de renseignements pertinents (des variables auxiliaires qui sont associées à la fois à la participation et aux variables d’intérêt). Lorsqu’il manque des renseignements pertinents, un biais peut persister après la modélisation de la non-réponse.
Le projet visait l’évaluation du biais plausible qui subsiste en raison de renseignements auxiliaires manquants. La stratégie était d’adapter une analyse de sensibilité du domaine de l’inférence causale. Une analyse de sensibilité débute par une prémisse limitant la perturbation (p. ex. l’importance des renseignements manquants) et convertit la prémisse en assurances au sujet d’une quantité d’intérêt (p. ex. le biais d’estimations fondées sur un échantillon). Pour l’inférence causale, il y a des unités de traitement et de contrôle dans une étude d’observation, et la quantité d’intérêt est l’effet causal du traitement. Une analyse de sensibilité élaborée pour une telle situation doit être adaptée à notre problème d’estimation pour des échantillons biaisés par la non-réponse.
Progrès :
Nous avons adapté l’analyse de sensibilité de Ding et VanderWeele (2016) pour évaluer les estimations d’échantillons biaisés par la non-réponse. Pour toute prémisse donnée limitant l’importance des renseignements auxiliaires manquants, la méthode fournit des limites pour les biais qui en résultent. Notre analyse de sensibilité hérite de nombreuses propriétés souhaitables de la méthode de Ding et VanderWeele : elle ne requiert que trois paramètres, elle ne pose aucune hypothèse sur la dimension ou la distribution des renseignements manquants, les limites sont nettes et la prémisse peut être interprétée et peut être fondée sur les données actuelles ou sur une expertise spécialisée. Le dernier point est essentiel, car il signifie que la prémisse est défendable, ce qui donne des limites de biais défendables.
Nous avons testé l’analyse de sensibilité à l’aide d’un échantillon non probabiliste de l’approche participative et comparé les résultats à ceux d’une enquête probabiliste contemporaine ayant le même contenu (Brennan, 2022). Nous prévoyons présenter les résultats à une revue statistique à comité de lecture.
Pour obtenir plus de renseignements, communiquez avec :
Andrew Brennan (343-548-4028, andrew.brennan@statcan.gc.ca).
Bibliographie
Brennan, A. (2022). A sensitivity analysis for assessing plausible non-response or participation bias in sample data. Rapport interne, Statistique Canada.
Ding, P., et VanderWeele, T.J. (2016). Sensitivity analysis without assumptions. Epidemiology, 27(3), 368.
SOUS-PROJET : Approche bayésienne approximative pour l’intégration des données d’échantillons probabilistes et d’échantillons non probabilistes
Dans le cadre de ce projet d’intégration de données, nous examinons la situation où la variable d’intérêt et les variables auxiliaires sont observées à la fois dans un échantillon probabiliste et dans un échantillon non probabiliste. Nous cherchons à utiliser les données de l’échantillon non probabiliste pour améliorer l’efficacité des estimations pondérées par les poids d’enquête obtenues à partir de l’échantillon probabiliste. Récemment, Sakshaug, Wiśniowski, Ruiz et Blom (2019) et Wiśniowski, Sakshaug, Ruiz et Blom (2020) ont proposé une approche bayésienne pour l’intégration des données des deux échantillons aux fins de l’estimation de paramètres d’un modèle. Dans leur méthode, les données de l’échantillon non probabiliste sont utilisées pour déterminer la distribution a priori des paramètres du modèle, et la distribution a posteriori est obtenue en se fondant sur l’hypothèse selon laquelle le plan de sondage probabiliste est ignorable (ou non informatif). L’objectif du projet était d’étendre cette approche bayésienne à la prédiction de paramètres d’une population finie selon un plan de sondage non ignorable (ou informatif).
Progrès :
Nous avons proposé, conformément à Wang, Kim et Yang (2018), une procédure bayésienne approximative qui tient compte du plan de sondage probabiliste en nous appuyant sur des statistiques pondérées par des poids d’enquête appropriés. Nous avons mené des expériences par simulations et rédigé un article pour les actes du symposium de 2021 de Statistique Canada (You, Dasylva et Beaumont, 2021), qui brosse un tableau des méthodes et résume nos résultats empiriques. La principale conclusion qui découle de nos expériences est que notre approche bayésienne peut produire des gains d’efficacité non négligeables par rapport aux estimateurs pondérés par les poids d’enquête, même dans une situation où l’échantillon non probabiliste est très informatif, à condition que la variance a priori des paramètres du modèle soit soigneusement choisie. Toutefois, nous avons également observé de petites pertes d’efficacité dans un scénario où la corrélation entre la variable d’intérêt et les variables auxiliaires était faible. Le projet sera présenté à la réunion de juin du Comité consultatif des méthodes statistiques et aux Joint Statistical Meetings de 2022.
Pour obtenir
plus de renseignements, communiquez avec :
Jean-François
Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).
Bibliographie
Sakshaug, J.W., Wiśniowski, A., Ruiz, D.A.P. et Blom, A.G. (2019). Supplementing small probability samples with nonprobability samples: A Bayesian approach. Journal of Official Statistics, 35, 653-681.
Wang, Z., Kim, J.K. et Yang, S. (2018). Approximate Bayesian inference under informative sampling. Biometrika, 105, 91-102.
Wiśniowski, A., Sakshaug, J.W., Ruiz, D.A.P. et Blom, A.G. (2020). Integrating probability and nonprobability samples for survey inference. Journal of Survey Statistics and Methodology, 8, 120-147.
You, Y., Dasylva, A. et Beaumont, J.-F. (2021). An approximate Bayesian approach to improving probability sample estimators using a supplementary non-probability sample. Recueil du Symposium international de 2021 sur les questions de méthodologie, Statistique Canada.
SOUS-PROJET : Lissage des poids pour les enquêtes non probabilistes
Les techniques d’ajustement permettant d’atténuer le biais de sélection dans les échantillons non probabilistes font souvent appel à la modélisation de la propension à participer à l’échantillon non probabiliste ainsi qu’à la pondération par l’inverse de la propension à répondre. Il est bien connu que les procédures d’estimation des poids sont efficaces si les covariables sélectionnées dans le modèle de propension sont liées à la fois à la variable d’intérêt et à l’indicateur de participation. Dans la plupart des enquêtes, il y a de nombreuses variables d’intérêt, ce qui rend les ajustements de poids difficiles à déterminer, car un poids approprié pour une variable peut ne pas convenir pour d’autres variables. Le compromis type consiste à inclure un grand nombre de covariables dans le modèle de propension, mais cela peut accroître la variabilité des estimations, particulièrement lorsque certaines covariables ont un faible lien avec les variables d’intérêt. Le lissage des poids, établi pour les enquêtes probabilistes, pourrait être utile dans de telles situations. Il permet d’éliminer la variabilité causée par les modèles de propension surajustés en remplaçant les poids de propension inverses par les poids prédits obtenus à l’aide d’un modèle de lissage. Dans le projet, nous avons étudié le lissage des poids dans le contexte des enquêtes non probabilistes, autant sur le plan théorique que sur le plan empirique, afin de comprendre son utilité pour améliorer l’efficacité des estimations.
Progrès :
Nous avons d’abord montré théoriquement que l’estimateur lissé n’est jamais moins efficace que sa version non lissée dans un modèle linéaire pour les poids de propension. Nous avons également établi les conditions favorables à des gains d’efficacité plus importants. Par exemple, de tels gains seraient réalisés lorsque les variables d’intérêt ont un lien faible avec les covariables utilisées dans le modèle de propension. Ensuite, nous avons conçu deux études de simulation, basées sur des données artificielles et des données réelles, pour évaluer les propriétés du lissage des poids et son efficacité pour réduire l’erreur quadratique moyenne des estimations. Nous avons terminé la rédaction d’un article, qui a été accepté et publié dans la revue TEST (Ferri-García, Beaumont, Bosa, Charlebois et Chu, 2021).
Pour obtenir
plus de renseignements, communiquez avec :
Jean-François
Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).
Bibliographie
Ferri-García, R., Beaumont, J.-F., Bosa, K., Charlebois, J. et Chu, K. (2021). Weight smoothing for nonprobability surveys.TEST.
SOUS-PROJET : Intégration des données statistiques selon une approche par prédiction
Nous avons examiné la façon dont une grande base de données non probabilistes peut être utilisée, au moyen de techniques d’intégration des données, pour améliorer les estimations faites à partir d’un petit échantillon probabiliste. Dans la situation où la variable d’intérêt est observée dans les deux sources de données, Kim et Tam (2021) ont proposé deux estimateurs convergents par rapport au plan de sondage qui peuvent être justifiés par la théorie des enquêtes à double base de sondage. Dans la première partie du projet, nous avons déterminé les conditions garantissant que ces estimateurs sont plus efficaces que l’estimateur Horvitz-Thompson lorsque l’échantillon probabiliste est sélectionné à l’aide de l’échantillonnage de poisson ou de l’échantillonnage aléatoire simple sans remise. Dans la deuxième partie du projet, nous avons étudié une catégorie de prédicteurs, proposée par Särndal et Wright (1984), qui traite le cas où la base de données non probabiliste contient des variables auxiliaires, mais aucune variable d’intérêt. L’enquête probabiliste permet de recueillir les variables d’intérêt, et nous supposons que la base de données non probabiliste peut être couplée à l’échantillon probabiliste. Un tel cas présente un intérêt pour une enquête sur le trafic postal menée par La Poste en France.
Progrès :
Nous avons mené une étude par simulations pour comparer les propriétés par rapport au plan de différents prédicteurs dans la catégorie de prédicteurs proposée par Särndal et Wright (1984). Ces prédicteurs comprennent un prédicteur fondé sur un modèle, un estimateur assisté par un modèle et un estimateur cosmétique. Dans nos configurations de simulation, l’estimateur cosmétique a obtenu un rendement légèrement supérieur à l’estimateur assisté par un modèle. Comme prévu, le prédicteur fondé sur un modèle n’a pas donné de bons résultats lorsque le modèle sous-jacent était mal défini.
Le projet repose sur une collaboration avec La Poste en France ainsi qu’avec l’École d’économie de Toulouse et l’Université de Besançon. Les résultats préliminaires du projet ont été présentés lors d’une séance sur invitation au Colloque francophone sur les sondages à l’automne 2021. Un article a été rédigé et présenté à une revue à comité de lecture (Medous, Goga, Ruiz-Gazen, Beaumont, Dessertaine et Puech, 2022a).
Pour obtenir
plus de renseignements, communiquez avec :
Jean-François
Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).
Bibliographie
Kim, J.-K., et Tam, S.-M. (2021). Data integration by combining big data and survey sample data for finite population inference. Revue Internationale de Statistique, 89,382–401.
Medous, E., Goga, C., Ruiz-Gazen, A., Beaumont, J.-F., Dessertaine, A. et Puech, P. (2022a). QR prediction for statistical data integration. Manuscrit inédit en cours d’examen.
Särndal, C.-E., et Wright, R. (1984). Cosmetic form of estimators in survey sampling. Scandinavian Journal of Statistics, 11, 146–156.
1.2 Couplage d’enregistrements
Le couplage d’enregistrements joue un rôle important dans la production de statistiques officielles. Il peut toutefois donner lieu à des erreurs, car il repose souvent sur des quasi-identificateurs non uniques qui sont enregistrés avec des variations et des erreurs typographiques. Le projet porte sur la production et l’utilisation de données couplées, y compris sur l’estimation exacte des erreurs de couplage.
SOUS-PROJET : Estimation des erreurs de couplage
Les erreurs de couplage comprennent les faux négatifs et les faux positifs; le faux négatif ne permet pas de coupler les enregistrements d’une même unité, et le faux positif couple des enregistrements de différentes unités. Ces erreurs sont mesurées par le rappel et la précision. L’estimation des mesures est essentielle pour pouvoir coupler efficacement les ensembles de données, rendre compte de la qualité des données couplées et apporter des ajustements en tenant compte des erreurs lors de l’analyse des données. Le projet permet d’examiner la convergence des estimateurs qui modélisent le nombre de couplages faits à partir d’un enregistrement donné (Blakely et Salmond, 2002; Dasylva et Goussanou, 2020; Dasylva et Goussanou, 2021). Il est essentiel d’établir cette convergence si les erreurs doivent être estimées sans accès aux données réelles sur le terrain. Cela est toutefois difficile parce que les estimateurs sont fondés sur des modèles où les observations sous-jacentes ont une structure de dépendance complexe, c’est-à-dire une structure qui n’est pas facilement décrite par les structures de dépendance habituelles, comme les grappes indépendantes (comme dans les modèles linéaires mixtes généralisés), les séries chronologiques ou les U-statistiques.
Progrès :
Il a été démontré que la précision et le rappel satisfont à une loi des grands nombres dans des conditions générales, pour une vaste catégorie de stratégies de couplage, y compris certaines stratégies dans le cadre desquelles la décision de coupler deux enregistrements peut toucher d’autres enregistrements (Dasylva et Goussanou, 2022). Les estimateurs proposés par Blakely et Salmond (2002) et par Dasylva et Goussanou (2020) se sont également révélés convergents, c’est-à-dire qu’ils convergent vers la précision et le rappel limitatifs (Dasylva et Goussanou, 2022) lorsque la population devient arbitrairement importante.
Pour obtenir
plus de renseignements, communiquez avec :
Abel Dasylva (613-408-4850, abel.dasylva@statcan.gc.ca).
Bibliographie
Blakely, T., et Salmond, C. (2002). Probabilistic record linkage and a method to calculate the positive predicted value. Journal of Epidemiology, 31, 1246-1252.
Dasylva, A., et Goussanou, A. (2020). Estimating linkage errors under regularity conditions. Dans Proceedings of the Survey Research Methods Section, American Statistical Association, 687-692.
Dasylva, A., et Goussanou, A. (2021). Estimation des faux négatifs attribuables à la création des pochettes dans le couplage d’enregistrements. Techniques d’enquête, 47, 2, 325-338. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/pub/12-001-x/2021002/article/00002-fra.pdf.
Dasylva, A., et Goussanou, A. (2022). On the consistent estimation of linkage errors without training data. Japanese Journal of Statistics and Data Science.
SOUS-PROJET : Capture-recapture avec erreurs de couplage
Dans le contexte de son paradigme « données administratives d’abord », Statistique Canada donne la priorité à l’utilisation de sources autres que les enquêtes pour produire des statistiques officielles. Ce paradigme repose de façon capitale sur des sources autres que les enquêtes pouvant fournir une couverture quasi parfaite de certaines populations cibles, y compris des fichiers administratifs ou des sources de mégadonnées. Cette couverture doit toutefois être mesurée, en appliquant par exemple la méthode de capture-recapture, selon laquelle les données sont comparées à d’autres sources présentant une bonne couverture des mêmes populations, y compris un recensement. Cependant, il s’agit d’un exercice difficile lorsque des erreurs de couplage sont présentes (Ding et Fienberg, 1994; Di Consiglio et Tuoto, 2015), ce qui survient inévitablement lorsque le couplage repose sur des quasi-identificateurs, comme cela est généralement le cas.
Progrès :
Une nouvelle méthodologie de capture-recapture avec erreurs de couplage a été élaborée (Dasylva, Goussanou et Nambeu, 2021). Elle est fondée sur le modèle d’erreurs de couplage proposé par Dasylva et Goussanou (2020), et comporte une extension pour tenir compte de la sous-couverture. Comparativement aux solutions précédentes proposées par Ding et Fienberg (1994) et Di Consiglio et Tuoto (2015), la nouvelle méthodologie ne tient pas pour acquis qu’il n’y a pas de faux positifs. Elle a été appliquée avec succès dans le cadre d’une expérience avec des données publiques de recensement.
Pour obtenir
plus de renseignements, communiquez avec :
Abel Dasylva (613-408-4850, abel.dasylva@statcan.gc.ca).
Bibliographie
Dasylva, A., et Goussanou, A. (2020). Estimating linkage errors under regularity conditions. Dans Proceedings of the Survey Research Methods Section, American Statistical Association, 687-692.
Dasylva, A., Goussanou, A. et Nambeu, C.-O. (2021). Measuring the undercoverage of two data sources with a nearly perfect coverage through capture and recapture in the presence of linkage errors. Dans le Recueil du Symposium international de 2021 sur les questions de méthodologie, Statistique Canada, Ottawa (à paraître).
Di Consiglio, L., et Tuoto, T. (2015). Coverage Evaluation on Probabilistically Linked Data. Journal of Official Statistics, 31, 415-429.
Ding, Y., et Fienberg, S.E. (1994). Estimation de système dual du sous-dénombrement dans le recensement lorsqu’il y a erreur d’appariement. Techniques d’enquête, 20, 2, 155-165. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/fr/pub/12-001-x/1994002/article/14422-fra.pdf.
SOUS-PROJET : Intersection d’ensembles privés avec erreurs de couplage
Un organisme statistique peut évaluer la couverture d’une source de données d’une tierce partie en la comparant à une source de référence au moyen du couplage d’enregistrements et de l’estimation par capture-recapture. Cette comparaison représente toutefois un défi lorsque l’organisme statistique ne peut pas accéder directement à la source de la tierce partie parce que la confiance est limitée entre les deux parties. Lorsqu’il n’y a pas d’erreur de couplage, il est possible d’utiliser le protocole décrit par Christen (2012, chapitre 8) pour estimer la taille de l’intersection entre l’ensemble de données de la tierce partie et l’ensemble de données de référence, d’une manière qui permet de préserver la confidentialité. La solution est particulièrement simple, car elle ne requiert que des comparaisons exactes. La présence d’erreurs de couplage complique toutefois les choses.
Progrès :
Une méthodologie simple a été décrite pour l’estimation par capture-recapture lorsque l’intersection est déterminée au moyen du protocole d’intersection d’ensembles privés décrit par Christen (2012, chapitre 8), que les comparaisons sont exactes et que des erreurs de couplage sont présentes (Dasylva et Zanussi, 2021a, 2021b). La solution fait appel au modèle décrit par Dasylva et Goussanou (2020), qui permet à l’organisme d’apporter des ajustements en tenant compte des erreurs de couplage lorsqu’il estime la taille de l’intersection et de la couverture de la source de la tierce partie.
Pour obtenir
plus de renseignements, communiquez avec :
Abel Dasylva (613-408-4850, abel.dasylva@statcan.gc.ca).
Bibliographie
Christen, P. (2012). Data Matching. Springer, Berlin.
Dasylva, A., et Goussanou, A. (2020). Estimating linkage errors under regularity conditions. Dans Proceedings of the Survey Research Methods Section, American Statistical Association, 687-692.
Dasylva, A., et Zanussi, Z. (2021a). Measuring the coverage of a data source with a private set intersection. Rapport interne, Statistique Canada, Ottawa.
Dasylva, A., et Zanussi, Z. (2021b). A Private Set Intersection Use Case. Présentation à l’UNECE Input Privacy-Preserving webinar, Nov. 2021.
1.3 Estimation sur petits domaines
SOUS-PROJET : Inférence hiérarchique bayésienne pour l’estimation sur petits domaines à l’aide de différentes distributions a priori pour les composantes de variance
La modélisation hiérarchique bayésienne est très populaire dans l’estimation sur petits domaines, et la spécification de distributions a priori est très importante dans l’approche de la modélisation hiérarchique bayésienne. Dans le cadre du projet, nous étudions l’incidence des distributions a priori sur l’estimation sur petits domaines selon les modèles hiérarchiques bayésiens de You et Chapman (2006), de Sugasawa, Tamae et Kubokawa (2017) et de You (2021). En particulier, nous étudierons l’utilisation d’une distribution a priori non hiérarchique et de distributions a priori gamma inverses pour les composantes de variance au moyen d’une étude par simulations et d’une analyse sur données réelles.
Progrès :
Nous avons étudié deux spécifications de distributions a priori pour les composantes de variance dans les modèles hiérarchiques bayésiens de You et Chapman (2006) et de You (2021). Nous avons mené une étude par simulations et appliqué les modèles aux données de l’EPA. Nos résultats révèlent que la distribution a priori gamma inverse dans les modèles hiérarchiques bayésiens fonctionne très bien et peut donner de meilleurs résultats que la distribution a priori plate. Un document de recherche (You, 2022) a été rédigé.
Pour obtenir
plus de renseignements, communiquez avec :
Yong You
(613-863-9263, yong.you@statcan.gc.ca).
Bibliographie
Sugasawa, S., Tamae, H. et Kubokawa, T. (2017). Bayesian estimators for small area models shrinking both means and variances.Scandinavian Journal of Statistics, 44, 150-167.
You, Y. (2021). Estimation sur petits domaines à l’aide du modèle au niveau de domaine de Fay-Herriot avec lissage et modélisation de variance d’échantillonnage. Techniques d’enquête, 47, 2, 389-399. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/fr/pub/12-001-x/2021002/article/00007-fra.pdf.
You, Y. (2022). An empirical study of hierarchical Bayes small area estimators using different priors on model variances. Document de recherche interne, Statistique Canada, Ottawa.
You, Y., et Chapman, B. (2006). Estimation pour petits domaines au moyen de modèles régionaux et d’estimations des variances d’échantillonnage. Techniques d’enquête, 32, 1, 107-114. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/fr/pub/12-001-x/2006001/article/9263-fra.pdf.
SOUS-PROJET : Méthodes de lissage de la variance due à l’échantillonnage pour l’estimation sur petits domaines
Le lissage de la variance due à l’échantillonnage est un sujet important dans l’estimation sur petits domaines. Dans le cadre du projet, nous étudierons différentes méthodes de lissage de la variance due à l’échantillonnage, y compris l’utilisation des effets de plan et des fonctions de variance généralisée pour l’estimation de proportions sur petits domaines. Les méthodes de lissage proposées peuvent être utilisées comme approche type et permettre de simplifier la procédure de lissage pour l’estimation sur petits domaines fondée sur un modèle.
Progrès :
Nous avons étendu le travail de You et Hidiroglou (2012) et proposé différentes méthodes de lissage de la variance due à l’échantillonnage pour l’estimation des proportions sur petits domaines. Nous avons appliqué les méthodes de lissage proposées à différentes données d’enquête, y compris celles de l’Enquête sur la santé dans les collectivités canadiennes et de l’Enquête sur la participation et les limitations d’activités. Nous avons également appliqué les méthodes de lissage proposées aux données de l’Enquête sur la population active pour l’estimation du taux de chômage, et nous avons comparé les résultats avec ceux de la méthode proposée par Hidiroglou, Beaumont et Yung (2019). Un document de recherche (You et Hidiroglou, 2022) a été rédigé. Une étude par simulations sera réalisée, et nous prévoyons présenter le document à une revue à comité de lecture en vue d’une publication éventuelle.
Pour obtenir
plus de renseignements, communiquez avec :
Yong You
(613-863-9263, yong.you@statcan.gc.ca).
Bibliographie
Hidiroglou, M.A., Beaumont, J.-F. et Yung, W. (2019). Élaboration d’un système d’estimation sur petits domaines à Statistique Canada. Techniques d’enquête, 45, 1, 107-133. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/pub/12-001-x/2019001/article/00009-fra.pdf.
You, Y., et Hidiroglou, M. (2012). Sampling variance smoothing methods for small area proportion estimators. Document de travail de la Direction générale de la méthodologie, SRID-2012-08E, Statistique Canada, Ottawa, Canada.
You, Y., et Hidiroglou, M. (2022). Application of sampling variance smoothing methods for small area proportion estimation. Document de recherche interne, Statistique Canada, Ottawa.
SOUS-PROJET : Estimation de l’erreur quadratique moyenne fondée sur le plan de sondage dans l’estimation sur petits domaines
L’utilisation du modèle de Fay-Herriot pour produire des estimations sur petits domaines a augmenté à Statistique Canada au cours des cinq dernières années. Ces estimations sont généralement accompagnées d’estimations de l’erreur quadratique moyenne (EQM) fondée sur le modèle. Les utilisateurs sont toutefois habitués aux estimations de l’EQM fondée sur le plan de sondage. Par rapport à l’EQM fondée sur le modèle, l’EQM fondée sur le plan de sondage a l’avantage de ne pas éliminer par intégration la spécificité d’un domaine particulier, et elle peut présenter un plus grand intérêt pour les utilisateurs comme indicateur de la qualité des estimations. Les estimations fondées sur le plan de l’EQM fondée sur le plan sont réputées instables (voir par exemple Rao, Rubin-Bleuer et Estevao, 2018). Nous envisageons d’étudier l’utilisation d’une approche conditionnelle pour obtenir un estimateur plus efficace de l’EQM fondée sur le plan de sondage.
Progrès :
Dans le cadre d’études antérieures, des estimateurs de l’EQM fondée sur le plan de sondage à partir d’une approche conditionnelle ont été élaborés. Cette année, une étude de simulation a permis d’évaluer plusieurs estimateurs de l’EQM fondée sur le plan de sondage, et une théorie additionnelle permettant de mieux expliquer les propriétés empiriques a été élaborée. La principale conclusion de nos travaux de recherche est qu’il ne semble pas possible d’estimer avec exactitude l’EQM fondée sur le plan. Nous prévoyons terminer nos études et résumer nos constatations dans un rapport.
Pour obtenir
plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).
Bibliographie
Rao, J.N.K., Rubin-Bleuer, S. et Estevao, V.M. (2018). Mesure de l’incertitude associée aux estimateurs pour petits domaines basés sur un modèle. Techniques d’enquête, 44, 2, 163-180. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/pub/12-001-x/2018002/article/54958-fra.pdf.
- Date de modification :