Programme de recherche et développement en méthodologie : réalisations, 2020-2021
3. Théorie et cadre

3.1 Inférence provenant d’échantillons non probabilistes

Les bureaux nationaux de statistique souhaitent de plus en plus produire des statistiques officielles à l’aide d’échantillons de données non-probabilistes, comme les mégadonnées ou les données provenant d’enquêtes Web menées auprès de volontaires. En fait, Statistique Canada a récemment mené plusieurs enquêtes en ligne auprès de volontaires, appelées enquêtes par approche participative, pour évaluer les répercussions de la pandémie de COVID-19 sur différents aspects de la vie de la population canadienne. On veut utiliser des échantillons non probabilistes en raison de leur faible coût, du fardeau de réponse réduit, et d’un délai d’exécution rapide puisqu’ils permettent de produire des estimations peu après avoir déterminé les besoins en données. Toutefois, les échantillons non probabilistes sont bien connus pour produire des estimations qui peuvent être entachées d’un biais de sélection important. Beaumont et Rao (2021) discutent de cette importante limite, avec une illustration, et décrivent certains remèdes qui impliquent l’intégration des données de l’échantillon non probabiliste avec les données d’un échantillon probabiliste. Renaud et Beaumont (2020) décrivent quatre initiatives de recherche récentes visant à tirer parti des données d’échantillons non probabilistes.

La manière d’obtenir des estimations adéquates et de faire des inférences valides à partir d’échantillons non probabilistes est une question importante qui nécessite encore des recherches et des expérimentations. Les quatre sous-projets suivants ont tenté de répondre à cette question.

SOUS-PROJET : Réduction du biais des estimateurs d’échantillons non probabilistes par des méthodes de pondération par score de propension avec application aux données d’approche participative

L’objectif de ce projet est d’étudier et d’élaborer des méthodes de pondération par score de propension, qui combinent les données d’un échantillon non probabiliste qui contient des variables d’intérêt et des variables auxiliaires avec les données d’un échantillon probabiliste qui contient les mêmes variables auxiliaires (ou un sous-ensemble d’entre elles). La pondération par score de propension consiste à modéliser la probabilité de participation à l’échantillon non probabiliste.

Progrès :

Nous avons d’abord examiné un modèle logistique (voir Chen, Li et Wu, 2019) et développé une procédure de sélection de variables basée sur un critère d’information d’Akaike modifié (AIC). Notre critère AIC modifié tient compte de la structure des données et du plan de sondage probabiliste, qui peut être complexe. Nous avons également élaboré une méthode simple pour former des strates a posteriori homogènes. De plus, nous avons étendu l’algorithme de l’arbre de classification et de régression (CART) (Breiman, Friedman, Stone et Olshen, 1984) à cette structure de données et nous avons mis au point une procédure d’élagage qui, encore une fois, tient compte du plan de sondage probabiliste. Notre nouvel algorithme s’appelle nppCART. Quelques détails sur la procédure d’élagage sont donnés dans Beaumont et Chu (2020). Nous avons également mis au point un estimateur de la variance bootstrap, qui reflète deux sources de variabilité : le modèle d’échantillonnage probabiliste et le modèle de participation. Nos méthodes sont actuellement évaluées à l’aide de données de l’approche participative et de données de l’Enquête sur la population active (EPA). Un document a été rédigé, qui est sur le point d’être achevé.

SOUS-PROJET : Approche bayésienne approximative pour améliorer les estimateurs d’un échantillon probabiliste à l’aide d’un échantillon non probabiliste supplémentaire

Une méthode bayésienne pour combiner les données d’un échantillon probabiliste et non probabiliste a récemment été diffusée dans le Journal of Official Statistics (Sakshaug, Wisniowski, Ruiz, et Blom, 2019). Ces auteurs ont examiné l’estimation des paramètres du modèle lorsque la variable dépendante y et le vecteur des variables explicatives x sont observés dans les deux échantillons. Ils ont utilisé l’échantillon non probabiliste comme moyen de déterminer la moyenne a priori des paramètres du modèle, en supposant que le plan de sondage probabiliste est ignorable. L’objectif de ce projet est d’étendre leur méthode à l’estimation de paramètres de population finie pour un plan de sondage probabiliste qui n’est pas nécessairement ignorable, et de voir si nous pouvons obtenir des estimations fondées sur un modèle qui sont plus efficaces que les estimations pondérées standard.

Progrès :

Nous avons fait l’extension à l’estimation de la moyenne d’une population finie pour un plan de sondage probabiliste non ignorable. Nous avons également mené des expériences de simulation préliminaires qui ont été résumées dans You (2021c). Nous prévoyons terminer l’étude de simulation et rédiger un document qui sera présenté au Symposium de 2021 de Statistique Canada.

SOUS-PROJET : Estimation d’erreur quadratique moyenne pour les estimations d’échantillons non probabilistes à l’aide de techniques d’estimation sur petits domaines

Les données administratives et d’autres sources de données non probabilistes sont de plus en plus prises en compte par les bureaux nationaux de statistique comme un moyen d’obtenir directement les renseignements recherchés sur une population. Toutefois, les estimations de ces sources non probabilistes sont souvent assujetties à un certain nombre d’erreurs et il faut élaborer des indicateurs de leur exactitude.

Progrès :

Nous avons mis au point un estimateur de l’erreur quadratique moyenne conditionnelle (EQM) des estimations de l’échantillon non probabiliste qui s’appliquent lorsqu’un échantillon probabiliste avec les mêmes variables est également disponible. Notre estimateur conditionnel de l’EQM est obtenu en utilisant les techniques d’estimation sur petits domaines. Nous avons évalué la méthode à l’aide des données du programme Longitudinal Social Development Data (programme longitudinal d’élaboration de données sociales). Le fichier du programme est constitué de dossiers administratifs et permet d’estimer les caractéristiques de la main-d’œuvre. L’Enquête sur la population active (EPA) sert d’échantillon probabiliste. Nous avons commencé à écrire un article qui résume les constatations.

SOUS-PROJET : Intégration des données statistiques selon une approche par prédiction

Nous considérons le problème où un échantillon non probabiliste est disponible qui contient un vecteur de variables auxiliaires, x, pour chaque unité de l’échantillon. Nous supposons que cet échantillon non probabiliste couvre une partie importante de la population. Un échantillon probabiliste contenant x ainsi que la variable d’intérêt y pour chaque unité de l’échantillon est également disponible. L’indicateur de participation à l’échantillon non probabiliste est disponible dans l’échantillon probabiliste. Ce scénario est pertinent pour une enquête sur le trafic postal menée par La Poste en France. Alain Dessertaine a proposé un prédicteur pour ce scénario. Nous avons mis au point des estimateurs de variance, y compris un estimateur de variance bootstrap, pour évaluer la qualité du prédicteur proposé. Les détails sont donnés dans un rapport interne en ébauche.

Progrès :

La collaboration avec La Poste, l’École d’économie de Toulouse et l’Université de Besançon s’est poursuivie et l’objectif est de rédiger un document commun. Les résultats de ce projet seront d’abord présentés lors d’une session invitée au Colloque francophone sur les sondages à l’automne 2021.

Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Breiman, L., Friedman, J.H., Stone, C.J. et Olshen, R.A. (1984). Classification and regression trees. CRC Press.

Chen, Y., Li, P. et Wu, C. (2019). Doubly robust inference with non-probability survey samples. Journal of the American Statistical Association (published online).

Sakshaug, J.W., Wisniowski, A., Ruiz, D.A.P. et Blom, A.G. (2019). Supplementing small probability samples with nonprobability samples: A Bayesian approach. Journal of Official Statsitics, 35, 653-681.

3.2 Cadre pour l’apprentissage automatique

Statistique Canada utilise des techniques d'apprentissage automatique pour résoudre des problèmes de données à grande échelle. Parallèlement, les instituts nationaux de statistique sont confrontés à une pression sans précédent pour démontrer aux citoyens, aux entreprises et aux utilisateurs qu'ils sont des institutions dignes de confiance et transparentes. Statistique Canada a élaboré un cadre adapté à l'utilisation responsable des techniques d'apprentissage automatique, y compris des lignes directrices pour la construction et la mise en œuvre de processus éthiquement et méthodologiquement solides. Il s'articule autour de 4 thèmes: respect des personnes, respect des données, application rigoureuse et méthodes éprouvées et un certain nombre d'attributs pour chaque thème. Il est aligné avec la Directive sur la prise de décision automatisée et son outil d'évaluation de l’incidence algorithmique, élaborés par le Secrétariat du Conseil du Trésor (2020).

Progrès :

Suite à des mises à l’essai et une revue par la gestion, le cadre pour l’utilisation des processus d’apprentissage automatique de façon responsable a été officiellement adopté en juillet 2020 par Statistique Canada. Une liste de contrôle accompagnant les lignes directrices a été finalisée et est utilisée pour aider à évaluer les processus d'apprentissage automatique responsables. Un processus d’évaluation des applications en apprentissage automatique qui passeront à la production a été élaboré et celui-ci comprend une revue indépendante par des experts, une documentation adéquate et le remplissage de la liste de contrôle reliée au projet. La méthodologie du projet ainsi que la revue effectuée par les experts sont présentées devant un comité de revue scientifique qui émettra des recommandations sur la méthodologie proposée. Lors de la dernière année, sept projets ont été évalués à l’aide de ce cadre. Les prochaines étapes de ce projet incluent : l'élaboration d'un tableau de bord pour consigner les revues, le développement d’un gabarit de la documentation qui devrait être fournie aux réviseurs et une nouvelle revue de littérature concernant les concepts d’explicabilité et d’interprétabilité pour être à jour dans ce domaine.

Pour obtenir plus de renseignements, communiquez avec :
Keven Bosa (613-863-8964, keven.bosa@statcan.gc.ca).

3.3 Recherche d’indicateurs de qualité

Afin de fournir aux utilisateurs des indicateurs de qualité pour les programmes qui combinent les sources de données administratives, le Secrétariat de la qualité a entrepris de mettre au point un indicateur composite qui combine des indicateurs de qualité liés aux différentes étapes du traitement des données (couplage d’enregistrements, imputation, géocodage, etc.) en un seul indicateur. L’objectif est de donner une vision globale de la qualité d’une estimation en tenant compte de plusieurs facteurs susceptibles d’introduire des erreurs. Un premier programme publiera ces indicateurs et des estimations à l’été 2021. Ce projet sera présenté dans le cadre de l’European Establishment Statistics Workshop en septembre 2021 (Beaulieu et Lebrasseur, 2021).

Pour obtenir plus de renseignements, communiquez avec :
Martin Beaulieu (613-854-2406, martin-j.beaulieu@statcan.gc.ca).


Date de modification :