Programme de recherche et développement en méthodologie : réalisations, 2023-2024
4.  Confidentialité et accès aux données

Les travaux de recherche sur la confidentialité à Statistique Canada continuent de porter sur l’élaboration de nouvelles méthodes et idées qui offrent d’autres formes d’accès tout en continuant à garantir que les renseignements personnels des particuliers et des entreprises ne sont divulgués d’aucune façon. Des progrès ont été réalisés dans le cadre des projets décrits ci-dessous. L’équipe responsable du Centre de la confidentialité et de l’accès de Statistique Canada a également continué d’offrir des services de consultation aux partenaires internes et externes afin d’aider à renforcer la capacité de détection et de traitement des risques de divulgation (voir la section 5.5).

PROJET : Évaluation de la confidentialité pour des estimations sur petits domaines

À l’heure actuelle, Statistique Canada ne dispose d’aucune directive officielle concernant les règles de confidentialité aux fins de diffusion des estimations sur petits domaines et aucune étude officielle n’a encore été menée à ce sujet. Depuis quelques années, les chercheurs des centres de données de recherche (CDR) demandent de plus en plus des lignes directrices détaillées sur la confidentialité afin de pouvoir publier en toute sécurité des estimations sur petits domaines. La présente analyse de la confidentialité a été appliquée à l’estimation sur petits domaines au niveau du domaine et repose sur des simulations dans R pour examiner l’effet de différentes tailles d’échantillon et de divers niveaux d’erreur du modèle sur le risque de divulgation.

Progrès :

On a créé des populations simulées dans lesquelles les échantillons sont sélectionnés. Les populations simulées contenaient une variable auxiliaire, une variable d’intérêt et de l’information sur le domaine. La force de la relation entre la variable auxiliaire et la variable d’intérêt a été contrôlée au moyen d’une variable « d’erreur » avec une composante aléatoire. Des échantillons aléatoires stratifiés ont été tirés, et des estimations sur petits domaines au niveau du domaine ont été calculées au moyen du regroupement de fonctions sae de R (Molina et Marhuenda, 2015). On a comparé le risque de divulgation des estimations sur petits domaines aux estimations directes de Horvitz-Thompson pour démontrer que les estimations sur petits domaines sont intrinsèquement moins risquées que les estimations directes, particulièrement quand les taux d’échantillonnage sont extrêmement bas. Nous avons ensuite analysé les résultats, puis proposé des lignes directrices exhaustives concernant la confidentialité aux fins de diffusion d’estimations sur petits domaines au niveau du domaine.

Nous avons presque terminé de rédiger un article qui décrit le processus de simulation et explique les justifications des règles de confidentialité proposées. Un résumé pour le Symposium international de 2024 sur les questions de méthodologie a été soumis et est en attente d’approbation.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Cissy Tang (cissy.tang@statcan.gc.ca).

Bibliographie

Molina, I., et Marhuenda, Y. (2015). sae: An R Package for small area estimation. The R Journal, 7, 81-98.

PROJET : Données synthétiques

Il est essentiel de chercher à offrir plus d’options aux utilisateurs de données. La création de données synthétiques constitue un moyen de traiter les problèmes de confidentialité des données personnelles tout en conservant la plus grande valeur analytique possible. Les données synthétiques peuvent être particulièrement utiles quand il s’agit de collaborer avec des intervenants externes qui n’ont pas nécessairement accès aux microdonnées confidentielles.

Progrès :

La base de données synthétiques pour le modèle de microsimulation dynamique PASSAGES est terminée. Les données, accompagnées du modèle, ont été diffusées le 23 avril 2024 (Statistique Canada, 2024). La population de départ synthétique représente la population canadienne au 31 décembre 2015. Les antécédents familiaux et de revenu de ces acteurs individuels remontent à 1966. La population de départ synthétique a été créée principalement au moyen de méthodes d’apprentissage automatique qui intégraient des données de recensement, des données fiscales et d’autres sources de données administratives. Afin de créer cette base de données synthétique, on a eu recours à une combinaison de techniques de manière à tenir compte de sa dimension hiérarchique (personne organisée en unités familiales) et de sa dimension temporelle (variables relatives à la trajectoire de vie ayant des corrélations longitudinales complexes).

Le centre est en train de mettre à jour des lignes directrices internes aux fins de création de fichiers de données synthétiques et de terminer l’examen de l’évaluation des risques de divulgation pour les données synthétiques.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Héloïse Gauvin (heloise.gauvin@statcan.gc.ca) ou
Steven Thomas (steven.thomas@statcan.gc.ca).

Bibliographie

Statistique Canada (2024). Le Quotidien ‒ Nouveau modèle de microsimulation de revenu de retraite maintenant offert. Disponible à l’adresse : https://www150.statcan.gc.ca/n1/daily-quotidien/240423/dq240423c-fra.htm.

PROJET : Stratégies d’optimisation pour la suppression de cellules complémentaires

La suppression de cellules complémentaires est une méthode standard de suppression de cellules sensibles confidentielles lors de la diffusion de variables de données quantitatives tabulaires. Cette méthodologie est bien élaborée et appuyée par la solution G-Confid de Statistique Canada, par laquelle on obtient des solutions de suppression optimales qui garantissent que les modèles de suppression sont valides et réduisent le plus possible la quantité de renseignements supprimés.

Statistique Canada s’assure que ses solutions logicielles restent diversifiées et cherche des solutions autres que les solutions standards qui reposent sur le système d’analyse statistique (SAS) utilisé jusqu’à maintenant. Le retrait de G-Confid de SAS représente un défi, car il faut trouver des solutions compatibles avec le solveur OPTMODEL de SAS. Les solutions « libres » disponibles par l’intermédiaire du progiciel Python PuLP ont été étudiées comme solutions de remplacement possibles. Les résultats ont été analysés et des résultats préliminaires ont été présentés aux Joint Statistical Meetings (JSM) en 2023 (Chen et Thomas, 2023).

Pour obtenir plus de renseignements, veuillez communiquer avec :
Steven Thomas (steven.thomas@statcan.gc.ca).

Bibliographie

Chen, H., et Thomas, S. (2023). Assessing the Performance of the Open-Source Linear Programming Solver in Cell Suppression Problems. Dans Proceedings of the Survey Research Methods Section, American Statistical Association. Disponible à l’adresse : https://doi.org/10.5281/zenodo.10359791.


Date de modification :