Programme de recherche et développement en méthodologie : réalisations, 2024-2025
4.  Confidentialité et accès aux données

Les études de Statistique Canada portant sur la confidentialité ont continué de mettre l’accent sur l’élaboration de nouvelles méthodes et idées offrant d’autres formes d’accès, tout en continuant de veiller à ce que les renseignements personnels et commerciaux ne soient divulgués d’aucune façon. Des progrès ont été réalisés dans le cadre des projets décrits ci-dessous. L’équipe responsable du Centre de confidentialité et d’accès aux données à Statistique Canada a également continué d’offrir des services de consultation aux partenaires internes et externes comme moyen de contribuer au renforcement des capacités en matière de détermination et de traitement des risques de divulgation (voir la section 5.5).

PROJET : Évaluation de la confidentialité des estimations sur petits domaines

Comme il est indiqué dans le rapport précédent, Statistique Canada ne dispose pas de directives officielles sur les règles de confidentialité pour la diffusion d’estimations sur petits domaines et aucune étude officielle n’a encore été menée à ce sujet.

Progrès :

Une étude (Tang, 2024) décrivant le processus de simulation et traitant des justifications des règles de confidentialité proposées a été présentée au Symposium de 2024 sur les questions de méthodologie et sera publiée dans le cadre des actes du Symposium.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Cissy Tang (cissy.tang@statcan.gc.ca).

Bibliographie

Tang, C. (2024). Statistical disclosure control analysis for small area estimation. Recueil : Symposium 2024, Le futur des statistiques officielles, Statistique Canada, Ottawa, Canada.

PROJET : Données synthétiques

Il est essentiel de travailler à accroître les options à la disposition des utilisateurs de données. La création de données synthétiques est une façon d’aborder les problèmes de confidentialité liés aux données personnelles tout en conservant la plus grande valeur analytique possible. Les données synthétiques peuvent être particulièrement utiles lors de la recherche d’occasions de collaboration avec des intervenants externes qui n’ont peut-être pas accès aux microdonnées confidentielles.

Progrès :

Compte tenu du succès de la diffusion de la Base de données synthétiques pour le modèle de microsimulation dynamique PASSAGES, une version provisoire d’une mise à jour des lignes directrices internes pour la création de fichiers de données synthétiques a été préparée (Gauvin, 2025). Cette version remplacera la documentation existante utilisée pour guider les développeurs lors de la création de données synthétiques.

Gauvin (2024) a présenté son travail d’élaboration des données synthétiques pour le modèle PASSAGES à l’assemblée annuelle de 2024 de la Société statistique du Canada.

Yu (2024) a présenté un examen de l’évaluation du risque de divulgation de données synthétiques dans le cadre du Symposium international de 2024 sur les questions de méthodologie.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Héloïse Gauvin (heloise.gauvin@statcan.gc.ca) ou
Steven Thomas (steven.thomas@statcan.gc.ca).

Bibliographie

Gauvin, H. (2025). Practical Guidelines for the Creation of Synthetic Data Files. Document interne, Statistique Canada.

Gauvin, H. (2024). Creating a synthetic version of a longitudinal and structured file: Challenges and lessons. Recueil de la Section des méthodes d’enquête, Société Statistique du Canada, St. Johns, Terre-Neuve, https://ssc.ca/sites/default/files/imce/gauvin_ssc2024.pdf.

Yu, Z. (2024). Évaluation des risques liés à la divulgation de données synthétiques. Recueil : Symposium 2024, Le futur des statistiques officielles, Statistique Canada, Ottawa, Canada.

PROJET : Stratégies d’optimisation pour la suppression de cellules complémentaires

La suppression de cellules complémentaires (SCC) est une méthode typique pour supprimer de façon confidentielle les cellules sensibles lors de la diffusion de données quantitatives tabulaires. Cette méthodologie est bien élaborée et appuyée par la solution G-Confid de Statistique Canada, dans le cadre de laquelle des solutions de suppression optimales sont obtenues pour veiller à ce que les modèles de suppression soient valides et réduire au minimum la quantité de renseignements supprimés.

Progrès :

Statistique Canada a construit avec succès une solution bêta de G-Confid fondée sur Python. Cela comprend une solution d’arrondissement additive optimale, un outil de calcul des mesures de sensibilité, la création d’une tendance optimale de SCC et un programme de vérification pour s’assurer que les tendances sont valides. Les solutions fondées sur le code source ouvert disponibles dans le cadre de la trousse PuLP Python ont été étudiées en tant que remplacements potentiels et appliquées avec prudence aux cas les plus complexes à Statistique Canada.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Steven Thomas (steven.thomas@statcan.gc.ca).

PROJET : Cadre fondé sur le risque de divulgation et l’utilité des données pour comparer les mécanismes de contrôle de la divulgation statistique

En tant qu’organisme national de statistique (ONS), Statistique Canada a été chargé de trouver des façons de diffuser les données à des niveaux plus détaillés. Offrir des analyses statistiques sur de petites sous-populations à des niveaux géographiques plus désagrégés suscite un intérêt particulier. Il s’agit de l’initiative du Plan d’action sur les données désagrégées (PADD). Toutefois, la diffusion des données doit toujours se faire en respectant les dispositions en matière de confidentialité de la Loi sur la statistique. Une composante clé de la diffusion de produits statistiques conformes aux règles sur la confidentialité consiste à appliquer des mesures de contrôle de la divulgation statistique (CDS) aux produits statistiques avant leur diffusion.

Progrès :

Pour mieux répondre aux besoins des utilisateurs, des recherches sont en cours pour analyser les diverses méthodes de CDS, dans le but de mesurer l’utilité et le risque de divulgation qui leur sont associés. Un cadre de compromis entre l’utilité et le risque de divulgation est proposé pour comparer les méthodes de CDS présentées. En appliquant ce cadre, un responsable de la diffusion de données peut choisir une méthode de CDS qui équilibre de façon optimale le risque de divulgation et l’utilité dans une situation donnée. Un document de travail interne est en cours d’élaboration et sa publication externe sera envisagée.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Joshua Miller (joshua.miller@statcan.gc.ca).

PROJET : Évaluation des facteurs fondés sur l’utilité et le risque de divulgation au regard de la mise en œuvre de la confidentialité différentielle dans le contexte de la diffusion de données tabulaires

La confidentialité différentielle est un cadre de contrôle de la divulgation statistique (CDS) visant à limiter le niveau de fuite de renseignements privés encourue en fonction de la contribution d’une personne à une base de données privée après la diffusion des résultats statistiques. Ce cadre a d’abord été étudié dans Dwork, McSherry, Nissim et Smith (2006). Un cadre de CDS respectant les exigences de confidentialité différentielle a été proposé par des universitaires et des organismes gouvernementaux. Plus précisément, des méthodes se prêtant au cadre ont été utilisées comme solutions remplaçant des méthodes traditionnelles de CDS, comme l’arrondissement et la suppression de cellules. Par exemple, le Bureau du recensement des États-Unis a mis en œuvre des algorithmes de confidentialité différentielle comme méthode de publication des résultats de son Recensement de 2020, comme l’illustrent Abowd, Ashmead, Cumings-Menon, Garfinkel, Heineck, Heiss, Johns, Kifer, Leclerc, Machanavajjhala, Moran, Sexton, Spence et Zhuravlev (2022). Il est donc de la plus haute importance que Statistique Canada comprenne pleinement le cadre de confidentialité différentielle et investisse dans des domaines où cela pourrait se traduire par de grandes améliorations de son écosystème de diffusion de données.

Même si l’on sait que la confidentialité différentielle offre de solides garanties en matière de protection des renseignements personnels, elle peut faire l’objet de critiques. L’une des critiques courantes de la confidentialité différentielle est l’impact des méthodes sur l’utilité des données publiées. De plus, il peut être difficile d’établir un compromis approprié entre l’utilité et le risque de divulgation. Dans le contexte de la confidentialité différentielle, cela se traduit par la détermination d’un budget approprié pour la protection des renseignements personnels. De plus, si elle n’est pas correctement mise en œuvre, la confidentialité différentielle peut ne pas protéger les cellules sensibles. Par conséquent, une évaluation de l’utilité des données respectant la confidentialité différentielle ainsi qu’une étude plus approfondie des défis de la confidentialité différentielle sont justifiées. Cela comprend également de comparer des méthodes respectant les notions de confidentialité différentielle avec les méthodes traditionnelles de CDS.

Progrès :

Un article détaillé résumant les défis pratiques auxquels fait face l’adoption d’un cadre de confidentialité différentielle (Miller, 2025) a été rédigé. Cet article comprend un résumé de la confidentialité différentielle et une analyse de ses propriétés de base. Une comparaison des différentes définitions de la confidentialité différentielle est également incluse. De plus, une explication intuitive des garanties qu’un cadre de confidentialité différentielle fournit est présentée. Les méthodes traditionnelles de CDS, comme l’arrondissement aléatoire, sont également examinées dans l’optique de la confidentialité différentielle. L’un des principaux obstacles pratiques auxquels font face les responsables de la diffusion lorsqu’ils envisagent l’adoption de la confidentialité différentielle est le choix d’un paramètre de confidentialité approprié. Cette question est traitée en détail dans le document et des suggestions sont proposées.

Un algorithme de CDS respectant les principes de confidentialité différentielle a été mis à l’essai sur les données du Recensement canadien de 2021 pour démontrer à quoi pourrait ressembler l’adoption de la confidentialité différentielle en pratique. L’algorithme mis en œuvre était fondé sur l’algorithme TopDown du Bureau du recensement des États-Unis. L’algorithme TopDown a d’abord été appliqué aux données du recensement des États-Unis de 2020, comme il en est question dans Abowd et coll. (2022). L’une des principales constatations de l’étude de cas du recensement canadien était que l’utilité des produits statistiques pouvait être considérablement compromise si l’objectif du responsable de la diffusion était d’offrir des garanties importantes en matière de protection de la vie privée.

Le document de Miller sur la confidentialité différentielle (2025) fait l’objet d’un examen par les pairs et sera officialisé au cours de l’exercice 2025-2026 en tant que document de travail de la direction. Les résultats de ces recherches ont également été communiqués sous forme de séminaire sur la recherche méthodologique.

Pour obtenir plus de renseignements, veuillez communiquer avec :
Joshua Miller (joshua.miller@statcan.gc.ca).

Bibliographie

Abowd, J.M., Ashmead, R., Cumings-Menon, R., Garfinkel, S., Heineck, M., Heiss, C., Johns, R., Kifer, D., Leclerc, P., Machanavajjhala, A., Moran, B., Sexton, W., Spence, M. et Zhuravlev, P. (2022). The 2020 Census disclosure avoidance system TopDown algorithm. Harvard Data Science Review, (Numéro spécial 2).

Dwork, C., McSherry, F., Nissim, K. et Smith, A. (2006). Calibrating noise to sensitivity in private data analysis. Journal of Privacy and Confidentiality, 7(3), 17-51.

Miller, J. (2025). A Privacy-Utility Based Study of Differential Privacy. Rapport interne, Statistique Canada.


Date de modification :