Programme de recherche et développement en méthodologie : réalisations, 2024-2025
2. Méthodes et applications de la science des données
PROJET: Grands modèles de langage comme outil de post-traitement de moteurs de reconnaissance optique de caractères
Dans le cadre de ce projet, nous examinons les défis et les progrès de la technologie de reconnaissance optique de caractères (ROC), particulièrement dans le contexte de la reconnaissance de l’écriture manuscrite, en explorant la façon dont les grands modèles de langage (GML) peuvent améliorer les données de sortie de ROC grâce au post-traitement. Malgré les améliorations notables apportées aux systèmes de ROC, les textes manuscrits continuent de présenter des défis importants en raison de la variabilité des styles d’écriture manuscrite, ce qui entraîne des erreurs ayant une incidence sur les tâches en aval, comme la synthèse de texte et la reconnaissance d’entités nommées (REN).
Progrès:
Dans le cadre de cette recherche, nous avons évalué le rendement de divers outils de ROC en matière de reconnaissance de textes manuscrits et nous avons constaté que le système de reconnaissance optique de caractères par transformateur (TrOCR) fournissait les meilleurs résultats par rapport aux outils populaires de ROC en source ouverte, comme PaddleOCR et EasyOCR, tandis que des solutions exclusives comme GPT-4o et Document Intelligence ont également fourni les meilleurs résultats en présentant les taux d’erreurs de caractères les plus faibles. L’étude a démontré comment de grands modèles de langage pouvaient améliorer grandement la qualité des données de sortie de ROC en corrigeant les incohérences grammaticales et les fautes d’orthographe, GPT-4o étant un outil post-traitement réduisant substantiellement ces erreurs trouvées dans le texte extrait à l’aide de Tesseract (moteur de ROC gratuit à source ouverte) sur des extractions d’échantillons de l’ensemble de données d’écriture manuscrite de l’IAM.
De plus, nous avons exploré et conclu que les cadres d’ingénierie rédactique (requête ou invite de commande) automatique, comme DSPy, se sont révélés plus efficaces que les stratégies de rédactique manuelle pour générer des requêtes riches en contexte et détaillées. Même si la combinaison d’outils de ROC spécialisés et de modèles de langage s’est révélée très prometteuse pour améliorer l’exactitude de la reconnaissance, le défi de combinaisons d’erreurs complexes est demeuré, même pour les GML avancés, qui excellaient dans les corrections simples, mais éprouvaient des difficultés avec les substitutions de mots combinées et des problèmes plus complexes.
Nous avons reconnu la popularité de l’utilisation des GML Vision comme outils de ROC au cours des derniers mois. Par conséquent, nous avons également exploré le rendement d’outils en source ouverte comme Florence et Phi-3.5 de Microsoft et les sources fermées (GPT-4o, Document Intelligence) comme outils de reconnaissance de textes manuscrits (HTR) pour extraire du texte manuscrit et imprimé. Ces deux types d’outils fournissaient des niveaux acceptables de texte extrait. Nous espérons continuer d’explorer ces solutions, car des outils de ROC viables combinés à une optimisation de la rédactique font partie de nos travaux futurs.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Oladayo
Ogunnoiki (oladayo.ogunnoiki@statcan.gc.ca) ou
Johan
Fernandes (johan.fernandes@statcan.gc.ca).
PROJET : Détection des erreurs dans les valeurs unitaires du Commerce international
Ce travail consistait à terminer et à publier un article décrivant en détail la méthodologie sous-tendant un nouveau système fondé sur l’apprentissage automatique visant à vérifier et imputer des données sur le commerce, en production depuis octobre 2023. La Division du commerce et des comptes internationaux (DCCI) traite des millions d’enregistrements d’importations mensuels, y compris des variables comme les codes du Système harmonisé (SH), la valeur et la quantité; la valeur unitaire (VU) étant dérivée de ces deux dernières. En raison de l’accent mis sur la vérification de la valeur aux fins de droits de douane, les champs de quantité sont souvent mal déclarés, ce qui entraîne des erreurs dans les quantités agrégées et des problèmes liés aux valeurs unitaires qui, par le passé, ont demandé beaucoup de temps aux analystes pour les régler.
L’ancien système de découpage de VU, qui remplaçait les valeurs extrêmes par des donneurs autour de la médiane, comportait plusieurs limites, notamment une correction excessive, des erreurs persistantes non corrigées, une charge de travail manuel élevée et une utilisation retardée. Le nouveau système d’apprentissage automatique, passé en revue en 2022 et lancé en 2023, aborde ces problèmes et a été bien reçu par les analystes. L’officialisation de la documentation des méthodes et la publication des travaux accroîtront la transparence et faciliteront le partage des résultats pour stimuler la collaboration et le partage des connaissances, d’autant plus que l’utilisation de l’apprentissage automatique dans les statistiques officielles demeure un phénomène relativement nouveau.
Progrès :
Le projet a été mené à bien selon les étapes suivantes :
- Une version provisoire complète de l’article a été préparée (Hatko et Sall, 2024).
- L’examen par les pairs et la révision institutionnelle sont en cours.
- Les prochaines étapes comprennent l’examen du travail aux fins de confidentialité et de publication.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Stan Hatko (stan.hatko@statcan.gc.ca).
Bibliographie
Hatko, S. et Sall, A. (2024). International Trade Unit Value Error Detection and Correction. Rapport interne, Statistique Canada.
PROJET : Mesures pour le texte généré par l’IA
Ce projet porte sur la façon dont la qualité des données de sortie de la génération automatique de texte (GAT) est évaluée en fonction de différentes tâches, méthodes et cas d’utilisation. À mesure que les technologies de GAT, en particulier les grands modèles de langage (GML), se répandent, leurs données de sortie exigent des méthodes d’évaluation robustes, interprétables, multidimensionnelles et propres aux tâches. Toutefois, il n’existe actuellement aucun cadre normalisé de conception de pipelines d’évaluation. Pour aborder ce problème, le projet examine les techniques d’évaluation existantes, présente une taxonomie conceptuelle fondée sur la décomposition fonctionnelle et propose un cadre de conception d’évaluation réutilisable. L’accent est principalement mis sur les tâches unimodales de génération de texte à texte (par exemple résumé, traduction automatique, dialogue), dans le but de fournir à la fois de la clarté analytique et des outils pratiques pour la conception de futures évaluations.
Progrès :
Le projet de recherche est finalisé. Nous avons examiné la documentation d’évaluation de la GAT, en déterminant les limites critiques des pratiques actuelles (biais de surface des mesures fondées sur des règles, incohérence des protocoles d’évaluation humaine) et en synthétisant les résultats dans un cadre structuré et extensible. La revue de la littérature a été effectuée à l’aide d’un protocole de type PRISMA, afin d’analyser 385 documents de recherche, en ciblant principalement la documentation récente, tout en réexaminant les travaux fondamentaux. Cet examen couvre des méthodes d’évaluation fondées sur des règles, des humains et des GML, en mettant l’accent sur la nature multidimensionnelle de la qualité de la GAT. Nous proposons une taxonomie modulaire faisant la distinction entre les composantes d’évaluation, comme les fonctions de notation, la transformation des données d’entrée et les cibles d’évaluation. Nous avons conçu un cadre pratique de conception de pipelines d’évaluation (Istrate et Robatian, 2025), comprenant un flux de travail d’évaluation par étapes, des listes de vérification propres à chaque étape et des recommandations de pratiques exemplaires pour améliorer la convivialité et la reproductibilité, tout en proposant des outils et artefacts conviviaux pour les professionnels et n’exigeant pas de connaissances théoriques approfondies. L’objectif est de commencer à expérimenter ce cadre dans de futurs projets comprenant des textes générés par des GML, en intégrant continuellement les leçons apprises et les pratiques exemplaires, et en améliorant les artefacts du cadre.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Alexandre Istrate (alexandre.istrate@statcan.gc.ca) ou
Damoon
Robatian (damoon.robatian@statcan.gc.ca).
Bibliographie
Istrate, A. et Robatian, D. (2025). Evaluation of AI-Generated Text: Survey, Taxonomy and Practical Framework for Designing NLG Evaluation Pipelines. Rapport interne, Statistique Canada.
PROJET : Quantification de l’incertitude dans la classification des grands modèles de langage avec une prédiction conforme
Le présent projet vise à améliorer la fiabilité et l’exactitude de grands modèles de langage (GML) utilisés par Statistique Canada pour classer les tâches. En utilisant les techniques de prédiction conforme, nous cherchons à introduire des mesures de confiance quantifiables pour les prédictions faites par ces modèles avec des garanties théoriques. Cette recherche aide à améliorer la gestion des risques dans les processus de prise de décisions reposant sur des GML.
Progrès :
Notre mise en œuvre de la prédiction conforme pour les classificateurs de GML a démontré un compromis optimal entre une plus grande exactitude et l’automatisation pour les tâches de classification de GML, au moyen d’une couverture garantie de 90 %. Les GML ont atteint une exactitude de référence de 77 %. Toutefois, en appliquant la prédiction conforme aux prédictions de modèle et en automatisant le codage et la classification aux GML lorsqu’ils produisaient des prédictions très certaines (ensembles de prédictions de taille 1), 70,2 % des données étaient automatiquement classées avec une exactitude supérieure de 89,8 %. Les données restantes pouvaient également être codées automatiquement ou envoyées en vérification manuelle avec interaction humaine. Les résultats ont surpassé les approches de référence ne s’accompagnant pas de garanties théoriques. Cette technique fournit une quantification de l’incertitude statistiquement valide, traitant automatiquement des prédictions de grande fiabilité tout en acheminant intelligemment les cas ambigus aux fins d’examen manuel. Comme prochaine étape, cette approche pourrait être appliquée à la classification par code du Système de classification des industries de l’Amérique du Nord (SCIAN) en fonction des descriptions des entreprises.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Rafik Chemli (rafik.chemli@statcan.gc.ca).
PROJET : Données synthétiques pour les statistiques officielles
Ce projet porte sur les défis importants auxquels Statistique Canada doit faire face en raison de la baisse des taux de réponse aux enquêtes, du coût élevé de l’acquisition de données et de la nécessité croissante de statistiques détaillées sur de sous-populations rares. En raison de ces facteurs, il est difficile de produire des estimations statistiques solides et exactes. La solution proposée consiste à tirer parti de modèles probabilistes de diffusion de réduction du bruit de pointe pour générer de grands volumes de données tabulaires synthétiques reproduisant étroitement les répartitions de données du monde réel. Reconnaissant que les données synthétiques introduisent des biais, le projet intègre un processus de suppression de biais, inspiré par l’inférence par prédiction et l’estimateur par différence généralisé.
Progrès :
Le projet a été mené à bien selon les étapes suivantes.
- Des modèles de diffusion tabulaires ont été entraînés et appliqués à trois ensembles de données tabulaires à source ouverte.
- Les données synthétiques générées ont été analysées et comparées aux données d’origine, présentant de fortes similitudes en matière de distribution, tout en produisant des points de données entièrement uniques.
- Les estimations par échantillonnage non probabiliste fondées sur des données synthétiques ont produit des estimations présentant un biais relatif plus faible et des niveaux de couverture semblables ou légèrement réduits par rapport aux niveaux de référence.
- Pour le contexte d’échantillonnage probabiliste fondé sur le plan, un estimateur mathématique à deux degrés de suppression de biais a été proposé. Toutefois, cet estimateur n’est pas sans biais, et l’estimateur de variance n’est pas sans biais, et n’a également pas de forme explicite, ce qui rend cette approche non valide pour l’estimation fondée sur le plan.
- Nous concluons que les modèles de diffusion sont de puissants outils d’IA générative qui peuvent être utilisés pour la diffusion de microdonnées synthétiques. Les expériences semblent indiquer qu’ils maintiennent les propriétés statistiques de la répartition réelle des données sous-jacentes. Toutefois, trouver un estimateur approprié dans le contexte d’un plan de sondage probabiliste pour l’estimation de paramètres de population peut être hors de portée.
Pour obtenir plus de
renseignements, veuillez communiquer avec :
Nicholas Denis (nicholas.denis2@statcan.gc.ca).
PROJET : Guide de rédactique pour une utilisation efficace de grands modèles de langage
Le Guide de rédactique met l’accent sur l’élaboration d’un guide complet sur la rédactique afin d’aider les scientifiques de données, les chercheurs et les analystes à utiliser efficacement les grands modèles de langage (GML). L’objectif est de démystifier la rédactique et de fournir des pratiques exemplaires fondées sur des renseignements empiriques et les besoins opérationnels au sein de la communauté de la science des données fédérale. Ce guide sert de ressource pratique pour améliorer la fiabilité, la transparence et l’efficacité du déroulement des opérations axées sur les GML soutenant les programmes, l’élaboration de politiques et la prestation de services publics fédéraux.
Ce guide aborde les concepts fondamentaux, l’anatomie et la structure des requêtes, et présente des techniques de rédactique clés, comme la rédactique d’instructions, la rédactique de rôles et la rédactique « en quelques coups » (few-shot).
Progrès :
Le document a été créé et le contenu a été structuré en sections clés, notamment : 1) Principes fondamentaux de la rédactique; 2) Structure de la rédactique; 3) Techniques de rédactique (instructions, rôles, en quelques coups); 4) Pratiques exemplaires et embûches. Chaque section est appuyée par des exemples pratiques et des illustrations visuelles pour faciliter la compréhension et l’utilisation. Des commentaires sont actuellement recueillis auprès de multiples groupes internes, y compris des équipes techniques, d’IA responsable, et de capacité en matière d’IA et d’élaboration de programmes. Ce guide sera révisé et mis à jour au cours des prochains mois en fonction de ces commentaires, afin d’en assurer l’applicabilité générale et l’harmonisation avec les priorités organisationnelles.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Saptarshi Dutta Gupta (saptarshi.dutta-gupta@statcan.gc.ca).
PROJET : Création d’un ensemble de données structurées à partir de données non structurées à l’aide de grands modèles de langage
Ce projet porte sur l’utilisation de grands modèles de langage (GML) pour extraire des données structurées de documents PDF non structurés. Il évalue deux approches principales : 1) peaufiner des GML aux fins d’extraction directe de données; 2) utiliser la génération améliorée par récupération d’information (GARI) pour récupérer des fragments de texte pertinents avant l’extraction structurée. L’objectif est de créer des ensembles de données de grande qualité qui permettent d’autres applications d’apprentissage automatique et d’analyses statistiques.
Cette recherche vise à comparer le rendement de méthodes peaufinées et fondées sur la GARI à l’aide de l’ensemble de données CORD-19 (Wang, Lo, Chandrasekhar, Reas, Yang, Burdick, Eide, Funk, Katsis, Kinney, Li, Liu, Merrill, Mooney, Murdick, Rishi, Sheehan, Shen, Stilson, Wade, Wang, Wang, Wilhelm, Xie, Raymond, Weld, Etzioni et Kohlmeier, 2020), un corpus de plus de 1 000 000 d’articles scientifiques liés à la COVID-19. Des exemples de requête (par exemple « Quelle était la proportion de tous les patients asymptomatiques atteints de la COVID-19? ») sont utilisés pour évaluer l’exactitude de l’extraction par rapport à la réalité de terrain connue.
Progrès :
Méthodologie : L’ensemble de données CORD-19 a été utilisé pour élaborer et mettre à l’essai des approches peaufinées et fondées sur la GARI pour l’extraction structurée de données. Les questions de réalité de terrain ont été conçues pour permettre l’évaluation du rendement. Des ajustements ont été effectués à l’aide de modèles comme gpt-4o-mini et gpt-4.1-mini, tandis que des pipelines de GARI personnalisés ont été mis en œuvre en parallèle.
Résultats : L’évaluation montre que les modèles ajustés produisent des réponses plus cohérentes et quantitatives axées sur des résultats précis. En revanche, les données de sortie de la GARI fournissent des réponses plus générales et plus descriptives, combinant parfois des détails qualitatifs et quantitatifs. Bien que les deux méthodes fournissent des réponses comparables dans de nombreux cas, la variance de la qualité de la réponse dépend du type de requête. L’étape suivante consiste à mettre à l’essai le cadre au sein d’un ensemble plus diversifié de sources non structurées afin de valider le caractère généralisable et la robustesse des résultats.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Saptarshi Dutta Gupta (saptarshi.dutta.gupta@statcan.gc.ca).
Bibliographie
Wang, L.L., Lo, K., Chandrasekhar, Y., Reas, R., Yang, J., Burdick, D., Eide, D., Funk, K., Katsis, Y., Kinney, R., Li, Y., Liu, Z., Merrill, W., Mooney, P., Murdick, D., Rishi, D., Sheehan, J., Shen, Z., Stilson, B., Wade, A., Wang, K., Wang, N.X.R., Wilhelm, C., Xie, B., Raymond, D., Weld, D.S., Etzioni, O. et Kohlmeier, S. (2020). CORD-19: The COVID-19 Open Research Dataset. ArXiv preprint, https://doi.org/10.48550/arXiv.2004.10706.
PROJET : Cadre de protection des renseignements personnels d’entrée et de sortie – Couplage d’enregistrements assurant la protection des renseignements personnels
Le projet de Cadre de protection des renseignements personnels d’entrée et de sortie vise à concevoir et à mettre en œuvre des pipelines de protection des renseignements personnels robustes de bout en bout aux fins d’analyse et de couplage d’enregistrements de données de nature délicate en matière de protection des renseignements personnels. L’objectif central de cette initiative est de permettre à deux parties ou plus d’analyser et de coupler en collaboration des ensembles de données (comme des dossiers personnels ou organisationnels) sans divulguer de renseignements de nature délicate au niveau de la personne. Le projet est axé sur la protection de la vie privée à la fois à l’étape de l’entrée, de l’intégration (veiller à ce que les données soient protégées pendant le transfert et le calcul) et à l’étape de sortie (veiller à ce qu’aucune divulgation n’ait lieu dans les résultats publiés), en tirant parti des technologies d’amélioration de la confidentialité (TAC), en particulier le chiffrement homomorphe (HE), et les méthodes traditionnelles de contrôle de la divulgation statistique (CDS).
Deux principaux volets technologiques sont explorés : un pipeline fondé sur la cryptographie utilisant le chiffrement homomorphe et le calcul multipartite sécurisé, et un pipeline fondé sur des enclaves déployant des environnements matériels sécurisés. Le principal cas d’utilisation démontrant ces technologies est le couplage d’enregistrements assurant la protection des renseignements personnels, dans le cadre duquel des résumés statistiques peuvent être calculés à partir de l’ensemble de données couplé de façon sécurisée. Ce cadre est très pertinent pour des contextes comme les soins de santé, les finances ou les statistiques officielles, dans le cadre desquels les organisations doivent se conformer à des règlements rigoureux en matière de protection des renseignements personnels.
Progrès :
Des progrès importants ont été réalisés l’an dernier en ce qui concerne la conception, la mise en œuvre du prototype et la validation expérimentale du pipeline fondé sur la cryptographie. Un protocole de couplage d’enregistrements assurant la protection des renseignements personnels de bout en bout a été élaboré, qui combine des techniques de chiffrement homomorphe avancées et des mesures de protection en matière de protection des renseignements personnels des produits.
Un prototype de démonstration a été mis en œuvre pour permettre à un client et à un serveur de déterminer en toute sécurité les chevauchements d’enregistrements (correspondances exactes ou floues) et de calculer des résumés statistiques chiffrés (par exemple, la moyenne par strate) sans que l’une ou l’autre des parties ne découvre les données de nature délicate de l’autre partie. Des sous-protocoles critiques veillent à ce que les tailles d’intersections inférieures à un seuil établi soient supprimées pour éviter les atteintes à la vie privée et à préserver la sécurité des produits sommaires, comme l’exigent les lignes directrices sur le contrôle de la divulgation. L’évaluation expérimentale d’ensembles de données synthétiques a démontré la faisabilité du système pour des ensembles de données de taille moyenne, des produits statistiques exacts et un rendement de calcul raisonnable. De plus, ce cadre est conçu pour être modulaire et extensible pour des applications futures et des données de sortie de base. De la documentation et un rapport technique (Shukla, Rossiter et Santos, 2024), ainsi que la mise en œuvre de la démonstration, sont disponibles pour un examen plus approfondi et une analyse comparative.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Benjamin Santos (benjamin.santos@statcan.gc.ca).
Bibliographie
Shukla, A., Rossiter, E. et Santos B. (2024). Input/Output Privacy Framework: A Privacy-Preserving Record Linkage System. Rapport interne, Statistique Canada.
PROJET : Diffusion de données synthétiques avec garanties de confidentialité différentielle – Solution de rechange pour les fichiers de microdonnées à grande diffusion
Ce projet porte sur la production de données synthétiques avec garanties de confidentialité différentielle comme solution de rechange robuste aux fichiers de microdonnées à grande diffusion (FMGD) traditionnels. L’objectif est de permettre aux chercheurs, aux scientifiques des données et au public d’effectuer des analyses utiles de données synthétiques réalistes, tout en protégeant rigoureusement la confidentialité des personnes. Cette initiative vise à comparer l’efficacité de données synthétiques avec des garanties de confidentialité différentielle par rapport aux techniques classiques de contrôle de la divulgation actuellement utilisées avec les FMGD. Bien que les données synthétiques soient reconnues comme un mécanisme plus sécuritaire de partage de données, des recherches récentes indiquent que seule la confidentialité différentielle offre des protections solides et démontrables contre la réidentification sur les données synthétiques et potentiellement contre les menaces émergentes, comme celles que représentent les grands modèles de langage.
Ce cadre met l’accent sur les FMGD canadiens largement utilisés, diffusés par Statistique Canada dans le cadre de l’Initiative de démocratisation des données. En tirant parti de modèles génératifs avancés, y compris des modèles de diffusion et des réseaux antagonistes génératifs, ainsi que de méthodologies statistiques et d’évaluation de la protection des renseignements personnels robustes, le projet vise à produire des ensembles de données synthétiques protégés, à confidentialité différentielle ayant une validité analytique élevée. L’une des composantes cruciales est l’élaboration d’un progiciel en source ouverte Python, inspiré de la trousse d’outils Folktables (Ding, Hardt, Miller et Schmidt, 2021), visant à fournir des données synthétiques pour étalonner les modèles d’apprentissage automatique et faciliter la recherche reproductible.
Progrès :
Le projet a permis de mener à bien une revue de littérature approfondie, a déterminé les principaux FMGD à expérimenter et a examiné des méthodes de pointe pour des données à confidentialité différentielle et des données synthétiques génératives. L’équipe a lancé la mise en œuvre de nouveaux modèles génératifs (y compris des modèles de diffusion et des réseaux antagonistes génératifs) intégrés à des mécanismes de confidentialité différentielle, de concert avec le développement parallèle d’une trousse d’outils Python en source ouverte pour fournir des ensembles de données synthétiques à partir de FMGD à des fins d’étalonnage et d’analyse. Les premières étapes des évaluations mettent l’accent sur les principales mesures d’utilité et de confidentialité, en examinant le compromis entre l’utilité analytique et la confidentialité, tout en relevant le défi constant consistant à veiller à ce que les données synthétiques générées maintiennent la validité pour des tâches typiques d’apprentissage automatique démographique et socioéconomique.
Une comparaison juste de la confidentialité et de l’utilité entre des FMGD et des données synthétiques nécessitera l’entraînement de générateurs de données synthétiques à l’aide de microdonnées dépersonnalisées, une étape qui sera effectuée une fois que l’accès sera sécurisé. Les produits livrables à venir comprennent un rapport technique et un progiciel Python ouvert à l’usage du public et à des fins de référence.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Benjamin Santos (benjamin.santos@statcan.gc.ca).
Bibliographie
Ding, F., Hardt, M., Miller, J. et Schmidt, L. (2021). Retiring Adult: New datasets for fair machine learning. Advances in Neural Information Processing Systems, 34.
PROJET : Contrôle de la divulgation : limites et autres solutions
Dans son rôle d’organisme statistique national, Statistique Canada agit à titre d’intermédiaire pour recueillir ou agréger des données provenant de diverses sources et les compiler en tableaux sommaires ainsi qu’en ensembles de données plus détaillés. La fourniture de ces tableaux comprend toujours un risque de divulgation de renseignements personnels ou stratégiques de nature délicate. Pour éviter les fuites de renseignements de nature délicate, l’organisme déploie des programmes (comme G-Confid) visant à déterminer et à supprimer les cellules de nature délicate dans un tableau de contingence ou dans des ensembles de données plus détaillés comme des fichiers de microdonnées à grande diffusion (FMGD) ou les fichiers de microdonnées du recensement. L’objectif de ce projet était de cerner les vulnérabilités de ces méthodes, étant donné que le paysage de calcul a changé. Cela est non seulement attribuable à l’arrivée de grands modèles de langage et d’outils d’entrée de gamme facile d’accès, mais également à l’augmentation de la puissance de calcul, rendant certains calculs inversés moins difficiles.
Progrès :
Ce projet est terminé et un rapport a été soumis. Le projet portait principalement sur les tableaux de l’Entrepôt commun de données de sortie et la façon d’accéder aux valeurs supprimées. Nous avons résumé diverses méthodes d’attaque fondées sur l’expertise de l’adversaire. De plus, nous avons présenté des recommandations pour corriger ces vulnérabilités. En ce qui concerne les FMGD, nous avons relevé certaines attaques initiales, mais il faudrait obtenir l’autorisation pour effectuer un moissonnage du Web pour comparer des renseignements personnels sur des sites publics comme Facebook et LinkedIn. Par conséquent, nous n’avons fourni qu’une méthodologie (aucun résultat) pour les ensembles de données de FMGD.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Abhishek Shukla (abhishek.shukla@statcan.gc.ca).
- Date de modification :