Programme de recherche et développement en méthodologie : réalisations, 2021-2022
2. Méthodes et applications de la science des données

SOUS-PROJET : Techniques d’apprentissage automatique permettant de traiter la non-réponse aux questions des enquêtes

La non-réponse aux questions des enquêtes est un problème courant dans la production de statistiques officielles. En particulier, si la probabilité de non-réponse est corrélée à une variable d’intérêt, elle peut introduire un biais important dans les estimations finales si le biais n’est pas corrigé. Une façon courante de corriger le biais dû à la non-réponse est de modéliser la probabilité de réponse. En estimant la probabilité de réponse pour toutes les unités de l’enquête, nous pouvons ajuster le poids de chaque unité afin de compenser les non-répondants. Nous pouvons intégrer la robustesse au processus en regroupant les unités en groupes de réponses homogènes afin d’éviter les ajustements de poids extrêmes (p. ex. Gelein, Haziza et Causeur, 2018).

À l’heure actuelle, la plupart des modèles de non-réponse aux questions des enquêtes reposent sur la régression logistique (suivie de la création de groupes homogènes) ou des arbres de décision. L’objectif du projet était d’étudier l’application de méthodes d’apprentissage automatique plus complexes pour modéliser la probabilité de réponse à une enquête.

Progrès :

Dans le monde réel, la population peut être assez hétérogène pour ce qui est des probabilités de réponse. Le mécanisme sous-jacent pourrait être très difficile à modéliser au moyen de modèles simples comme la régression logistique. L’une des principales constatations du projet est qu’il est possible d’utiliser des techniques d’intelligibilité pour disséquer des modèles d’apprentissage automatique complexes et visualiser la structure des données sous-jacentes.

Dans le cadre de notre étude, nous avons créé un ensemble de données synthétiques en générant des réponses avec différentes probabilités pour différentes sous-populations. Dans un premier temps, nous avons utilisé un modèle complexe, mais efficace, d’apprentissage automatique d’optimisation (XGBoost) pour estimer la probabilité de réponse dans l’ensemble de données synthétique (Chen et Guestrin, 2016). Nous avons ensuite eu recours à une technique utilisée pour faire des prédictions de modèles d’apprentissage automatique complexes (« boîte noire ») interprétables par les humains, la technique LIME (Ribeiro, 2016), pour récupérer la majeure partie de la structure de sous-population correspondant aux différents mécanismes de non-réponse. La technique LIME permet d’ajuster un modèle linéaire local dans le voisinage de chaque point de données en utilisant les valeurs prédites du modèle complexe. Les coefficients des modèles linéaires peuvent ensuite être regroupés pour définir les tendances de non-réponse (Van der Maaten et Hinton, 2008; Ribeiro, Singh et Guestrin, 2016; et Wattenberg, Viégas et Johnson, 2016). Étant donné que l’ensemble de données est synthétique, la véritable structure de la sous-population est connue, et la comparaison des grappes de coefficients établies au moyen de la technique LIME avec les groupes de sous-populations réels a montré une bonne cohérence.

Cette technique pourrait représenter une nouvelle façon prometteuse de former des groupes de réponse homogènes en combinant des algorithmes d’apprentissage automatique complexes et des techniques d’intelligibilité pour les populations dont la structure de non-réponse est hétérogène.

Pour obtenir plus de renseignements, communiquez avec :
Jeffery Zhang (343-551-1318, jeffery.zhang@statcan.gc.ca).

Bibliographie

Gelein, B., Haziza, D. et Causeur, D. (2018). Propensity Weighting for Survey Nonresponse Through Machine Learning. Dans Journées de méthodologie statistique, INSEE, Paris, 12 au 14 juin 2018.

Chen, T., et Guestrin, C. (2016). XGBoost: A Scalable Tree Boosting System. arXiv: 1603.02754v3.

Ribeiro, M.T. (2016). LIME – Local Interpretable Model-Agnostic Explanations. Extrait de https://homes.cs.washington.edu/~marcotcr/blog/lime/.

Van der Maaten, L., et Hinton, G. (2008). Visualizing High-Dimensional Data Using t-SNE. Journal of Machine Learning Research, 9, 2579-2605.

Ribeiro, M. T., Singh, S. et Guestrin, C. (2016). "Why Should I Trust You?": Explaining the Predictions of Any Classifier. arXiv: 1602.04938v3.

Wattenberg, M., Viégas, F. et Johnson, I. (2016). How to use t-SNE effectively. Distill.

SOUS-PROJET : Apprentissage automatique quantique pour la classification de textes

L’informatique quantique promet de révolutionner la science des données grâce à l’émergence de l’apprentissage automatique quantique. Nous avons entrepris un projet de recherche pour étudier la faisabilité d’appliquer l’apprentissage automatique quantique aux tâches de classification de textes à Statistique Canada; le projet a été réalisé en collaboration avec l’Université de Sherbrooke et la Banque du Canada, et il a été financé par le Conseil de recherche et développement de Statistique Canada.

Progrès :

Nous avons mis en œuvre et testé trois méthodes différentes : le classificateur quantique variationnel, la méthode quantique fondée sur le noyau et l’apprentissage par transfert hybride quantique-classique (Laprade, Blanchette, Zanussi, Chikhar et Skavysh, 2021). En ce qui concerne l’apprentissage automatique quantique, l’une des grandes limites à l’application de la classification de textes est la grande dimensionnalité du codage des données. Il est notoire que les méthodes de classification de textes comportent de grands espaces des attributs, et bien que de nombreux partisans de l’apprentissage automatique quantique mentionnent la croissance exponentielle des circuits de bits quantiques, de tels plongements denses sont coûteux et nécessitent des circuits profonds. Par conséquent, les techniques de réduction de la dimensionnalité étaient essentielles au succès du projet.

Même si les résultats du projet de recherche sont prometteurs, d’autres études sont nécessaires pour que nous puissions appliquer de telles méthodes à des cas d’utilisation typiques pour la classification de textes au sein de l’organisme.

Pour obtenir plus de renseignements, communiquez avec :
Saeid Molladavoudi (613-290-7418, saeid.molladavoudi@statcan.gc.ca).

Bibliographie

Laprade, J.-F., Blanchette, S., Zanussi, Z., Chikhar, O. et Skavysh, V. (2021). Quantum machine learning for text classification. Présentation d’affiche au 2021 Montreal AI Symposium.

SOUS-PROJET : Amélioration du rendement de la reconnaissance optique de caractères grâce au prétraitement des images

De nombreux projets de la Division de la science des données portent sur l’extraction de l’information. L’extraction de l’information vise l’extraction automatique de renseignements structurés de documents non structurés ou semi-structurés. L’un des objectifs de la Division de la science des données est que d’autres divisions utilisent des techniques de science des données pour améliorer leurs processus et obtenir plus de renseignements à partir de leurs données. L’extraction de l’information est un moyen permettant de réduire le temps de traitement nécessaire pour extraire l’information pertinente des documents, de réduire au minimum le travail manuel et d’accroître l’efficacité. Le degré de difficulté de l’extraction des données dépend de l’état des documents. Pour les documents ou les images numérisés, la reconnaissance optique de caractères (ROC) est requise. Les moteurs de ROC sont utilisés pour convertir des images textuelles en fichiers modifiables. Pour ce qui est d’améliorer le rendement des pipelines d’extraction de l’information pour les images numérisées, le rendement de la ROC joue un rôle important.

L’objectif du projet de recherche est d’étudier des techniques de pointe pour améliorer le rendement des moteurs de ROC au moyen de techniques d’amélioration du prétraitement des images et, plus particulièrement, de la modélisation au moyen de la binarisation d’images. La binarisation d’images est le processus de conversion d’une image, dans le format en niveaux de gris, en une image en noir et blanc.

Progrès :

Une revue de littérature a été effectuée, et les travaux d’Ayantha, Nilanjan, Xiao et Allegra (2021) ont révélé des résultats prometteurs. Les techniques et les méthodes proposées dans leur document ont été utilisées pour différents ensembles de données et comparées à d’autres méthodes de pointe, et elles ont été jugées supérieures en fonction de l’exactitude et du taux d’erreur des caractères. De plus, une légère amélioration à la méthode a été proposée. Le projet de recherche est terminé. Nous espérons pouvoir utiliser les résultats du projet de recherche dans de futurs projets de la Division de la science des données pour des enquêtes comportant des données de réception numérisées. Les prochaines étapes de ces travaux sont à l’étude. Voici la liste des tâches accomplies :

Pour obtenir plus de renseignements, communiquez avec :
Oladayo Ogunnoiki (289-489-1239, oladayo.ogunnoiki@statcan.gc.ca).

Bibliographie

Ayantha, R., Nilanjan, R., Xiao, X. et Allegra, L. (2021). Unknown-Box Approximation to Improve Optical Character Recognition Performance. Dans ICDAR, (1), 481-496.

SOUS-PROJET : Approche participative de préservation de la confidentialité pour la détection de la cyberintimidation

En collaboration avec le Centre de l’intégration et du développement des données sociales et le Secrétariat de l’éthique des données du Centre de coopération internationale et d’innovation en méthodologie, nous avons étudié la capacité d’entraîner des modèles d’apprentissage automatique à partir des données des clients sans jamais visualiser ou recueillir les données, en utilisant une technique d’apprentissage automatique distribué appelée « apprentissage fédéré». L’apprentissage fédéré permet à un modèle d’apprentissage automatique centralisé conservé par une autorité centrale, comme Statistique Canada, d’être entraîné à une tâche précise dans un domaine spécialisé précis sans que l’autorité centrale n’ait besoin d’accéder aux données de formation ou de les conserver. L’hôte du modèle d’apprentissage automatique centralisé reçoit uniquement les pondérations numériques des modèles d’apprentissage automatique locaux qui sont entraînés à partir des données distribuées des clients conservées sur les appareils des clients. En agrégeant les pondérations obtenues, l’autorité centrale met à jour son modèle d’apprentissage automatique central avec les changements effectués par les clients sur leurs appareils.

Ce projet de validation de la technologie vise à étudier le fonctionnement de l’apprentissage fédéré, la façon dont il peut être appliqué dans un contexte d’approche participative et la faisabilité de son application dans des contextes de production. Grâce aux connaissances acquises, Statistique Canada aura une meilleure compréhension de la technique en évolution et des possibilités offertes par l’application.

Progrès :

Après avoir effectué des essais simulés à l’aide d’un ensemble de données sur la cyberintimidation accessible au public, nous avons démontré que l’approche peut fonctionner efficacement dans le cadre de différentes approches participatives, si nous portons une attention particulière lorsque nous travaillons avec des données non étiquetées. Nous avons étudié deux cadres pour évaluer la façon dont l’apprentissage fédéré peut être utilisé pour les données sur la cyberintimidation dans un contexte d’approche participative. Le premier, un cadre d’annotateurs, révèle que l’utilisation de l’apprentissage fédéré avec un ensemble d’annotateurs de données fiables peut permettre à Statistique Canada d’entraîner les données annotées tout en conservant les données du côté de l’annotateur. Le deuxième cadre, un cadre d’apprentissage fédéré semi-supervisé, permet d’utiliser des données non étiquetées pour la formation, et ces données demeurent sur les appareils des clients. Une approche d’apprentissage fédéré semi-supervisé de base a été appliquée au cadre avec un succès limité, mais il s’est avéré que cette approche peut être mise en œuvre.

L’apprentissage fédéré est donc un outil prometteur qui devrait continuer d’être étudié en vue de son utilisation dans les systèmes de production à mesure que le concept continue d’évoluer. À la lumière de telles constatations, nous recommandons, comme prochaines étapes, d’étudier davantage l’apprentissage fédéré en la combinant à différentes technologies d’amélioration de la confidentialité (comme la confidentialité différentielle et le chiffrement homomorphique) en vue d’accroître davantage la confidentialité des données des utilisateurs, et en appliquant l’apprentissage fédéré à une page Web fictive déployée ou à une application mobile afin d’élaborer un projet étendu de validation de la technologie sur la façon dont la technique peut être appliquée à un exercice réaliste d’approche participative. La mise à l’essai plus poussée de l’approche peut mener à des collaborations qui permettront de concevoir des modèles d’apprentissage automatique robustes comportant des données sensibles et privées distribuées entre plusieurs organisations différentes.

Pour obtenir plus de renseignements, communiquez avec :
Benjamin Santos (438-459-7721, benjamin.santos@statcan.gc.ca) ou
Julian Templeton (julian.templeton@statcan.gc.ca).

SOUS-PROJET : Revue de littérature sur les itinéraires efficaces pour les activités de dénombrement

Les activités de dénombrement du recensement et de l’Enquête sur la population active qui se déroulent en personne exigent des déplacements dans de grandes régions géographiques (unités de collecte), qui sont divisées en îlots (îlots de collecte). La recherche de l’itinéraire le plus efficace dans ces îlots est un processus à étapes multiples, et sa complexité varie en fonction du nombre d’îlots à parcourir. L’ordre des îlots idéal représente un chemin hamiltonien, connu pour être un problème informatique difficile qui est NP complet.

Nous avons effectué une revue de littérature sur les progrès réalisés au chapitre de l’apprentissage automatique et des approches de l’informatique quantique pour trouver les chemins hamiltoniens, particulièrement en ce qui concerne la mise en œuvre de l’apprentissage par renforcement profond et de la programmation dynamique des processus décisionnels de Markov pour l’apprentissage automatique ainsi que la mise en œuvre du problème de satisfaction contraint pour l’informatique quantique (Montanaro, 2018; Campbell, Khurana et Montanaro, 2019).

Progrès :

En fin de compte, la recherche n’a abouti à aucune solution particulière qui pourrait être facilement déployée et permettrait de résoudre le cas d’utilisation du recensement et de l’Enquête sur la population active. Il faudrait mener d’autres expériences pour déterminer le degré de réussite possible d’une approche d’apprentissage automatique ou quantique, et il est possible qu’un ensemble hybride d’approches donne les meilleurs résultats.

Pour obtenir plus de renseignements, communiquez avec :
Reginald Maltais (613-612-9438, reginald.maltais@statcan.gc.ca).

Bibliographie

Montanaro, A. (2018). Quantum-walk speedup of backtracking algorithms. Theory of Computing, 14, 1-24.

Campbell, E., Khurana, A. et Montanaro, A. (2019). Applying quantum algorithms to constraint satisfaction problems. Quantum, 3, 167.

SOUS-PROJET : Revue de littérature sur l’intersection d’ensembles privés

Les organismes statistiques nationaux, comme Statistique Canada, procèdent souvent au couplage d’enregistrements entre des ensembles de données afin d’améliorer la valeur analytique des données disponibles. Toutefois, dans de nombreux cas, un ensemble de données ou les deux ensembles sont considérés comme sensibles, ce qui se traduit par des frais généraux juridiques et administratifs supplémentaires importants associés au couplage. Le couplage d’enregistrements préservant la confidentialité pourrait être une option pour que le couplage d’enregistrements puisse être effectué sans ces frais généraux.

Dans le cadre des travaux, nous avons effectué une revue de littérature sur le couplage d’enregistrements préservant la confidentialité dans le contexte de Statistique Canada. Diverses techniques d’appariement exact, comme les méthodes par hachage, le chiffrement totalement homomorphique, le transfert inconscient, les fonctions pseudo-aléatoires inconscientes et le calcul multipartite sécurisé, ont été étudiées dans le contexte du couplage d’enregistrements préservant la confidentialité entre deux parties.

Progrès :

Dans le cadre des travaux, nous avons décrit un certain nombre de méthodes relatives au couplage d’enregistrements préservant la confidentialité à Statistique Canada. Il s’agit d’un domaine en expansion rapide qui pourrait avoir des répercussions futures sur les travaux portant sur les couplages et l’intégration de données (Zanussi et Dugdale, 2022). D’autres études sont nécessaires pour que ces protocoles puissent être appliqués aux cas d’utilisation typiques au sein de l’organisme.

Pour obtenir plus de renseignements, communiquez avec :
Saeid Molladavoudi (613-290-7418, saeid.molladavoudi@statcan.gc.ca).

Bibliographie

Zanussi, Z., et Dugdale, C. (2022). Practical Privacy-Aware Data Linkage and Statistical Aggregation based on Privacy Enhancing Techniques. Rapport interne soumis pour publication, Statistique Canada, Ottawa.

SOUS-PROJET : Revue de littérature sur l’apprentissage automatique automatisé

Le principal objectif du projet était d’effectuer une revue de littérature et d’en apprendre davantage sur la façon dont la collectivité de l’apprentissage automatique définit et comprend l’apprentissage automatique automatisé et sur les moyens qui devraient être pris pour intégrer un tel paradigme aux pratiques d’apprentissage automatique de Statistique Canada.

Progrès :

Dans le cadre de la revue de littérature, nous avons examiné les différentes perspectives et approches en matière d’apprentissage automatique automatisé dans le but de répondre aux questions suivantes : Quelles composantes du processus d’apprentissage automatique sont habituellement automatisées, et quels sont les outils et les services populaires courants disponibles pour l’apprentissage automatique automatisé au moyen de licences ou d’accès aux codes sources libres ? De plus, quelques fournisseurs de services et de progiciels en matière d’apprentissage automatique automatisé ont été interrogés et comparés. Le produit livrable définitif était un document interne. Il s’agit de la première phase de l’étude de la Division de la science des données sur l’apprentissage automatique automatisé; la prochaine phase sera un projet pratique dans le cadre duquel nous réaliserons une étude empirique pour évaluer les avantages d’une approche d’apprentissage automatique automatisé.

Pour obtenir plus de renseignements, communiquez avec :
Loïc Muhirwa (343-998-7756, loic.muhirwa@statcan.gc.ca).

SOUS-PROJET : Introduction à l’intelligence artificielle explicable examen technique de méthodes locales indépendantes d’un modèle

Les principes d’explicabilité abordés dans le cadre « Utilisation responsable de l’apprentissage automatique à Statistique Canada » (Bosa, 2021) orientent l’élaboration de processus d’apprentissage automatique responsables. Il s’agit d’une source de motivation essentielle pour cet examen technique. L’apprentissage automatique responsable fait également partie de la capacité stratégique « opérationnalisation » de la Stratégie de la science des données, qui met l’accent sur l’application des modèles en production.

Les travaux donnent un aperçu des principes généraux de l’intelligence artificielle explicable. Ils donnent une description taxonomique complète des méthodes d’intelligence artificielle explicable ainsi que des définitions et des références pour les méthodes les plus populaires. Ils montrent également brièvement la façon dont fonctionnent certaines méthodes d’intelligence artificielle explicable. Nous examinons ensuite de plus près la plupart des méthodes locales populaires indépendantes d’un modèle. Nous mettons l’accent sur quatre méthodes, pour lesquelles nous présentons la théorie, les avantages et les inconvénients de chaque méthode. Ensuite, au moyen de plusieurs ensembles de données, les applications des méthodes montrent la façon dont elles pourraient être utilisées pour différents types de problèmes relatifs à la science des données. Nous concluons par un bref exposé sur la façon d’utiliser l’intelligence artificielle explicable à diverses étapes, des expériences à la production, et sur la façon de l’utiliser dans le monde réel.

Progrès :

Dans le cadre du projet, nous mettons principalement l’accent sur les méthodes indépendantes d’un modèle, qui deviennent de plus en plus attrayantes dans le domaine de l’apprentissage automatique tout au long du processus de production. Les travaux incitent la Division de la science des données à accorder encore plus d’attention à l’application de ces méthodes d’intelligence artificielle explicable dans le développement de systèmes de production.

Comme dans tout domaine de recherche brûlant, les méthodes ne cessent d’évoluer, bien qu’il soit important de souligner que diverses méthodes comportent des limites, chacune présentant ses propres avantages et désavantages. De plus, nous tenons à souligner que l’accent mis sur les techniques d’explicabilité locale n’est qu’une première introduction à ce sujet; notre intention est de poursuivre la recherche sur ces techniques dans le cadre d’un travail à plus long terme. Nous avons hâte de mettre ces connaissances à profit dans l’élaboration de futures lignes directrices pratiques sur la sélection de l’approche d’intelligence artificielle explicable la plus appropriée pour les projets de la Division.

Pour obtenir plus de renseignements, communiquez avec :
Soufiane Fadel (343-573-7912, soufiane.fadel@statcan.gc.ca).

Bibliographie

Bosa, K. (2021). Utilisation responsable de l’apprentissage automatique à Statistique Canada. Extrait de https://www.statcan.gc.ca/fr/data-science/network/machine-learning.


Date de modification :