Programme de recherche et développement en méthodologie : réalisations, 2020-2021
1. Modélisation, intégration des données et science des données

1.1 Estimation sur petits domaines

Les estimations classiques fondées sur le plan de sondages de paramètres de population, appelées estimations directes, sont généralement fiables à condition que la taille de l’échantillon dans les domaines d’intérêt ne soit pas trop petite. Les estimations indirectes, qui empruntent de l’information à d’autres domaines ou à d’autres périodes, permettent souvent de réaliser des gains d’efficacité importants pour les petits domaines moyennant l’introduction d’hypothèses de modélisation. Ces dernières années, un regain d’intérêt a eu lieu à Statistique Canada pour l’étude et l’utilisation de méthodes d’estimation indirecte fondée sur un modèle pour les petits domaines. Les principaux objectifs du présent projet sont les suivants :

Jusqu’à présent, des progrès ont été réalisés dans le cadre des sous-projets suivants.

SOUS-PROJET : Diagnostics locaux pour le modèle de Fay-Herriot

Les outils de validation de modèles, comme les graphiques des résidus, sont souvent utilisés pour évaluer la plausibilité du modèle de Fay-Herriot. Des estimations de l’erreur quadratique moyenne (EQM) fondées sur des modèles sont ensuite utilisées pour évaluer les gains d’efficacité générés par les estimations sur petits domaines par rapport aux estimateurs directs. Toutes ces techniques sont utiles pour évaluer le rendement global des estimations sur petits domaines. Toutefois, les utilisateurs ne s’intéressent souvent qu’à leur domaine particulier, et un indicateur de la qualité des estimations pour leur domaine est plus pertinent de leur point de vue. L’EQM fondée sur un modèle atteint en partie cet objectif, mais intègre l’effet aléatoire local (l’erreur de modèle de couplage) qui intéresse les utilisateurs d’un domaine particulier. L’EQM fondée sur le plan de sondage serait plus pertinente pour ces utilisateurs, mais on connaît la grande instabilité des estimations sans biais de l’EQM fondée sur le plan de sondage (par exemple, Rao, Rubin-Bleuer et Estevao, 2018). Dans le cadre de ce projet, nous avons élaboré et étudié deux nouveaux diagnostics locaux pour l’évaluation d’estimations sur petits domaines.

Progrès :

Un document a déjà été rédigé et soumis à Techniques d’enquête. Nous avons reçu les commentaires des examinateurs cette année et révisé le document en conséquence. Le document a été accepté et sera publié dans un numéro de Techniques d’enquête de 2021 (Lesage, Beaumont et Bocci, 2021).

SOUS-PROJET : Modèles et estimation robustes sur petits domaines avec application à l’aide des données de l’Enquête sur la population active

Le modèle de Fay-Herriot, qui comporte des erreurs d’échantillonnage normales et des effets aléatoires, est largement utilisé dans l’estimation sur petits domaines pour améliorer les estimations d’enquête directes. Ghosh, Myung et Moura (2018) ont proposé des lois a priori t pour les effets aléatoires et une loi a priori de Jeffreys modifiée au moyen d’une méthode hiérarchique bayésienne (HB). Dans le cadre de ce projet, nous évaluerons les modèles HB avec des distributions normales et t basées sur le modèle de You et Chapman (2006), nous comparerons les divers modèles HB sur petits domaines et étudierons les effets de la modélisation robuste de l’estimation sur petits domaines (EPD) avec la distribution de la loi a priori t pour les erreurs d’échantillonnage et les effets aléatoires. Les modèles et les méthodes proposés seront programmés en R et comparés à l’aide des données de l’Enquête sur la population active (EPA).

Progrès :

Nous avons examiné le modèle You et Chapman (2006) et étudié deux types de modèles EPD robustes fondés sur la loi normale et la loi t pour des erreurs d’échantillonnage et des effets aléatoires. La spécification du modèle et les programmes ont été achevés et programmés. Les modèles et les méthodes ont été appliqués aux données de l’EPA aux fins d’évaluation et de comparaison. Un rapport de recherche est terminé (You, 2021a). Le modèle de loi normale et de loi t peut être étendu au modèle de variance d’échantillonnage de Sugasawa, Tamae et Kubokawa (2017) et You (2021b).

SOUS-PROJET : Estimation sur petits domaines au moyen du lissage et de la modélisation de la variance d’échantillonnage

Nous considérons le modèle de Fay-Herriot et étudions les méthodes des meilleurs prédicteurs linéaires sans biais empirique (MPLSBE) et HB pour l’estimation sur petits domaines avec lissage et modélisation de la variance d’échantillonnage. Nous étudions et proposons des méthodes de lissage et de modélisation de la variance d’échantillonnage et comparons les modèles de You et Chapman (2006), You (2016) et Sugasawa et coll. (2017) pour l’estimation du taux de chômage de l’EPA et d’autres problèmes d’estimation sur petits domaines.

Progrès :

Nous avons étudié les méthodes MPLSBE et HB avec lissage et modélisation de la variance d’échantillonnage et nous avons appliqué nos méthodes aux données de l’EPA. Nos résultats indiquent que le lissage de la variance d’échantillonnage peut améliorer l’efficacité et la précision de l’estimateur fondé sur le modèle. La modélisation de la variance d’échantillonnage peut également être utile et se révèle beaucoup plus efficace que l’utilisation d’estimations directes de la variance d’échantillonnage. Un document de recherche sur ce projet a été rédigé et paraîtra dans le numéro de décembre de Techniques d’enquête (You, 2021b).

SOUS-PROJET : Prototype d’estimation sur petits domaines

Un prototype SAS a été développé pour produire des estimations sur petits domaines. Ce prototype constitue la base de la mise en œuvre de nouvelles méthodes d’EPD au sein du système généralisé d’estimation G-Est. Le prototype SAS est utilisé comme outil de production pour répondre à la demande croissante d’estimations à des niveaux désagrégés.

Progrès :

Nous avons mis en œuvre et testé une nouvelle méthode de sélection de modèles pour aider les utilisateurs à déterminer les principales variables auxiliaires du modèle. Il est basé sur une approche de sélection rétrograde utilisant un critère du chi carré pour déterminer les variables explicatives significatives. Cette amélioration permet de réduire considérablement le temps et les efforts requis pour construire un modèle approprié.

SOUS-PROJET : Estimation sur petits domaines des montants moyens des liquidités par division de recensement

Nous étudions l’estimation sur petits domaines des montants moyens des liquidités à l’échelon de la division de recensement. Les estimations d’enquête sur les montants moyens des liquidités à l’échelon de la division de recensement sont calculées à l’aide des données de l’Enquête sur la sécurité financière de 2016. Ces estimations d’enquêtes sont ensuite modélisées en fonction des caractéristiques socio-économiques des familles tirées du recensement de la population de 2016 au même niveau afin de produire des estimations sur petits domaines des montants moyens des liquidités à l’aide du modèle du modèle de Fay-Herriot.

Progrès :

Le modèle de Fay-Herriot a été validé avec soin et des estimations sur petits domaines des montants moyens des liquidités à l’échelon de la division de recensement pour 2016 ont été produites. Un rapport a été rédigé (Bocci, Morissette et Beaumont, 2020) et contient une description des modèles d’estimation sur petits domaines.

SOUS-PROJET : Estimation de l’erreur quadratique moyenne sous le plan de sondage dans l’estimation sur petits domaines

L’utilisation du modèle de Fay-Herriot pour produire des estimations sur petits domaines a augmenté à Statistique Canada au cours des dernières années. Ces estimations sont généralement accompagnées d’estimations de l’erreur quadratique moyenne (EQM) sous le modèle. Toutefois, les utilisateurs sont généralement habitués aux estimations de l’EQM sous le plan de sondage. Par rapport à l’EQM sous le modèle, l’EQM sous le plan a l’avantage de ne pas intégrer la spécificité d’un domaine particulier et peut être plus pertinente pour les utilisateurs comme indicateur de la qualité des estimations. On sait que les estimations fondées sur le plan de l’EQM sous le plan sont instables (par exemple, Rao, Rubin-Bleuer et Estevao, 2018). Nous envisageons d’étudier l’utilisation d’une approche conditionnelle pour obtenir un estimateur plus efficace de l’EQM sous le plan.

Progrès :

Dans le cadre de recherches antérieures, un estimateur de l’EQM sous le plan fondé sur une approche conditionnelle a été élaboré et un rapport interne préliminaire a été rédigé. Dans la dernière partie de cet exercice, une étude de simulation a été lancée pour évaluer l’approche conditionnelle proposée.
Pour obtenir plus de renseignements, communiquez avec :
Jean-François Beaumont (613-863-9024, jean-francois.beaumont@statcan.gc.ca).

Bibliographie

Ghosh, M., Myung, J. et  Moura, F.A.S. (2018). Robust Bayesian small area estimation. Survey Methodology, 44, 101-115.

Rao, J.N.K., Rubin-Bleuer, S. et Estevao, V.M. (2018). Measuring uncertainty associated with model-based small area estimators. Survey Methodology, 44, 151-166.

Sugasawa, S., Tamae, H. et Kubokawa, T. (2017). Bayesian estimators for small area models shrinking both means and variances. Scandinavian Journal of Statistics, 44, 150-167.

You, Y. (2016). Hierarchical Bayes sampling variance modeling for small area estimation based on area level models with applications. Methodology Branch working paper, ICCSMD-2016-03-E.

You, Y., et Chapman, B. (2006). Small area estimation using area level models and estimated sampling variances. Survey Methodology, 32, 97-103.

1.2 Estimation en temps réel au moyen de méthodes de séries chronologiques

SOUS-PROJET : Prévisions immédiates des indicateurs économiques

Nous visons à élaborer un indicateur précoce de l’activité économique canadienne en collaboration avec diverses équipes de Statistique Canada. L’objectif est de tirer parti des méthodes traditionnelles et nouvelles d’apprentissage automatique combinées à des données alternatives pour établir des prévisions immédiates des valeurs mensuelles des activités économiques.

Progrès :

Un environnement infonuagique de modélisation a été établi sur l’espace de travail d’analyse avancée de Statistique Canada. Une vaste base de données de séries chronologiques a été construite avec ElasticSearch et était composée de données économiques et de rechange de différentes fréquences. Des pipelines de traitement ont été construits en Python et en R pour permettre aux spécialistes des séries chronologiques d’accéder à la base de données pour la modélisation. Les résultats de la modélisation indiquent que certaines des sources de données alternatives utilisées peuvent améliorer le rendement des prévisions immédiates et fournir des données pertinentes et opportunes pour la modélisation macroéconomique future. Le rendement des modèles de séries chronologiques de type ARIMAX et PROPHET ainsi que différents modèles d’apprentissage automatique, y compris XGBoost, ont été comparés. Le modèle ARIMAX a obtenu des résultats légèrement meilleurs que PROPHET et le modèle XGBoost ajusté. Les premiers résultats indiquent qu’un modèle hybride (méta) combinant les trois modèles peut améliorer davantage le rendement d’ARIMAX.

Pour de plus amples renseignements sur l’espace de travail d’analyse avancée, veuillez consulter :
https://www.statcan.gc.ca/fra/science-donnees/reseau/plateforme-infonuagique.

SOUS-PROJET : Modélisation et prévision dans le contexte de l’estimation en temps réel

L’augmentation de l’actualité des indicateurs statistiques est une priorité importante pour Statistique Canada et une option pour ce faire consiste à utiliser des modèles de séries chronologiques pour établir des prévisions immédiates des indicateurs économiques beaucoup plus tôt que le moment où le premier estimateur traditionnel est produit.

Progrès :

L’évaluation des modèles statistiques dans ce contexte s’est poursuivie en déterminant les modèles ARRMI et en indiquant les modèles d’espace comme les candidats les plus attrayants. Un exposé a été présenté au Comité consultatif des méthodes statistiques de Statistique Canada afin de recueillir des commentaires sur les progrès et les plans pour ce travail (Matthews, Patak et Picard, 2020).

Deux études de cas ont été menées en collaboration avec la Division de la science des données afin d’évaluer les méthodes prédictives pour la prévision immédiate des permis de bâtir et du produit intérieur brut mensuel. Ces études ont comparé des modèles plus traditionnels comme regARIMA à des modèles prédictifs d’apprentissage automatique, indiquant un rendement similaire et mettant en évidence non seulement les différences entre les méthodes, mais aussi les nombreuses similitudes (Matthews et Ritter, 2020). Un exposé sur ces travaux a été élaboré en vue d’être présenté au Symposium de 2021 sur les questions de méthodologie de Statistique Canada.

Une analyse approfondie des modèles à facteurs dynamiques a été effectuée afin de comprendre la théorie sous-jacente et le potentiel d’application dans le contexte de la prévision immédiate des indicateurs économiques canadiens. Cette méthode est largement utilisée dans d’autres organismes statistiques pour la prévision immédiate. Elle combine des techniques de réduction de la dimensionnalité pour générer des variables auxiliaires, couplées à des modèles linéaires dans un cadre d’espaces d’état pour générer les prédictions. Cette évaluation a été menée en partenariat avec le Dr Rafal Kulik, de l’Université d’Ottawa, ainsi qu’avec un étudiant diplômé, Ismael Zie Diamoutene, qui collabore également à cette analyse. Cette enquête a conclu que la puissance prédictive des modèles à facteurs dynamiques repose fortement sur la disponibilité de plusieurs variables auxiliaires fortement corrélées, qui sont encore identifiées pour les indicateurs économiques canadiens.

Des lignes directrices préliminaires ont été préparées et examinées par le Comité des méthodes modernes : Conversion de données en renseignements, afin de promouvoir la normalisation de la terminologie pour la production d’indicateurs avancés (y compris les prévisions immédiates fondées sur des modèles), de définir des critères à l’appui de la décision de diffuser de nouveaux indicateurs avancés, et de fournir des orientations sur les méthodes appropriées pour établir les prévisions immédiates, ainsi que les avantages et les inconvénients (Matthews, 2020b, 2021b). Des progrès ont été réalisés afin d’achever les lignes directrices qui seront intégrées à l’ensemble des politiques de Statistique Canada. On s’attend à ce que cette étape soit terminée au cours de la première moitié du prochain exercice.

Pour obtenir plus de renseignements, communiquez avec :
Steve Matthews (613-854-3174, Steve.Matthews@statcan.gc.ca).

1.3 Apprentissage automatique et activités choisies en science des données

SOUS-PROJET : Déterminer des carrefours de la COVID-19 à l’échelon de la région sociosanitaire

Dans les premiers instants de la pandémie de COVID-19, Statistique Canada a entrepris de collaborer avec l’Agence de la santé publique du Canada afin de déterminer et de prédire les points chauds de la pandémie de COVID-19 à l’échelon de la région sociosanitaire en utilisant des modèles d’apprentissage automatique. Le but principal du projet était d’élaborer un modèle de prévision pseudospatiotemporelle à partir de données socio-économiques et socio-démographiques, sur la santé, sur l’épidémiologie et sur la mobilité accessibles au public afin de détourner les ressources de la santé publique des régions à faible risque vers les régions à risque plus élevé.

Progrès :

Des modèles de prédiction des niveaux de risque supervisés (fondés sur l’apprentissage profond) ont été mis au point avec succès (Arim, Hennessey et Molladavoudi, 2021). Ils sont hautement personnalisables et permettraient la prédiction des risques avec diverses plages et fenêtres coulissantes de prévisions (jusqu’à plusieurs jours) au niveau de la région sociosanitaire. Un tableau de bord interactif a également été élaboré afin de permettre aux autorités sanitaires fédérales et provinciales de suivre les tendances des cas et des décès liés à la COVID-19 à l’échelon de la région sociosanitaire et de détourner les ressources de santé publique (par exemple, équipement de protection individuelle, travailleurs médicaux de première ligne médicaux, etc.) des régions à faible risque vers les régions à risque plus élevé, et de contenir plus rapidement les cas dans ces régions par l’isolement, la recherche de contacts et la quarantaine des contacts. La preuve de concept a pris fin avec succès à l’automne 2020. L’étape suivante consisterait à utiliser les modèles et le tableau de bord dans le contexte des unités sanitaires mobiles en collaboration avec Santé Canada.

SOUS-PROJET : Détection d’événements – Détection d’événements à partir d’articles de presse

L’objectif de ce projet est de déterminer les événements économiques liés à des entreprises spécifiques à partir d’articles de presse (provenant de différentes sources comme Factiva et Newsdesk) et de représenter les événements dans une chronologie. Le projet vise également à fournir une façon conviviale d’interagir avec les données en mettant en évidence les événements et les entreprises indiqués sur un tableau de bord.

Progrès :

Pour détecter les entreprises pertinentes dans les articles de presse, nous avons utilisé des algorithmes Named-Entity-Recognition (NER) basés sur BERT qui sont disponibles dans la bibliothèque SpaCy. Étant donné que ces modèles NER sont spécifiques à la langue, des modèles de traduction d’apprentissage profond ont été envisagés. La traduction des articles du français vers l’anglais nous a également permis d’appliquer l’algorithme NER à ces articles. Une approche de classification à étiquettes multiples a ensuite été utilisée pour détecter des événements spécifiques liés aux activités économiques. Pour le module frontal, nous avons utilisé les technologies Dash et Kibana pour concevoir des tableaux de bord. Les résultats sont prometteurs et les prochaines étapes seront axées sur la réalisation d’un plus grand nombre de tests d’utilisateurs.

Pour de plus amples renseignements, veuillez consulter : https://www.statcan.gc.ca/fra/science-donnees/reseau/outil-infonuagique.

SOUS-PROJET : Classificateur de commentaires sur le recensement

À la fin des questionnaires du Recensement de la population, les répondants disposent d’une zone de texte où ils peuvent formuler des commentaires qui sont classés par domaine d’activité, comme l’éducation, le travail ou la démographie, et communiqués aux analystes experts correspondants. Les renseignements sont utilisés pour appuyer la prise de décision au sujet de la détermination du contenu pour le prochain recensement et pour surveiller des facteurs tels que le fardeau du répondant. Au cours d’un projet de preuve de concept, nous avons évalué si des techniques d’apprentissage automatique pouvaient être utilisées pour classer les commentaires des répondants au recensement en 16 catégories différentes.

Progrès :

Nous avons utilisé les données étiquetées provenant de la mise à l’essai du recensement de 2019 pour créer un algorithme de classification de texte semi-supervisé bilingue. Nous avons évalué la performance de quatre modèles différents : machine à vecteurs de support, réseau de mémoire à long ou à court terme simple et multiple, réseau de neurones à convolution multiple. Le projet de preuve de concept a été mené à bien et le classificateur sera utilisé en production à compter de mai pour classer des milliers de commentaires des répondants du Recensement de 2021 du Canada.

Pour de plus amples renseignements, veuillez consulter : https://www.statcan.gc.ca/fra/science-donnees/reseau/recensement-commentaires-2021.

SOUS-PROJET : Indicateur de la Loi canadienne sur l’accessibilité

La mise en évidence des règlements à mettre en œuvre par une entreprise donnée comporte de lire des milliers de plans d’accessibilité longs dont le format n’est pas uniforme, et peut être très subjective. L’idée derrière cette preuve de concept est d’explorer de quelle manière le traitement du langage naturel peut être utilisé pour rechercher plus de 200 exigences réglementaires sur 10 à plus de 150 pages de plans d’accessibilité afin de mettre rapidement en évidence les règlements qu’une entreprise donnée doit mettre en œuvre.

Progrès :

À la fin de la preuve de concept, l’équipe a fourni un modèle de traitement de la langue naturelle qui utilisait une couche d’enrobage de mots préformés pour faire correspondre les éléments du plan d’accessibilité à son règlement. Parallèlement, le projet pilote a déterminé des mesures visant à accroître l’information utile correctement extraite des plans publiés. Il convient de noter que ce projet pilote n’est pas une évaluation exhaustive de tous les plans et règlements; pour appliquer les résultats du projet pilote à une évaluation des plans et des règlements de la Loi canadienne sur l’accessibilité, il faudra déployer des efforts considérables pour perfectionner le modèle choisi. Pourtant, ce travail montre que c’est faisable.

SOUS-PROJET : Modélisation thématique dynamique

Ce projet a examiné l’application éventuelle de méthodes de modélisation thématique à la Base canadienne de données des coroners et des médecins légistes (BCDCML) pour détecter les changements dans les profils de décès. La BCDCML contient des données non structurées sous forme de variables en texte libre, appelées textes narratifs, qui fournissent des renseignements détaillés sur les circonstances entourant les décès déclarés. Le but de ce projet est d’appliquer des techniques d’apprentissage automatique à la variable de textes narratifs pour découvrir des structures sémantiques cachées au sein de la BCDCML et d’analyser ces structures de manière dynamique (au fil du temps) afin de détecter les textes narratifs émergents sur les décès.

Progrès :

Une première preuve de concept pour élaborer un système dynamique de modélisation thématique a été conçue, mise en œuvre et déployée à l’aide des données de la BCDCML de la Colombie-Britannique. Le système comprend un modèle, un pipeline d’ingestion et de traitement de données et des outils de visualisation de données. Le modèle regroupe les textes narratifs sur les décès en grappes ayant des structures sémantiques similaires (sujets) tout en utilisant une approche de modélisation de sujet dynamique bayésienne novatrice dans laquelle les sujets précédemment appris sont utilisés comme lois a priori bayésiennes pour les sujets actuels. Pour interpréter, visualiser et analyser les résultats de modélisation, une interface utilisateur de tableau de bord a également été déployée. Les prochaines étapes sont les suivantes : (1) adapter ce modèle aux autres provinces canadiennes; et (2) élaborer des mesures d’indicateur afin de détecter les changements importants dans différents sujets.

SOUS-PROJET : Apprentissage de stratégies optimales d’atténuation des effets de la COVID-19 en utilisant l’apprentissage par renforcement

Un environnement de simulation orientée agents a été créé pour représenter la population canadienne pendant la pandémie de COVID-19. L’apprentissage par renforcement a été utilisé pour apprendre les comportements des agents qui réduisent au minimum la propagation de la COVID dans l’environnement de simulation. L’environnement de simulation a été conçu à l’aide de données disponibles gratuitement (de Statistique Canada, l’Institut canadien d’information sur la santé et l’Agence de la santé publique du Canada). L’objectif est d’optimiser les stratégies d’intervention non pharmaceutique mises en œuvre et de déterminer l’ensemble optimal de comportements de la population contribuant à réduire au minimum la propagation d’une infection dans l’environnement de simulation.

Progrès :

Une population comportant 50 000 agents a été construite et 100 simulations ont été effectuées lors de l’application de l’apprentissage par renforcement. Les comportements des agents ont été optimisés afin de réduire au minimum le nombre d’infections dans l’environnement de simulation. Les comportements ont été analysés et des idées intéressantes ont été découvertes. De plus, des scénarios incluant la « fatigue associée à la COVID » et la non-conformité ont été étudiés. Le projet a été achevé avec succès et a mené à une publication en tant que chapitre d’un prochain livre sur la modélisation mathématique pour la COVID-19 (Denis, El-Hajj Drummond, Abiza et Gopaluni, 2021).

Pour de plus amples renseignements, veuillez consulter : https://www.statcan.gc.ca/fra/science-donnees/reseau/inp.

SOUS-PROJET : Évaluation des stratégies de réouverture des immeubles de bureaux pendant la COVID-19 à l’aide de bandits manchots

Le retour au travail et la « réouverture » à la suite des fermetures d’entreprises et d’industries liées à Covid ont été envisagés. Ce projet a été réalisé en collaboration avec l’Agence de la santé publique du Canada et a consisté à créer un environnement de simulation axé sur des agents pour des immeubles de bureaux de différentes tailles, comportant un nombre varié d’étages et d’ascenseurs, afin de représenter une journée de travail selon divers scénarios. Plus de 200 000 scénarios de travail différents ont été explorés, comprenant la présence de mécanismes de détection, le contrôle de la capacité des employés, la répartition des employés sur les étages, la taille des réunions, l’utilisation des ascenseurs ainsi que l’horaire de travail. Nous tirons parti de la théorie de la décision séquentielle pour contrôler l’échantillonnage de scénarios de simulation à l’aide de bandits manchots. Grâce à cette approche, chaque scénario a été évalué en fonction de la capacité de réduire au minimum le nombre d’événements d’infection survenant dans le milieu de travail. Il s’agit de la première méthode de modélisation à envisager des scénarios de retour au travail pour un environnement de travail dans un immeuble de bureaux, et qui a donné lieu à des recommandations partagées à l’ensemble du gouvernement concernant les décisions relatives au retour au travail dans les immeubles de bureaux.

Progrès :

Ce projet a été achevé avec succès. Plus précisément, un environnement de simulation fondé sur des agents représentant différents immeubles de bureaux de taille différente a été créé. Plus de 200 000 scénarios pour des immeubles à bureaux distincts ont été simulés, comprenant une vaste gamme de facteurs et de variables propres au milieu de travail des immeubles de bureaux. Des bandits manchots ont été utilisés pour contrôler le processus d’échantillonnage. De plus, les principales conclusions et recommandations découlant de ce travail ont été communiquées aux organismes et aux ministères de l’ensemble du Canada. L’Agence de la santé publique du Canada et Statistique Canada visent à préparer et à publier un manuscrit.

SOUS-PROJET : Estimation des superficies consacrées aux cultures sur la plate-forme d’analyse des données en tant que service (ADS) à l’aide de l’imagerie satellite

S’appuyant sur le succès de deux preuves de concept antérieures, ce projet vise à construire un nouveau modèle d’apprentissage automatique qui prend comme entrée un nombre variable d’images satellites d’un champ de culture particulier au Canada et effectue une régression sur l’image, estimant la superficie de 46 types de cultures différentes. L’imagerie satellite est jumelée aux données sur l’assurance-récolte pour certaines provinces canadiennes, à savoir l’Alberta, le Manitoba et la Saskatchewan. Ce projet permettra à Statistique Canada d’effectuer l’estimation des superficies en culture en saison dès juin ou juillet. L’objectif est d’effectuer un essai parallèle pour la campagne de culture 2021 et de réduire ou même de remplacer les enquêtes coûteuses.

Progrès :

Grâce à l’espace de travail d’analyse avancée de Statistique Canada, nous avons effectué le prétraitement coûteux de sept années de données historiques, en utilisant l’imagerie Landsat-8. Les données prétraitées sont mises à disposition pour former un réseau neuronal, et la quantité massive de données a conduit au modèle le plus précis qui puisse être atteint. En parallèle, le prototype de « système de production » est en cours de développement, qui utilisera en fin de compte le modèle d’apprentissage automatique pour produire des estimations en continu pour les analystes agricoles.

Pour de plus amples renseignements, veuillez consulter : https://www.statcan.gc.ca/fra/science-donnees/reseau/imagerie-satellite.

Pour de plus amples renseignements sur l’espace de travail d’analyse avancée, veuillez consulter : https://www.statcan.gc.ca/fra/science-donnees/reseau/plateforme-infonuagique.

SOUS-PROJET : Données fondées sur la disposition spatiale et extraction de contenu

Le format de document transférable (PDF) est le plus fréquemment utilisé par les entreprises aux fins de production de rapports financiers. L’absence de moyens efficaces d’extraction des données de ces fichiers PDF hautement non structurés d’une manière qui tienne compte de la mise en page présente un défi important pour les organismes statistiques pour analyser efficacement les données et les traiter dans cette riche source de données administratives en temps opportun. Cette recherche présente un nouvel algorithme de vision informatique, à savoir Données fondées sur la disposition spatiale et extraction de contenu, conçu et développé par Statistique Canada, qui utilise simultanément des données textuelles, visuelles et de mise en page pour segmenter plusieurs points de données dans une structure tabulaire. Cette solution modulaire proposée réduit considérablement les heures d’efforts manuels consacrés à la détermination des renseignements requis et à leur saisie en automatisant l’extraction des variables financières pour une variété de documents PDF.

Progrès :

Au cours des quatre phases de ce projet, un certain nombre de méthodes ont été testées et appliquées. Dans son état final, les Données fondées sur la disposition spatiale et extraction de contenu utilisent des pixels pour déterminer les divisions idéales de page et définir la page entière en plusieurs sous-sections rectangulaires. Une fois définies, ces sous-sections sont exploitées à l’aide de techniques graphiques transversales pour déterminer la position de chaque jeton dans une matrice tabulaire. Le produit a été présenté à Statistique Canada et à d’autres ministères et il est maintenant prêt à être mis en production.

SOUS-PROJET : Détection des chantiers de construction au moyen de l’apprentissage profond

L’objectif du projet est de démontrer la possibilité de réduire le coût d’identification et de catégorisation des chantiers de construction et de leurs propriétés en automatisant complètement le processus de détection. Grâce à l’extraction à partir d’images satellites à l’aide de l’apprentissage profond, cela permettrait une détection plus rapide (mensuelle) des chantiers de construction. Pour détecter les chantiers, nous avons adopté une approche supervisée fondée sur l’apprentissage automatique pour classifier la classe d’objets pour chaque pixel dans une image (segmentation sémantique).

Progrès :

Nous avons développé une structure de données et de métadonnées pour le déroulement des opérations collaboratives, un pipeline de traitement d’images en parallèle qui peut traiter 100 Go d’images pour créer des ensembles de formation sur l’espace de travail d’analyse avancée, accessibles aux collaborateurs.

Nous avons conçu plusieurs modèles d’apprentissage automatique en utilisant l’approche de segmentation sémantique (réseau U) de Ronneberger, Fischer et Brox (2015) pour la détection de construction basée sur les données d’image et évaluée sur des secteurs de validation et d’essai invisibles. Nous avons conçu un pipeline d’après-traitement pour traiter les prédictions du modèle à l’échelon des pixels et créer des polygones. Sur un ensemble d’essais, le modèle de début de construction a obtenu des résultats d’une qualité suffisante pour justifier la poursuite de cette preuve de concept plus loin.

SOUS-PROJET : Prévisions d’occupation des hôpitaux à court terme en lien avec la COVID-19 à Ottawa

Un modèle bayésien hiérarchique a été construit pour générer des prévisions locales d’occupation des hôpitaux en lien avec la COVID-19, fondées sur le chiffre quotidien des nouvelles admissions à l’hôpital liées à la COVID-19 et le chiffre quotidien du recensement à minuit des hôpitaux. Les deux phénomènes clés modélisés sont le retard aléatoire entre l’infection (non observée) et l’admission (observée) à l’hôpital, et celui entre l’admission à l’hôpital et le congé/décès (observé).

Ce projet de preuve de concept a été commandé par Santé Canada en septembre 2020. Les prévisions sous-provinciales d’occupation des hôpitaux en raison de la COVID-19 pourraient éclairer leur prise de décision relativement au déploiement des ressources dans le cadre de la réponse à la pandémie au Canada. L’objectif de ce projet était de déterminer la faisabilité de produire de telles prévisions avec suffisamment d’exactitude, en se fondant uniquement sur les données d’admission et d’occupation quotidiennes à l’hôpital, en utilisant Ottawa comme scénario d’essai. Ce modèle a été adapté de Flaxman et coll. (2020).

Progrès :

Un modèle a été élaboré pour générer des prévisions à court terme de l’occupation des hôpitaux d’Ottawa en lien avec la COVID-19, fondées sur le chiffre quotidien des nouvelles admissions à l’hôpital liées à la COVID-19 et le chiffre quotidien du recensement à minuit des hôpitaux d’Ottawa. Un pipeline de modélisation et de prévision a été mis en œuvre et déployé sur l’espace de travail d’analyse avancée de Statistique Canada (infrastructure informatique collaborative en nuage). À l’aide de données ouvertes déclarées pour la période allant du 10 février 2020 au 9 mars 2021, un test d’efficacité a été effectué sous la forme d’une série de simulations de prévisions, en tronquant les données de formation pour 15 lundis consécutifs (du 23 novembre 2020 au 1er mars 2021). Un modèle a été adapté à chacun des 15 ensembles de données tronqués, des prévisions ont été générées en conséquence pour une période (jusqu’à 21 jours) suivant immédiatement la date de troncation des données de formation, et les prévisions ont été comparées aux données déclarées. Le modèle a donné des résultats satisfaisants, malgré certaines limites, étant donné la simplicité et la portée limitée des données observées. Les travaux ultérieurs possibles comprennent l’expansion vers d’autres administrations, en attendant la disponibilité des données locales. Les travaux sont documentés dans Bosa et Chu (2020).

SOUS-PROJET : Modélisation épidémiologique de la COVID-19 pour l’estimation de la demande d’équipement de protection individuelle

La pandémie de SRAS-CoV-2 (COVID-19) a imposé une demande sans précédent sur le gouvernement du Canada pour qu’il fournisse des renseignements opportuns, exacts et pertinents afin d’éclairer l’élaboration de politiques portant sur une foule d’enjeux, y compris l’acquisition d’équipement de protection individuelle (EPI) et le déploiement des EPI dans les provinces et les territoires. Des modèles épidémiologiques peuvent être utilisés pour extrapoler la trajectoire des épidémies, selon différentes hypothèses futures, permettant aux décideurs d’envisager un éventail de scénarios. L’un des objectifs de ce projet consiste à améliorer le modèle compartimental dynamique stratifié selon l’âge élaboré par l’Agence de la santé publique du Canada (ASPC) en collaboration avec Statistique Canada (Ludwig et coll., 2020) en mettant en œuvre d’autres scénarios de pandémie. Dans ce modèle, la population est attribuée à divers compartiments et traverse le modèle à un rythme défini.

Progrès :

Un modèle de vaccin a été conçu selon lequel les phases de vaccination ont été divisées en quatre compartiments : 1) première injection sans avoir encore développé d’immunité; 2) première injection et développement d’une immunité partielle; 3) deuxième injection et toujours une immunité partielle; 4) deuxième injection et développement d’une immunité maximale. Le passage d’un compartiment vaccinal à l’autre est contrôlé par le nombre de doses disponibles que chaque province peut distribuer ce jour-là. Conformément à la ligne directrice du Comité consultatif national de l’immunisation (ASPC, 2021), le modèle simule le processus de vaccination qui consiste à donner la priorité aux personnes âgées, puis à passer vers la population plus jeune, tout en permettant la distribution d’un petit nombre de doses au groupe d’âge moyen pour expliquer l’effet de la vaccination des travailleurs de la santé. Différents flux d’un compartiment à l’autre ont été simulés en tenant compte de l’efficacité du vaccin, du taux de vaccination et du niveau d’immunité.

Un modèle pour les variants préoccupants a été élaboré et mis à l’essai pour modéliser l’effet que peut présenter un variant spécifique (B117) dans les provinces canadiennes. D’abord, les constatations de Davies et coll. (2021), qui ont indiqué que l’infectiosité du B117 peut être plus élevée que celle du variant de type sauvage, ont été ajoutées au modèle. De plus, Challen et coll. (2021) ont indiqué que le B117 augmente le risque d’admission à l’hôpital (c.-à-d. cas graves), et cette information a également été incorporée au modèle.

Pour obtenir plus de renseignements, communiquez avec :
Saeid Molladavoudi (613-294-7418, saeid.molladavoudi@statcan.gc.ca).

Bibliographie

Challen, R., Brooks-Pollock, E., Read, J.M., Dyson, L., Tsaneva-Atanasova, K. et Danon, L. (2021). Risk of mortality in patients infected with SARS-CoV-2 variant of concern 202012/1: matched cohort study. BMJ, 372.

Davies, N.G., Abbott, S., Barnard, R.C., Jarvis, C.I., Kucharski, A.J., Munday, J.D., Pearson, C.A., Russell, T.W., Tully, D.C., Washburne, A.D. et Wenseleers, T. (2021). Estimated transmissibility and impact of SARS-CoV-2 lineage B. 1.1. 7 in England. Science, 372(6538).

Flaxman, S., Mishra, S., Gandy, A. et al. (2020). Estimating the effects of non-pharmaceutical interventions on COVID-19 in Europe. Nature 584, 257–261. https://doi.org/10.1038/s41586-020-2405-7

Ludwig A., Berthiaume P., Orpana H., Nadeau C., Diasparra M., Barnes J., Hennessy D., Otten A. et Ogden N. (2020). Assessing the impact of varying levels of case detection and contact tracing on COVID-19 transmission in Canada during lifting of restrictive closures using a dynamic compartmental model. Canada Communicable Disease Report, 46(11/12):409-421.

Public Health Agency of Canada (PHAC). (2021). Recommendations on the use of COVID-19 vaccines. National Advisory Committee on Immunization (NACI): Statements and publications. https://www.canada.ca/content/dam/phac-aspc/documents/services/immunization/national-advisory-committee-on-immunization-naci/recommendations-use-covid-19-vaccines/recommendations-use-covid-19-vaccines-en.pdf

Ronneberger, O., Fischer, P. et Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation.

1.4 Couplages d’enregistrements

Le couplage d’enregistrements joue un rôle important dans la production de statistiques officielles. Il est cependant sujet aux erreurs, car il se fonde souvent sur des quasi-identificateurs non uniques qui sont enregistrés avec des variations et des erreurs typographiques. Le projet porte sur la production et l’utilisation de données couplées, y compris sur l’estimation exacte des erreurs de couplage.

SOUS-PROJET : Estimation des erreurs de couplage

L’estimation précise des erreurs de couplage est essentielle pour les applications, y compris l’estimation du nombre de faux négatifs attribuables au groupage. Ce projet évalue ces erreurs sans aucune vérification manuelle avec une extension du modèle de Blakely et Salmond (2002), pour tenir compte de l’hétérogénéité de l’enregistrement (voir les détails dans Dasylva et Goussanou, 2020). Ce modèle implique un mélange fini, où chaque composante est la somme d’une variable de Bernoulli avec une variable de Poisson indépendante. L’estimation est fondée sur la maximisation numérique d’une vraisemblance composite.

Progrès :

Le modèle a été utilisé pour estimer le nombre de faux négatifs attribuables au groupage lors du couplage de deux sources sans doublons, dont un dossier et un registre ou un recensement, avec une couverture presque complète. La méthodologie proposée a été évaluée avec succès dans une étude empirique, qui est décrite dans un article devant être publié dans Techniques d’enquête (Dasylva et Goussanou, 2021). Cela présente un intérêt au moment de coupler les données fiscales ou sur la mortalité et le recensement (Blakely et Salmond, 2002; Statistique Canada, 2017).

Une nouvelle procédure d’estimation a été élaborée pour tenir compte de certaines limitations de la précédente. En effet, cette procédure utilisait l’espérance-maximisation et était lente à converger. En outre, le nombre de composantes du mélange devait être sélectionné manuellement. La nouvelle procédure utilise plutôt une procédure de Newton-Raphson plus rapide et sélectionne automatiquement le nombre de composants en fonction du critère d’information d’Akaike. Il fournit également des intervalles de confiance du rapport de vraisemblance fondés sur un sous-ensemble des observations. Cette procédure peut être utilisée pour estimer les taux d’erreur à la fin d’un couplage, quelle que soit la méthode choisie (par exemple, probabiliste, déterministe, hiérarchique, etc.), à condition que la décision de coupler deux enregistrements ne dépende d’aucun autre enregistrement. Avec la méthode probabiliste, elle peut également être utilisée pendant le développement pour sélectionner automatiquement les poids de couplage et les seuils (compte tenu des taux d’erreur cibles), sans avoir à préciser la manière dont les variables sont corrélées. Par conséquent, elle simplifie grandement le processus d’estimation des erreurs et élimine les hypothèses d’indépendance conditionnelle qui sont une source possible de biais de corrélation (Blakely et Salmond, 2002; Newcombe, 1988, p. 149).

Pour obtenir plus de renseignements, communiquez avec :
Abel Dasylva (613-408-4850, abel.dasylva@statcan.gc.ca). 

Bibliographie

Blakely, T., et Salmond, C. (2002). "Probabilistic record linkage and a method to calculate the positive predicted value", Journal of Epidemiology, 31, 1246-1252.

Newcombe, H. (1988). Handbook of Record Linkage, Oxford University Press.

Statistics Canada (2017). 2016 Census of Population Income Reference Guide. Catalog no. 98-500-X2016004.

1.5 Recherche qualitative

SOUS-PROJET : Perceptions de la sensibilité des données

Le Centre de ressources en conception de questionnaire (CRQE) entretient un lien permanent avec les Canadiens lors des interviews cognitives. Ce lien est un excellent véhicule permettant de recueillir des données sur la sensibilité perçue de diverses sources de données d’enquête et non d’enquête et de contribuer en partie au projet d’échelle de sensibilité du Cadre de nécessité et de proportionnalité.

Progrès :

Une première ébauche d’un court questionnaire a été élaborée et administrée aux personnes qui participent aux interviews cognitives habituelles du CRQE. À la suite de cette première phase, on a obtenu des résultats d’enquête préliminaires, rédigé un rapport interne (Reicker, 2020) et recommandé des modifications au questionnaire. Le questionnaire mis à jour a ensuite été utilisé dans la collecte pour une brève deuxième phase. Les résultats de cette deuxième phase devraient être communiqués en 2021.

Pour obtenir plus de renseignements, communiquez avec :

Paul Kelly (613-371-1489, paul.kelly2@statcan.gc.ca). 
Date de modification :