Programme de recherche et développement en méthodologie : réalisations, 2024-2025
5. Soutien (centres de ressources)
5.1 Centre de recherche et d’analyse en séries chronologiques
Le Centre de recherche et d’analyse en séries chronologiques a pour objectif de maintenir une expertise de haut niveau et d’offrir des consultations sur les séries chronologiques à l’ensemble de l’organisme. Le centre fournit des consultations et des conseils sur les problèmes liés aux séries chronologiques, étudie les problèmes pour lesquels aucune solution n’est actuellement connue ou satisfaisante et élabore et tient à jour des outils permettant d’appliquer des solutions à des problèmes réels de séries chronologiques.
Ces projets peuvent être répartis en quatre sous-sujets mettant l’accent sur les aspects suivants :
- Consultation et formation en séries chronologiques;
- Soutien et amélioration du système et des outils de traitement de séries chronologiques;
- Modélisation et prévision de séries chronologiques;
- Soutien méthodologique au programme de l’Indice des prix à la consommation et au programme de l’Indice des prix à la production.
Progrès :
Consultation et formation sur les séries chronologiques
Le Centre de recherche et d’analyse en séries chronologiques est responsable de l’élaboration et de la prestation de formations sur les méthodes de séries chronologiques, y compris la désaisonnalisation, l’étalonnage, le rapprochement et la modélisation de séries chronologiques, aux participants de Statistique Canada ainsi qu’à ceux d’autres organismes. De plus, il fournit des conseils et des consultations sur les projets de séries chronologiques en général pour les programmes de l’ensemble de Statistique Canada.
Le Centre a offert des cours sur les composantes de séries chronologiques, la désaisonnalisation, l’étalonnage et le rapprochement au cours de l’année aux participants internes et externes par l’entremise du centre de formation de Statistique Canada (Statistique Canada, 2024). En particulier, le cours d’introduction sur les composantes de séries chronologiques et la désaisonnalisation a été présenté aux membres du Bureau de la statistique du Laos. Le Centre a également participé à des activités de sensibilisation et à de la formation ponctuelle auprès d’autres groupes de Statistique Canada sur des sujets liés aux séries chronologiques (série de séminaires de la Direction de la méthodologie pour les recrues, cours sur les navigateurs de données et démonstrations du tableau de bord de la désaisonnalisation).
Le Centre a en outre fourni des consultations dans le cadre de divers programmes internes (désaisonnalisation, modélisation de séries chronologiques, rétropolation, prévision immédiate, prévision, estimation de tendances, calendarisation, etc.) En particulier, le Centre a fourni un soutien en matière de séries chronologiques au Système de comptabilité nationale dans divers domaines, y compris les programmes sur le produit intérieur brut trimestriel et mensuel, la balance des paiements, le commerce international de services et les opérations sur titres. Des représentants du Centre assistent également périodiquement à un forum hebdomadaire d’analystes, afin de maintenir une présence dans la communauté des analystes. Le Centre mène régulièrement des consultations sur la rétropolation pour préserver ou rétablir la comparabilité au fil du temps. Les travaux relatifs à la production de lignes directrices sur la continuité des séries chronologiques se sont poursuivis et ont été intégrés à un projet plus vaste de mise à jour et d’expansion de lignes directrices sur les méthodes de séries chronologiques pour les programmes de Statistique Canada. De récents travaux comprenaient des discussions sur les lignes directrices proposées avec le Bureau de gestion de projets de l’organisme, afin de déterminer la façon d’intégrer ces lignes directrices au cadre de gestion de projet.
De plus, pour appuyer divers programmes internes, le Centre a consulté et échangé à l’externe sur des sujets liés aux séries chronologiques (stratégie de désaisonnalisation pendant la pandémie, rétropolation, déflation, outils logiciels, etc.) avec de multiples organismes publics fédéraux et provinciaux ainsi que des organismes nationaux de statistique.
Soutien et amélioration du système et des outils de traitement des séries chronologiques
Le Centre de recherche et d’analyse en séries chronologiques élabore et tient à jour un certain nombre d’outils importants utilisés pour traiter et analyser les données de séries chronologiques pour les programmes de Statistique Canada produisant des données désaisonnalisées, en particulier le système généralisé G-Séries, aux fins d’étalonnage et de réconciliation (ratissage et équilibrage) (Statistique Canada, 2016; Ferland, 2025), le Système de traitement des séries chronologiques (Ferland, 2022) et le tableau de bord de la désaisonnalisation (Verret, 2021).
Le travail restant sur une nouvelle version libre de G-Séries en R est terminé, avec l’ajout de la fonctionnalité d’équilibrage, des fonctions d’utilité et de la documentation bilingue élargie. La nouvelle version de G-Séries est élaborée et tenue à jour dans l’environnement GitLab interne de Statistique Canada en respectant des pratiques exemplaires d’intégration et de prestation continues (CI/CD). Elle a fait l’objet d’essais alpha et bêta, ainsi que d’un examen du code et d’une évaluation de la vulnérabilité des applications de cybersécurité. La nouvelle version de G-Séries sera diffusée officiellement en tant que progiciel R sur GitHub et CRAN en mai 2025.
Le système de traitement des séries chronologiques est une application personnalisable reposant sur SAS et permettant d’appliquer des techniques de séries chronologiques, dont des techniques de désaisonnalisation, d’étalonnage et de réconciliation, largement utilisées au sein de Statistique Canada dans la production d’estimations désaisonnalisées pour des programmes infra-annuels (essentiels au mandat dans de nombreux cas). Le système est dans un état mature et stable. Toutefois, il doit être constamment mis à jour, afin d’élargir ses fonctionnalités et de répondre aux nouveaux besoins des programmes de l’organisme. Tout comme G-Séries, le système de traitement des séries chronologiques sera remanié en R. Le travail devrait commencer l’an prochain et offrira la souplesse nécessaire pour intégrer les outils et les nouvelles techniques disponibles à partir de logiciels libres.
Le tableau de bord de la désaisonnalisation est maintenant hébergé sur le GitLab interne de Statistique Canada et reconfiguré pour faciliter son installation. Parmi les autres améliorations mineures apportées au tableau de bord, mentionnons la réduction des dépendances et du temps de chargement. Le tableau de bord a été déployé cette année pour deux autres programmes sur la main-d’œuvre, dans le cadre desquels une révision mineure a été apportée pour intégrer un effet de calendrier propre au programme. Le Centre a également offert de la formation à des analystes spécialisés.
Modélisation et prévision de séries chronologiques
Le Centre a terminé un projet sur la production d’indications précoces de ruptures structurelles à l’aide de modèles d’espace d’états. Un outil R a été créé pour détecter et modéliser les chocs (changements soudains) dans les séries chronologiques, soit dans des équations de mesure (valeurs aberrantes additives), soit dans des équations d’état (effets plus permanents).
Dans l’Enquête sur la population active, certaines estimations sont calées en fonction des chiffres de population. La proportion de résidents temporaires au sein de la population varie selon les saisons (en partie en raison des étudiants étrangers et des travailleurs temporaires). Pour stabiliser le calage, une méthodologie simple est actuellement utilisée pour lisser ces fluctuations (moyenne mobile sur 12 mois). Le Centre a lancé une étude visant à déterminer si les techniques de désaisonnalisation et d’estimation de tendance-cycle pourraient fournir une méthodologie améliorée, particulièrement en période de changements rapides dans ce segment de la population. L’étude est en cours.
La période de pandémie de COVID-19 a eu une incidence considérable sur de nombreuses séries chronologiques économiques au cours de la période de 2020 à 2022. Les données étant maintenant disponibles pour 2023 et 2024, on peut commencer à évaluer l’impact de la pandémie sur les tendances saisonnières, la tendance-cycle et la volatilité. Le Centre a entamé un examen préliminaire à l’aide de séries chronologiques représentatives de divers programmes statistiques (main-d’œuvre, commerce, fabrication, permis de construction et investissement en construction de bâtiments, tourisme, Indice des prix à la consommation), afin de déterminer si ces séries sont revenues à des tendances prépandémie ou sont passées à un nouveau régime postpandémie. Cette enquête continuera d’être affinée à mesure que d’autres données postpandémie deviendront disponibles.
Le Centre a également contribué à un projet de prévision immédiate dans le cadre de l’initiative d’accélération méthodologique de Statistique Canada, initiative lancée pour répondre à la nécessité d’améliorer considérablement la capacité de l’organisme à mettre en œuvre efficacement et rapidement des solutions modernes aux défis liés aux données. Le Centre a élaboré, mis à l’essai et validé un scénario de prévision immédiate de macro-estimations pour l’Enquête sur les marchandises vendues au détail, à l’aide des modèles ARIMA et de réseaux neuronaux. De plus, un scénario de micromodélisation, au niveau de l’entreprise, a été élaboré, mis à l’essai et validé.
Soutien méthodologique au programme de l’Indice des prix à la consommation et au programme de l’Indice des prix à la production
Le Centre de recherche et d’analyse en séries chronologiques compte également une sous-section chargée de fournir un soutien méthodologique au programme de l’Indice des prix à la consommation (IPC) et au programme de l’Indice des prix à la production (IPP).
Cette sous-section a élaboré et mis à l’essai un protocole d’échantillonnage pour le contrôle de la qualité des classificateurs d’apprentissage automatique utilisés pour les problèmes de classification à grande échelle à multiples catégories et la collecte longitudinale. Au cours des dernières années, l’IPC a intégré des données de lecteurs optiques aux points de vente, ce qui permet de fournir chaque mois un recensement des opérations de quelques grands détaillants. Les descriptions textuelles des produits doivent être classées dans la structure d’agrégation hiérarchique de l’IPC de plus de 700 catégories de produits. Un classificateur de machines à vecteurs de soutien linéaires a été entraîné pour effectuer cette classification. Toutefois, il fait trop d’erreurs pour être acceptable pour l’IPC, nécessitant un examen supplémentaire par des annotateurs humains. Le coût de l’annotation humaine est l’étape limitant l’expansion de l’utilisation des données de lecteurs optiques. Trois stratégies d’échantillonnage ont été élaborées pour sélectionner les cas devant faire l’objet d’une annotation humaine et fournir des estimations des taux d’erreurs de classification erronée avec des intervalles de confiance de Wilson modifiés. Le Centre a collaboré avec des scientifiques des données de la Division des prix à la consommation pour mettre en œuvre ces stratégies d’échantillonnage en Python et les mettre à l’essai sur des cas simulés de ventes d’aliments, dans le but de rendre le code public pour d’autres organismes nationaux de statistique et d’autres chercheurs. Les résultats de la simulation ont privilégié une solution hybride entre deux stratégies : 1) un échantillon aléatoire simple stratifié pour de nouveaux produits chaque mois, afin d’estimer les taux de classification erronée et de surveiller le rendement du modèle; 2) un échantillon par probabilité proportionnelle à la taille parmi les unités non examinées des mois précédents, ciblant les cas les plus susceptibles de causer un biais de classification erronée dans l’estimation de l’IPC, selon une mesure d’influence dérivée des indices de prix (Spackman, Francis et Goussev, 2025). Les résultats de la stratégie et de la simulation ont été présentés lors d’une réunion d’avril 2025 de la Commission économique des Nations Unies pour l’Europe (CEE-ONU) à Genève, en Suisse, sur les méthodes d’indice des prix à la consommation.
Le Centre a également mené des consultations sur l’élaboration d’un ensemble d’indicateurs de la qualité pour l’IPC. La première étape de ce projet a donné lieu à un ensemble d’indicateurs quantitatifs et à une mesure agrégée pour des problèmes potentiels de collecte et de traitement. De plus, un ensemble préliminaire d’indicateurs qualitatifs portant sur les six dimensions de la qualité de Statistique Canada a été élaboré (Francis, Carrillo-Garcia, Yélou et Rassart, 2025).
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Etienne Rassart (etienne.rassart@statcan.gc.ca).
Bibliographie
Ferland, M. (2022). Time Series Processing System – v3.08. Document interne, Statistique Canada.
Ferland, M. (2025). gseries: Improve the Coherence of Your Time Series Data. R package version 3.0.2, https://StatCan.github.io/gensol-gseries/fr/.
Francis, J., Carrillo-Garcia, I., Yélou, C. et Rassart, E. (2025). Developing CPI Quality Indicators: Project Update. Document interne, Statistique Canada.
Spackman, W., Francis, J. et Goussev, S. (2025). Optimal use of machine learning at scale: Designing quality control of machine learning classification and mitigating misclassification error. Proceedings of the 17th Meeting of the Group of Experts on Consumer Price Indices, CEE-ONU, Genève, Suisse. Disponible à l’adresse : https://unece.org/sites/default/files/2025-04/Spackman%20et%20al%20%282025%29%20-%20QC%20for%20mitigating%20misclassification%20bias%20-%20paper.pdf.
Statistique Canada (2024). Formation. Disponible à: https://www.statcan.gc.ca/fr/afc/formation.
Statistique Canada (2016). G-Series 2.00.001 User Guides. Document interne, Statistique Canada.
Verret, F. (2021). Le tableau de bord de la désaisonnalisation de Statistique Canada. Recueil : Symposium 2021, Adopter la science des données en statistique officielle pour répondre aux besoins émergents de la société, Statistique Canada, Ottawa, Canada.
5.2 Centre de ressources sur l’innovation et les outils de statistiques économiques
La Sous-section des systèmes généralisés pour les statistiques économiques a été réorganisée en tant que section appelée le Centre de ressources sur l’innovation et les outils de statistiques économiques. Ce nouveau centre est responsable, entre autres, du soutien et du développement de trois systèmes généralisés : G-Sam (système généralisé d’échantillonnage), Banff (système généralisé de vérification des données statistiques) et G-Est (système généralisé d’estimation).
Progrès :
Les projets du Centre peuvent généralement être classés en soutien (pour les utilisateurs du système), recherche et développement.
Le Centre a traité un volume de cas de soutien typique pour G-Sam, Banff et G-Est. Ceux-ci comprenaient des cas de soutien pour les deux versions actuelles des systèmes fondées sur SAS et du soutien pour la migration vers la version Python de Banff. Même si certains cas ont été résolus en quelques échanges de courriels, plusieurs autres ont nécessité une participation plus approfondie et ont comporté des recommandations sur la mise en œuvre appropriée du système pour atteindre les objectifs statistiques. Un résumé de ces cas est fourni ci-dessous.
Équipe du système Banff :
- Poursuite de la collaboration avec l’Enquête sur les postes vacants et les salaires pour mettre en œuvre des changements à son étape de vérification et d’imputation. De plus, l’équipe a fourni une version à code source ouvert du processus, appelant la version Python de Banff, en excluant les étapes personnalisées de SAS.
- Collaboration avec la section des impôts sur une stratégie d’imputation pour le projet de remaniement du système de traitement des données du fichier T1, à l’aide de la version Python de Banff.
- Consultation auprès de plusieurs équipes d’enquête, tant du côté économique que des ménages, pour étudier l’utilisation de la nouvelle version Python. Cela a inclus des démonstrations du processeur Banff et des recommandations sur des méthodes à code source ouvert qui pourraient être intégrées au système Banff.
Équipe de G-Sam :
- Soutien à l’Enquête sur les ventes d’aliments et de boissons prêts à servir, à l’Enquête sur les infrastructures publiques essentielles du Canada (IPEC) et à l’Enquête canadienne sur le commerce interprovincial en matière d’optimisation de la répartition selon diverses contraintes (taille d’échantillon, précision et coordination), incluant des commentaires supplémentaires sur la rotation et la restratification.
- Présentation de la fonctionnalité de répartition de G-Sam à l’équipe de l’IPEC, en soulignant ses caractéristiques et ses applications potentielles.
- Présentation d’une explication détaillée de l’algorithme de stratification de Lavallée-Hidiroglou au ministère de la Statistique de Singapour, y compris son fondement théorique et son application pratique dans le plan de sondage.
- Résolution de problèmes numériques liés à la répartition pour l’Enquête sur les fruits et légumes, afin d’assurer la mise en œuvre efficace de stratégies d’échantillonnage.
Au cours de l’exercice, la majeure partie de la recherche et du développement a été consacrée à l’initiative de Transition vers les sources ouvertes (SOS) de Statistique Canada. L’équipe a joué un rôle actif pour tenir informés les utilisateurs, au sein et hors de la direction, de l’état d’avancement du système. Cela a inclus des présentations au Comité directeur sur les systèmes généralisés, des séminaires de la direction, des réunions du Conseil de planification du secteur et un article externe (Gray et Pierre, 2025). L’équipe du Centre a également rencontré des représentants de l’Office fédéral allemand de la statistique (Destatis) pour discuter de la transition de Banff vers les sources ouvertes et pour amorcer un projet de collaboration sur l’élaboration d’un cadre et d’un outil d’évaluation des méthodes d’imputation.
Le projet de modernisation de Banff a été mené à bien en respectant la portée, le budget et le calendrier définis. Banff est un système modulaire de vérification des données statistiques (VDS) permettant de détecter et de traiter les erreurs de déclaration et les cas de non-réponse. En janvier 2025, la version fondée sur Python a été diffusée, ce qui a permis d’améliorer la flexibilité, d’appuyer des méthodes d’imputation avancées et de faciliter la collaboration internationale. Banff comprend neuf procédures remplissant diverses fonctions de VDS, notamment la détection de valeurs aberrantes, la localisation des erreurs, l’imputation et l’ajustement proportionnel, ainsi que des méthodes de vérification et d’imputation des données sous contraintes de relations linéaires. Le processeur Banff est un outil axé sur les métadonnées qui exécute la vérification des données en production, en appelant des procédures Banff intégrées parallèlement à des modules personnalisés dans le cadre d’un enchaînement de processus précisé par l’utilisateur. Les utilisateurs sont invités à partager des modules personnalisés compatibles avec Banff dans le répertoire des modules d’extension Banff, ouvert à tous les utilisateurs, afin de favoriser la collaboration et de réduire la répétition inutile. Cette version en Python harmonise le système avec le Modèle générique de vérification des données statistiques (CEE-ONU, 2019). Une présentation de premier plan portant sur le nouveau système a eu lieu à la réunion d’experts sur la vérification des données statistiques de la Commission économique des Nations Unies pour l’Europe (CEE-ONU) (Gray, 2024). Pour promouvoir le système, l’équipe du système Banff a présenté un séminaire de lancement (Gray et Seffal, 2025a) et a communiqué les leçons apprises au cours de la semaine d’apprentissage de la Direction des méthodes statistiques modernes et de la science des données (Gray et Seffal, 2025b).
La version en R de G-Sam a été entièrement reconstruite, en conservant les méthodes de base de la version SAS tout en améliorant considérablement le rendement et en élargissant les fonctionnalités. Les nouvelles fonctions de répartition et de sélection gèrent un éventail plus large de problèmes et surpassent leurs équivalents en SAS avec moins de code et moins de données d’entrée. Les dépendances sont minimales et les structures d’entrées ont été remaniées pour améliorer la convivialité. Pour faciliter la transition, l’équipe élabore actuellement des outils et des conseils en matière de migration. Les données de sortie demeurent en grande partie cohérentes; elles présentent seulement des différences mineures en raison du changement dans les moteurs d’optimisation. Une version bêta devrait être diffusée en juin 2025, la diffusion de production étant prévue pour septembre 2025.
La version en R de G-Est offrira des fonctions de pondération et d’estimation de la variance pour des plans d’enquête complexes et comprendra la plupart des mêmes caractéristiques que la version SAS. Elle inclura la méthode du bootstrap, le calage, les corrections pour la non-réponse, l’estimation sur petits domaines et la variance due à l’imputation (par l’entremise du module du Système d’estimation de la variance due à la non-réponse et à l’imputation, SEVANI). Comme pour G-Sam, la mise en œuvre a été entièrement reconçue, optimisée pour R avec des dépendances externes minimales et la possibilité d’ajouter des méthodes à l’avenir. Les versions alpha du calage et de l’estimation de la variance en une étape sont terminées; les essais initiaux montrent des améliorations de rendement importantes par rapport à la version SAS. Pour l’estimation sur petits domaines, l’équipe de transition examine la pertinence d’un progiciel existant, tandis que l’élaboration des modules bootstrap et SEVANI devrait commencer ce printemps. Une version bêta devrait être diffusée en décembre 2025, la diffusion de production étant prévue pour décembre 2026.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Fritz Pierre (fritz.pierre@statcan.gc.ca).
Bibliographie
Commission Économique des Nations Unies pour l’Europe (CEE-ONU) (2019). Generic Statistical Data Editing Model (GSDEM), https://statswiki.unece.org/display/sde/GSDEM.
Gray, D. (2024). Building the new Banff: An open-source data editing system based on GSDEM concepts. UNECE Expert Meeting on Statistical Data Editing, 7 au 9 octobre 2024, Vienne.
Gray, D. et Pierre, F. (2025). De SAS vers les sources libres : conversion des systèmes généralisés de Statistique Canada. À paraître dans le prochain numéro de Convergence, une revue de l’Association des statisticiennes et statisticiens du Québec.
Gray, D. et Seffal, M. (2025a). The New Banff: A Modern Edit and Imputation Platform for Everyone. Présentation interne, Statistique Canada.
Gray, D. et Seffal, M. (2025b). From SAS to Open-Source: What we learned from the Banff project. Présentation interne, Modern Statistical Methods and Data Science Branch Learning Week, Statistique Canada.
5.3 Centre de ressources en couplage d’enregistrements
Les objectifs du Centre de ressources sur le couplage d’enregistrements (CRCE) sont d’offrir des services de consultation aux utilisateurs internes et externes de méthodes de couplage d’enregistrements, ce qui comprend la formulation de recommandations sur les logiciels et les méthodes à utiliser, et le travail de collaboration sur les applications de couplage d’enregistrements. Nous facilitons également la diffusion de renseignements sur les méthodes, les logiciels et les politiques de couplage d’enregistrements, ainsi que sur l’analyse de données couplées aux parties intéressées à l’intérieur et à l’extérieur de Statistique Canada.
Progrès :
Nous avons offert du soutien à l’équipe de développement de G-coup, le système de couplage d’enregistrements mis au point à Statistique Canada. Le CRCE a également offert un soutien aux utilisateurs internes et externes de G-coup qui ont demandé de l’aide, fourni des commentaires ou soumis des suggestions au moyen de requêtes à G-coup_info.
Au cours de l’année, l’essentiel des travaux méthodologiques a porté sur la maintenance, le développement et l’accompagnement des utilisateurs de la version 3.5 de G-coup sur les serveurs SAS en environnement infonuagique. Un volume typique de cas d’assistance pour G-coup a été traité par l’équipe du projet. La plupart d’entre eux ont été résolus par des suggestions sur la manière d’appliquer le système en termes pratiques, mais plusieurs ont nécessité un engagement plus important.
Le travail de développement a été axé sur une mise à jour des outils pour la création de données synthétiques pour le couplage d’enregistrements à des fins de test et de formation. Le travail a été réalisé en R et en Python dans le cadre du passage à des outils à code source ouvert au sein de l’organisme.
Le CRCE a également travaillé sur divers autres couplages probabilistes dans l’Environnement de couplage des données sociales ECDS. Ces couplages nous ont aidés à analyser les performances du logiciel et les solutions à fournir. Le travail sur ces projets a abouti à des approches plus systématiques pour définir et ajuster les couplages d’enregistrements sur les serveurs SAS basés sur l’infonuagique. Des travaux ont également été entrepris pour réajuster les poids de sondage afin de compenser les biais introduits par les liens manqués, y compris des travaux pour des clients externes sur des données de recensement liées à plusieurs fichiers administratifs longitudinaux.
Les membres de l'équipe ont offert des cours formels avec le Centre de formation de Statistique Canada et ont préparé du matériel pour un atelier dans le cadre de la conférence du Réseau canadien des centres de données de recherche en 2025. Le CRCE a aussi mis à jour de la documentation de référence et de stratégie pour les utilisateurs des techniques de couplages probabilistes.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Abdelnasser Saïdi (abdelnasser.saidi@statcan.gc.ca).
5.4 Centre de ressources en analyse de données
Le Centre de ressources en analyse de données (CRAD) a pour objectif premier de fournir des conseils sur le bon usage des outils et des méthodes d’analyse de données et de promouvoir l’adoption de pratiques exemplaires dans ce domaine. Les services du CRAD, axés principalement sur les données d’enquête, les données de recensement et les données administratives, sont offerts aux employés de Statistique Canada et d’autres ministères, ainsi qu’aux analystes et chercheurs du milieu universitaire et des centres de données de recherche.
Progrès :
Consultations
Des services de consultation ont été fournis à la demande de clients internes et externes. Entre le 1er avril 2024 et le 31 mars 2025, le CRAD a répondu à environ 50 demandes. Les questions ont varié en complexité et ont porté sur des sujets comme la régression logistique au moyen des données d’enquête, l’estimation de la variance au moyen des poids bootstrap, les intervalles de confiance pour de petites proportions, la comparaison de sous-populations dépendantes, les tests du khi carré, le calcul des degrés de liberté pour des données d’enquête et la régression par quantile. Le CRAD a également aidé des clients à mettre en œuvre des méthodes statistiques avec les logiciels R, SAS, SUDAAN et STATA. De plus, le CRAD a examiné des documents analytiques pour des revues scientifiques, des conférences et des publications internes.
Services de formation
Le CRAD a présenté, en anglais, le cours interne 0438A « Analyse statistique des données d’enquête – Module 1 ». Ce cours de six jours allie théorie et pratique. Des exercices et des exemples ont été présentés en utilisant du code R, SUDAAN et SAS.
Le CRAD a fait une présentation sur l’analyse de données d’enquête complexe, en français et en anglais, lors de l’Atelier d’interprétation de données organisé par Statistique Canada. Le CRAD a présenté de nouveau, en anglais, les séances sur la régression linéaire au moyen de données d’enquête complexes, dans le cadre du cours sur la modélisation statistique à Statistique Canada. Le CRAD a également organisé un séminaire pour les recrues sur l’analyse des données d’une enquête complexe.
En collaboration avec la Division de l’analyse de la santé (DAS), le CRAD a élaboré et présenté un cours de 12 heures intitulé « Survivre à la transition en R pour les analystes d’enquêtes ». Cette formation pratique a été proposée aux analystes d’enquête de la DAS et comprenait des exemples pratiques et des exercices axés sur la préparation préalable des données, l’analyse des données à l’aide du progiciel « survey » de R et la visualisation des données.
Collaboration
Le CRAD a collaboré avec le Secrétariat du Conseil du Trésor à l’élaboration de stratégies de mesure pour le projet de mesure du rendement en santé mentale en milieu de travail. Pour ce projet, les données recueillies dans le cadre des cycles 2019, 2020 et 2022 du Sondage auprès des fonctionnaires fédéraux ont été utilisées pour mesurer des variables latentes, comme les facteurs de risque psychologiques et les comportements, et pour calculer les scores factoriels pour différents niveaux d’agrégation. Les scores factoriels établis pour le projet ont servi à créer le tableau de bord de la santé mentale en milieu de travail dans la fonction publique fédérale : Tableau de bord de la santé mentale - Canada.ca (tbs-sct.gc.ca). Les modèles de mesure ont été élaborés au moyen de l’analyse factorielle et de la modélisation par équations structurelles, comme l’ont expliqué Blais, Mach, Michaud et Simard (2020), et Blais, Michaud, Simard, Mach et Houle (2021). Cette année, le CRAD a estimé la variance des scores factoriels, permettant le calcul des coefficients de variation et des intervalles de confiance pour tous les domaines présentés dans le tableau de bord.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Pierre-Olivier
Julien (pierre-olivier.julien@statcan.gc.ca)
ou
Isabelle
Michaud (isabelle.michaud@statcan.gc.ca).
Bibliographie
Blais, A.-R., Mach, L., Michaud, I. et Simard, J.-F. (2020). Analysis of the Public Service Employee Survey Items as Measures of the Psychosocial Risk Factors. Présentation au Workplace Mental Health Performance Measurement Steering Committee, 7 octobre 2020.
Blais, A.-R., Michaud, I., Simard, J.-S., Mach, L. et Houle, S. (2021). Mesurer les facteurs psychosociaux en milieu de travail au sein du gouvernement fédéral. Rapports sur la santé, 32, 12.
5.5 Centre de ressources pour la confidentialité et l’accès aux données
Le groupe de la méthodologie responsable de la confidentialité et des méthodes d’accès a continué d’offrir des services de consultation et de soutien aux partenaires internes et externes en ce qui concerne les diverses solutions d’accès et de stratégies de prévention de la divulgation.
Anonymisation
Le groupe de soutien à la confidentialité a continué d’offrir son expertise dans la compréhension et le développement d’idées liées à la dépersonnalisation et à l’anonymisation. Statistique Canada continue d’améliorer ses propres stratégies internes pour s’assurer que les renseignements internes sont dépersonnalisés dans la mesure du possible afin de réduire le plus possible les risques de divulgation.
Statistique Canada a contribué à un ensemble de fiches de renseignements qui seront publiées par le Commissaire à l’information et à la protection de la vie privée de l’Ontario.
Le Centre de ressources pour la confidentialité et l’accès aux données continue d’offrir gouvernance, orientation et conseils stratégiques en matière de production d’ensembles de données ouvertes. Cette année, plus de 15 nouveaux fichiers de microdonnées à grande diffusion ont été examinés et rendus accessibles sur le site Web de Statistique Canada.
Consultations externes
Statistique Canada a continué d’offrir son expertise à plusieurs groupes à l’étranger et au Canada. À l’échelle internationale, Statistique Canada a continué de participer à une étude pilote entre le Canada (StatCan), la France (Institut national du cancer) et les États-Unis (National Cancer Institute) visant à étudier la capacité d’échanger des données sur le cancer entre les pays.
À l’échelle nationale, nous continuons de travailler avec Santé Canada en fournissant des tableaux non divulgateurs des chiffres quotidiens de mortalité afin de contribuer à son projet de Cote air santé. Plutôt que des techniques d’arrondissement classiques, nous proposons des méthodes d’ajout de bruit visant à accroître l’utilité pour le même niveau de risque de divulgation.
Statistique Canada a offert son expertise en matière de stratégies de contrôle de la divulgation auprès de Service correctionnel Canada, à des analystes de l’Enquête nationale sur la santé des Inuits, à l’Agence de la santé publique du Canada pour sa diffusion d’information de la Base de données en ligne des effets indésirables de Canada Vigilance et à la Banque du Canada pour son Enquête sur les attentes des consommateurs au Canada.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Steven Thomas (steven.thomas@statcan.gc.ca).
5.6 Activités de soutien et de recherche en intelligence artificielle
Le Programme de recherche et développement en méthodologie (PRDM) de Statistique Canada a appuyé de nombreuses activités du Centre de recherche et d’excellence en intelligence artificielle et de la Division des méthodes d’intelligence artificielle. Le soutien du PRDM a permis à de nombreuses personnes d’effectuer des recherches approfondies, de créer des prototypes, d’établir des collectivités, de créer des centres d’expertise et d’élaborer des lignes directrices pouvant profiter à l’organisme.
Activités, mandats et produits
Le financement a permis au Centre d’expertise du traitement automatique de la langue naturelle (TALN) de progresser dans son mandat de centraliser les ressources pour le partage des connaissances et le renforcement des capacités en matière d’analyse de textes à l’aide de l’apprentissage automatique et de créer, de tenir à jour et de promouvoir des pratiques exemplaires et des lignes directrices en matière d’analyse de textes. Les activités du Centre consistent à procéder à des examens, à fournir des services de consultation et de l’orientation aux spécialistes du TALN au sein de Statistique Canada, ainsi qu’à créer la liste des projets de TALN réalisés et en cours au sein de l’organisme.
Une autre communauté financée par le PRDM traite des technologies d’amélioration de la protection de la vie privée (TPVP). Ce soutien a permis le lancement de la communauté de pratique, qui est toujours en cours. En cette ère de protection de la vie privée, le fonctionnaire ayant besoin de TPVP sera en mesure de chercher et de trouver des renseignements sur les techniques les plus récentes, de communiquer avec l’équipe de TPVP de Statistique Canada et, éventuellement, de trouver des conférences et des articles à mesure que le site évolue. Le soutien du PRDM a également permis le lancement de l’équipe de TPVP responsable, qui élaborera des lignes directrices et créera un comité d’examen pour tout projet de TPVP interne ou externe (travaux en cours).
Outre le soutien apporté aux communautés et aux centres, ce financement a permis de poursuivre une étude approfondie comprenant la mise à profit de modèles probabilistes de diffusion de débruitage pour générer de grands volumes de données tabulaires synthétiques qui reproduisent fidèlement les répartitions de données du monde réel. Le projet intègre un processus de réduction du biais, inspiré de l’inférence alimentée par des prédictions et de l’estimateur par la différence généralisée. La solution proposée est maintenant évaluée à des fins de mise en œuvre, ce qui pourrait permettre de gagner du temps, de réduire les efforts et d’économiser de l’argent lors de la réalisation d’enquêtes par échantillonnage.
Le deuxième projet de recherche prometteur financé par le comité est une étude approfondie visant à créer des mesures d’évaluation pour l’intelligence artificielle (IA) générative, c’est-à-dire un cadre pour les grands modèles de langage. Contrairement aux problèmes classiques, comme la classification ou la régression, avec des mesures établies (comme la racine de l’erreur quadratique moyenne, REQM, ou la cote F1), l’IA générative manque de méthodes d’évaluation normalisées; celles qui sont utilisées en pratique varient en fonction de tâches particulières et présentent des problèmes de fiabilité. Un cadre d’évaluation a été créé pour améliorer la convivialité et la reproductibilité, tout en offrant des outils et des artefacts conviviaux qui n’exigent pas de connaissances théoriques approfondies pour les praticiens.
D’autres recherches ont été rendues possibles par le PRDM, qui soulignent son importance en matière de soutien à la recherche en IA, à la modernisation de la méthodologie et à la communauté gouvernementale de l’IA en général.
Pour obtenir plus de renseignements, veuillez communiquer
avec :
Marie-Eve Bedard (marie-eve.bedard@statcan.gc.ca) ou
Nabila Ould-Brahim (nabila.ould-brahim@statcan.gc.ca).
5.7 Centre de ressources en conception de questionnaires
Le Centre de ressources en conception de questionnaires (CRCQ) est le centre d’expertise de Statistique Canada en matière de conception et d’évaluation de questionnaires. Le CRCQ offre des services de consultation et de soutien et mène des recherches et des projets relatifs à l’élaboration, à la mise à l’essai et à l’évaluation de questionnaires d’enquête. Il joue un rôle très important dans la gestion de la qualité et répond aux exigences de l’ensemble des programmes de Statistique Canada en consultant les clients, les répondants et les utilisateurs de données et en procédant à l’essai préliminaire des questionnaires d’enquête.
Même si une grande partie du travail du Centre de ressources en conception de questionnaires est effectuée selon le principe du recouvrement des coûts, la section est fréquemment sollicitée, de manière ponctuelle, pour effectuer des évaluations d’expert et offrir des services de consultation relativement à un large éventail d’enquêtes. Le groupe propose aussi des cours sur la conception de questionnaires.
Progrès :
Le CRCQ a effectué de nombreux examens de questionnaires d’enquête. Même si la plupart de ces examens portaient sur des questionnaires de Statistique Canada, plusieurs ont été effectués pour des enquêtes menées par d’autres organismes gouvernementaux, comme Travaux publics et Services gouvernementaux Canada, Régie de l’énergie du Canada, Services publics et Approvisionnement Canada et d’autres.
Le groupe a également contribué à diverses initiatives de consultation de l’organisme.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Jeremy Solomon (jeremy.solomon@statcan.gc.ca).
5.8 Centre de ressources en assurance de la qualité
Le Centre de ressources en assurance de la qualité (CRAQ) a pour mission de faire progresser la recherche et développement dans les méthodes statistiques visant à améliorer les processus d’assurance et de contrôle de la qualité. Notre principal objectif est d’élever les normes des opérations de collecte et de traitement des données d’enquête au sein de l’organisme. Pour atteindre cet objectif, nous explorons un éventail de méthodologies, en mettant particulièrement l’accent sur l’amélioration de la qualité des données sortantes.
Au cœur de nos efforts se trouve la prestation de services méthodologiques pour G-Code, un système généralisé mis au point à Statistique Canada pour la création de bases de données codées et la mise en œuvre d’algorithmes d’apprentissage automatique dans le traitement des données. Nos recherches portent sur un large éventail de pratiques d’assurance et de contrôle de la qualité pour lesquelles nous devons résoudre des questions d’efficacité et d’automatisation. Les résultats de nos recherches sont pertinents non seulement pour nos activités internes, mais également par leur grande applicabilité à différentes étapes des processus d’enquête.
Progrès :
L’équipe de soutien méthodologique a aidé l’équipe de développement de G-Code et a fait le suivi des commentaires des utilisateurs pour cibler des possibilités d’amélioration de G-Code. De plus, le CRAQ a apporté son soutien aux utilisateurs internes et externes de G-Code chaque fois que de l’aide, des commentaires ou des suggestions concernant G-Code étaient nécessaires.
Tout au long de l’année, le CRAQ s’est consacré à mettre en œuvre une nouvelle méthodologie appelée « Contrôle de la qualité par score » afin d’améliorer le contrôle de la qualité (CQ) des processus de codage de texte par apprentissage automatique (AA). Comme la technologie d’AA joue un rôle de plus en plus essentiel dans le traitement des données, il est primordial d’assurer la qualité des codes générés. Pour relever ce défi, Statistique Canada cherche activement à élaborer une stratégie pour déterminer les taux d’échantillonnage optimaux aux fins de CQ en utilisant des scores tirés du processus d’apprentissage automatique. Cette méthodologie favorise une approche responsable de classification des données tout en facilitant l’adoption plus large de l’apprentissage automatique. Notre objectif est d’appliquer cette méthode à des fins de CQ pour plusieurs classifications au sein d’enquêtes essentielles comme l’Enquête sur la population active (EPA), l’Enquête sur les postes vacants et les salaires, l’Enquête sur la santé dans les collectivités canadiennes et le Registre statistique des entreprises (RSE). Un article exposant en détail cette méthodologie a notamment été présenté au Comité consultatif des méthodes statistiques (Oyarzun, Wile et Evans, 2023).
De plus, le CRAQ a aidé l’équipe de l’EPA à mettre à jour ses données pour refléter les plus récentes classifications des industries et des professions, ce qui a entraîné d’importants changements structurels. Traditionnellement, les catégories fractionnées étaient traitées au moyen d’un codage manuel et d’une répartition aléatoire. Un nouveau cadre hybride, combinant l’apprentissage automatique (fastText) et la programmation linéaire, a été élaboré pour améliorer l’efficacité tout en maintenant la cohérence avec les estimations traditionnelles. Ces travaux ont été présentés au Symposium de 2024 de Statistique Canada (Evans et Wile, 2024).
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Javier Oyarzun (javier.oyarzun@statcan.gc.ca).
Bibliographie
Evans, J. et Wile, L. (2024). Filer sur la voie du FastText : Exploiter l’apprentissage automatique restreint par la programmation linéaire pour réviser les classifications. Recueil : Symposium 2024, Le futur des statistiques officielles, Statistique Canada, Ottawa, Canada.
Oyarzun, J., Wile, L. et Evans, J. (2023). Quality control by score. Article présenté au Comité consultatif sur les méthodes statistiques, octobre 2023, Statistique Canada.
5.9 Secrétariat de l’éthique des données
Le rôle du Secrétariat à l’éthique des données est de mettre en œuvre le Cadre de nécessité et de proportionnalité. Concrètement, le Secrétariat de l’éthique des données effectue des examens éthiques des nouvelles acquisitions de données par l’entremise d’enquêtes ou d’autres sources et des nouvelles utilisations de données, comme le couplage de microdonnées. Son travail a récemment été élargi pour inclure des examens liés à l’apprentissage automatique et à l’intelligence artificielle. L’objectif de ces examens éthiques est d’assurer une utilisation responsable des données tout au long de leur cycle de vie. Le Secrétariat de l’éthique des données soulève des considérations éthiques, tient des discussions avec les gestionnaires de programme et formule des recommandations au dirigeant principal de l’éthique des données, de la qualité et de l’intégrité scientifique. Le Secrétariat à l’éthique des données appuie également le Comité interne d’éthique des données et joue un rôle de renforcement des capacités.
Progrès :
En plus d’avoir mené plus de 150 examens éthiques au cours de la dernière année seulement, les membres du Secrétariat de l’éthique des données ont fait de nombreuses présentations pour informer les partenaires internes et des collègues d’autres ministères fédéraux et d’organismes internationaux de l’approche de Statistique Canada en matière d’évaluation de l’éthique des données. L’équipe recueille des renseignements pour se tenir au courant des sujets qui pourraient être jugés délicats par le public. Pour ce faire, elle procède à des revues de la littérature sur certains sujets ciblés et à des discussions informelles avec des partenaires internes, comme les Communications et le Centre de ressources en conception de questionnaires, ainsi qu’avec des homologues d’autres ministères fédéraux ou de bureaux nationaux de la statistique à l’étranger.
Outre ses activités internes, l’équipe est très active à l’échelle internationale, jouant un rôle de chef de file au sein de l’équipe de travail de la Commission économique des Nations Unies pour l’Europe (CEE-ONU) sur le leadership éthique. Le principal objectif de cette équipe de travail est de rédiger un ouvrage de référence sur l’éthique destiné aux organismes nationaux de statistique. Les travaux sur cet ouvrage de référence ont été réalisés en 2025.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Ryan Chepita (ryan.chepita@statcan.gc.ca).
5.10 Secrétariat de la qualité
Le Secrétariat de la qualité a entre autres pour mandat de concevoir et de gérer des études liées à la gestion de la qualité et de répondre aux demandes de renseignements ou d’assistance en matière de gestion de la qualité provenant des divers programmes de Statistique Canada ou d’autres organismes.
PROJET : Renforcement des capacités avec des partenaires internes, nationaux et internationaux
Le Secrétariat de la qualité a pour objectif de donner des conseils et de prendre des mesures de renforcement des capacités à l’interne, avec des partenaires nationaux (d’autres ministères ou organismes) et internationaux, principalement en présentant un aperçu général des pratiques de gestion de la qualité de Statistique Canada et des documents officiels liés à la qualité (le Cadre d’assurance de la qualité et les Lignes directrices concernant la qualité) et en offrant des services de soutien en gestion de la qualité.
Progrès :
Le Secrétariat de la qualité a entrepris de renforcer les capacités de nombreux partenaires au cours de la période visée. À l’interne, divers cours ont été offerts au personnel. En ce qui concerne les partenaires nationaux, une présentation sur les pratiques de gestion de la qualité relativement au Modèle générique du processus de production statistique a été donnée au Centre de gouvernance de l’information des Premières Nations.
Des discussions ont eu lieu au sein du Groupe de travail sur la qualité des données de la Communauté de pratique sur les données ministérielles à l’échelle du gouvernement du Canada. Ce groupe de travail, coprésidé par Statistique Canada, a publié en janvier 2024 une version abrégée du cadre de la qualité des données, appelée « Orientation sur la qualité des données ». Depuis son relancement à l’automne 2024, ce groupe vise à cerner les lacunes dans la gouvernance en matière de qualité en effectuant une analyse de l’environnement sur des sujets comme les métadonnées, les données ouvertes et la production de rapports sur la qualité.
À l’échelle internationale, le Secrétariat à la qualité a rencontré le Centre de statistique d’Abu Dhabi pour lui fournir des conseils sur les tableaux de bord sur la qualité des données, tout en poursuivant son engagement auprès du groupe d’experts des Nations Unies sur les cadres nationaux d’assurance de la qualité. Statistique Canada a coprésidé le sous-groupe sur les sources de données administratives et d’autres sources de données, chargé de préparer un module d’assurance de la qualité lors de l’utilisation de sources de données administratives et d’autres sources de données pour produire des statistiques officielles. Ce module, publié au début de 2025, vise à fournir des orientations pratiques et concises ainsi que des pratiques exemplaires aux organismes statistiques, afin d’assurer la qualité des statistiques officielles quand d’autres sources de données sont utilisées pour la production de statistiques officielles. Il s’utilise en complément du Manuel des cadres nationaux d’assurance de la qualité des Nations Unies en statistique officielle (Nations Unies, 2019).
PROJET : Examens du programme triennal
Dans le cadre des examens triennaux des programmes de Statistique Canada, le Secrétariat de la qualité a conçu un questionnaire d’autoévaluation qui a été rempli par les sept programmes concernés par les examens de 2024-2025. Ce questionnaire a permis à chaque programme d’évaluer son degré de préparation en matière de qualité et ses pratiques exemplaires actuelles en ce qui concerne sa culture et les six dimensions de la qualité de Statistique Canada. Le Secrétariat de la qualité continuera de jouer un rôle clé dans ces examens à mesure que leur portée s’élargit en 2025-2026.
Pour obtenir plus de renseignements, veuillez
communiquer avec :
Ryan Chepita (ryan.chepita@statcan.gc.ca).
Bibliographie
Nations Unies (2019). United Nations National Quality Assurance Frameworks Manual for Official Statistics. Disponible à l’adresse : https://unstats.un.org/unsd/methodology/dataquality/un-nqaf-manual/.
- Date de modification :