Programme de recherche et développement en méthodologie : réalisations, 2023-2024
5. Soutien (centres de ressources)
5.1 Centre de recherche et d’analyse en séries chronologiques
L’objectif du Centre de recherche et d’analyse en séries chronologiques est de maintenir une expertise de haut niveau et d’offrir des services de consultation en matière de séries chronologiques dans l’ensemble de l’organisme. Le centre offre des services de consultation et des conseils sur les problèmes relatifs aux séries chronologiques, il étudie les problèmes pour lesquels il n’existe pas actuellement de solutions connues ou satisfaisantes, et il élabore et tient à jour des outils permettant d’appliquer des solutions à des problèmes réels de séries chronologiques.
Les projets peuvent être répartis en quatre sous-catégories, l’accent étant mis sur les thèmes suivants :
- consultation et formation sur les séries chronologiques;
- soutien et amélioration du système et des outils de traitement des séries chronologiques;
- modélisation et prévision des séries chronologiques;
- soutien méthodologique aux programmes d’indice des prix à la consommation et à la production.
Progrès :
Consultation et formation sur les séries chronologiques
Le Centre de recherche et d’analyse en séries chronologiques est chargé d’élaborer et de fournir une formation sur les méthodes en séries chronologiques, comprenant la désaisonnalisation, l’étalonnage, le rapprochement et la modélisation en séries chronologiques, à l’intention des participants de Statistique Canada et aussi d’autres organismes. De plus, le centre offre des conseils et des services de consultations sur des projets de séries chronologiques en général pour les programmes de l’ensemble de Statistique Canada.
Au cours de l’année, le centre a proposé des cours sur les composantes des séries chronologiques, la désaisonnalisation, le rapprochement, la modélisation et les prévisions aux participants internes et externes par l’entremise du Centre de formation de Statistique Canada (Statistique Canada, 2024). Dans le cadre de la formation pour les nouvelles recrues (série de séminaires de la Direction de la méthodologie pour les recrues et cours de navigation des données), les membres du centre ont également participé à des activités de sensibilisation et de formation auprès d’autres groupes de Statistique Canada sur des thèmes touchant les séries chronologiques et ils ont donné un cours d’introduction à R.
Le centre a également offert des services de consultation à plusieurs programmes internes (désaisonnalisation, modélisation de séries chronologiques, extrapolation rétrospective, prévisions immédiates, prévisions, estimation des tendances, calendarisation, etc.). En particulier, le centre a fourni un soutien en matière de séries chronologiques au Système de comptabilité nationale dans un certain nombre de domaines, notamment le produit intérieur brut mensuel, les transports et l’investissement en logement. En outre, des représentants du centre assistent périodiquement à un forum hebdomadaire d’analystes pour maintenir une présence au sein de la communauté des analystes. Le centre mène régulièrement des consultations sur l’extrapolation rétrospective afin de préserver ou de rétablir la comparabilité au fil du temps, et il a travaillé à la production de lignes directrices sur la continuité des séries chronologiques pour les programmes de Statistique Canada. Il s’agit d’une initiative conjointe avec le Système de comptabilité nationale, dont les récents travaux ont consisté à discuter des lignes directrices proposées avec notre Bureau de gestion des projets de l’organisme afin de déterminer la manière dont les lignes directrices pourraient être intégrées au cadre de gestion des projets.
De plus, afin de soutenir divers programmes internes, le centre a mené des consultations et des échanges avec de nombreux organismes publics fédéraux et provinciaux, ainsi qu’avec des organismes nationaux de statistique (Banque du Canada, Institut de la statistique du Québec, Bureau de la statistique de l’Australie, US Census Bureau, BMO, BC Stats) sur des thèmes liés aux séries chronologiques (stratégie de désaisonnalisation durant la pandémie, extrapolation rétrospective, déflation, outils logiciels, etc.).
Soutien et amélioration du système et des outils de traitement des séries chronologiques
Le Centre de recherche et d’analyse en séries chronologiques élabore et tient à jour un certain nombre d’outils importants utilisés pour traiter et analyser les données des séries chronologiques pour les programmes de Statistique Canada qui produisent des données désaisonnalisées, notamment : le système généralisé G-Séries, pour l’étalonnage et le ratissage, le rapprochement et l’équilibrage (Statistique Canada, 2016); le Système de traitement des séries chronologiques (Ferland, 2022); le tableau de bord de la désaisonnalisation (Verret, 2021).
Les travaux sur une version prototype de G-Séries dans R se sont poursuivis. Les fonctionnalités d’étalonnage et de ratissage ont été mises en œuvre, développées en regroupements et hébergées dans le GitLab interne de Statistique Canada à usage interne (regroupement de fonctions rgseriespt). La fonction d’équilibrage sera terminée d’ici l’automne 2024. Une fois le prototype terminé, il sera examiné en vue de sa diffusion officielle (à l’interne et à l’externe).
Le système de traitement des séries chronologiques est une application personnalisable qui repose sur SAS et qui permet d’appliquer des techniques de séries chronologiques, dont des techniques de désaisonnalisation, d’étalonnage et de rapprochement, largement utilisées dans la production d’estimations désaisonnalisées pour les sous-programmes annuels de Statistique Canada (essentiels à la mission dans de nombreux cas). Le système est dans un état mature et stable. Toutefois, il doit être constamment mis à jour afin d’élargir ses fonctionnalités et d’aborder les nouveaux besoins des programmes de l’organisme. Nous étudions une nouvelle version du système qui permettrait à plus long terme une plus grande flexibilité pour intégrer les outils et les nouvelles techniques disponibles à partir de logiciels libres, en particulier ceux de désaisonnalisation (regroupement de fonctions R fournissant une interface au logiciel X-13ARIMA-SEATS de l’US Census Bureau), PyX13 (US Census Bureau, version bêta), JDemetra+/RJDemetra (Eurostat) et rgseriespt (regroupement de fonctions R pour G-Séries). Des discussions concernant les systèmes de traitement des séries chronologiques ont eu lieu avec l’Institut national de la statistique et des études économiques (France), l’US Census Bureau et le Bureau de la statistique de l’Australie.
Un certain nombre d’améliorations ont été apportées au tableau de bord sur la désaisonnalisation cette année. En particulier, de nouvelles fonctionnalités visant à augmenter l’efficacité ont été ajoutées, la compatibilité avec différentes versions de R a été ajoutée et des bogues mineurs ont été résolus. Le tableau de bord est en voie d’être déployé pour un programme supplémentaire sur la main-d’œuvre. Une documentation complète a été produite.
Modélisation et prévision des séries chronologiques
L’augmentation de l’actualité des indicateurs statistiques est une priorité importante pour Statistique Canada, et l’une des options pour y arriver est de modéliser les séries chronologiques pour établir des prévisions immédiates des indicateurs économiques beaucoup plus tôt que le moment où le premier estimateur traditionnel est produit. Des travaux sur un projet de prévisions immédiates pour élaborer une méthode plus précise d’estimation des dépenses liées aux activités de rénovation (dans le cadre du programme mensuel d’investissement en construction de bâtiments, un indicateur économique clé qui quantifie l’état de l’investissement en construction de bâtiments dans l’économie) ont été présentés au Comité d’examen scientifique de la Direction des méthodes statistiques modernes et de la science des données (Patak et Plunkett, 2023). Des travaux sur la production d’indicateurs avancés concernant les statistiques de l’énergie et d’un cadre général pour les indicateurs avancés de la qualité ont été présentés à la 76e réunion du Comité consultatif sur les méthodes statistiques de Statistique Canada (Le Moullec et Matthews, 2023; Matthews, 2022). Une séance sur invitation sur le thème de l’estimation en temps réel a été organisée au Congrès mondial de la statistique de l’Institut international de la statistique en juillet 2023.
Le Centre a poursuivi son étude des moyens de produire des indications précoces de ruptures structurelles au moyen de modèles espace-état.
Soutien méthodologique aux programmes d’indice des prix à la consommation et à la production.
Le Centre de recherche et d’analyse des séries chronologiques possède aussi une sous-section chargée de fournir un soutien méthodologique aux programmes d’indice des prix à la consommation et à la production (IPC et IPP).
Au cours des dernières années, l’indice des prix à la consommation a fait l’objet de nombreux changements concernant la collecte et la méthodologie dans le but de moderniser les pratiques et de s’adapter à l’évolution des conditions depuis la pandémie de COVID-19. La collecte classique en personne a été remplacée par une combinaison de collecte en ligne et de données d’autres sources, notamment des données de lecteurs optiques aux points de vente, des bases de données administratives, le moissonnage du Web et d’autres enquêtes. Les pondérations du panier proviennent maintenant de la série sur les dépenses de consommation finale des ménages plutôt que de l’Enquête sur les dépenses des ménages, afin de permettre des mises à jour plus fréquentes et actuelles du panier. Des couplages d’enregistrements ont créé une base de sondage partielle de l’IPC liant les entreprises aux ventes au niveau des produits pour certains agrégats de l’IPC. Le centre a examiné la méthodologie d’échantillonnage de l’IPC dans le contexte de ces changements. Plusieurs améliorations possibles ont été proposées, notamment la mise à jour de la répartition d’échantillons, le renouvellement de l’échantillon, l’échantillonnage probabiliste pour certains agrégats, et l’utilisation d’indicateurs de qualité adaptés à des caractéristiques uniques de l’IPC (Francis, 2023). Des méthodes fondées sur le plan et fondées sur un modèle pour l’estimation de la variance ont été étudiées. Le centre a également élaboré une stratégie et un outil dans R pouvant servir à évaluer l’échantillon des différentes composantes de l’IPC. La méthode a été appliquée à la composante habillement et chaussures cette année et des améliorations ont été proposées.
De nombreux indices des prix à la production pour les services (IPPS) utilisent l’échantillonnage probabiliste des entreprises au premier degré. La plupart utilisent un échantillonnage de Poisson séquentiel avec probabilité proportionnelle à la taille (Ohlsson, 1998), stratifié par groupes d’industries. Les plans d’échantillonnage précédents attribuaient l’échantillon aux groupes d’industrie par des méthodes plus simples, comme la répartition proportionnelle au revenu ou à la taille, en l’absence de bonnes estimations de la variance. Chaque échantillon de l’IPPS a été conçu de façon indépendante avec des budgets, des tailles d’échantillon et une précision très variables. Ce projet a permis d’étudier l’optimisation de l’utilisation des ressources afin d’assurer une qualité uniforme dans l’ensemble des IPPS et de conserver le budget dans la mesure du possible. On a utilisé le bootstrap généralisé de Beaumont-Patak (Beaumont et Patak, 2012) et la linéarisation en séries de Taylor pour estimer les variances dues au premier degré pour les indices de prix de Lowe avec des échantillons de Poisson séquentiels avec probabilité proportionnelle à la taille. Des ajustements ont été apportés pour tenir compte de caractéristiques propres aux indices de prix, à savoir la non-réponse périodique, l’imputation parentale, la pondération mise à jour en fonction des prix, l’enchaînement et la non-unicité (Francis, 2024). Des fonctions R ont été développées. À partir de ces estimations de la variance, on a estimé des tailles d’échantillon pour atteindre les cibles de coefficient de variation pour les niveaux les plus bas publiés. Les résultats ont été mis à l’essai pour une grande enquête (Indice des prix des services du commerce de gros) ainsi qu’une petite enquête (Indice des prix des services d’architecture, de génie et de services connexes) et présentés à la Division des prix à la production.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Etienne Rassart (etienne.rassart@statcan.gc.ca).
Bibliographie
Beaumont, J.-F., et Patak, Z. (2012). On the generalized bootstrap for sample surveys with special attention to Poisson sampling. Revue Internationale de Statistique, 80, 127-148.
Ferland, M. (2022). Time Series Processing System – v3.08. Document interne, Statistique Canada.
Francis, J. (2023). Canadian CPI Sample Design Methodology Review. Document interne, Statistique Canada.
Francis, J. (2024). Design-Based Estimates and Variance Estimation for SPPIs with Sequential Poisson PPS Samples. Document interne, Statistique Canada.
Le Moullec, J., et Matthews, S. (2023). On the Path to Real-Time Economic Indicators: A use case in producing model-based flash estimates for monthly electricity generation: Simpler is better! Présenté à la 76e réunion du Comité consultative des méthodes statistiques, Statistique Canada.
Matthews, S. (2022). A framework for Advance Indicators at Statistics Canada. Document interne, Statistique Canada.
Ohlsson, E. (1998). Sequential Poisson sampling. Journal of Official Statistics, 14, 149-162.
Patak, Z., et Plunkett, K. (2023). Nowcasting monthly renovation activity expenditures. Présenté lors de la réunion du 28 avril du Scientific Review Committee of the Modern Statistical Methods and Data Science Branch. Document interne, Statistique Canada.
Statistique Canada (2016). G-Series 2.00.001 User Guides. Document interne, Statistique Canada.
Statistique Canada (2024). Ateliers, formation et conférences. Disponible à l’adresse : https://www.statcan.gc.ca/fr/afc/formation.
Verret, F. (2021). Le tableau de bord de la désaisonnalisation de Statistique Canada. Recueil : Symposium 2021, Adopter la science des données en statistique officielle pour répondre aux besoins émergents de la société, Statistique Canada, Ottawa, Canada.
5.2 Systèmes généralisés pour les statistiques économiques
L’équipe des systèmes généralisés pour les statistiques économiques est responsable du soutien et du développement de trois systèmes généralisés : G-Sam, le système généralisé d’échantillonnage; BANFF, le système généralisé de vérification et d’imputation; et G-Est, le système généralisé d’estimation.
Progrès :
Un volume habituel de cas de soutien a été traité par l’équipe de projet pour G-Sam, BANFF et G-Est. La plupart des cas ont été réglés au moyen de suggestions sur la façon d’appliquer les systèmes en termes pratiques, mais plusieurs cas ont nécessité une intervention plus poussée. Plus particulièrement, l’équipe de BANFF a réalisé un examen approfondi du processus de vérification et d’imputation pour l’Enquête sur les postes vacants et les salaires. L’équipe de BANFF a proposé des mises à jour du plan du processus d’enchaînement des opérations et continuera de collaborer avec l’équipe d’enquête pour mettre en œuvre et mettre à l’essai ces modifications. Par ailleurs, l’équipe de G‑Sam a collaboré avec des méthodologistes travaillant sur l’Enquête canadienne sur le commerce interprovincial et l’Enquête canadienne sur la situation des entreprises afin d’optimiser la répartition par rapport aux cibles de précision des erreurs-types pour des estimations de proportions. Ce cas de soutien comportait de vastes consultations avec les clients, l’examen de la théorie pertinente et l’élaboration de plusieurs exemples de programmes.
L’équipe des systèmes généralisés a participé activement à plusieurs activités liées à l’initiative de diversification analytique de Statistique Canada, une initiative de transition des systèmes vers des solutions de rechange libres. Un membre de l’équipe a participé activement au groupe de travail de l’initiative et a présenté le sujet de discussion à la 77e réunion du Comité consultatif sur les méthodes statistiques (Gray, 2023). Tout au long de l’année, la sous-section a informé le Comité directeur des systèmes généralisés de l’avancement et des plans de diversification pour G‑Sam, BANFF et G‑Est. De plus, les membres de l’équipe ont rencontré, à l’occasion, des représentants d’organismes nationaux de statistique étrangers pour discuter de la diversification analytique, notamment l’Institut national de la statistique et des études économiques (France) pour discuter de sa propre migration de SAS à R et avec le Bureau de la statistique de l’Australie pour faire la lumière sur l’expérience de Statistique Canada à ce jour.
La version 1.04 de G-Sam est sortie le 9 novembre 2023 et comportait plusieurs modifications importantes du module de répartition. Ces modifications comprenaient : l’introduction de contraintes probabilistes spécifiées par l’utilisateur sur la taille de l’échantillon et le nombre de répondants pour des domaines arbitraires; de meilleures approximations de la variance qui sont appropriées aux solveurs d’optimisation; et un nouveau fichier de sortie de diagnostic. Les calculs sous-jacents sont donnés dans les manuels de l’utilisateur de G-Sam (Stinner, 2024). L’équipe de G‑Sam a l’intention de présenter la méthode lors d’une conférence (ou d’un événement similaire) quand la version R de G‑Sam sortira l’année prochaine. La version 1.04 de G-Sam est la version SAS finale.
Des progrès importants ont été réalisés dans le cadre du projet de modernisation de BANFF, et une version de Python devrait sortir en décembre 2024. Plusieurs modifications structurelles proposées par (Gray, 2022) doivent être mises en œuvre dans la version publiée, notamment de nouveaux contrôles de processus, des blocs de traitement et des modules d’extension Python personnalisés. Ces améliorations harmonisent le système avec le Modèle général d’édition des données statistiques (CEE-ONU, 2019), et l’équipe de BANFF a été invitée à faire une présentation principale sur le nouveau système à la prochaine réunion d’experts de la Commission économique des Nations Unies pour l’Europe sur la vérification de données statistiques (octobre 2024).
Des prototypes de versions libres de G-Sam et de G-Est sont en cours d’élaboration. Pour chaque système, l’équipe a évalué des options pour adopter des progiciels libres disponibles qui remplissent des fonctions particulières (par exemple stratification, calage), mais elle a constaté que ces progiciels ne répondaient pas aux normes de rendement pour la production. Des plans de diversification pour les deux systèmes ont été présentés au Comité directeur des systèmes généralisés.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Etienne Rassart (etienne.rassart@statcan.gc.ca).
Bibliographie
Gray, D. (2022). Banff’s Next Step: An Open-Source Data Editing System for Advanced Tools and Collaboration. UNECE Expert Meeting on Statistical Data Editing.
Gray, D. (2023). Statistics Canada’s Analytical Diversification Initiative – impact on Statistical Generalized Systems. Présenté à la 77e réunion du Comité consultative des méthodes statistiques, Statistique Canada.
Stinner, M. (2024). G-Sam user guide (ébauche). Document interne, Statistique Canada.
UNECE (2019). Generic Statistical Data Editing Model. Disponible à l’adresse : https://statswiki.unece.org/display/sde/GSDEM.
5.3 Centre de ressources en couplage d’enregistrements
Les objectifs du Centre de ressources sur le couplage d’enregistrements (CRCE) sont d’offrir des services de consultation aux utilisateurs internes et externes des méthodes de couplage d’enregistrements, ce qui comprend la formulation de recommandations sur les logiciels et les méthodes à utiliser, et le travail de collaboration sur les applications de couplage d’enregistrements. Nous facilitons également la diffusion d’information sur les méthodes, les logiciels et les politiques de couplage d’enregistrements, ainsi que sur l’analyse de données couplées aux parties intéressées à l’intérieur et à l’extérieur de Statistique Canada.
Progrès :
Nous avons offert du soutien à l’équipe de développement de G-coup, le système de couplage d’enregistrements mis au point à Statistique Canada, et participer aux réunions du Groupe de travail sur le couplage d’enregistrements de la Division de la gestion du cycle de vie des solutions de la technologie de l’information (DGCSTI) et de la Division des méthodes d’intégration statistique (DMIS). L’équipe du CRCE a rencontré les représentants de la DGCSTI toutes les deux semaines et a fait le suivi des procès-verbaux mentionnant les sources possibles, passées ou présentes, de corrections, de bogues ou d’améliorations pour G-coup. Le CRCE a également offert un soutien aux utilisateurs internes et externes de G-coup qui ont demandé de l’aide, fourni des commentaires ou soumis des suggestions au moyen de requêtes à G-coup_info.
Au cours de l’année, l’essentiel des travaux méthodologiques a porté sur la maintenance, le développement et l’accompagnement des utilisateurs de la version 3.5 de G-coup sur les serveurs SAS en environnement infonuagique. Un volume typique de cas d’assistance pour G-coup a été traité par l’équipe de projet. La plupart d’entre eux ont été résolus par des suggestions sur la manière d’appliquer le système en termes pratiques, mais plusieurs ont nécessité une plus grande participation.
Le développement a consisté à normaliser et à intégrer des procédures de revue manuelle pour l’estimation des erreurs de couplage d’enregistrements et à élaborer des indicateurs de qualité tels que la spécificité et la sensibilité, ainsi qu’à s’assurer que l’interface utilisateur rendait les résultats faciles à interpréter.
Le CRCE a également travaillé sur divers autres couplages probabilistes dans l’Environnement de couplage des données sociales ECDS. Ces couplages nous ont aidé à analyser les performances du logiciel et les solutions à apporter. Les travaux sur ces projets ont donné lieu à des approches plus systématiques pour définir et ajuster les couplages d’enregistrements sur les serveurs SAS basés sur l’infonuagique. Des travaux ont également été entrepris sur la repondération pour compenser le biais introduit par les liens manqués, y compris des méthodes expérimentales pour créer des poids répétés dans le cas d’un couplage entre deux échantillons tirés de manière indépendante. Les membres de l’unité ont également effectué d’autres travaux théoriques et prototypes sur les indicateurs de qualité pour des modèles ajustés à des données couplées.
Les membres de l’équipe ont offert des cours formels avec le Centre de formation de Statistique Canada, ainsi que des séminaires pour les statisticiens récemment recrutés, un forum sur le couplage d’enregistrements et d’autres présentations spéciales aux analystes.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Abdelnasser Saïdi (abdelnasser.saidi@statcan.gc.ca).
5.4 Centre de ressources en analyse de données
Le Centre de ressources en analyse de données (CRAD) a pour objectif premier de fournir des conseils sur le bon usage des outils et des méthodes d’analyse de données et de promouvoir l’adoption de pratiques exemplaires dans ce domaine. Les services du CRAD, axés principalement sur les données d’enquête, les données de recensement et les données administratives, sont offerts aux employés de Statistique Canada et à ceux d’autres ministères, ainsi qu’aux analystes et aux chercheurs du milieu universitaire et des centres de données de recherche (CDR).
Progrès :
Consultations
Des services de consultation ont été offerts à la demande de clients internes et externes. Entre le 1er avril 2023 et le 31 mars 2024, le CRAD a répondu à 37 demandes. La complexité des questions était variable et elles portaient sur des sujets comme l’analyse d’échelles de Likert, l’interprétation de résultats de régression, la comparaison de médianes, la régression logistique, les quartiles et les estimations de ratios avec des données d’enquête, la spécification de degrés de liberté, et la comparaison de plusieurs cycles d’une enquête. Le CRAD a également aidé les clients à mettre en œuvre des méthodes dans les logiciels SUDAAN, SAS, STATA et R.
Services de formation
Le CRAD a remanié et présenté, en français, le cours interne 0438A « Analyse statistique des données d’enquête – Module 1 ». Un code R a été élaboré pour les exercices et les exemples, en plus du code SUDAAN et du code SAS. Ce cours de six jours mêle théorie et pratique.
Le CRAD a fait une présentation sur l’analyse de données avec des données d’enquête complexes, en français et en anglais, lors de l’Atelier d’interprétation de données organisé par Statistique Canada. Le centre a présenté de nouveau les séances sur la régression linéaire et sur la régression logistique, avec des données d’enquête complexes, dans le cadre du cours sur la modélisation statistique à Statistique Canada, en français. Le CRAD a également organisé un séminaire pour les recrues sur l’analyse des données d’une enquête complexe.
Collaboration
Le CRAD a collaboré avec le Secrétariat du Conseil du Trésor (SCT) à l’élaboration de stratégies de mesure pour le projet de mesure du rendement en santé mentale en milieu de travail. Pour ce projet, les données recueillies dans le cadre du Sondage auprès des fonctionnaires fédéraux (SAFF) de 2022 ont été utilisées pour mesurer des variables latentes comme les facteurs de risque psychologiques, les comportements, etc. et pour calculer les scores factoriels pour différents niveaux d’agrégation. Les scores factoriels établis pour le projet ont servi à créer le tableau de bord de la santé mentale en milieu de travail dans la fonction publique fédérale : Tableau de bord de la santé mentale – Canada.ca (tbs-sct.gc.ca). Les modèles de mesure ont été élaborés au moyen de l’analyse factorielle et de la modélisation par équations structurelles, comme l’ont expliqué Blais, Mach, Michaud et Simard (2020), et Blais, Michaud, Simard, Mach et Houle (2021).
Pour obtenir plus de renseignements, veuillez communiquer avec :
Fritz Pierre (fritz.pierre@statcan.gc.ca) ou
Isabelle Michaud (isabelle.michaud@statcan.gc.ca).
Bibliographie
Blais, A.-R., Mach, L., Michaud, I. et Simard, J.-F. (2020). Analysis of the Public Service Employee Survey Items as Measures of the Psychosocial Risk Factors. Présentation au Workplace Mental Health Performance Measurement Steering Committee, 7 octobre 2020.
Blais, A.-R., Michaud, I., Simard, J.-F., Mach, L. et Houle, S. (2021). Mesurer les facteurs psychosociaux en milieu de travail au sein du gouvernement fédéral. Rapport sur la santé, 32, 12. Article accessible à l’adresse https://www150.statcan.gc.ca/n1/fr/pub/82-003-x/2021012/article/00001-fra.pdf.
5.5 Centre de ressources pour la confidentialité et l’accès aux données
Le groupe de méthodologie responsable de la confidentialité et des méthodes d’accès a continué d’offrir des services de consultation et de soutien aux partenaires internes et externes en ce qui concerne les diverses solutions d’accès et de stratégies de prévention de la divulgation.
Dépersonnalisation
Le groupe de soutien à la confidentialité a continué d’offrir son expertise dans la compréhension et le développement d’idées liées à la dépersonnalisation et à l’anonymisation. Statistique Canada continue d’améliorer ses propres stratégies internes pour s’assurer que les renseignements internes sont dépersonnalisés dans la mesure du possible afin de réduire le plus possible les risques de divulgation.
Consultations externes
Statistique Canada a offert son expertise à plusieurs groupes au pays et à l’étranger. À l’échelle internationale, Statistique Canada a partagé son outil d’ajustement tabulaire aléatoire avec Statistique Suède et le National Agricultural Statistics Service aux États-Unis. L’équipe a également consulté des groupes externes, notamment IBM et Gurobi, afin de trouver des solutions de rechange appropriées à l’utilisation d’OPTMODEL de SAS dans ses stratégies de suppression de cellules complémentaires. Le groupe sur la confidentialité a également travaillé en étroite collaboration avec ses collègues de la santé à l’élaboration de nouvelles méthodes de communication de données sur le cancer avec des homologues internationaux.
Au Canada, Statistique Canada a tenu plusieurs réunions avec la Banque du Canada pour donner des conseils sur ses stratégies de contrôle de la divulgation, l’Agence du revenu du Canada pour discuter des risques de réidentification, et l’Agence de la santé publique du Canada pour discuter des données synthétiques.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Steven Thomas (steven.thomas@statcan.gc.ca).
5.6 Activités de soutien et de recherche à la Division de la science des données et de l’innovation
Le Programme de recherche et développement en méthodologie (PRDM) de Statistique Canada a appuyé de nombreuses activités pour la Division de la science des données et de l’innovation. Le soutien du PRDM a permis la prestation de nombreux services, une communauté de pratique, des recherches plus poussées, un centre d’expertise et des lignes directrices qui peuvent profiter à l’organisme.
Activités, mandats et produits
Le financement a permis à la communauté de pratique de l’apprentissage automatique de remplir son mandat consistant à accroître les connaissances et renforcer les capacités à l’échelle de Statistique Canada en matière d’apprentissage automatique. Les activités liées à la communauté de pratique sont très variées : organisation de séminaires techniques hebdomadaires sur l’apprentissage automatique, diffusion de bulletins et de balados hebdomadaires, défis de codage et « heures de bureau porte ouverte » hebdomadaires. Un autre centre a bénéficié du financement : le Centre d’expertise du traitement du langage naturel (TLN), qui a pour mandat de centraliser les ressources pour le partage de connaissances et le renforcement des capacités en analyse de textes au moyen de l’apprentissage automatique et de créer, tenir à jour et promouvoir des pratiques exemplaires et des lignes directrices en matière d’analyse de textes. Les activités du centre consistent à procéder à des examens, à fournir des services de consultations et de l’orientation aux spécialistes du TLN au sein de Statistique Canada, ainsi qu’à créer la liste des projets de TLN réalisés et en cours au sein de l’organisme.
Outre les communautés et les centres, on a élaboré des lignes directrices sur l’apprentissage automatique qui forment un document pérenne à l’intention des spécialistes. Ces lignes directrices portent sur l’intelligence artificielle (IA) et l’apprentissage automatique responsables, l’IA explicable, et l’équité dans l’apprentissage automatique.
Enfin, deux projets de recherche de premier plan ont été soutenus en vue d’approfondir les expérimentations, car leurs résultats étaient prometteurs pour l’organisme. Le premier traite de la production de données synthétiques dans le domaine de la santé : il évalue l’innocuité et l’efficacité des méthodes de production de données synthétiques sur les soins de santé, en s’intéressant particulièrement à l’équilibre entre utilité et confidentialité. Ce projet s’inscrit dans la ligne des initiatives de l’Institut canadien de recherches avancées et vise à moderniser le partage des données et la prise de décisions dans le secteur des soins de santé. Un atelier sur le projet se tiendra prochainement.
Le deuxième projet de recherche prometteur financé par le comité est une recherche visant à améliorer l’efficacité du prétraitement des microdonnées dans les données d’enquête à Statistique Canada. Le projet s’intéresse à la robustesse du prétraitement des données pour les tâches complexes et aux performances d’une méthode d’imputation dans différentes conditions. Cette recherche est conçue pour optimiser l’actualité et réduire les efforts manuels dans le cadre de l’Enquête mensuelle sur l’approvisionnement et l’écoulement de l’électricité (voir aussi le projet « Optimisation du temps et des efforts dans le traitement des données » à la section 2).
Pour obtenir plus de renseignements, veuillez communiquer avec :
Marie-Eve Bedard (marie-eve.bedard@statcan.gc.ca).
5.7 Centre de ressources en conception de questionnaires
Le Centre de ressources en conception de questionnaires (CRCQ) est le centre d’expertise de Statistique Canada en matière de conception et d’évaluation de questionnaires. Le CRCQ offre des services de consultation et de soutien et mène des recherches et des projets relatifs à l’élaboration, à la mise à l’essai et à l’évaluation de questionnaires d’enquête. Il joue un rôle très important dans la gestion de la qualité et il répond aux exigences de l’ensemble des programmes de Statistique Canada en consultant les clients, les répondants et les utilisateurs de données et en procédant à l’essai préliminaire des questionnaires d’enquête.
Bien qu’une grande partie du travail du Centre de ressources en conception de questionnaires soit effectuée selon le principe du recouvrement des coûts, la section est fréquemment sollicitée, de manière ponctuelle, pour effectuer des évaluations d’expert et offrir des services de consultation relativement à un large éventail d’enquêtes. Le groupe offre aussi des cours sur la conception de questionnaires.
Progrès :
Le Centre de ressources en conception de questionnaires a effectué de nombreux examens de questionnaires d’enquête. Bien que la plupart de ces examens portaient sur des questionnaires de Statistique Canada, plusieurs ont été effectués pour des enquêtes menées par d’autres organismes gouvernementaux, comme Transports Canada, Services publics et Approvisionnement Canada et d’autres.
Le groupe a également contribué à diverses initiatives de consultation de Statistique Canada.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Paul Kelly (paul.kelly@statcan.gc.ca).
5.8 Centre de ressources en assurance de la qualité
Le Centre de ressources en assurance de la qualité (CRAQ) a pour mission de faire progresser la recherche et le développement dans les méthodes statistiques visant à améliorer les processus d’assurance et de contrôle de la qualité. Notre principal objectif est d’élever les normes des opérations de collecte et de traitement des données d’enquête au sein de l’organisme. Pour atteindre cet objectif, il faut étudier des méthodologies diverses, en mettant particulièrement l’accent sur l’amélioration de la qualité des données sortantes.
Au cœur de nos efforts se trouve la prestation de services méthodologiques pour G-Code, un système généralisé mis au point à Statistique Canada pour la création de bases de données codées et la mise en œuvre d’algorithmes d’apprentissage automatique dans le traitement des données. Nos recherches portent sur un large éventail de pratiques d’assurance et de contrôle de la qualité pour lesquelles nous devons résoudre des questions d’efficacité et d’automatisation. Les résultats de nos recherches sont pertinents non seulement pour nos opérations, mais aussi par leur grande applicabilité à différentes étapes des opérations d’enquête.
Progrès :
L’équipe de soutien méthodologique a aidé l’équipe de développement de G-Code et a fait le suivi des commentaires des utilisateurs pour cibler des possibilités d’amélioration de G-Code. De plus, le CRAQ a apporté son soutien aux utilisateurs internes et externes de G-Code chaque fois que de l’aide, des commentaires ou des suggestions concernant G-Code étaient nécessaires.
Tout au long de l’année, le CRAQ a concentré ses efforts sur l’élaboration d’une nouvelle méthodologie appelée « Contrôle de la qualité par score » afin d’améliorer le contrôle de la qualité (CQ) des processus de codage de texte de l’apprentissage automatique (AA). Comme la technologie d’AA joue un rôle de plus en plus essentiel, il est primordial d’assurer la qualité des codes générés. Pour répondre à cette nécessité, Statistique Canada cherche activement à élaborer une stratégie pour déterminer les taux d’échantillonnage optimaux aux fins de CQ en utilisant des scores tirés du processus d’apprentissage automatique. Cette méthodologie permettra une méthode responsable de classification des données avec une mise en œuvre plus grande de l’apprentissage automatique. Notre objectif est d’utiliser cette méthode à des fins de CQ pour plusieurs classifications à l’intérieur d’enquêtes essentielles comme l’Enquête sur la population active (EPA), l’Enquête sur les postes vacants et les salaires (EPVS), l’Enquête sur la santé dans les collectivités canadiennes (ESCC) et le Registre statistique des entreprises (RSE). Un article décrivant en détail la méthodologie a notamment été présenté au Comité consultatif sur les méthodes statistiques (Oyarzun, Wile et Evans, 2023).
L’équipe du CRAQ a également étudié une méthodologie de calage visant à établir une relation plus cohérente entre les scores d’apprentissage automatique et l’exactitude des données codées. Dans ce contexte, le calage consiste à affiner le modèle d’apprentissage automatique afin d’aligner son système de notation avec l’exactitude réelle des données codées. En affinant cette relation, nous cherchons à améliorer la fiabilité et la précision du processus de classification, ce qui, en fin de compte, améliorera les mesures globales d’assurance de la qualité dans nos opérations de traitement des données. Cette méthodologie de calage représente une étape cruciale vers l’optimisation du rendement des algorithmes d’apprentissage automatique dans les tâches de codage, puisqu’elle assure une correspondance étroite entre les sorties et les classifications souhaitées et qu’elle renforce la confiance dans les données finales.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Javier Oyarzun (javier.oyarzun@statcan.gc.ca).
Bibliographie
Oyarzun, J., Wile, L. et Evans, J. (2023). Quality Control by Score. Document présenté au Comité consultative sur les méthodes statistiques, octobre 2023, Statistique Canada.
5.9 Secrétariat de l’éthique des données
Le Secrétariat de l’éthique des données a pour rôle de mettre en œuvre le Cadre de nécessité et de proportionnalité. Concrètement, le Secrétariat de l’éthique des données effectue des examens éthiques des nouvelles acquisitions de données par l’entremise d’enquêtes ou d’autres sources, et des nouvelles utilisations de données, comme le couplage de microdonnées. Ces examens éthiques ont pour objectif de garantir une utilisation responsable des données tout au long de leur cycle de vie. Le Secrétariat de l’éthique des données soulève des considérations éthiques, tient des discussions avec les gestionnaires de programme et formule des recommandations à l’agent principal de l’éthique des données et de l’intégrité scientifique. Le Secrétariat de l’éthique des données appuie également le comité interne d’éthique des données et joue un rôle de renforcement des capacités.
Progrès :
En plus d’avoir effectué environ 180 examens éthiques, les membres du Secrétariat de l’éthique des données ont donné de nombreuses présentations pour informer les partenaires internes et les collègues d’autres ministères fédéraux et d’organismes internationaux sur l’approche de Statistique Canada en matière d’éthique des données. L’équipe recueille des renseignements pour être à jour à propos de sujets jugés délicats par le public. Pour ce faire, elle procède à une revue de la littérature sur certains sujets ciblés, à des discussions informelles avec des partenaires internes, comme les Communications et le Centre de ressources en conception de questionnaires, ainsi qu’avec des homologues d’autres ministères fédéraux ou de bureaux nationaux de la statistique à l’étranger.
Outre ses activités internes, l’équipe est très active à l’échelle internationale, jouant un rôle de chef de file au sein de l’équipe de travail de la CEE-ONU sur le leadership éthique. Le principal objectif de l’équipe de travail est de rédiger un ouvrage de référence sur l’éthique destiné aux organismes nationaux de statistique. Les travaux sur cet ouvrage de référence ont considérablement avancé en mars 2024 lors de l’atelier sur l’éthique dans les organismes statistiques modernes, où des séances de discussion sur chaque section du manuel de référence ont été organisées. L’ouvrage de référence devrait être terminé en 2025.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Martin Beaulieu (martin-j.beaulieu@statcan.gc.ca).
5.10 Secrétariat de la qualité
Le Secrétariat de la qualité a entre autres pour mandat de concevoir et de gérer des études liées à la gestion de la qualité et de répondre aux demandes de renseignements ou d’assistance en matière de gestion de la qualité provenant des divers programmes de Statistique Canada ou d’autres organismes.
PROJET : Renforcement des capacités avec des partenaires internes, nationaux et internationaux
Le Secrétariat de la qualité a pour objectif de donner des conseils et de prendre des mesures de renforcement des capacités à l’interne, avec des partenaires nationaux (d’autres ministères ou organismes) et avec des partenaires internationaux, principalement en présentant un aperçu général des pratiques de gestion de la qualité de Statistique Canada et des documents officiels liés à la qualité (le Cadre d’assurance de la qualité et les Lignes directrices concernant la qualité) et en offrant des services de soutien en gestion de la qualité.
Progrès :
Le Secrétariat de la qualité a entrepris de renforcer les capacités de nombreux partenaires au cours de la période visée. À l’interne, divers cours ont été offerts au personnel. En ce qui a trait aux partenaires nationaux, le Secrétariat a présenté des exposés officiels sur les pratiques de gestion de la qualité à deux organismes, en plus de tenir un certain nombre d’ateliers et de séminaires. Le Secrétariat de la qualité a collaboré, par l’entremise de l’Initiative de formation en littératie des données de Statistique Canada, à l’élaboration d’un module de formation en ligne intitulé Adéquation de la qualité des données à l’utilisation prévue. Ce cours présente un cadre clair et facile à utiliser pour aider les apprenants et apprenantes à définir leurs besoins en données, à évaluer la pertinence des sources de données potentielles selon la finalité prévue, et à décider si une source de données potentielle est en fait adaptée à l’utilisation prévue.
Des discussions ont eu lieu au sein du Groupe de travail sur la qualité des données de la Communauté de pratique sur les données ministérielles à l’échelle du gouvernement du Canada. Ce groupe de travail, coprésidé par Statistique Canada, a pour mandat, dans le cadre de la mise en œuvre de la Stratégie de données, de définir un cadre de qualité des données applicable à tous les organismes du gouvernement du Canada. Une ébauche du Cadre de la qualité des données est mise à la disposition des partenaires d’autres ministères fédéraux, et une version abrégée du cadre, appelée Orientation sur la qualité des données, a été approuvée et mise à la disposition du public en janvier 2024.
À l’échelle internationale, notre participation au Groupe d’experts des Nations Unies des cadres nationaux d’assurance de la qualité s’est accrue, puisque nous assumons le rôle de coprésident du sous-groupe sur les sources de données administratives et autres. Le but du sous-groupe est de préparer un module d’assurance de la qualité en cas d’utilisation de sources de données administratives et autres pour produire des statistiques officielles. Ce module vise à fournir des orientations pratiques et concises ainsi que des pratiques exemplaires aux organismes statistiques afin d’assurer la qualité des statistiques officielles quand des sources de données administratives, d’autres sources de données ou de multiples sources de données sont utilisées pour la production de statistiques officielles. Il s’utilise en complément du Manuel des cadres nationaux d’assurance de la qualité des Nations Unies en statistique officielle (Nations Unies, 2019). Le module fera l’objet d’une consultation mondiale au printemps 2024 et sera soumis à l’approbation de la Commission de statistique des Nations Unies vers la fin de 2024.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Martin Beaulieu (martin-j.beaulieu@statcan.gc.ca).
Bibliographie
Nations Unies (2019). United Nations National Quality Assurance Frameworks Manual for Official Statistics. Disponible à l’adresse : https://unstats.un.org/unsd/methodology/dataquality/un-nqaf-manual/.
PROJET : Indicateurs de qualité pour les statistiques tirées de données intégrées
Afin de fournir aux utilisateurs des indicateurs de qualité pour les programmes combinant des sources de données administratives, le Secrétariat de la qualité a travaillé à l’élaboration d’un indicateur composite qui combine des indicateurs de qualité liés à différentes étapes du traitement des données (couplage d’enregistrements, imputation, géocodage, etc.) en un seul indicateur. L’objectif est de donner un aperçu global de la qualité d’une estimation en tenant compte de plusieurs facteurs qui peuvent introduire des erreurs (Gagnon, Qian, Yeung, Lebrasseur et Beaulieu, 2022).
Progrès :
Ces indicateurs ont été utilisés pour d’autres tableaux du Programme de la statistique du logement canadien (PSLC). Le Secrétariat de la qualité continue de fournir un soutien sur le code et la méthode. Certaines solutions ont été étudiées en collaboration avec l’équipe du PSLC afin d’améliorer la méthode et la cohérence des résultats.
Pour obtenir plus de renseignements, veuillez communiquer avec :
Martin Beaulieu (martin-j.beaulieu@statcan.gc.ca).
Bibliographie
Gagnon, R., Qian, W., Yeung, A., Lebrasseur, D. et Beaulieu, M. (2022). Développement d’un indicateur composite de qualité pour les produits statistiques dérivés de sources administratives. Statistique Canada, disponible à l’adresse : https://www150.statcan.gc.ca/n1/pub/46-28-0001/2022001/article/00001-fra.htm.
PROJET : Mise à jour du Cadre d’assurance de la qualité
Le Secrétariat de la qualité a entrepris un examen du Cadre d’assurance de la qualité (CAQ) de Statistique Canada. La version actuelle a été publiée en 2017. Bien que le contenu de la version actuelle soit toujours valide, l’évolution rapide des nouvelles sources de données et des nouvelles techniques utilisées dans la production de statistiques officielles a rendu cet examen pertinent. La version mise à jour soulignera l’importance de l’intendance des données, des principes d’éthique des données et de certaines considérations relatives aux nouvelles techniques utilisées. Le plan de mise à jour a été présenté au Comité consultatif sur les méthodes statistiques à l’automne 2022 (Beaulieu, Yung et Rancourt, 2022).
Pour obtenir plus de renseignements, veuillez communiquer avec :
Martin Beaulieu (martin-j.beaulieu@statcan.gc.ca).
Bibliographie
Beaulieu, M., Yung, W. et Rancourt, E. (2022). Data Quality and Official Statistics in a Modern World. Document présenté au Comité consultatif sur les méthodes statistiques, octobre 2022, Statistique Canada.
- Date de modification :