Aide à l'ordre
entrées

Résultats

Tout (10)

Tout (10) ((10 results))

  • Articles et rapports : 12-001-X202600100002
    Description : Habituellement, il manque des valeurs dans les données d’enquête en raison de la non-réponse totale et partielle. Parfois, les organismes d’enquête connaissent les distributions marginales de certaines variables catégoriques dans la population visée. Comme l’ont démontré des travaux antérieurs, les organismes d’enquête peuvent tirer profit de ces distributions dans une imputation multiple pour la non-réponse totale non ignorable, en générant des imputations qui donnent lieu à des estimations plausibles à partir de données complètes pour les variables dont les marges sont connues. Cependant, ces travaux antérieurs ne font pas appel aux poids de sondage pour les unités non répondantes. Nous prolongeons ces travaux antérieurs pour utiliser les poids de sondage pour toutes les unités échantillonnées. Nous illustrons l’approche à l’aide d’études par simulation.
    Date de diffusion : 2026-06-29

  • Articles et rapports : 12-001-X202500100004
    Description : La collecte de données d’enquête est souvent limitée par une non-réponse totale ou partielle. Pour réduire la dépendance à des hypothèses robustes relatives aux mécanismes d’absence de données, les statisticiens peuvent utiliser des renseignements sur les distributions marginales de population connues, par exemple, découlant de recensements ou de bases de données administratives. Une approche en ce sens est le recours au cadre de données manquantes avec marges auxiliaires, qui repose sur l’imputation multiple à la fois pour la non-réponse totale et la non-réponse partielle, de sorte que les estimations pondérées par les poids d’enquête correspondent aux distributions marginales connues. Toutefois, ce cadre repose sur la spécification et l’estimation d’une distribution conjointe pour les indicateurs de données d’enquête et de non-réponse, ce qui peut présenter des défis du point de vue du calcul et de la pratique pour des données comportant de nombreuses variables de divers types. Nous proposons deux adaptations du cadre de données manquantes avec marges auxiliaires afin de simplifier la tâche d’imputation. Tout d’abord, plutôt que de préciser un modèle conjoint pour les données des unités répondantes, nous avons recours à une imputation hot deck aléatoire tout en utilisant toujours les distributions marginales connues. Ensuite, plutôt qu’un échantillonnage à partir de distributions conditionnelles découlant du modèle conjoint pour les données manquantes dues à une non-réponse partielle, nous appliquons une imputation multiple par équations en séries pour la non-réponse partielle avant une imputation pour la non-réponse totale. À l’aide d’études par simulations avec des mécanismes de données manquantes non ignorables, nous démontrons que la démarche proposée peut fournir des estimations ponctuelles et par intervalle plus exactes que des modèles ne tirant pas profit de l’information auxiliaire. Nous illustrons cette démarche à l’aide de données relatives à la participation électorale tirée de la Current Population Survey des États-Unis.
    Date de diffusion : 2025-06-30

  • Articles et rapports : 12-001-X202400200008
    Description : Lorsqu’ils souhaitent diffuser des fichiers à grande diffusion pour des données confidentielles, les organismes de statistique peuvent générer des données entièrement synthétiques. Nous proposons une méthode pour construire des données entièrement synthétiques à partir d’enquêtes dont les données sont recueillies selon des plans d’échantillonnage complexes. Notre méthode respecte la stratégie générale proposée par Rubin (1993). Plus précisément, nous générons des pseudo-populations en appliquant la méthode du bootstrap bayésien en population finie pondéré pour tenir compte des poids d’enquête, tirons des échantillons aléatoires simples de ces pseudo-populations, estimons des modèles de synthèse en utilisant ces échantillons aléatoires simples et diffusons des données simulées tirées des modèles sous la forme de fichiers à grande diffusion. Pour faciliter l’estimation de la variance, nous utilisons le cadre d’imputation multiple et deux stratégies de génération de données. Dans la première, nous générons plusieurs ensembles de données à partir de chaque échantillon aléatoire simple. Dans la seconde, nous générons un seul ensemble de données synthétiques à partir de chaque échantillon aléatoire simple. Nous présentons des règles de combinaison de l’imputation multiple pour chaque scénario. Nous illustrons les propriétés d’échantillonnage répété des règles de combinaison au moyen d’études par simulations, ce qui comprend des comparaisons avec la génération de données synthétiques en fonction de méthodes de pseudo-vraisemblance. Nous appliquons les méthodes proposées à un sous-ensemble de données tirées de l’American Community Survey.
    Date de diffusion : 2024-12-20

  • Articles et rapports : 12-001-X201900200005
    Description : Nous exposons une méthode d’imputation de valeurs manquantes dans des données catégoriques multivariées emboîtées au sein des ménages. Cette méthode reposant sur un modèle à classes latentes (i) permet des variables au double niveau des ménages et des particuliers, (ii) attribue dans ce modèle une probabilité nulle aux configurations impossibles des ménages et (iii) peut préserver les distributions multivariées à la fois dans et entre les ménages. Nous présentons un échantillonneur de Gibbs pour l’estimation du modèle et la production des imputations. Nous décrivons en outre des stratégies d’amélioration de l’efficacité de calcul pour l’estimation du modèle. Nous illustrons enfin le rendement de la méthode à l’aide de données imitant les variables recueillies dans des recensements types de la population.
    Date de diffusion : 2019-06-27

  • Articles et rapports : 12-001-X201400114002
    Description : Nous proposons une approche d’imputation multiple des réponses manquant aléatoirement dans les enquêtes à grande échelle qui ne portent que sur des variables catégoriques présentant des zéros structurels. Notre approche consiste à utiliser des mélanges de lois multinomiales comme outils d’imputation et à tenir compte des zéros structurels en concevant les données observées comme un échantillon tronqué issu d’une population hypothétique ne contenant pas de zéros structurels. Cette approche possède plusieurs caractéristiques intéressantes : les imputations sont générées à partir de modèles bayésiens conjoints cohérents qui tiennent compte automatiquement des dépendances complexes et s’adaptent facilement à de grands nombres de variables. Nous décrivons un algorithme d’échantillonnage de Gibbs pour mettre en œuvre l’approche et illustrons son potentiel au moyen d’une étude par échantillonnage répété en utilisant des microdonnées de recensement à grande diffusion provenant de l’État de New York, aux États Unis.
    Date de diffusion : 2014-06-27

  • Articles et rapports : 12-001-X201200111687
    Description :

    Afin de créer des fichiers de données à grande diffusion à partir d'enquêtes à grande échelle, les organismes statistiques diffusent parfois des sous­échantillons aléatoires des enregistrements originaux. Le sous­échantillonnage aléatoire amenuise la taille des fichiers transmis aux analystes secondaires des données et réduit les risques de divulgation accidentelle de renseignements confidentiels sur les participants aux enquêtes. Cependant, le sous­échantillonnage n'élimine pas entièrement le risque, de sorte qu'il faut altérer les données avant leur diffusion. Nous proposons de créer des sous­échantillons protégés contre la divulgation provenant d'enquêtes à grande échelle en recourant à l'imputation multiple. L'idée consiste à remplacer dans l'échantillon original les valeurs identificatoires ou sensibles par des valeurs tirées de modèles statistiques et de diffuser des sous­échantillons de ces données protégées contre la divulgation. Nous présentons des méthodes permettant de faire des inférences fondées sur les multiples sous­échantillons synthétiques.

    Date de diffusion : 2012-06-27

  • Articles et rapports : 12-001-X20060029548
    Description :

    La théorie de l'imputation multiple pour traiter les données manquantes exige que l'imputation soit faite conditionnellement du plan d'échantillonnage. Cependant, comme la plupart des progiciels standard utilisés pour l'imputation multiple fondée sur un modèle reposent sur l'hypothèse d'un échantillonnage aléatoire simple, de nombreux praticiens sont portés à ne pas tenir compte des caractéristiques des plans d'échantillonnage complexes, comme la stratification et la mise en grappes, dans leurs imputations. Or, la théorie prédit que l'analyse d'ensembles de données soumis de telle façon à une imputation multiple peut produire des estimations biaisées du point de vue du plan de sondage. Dans le présent article, nous montrons au moyen de simulations que i) le biais peut être important si les caractéristiques du plan sont reliées aux variables d'intérêt et que ii) le biais peu être réduit en tenant compte de l'effet des caractéristiques du plan dans les modèles d'imputation. Les simulations montrent aussi que l'introduction de caractéristiques non pertinentes du plan comme contraintes dans les modèles d'imputation peut donner lieu à des inférences conservatrices, à condition que les modèles contiennent aussi des variables explicatives pertinentes. Ces résultats portent à formuler la prescription qui suit à l'intention des imputeurs : le moyen le plus sûr de procéder consiste à inclure les variables du plan de sondage dans la spécification des modèles d'imputation. À l'aide de données réelles, nous donnons une démonstration d'une approche simple d'intégration des caractéristiques d'un plan de sondage complexe qui peut être suivie en utilisant certains progiciels standard pour créer des imputations multiples.

    Date de diffusion : 2006-12-21

  • Articles et rapports : 12-001-X20040027755
    Description :

    Plusieurs organismes statistiques utilisent, ou considèrent utiliser, l'imputation multiple pour limiter le risque de divulguer l'identité des répondants ou certains attributs délicats dans les fichiers de données à grande diffusion. Par exemple, ces organismes peuvent diffuser des ensembles de données partiellement synthétiques comprenant les unités étudiées originellement, où certaines valeurs recueillies, comme les valeurs délicates posant un risque élevé de divulgation ou les valeurs d'identificateurs clés, sont remplacées par des imputations multiples. Le présent article décrit une approche permettant de générer des ensembles de données partiellement synthétiques multi imputés pour traiter simultanément le contrôle de la divulgation et les données manquantes. L'idée fondamentale consiste à imputer d'abord les valeurs manquantes pour produire m ensembles de données complets, puis à remplacer dans chaque ensemble de données complet les valeurs délicates ou permettant l'identification par r valeurs imputées. L'article décrit aussi des méthodes permettant de faire des inférences valides à partir d'ensembles de données multi imputés de ce genre. De nouvelles règles sont nécessaires pour combiner les estimations ponctuelles et de variances multiples, parce que les deux étapes d'imputation multiple introduisent dans les estimations ponctuelles deux sources de variabilité que les méthodes existantes d'obtention d'inférences à partir d'ensembles de données multi imputés ne mesurent pas correctement. Une loi t de référence appropriée pour l'inférence quand les valeurs de m et r sont moyennes est établie au moyen d'approximations par appariement de moments et par développement en série de Taylor.

    Date de diffusion : 2005-02-03

  • Articles et rapports : 11-522-X20030017692
    Description :

    Ce document porte sur les serveurs d'applications de régression, lesquels sont des systèmes de diffusion des données qui ne fournissent que certains résultats des analyses par régression en réponse aux demandes de l'utilisateur. On y présente aussi de façon détaillée les travaux sur le cas spécial où les données contiennent une variable confidentielle pour laquelle les résultats des régressions doivent être protégés.

    Date de diffusion : 2005-01-26

  • Articles et rapports : 12-001-X20030026785
    Description :

    L'une des méthodes permettant d'éviter les divulgations consiste à diffuser des ensembles de microdonnées à grande diffusion partiellement synthétiques. Ces ensembles comprennent les unités enquêtés au départ, mais certaines valeurs recueillies, comme celles de nature délicate présentant un haut risque de divulgation ou celles d'identificateurs clés, sont remplacées par des imputations multiples. Bien qu'on recoure à l'heure actuelle à des approches partiellement synthétiques pour protéger les données à grande diffusion, on ne les a pas encore assorties de méthodes d'inférence valides. Le présent article décrit de telles méthodes. Elles sont fondées sur les concepts de l'imputation multiple en vue de remplacer des données manquantes, mais s'appuient sur des règles différentes pour combiner les estimations ponctuelles et les estimations de la variance. Ces règles de combinaison diffèrent aussi de celles élaborées par Raghunathan, Reiter et Rubin (2003) pour les ensembles de données entièrement synthétiques. La validité de ces nouvelles règles est illustrée au moyen d'études par simulation.

    Date de diffusion : 2004-01-27
Articles et rapports (10)

Articles et rapports (10) ((10 results))

  • Articles et rapports : 12-001-X202600100002
    Description : Habituellement, il manque des valeurs dans les données d’enquête en raison de la non-réponse totale et partielle. Parfois, les organismes d’enquête connaissent les distributions marginales de certaines variables catégoriques dans la population visée. Comme l’ont démontré des travaux antérieurs, les organismes d’enquête peuvent tirer profit de ces distributions dans une imputation multiple pour la non-réponse totale non ignorable, en générant des imputations qui donnent lieu à des estimations plausibles à partir de données complètes pour les variables dont les marges sont connues. Cependant, ces travaux antérieurs ne font pas appel aux poids de sondage pour les unités non répondantes. Nous prolongeons ces travaux antérieurs pour utiliser les poids de sondage pour toutes les unités échantillonnées. Nous illustrons l’approche à l’aide d’études par simulation.
    Date de diffusion : 2026-06-29

  • Articles et rapports : 12-001-X202500100004
    Description : La collecte de données d’enquête est souvent limitée par une non-réponse totale ou partielle. Pour réduire la dépendance à des hypothèses robustes relatives aux mécanismes d’absence de données, les statisticiens peuvent utiliser des renseignements sur les distributions marginales de population connues, par exemple, découlant de recensements ou de bases de données administratives. Une approche en ce sens est le recours au cadre de données manquantes avec marges auxiliaires, qui repose sur l’imputation multiple à la fois pour la non-réponse totale et la non-réponse partielle, de sorte que les estimations pondérées par les poids d’enquête correspondent aux distributions marginales connues. Toutefois, ce cadre repose sur la spécification et l’estimation d’une distribution conjointe pour les indicateurs de données d’enquête et de non-réponse, ce qui peut présenter des défis du point de vue du calcul et de la pratique pour des données comportant de nombreuses variables de divers types. Nous proposons deux adaptations du cadre de données manquantes avec marges auxiliaires afin de simplifier la tâche d’imputation. Tout d’abord, plutôt que de préciser un modèle conjoint pour les données des unités répondantes, nous avons recours à une imputation hot deck aléatoire tout en utilisant toujours les distributions marginales connues. Ensuite, plutôt qu’un échantillonnage à partir de distributions conditionnelles découlant du modèle conjoint pour les données manquantes dues à une non-réponse partielle, nous appliquons une imputation multiple par équations en séries pour la non-réponse partielle avant une imputation pour la non-réponse totale. À l’aide d’études par simulations avec des mécanismes de données manquantes non ignorables, nous démontrons que la démarche proposée peut fournir des estimations ponctuelles et par intervalle plus exactes que des modèles ne tirant pas profit de l’information auxiliaire. Nous illustrons cette démarche à l’aide de données relatives à la participation électorale tirée de la Current Population Survey des États-Unis.
    Date de diffusion : 2025-06-30

  • Articles et rapports : 12-001-X202400200008
    Description : Lorsqu’ils souhaitent diffuser des fichiers à grande diffusion pour des données confidentielles, les organismes de statistique peuvent générer des données entièrement synthétiques. Nous proposons une méthode pour construire des données entièrement synthétiques à partir d’enquêtes dont les données sont recueillies selon des plans d’échantillonnage complexes. Notre méthode respecte la stratégie générale proposée par Rubin (1993). Plus précisément, nous générons des pseudo-populations en appliquant la méthode du bootstrap bayésien en population finie pondéré pour tenir compte des poids d’enquête, tirons des échantillons aléatoires simples de ces pseudo-populations, estimons des modèles de synthèse en utilisant ces échantillons aléatoires simples et diffusons des données simulées tirées des modèles sous la forme de fichiers à grande diffusion. Pour faciliter l’estimation de la variance, nous utilisons le cadre d’imputation multiple et deux stratégies de génération de données. Dans la première, nous générons plusieurs ensembles de données à partir de chaque échantillon aléatoire simple. Dans la seconde, nous générons un seul ensemble de données synthétiques à partir de chaque échantillon aléatoire simple. Nous présentons des règles de combinaison de l’imputation multiple pour chaque scénario. Nous illustrons les propriétés d’échantillonnage répété des règles de combinaison au moyen d’études par simulations, ce qui comprend des comparaisons avec la génération de données synthétiques en fonction de méthodes de pseudo-vraisemblance. Nous appliquons les méthodes proposées à un sous-ensemble de données tirées de l’American Community Survey.
    Date de diffusion : 2024-12-20

  • Articles et rapports : 12-001-X201900200005
    Description : Nous exposons une méthode d’imputation de valeurs manquantes dans des données catégoriques multivariées emboîtées au sein des ménages. Cette méthode reposant sur un modèle à classes latentes (i) permet des variables au double niveau des ménages et des particuliers, (ii) attribue dans ce modèle une probabilité nulle aux configurations impossibles des ménages et (iii) peut préserver les distributions multivariées à la fois dans et entre les ménages. Nous présentons un échantillonneur de Gibbs pour l’estimation du modèle et la production des imputations. Nous décrivons en outre des stratégies d’amélioration de l’efficacité de calcul pour l’estimation du modèle. Nous illustrons enfin le rendement de la méthode à l’aide de données imitant les variables recueillies dans des recensements types de la population.
    Date de diffusion : 2019-06-27

  • Articles et rapports : 12-001-X201400114002
    Description : Nous proposons une approche d’imputation multiple des réponses manquant aléatoirement dans les enquêtes à grande échelle qui ne portent que sur des variables catégoriques présentant des zéros structurels. Notre approche consiste à utiliser des mélanges de lois multinomiales comme outils d’imputation et à tenir compte des zéros structurels en concevant les données observées comme un échantillon tronqué issu d’une population hypothétique ne contenant pas de zéros structurels. Cette approche possède plusieurs caractéristiques intéressantes : les imputations sont générées à partir de modèles bayésiens conjoints cohérents qui tiennent compte automatiquement des dépendances complexes et s’adaptent facilement à de grands nombres de variables. Nous décrivons un algorithme d’échantillonnage de Gibbs pour mettre en œuvre l’approche et illustrons son potentiel au moyen d’une étude par échantillonnage répété en utilisant des microdonnées de recensement à grande diffusion provenant de l’État de New York, aux États Unis.
    Date de diffusion : 2014-06-27

  • Articles et rapports : 12-001-X201200111687
    Description :

    Afin de créer des fichiers de données à grande diffusion à partir d'enquêtes à grande échelle, les organismes statistiques diffusent parfois des sous­échantillons aléatoires des enregistrements originaux. Le sous­échantillonnage aléatoire amenuise la taille des fichiers transmis aux analystes secondaires des données et réduit les risques de divulgation accidentelle de renseignements confidentiels sur les participants aux enquêtes. Cependant, le sous­échantillonnage n'élimine pas entièrement le risque, de sorte qu'il faut altérer les données avant leur diffusion. Nous proposons de créer des sous­échantillons protégés contre la divulgation provenant d'enquêtes à grande échelle en recourant à l'imputation multiple. L'idée consiste à remplacer dans l'échantillon original les valeurs identificatoires ou sensibles par des valeurs tirées de modèles statistiques et de diffuser des sous­échantillons de ces données protégées contre la divulgation. Nous présentons des méthodes permettant de faire des inférences fondées sur les multiples sous­échantillons synthétiques.

    Date de diffusion : 2012-06-27

  • Articles et rapports : 12-001-X20060029548
    Description :

    La théorie de l'imputation multiple pour traiter les données manquantes exige que l'imputation soit faite conditionnellement du plan d'échantillonnage. Cependant, comme la plupart des progiciels standard utilisés pour l'imputation multiple fondée sur un modèle reposent sur l'hypothèse d'un échantillonnage aléatoire simple, de nombreux praticiens sont portés à ne pas tenir compte des caractéristiques des plans d'échantillonnage complexes, comme la stratification et la mise en grappes, dans leurs imputations. Or, la théorie prédit que l'analyse d'ensembles de données soumis de telle façon à une imputation multiple peut produire des estimations biaisées du point de vue du plan de sondage. Dans le présent article, nous montrons au moyen de simulations que i) le biais peut être important si les caractéristiques du plan sont reliées aux variables d'intérêt et que ii) le biais peu être réduit en tenant compte de l'effet des caractéristiques du plan dans les modèles d'imputation. Les simulations montrent aussi que l'introduction de caractéristiques non pertinentes du plan comme contraintes dans les modèles d'imputation peut donner lieu à des inférences conservatrices, à condition que les modèles contiennent aussi des variables explicatives pertinentes. Ces résultats portent à formuler la prescription qui suit à l'intention des imputeurs : le moyen le plus sûr de procéder consiste à inclure les variables du plan de sondage dans la spécification des modèles d'imputation. À l'aide de données réelles, nous donnons une démonstration d'une approche simple d'intégration des caractéristiques d'un plan de sondage complexe qui peut être suivie en utilisant certains progiciels standard pour créer des imputations multiples.

    Date de diffusion : 2006-12-21

  • Articles et rapports : 12-001-X20040027755
    Description :

    Plusieurs organismes statistiques utilisent, ou considèrent utiliser, l'imputation multiple pour limiter le risque de divulguer l'identité des répondants ou certains attributs délicats dans les fichiers de données à grande diffusion. Par exemple, ces organismes peuvent diffuser des ensembles de données partiellement synthétiques comprenant les unités étudiées originellement, où certaines valeurs recueillies, comme les valeurs délicates posant un risque élevé de divulgation ou les valeurs d'identificateurs clés, sont remplacées par des imputations multiples. Le présent article décrit une approche permettant de générer des ensembles de données partiellement synthétiques multi imputés pour traiter simultanément le contrôle de la divulgation et les données manquantes. L'idée fondamentale consiste à imputer d'abord les valeurs manquantes pour produire m ensembles de données complets, puis à remplacer dans chaque ensemble de données complet les valeurs délicates ou permettant l'identification par r valeurs imputées. L'article décrit aussi des méthodes permettant de faire des inférences valides à partir d'ensembles de données multi imputés de ce genre. De nouvelles règles sont nécessaires pour combiner les estimations ponctuelles et de variances multiples, parce que les deux étapes d'imputation multiple introduisent dans les estimations ponctuelles deux sources de variabilité que les méthodes existantes d'obtention d'inférences à partir d'ensembles de données multi imputés ne mesurent pas correctement. Une loi t de référence appropriée pour l'inférence quand les valeurs de m et r sont moyennes est établie au moyen d'approximations par appariement de moments et par développement en série de Taylor.

    Date de diffusion : 2005-02-03

  • Articles et rapports : 11-522-X20030017692
    Description :

    Ce document porte sur les serveurs d'applications de régression, lesquels sont des systèmes de diffusion des données qui ne fournissent que certains résultats des analyses par régression en réponse aux demandes de l'utilisateur. On y présente aussi de façon détaillée les travaux sur le cas spécial où les données contiennent une variable confidentielle pour laquelle les résultats des régressions doivent être protégés.

    Date de diffusion : 2005-01-26

  • Articles et rapports : 12-001-X20030026785
    Description :

    L'une des méthodes permettant d'éviter les divulgations consiste à diffuser des ensembles de microdonnées à grande diffusion partiellement synthétiques. Ces ensembles comprennent les unités enquêtés au départ, mais certaines valeurs recueillies, comme celles de nature délicate présentant un haut risque de divulgation ou celles d'identificateurs clés, sont remplacées par des imputations multiples. Bien qu'on recoure à l'heure actuelle à des approches partiellement synthétiques pour protéger les données à grande diffusion, on ne les a pas encore assorties de méthodes d'inférence valides. Le présent article décrit de telles méthodes. Elles sont fondées sur les concepts de l'imputation multiple en vue de remplacer des données manquantes, mais s'appuient sur des règles différentes pour combiner les estimations ponctuelles et les estimations de la variance. Ces règles de combinaison diffèrent aussi de celles élaborées par Raghunathan, Reiter et Rubin (2003) pour les ensembles de données entièrement synthétiques. La validité de ces nouvelles règles est illustrée au moyen d'études par simulation.

    Date de diffusion : 2004-01-27