Les médias sociaux comme source de données pour les statistiques officielles; l’Indice de confiance des consommateurs des Pays-Bas
Section 5. Discussion

Pendant des décennies, les instituts nationaux de statistique se sont appuyés sur l’échantillonnage probabiliste pour produire les statistiques officielles. Cette approche est fondée sur une théorie éprouvée en vue de faire des inférences statistiques valides pour de grandes populations cibles finies en partant d’échantillons aléatoires relativement petits. Au cours des dernières décennies, de plus en plus de sources de données de rechange, comme les données administratives et les mégadonnées, sont devenues disponibles et la question qui se pose est celle de savoir comment utiliser ces sources de données pour produire les statistiques officielles. Un important problème concerne la généralisation des résultats obtenus au moyen de ces sources à une population cible finie. Puisque le processus de génération des données est habituellement inconnu, la façon de faire des inférences valides au moyen de ces sources de données n’est pas évidente.

Le présent article traite de la façon d’utiliser les sources de données administratives et de mégadonnées pour produire des statistiques officielles. L’approche la plus extrême consiste à remplacer les données d’enquête par des données provenant de sources de rechange reliées, en courant le risque d’introduire, par exemple, un biais de sélection. Puisque la plupart des enquêtes sont réalisées de manière répétée, nous proposons une approche de modélisation de séries chronologiques pour déterminer dans quelle mesure les sources de données de rechange reliées reflètent une même évolution que la série obtenue au moyen d’une enquête répétée. Un modèle espace-état multivarié permet de modéliser la corrélation entre les composantes sous-jacentes non observées des deux séries. Le cas où les composantes du modèle de séries chronologiques sont cointégrées constitue un fort indice que les deux sources de données ont pour moteur le même facteur sous-jacent. Le cas échéant, cela permettrait d’arguer qu’une source de rechange peut remplacer les enquêtes existantes, puisqu’elles reflètent la même évolution d’un processus, généralement à un niveau différent.

La théorie qui sous-tend l’échantillonnage probabiliste pour l’inférence sur des populations finies est plus solide que l’application du concept de cointégration. Les séries obtenues à partir des médias sociaux ou de Google Trends sont choisies de manière à maximiser la corrélation avec la série issue de l’enquête par sondage et ne mesurent pas nécessairement le même concept que l’enquête. Rien ne garantit que cette corrélation est basée sur une causalité réelle ni que la corrélation persistera dans l’avenir. En revanche, la théorie de l’échantillonnage repose sur une théorie mathématique rigoureuse montrant qu’une stratégie d’échantillonnage correcte, c’est-à-dire la combinaison appropriée d’un échantillon probabiliste et d’un estimateur approximativement sans biais sous le plan, aboutit à des inférences statistiques valides pour les populations cibles choisies.

Même dans le cas de séries cointégrées, une évaluation approfondie du modèle, par exemple une forme de validation croisée, sera nécessaire pour avoir la certitude que la source de données de rechange est un remplacement valide. Consulter aussi, dans ce contexte, Eichler (2013) pour une discussion de l’utilisation de la causalité de Granger pour l’inférence causale dans le cas de séries chronologiques multiples. Au lieu de remplacer une enquête périodique par des sources de données reliées, ces dernières peuvent être utilisées comme série auxiliaire dans une approche de modélisation de séries chronologiques multivariée en vue d’améliorer la précision des estimations directes ou des estimations du mouvement période-à-période des estimations directes obtenues au moyen d’une enquête périodique. Un autre avantage important des sources de mégadonnées consiste à profiter de la plus grande fréquence de ces sources de données pour faire des prédictions précoces ou des prédictions immédiates plus précises quand, en temps réel, les estimations issues de l’enquête ne sont pas encore disponibles, mais que la covariable l’est déjà. Le modèle de séries chronologiques appliqué dans le présent article, proposé pour la première fois par Harvey et Chung (2000), représente une approche générique pour une procédure d’estimation fondée sur un modèle pour des enquêtes périodiques. Naturellement, les enquêtes par sondage posent aussi des problèmes. À titre d’exemple, les taux de réponse continuellement à la baisse et les modes de collecte des données ne permettant pas d’atteindre la population cible produisent aussi un biais de sélection. Dans cette situation, la cointégration avec une série reliée dérivée des médias sociaux pourrait être un signe qu’il existe des similarités entre le biais de sélection dans les sources de mégadonnées non probabilistes et le biais de couverture et de sélection de la non-réponse dans un sondage, comme l’ont souligné Baker et coll. (2013).

Dans l’application à l’ICC, l’approche de modélisation de séries chronologiques ne réduit pas la variance de l’estimateur direct quand elle est utilisée pour produire des estimations de niveau. Cela tient au fait que l’erreur-type du modèle de séries chronologiques reflète l’erreur d’échantillonnage et le bruit blanc du paramètre de population. L’erreur-type de l’estimateur direct reflète uniquement l’erreur d’échantillonnage. Dans le cas de l’ICC, la composante de variance du bruit blanc du paramètre de population est aussi grande que la variance de l’erreur d’échantillonnage. L’approche du modèle espace-état est néanmoins utile pour produire les chiffres officiels de l’ICC, puisqu’elle filtre une tendance plus stable de l’opinion des personnes interrogées au sujet du climat économique à partir de la série observée d’estimations directes. Cependant, la situation change si le modèle de séries chronologiques est utilisé pour estimer les mouvements mois-à-mois. Les estimations de la tendance stable résultent d’une forte corrélation positive entre les estimations de périodes subséquentes. Par conséquent, les erreurs-types du mouvement mois-à-mois obtenues au moyen du modèle de séries chronologiques sont nettement plus petites que celles des estimations directes. Les erreurs-types des mouvements mois-à-mois lissés sont environ 47 % plus petites que celles des estimations directes. Les erreurs-types des estimations filtrées sont environ 17 % plus petites que celles des estimations directes.

L’utilisation de l’IMS comme série auxiliaire dans un modèle espace-état bivarié réduit légèrement l’erreur-type des estimations modélisées de l’ICC. Cependant, puisque la série de l’IMS disponible est relativement courte, la réduction obtenue au moyen de cette série auxiliaire ne surpasse pas la perte de l’information de la série de l’ICC qui a été observée durant la période avant que l’IMS soit disponible. Toutefois, puisque les deux séries présentent une même évolution et que les données des médias sociaux sont disponibles rapidement, l’IMS s’est avéré utile comme série auxiliaire dans le modèle bivarié pour produire des prédictions immédiates plus fiables pour l’ICC en temps réel, au moment où l’IMS devient disponible tandis que l’ICC ne l’est pas encore. Dans cette application, l’IMS réduit d’environ 17 % les erreurs-types de l’ICC dans une procédure de prédiction immédiate.

D’aucuns se demanderont si, dans sa mise en œuvre actuelle, l’IMS mesure le même concept que celui qu’essaie de mesurer l’ICC et comment on pourrait tirer parti de toutes les possibilités qu’offrent les données des médias sociaux et d’autres sources de mégadonnées pour obtenir de meilleures mesures de la confiance des consommateurs que celles produites par les ICC et IMS actuels. Au lieu de construire un indice basé sur les médias sociaux en prenant la différence entre les messages jugés positifs et négatifs, on pourrait construire un IMS en examinant les concepts qui sous-tendent les questions utilisées pour l’ICC. Par exemple, si l’on mesure la confiance des consommateurs par le nombre d’achats de biens coûteux au cours des 12 derniers mois ou par la tendance des ménages à acheter des biens coûteux, les indices fondés sur les médias sociaux devraient mesurer la recherche de ce genre de biens sur Internet (automobiles, maisons, produits blancs, etc.), ainsi que les achats réels de ces biens durant les mois précédents. Le grand avantage de cette approche est qu’elle permet de mesurer directement le comportement actuel des ménages, alors qu’une enquête le mesure indirectement, ce qui induit une plus grande erreur de mesure. Cela pourrait aboutir à des séries cointégrées qui mesurent des concepts similaires et améliorent davantage ou même remplacent l’ICC.

Remerciements

Les auteurs sont reconnaissants au rédacteur associé et aux examinateurs pour leur lecture attentive d’une version antérieure de cet article et pour leurs commentaires constructifs ayant contribué à améliorer significativement le contenu de l’article. Les opinions exprimées dans le présent article sont celles des auteurs et ne reflètent pas forcément les politiques de Statistics Netherlands.

Annexe A

Diagnostics du modèle

Tableau A.1
Modèle univarié (3.8) pour l’ICC 172-24 observations
Sommaire du tableau
Le tableau montre les résultats de Modèle univarié (3.8) pour l’ICC 172-24 observations. Les données sont présentées selon Diagnostic (titres de rangée) et Valeur, Valeur (equation) et IC à 95 % (figurant comme en-tête de colonne).
Diagnostic Valeur Valeur p MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqadiGacaGaaeqabaWaaeaaeaaakeaacaWGWbaaaa@3603@ IC à 95 %
Inf. Sup.
Log-vraisemblance -464 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Moyenne des innovations standardisées 0,0152 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Variance des innovations standardisées 1,0851 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Asymétrie des innovations standardisées 0,0276 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Aplatissement des innovations standardisées 2,8901 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Test de Bowman-ShentonTableau A.1 Note 1 sur la normalité des innovations standardisées 0,0926 0,955 Cette cellule est vide Cette cellule est vide
Test de Ljung-BoxTableau A.1 Note 2 sur la corrélation sériale des innovations standardisées 24,108 0,287 Cette cellule est vide Cette cellule est vide
Test de Durban-WatsonTableau A.1 Note 3 sur la corrélation sériale des innovations standardisées ( T = 148 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamivaiaaykW7cqGH9aqpcaaMc8UaaGymaiaaisda caaI4aaacaGLOaGaayzkaaaaaa@3DE6@ 2,082 Cette cellule est vide 1,68 2,32
Test F MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbiaadAeadaahaaWcbeqaaiaaisdaaaaaaa@36E3@ Tableau A.1 Note 4 sur l’hétéroscédasticité des innovations standardisées ( d f num = d f denom = 60 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamizaiaadAgapaWaaSbaaSqaa8qacaqGUbGaaeyD aiaab2gaa8aabeaakiaaykW7peGaeyypa0JaaGPaVlaadsgacaWGMb WdamaaBaaaleaapeGaaeizaiaabwgacaqGUbGaae4Baiaab2gaa8aa beaakiaaykW7peGaeyypa0JaaGPaVlaaiAdacaaIWaaacaGLOaGaay zkaaaaaa@4C73@ 0,913 Cette cellule est vide 0,60 1,67
Tableau A.2
Modèle bivarié (3.9) pour l’ICC 57-24 observations
Sommaire du tableau
Le tableau montre les résultats de Modèle bivarié (3.9) pour l’ICC 57-24 observations. Les données sont présentées selon Diagnostic (titres de rangée) et Valeur, Valeur (equation) et IC à 95 % (figurant comme en-tête de colonne).
Diagnostic Valeur Valeur p MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqadiGacaGaaeqabaWaaeaaeaaakeaacaWGWbaaaa@3603@ IC à 95 %
Inf. Sup.
Log-vraisemblance -230 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Moyenne des innovations standardisées -0,0872 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Variance des innovations standardisées 0,9777 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Asymétrie des innovations standardisées 0,0982 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Aplatissement des innovations standardisées 2,5450 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Test de Bowman-ShentonTableau A.2 Note 1 sur la normalité des innovations standardisées 0,3382 0,844 Cette cellule est vide Cette cellule est vide
Test de Ljung-BoxTableau A.2 Note 2 sur la corrélation sériale des innovations standardisées 18,060 0,645 Cette cellule est vide Cette cellule est vide
Test de Durban-WatsonTableau A.2 Note 3 sur la corrélation sériale des innovations standardisées ( T=33 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamivaiaaykW7cqGH9aqpcaaMc8UaaGinaiaaiwda aiaawIcacaGLPaaaaaa@3D28@ 2,133 Cette cellule est vide 1,32 2,68
Test F MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbiaadAeadaahaaWcbeqaaiaaisdaaaaaaa@36E3@ Tableau A.2 Note 4 sur l’hétéroscédasticité des innovations standardisées ( d f num =d f denom =15 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamizaiaadAgapaWaaSbaaSqaa8qacaqGUbGaaeyD aiaab2gaa8aabeaakiaaykW7peGaeyypa0JaaGPaVlaadsgacaWGMb WdamaaBaaaleaapeGaaeizaiaabwgacaqGUbGaae4Baiaab2gaa8aa beaakiaaykW7peGaeyypa0JaaGPaVlaaigdacaaI1aaacaGLOaGaay zkaaaaaa@4C73@ 0,783 Cette cellule est vide 0,35 2,86
Tableau A.3
Modèle bivarié (3.9) pour l’IMS 57-12 observations
Sommaire du tableau
Le tableau montre les résultats de Modèle bivarié (3.9) pour l’IMS 57-12 observations. Les données sont présentées selon Diagnostic (titres de rangée) et Valeur, Valeur (equation) et IC à 95 % (figurant comme en-tête de colonne).
Diagnostic Valeur Valeur p MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqadiGacaGaaeqabaWaaeaaeaaakeaacaWGWbaaaa@3603@ IC à 95 %
Inf. Sup.
Log-vraisemblance -230 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Moyenne des innovations standardisées 0,0954 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Variance des innovations standardisées 1,0437 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Asymétrie des innovations standardisées -0,1311 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Aplatissement des innovations standardisées 2,5331 Cette cellule est vide Cette cellule est vide Cette cellule est vide
Test de Bowman-ShentonTableau A.3 Note 1 sur la normalité des innovations standardisées 0,5377 0,764 Cette cellule est vide Cette cellule est vide
Test de Ljung-BoxTableau A.3 Note 2 sur la corrélation sériale des innovations standardisées 24,208 0,283 Cette cellule est vide Cette cellule est vide
Test de Durban-WatsonTableau A.3 Note 3 sur la corrélation sériale des innovations standardisées ( T = 45 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamivaiaaykW7cqGH9aqpcaaMc8UaaGinaiaaiwda aiaawIcacaGLPaaaaaa@3D28@ 2,028 Cette cellule est vide 1,42 2,58
Test F MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbiaadAeadaahaaWcbeqaaiaaisdaaaaaaa@36E3@ Tableau A.3 Note 4 sur l’hétéroscédasticité des innovations standardisées ( d f num = d f denom = 20 ) MathType@MTEF@5@5@+= feaagKart1ev2aqatCvAUfeBSjuyZL2yd9gzLbvyNv2CaerbuLwBLn hiov2DGi1BTfMBaeXatLxBI9gBaerbd9wDYLwzYbItLDharqqtubsr 4rNCHbGeaGqk0Jf9crFfpeea0xh9v8qiW7rqqrpgpC0xg9Gqpe0xc9 qqaqFeFr0xbbG8FaYPYRWFb9fi0dYdcba9Ff0db9WqpeeaY=crpwe9 Fve9Fve8meaabaqaciGacaGaaeqabaWaaeaaeaaakeaaqaaaaaaaaa WdbmaabmaabaGaamizaiaadAgapaWaaSbaaSqaa8qacaqGUbGaaeyD aiaab2gaa8aabeaakiaaykW7peGaeyypa0JaaGPaVlaadsgacaWGMb WdamaaBaaaleaapeGaaeizaiaabwgacaqGUbGaae4Baiaab2gaa8aa beaakiaaykW7peGaeyypa0JaaGPaVlaaikdacaaIWaaacaGLOaGaay zkaaaaaa@4C6F@ 0,329 Cette cellule est vide 0,41 2,46

Bibliographie

Baker, R., Brick, J.M., Bates, N.A., Battaglia, M., Couper, M.P., Dever, J.A., Gile, K.J. et Tourangeau, R. (2013). Summary report of the AAPOR task force on non-probability sampling. Journal of Survey Statistics and Methodology, 1, 90-143, publié pour la première fois en ligne le 26 septembre 2013, doi:10.1093/jssam/smt008.

Bell, W.R. (2005). Some considerations of seasonal adjustment variances. Census Bureau. Article accessible à l’adresse https://www.census.gov/ts/papers/jsm2005wrb.pdf.

Bell, W.R., et Hillmer, S.C. (1990). Estimation dans les enquêtes à passages répétés au moyen de séries chronologiques. Techniques d’enquête, 16, 2, 205-227. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/1990002/article/14535-fra.pdf.

Binder, D.A., et Dick, J.P. (1989). Enquêtes répétées – Modélisation et estimation. Techniques d’enquête, 15, 1, 31-48. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/1989001/article/14579-fra.pdf.

Binder, D.A., et Dick, J.P. (1990). Méthode pour l’analyse des modèles ARMMI. Techniques d’enquête, 16, 2, 251-265. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/1990002/article/14533-fra.pdf.

Blight, B.J.N., et Scott, A.J. (1973). A stochastic model for repeated surveys. Journal of the Royal Statistical Society, Series B, 35, 61-66.

Blumenstock, J., Cadamuro, G. et On, R. (2015). Predicting poverty and wealth from mobile phone metadata. Science, 350, 1073-1076.

Bollineni-Balabay, O., van den Brakel, J.A. et Palm, F. (2015). Multivariate state-space approach to variance reduction in series with level and variance breaks due to sampling redesigns. Accepté pour publication dans Journal of the Royal Statistical Society, Series A.

Bollineni-Balabay, O., van den Brakel, J.A. et Palm, F. (2017). La modélisation espace-état appliquée aux séries chronologiques de l’Enquête sur la population active des Pays-Bas : sélection de modèles et estimation de l’erreur quadratique moyenne. Techniques d’enquête, 43, 1, 47-75. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/2017001/article/14819-fra.pdf.

Bowley, A.L. (1926). Measurement of the precision attained in sampling. Bulletin de l’Institut International de Statistique, 22, Supplément au livre 1, 6-62.

Buelens, B., Burger, J. et van den Brakel, J.A. (2015). Predictive inference for non-probability samples: A simulation study. Document de discussion 2015-13, Statistics Netherlands, Heerlen.

Cochran, W. (1977). Sampling Theory. New York: John Wiley & Sons, Inc.

Daas, P., et Puts, M. (2014a). Big data as a source of statistical information. The Survey Statistician, 69, 22-31.

Daas, P., et Puts, M. (2014b). Social media sentiment and consumer confidence. European Central Bank Statistics paper series No. 5, Frankfurt Allemagne.

Doornik, J.A. (2009). An Object-oriented Matrix Programming Language Ox 6. Londres: Timberlake Consultants Press.

Durbin, J., et Koopman, S.J. (2012). Time Series Analysis by State Space Methods, Second Edition. Oxford: Oxford University Press.

Eichler, M. (2013). Causal inference with multiple time series: Principles and problems. Philosophical transactions of the Royal Statistical Society A, 371, édition 1997.

Feder, M. (2001). Time series analysis of repeated surveys: The state-space approach. Statistica Neerlandica, 55, 182-199.

Hansen, M.H., et Hurwitz, W.N. (1943). On the theory of sampling from finite populations. Annals of Mathematical Statistics 14, 333-362.

Harvey, A.C. (1989). Forecasting, Structural Time Series Models and the Kalman Filter. Cambridge: Cambridge University Press.

Harvey, A.C., et Chung, C.H. (2000). Estimating the underlying change in unemployment in the UK. Journal of the Royal Statistical Society, Series A, 163, 303-339.

Koopman, S.J. (1997). Exact initial Kalman filtering and smoothing for non-stationary time series models. Journal of the American Statistical Association, 92, 1630-1638.

Koopman, S.J., Harvey, A., Shephard, N. et Doornik, J.A. (2009). STAMP 8.2, Londres: Timberlake Consultants Press.

Koopman, S.J., Shephard, N. et Doornik, J.A. (2008). SsfPack 3.0: Statistical Algorithms for Models in State Space Form, Londres: Timberlake Consultants Press.

Lind, J.T. (2005). Repeated surveys and the Kalman filter. Econometrics Journal, 8, 418-427.

Marchetti, S., Giusti, C., Pratesi, M., Salvati, N., Giannotti, F., Perdreschi, D., Rinzivillo, S., Pappalardo, L. et Gabrielli, L. (2015). Small area model-based estimators using big data sources. Journal of Official Statistics, 31, 263-281.

Neyman, J. (1934). On the two different aspects of the representative method: The method of stratified sampling and the method of purposive selection. Journal of the Royal Statistical Society, 97, 558-625.

Pang, B., et Lee, L. (2008). Opinion mining and sentiment analysis. Foundations and Trends in Information Retrieval, 2, 1-135.

Pfeffermann, D. (1991). Estimation and seasonal adjustment of population means using data from repeated surveys. Journal of Business & Economic Statistics, 9, 163-175.

Pfeffermann, D., et Burck, L. (1990). Estimation robuste pour petits domaines par la combinaison de données chronologiques et transversales. Techniques d’enquête, 16, 2, 229-249. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/1990002/article/14534-fra.pdf.

Pfeffermann, D., et Rubin-Bleuer, S. (1993). Modélisation conjointe robuste de séries de données sur l’activité pour de petites régions. Techniques d’enquête, 19, 2, 159-174. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/1993002/article/14458-fra.pdf.

Pfeffermann, D., et Sverchkov, M. (2014). Estimation of mean squared error of X-11-ARIMA and other estimators of time series components. Journal of Official Statistics, 30, 811-838.

Pfeffermann, D., et Tiller, R. (2006). Small area estimation with state space models subject to benchmark constraints. Journal of the American Statistical Association, 101, 1387-1397.

Pfeffermann, D., Feder, M. et Signorelli, D. (1998). Estimation of autocorrelations of survey errors with application to trend estimation in small areas. Journal of Business & Economic Statistics, 16, 339-348.

Rao, J.N.K., et Yu, M. (1994). Small area estimation by combining time series and cross-sectional data. Canadian Journal of Statistics, 22, 511-528.

Särndal, C.-E., Swensson, B. et Wretman, J. (1992). Model Assisted Survey Sampling. Springer-Verlag.

Scott, A.J., et Smith, T.M.F. (1974). Analysis of repeated surveys using time series methods. Journal of the American Statistical Association, 69, 674-678.

Scott, A.J., Smith, T.M.F. et Jones, R.G. (1977). The application of time series methods to the analysis of repeated surveys. International Statistical Review/Revue Internationale de Statistique, 45, 13-28.

Tam, S.-M. (1987). Analysis of repeated surveys using a dynamic linear model. International Statistical Review/Revue Internationale de Statistique, 55, 1, 63-73.

Tiller, R.B. (1992). Time series modelling of sample survey data from the U.S. current population survey. Journal of Official Statistics, 8, 149-166.

van den Brakel, J.A., et Krieg, S. (2009). Estimation du taux de chômage mensuel par modélisation structurelle de séries chronologiques dans un plan de sondage avec renouvellement de panel. Techniques d’enquête, 35, 2, 193-207. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/2009002/article/11040-fra.pdf.

van den Brakel, J.A., et Krieg, S. (2015). Remédier aux petites tailles d’échantillon, au biais de groupe de renouvellement et aux discontinuités dans les plans de sondage avec renouvellement de panel. Techniques d’enquête, 41, 2, 281-312. Article accessible à l’adresse http://www.statcan.gc.ca/pub/12-001-x/2015002/article/14231-fra.pdf.


Date de modification :