Qualité des données, concepts et méthodologie : Méthodologie et qualité des données

Avertissement Consulter la version la plus récente.

Information archivée dans le Web

L’information dont il est indiqué qu’elle est archivée est fournie à des fins de référence, de recherche ou de tenue de documents. Elle n’est pas assujettie aux normes Web du gouvernement du Canada et elle n’a pas été modifiée ou mise à jour depuis son archivage. Pour obtenir cette information dans un autre format, veuillez communiquer avec nous.

Base de sondage et échantillonnage

Tous les cinq ans, le Recensement de l'agriculture recueille l'information sur les exploitations agricoles au Canada, incluant les fermes institutionnelles, les pâturages communautaires, les fermes situées dans les réserves des Première Nations, etc. Le Recensement de l'agriculture dresse une liste des fermes et de leur superficie en culture à partir de laquelle un échantillon probabiliste pour l'Enquête sur les fermes de novembre est tiré.

La population cible pour l'Enquête sur les fermes de novembre est constituée de toutes les exploitations agricoles du Canada énumérées dans le Recensement de l'agriculture, sauf les fermes institutionnelles, les fermes des réserves des Première Nations et les fermes des Territoires du Nord-Ouest, du Yukon et du Nunavut.

Les enquêtes probabilistes peuvent utiliser deux types de bases d'échantillonnage : la base de sondage de type liste et la base aréolaire. Dans l'Enquête sur les fermes de novembre, seule la base de sondage de type liste est utilisée pour la sélection de l'échantillon. La base de sondage de type liste est stratifiée en groupes homogènes sur la base des caractéristiques du recensement (exemples : la taille de la ferme et la superficie en culture) et sur les frontières géographiques intra-provinciales. Un échantillon d'environ 28 600 fermes a été tiré de la base liste pour l'Enquête sur les fermes de novembre 2011.

Collecte des données

L'Enquête sur les fermes de novembre 2011 a eu lieu du 24 octobre au 10 novembre. La collecte des données est faite en utilisant le système « Interviews téléphoniques assistées par ordinateur » (ITAO).

Vérification et imputation

Avec le système ITAO, il est possible d'exécuter des procédures de vérification au moment même de l'enquête. Les programmes informatiques de vérification de ce système affichent des messages qui informent les interviewers au téléphone sur la possibilité d'erreurs de données, lesquelles peuvent être corrigées immédiatement. Le système ITAO réduit de façon significative le besoin d'un suivi téléphonique, diminuant ainsi le fardeau des répondants et la durée du traitement de l'enquête.

Taux de réponse

Habituellement, à la fin de la collecte des données, 80 % des questionnaires ont été complétés en entier. Le taux de refus des enquêtes est approximativement de 8 à 9 %. La portion restante de l'échantillon peut être expliquée par les cas où il n'y a pas eu de contact ou de réponse. Les facteurs de pondération théorique sont ajustés par un processus appelé « ajustement des facteurs de pondération » dans les cas de réponse partielle ou d'absence totale de réponse.

Erreurs d'échantillonnage et erreurs non liées à l'échantillonnage

Les statistiques contenues dans cette publication sont basées sur un échantillon d'exploitations agricoles tiré au hasard et, comme telles, sont sujettes à des erreurs d'échantillonnage et à des erreurs non liées à l'échantillonnage. La qualité globale des estimations dépend ainsi de l'effet combiné de ces deux types d'erreur.

Les erreurs d'échantillonnage se produisent parce que les estimations sont dérivées des données d'un échantillon et non de la population totale. Ces erreurs dépendent de facteurs tels que la taille de l'échantillon, le plan d'échantillonnage et la méthode d'estimation. Une caractéristique importante de l'échantillonnage probabiliste est que les erreurs d'échantillonnage peuvent être mesurées à partir de l'échantillon même.

Les erreurs non liées à l'échantillonnage sont des erreurs qui surviennent au cours de la réalisation de l'enquête pour différentes raisons. Par exemple, les cas où il y a absence de réponse sont une source importante d'erreurs non liées à l'échantillonnage. La couverture, la différence dans l'interprétation des questions, les informations erronées fournies par les répondants, les erreurs d'enregistrement, de codification et de traitement des données sont d'autres exemples d'erreurs non liées à l'échantillonnage.

Estimation

Les données recueillies sont pondérées pour produire des indicateurs non biaisés et représentatifs de la population. Ces indicateurs de niveau sont alors soumis à un processus de validation basé sur une analyse faite par des spécialistes avant que les estimations finales soient publiées.

Révisions

Les estimations de la production de novembre contenues dans ce rapport sont les estimations finales pour la campagne agricole en cours. Des révisions à ces estimations peuvent être encore faites jusqu'à deux ans après la fin de la campagne agricole.

Le tableau suivant indique la mesure et la direction des données entre les estimations de la production de novembre et les estimations finales révisées de production. La mesure de ces changements est obtenue par le pourcentage moyen de variation entre les estimations finales et révisées. La direction des révisions est mesurée par le nombre d'années où l'estimation préliminaire est inférieure ou supérieure à l'estimation finale. Les données indiquent, par exemple, que l'estimation de la production de novembre pour l'orge est révisée, en moyenne, dans une proportion de 2,9 %, et habituellement à la baisse.

Qualité des données

Les estimations de la production de novembre sont basées sur des indicateurs de niveau obtenus à partir d'une enquête probabiliste sur les exploitations agricoles. L'erreur potentielle introduite par l'échantillonnage peut être calculée à partir de l'échantillon en utilisant une mesure statistique appelée le « coefficient de variation » (c.v.). Pour un échantillonnage répété, les chances sont de 95 % que la différence relative entre l'estimation de l'échantillon et ce qui aurait été obtenu d'une énumération de toutes les exploitations agricoles soit moindre que le double du c.v.. Cet ensemble de valeurs acceptables est appelé « intervalle de confiance ». Les estimations publiées peuvent ne pas être les mêmes que les indicateurs de niveau en raison de la validation. Toutefois, ces estimations demeurent à l'intérieur de l'intervalle de confiance des indicateurs de niveau de l'enquête. Pour l'Enquête sur les fermes de novembre, les c.v. varient de 1 % à 5 % pour les cultures principales. Les c.v. pour les cultures spéciales et les petites régions varient habituellement entre 6% et 25%.

Pour les différentes catégories des cultures spéciales, on a attribué aux estimations contenues dans la présente publication une cote qui témoigne de l'importance du coefficient de variation (c.v.) en pourcentage. Les cotes alphabétiques représentent les intervalles de c.v. suivants : 

Confidentialité des données

La confidentialité des données est assujettie à la Loi sur la Statistique qui interdit la divulgation de données individuelles et agrégées quand des individus ou des entreprises pourraient être identifiés.

Suivant | Précédent