2 La loi a posteriori de Pólya
Jeremy Strief et Glen Meeden
Précédent | Suivant
Soit l'ensemble d'étiquettes d'un
échantillon de taille tiré d'une population de taille Pour simplifier, nous supposons
que les membres de sont et nous supposons aussi que la
fraction est très petite. Soit la caractéristique d'intérêt et les valeurs d'échantillon
observées.
La loi
a posteriori de Pólya repose sur l'échantillonnage selon le modèle de
l'urne de Pólya dont le principe est le suivant : supposons que les
valeurs de unités observées ou vues sont
marquées sur balles et sont placées dans
l'urne 1. Les unités restantes non vues de la
population sont représentées par balles non marquées placées dans
l'urne 2. De chaque urne on tire une balle avec la même probabilité et on
attribue à la balle provenant de l'urne 2 la valeur de la balle provenant
de l'urne 1. On retourne ensuite les deux balles dans l'urne 1. Donc,
à la deuxième étape de l'échantillonnage de Pólya, l'urne 1 contient balles et l'urne 2 contient balles. On répète cette procédure
jusqu'à ce que l'urne 2 soit vide, moment auquel les balles contenues dans
l'urne 1 constituent une copie simulée complète de la population. Toute quantité
de population finie moyenne, total, quantile,
coefficient de régression peut maintenant être calculée à
partir de la copie complète. Nous pouvons simuler de ces copies complètes et, dans
chaque cas, calculer la valeur de la quantité de population d'intérêt.
L'estimation ponctuelle est donnée par la moyenne de ces valeurs simulées et un
intervalle de crédibilité bayésien à 95 % approximatif est donné par les
quantiles correspondant à 2,5 % et 97,5 % des valeurs.
On peut
vérifier que, sous la loi a posteriori de Pólya, l'espérance
a posteriori de la moyenne de population est simplement la moyenne
d'échantillon et la variance a posteriori est simplement égale à fois la variance sous le plan
habituelle de la moyenne d'échantillon sous échantillonnage aléatoire simple
sans remise. La loi a posteriori de Pólya possède une justification fondée
sur la théorie de la décision en raison de sa nature bayésienne séquentielle.
En s'appuyant sur ce fait, on peut montrer que de nombreux estimateurs
classiques sont admissibles. Des renseignements détaillés figurent dans Ghosh
et Meeden (1997). La loi a posteriori de Pólya est le bootstrap bayésien
de Rubin (1981) appliqué à l'échantillonnage en population finie. Lo (1988)
discute aussi du bootstrap bayésien dans le cas de l'échantillonnage en
population finie. Certains des premiers travaux dans ce domaine sont décrits
dans Hartley et Rao (1968) et dans Binder (1982).
Pour
l'unité échantillonnée soit la proportion d'unités présentes
dans une copie simulée complète de la population qui possédent la valeur Ghosh et Meeden (1997) ont montré
que, sous la loi a posteriori de Pólya, Si nous posons que
alors
peut être interprété comme la
pondération appliquée à l'unité puisqu'elle est égale au nombre
moyen d'unités de la population représentée par l'unité sous la loi a posteriori de
Pólya. Rappelons que sous échantillonnage aléatoire simple sans remise, la
fraction est la probabilité d'inclusion de
chaque unité. Donc, dans ce cas, il y a concordance entre la pondération
fréquentiste habituelle, qui est la réciproque de la probabilité d'inclusion,
et la pondération sous la loi a posteriori de Pólya définie plus haut.
Donc,
quand l'information a priori est limitée, la loi a posteriori de
Pólya donne des pondérations identiques aux pondérations fréquentistes dérivées
du plan d'échantillonnage aléatoire simple sans remise. La justification du
choix de la loi a posteriori de Pólya pour ces pondérations ne dépend pas
explicitement du plan d'échantillonnage et conviendrait dans toute circonstance
où l'échantillonneur considère que les unités observées et non observées de la
population sont approximativement interchangeables.
Nous
allons maintenant examiner la relation entre la loi a posteriori de Pólya
et les méthodes bootstrap habituelles sous échantillonnage en population finie.
Les deux approches sont fondées sur une hypothèse d'interchangeabilité. Gross
(1980) a présenté l'idée fondamentale du bootstrap. Supposons que l'on procède
à un échantillonnage aléatoire simple sans remise et que est un entier. Étant donné un échantillon, nous créons une bonne
approximation de la population en combinant répliques de cet échantillon. En
tirant des échantillons aléatoires répétés de taille de cette population créée, nous
pouvons étudier le comportement d'un estimateur d'intérêt. Booth, Bulter et
Hall (1994) ont étudié les propriétés asymptotiques de ce genre d'estimateurs.
Hu, Zhang, Cohen et Salvucci (1997) donnent un exemple d'utilisation de
l'échantillon pour construire une population artificielle, suivie du tirage
d'échantillons répétés de cette population pour construire une estimation de la
variance de leur estimateur et des intervalles de confiance.
Notons
que cette situation diffère de celle de la loi a posteriori de Pólya où
l'échantillon est considéré fixe et des versions complètes de la population sont
générées de manière répétée.
Précédent | Suivant