Intervalle de confiance
moyenne, σ inconnu : x̄ ± t(1−α/2, n−1) · s/√n
Trois situations traitées séparément parce qu'elles n'ont ni la même loi ni le même domaine : une moyenne avec écart-type de population inconnu (loi de Student, le cas réel presque toujours). Une moyenne avec σ connu (loi normale, rare), et une proportion. Pour la proportion, l'outil sert l'intervalle de wilson et non celui de Wald : Wald donne des bornes hors de [0 ; 1] et s'effondre en un point quand aucun succès n'est observé. L'outil calcule les deux et signale le cas où Wald ment.
[93,808 ; 106,19]
- Calcul
- IC = x̄ ± c × erreur-type = 100 ± 2,0639 × 3
- Marge d’erreur
- ± 6,1917
La vraie moyenne est estimée dans [93,808 ; 106,19], soit une marge de ± 6,1917.
Ce que 95 % signifie : si l’on répétait l’échantillonnage un grand nombre de fois, 95 % des intervalles ainsi construits contiendraient la vraie valeur. Ce n’est pas « il y a 95 % de chances que la vraie valeur soit dans cet intervalle-ci ». La vraie valeur est fixe, c’est l’intervalle qui varie d’un échantillon à l’autre.
Dossier scientifique
Ce que l'outil calcule, ce qu'il suppose, où il cesse d'être valable et d'où viennent ses données.
Méthode & formulesmoyenne, σ inconnu : x̄ ± t(1−α/2, n−1) · s/√n
moyenne, σ inconnu : x̄ ± t(1−α/2, n−1) · s/√n
moyenne, σ connu : x̄ ± z(1−α/2) · σ/√n
proportion (Wilson) : (p̂ + z²/2n)/(1 + z²/n) ± z·√(p̂(1−p̂)/n + z²/4n²)/(1 + z²/n)
proportion (Wald, pour comparaison) : p̂ ± z·√(p̂(1−p̂)/n)
Un intervalle de confiance a toujours la même structure : l'estimation, plus ou moins une valeur critique multipliée par une erreur-type. Ce qui change d'un cas à l'autre, c'est la loi qui fournit la valeur critique. Quand l'écart-type de la population est inconnu, la situation réelle presque partout, l'estimer sur l'échantillon ajoute de l'incertitude, dont la loi de Student tient compte : à n = 5, sa valeur critique vaut 2,78 contre 1,96 pour la loi normale, soit un intervalle 42 % plus large. Pour une proportion, la formule de Wilson n'est pas centrée sur p̂ : son centre est légèrement déplacé vers 1/2, et c'est exactement ce qui lui permet de rester dans [0 ; 1].
- Niveau de confiance
- · la proportion des intervalles qui contiendraient la vraie valeur si l'échantillonnage était répété un grand nombre de fois. C'est une propriété de la méthode, pas de l'intervalle particulier que vous avez sous les yeux.
- Marge d’erreur
- · la demi-largeur de l'intervalle. Elle décroît comme 1/√n : quadrupler l'échantillon divise la marge par deux, c'est le prix à payer pour gagner en précision.
- Intervalle de Wilson
- · la méthode recommandée pour une proportion (Wilson, 1927) : sa couverture réelle reste proche du niveau annoncé même pour p proche de 0 ou 1, là où celle de Wald s’effondre.
Domaine de validitéL'intervalle sur une moyenne suppose un échantillonnage aléatoire et, pour de petits effectifs.
L'intervalle sur une moyenne suppose un échantillonnage aléatoire et, pour de petits effectifs. Une population approximativement normale. Sur un grand échantillon, le théorème central limite rend l'hypothèse peu contraignante, mais un échantillon biaisé reste biaisé quelle que soit sa taille. Aucune correction pour population finie n'est appliquée (elle importe quand l'échantillon dépasse ~5 % de la population). L'outil ne vérifie pas la normalité de vos données : il calcule sous l'hypothèse, il ne la teste pas.
Piège classique : « 95 % de chances que la vraie valeur y soit »C'est l'interprétation la plus répandue, et elle est fausse dans le cadre fréquentiste.
C'est l'interprétation la plus répandue, et elle est fausse dans le cadre fréquentiste. La vraie valeur est fixe : elle est dans l'intervalle, ou elle n'y est pas. Il n'y a pas de probabilité là-dessus. Ce qui est probabiliste, c'est la procédure : sur un grand nombre d'échantillons, 95 % des intervalles construits ainsi contiendraient la vraie valeur. L'énoncé « 95 % de chances que θ soit dans [a ; b] » appartient à l'approche bayésienne, avec un intervalle de crédibilité, qui n'est pas ce que calcule cet outil.