On ne mesure jamais toute une population : on observe un échantillon et l'on veut en déduire la moyenne ou la proportion inconnue de la population, avec une marge d'erreur maîtrisée. C'est l'objet de l'inférence statistique. Ce chapitre décrit comment fluctue une moyenne d'échantillon, ce qu'est un bon estimateur, puis comment construire un intervalle de confiance — un calcul demandé à chaque session d'examen de Statistiques S3.
1. Population, échantillon et fluctuation d'échantillonnage
La population est décrite par des paramètres inconnus et fixes : la moyenne μ, l'écart-type σ, la proportion p d'individus présentant un caractère. Un échantillon aléatoire de taille n, tiré au hasard (chaque individu ayant la même chance d'être choisi, tirages indépendants), fournit des statistiques calculables : la moyenne observée x̄, l'écart-type observé, la fréquence observée f. Si l'on tire un autre échantillon, ces valeurs changent : c'est la fluctuation d'échantillonnage. Une statistique est donc elle-même une variable aléatoire, et l'inférence consiste à connaître sa loi.
2. Distribution d'échantillonnage de la moyenne et de la proportion
Soit X̄ la moyenne d'un échantillon de taille n tiré d'une population de moyenne μ et d'écart-type σ. Alors E(X̄) = μ et V(X̄) = σ2/n, donc σ(X̄) = σ/√n : la moyenne d'échantillon est centrée sur la vraie moyenne et sa dispersion diminue comme la racine de n (il faut multiplier n par 4 pour diviser l'erreur par 2). Si la population est normale, X̄ suit exactement N(μ, σ/√n) ; sinon, le théorème central limite assure que c'est approximativement vrai dès que n ≥ 30.
Pour un caractère qualitatif de proportion p dans la population, la fréquence observée F = X/n (X suit B(n, p)) vérifie E(F) = p et V(F) = pq/n. Quand np ≥ 5 et nq ≥ 5, F suit approximativement N(p, √(pq/n)). Ces deux résultats sont la clé de tout le reste : ils disent à quelle distance de μ (ou de p) on peut s'attendre à trouver x̄ (ou f).
3. Estimation ponctuelle : estimateurs et biais
Un estimateur T d'un paramètre θ est une statistique dont on utilise la valeur observée comme valeur approchée de θ. Il est sans biais si E(T) = θ, et convergent si sa variance tend vers 0 quand n augmente ; entre deux estimateurs sans biais, le plus efficace est celui de plus petite variance. La moyenne X̄ est un estimateur sans biais et convergent de μ, la fréquence F un estimateur sans biais de p. En revanche la variance observée σobs2 = (1/n) Σ (xi − x̄)2 sous-estime σ2 ; l'estimateur sans biais est la variance corrigée s2 = n/(n−1) × σobs2 = (1/(n−1)) Σ (xi − x̄)2. Le facteur n/(n−1) devient négligeable pour les grands échantillons, mais il est exigé dans les calculs d'examen.
4. Intervalle de confiance d'une moyenne
Une estimation ponctuelle ne dit rien de sa précision ; l'intervalle de confiance (IC) au niveau 1 − α est un intervalle calculé à partir de l'échantillon qui contient le vrai paramètre avec la probabilité 1 − α (et se trompe avec le risque α). Comme X̄ suit N(μ, σ/√n), on obtient, pour σ connu ou pour n ≥ 30 (σ remplacé par s) : IC = [x̄ − zα σ/√n ; x̄ + zα σ/√n] avec zα = 1,96 pour 95 % et 2,576 pour 99 %. Exemple : 100 souris de masse moyenne 25 g avec s = 4 g donnent au niveau 95 % l'intervalle 25 ± 1,96 × 4/10 = [24,2 ; 25,8] g.
Quand σ est inconnu et n < 30, dans une population supposée normale, on remplace z par la valeur tα de la loi de Student à n − 1 degrés de liberté, lue dans la table (t est plus grand que z, l'intervalle est plus large) : IC = [x̄ ± tα, n−1 s/√n]. La largeur de l'intervalle augmente avec le niveau de confiance et avec σ, et diminue avec √n. Attention à l'interprétation : c'est l'intervalle qui est aléatoire, pas μ ; « 95 % » est la proportion d'intervalles, construits sur de nombreux échantillons, qui contiendraient μ.
5. Intervalle de confiance d'une proportion et taille d'échantillon
Avec les conditions nf ≥ 5 et n(1 − f) ≥ 5, l'intervalle de confiance d'une proportion est IC = [f − zα √(f(1−f)/n) ; f + zα √(f(1−f)/n)]. Exemple : 60 germinations sur 200 graines donnent f = 0,30 et, au niveau 95 %, 0,30 ± 1,96 × √(0,3 × 0,7/200) = 0,30 ± 0,064, soit [0,236 ; 0,364]. On peut inverser le calcul pour déterminer la taille d'échantillon nécessaire à une précision e (demi-largeur) donnée : n ≥ (zα σ/e)2 pour une moyenne, n ≥ zα2 p(1−p)/e2 pour une proportion (avec p = 0,5 en l'absence d'information, cas le plus défavorable).
Statistique T dont l'espérance est égale au paramètre estimé : E(T) = θ. La moyenne X̄ est sans biais pour μ ; la variance corrigée s² (division par n − 1) est sans biais pour σ².
Intervalle calculé à partir de l'échantillon qui contient le paramètre inconnu avec la probabilité 1 − α ; α est le risque d'erreur (5 % le plus souvent).
| Paramètre | Conditions | Intervalle au niveau 1 − α | Valeur tabulée |
|---|---|---|---|
| Moyenne μ, σ connu | Population normale ou n ≥ 30 | x̄ ± z σ/√n | z = 1,96 (95 %) |
| Moyenne μ, σ inconnu, n ≥ 30 | TCL | x̄ ± z s/√n | z = 1,96 (95 %) |
| Moyenne μ, σ inconnu, n < 30 | Population normale | x̄ ± t s/√n | t de Student à n − 1 ddl |
| Proportion p | nf ≥ 5 et n(1 − f) ≥ 5 | f ± z √(f(1−f)/n) | z = 1,96 (95 %) |
Quel intervalle de confiance utiliser ?
- Paramètres (μ, σ, p) fixes et inconnus vs statistiques (x̄, s, f) aléatoires : fluctuation d'échantillonnage.
- X̄ suit N(μ, σ/√n) : l'erreur type σ/√n diminue avec la racine de n ; F suit N(p, √(pq/n)).
- Variance corrigée s² = n/(n−1) × σ²<sub>obs</sub> : estimateur sans biais de σ².
- IC moyenne : x̄ ± 1,96 σ/√n (95 %) ; petit échantillon et σ inconnu → t de Student à n − 1 ddl.
- IC proportion : f ± 1,96 √(f(1−f)/n) ; taille d'échantillon n = (zσ/e)² ou z²p(1−p)/e².
Question classique : « Sur un échantillon de n individus on a mesuré x̄ et s ; estimer μ et donner un intervalle de confiance à 95 % puis à 99 %. » Commence par vérifier n ≥ 30 ou non (z ou t), écris la formule littérale, puis remplace. Pièges : oublier de diviser σ par √n, utiliser σobs à la place de s pour un petit échantillon, prendre z = 1,645 au lieu de 1,96 pour un intervalle bilatéral, et affirmer que « μ a 95 % de chances d'être dans l'intervalle ».