Fiche de révision · S6
Résumé — Biostatistique
Tout le module en une page : les chapitres condensés en points essentiels, le vocabulaire et les pièges d'examen. Pour la veille de l'épreuve.
1
Introduction à la biostatistique et statistique descriptive
- Population = ensemble complet ; échantillon = sous-ensemble étudié, représentatif si tirage aléatoire.
- Variable qualitative (nominale ou ordinale) vs quantitative (discrète ou continue) → détermine le graphique adapté.
- Effectif n<sub>i</sub> vs fréquence relative f<sub>i</sub> = n<sub>i</sub> / N ; somme des f<sub>i</sub> = 1.
- Diagramme en bâtons (discrète) vs histogramme (continue, surface proportionnelle à l'effectif) vs secteurs (qualitative).
- Effectifs cumulés croissants/décroissants → lecture graphique de la médiane et des quantiles.
2
Paramètres de position et de dispersion
- Mode, médiane, moyenne : trois paramètres de position, confondus seulement si la distribution est symétrique.
- Moyenne x̄ = (Σ n<sub>i</sub>x<sub>i</sub>) / N, sensible aux valeurs extrêmes → médiane, peu sensible, lui est préférée en cas d'asymétrie.
- Variance V = moyenne des carrés des écarts à la moyenne ; écart-type σ = √V, même unité que la variable.
- Coefficient de variation CV = (σ / x̄) × 100 : dispersion relative, sans unité, compare des séries différentes.
- Intervalle interquartile Q3 − Q1 : dispersion de la moitié centrale, insensible aux valeurs extrêmes.
3
Notions de probabilités
- P(A) ∈ [0, 1] ; P(Ω) = 1 ; événement contraire P(Ā) = 1 − P(A).
- Incompatibles → P(A ou B) = P(A) + P(B) ; cas général → P(A ou B) = P(A) + P(B) − P(A et B).
- Probabilité conditionnelle P(A|B) = P(A et B) / P(B) ; indépendance ⇔ P(A et B) = P(A) × P(B).
- Variable aléatoire discrète = loi de probabilité + espérance E(X) + variance V(X), équivalents théoriques de la moyenne et de la variance.
- Théorème des probabilités totales : P(B) = Σ P(A<sub>i</sub>) × P(B|A<sub>i</sub>) sur une partition de l'univers.
4
Lois de probabilité usuelles
- Loi binomiale B(n, p) : n épreuves indépendantes à deux issues, p constant ; E(X) = np, V(X) = np(1 − p).
- Loi de Poisson (λ) : événements rares et indépendants ; particularité E(X) = V(X) = λ.
- Loi normale N(μ, σ) : courbe en cloche symétrique ; ≈ 68 % dans [μ − σ, μ + σ], ≈ 95 % dans [μ − 2σ, μ + 2σ].
- Variable centrée réduite Z = (X − μ) / σ → ramène toute loi normale à N(0, 1), lue dans la table de Gauss.
- Binomiale ≈ Poisson si n grand et p petit (λ = np) ; binomiale ≈ normale si n grand et p ni trop petit ni trop grand.
5
Échantillonnage et estimation
- Fluctuation d'échantillonnage : x̄ varie d'un échantillon à l'autre, écart-type = erreur standard σ / √n.
- Théorème central limite : x̄ suit approximativement N(μ, σ / √n) quand n est assez grand, quelle que soit la loi de départ.
- Estimation ponctuelle : x̄ pour μ, f pour p ; variance corrigée (division par n − 1) pour estimer σ² sans biais.
- Intervalle de confiance de la moyenne : x̄ ± z × (σ / √n) ; z lu dans la table normale selon le niveau de confiance (souvent 95 %, z ≈ 1,96).
- Intervalle de confiance d'une proportion : f ± z × √(f(1 − f) / n).
6
Tests d'hypothèses statistiques
- H0 = pas de différence vs H1 = différence réelle ; risque α (rejeter H0 à tort) souvent fixé à 5 %, risque β (ne pas la rejeter à tort).
- On rejette H0 si la statistique calculée > valeur critique de la table, ou si p-valeur < α.
- Test t de Student : comparaison de moyennes (un échantillon, deux indépendants, séries appariées).
- Test du Khi-deux (χ²) : indépendance ou ajustement de variables qualitatives, effectifs observés vs théoriques.
- ANOVA : comparaison de plus de deux moyennes par décomposition de la variance (test F de Fisher-Snedecor).
7
Corrélation et régression linéaire
- Nuage de points (x<sub>i</sub>, y<sub>i</sub>) avant tout calcul ; covariance positive/négative selon le sens de variation commun.
- Coefficient de corrélation r ∈ [−1, +1], sans unité ; proche de ±1 = relation linéaire forte, proche de 0 = absente.
- Droite de régression y = ax + b, ajustée par la méthode des moindres carrés (minimise les écarts au carré).
- R² = part de la variabilité de Y expliquée par X à travers la droite de régression.
- Corrélation ≠ causalité : toujours envisager un facteur de confusion avant de conclure à un lien de cause à effet.
Vocabulaire à connaître par cœur
- Échantillon
- sous-ensemble étudié de la population
- Écart-type
- dispersion moyenne autour de la moyenne
- Médiane
- valeur centrale de la série ordonnée
- Probabilité conditionnelle
- P(A) sachant B réalisé
- Loi normale
- courbe en cloche symétrique N(μ, σ)
- Erreur standard
- écart-type de la moyenne d'échantillon (σ / √n)
- Intervalle de confiance
- fourchette contenant probablement le vrai paramètre
- Hypothèse nulle (H0)
- absence de différence testée par défaut
- p-valeur
- seuil comparé à α pour rejeter H0
- Khi-deux (χ²)
- test d'indépendance ou d'ajustement qualitatif
- Coefficient de corrélation (r)
- force d'une relation linéaire entre deux variables
- Régression linéaire
- droite y = ax + b ajustée par moindres carrés