📊
Types de données en santéEn santé, on recueille des données sur les patients : âge, poids, groupe sanguin, présence d'une maladie. Ces données sont classées en variables qualitatives (catégorielles) et quantitatives (numériques). Les variables qualitatives peuvent être nominales (sexe, groupe sanguin) ou ordinales (stade d'un cancer). Les variables quantitatives sont discrètes (nombre d'enfants) ou continues (taille, pression artérielle). Cette distinction est cruciale car elle détermine les méthodes statistiques à utiliser.
📖 Définition
Variable qualitative : décrit une qualité ou catégorie, non mesurable numériquement (ex. sexe, groupe sanguin).
📖 Définition
Variable quantitative : s'exprime par un nombre, mesurable (ex. âge, glycémie).
🔍 Exemple
Le stade TNM d'un cancer est une variable qualitative ordinale.
💡 À retenir : La nature de la variable dicte le choix du test statistique.
📈
Résumer les donnéesPour décrire un échantillon, on utilise des indicateurs de tendance centrale (moyenne, médiane) et de dispersion (écart-type, écart interquartile). La moyenne est sensible aux valeurs extrêmes, contrairement à la médiane. L'écart-type mesure la dispersion autour de la moyenne. La boîte à moustaches (boxplot) visualise la médiane, les quartiles et les valeurs aberrantes. Ces outils permettent de résumer de grandes quantités de données de santé.
📢 Rappel
Un échantillon est un sous-ensemble représentatif d'une population.
⭐ À retenir
En présence de valeurs aberrantes, préférer la médiane et l'écart interquartile à la moyenne et l'écart-type.
💡 À retenir : La médiane est robuste aux valeurs extrêmes, contrairement à la moyenne.
🎲
Lois de probabilitéLa loi normale, en forme de cloche, est définie par sa moyenne μ et son écart-type σ. Elle modélise de nombreux phénomènes biologiques (taille, pression artérielle). La loi binomiale décrit le nombre de succès dans une série d'épreuves indépendantes (ex. nombre de patients guéris). Le théorème central limite (TCL) stipule que la moyenne d'un échantillon de taille suffisante (n≥30) suit approximativement une loi normale, quelle que soit la distribution d'origine. Ce théorème fonde l'inférence statistique.
📖 Définition
Loi normale : distribution continue symétrique, caractérisée par μ et σ.
⭐ À retenir
Pour n≥30, la distribution des moyennes d'échantillons est approximativement normale (TCL).
💡 À retenir : Le TCL justifie l'usage de tests paramétriques même si la population n'est pas normale, pour n≥30.
🔬
Tests d'hypothèsesUn test statistique débute par deux hypothèses : H0 (nulle, absence d'effet) et H1 (alternative, présence d'un effet). On calcule une statistique de test, puis la p-value : probabilité d'observer un résultat au moins aussi extrême si H0 est vraie. On compare la p-value au seuil α (souvent 0,05). Si p < α, on rejette H0 et on conclut à un effet significatif. Attention, une p-value ne mesure pas la taille de l'effet ni son importance clinique.
📖 Définition
p-value : probabilité d'obtenir une statistique de test aussi extrême que celle observée, sous H0.
⭐ À retenir
p < 0,05 → rejet de H0 ; p ≥ 0,05 → non-rejet de H0. Ne pas confondre non-rejet et acceptation de H0.
💡 À retenir : Une p-value < 0,05 signifie que les données sont peu compatibles avec H0.