Mathématiques
Calculatrice de statistiques descriptives
Collez ou saisissez vos données : moyenne, médiane, mode, écart type et quartiles sont calculés au fil de la frappe.
Comment lire ces indicateurs
Les statistiques descriptives résument un ensemble de données en quelques mesures, réparties en deux familles. Les indicateurs de position disent où se trouve le centre : moyenne, médiane et mode. Les indicateurs de dispersion disent à quel point les valeurs s'écartent de ce centre : étendue, variance, écart type et écart interquartile. Les deux familles sont nécessaires, car deux ensembles de même moyenne peuvent avoir des formes complètement différentes.
Moyenne et médiane répondent à la même question de deux manières. La moyenne additionne toutes les valeurs et divise par leur nombre : elle subit donc l'influence des valeurs extrêmes, un seul salaire très élevé déplaçant la moyenne d'un service entier. La médiane est la valeur qui se trouve au milieu une fois les données triées, et ne bouge pas pour une seule valeur aberrante. Quand moyenne et médiane s'écartent nettement, la distribution est asymétrique et c'est la médiane qui décrit le mieux le cas typique.
L'écart type est la racine carrée de la variance, avec l'avantage d'être exprimé dans la même unité que les données. Il en existe deux versions : celle de population divise par n et s'emploie lorsque les données constituent l'ensemble étudié tout entier ; celle d'échantillon divise par n − 1 (correction de Bessel) et s'emploie lorsque les données sont un échantillon tiré d'une population plus large. La seconde est légèrement plus grande, parce qu'elle corrige la tendance de l'échantillon à sous-estimer la variabilité réelle.
Exemple chiffré avec les données 12, 15, 15, 18, 21, 24, 24, 24, 30 : la somme vaut 183 pour 9 valeurs, donc la moyenne est 20,33. Une fois triées, la valeur centrale est la cinquième, soit 21 : c'est la médiane. Le 24 apparaît trois fois, c'est le mode. L'écart type de population vaut 5,52, celui d'échantillon 5,85. Le premier quartile vaut 15 et le troisième 24 : la moitié des données se situe donc entre ces deux valeurs.
Erreurs fréquentes
- Employer l'écart type d'échantillon pour des données qui représentent la population entière, ou l'inverse : l'écart est négligeable sur de grands effectifs, mais sensible en dessous d'une trentaine d'observations.
- Décrire par la seule moyenne une distribution fortement asymétrique, comme les revenus : la médiane rend mieux compte du cas typique.
- Confondre absence de mode et mode multiple : si toutes les valeurs apparaissent le même nombre de fois il n'y a pas de mode, alors que deux valeurs à fréquence maximale égale donnent une distribution bimodale.
- Comparer les écarts types de grandeurs d'unités ou d'ordres de grandeur différents : c'est le rôle du coefficient de variation, qui rapporte la dispersion à la moyenne.
- Oublier que les quartiles peuvent être calculés selon plusieurs conventions : cette page utilise l'interpolation linéaire, la même que les tableurs, et d'autres ouvrages peuvent renvoyer des valeurs légèrement différentes.
Questions fréquentes
Quelle est la différence entre moyenne, médiane et mode ?
La moyenne est la somme des valeurs divisée par leur nombre. La médiane est la valeur centrale des données triées, ou la moyenne des deux valeurs centrales si l'effectif est pair. Le mode est la valeur qui revient le plus souvent. Sur une distribution symétrique, les trois coïncident presque ; sur une distribution asymétrique, elles se séparent.
Dois-je utiliser l'écart type de population ou d'échantillon ?
Si les données constituent l'ensemble qui vous intéresse — les notes de toute la classe — utilisez celui de population, qui divise par n. S'il s'agit d'un échantillon dont vous voulez tirer des conclusions sur un ensemble plus large, utilisez celui d'échantillon, qui divise par n − 1.
Qu'indique le coefficient de variation ?
C'est le rapport entre l'écart type et la moyenne, exprimé en pourcentage. Il sert à comparer la dispersion de grandeurs différentes : une variabilité de 5 sur une moyenne de 10 pèse bien plus que la même variabilité sur une moyenne de 1 000.
Comment calcule-t-on les quartiles ?
Q1 laisse au-dessous de lui un quart des données triées, Q3 les trois quarts. Cette calculatrice les obtient par interpolation linéaire entre les valeurs voisines de la position théorique, la convention qu'emploient les tableurs. La différence Q3 − Q1 est l'écart interquartile.
Sous quel format dois-je saisir les données ?
Comme vous préférez : séparées par des espaces, des virgules, des points-virgules ou des retours à la ligne. Vous pouvez coller directement une colonne copiée depuis Excel ou un CSV. La virgule est traitée comme un séparateur entre valeurs, il faut donc utiliser le point pour les décimales.
Comment fonctionne ce calcul
Moyenne : x̄ = Σxᵢ / n. Médiane : valeur en position (n + 1) / 2 sur les données triées, interpolée lorsque la position n'est pas entière. Variance de population : σ² = Σ(xᵢ − x̄)² / n ; variance d'échantillon : s² = Σ(xᵢ − x̄)² / (n − 1). L'écart type est la racine carrée de la variance correspondante. Les quartiles s'obtiennent en position p × (n − 1) par interpolation linéaire entre les valeurs voisines. Coefficient de variation = σ / |x̄| × 100.
Calculs liés
Propagation des incertitudes
Incertitude d'une grandeur calculée par n'importe quelle formule, en quadrature et en erreur maximale, et moyenne de mesures répétées avec son incertitude.
Régression linéaire
Droite des moindres carrés avec les incertitudes sur la pente et l'ordonnée à l'origine, pondérée si vous avez les σ, coefficient de corrélation et χ², avec le graphique.
Moyenne des notes
Moyenne simple et pondérée, et note nécessaire pour l'objectif.
Probabilités
Probabilité classique, conditionnelle, Bayes et loi binomiale.