Calculatrice de quartiles
Résultat
Écart interquartile (IQR)
- Premier quartile (Q1)
- 4,0000
- Deuxième quartile (Q2)
- 4,5000
- Troisième quartile (Q3)
- 5,5000
- Minimum
- 2,0000
- Maximum
- 9,0000
- Effectif
- 8
Les quartiles découpent une liste triée en quatre parts : un quart des données se situe au plus au niveau de Q1, la moitié au plus au niveau de Q2, les trois quarts au plus au niveau de Q3. Avec la plus petite et la plus grande valeur, ils forment le résumé en cinq nombres, qui décrit la position et l’étalement d’un ensemble de données sans jamais additionner les valeurs. Cette calculatrice de quartiles affiche ces cinq nombres, et place l’écart interquartile — Q3 moins Q1, la largeur de la moitié centrale des données — en tête du résultat, parce que ce seul nombre dit si le centre de la distribution est resserré ou étiré. Elle montre aussi Q2 à côté, qui est la médiane, de sorte que les deux pages s’accordent par construction et non par coïncidence.
Formule
Q1 = valeur à la position (n − 1) × 0,25, Q2 à (n − 1) × 0,5, Q3 à (n − 1) × 0,75, avec interpolation entre les voisins ; IQR = Q3 − Q1
- xᵢ
- Une valeur de l’ensemble de données. Les quartiles sont des positions dans la liste triée, donc ce qui compte est l’ordre des valeurs et non leur taille : une lecture extrême déplace un peu les repères extérieurs mais laisse la moitié centrale presque intacte
- n
- Le nombre de valeurs de la liste, plafonné à 200 ici. Les positions se comptent à partir de 0 et la dernière vaut n − 1, ce qui explique pourquoi les trois positions de quartile se répartissent sur cet intervalle
- Q1
- Le premier quartile, avec environ 25 % des données au plus à son niveau. Il marque la fin du quart inférieur de la liste triée, et ce n’est pas nécessairement une valeur présente dans vos données
- Q2
- Le deuxième quartile, qui est exactement la médiane : la moitié des données au plus à son niveau. Il est imprimé ici pour la comparaison, et la page consacrée à la médiane calcule le même nombre par la même règle
- Q3
- Le troisième quartile, avec environ 75 % des données au plus à son niveau. Avec Q1 il encadre la moitié centrale des données, la partie qu’un diagramme en boîte dessine comme un rectangle
- IQR
- L’écart interquartile, Q3 − Q1 : l’étalement de la moitié centrale. Il porte les unités des données et, contrairement à l’écart type, il est à peine affecté par les valeurs aberrantes puisqu’il ignore complètement les quartiers extérieurs
Les quartiles sont le bon résumé quand les données sont asymétriques, comportent des valeurs aberrantes, ou ne sont pas mesurées sur une échelle où additionner quoi que ce soit a un sens : revenus, prix immobiliers, temps de réponse, notes d’examen. Là où une moyenne et un écart type décrivent une cloche symétrique, le résumé en cinq nombres décrit une distribution de forme quelconque : la médiane dit où se trouve le centre, Q1 et Q3 disent sur quelle largeur s’étend la moitié centrale, et la plus petite et la plus grande valeur bornent le tout. L’écart interquartile accompagne la médiane pour la même raison que l’écart type accompagne la moyenne, et c’est le nombre que l’on cite quand on veut un étalement qu’une seule lecture extrême ne peut pas gonfler. Il est aussi la base du diagramme en boîte et de la règle des 1,5 × IQR qui signale les valeurs aberrantes possibles — la barrière se pose ici, mais le signalement est un autre travail. Servez-vous des quartiles à côté d’un histogramme quand vous le pouvez : quatre points de coupure ne peuvent pas montrer si les données ont deux bosses, et un ensemble de données bimodal produira sans se plaindre un résumé en cinq nombres parfaitement ordinaire.
Exemples détaillés
Huit valeurs : Q1 = 4, Q3 = 5,5, IQR = 1,5
- Tri : 2, 4, 4, 4, 5, 5, 7, 9 — huit valeurs, donc n − 1 = 7
- Q1 : position 7 × 0,25 = 1,75, entre le 4 de la position 1 et le 4 de la position 2, donc Q1 = 4
- Q2 : position 7 × 0,50 = 3,5, entre 4 et 5, donc Q2 = 4,5 — la même médiane que celle annoncée par la page de la médiane
- Q3 : position 7 × 0,75 = 5,25, entre le 5 de la position 5 et le 7 de la position 6 : 5 + 0,25 × 2 = 5,5
- IQR : 5,5 − 4 = 1,5, donc la moitié centrale des données couvre un intervalle de 1,5
La moitié centrale est ici formée des quatre valeurs de 4 à 5,5, et l’écart interquartile est la largeur de cette bande. Remarquez que Q1 est tombé exactement sur une valeur observée alors que Q3 non : le fait qu’un quartile coïncide ou non avec une valeur dépend entièrement de l’effectif, et le résumé en cinq nombres décrit des positions, pas un sous-ensemble des données.
Quatre valeurs, où chaque quartile est interpolé
- Tri : 1, 2, 3, 4 — quatre valeurs, donc n − 1 = 3
- Q1 : position 3 × 0,25 = 0,75, aux trois quarts du chemin de 1 vers 2, donc Q1 = 1,75
- Q2 : position 3 × 0,50 = 1,5, à mi-chemin entre 2 et 3, donc Q2 = 2,5
- Q3 : position 3 × 0,75 = 2,25, au quart du chemin de 3 vers 4, donc Q3 = 3,25
- IQR : 3,25 − 1,75 = 1,5
C’est le cas qui sépare les conventions, et il vaut donc la peine de savoir ce que donne l’autre. La méthode employée par OpenStax et par beaucoup de manuels coupe les données à la médiane et prend le milieu de chaque moitié : la moitié inférieure est 1 et 2, donc Q1 = 1,5 ; la moitié supérieure est 3 et 4, donc Q3 = 3,5, et l’écart interquartile devient 2. Cette page interpole entre les voisins, ce qui est la convention par défaut de R et de NumPy, et elle imprime Q1 et Q3 pour que vous voyiez quelle convention les a produits.
Les 14 valeurs du manuel, calculées de l’autre façon
- Tri : 1, 1, 2, 2, 4, 6, 6,8, 7,2, 8, 8,3, 9, 10, 10, 11,5 — quatorze valeurs, donc n − 1 = 13
- Q2 : position 13 × 0,50 = 6,5, à mi-chemin entre 6,8 et 7,2, donc Q2 = 7 — exactement la médiane annoncée par le manuel
- Q1 : position 13 × 0,25 = 3,25, au quart du chemin du 2 de la position 3 vers le 4 de la position 4, donc Q1 = 2,5
- Q3 : position 13 × 0,75 = 9,75, aux trois quarts du chemin de 8,3 vers 9, donc Q3 = 8,825
- IQR : 8,825 − 2,5 = 6,325
Ces quatorze nombres se trouvent dans la section d’OpenStax sur les mesures de position, qui emploie la méthode des moitiés et annonce Q1 = 2 et Q3 = 9, soit un écart interquartile de 7. Les deux réponses viennent d’une règle documentée et enseignable ; elles diffèrent parce qu’elles n’interpolent pas de la même façon entre les mêmes observations. La médiane, elle, tombe exactement pareil, et c’est la partie rassurante : quelle que soit la convention, le milieu d’un ensemble de données reste le milieu d’un ensemble de données.
Limites
Quatre points de coupure ne suffisent pas à décrire une distribution. Deux ensembles de données peuvent partager tous leurs quartiles et ne pas se ressembler du tout — l’un regroupé, l’autre à deux bosses — donc lisez le résumé en cinq nombres à côté d’un histogramme quand la forme compte. Les quartiles sont aussi une convention plutôt qu’un fait : cette page interpole entre les valeurs voisines, suivant la méthode de Hyndman–Fan de type 7, et la méthode des moitiés employée par beaucoup de manuels donnera des nombres différents dès que l’effectif n’est pas un multiple de quatre. L’effectif compte d’une autre manière encore : en dessous de quatre valeurs chaque quartile est une interpolation, et avec une seule valeur les cinq nombres valent cette valeur et l’écart interquartile vaut zéro puisqu’il n’y a aucun étalement à mesurer. La liste est plafonnée à 200 valeurs, et un jeton comme « 1,500 » est refusé plutôt que deviné, parce qu’une virgule entre deux chiffres est un séparateur décimal dans certains pays et un séparateur de milliers dans d’autres. Rien sur cette page ne signale les valeurs aberrantes : la barrière des 1,5 × IQR est la règle habituelle pour cela, et l’appliquer est le travail d’un autre outil.
Questions fréquentes
- Comment trouve-t-on les quartiles d’un ensemble de données ?
- Pour trouver les quartiles, triez la liste, puis lisez trois positions : (n − 1) × 0,25 pour Q1, (n − 1) × 0,50 pour Q2 et (n − 1) × 0,75 pour Q3, en interpolant quand une position tombe entre deux valeurs. Avec huit valeurs les positions valent 1,75, 3,5 et 5,25, ce qui donne Q1 = 4, Q2 = 4,5 et Q3 = 5,5. L’écart interquartile est ensuite Q3 − Q1, soit 1,5 ici. Les trois quartiles ainsi que la plus petite et la plus grande valeur sont imprimés ci-dessus, donc tout le résumé tient sur un écran.
- Pourquoi mon Q1 diffère-t-il de celui d’une autre calculatrice ?
- Parce que les quartiles sont une convention et non un fait, et que les deux conventions courantes ne s’accordent plus dès que l’effectif n’est pas un multiple de quatre. Cette page interpole entre les valeurs voisines, suivant la méthode de Hyndman–Fan de type 7, qui est la valeur par défaut de R et de NumPy. Beaucoup de manuels, dont OpenStax, coupent plutôt les données à la médiane et prennent le milieu de chaque moitié : sur ses propres quatorze valeurs, cela donne Q1 = 2 et Q3 = 9, tandis que cette page renvoie 2,5 et 8,825. Les deux sont des règles documentées. Q2, la médiane, ressort identique dans les deux cas.
- Que m’apprend l’écart interquartile ?
- C’est la largeur de la moitié centrale des données : l’intervalle qui contient les 50 % des valeurs comprises entre Q1 et Q3. Il porte les unités de vos données, donc un écart interquartile de 1,5 signifie que la moitié centrale s’étend sur 1,5 de ce que vous avez mesuré. Comme il écarte les quartiers supérieur et inférieur, une lecture extrême ne le déplace presque pas, et c’est pourquoi c’est l’étalement que l’on cite habituellement à côté d’une médiane. Un écart interquartile nul signifie que la moitié centrale est une seule valeur répétée — la moitié de vos données au moins est identique — et non que quelque chose s’est mal passé.
- Qu’est-ce que le résumé en cinq nombres ?
- La plus petite valeur, Q1, la médiane, Q3 et la plus grande valeur — les cinq nombres imprimés par cette page, généralement cités dans cet ordre. C’est la façon habituelle de décrire un ensemble de données sans supposer de forme particulière, et c’est exactement ce que dessine un diagramme en boîte : un rectangle de Q1 à Q3 avec un trait à la médiane, et des moustaches jusqu’aux extrêmes. L’écart interquartile affiché en tête ne fait pas partie des cinq ; c’est Q3 − Q1, la largeur du rectangle.
- Un quartile peut-il être une valeur absente de mes données ?
- Oui, et sur les courtes listes c’est le cas habituel. Un quartile est une position sur l’échelle des données, donc 1,75 pour les quatre valeurs 1, 2, 3 et 4 est un premier quartile parfaitement ordinaire même si la liste ne contient aucun 1,75. Quand une position tombe exactement sur un nombre entier, le quartile coïncide au contraire avec une valeur observée. Les deux cas sont imprimés avec l’effectif à côté, de sorte que vous voyez lequel vous regardez.
- Cette page signale-t-elle les valeurs aberrantes ?
- Non. Elle donne l’écart interquartile, qui est l’entrée de la règle habituelle : une valeur est traitée comme une valeur aberrante possible lorsqu’elle se situe à plus de 1,5 × IQR sous Q1 ou au-dessus de Q3. Appliquer cette barrière est délibérément le travail d’un autre outil, pour que cette page reste une description honnête des données plutôt qu’un verdict sur les points à écarter. Pour les huit valeurs ci-dessus, 1,5 × IQR vaut 2,25, donc la barrière va de 1,75 à 7,75.
Références
- Measures of the Location of the Data — Introductory Statistics 2e, section 2.3 (defines the quartiles and the interquartile range as the spread of the middle half, and works through the 14-value example; its halves method differs from the interpolation used here) — OpenStax, Rice University
- Quartiles — définitions et méthodes (les quartiles partagent une distribution en quatre parties égales ; Q1 est la valeur au-dessous de laquelle se situent 25 % de la population) — Insee (Institut national de la statistique et des études économiques)
- quantile — R stats package reference (documents the nine quantile types; type 7, the default, is the convention used here for all three quartiles) — The R Project for Statistical Computing
- numpy.quantile — NumPy reference (the method="linear" default interpolates exactly as this page does) — NumPy
- GB/T 3358.1-2009, Statistics — Vocabulary and symbols, Part 1 (the Chinese national vocabulary standard covering the quartiles and the interquartile range; the record page notes that no online full text is offered) — State Administration for Market Regulation, China