Calculadora de desviación estándar
Resultado
Desviación estándar
- Varianza
- 4,5714
- Media
- 5,0000
- Suma de las desviaciones al cuadrado
- 32,0000
- Cantidad
- 8
- Suma
- 40,0000
La desviación estándar dice a qué distancia típica de su media se sitúan los valores de un conjunto de datos, medida en las mismas unidades que los datos. Escribe o pega los números —uno por línea, o separados por punto y coma, comas o espacios— y esta calculadora obtiene la cantidad, la suma, la media y la suma de las desviaciones al cuadrado, y después divide y saca una raíz cuadrada. Ese último paso es el que devuelve la respuesta a las unidades que escribiste. Elige la versión muestral, que divide entre n − 1, o la poblacional, que divide entre n: entre las dos respuestas no hay más diferencia que ese divisor. En buena parte de los textos de habla hispana esta misma cantidad se llama desviación típica.
Fórmula
Desviación estándar = √( Σ (xᵢ − x̄)² ÷ (n − 1) ) para una muestra, o la misma suma dividida entre n para una población
- xᵢ
- Un valor del conjunto de datos. Cada valor entra como su distancia a la media, y elevar esa distancia al cuadrado es lo que impide que las distancias por encima de la media anulen a las que quedan por debajo
- x̄
- La media de los datos: la suma de todos los valores dividida entre cuántos hay. Se imprime junto a la respuesta para poder comprobar el desarrollo
- n
- Cuántos valores tiene el conjunto de datos, hasta 200 aquí. El divisor es n − 1 para una muestra y n para una población, y esa es la única diferencia entre las dos desviaciones estándar
- Σ (xᵢ − x̄)²
- La suma de las desviaciones al cuadrado: la distancia de cada valor a la media se eleva al cuadrado y luego se suman. Queda en unidades al cuadrado, y por eso exactamente el último paso saca una raíz
- s
- La desviación estándar, en las unidades originales de los datos. Sumar la misma constante a todos los valores la deja igual; multiplicarlos todos por dos la multiplica por dos
Úsala cuando un solo número tenga que representar cuánto se reparten una serie de mediciones: lecturas repetidas de la misma cantidad, notas de examen, la recaudación diaria, los pesos de un lote de piezas. Informa la desviación estándar muestral cuando los números que tienes son una muestra de algo mayor, y pasa a la versión poblacional solo cuando la lista sea de verdad el grupo completo. Es además el número que convierte un valor bruto en una puntuación z, y en el que se apoyan casi todas las reglas de valores atípicos. Fíjate en lo que compra la raíz cuadrada: la suma de las desviaciones al cuadrado lleva unidades al cuadrado, y sacar la raíz es lo que, según la sección Measures of Scale de NIST, devuelve las unidades de la dispersión a las unidades originales de los datos mientras que la varianza las eleva al cuadrado. Hay dos cosas que no te dirá: si la dispersión es simétrica y si un valor extremo es una errata. Un conjunto de datos sesgado se describe mejor con sus cuartiles y su mediana.
Ejemplos resueltos
Ocho valores, muestra y población una al lado de la otra
- Cantidad: 8 valores; suma: 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40
- Media: 40 ÷ 8 = 5
- Desviaciones respecto a la media: −3, −1, −1, −1, 0, 0, 2, 4
- Desviaciones al cuadrado: 9 + 1 + 1 + 1 + 0 + 0 + 4 + 16 = 32
- Varianza muestral: 32 ÷ (8 − 1) = 4,5714
- Desviación estándar muestral: √4,5714 = 2,1381
Esos mismos ocho valores como población dan una varianza de 32 ÷ 8 = 4 y una desviación estándar de exactamente 2. Elegir mal el divisor es la razón más frecuente de que una desviación estándar no coincida con la de otra herramienta, y aquí cambia la respuesta alrededor de un 7 %: más cuando la lista es corta, menos cuando es larga.
Cinco notas de examen
- Suma: 85 + 90 + 78 + 92 + 88 = 433, entre 5 notas
- Media: 433 ÷ 5 = 86,6
- Desviaciones al cuadrado: 2,56 + 11,56 + 73,96 + 29,16 + 1,96 = 119,2
- Varianza muestral: 119,2 ÷ 4 = 29,8
- Desviación estándar muestral: √29,8 = 5,4589
Lee las desviaciones y las desviaciones al cuadrado una junto a otra: el 78 queda 8,6 puntos por debajo de la media y aporta 73,96 a la suma, más que las otras cuatro notas juntas. Elevar una distancia al cuadrado es lo que da su peso a los valores alejados, y es también la razón de que un solo mal día mueva la desviación estándar más de lo que mueve la media.
Una población de tres, donde los dos divisores se separan mucho
- Suma: 4 + 8 + 6 = 18, entre 3 valores, así que la media es 6
- Desviaciones: −2, 2, 0; al cuadrado: 4, 4, 0, lo que da una suma de cuadrados de 8
- Varianza poblacional: 8 ÷ 3 = 2,6667
- Desviación estándar poblacional: √2,6667 = 1,633
Tres valores es la lista más corta que esta página trata como muestra, y es donde el divisor enseña los dientes: la versión muestral divide esos mismos 8 entre 2 y da 2 en lugar de 1,633, una diferencia de más del 20 %. La desviación estándar muestral es siempre la mayor de las dos, y la distancia entre ambas se encoge según crece el conjunto de datos.
Limitaciones
Esta es la desviación estándar aritmética sin más de una lista de números. No tiene forma de usar pesos, así que un valor escrito una vez cuenta una vez: una tabla de frecuencias o una encuesta ponderada necesitan otro cálculo. Describe la dispersión, no la forma: un conjunto de datos sesgado tiene un lado corto y una cola larga, y la sección Measures of the Spread of the Data de OpenStax dice explícitamente que en una distribución sesgada la desviación estándar puede no ser de mucha ayuda, y que es preferible recurrir a los cuartiles y a la mediana. Todos los valores cuentan, así que un solo valor atípico mal tecleado infla la respuesta. La lista está limitada a 200 valores. Una forma como 1,500 se rechaza en lugar de adivinar qué significa, porque una coma entre dígitos es una parte decimal en buena parte del mundo y un separador de millares en otras partes; escribe 1500 o 1,5. Por último, los números se leen exactamente como se escriben, en todos los idiomas: el separador que uses nunca cambia lo que significa la lista.
Preguntas frecuentes
- ¿Qué diferencia hay entre la desviación estándar muestral y la poblacional?
- Un divisor. Las dos parten de la misma suma de las desviaciones al cuadrado, y después la versión muestral divide entre n − 1 y la poblacional entre n. Para los ocho valores 2, 4, 4, 4, 5, 5, 7 y 9 la suma de cuadrados es 32, así que la desviación estándar muestral es √(32 ÷ 7) = 2,1381 y la poblacional es √(32 ÷ 8) = 2. La respuesta muestral es siempre la mayor de las dos, y ambas se acercan según crece el conjunto de datos.
- ¿Cómo se calcula la desviación estándar a mano?
- Cinco pasos. Suma los valores y divide entre cuántos hay para obtener la media. Resta la media a cada valor para obtener su desviación. Eleva al cuadrado cada desviación: elevar al cuadrado es lo que impide que las que quedan por encima de la media anulen a las que quedan por debajo. Suma los cuadrados. Divide entre n − 1 si es una muestra o entre n si es una población, y saca la raíz cuadrada. La fórmula es la misma en los dos casos; lo único que cambia es el divisor. El panel imprime la cantidad, la suma, la media y la suma de las desviaciones al cuadrado, así que cualquier paso se puede comprobar por separado.
- ¿Por qué la versión muestral divide entre n − 1 en lugar de entre n?
- Porque la media que restas se midió con esos mismos valores, y cada valor tiró de esa media hacia sí mismo. Las desviaciones medidas respecto a una media que los propios datos eligieron son, en promedio, algo más pequeñas que la dispersión verdadera, así que dividir entre n la dejaría corta. Dividir entre n − 1 corrige eso. La corrección importa sobre todo en listas cortas —con tres valores es una diferencia del 22 %— y resulta despreciable cuando hay unos cientos.
- ¿Puedo pegar una columna tal cual desde una hoja de cálculo?
- Sí. Los saltos de línea, los tabuladores, los puntos y coma, los espacios y una coma seguida de espacio separan valores, así que tanto una columna pegada como una línea escrita con puntos y coma funcionan. Los tramos vacíos se ignoran en lugar de rechazarse, de modo que un salto de línea final es inofensivo. Se leen hasta 200 valores. Una forma se rechaza a propósito: la del tipo 1,500 o 1.500, donde detrás del separador van tres dígitos, porque eso es un separador de millares en unos países y una parte decimal en otros; escribe 1500 o 1,5.
- ¿En qué unidades viene la desviación estándar?
- En las mismas unidades que los datos. Pesa un lote de piezas en gramos y la desviación estándar saldrá en gramos, que es justo para lo que se saca la raíz cuadrada al final: la suma de las desviaciones al cuadrado está en gramos al cuadrado, y la varianza también. NIST lo dice sin rodeos: la desviación estándar devuelve las unidades de la dispersión a las unidades originales de los datos, mientras que la varianza eleva las unidades al cuadrado. Por eso una desviación estándar se puede leer junto a los valores que describe y una varianza no.
- ¿Por qué mi resultado no coincide con el de otra calculadora?
- Nueve de cada diez veces, por el divisor. Muchas herramientas devuelven solo la desviación estándar poblacional, o solo la muestral, sin decir cuál. Busca en el otro programa si pone n − 1 o n. Merece la pena descartar otras dos causas: un valor escrito con coma decimal que la otra herramienta leyó como separador, y un valor atípico que uno de los dos incluyó y el otro no, porque la desviación estándar es sensible a cada valor, así que un número de más la cambia.
Referencias
- Measures of Scale — e-Handbook of Statistical Methods, section 1.3.5.6 (defines the standard deviation as the square root of the sum of squared deviations divided by n − 1, and states that taking the root restores the units of the spread to the original data units while the variance squares the units) — National Institute of Standards and Technology (NIST)
- Measures of the Spread of the Data — Introductory Statistics 2e, section 2.7 (defines the standard deviation as a number that measures how far the data values are from their mean, and warns that it may not be much help for a skewed distribution, where quartiles and the median are preferred) — OpenStax, Rice University
- Detection of Outliers — e-Handbook of Statistical Methods, section 1.3.5.17 (the source of the small-sample caveat: the largest possible z-score in a sample of n values is at most (n − 1) ÷ √n, so with fewer than about eleven values a rule set at three standard deviations never fires) — National Institute of Standards and Technology (NIST)