---
title: "Estadística descriptiva"
book: "Matemáticas de secundaria"
subject: math
language: es
chapter: 17
exercises: 10
source: https://one-course.com/books/math/2/es/chapter/17-estadistica-descriptiva
---

# Capítulo 17 — Estadística descriptiva

La estadística comprime una lista de números en unos pocos resúmenes con sentido: dónde se sitúan los datos ([media](#def-g11-stat-mean), [mediana](#def-g11-stat-median)) y hasta qué punto están dispersos ([cuartiles](#def-g11-stat-quartiles), [varianza](#def-g11-stat-variance), [desviación típica](#def-g11-stat-variance)). Este capítulo lo desarrolla todo sobre un mismo ejemplo. Los mismos resúmenes reaparecen para las variables aleatorias en el [Capítulo 18](https://one-course.com/books/math/2/es/chapter/18-probabilidad-y-variables-aleatorias#ch-g11-prob), y sus leyes probabilísticas, en el [Capítulo 34](https://one-course.com/books/math/2/es/chapter/34-sumas-de-variables-aleatorias-y-la-ley-de-los-grandes-numeros#ch-g12-sums).

A lo largo del capítulo, nuestro conjunto de datos de referencia son las notas (sobre $20$) de una clase de $12$ alumnos:

$$
8,\ 9,\ 10,\ 10,\ 11,\ 12,\ 12,\ 12,\ 13,\ 14,\ 16,\ 17 .
$$

## 17.1 Media y mediana

**Definición 17.1 (Media).**

La *media* de los valores $x_1, x_2, \dots, x_n$ es

$$
\bar x = \frac{x_1 + x_2 + \dots + x_n}{n}.
$$

Si el valor $x_i$ aparece con frecuencia $n_i$ (con $n_1 + \dots + n_k = n$), entonces $\bar x = \frac{n_1 x_1 + \dots + n_k x_k}{n}$.

**Definición 17.2 (Mediana).**

Una *mediana* de un conjunto de datos ordenado es un valor que lo parte por la mitad: al menos la mitad de los valores son $\leq$ que él y al menos la mitad son $\geq$ que él. En la práctica se ordenan los $n$ valores; si $n$ es [impar](https://one-course.com/books/math/2/es/chapter/11-funciones-y-variacion#def-g11-func-parity), la mediana es el valor central; si $n$ es par, se toma el [punto medio](https://one-course.com/books/math/2/es/chapter/5-geometria-analitica#prop-g10-coordgeom-midpoint) de los dos valores centrales.

**Ejemplo 17.3.**

Para nuestro conjunto de datos, la suma es $144$, luego $\bar x = \frac{144}{12} = 12$. Los dos valores centrales (el $6$ y el $7$ de la lista ordenada) son los dos $12$, así que la [mediana](#def-g11-stat-median) también es $12$. La [media](#def-g11-stat-mean) y la [mediana](#def-g11-stat-median) no tienen por qué coincidir: la [mediana](#def-g11-stat-median) ignora *cuán lejos* están los valores extremos y la [media](#def-g11-stat-mean), no. Sustituir la nota más alta, $17$, por $20$ mueve la [media](#def-g11-stat-mean) a $12.25$, pero deja la [mediana](#def-g11-stat-median) en $12$.

## 17.2 Cuartiles

**Definición 17.4 (Cuartiles, recorrido intercuartílico).**

El *primer cuartil* $Q_1$ es el menor valor tal que al menos una cuarta parte de los datos es $\leq Q_1$; el *tercer cuartil* $Q_3$ es el menor valor tal que al menos tres cuartas partes de los datos son $\leq Q_3$. El *recorrido intercuartílico* es $Q_3 - Q_1$: la anchura de la mitad central de los datos.

**Ejemplo 17.5.**

$n = 12$: la cuarta parte es $3$, así que $Q_1$ es el $3$.er valor ordenado: $Q_1 = 10$. Tres cuartas partes son $9$, así que $Q_3$ es el $9$.o valor: $Q_3 = 13$. El [recorrido intercuartílico](#def-g11-stat-quartiles) es $3$: la mitad central de la clase cabe en $3$ puntos de nota.

![El conjunto de datos como diagrama de puntos, su media (en rojo) y, encima, el resumen de cinco números (en naranja): mínimo, Q_1, mediana, Q_3 y máximo. La caja contiene la mitad central de los datos.](https://one-course.com/images/onecourse/chapters/math-2/g11-stat/fig-a05e71bdfe62.svg)

*El conjunto de datos como diagrama de puntos, su [media](#def-g11-stat-mean) (en rojo) y, encima, el resumen de cinco números (en naranja): [mínimo](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema), $Q_1$, [mediana](#def-g11-stat-median), $Q_3$ y [máximo](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema). La caja contiene la mitad central de los datos.*

## 17.3 Varianza y desviación típica

**Definición 17.6 (Varianza, desviación típica).**

La *varianza* del conjunto de datos es la [media](#def-g11-stat-mean) de los cuadrados de las desviaciones respecto de la [media](#def-g11-stat-mean):

$$
V = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar x)^2,
$$

y la *desviación típica* es $\sigma = \sqrt{V}$, expresada en la misma unidad que los datos.

**Proposición 17.7 (Fórmula abreviada).**

La [varianza](#def-g11-stat-variance) es la [media](#def-g11-stat-mean) de los cuadrados menos el cuadrado de la [media](#def-g11-stat-mean):

$$
V = \frac{1}{n}\sum_{i=1}^{n} x_i^2 \;-\; \bar x^{\,2}.
$$

**Demostración.** Desarrollamos cada desviación al cuadrado: $(x_i - \bar x)^2 = x_i^2 - 2\bar x\, x_i + \bar x^2$. Sumando y dividiendo entre $n$:

$$
V = \frac1n \sum x_i^2 - 2\bar x \cdot \underbrace{\frac1n \sum
x_i}_{=\ \bar x} + \frac1n \cdot n\bar x^2
= \frac1n\sum x_i^2 - 2\bar x^2 + \bar x^2
= \frac1n\sum x_i^2 - \bar x^2 .
$$

La misma identidad, para variables aleatorias, es la [Proposición 18.13](https://one-course.com/books/math/2/es/chapter/18-probabilidad-y-variables-aleatorias#prop-g11-prob-konig). ∎

**Ejemplo 17.8.**

Para nuestro conjunto de datos, las desviaciones respecto de $\bar x = 12$ son $-4$, $-3$, $-2$, $-2$, $-1$, $0$, $0$, $0$, $1$, $2$, $4$, $5$; sus cuadrados suman

$$
16 + 9 + 4 + 4 + 1 + 0 + 0 + 0 + 1 + 4 + 16 + 25 = 80 .
$$

Por tanto,

$$
V = \frac{80}{12} = \frac{20}{3} \approx 6.67,
\qquad
\sigma = \sqrt{20/3} \approx 2.6 \text{ puntos}.
$$

A grandes rasgos, una nota típica se aleja unos $2.6$ puntos de la [media](#def-g11-stat-mean).

**Proposición 17.9 (Cambio de unidades).**

Si todos los valores se transforman mediante $y_i = a x_i + b$, entonces

$$
\bar y = a \bar x + b,
\qquad
V_y = a^2\, V_x,
\qquad
\sigma_y = \abs{a}\,\sigma_x .
$$

**Demostración.** $\bar y = \frac1n \sum (a x_i + b) = a\left(\frac1n\sum x_i\right) +
\frac1n \cdot nb = a\bar x + b$. Después, $y_i - \bar y = a(x_i - \bar x)$: cada desviación queda multiplicada por $a$ (el desplazamiento $b$ se cancela), así que cada desviación al cuadrado queda multiplicada por $a^2$, y su [media](#def-g11-stat-mean) también. Tomando raíces cuadradas se obtiene $\sigma_y = \abs a\,\sigma_x$. ∎

**Ejemplo 17.10.**

Unas temperaturas registradas en grados Celsius con [media](#def-g11-stat-mean) $20$ y [desviación típica](#def-g11-stat-variance) $3$ se pasan a Fahrenheit con $F = 1.8\,C + 32$: la [media](#def-g11-stat-mean) pasa a ser $1.8 \times 20 + 32 = 68$ y la [desviación típica](#def-g11-stat-variance), $1.8 \times 3 = 5.4$. Desplazar un conjunto de datos no cambia su dispersión; cambiarle la escala se la cambia también a ella.

**Método 17.11 (Resumir y comparar conjuntos de datos).**

Para comparar dos conjuntos de datos, pon uno junto a otro: la [media](#def-g11-stat-mean) (o la [mediana](#def-g11-stat-median)) para la *posición* y la [desviación típica](#def-g11-stat-variance) (o el [recorrido intercuartílico](#def-g11-stat-quartiles)) para la *dispersión*. La pareja ([mediana](#def-g11-stat-median), [recorrido intercuartílico](#def-g11-stat-quartiles)) es robusta frente a los valores extremos; la pareja ([media](#def-g11-stat-mean), [desviación típica](#def-g11-stat-variance)) usa todos los valores y alimenta la teoría de la [probabilidad](https://one-course.com/books/math/2/es/chapter/9-probabilidad-y-muestreo#def-g10-proba-distribution).

**Ejemplo 17.12.**

Dos arqueros lanzan $10$ flechas cada uno; las puntuaciones promedian $8.5$ en los dos casos, pero las desviaciones típicas son $0.5$ y $2.1$. El mismo nivel de [media](#def-g11-stat-mean), pero el primer arquero es mucho más regular.

## 17.4 Ejercicios

**Ejercicio 17.1 ★.**

Calcula la [media](#def-g11-stat-mean), la [mediana](#def-g11-stat-median), los [cuartiles](#def-g11-stat-quartiles) y el [recorrido intercuartílico](#def-g11-stat-quartiles) del conjunto de datos

$$
5,\ 7,\ 7,\ 8,\ 9,\ 10,\ 11,\ 14 .
$$

**Solución de Ejercicio 17.1.**

$n = 8$ y suma $71$: [media](#def-g11-stat-mean) $\bar x = \frac{71}{8} = 8.875$. [Mediana](#def-g11-stat-median): [punto medio](https://one-course.com/books/math/2/es/chapter/5-geometria-analitica#prop-g10-coordgeom-midpoint) del $4$.o y el $5$.o valores, $\frac{8 + 9}{2} = 8.5$. [Cuartiles](#def-g11-stat-quartiles): la cuarta parte de $8$ es $2$, así que $Q_1$ es el $2$.o valor, $7$; tres cuartas partes son $6$, así que $Q_3$ es el $6$.o valor, $10$. [Recorrido intercuartílico](#def-g11-stat-quartiles): $10 - 7 = 3$.

**Ejercicio 17.2 ★.**

Calcula la [varianza](#def-g11-stat-variance) y la [desviación típica](#def-g11-stat-variance) del conjunto de datos $2,\ 4,\ 4,\ 4,\ 5,\ 5,\ 7,\ 9$ (primero la [media](#def-g11-stat-mean) y después la fórmula abreviada de la [Proposición 17.7](#prop-g11-stat-shortcut)).

**Solución de Ejercicio 17.2.**

Suma $40$, luego $\bar x = 5$. Suma de cuadrados: $4 + 16 + 16 + 16 + 25 + 25 + 49 + 81 = 232$. Por la fórmula abreviada,

$$
V = \frac{232}{8} - 5^2 = 29 - 25 = 4,
\qquad
\sigma = 2 .
$$

**Ejercicio 17.3 ★.**

Se lanza un dado $50$ veces; los resultados se resumen en frecuencias:

| resultado | 1 | 2 | 3 | 4 | 5 | 6 |
| --- | --- | --- | --- | --- | --- | --- |
| frecuencia | 6 | 9 | 8 | 10 | 9 | 8 |

Calcula el resultado medio y la [mediana](#def-g11-stat-median).

**Solución de Ejercicio 17.3.**

[Media](#def-g11-stat-mean):

$$
\bar x = \frac{1 \times 6 + 2 \times 9 + 3 \times 8 + 4 \times 10
+ 5 \times 9 + 6 \times 8}{50}
= \frac{181}{50} = 3.62 .
$$

[Mediana](#def-g11-stat-median): las frecuencias acumuladas son $6, 15, 23, 33, \dots$, así que los resultados $25$ y $26$ de la lista ordenada son los dos $4$: la [mediana](#def-g11-stat-median) es $4$.

**Ejercicio 17.4 ★★.**

Una clase de $15$ alumnos tiene una nota [media](#def-g11-stat-mean) de $11.2$. Se incorpora un $16$.o alumno y saca $18$. ¿Cuál es la nueva [media](#def-g11-stat-mean) de la clase?

**Solución de Ejercicio 17.4.**

El total de las $15$ notas es $15 \times 11.2 = 168$; con el recién llegado, $\frac{168 + 18}{16} = \frac{186}{16} = 11.625$.

**Ejercicio 17.5 ★★.**

La [media](#def-g11-stat-mean) del conjunto de datos $6, 8, x, 12, 14$ es $10$. Halla $x$ y calcula después la [desviación típica](#def-g11-stat-variance) del conjunto completo.

**Solución de Ejercicio 17.5.**

$\frac{6 + 8 + x + 12 + 14}{5} = 10$ da $40 + x = 50$, luego $x = 10$. Las desviaciones de $6, 8, 10, 12, 14$ respecto de la [media](#def-g11-stat-mean) $10$ son $-4, -2, 0, 2, 4$, con cuadrados que suman $40$: $V = \frac{40}{5} = 8$ y $\sigma = 2\sqrt2 \approx 2.83$.

**Ejercicio 17.6 ★.**

Unas notas de [media](#def-g11-stat-mean) $12.4$ y [desviación típica](#def-g11-stat-variance) $2.5$ se transforman con $y = \frac{x}{2} + 4$. Da la nueva [media](#def-g11-stat-mean) y la nueva [desviación típica](#def-g11-stat-variance).

**Solución de Ejercicio 17.6.**

Por la [Proposición 17.9](#prop-g11-stat-affine) con $a = \frac12$ y $b = 4$: nueva [media](#def-g11-stat-mean) $\frac{12.4}{2} + 4 = 10.2$; nueva [desviación típica](#def-g11-stat-variance) $\frac{2.5}{2} = 1.25$.

**Ejercicio 17.7 ★★.**

El grupo A ($20$ valores) tiene [media](#def-g11-stat-mean) $10$; el grupo B ($30$ valores) tiene [media](#def-g11-stat-mean) $15$. Calcula la [media](#def-g11-stat-mean) de los $50$ valores juntos. ¿Es el [punto medio](https://one-course.com/books/math/2/es/chapter/5-geometria-analitica#prop-g10-coordgeom-midpoint) $12.5$? ¿Por qué no?

**Solución de Ejercicio 17.7.**

La [media](#def-g11-stat-mean) conjunta es la [media](#def-g11-stat-mean) *ponderada*

$$
\frac{20 \times 10 + 30 \times 15}{50} = \frac{650}{50} = 13,
$$

y no $12.5$: el grupo B aporta más valores, así que arrastra la [media](#def-g11-stat-mean) conjunta hacia la suya.

**Ejercicio 17.8 ★★.**

Dos líneas de producción llenan bolsas de azúcar de $1$ kg. Unas [muestras](https://one-course.com/books/math/2/es/chapter/9-probabilidad-y-muestreo#def-g10-proba-sample) dan: línea 1: [media](#def-g11-stat-mean) $1.002$ kg, [desviación típica](#def-g11-stat-variance) $0.006$ kg; línea 2: [media](#def-g11-stat-mean) $1.001$ kg, [desviación típica](#def-g11-stat-variance) $0.019$ kg. ¿Qué línea hay que recalibrar primero y por qué?

**Solución de Ejercicio 17.8.**

Las dos líneas están casi en el objetivo de [media](#def-g11-stat-mean) ($1.002$ y $1.001$ kg), pero la [desviación típica](#def-g11-stat-variance) de la línea 2 es el triple: sus bolsas varían mucho más y produce muchas más bolsas visiblemente escasas o pasadas de peso. Hay que ocuparse primero de la línea 2: lo que hay que arreglar es la regularidad, no solo la [media](#def-g11-stat-mean).

**Ejercicio 17.9 ★★.**

Un conjunto de $n = 10$ valores cumple $\sum x_i = 70$ y $\sum x_i^2 = 540$. Calcula su [media](#def-g11-stat-mean), su [varianza](#def-g11-stat-variance) y su [desviación típica](#def-g11-stat-variance).

**Solución de Ejercicio 17.9.**

$\bar x = \frac{70}{10} = 7$; $V = \frac{540}{10} - 7^2 = 54 - 49 = 5$; $\sigma = \sqrt5 \approx 2.24$.

**Ejercicio 17.10 ★★★.**

El conjunto de datos $1,\ 2,\ 2,\ 3,\ 3,\ 3,\ 4,\ 4,\ 5,\ 23$ contiene un *valor atípico*.

1. Calcula la [media](#def-g11-stat-mean) y la [mediana](#def-g11-stat-median) con y sin el valor $23$ .
2. Calcula el [recorrido intercuartílico](#def-g11-stat-quartiles) con y sin el $23$ .
3. ¿Qué resúmenes son robustos frente al valor atípico? Concluye con una recomendación.

**Solución de Ejercicio 17.10.**

*1.* Con el $23$: suma $50$, [media](#def-g11-stat-mean) $5$; [mediana](#def-g11-stat-median) $=$ [punto medio](https://one-course.com/books/math/2/es/chapter/5-geometria-analitica#prop-g10-coordgeom-midpoint) del $5$.o y el $6$.o valores $= 3$. Sin el $23$: suma $27$, [media](#def-g11-stat-mean) $3$; [mediana](#def-g11-stat-median) (el $5$.o de $9$ valores) $= 3$.

*2.* Con el $23$ ($n = 10$): $Q_1$ es el $3$.er valor ($2$) y $Q_3$, el $8$.o ($4$): [recorrido intercuartílico](#def-g11-stat-quartiles) $2$. Sin él ($n = 9$): $Q_1$ es el $3$.er valor ($2$) y $Q_3$, el $7$.o ($4$): sigue siendo $2$.

*3.* Un único valor atípico arrastra la [media](#def-g11-stat-mean) de $3$ a $5$, pero deja intactos la [mediana](#def-g11-stat-median) y el [recorrido intercuartílico](#def-g11-stat-quartiles): esos dos son *robustos*. Cuando un conjunto de datos puede contener valores aberrantes, informa de la [mediana](#def-g11-stat-median) y del [recorrido intercuartílico](#def-g11-stat-quartiles) antes que de la [media](#def-g11-stat-mean) y la [desviación típica](#def-g11-stat-variance).

## 17.5 Problema: La puntuación z, una regla universal

**Problema 17.1.**

Problema de fin de semana — las desviaciones típicas comparan peras con manzanas, la desigualdad de Chebyshev convierte $\sigma$ en una garantía y la media se gana su propia medalla

¿Es mejor un $15$ sobre $20$ en un examen difícil que un $13$ sobre $20$ en uno fácil? ¿Un $23$ en una lista de números pequeños es un accidente o un valor atípico? Los números en bruto no lo pueden decir, pero divididos entre la [desviación típica](#def-g11-stat-variance) adecuada hablan todos un mismo idioma: la *[puntuación z](#pb-g11-stat-1)*. Este problema domina la maquinaria de la [varianza](#def-g11-stat-variance) ([Definición 17.6](#def-g11-stat-variance), [Proposición 17.7](#prop-g11-stat-shortcut)), construye la regla universal y demuestra la notable desigualdad que convierte $\sigma$ de número descriptivo en garantía.

**Parte I — Mecánica de la [varianza](#def-g11-stat-variance).**

1. Para el conjunto de datos $4, 8, 6, 5, 2$ : calcula la [media](#def-g11-stat-mean) , después la [varianza](#def-g11-stat-variance) directamente desde la definición y después $\sigma$ .
2. Vuelve a calcular la [varianza](#def-g11-stat-variance) con la fórmula abreviada ( [Proposición 17.7](#prop-g11-stat-shortcut) ), la [media](#def-g11-stat-mean) de los cuadrados menos el cuadrado de la [media](#def-g11-stat-mean) , y comprueba que coinciden.
3. Con frecuencias: notas $8$ , $10$ , $14$ obtenidas por $3$ , $5$ y $2$ alumnos. Calcula la [media](#def-g11-stat-mean) , la [varianza](#def-g11-stat-variance) y $\sigma$ (con dos decimales).
4. Unas temperaturas tienen [media](#def-g11-stat-mean) $20$ y $\sigma = 3$ (en grados Celsius). Da la [media](#def-g11-stat-mean) y $\sigma$ en Fahrenheit ( $F = 1.8\,C + 32$ ; [Proposición 17.9](#prop-g11-stat-affine) ).
5. Demuestra las dos reglas que acabas de usar: sumar una constante $b$ a todos los valores desplaza la [media](#def-g11-stat-mean) en $b$ y deja $\sigma$ igual; multiplicar por $a$ multiplica la [media](#def-g11-stat-mean) por $a$ y $\sigma$ por $\abs a$ .

**Parte II — La regla universal.** La *puntuación z* de un valor $x$ en un conjunto de datos de [media](#def-g11-stat-mean) $\bar x$ y [desviación típica](#def-g11-stat-variance) $\sigma$ es $z = \dfrac{x - \bar x}{\sigma}$: el número de desviaciones típicas que separan $x$ de la [media](#def-g11-stat-mean).

6. El examen A tiene [media](#def-g11-stat-mean) $12$ y $\sigma = 2$ ; el examen B tiene [media](#def-g11-stat-mean) $8$ y $\sigma = 4$ . Alicia sacó un $15$ en A y Bruno un $13$ en B. Calcula las dos puntuaciones z: ¿cuál de las dos actuaciones destaca más sobre el grupo?
7. Calcula las cinco puntuaciones z del conjunto de datos de la pregunta 1 y comprueba que tienen [media](#def-g11-stat-mean) $0$ y [desviación típica](#def-g11-stat-variance) $1$ . Explica, a partir de la pregunta 5, por qué la estandarización produce *siempre* [media](#def-g11-stat-mean) $0$ y $\sigma = 1$ .
8. Un test de aptitud tiene [media](#def-g11-stat-mean) $100$ y $\sigma = 15$ . ¿Qué puntuación bruta tiene $z = 2$ ? ¿Cuál es la [puntuación z](#pb-g11-stat-1) de $76$ ?
9. Un pediatra anota el peso de un bebé como “ $z = -2.5$ ”. Explica qué significa eso y por qué el crecimiento se sigue en puntuaciones z y no en kilogramos a medida que el niño crece.
10. El valor atípico del [Ejercicio 17.10](#exo-g11-stat-10) (conjunto $1, 2, 2, 3, 3, 3, 4, 4, 5, 23$ ): calcula la [media](#def-g11-stat-mean) , $\sigma$ y la [puntuación z](#pb-g11-stat-1) de $23$ . El umbral de alarma clásico es $\abs z \geq 3$ : ¿veredicto?
11. Vuelve a calcular $\sigma$ *sin* el valor $23$ , y la [puntuación z](#pb-g11-stat-1) que tendría $23$ frente a la [media](#def-g11-stat-mean) y la $\sigma$ de los datos limpios. ¿Qué le ha hecho el valor atípico a la propia regla que debía medirlo, y qué contramedida sugiere el [Ejercicio 17.10](#exo-g11-stat-10) ?

**Parte III — La garantía de Chebyshev.**

12. Demuestra la desigualdad de Bienaymé–Chebyshev para un conjunto de datos: si una proporción $p$ de los valores cumple $\abs{x - \bar x} \geq k\sigma$, entonces, conservando solo esos términos en la suma de la [varianza](#def-g11-stat-variance), $$\sigma^2 \geq p \cdot (k\sigma)^2,  \qquad\text{luego}\qquad  p \leq \frac{1}{k^2} .$$
13. ¿Qué garantiza la desigualdad sobre la proporción de un conjunto de datos cualquiera más allá de $2\sigma$ de su [media](#def-g11-stat-mean) ? ¿Y más allá de $3\sigma$ ? Comprueba lo de $2\sigma$ con el conjunto de datos de la pregunta 1.
14. Una fábrica produce tornillos de [media](#def-g11-stat-mean) $50$ mm y $\sigma = 0.1$ mm. ¿Qué garantiza Chebyshev sobre la proporción de tornillos fuera de $\intcc{49.7}{50.3}$ ? (La producción real lo hace mucho mejor: la campana del año que viene convierte este prudente $\frac19$ en una fracción de punto porcentual.)
15. Dos fondos rinden de [media](#def-g11-stat-mean) un $5\,\%$ anual, con $\sigma = 2\,\%$ para el fondo A y $\sigma = 12\,\%$ para el fondo B. Para cada fondo, ¿qué dice Chebyshev sobre la proporción de años con rendimientos por debajo del $-19\,\%$ ? ¿Cuál es el nombre financiero de $\sigma$ ?

**Parte IV — La medalla de la [media](#def-g11-stat-mean), y un aviso.**

16. Sea $f(c)$ la [media](#def-g11-stat-mean) de las desviaciones al cuadrado $(x_i - c)^2$ respecto de un centro arbitrario $c$. Demuestra la identidad $$f(c) = \sigma^2 + (\bar x - c)^2 ,$$ y concluye: la [media](#def-g11-stat-mean) es el único punto que minimiza la desviación cuadrática [media](#def-g11-stat-mean); esa es su medalla, pareja de la minimización de las desviaciones en [valor absoluto](https://one-course.com/books/math/2/es/chapter/1-numeros-y-conjuntos-de-numeros#def-g10-numbers-abs) que logra la [mediana](#def-g11-stat-median) en el [Problema 8.1](https://one-course.com/books/math/2/es/chapter/8-estadistica-descriptiva#pb-g10-stats-1).
17. Comprueba la identidad con el conjunto de datos de la pregunta 1 y $c = 6$ : calcula $f(6)$ directamente y con la fórmula.
18. Mismos resúmenes, datos distintos: comprueba que $P = \{3, 5, 7, 9, 11\}$ y $Q = \{1, 7, 7, 7, 13\}$ comparten la [media](#def-g11-stat-mean) , pero no la [varianza](#def-g11-stat-variance) ; y construye después un conjunto de la forma $\{7 - a, 7, 7, 7, 7 + a\}$ con exactamente la [media](#def-g11-stat-mean) y la [varianza](#def-g11-stat-variance) de $P$ , pero con una forma completamente propia.
19. Demuestra que $\sigma = 0$ obliga a que todos los valores sean iguales. (¿Cómo tiene que ser cada término de una suma de cuadrados que vale cero?)
20. Final: la escalera del estadístico, una línea por peldaño: los centros ( [media](#def-g11-stat-mean) , [mediana](#def-g11-stat-median) ), las dispersiones ( $\sigma$ , [recorrido intercuartílico](#def-g11-stat-quartiles) ), la regla universal ( $z$ ), la garantía (Chebyshev) y el aviso de la pregunta 18: los resúmenes comprimen, y comprimir pierde información; la campana del año que viene espera para convertir las puntuaciones z en [probabilidades](https://one-course.com/books/math/2/es/chapter/9-probabilidad-y-muestreo#def-g10-proba-distribution) exactas.

**Solución de Problema 17.1.**

**1.** [Media](#def-g11-stat-mean) $\bar x = \frac{25}{5} = 5$. Desviaciones al cuadrado: $1, 9, 1, 0, 9$: [varianza](#def-g11-stat-variance) $\frac{20}{5} = 4$, luego $\sigma = 2$.

**2.** [Media](#def-g11-stat-mean) de los cuadrados: $\frac{16 + 64 + 36 + 25 + 4}{5} = 29$; menos $\bar x^2 = 25$: [varianza](#def-g11-stat-variance) $4$. La misma respuesta con la mitad de trabajo.

**3.** [Media](#def-g11-stat-mean) $= \frac{3 \times 8 + 5 \times 10 + 2 \times
14}{10} = 10.2$; [varianza](#def-g11-stat-variance) $= \frac{3 \times 64 + 5 \times 100 +
2 \times 196}{10} - 10.2^2 = 108.4 - 104.04 = 4.36$; $\sigma \approx 2.09$.

**4.** [Media](#def-g11-stat-mean): $1.8 \times 20 + 32 = 68\,^\circ$F; $\sigma$: $1.8 \times 3 = 5.4\,^\circ$F: el desplazamiento $+32$ no dispersa nada.

**5.** Al sumar $b$: cada desviación $x_i + b - (\bar x + b) = x_i - \bar x$ no cambia, luego la [varianza](#def-g11-stat-variance) tampoco. Al multiplicar por $a$: las desviaciones quedan multiplicadas por $a$, sus cuadrados por $a^2$, la [varianza](#def-g11-stat-variance) por $a^2$ y $\sigma$ por $\sqrt{a^2} = \abs a$.

**6.** $z_A = \frac{15 - 12}{2} = 1.5$; $z_B = \frac{13 - 8}{4} = 1.25$. Alicia destaca más sobre su grupo: el $15$ del examen difícil gana al $13$ del fácil.

**7.** Puntuaciones z: $-0.5,\ 1.5,\ 0.5,\ 0,\ -1.5$: [media](#def-g11-stat-mean) $0$ y [desviación típica](#def-g11-stat-variance) $1$. En general, estandarizar resta $\bar x$ (la [media](#def-g11-stat-mean) pasa a $0$ y $\sigma$ no se toca) y divide después entre $\sigma$ (la nueva $\sigma$ pasa a valer $1$): la pregunta 5 aplicada dos veces.

**8.** $z = 2$: $100 + 2 \times 15 = 130$. Y $z(76) = \frac{76 - 100}{15} = -1.6$.

**9.** El bebé está $2.5$ desviaciones típicas por debajo del peso medio *de los bebés de su edad*: alarmantemente ligero para su cohorte. Los kilogramos en bruto no se pueden comparar entre edades (todos los bebés ganan peso); las puntuaciones z miden a cada niño frente a su propio grupo de edad, con una sola regla para todas las edades.

**10.** [Media](#def-g11-stat-mean) $5$; [media](#def-g11-stat-mean) de los cuadrados $\frac{622}{10} = 62.2$, [varianza](#def-g11-stat-variance) $37.2$ y $\sigma \approx 6.10$; $z(23) = \frac{18}{6.10} \approx 2.95$: justo por debajo del umbral de alarma; el test apenas parpadea.

**11.** Sin el $23$: [media](#def-g11-stat-mean) $3$, [varianza](#def-g11-stat-variance) $\frac{93}{9} - 9 \approx 1.33$ y $\sigma \approx 1.15$; frente a esa regla limpia, el $23$ puntúa $z \approx \frac{20}{1.15} \approx 17$: un monstruo. El valor atípico infló a la vez la [media](#def-g11-stat-mean) y $\sigma$ y se camufló: por eso el [Ejercicio 17.10](#exo-g11-stat-10) recomienda resúmenes robustos ([mediana](#def-g11-stat-median), [recorrido intercuartílico](#def-g11-stat-quartiles)) cuando amenaza la contaminación.

**12.** En la suma de la [varianza](#def-g11-stat-variance) $\sigma^2 = \frac1N \sum (x_i - \bar x)^2$, conservamos solo los términos con $\abs{x_i - \bar x} \geq k\sigma$: hay $pN$ de ellos y cada uno vale al menos $(k\sigma)^2$, luego $\sigma^2 \geq \frac{1}{N} \cdot pN \cdot k^2\sigma^2 =
p\,k^2\sigma^2$; dividiendo entre $k^2 \sigma^2$ (con dispersión no nula), $p \leq \frac{1}{k^2}$.

**13.** Más allá de $2\sigma$: como mucho $\frac14 = 25\,\%$ de un conjunto de datos cualquiera; más allá de $3\sigma$: como mucho $\frac19 \approx 11\,\%$. Con los datos de la pregunta 1: más allá de $2\sigma = 4$ de la [media](#def-g11-stat-mean) $5$ significa $\leq 1$ o $\geq 9$: ninguno de los cinco valores, o sea, $0\,\% \leq 25\,\%$, como se prometía.

**14.** Estar fuera de $\intcc{49.7}{50.3}$ significa estar más allá de $3\sigma$: como mucho $\frac19$ de la producción, *sea cual sea* la forma de la distribución; Chebyshev no pide nada más que una [media](#def-g11-stat-mean) y una $\sigma$. Una producción en forma de campana se concentra mucho mejor (alrededor de un $0.3\,\%$ más allá de $3\sigma$): la ley normal, el año que viene.

**15.** El $-19\,\%$ está $24$ puntos por debajo de la [media](#def-g11-stat-mean) $5$. Fondo B: $24 = 2\sigma_B$, así que Chebyshev permite hasta $\frac14$ de años tan malos. Fondo A: $24 = 12\sigma_A$: como mucho $\frac{1}{144}$. La misma [media](#def-g11-stat-mean), peligros incomparables: $\sigma$ es lo que en finanzas se llama *riesgo* (o volatilidad).

**16.** Desarrollamos alrededor de $\bar x$: $(x_i - c)^2 = \left((x_i - \bar x) + (\bar x - c)\right)^2
= (x_i - \bar x)^2 + 2(\bar x - c)(x_i - \bar x) + (\bar x - c)^2$. Al promediar, el término central muere (las desviaciones respecto de la [media](#def-g11-stat-mean) suman cero) y queda $f(c) = \sigma^2 + (\bar x - c)^2$, [mínimo](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema) exactamente en $c = \bar x$, con [mínimo](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema) $\sigma^2$. La [media](#def-g11-stat-mean) es el centro de [mínimos](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema) cuadrados, igual que la [mediana](#def-g11-stat-median) es el centro de [mínimos](https://one-course.com/books/math/2/es/chapter/3-funciones#def-g10-functions-extrema) [valores absolutos](https://one-course.com/books/math/2/es/chapter/1-numeros-y-conjuntos-de-numeros#def-g10-numbers-abs) ([Problema 8.1](https://one-course.com/books/math/2/es/chapter/8-estadistica-descriptiva#pb-g10-stats-1)).

**17.** Directamente: las desviaciones respecto de $6$ son $-2, 2, 0, -1, -4$, con cuadrados $4, 4, 0, 1, 16$: $f(6) = \frac{25}{5} = 5$. Con la fórmula: $\sigma^2 + (5 - 6)^2 = 4 + 1 = 5$. Coinciden.

**18.** Los dos tienen [media](#def-g11-stat-mean) $7$; [varianzas](#def-g11-stat-variance): $P$: $\frac{16 + 4 + 0 + 4 + 16}{5} = 8$; $Q$: $\frac{36 + 0 + 0 + 0 + 36}{5} = 14.4$: dispersiones distintas tras una misma [media](#def-g11-stat-mean). Para $\{7 - a, 7, 7, 7, 7 + a\}$: la [varianza](#def-g11-stat-variance) $\frac{2a^2}{5} = 8$ da $a = \sqrt{20} \approx 4.47$: el conjunto $\{2.53, 7, 7, 7, 11.47\}$ tiene exactamente la [media](#def-g11-stat-mean) y la [varianza](#def-g11-stat-variance) de $P$ con un perfil completamente distinto; los resúmenes comprimen, y comprimir pierde.

**19.** $\sigma^2 = 0$ significa que se anula una suma de cuadrados $(x_i - \bar x)^2$; los cuadrados son $\geq 0$, así que una suma nula obliga a que todos los términos sean nulos: $x_i = \bar x$ para todo $i$, o sea, todos los valores iguales.

**20.** Los centros dicen dónde vive el conjunto de datos; las dispersiones, con qué holgura; la [puntuación z](#pb-g11-stat-1) tiende una misma regla sobre todos los conjuntos de datos, exámenes, edades y monedas; Chebyshev convierte $\sigma$ en una garantía incondicional; y la pregunta 18 nos mantiene honrados: ningún puñado de números contiene nunca la historia entera. El año que viene la campana afinará la regla hasta convertirla en [probabilidades](https://one-course.com/books/math/2/es/chapter/9-probabilidad-y-muestreo#def-g10-proba-distribution) exactas.
