---
title: "Funciones características y teorema central del límite"
book: "Matemáticas universitarias — Grado 3"
subject: math
language: es
chapter: 23
exercises: 12
source: https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite
---

# Capítulo 23 — Funciones características y teorema central del límite

La ley de los grandes números dice que las medias convergen; el teorema central del límite dice *cómo fluctúan*: el error, amplificado por $\sqrt n$, es asintóticamente [gaussiano](#def-b3-clt-gaussianvector) — sea cual sea la ley de partida. Esta universalidad es el hecho más profundo de la probabilidad elemental, y su demostración natural es de análisis de Fourier: la *[función característica](#def-b3-clt-cf)* (la transformada de Fourier de una ley) convierte las sumas [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) en productos, y la maquinaria del [Capítulo 14](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#ch-b3-fouriertransform) — inyectividad, puntos fijos [gaussianos](#def-b3-clt-gaussianvector) — convierte la convergencia puntual de esos productos en convergencia de leyes (teorema de Lévy, demostrado por completo). El capítulo termina con los [vectores gaussianos](#def-b3-clt-gaussianvector) y la deducción honesta de los intervalos de confianza que se usan en toda la estadística; el problema de fin de semana da la segunda demostración del TCL, la de Lindeberg, con una velocidad de error explícita.

## 23.1 Funciones características

**Definición 23.1.**

La *función característica* de una [variable aleatoria](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) real $X$ es

$$
\varphi_X(\xi) = \E\bigl[\eu^{\iu\xi X}\bigr]
= \int_\R \eu^{\iu\xi x}\,\dd\P_X(x)
\qquad (\xi \in \R)
$$

(el teorema de transferencia la calcula a partir de la ley; para una [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $f$, $\varphi_X(\xi) = \hat f(-\xi)$ en el convenio del [Capítulo 14](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#ch-b3-fouriertransform)).

**Proposición 23.2.**

(a) $\varphi_X(0) = 1$, $\abs{\varphi_X} \leq 1$, y $\varphi_X$ es uniformemente [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity); $\varphi_{aX + b}(\xi) = \eu^{\iu b\xi}\varphi_X(a\xi)$. (b) Si $X, Y$ son *[independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence)*: $\varphi_{X+Y} = \varphi_X\,\varphi_Y$. (c) Si $\E\abs X^k < \infty$, entonces $\varphi_X \in \mathcal
C^k$ con $\varphi_X^{(j)}(0) = \iu^j\,\E[X^j]$ para $j \leq
k$; en particular, para $X \in L^2$ centrada de varianza $\sigma^2$:

$$
\varphi_X(\xi) = 1 - \frac{\sigma^2\xi^2}{2} +
o(\xi^2) \qquad (\xi \to 0).
$$

(d) [Gaussiana](#def-b3-clt-gaussianvector): $X \sim \mathcal N(m, \sigma^2)$ tiene $\varphi_X(\xi) = \eu^{\iu m\xi - \sigma^2\xi^2/2}$.

**Demostración.** (a) Las cotas son inmediatas; [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity): $\abs{\varphi(\xi + h)
- \varphi(\xi)} \leq \E\abs{\eu^{\iu hX} - 1} \to 0$ cuando $h
\to 0$ por convergencia dominada, uniformemente en $\xi$. La regla afín es una sustitución. (b) $\eu^{\iu\xi(X+Y)} =
\eu^{\iu\xi X}\eu^{\iu\xi Y}$, y las [esperanzas](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) de productos de variables [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) factorizan (el [Teorema 22.5](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-independence), aplicado a las partes real e imaginaria). (c) Derivación bajo la [esperanza](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space), dominada por $\E\abs X^j$ (el [Teorema 10.15](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#thm-b3-lebesgue-paramdiff)); el desarrollo de Taylor en $0$ es entonces Taylor–Young para la función $\mathcal C^2$ $\varphi$. (d) Para $\mathcal N(0,1)$: la transformada [gaussiana](#def-b3-clt-gaussianvector) (el [Ejemplo 14.2](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#ex-b3-fouriertransform-gaussian) con $a = \frac12$) da $\int\eu^{\iu\xi x}\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\dd
x = \eu^{-\xi^2/2}$; el caso general, por la regla afín. ∎

**Teorema 23.3 (Inyectividad).**

Si $\varphi_X = \varphi_Y$, entonces $X$ y $Y$ tienen la misma ley. Con más precisión, para $N \sim \mathcal N(0,1)$ independiente de $X$ y $\varepsilon > 0$, la variable regularizada $X +
\varepsilon N$ tiene la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma)

$$
p_\varepsilon(x) = \frac1{2\pi}\int_\R
\varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\,
\eu^{\iu\xi x}\,\dd\xi ,
$$

determinada solo por $\varphi_X$; haciendo $\varepsilon \to 0$ se recupera la ley de $X$.

**Demostración.** $X + \varepsilon N$ tiene la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $p_\varepsilon(x) =
\E\bigl[g_\varepsilon(x - X)\bigr]$, donde $g_\varepsilon$ es la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\mathcal N(0, \varepsilon^2)$: en efecto, para $B$ boreliana, la [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y Tonelli dan $\P(X + \varepsilon N \in
B) = \int\!\!\int\mathbf 1_B(x + \varepsilon
n)g_1(n)\,\dd n\,\dd\P_X(x) = \int_B\E[g_\varepsilon(t -
X)]\dd t$ (sustitúyase y aplíquese Tonelli de nuevo). Escribiendo $g_\varepsilon$ por inversión de Fourier de su transformada (el [Ejercicio 14.4](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#exo-b3-fouriertransform-4), reescalado): $g_\varepsilon(u) = \frac1{2\pi}\int
\eu^{-\varepsilon^2\xi^2/2}\eu^{\iu\xi u}\dd\xi$, y Fubini (todo dominado por el factor [gaussiano](#def-b3-clt-gaussianvector)):

$$
p_\varepsilon(x) = \frac1{2\pi}\int_\R
\varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\,
\eu^{\iu\xi x}\,\dd\xi ,
$$

un funcional solo de $\varphi_X$. Si $\varphi_X =
\varphi_Y$: $X + \varepsilon N$ y $Y + \varepsilon N$ tienen leyes iguales para todo $\varepsilon$; para $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y acotada, $\E f(X + \varepsilon N) \to \E f(X)$ cuando $\varepsilon
\to 0$ (convergencia dominada, $X + \varepsilon N \to X$ puntualmente en el espacio producto), de modo que $\E f(X) = \E f(Y)$ para toda tal $f$ — y esto determina la ley: para cada $t$, encájese $\mathbf 1_{\intoc{-\infty}t}$ entre las rampas [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotadas $f_k^\pm$ (iguales a $1$ en $\intoc{-\infty}{t \mp \frac1k}$, a $0$ más allá de $t \pm
\frac1k$, afines en medio); pasando al límite en $\E
f_k^-(X) \leq F_X(t) \leq \E f_k^+(X)$ se obtiene $F_X(t) =
F_Y(t)$ en todo $t$ donde ambas sean [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), luego en todas partes por [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por la derecha y [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) de los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) comunes (ambas $F$ tienen una cantidad numerable de saltos); funciones de distribución iguales fuerzan leyes iguales (el [Ejercicio 9.3](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#exo-b3-measure-3), apoyado en [Teorema 9.7](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#thm-b3-measure-uniqueness)). ∎

## 23.2 Convergencia en distribución

**Definición 23.4.**

$X_n$ *converge en distribución* (o en ley) hacia $X$, y se escribe $X_n \Rightarrow X$, si

$$
\E\bigl[f(X_n)\bigr] \longrightarrow \E\bigl[f(X)\bigr]
\qquad\text{para toda continua acotada } f\colon\R\to\R .
$$

Equivalentemente (el [Ejercicio 23.4](#exo-b3-clt-4)): $F_{X_n}(t) \to F_X(t)$ en todo punto de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $t$ de $F_X$. Las $X_n$ no necesitan vivir en un [espacio de probabilidad](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) común: solo importan las leyes.

**Teorema 23.5 (Teorema de selección de Helly).**

Toda sucesión $(F_n)$ de funciones de distribución tiene una subsucesión que converge puntualmente, en todo punto de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) del límite, a una función $G \colon
\R \to \intcc01$ no decreciente y [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por la derecha — posiblemente con $G(+\infty) - G(-\infty) <
1$ (la masa puede escaparse al infinito).

**Demostración.** La extracción diagonal da $F_{n_k}(q) \to \ell(q)$ para todo racional $q$ (valores en el [compacto](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-compact) $\intcc01$). Defínase $G(t) = \inf\{\ell(q) : q \in \Q, q > t\}$: no decreciente y [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por la derecha (un ínfimo sobre [entornos](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-topology) racionales que se encogen por la derecha). En un punto de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $t$ de $G$: para racionales $q_1 < t < q_2$,

$$
\ell(q_1) \leq \liminf F_{n_k}(t) \leq \limsup F_{n_k}(t)
\leq \ell(q_2),
$$

por monotonía de cada $F_{n_k}$. De la definición de $G$ como ínfimo y de la monotonía de $\ell$ en los racionales: $G(s) \leq \ell(q) \leq G(q)$ siempre que $s < q$. Tomando $s < q_1 < t$ se obtiene $\ell(q_1) \geq G(s)$, y $\ell(q_2) \leq G(q_2)$; haciendo $s \uparrow t$ y $q_2
\downarrow t$, la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de $G$ en $t$ encajona tanto el $\liminf$ como el $\limsup$ hacia $G(t)$. ∎

**Lema 23.6 (Tensión a partir de la función característica).**

Para toda [variable aleatoria](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) $X$ y todo $u > 0$:

$$
\P\Bigl(\abs X \geq \frac2u\Bigr) \;\leq\;
\frac1u\int_{-u}^{u}\bigl(1 -
\operatorname{Re}\varphi_X(\xi)\bigr)\,\dd\xi .
$$

**Demostración.** Por Tonelli–Fubini (integrando acotado, región finita en $\xi$):

$$
\frac1u\int_{-u}^u\bigl(1 -
\operatorname{Re}\varphi_X(\xi)\bigr)\dd\xi
= \E\Bigl[\frac1u\int_{-u}^u(1 - \cos(\xi X))\,\dd\xi\Bigr]
= 2\,\E\Bigl[1 - \frac{\sin(uX)}{uX}\Bigr]
$$

(interprétese el corchete como su límite $0$ en $X = 0$). El integrando es no negativo ($\abs{\sin t} \leq \abs t$) y, para $\abs{uX} \geq 2$: $1 - \frac{\sin(uX)}{uX} \geq 1 -
\frac1{\abs{uX}} \geq \frac12$. Conservar dentro de la [esperanza](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) solo el suceso $\{\abs{uX} \geq 2\}$ deja, por tanto, al menos $2 \cdot \frac12\,\P(\abs X \geq \frac2u)$, que es lo afirmado. ∎

**Teorema 23.7 (Teorema de continuidad de Lévy).**

Sean $(X_n)$ [variables aleatorias](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) cuyas [funciones características](#def-b3-clt-cf) convergen puntualmente: $\varphi_{X_n}(\xi) \to
\varphi(\xi)$ para todo $\xi$, donde $\varphi =
\varphi_X$ es la [función característica](#def-b3-clt-cf) de cierta [variable aleatoria](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) $X$. Entonces $X_n \Rightarrow X$.

**Demostración.** *Tensión.* Fíjese $\varepsilon > 0$. Como $\varphi$ es [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) en $0$ con $\varphi(0) = 1$, elíjase $u > 0$ con $\frac1u\int_{-u}^u(1 - \operatorname{Re}\varphi) <
\varepsilon$; por convergencia dominada (integrando acotado por $2$ en el $[-u,u]$ fijo), la misma integral para $\varphi_{X_n}$ es $< 2\varepsilon$ si $n$ es grande: el [Lema 23.6](#lem-b3-clt-tightness) da $\P(\abs{X_n} \geq \frac2u)
\leq 2\varepsilon$ para $n$ grande, y agrandar la constante se ocupa de las finitas restantes: las leyes son *tensas* — no se escapa masa.

*Subsucesiones.* Sea $(F_{n_k})$ una subsucesión cualquiera; por Helly (el [Teorema 23.5](#thm-b3-clt-helly)), extráigase $F_{n_{k_j}} \to G$ en los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity). La tensión fuerza $G(-\infty) = 0$, $G(+\infty) = 1$ ($G(\frac2u) - G(-\frac2u) \geq 1 -
2\varepsilon$ en los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity)): $G$ es una función de distribución genuina, de cierta [variable aleatoria](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) $Y$. Entonces $X_{n_{k_j}} \Rightarrow Y$ ([Ejercicio 23.4](#exo-b3-clt-4), convergencia distribucional a partir de las $F$), de modo que $\varphi_{X_{n_{k_j}}} \to \varphi_Y$ *puntualmente* ($x
\mapsto \eu^{\iu\xi x}$ es [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y acotada, por separado en sus partes real e imaginaria); comparando con la hipótesis: $\varphi_Y = \varphi = \varphi_X$, y la inyectividad (el [Teorema 23.3](#thm-b3-clt-injectivity)) da $Y \sim X$, es decir, $G =
F_X$.

*Conclusión.* Toda subsucesión de $(F_n)$ tiene una subsubsucesión que converge a la *misma* $F_X$ (en sus puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity)); por tanto, $F_n(t) \to F_X(t)$ en todo punto de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $t$ (una sucesión real cuyas subsucesiones tienen todas subsubsucesiones con el mismo límite converge): $X_n \Rightarrow X$. ∎

## 23.3 El teorema central del límite

**Teorema 23.8 (Teorema central del límite).**

Sean $(X_n)$ i.i.d. con $\E X_1 = m$ y $\V(X_1) =
\sigma^2 \in \intoo0\infty$. Entonces

$$
\frac{S_n - nm}{\sigma\sqrt n} \;\Longrightarrow\; \mathcal
N(0, 1) :
\qquad
\P\Bigl(a \leq \frac{S_n - nm}{\sigma\sqrt n} \leq
b\Bigr) \longrightarrow
\frac{1}{\sqrt{2\pi}}\int_a^b\eu^{-x^2/2}\,\dd x
$$

para todos $a < b$.

**Demostración.** Céntrese y normalícese: $Z_i = \frac{X_i - m}{\sigma}$ (i.i.d., de media $0$ y varianza $1$) y $T_n =
\frac1{\sqrt n}\sum_{i\leq n}Z_i$. Por [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y la regla afín (la [Proposición 23.2](#prop-b3-clt-cfbasics)):

$$
\varphi_{T_n}(\xi) =
\varphi_{Z}\Bigl(\frac{\xi}{\sqrt n}\Bigr)^{n},
\qquad
\varphi_Z(\eta) = 1 - \frac{\eta^2}2 + \eta^2\rho(\eta),\quad
\rho(\eta)\to0 .
$$

Fíjese $\xi$ y sean $a_n = \varphi_Z(\xi/\sqrt n)$, $b_n = 1 -
\frac{\xi^2}{2n}$: ambos tienen módulo $\leq 1$ si $n$ es grande ($\abs{b_n} \leq 1$ en cuanto $\xi^2 \leq 4n$; $\abs{a_n} \leq 1$ siempre). La desigualdad elemental $\abs{a^n - b^n} \leq
n\abs{a - b}$ para $\abs a, \abs b \leq 1$ (telescopando $a^n - b^n = \sum a^k(a - b)b^{n-1-k}$) da

$$
\Bigl|\varphi_{T_n}(\xi) - \Bigl(1 -
\frac{\xi^2}{2n}\Bigr)^{n}\Bigr|
\leq n\,\Bigl|\varphi_Z\Bigl(\frac\xi{\sqrt n}\Bigr) - 1 +
\frac{\xi^2}{2n}\Bigr|
= \xi^2\,\Bigl|\rho\Bigl(\frac{\xi}{\sqrt n}\Bigr)\Bigr|
\longrightarrow 0,
$$

mientras que $\bigl(1 - \frac{\xi^2}{2n}\bigr)^n \to
\eu^{-\xi^2/2}$ (logaritmo real). Así, $\varphi_{T_n}(\xi) \to
\eu^{-\xi^2/2} = \varphi_{\mathcal N(0,1)}(\xi)$ (la [Proposición 23.2](#prop-b3-clt-cfbasics)(d)) para todo $\xi$: Lévy (el [Teorema 23.7](#thm-b3-clt-levy)) concluye $T_n \Rightarrow \mathcal
N(0,1)$. Las probabilidades de intervalos se siguen porque $F_{\mathcal
N}$ es [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) en todas partes. ∎

**Ejemplo 23.9 (Intervalos de confianza, deducidos honestamente).**

Encuéstese a $n$ votantes [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence); $\hat p_n = S_n/n$ estima el verdadero $p$, con $\sigma^2 = p(1-p) \leq \frac14$. El TCL da, para $n$ grande,

$$
\P\Bigl(\abs{\hat p_n - p} \leq
\frac{z}{2\sqrt n}\Bigr)
\;\geq\; \P\Bigl(\Bigl|\frac{S_n - np}{\sigma\sqrt n}\Bigr|
\leq z\Bigr)
\longrightarrow \Phi(z) - \Phi(-z),
$$

donde $\Phi$ es la función de distribución [gaussiana](#def-b3-clt-gaussianvector) estándar. Con $z = 1.96$: confianza asintótica $95\%$, y un margen $\frac{1.96}{2\sqrt n} \leq 3\%$ exige $n \geq
\bigl(\frac{1.96}{0.06}\bigr)^2 \approx 1068$ — el número que hay detrás de todo «$\pm3$ puntos, $95\%$» que uno lee; compárese con el $5556$ de Chebyshev (el [Ejercicio 22.7](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#exo-b3-probability-7)). El $\sqrt n$ es universal: para reducir el error a la mitad, cuadruplíquese la muestra — la misma ley que fija el coste de [Monte Carlo](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#ex-b3-probability-sllnapps) ([Ejercicio 23.7](#exo-b3-clt-7)).

## 23.4 Vectores gaussianos

**Definición 23.10.**

Un vector aleatorio $X = (X_1, \dots, X_d)$ es *gaussiano* si toda combinación lineal $\langle t, X\rangle = \sum t_iX_i$ es una variable gaussiana real (posiblemente degenerada). Su ley queda determinada por el vector de medias $m = (\E X_i)$ y la *matriz de covarianzas* $\Sigma = \bigl(\operatorname{Cov}
(X_i, X_j)\bigr)$: en efecto, la [función característica](#def-b3-clt-cf) del vector, $\varphi_X(t) = \E\eu^{\iu\langle t, X\rangle}$, es el valor en $1$ de la f.c. de $\langle t, X\rangle$:

$$
\varphi_X(t) = \exp\Bigl(\iu\langle t, m\rangle -
\tfrac12\,t^{\mathsf T}\Sigma\,t\Bigr),
$$

y las [funciones características](#def-b3-clt-cf) en dimensión $d$ son inyectivas (la misma demostración por regularización del [Teorema 23.3](#thm-b3-clt-injectivity), con gaussianas coordenada a coordenada).

**Teorema 23.11.**

Sea $X$ un [vector gaussiano](#def-b3-clt-gaussianvector).

1. Toda imagen afín $AX + b$ es un [vector gaussiano](#def-b3-clt-gaussianvector) .
2. Las componentes $X_i$ son *[independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence)* si y solo si $\Sigma$ es diagonal: para variables conjuntamente [gaussianas](#def-b3-clt-gaussianvector) , incorreladas $=$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) .
3. Si $\Sigma$ es invertible, $X$ tiene la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\frac{1}{(2\pi)^{d/2}\sqrt{\det\Sigma}}  \exp\bigl(-\frac12(x - m)^{\mathsf T}\Sigma^{-1}(x -  m)\bigr)$ .

**Demostración.** (1) Las combinaciones lineales de las componentes de $AX + b$ son funciones afines de combinaciones lineales de $X$: [gaussianas](#def-b3-clt-gaussianvector) (una imagen afín de una variable [gaussiana](#def-b3-clt-gaussianvector) es [gaussiana](#def-b3-clt-gaussianvector)). (2) Si $\Sigma$ es diagonal, la [función característica](#def-b3-clt-cf) factoriza: $\varphi_X(t) = \prod_i\exp(\iu t_im_i -
\frac12\Sigma_{ii}t_i^2) = \prod\varphi_{X_i}(t_i)$, que es la [función característica](#def-b3-clt-cf) de la ley producto (el [Teorema 22.5](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-independence) leído a través de la inyectividad en dimensión $d$): las componentes son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence). El recíproco es la anulación de las covarianzas de variables $L^2$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence). (3) Diagonalícese $\Sigma = P D P^{\mathsf T}$ ($P$ ortogonal, $D > 0$ diagonal — el [Ejercicio 20.8](https://one-course.com/books/math/5/es/chapter/20-subvariedades-de-rn#exo-b3-submanifolds-8)); el vector $Y = P^{\mathsf T}(X - m)$ es [gaussiano](#def-b3-clt-gaussianvector) de covarianza $D$: por (2), sus componentes son $\mathcal N(0, d_i)$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), de modo que $Y$ tiene la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) producto; empújese por la $x = m + PY$, que conserva el volumen (el [Teorema 11.10](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#thm-b3-product-linearchange), $\abs{\det P} = 1$), y reescríbase el exponente de forma invariante. ∎

**Teorema 23.12 (TCL multidimensional).**

Sean $(X_n)$ *vectores* aleatorios i.i.d. de cuadrado [integrable](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1) de $\R^d$, de media $m$ y matriz de covarianzas $\Sigma$. Entonces $\frac{S_n - nm}{\sqrt n}$ converge en distribución al [vector gaussiano](#def-b3-clt-gaussianvector) $\mathcal N(0,
\Sigma)$.

**Demostración.** *Admitido a este nivel.* ∎

**Observación 23.13.**

Casi todo está ya en nuestras manos. Para cada dirección $t \in \R^d$, la variable real $\langle t,
\frac{S_n - nm}{\sqrt n}\rangle$ es una suma normalizada de variables reales i.i.d. de varianza $t^{\mathsf T}\Sigma t$, de modo que el cálculo del [Teorema 23.8](#thm-b3-clt-clt) da la convergencia puntual de las [funciones características](#def-b3-clt-cf) en dimensión $d$ hacia $\eu^{-t^{\mathsf T}\Sigma t/2}$, la [función característica](#def-b3-clt-cf) de $\mathcal N(0, \Sigma)$ (la [Definición 23.10](#def-b3-clt-gaussianvector)). Lo que no hemos vuelto a demostrar es el teorema de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de Lévy *en $\R^d$*: la selección de Helly y la estimación de tensión se generalizan de manera rutinaria (coordenada a coordenada), y esta reducción de Cramér–Wold se lleva a cabo honestamente en cualquier curso de posgrado de probabilidad; no hace falta nada más allá de los métodos de este capítulo.

**Método 23.14.**

Para identificar una ley límite: calcúlense [funciones características](#def-b3-clt-cf), tómese el límite puntual, reconózcase ([gaussiana](#def-b3-clt-gaussianvector) $\eu^{-\sigma^2\xi^2/2}$, Poisson $\eu^{\lambda(\eu^{\iu\xi}-1)}$, exponencial $\frac{\lambda}
{\lambda - \iu\xi}$, …) e invóquese Lévy. El ritual de tres pasos ([independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) $\to$ producto; Taylor en $0$ $\to$ límite exponencial; Lévy $\to$ convergencia en ley) demuestra el TCL, la ley de los sucesos raros de Poisson (el [Ejercicio 23.5](#exo-b3-clt-5)) y todos los teoremas límite clásicos de este curso. Para los enunciados c.s., vuélvase a la caja de herramientas del [Capítulo 22](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#ch-b3-probability): los dos capítulos responden a preguntas distintas sobre el mismo $S_n$.

## 23.5 Ejercicios

**Ejercicio 23.1 ★.**

Calcúlense las [funciones características](#def-b3-clt-cf): uniforme en $\intcc{-1}1$; exponencial $\mathcal E(\lambda)$; Poisson $\mathcal P(\lambda)$; binomial $\mathcal B(n, p)$. Dedúzcase, vía el [Teorema 23.3](#thm-b3-clt-injectivity), que la suma de variables de Poisson [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) ($\lambda, \mu$) es de Poisson $(\lambda +
\mu)$.

**Solución de Ejercicio 23.1.**

Uniforme en $\intcc{-1}1$: $\varphi(\xi) =
\frac12\int_{-1}^1\eu^{\iu\xi x}\dd x =
\frac{\sin\xi}{\xi}$ (igual a $1$ en $\xi = 0$). Exponencial $\mathcal E(\lambda)$: $\varphi(\xi) =
\lambda\int_0^\infty\eu^{(\iu\xi - \lambda)x}\dd x =
\frac{\lambda}{\lambda - \iu\xi}$ (la primitiva se anula en $+\infty$, pues $\operatorname{Re}(\iu\xi -
\lambda) < 0$). Poisson $\mathcal P(\lambda)$: por el teorema de transferencia para leyes discretas,

$$
\varphi(\xi) = \sum_{k\geq0}\eu^{\iu\xi
k}\,\eu^{-\lambda}\frac{\lambda^k}{k!}
= \eu^{-\lambda}\exp\bigl(\lambda\eu^{\iu\xi}\bigr)
= \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr).
$$

Binomial $\mathcal B(n, p)$: una suma de $n$ variables de Bernoulli [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), cada una de f.c. $1 - p + p\eu^{\iu\xi}$, de modo que $\varphi(\xi) = \bigl(1 - p + p\eu^{\iu\xi}\bigr)^n$ (la [Proposición 23.2](#prop-b3-clt-cfbasics)(b)). Aditividad de Poisson: si $X
\sim \mathcal P(\lambda)$, $Y \sim \mathcal P(\mu)$ son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence),

$$
\varphi_{X+Y}(\xi) = \eu^{\lambda(\eu^{\iu\xi}-1)}
\eu^{\mu(\eu^{\iu\xi}-1)} =
\eu^{(\lambda+\mu)(\eu^{\iu\xi}-1)},
$$

la f.c. de $\mathcal P(\lambda + \mu)$; la inyectividad (el [Teorema 23.3](#thm-b3-clt-injectivity)) identifica la ley.

**Ejercicio 23.2 ★★.**

(a) Demuéstrese que $\varphi_X$ toma valores reales si y solo si $X$ y $-X$ tienen la misma ley (una variable *simétrica*). (b) Supóngase $\abs{\varphi_X(\xi_0)} = 1$ para cierto $\xi_0 \neq
0$. Demuéstrese que $X$ está casi seguramente soportada en una progresión aritmética $a + \frac{2\pi}{\xi_0}\Z$ *(escríbase $\varphi_X(\xi_0) = \eu^{\iu\theta}$ y calcúlese $\E[1 -
\cos(\xi_0X - \theta)]$)*. Dedúzcase que si $X$ tiene [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma), entonces $\abs{\varphi_X(\xi)} < 1$ para todo $\xi \neq 0$.

**Solución de Ejercicio 23.2.**

(a) $\overline{\varphi_X(\xi)} = \E\eu^{-\iu\xi X} =
\varphi_{-X}(\xi)$. Así, $\varphi_X$ es real si y solo si $\varphi_X = \varphi_{-X}$, si y solo si (inyectividad, el [Teorema 23.3](#thm-b3-clt-injectivity)) $X$ y $-X$ tienen la misma ley. (b) Escríbase $\varphi_X(\xi_0) = \eu^{\iu\theta}$. Entonces

$$
\E\bigl[1 - \cos(\xi_0X - \theta)\bigr]
= 1 - \operatorname{Re}\bigl(\eu^{-\iu\theta}
\varphi_X(\xi_0)\bigr) = 1 - 1 = 0 .
$$

El integrando es no negativo, de modo que $\cos(\xi_0X - \theta) = 1$ casi seguramente (una variable no negativa de [esperanza](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) nula se anula c.s.), es decir, $\xi_0X - \theta \in 2\pi\Z$ c.s.: $X$ toma sus valores en la progresión aritmética $\frac{\theta}{\xi_0} + \frac{2\pi}{\xi_0}\Z$ casi seguramente. Si $X$ tiene [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma), ese conjunto numerable es de [medida de Lebesgue](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-lebesgueouter) nula, de modo que soporta probabilidad $0$ — contradicción; por tanto, $\abs{\varphi_X(\xi)} < 1$ para todo $\xi \neq 0$.

**Ejercicio 23.3 ★★.**

Sean $X \sim \mathcal N(m_1, \sigma_1^2)$ y $Y \sim
\mathcal N(m_2, \sigma_2^2)$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence). Demuéstrese $X + Y
\sim \mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2)$ y, más en general, que la familia [gaussiana](#def-b3-clt-gaussianvector) es estable por sumas [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y aplicaciones afines. Contraste: ¿es siempre [gaussiana](#def-b3-clt-gaussianvector) la suma de dos [gaussianas](#def-b3-clt-gaussianvector) *dependientes*? ([Ejercicio 23.9](#exo-b3-clt-9).)

**Solución de Ejercicio 23.3.**

Por [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y la [Proposición 23.2](#prop-b3-clt-cfbasics):

$$
\varphi_{X+Y}(\xi) = \eu^{\iu m_1\xi - \sigma_1^2\xi^2/2}\,
\eu^{\iu m_2\xi - \sigma_2^2\xi^2/2}
= \eu^{\iu(m_1+m_2)\xi - (\sigma_1^2+\sigma_2^2)\xi^2/2},
$$

la f.c. de $\mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2)$; la inyectividad concluye. La estabilidad por aplicaciones afines es la regla afín ($aX + b \sim \mathcal N(am_1 + b,
a^2\sigma_1^2)$, admitiendo el caso degenerado $a = 0$), y la estabilidad por sumas [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) se sigue por inducción del cálculo anterior. Para [gaussianas](#def-b3-clt-gaussianvector) *dependientes*, la suma no tiene por qué ser [gaussiana](#def-b3-clt-gaussianvector): en el [Ejercicio 23.9](#exo-b3-clt-9), $X$ y $Y =
\varepsilon X$ son [gaussianas](#def-b3-clt-gaussianvector) estándar cada una, pero $X + Y$ se anula con probabilidad $\frac12$ sin ser c.s. nula, de modo que no es [gaussiana](#def-b3-clt-gaussianvector).

**Ejercicio 23.4 ★★.**

(a) Demuéstrese la equivalencia de la [Definición 23.4](#def-b3-clt-cid): si $\E f(X_n) \to \E f(X)$ para toda $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada, entonces $F_{X_n}(t) \to F_X(t)$ en los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) *(encájese $\mathbf 1_{\intoc{-\infty}t}$ entre dos rampas escalonadas [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity))*; y recíprocamente *(aproxímese una $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada por sumas de funciones rampa, o condiciónese a una malla fina de puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity))* — el recíproco puede tratarse primero para $f$ uniformemente [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y después en general. (b) Demuéstrese que $X_n \Rightarrow c$ (una constante) implica $X_n
\to c$ en probabilidad.

**Solución de Ejercicio 23.4.**

(a) *Implicación directa.* Sean $t$ un punto de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de $F_X$ y $\delta > 0$. Tómense las rampas [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $f^-$ ($= 1$ en $\intoc{-\infty}{t-\delta}$, $0$ a partir de $t$, afín en medio) y $f^+$ ($= 1$ en $\intoc{-\infty}t$, $0$ a partir de $t + \delta$, afín en medio); entonces $f^- \leq
\mathbf 1_{\intoc{-\infty}t} \leq f^+$, de modo que

$$
\E f^-(X_n) \leq F_{X_n}(t) \leq \E f^+(X_n),
$$

y los términos extremos convergen a $\E f^\pm(X)$, a su vez encajonados entre $F_X(t - \delta)$ y $F_X(t + \delta)$. Haciendo $n \to \infty$ y después $\delta \to 0$, y usando la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de $F_X$ en $t$: $F_{X_n}(t) \to F_X(t)$.

*Recíproco.* Sea $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y acotada, $M =
\sup\abs f$, $\varepsilon > 0$. Los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de $F_X$ son densos ($F_X$ tiene a lo sumo una cantidad numerable de saltos), de modo que elíjanse puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $a < b$ con $F_X(a) < \varepsilon$ y $1 - F_X(b) < \varepsilon$. En el [compacto](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-compact) $\intcc ab$, la función $f$ es uniformemente [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity): elíjanse puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $a = t_0 < t_1 < \dots < t_m = b$ de $F_X$ con oscilación de $f$ a lo sumo $\varepsilon$ en cada $\intoc{t_{j-1}}{t_j}$, y póngase $g = \sum_j
f(t_j)\,\mathbf 1_{\intoc{t_{j-1}}{t_j}}$. Entonces $\abs{f - g}
\leq \varepsilon$ en $\intoc ab$, $\abs g \leq M$, y para $T = X_n$ o $X$:

$$
\bigl|\E f(T) - \E g(T)\bigr| \leq \varepsilon +
2M\bigl(F_T(a) + 1 - F_T(b)\bigr).
$$

Además, $\E g(X_n) = \sum_j f(t_j)\bigl(F_{X_n}(t_j) -
F_{X_n}(t_{j-1})\bigr) \to \E g(X)$ (una suma finita de términos convergentes, siendo todos los $t_j$ puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity)), y $F_{X_n}(a) \to F_X(a) < \varepsilon$, $1 - F_{X_n}(b) \to 1
- F_X(b) < \varepsilon$. Ensamblando: $\limsup_n\abs{\E f(X_n) - \E f(X)} \leq 2\varepsilon +
8M\varepsilon$; hágase $\varepsilon \to 0$.

(b) La función de distribución de la constante $c$ es $\mathbf 1_{\intco c\infty}$, [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) salvo en $c$. Para $\varepsilon > 0$, los puntos $c - \varepsilon$ y $c +
\frac\varepsilon2$ son puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), de modo que

$$
\P(\abs{X_n - c} > \varepsilon) \leq F_{X_n}(c -
\varepsilon) + 1 - F_{X_n}\Bigl(c + \frac\varepsilon2\Bigr)
\longrightarrow 0 + 1 - 1 = 0 .
$$

**Ejercicio 23.5 ★★.**

(Ley de los sucesos raros) Sea $X_n \sim \mathcal B(n, p_n)$ con $np_n \to \lambda > 0$. Demuéstrese, vía [funciones características](#def-b3-clt-cf) y el [Teorema 23.7](#thm-b3-clt-levy), que $X_n \Rightarrow \mathcal
P(\lambda)$. Comprobación numérica de sensatez: compárense $\P(X = 0)$ para $\mathcal B(100, 0.02)$ y $\mathcal P(2)$.

**Solución de Ejercicio 23.5.**

Sea $z_n = p_n(\eu^{\iu\xi} - 1)$, de modo que $\varphi_{X_n}(\xi) =
(1 + z_n)^n$ (el [Ejercicio 23.1](#exo-b3-clt-1)) y $\abs{z_n} \leq 2p_n
\to 0$ (obsérvese $p_n = \frac{np_n}n \to 0$). Tanto $1 + z_n$ como $\eu^{z_n}$ tienen módulo a lo sumo $1$: $\abs{1 + z_n} =
\abs{(1 - p_n) + p_n\eu^{\iu\xi}} \leq 1$ por la desigualdad triangular, y $\abs{\eu^{z_n}} = \eu^{p_n(\cos\xi - 1)}
\leq 1$. La desigualdad telescópica $\abs{a^n - b^n} \leq
n\abs{a - b}$ (demostración del [Teorema 23.8](#thm-b3-clt-clt)) y la cota de la serie de potencias $\abs{\eu^z - 1 - z} \leq
\abs z^2\eu^{\abs z}$ dan

$$
\bigl|(1 + z_n)^n - \eu^{nz_n}\bigr| \leq n\bigl|1 + z_n -
\eu^{z_n}\bigr| \leq n\,\abs{z_n}^2\,\eu^{\abs{z_n}} \leq
4\eu^2\,np_n^2 = 4\eu^2\,(np_n)\,p_n \longrightarrow 0 .
$$

Como $nz_n = np_n(\eu^{\iu\xi} - 1) \to
\lambda(\eu^{\iu\xi} - 1)$, concluimos $\varphi_{X_n}(\xi)
\to \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr)$ para todo $\xi$: la f.c. de $\mathcal P(\lambda)$, y Lévy (el [Teorema 23.7](#thm-b3-clt-levy)) da $X_n \Rightarrow \mathcal
P(\lambda)$. Numéricamente: $\P\bigl(\mathcal B(100, 0.02) =
0\bigr) = 0.98^{100} = \eu^{100\ln 0.98} \approx
\eu^{-2.020} \approx 0.1326$, mientras que $\P\bigl(\mathcal P(2) =
0\bigr) = \eu^{-2} \approx 0.1353$: dos puntos porcentuales de diferencia ya con este $n$ tan burdo.

**Ejercicio 23.6 ★★.**

(a) Se lanza un dado equilibrado $n = 1000$ veces; apróxímese la probabilidad de que el total supere $3600$ (media $3500$, varianza por lanzamiento $\frac{35}{12}$). (b) Para $S \sim \mathcal B(100, \frac12)$, apróxímese $\P(45 \leq S \leq 55)$ mediante el TCL con la corrección de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) ($\pm\frac12$), y coméntese el efecto de la corrección.

**Solución de Ejercicio 23.6.**

(a) Un lanzamiento tiene media $\frac72$ y varianza $\frac{35}{12}$, de modo que $S$ tiene media $3500$, varianza $\frac{35000}{12} \approx 2916.7$ y desviación típica $\approx 54.0$. Por el TCL,

$$
\P(S > 3600) = \P\Bigl(\frac{S - 3500}{54.0} > 1.85\Bigr)
\approx 1 - \Phi(1.85) \approx 0.032 :
$$

alrededor de un $3\%$ de probabilidad. (b) $S \sim \mathcal B(100, \frac12)$: media $50$, desviación típica $5$. Con la corrección de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity),

$$
\P(45 \leq S \leq 55) \approx
\Phi\Bigl(\frac{55.5 - 50}{5}\Bigr) -
\Phi\Bigl(\frac{44.5 - 50}{5}\Bigr) = 2\Phi(1.1) - 1
\approx 0.729,
$$

frente al valor exacto $0.7287$; sin la corrección, $2\Phi(1) - 1 \approx 0.683$, con casi cinco puntos de desviación. La corrección importa porque $S$ es una variable reticular: el átomo $\P(S = k)$ queda bien aproximado por la masa [gaussiana](#def-b3-clt-gaussianvector) de $\intcc{k - \frac12}{k + \frac12}$, y recortar el intervalo en los enteros $45$ y $55$ desecha medio átomo en cada extremo.

**Ejercicio 23.7 ★★.**

(Error de [Monte Carlo](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#ex-b3-probability-sllnapps)) En el marco del [Problema 22.1](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#pb-b3-probability-1), pregunta 11, con $g \in
L^2(\intcc01^d)$, sean $\sigma^2 = \V(g(U_1))$ y $I = \int
g$. Demuéstrese

$$
\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr)
\Longrightarrow \mathcal N(0, \sigma^2),
$$

y dedúzcase la barra de error asintótica al $95\%$, $\pm
1.96\,\sigma/\sqrt n$ — independiente de la dimensión $d$. Compárese con la regla del punto medio determinista en dimensión $d$ (error $\sim n^{-2/d}$ para integrandos $\mathcal C^2$): ¿a partir de qué dimensión gana el muestreo aleatorio?

**Solución de Ejercicio 23.7.**

Las variables $g(U_k)$ son i.i.d. (imágenes [medibles](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) de variables i.i.d.), de cuadrado [integrable](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1), de media $I$ (teorema de transferencia, el [Ejercicio 11.9](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-9)) y varianza $\sigma^2$. Si $\sigma > 0$, el [Teorema 23.8](#thm-b3-clt-clt) aplicado a ellas es exactamente la convergencia enunciada

$$
\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr) =
\frac{\sum_{k\leq n}\bigl(g(U_k) - I\bigr)}{\sqrt n}
\Longrightarrow \mathcal N(0, \sigma^2)
$$

(si $\sigma = 0$, $g$ es c.s. constante y el miembro izquierdo se anula idénticamente). Por tanto, $\P\bigl(\abs{\frac1n\sum g(U_k) - I} \leq
1.96\,\sigma/\sqrt n\bigr) \to 0.95$: la barra de error $\pm
1.96\,\sigma/\sqrt n$ ve la dimensión $d$ solo a través de la constante $\sigma$, nunca a través de la velocidad en $n$. La regla del punto medio con $n$ nodos en dimensión $d$ tiene paso $n^{-1/d}$ y error de orden $n^{-2/d}$ para integrandos $\mathcal C^2$. El $n^{-1/2}$ de [Monte Carlo](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#ex-b3-probability-sllnapps) decae más deprisa que $n^{-2/d}$ exactamente cuando $\frac12 > \frac2d$, es decir, $d > 4$: a partir de la dimensión $5$, el muestreo aleatorio gana asintóticamente a la malla — la maldición de la dimensión perdona a los métodos probabilísticos, y por eso [Monte Carlo](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#ex-b3-probability-sllnapps) reina en la integración en dimensión alta.

**Ejercicio 23.8 ★★★.**

(Slutsky) Supóngase $X_n \Rightarrow X$ y $Y_n \to c$ en probabilidad ($c$ constante). Demuéstrense $X_n + Y_n \Rightarrow X +
c$ y $Y_nX_n \Rightarrow cX$. *(Trabájese con [funciones características](#def-b3-clt-cf) y la cota $\abs{\E\eu^{\iu\xi
(X_n+Y_n)} - \eu^{\iu\xi c}\E\eu^{\iu\xi X_n}} \leq
\E\abs{\eu^{\iu\xi(Y_n - c)} - 1}$, separando según $\abs{Y_n - c}
\leq \delta$.)* Aplicación: en el [Ejemplo 23.9](#ex-b3-clt-confidence), justifíquese la sustitución del $\sigma = \sqrt{p(1-p)}$ desconocido por $\sqrt{\hat p_n(1 - \hat
p_n)}$.

**Solución de Ejercicio 23.8.**

*Suma.* Para $\xi$ fijo:

$$
\bigl|\E\eu^{\iu\xi(X_n+Y_n)} -
\eu^{\iu\xi c}\,\E\eu^{\iu\xi X_n}\bigr|
= \bigl|\E\bigl[\eu^{\iu\xi X_n}\bigl(\eu^{\iu\xi Y_n} -
\eu^{\iu\xi c}\bigr)\bigr]\bigr|
\leq \E\bigl|\eu^{\iu\xi(Y_n - c)} - 1\bigr| .
$$

Sepárese según el suceso $\{\abs{Y_n - c} \leq \delta\}$: allí, $\abs{\eu^{\iu\xi(Y_n-c)} - 1} \leq \abs\xi\,\delta$ (la cuerda es más corta que el arco); el complementario aporta a lo sumo $2\,\P(\abs{Y_n - c} > \delta) \to 0$. Por tanto, el $\limsup$ es $\leq \abs\xi\,\delta$ para todo $\delta > 0$: la diferencia tiende a $0$. Como $\E\eu^{\iu\xi X_n} \to
\varphi_X(\xi)$, se obtiene $\varphi_{X_n+Y_n}(\xi) \to
\eu^{\iu\xi c}\varphi_X(\xi) = \varphi_{X+c}(\xi)$, y Lévy (el [Teorema 23.7](#thm-b3-clt-levy)) da $X_n + Y_n
\Rightarrow X + c$.

*Producto.* Primero, $cX_n \Rightarrow cX$: $\varphi_{cX_n}(\xi) = \varphi_{X_n}(c\xi) \to
\varphi_X(c\xi) = \varphi_{cX}(\xi)$. Después, $(Y_n - c)X_n
\to 0$ en probabilidad: las leyes de las $X_n$ son tensas (sus f.c. convergen a una f.c.; véase el paso de tensión del [Teorema 23.7](#thm-b3-clt-levy)), de modo que, dado $\varepsilon > 0$, tómese $M$ con $\P(\abs{X_n} > M) \leq \varepsilon$ para todo $n$; entonces

$$
\P\bigl(\abs{(Y_n - c)X_n} > \varepsilon\bigr) \leq
\P(\abs{X_n} > M) + \P\Bigl(\abs{Y_n - c} >
\frac{\varepsilon}{M}\Bigr) \leq \varepsilon + o(1) .
$$

Escribiendo $Y_nX_n = cX_n + (Y_n - c)X_n$ y aplicando la parte de la suma (cuya demostración solo usó $Y_n' := (Y_n - c)X_n \to 0$ en probabilidad, con constante $0$): $Y_nX_n \Rightarrow cX$.

*Aplicación.* Por la ley fuerte de los grandes números (el [Teorema 22.13](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-slln)), $\hat p_n \to p$ c.s., de modo que por [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $\hat\sigma_n = \sqrt{\hat p_n(1 - \hat p_n)}
\to \sigma = \sqrt{p(1 - p)} > 0$ c.s. y, por tanto, $\frac{\sigma}{\hat\sigma_n} \to 1$ en probabilidad. La regla del producto de Slutsky eleva $\frac{S_n - np}{\sigma\sqrt n}
\Rightarrow \mathcal N(0,1)$ a $\frac{S_n -
np}{\hat\sigma_n\sqrt n} = \frac{\sigma}{\hat\sigma_n}\cdot
\frac{S_n - np}{\sigma\sqrt n} \Rightarrow \mathcal N(0,1)$: el intervalo de confianza *utilizable* $\hat p_n \pm
1.96\,\hat\sigma_n/\sqrt n$, construido solo con los datos, conserva su nivel asintótico $95\%$.

**Ejercicio 23.9 ★★★.**

Sean $X \sim \mathcal N(0,1)$ y $\varepsilon$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) con $\P(\varepsilon = \pm1) = \frac12$; póngase $Y =
\varepsilon X$. (a) Demuéstrense $Y \sim \mathcal N(0,1)$ y $\operatorname{Cov}(X, Y) = 0$. (b) Demuéstrese que $X$ y $Y$ *no* son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y que $(X, Y)$ no es un [vector gaussiano](#def-b3-clt-gaussianvector) *(calcúlese $\P(X + Y =
0)$)*. (c) Moraleja: el [Teorema 23.11](#thm-b3-clt-gaussianvector)(2) exige gaussianidad conjunta — «[gaussianas](#def-b3-clt-gaussianvector) incorreladas» por sí solo no demuestra nada.

**Solución de Ejercicio 23.9.**

(a) Separando la [esperanza](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) según los dos valores de $\varepsilon$ ([independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence)): para $B$ boreliana, $\P(Y \in B) =
\frac12\P(X \in B) + \frac12\P(-X \in B) = \P(X \in B)$, pues $-X \sim X$ ($\mathcal N(0,1)$ es simétrica): $Y \sim
\mathcal N(0,1)$. Y $\operatorname{Cov}(X, Y) =
\E[\varepsilon X^2] = \E[\varepsilon]\,\E[X^2] = 0 \cdot 1 =
0$. (b) $\abs Y = \abs X$, de modo que $\P(\abs X \leq 1,\ \abs Y \geq 2)
= 0$ mientras que $\P(\abs X \leq 1)\,\P(\abs Y \geq 2) > 0$: no [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence). Si $(X, Y)$ fuera un [vector gaussiano](#def-b3-clt-gaussianvector), $X + Y =
(1 + \varepsilon)X$ sería una variable [gaussiana](#def-b3-clt-gaussianvector) real (la [Definición 23.10](#def-b3-clt-gaussianvector) con $t = (1,1)$); pero $\P(X + Y = 0) = \P(\varepsilon = -1) = \frac12$, mientras que una variable [gaussiana](#def-b3-clt-gaussianvector) solo tiene un átomo si es c.s. constante — y $X + Y$ vale $2X \neq 0$ c.s. en $\{\varepsilon = 1\}$. Contradicción: $(X, Y)$ no es [gaussiano](#def-b3-clt-gaussianvector). (c) Cada marginal es [gaussiana](#def-b3-clt-gaussianvector) y la covarianza se anula y, sin embargo, falla la [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) — porque el *par* no es conjuntamente [gaussiano](#def-b3-clt-gaussianvector). El [Teorema 23.11](#thm-b3-clt-gaussianvector)(2) no puede debilitarse a «marginales [gaussianas](#def-b3-clt-gaussianvector)».

**Ejercicio 23.10 ★★.**

La ley de Cauchy tiene [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\frac1{\pi(1 + x^2)}$. (a) Demuéstrese que su [función característica](#def-b3-clt-cf) es $\eu^{-\abs\xi}$ (el [Ejercicio 14.1](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#exo-b3-fouriertransform-1) e inversión). (b) Demuéstrese que si $X_1, \dots, X_n$ son i.i.d. de Cauchy, entonces $\frac{S_n}n$ es de nuevo de Cauchy — la *misma* ley: la media nunca se concentra. (c) Concíliese con las leyes de los grandes números y el TCL: ¿qué hipótesis fallan? (Calcúlese $\E\abs{X_1}$.)

**Solución de Ejercicio 23.10.**

(a) El [Ejercicio 14.1](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#exo-b3-fouriertransform-1) calcula $\widehat{\eu^{-\abs\cdot}}(\xi) = \frac{2}{1 + \xi^2}$; siendo ambos miembros [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1), la inversión de Fourier (el [Teorema 14.5](https://one-course.com/books/math/5/es/chapter/14-la-transformada-de-fourier#thm-b3-fouriertransform-inversion)) le da la vuelta:

$$
\int_\R\eu^{\iu\xi x}\,\frac{\dd x}{\pi(1 + x^2)} =
\eu^{-\abs\xi},
$$

que es exactamente $\varphi_X(\xi)$ para una variable de Cauchy $X$. (b) Por [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), $\varphi_{S_n}(\xi) =
\bigl(\eu^{-\abs\xi}\bigr)^n = \eu^{-n\abs\xi}$, de modo que $\varphi_{S_n/n}(\xi) = \varphi_{S_n}(\xi/n) =
\eu^{-\abs\xi}$: la media empírica $\frac{S_n}n$ vuelve a ser de Cauchy estándar para todo $n$ (inyectividad). La media nunca se concentra: sus fluctuaciones en el instante $10^6$ son las de una sola observación. (c) $\E\abs{X_1} = \frac2\pi\int_0^\infty\frac{x\,\dd x}{1 +
x^2} = +\infty$: la ley de Cauchy no es [integrable](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1), de modo que la ley fuerte de los grandes números (el [Teorema 22.13](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-slln)) no se aplica, y el TCL (que necesita varianza finita) menos aún. Aquí fallan genuinamente sus conclusiones, no solo sus demostraciones. Comprobación de consistencia: $\varphi(\xi) = \eu^{-\abs\xi}$ no es derivable en $0$, como predice la [Proposición 23.2](#prop-b3-clt-cfbasics)(c) leída por contrarrecíproco para una variable no [integrable](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1).

**Ejercicio 23.11 ★★.**

(Leyes estables en embrión) Sean $(X_n)$ i.i.d. de Cauchy estándar (el [Ejercicio 23.10](#exo-b3-clt-10)). (a) Demuéstrese que, para todo $a, b > 0$, $aX_1 + bX_2$ tiene la ley de $(a + b)X_1$: la familia de Cauchy es *estrictamente estable* de índice $1$. (b) Demuéstrese que la familia [gaussiana](#def-b3-clt-gaussianvector) es estrictamente estable de índice $2$: $aX_1 + bX_2 \sim \sqrt{a^2 + b^2}\,X_1$ para $X_i$ i.i.d. $\mathcal N(0,1)$. (c) Explíquese, mediante [funciones características](#def-b3-clt-cf) de la forma $\eu^{-c\abs\xi^\alpha}$, por qué la estabilidad de índice $\alpha$ fuerza la normalización $n^{1/\alpha}$ para las sumas, y qué dice esto sobre las cuencas de atracción del TCL: ¿qué sumas i.i.d. pueden converger, tras normalización afín, a una ley de Cauchy en lugar de a una [gaussiana](#def-b3-clt-gaussianvector)?

**Solución de Ejercicio 23.11.**

(a) $\varphi_{aX_1 + bX_2}(\xi) =
\eu^{-a\abs\xi}\eu^{-b\abs\xi} = \eu^{-(a+b)\abs\xi} =
\varphi_{(a+b)X_1}(\xi)$ ([independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y el [Ejercicio 23.10](#exo-b3-clt-10)); la inyectividad identifica las leyes.

(b) $\varphi_{aX_1+bX_2}(\xi) = \eu^{-a^2\xi^2/2}
\eu^{-b^2\xi^2/2} = \eu^{-(a^2+b^2)\xi^2/2}$: la ley de $\sqrt{a^2+b^2}\,X_1$.

(c) Si $\varphi_X(\xi) = \eu^{-c\abs\xi^\alpha}$, entonces $S_n = X_1 + \dots + X_n$ tiene $\varphi_{S_n} =
\eu^{-cn\abs\xi^\alpha}$, y $S_n/n^{1/\alpha}$ vuelve a tener $\varphi(\xi) = \eu^{-c\abs\xi^\alpha}$: autorreproducción exacta bajo el reescalado $n^{1/\alpha}$ — $\sqrt n$ para la [gaussiana](#def-b3-clt-gaussianvector) ($\alpha = 2$), el propio $n$ para Cauchy ($\alpha = 1$, el [Ejercicio 23.10](#exo-b3-clt-10)(b)). Una suma de variables i.i.d. solo puede converger (tras normalización afín) a una ley estable bajo tales convoluciones; el TCL dice que la varianza finita fuerza la cuenca [gaussiana](#def-b3-clt-gaussianvector), y la cuenca de Cauchy está reservada a leyes de colas tan pesadas que $\E X^2 = \infty$ e incluso $\E\abs
X = \infty$ — por ejemplo, sumas de variables de Cauchy. La universalidad tiene varias islas, indexadas por el exponente de cola $\alpha \in \intoc02$.

**Ejercicio 23.12 ★★.**

(La función de distribución empírica) Sean $(X_n)$ i.i.d. de función de distribución $F$, y $F_n(t) =
\frac1n\#\{k \leq n : X_k \leq t\}$. (a) Fíjese $t$. Demuéstrense que $n F_n(t) \sim \mathcal B(n, F(t))$, que $F_n(t) \to F(t)$ c.s. (el [Teorema 22.13](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-slln)) y que

$$
\sqrt n\,\bigl(F_n(t) - F(t)\bigr) \Longrightarrow
\mathcal N\bigl(0,\ F(t)(1 - F(t))\bigr) .
$$

(b) ¿En qué $t$ es máxima la varianza asintótica? Interprétese: la mediana es donde más cuesta fijar una distribución empírica. (c) Para $F$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), demuéstrese que la ley de $\sup_t\abs{F_n(t) - F(t)}$ no depende de $F$ *(redúzcase a variables uniformes vía el [Ejercicio 22.1](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#exo-b3-probability-1))* — el milagro libre de distribución que hay detrás del contraste de Kolmogorov–Smirnov; no se pide calcular esa ley.

**Solución de Ejercicio 23.12.**

(a) Los indicadores $\mathbf 1_{X_k \leq t}$ son i.i.d. de Bernoulli de parámetro $p = F(t)$: su suma $nF_n(t)$ es binomial $\mathcal B(n, p)$; la ley fuerte da $F_n(t)
\to p$ c.s., y el TCL (el [Teorema 23.8](#thm-b3-clt-clt)) aplicado a los mismos indicadores (varianza $p(1-p)$) da el límite [gaussiano](#def-b3-clt-gaussianvector) enunciado.

(b) $p(1 - p)$ es máxima en $p = \frac12$, es decir, donde $F(t) = \frac12$: en la *mediana*. Estimar probabilidades de cola es asintóticamente fácil (varianza $\to 0$ cuando $p \to 0, 1$); la región de la mediana carga con el mayor ruido estadístico — la curva empírica oscila más en su parte central.

(c) Para $F$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), las variables $U_k = F(X_k)$ son i.i.d. uniformes en $\intoo01$ (el [Ejercicio 22.1](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#exo-b3-probability-1)), y la monotonía de $F$ da, escribiendo $G_n$ para la función de distribución empírica de las $U_k$:

$$
\sup_{t\in\R}\,\abs{F_n(t) - F(t)}
= \sup_{u \in \operatorname{im}F}\,\abs{G_n(u) - u}
= \sup_{u\in\intcc01}\abs{G_n(u) - u} :
$$

la primera igualdad porque $\{X_k \leq t\} = \{U_k \leq
F(t)\}$ salvo sucesos nulos (monotonía; la desigualdad estricta solo puede fallar en los tramos planos de $F$, donde ambos miembros no cambian), y la segunda porque una $F$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), que va de $0$ a $1$, alcanza todo valor de $\intoo01$ (teorema del valor intermedio), y los extremos no añaden nada ($G_n(0) - 0 = 0$ y $G_n(1) - 1 = 0$). El miembro derecho solo involucra uniformes: una ley para todos los $F$ — de modo que una única tabla de valores críticos (la de la distribución de Kolmogorov) contrasta *cualquier* modelo [continuo](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) frente a los datos.

## 23.6 Problema: la demostración de Lindeberg del TCL, con velocidad

**Problema 23.1.**

Problema de fin de semana — el método de sustitución

Lindeberg (1922) demostró el teorema central del límite con una idea de una sencillez desarmante: *sustitúyanse los sumandos, uno a uno, por [gaussianas](#def-b3-clt-gaussianvector)* y contrólese cada sustitución con un desarrollo de Taylor. El método no necesita análisis de Fourier, produce una velocidad de error explícita y hoy alimenta demostraciones de universalidad en toda la teoría de la probabilidad. Sean $(X_i)$ i.i.d., centradas, $\V(X_1) = 1$, con $\beta = \E\abs{X_1}^3 < \infty$; sean $(N_i)$ i.i.d. $\mathcal N(0,1)$, [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) de las $X_i$ (existencia: el [Teorema 22.6](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-existence)). Póngase

$$
T_n = \frac{X_1 + \dots + X_n}{\sqrt n},
\qquad
G_n = \frac{N_1 + \dots + N_n}{\sqrt n} \sim \mathcal N(0,1).
$$

**Parte I — La identidad de sustitución.** Fíjese $f
\in \mathcal C^3_b(\R)$ (tres derivadas [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotadas; $M_3 = \sup\abs{f'''}$). Para $0 \leq i \leq n$ defínanse las sumas híbridas

$$
H_i = \frac{X_1 + \dots + X_i + N_{i+1} + \dots +
N_n}{\sqrt n},
$$

de modo que $H_n = T_n$ y $H_0 = G_n$.

1. Escríbanse $H_i = W_i + \frac{X_i}{\sqrt n}$ y $H_{i-1}  = W_i + \frac{N_i}{\sqrt n}$ con $W_i =  \frac{1}{\sqrt n}\bigl(\sum_{j<i}X_j +  \sum_{j>i}N_j\bigr)$ , y obsérvese que $W_i$ es independiente del par $(X_i, N_i)$ . Justifíquese.
2. Taylor con resto integral o de Lagrange: para cualesquiera reales $w, h$: $$\Bigl|f(w + h) - f(w) - f'(w)h -  \tfrac12f''(w)h^2\Bigr| \leq  \frac{M_3\,\abs h^3}{6} .$$
3. Aplíquese la pregunta 2 dos veces ($h = \frac{X_i}{\sqrt n}$ y $h = \frac{N_i}{\sqrt n}$ en $w = W_i$), tómense [esperanzas](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) y úsense la [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y la coincidencia de los dos primeros momentos de $X_i$ y $N_i$ para demostrar $$\bigl|\E f(H_i) - \E f(H_{i-1})\bigr|  \leq \frac{M_3}{6}\cdot  \frac{\beta + \gamma}{n^{3/2}},  \qquad \gamma = \E\abs{N_1}^3 =  \frac{2\sqrt2}{\sqrt\pi} .$$
4. Telescópese en $i$ y conclúyase la *cota de Lindeberg*: $$\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq  \frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .$$

**Parte II — De las $f$ regulares al TCL.**

5. Demuéstrese que $\E f(T_n) \to \E f(N)$ para todo $f \in  \mathcal C_b^3$ , y elévese a todas las $f$ [continuas](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotadas: dadas una tal $f$ y $\varepsilon$ , constrúyase $f_\varepsilon \in \mathcal C^3_b$ con $\norm{f - f_\varepsilon}_\infty \leq \varepsilon$ en un intervalo grande — por ejemplo, convoluciónese $f$ con una meseta $\mathcal C^\infty$ (el [Teorema 12.9](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#thm-b3-lp-regularization) ) — y trátense las colas por tensión ( $\V(T_n) = 1$ y Chebyshev). Conclúyase $T_n \Rightarrow \mathcal N(0, 1)$ : el teorema central del límite, vuelto a demostrar.
6. ¿Dónde usó la demostración que las $X_i$ estén *idénticamente* distribuidas? Demuéstrese que apenas lo usó: enúnciese y demuéstrese la versión para $X_i$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) , centradas y no idénticas, con $\sum_i\V(X_i) = s_n^2$ y terceros momentos, obteniendo el error $\frac{M_3}{6s_n^3}\sum_i\bigl(\E\abs{X_i}^3  + \V(X_i)^{3/2}\gamma\bigr)$ — el verdadero teorema de Lindeberg en su forma de Lyapunov.

**Parte III — Dividendos cuantitativos.**

7. (Funciones de distribución) Sea $t \in \R$ y apróxímese $\mathbf 1_{\intoc{-\infty}t}$ por arriba y por abajo mediante rampas $\mathcal C^3_b$ de anchura $\delta$ (constrúyanse, con $M_3 = O(\delta^{-3})$). Combinando con la Parte I, dedúzcase la cota de dos términos $$\sup_{t\in\R}\,\bigl|\P(T_n \leq t) -  \Phi(t)\bigr| \;\leq\;  \frac{C_1(\beta + \gamma)}{\delta^3\sqrt n} +  C_2\,\delta  \qquad (\text{todo } \delta > 0),$$ con constantes explícitas (el término $C_2\delta$ usa que $\Phi$ tiene [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) acotada por $\frac1{\sqrt{2\pi}}$), y optimícese $\delta \sim  n^{-1/8}$ para obtener una velocidad uniforme de orden $n^{-1/8}$. (La $n^{-1/2}$ óptima — Berry–Esseen — necesita herramientas más finas; lo importante es obtener una velocidad *explícita* a partir de una sustitución elemental.)
8. (De Moivre–Laplace, cuantificado) Especialícese a $X_i = 2B_i - 1$ (signos de monedas equilibradas): compárese la conclusión con la estimación local del [Problema 11.1](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#pb-b3-product-1) , pregunta 7 — ¿qué da cada método que el otro no da?
9. (Universalidad) Explíquese en un párrafo por qué el método de sustitución muestra más que el TCL: todo estadístico de la forma $\E f(\text{suma})$ con $f$ regular es insensible, al orden $n^{-1/2}$ , a *toda la ley* de los sumandos más allá de sus dos primeros momentos — el «principio de invariancia» que subyace a los resultados modernos de universalidad (matrices aleatorias, polinomios aleatorios), del que el TCL es la primera instancia.

**Parte IV — Regularización, llevada más lejos: mejores velocidades.** La pérdida al pasar de $n^{-1/2}$ ($f$ regulares) a $n^{-1/8}$ (funciones de distribución) vino de cargar $f'''$ en norma del supremo. Los híbridos pueden reparar parte de ella: contienen sumandos [gaussianos](#def-b3-clt-gaussianvector), y las [gaussianas](#def-b3-clt-gaussianvector) *regularizan*.

10. (Una [gaussiana](#def-b3-clt-gaussianvector) escondida) Para $1 \leq i \leq n - 1$, $h =  \frac{X_i}{\sqrt n}$ o $\frac{N_i}{\sqrt n}$, y $\theta \in \intcc01$, escríbase $W_i + \theta h = A +  Z$ con $Z = \frac{N_{i+1} + \dots + N_n}{\sqrt  n}$. Demuéstrese que $Z \sim \mathcal N\bigl(0,  \frac{n-i}n\bigr)$ es independiente del par $(A,  h)$ y dedúzcase, para toda $g \in  L^1(\R)$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), $$\E\bigl[\abs h^3\,\abs{g(W_i + \theta h)}\bigr]  \;\leq\; \sqrt{\frac{n}{2\pi(n - i)}}\;  \norm{g}_{L^1}\;\E\abs h^3 .$$
11. Combínese la pregunta 10 con la forma integral del resto de Taylor, $$f(w + h) = f(w) + f'(w)h + \tfrac12f''(w)h^2 +  \int_0^1\frac{(1 - \theta)^2}2\,f'''(w + \theta  h)\,h^3\,\dd\theta,$$ para rehacer las preguntas 3–4: para $f \in \mathcal C^3_b$ con, además, $f''' \in L^1(\R)$, $$\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq  \frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot  \frac{\norm{f'''}_{L^1}}{\sqrt n} +  \frac{M_3(\beta + \gamma)}{6\,n^{3/2}}$$ *(la pregunta 10 se ocupa de las sustituciones $i \leq n - 1$ — úsese $\sum_{m=1}^{n-1}m^{-1/2} \leq 2\sqrt n$ — y la cota burda de la pregunta 3 se ocupa de la última)*. Compruébese que las rampas de la pregunta 7 cumplen $\norm{\psi_\delta'''}_{L^1} = K_1\delta^{-2}$ mientras que $M_3 = K\delta^{-3}$, introdúzcanse y optimícese $\delta$: la velocidad uniforme para funciones de distribución mejora a $O(n^{-1/6})$.
12. (Ajustando un momento más) Supóngase además $\E  X_1^3 = 0$ y $\beta_4 = \E X_1^4 < \infty$ . Calcúlense $\E N_1^3$ y $\E N_1^4$ , desarróllese hasta el cuarto orden y demuéstrese por la misma vía que la velocidad para funciones de distribución pasa a ser $O(n^{-1/4})$ *(ahora $\norm{\psi_\delta^{(4)}}_{L^1} =  K_2\delta^{-3}$ y $M_4 = K'\delta^{-4}$; elíjase $\delta = n^{-1/4}$)* .
13. (La obstrucción) Supóngase que los $k$ primeros momentos de $X_1$ coinciden con los [gaussianos](#def-b3-clt-gaussianvector) ( $k = 2$ siempre; $k = 3$ exactamente cuando $\E X_1^3 = 0$ ; $k \geq 4$ prácticamente nunca, pues $\E N_1^4 = 3$ ). Verifíquese que el esquema de las preguntas 10–12 entrega la velocidad $n^{-(k-1)/(2k+2)}$ para funciones de distribución, equilibrando $\delta^{-k}n^{-(k-1)/2}$ frente a $\delta$ , y obsérvese que el exponente se aproxima al valor $\frac12$ de Berry–Esseen solo cuando $k \to  \infty$ . Explíquese en unas frases por qué el método de sustitución se satura: cada sustitución se carga en valor absoluto, mientras que la vía de Fourier (desigualdad de regularización de Esseen) explota la oscilación de la diferencia de [funciones características](#def-b3-clt-cf) y alcanza $C\beta n^{-1/2}$ con solo tres momentos.

**Parte V — Dos dimensiones: el TCL multidimensional, por sustitución.** Sean ahora las $X_i$ *vectores* aleatorios i.i.d. centrados de $\R^2$, con matriz de covarianzas $\Sigma$ y $\beta' = \E\norm{X_1}^3 <
\infty$ (norma euclídea).

14. ( [Vectores gaussianos](#def-b3-clt-gaussianvector) , hasta el orden) Diagonalícese $\Sigma =  PDP^{\mathsf T}$ (el [Ejercicio 20.8](https://one-course.com/books/math/5/es/chapter/20-subvariedades-de-rn#exo-b3-submanifolds-8) ) y póngase $C = P\sqrt DP^{\mathsf T}$ . Para $Z = (Z^1,  Z^2)$ un par de [gaussianas](#def-b3-clt-gaussianvector) estándar [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) (el [Teorema 22.6](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-existence) ), demuéstrese que $N  = CZ$ es un [vector gaussiano](#def-b3-clt-gaussianvector) (la [Definición 23.10](#def-b3-clt-gaussianvector) ) de media $0$ y covarianza $\Sigma$ , con $\gamma' = \E\norm N^3 <  \infty$ ; y que $G_n = \frac{N_1 + \dots +  N_n}{\sqrt n}$ tiene ley $\mathcal N(0, \Sigma)$ *exactamente* para copias i.i.d. $N_i$ .
15. (Taylor en dos variables) Para $f \colon \R^2 \to  \R$ de clase $\mathcal C^3$ con $M_3 =  \max_{\abs\alpha = 3}\sup\abs{\partial^\alpha f} <  \infty$, demuéstrese $$\Bigl|f(w + h) - f(w) - \langle\nabla f(w),  h\rangle - \tfrac12\langle h, D^2f(w)\,h\rangle  \Bigr| \leq \frac{M_3}6\,\bigl(\abs{h_1} +  \abs{h_2}\bigr)^3 \leq \frac{\sqrt2\,M_3}3\,  \norm h^3$$ *(estúdiese $t \mapsto f(w + th)$ en $\intcc01$)*.
16. (El TCL en $\R^2$) Ejecútese el esquema de sustitución sobre los híbridos vectoriales $H_i$: demuéstrese que los términos de primer y segundo orden se cancelan (medias y covarianzas coinciden), telescópese y elévese como en la pregunta 5 (tensión a partir de $\E\norm{T_n}^2 =  \operatorname{tr}\Sigma$; regularización ahora en $\R^2$, el [Teorema 12.9](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#thm-b3-lp-regularization)) para concluir: para toda $f \colon  \R^2 \to \R$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada, $$\E\,f\Bigl(\frac{X_1 + \dots + X_n}{\sqrt n}\Bigr)  \longrightarrow \E\,f(N), \qquad N \sim \mathcal  N(0, \Sigma) :$$ el [Teorema 23.12](#thm-b3-clt-multiclt) en dimensión $2$, con velocidad para $f$ regulares y sin análisis de Fourier.
17. (Cramér–Wold y una fluctuación conjunta) Dedúzcase que $\langle t, \frac{S_n}{\sqrt n}\rangle  \Rightarrow \mathcal N(0, t^{\mathsf T}\Sigma t)$ para todo $t \in \R^2$ fijo. Aplicación: para $(\xi_i)$ reales i.i.d., centradas, con $\E\xi_1^2 = 1$, $\E\xi_1^6 < \infty$ (de modo que la Parte V se aplica a $V_i = (\xi_i, \xi_i^2 - 1)$), demuéstrese $$\frac1{\sqrt n}\Bigl(\sum_{i\leq n}\xi_i,\  \sum_{i\leq n}(\xi_i^2 - 1)\Bigr) \Longrightarrow  \mathcal N\Bigl(0, \begin{pmatrix} 1 & \E\xi_1^3\\  \E\xi_1^3 & \E\xi_1^4 - 1\end{pmatrix}\Bigr) :$$ la media empírica y el momento empírico de segundo orden fluctúan conjuntamente de manera [gaussiana](#def-b3-clt-gaussianvector) — de manera independiente en el límite si y solo si $\E\xi_1^3 = 0$ ([Teorema 23.11](#thm-b3-clt-gaussianvector)).

**Parte VI — El método delta.**

18. Sean $(\hat\theta_n)$ [variables aleatorias](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) con $\sqrt n(\hat\theta_n - \theta) \Rightarrow  \mathcal N(0, \sigma^2)$ para un parámetro real $\theta$, y sea $g$ derivable en $\theta$. Demuéstrese el *método delta*: $$\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr)  \Longrightarrow \mathcal N\bigl(0,  g'(\theta)^2\sigma^2\bigr)$$ *(escríbase $g(x) - g(\theta) = (g'(\theta) +  \eta(x))(x - \theta)$ con $\eta \to 0$ en $\theta$; demuéstrense $\hat\theta_n \to \theta$ y después $\eta(\hat\theta_n) \to 0$, en probabilidad; termínese con Slutsky, el [Ejercicio 23.8](#exo-b3-clt-8), y [Ejercicio 23.4](#exo-b3-clt-4)(b))*.
19. Aplicaciones. (a) Para $(\xi_i)$ reales i.i.d. de media $\mu$ y varianza $\sigma^2$, y $\bar X_n =  \frac1n\sum_{i\leq n}\xi_i$: demuéstrese $\sqrt n(\bar  X_n^2 - \mu^2) \Rightarrow \mathcal N(0,  4\mu^2\sigma^2)$ cuando $\mu \neq 0$, y que para $\mu = 0$ el enunciado correcto vive en otra escala: $n\bar X_n^2 \Rightarrow \sigma^2N^2$ con $N \sim \mathcal N(0,1)$ (identifíquese la función de distribución del límite). (b) (Estabilización de la varianza) Para $\hat p_n$ la frecuencia de éxitos de una muestra $\mathcal B(1, p)$, $p \in \intoo01$: demuéstrese que $g(p) = \arcsin\sqrt p$ cumple $$\sqrt n\,\bigl(g(\hat p_n) - g(p)\bigr)  \Longrightarrow \mathcal N\Bigl(0, \frac14\Bigr)$$ *sea cual sea* $p$ — una barra de error asintótica libre del parámetro desconocido; compárese con [Ejemplo 23.9](#ex-b3-clt-confidence).

**Parte VII — Poisson, por el mismo método: el teorema de Le Cam.** La sustitución conoce una segunda clase de universalidad: las sumas de muchos sucesos *raros* [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence). Para leyes en $\N$, la distancia adecuada es la *variación total*,

$$
d_{\mathrm{TV}}(\mu, \nu) = \sup_{A\subseteq\N}\,
\abs{\mu(A) - \nu(A)} .
$$

20. Demuéstrese $d_{\mathrm{TV}}(\mu, \nu) =  \frac12\sum_{k\geq0}\abs{\mu(\{k\}) -  \nu(\{k\})}$ y demuéstrese la cota por acoplamiento: para *cualquier* par $(X, Y)$ de [variables aleatorias](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) de leyes $\mu$ y $\nu$ en el mismo espacio, $d_{\mathrm{TV}}(\mu, \nu) \leq \P(X \neq Y)$ .
21. Calcúlese exactamente, para $p \in \intoo01$: $$d_{\mathrm{TV}}\bigl(\mathcal B(1, p), \mathcal  P(p)\bigr) = p\bigl(1 - \eu^{-p}\bigr) \leq p^2 .$$
22. (Le Cam, por sustitución) Sean $X_i \sim \mathcal B(1,  p_i)$ y $Y_i \sim \mathcal P(p_i)$, con las $2n$ variables [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence); $S = X_1 + \dots + X_n$, y recuérdese $Y_1 + \dots + Y_n \sim \mathcal P(\lambda)$ con $\lambda = \sum_ip_i$ (el [Ejercicio 23.1](#exo-b3-clt-1)). Sustitúyase una coordenada cada vez en los híbridos enteros $H_i = Y_1 + \dots + Y_i + X_{i+1} + \dots  + X_n$: demuéstrese, para todo $A \subseteq \N$, $$\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} \leq  d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal  P(p_i)\bigr),$$ y conclúyase la *desigualdad de Le Cam*: $$d_{\mathrm{TV}}\bigl(\text{ley de } S,\ \mathcal  P(\lambda)\bigr) \leq \sum_{i=1}^np_i^2 .$$
23. Dividendos. (a) Para $p_i = \frac\lambda n$ : la cota es $\frac{\lambda^2}n$ — la ley de los sucesos raros (el [Ejercicio 23.5](#exo-b3-clt-5) ) elevada a una velocidad explícita, uniforme sobre todos los sucesos y válida también para $p_i$ desiguales. (b) Se entregan $500$ cartas, cada una extraviándose independientemente con probabilidad $\frac1{500}$ : acótese el error del modelo de Poisson de parámetro $1$ y estímese la probabilidad de que no se extravíe ninguna. (c) Ciérrese el problema: compárense las dos clases de universalidad encontradas aquí — la [gaussiana](#def-b3-clt-gaussianvector) (muchas contribuciones pequeñas y repartidas; dos momentos ajustados; Taylor) y la de Poisson (muchas contribuciones raras; una media ajustada; un acoplamiento exacto en variación total) — y el único método de sustitución que hay detrás de ambas.
24. (Error relativo y transformación logarítmica) Sean $(X_n)$ i.i.d., positivas, de media $\mu > 0$ y varianza $\sigma^2$, y $\bar X_n$ la media empírica. Demuéstrese por el método delta que $$\sqrt n\,\bigl(\ln\bar X_n - \ln\mu\bigr)  \Longrightarrow  \mathcal N\Bigl(0,\ \frac{\sigma^2}{\mu^2}\Bigr) :$$ el parámetro asintótico de $\ln\bar X_n$ es el *coeficiente de variación* $\sigma/\mu$ — error relativo, sin escala. Dedúzcase un intervalo de confianza al $95\%$ para $\mu$ de forma multiplicativa $\bar X_n\cdot\eu^{\pm1.96\,\sigma/(\mu\sqrt  n)}$, y explíquese cuándo es preferible al aditivo.
25. (El tercer momento gobierna el error) Para $X \sim$ Bernoulli( $p$ ) centrada, calcúlese $\E\bigl[(X -  p)^3\bigr] = p(1-p)(1-2p)$ . Usando el análisis de la Parte IV (el error de sustitución lo gobiernan los terceros momentos), explíquese por qué la aproximación normal de $\mathcal B(n, p)$ es asimétrica para $p \neq \frac12$ — excediéndose por un lado y quedándose corta por el otro — y por qué $p = \frac12$ disfruta de la velocidad más rápida de momentos ajustados. Verifíquese numéricamente el signo de la asimetría en $\mathcal  B(20, 0.1)$ frente a $\mathcal N(2, 1.8)$ : compárese $\P(S = 0) = 0.9^{20}$ con la masa [gaussiana](#def-b3-clt-gaussianvector) de $\intoo{-\infty}{0.5}$ .

**Solución de Problema 23.1.**

**1.** La familia $(X_1, \dots, X_n, N_1, \dots, N_n)$ es independiente: los dos bloques son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) entre sí por construcción y cada bloque es i.i.d. $W_i$ es una [función medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) únicamente de las variables $(X_j)_{j<i}$ y $(N_j)_{j>i}$, todas distintas de $X_i$ y $N_i$: por el principio de coaliciones (el [Teorema 22.5](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-independence)), $W_i$ es independiente del par $(X_i, N_i)$. Las descomposiciones $H_i = W_i + \frac{X_i}{\sqrt n}$ y $H_{i-1} = W_i +
\frac{N_i}{\sqrt n}$ son inmediatas de las definiciones: pasar de $H_i$ a $H_{i-1}$ intercambia el único sumando $X_i$ por $N_i$.

**2.** Taylor–Lagrange de orden $3$: existe $c$ entre $w$ y $w + h$ con $f(w + h) = f(w) + f'(w)h +
\frac12f''(w)h^2 + \frac16f'''(c)h^3$, y $\abs{f'''(c)}
\leq M_3$ da la cota.

**3.** Restando los dos desarrollos en el punto base común $w = W_i$:

$$
f(H_i) - f(H_{i-1}) = f'(W_i)\,\frac{X_i - N_i}{\sqrt n} +
\frac{f''(W_i)}{2}\,\frac{X_i^2 - N_i^2}{n} + R_i,
\qquad
\abs{R_i} \leq \frac{M_3}{6}\cdot
\frac{\abs{X_i}^3 + \abs{N_i}^3}{n^{3/2}} .
$$

Tómense [esperanzas](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space). Por la pregunta 1, $f'(W_i)$ y $f''(W_i)$ son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) de $(X_i, N_i)$, de modo que las [esperanzas](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) mixtas factorizan:

$$
\begin{align*}
\E\Bigl[f'(W_i)\,\frac{X_i - N_i}{\sqrt n}\Bigr] &=
\E\bigl[f'(W_i)\bigr]\,\frac{\E X_i - \E N_i}{\sqrt n} = 0,
\\
\E\Bigl[f''(W_i)\,\frac{X_i^2 - N_i^2}{n}\Bigr] &=
\E\bigl[f''(W_i)\bigr]\,\frac{1 - 1}{n} = 0 :
\end{align*}
$$

los dos primeros momentos de $X_i$ y $N_i$ *coinciden*, y solo sobrevive el resto:

$$
\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \E\abs{R_i} \leq
\frac{M_3}{6}\cdot\frac{\beta + \gamma}{n^{3/2}} .
$$

El tercer momento [gaussiano](#def-b3-clt-gaussianvector): $\gamma = \E\abs{N_1}^3 =
2\int_0^\infty x^3\,\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\,\dd x
= \frac{2}{\sqrt{2\pi}}\int_0^\infty 2u\,\eu^{-u}\dd u =
\frac{4}{\sqrt{2\pi}} = \frac{2\sqrt2}{\sqrt\pi}$ (sustitución $u = x^2/2$ y después $\Gamma(2) = 1$).

**4.** Telescopando $\E f(T_n) - \E f(G_n) =
\sum_{i=1}^n\bigl(\E f(H_i) - \E f(H_{i-1})\bigr)$ y aplicando la pregunta 3 a cada uno de los $n$ términos:

$$
\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq
n \cdot \frac{M_3(\beta + \gamma)}{6\,n^{3/2}} =
\frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .
$$

**5.** $G_n$ es $\mathcal N(0,1)$ *exactamente* para todo $n$ (una suma normalizada de [gaussianas](#def-b3-clt-gaussianvector) estándar [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), el [Ejercicio 23.3](#exo-b3-clt-3)), de modo que $\E f(G_n) = \E f(N)$ y la pregunta 4 se lee $\abs{\E f(T_n) - \E f(N)} \leq
\frac{M_3(\beta+\gamma)}{6\sqrt n} \to 0$ para $f \in
\mathcal C^3_b$. *Elevación.* Sea $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada, $M = \sup\abs f$, $\varepsilon > 0$. Elíjase $A
\geq 1$ con $\frac1{A^2} \leq \varepsilon$: Chebyshev con $\V(T_n) = 1$ da $\P(\abs{T_n} > A) \leq \varepsilon$ para todo $n$, y análogamente $\P(\abs N > A) \leq \varepsilon$. Sea $\chi$ de clase $\mathcal C^\infty$ con $\mathbf 1_{\intcc{-A}A} \leq \chi \leq
\mathbf 1_{\intcc{-A-1}{A+1}}$ (una meseta regular, construida regularizando $\mathbf 1_{\intcc{-A-\frac12}{A+\frac12}}$, el [Teorema 12.9](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#thm-b3-lp-regularization)); $g = f\chi$ es [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de soporte [compacto](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-compact), luego uniformemente [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), de modo que su regularizada $g_\eta = g * \rho_\eta$ es $\mathcal
C^\infty$ con derivadas acotadas de todos los órdenes y $\norm{g - g_\eta}_\infty \leq \varepsilon$ para $\eta$ suficientemente pequeño. Para $T = T_n$ o $N$, puesto que $f = g$ en $\intcc{-A}A$ y $\abs{f - g} \leq 2M$ en todas partes:

$$
\bigl|\E f(T) - \E g_\eta(T)\bigr| \leq
\E\abs{(f - g)(T)} + \norm{g - g_\eta}_\infty
\leq 2M\,\P(\abs T > A) + \varepsilon \leq
(2M + 1)\,\varepsilon .
$$

Combinando con $\E g_\eta(T_n) \to \E g_\eta(N)$ (la pregunta 4 se aplica: $g_\eta \in \mathcal C^3_b$):

$$
\limsup_n\;\bigl|\E f(T_n) - \E f(N)\bigr| \leq
2(2M + 1)\,\varepsilon ,
$$

y $\varepsilon$ era arbitrario: $\E f(T_n) \to \E f(N)$ para toda $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada, es decir, $T_n \Rightarrow
\mathcal N(0,1)$.

**6.** La idéntica distribución entró solo a través de una frase: «$X_i$ y $N_i$ tienen los mismos dos primeros momentos». Sean, pues, $X_1, \dots, X_n$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), centradas, de varianzas $\sigma_i^2$ y terceros momentos finitos, $s_n^2 = \sum_i\sigma_i^2 > 0$, y tómense $N_i \sim
\mathcal N(0, \sigma_i^2)$ [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) de todo lo demás. Defínanse los híbridos con normalización $s_n$: $H_i =
\frac1{s_n}(\sum_{j\leq i}X_j + \sum_{j>i}N_j)$. En la $i$-ésima sustitución, $\E X_i = \E N_i = 0$ y $\E X_i^2 = \E N_i^2
= \sigma_i^2$ vuelven a matar los términos de orden $f'$ y $f''$, y el resto da (usando $\E\abs{N_i}^3 = \sigma_i^3\gamma$ por reescalado):

$$
\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq
\frac{M_3}{6\,s_n^3}\bigl(\E\abs{X_i}^3 +
\sigma_i^3\gamma\bigr) .
$$

Telescopando:

$$
\Bigl|\E f\Bigl(\frac{X_1 + \dots + X_n}{s_n}\Bigr) -
\E f(N)\Bigr| \leq \frac{M_3}{6\,s_n^3}\sum_{i=1}^n
\Bigl(\E\abs{X_i}^3 + \V(X_i)^{3/2}\,\gamma\Bigr) .
$$

Como $\sigma_i^3 = (\E X_i^2)^{3/2} \leq \E\abs{X_i}^3$ (la desigualdad de las medias de potencias, es decir, Jensen para $t \mapsto
t^{3/2}$ aplicado a $X_i^2$), el miembro derecho es a lo sumo $\frac{M_3(1 + \gamma)}{6}\cdot
\frac{\sum_i\E\abs{X_i}^3}{s_n^3}$: bajo la *condición de Lyapunov* $\frac1{s_n^3}\sum_i\E\abs{X_i}^3 \to 0$, las sumas normalizadas convergen en ley a $\mathcal N(0,1)$ — el TCL sin idéntica distribución.

**7.** Sea $\rho \in \mathcal C^\infty_c(\intoo01)$ con $\int\rho = 1$ y póngase $\psi(x) = \int_x^1\rho(s)\dd
s$: $\psi$ es $\mathcal C^\infty$, no creciente, $\psi = 1$ en $\R_-$, $\psi = 0$ en $\intco1\infty$; sea $K =
\norm{\psi'''}_\infty$. Para $t \in \R$ y $\delta > 0$, defínanse $\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta\bigr)$ y $\tilde\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta +
1\bigr)$: son $\mathcal C^3_b$ con tercera derivada acotada por $K/\delta^3$, y

$$
\mathbf 1_{\intoc{-\infty}{t-\delta}} \leq
\tilde\psi_\delta \leq \mathbf 1_{\intoc{-\infty}t} \leq
\psi_\delta \leq \mathbf 1_{\intoc{-\infty}{t+\delta}} .
$$

Cota superior: por la pregunta 4 aplicada a $\psi_\delta$ (con $M_3 = K/\delta^3$),

$$
\P(T_n \leq t) \leq \E\psi_\delta(T_n) \leq
\E\psi_\delta(N) + \frac{K(\beta +
\gamma)}{6\,\delta^3\sqrt n}
\leq \Phi(t + \delta) + \frac{K(\beta +
\gamma)}{6\,\delta^3\sqrt n}
\leq \Phi(t) + \frac{\delta}{\sqrt{2\pi}} +
\frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n},
$$

porque $\Phi$ es lipschitziana de constante $\frac1{\sqrt{2\pi}}$ (su [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) está acotada por $\frac1{\sqrt{2\pi}}$). La cota inferior simétrica vía $\tilde\psi_\delta$ da la estimación de dos términos

$$
\sup_{t\in\R}\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq
\frac{K(\beta + \gamma)}{6}\cdot\frac{1}{\delta^3\sqrt n} +
\frac{\delta}{\sqrt{2\pi}}
\qquad(\delta > 0\ \text{arbitrario}).
$$

Los dos términos se equilibran cuando $\delta^{-3}n^{-1/2} \asymp
\delta$, es decir, $\delta = n^{-1/8}$: ambos valen entonces $O(n^{-1/8})$, una velocidad uniforme explícita válida para todo $n$. (La velocidad óptima de Berry–Esseen $C\beta/\sqrt n$ exige la desigualdad de regularización de Fourier; la sustitución cambia agudeza por elementalidad [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete).)

**8.** Para $X_i = 2B_i - 1$ (signos equilibrados): centrada, varianza $1$, y $\abs{X_i} = 1$, de modo que $\beta = 1$. La pregunta 7 acota entonces $\sup_t\abs{\P(\frac{S_n}{\sqrt n} \leq t) -
\Phi(t)}$ de manera explícita y uniforme para *todo* $n$ finito — un enunciado global y no asintótico sobre la función de distribución. La estimación local del [Problema 11.1](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#pb-b3-product-1), pregunta 7, da en cambio la asintótica exacta de un átomo individual, $\P(S_{2n} = 2k) \sim
\frac{\eu^{-k^2/n}}{\sqrt{\pi n}}$: resuelve probabilidades de tamaño $n^{-1/2}$, muy por debajo de la resolución $n^{-1/8}$ de la pregunta 7, pero es puntual, asintótica (sin error explícito a $n$ fijo) y está atada a esta ley reticular concreta. Precisión local frente a uniformidad global: los dos métodos son complementarios, y sumar la estimación local en $k \in \intint{a\sqrt n}{b\sqrt n}$ recupera De Moivre–Laplace en intervalos — con velocidad más fina, pero solo para esta ley.

**9.** El argumento de sustitución no usó nada de la ley de las $X_i$ más allá de $\E X_i = 0$, $\E X_i^2 = 1$ y la finitud de $\E\abs{X_i}^3$: si hubiéramos sustituido las [gaussianas](#def-b3-clt-gaussianvector) $N_i$ por cualquier otra familia i.i.d. con los mismos dos primeros momentos y tercer momento finito, el mismo telescopaje acotaría $\abs{\E f(\text{suma}_X) - \E f(\text{suma}_Y)}$ por $O(n^{-1/2})$ para toda $f$ regular. Los estadísticos regulares de grandes sumas [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) son, por tanto, *universales*: salvo un error cuantificado, dependen de la ley de los sumandos solo a través de dos números. Este es el principio de invariancia: demuéstrese un teorema límite para la ley más calculable (la [gaussiana](#def-b3-clt-gaussianvector), donde todo es exacto) y transfiérase después a todas las leyes por sustitución. El mismo esquema — con sumas reemplazadas por funcionales más elaborados — gobierna la ley del semicírculo de Wigner para matrices aleatorias, la universalidad de las raíces de polinomios aleatorios y buena parte de la probabilidad moderna; el teorema central del límite es su primera y más sencilla instancia.

**10.** $Z$ es una función boreliana solo de $(N_{i+1}, \dots,
N_n)$, mientras que $A = W_i + \theta h - Z$ y $h$ son funciones de las variables restantes de la familia independiente $(X_1, \dots, X_n, N_1, \dots, N_n)$: por el principio de coaliciones (el [Teorema 22.5](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#thm-b3-probability-independence)), $Z$ es independiente de $(A, h)$. Como suma de las [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) $N_j/\sqrt n \sim \mathcal N(0, \frac1n)$, $Z \sim \mathcal
N(0, s^2)$ con $s^2 = \frac{n-i}n$ (el [Ejercicio 23.3](#exo-b3-clt-3)), de [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) acotada por $\frac1{s\sqrt{2\pi}}$. La ley de $((A, h), Z)$ es el producto de las dos leyes marginales, de modo que Tonelli (transferencia) congela el primer bloque: con $G(a) =
\E\abs{g(a + Z)} = \int\abs{g(a + z)}\,\varphi_s(z)\,\dd z
\leq \frac{\norm g_{L^1}}{s\sqrt{2\pi}}$ para todo $a$,

$$
\E\bigl[\abs h^3\abs{g(A + Z)}\bigr] =
\E\bigl[\abs h^3\,G(A)\bigr] \leq
\frac{\norm g_{L^1}}{s\sqrt{2\pi}}\,\E\abs h^3
= \sqrt{\frac{n}{2\pi(n-i)}}\,\norm g_{L^1}\,\E\abs h^3 .
$$

**11.** La forma integral de la fórmula de Taylor se sigue integrando $f(w + h) - f(w) =
h\int_0^1f'(w + \theta h)\,\dd\theta$ por partes dos veces en $\theta$. Tomando [esperanzas](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-space) en la $i$-ésima sustitución, los órdenes $0, 1, 2$ se cancelan exactamente como en la pregunta 3, y los dos restos (para $h = X_i/\sqrt n$ y $N_i/\sqrt n$) se acotan, para $i \leq n - 1$, por la pregunta 10 con $g = f'''$:

$$
\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq
\int_0^1\frac{(1-\theta)^2}2\,\dd\theta\;
\sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1}
\frac{\beta + \gamma}{n^{3/2}}
= \frac{\beta + \gamma}{6\,n^{3/2}}
\sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1} .
$$

Sumando, con $\sum_{i=1}^{n-1}\sqrt{\frac n{n-i}} =
\sqrt n\sum_{m=1}^{n-1}m^{-1/2} \leq 2n$, y añadiendo la cota de la pregunta 3 para la última sustitución ($i = n$, sin [gaussiana](#def-b3-clt-gaussianvector) restante):

$$
\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq
\frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot
\frac{\norm{f'''}_{L^1}}{\sqrt n} +
\frac{M_3(\beta + \gamma)}{6\,n^{3/2}} .
$$

Rampas: $\psi_\delta'''(x) =
\delta^{-3}\psi'''\bigl(\frac{x - t}\delta\bigr)$, de modo que $M_3 = K\delta^{-3}$ con $K = \norm{\psi'''}_\infty$ y $\norm{\psi_\delta'''}_{L^1} = \delta^{-2}
\norm{\psi'''}_{L^1} = K_1\delta^{-2}$ (sustitución). El sándwich de la pregunta 7 da entonces

$$
\sup_t\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq
\frac{K_1(\beta + \gamma)}{3\sqrt{2\pi}}\cdot
\frac1{\delta^2\sqrt n} +
\frac{K(\beta + \gamma)}{6}\cdot
\frac1{\delta^3n^{3/2}} + \frac\delta{\sqrt{2\pi}} .
$$

En $\delta = n^{-1/6}$, el primer y el tercer término valen $O(n^{-1/6})$ y el central $O(n^{-1})$: una velocidad uniforme $O(n^{-1/6})$, estrictamente mejor que el $n^{-1/8}$ de la pregunta 7 — la mitad [gaussiana](#def-b3-clt-gaussianvector) del híbrido hizo la regularización adicional.

**12.** $\E N_1^3 = 0$ (integrando impar), y la integración por partes da $\E N_1^4 = 3\,\E N_1^2 = 3$ ($\int x^3\cdot x\varphi(x)\dd x =
3\int x^2\varphi$). Para $f$ de clase $\mathcal C^4$ con derivadas acotadas, desarróllese cada sustitución hasta el cuarto orden: los términos de tercer orden llevan el factor $\E X_i^3 - \E N_i^3 =
0$ (la [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) los factoriza como en la pregunta 3), de modo que solo sobrevive el resto de cuarto orden $\int_0^1\frac{(1-\theta)^3}6f^{(4)}(w + \theta
h)h^4\dd\theta$, con $\int_0^1
\frac{(1-\theta)^3}6\dd\theta = \frac1{24}$ y $\E h^4 =
\beta_4n^{-2}$ o $3n^{-2}$. La pregunta 10 (con $g =
f^{(4)}$) acota las sustituciones $i \leq n - 1$, y sumando como en la pregunta 11:

$$
\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq
\frac{\beta_4 + 3}{12\sqrt{2\pi}}\cdot
\frac{\norm{f^{(4)}}_{L^1}}{n} +
\frac{M_4(\beta_4 + 3)}{24\,n^2} .
$$

Con $\norm{\psi_\delta^{(4)}}_{L^1} = K_2\delta^{-3}$ y $M_4 = K'\delta^{-4}$, la cota para funciones de distribución pasa a ser $C\delta^{-3}n^{-1} + C'\delta^{-4}n^{-2} +
\frac\delta{\sqrt{2\pi}}$; en $\delta = n^{-1/4}$, los términos extremos valen $O(n^{-1/4})$ y el central $O(n^{-1})$: velocidad $O(n^{-1/4})$.

**13.** Con $k$ momentos ajustados, el resto que sobrevive por sustitución es de orden $\E\abs h^{k+1} \asymp
n^{-(k+1)/2}$; la cota de [gaussiana](#def-b3-clt-gaussianvector) escondida carga $\norm{f^{(k+1)}}_{L^1}$ y la suma sobre las sustituciones aporta el factor $2n$, dando $\asymp\norm{f^{(k+1)}}_{L^1}\,
n^{-(k-1)/2}$ para $f$ regulares. Las rampas cuestan $\norm{\psi_\delta^{(k+1)}}_{L^1} \asymp \delta^{-k}$, de modo que el error para funciones de distribución es $\asymp
\delta^{-k}n^{-(k-1)/2} + \delta$, equilibrado en $\delta =
n^{-(k-1)/(2k+2)}$: velocidad $n^{-(k-1)/(2k+2)}$, que vale $n^{-1/6}$ para $k = 2$, $n^{-1/4}$ para $k = 3$, y tiende a $n^{-1/2}$ solo cuando $k \to \infty$ — pero $k \geq 4$ forzaría $\E X_1^4 = 3$ y más allá, es decir, una ley que ya imita a la [gaussiana](#def-b3-clt-gaussianvector). La saturación es estructural: la sustitución suma $n$ errores de sustitución *en valor absoluto*, renunciando a toda cancelación entre ellos. La demostración de Fourier compara [funciones características](#def-b3-clt-cf), donde los errores aparecen con sus fases oscilantes; la desigualdad de regularización de Esseen convierte $\abs{\varphi_{T_n}
- \varphi_N}$, integrada contra $\frac{\dd\xi}{\abs\xi}$, en una cota para funciones de distribución con un coste solo logarítmico, y entrega el $C\beta n^{-1/2}$ de Berry–Esseen con solo tres momentos. La sustitución cambia optimalidad por robustez — y, como muestra la Parte VII, por portabilidad.

**14.** $\Sigma$ es simétrica semidefinida positiva; con $\Sigma = PDP^{\mathsf T}$ ($P$ ortogonal, $D \geq 0$ diagonal, el [Ejercicio 20.8](https://one-course.com/books/math/5/es/chapter/20-subvariedades-de-rn#exo-b3-submanifolds-8)), la simétrica $C =
P\sqrt DP^{\mathsf T}$ cumple $C^2 = \Sigma$. Para todo $t
\in \R^2$, $\langle t, CZ\rangle = \langle Ct, Z\rangle =
(Ct)_1Z^1 + (Ct)_2Z^2$ es una combinación lineal de [gaussianas](#def-b3-clt-gaussianvector) [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence), luego [gaussiana](#def-b3-clt-gaussianvector) (el [Ejercicio 23.3](#exo-b3-clt-3)): $N = CZ$ es un [vector gaussiano](#def-b3-clt-gaussianvector); su media es $0$ y su covarianza $\E[NN^{\mathsf T}] =
C\,\E[ZZ^{\mathsf T}]\,C^{\mathsf T} = CC^{\mathsf T} =
\Sigma$. Momentos: $\norm N^3 \leq (\abs{N_1} +
\abs{N_2})^3 \leq 4(\abs{N_1}^3 + \abs{N_2}^3)$ (convexidad de $x^3$ en $\R_+$), y cada coordenada es una [gaussiana](#def-b3-clt-gaussianvector) real con momentos de todos los órdenes (el [Ejercicio 11.10](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-10)): $\gamma' < \infty$. Por último, cada $\langle t, G_n\rangle = \frac1{\sqrt
n}\sum_i\langle t, N_i\rangle$ es una suma normalizada de $\mathcal N(0, t^{\mathsf T}\Sigma t)$ i.i.d., luego exactamente $\mathcal N(0, t^{\mathsf T}\Sigma t)$: $G_n$ es un [vector gaussiano](#def-b3-clt-gaussianvector) de media $0$ y covarianza $\Sigma$, y su ley es $\mathcal N(0, \Sigma)$ (la [Definición 23.10](#def-b3-clt-gaussianvector): la ley queda determinada por estos datos).

**15.** Sean $\phi(t) = f(w + th)$, $t \in \intcc01$: $\phi$ es $\mathcal C^3$ con

$$
\phi'''(t) = \sum_{j,k,l\in\{1,2\}}\partial_{jkl}f(w +
th)\,h_jh_kh_l, \qquad \abs{\phi'''(t)} \leq
M_3\Bigl(\sum_j\abs{h_j}\Bigr)^3 = M_3(\abs{h_1} +
\abs{h_2})^3 .
$$

Taylor–Lagrange de orden $3$ para cierto $\phi$ entre $0$ y $1$ da la primera desigualdad; Cauchy–Schwarz da $\abs{h_1} + \abs{h_2} \leq \sqrt2\norm h$, de donde la constante $\frac{2\sqrt2M_3}6 = \frac{\sqrt2M_3}3$.

**16.** Defínanse $H_i$ y $W_i$ como en la pregunta 1, ahora en $\R^2$; el argumento de coaliciones no cambia. En la $i$-ésima sustitución, los términos de primer orden dan $\sum_j\E[\partial_jf(W_i)]\,(\E X_{i,j} - \E N_{i,j})/
\sqrt n = 0$ y los de segundo orden dan $\frac1{2n}\sum_{j,k}\E[\partial_{jk}f(W_i)]\,(\Sigma_{jk}
- \Sigma_{jk}) = 0$: medias y covarianzas coinciden. La pregunta 15 acota los dos restos:

$$
\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq
\frac{\sqrt2M_3}3\cdot\frac{\E\norm{X_i}^3 +
\E\norm{N_i}^3}{n^{3/2}}
= \frac{\sqrt2M_3(\beta' + \gamma')}{3\,n^{3/2}},
$$

y telescopando sobre las $n$ sustituciones:

$$
\Bigl|\E f\Bigl(\frac{S_n}{\sqrt n}\Bigr) - \E
f(G_n)\Bigr| \leq \frac{\sqrt2\,M_3(\beta' +
\gamma')}{3\sqrt n},
\qquad G_n \sim \mathcal N(0, \Sigma)\ \text{exactamente} .
$$

Elevación: $\E\norm{T_n}^2 = \E\norm{X_1}^2 =
\operatorname{tr}\Sigma$ (los términos cruzados se anulan por [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) y centrado), de modo que $\P(\norm{T_n} > A) \leq
\operatorname{tr}\Sigma/A^2$, y análogamente para $N$: tensión. Dada una $f$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada y $\varepsilon
> 0$, multiplíquese por una meseta regular $\chi$ igual a $1$ en la bola de radio $A$ y soportada en radio $A + 1$ (regularícese un indicador en $\R^2$, el [Teorema 12.9](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#thm-b3-lp-regularization)); $g = f\chi$ es uniformemente [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de soporte [compacto](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-compact), de modo que su regularización bidimensional $g_\eta$ es $\mathcal C^\infty$ con derivadas acotadas de todos los órdenes y $\norm{g - g_\eta}_\infty
\leq \varepsilon$ para $\eta$ pequeño. La cadena de tres $\varepsilon$ de la pregunta 5 se transfiere entonces palabra por palabra: $\E f(T_n)
\to \E f(N)$ para toda $f \colon \R^2
\to \R$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada. Este es el [Teorema 23.12](#thm-b3-clt-multiclt) para $d = 2$, ahora demostrado — la sustitución esquiva el teorema de Lévy bidimensional que el capítulo había dejado admitido.

**17.** Para $g \colon \R \to \R$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) acotada, la aplicación $x \mapsto g(\langle t, x\rangle)$ es [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y acotada en $\R^2$, de modo que la pregunta 16 da $\E g(\langle
t, T_n\rangle) \to \E g(\langle t, N\rangle)$: toda proyección converge en distribución, y $\langle t,
N\rangle \sim \mathcal N(0, t^{\mathsf T}\Sigma t)$. (Esta es la dirección fácil de Cramér–Wold: la convergencia conjunta implica la de todas las imágenes lineales.) Aplicación: $V_i = (\xi_i, \xi_i^2 - 1)$ son vectores i.i.d. centrados ($\E\xi_1^2 = 1$), con entradas de covarianza $\V(\xi_1) =
1$, $\operatorname{Cov}(\xi_1, \xi_1^2 - 1) = \E\xi_1^3$ y $\V(\xi_1^2 - 1) = \E\xi_1^4 - 1$; el tercer momento $\E\norm{V_1}^3 \leq 4\bigl(\E\abs{\xi_1}^3 +
\E\abs{\xi_1^2 - 1}^3\bigr)$ es finito cuando $\xi_1 \in
L^6$. La pregunta 16 produce el límite [gaussiano](#def-b3-clt-gaussianvector) conjunto exhibido, y el [Teorema 23.11](#thm-b3-clt-gaussianvector)(2): las dos coordenadas del límite son [independientes](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence) exactamente cuando la covarianza $\E\xi_1^3$ se anula — para leyes simétricas, la media empírica y la varianza empírica se desacoplan asintóticamente.

**18.** Escríbase $g(x) - g(\theta) = (g'(\theta) +
\eta(x))(x - \theta)$, donde $\eta(x) = \frac{g(x) -
g(\theta)}{x - \theta} - g'(\theta)$ para $x \neq \theta$ y $\eta(\theta) = 0$: la derivabilidad en $\theta$ significa precisamente $\eta(x) \to 0$ cuando $x \to \theta$. *Paso 1:* $\hat\theta_n \to \theta$ en probabilidad: para $\varepsilon > 0$ y cualquier $A > 0$, a partir de cierto índice $\varepsilon\sqrt n \geq A$, de modo que $\P(\abs{\hat\theta_n -
\theta} > \varepsilon) \leq \P(\abs{\sqrt
n(\hat\theta_n - \theta)} > A) \to \P(\sigma\abs N > A)$ (las funciones de distribución convergen en los puntos de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $\pm A$), y el miembro derecho tiende a $0$ cuando $A \to
\infty$. *Paso 2:* $\eta(\hat\theta_n) \to 0$ en probabilidad: dado $\varepsilon' > 0$, tómese $\delta$ con $\abs\eta \leq \varepsilon'$ en $\abs{x - \theta} \leq
\delta$; entonces $\P(\abs{\eta(\hat\theta_n)} > \varepsilon')
\leq \P(\abs{\hat\theta_n - \theta} > \delta) \to 0$. *Paso 3:*

$$
\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr) =
g'(\theta)\,\sqrt n(\hat\theta_n - \theta) +
\eta(\hat\theta_n)\cdot\sqrt n(\hat\theta_n - \theta) .
$$

Por la regla del producto de Slutsky (el [Ejercicio 23.8](#exo-b3-clt-8), con la sucesión $\eta(\hat\theta_n) \to 0$ en probabilidad y la convergente en ley $\sqrt n(\hat\theta_n - \theta)$), el segundo término converge en ley a $0\cdot\mathcal N(0,
\sigma^2) = 0$, luego a $0$ en probabilidad (el [Ejercicio 23.4](#exo-b3-clt-4)(b)); el primero converge en ley a $g'(\theta)\mathcal N(0, \sigma^2)$ (Slutsky de nuevo, o la regla afín para [funciones características](#def-b3-clt-cf)); la regla de la suma de Slutsky los ensambla: el límite es $\mathcal N(0,
g'(\theta)^2\sigma^2)$.

**19.** (a) El TCL da $\sqrt n(\bar X_n - \mu)
\Rightarrow \mathcal N(0, \sigma^2)$; el método delta con $g(x) = x^2$, $g'(\mu) = 2\mu$, da $\sqrt n(\bar
X_n^2 - \mu^2) \Rightarrow \mathcal N(0, 4\mu^2\sigma^2)$ — degenerado (límite $0$) cuando $\mu = 0$. En ese caso la fluctuación vive una escala más arriba: $n\bar X_n^2 =
(\sqrt n\,\bar X_n)^2$, y para $t > 0$

$$
\P\bigl(n\bar X_n^2 \leq t\bigr) = \P\bigl(-\sqrt t \leq
\sqrt n\,\bar X_n \leq \sqrt t\bigr) \longrightarrow
\Phi\Bigl(\frac{\sqrt t}\sigma\Bigr) -
\Phi\Bigl(-\frac{\sqrt t}\sigma\Bigr) = \P(\sigma^2N^2
\leq t) :
$$

$n\bar X_n^2 \Rightarrow \sigma^2N^2$, el cuadrado de una [gaussiana](#def-b3-clt-gaussianvector) (una ley «ji cuadrado») — cuando la primera derivada muere, el término de segundo orden de Taylor dicta un límite no [gaussiano](#def-b3-clt-gaussianvector). (b) Aquí $\sqrt n(\hat p_n - p)
\Rightarrow \mathcal N(0, p(1 - p))$ y $g(p) =
\arcsin\sqrt p$ tiene $g'(p) = \frac1{2\sqrt{p(1 - p)}}$, de modo que $g'(p)^2\,p(1 - p) = \frac14$: el límite es $\mathcal
N(0, \frac14)$ para todo $p \in \intoo01$. En la escala $\arcsin$, la barra de error asintótica al $95\%$ vale $\pm
\frac{0.98}{\sqrt n}$, conocida de antemano — mientras que en el [Ejemplo 23.9](#ex-b3-clt-confidence) la anchura involucraba el $\sigma = \sqrt{p(1-p)}$ desconocido, que había que acotar por el peor caso $\frac12$ o estimar: la transformación *estabiliza* la varianza.

**20.** Sean $A^* = \{k : \mu(\{k\}) > \nu(\{k\})\}$ y $\Delta_k = \mu(\{k\}) - \nu(\{k\})$, de modo que $\sum_k\Delta_k = 0$. Para todo $A \subseteq \N$: $\mu(A) -
\nu(A) = \sum_{k\in A}\Delta_k \leq \sum_{k\in
A^*}\Delta_k$, con igualdad en $A = A^*$; y como las partes positiva y negativa de $(\Delta_k)$ tienen la misma masa total, $\sum_{A^*}\Delta_k =
\frac12\sum_k\abs{\Delta_k}$. Intercambiar $\mu, \nu$ se ocupa del signo: $d_{\mathrm{TV}}(\mu, \nu) =
\frac12\sum_k\abs{\Delta_k}$. Acoplamiento: para todo $A$,

$$
\mu(A) - \nu(A) = \E\bigl[\mathbf 1_A(X) - \mathbf
1_A(Y)\bigr] = \E\bigl[(\mathbf 1_A(X) - \mathbf
1_A(Y))\,\mathbf 1_{X\neq Y}\bigr] \leq \P(X \neq Y),
$$

y tómese el supremo en $A$.

**21.** Las dos leyes cargan: $k = 0$: $1 - p$ frente a $\eu^{-p}$, con $\eu^{-p} > 1 - p$; $k = 1$: $p$ frente a $p\,\eu^{-p} < p$; $k \geq 2$: $0$ frente al resto de Poisson $1 - \eu^{-p} - p\eu^{-p} \geq 0$. Por tanto,

$$
d_{\mathrm{TV}} = \tfrac12\bigl[(\eu^{-p} - 1 + p) + (p -
p\eu^{-p}) + (1 - \eu^{-p} - p\eu^{-p})\bigr] =
\tfrac12\bigl(2p - 2p\eu^{-p}\bigr) = p(1 - \eu^{-p}),
$$

y $1 - \eu^{-p} \leq p$ da la cota $p^2$.

**22.** Escríbanse $H_{i-1} = W_i + X_i$ y $H_i = W_i +
Y_i$ con $W_i = \sum_{j<i}Y_j + \sum_{j>i}X_j$, independiente del par $(X_i, Y_i)$ (coaliciones). Para $A
\subseteq \N$, condicionando a los valores, en cantidad numerable, por [independencia](https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros#def-b3-probability-independence),

$$
\P(H_{i-1} \in A) = \sum_{k\geq0}\P(X_i = k)\,\P(W_i + k
\in A),
$$

y análogamente para $H_i$ con $Y_i$. Restando, con $c_k
= \P(W_i + k \in A) \in \intcc01$ y $\Delta_k = \P(X_i =
k) - \P(Y_i = k)$ de suma nula:

$$
\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} =
\Bigl|\sum_k\Delta_k\bigl(c_k - \tfrac12\bigr)\Bigr| \leq
\tfrac12\sum_k\abs{\Delta_k} =
d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal
P(p_i)\bigr) .
$$

Telescopando de $H_0 = S$ a $H_n = \sum_iY_i \sim
\mathcal P(\lambda)$ (el [Ejercicio 23.1](#exo-b3-clt-1), iterado) y usando la pregunta 21:

$$
\abs{\P(S \in A) - \P(\mathcal P(\lambda) \in A)} \leq
\sum_{i=1}^np_i\bigl(1 - \eu^{-p_i}\bigr) \leq
\sum_{i=1}^np_i^2
\qquad\text{para todo } A :
$$

la desigualdad de Le Cam. (La cota por acoplamiento de la pregunta 20 da una vía alternativa: acóplese cada par sobre una variable uniforme de modo que $\P(X_i \neq Y_i) \leq p_i^2$ y acótese $\P(S \neq \sum Y_i)$; la sustitución no necesita construcción alguna.)

**23.** (a) Con $p_i = \frac\lambda n$: $d_{\mathrm{TV}}(\text{ley de }S, \mathcal P(\lambda))
\leq \frac{\lambda^2}n$. Esto afina el [Ejercicio 23.5](#exo-b3-clt-5) por triplicado: un error explícito en cada $n$ finito, uniformidad sobre todos los sucesos $A$ a la vez (no un intervalo cada vez) y ninguna necesidad de que los $p_i$ sean iguales — solo que $\sum_ip_i^2$ sea pequeño, por ejemplo $\sum p_i^2 \leq
\lambda\max_ip_i$: *muchos sucesos raros, ninguno dominante*. (b) Aquí $n = 500$, $p_i = \frac1{500}$, $\lambda = 1$: el modelo de Poisson yerra a lo sumo en $500\cdot\frac1{500^2} = 0.002$ en todo suceso; en particular, tomando $A = \{0\}$,

$$
\P(\text{ninguna carta extraviada}) = \Bigl(1 -
\frac1{500}\Bigr)^{500},
\qquad
\Bigl|\P(\text{ninguna carta extraviada}) - \eu^{-1}\Bigr| \leq
0.002,
$$

de modo que la respuesta es $\eu^{-1} \approx 0.368$ con un $0.002$ garantizado (la discrepancia verdadera es de unos $4\cdot10^{-4}$). (c) El problema se cierra con un método y dos regímenes. Cuando $n$ contribuciones comparables llevan cada una varianza $\frac1n$, ajustar *dos* momentos frente a la [gaussiana](#def-b3-clt-gaussianvector) hace que los errores de sustitución valgan $o(\frac1n)$ cada uno: las sumas se vuelven [gaussianas](#def-b3-clt-gaussianvector) — con Taylor como herramienta de comparación local. Cuando $n$ contribuciones son indicadores de probabilidad $p_i$, ajustar la *media* frente a un átomo de Poisson hace que cada sustitución cueste $p_i^2$: los recuentos de sucesos raros se vuelven de Poisson — con la variación total como comparación local exacta. Los mismos híbridos, el mismo telescopio, distinta estimación local: la sustitución es una estrategia, no un teorema, y los límites [gaussiano](#def-b3-clt-gaussianvector) y de Poisson son sus dos dividendos más antiguos.

**24.** El TCL da $\sqrt n(\bar X_n - \mu)
\Rightarrow \mathcal N(0, \sigma^2)$, y $g(x) = \ln x$ es derivable en $\mu > 0$ con $g'(\mu) = \frac1\mu$: el método delta (Parte VI) produce $\sqrt n(\ln\bar X_n - \ln\mu)
\Rightarrow \mathcal N(0, \sigma^2/\mu^2)$. Deshaciendo el intervalo $\abs{\ln\bar X_n - \ln\mu} \leq
\frac{1.96\,\sigma}{\mu\sqrt n}$ por exponenciación:

$$
\mu \in \bar X_n\cdot
\eu^{\pm1.96\,\sigma/(\mu\sqrt n)}
\qquad\text{con probabilidad asintótica } 95\%
$$

(en la práctica, $\sigma/\mu$ se sustituye por su versión empírica, Slutsky como en el [Ejercicio 23.8](#exo-b3-clt-8)). El intervalo multiplicativo es el natural cuando los datos son positivos con errores proporcionales a su tamaño — rentas, concentraciones, semividas: magnitudes que viven en escala logarítmica, donde los intervalos aditivos simétricos podrían incluso cruzar el cero.

**25.** $\E[(X - p)^3] = (1-p)^3p + (-p)^3(1 - p) =
p(1-p)\bigl[(1-p)^2 - p^2\bigr] = p(1-p)(1 - 2p)$. En el análisis por sustitución (Parte IV), el término de error dominante tras ajustar dos momentos lleva el tercer momento *con signo*: para $p < \frac12$ es positivo (la ley se inclina a la derecha: excursiones grandes y raras por encima de la media) y la aproximación normal desplaza sistemáticamente la masa — subestimando la cola izquierda, corta, y sobrestimando la derecha — con un error de orden $n^{-1/2}$; en $p =
\frac12$ el tercer momento se anula, la Bernoulli coincide con la [gaussiana](#def-b3-clt-gaussianvector) hasta el tercer orden y la velocidad mejora (la pregunta de momentos ajustados de la Parte IV). Numéricamente: $\P(S = 0) =
0.9^{20} = 0.1216$, mientras que la [gaussiana](#def-b3-clt-gaussianvector) $\mathcal N(2, 1.8)$ da $\Phi\bigl(\frac{0.5 -
2}{\sqrt{1.8}}\bigr) = \Phi(-1.118) \approx 0.132$: la curva normal, ignorante del muro en $0$ y de la asimetría hacia la derecha, pone demasiada masa abajo — el signo del error predicho, visible en $n = 20$.
