Mathematics · Libro 5 · Bachelor Year 3

Matemáticas universitarias — Grado 3

Matemáticas universitarias — Grado 3 · Bachelor Year 3

23Funciones características y teorema central del límite

La ley de los grandes números dice que las medias convergen; el teorema central del límite dice cómo fluctúan: el error, amplificado por n\sqrt n, es asintóticamente gaussiano — sea cual sea la ley de partida. Esta universalidad es el hecho más profundo de la probabilidad elemental, y su demostración natural es de análisis de Fourier: la función característica (la transformada de Fourier de una ley) convierte las sumas independientes en productos, y la maquinaria del Capítulo 14 — inyectividad, puntos fijos gaussianos — convierte la convergencia puntual de esos productos en convergencia de leyes (teorema de Lévy, demostrado por completo). El capítulo termina con los vectores gaussianos y la deducción honesta de los intervalos de confianza que se usan en toda la estadística; el problema de fin de semana da la segunda demostración del TCL, la de Lindeberg, con una velocidad de error explícita.

23.1 Funciones características

Definición 23.1

La función característica de una variable aleatoria real XX es

φX(ξ)=E[eiξX]=Reiξx ⁣dPX(x)(ξR)\varphi_X(\xi) = \E\bigl[\eu^{\iu\xi X}\bigr] = \int_\R \eu^{\iu\xi x}\,\dd\P_X(x) \qquad (\xi \in \R)

(el teorema de transferencia la calcula a partir de la ley; para una densidad ff, φX(ξ)=f^(ξ)\varphi_X(\xi) = \hat f(-\xi) en el convenio del Capítulo 14).

Proposición 23.2

(a) φX(0)=1\varphi_X(0) = 1, φX1\abs{\varphi_X} \leq 1, y φX\varphi_X es uniformemente continua; φaX+b(ξ)=eibξφX(aξ)\varphi_{aX + b}(\xi) = \eu^{\iu b\xi}\varphi_X(a\xi). (b) Si X,YX, Y son independientes: φX+Y=φXφY\varphi_{X+Y} = \varphi_X\,\varphi_Y. (c) Si EXk<\E\abs X^k < \infty, entonces φXCk\varphi_X \in \mathcal C^k con φX(j)(0)=ijE[Xj]\varphi_X^{(j)}(0) = \iu^j\,\E[X^j] para jkj \leq k; en particular, para XL2X \in L^2 centrada de varianza σ2\sigma^2:

φX(ξ)=1σ2ξ22+o(ξ2)(ξ0).\varphi_X(\xi) = 1 - \frac{\sigma^2\xi^2}{2} + o(\xi^2) \qquad (\xi \to 0).

(d) Gaussiana: XN(m,σ2)X \sim \mathcal N(m, \sigma^2) tiene φX(ξ)=eimξσ2ξ2/2\varphi_X(\xi) = \eu^{\iu m\xi - \sigma^2\xi^2/2}.

Demostración. (a) Las cotas son inmediatas; continuidad: φ(ξ+h)φ(ξ)EeihX10\abs{\varphi(\xi + h) - \varphi(\xi)} \leq \E\abs{\eu^{\iu hX} - 1} \to 0 cuando h0h \to 0 por convergencia dominada, uniformemente en ξ\xi. La regla afín es una sustitución. (b) eiξ(X+Y)=eiξXeiξY\eu^{\iu\xi(X+Y)} = \eu^{\iu\xi X}\eu^{\iu\xi Y}, y las esperanzas de productos de variables independientes factorizan (el Teorema 22.5, aplicado a las partes real e imaginaria). (c) Derivación bajo la esperanza, dominada por EXj\E\abs X^j (el Teorema 10.15); el desarrollo de Taylor en 00 es entonces Taylor–Young para la función C2\mathcal C^2 φ\varphi. (d) Para N(0,1)\mathcal N(0,1): la transformada gaussiana (el Ejemplo 14.2 con a=12a = \frac12) da eiξxex2/22π ⁣dx=eξ2/2\int\eu^{\iu\xi x}\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\dd x = \eu^{-\xi^2/2}; el caso general, por la regla afín.

Teorema 23.3 (Inyectividad)

Si φX=φY\varphi_X = \varphi_Y, entonces XX y YY tienen la misma ley. Con más precisión, para NN(0,1)N \sim \mathcal N(0,1) independiente de XX y ε>0\varepsilon > 0, la variable regularizada X+εNX + \varepsilon N tiene la densidad

pε(x)=12πRφX(ξ)eε2ξ2/2eiξx ⁣dξ,p_\varepsilon(x) = \frac1{2\pi}\int_\R \varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\, \eu^{\iu\xi x}\,\dd\xi ,

determinada solo por φX\varphi_X; haciendo ε0\varepsilon \to 0 se recupera la ley de XX.

Demostración. X+εNX + \varepsilon N tiene la densidad pε(x)=E[gε(xX)]p_\varepsilon(x) = \E\bigl[g_\varepsilon(x - X)\bigr], donde gεg_\varepsilon es la densidad N(0,ε2)\mathcal N(0, \varepsilon^2): en efecto, para BB boreliana, la independencia y Tonelli dan P(X+εNB)= ⁣ ⁣1B(x+εn)g1(n) ⁣dn ⁣dPX(x)=BE[gε(tX)] ⁣dt\P(X + \varepsilon N \in B) = \int\!\!\int\mathbf 1_B(x + \varepsilon n)g_1(n)\,\dd n\,\dd\P_X(x) = \int_B\E[g_\varepsilon(t - X)]\dd t (sustitúyase y aplíquese Tonelli de nuevo). Escribiendo gεg_\varepsilon por inversión de Fourier de su transformada (el Ejercicio 14.4, reescalado): gε(u)=12πeε2ξ2/2eiξu ⁣dξg_\varepsilon(u) = \frac1{2\pi}\int \eu^{-\varepsilon^2\xi^2/2}\eu^{\iu\xi u}\dd\xi, y Fubini (todo dominado por el factor gaussiano):

pε(x)=12πRφX(ξ)eε2ξ2/2eiξx ⁣dξ,p_\varepsilon(x) = \frac1{2\pi}\int_\R \varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\, \eu^{\iu\xi x}\,\dd\xi ,

un funcional solo de φX\varphi_X. Si φX=φY\varphi_X = \varphi_Y: X+εNX + \varepsilon N y Y+εNY + \varepsilon N tienen leyes iguales para todo ε\varepsilon; para ff continua y acotada, Ef(X+εN)Ef(X)\E f(X + \varepsilon N) \to \E f(X) cuando ε0\varepsilon \to 0 (convergencia dominada, X+εNXX + \varepsilon N \to X puntualmente en el espacio producto), de modo que Ef(X)=Ef(Y)\E f(X) = \E f(Y) para toda tal ff — y esto determina la ley: para cada tt, encájese 1(,t]\mathbf 1_{\intoc{-\infty}t} entre las rampas continuas acotadas fk±f_k^\pm (iguales a 11 en (,t1k]\intoc{-\infty}{t \mp \frac1k}, a 00 más allá de t±1kt \pm \frac1k, afines en medio); pasando al límite en Efk(X)FX(t)Efk+(X)\E f_k^-(X) \leq F_X(t) \leq \E f_k^+(X) se obtiene FX(t)=FY(t)F_X(t) = F_Y(t) en todo tt donde ambas sean continuas, luego en todas partes por continuidad por la derecha y densidad de los puntos de continuidad comunes (ambas FF tienen una cantidad numerable de saltos); funciones de distribución iguales fuerzan leyes iguales (el Ejercicio 9.3, apoyado en Teorema 9.7).

23.2 Convergencia en distribución

Definición 23.4

XnX_n converge en distribución (o en ley) hacia XX, y se escribe XnXX_n \Rightarrow X, si

E[f(Xn)]E[f(X)]para toda continua acotada f ⁣:RR.\E\bigl[f(X_n)\bigr] \longrightarrow \E\bigl[f(X)\bigr] \qquad\text{para toda continua acotada } f\colon\R\to\R .

Equivalentemente (el Ejercicio 23.4): FXn(t)FX(t)F_{X_n}(t) \to F_X(t) en todo punto de continuidad tt de FXF_X. Las XnX_n no necesitan vivir en un espacio de probabilidad común: solo importan las leyes.

Teorema 23.5 (Teorema de selección de Helly)

Toda sucesión (Fn)(F_n) de funciones de distribución tiene una subsucesión que converge puntualmente, en todo punto de continuidad del límite, a una función G ⁣:R[0,1]G \colon \R \to \intcc01 no decreciente y continua por la derecha — posiblemente con G(+)G()<1G(+\infty) - G(-\infty) < 1 (la masa puede escaparse al infinito).

Demostración. La extracción diagonal da Fnk(q)(q)F_{n_k}(q) \to \ell(q) para todo racional qq (valores en el compacto [0,1]\intcc01). Defínase G(t)=inf{(q):qQ,q>t}G(t) = \inf\{\ell(q) : q \in \Q, q > t\}: no decreciente y continua por la derecha (un ínfimo sobre entornos racionales que se encogen por la derecha). En un punto de continuidad tt de GG: para racionales q1<t<q2q_1 < t < q_2,

(q1)lim infFnk(t)lim supFnk(t)(q2),\ell(q_1) \leq \liminf F_{n_k}(t) \leq \limsup F_{n_k}(t) \leq \ell(q_2),

por monotonía de cada FnkF_{n_k}. De la definición de GG como ínfimo y de la monotonía de \ell en los racionales: G(s)(q)G(q)G(s) \leq \ell(q) \leq G(q) siempre que s<qs < q. Tomando s<q1<ts < q_1 < t se obtiene (q1)G(s)\ell(q_1) \geq G(s), y (q2)G(q2)\ell(q_2) \leq G(q_2); haciendo sts \uparrow t y q2tq_2 \downarrow t, la continuidad de GG en tt encajona tanto el lim inf\liminf como el lim sup\limsup hacia G(t)G(t).

Lema 23.6 (Tensión a partir de la función característica)

Para toda variable aleatoria XX y todo u>0u > 0:

P(X2u)    1uuu(1ReφX(ξ)) ⁣dξ.\P\Bigl(\abs X \geq \frac2u\Bigr) \;\leq\; \frac1u\int_{-u}^{u}\bigl(1 - \operatorname{Re}\varphi_X(\xi)\bigr)\,\dd\xi .

Demostración. Por Tonelli–Fubini (integrando acotado, región finita en ξ\xi):

1uuu(1ReφX(ξ)) ⁣dξ=E[1uuu(1cos(ξX)) ⁣dξ]=2E[1sin(uX)uX]\frac1u\int_{-u}^u\bigl(1 - \operatorname{Re}\varphi_X(\xi)\bigr)\dd\xi = \E\Bigl[\frac1u\int_{-u}^u(1 - \cos(\xi X))\,\dd\xi\Bigr] = 2\,\E\Bigl[1 - \frac{\sin(uX)}{uX}\Bigr]

(interprétese el corchete como su límite 00 en X=0X = 0). El integrando es no negativo (sintt\abs{\sin t} \leq \abs t) y, para uX2\abs{uX} \geq 2: 1sin(uX)uX11uX121 - \frac{\sin(uX)}{uX} \geq 1 - \frac1{\abs{uX}} \geq \frac12. Conservar dentro de la esperanza solo el suceso {uX2}\{\abs{uX} \geq 2\} deja, por tanto, al menos 212P(X2u)2 \cdot \frac12\,\P(\abs X \geq \frac2u), que es lo afirmado.

Teorema 23.7 (Teorema de continuidad de Lévy)

Sean (Xn)(X_n) variables aleatorias cuyas funciones características convergen puntualmente: φXn(ξ)φ(ξ)\varphi_{X_n}(\xi) \to \varphi(\xi) para todo ξ\xi, donde φ=φX\varphi = \varphi_X es la función característica de cierta variable aleatoria XX. Entonces XnXX_n \Rightarrow X.

Demostración. Tensión. Fíjese ε>0\varepsilon > 0. Como φ\varphi es continua en 00 con φ(0)=1\varphi(0) = 1, elíjase u>0u > 0 con 1uuu(1Reφ)<ε\frac1u\int_{-u}^u(1 - \operatorname{Re}\varphi) < \varepsilon; por convergencia dominada (integrando acotado por 22 en el [u,u][-u,u] fijo), la misma integral para φXn\varphi_{X_n} es <2ε< 2\varepsilon si nn es grande: el Lema 23.6 da P(Xn2u)2ε\P(\abs{X_n} \geq \frac2u) \leq 2\varepsilon para nn grande, y agrandar la constante se ocupa de las finitas restantes: las leyes son tensas — no se escapa masa.

Subsucesiones. Sea (Fnk)(F_{n_k}) una subsucesión cualquiera; por Helly (el Teorema 23.5), extráigase FnkjGF_{n_{k_j}} \to G en los puntos de continuidad. La tensión fuerza G()=0G(-\infty) = 0, G(+)=1G(+\infty) = 1 (G(2u)G(2u)12εG(\frac2u) - G(-\frac2u) \geq 1 - 2\varepsilon en los puntos de continuidad): GG es una función de distribución genuina, de cierta variable aleatoria YY. Entonces XnkjYX_{n_{k_j}} \Rightarrow Y (Ejercicio 23.4, convergencia distribucional a partir de las FF), de modo que φXnkjφY\varphi_{X_{n_{k_j}}} \to \varphi_Y puntualmente (xeiξxx \mapsto \eu^{\iu\xi x} es continua y acotada, por separado en sus partes real e imaginaria); comparando con la hipótesis: φY=φ=φX\varphi_Y = \varphi = \varphi_X, y la inyectividad (el Teorema 23.3) da YXY \sim X, es decir, G=FXG = F_X.

Conclusión. Toda subsucesión de (Fn)(F_n) tiene una subsubsucesión que converge a la misma FXF_X (en sus puntos de continuidad); por tanto, Fn(t)FX(t)F_n(t) \to F_X(t) en todo punto de continuidad tt (una sucesión real cuyas subsucesiones tienen todas subsubsucesiones con el mismo límite converge): XnXX_n \Rightarrow X.

23.3 El teorema central del límite

Teorema 23.8 (Teorema central del límite)

Sean (Xn)(X_n) i.i.d. con EX1=m\E X_1 = m y V(X1)=σ2(0,)\V(X_1) = \sigma^2 \in \intoo0\infty. Entonces

Snnmσn    N(0,1):P(aSnnmσnb)12πabex2/2 ⁣dx\frac{S_n - nm}{\sigma\sqrt n} \;\Longrightarrow\; \mathcal N(0, 1) : \qquad \P\Bigl(a \leq \frac{S_n - nm}{\sigma\sqrt n} \leq b\Bigr) \longrightarrow \frac{1}{\sqrt{2\pi}}\int_a^b\eu^{-x^2/2}\,\dd x

para todos a<ba < b.

Demostración. Céntrese y normalícese: Zi=XimσZ_i = \frac{X_i - m}{\sigma} (i.i.d., de media 00 y varianza 11) y Tn=1ninZiT_n = \frac1{\sqrt n}\sum_{i\leq n}Z_i. Por independencia y la regla afín (la Proposición 23.2):

φTn(ξ)=φZ(ξn)n,φZ(η)=1η22+η2ρ(η),ρ(η)0.\varphi_{T_n}(\xi) = \varphi_{Z}\Bigl(\frac{\xi}{\sqrt n}\Bigr)^{n}, \qquad \varphi_Z(\eta) = 1 - \frac{\eta^2}2 + \eta^2\rho(\eta),\quad \rho(\eta)\to0 .

Fíjese ξ\xi y sean an=φZ(ξ/n)a_n = \varphi_Z(\xi/\sqrt n), bn=1ξ22nb_n = 1 - \frac{\xi^2}{2n}: ambos tienen módulo 1\leq 1 si nn es grande (bn1\abs{b_n} \leq 1 en cuanto ξ24n\xi^2 \leq 4n; an1\abs{a_n} \leq 1 siempre). La desigualdad elemental anbnnab\abs{a^n - b^n} \leq n\abs{a - b} para a,b1\abs a, \abs b \leq 1 (telescopando anbn=ak(ab)bn1ka^n - b^n = \sum a^k(a - b)b^{n-1-k}) da

φTn(ξ)(1ξ22n)nnφZ(ξn)1+ξ22n=ξ2ρ(ξn)0,\Bigl|\varphi_{T_n}(\xi) - \Bigl(1 - \frac{\xi^2}{2n}\Bigr)^{n}\Bigr| \leq n\,\Bigl|\varphi_Z\Bigl(\frac\xi{\sqrt n}\Bigr) - 1 + \frac{\xi^2}{2n}\Bigr| = \xi^2\,\Bigl|\rho\Bigl(\frac{\xi}{\sqrt n}\Bigr)\Bigr| \longrightarrow 0,

mientras que (1ξ22n)neξ2/2\bigl(1 - \frac{\xi^2}{2n}\bigr)^n \to \eu^{-\xi^2/2} (logaritmo real). Así, φTn(ξ)eξ2/2=φN(0,1)(ξ)\varphi_{T_n}(\xi) \to \eu^{-\xi^2/2} = \varphi_{\mathcal N(0,1)}(\xi) (la Proposición 23.2(d)) para todo ξ\xi: Lévy (el Teorema 23.7) concluye TnN(0,1)T_n \Rightarrow \mathcal N(0,1). Las probabilidades de intervalos se siguen porque FNF_{\mathcal N} es continua en todas partes.

Ejemplo 23.9 (Intervalos de confianza, deducidos honestamente)

Encuéstese a nn votantes independientes; p^n=Sn/n\hat p_n = S_n/n estima el verdadero pp, con σ2=p(1p)14\sigma^2 = p(1-p) \leq \frac14. El TCL da, para nn grande,

P(p^npz2n)    P(Snnpσnz)Φ(z)Φ(z),\P\Bigl(\abs{\hat p_n - p} \leq \frac{z}{2\sqrt n}\Bigr) \;\geq\; \P\Bigl(\Bigl|\frac{S_n - np}{\sigma\sqrt n}\Bigr| \leq z\Bigr) \longrightarrow \Phi(z) - \Phi(-z),

donde Φ\Phi es la función de distribución gaussiana estándar. Con z=1.96z = 1.96: confianza asintótica 95%95\%, y un margen 1.962n3%\frac{1.96}{2\sqrt n} \leq 3\% exige n(1.960.06)21068n \geq \bigl(\frac{1.96}{0.06}\bigr)^2 \approx 1068 — el número que hay detrás de todo «±3\pm3 puntos, 95%95\%» que uno lee; compárese con el 55565556 de Chebyshev (el Ejercicio 22.7). El n\sqrt n es universal: para reducir el error a la mitad, cuadruplíquese la muestra — la misma ley que fija el coste de Monte Carlo (Ejercicio 23.7).

23.4 Vectores gaussianos

Definición 23.10

Un vector aleatorio X=(X1,,Xd)X = (X_1, \dots, X_d) es gaussiano si toda combinación lineal t,X=tiXi\langle t, X\rangle = \sum t_iX_i es una variable gaussiana real (posiblemente degenerada). Su ley queda determinada por el vector de medias m=(EXi)m = (\E X_i) y la matriz de covarianzas Σ=(Cov(Xi,Xj))\Sigma = \bigl(\operatorname{Cov} (X_i, X_j)\bigr): en efecto, la función característica del vector, φX(t)=Eeit,X\varphi_X(t) = \E\eu^{\iu\langle t, X\rangle}, es el valor en 11 de la f.c. de t,X\langle t, X\rangle:

φX(t)=exp(it,m12tTΣt),\varphi_X(t) = \exp\Bigl(\iu\langle t, m\rangle - \tfrac12\,t^{\mathsf T}\Sigma\,t\Bigr),

y las funciones características en dimensión dd son inyectivas (la misma demostración por regularización del Teorema 23.3, con gaussianas coordenada a coordenada).

Teorema 23.11

Sea XX un vector gaussiano.

  1. Toda imagen afín AX+bAX + b es un vector gaussiano.
  2. Las componentes XiX_i son independientes si y solo si Σ\Sigma es diagonal: para variables conjuntamente gaussianas, incorreladas == independientes.
  3. Si Σ\Sigma es invertible, XX tiene la densidad 1(2π)d/2detΣexp(12(xm)TΣ1(xm))\frac{1}{(2\pi)^{d/2}\sqrt{\det\Sigma}} \exp\bigl(-\frac12(x - m)^{\mathsf T}\Sigma^{-1}(x - m)\bigr).

Demostración. (1) Las combinaciones lineales de las componentes de AX+bAX + b son funciones afines de combinaciones lineales de XX: gaussianas (una imagen afín de una variable gaussiana es gaussiana). (2) Si Σ\Sigma es diagonal, la función característica factoriza: φX(t)=iexp(itimi12Σiiti2)=φXi(ti)\varphi_X(t) = \prod_i\exp(\iu t_im_i - \frac12\Sigma_{ii}t_i^2) = \prod\varphi_{X_i}(t_i), que es la función característica de la ley producto (el Teorema 22.5 leído a través de la inyectividad en dimensión dd): las componentes son independientes. El recíproco es la anulación de las covarianzas de variables L2L^2 independientes. (3) Diagonalícese Σ=PDPT\Sigma = P D P^{\mathsf T} (PP ortogonal, D>0D > 0 diagonal — el Ejercicio 20.8); el vector Y=PT(Xm)Y = P^{\mathsf T}(X - m) es gaussiano de covarianza DD: por (2), sus componentes son N(0,di)\mathcal N(0, d_i) independientes, de modo que YY tiene la densidad producto; empújese por la x=m+PYx = m + PY, que conserva el volumen (el Teorema 11.10, detP=1\abs{\det P} = 1), y reescríbase el exponente de forma invariante.

Teorema 23.12 (TCL multidimensional)

Sean (Xn)(X_n) vectores aleatorios i.i.d. de cuadrado integrable de Rd\R^d, de media mm y matriz de covarianzas Σ\Sigma. Entonces Snnmn\frac{S_n - nm}{\sqrt n} converge en distribución al vector gaussiano N(0,Σ)\mathcal N(0, \Sigma).

Demostración. Admitido a este nivel.

Observación 23.13

Casi todo está ya en nuestras manos. Para cada dirección tRdt \in \R^d, la variable real t,Snnmn\langle t, \frac{S_n - nm}{\sqrt n}\rangle es una suma normalizada de variables reales i.i.d. de varianza tTΣtt^{\mathsf T}\Sigma t, de modo que el cálculo del Teorema 23.8 da la convergencia puntual de las funciones características en dimensión dd hacia etTΣt/2\eu^{-t^{\mathsf T}\Sigma t/2}, la función característica de N(0,Σ)\mathcal N(0, \Sigma) (la Definición 23.10). Lo que no hemos vuelto a demostrar es el teorema de continuidad de Lévy en Rd\R^d: la selección de Helly y la estimación de tensión se generalizan de manera rutinaria (coordenada a coordenada), y esta reducción de Cramér–Wold se lleva a cabo honestamente en cualquier curso de posgrado de probabilidad; no hace falta nada más allá de los métodos de este capítulo.

Método 23.14

Para identificar una ley límite: calcúlense funciones características, tómese el límite puntual, reconózcase (gaussiana eσ2ξ2/2\eu^{-\sigma^2\xi^2/2}, Poisson eλ(eiξ1)\eu^{\lambda(\eu^{\iu\xi}-1)}, exponencial λλiξ\frac{\lambda} {\lambda - \iu\xi}, …) e invóquese Lévy. El ritual de tres pasos (independencia \to producto; Taylor en 00 \to límite exponencial; Lévy \to convergencia en ley) demuestra el TCL, la ley de los sucesos raros de Poisson (el Ejercicio 23.5) y todos los teoremas límite clásicos de este curso. Para los enunciados c.s., vuélvase a la caja de herramientas del Capítulo 22: los dos capítulos responden a preguntas distintas sobre el mismo SnS_n.

23.5 Ejercicios

Ejercicio 23.1

Calcúlense las funciones características: uniforme en [1,1]\intcc{-1}1; exponencial E(λ)\mathcal E(\lambda); Poisson P(λ)\mathcal P(\lambda); binomial B(n,p)\mathcal B(n, p). Dedúzcase, vía el Teorema 23.3, que la suma de variables de Poisson independientes (λ,μ\lambda, \mu) es de Poisson (λ+μ)(\lambda + \mu).

Solución

Solución de Ejercicio 23.1.

Uniforme en [1,1]\intcc{-1}1: φ(ξ)=1211eiξx ⁣dx=sinξξ\varphi(\xi) = \frac12\int_{-1}^1\eu^{\iu\xi x}\dd x = \frac{\sin\xi}{\xi} (igual a 11 en ξ=0\xi = 0). Exponencial E(λ)\mathcal E(\lambda): φ(ξ)=λ0e(iξλ)x ⁣dx=λλiξ\varphi(\xi) = \lambda\int_0^\infty\eu^{(\iu\xi - \lambda)x}\dd x = \frac{\lambda}{\lambda - \iu\xi} (la primitiva se anula en ++\infty, pues Re(iξλ)<0\operatorname{Re}(\iu\xi - \lambda) < 0). Poisson P(λ)\mathcal P(\lambda): por el teorema de transferencia para leyes discretas,

φ(ξ)=k0eiξkeλλkk!=eλexp(λeiξ)=exp(λ(eiξ1)).\varphi(\xi) = \sum_{k\geq0}\eu^{\iu\xi k}\,\eu^{-\lambda}\frac{\lambda^k}{k!} = \eu^{-\lambda}\exp\bigl(\lambda\eu^{\iu\xi}\bigr) = \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr).

Binomial B(n,p)\mathcal B(n, p): una suma de nn variables de Bernoulli independientes, cada una de f.c. 1p+peiξ1 - p + p\eu^{\iu\xi}, de modo que φ(ξ)=(1p+peiξ)n\varphi(\xi) = \bigl(1 - p + p\eu^{\iu\xi}\bigr)^n (la Proposición 23.2(b)). Aditividad de Poisson: si XP(λ)X \sim \mathcal P(\lambda), YP(μ)Y \sim \mathcal P(\mu) son independientes,

φX+Y(ξ)=eλ(eiξ1)eμ(eiξ1)=e(λ+μ)(eiξ1),\varphi_{X+Y}(\xi) = \eu^{\lambda(\eu^{\iu\xi}-1)} \eu^{\mu(\eu^{\iu\xi}-1)} = \eu^{(\lambda+\mu)(\eu^{\iu\xi}-1)},

la f.c. de P(λ+μ)\mathcal P(\lambda + \mu); la inyectividad (el Teorema 23.3) identifica la ley.

Ejercicio 23.2 ★★

(a) Demuéstrese que φX\varphi_X toma valores reales si y solo si XX y X-X tienen la misma ley (una variable simétrica). (b) Supóngase φX(ξ0)=1\abs{\varphi_X(\xi_0)} = 1 para cierto ξ00\xi_0 \neq 0. Demuéstrese que XX está casi seguramente soportada en una progresión aritmética a+2πξ0Za + \frac{2\pi}{\xi_0}\Z (escríbase φX(ξ0)=eiθ\varphi_X(\xi_0) = \eu^{\iu\theta} y calcúlese E[1cos(ξ0Xθ)]\E[1 - \cos(\xi_0X - \theta)]). Dedúzcase que si XX tiene densidad, entonces φX(ξ)<1\abs{\varphi_X(\xi)} < 1 para todo ξ0\xi \neq 0.

Solución

Solución de Ejercicio 23.2.

(a) φX(ξ)=EeiξX=φX(ξ)\overline{\varphi_X(\xi)} = \E\eu^{-\iu\xi X} = \varphi_{-X}(\xi). Así, φX\varphi_X es real si y solo si φX=φX\varphi_X = \varphi_{-X}, si y solo si (inyectividad, el Teorema 23.3) XX y X-X tienen la misma ley. (b) Escríbase φX(ξ0)=eiθ\varphi_X(\xi_0) = \eu^{\iu\theta}. Entonces

E[1cos(ξ0Xθ)]=1Re(eiθφX(ξ0))=11=0.\E\bigl[1 - \cos(\xi_0X - \theta)\bigr] = 1 - \operatorname{Re}\bigl(\eu^{-\iu\theta} \varphi_X(\xi_0)\bigr) = 1 - 1 = 0 .

El integrando es no negativo, de modo que cos(ξ0Xθ)=1\cos(\xi_0X - \theta) = 1 casi seguramente (una variable no negativa de esperanza nula se anula c.s.), es decir, ξ0Xθ2πZ\xi_0X - \theta \in 2\pi\Z c.s.: XX toma sus valores en la progresión aritmética θξ0+2πξ0Z\frac{\theta}{\xi_0} + \frac{2\pi}{\xi_0}\Z casi seguramente. Si XX tiene densidad, ese conjunto numerable es de medida de Lebesgue nula, de modo que soporta probabilidad 00 — contradicción; por tanto, φX(ξ)<1\abs{\varphi_X(\xi)} < 1 para todo ξ0\xi \neq 0.

Ejercicio 23.3 ★★

Sean XN(m1,σ12)X \sim \mathcal N(m_1, \sigma_1^2) y YN(m2,σ22)Y \sim \mathcal N(m_2, \sigma_2^2) independientes. Demuéstrese X+YN(m1+m2,σ12+σ22)X + Y \sim \mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2) y, más en general, que la familia gaussiana es estable por sumas independientes y aplicaciones afines. Contraste: ¿es siempre gaussiana la suma de dos gaussianas dependientes? (Ejercicio 23.9.)

Solución

Solución de Ejercicio 23.3.

Por independencia y la Proposición 23.2:

φX+Y(ξ)=eim1ξσ12ξ2/2eim2ξσ22ξ2/2=ei(m1+m2)ξ(σ12+σ22)ξ2/2,\varphi_{X+Y}(\xi) = \eu^{\iu m_1\xi - \sigma_1^2\xi^2/2}\, \eu^{\iu m_2\xi - \sigma_2^2\xi^2/2} = \eu^{\iu(m_1+m_2)\xi - (\sigma_1^2+\sigma_2^2)\xi^2/2},

la f.c. de N(m1+m2,σ12+σ22)\mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2); la inyectividad concluye. La estabilidad por aplicaciones afines es la regla afín (aX+bN(am1+b,a2σ12)aX + b \sim \mathcal N(am_1 + b, a^2\sigma_1^2), admitiendo el caso degenerado a=0a = 0), y la estabilidad por sumas independientes se sigue por inducción del cálculo anterior. Para gaussianas dependientes, la suma no tiene por qué ser gaussiana: en el Ejercicio 23.9, XX y Y=εXY = \varepsilon X son gaussianas estándar cada una, pero X+YX + Y se anula con probabilidad 12\frac12 sin ser c.s. nula, de modo que no es gaussiana.

Ejercicio 23.4 ★★

(a) Demuéstrese la equivalencia de la Definición 23.4: si Ef(Xn)Ef(X)\E f(X_n) \to \E f(X) para toda ff continua acotada, entonces FXn(t)FX(t)F_{X_n}(t) \to F_X(t) en los puntos de continuidad (encájese 1(,t]\mathbf 1_{\intoc{-\infty}t} entre dos rampas escalonadas continuas); y recíprocamente (aproxímese una ff continua acotada por sumas de funciones rampa, o condiciónese a una malla fina de puntos de continuidad) — el recíproco puede tratarse primero para ff uniformemente continua y después en general. (b) Demuéstrese que XncX_n \Rightarrow c (una constante) implica XncX_n \to c en probabilidad.

Solución

Solución de Ejercicio 23.4.

(a) Implicación directa. Sean tt un punto de continuidad de FXF_X y δ>0\delta > 0. Tómense las rampas continuas ff^- (=1= 1 en (,tδ]\intoc{-\infty}{t-\delta}, 00 a partir de tt, afín en medio) y f+f^+ (=1= 1 en (,t]\intoc{-\infty}t, 00 a partir de t+δt + \delta, afín en medio); entonces f1(,t]f+f^- \leq \mathbf 1_{\intoc{-\infty}t} \leq f^+, de modo que

Ef(Xn)FXn(t)Ef+(Xn),\E f^-(X_n) \leq F_{X_n}(t) \leq \E f^+(X_n),

y los términos extremos convergen a Ef±(X)\E f^\pm(X), a su vez encajonados entre FX(tδ)F_X(t - \delta) y FX(t+δ)F_X(t + \delta). Haciendo nn \to \infty y después δ0\delta \to 0, y usando la continuidad de FXF_X en tt: FXn(t)FX(t)F_{X_n}(t) \to F_X(t).

Recíproco. Sea ff continua y acotada, M=supfM = \sup\abs f, ε>0\varepsilon > 0. Los puntos de continuidad de FXF_X son densos (FXF_X tiene a lo sumo una cantidad numerable de saltos), de modo que elíjanse puntos de continuidad a<ba < b con FX(a)<εF_X(a) < \varepsilon y 1FX(b)<ε1 - F_X(b) < \varepsilon. En el compacto [a,b]\intcc ab, la función ff es uniformemente continua: elíjanse puntos de continuidad a=t0<t1<<tm=ba = t_0 < t_1 < \dots < t_m = b de FXF_X con oscilación de ff a lo sumo ε\varepsilon en cada (tj1,tj]\intoc{t_{j-1}}{t_j}, y póngase g=jf(tj)1(tj1,tj]g = \sum_j f(t_j)\,\mathbf 1_{\intoc{t_{j-1}}{t_j}}. Entonces fgε\abs{f - g} \leq \varepsilon en (a,b]\intoc ab, gM\abs g \leq M, y para T=XnT = X_n o XX:

Ef(T)Eg(T)ε+2M(FT(a)+1FT(b)).\bigl|\E f(T) - \E g(T)\bigr| \leq \varepsilon + 2M\bigl(F_T(a) + 1 - F_T(b)\bigr).

Además, Eg(Xn)=jf(tj)(FXn(tj)FXn(tj1))Eg(X)\E g(X_n) = \sum_j f(t_j)\bigl(F_{X_n}(t_j) - F_{X_n}(t_{j-1})\bigr) \to \E g(X) (una suma finita de términos convergentes, siendo todos los tjt_j puntos de continuidad), y FXn(a)FX(a)<εF_{X_n}(a) \to F_X(a) < \varepsilon, 1FXn(b)1FX(b)<ε1 - F_{X_n}(b) \to 1 - F_X(b) < \varepsilon. Ensamblando: lim supnEf(Xn)Ef(X)2ε+8Mε\limsup_n\abs{\E f(X_n) - \E f(X)} \leq 2\varepsilon + 8M\varepsilon; hágase ε0\varepsilon \to 0.

(b) La función de distribución de la constante cc es 1[c,)\mathbf 1_{\intco c\infty}, continua salvo en cc. Para ε>0\varepsilon > 0, los puntos cεc - \varepsilon y c+ε2c + \frac\varepsilon2 son puntos de continuidad, de modo que

P(Xnc>ε)FXn(cε)+1FXn(c+ε2)0+11=0.\P(\abs{X_n - c} > \varepsilon) \leq F_{X_n}(c - \varepsilon) + 1 - F_{X_n}\Bigl(c + \frac\varepsilon2\Bigr) \longrightarrow 0 + 1 - 1 = 0 .

Ejercicio 23.5 ★★

(Ley de los sucesos raros) Sea XnB(n,pn)X_n \sim \mathcal B(n, p_n) con npnλ>0np_n \to \lambda > 0. Demuéstrese, vía funciones características y el Teorema 23.7, que XnP(λ)X_n \Rightarrow \mathcal P(\lambda). Comprobación numérica de sensatez: compárense P(X=0)\P(X = 0) para B(100,0.02)\mathcal B(100, 0.02) y P(2)\mathcal P(2).

Solución

Solución de Ejercicio 23.5.

Sea zn=pn(eiξ1)z_n = p_n(\eu^{\iu\xi} - 1), de modo que φXn(ξ)=(1+zn)n\varphi_{X_n}(\xi) = (1 + z_n)^n (el Ejercicio 23.1) y zn2pn0\abs{z_n} \leq 2p_n \to 0 (obsérvese pn=npnn0p_n = \frac{np_n}n \to 0). Tanto 1+zn1 + z_n como ezn\eu^{z_n} tienen módulo a lo sumo 11: 1+zn=(1pn)+pneiξ1\abs{1 + z_n} = \abs{(1 - p_n) + p_n\eu^{\iu\xi}} \leq 1 por la desigualdad triangular, y ezn=epn(cosξ1)1\abs{\eu^{z_n}} = \eu^{p_n(\cos\xi - 1)} \leq 1. La desigualdad telescópica anbnnab\abs{a^n - b^n} \leq n\abs{a - b} (demostración del Teorema 23.8) y la cota de la serie de potencias ez1zz2ez\abs{\eu^z - 1 - z} \leq \abs z^2\eu^{\abs z} dan

(1+zn)nenznn1+zneznnzn2ezn4e2npn2=4e2(npn)pn0.\bigl|(1 + z_n)^n - \eu^{nz_n}\bigr| \leq n\bigl|1 + z_n - \eu^{z_n}\bigr| \leq n\,\abs{z_n}^2\,\eu^{\abs{z_n}} \leq 4\eu^2\,np_n^2 = 4\eu^2\,(np_n)\,p_n \longrightarrow 0 .

Como nzn=npn(eiξ1)λ(eiξ1)nz_n = np_n(\eu^{\iu\xi} - 1) \to \lambda(\eu^{\iu\xi} - 1), concluimos φXn(ξ)exp(λ(eiξ1))\varphi_{X_n}(\xi) \to \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr) para todo ξ\xi: la f.c. de P(λ)\mathcal P(\lambda), y Lévy (el Teorema 23.7) da XnP(λ)X_n \Rightarrow \mathcal P(\lambda). Numéricamente: P(B(100,0.02)=0)=0.98100=e100ln0.98e2.0200.1326\P\bigl(\mathcal B(100, 0.02) = 0\bigr) = 0.98^{100} = \eu^{100\ln 0.98} \approx \eu^{-2.020} \approx 0.1326, mientras que P(P(2)=0)=e20.1353\P\bigl(\mathcal P(2) = 0\bigr) = \eu^{-2} \approx 0.1353: dos puntos porcentuales de diferencia ya con este nn tan burdo.

Ejercicio 23.6 ★★

(a) Se lanza un dado equilibrado n=1000n = 1000 veces; apróxímese la probabilidad de que el total supere 36003600 (media 35003500, varianza por lanzamiento 3512\frac{35}{12}). (b) Para SB(100,12)S \sim \mathcal B(100, \frac12), apróxímese P(45S55)\P(45 \leq S \leq 55) mediante el TCL con la corrección de continuidad (±12\pm\frac12), y coméntese el efecto de la corrección.

Solución

Solución de Ejercicio 23.6.

(a) Un lanzamiento tiene media 72\frac72 y varianza 3512\frac{35}{12}, de modo que SS tiene media 35003500, varianza 35000122916.7\frac{35000}{12} \approx 2916.7 y desviación típica 54.0\approx 54.0. Por el TCL,

P(S>3600)=P(S350054.0>1.85)1Φ(1.85)0.032:\P(S > 3600) = \P\Bigl(\frac{S - 3500}{54.0} > 1.85\Bigr) \approx 1 - \Phi(1.85) \approx 0.032 :

alrededor de un 3%3\% de probabilidad. (b) SB(100,12)S \sim \mathcal B(100, \frac12): media 5050, desviación típica 55. Con la corrección de continuidad,

P(45S55)Φ(55.5505)Φ(44.5505)=2Φ(1.1)10.729,\P(45 \leq S \leq 55) \approx \Phi\Bigl(\frac{55.5 - 50}{5}\Bigr) - \Phi\Bigl(\frac{44.5 - 50}{5}\Bigr) = 2\Phi(1.1) - 1 \approx 0.729,

frente al valor exacto 0.72870.7287; sin la corrección, 2Φ(1)10.6832\Phi(1) - 1 \approx 0.683, con casi cinco puntos de desviación. La corrección importa porque SS es una variable reticular: el átomo P(S=k)\P(S = k) queda bien aproximado por la masa gaussiana de [k12,k+12]\intcc{k - \frac12}{k + \frac12}, y recortar el intervalo en los enteros 4545 y 5555 desecha medio átomo en cada extremo.

Ejercicio 23.7 ★★

(Error de Monte Carlo) En el marco del Problema 22.1, pregunta 11, con gL2([0,1]d)g \in L^2(\intcc01^d), sean σ2=V(g(U1))\sigma^2 = \V(g(U_1)) y I=gI = \int g. Demuéstrese

n(1nkng(Uk)I)N(0,σ2),\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr) \Longrightarrow \mathcal N(0, \sigma^2),

y dedúzcase la barra de error asintótica al 95%95\%, ±1.96σ/n\pm 1.96\,\sigma/\sqrt n — independiente de la dimensión dd. Compárese con la regla del punto medio determinista en dimensión dd (error n2/d\sim n^{-2/d} para integrandos C2\mathcal C^2): ¿a partir de qué dimensión gana el muestreo aleatorio?

Solución

Solución de Ejercicio 23.7.

Las variables g(Uk)g(U_k) son i.i.d. (imágenes medibles de variables i.i.d.), de cuadrado integrable, de media II (teorema de transferencia, el Ejercicio 11.9) y varianza σ2\sigma^2. Si σ>0\sigma > 0, el Teorema 23.8 aplicado a ellas es exactamente la convergencia enunciada

n(1nkng(Uk)I)=kn(g(Uk)I)nN(0,σ2)\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr) = \frac{\sum_{k\leq n}\bigl(g(U_k) - I\bigr)}{\sqrt n} \Longrightarrow \mathcal N(0, \sigma^2)

(si σ=0\sigma = 0, gg es c.s. constante y el miembro izquierdo se anula idénticamente). Por tanto, P(1ng(Uk)I1.96σ/n)0.95\P\bigl(\abs{\frac1n\sum g(U_k) - I} \leq 1.96\,\sigma/\sqrt n\bigr) \to 0.95: la barra de error ±1.96σ/n\pm 1.96\,\sigma/\sqrt n ve la dimensión dd solo a través de la constante σ\sigma, nunca a través de la velocidad en nn. La regla del punto medio con nn nodos en dimensión dd tiene paso n1/dn^{-1/d} y error de orden n2/dn^{-2/d} para integrandos C2\mathcal C^2. El n1/2n^{-1/2} de Monte Carlo decae más deprisa que n2/dn^{-2/d} exactamente cuando 12>2d\frac12 > \frac2d, es decir, d>4d > 4: a partir de la dimensión 55, el muestreo aleatorio gana asintóticamente a la malla — la maldición de la dimensión perdona a los métodos probabilísticos, y por eso Monte Carlo reina en la integración en dimensión alta.

Ejercicio 23.8 ★★★

(Slutsky) Supóngase XnXX_n \Rightarrow X y YncY_n \to c en probabilidad (cc constante). Demuéstrense Xn+YnX+cX_n + Y_n \Rightarrow X + c y YnXncXY_nX_n \Rightarrow cX. (Trabájese con funciones características y la cota Eeiξ(Xn+Yn)eiξcEeiξXnEeiξ(Ync)1\abs{\E\eu^{\iu\xi (X_n+Y_n)} - \eu^{\iu\xi c}\E\eu^{\iu\xi X_n}} \leq \E\abs{\eu^{\iu\xi(Y_n - c)} - 1}, separando según Yncδ\abs{Y_n - c} \leq \delta.) Aplicación: en el Ejemplo 23.9, justifíquese la sustitución del σ=p(1p)\sigma = \sqrt{p(1-p)} desconocido por p^n(1p^n)\sqrt{\hat p_n(1 - \hat p_n)}.

Solución

Solución de Ejercicio 23.8.

Suma. Para ξ\xi fijo:

Eeiξ(Xn+Yn)eiξcEeiξXn=E[eiξXn(eiξYneiξc)]Eeiξ(Ync)1.\bigl|\E\eu^{\iu\xi(X_n+Y_n)} - \eu^{\iu\xi c}\,\E\eu^{\iu\xi X_n}\bigr| = \bigl|\E\bigl[\eu^{\iu\xi X_n}\bigl(\eu^{\iu\xi Y_n} - \eu^{\iu\xi c}\bigr)\bigr]\bigr| \leq \E\bigl|\eu^{\iu\xi(Y_n - c)} - 1\bigr| .

Sepárese según el suceso {Yncδ}\{\abs{Y_n - c} \leq \delta\}: allí, eiξ(Ync)1ξδ\abs{\eu^{\iu\xi(Y_n-c)} - 1} \leq \abs\xi\,\delta (la cuerda es más corta que el arco); el complementario aporta a lo sumo 2P(Ync>δ)02\,\P(\abs{Y_n - c} > \delta) \to 0. Por tanto, el lim sup\limsup es ξδ\leq \abs\xi\,\delta para todo δ>0\delta > 0: la diferencia tiende a 00. Como EeiξXnφX(ξ)\E\eu^{\iu\xi X_n} \to \varphi_X(\xi), se obtiene φXn+Yn(ξ)eiξcφX(ξ)=φX+c(ξ)\varphi_{X_n+Y_n}(\xi) \to \eu^{\iu\xi c}\varphi_X(\xi) = \varphi_{X+c}(\xi), y Lévy (el Teorema 23.7) da Xn+YnX+cX_n + Y_n \Rightarrow X + c.

Producto. Primero, cXncXcX_n \Rightarrow cX: φcXn(ξ)=φXn(cξ)φX(cξ)=φcX(ξ)\varphi_{cX_n}(\xi) = \varphi_{X_n}(c\xi) \to \varphi_X(c\xi) = \varphi_{cX}(\xi). Después, (Ync)Xn0(Y_n - c)X_n \to 0 en probabilidad: las leyes de las XnX_n son tensas (sus f.c. convergen a una f.c.; véase el paso de tensión del Teorema 23.7), de modo que, dado ε>0\varepsilon > 0, tómese MM con P(Xn>M)ε\P(\abs{X_n} > M) \leq \varepsilon para todo nn; entonces

P((Ync)Xn>ε)P(Xn>M)+P(Ync>εM)ε+o(1).\P\bigl(\abs{(Y_n - c)X_n} > \varepsilon\bigr) \leq \P(\abs{X_n} > M) + \P\Bigl(\abs{Y_n - c} > \frac{\varepsilon}{M}\Bigr) \leq \varepsilon + o(1) .

Escribiendo YnXn=cXn+(Ync)XnY_nX_n = cX_n + (Y_n - c)X_n y aplicando la parte de la suma (cuya demostración solo usó Yn:=(Ync)Xn0Y_n' := (Y_n - c)X_n \to 0 en probabilidad, con constante 00): YnXncXY_nX_n \Rightarrow cX.

Aplicación. Por la ley fuerte de los grandes números (el Teorema 22.13), p^np\hat p_n \to p c.s., de modo que por continuidad σ^n=p^n(1p^n)σ=p(1p)>0\hat\sigma_n = \sqrt{\hat p_n(1 - \hat p_n)} \to \sigma = \sqrt{p(1 - p)} > 0 c.s. y, por tanto, σσ^n1\frac{\sigma}{\hat\sigma_n} \to 1 en probabilidad. La regla del producto de Slutsky eleva SnnpσnN(0,1)\frac{S_n - np}{\sigma\sqrt n} \Rightarrow \mathcal N(0,1) a Snnpσ^nn=σσ^nSnnpσnN(0,1)\frac{S_n - np}{\hat\sigma_n\sqrt n} = \frac{\sigma}{\hat\sigma_n}\cdot \frac{S_n - np}{\sigma\sqrt n} \Rightarrow \mathcal N(0,1): el intervalo de confianza utilizable p^n±1.96σ^n/n\hat p_n \pm 1.96\,\hat\sigma_n/\sqrt n, construido solo con los datos, conserva su nivel asintótico 95%95\%.

Ejercicio 23.9 ★★★

Sean XN(0,1)X \sim \mathcal N(0,1) y ε\varepsilon independientes con P(ε=±1)=12\P(\varepsilon = \pm1) = \frac12; póngase Y=εXY = \varepsilon X. (a) Demuéstrense YN(0,1)Y \sim \mathcal N(0,1) y Cov(X,Y)=0\operatorname{Cov}(X, Y) = 0. (b) Demuéstrese que XX y YY no son independientes y que (X,Y)(X, Y) no es un vector gaussiano (calcúlese P(X+Y=0)\P(X + Y = 0)). (c) Moraleja: el Teorema 23.11(2) exige gaussianidad conjunta — «gaussianas incorreladas» por sí solo no demuestra nada.

Solución

Solución de Ejercicio 23.9.

(a) Separando la esperanza según los dos valores de ε\varepsilon (independencia): para BB boreliana, P(YB)=12P(XB)+12P(XB)=P(XB)\P(Y \in B) = \frac12\P(X \in B) + \frac12\P(-X \in B) = \P(X \in B), pues XX-X \sim X (N(0,1)\mathcal N(0,1) es simétrica): YN(0,1)Y \sim \mathcal N(0,1). Y Cov(X,Y)=E[εX2]=E[ε]E[X2]=01=0\operatorname{Cov}(X, Y) = \E[\varepsilon X^2] = \E[\varepsilon]\,\E[X^2] = 0 \cdot 1 = 0. (b) Y=X\abs Y = \abs X, de modo que P(X1, Y2)=0\P(\abs X \leq 1,\ \abs Y \geq 2) = 0 mientras que P(X1)P(Y2)>0\P(\abs X \leq 1)\,\P(\abs Y \geq 2) > 0: no independientes. Si (X,Y)(X, Y) fuera un vector gaussiano, X+Y=(1+ε)XX + Y = (1 + \varepsilon)X sería una variable gaussiana real (la Definición 23.10 con t=(1,1)t = (1,1)); pero P(X+Y=0)=P(ε=1)=12\P(X + Y = 0) = \P(\varepsilon = -1) = \frac12, mientras que una variable gaussiana solo tiene un átomo si es c.s. constante — y X+YX + Y vale 2X02X \neq 0 c.s. en {ε=1}\{\varepsilon = 1\}. Contradicción: (X,Y)(X, Y) no es gaussiano. (c) Cada marginal es gaussiana y la covarianza se anula y, sin embargo, falla la independencia — porque el par no es conjuntamente gaussiano. El Teorema 23.11(2) no puede debilitarse a «marginales gaussianas».

Ejercicio 23.10 ★★

La ley de Cauchy tiene densidad 1π(1+x2)\frac1{\pi(1 + x^2)}. (a) Demuéstrese que su función característica es eξ\eu^{-\abs\xi} (el Ejercicio 14.1 e inversión). (b) Demuéstrese que si X1,,XnX_1, \dots, X_n son i.i.d. de Cauchy, entonces Snn\frac{S_n}n es de nuevo de Cauchy — la misma ley: la media nunca se concentra. (c) Concíliese con las leyes de los grandes números y el TCL: ¿qué hipótesis fallan? (Calcúlese EX1\E\abs{X_1}.)

Solución

Solución de Ejercicio 23.10.

(a) El Ejercicio 14.1 calcula e^(ξ)=21+ξ2\widehat{\eu^{-\abs\cdot}}(\xi) = \frac{2}{1 + \xi^2}; siendo ambos miembros integrables, la inversión de Fourier (el Teorema 14.5) le da la vuelta:

Reiξx ⁣dxπ(1+x2)=eξ,\int_\R\eu^{\iu\xi x}\,\frac{\dd x}{\pi(1 + x^2)} = \eu^{-\abs\xi},

que es exactamente φX(ξ)\varphi_X(\xi) para una variable de Cauchy XX. (b) Por independencia, φSn(ξ)=(eξ)n=enξ\varphi_{S_n}(\xi) = \bigl(\eu^{-\abs\xi}\bigr)^n = \eu^{-n\abs\xi}, de modo que φSn/n(ξ)=φSn(ξ/n)=eξ\varphi_{S_n/n}(\xi) = \varphi_{S_n}(\xi/n) = \eu^{-\abs\xi}: la media empírica Snn\frac{S_n}n vuelve a ser de Cauchy estándar para todo nn (inyectividad). La media nunca se concentra: sus fluctuaciones en el instante 10610^6 son las de una sola observación. (c) EX1=2π0x ⁣dx1+x2=+\E\abs{X_1} = \frac2\pi\int_0^\infty\frac{x\,\dd x}{1 + x^2} = +\infty: la ley de Cauchy no es integrable, de modo que la ley fuerte de los grandes números (el Teorema 22.13) no se aplica, y el TCL (que necesita varianza finita) menos aún. Aquí fallan genuinamente sus conclusiones, no solo sus demostraciones. Comprobación de consistencia: φ(ξ)=eξ\varphi(\xi) = \eu^{-\abs\xi} no es derivable en 00, como predice la Proposición 23.2(c) leída por contrarrecíproco para una variable no integrable.

Ejercicio 23.11 ★★

(Leyes estables en embrión) Sean (Xn)(X_n) i.i.d. de Cauchy estándar (el Ejercicio 23.10). (a) Demuéstrese que, para todo a,b>0a, b > 0, aX1+bX2aX_1 + bX_2 tiene la ley de (a+b)X1(a + b)X_1: la familia de Cauchy es estrictamente estable de índice 11. (b) Demuéstrese que la familia gaussiana es estrictamente estable de índice 22: aX1+bX2a2+b2X1aX_1 + bX_2 \sim \sqrt{a^2 + b^2}\,X_1 para XiX_i i.i.d. N(0,1)\mathcal N(0,1). (c) Explíquese, mediante funciones características de la forma ecξα\eu^{-c\abs\xi^\alpha}, por qué la estabilidad de índice α\alpha fuerza la normalización n1/αn^{1/\alpha} para las sumas, y qué dice esto sobre las cuencas de atracción del TCL: ¿qué sumas i.i.d. pueden converger, tras normalización afín, a una ley de Cauchy en lugar de a una gaussiana?

Solución

Solución de Ejercicio 23.11.

(a) φaX1+bX2(ξ)=eaξebξ=e(a+b)ξ=φ(a+b)X1(ξ)\varphi_{aX_1 + bX_2}(\xi) = \eu^{-a\abs\xi}\eu^{-b\abs\xi} = \eu^{-(a+b)\abs\xi} = \varphi_{(a+b)X_1}(\xi) (independencia y el Ejercicio 23.10); la inyectividad identifica las leyes.

(b) φaX1+bX2(ξ)=ea2ξ2/2eb2ξ2/2=e(a2+b2)ξ2/2\varphi_{aX_1+bX_2}(\xi) = \eu^{-a^2\xi^2/2} \eu^{-b^2\xi^2/2} = \eu^{-(a^2+b^2)\xi^2/2}: la ley de a2+b2X1\sqrt{a^2+b^2}\,X_1.

(c) Si φX(ξ)=ecξα\varphi_X(\xi) = \eu^{-c\abs\xi^\alpha}, entonces Sn=X1++XnS_n = X_1 + \dots + X_n tiene φSn=ecnξα\varphi_{S_n} = \eu^{-cn\abs\xi^\alpha}, y Sn/n1/αS_n/n^{1/\alpha} vuelve a tener φ(ξ)=ecξα\varphi(\xi) = \eu^{-c\abs\xi^\alpha}: autorreproducción exacta bajo el reescalado n1/αn^{1/\alpha}n\sqrt n para la gaussiana (α=2\alpha = 2), el propio nn para Cauchy (α=1\alpha = 1, el Ejercicio 23.10(b)). Una suma de variables i.i.d. solo puede converger (tras normalización afín) a una ley estable bajo tales convoluciones; el TCL dice que la varianza finita fuerza la cuenca gaussiana, y la cuenca de Cauchy está reservada a leyes de colas tan pesadas que EX2=\E X^2 = \infty e incluso EX=\E\abs X = \infty — por ejemplo, sumas de variables de Cauchy. La universalidad tiene varias islas, indexadas por el exponente de cola α(0,2]\alpha \in \intoc02.

Ejercicio 23.12 ★★

(La función de distribución empírica) Sean (Xn)(X_n) i.i.d. de función de distribución FF, y Fn(t)=1n#{kn:Xkt}F_n(t) = \frac1n\#\{k \leq n : X_k \leq t\}. (a) Fíjese tt. Demuéstrense que nFn(t)B(n,F(t))n F_n(t) \sim \mathcal B(n, F(t)), que Fn(t)F(t)F_n(t) \to F(t) c.s. (el Teorema 22.13) y que

n(Fn(t)F(t))N(0, F(t)(1F(t))).\sqrt n\,\bigl(F_n(t) - F(t)\bigr) \Longrightarrow \mathcal N\bigl(0,\ F(t)(1 - F(t))\bigr) .

(b) ¿En qué tt es máxima la varianza asintótica? Interprétese: la mediana es donde más cuesta fijar una distribución empírica. (c) Para FF continua, demuéstrese que la ley de suptFn(t)F(t)\sup_t\abs{F_n(t) - F(t)} no depende de FF (redúzcase a variables uniformes vía el Ejercicio 22.1) — el milagro libre de distribución que hay detrás del contraste de Kolmogorov–Smirnov; no se pide calcular esa ley.

Solución

Solución de Ejercicio 23.12.

(a) Los indicadores 1Xkt\mathbf 1_{X_k \leq t} son i.i.d. de Bernoulli de parámetro p=F(t)p = F(t): su suma nFn(t)nF_n(t) es binomial B(n,p)\mathcal B(n, p); la ley fuerte da Fn(t)pF_n(t) \to p c.s., y el TCL (el Teorema 23.8) aplicado a los mismos indicadores (varianza p(1p)p(1-p)) da el límite gaussiano enunciado.

(b) p(1p)p(1 - p) es máxima en p=12p = \frac12, es decir, donde F(t)=12F(t) = \frac12: en la mediana. Estimar probabilidades de cola es asintóticamente fácil (varianza 0\to 0 cuando p0,1p \to 0, 1); la región de la mediana carga con el mayor ruido estadístico — la curva empírica oscila más en su parte central.

(c) Para FF continua, las variables Uk=F(Xk)U_k = F(X_k) son i.i.d. uniformes en (0,1)\intoo01 (el Ejercicio 22.1), y la monotonía de FF da, escribiendo GnG_n para la función de distribución empírica de las UkU_k:

suptRFn(t)F(t)=supuimFGn(u)u=supu[0,1]Gn(u)u:\sup_{t\in\R}\,\abs{F_n(t) - F(t)} = \sup_{u \in \operatorname{im}F}\,\abs{G_n(u) - u} = \sup_{u\in\intcc01}\abs{G_n(u) - u} :

la primera igualdad porque {Xkt}={UkF(t)}\{X_k \leq t\} = \{U_k \leq F(t)\} salvo sucesos nulos (monotonía; la desigualdad estricta solo puede fallar en los tramos planos de FF, donde ambos miembros no cambian), y la segunda porque una FF continua, que va de 00 a 11, alcanza todo valor de (0,1)\intoo01 (teorema del valor intermedio), y los extremos no añaden nada (Gn(0)0=0G_n(0) - 0 = 0 y Gn(1)1=0G_n(1) - 1 = 0). El miembro derecho solo involucra uniformes: una ley para todos los FF — de modo que una única tabla de valores críticos (la de la distribución de Kolmogorov) contrasta cualquier modelo continuo frente a los datos.

23.6 Problema: la demostración de Lindeberg del TCL, con velocidad

Problema 23.1

Problema de fin de semana — el método de sustitución

Lindeberg (1922) demostró el teorema central del límite con una idea de una sencillez desarmante: sustitúyanse los sumandos, uno a uno, por gaussianas y contrólese cada sustitución con un desarrollo de Taylor. El método no necesita análisis de Fourier, produce una velocidad de error explícita y hoy alimenta demostraciones de universalidad en toda la teoría de la probabilidad. Sean (Xi)(X_i) i.i.d., centradas, V(X1)=1\V(X_1) = 1, con β=EX13<\beta = \E\abs{X_1}^3 < \infty; sean (Ni)(N_i) i.i.d. N(0,1)\mathcal N(0,1), independientes de las XiX_i (existencia: el Teorema 22.6). Póngase

Tn=X1++Xnn,Gn=N1++NnnN(0,1).T_n = \frac{X_1 + \dots + X_n}{\sqrt n}, \qquad G_n = \frac{N_1 + \dots + N_n}{\sqrt n} \sim \mathcal N(0,1).

Parte I — La identidad de sustitución. Fíjese fCb3(R)f \in \mathcal C^3_b(\R) (tres derivadas continuas acotadas; M3=supfM_3 = \sup\abs{f'''}). Para 0in0 \leq i \leq n defínanse las sumas híbridas

Hi=X1++Xi+Ni+1++Nnn,H_i = \frac{X_1 + \dots + X_i + N_{i+1} + \dots + N_n}{\sqrt n},

de modo que Hn=TnH_n = T_n y H0=GnH_0 = G_n.

  1. Escríbanse Hi=Wi+XinH_i = W_i + \frac{X_i}{\sqrt n} y Hi1=Wi+NinH_{i-1} = W_i + \frac{N_i}{\sqrt n} con Wi=1n(j<iXj+j>iNj)W_i = \frac{1}{\sqrt n}\bigl(\sum_{j<i}X_j + \sum_{j>i}N_j\bigr), y obsérvese que WiW_i es independiente del par (Xi,Ni)(X_i, N_i). Justifíquese.
  2. Taylor con resto integral o de Lagrange: para cualesquiera reales w,hw, h:

    f(w+h)f(w)f(w)h12f(w)h2M3h36.\Bigl|f(w + h) - f(w) - f'(w)h - \tfrac12f''(w)h^2\Bigr| \leq \frac{M_3\,\abs h^3}{6} .
  3. Aplíquese la pregunta 2 dos veces (h=Xinh = \frac{X_i}{\sqrt n} y h=Ninh = \frac{N_i}{\sqrt n} en w=Wiw = W_i), tómense esperanzas y úsense la independencia y la coincidencia de los dos primeros momentos de XiX_i y NiN_i para demostrar

    Ef(Hi)Ef(Hi1)M36β+γn3/2,γ=EN13=22π.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{M_3}{6}\cdot \frac{\beta + \gamma}{n^{3/2}}, \qquad \gamma = \E\abs{N_1}^3 = \frac{2\sqrt2}{\sqrt\pi} .
  4. Telescópese en ii y conclúyase la cota de Lindeberg:

    Ef(Tn)Ef(Gn)M3(β+γ)6n.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .

Parte II — De las ff regulares al TCL.

  1. Demuéstrese que Ef(Tn)Ef(N)\E f(T_n) \to \E f(N) para todo fCb3f \in \mathcal C_b^3, y elévese a todas las ff continuas acotadas: dadas una tal ff y ε\varepsilon, constrúyase fεCb3f_\varepsilon \in \mathcal C^3_b con ffεε\norm{f - f_\varepsilon}_\infty \leq \varepsilon en un intervalo grande — por ejemplo, convoluciónese ff con una meseta C\mathcal C^\infty (el Teorema 12.9) — y trátense las colas por tensión (V(Tn)=1\V(T_n) = 1 y Chebyshev). Conclúyase TnN(0,1)T_n \Rightarrow \mathcal N(0, 1): el teorema central del límite, vuelto a demostrar.
  2. ¿Dónde usó la demostración que las XiX_i estén idénticamente distribuidas? Demuéstrese que apenas lo usó: enúnciese y demuéstrese la versión para XiX_i independientes, centradas y no idénticas, con iV(Xi)=sn2\sum_i\V(X_i) = s_n^2 y terceros momentos, obteniendo el error M36sn3i(EXi3+V(Xi)3/2γ)\frac{M_3}{6s_n^3}\sum_i\bigl(\E\abs{X_i}^3 + \V(X_i)^{3/2}\gamma\bigr) — el verdadero teorema de Lindeberg en su forma de Lyapunov.

Parte III — Dividendos cuantitativos.

  1. (Funciones de distribución) Sea tRt \in \R y apróxímese 1(,t]\mathbf 1_{\intoc{-\infty}t} por arriba y por abajo mediante rampas Cb3\mathcal C^3_b de anchura δ\delta (constrúyanse, con M3=O(δ3)M_3 = O(\delta^{-3})). Combinando con la Parte I, dedúzcase la cota de dos términos

    suptRP(Tnt)Φ(t)    C1(β+γ)δ3n+C2δ(todo δ>0),\sup_{t\in\R}\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \;\leq\; \frac{C_1(\beta + \gamma)}{\delta^3\sqrt n} + C_2\,\delta \qquad (\text{todo } \delta > 0),

    con constantes explícitas (el término C2δC_2\delta usa que Φ\Phi tiene densidad acotada por 12π\frac1{\sqrt{2\pi}}), y optimícese δn1/8\delta \sim n^{-1/8} para obtener una velocidad uniforme de orden n1/8n^{-1/8}. (La n1/2n^{-1/2} óptima — Berry–Esseen — necesita herramientas más finas; lo importante es obtener una velocidad explícita a partir de una sustitución elemental.)

  2. (De Moivre–Laplace, cuantificado) Especialícese a Xi=2Bi1X_i = 2B_i - 1 (signos de monedas equilibradas): compárese la conclusión con la estimación local del Problema 11.1, pregunta 7 — ¿qué da cada método que el otro no da?
  3. (Universalidad) Explíquese en un párrafo por qué el método de sustitución muestra más que el TCL: todo estadístico de la forma Ef(suma)\E f(\text{suma}) con ff regular es insensible, al orden n1/2n^{-1/2}, a toda la ley de los sumandos más allá de sus dos primeros momentos — el «principio de invariancia» que subyace a los resultados modernos de universalidad (matrices aleatorias, polinomios aleatorios), del que el TCL es la primera instancia.

Parte IV — Regularización, llevada más lejos: mejores velocidades. La pérdida al pasar de n1/2n^{-1/2} (ff regulares) a n1/8n^{-1/8} (funciones de distribución) vino de cargar ff''' en norma del supremo. Los híbridos pueden reparar parte de ella: contienen sumandos gaussianos, y las gaussianas regularizan.

  1. (Una gaussiana escondida) Para 1in11 \leq i \leq n - 1, h=Xinh = \frac{X_i}{\sqrt n} o Nin\frac{N_i}{\sqrt n}, y θ[0,1]\theta \in \intcc01, escríbase Wi+θh=A+ZW_i + \theta h = A + Z con Z=Ni+1++NnnZ = \frac{N_{i+1} + \dots + N_n}{\sqrt n}. Demuéstrese que ZN(0,nin)Z \sim \mathcal N\bigl(0, \frac{n-i}n\bigr) es independiente del par (A,h)(A, h) y dedúzcase, para toda gL1(R)g \in L^1(\R) continua,

    E[h3g(Wi+θh)]    n2π(ni)  gL1  Eh3.\E\bigl[\abs h^3\,\abs{g(W_i + \theta h)}\bigr] \;\leq\; \sqrt{\frac{n}{2\pi(n - i)}}\; \norm{g}_{L^1}\;\E\abs h^3 .
  2. Combínese la pregunta 10 con la forma integral del resto de Taylor,

    f(w+h)=f(w)+f(w)h+12f(w)h2+01(1θ)22f(w+θh)h3 ⁣dθ,f(w + h) = f(w) + f'(w)h + \tfrac12f''(w)h^2 + \int_0^1\frac{(1 - \theta)^2}2\,f'''(w + \theta h)\,h^3\,\dd\theta,

    para rehacer las preguntas 3–4: para fCb3f \in \mathcal C^3_b con, además, fL1(R)f''' \in L^1(\R),

    Ef(Tn)Ef(Gn)β+γ32πfL1n+M3(β+γ)6n3/2\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot \frac{\norm{f'''}_{L^1}}{\sqrt n} + \frac{M_3(\beta + \gamma)}{6\,n^{3/2}}

    (la pregunta 10 se ocupa de las sustituciones in1i \leq n - 1 — úsese m=1n1m1/22n\sum_{m=1}^{n-1}m^{-1/2} \leq 2\sqrt n — y la cota burda de la pregunta 3 se ocupa de la última). Compruébese que las rampas de la pregunta 7 cumplen ψδL1=K1δ2\norm{\psi_\delta'''}_{L^1} = K_1\delta^{-2} mientras que M3=Kδ3M_3 = K\delta^{-3}, introdúzcanse y optimícese δ\delta: la velocidad uniforme para funciones de distribución mejora a O(n1/6)O(n^{-1/6}).

  3. (Ajustando un momento más) Supóngase además EX13=0\E X_1^3 = 0 y β4=EX14<\beta_4 = \E X_1^4 < \infty. Calcúlense EN13\E N_1^3 y EN14\E N_1^4, desarróllese hasta el cuarto orden y demuéstrese por la misma vía que la velocidad para funciones de distribución pasa a ser O(n1/4)O(n^{-1/4}) (ahora ψδ(4)L1=K2δ3\norm{\psi_\delta^{(4)}}_{L^1} = K_2\delta^{-3} y M4=Kδ4M_4 = K'\delta^{-4}; elíjase δ=n1/4\delta = n^{-1/4}).
  4. (La obstrucción) Supóngase que los kk primeros momentos de X1X_1 coinciden con los gaussianos (k=2k = 2 siempre; k=3k = 3 exactamente cuando EX13=0\E X_1^3 = 0; k4k \geq 4 prácticamente nunca, pues EN14=3\E N_1^4 = 3). Verifíquese que el esquema de las preguntas 10–12 entrega la velocidad n(k1)/(2k+2)n^{-(k-1)/(2k+2)} para funciones de distribución, equilibrando δkn(k1)/2\delta^{-k}n^{-(k-1)/2} frente a δ\delta, y obsérvese que el exponente se aproxima al valor 12\frac12 de Berry–Esseen solo cuando kk \to \infty. Explíquese en unas frases por qué el método de sustitución se satura: cada sustitución se carga en valor absoluto, mientras que la vía de Fourier (desigualdad de regularización de Esseen) explota la oscilación de la diferencia de funciones características y alcanza Cβn1/2C\beta n^{-1/2} con solo tres momentos.

Parte V — Dos dimensiones: el TCL multidimensional, por sustitución. Sean ahora las XiX_i vectores aleatorios i.i.d. centrados de R2\R^2, con matriz de covarianzas Σ\Sigma y β=EX13<\beta' = \E\norm{X_1}^3 < \infty (norma euclídea).

  1. (Vectores gaussianos, hasta el orden) Diagonalícese Σ=PDPT\Sigma = PDP^{\mathsf T} (el Ejercicio 20.8) y póngase C=PDPTC = P\sqrt DP^{\mathsf T}. Para Z=(Z1,Z2)Z = (Z^1, Z^2) un par de gaussianas estándar independientes (el Teorema 22.6), demuéstrese que N=CZN = CZ es un vector gaussiano (la Definición 23.10) de media 00 y covarianza Σ\Sigma, con γ=EN3<\gamma' = \E\norm N^3 < \infty; y que Gn=N1++NnnG_n = \frac{N_1 + \dots + N_n}{\sqrt n} tiene ley N(0,Σ)\mathcal N(0, \Sigma) exactamente para copias i.i.d. NiN_i.
  2. (Taylor en dos variables) Para f ⁣:R2Rf \colon \R^2 \to \R de clase C3\mathcal C^3 con M3=maxα=3supαf<M_3 = \max_{\abs\alpha = 3}\sup\abs{\partial^\alpha f} < \infty, demuéstrese

    f(w+h)f(w)f(w),h12h,D2f(w)hM36(h1+h2)32M33h3\Bigl|f(w + h) - f(w) - \langle\nabla f(w), h\rangle - \tfrac12\langle h, D^2f(w)\,h\rangle \Bigr| \leq \frac{M_3}6\,\bigl(\abs{h_1} + \abs{h_2}\bigr)^3 \leq \frac{\sqrt2\,M_3}3\, \norm h^3

    (estúdiese tf(w+th)t \mapsto f(w + th) en [0,1]\intcc01).

  3. (El TCL en R2\R^2) Ejecútese el esquema de sustitución sobre los híbridos vectoriales HiH_i: demuéstrese que los términos de primer y segundo orden se cancelan (medias y covarianzas coinciden), telescópese y elévese como en la pregunta 5 (tensión a partir de ETn2=trΣ\E\norm{T_n}^2 = \operatorname{tr}\Sigma; regularización ahora en R2\R^2, el Teorema 12.9) para concluir: para toda f ⁣:R2Rf \colon \R^2 \to \R continua acotada,

    Ef(X1++Xnn)Ef(N),NN(0,Σ):\E\,f\Bigl(\frac{X_1 + \dots + X_n}{\sqrt n}\Bigr) \longrightarrow \E\,f(N), \qquad N \sim \mathcal N(0, \Sigma) :

    el Teorema 23.12 en dimensión 22, con velocidad para ff regulares y sin análisis de Fourier.

  4. (Cramér–Wold y una fluctuación conjunta) Dedúzcase que t,SnnN(0,tTΣt)\langle t, \frac{S_n}{\sqrt n}\rangle \Rightarrow \mathcal N(0, t^{\mathsf T}\Sigma t) para todo tR2t \in \R^2 fijo. Aplicación: para (ξi)(\xi_i) reales i.i.d., centradas, con Eξ12=1\E\xi_1^2 = 1, Eξ16<\E\xi_1^6 < \infty (de modo que la Parte V se aplica a Vi=(ξi,ξi21)V_i = (\xi_i, \xi_i^2 - 1)), demuéstrese

    1n(inξi, in(ξi21))N(0,(1Eξ13Eξ13Eξ141)):\frac1{\sqrt n}\Bigl(\sum_{i\leq n}\xi_i,\ \sum_{i\leq n}(\xi_i^2 - 1)\Bigr) \Longrightarrow \mathcal N\Bigl(0, \begin{pmatrix} 1 & \E\xi_1^3\\ \E\xi_1^3 & \E\xi_1^4 - 1\end{pmatrix}\Bigr) :

    la media empírica y el momento empírico de segundo orden fluctúan conjuntamente de manera gaussiana — de manera independiente en el límite si y solo si Eξ13=0\E\xi_1^3 = 0 (Teorema 23.11).

Parte VI — El método delta.

  1. Sean (θ^n)(\hat\theta_n) variables aleatorias con n(θ^nθ)N(0,σ2)\sqrt n(\hat\theta_n - \theta) \Rightarrow \mathcal N(0, \sigma^2) para un parámetro real θ\theta, y sea gg derivable en θ\theta. Demuéstrese el método delta:

    n(g(θ^n)g(θ))N(0,g(θ)2σ2)\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr) \Longrightarrow \mathcal N\bigl(0, g'(\theta)^2\sigma^2\bigr)

    (escríbase g(x)g(θ)=(g(θ)+η(x))(xθ)g(x) - g(\theta) = (g'(\theta) + \eta(x))(x - \theta) con η0\eta \to 0 en θ\theta; demuéstrense θ^nθ\hat\theta_n \to \theta y después η(θ^n)0\eta(\hat\theta_n) \to 0, en probabilidad; termínese con Slutsky, el Ejercicio 23.8, y Ejercicio 23.4(b)).

  2. Aplicaciones. (a) Para (ξi)(\xi_i) reales i.i.d. de media μ\mu y varianza σ2\sigma^2, y Xˉn=1ninξi\bar X_n = \frac1n\sum_{i\leq n}\xi_i: demuéstrese n(Xˉn2μ2)N(0,4μ2σ2)\sqrt n(\bar X_n^2 - \mu^2) \Rightarrow \mathcal N(0, 4\mu^2\sigma^2) cuando μ0\mu \neq 0, y que para μ=0\mu = 0 el enunciado correcto vive en otra escala: nXˉn2σ2N2n\bar X_n^2 \Rightarrow \sigma^2N^2 con NN(0,1)N \sim \mathcal N(0,1) (identifíquese la función de distribución del límite). (b) (Estabilización de la varianza) Para p^n\hat p_n la frecuencia de éxitos de una muestra B(1,p)\mathcal B(1, p), p(0,1)p \in \intoo01: demuéstrese que g(p)=arcsinpg(p) = \arcsin\sqrt p cumple

    n(g(p^n)g(p))N(0,14)\sqrt n\,\bigl(g(\hat p_n) - g(p)\bigr) \Longrightarrow \mathcal N\Bigl(0, \frac14\Bigr)

    sea cual sea pp — una barra de error asintótica libre del parámetro desconocido; compárese con Ejemplo 23.9.

Parte VII — Poisson, por el mismo método: el teorema de Le Cam. La sustitución conoce una segunda clase de universalidad: las sumas de muchos sucesos raros independientes. Para leyes en N\N, la distancia adecuada es la variación total,

dTV(μ,ν)=supANμ(A)ν(A).d_{\mathrm{TV}}(\mu, \nu) = \sup_{A\subseteq\N}\, \abs{\mu(A) - \nu(A)} .
  1. Demuéstrese dTV(μ,ν)=12k0μ({k})ν({k})d_{\mathrm{TV}}(\mu, \nu) = \frac12\sum_{k\geq0}\abs{\mu(\{k\}) - \nu(\{k\})} y demuéstrese la cota por acoplamiento: para cualquier par (X,Y)(X, Y) de variables aleatorias de leyes μ\mu y ν\nu en el mismo espacio, dTV(μ,ν)P(XY)d_{\mathrm{TV}}(\mu, \nu) \leq \P(X \neq Y).
  2. Calcúlese exactamente, para p(0,1)p \in \intoo01:

    dTV(B(1,p),P(p))=p(1ep)p2.d_{\mathrm{TV}}\bigl(\mathcal B(1, p), \mathcal P(p)\bigr) = p\bigl(1 - \eu^{-p}\bigr) \leq p^2 .
  3. (Le Cam, por sustitución) Sean XiB(1,pi)X_i \sim \mathcal B(1, p_i) y YiP(pi)Y_i \sim \mathcal P(p_i), con las 2n2n variables independientes; S=X1++XnS = X_1 + \dots + X_n, y recuérdese Y1++YnP(λ)Y_1 + \dots + Y_n \sim \mathcal P(\lambda) con λ=ipi\lambda = \sum_ip_i (el Ejercicio 23.1). Sustitúyase una coordenada cada vez en los híbridos enteros Hi=Y1++Yi+Xi+1++XnH_i = Y_1 + \dots + Y_i + X_{i+1} + \dots + X_n: demuéstrese, para todo ANA \subseteq \N,

    P(Hi1A)P(HiA)dTV(B(1,pi),P(pi)),\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} \leq d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal P(p_i)\bigr),

    y conclúyase la desigualdad de Le Cam:

    dTV(ley de S, P(λ))i=1npi2.d_{\mathrm{TV}}\bigl(\text{ley de } S,\ \mathcal P(\lambda)\bigr) \leq \sum_{i=1}^np_i^2 .
  4. Dividendos. (a) Para pi=λnp_i = \frac\lambda n: la cota es λ2n\frac{\lambda^2}n — la ley de los sucesos raros (el Ejercicio 23.5) elevada a una velocidad explícita, uniforme sobre todos los sucesos y válida también para pip_i desiguales. (b) Se entregan 500500 cartas, cada una extraviándose independientemente con probabilidad 1500\frac1{500}: acótese el error del modelo de Poisson de parámetro 11 y estímese la probabilidad de que no se extravíe ninguna. (c) Ciérrese el problema: compárense las dos clases de universalidad encontradas aquí — la gaussiana (muchas contribuciones pequeñas y repartidas; dos momentos ajustados; Taylor) y la de Poisson (muchas contribuciones raras; una media ajustada; un acoplamiento exacto en variación total) — y el único método de sustitución que hay detrás de ambas.
  5. (Error relativo y transformación logarítmica) Sean (Xn)(X_n) i.i.d., positivas, de media μ>0\mu > 0 y varianza σ2\sigma^2, y Xˉn\bar X_n la media empírica. Demuéstrese por el método delta que

    n(lnXˉnlnμ)N(0, σ2μ2):\sqrt n\,\bigl(\ln\bar X_n - \ln\mu\bigr) \Longrightarrow \mathcal N\Bigl(0,\ \frac{\sigma^2}{\mu^2}\Bigr) :

    el parámetro asintótico de lnXˉn\ln\bar X_n es el coeficiente de variación σ/μ\sigma/\mu — error relativo, sin escala. Dedúzcase un intervalo de confianza al 95%95\% para μ\mu de forma multiplicativa Xˉne±1.96σ/(μn)\bar X_n\cdot\eu^{\pm1.96\,\sigma/(\mu\sqrt n)}, y explíquese cuándo es preferible al aditivo.

  6. (El tercer momento gobierna el error) Para XX \sim Bernoulli(pp) centrada, calcúlese E[(Xp)3]=p(1p)(12p)\E\bigl[(X - p)^3\bigr] = p(1-p)(1-2p). Usando el análisis de la Parte IV (el error de sustitución lo gobiernan los terceros momentos), explíquese por qué la aproximación normal de B(n,p)\mathcal B(n, p) es asimétrica para p12p \neq \frac12 — excediéndose por un lado y quedándose corta por el otro — y por qué p=12p = \frac12 disfruta de la velocidad más rápida de momentos ajustados. Verifíquese numéricamente el signo de la asimetría en B(20,0.1)\mathcal B(20, 0.1) frente a N(2,1.8)\mathcal N(2, 1.8): compárese P(S=0)=0.920\P(S = 0) = 0.9^{20} con la masa gaussiana de (,0.5)\intoo{-\infty}{0.5}.
Solución

Solución de Problema 23.1.

1. La familia (X1,,Xn,N1,,Nn)(X_1, \dots, X_n, N_1, \dots, N_n) es independiente: los dos bloques son independientes entre sí por construcción y cada bloque es i.i.d. WiW_i es una función medible únicamente de las variables (Xj)j<i(X_j)_{j<i} y (Nj)j>i(N_j)_{j>i}, todas distintas de XiX_i y NiN_i: por el principio de coaliciones (el Teorema 22.5), WiW_i es independiente del par (Xi,Ni)(X_i, N_i). Las descomposiciones Hi=Wi+XinH_i = W_i + \frac{X_i}{\sqrt n} y Hi1=Wi+NinH_{i-1} = W_i + \frac{N_i}{\sqrt n} son inmediatas de las definiciones: pasar de HiH_i a Hi1H_{i-1} intercambia el único sumando XiX_i por NiN_i.

2. Taylor–Lagrange de orden 33: existe cc entre ww y w+hw + h con f(w+h)=f(w)+f(w)h+12f(w)h2+16f(c)h3f(w + h) = f(w) + f'(w)h + \frac12f''(w)h^2 + \frac16f'''(c)h^3, y f(c)M3\abs{f'''(c)} \leq M_3 da la cota.

3. Restando los dos desarrollos en el punto base común w=Wiw = W_i:

f(Hi)f(Hi1)=f(Wi)XiNin+f(Wi)2Xi2Ni2n+Ri,RiM36Xi3+Ni3n3/2.f(H_i) - f(H_{i-1}) = f'(W_i)\,\frac{X_i - N_i}{\sqrt n} + \frac{f''(W_i)}{2}\,\frac{X_i^2 - N_i^2}{n} + R_i, \qquad \abs{R_i} \leq \frac{M_3}{6}\cdot \frac{\abs{X_i}^3 + \abs{N_i}^3}{n^{3/2}} .

Tómense esperanzas. Por la pregunta 1, f(Wi)f'(W_i) y f(Wi)f''(W_i) son independientes de (Xi,Ni)(X_i, N_i), de modo que las esperanzas mixtas factorizan:

E[f(Wi)XiNin]=E[f(Wi)]EXiENin=0,E[f(Wi)Xi2Ni2n]=E[f(Wi)]11n=0:\begin{align*} \E\Bigl[f'(W_i)\,\frac{X_i - N_i}{\sqrt n}\Bigr] &= \E\bigl[f'(W_i)\bigr]\,\frac{\E X_i - \E N_i}{\sqrt n} = 0, \\ \E\Bigl[f''(W_i)\,\frac{X_i^2 - N_i^2}{n}\Bigr] &= \E\bigl[f''(W_i)\bigr]\,\frac{1 - 1}{n} = 0 : \end{align*}

los dos primeros momentos de XiX_i y NiN_i coinciden, y solo sobrevive el resto:

Ef(Hi)Ef(Hi1)ERiM36β+γn3/2.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \E\abs{R_i} \leq \frac{M_3}{6}\cdot\frac{\beta + \gamma}{n^{3/2}} .

El tercer momento gaussiano: γ=EN13=20x3ex2/22π ⁣dx=22π02ueu ⁣du=42π=22π\gamma = \E\abs{N_1}^3 = 2\int_0^\infty x^3\,\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\,\dd x = \frac{2}{\sqrt{2\pi}}\int_0^\infty 2u\,\eu^{-u}\dd u = \frac{4}{\sqrt{2\pi}} = \frac{2\sqrt2}{\sqrt\pi} (sustitución u=x2/2u = x^2/2 y después Γ(2)=1\Gamma(2) = 1).

4. Telescopando Ef(Tn)Ef(Gn)=i=1n(Ef(Hi)Ef(Hi1))\E f(T_n) - \E f(G_n) = \sum_{i=1}^n\bigl(\E f(H_i) - \E f(H_{i-1})\bigr) y aplicando la pregunta 3 a cada uno de los nn términos:

Ef(Tn)Ef(Gn)nM3(β+γ)6n3/2=M3(β+γ)6n.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq n \cdot \frac{M_3(\beta + \gamma)}{6\,n^{3/2}} = \frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .

5. GnG_n es N(0,1)\mathcal N(0,1) exactamente para todo nn (una suma normalizada de gaussianas estándar independientes, el Ejercicio 23.3), de modo que Ef(Gn)=Ef(N)\E f(G_n) = \E f(N) y la pregunta 4 se lee Ef(Tn)Ef(N)M3(β+γ)6n0\abs{\E f(T_n) - \E f(N)} \leq \frac{M_3(\beta+\gamma)}{6\sqrt n} \to 0 para fCb3f \in \mathcal C^3_b. Elevación. Sea ff continua acotada, M=supfM = \sup\abs f, ε>0\varepsilon > 0. Elíjase A1A \geq 1 con 1A2ε\frac1{A^2} \leq \varepsilon: Chebyshev con V(Tn)=1\V(T_n) = 1 da P(Tn>A)ε\P(\abs{T_n} > A) \leq \varepsilon para todo nn, y análogamente P(N>A)ε\P(\abs N > A) \leq \varepsilon. Sea χ\chi de clase C\mathcal C^\infty con 1[A,A]χ1[A1,A+1]\mathbf 1_{\intcc{-A}A} \leq \chi \leq \mathbf 1_{\intcc{-A-1}{A+1}} (una meseta regular, construida regularizando 1[A12,A+12]\mathbf 1_{\intcc{-A-\frac12}{A+\frac12}}, el Teorema 12.9); g=fχg = f\chi es continua de soporte compacto, luego uniformemente continua, de modo que su regularizada gη=gρηg_\eta = g * \rho_\eta es C\mathcal C^\infty con derivadas acotadas de todos los órdenes y ggηε\norm{g - g_\eta}_\infty \leq \varepsilon para η\eta suficientemente pequeño. Para T=TnT = T_n o NN, puesto que f=gf = g en [A,A]\intcc{-A}A y fg2M\abs{f - g} \leq 2M en todas partes:

Ef(T)Egη(T)E(fg)(T)+ggη2MP(T>A)+ε(2M+1)ε.\bigl|\E f(T) - \E g_\eta(T)\bigr| \leq \E\abs{(f - g)(T)} + \norm{g - g_\eta}_\infty \leq 2M\,\P(\abs T > A) + \varepsilon \leq (2M + 1)\,\varepsilon .

Combinando con Egη(Tn)Egη(N)\E g_\eta(T_n) \to \E g_\eta(N) (la pregunta 4 se aplica: gηCb3g_\eta \in \mathcal C^3_b):

lim supn  Ef(Tn)Ef(N)2(2M+1)ε,\limsup_n\;\bigl|\E f(T_n) - \E f(N)\bigr| \leq 2(2M + 1)\,\varepsilon ,

y ε\varepsilon era arbitrario: Ef(Tn)Ef(N)\E f(T_n) \to \E f(N) para toda ff continua acotada, es decir, TnN(0,1)T_n \Rightarrow \mathcal N(0,1).

6. La idéntica distribución entró solo a través de una frase: «XiX_i y NiN_i tienen los mismos dos primeros momentos». Sean, pues, X1,,XnX_1, \dots, X_n independientes, centradas, de varianzas σi2\sigma_i^2 y terceros momentos finitos, sn2=iσi2>0s_n^2 = \sum_i\sigma_i^2 > 0, y tómense NiN(0,σi2)N_i \sim \mathcal N(0, \sigma_i^2) independientes de todo lo demás. Defínanse los híbridos con normalización sns_n: Hi=1sn(jiXj+j>iNj)H_i = \frac1{s_n}(\sum_{j\leq i}X_j + \sum_{j>i}N_j). En la ii-ésima sustitución, EXi=ENi=0\E X_i = \E N_i = 0 y EXi2=ENi2=σi2\E X_i^2 = \E N_i^2 = \sigma_i^2 vuelven a matar los términos de orden ff' y ff'', y el resto da (usando ENi3=σi3γ\E\abs{N_i}^3 = \sigma_i^3\gamma por reescalado):

Ef(Hi)Ef(Hi1)M36sn3(EXi3+σi3γ).\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{M_3}{6\,s_n^3}\bigl(\E\abs{X_i}^3 + \sigma_i^3\gamma\bigr) .

Telescopando:

Ef(X1++Xnsn)Ef(N)M36sn3i=1n(EXi3+V(Xi)3/2γ).\Bigl|\E f\Bigl(\frac{X_1 + \dots + X_n}{s_n}\Bigr) - \E f(N)\Bigr| \leq \frac{M_3}{6\,s_n^3}\sum_{i=1}^n \Bigl(\E\abs{X_i}^3 + \V(X_i)^{3/2}\,\gamma\Bigr) .

Como σi3=(EXi2)3/2EXi3\sigma_i^3 = (\E X_i^2)^{3/2} \leq \E\abs{X_i}^3 (la desigualdad de las medias de potencias, es decir, Jensen para tt3/2t \mapsto t^{3/2} aplicado a Xi2X_i^2), el miembro derecho es a lo sumo M3(1+γ)6iEXi3sn3\frac{M_3(1 + \gamma)}{6}\cdot \frac{\sum_i\E\abs{X_i}^3}{s_n^3}: bajo la condición de Lyapunov 1sn3iEXi30\frac1{s_n^3}\sum_i\E\abs{X_i}^3 \to 0, las sumas normalizadas convergen en ley a N(0,1)\mathcal N(0,1) — el TCL sin idéntica distribución.

7. Sea ρCc((0,1))\rho \in \mathcal C^\infty_c(\intoo01) con ρ=1\int\rho = 1 y póngase ψ(x)=x1ρ(s) ⁣ds\psi(x) = \int_x^1\rho(s)\dd s: ψ\psi es C\mathcal C^\infty, no creciente, ψ=1\psi = 1 en R\R_-, ψ=0\psi = 0 en [1,)\intco1\infty; sea K=ψK = \norm{\psi'''}_\infty. Para tRt \in \R y δ>0\delta > 0, defínanse ψδ(x)=ψ(xtδ)\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta\bigr) y ψ~δ(x)=ψ(xtδ+1)\tilde\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta + 1\bigr): son Cb3\mathcal C^3_b con tercera derivada acotada por K/δ3K/\delta^3, y

1(,tδ]ψ~δ1(,t]ψδ1(,t+δ].\mathbf 1_{\intoc{-\infty}{t-\delta}} \leq \tilde\psi_\delta \leq \mathbf 1_{\intoc{-\infty}t} \leq \psi_\delta \leq \mathbf 1_{\intoc{-\infty}{t+\delta}} .

Cota superior: por la pregunta 4 aplicada a ψδ\psi_\delta (con M3=K/δ3M_3 = K/\delta^3),

P(Tnt)Eψδ(Tn)Eψδ(N)+K(β+γ)6δ3nΦ(t+δ)+K(β+γ)6δ3nΦ(t)+δ2π+K(β+γ)6δ3n,\P(T_n \leq t) \leq \E\psi_\delta(T_n) \leq \E\psi_\delta(N) + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n} \leq \Phi(t + \delta) + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n} \leq \Phi(t) + \frac{\delta}{\sqrt{2\pi}} + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n},

porque Φ\Phi es lipschitziana de constante 12π\frac1{\sqrt{2\pi}} (su densidad está acotada por 12π\frac1{\sqrt{2\pi}}). La cota inferior simétrica vía ψ~δ\tilde\psi_\delta da la estimación de dos términos

suptRP(Tnt)Φ(t)K(β+γ)61δ3n+δ2π(δ>0 arbitrario).\sup_{t\in\R}\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq \frac{K(\beta + \gamma)}{6}\cdot\frac{1}{\delta^3\sqrt n} + \frac{\delta}{\sqrt{2\pi}} \qquad(\delta > 0\ \text{arbitrario}).

Los dos términos se equilibran cuando δ3n1/2δ\delta^{-3}n^{-1/2} \asymp \delta, es decir, δ=n1/8\delta = n^{-1/8}: ambos valen entonces O(n1/8)O(n^{-1/8}), una velocidad uniforme explícita válida para todo nn. (La velocidad óptima de Berry–Esseen Cβ/nC\beta/\sqrt n exige la desigualdad de regularización de Fourier; la sustitución cambia agudeza por elementalidad completa.)

8. Para Xi=2Bi1X_i = 2B_i - 1 (signos equilibrados): centrada, varianza 11, y Xi=1\abs{X_i} = 1, de modo que β=1\beta = 1. La pregunta 7 acota entonces suptP(Snnt)Φ(t)\sup_t\abs{\P(\frac{S_n}{\sqrt n} \leq t) - \Phi(t)} de manera explícita y uniforme para todo nn finito — un enunciado global y no asintótico sobre la función de distribución. La estimación local del Problema 11.1, pregunta 7, da en cambio la asintótica exacta de un átomo individual, P(S2n=2k)ek2/nπn\P(S_{2n} = 2k) \sim \frac{\eu^{-k^2/n}}{\sqrt{\pi n}}: resuelve probabilidades de tamaño n1/2n^{-1/2}, muy por debajo de la resolución n1/8n^{-1/8} de la pregunta 7, pero es puntual, asintótica (sin error explícito a nn fijo) y está atada a esta ley reticular concreta. Precisión local frente a uniformidad global: los dos métodos son complementarios, y sumar la estimación local en k[ ⁣[an,bn] ⁣]k \in \intint{a\sqrt n}{b\sqrt n} recupera De Moivre–Laplace en intervalos — con velocidad más fina, pero solo para esta ley.

9. El argumento de sustitución no usó nada de la ley de las XiX_i más allá de EXi=0\E X_i = 0, EXi2=1\E X_i^2 = 1 y la finitud de EXi3\E\abs{X_i}^3: si hubiéramos sustituido las gaussianas NiN_i por cualquier otra familia i.i.d. con los mismos dos primeros momentos y tercer momento finito, el mismo telescopaje acotaría Ef(sumaX)Ef(sumaY)\abs{\E f(\text{suma}_X) - \E f(\text{suma}_Y)} por O(n1/2)O(n^{-1/2}) para toda ff regular. Los estadísticos regulares de grandes sumas independientes son, por tanto, universales: salvo un error cuantificado, dependen de la ley de los sumandos solo a través de dos números. Este es el principio de invariancia: demuéstrese un teorema límite para la ley más calculable (la gaussiana, donde todo es exacto) y transfiérase después a todas las leyes por sustitución. El mismo esquema — con sumas reemplazadas por funcionales más elaborados — gobierna la ley del semicírculo de Wigner para matrices aleatorias, la universalidad de las raíces de polinomios aleatorios y buena parte de la probabilidad moderna; el teorema central del límite es su primera y más sencilla instancia.

10. ZZ es una función boreliana solo de (Ni+1,,Nn)(N_{i+1}, \dots, N_n), mientras que A=Wi+θhZA = W_i + \theta h - Z y hh son funciones de las variables restantes de la familia independiente (X1,,Xn,N1,,Nn)(X_1, \dots, X_n, N_1, \dots, N_n): por el principio de coaliciones (el Teorema 22.5), ZZ es independiente de (A,h)(A, h). Como suma de las independientes Nj/nN(0,1n)N_j/\sqrt n \sim \mathcal N(0, \frac1n), ZN(0,s2)Z \sim \mathcal N(0, s^2) con s2=nins^2 = \frac{n-i}n (el Ejercicio 23.3), de densidad acotada por 1s2π\frac1{s\sqrt{2\pi}}. La ley de ((A,h),Z)((A, h), Z) es el producto de las dos leyes marginales, de modo que Tonelli (transferencia) congela el primer bloque: con G(a)=Eg(a+Z)=g(a+z)φs(z) ⁣dzgL1s2πG(a) = \E\abs{g(a + Z)} = \int\abs{g(a + z)}\,\varphi_s(z)\,\dd z \leq \frac{\norm g_{L^1}}{s\sqrt{2\pi}} para todo aa,

E[h3g(A+Z)]=E[h3G(A)]gL1s2πEh3=n2π(ni)gL1Eh3.\E\bigl[\abs h^3\abs{g(A + Z)}\bigr] = \E\bigl[\abs h^3\,G(A)\bigr] \leq \frac{\norm g_{L^1}}{s\sqrt{2\pi}}\,\E\abs h^3 = \sqrt{\frac{n}{2\pi(n-i)}}\,\norm g_{L^1}\,\E\abs h^3 .

11. La forma integral de la fórmula de Taylor se sigue integrando f(w+h)f(w)=h01f(w+θh) ⁣dθf(w + h) - f(w) = h\int_0^1f'(w + \theta h)\,\dd\theta por partes dos veces en θ\theta. Tomando esperanzas en la ii-ésima sustitución, los órdenes 0,1,20, 1, 2 se cancelan exactamente como en la pregunta 3, y los dos restos (para h=Xi/nh = X_i/\sqrt n y Ni/nN_i/\sqrt n) se acotan, para in1i \leq n - 1, por la pregunta 10 con g=fg = f''':

Ef(Hi)Ef(Hi1)01(1θ)22 ⁣dθ  n2π(ni)fL1β+γn3/2=β+γ6n3/2n2π(ni)fL1.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \int_0^1\frac{(1-\theta)^2}2\,\dd\theta\; \sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1} \frac{\beta + \gamma}{n^{3/2}} = \frac{\beta + \gamma}{6\,n^{3/2}} \sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1} .

Sumando, con i=1n1nni=nm=1n1m1/22n\sum_{i=1}^{n-1}\sqrt{\frac n{n-i}} = \sqrt n\sum_{m=1}^{n-1}m^{-1/2} \leq 2n, y añadiendo la cota de la pregunta 3 para la última sustitución (i=ni = n, sin gaussiana restante):

Ef(Tn)Ef(Gn)β+γ32πfL1n+M3(β+γ)6n3/2.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot \frac{\norm{f'''}_{L^1}}{\sqrt n} + \frac{M_3(\beta + \gamma)}{6\,n^{3/2}} .

Rampas: ψδ(x)=δ3ψ(xtδ)\psi_\delta'''(x) = \delta^{-3}\psi'''\bigl(\frac{x - t}\delta\bigr), de modo que M3=Kδ3M_3 = K\delta^{-3} con K=ψK = \norm{\psi'''}_\infty y ψδL1=δ2ψL1=K1δ2\norm{\psi_\delta'''}_{L^1} = \delta^{-2} \norm{\psi'''}_{L^1} = K_1\delta^{-2} (sustitución). El sándwich de la pregunta 7 da entonces

suptP(Tnt)Φ(t)K1(β+γ)32π1δ2n+K(β+γ)61δ3n3/2+δ2π.\sup_t\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq \frac{K_1(\beta + \gamma)}{3\sqrt{2\pi}}\cdot \frac1{\delta^2\sqrt n} + \frac{K(\beta + \gamma)}{6}\cdot \frac1{\delta^3n^{3/2}} + \frac\delta{\sqrt{2\pi}} .

En δ=n1/6\delta = n^{-1/6}, el primer y el tercer término valen O(n1/6)O(n^{-1/6}) y el central O(n1)O(n^{-1}): una velocidad uniforme O(n1/6)O(n^{-1/6}), estrictamente mejor que el n1/8n^{-1/8} de la pregunta 7 — la mitad gaussiana del híbrido hizo la regularización adicional.

12. EN13=0\E N_1^3 = 0 (integrando impar), y la integración por partes da EN14=3EN12=3\E N_1^4 = 3\,\E N_1^2 = 3 (x3xφ(x) ⁣dx=3x2φ\int x^3\cdot x\varphi(x)\dd x = 3\int x^2\varphi). Para ff de clase C4\mathcal C^4 con derivadas acotadas, desarróllese cada sustitución hasta el cuarto orden: los términos de tercer orden llevan el factor EXi3ENi3=0\E X_i^3 - \E N_i^3 = 0 (la independencia los factoriza como en la pregunta 3), de modo que solo sobrevive el resto de cuarto orden 01(1θ)36f(4)(w+θh)h4 ⁣dθ\int_0^1\frac{(1-\theta)^3}6f^{(4)}(w + \theta h)h^4\dd\theta, con 01(1θ)36 ⁣dθ=124\int_0^1 \frac{(1-\theta)^3}6\dd\theta = \frac1{24} y Eh4=β4n2\E h^4 = \beta_4n^{-2} o 3n23n^{-2}. La pregunta 10 (con g=f(4)g = f^{(4)}) acota las sustituciones in1i \leq n - 1, y sumando como en la pregunta 11:

Ef(Tn)Ef(Gn)β4+3122πf(4)L1n+M4(β4+3)24n2.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta_4 + 3}{12\sqrt{2\pi}}\cdot \frac{\norm{f^{(4)}}_{L^1}}{n} + \frac{M_4(\beta_4 + 3)}{24\,n^2} .

Con ψδ(4)L1=K2δ3\norm{\psi_\delta^{(4)}}_{L^1} = K_2\delta^{-3} y M4=Kδ4M_4 = K'\delta^{-4}, la cota para funciones de distribución pasa a ser Cδ3n1+Cδ4n2+δ2πC\delta^{-3}n^{-1} + C'\delta^{-4}n^{-2} + \frac\delta{\sqrt{2\pi}}; en δ=n1/4\delta = n^{-1/4}, los términos extremos valen O(n1/4)O(n^{-1/4}) y el central O(n1)O(n^{-1}): velocidad O(n1/4)O(n^{-1/4}).

13. Con kk momentos ajustados, el resto que sobrevive por sustitución es de orden Ehk+1n(k+1)/2\E\abs h^{k+1} \asymp n^{-(k+1)/2}; la cota de gaussiana escondida carga f(k+1)L1\norm{f^{(k+1)}}_{L^1} y la suma sobre las sustituciones aporta el factor 2n2n, dando f(k+1)L1n(k1)/2\asymp\norm{f^{(k+1)}}_{L^1}\, n^{-(k-1)/2} para ff regulares. Las rampas cuestan ψδ(k+1)L1δk\norm{\psi_\delta^{(k+1)}}_{L^1} \asymp \delta^{-k}, de modo que el error para funciones de distribución es δkn(k1)/2+δ\asymp \delta^{-k}n^{-(k-1)/2} + \delta, equilibrado en δ=n(k1)/(2k+2)\delta = n^{-(k-1)/(2k+2)}: velocidad n(k1)/(2k+2)n^{-(k-1)/(2k+2)}, que vale n1/6n^{-1/6} para k=2k = 2, n1/4n^{-1/4} para k=3k = 3, y tiende a n1/2n^{-1/2} solo cuando kk \to \infty — pero k4k \geq 4 forzaría EX14=3\E X_1^4 = 3 y más allá, es decir, una ley que ya imita a la gaussiana. La saturación es estructural: la sustitución suma nn errores de sustitución en valor absoluto, renunciando a toda cancelación entre ellos. La demostración de Fourier compara funciones características, donde los errores aparecen con sus fases oscilantes; la desigualdad de regularización de Esseen convierte φTnφN\abs{\varphi_{T_n} - \varphi_N}, integrada contra  ⁣dξξ\frac{\dd\xi}{\abs\xi}, en una cota para funciones de distribución con un coste solo logarítmico, y entrega el Cβn1/2C\beta n^{-1/2} de Berry–Esseen con solo tres momentos. La sustitución cambia optimalidad por robustez — y, como muestra la Parte VII, por portabilidad.

14. Σ\Sigma es simétrica semidefinida positiva; con Σ=PDPT\Sigma = PDP^{\mathsf T} (PP ortogonal, D0D \geq 0 diagonal, el Ejercicio 20.8), la simétrica C=PDPTC = P\sqrt DP^{\mathsf T} cumple C2=ΣC^2 = \Sigma. Para todo tR2t \in \R^2, t,CZ=Ct,Z=(Ct)1Z1+(Ct)2Z2\langle t, CZ\rangle = \langle Ct, Z\rangle = (Ct)_1Z^1 + (Ct)_2Z^2 es una combinación lineal de gaussianas independientes, luego gaussiana (el Ejercicio 23.3): N=CZN = CZ es un vector gaussiano; su media es 00 y su covarianza E[NNT]=CE[ZZT]CT=CCT=Σ\E[NN^{\mathsf T}] = C\,\E[ZZ^{\mathsf T}]\,C^{\mathsf T} = CC^{\mathsf T} = \Sigma. Momentos: N3(N1+N2)34(N13+N23)\norm N^3 \leq (\abs{N_1} + \abs{N_2})^3 \leq 4(\abs{N_1}^3 + \abs{N_2}^3) (convexidad de x3x^3 en R+\R_+), y cada coordenada es una gaussiana real con momentos de todos los órdenes (el Ejercicio 11.10): γ<\gamma' < \infty. Por último, cada t,Gn=1nit,Ni\langle t, G_n\rangle = \frac1{\sqrt n}\sum_i\langle t, N_i\rangle es una suma normalizada de N(0,tTΣt)\mathcal N(0, t^{\mathsf T}\Sigma t) i.i.d., luego exactamente N(0,tTΣt)\mathcal N(0, t^{\mathsf T}\Sigma t): GnG_n es un vector gaussiano de media 00 y covarianza Σ\Sigma, y su ley es N(0,Σ)\mathcal N(0, \Sigma) (la Definición 23.10: la ley queda determinada por estos datos).

15. Sean ϕ(t)=f(w+th)\phi(t) = f(w + th), t[0,1]t \in \intcc01: ϕ\phi es C3\mathcal C^3 con

ϕ(t)=j,k,l{1,2}jklf(w+th)hjhkhl,ϕ(t)M3(jhj)3=M3(h1+h2)3.\phi'''(t) = \sum_{j,k,l\in\{1,2\}}\partial_{jkl}f(w + th)\,h_jh_kh_l, \qquad \abs{\phi'''(t)} \leq M_3\Bigl(\sum_j\abs{h_j}\Bigr)^3 = M_3(\abs{h_1} + \abs{h_2})^3 .

Taylor–Lagrange de orden 33 para cierto ϕ\phi entre 00 y 11 da la primera desigualdad; Cauchy–Schwarz da h1+h22h\abs{h_1} + \abs{h_2} \leq \sqrt2\norm h, de donde la constante 22M36=2M33\frac{2\sqrt2M_3}6 = \frac{\sqrt2M_3}3.

16. Defínanse HiH_i y WiW_i como en la pregunta 1, ahora en R2\R^2; el argumento de coaliciones no cambia. En la ii-ésima sustitución, los términos de primer orden dan jE[jf(Wi)](EXi,jENi,j)/n=0\sum_j\E[\partial_jf(W_i)]\,(\E X_{i,j} - \E N_{i,j})/ \sqrt n = 0 y los de segundo orden dan 12nj,kE[jkf(Wi)](ΣjkΣjk)=0\frac1{2n}\sum_{j,k}\E[\partial_{jk}f(W_i)]\,(\Sigma_{jk} - \Sigma_{jk}) = 0: medias y covarianzas coinciden. La pregunta 15 acota los dos restos:

Ef(Hi)Ef(Hi1)2M33EXi3+ENi3n3/2=2M3(β+γ)3n3/2,\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{\sqrt2M_3}3\cdot\frac{\E\norm{X_i}^3 + \E\norm{N_i}^3}{n^{3/2}} = \frac{\sqrt2M_3(\beta' + \gamma')}{3\,n^{3/2}},

y telescopando sobre las nn sustituciones:

Ef(Snn)Ef(Gn)2M3(β+γ)3n,GnN(0,Σ) exactamente.\Bigl|\E f\Bigl(\frac{S_n}{\sqrt n}\Bigr) - \E f(G_n)\Bigr| \leq \frac{\sqrt2\,M_3(\beta' + \gamma')}{3\sqrt n}, \qquad G_n \sim \mathcal N(0, \Sigma)\ \text{exactamente} .

Elevación: ETn2=EX12=trΣ\E\norm{T_n}^2 = \E\norm{X_1}^2 = \operatorname{tr}\Sigma (los términos cruzados se anulan por independencia y centrado), de modo que P(Tn>A)trΣ/A2\P(\norm{T_n} > A) \leq \operatorname{tr}\Sigma/A^2, y análogamente para NN: tensión. Dada una ff continua acotada y ε>0\varepsilon > 0, multiplíquese por una meseta regular χ\chi igual a 11 en la bola de radio AA y soportada en radio A+1A + 1 (regularícese un indicador en R2\R^2, el Teorema 12.9); g=fχg = f\chi es uniformemente continua de soporte compacto, de modo que su regularización bidimensional gηg_\eta es C\mathcal C^\infty con derivadas acotadas de todos los órdenes y ggηε\norm{g - g_\eta}_\infty \leq \varepsilon para η\eta pequeño. La cadena de tres ε\varepsilon de la pregunta 5 se transfiere entonces palabra por palabra: Ef(Tn)Ef(N)\E f(T_n) \to \E f(N) para toda f ⁣:R2Rf \colon \R^2 \to \R continua acotada. Este es el Teorema 23.12 para d=2d = 2, ahora demostrado — la sustitución esquiva el teorema de Lévy bidimensional que el capítulo había dejado admitido.

17. Para g ⁣:RRg \colon \R \to \R continua acotada, la aplicación xg(t,x)x \mapsto g(\langle t, x\rangle) es continua y acotada en R2\R^2, de modo que la pregunta 16 da Eg(t,Tn)Eg(t,N)\E g(\langle t, T_n\rangle) \to \E g(\langle t, N\rangle): toda proyección converge en distribución, y t,NN(0,tTΣt)\langle t, N\rangle \sim \mathcal N(0, t^{\mathsf T}\Sigma t). (Esta es la dirección fácil de Cramér–Wold: la convergencia conjunta implica la de todas las imágenes lineales.) Aplicación: Vi=(ξi,ξi21)V_i = (\xi_i, \xi_i^2 - 1) son vectores i.i.d. centrados (Eξ12=1\E\xi_1^2 = 1), con entradas de covarianza V(ξ1)=1\V(\xi_1) = 1, Cov(ξ1,ξ121)=Eξ13\operatorname{Cov}(\xi_1, \xi_1^2 - 1) = \E\xi_1^3 y V(ξ121)=Eξ141\V(\xi_1^2 - 1) = \E\xi_1^4 - 1; el tercer momento EV134(Eξ13+Eξ1213)\E\norm{V_1}^3 \leq 4\bigl(\E\abs{\xi_1}^3 + \E\abs{\xi_1^2 - 1}^3\bigr) es finito cuando ξ1L6\xi_1 \in L^6. La pregunta 16 produce el límite gaussiano conjunto exhibido, y el Teorema 23.11(2): las dos coordenadas del límite son independientes exactamente cuando la covarianza Eξ13\E\xi_1^3 se anula — para leyes simétricas, la media empírica y la varianza empírica se desacoplan asintóticamente.

18. Escríbase g(x)g(θ)=(g(θ)+η(x))(xθ)g(x) - g(\theta) = (g'(\theta) + \eta(x))(x - \theta), donde η(x)=g(x)g(θ)xθg(θ)\eta(x) = \frac{g(x) - g(\theta)}{x - \theta} - g'(\theta) para xθx \neq \theta y η(θ)=0\eta(\theta) = 0: la derivabilidad en θ\theta significa precisamente η(x)0\eta(x) \to 0 cuando xθx \to \theta. Paso 1: θ^nθ\hat\theta_n \to \theta en probabilidad: para ε>0\varepsilon > 0 y cualquier A>0A > 0, a partir de cierto índice εnA\varepsilon\sqrt n \geq A, de modo que P(θ^nθ>ε)P(n(θ^nθ)>A)P(σN>A)\P(\abs{\hat\theta_n - \theta} > \varepsilon) \leq \P(\abs{\sqrt n(\hat\theta_n - \theta)} > A) \to \P(\sigma\abs N > A) (las funciones de distribución convergen en los puntos de continuidad ±A\pm A), y el miembro derecho tiende a 00 cuando AA \to \infty. Paso 2: η(θ^n)0\eta(\hat\theta_n) \to 0 en probabilidad: dado ε>0\varepsilon' > 0, tómese δ\delta con ηε\abs\eta \leq \varepsilon' en xθδ\abs{x - \theta} \leq \delta; entonces P(η(θ^n)>ε)P(θ^nθ>δ)0\P(\abs{\eta(\hat\theta_n)} > \varepsilon') \leq \P(\abs{\hat\theta_n - \theta} > \delta) \to 0. Paso 3:

n(g(θ^n)g(θ))=g(θ)n(θ^nθ)+η(θ^n)n(θ^nθ).\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr) = g'(\theta)\,\sqrt n(\hat\theta_n - \theta) + \eta(\hat\theta_n)\cdot\sqrt n(\hat\theta_n - \theta) .

Por la regla del producto de Slutsky (el Ejercicio 23.8, con la sucesión η(θ^n)0\eta(\hat\theta_n) \to 0 en probabilidad y la convergente en ley n(θ^nθ)\sqrt n(\hat\theta_n - \theta)), el segundo término converge en ley a 0N(0,σ2)=00\cdot\mathcal N(0, \sigma^2) = 0, luego a 00 en probabilidad (el Ejercicio 23.4(b)); el primero converge en ley a g(θ)N(0,σ2)g'(\theta)\mathcal N(0, \sigma^2) (Slutsky de nuevo, o la regla afín para funciones características); la regla de la suma de Slutsky los ensambla: el límite es N(0,g(θ)2σ2)\mathcal N(0, g'(\theta)^2\sigma^2).

19. (a) El TCL da n(Xˉnμ)N(0,σ2)\sqrt n(\bar X_n - \mu) \Rightarrow \mathcal N(0, \sigma^2); el método delta con g(x)=x2g(x) = x^2, g(μ)=2μg'(\mu) = 2\mu, da n(Xˉn2μ2)N(0,4μ2σ2)\sqrt n(\bar X_n^2 - \mu^2) \Rightarrow \mathcal N(0, 4\mu^2\sigma^2) — degenerado (límite 00) cuando μ=0\mu = 0. En ese caso la fluctuación vive una escala más arriba: nXˉn2=(nXˉn)2n\bar X_n^2 = (\sqrt n\,\bar X_n)^2, y para t>0t > 0

P(nXˉn2t)=P(tnXˉnt)Φ(tσ)Φ(tσ)=P(σ2N2t):\P\bigl(n\bar X_n^2 \leq t\bigr) = \P\bigl(-\sqrt t \leq \sqrt n\,\bar X_n \leq \sqrt t\bigr) \longrightarrow \Phi\Bigl(\frac{\sqrt t}\sigma\Bigr) - \Phi\Bigl(-\frac{\sqrt t}\sigma\Bigr) = \P(\sigma^2N^2 \leq t) :

nXˉn2σ2N2n\bar X_n^2 \Rightarrow \sigma^2N^2, el cuadrado de una gaussiana (una ley «ji cuadrado») — cuando la primera derivada muere, el término de segundo orden de Taylor dicta un límite no gaussiano. (b) Aquí n(p^np)N(0,p(1p))\sqrt n(\hat p_n - p) \Rightarrow \mathcal N(0, p(1 - p)) y g(p)=arcsinpg(p) = \arcsin\sqrt p tiene g(p)=12p(1p)g'(p) = \frac1{2\sqrt{p(1 - p)}}, de modo que g(p)2p(1p)=14g'(p)^2\,p(1 - p) = \frac14: el límite es N(0,14)\mathcal N(0, \frac14) para todo p(0,1)p \in \intoo01. En la escala arcsin\arcsin, la barra de error asintótica al 95%95\% vale ±0.98n\pm \frac{0.98}{\sqrt n}, conocida de antemano — mientras que en el Ejemplo 23.9 la anchura involucraba el σ=p(1p)\sigma = \sqrt{p(1-p)} desconocido, que había que acotar por el peor caso 12\frac12 o estimar: la transformación estabiliza la varianza.

20. Sean A={k:μ({k})>ν({k})}A^* = \{k : \mu(\{k\}) > \nu(\{k\})\} y Δk=μ({k})ν({k})\Delta_k = \mu(\{k\}) - \nu(\{k\}), de modo que kΔk=0\sum_k\Delta_k = 0. Para todo ANA \subseteq \N: μ(A)ν(A)=kAΔkkAΔk\mu(A) - \nu(A) = \sum_{k\in A}\Delta_k \leq \sum_{k\in A^*}\Delta_k, con igualdad en A=AA = A^*; y como las partes positiva y negativa de (Δk)(\Delta_k) tienen la misma masa total, AΔk=12kΔk\sum_{A^*}\Delta_k = \frac12\sum_k\abs{\Delta_k}. Intercambiar μ,ν\mu, \nu se ocupa del signo: dTV(μ,ν)=12kΔkd_{\mathrm{TV}}(\mu, \nu) = \frac12\sum_k\abs{\Delta_k}. Acoplamiento: para todo AA,

μ(A)ν(A)=E[1A(X)1A(Y)]=E[(1A(X)1A(Y))1XY]P(XY),\mu(A) - \nu(A) = \E\bigl[\mathbf 1_A(X) - \mathbf 1_A(Y)\bigr] = \E\bigl[(\mathbf 1_A(X) - \mathbf 1_A(Y))\,\mathbf 1_{X\neq Y}\bigr] \leq \P(X \neq Y),

y tómese el supremo en AA.

21. Las dos leyes cargan: k=0k = 0: 1p1 - p frente a ep\eu^{-p}, con ep>1p\eu^{-p} > 1 - p; k=1k = 1: pp frente a pep<pp\,\eu^{-p} < p; k2k \geq 2: 00 frente al resto de Poisson 1eppep01 - \eu^{-p} - p\eu^{-p} \geq 0. Por tanto,

dTV=12[(ep1+p)+(ppep)+(1eppep)]=12(2p2pep)=p(1ep),d_{\mathrm{TV}} = \tfrac12\bigl[(\eu^{-p} - 1 + p) + (p - p\eu^{-p}) + (1 - \eu^{-p} - p\eu^{-p})\bigr] = \tfrac12\bigl(2p - 2p\eu^{-p}\bigr) = p(1 - \eu^{-p}),

y 1epp1 - \eu^{-p} \leq p da la cota p2p^2.

22. Escríbanse Hi1=Wi+XiH_{i-1} = W_i + X_i y Hi=Wi+YiH_i = W_i + Y_i con Wi=j<iYj+j>iXjW_i = \sum_{j<i}Y_j + \sum_{j>i}X_j, independiente del par (Xi,Yi)(X_i, Y_i) (coaliciones). Para ANA \subseteq \N, condicionando a los valores, en cantidad numerable, por independencia,

P(Hi1A)=k0P(Xi=k)P(Wi+kA),\P(H_{i-1} \in A) = \sum_{k\geq0}\P(X_i = k)\,\P(W_i + k \in A),

y análogamente para HiH_i con YiY_i. Restando, con ck=P(Wi+kA)[0,1]c_k = \P(W_i + k \in A) \in \intcc01 y Δk=P(Xi=k)P(Yi=k)\Delta_k = \P(X_i = k) - \P(Y_i = k) de suma nula:

P(Hi1A)P(HiA)=kΔk(ck12)12kΔk=dTV(B(1,pi),P(pi)).\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} = \Bigl|\sum_k\Delta_k\bigl(c_k - \tfrac12\bigr)\Bigr| \leq \tfrac12\sum_k\abs{\Delta_k} = d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal P(p_i)\bigr) .

Telescopando de H0=SH_0 = S a Hn=iYiP(λ)H_n = \sum_iY_i \sim \mathcal P(\lambda) (el Ejercicio 23.1, iterado) y usando la pregunta 21:

P(SA)P(P(λ)A)i=1npi(1epi)i=1npi2para todo A:\abs{\P(S \in A) - \P(\mathcal P(\lambda) \in A)} \leq \sum_{i=1}^np_i\bigl(1 - \eu^{-p_i}\bigr) \leq \sum_{i=1}^np_i^2 \qquad\text{para todo } A :

la desigualdad de Le Cam. (La cota por acoplamiento de la pregunta 20 da una vía alternativa: acóplese cada par sobre una variable uniforme de modo que P(XiYi)pi2\P(X_i \neq Y_i) \leq p_i^2 y acótese P(SYi)\P(S \neq \sum Y_i); la sustitución no necesita construcción alguna.)

23. (a) Con pi=λnp_i = \frac\lambda n: dTV(ley de S,P(λ))λ2nd_{\mathrm{TV}}(\text{ley de }S, \mathcal P(\lambda)) \leq \frac{\lambda^2}n. Esto afina el Ejercicio 23.5 por triplicado: un error explícito en cada nn finito, uniformidad sobre todos los sucesos AA a la vez (no un intervalo cada vez) y ninguna necesidad de que los pip_i sean iguales — solo que ipi2\sum_ip_i^2 sea pequeño, por ejemplo pi2λmaxipi\sum p_i^2 \leq \lambda\max_ip_i: muchos sucesos raros, ninguno dominante. (b) Aquí n=500n = 500, pi=1500p_i = \frac1{500}, λ=1\lambda = 1: el modelo de Poisson yerra a lo sumo en 50015002=0.002500\cdot\frac1{500^2} = 0.002 en todo suceso; en particular, tomando A={0}A = \{0\},

P(ninguna carta extraviada)=(11500)500,P(ninguna carta extraviada)e10.002,\P(\text{ninguna carta extraviada}) = \Bigl(1 - \frac1{500}\Bigr)^{500}, \qquad \Bigl|\P(\text{ninguna carta extraviada}) - \eu^{-1}\Bigr| \leq 0.002,

de modo que la respuesta es e10.368\eu^{-1} \approx 0.368 con un 0.0020.002 garantizado (la discrepancia verdadera es de unos 41044\cdot10^{-4}). (c) El problema se cierra con un método y dos regímenes. Cuando nn contribuciones comparables llevan cada una varianza 1n\frac1n, ajustar dos momentos frente a la gaussiana hace que los errores de sustitución valgan o(1n)o(\frac1n) cada uno: las sumas se vuelven gaussianas — con Taylor como herramienta de comparación local. Cuando nn contribuciones son indicadores de probabilidad pip_i, ajustar la media frente a un átomo de Poisson hace que cada sustitución cueste pi2p_i^2: los recuentos de sucesos raros se vuelven de Poisson — con la variación total como comparación local exacta. Los mismos híbridos, el mismo telescopio, distinta estimación local: la sustitución es una estrategia, no un teorema, y los límites gaussiano y de Poisson son sus dos dividendos más antiguos.

24. El TCL da n(Xˉnμ)N(0,σ2)\sqrt n(\bar X_n - \mu) \Rightarrow \mathcal N(0, \sigma^2), y g(x)=lnxg(x) = \ln x es derivable en μ>0\mu > 0 con g(μ)=1μg'(\mu) = \frac1\mu: el método delta (Parte VI) produce n(lnXˉnlnμ)N(0,σ2/μ2)\sqrt n(\ln\bar X_n - \ln\mu) \Rightarrow \mathcal N(0, \sigma^2/\mu^2). Deshaciendo el intervalo lnXˉnlnμ1.96σμn\abs{\ln\bar X_n - \ln\mu} \leq \frac{1.96\,\sigma}{\mu\sqrt n} por exponenciación:

μXˉne±1.96σ/(μn)con probabilidad asintoˊtica 95%\mu \in \bar X_n\cdot \eu^{\pm1.96\,\sigma/(\mu\sqrt n)} \qquad\text{con probabilidad asintótica } 95\%

(en la práctica, σ/μ\sigma/\mu se sustituye por su versión empírica, Slutsky como en el Ejercicio 23.8). El intervalo multiplicativo es el natural cuando los datos son positivos con errores proporcionales a su tamaño — rentas, concentraciones, semividas: magnitudes que viven en escala logarítmica, donde los intervalos aditivos simétricos podrían incluso cruzar el cero.

25. E[(Xp)3]=(1p)3p+(p)3(1p)=p(1p)[(1p)2p2]=p(1p)(12p)\E[(X - p)^3] = (1-p)^3p + (-p)^3(1 - p) = p(1-p)\bigl[(1-p)^2 - p^2\bigr] = p(1-p)(1 - 2p). En el análisis por sustitución (Parte IV), el término de error dominante tras ajustar dos momentos lleva el tercer momento con signo: para p<12p < \frac12 es positivo (la ley se inclina a la derecha: excursiones grandes y raras por encima de la media) y la aproximación normal desplaza sistemáticamente la masa — subestimando la cola izquierda, corta, y sobrestimando la derecha — con un error de orden n1/2n^{-1/2}; en p=12p = \frac12 el tercer momento se anula, la Bernoulli coincide con la gaussiana hasta el tercer orden y la velocidad mejora (la pregunta de momentos ajustados de la Parte IV). Numéricamente: P(S=0)=0.920=0.1216\P(S = 0) = 0.9^{20} = 0.1216, mientras que la gaussiana N(2,1.8)\mathcal N(2, 1.8) da Φ(0.521.8)=Φ(1.118)0.132\Phi\bigl(\frac{0.5 - 2}{\sqrt{1.8}}\bigr) = \Phi(-1.118) \approx 0.132: la curva normal, ignorante del muro en 00 y de la asimetría hacia la derecha, pone demasiada masa abajo — el signo del error predicho, visible en n=20n = 20.