Mathematics · Book 5 · Bachelor Year 3

Matemáticas universitarias — Grado 3

Matemáticas universitarias — Grado 3 · Bachelor Year 3

23Funciones características y límite central teorema

La ley de los grandes números dice que los promedios convergen; el central teorema del límite dice cómo fluctúan: el error, magnificado por n\sqrt n, es asintóticamente gaussiano — cualquiera que sea la ley por la que se parta. Esta universalidad es la El hecho más profundo de la probabilidad elemental y su prueba natural. es analítico de Fourier: el función característica (la transformada de Fourier de una ley) convierte sumas independiente en productos, y la maquinaria de Capítulo 14 — inyectividad, puntos fijos gaussiano — convierte puntualmente convergencia de estos productos en convergencia de leyes (Teorema de Lévy, demostrado en su totalidad). El capítulo termina con Vectores gaussianos y la honesta derivación de la confianza. intervalos utilizados en todas partes en estadística; el problema del fin de semana da la segunda prueba de Lindeberg del CLT, con una explícita tasa de error.

23.1 Funciones características

Definición 23.1

El función característica de un variable aleatoria XX real es

φX(ξ)=E[eiξX]=Reiξx ⁣dPX(x)(ξR)\varphi_X(\xi) = \E\bigl[\eu^{\iu\xi X}\bigr] = \int_\R \eu^{\iu\xi x}\,\dd\P_X(x) \qquad (\xi \in \R)

(el teorema de transferencia lo calcula a partir de la ley; para un densidad ff, φX(ξ)=f^(ξ)\varphi_X(\xi) = \hat f(-\xi) en XXXP0741Convención XXX).

Proposición 23.2

(a) φX(0)=1\varphi_X(0) = 1, φX1\abs{\varphi_X} \leq 1 y φX\varphi_X es uniformemente continuo; φaX+b(ξ)=eibξφX(aξ)\varphi_{aX + b}(\xi) = \eu^{\iu b\xi}\varphi_X(a\xi). (b) Si X,YX, Y es independiente: φX+Y=φXφY\varphi_{X+Y} = \varphi_X\,\varphi_Y. (c) Si EXk<\E\abs X^k < \infty, entonces φXCk\varphi_X \in \mathcal C^kconφX(j)(0)=ijE[Xj]\varphi_X^{(j)}(0) = \iu^j\,\E[X^j]parajkj \leq k; en particular, paraXL2X \in L^2 centrado con variación σ2\sigma^2:

φX(ξ)=1σ2ξ22+o(ξ2)(ξ0).\varphi_X(\xi) = 1 - \frac{\sigma^2\xi^2}{2} + o(\xi^2) \qquad (\xi \to 0).

(d) gaussiano: XN(m,σ2)X \sim \mathcal N(m, \sigma^2) tiene φX(ξ)=eimξσ2ξ2/2\varphi_X(\xi) = \eu^{\iu m\xi - \sigma^2\xi^2/2}.

Demostración. (a) Los límites son inmediatos; continuidad: φ(ξ+h)φ(ξ)EeihX10\abs{\varphi(\xi + h) - \varphi(\xi)} \leq \E\abs{\eu^{\iu hX} - 1} \to 0comoh0h \to 0por convergencia dominada, uniformemente enξ\xi. el La regla afín es una sustitución. (b) eiξ(X+Y)=eiξXeiξY\eu^{\iu\xi(X+Y)} = \eu^{\iu\xi X}\eu^{\iu\xi Y} y esperanzas de heredar de productos del factor de variables independiente (Teorema 22.5, aplicado a bienes reales y partes imaginarias). (c) Diferenciación según la expectativa, dominado por EXj\E\abs X^j (Teorema 10.15); la expansión de Taylor en 00 es entonces Taylor–Young para la función C2\mathcal C^2 φ\varphi. (d) Para N(0,1)\mathcal N(0,1): la transformación gaussiano (Ejemplo 14.2 con a=12a = \frac12) da eiξxex2/22π ⁣dx=eξ2/2\int\eu^{\iu\xi x}\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\dd x = \eu^{-\xi^2/2}; el caso general por la regla afín.

Teorema 23.3 (Inyectividad)

Si φX=φY\varphi_X = \varphi_Y, entonces XX y YY tienen el mismo ley. Más precisamente, para NN(0,1)N \sim \mathcal N(0,1) independiente de XX y ε>0\varepsilon > 0, la variable suavizada X+εNX + \varepsilon N tiene el densidad

pε(x)=12πRφX(ξ)eε2ξ2/2eiξx ⁣dξ,p_\varepsilon(x) = \frac1{2\pi}\int_\R \varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\, \eu^{\iu\xi x}\,\dd\xi ,

determinado únicamente por φX\varphi_X; dejando ε0\varepsilon \to 0 recupera la ley de XX.

Demostración. X+εNX + \varepsilon N tiene el densidad pε(x)=E[gε(xX)]p_\varepsilon(x) = \E\bigl[g_\varepsilon(x - X)\bigr], dondegεg_\varepsilon es el N(0,ε2)\mathcal N(0, \varepsilon^2) densidad: efectivamente para Borel BB, independencia y Tonelli dan P(X+εNB)= ⁣ ⁣1B(x+εn)g1(n) ⁣dn ⁣dPX(x)=BE[gε(tX)] ⁣dt\P(X + \varepsilon N \in B) = \int\!\!\int\mathbf 1_B(x + \varepsilon n)g_1(n)\,\dd n\,\dd\P_X(x) = \int_B\E[g_\varepsilon(t - X)]\dd t (sustituto, luego Tonelli nuevamente). escribiendo gεg_\varepsilon por inversión de Fourier de su transformada (Ejercicio 14.4, reescalado): gε(u)=12πeε2ξ2/2eiξu ⁣dξg_\varepsilon(u) = \frac1{2\pi}\int \eu^{-\varepsilon^2\xi^2/2}\eu^{\iu\xi u}\dd\xi y Fubini (todo dominado por el factor gaussiano):

pε(x)=12πRφX(ξ)eε2ξ2/2eiξx ⁣dξ,p_\varepsilon(x) = \frac1{2\pi}\int_\R \varphi_X(-\xi)\,\eu^{-\varepsilon^2\xi^2/2}\, \eu^{\iu\xi x}\,\dd\xi ,

un funcional de φX\varphi_X solo. Si φX=φY\varphi_X = \varphi_Y:X+εNX + \varepsilon NyY+εNY + \varepsilon N tienen leyes iguales para cada ε\varepsilon; para continuo acotado ff, Ef(X+εN)Ef(X)\E f(X + \varepsilon N) \to \E f(X) como ε0\varepsilon \to 0(convergencia dominada,X+εNXX + \varepsilon N \to X puntualmente en el espacio del producto), por lo que Ef(X)=Ef(Y)\E f(X) = \E f(Y) para todos esos ff — y esto determina la ley: para cada tt, aprieta 1(,t]\mathbf 1_{\intoc{-\infty}t} entre los acotados continuo rampas fk±f_k^\pm (igual a 11 en (,t1k]\intoc{-\infty}{t \mp \frac1k}, a 00 más allá de t±1kt \pm \frac1k, afín entre); pasar al límite enEfk(X)FX(t)Efk+(X)\E f_k^-(X) \leq F_X(t) \leq \E f_k^+(X)daFX(t)=FY(t)F_X(t) = F_Y(t)en cadatt donde ambos son continuo, por lo tanto en todas partes por continuidad derecha y densidad de común puntos continuidad (ambos FF tienen muchos saltos contables); funciones de distribución iguales fuerzan leyes iguales (Ejercicio 9.3, descansando sobre Teorema 9.7).

23.2 Convergencia en la distribución

Definición 23.4

XnX_n converge en distribución (o en la ley) a XX, escrito XnXX_n \Rightarrow X, si

E[f(Xn)]E[f(X)]for every bounded continuous f ⁣:RR.\E\bigl[f(X_n)\bigr] \longrightarrow \E\bigl[f(X)\bigr] \qquad\text{for every bounded continuous } f\colon\R\to\R .

Equivalentemente (Ejercicio 23.4): FXn(t)FX(t)F_{X_n}(t) \to F_X(t) en cada punto continuidad tt de FXF_X. El XnX_n no necesita vivir de un espacio de probabilidad común: sólo importan las leyes.

Teorema 23.5 (Teorema de selección de Helly)

Cada secuencia (Fn)(F_n) de funciones de distribución tiene un subsecuencia convergente puntualmente, en cada punto continuidad del límite, a un continuo a la derecha G ⁣:R[0,1]G \colon \R \to \intcc01no decreciente — posiblemente conG(+)G()<1G(+\infty) - G(-\infty) < 1 (la masa puede escapar al infinito).

Demostración. La extracción diagonal da Fnk(q)(q)F_{n_k}(q) \to \ell(q) por cada racional qq (valores en el compacto [0,1]\intcc01). Definir G(t)=inf{(q):qQ,q>t}G(t) = \inf\{\ell(q) : q \in \Q, q > t\}: no decreciente; continuo a la derecha (un mínimo sobre la reducción racional barrios desde la derecha). En un punto continuidad tt de GG: para racionales q1<t<q2q_1 < t < q_2,

(q1)lim infFnk(t)lim supFnk(t)(q2),\ell(q_1) \leq \liminf F_{n_k}(t) \leq \limsup F_{n_k}(t) \leq \ell(q_2),

por monotonicidad de cada FnkF_{n_k}. De la definición de GG como mínimo y monotonicidad de \ell en el racionales: G(s)(q)G(q)G(s) \leq \ell(q) \leq G(q) siempre que s<qs < q. Al tomar s<q1<ts < q_1 < t se obtiene (q1)G(s)\ell(q_1) \geq G(s), y (q2)G(q2)\ell(q_2) \leq G(q_2); dejando que sts \uparrow t y q2tq_2 \downarrow t, continuidad deGGentt expriman ambos lim inf\liminf y lim sup\limsup a G(t)G(t).

Lema 23.6 (Estanqueidad desde la función característica)

Para cualquier variable aleatoria XX y u>0u > 0:

P(X2u)    1uuu(1ReφX(ξ)) ⁣dξ.\P\Bigl(\abs X \geq \frac2u\Bigr) \;\leq\; \frac1u\int_{-u}^{u}\bigl(1 - \operatorname{Re}\varphi_X(\xi)\bigr)\,\dd\xi .

Demostración. Por Tonelli–Fubini (integrando acotado, región finita en ξ\xi):

1uuu(1ReφX(ξ)) ⁣dξ=E[1uuu(1cos(ξX)) ⁣dξ]=2E[1sin(uX)uX]\frac1u\int_{-u}^u\bigl(1 - \operatorname{Re}\varphi_X(\xi)\bigr)\dd\xi = \E\Bigl[\frac1u\int_{-u}^u(1 - \cos(\xi X))\,\dd\xi\Bigr] = 2\,\E\Bigl[1 - \frac{\sin(uX)}{uX}\Bigr]

(interprete el corchete como su límite 00 en X=0X = 0). el el integrando no es negativo (sintt\abs{\sin t} \leq \abs t), y para uX2\abs{uX} \geq 2: 1sin(uX)uX11uX121 - \frac{\sin(uX)}{uX} \geq 1 - \frac1{\abs{uX}} \geq \frac12. Manteniendo solo el evento {uX2}\{\abs{uX} \geq 2\} dentro del expectativa por lo tanto deja al menos 212P(X2u)2 \cdot \frac12\,\P(\abs X \geq \frac2u), cual es el reclamo.

Teorema 23.7 (teorema de continuidad de Lévy)

Sea (Xn)(X_n) variables aleatorias cuyo característica funciones converge puntualmente: φXn(ξ)φ(ξ)\varphi_{X_n}(\xi) \to \varphi(\xi)por cadaξ\xi, dondeφ=φX\varphi = \varphi_X es el función característica de algún aleatorio variable XX. Entonces XnXX_n \Rightarrow X.

Demostración. Opresión. Reparar ε>0\varepsilon > 0. Dado que φ\varphi es continuo en 00 con φ(0)=1\varphi(0) = 1, elija u>0u > 0 con 1uuu(1Reφ)<ε\frac1u\int_{-u}^u(1 - \operatorname{Re}\varphi) < \varepsilon; por convergencia dominada (integrando acotado por 22 en el fijo [u,u][-u,u]), la misma integral para φXn\varphi_{X_n} es <2ε< 2\varepsilon para nn grande: Lema 23.6 da P(Xn2u)2ε\P(\abs{X_n} \geq \frac2u) \leq 2\varepsilonparann grande y amplía la constante maneja un número finito de otros: las leyes son ajustado — no hay fugas masivas.

Subsecuencias. Sea (Fnk)(F_{n_k}) cualquier subsecuencia; por Helly (Teorema 23.5) extracto FnkjGF_{n_{k_j}} \to G en puntos continuidad. Fuerzas de estanqueidad G()=0G(-\infty) = 0, G(+)=1G(+\infty) = 1 (G(2u)G(2u)12εG(\frac2u) - G(-\frac2u) \geq 1 - 2\varepsilonen puntos continuidad):GG es un producto genuino función de distribución, de algunos variable aleatoria YY. entonces XnkjYX_{n_{k_j}} \Rightarrow Y (Ejercicio 23.4, convergencia distributiva de FF), por lo que φXnkjφY\varphi_{X_{n_{k_j}}} \to \varphi_Y puntualmente (xeiξxx \mapsto \eu^{\iu\xi x} está acotado continuo, real y partes imaginarias por separado); comparando con la hipótesis: φY=φ=φX\varphi_Y = \varphi = \varphi_X y inyectividad. (Teorema 23.3) da YXY \sim X, es decir, G=FXG = F_X.

Conclusión. Cada subsecuencia de (Fn)(F_n) tiene un subsubsecuencia que converge al mismo FXF_X (en su continuidad puntos); por lo tanto Fn(t)FX(t)F_n(t) \to F_X(t) en cada continuidad punto tt (una secuencia real cuya totalidad las subsecuencias tienen subsecuencias con el mismo límite converge): XnXX_n \Rightarrow X.

23.3 El teorema del límite central

Teorema 23.8 (Teorema del límite central)

Sea (Xn)(X_n) i.i.d. con EX1=m\E X_1 = m y V(X1)=σ2(0,)\V(X_1) = \sigma^2 \in \intoo0\infty. Entonces

Snnmσn    N(0,1):P(aSnnmσnb)12πabex2/2 ⁣dx\frac{S_n - nm}{\sigma\sqrt n} \;\Longrightarrow\; \mathcal N(0, 1) : \qquad \P\Bigl(a \leq \frac{S_n - nm}{\sigma\sqrt n} \leq b\Bigr) \longrightarrow \frac{1}{\sqrt{2\pi}}\int_a^b\eu^{-x^2/2}\,\dd x

para todos los a<ba < b.

Demostración. Centro y normalizar: Zi=XimσZ_i = \frac{X_i - m}{\sigma} (i.i.d., media 00, varianza 11) y Tn=1ninZiT_n = \frac1{\sqrt n}\sum_{i\leq n}Z_i. Por independencia y el regla afín (Proposición 23.2):

φTn(ξ)=φZ(ξn)n,φZ(η)=1η22+η2ρ(η),ρ(η)0.\varphi_{T_n}(\xi) = \varphi_{Z}\Bigl(\frac{\xi}{\sqrt n}\Bigr)^{n}, \qquad \varphi_Z(\eta) = 1 - \frac{\eta^2}2 + \eta^2\rho(\eta),\quad \rho(\eta)\to0 .

Reparar ξ\xi y dejar an=φZ(ξ/n)a_n = \varphi_Z(\xi/\sqrt n), bn=1ξ22nb_n = 1 - \frac{\xi^2}{2n}: ambos tienen módulo1\leq 1parann grande (bn1\abs{b_n} \leq 1 una vez ξ24n\xi^2 \leq 4n; an1\abs{a_n} \leq 1 siempre). La desigualdad elemental anbnnab\abs{a^n - b^n} \leq n\abs{a - b}paraa,b1\abs a, \abs b \leq 1 (telescópica anbn=ak(ab)bn1ka^n - b^n = \sum a^k(a - b)b^{n-1-k}) da

φTn(ξ)(1ξ22n)nnφZ(ξn)1+ξ22n=ξ2ρ(ξn)0,\Bigl|\varphi_{T_n}(\xi) - \Bigl(1 - \frac{\xi^2}{2n}\Bigr)^{n}\Bigr| \leq n\,\Bigl|\varphi_Z\Bigl(\frac\xi{\sqrt n}\Bigr) - 1 + \frac{\xi^2}{2n}\Bigr| = \xi^2\,\Bigl|\rho\Bigl(\frac{\xi}{\sqrt n}\Bigr)\Bigr| \longrightarrow 0,

mientras que (1ξ22n)neξ2/2\bigl(1 - \frac{\xi^2}{2n}\bigr)^n \to \eu^{-\xi^2/2}(logaritmo real). EntoncesφTn(ξ)eξ2/2=φN(0,1)(ξ)\varphi_{T_n}(\xi) \to \eu^{-\xi^2/2} = \varphi_{\mathcal N(0,1)}(\xi) (Proposición 23.2(d)) por cada ξ\xi: Lévy (Teorema 23.7) concluye TnN(0,1)T_n \Rightarrow \mathcal N(0,1). Las probabilidades de intervalo siguen ya queFNF_{\mathcal N} es continuo en todas partes.

Ejemplo 23.9 (Intervalos de confianza, derivados honestamente)

Encuesta nn independiente votantes; p^n=Sn/n\hat p_n = S_n/n estima el verdadero pp, con σ2=p(1p)14\sigma^2 = p(1-p) \leq \frac14. El CLT da, para grande nn,

P(p^npz2n)    P(Snnpσnz)Φ(z)Φ(z),\P\Bigl(\abs{\hat p_n - p} \leq \frac{z}{2\sqrt n}\Bigr) \;\geq\; \P\Bigl(\Bigl|\frac{S_n - np}{\sigma\sqrt n}\Bigr| \leq z\Bigr) \longrightarrow \Phi(z) - \Phi(-z),

donde Φ\Phi es la función de distribución estándar gaussiano. Con z=1.96z = 1.96: confianza asintótica 95%95\% y margen 1.962n3%\frac{1.96}{2\sqrt n} \leq 3\% requiere n(1.960.06)21068n \geq \bigl(\frac{1.96}{0.06}\bigr)^2 \approx 1068 — el número detrás de cada punto “±3\pm3, 95%95\%” se lee; comparar 55565556 (Ejercicio 22.7) de Chebyshev. el n\sqrt n es universal: para reducir a la mitad el error, cuadriplica el muestra — la misma ley que fija el costo de Montecarlo (Ejercicio 23.7).

23.4 Vectores gaussianos

Definición 23.10

Un vector aleatorio X=(X1,,Xd)X = (X_1, \dots, X_d) es gaussiano si cada lineal combinación t,X=tiXi\langle t, X\rangle = \sum t_iX_i es una (posiblemente degenerada) variable gaussiana real. Su ley es determinado por el vector medio m=(EXi)m = (\E X_i) y el matriz de covarianza Σ=(Cov(Xi,Xj))\Sigma = \bigl(\operatorname{Cov} (X_i, X_j)\bigr): efectivamente el función característica del El vector φX(t)=Eeit,X\varphi_X(t) = \E\eu^{\iu\langle t, X\rangle} es el valor en 11 del cf de t,X\langle t, X\rangle:

φX(t)=exp(it,m12tTΣt),\varphi_X(t) = \exp\Bigl(\iu\langle t, m\rangle - \tfrac12\,t^{\mathsf T}\Sigma\,t\Bigr),

y dd-dimensional funciones características son inyectivos (la misma prueba de suavizado que Teorema 23.3, Gaussianos coordinados).

Teorema 23.11

Sea XX un vector gaussiano.

  1. Cada imagen afín AX+bAX + b es una vector gaussiano.
  2. Los componentes XiX_i son independiente si y sólo si Σ\Sigma es diagonal: para gaussiano en conjunto variables, no correlacionadas == independiente.
  3. Si Σ\Sigma es invertible, XX tiene el densidad 1(2π)d/2detΣexp(12(xm)TΣ1(xm))\frac{1}{(2\pi)^{d/2}\sqrt{\det\Sigma}} \exp\bigl(-\frac12(x - m)^{\mathsf T}\Sigma^{-1}(x - m)\bigr).

Demostración. (1) Las combinaciones lineales de componentes de AX+bAX + b son afines funciones de combinaciones lineales de XX: gaussiano (un afín imagen de una variable gaussiano es gaussiano). (2) Si Σ\Sigma es diagonal, el función característica factoriza: φX(t)=iexp(itimi12Σiiti2)=φXi(ti)\varphi_X(t) = \prod_i\exp(\iu t_im_i - \frac12\Sigma_{ii}t_i^2) = \prod\varphi_{X_i}(t_i), que es el función característica de la ley de productos (Teorema 22.5 leer detenidamente dd-inyectividad dimensional): los componentes son independiente. Lo contrario es la desaparición de las covarianzas de independiente. L2L^2 variables. (3) Diagonalizar Σ=PDPT\Sigma = P D P^{\mathsf T} (PP ortogonal, D>0D > 0 diagonal — Ejercicio 20.8); el el vector Y=PT(Xm)Y = P^{\mathsf T}(X - m) es gaussiano con covarianza DD: por (2) sus componentes son independiente N(0,di)\mathcal N(0, d_i), por lo que YY tiene el producto densidad; empujar adelante por el x=m+PYx = m + PY que preserva el volumen (Teorema 11.10, detP=1\abs{\det P} = 1) y reescribe el exponente invariantemente.

Teorema 23.12 (CLT multidimensional)

Sea (Xn)(X_n) i.i.d. cuadrado integrable aleatorio vectores de Rd\R^d con media mm y matriz de covarianza Σ\Sigma. Entonces Snnmn\frac{S_n - nm}{\sqrt n} converge en distribución al vector gaussiano N(0,Σ)\mathcal N(0, \Sigma).

Demostración. Admitido a este nivel.

Observación 23.13

Casi todo ya está en nuestras manos. para cada dirección tRdt \in \R^d, la variable real t,Snnmn\langle t, \frac{S_n - nm}{\sqrt n}\rangle es una suma normalizada de i.i.d. variables reales de varianza tTΣtt^{\mathsf T}\Sigma t, entonces el cálculo de Teorema 23.8 da puntualmente convergencia del dd-dimensional funciones características a etTΣt/2\eu^{-t^{\mathsf T}\Sigma t/2}, el característica función de N(0,Σ)\mathcal N(0, \Sigma) (Definición 23.10). lo que no tenemos Se vuelve a demostrar el teorema continuidad in Rd\R^d de Lévy: La selección de Helly y la estimación de estanqueidad se generalizan rutinariamente (en forma de coordenadas), y este Cramér–Wold La reducción se realiza honestamente en cualquier egresado. curso de probabilidad; nada más allá de los métodos de este capítulo es necesario.

Método 23.14

Para identificar una ley límite: calcule funciones características, toma el límite puntual, reconócelo (gaussiano eσ2ξ2/2\eu^{-\sigma^2\xi^2/2}, Poison eλ(eiξ1)\eu^{\lambda(\eu^{\iu\xi}-1)}, exponencial λλiξ\frac{\lambda} {\lambda - \iu\xi}, …) e invocar Lévy. los tres pasos ritual (independencia \to producto; Taylor en 00 \to límite exponencial; Lévy \to convergencia en el derecho) demuestra el CLT, la ley de Poisson de eventos raros (Ejercicio 23.5), y cada teorema del límite clásico de este curso. Para declaraciones a.s. regrese a Conjunto de herramientas de Capítulo 22: respuesta de los dos capítulos diferentes preguntas sobre el mismo SnS_n.

23.5 Ceremonias

Ejercicio 23.1

Calcule el funciones características: uniforme en [1,1]\intcc{-1}1; exponencial E(λ)\mathcal E(\lambda); Poison P(λ)\mathcal P(\lambda); binomio B(n,p)\mathcal B(n, p). deducir vía Teorema 23.3 que la suma de independiente Las variables de Poisson (λ,μ\lambda, \mu) son Poisson (λ+μ)(\lambda + \mu).

Solución

Solución de Ejercicio 23.1.

Uniforme en [1,1]\intcc{-1}1: φ(ξ)=1211eiξx ⁣dx=sinξξ\varphi(\xi) = \frac12\int_{-1}^1\eu^{\iu\xi x}\dd x = \frac{\sin\xi}{\xi}(igual a11enξ=0\xi = 0). Exponencial E(λ)\mathcal E(\lambda): φ(ξ)=λ0e(iξλ)x ⁣dx=λλiξ\varphi(\xi) = \lambda\int_0^\infty\eu^{(\iu\xi - \lambda)x}\dd x = \frac{\lambda}{\lambda - \iu\xi} (la antiderivada desaparece en ++\infty desde Re(iξλ)<0\operatorname{Re}(\iu\xi - \lambda) < 0). PoissonP(λ)\mathcal P(\lambda): por el teorema de transferencia para leyes discretas,

φ(ξ)=k0eiξkeλλkk!=eλexp(λeiξ)=exp(λ(eiξ1)).\varphi(\xi) = \sum_{k\geq0}\eu^{\iu\xi k}\,\eu^{-\lambda}\frac{\lambda^k}{k!} = \eu^{-\lambda}\exp\bigl(\lambda\eu^{\iu\xi}\bigr) = \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr).

Binomio B(n,p)\mathcal B(n, p): una suma de nn independiente Variables de Bernoulli, cada una con cf 1p+peiξ1 - p + p\eu^{\iu\xi}, entonces φ(ξ)=(1p+peiξ)n\varphi(\xi) = \bigl(1 - p + p\eu^{\iu\xi}\bigr)^n (Proposición 23.2(b)). Aditividad de Poisson: si XP(λ)X \sim \mathcal P(\lambda),YP(μ)Y \sim \mathcal P(\mu) son independiente,

φX+Y(ξ)=eλ(eiξ1)eμ(eiξ1)=e(λ+μ)(eiξ1),\varphi_{X+Y}(\xi) = \eu^{\lambda(\eu^{\iu\xi}-1)} \eu^{\mu(\eu^{\iu\xi}-1)} = \eu^{(\lambda+\mu)(\eu^{\iu\xi}-1)},

el cf de P(λ+μ)\mathcal P(\lambda + \mu); inyectividad (Teorema 23.3) identifica la ley.

Ejercicio 23.2 ★★

(a) Demuestre que φX\varphi_X tiene un valor real si y sólo si XX y X-X tienen la misma ley (una variable simétrico). (b) Supongamos φX(ξ0)=1\abs{\varphi_X(\xi_0)} = 1 para algunos ξ00\xi_0 \neq 0. Demuestre queXX casi seguramente se apoya en una aritmética progresión a+2πξ0Za + \frac{2\pi}{\xi_0}\Z (write φX(ξ0)=eiθ\varphi_X(\xi_0) = \eu^{\iu\theta} and compute E[1cos(ξ0Xθ)]\E[1 - \cos(\xi_0X - \theta)]). Deduzca que siXX tiene un densidad, luego φX(ξ)<1\abs{\varphi_X(\xi)} < 1 para todos los ξ0\xi \neq 0.

Solución

Solución de Ejercicio 23.2.

(a) φX(ξ)=EeiξX=φX(ξ)\overline{\varphi_X(\xi)} = \E\eu^{-\iu\xi X} = \varphi_{-X}(\xi). EntoncesφX\varphi_X es real si y sólo si φX=φX\varphi_X = \varphi_{-X}, si y sólo si (inyectividad, Teorema 23.3) XX y X-X tienen el mismo ley. (b) Escriba φX(ξ0)=eiθ\varphi_X(\xi_0) = \eu^{\iu\theta}. entonces

E[1cos(ξ0Xθ)]=1Re(eiθφX(ξ0))=11=0.\E\bigl[1 - \cos(\xi_0X - \theta)\bigr] = 1 - \operatorname{Re}\bigl(\eu^{-\iu\theta} \varphi_X(\xi_0)\bigr) = 1 - 1 = 0 .

El integrando no es negativo, por lo que cos(ξ0Xθ)=1\cos(\xi_0X - \theta) = 1 casi con seguridad (una variable no negativa con cero expectativa desaparece a.s.), es decir ξ0Xθ2πZ\xi_0X - \theta \in 2\pi\Z a.s.: XX toma sus valores en la progresión aritmética θξ0+2πξ0Z\frac{\theta}{\xi_0} + \frac{2\pi}{\xi_0}\Z casi con toda seguridad. Si XX tiene un densidad, este conjunto contable es Lebesgue-null, por lo que conlleva probabilidad 00 — contradicción; por lo tanto φX(ξ)<1\abs{\varphi_X(\xi)} < 1 por cada ξ0\xi \neq 0.

Ejercicio 23.3 ★★

Sean XN(m1,σ12)X \sim \mathcal N(m_1, \sigma_1^2) y YN(m2,σ22)Y \sim \mathcal N(m_2, \sigma_2^2)independiente. MostrarX+YN(m1+m2,σ12+σ22)X + Y \sim \mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2) y de manera más general, que la familia gaussiano es estable bajo independiente sumas y mapas afines. Contraste: es la suma de dos dependiente gaussianos siempre gaussiano? (Ejercicio 23.9.)

Solución

Solución de Ejercicio 23.3.

Por independencia y Proposición 23.2:

φX+Y(ξ)=eim1ξσ12ξ2/2eim2ξσ22ξ2/2=ei(m1+m2)ξ(σ12+σ22)ξ2/2,\varphi_{X+Y}(\xi) = \eu^{\iu m_1\xi - \sigma_1^2\xi^2/2}\, \eu^{\iu m_2\xi - \sigma_2^2\xi^2/2} = \eu^{\iu(m_1+m_2)\xi - (\sigma_1^2+\sigma_2^2)\xi^2/2},

el cf de N(m1+m2,σ12+σ22)\mathcal N(m_1 + m_2, \sigma_1^2 + \sigma_2^2); concluye la inyectividad. La estabilidad bajo mapas afines es la regla afín (aX+bN(am1+b,a2σ12)aX + b \sim \mathcal N(am_1 + b, a^2\sigma_1^2), que permite el caso degeneradoa=0a = 0), y La estabilidad bajo sumas independiente sigue por inducción en el cálculo anterior. Para dependiente gaussianos la suma no es necesario que sea gaussiano: en Ejercicio 23.9, XX y Y=εXY = \varepsilon Xson cada uno estándar gaussiano peroX+YX + Y desaparece con probabilidad 12\frac12 sin ser a.s. cero, por lo que no es gaussiano.

Ejercicio 23.4 ★★

(a) Acreditar la equivalencia en Definición 23.4: si Ef(Xn)Ef(X)\E f(X_n) \to \E f(X) para todos los continuo ff acotados, luego FXn(t)FX(t)F_{X_n}(t) \to F_X(t) en puntos continuidad (squeeze 1(,t]\mathbf 1_{\intoc{-\infty}t} between two continuo staircase-ramps); y a la inversa (approximate a bounded continuo ff by sums of ramp functions, or condition on a fine grid of continuidad points) — lo contrario puede tratarse para ff de manera uniforme continuo primero, luego en general. (b) Demuestre que XncX_n \Rightarrow c (una constante) implica XncX_n \to c en probabilidad.

Solución

Solución de Ejercicio 23.4.

(a) Implicación directa. Sea tt un punto continuidad de FXF_X y δ>0\delta > 0. Tome las rampas continuo ff^- (=1= 1 en (,tδ]\intoc{-\infty}{t-\delta}, 00 de tt en, afín entre) y f+f^+ (=1= 1 en (,t]\intoc{-\infty}t, 00 desde t+δt + \delta en adelante, afín entre); entonces f1(,t]f+f^- \leq \mathbf 1_{\intoc{-\infty}t} \leq f^+, entonces

Ef(Xn)FXn(t)Ef+(Xn),\E f^-(X_n) \leq F_{X_n}(t) \leq \E f^+(X_n),

y los términos externos convergen a Ef±(X)\E f^\pm(X), ellos mismos comprimido entre FX(tδ)F_X(t - \delta) y FX(t+δ)F_X(t + \delta). Dejando nn \to \infty luego δ0\delta \to 0 y usando continuidad de FXF_X en tt: FXn(t)FX(t)F_{X_n}(t) \to F_X(t).

Conversar. Sea ff acotado continuo, M=supfM = \sup\abs f,ε>0\varepsilon > 0. Los puntos continuidad de FXF_X son densos (FXF_X tiene como máximo muchos saltos contables), por lo que elige continuidad puntos a<ba < b con FX(a)<εF_X(a) < \varepsilon y 1FX(b)<ε1 - F_X(b) < \varepsilon. En el compacto [a,b]\intcc ab la función ff es uniformemente continuo: elija continuidad puntos a=t0<t1<<tm=ba = t_0 < t_1 < \dots < t_m = b de FXF_X con oscilación de ff como máximo ε\varepsilon en cada (tj1,tj]\intoc{t_{j-1}}{t_j} y establezca g=jf(tj)1(tj1,tj]g = \sum_j f(t_j)\,\mathbf 1_{\intoc{t_{j-1}}{t_j}}. Luegofgε\abs{f - g} \leq \varepsilonen(a,b]\intoc ab,gM\abs g \leq M y para T=XnT = X_n o XX:

Ef(T)Eg(T)ε+2M(FT(a)+1FT(b)).\bigl|\E f(T) - \E g(T)\bigr| \leq \varepsilon + 2M\bigl(F_T(a) + 1 - F_T(b)\bigr).

Además Eg(Xn)=jf(tj)(FXn(tj)FXn(tj1))Eg(X)\E g(X_n) = \sum_j f(t_j)\bigl(F_{X_n}(t_j) - F_{X_n}(t_{j-1})\bigr) \to \E g(X) (una suma finita de términos convergentes, siendo todos tjt_j puntos continuidad), y FXn(a)FX(a)<εF_{X_n}(a) \to F_X(a) < \varepsilon, 1FXn(b)1FX(b)<ε1 - F_{X_n}(b) \to 1 - F_X(b) < \varepsilon. Montaje: lim supnEf(Xn)Ef(X)2ε+8Mε\limsup_n\abs{\E f(X_n) - \E f(X)} \leq 2\varepsilon + 8M\varepsilon; dejaε0\varepsilon \to 0.

(b) La función de distribución de la constante cc es 1[c,)\mathbf 1_{\intco c\infty}, continuo excepto en cc. Para ε>0\varepsilon > 0, los puntos cεc - \varepsilon y c+ε2c + \frac\varepsilon2 son puntos continuidad, por lo que

P(Xnc>ε)FXn(cε)+1FXn(c+ε2)0+11=0.\P(\abs{X_n - c} > \varepsilon) \leq F_{X_n}(c - \varepsilon) + 1 - F_{X_n}\Bigl(c + \frac\varepsilon2\Bigr) \longrightarrow 0 + 1 - 1 = 0 .

Ejercicio 23.5 ★★

(Ley de eventos raros) Sea XnB(n,pn)X_n \sim \mathcal B(n, p_n) con npnλ>0np_n \to \lambda > 0. Mostrar, vía funciones características y Teorema 23.7, que XnP(λ)X_n \Rightarrow \mathcal P(\lambda). Comprobación de cordura numérica: compareP(X=0)\P(X = 0) para B(100,0.02)\mathcal B(100, 0.02) y P(2)\mathcal P(2).

Solución

Solución de Ejercicio 23.5.

Sea zn=pn(eiξ1)z_n = p_n(\eu^{\iu\xi} - 1), entonces φXn(ξ)=(1+zn)n\varphi_{X_n}(\xi) = (1 + z_n)^n(Ejercicio 23.1) yzn2pn0\abs{z_n} \leq 2p_n \to 0(notapn=npnn0p_n = \frac{np_n}n \to 0). Tanto1+zn1 + z_n como ezn\eu^{z_n} tiene módulo como máximo 11: 1+zn=(1pn)+pneiξ1\abs{1 + z_n} = \abs{(1 - p_n) + p_n\eu^{\iu\xi}} \leq 1 por el triángulo desigualdad, y ezn=epn(cosξ1)1\abs{\eu^{z_n}} = \eu^{p_n(\cos\xi - 1)} \leq 1. La desigualdad telescópicaanbnnab\abs{a^n - b^n} \leq n\abs{a - b} (prueba de Teorema 23.8) y la potencia serie encuadernada ez1zz2ez\abs{\eu^z - 1 - z} \leq \abs z^2\eu^{\abs z} dar

(1+zn)nenznn1+zneznnzn2ezn4e2npn2=4e2(npn)pn0.\bigl|(1 + z_n)^n - \eu^{nz_n}\bigr| \leq n\bigl|1 + z_n - \eu^{z_n}\bigr| \leq n\,\abs{z_n}^2\,\eu^{\abs{z_n}} \leq 4\eu^2\,np_n^2 = 4\eu^2\,(np_n)\,p_n \longrightarrow 0 .

Desde nzn=npn(eiξ1)λ(eiξ1)nz_n = np_n(\eu^{\iu\xi} - 1) \to \lambda(\eu^{\iu\xi} - 1), concluimosφXn(ξ)exp(λ(eiξ1))\varphi_{X_n}(\xi) \to \exp\bigl(\lambda(\eu^{\iu\xi} - 1)\bigr) para cada ξ\xi: el cf de P(λ)\mathcal P(\lambda) y Lévy (Teorema 23.7) da XnP(λ)X_n \Rightarrow \mathcal P(\lambda). Numéricamente:P(B(100,0.02)=0)=0.98100=e100ln0.98e2.0200.1326\P\bigl(\mathcal B(100, 0.02) = 0\bigr) = 0.98^{100} = \eu^{100\ln 0.98} \approx \eu^{-2.020} \approx 0.1326, mientras queP(P(2)=0)=e20.1353\P\bigl(\mathcal P(2) = 0\bigr) = \eu^{-2} \approx 0.1353: dos por ciento de diferencia ya en este grueso nn.

Ejercicio 23.6 ★★

(a) Se lanza un dado justo n=1000n = 1000 veces; aproximar el probabilidad de que el total supere 36003600 (media 35003500, variación por rollo 3512\frac{35}{12}). (b) Para SB(100,12)S \sim \mathcal B(100, \frac12), aproximado P(45S55)\P(45 \leq S \leq 55) por el CLT con el continuidad corrección (±12\pm\frac12) y comentar sobre la corrección. efecto.

Solución

Solución de Ejercicio 23.6.

(a) Una tirada tiene media 72\frac72 y varianza 3512\frac{35}{12}, por lo que SS tiene media 35003500, varianza 35000122916.7\frac{35000}{12} \approx 2916.7 y desviación estándar 54.0\approx 54.0. Por el CLT,

P(S>3600)=P(S350054.0>1.85)1Φ(1.85)0.032:\P(S > 3600) = \P\Bigl(\frac{S - 3500}{54.0} > 1.85\Bigr) \approx 1 - \Phi(1.85) \approx 0.032 :

sobre una posibilidad 3%3\%. (b) SB(100,12)S \sim \mathcal B(100, \frac12): media 5050, estándar desviación 55. Con la corrección continuidad,

P(45S55)Φ(55.5505)Φ(44.5505)=2Φ(1.1)10.729,\P(45 \leq S \leq 55) \approx \Phi\Bigl(\frac{55.5 - 50}{5}\Bigr) - \Phi\Bigl(\frac{44.5 - 50}{5}\Bigr) = 2\Phi(1.1) - 1 \approx 0.729,

contra el valor exacto 0.72870.7287; sin la corrección, 2Φ(1)10.6832\Phi(1) - 1 \approx 0.683, con casi cinco puntos de diferencia. el La corrección es importante porque SS es una variable de red: la El átomo P(S=k)\P(S = k) está bien aproximado por la masa gaussiano. de [k12,k+12]\intcc{k - \frac12}{k + \frac12}, y recortando el intervalo en los números enteros 4545 y 5555 descarta medio átomo en cada extremo.

Ejercicio 23.7 ★★

(Error Montecarlo) En la configuración de Problema 22.1, pregunta 11, con gL2([0,1]d)g \in L^2(\intcc01^d), seanσ2=V(g(U1))\sigma^2 = \V(g(U_1))yI=gI = \int g. Mostrar

n(1nkng(Uk)I)N(0,σ2),\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr) \Longrightarrow \mathcal N(0, \sigma^2),

y deducir la barra de error asintótica 95%95\% ±1.96σ/n\pm 1.96\,\sigma/\sqrt nindependiente de la dimensióndd. Comparar con la regla determinista del punto medio en dimensión dd (error n2/d\sim n^{-2/d} para integrandos C2\mathcal C^2): ¿A partir de qué dimensión gana el muestreo aleatorio?

Solución

Solución de Ejercicio 23.7.

Las variables g(Uk)g(U_k) son i.i.d. (mensurable imágenes de i.i.d. variables), cuadrado integrable, con media II (teorema de transferencia, Ejercicio 11.9) y varianza σ2\sigma^2. Si se aplica σ>0\sigma > 0, Teorema 23.8 para ellos es exactamente la convergencia declarada

n(1nkng(Uk)I)=kn(g(Uk)I)nN(0,σ2)\sqrt n\,\Bigl(\frac1n\sum_{k\leq n}g(U_k) - I\Bigr) = \frac{\sum_{k\leq n}\bigl(g(U_k) - I\bigr)}{\sqrt n} \Longrightarrow \mathcal N(0, \sigma^2)

(si σ=0\sigma = 0, gg es a.s. constante y el lado izquierdo lado desaparece de forma idéntica). Por lo tanto P(1ng(Uk)I1.96σ/n)0.95\P\bigl(\abs{\frac1n\sum g(U_k) - I} \leq 1.96\,\sigma/\sqrt n\bigr) \to 0.95: la barra de error±1.96σ/n\pm 1.96\,\sigma/\sqrt nve la dimensióndd solo a través la constante σ\sigma, nunca a través de la tasa en nn. el La regla del punto medio con nodos nn en la dimensión dd tiene malla. n1/dn^{-1/d} y error de pedido n2/dn^{-2/d} para C2\mathcal C^2 integrandos. El n1/2n^{-1/2} de Montecarlo se desintegra más rápido que n2/dn^{-2/d} exactamente cuando 12>2d\frac12 > \frac2d, es decir d>4d > 4: a partir de la dimensión 55, el muestreo aleatorio supera asintóticamente la red — la maldición de la dimensionalidad repuestos métodos probabilísticos, razón por la cual Montecarlo gobierna integración de alta dimensión.

Ejercicio 23.8 ★★★

(Slutsky) Supongamos que XnXX_n \Rightarrow X y YncY_n \to c en probabilidad (constante cc). Mostrar Xn+YnX+cX_n + Y_n \Rightarrow X + cyYnXncXY_nX_n \Rightarrow cX. (Work with funciones características and the bound Eeiξ(Xn+Yn)eiξcEeiξXnEeiξ(Ync)1\abs{\E\eu^{\iu\xi (X_n+Y_n)} - \eu^{\iu\xi c}\E\eu^{\iu\xi X_n}} \leq \E\abs{\eu^{\iu\xi(Y_n - c)} - 1}, split onYncδ\abs{Y_n - c} \leq \delta.) Aplicación: en Ejemplo 23.9, justifica reemplazar la incógnita σ=p(1p)\sigma = \sqrt{p(1-p)} por p^n(1p^n)\sqrt{\hat p_n(1 - \hat p_n)}.

Solución

Solución de Ejercicio 23.8.

Suma. Para ξ\xi fijo:

Eeiξ(Xn+Yn)eiξcEeiξXn=E[eiξXn(eiξYneiξc)]Eeiξ(Ync)1.\bigl|\E\eu^{\iu\xi(X_n+Y_n)} - \eu^{\iu\xi c}\,\E\eu^{\iu\xi X_n}\bigr| = \bigl|\E\bigl[\eu^{\iu\xi X_n}\bigl(\eu^{\iu\xi Y_n} - \eu^{\iu\xi c}\bigr)\bigr]\bigr| \leq \E\bigl|\eu^{\iu\xi(Y_n - c)} - 1\bigr| .

Dividido en el evento {Yncδ}\{\abs{Y_n - c} \leq \delta\}: allí, eiξ(Ync)1ξδ\abs{\eu^{\iu\xi(Y_n-c)} - 1} \leq \abs\xi\,\delta (el cuerda es más corta que el arco); el complemento contribuye como máximo 2P(Ync>δ)02\,\P(\abs{Y_n - c} > \delta) \to 0. De ahí el lim sup\limsup es ξδ\leq \abs\xi\,\delta por cada δ>0\delta > 0: la diferencia tiende a 00. Desde EeiξXnφX(ξ)\E\eu^{\iu\xi X_n} \to \varphi_X(\xi), obtenemosφXn+Yn(ξ)eiξcφX(ξ)=φX+c(ξ)\varphi_{X_n+Y_n}(\xi) \to \eu^{\iu\xi c}\varphi_X(\xi) = \varphi_{X+c}(\xi), y Lévy (Teorema 23.7) produce Xn+YnX+cX_n + Y_n \Rightarrow X + c.

Producto. Primero, cXncXcX_n \Rightarrow cX: φcXn(ξ)=φXn(cξ)φX(cξ)=φcX(ξ)\varphi_{cX_n}(\xi) = \varphi_{X_n}(c\xi) \to \varphi_X(c\xi) = \varphi_{cX}(\xi). A continuación,(Ync)Xn0(Y_n - c)X_n \to 0en probabilidad: las leyes delXnX_n son estrictas (su los cfs convergen a un cf; ver el paso de estanqueidad de Teorema 23.7), por lo que dado ε>0\varepsilon > 0 elige MM con P(Xn>M)ε\P(\abs{X_n} > M) \leq \varepsilon para todos los nn; entonces

P((Ync)Xn>ε)P(Xn>M)+P(Ync>εM)ε+o(1).\P\bigl(\abs{(Y_n - c)X_n} > \varepsilon\bigr) \leq \P(\abs{X_n} > M) + \P\Bigl(\abs{Y_n - c} > \frac{\varepsilon}{M}\Bigr) \leq \varepsilon + o(1) .

Escribiendo YnXn=cXn+(Ync)XnY_nX_n = cX_n + (Y_n - c)X_n y aplicando la suma parte (cuya prueba sólo utilizó Yn:=(Ync)Xn0Y_n' := (Y_n - c)X_n \to 0 en probabilidad, con constante 00): YnXncXY_nX_n \Rightarrow cX.

Solicitud. Por la fuerte ley de los grandes números (Teorema 22.13), p^np\hat p_n \to p a.s., entonces por continuidad σ^n=p^n(1p^n)σ=p(1p)>0\hat\sigma_n = \sqrt{\hat p_n(1 - \hat p_n)} \to \sigma = \sqrt{p(1 - p)} > 0 a.s., por lo tanto σσ^n1\frac{\sigma}{\hat\sigma_n} \to 1 en probabilidad. Slutsky actualizaciones de reglas de producto SnnpσnN(0,1)\frac{S_n - np}{\sigma\sqrt n} \Rightarrow \mathcal N(0,1)aSnnpσ^nn=σσ^nSnnpσnN(0,1)\frac{S_n - np}{\hat\sigma_n\sqrt n} = \frac{\sigma}{\hat\sigma_n}\cdot \frac{S_n - np}{\sigma\sqrt n} \Rightarrow \mathcal N(0,1): el intervalo de confianza usable p^n±1.96σ^n/n\hat p_n \pm 1.96\,\hat\sigma_n/\sqrt n, construido únicamente a partir de los datos, mantiene su nivel asintótico 95%95\%.

Ejercicio 23.9 ★★★

Deje XN(0,1)X \sim \mathcal N(0,1) y ε\varepsilon independiente con P(ε=±1)=12\P(\varepsilon = \pm1) = \frac12; establezca Y=εXY = \varepsilon X. (a) Mostrar YN(0,1)Y \sim \mathcal N(0,1) y Cov(X,Y)=0\operatorname{Cov}(X, Y) = 0. (b) Mostrar XX y YY son no independiente, y que (X,Y)(X, Y) no es un vector gaussiano (compute P(X+Y=0)\P(X + Y = 0)). (c) Moraleja: Teorema 23.11(2) requiere Gaussianidad conjunta — “gaussianos” no correlacionada” sola no prueba nada.

Solución

Solución de Ejercicio 23.9.

(a) Dividiendo el expectativa entre los dos valores de ε\varepsilon (independencia): para Borel BB, P(YB)=12P(XB)+12P(XB)=P(XB)\P(Y \in B) = \frac12\P(X \in B) + \frac12\P(-X \in B) = \P(X \in B), desde XX-X \sim X (N(0,1)\mathcal N(0,1) es simétrico): YN(0,1)Y \sim \mathcal N(0,1). YCov(X,Y)=E[εX2]=E[ε]E[X2]=01=0\operatorname{Cov}(X, Y) = \E[\varepsilon X^2] = \E[\varepsilon]\,\E[X^2] = 0 \cdot 1 = 0. (b) Y=X\abs Y = \abs X, entonces P(X1, Y2)=0\P(\abs X \leq 1,\ \abs Y \geq 2) = 0mientras queP(X1)P(Y2)>0\P(\abs X \leq 1)\,\P(\abs Y \geq 2) > 0: no independiente. Si (X,Y)(X, Y) fuera vector gaussiano, X+Y=(1+ε)XX + Y = (1 + \varepsilon)X sería una variable gaussiano real (Definición 23.10 con t=(1,1)t = (1,1)); pero P(X+Y=0)=P(ε=1)=12\P(X + Y = 0) = \P(\varepsilon = -1) = \frac12, mientras que un La variable gaussiano tiene un átomo solo si es a.s. constante — y X+YX + Y es igual a 2X02X \neq 0 a.s. en {ε=1}\{\varepsilon = 1\}. Contradicción: (X,Y)(X, Y) no es gaussiano. (c) Cada marginal es gaussiano y la covarianza desaparece, sin embargo, independencia falla — porque el par no está conjuntamente gaussiano. Teorema 23.11(2) no puede debilitarse a “gaussiano marginales”.

Ejercicio 23.10 ★★

La ley Cauchy tiene densidad 1π(1+x2)\frac1{\pi(1 + x^2)}. (a) Muestre que función característica es eξ\eu^{-\abs\xi} (Ejercicio 14.1 e inversión). (b) Demuestre que si X1,,XnX_1, \dots, X_n son i.i.d. Cauchy, entonces Snn\frac{S_n}n es nuevamente Cauchy — la ley mismo: la El promedio nunca se concentra. (c) Conciliar con las leyes de los grandes números y la CLT: ¿Qué hipótesis fallan? (Calcule EX1\E\abs{X_1}.)

Solución

Solución de Ejercicio 23.10.

(a) Ejercicio 14.1 calcula e^(ξ)=21+ξ2\widehat{\eu^{-\abs\cdot}}(\xi) = \frac{2}{1 + \xi^2}; ambos lados son integrable, inversión de Fourier (Teorema 14.5) convierte esto alrededor:

Reiξx ⁣dxπ(1+x2)=eξ,\int_\R\eu^{\iu\xi x}\,\frac{\dd x}{\pi(1 + x^2)} = \eu^{-\abs\xi},

que es exactamente φX(ξ)\varphi_X(\xi) para una variable de Cauchy XX. (b) Por independencia, φSn(ξ)=(eξ)n=enξ\varphi_{S_n}(\xi) = \bigl(\eu^{-\abs\xi}\bigr)^n = \eu^{-n\abs\xi}, entonces φSn/n(ξ)=φSn(ξ/n)=eξ\varphi_{S_n/n}(\xi) = \varphi_{S_n}(\xi/n) = \eu^{-\abs\xi}: la media empíricaSnn\frac{S_n}n es nuevamente Cauchy estándar para cada nn (inyectividad). el promedio nunca se concentra: sus fluctuaciones en el momento 10610^6 son los de una sola observación. (c) EX1=2π0x ⁣dx1+x2=+\E\abs{X_1} = \frac2\pi\int_0^\infty\frac{x\,\dd x}{1 + x^2} = +\infty: la ley de Cauchy no es integrable, por lo que la ley fuerte de los grandes números (Teorema 22.13) no se aplica y el CLT (que necesita una varianza finita) incluso menos. Aquí su las conclusiones realmente fallan, no sólo sus pruebas. Verificación de coherencia: φ(ξ)=eξ\varphi(\xi) = \eu^{-\abs\xi} no es diferenciable en 00, como Proposición 23.2(c) leer predice de manera contrapositiva un no integrable variable.

Ejercicio 23.11 ★★

(Leyes estables en embrión) Sea (Xn)(X_n) i.i.d. estándar Cauchy (Ejercicio 23.10). (a) Demuestre que para cualquier a,b>0a, b > 0, aX1+bX2aX_1 + bX_2 tiene la ley de (a+b)X1(a + b)X_1: la familia Cauchy es estrictamente estable de índice 11. (b) Demuestre que la familia gaussiano es estrictamente estable de índice 22: aX1+bX2a2+b2X1aX_1 + bX_2 \sim \sqrt{a^2 + b^2}\,X_1 para XiX_i i.i.d. N(0,1)\mathcal N(0,1). (c) Explique, vía funciones características del formulario ecξα\eu^{-c\abs\xi^\alpha}, por qué la estabilidad del índice-α\alpha fuerza la normalización n1/αn^{1/\alpha} para sumas, y qué esto dice sobre las cuencas de atracción del CLT: que Las sumas i.i.d. pueden converger, después de una normalización afín, a una ¿Ley de Cauchy en lugar de una gaussiano?

Solución

Solución de Ejercicio 23.11.

(a) φaX1+bX2(ξ)=eaξebξ=e(a+b)ξ=φ(a+b)X1(ξ)\varphi_{aX_1 + bX_2}(\xi) = \eu^{-a\abs\xi}\eu^{-b\abs\xi} = \eu^{-(a+b)\abs\xi} = \varphi_{(a+b)X_1}(\xi) (independencia y Ejercicio 23.10); La inyectividad identifica las leyes.

(b) φaX1+bX2(ξ)=ea2ξ2/2eb2ξ2/2=e(a2+b2)ξ2/2\varphi_{aX_1+bX_2}(\xi) = \eu^{-a^2\xi^2/2} \eu^{-b^2\xi^2/2} = \eu^{-(a^2+b^2)\xi^2/2}: la ley de a2+b2X1\sqrt{a^2+b^2}\,X_1.

(c) Si φX(ξ)=ecξα\varphi_X(\xi) = \eu^{-c\abs\xi^\alpha}, entonces Sn=X1++XnS_n = X_1 + \dots + X_n tiene φSn=ecnξα\varphi_{S_n} = \eu^{-cn\abs\xi^\alpha}ySn/n1/αS_n/n^{1/\alpha} tiene φ(ξ)=ecξα\varphi(\xi) = \eu^{-c\abs\xi^\alpha} nuevamente: exacto autorreproducción bajo la escala n1/αn^{1/\alpha}n\sqrt n para gaussiano (α=2\alpha = 2), nn para Cauchy (α=1\alpha = 1, Ejercicio 23.10(b)). una suma de i.i.d. variables sólo pueden converger (después de afines normalización) a una ley que es estable bajo tal convoluciones; el CLT dice que la varianza finita obliga a Cuenca gaussiano, y la cuenca Cauchy está reservada a las leyes. con colas tan pesadas que EX2=\E X^2 = \infty e incluso EX=\E\abs X = \infty — por ejemplo, sumas de las propias variables de Cauchy. La universalidad tiene varias islas, indexadas por la cola. exponente α(0,2]\alpha \in \intoc02.

Ejercicio 23.12 ★★

(La función de distribución empírica) Sea (Xn)(X_n) i.i.d. con función de distribución FF y Fn(t)=1n#{kn:Xkt}F_n(t) = \frac1n\#\{k \leq n : X_k \leq t\}. (a) Reparar tt. Muestra que nFn(t)B(n,F(t))n F_n(t) \sim \mathcal B(n, F(t)), que Fn(t)F(t)F_n(t) \to F(t) a.s. (Teorema 22.13), y eso

n(Fn(t)F(t))N(0, F(t)(1F(t))).\sqrt n\,\bigl(F_n(t) - F(t)\bigr) \Longrightarrow \mathcal N\bigl(0,\ F(t)(1 - F(t))\bigr) .

(b) ¿En qué tt es máxima la varianza asintótica? Interpretar: la mediana es donde se encuentra una distribución empírica más difícil de precisar. (c) Para FF continuo, demuestre que la ley de suptFn(t)F(t)\sup_t\abs{F_n(t) - F(t)} no depende de FF (reduce to uniform variables via Ejercicio 22.1) — la distribución gratuita milagro detrás del test de Kolmogorov-Smirnov; sin cálculo de esa ley se pregunta.

Solución

Solución de Ejercicio 23.12.

(a) Los indicadores 1Xkt\mathbf 1_{X_k \leq t} son i.i.d. Bernoulli del parámetro p=F(t)p = F(t): su suma nFn(t)nF_n(t) es binomio B(n,p)\mathcal B(n, p); la ley fuerte otorga Fn(t)pF_n(t) \to p a.s., y el CLT (Teorema 23.8) aplicado a los mismos indicadores (variación p(1p)p(1-p)) dan lo indicado Límite gaussiano.

(b) p(1p)p(1 - p) es máximo en p=12p = \frac12, es decir, donde F(t)=12F(t) = \frac12: en el mediana. estimando la cola probabilidades es asintóticamente fácil (varianza 0\to 0 como p0,1p \to 0, 1); la región mediana tiene la mayor ruido estadístico: la curva empírica se tambalea más en su medio.

(c) Para continuo FF, las variables Uk=F(Xk)U_k = F(X_k) son i.i.d. uniforme en (0,1)\intoo01 (Ejercicio 22.1), y monotonicidad de FF da, escribiendo GnG_n para el Función de distribución empírica del UkU_k:

suptRFn(t)F(t)=supuimFGn(u)u=supu[0,1]Gn(u)u:\sup_{t\in\R}\,\abs{F_n(t) - F(t)} = \sup_{u \in \operatorname{im}F}\,\abs{G_n(u) - u} = \sup_{u\in\intcc01}\abs{G_n(u) - u} :

la primera igualdad porque {Xkt}={UkF(t)}\{X_k \leq t\} = \{U_k \leq F(t)\} hasta eventos nulos (monotonicidad; desigualdad estricta puede fallar solo en las partes planas de FF, donde ambos lados no cambian), y el segundo porque un continuo FF, que va desde 00 a 11, alcanza todos los valores de (0,1)\intoo01 (teorema del valor intermedio) y los puntos finales no agregue nada (Gn(0)0=0G_n(0) - 0 = 0 y Gn(1)1=0G_n(1) - 1 = 0). el el lado derecho involucra solo uniformes: una ley para todos FF — por lo que una sola tabla de valores críticos (que de la distribución de Kolmogorov) pruebas cualquier continuo modelo contra datos.

23.6 Problema: la prueba de Lindeberg del CLT, con una tarifa

Problema 23.1

Problema del fin de semana — el método de reemplazo

Lindeberg (1922) demostró el teorema del límite central mediante una idea de una sencillez que desarma: swap the summands one at a time for gaussianos y controla cada swap mediante una Taylor expansión. El método no necesita análisis de Fourier, produce una tasa de error explícito y hoy impulsa las pruebas de universalidad a través de la teoría de la probabilidad. Sea (Xi)(X_i) i.i.d., centrado, V(X1)=1\V(X_1) = 1, con β=EX13<\beta = \E\abs{X_1}^3 < \infty; dejar (Ni)(N_i) sea i.i.d. N(0,1)\mathcal N(0,1), independiente del XiX_i (existencia: Teorema 22.6). conjunto

Tn=X1++Xnn,Gn=N1++NnnN(0,1).T_n = \frac{X_1 + \dots + X_n}{\sqrt n}, \qquad G_n = \frac{N_1 + \dots + N_n}{\sqrt n} \sim \mathcal N(0,1).

Parte I — The swapping identity. Reparar fCb3(R)f \in \mathcal C^3_b(\R) (tres continuo acotados derivados; M3=supfM_3 = \sup\abs{f'''}). Para 0in0 \leq i \leq n definir las sumas híbridas

Hi=X1++Xi+Ni+1++Nnn,H_i = \frac{X_1 + \dots + X_i + N_{i+1} + \dots + N_n}{\sqrt n},

entonces Hn=TnH_n = T_n y H0=GnH_0 = G_n.

  1. Escriba Hi=Wi+XinH_i = W_i + \frac{X_i}{\sqrt n} y Hi1=Wi+NinH_{i-1} = W_i + \frac{N_i}{\sqrt n}conWi=1n(j<iXj+j>iNj)W_i = \frac{1}{\sqrt n}\bigl(\sum_{j<i}X_j + \sum_{j>i}N_j\bigr)y observe queWiW_i es independiente del par (Xi,Ni)(X_i, N_i). Justificar.
  2. Taylor con resto integral o Lagrange: para cualquier reales w,hw, h:

    f(w+h)f(w)f(w)h12f(w)h2M3h36.\Bigl|f(w + h) - f(w) - f'(w)h - \tfrac12f''(w)h^2\Bigr| \leq \frac{M_3\,\abs h^3}{6} .
  3. Aplicar la pregunta 2 dos veces (h=Xinh = \frac{X_i}{\sqrt n} y h=Ninh = \frac{N_i}{\sqrt n} en w=Wiw = W_i), tome esperanzas de heredar y utilice independencia más el correspondiente de los dos primeros momentos de XiX_i y NiN_i para mostrar

    Ef(Hi)Ef(Hi1)M36β+γn3/2,γ=EN13=22π.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{M_3}{6}\cdot \frac{\beta + \gamma}{n^{3/2}}, \qquad \gamma = \E\abs{N_1}^3 = \frac{2\sqrt2}{\sqrt\pi} .

    Telescopio

  4. sobre ii y concluir el Lindeberg atado:

    Ef(Tn)Ef(Gn)M3(β+γ)6n.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .

Parte II — From smooth ff to the CLT.

  1. Muestre que Ef(Tn)Ef(N)\E f(T_n) \to \E f(N) para cada fCb3f \in \mathcal C_b^3 y actualice a todos los límites continuo ff: dados tales ff y ε\varepsilon, construir fεCb3f_\varepsilon \in \mathcal C^3_b con ffεε\norm{f - f_\varepsilon}_\infty \leq \varepsilon en un intervalo grande — por ejemplo convoluciona ff con un C\mathcal C^\infty golpe (Teorema 12.9) — y manejar el colas por tensión (V(Tn)=1\V(T_n) = 1 y Chebyshev). Concluye TnN(0,1)T_n \Rightarrow \mathcal N(0, 1): el Teorema del límite central, nuevamente demostrado.
  2. ¿De dónde se utilizó la prueba de que están los XiX_i? idénticamente distribuido? Demuestra que apenas hizo: indicar y probar la versión para independiente, centrado, no idéntico XiX_i con iV(Xi)=sn2\sum_i\V(X_i) = s_n^2 y terceros momentos, obteniendo el error M36sn3i(EXi3+V(Xi)3/2γ)\frac{M_3}{6s_n^3}\sum_i\bigl(\E\abs{X_i}^3 + \V(X_i)^{3/2}\gamma\bigr) — Lindeberg es cierto teorema en su forma de Lyapunov.

Parte III — Quantitative dividends.

  1. (Funciones de distribución) Dejemos que tRt \in \R y aproximado 1(,t]\mathbf 1_{\intoc{-\infty}t} arriba y abajo por Cb3\mathcal C^3_b rampas de ancho δ\delta (constrúyalos, con M3=O(δ3)M_3 = O(\delta^{-3})). Combinando con la Parte I, obtenga la cota de dos términos

    suptRP(Tnt)Φ(t)    C1(β+γ)δ3n+C2δ(every δ>0),\sup_{t\in\R}\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \;\leq\; \frac{C_1(\beta + \gamma)}{\delta^3\sqrt n} + C_2\,\delta \qquad (\text{every } \delta > 0),

    con constantes explícitas (el término C2δC_2\delta usa que Φ\Phi tiene densidad delimitado por 12π\frac1{\sqrt{2\pi}}) y optimice δn1/8\delta \sim n^{-1/8} para obtener una tasa uniforme de pedidos. n1/8n^{-1/8}. (El n1/2n^{-1/2} óptimo — Berry–Esseen — necesita herramientas más finas; el punto es un explícito tasa de intercambio elemental.)

  2. (De Moivre–Laplace, cuantificado) Especializarse en Xi=2Bi1X_i = 2B_i - 1 (signos de monedas justas): comparar el conclusión con la estimación local de Problema 11.1, pregunta 7 — ¿qué significa ¿Cada método da lo que el otro no?
  3. (Universalidad) Explique en un párrafo por qué El método de reemplazo muestra más que el CLT: cualquier estadístico de la forma Ef(sum)\E f(\text{sum}) con ff suave es insensible, en la orden n1/2n^{-1/2}, a la toda la ley de las demandas más allá de su primera dos momentos: el "principio de invariancia" que subyace a los resultados modernos de universalidad (aleatorios matrices, polinomios aleatorios), de los cuales el CLT es la primera instancia.

Parte IV — Smoothing, pushed: better rates. La pérdida de n1/2n^{-1/2} (suave ff) a n1/8n^{-1/8} (funciones de distribución) provienen de la carga ff''' en norma sup. Los híbridos pueden reparar parte de ello: ellos contienen comandos gaussiano y gaussianos liso.

  1. (Un gaussiano oculto) Para 1in11 \leq i \leq n - 1, h=Xinh = \frac{X_i}{\sqrt n}oNin\frac{N_i}{\sqrt n}, y θ[0,1]\theta \in \intcc01, escriba Wi+θh=A+ZW_i + \theta h = A + ZconZ=Ni+1++NnnZ = \frac{N_{i+1} + \dots + N_n}{\sqrt n}. Demuestre queZN(0,nin)Z \sim \mathcal N\bigl(0, \frac{n-i}n\bigr)es independiente del par(A,h)(A, h)y deduzca, para cada continuogL1(R)g \in L^1(\R),

    E[h3g(Wi+θh)]    n2π(ni)  gL1  Eh3.\E\bigl[\abs h^3\,\abs{g(W_i + \theta h)}\bigr] \;\leq\; \sqrt{\frac{n}{2\pi(n - i)}}\; \norm{g}_{L^1}\;\E\abs h^3 .
  2. Combina la pregunta 10 con la forma integral de la Resto de Taylor,

    f(w+h)=f(w)+f(w)h+12f(w)h2+01(1θ)22f(w+θh)h3 ⁣dθ,f(w + h) = f(w) + f'(w)h + \tfrac12f''(w)h^2 + \int_0^1\frac{(1 - \theta)^2}2\,f'''(w + \theta h)\,h^3\,\dd\theta,

    para rehacer las preguntas 3–4: para fCb3f \in \mathcal C^3_b con además fL1(R)f''' \in L^1(\R),

    Ef(Tn)Ef(Gn)β+γ32πfL1n+M3(β+γ)6n3/2\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot \frac{\norm{f'''}_{L^1}}{\sqrt n} + \frac{M_3(\beta + \gamma)}{6\,n^{3/2}}

    (question 10 handles the swaps in1i \leq n - 1 — use m=1n1m1/22n\sum_{m=1}^{n-1}m^{-1/2} \leq 2\sqrt n — and question 3’s crude bound handles the last one). Comprueba que las rampas de la pregunta 7 satisfacen ψδL1=K1δ2\norm{\psi_\delta'''}_{L^1} = K_1\delta^{-2} mientras M3=Kδ3M_3 = K\delta^{-3}, aliméntalos y optimizar δ\delta: el uniforme La tasa de función de distribución mejora a O(n1/6)O(n^{-1/6}).

  3. (Coincidencia de un momento más) Supongamos además EX13=0\E X_1^3 = 0yβ4=EX14<\beta_4 = \E X_1^4 < \infty. Calcule EN13\E N_1^3 y EN14\E N_1^4, expanda al cuarto orden, y probar en la misma línea que el la tasa de función de distribución se convierte en O(n1/4)O(n^{-1/4}) (now ψδ(4)L1=K2δ3\norm{\psi_\delta^{(4)}}_{L^1} = K_2\delta^{-3}andM4=Kδ4M_4 = K'\delta^{-4}; choose δ=n1/4\delta = n^{-1/4}).
  4. (La obstrucción) Supongamos que los primeros kk momentos de X1X_1 concuerda con los gaussiano (k=2k = 2 siempre; k=3k = 3 exactamente cuando EX13=0\E X_1^3 = 0; k4k \geq 4 esencialmente nunca, como EN14=3\E N_1^4 = 3). verificar que el esquema de las preguntas 10 a 12 ofrece la tasa de función de distribución n(k1)/(2k+2)n^{-(k-1)/(2k+2)}, equilibrando δkn(k1)/2\delta^{-k}n^{-(k-1)/2} contra δ\delta, y observe que el exponente se aproxima a la Berry: valor visto 12\frac12 solo como kk \to \infty. Explique en unas pocas frases por qué El método de swap se satura: cada swap se carga en valor absoluto, mientras que la ruta de Fourier (El método para suavizar la desigualdad de Esseen) explota la oscilación de la función característica diferencia y llega a Cβn1/2C\beta n^{-1/2} con tres sólo momentos.

Part V — Two dimensions: the multidimensional CLT, by swapping. Ahora deja que el XiX_i sea i.i.d. vectores aleatorio centrado de R2\R^2 con matriz de covarianza Σ\Sigma y β=EX13<\beta' = \E\norm{X_1}^3 < \infty (norma euclidiana).

  1. (Vectores gaussianos, bajo pedido) Diagonalizar Σ=PDPT\Sigma = PDP^{\mathsf T} (Ejercicio 20.8) y establezca C=PDPTC = P\sqrt DP^{\mathsf T}. Para Z=(Z1,Z2)Z = (Z^1, Z^2) un par de independiente estándar gaussianos (Teorema 22.6), muestra que N=CZN = CZ es un vector gaussiano (Definición 23.10) de la media 00, covarianza Σ\Sigma, con γ=EN3<\gamma' = \E\norm N^3 < \infty; y queGn=N1++NnnG_n = \frac{N_1 + \dots + N_n}{\sqrt n}tiene leyN(0,Σ)\mathcal N(0, \Sigma) exactamente para i.i.d. copias NiN_i.
  2. (Taylor en dos variables) Para f ⁣:R2Rf \colon \R^2 \to \Rde claseC3\mathcal C^3conM3=maxα=3supαf<M_3 = \max_{\abs\alpha = 3}\sup\abs{\partial^\alpha f} < \infty, demostrar

    f(w+h)f(w)f(w),h12h,D2f(w)hM36(h1+h2)32M33h3\Bigl|f(w + h) - f(w) - \langle\nabla f(w), h\rangle - \tfrac12\langle h, D^2f(w)\,h\rangle \Bigr| \leq \frac{M_3}6\,\bigl(\abs{h_1} + \abs{h_2}\bigr)^3 \leq \frac{\sqrt2\,M_3}3\, \norm h^3

    (study tf(w+th)t \mapsto f(w + th) on [0,1]\intcc01).

  3. (El CLT en R2\R^2) Ejecute el esquema de reemplazo en los híbridos vectoriales HiH_i: muestran que el primero y el términos de segundo orden se cancelan (medias y covarianzas) coincidencia), telescopio y actualización como en la pregunta 5 (tensión de ETn2=trΣ\E\norm{T_n}^2 = \operatorname{tr}\Sigma; apaciguamiento ahora en R2\R^2, Teorema 12.9) a concluir: para cada continuo f ⁣:R2Rf \colon \R^2 \to \R acotado,

    Ef(X1++Xnn)Ef(N),NN(0,Σ):\E\,f\Bigl(\frac{X_1 + \dots + X_n}{\sqrt n}\Bigr) \longrightarrow \E\,f(N), \qquad N \sim \mathcal N(0, \Sigma) :

    Teorema 23.12 en dimensión 22, con un tasa para ff suave y sin análisis de Fourier.

  4. (Cramér–Wold y una fluctuación conjunta) Deducir que t,SnnN(0,tTΣt)\langle t, \frac{S_n}{\sqrt n}\rangle \Rightarrow \mathcal N(0, t^{\mathsf T}\Sigma t) por cada tR2t \in \R^2 fijo. Aplicación: para i.i.d. real (ξi)(\xi_i), centrado, Eξ12=1\E\xi_1^2 = 1, Eξ16<\E\xi_1^6 < \infty (para que la Parte V se aplique a Vi=(ξi,ξi21)V_i = (\xi_i, \xi_i^2 - 1)), mostrar

    1n(inξi, in(ξi21))N(0,(1Eξ13Eξ13Eξ141)):\frac1{\sqrt n}\Bigl(\sum_{i\leq n}\xi_i,\ \sum_{i\leq n}(\xi_i^2 - 1)\Bigr) \Longrightarrow \mathcal N\Bigl(0, \begin{pmatrix} 1 & \E\xi_1^3\\ \E\xi_1^3 & \E\xi_1^4 - 1\end{pmatrix}\Bigr) :

    media empírica y segundo momento empírico fluctúan conjuntamente de forma gaussiana — independientemente en el límite si y sólo si Eξ13=0\E\xi_1^3 = 0 (Teorema 23.11).

Part VI — The delta method.

  1. Sea (θ^n)(\hat\theta_n) variables aleatorias con n(θ^nθ)N(0,σ2)\sqrt n(\hat\theta_n - \theta) \Rightarrow \mathcal N(0, \sigma^2) para un parámetro real θ\theta, y sea gg diferenciable en θ\theta. Pruebe el método delta:

    n(g(θ^n)g(θ))N(0,g(θ)2σ2)\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr) \Longrightarrow \mathcal N\bigl(0, g'(\theta)^2\sigma^2\bigr)

    (write g(x)g(θ)=(g(θ)+η(x))(xθ)g(x) - g(\theta) = (g'(\theta) + \eta(x))(x - \theta)withη0\eta \to 0 at θ\theta; show θ^nθ\hat\theta_n \to \theta, then η(θ^n)0\eta(\hat\theta_n) \to 0, in probability; finish with Slutsky, Ejercicio 23.8, and Ejercicio 23.4(b)).

  2. Aplicaciones. (a) Para i.i.d. real (ξi)(\xi_i) con media μ\mu y varianza σ2\sigma^2, y Xˉn=1ninξi\bar X_n = \frac1n\sum_{i\leq n}\xi_i: muestran(Xˉn2μ2)N(0,4μ2σ2)\sqrt n(\bar X_n^2 - \mu^2) \Rightarrow \mathcal N(0, 4\mu^2\sigma^2)cuandoμ0\mu \neq 0, y eso para μ=0\mu = 0 la afirmación correcta vive en otro escala: nXˉn2σ2N2n\bar X_n^2 \Rightarrow \sigma^2N^2 con NN(0,1)N \sim \mathcal N(0,1) (identifique el límite función de distribución). (b) (Varianza estabilización) Para p^n\hat p_n la frecuencia de éxito de una muestra B(1,p)\mathcal B(1, p), p(0,1)p \in \intoo01: mostrar que g(p)=arcsinpg(p) = \arcsin\sqrt p satisface

    n(g(p^n)g(p))N(0,14)\sqrt n\,\bigl(g(\hat p_n) - g(p)\bigr) \Longrightarrow \mathcal N\Bigl(0, \frac14\Bigr)

    lo que pp — una barra de error asintótica libre del parámetro desconocido; comparar con Ejemplo 23.9.

Part VII — Poisson, by the same method: Le Cam’s theorem. El reemplazo conoce una segunda universalidad clase: sumas de muchos eventos independiente extraño. Para leyes sobre N\N la distancia correcta es variación total,

dTV(μ,ν)=supANμ(A)ν(A).d_{\mathrm{TV}}(\mu, \nu) = \sup_{A\subseteq\N}\, \abs{\mu(A) - \nu(A)} .
  1. Demuestre que dTV(μ,ν)=12k0μ({k})ν({k})d_{\mathrm{TV}}(\mu, \nu) = \frac12\sum_{k\geq0}\abs{\mu(\{k\}) - \nu(\{k\})} y pruebe el vínculo del acoplamiento: para cualquier par (X,Y)(X, Y) de variables aleatorias con leyes μ\mu y ν\nu en el mismo espacio, dTV(μ,ν)P(XY)d_{\mathrm{TV}}(\mu, \nu) \leq \P(X \neq Y).
  2. Calcule exactamente, para p(0,1)p \in \intoo01:

    dTV(B(1,p),P(p))=p(1ep)p2.d_{\mathrm{TV}}\bigl(\mathcal B(1, p), \mathcal P(p)\bigr) = p\bigl(1 - \eu^{-p}\bigr) \leq p^2 .
  3. (Le Cam, mediante intercambio) Deja que XiB(1,pi)X_i \sim \mathcal B(1, p_i)yYiP(pi)Y_i \sim \mathcal P(p_i), el2n2n variablesindependiente; S=X1++XnS = X_1 + \dots + X_n, y recordar Y1++YnP(λ)Y_1 + \dots + Y_n \sim \mathcal P(\lambda) con λ=ipi\lambda = \sum_ip_i (Ejercicio 23.1). Intercambiar una coordenada a la vez en el número entero híbridos Hi=Y1++Yi+Xi+1++XnH_i = Y_1 + \dots + Y_i + X_{i+1} + \dots + X_n: mostrar, por cadaANA \subseteq \N,

    P(Hi1A)P(HiA)dTV(B(1,pi),P(pi)),\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} \leq d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal P(p_i)\bigr),

    y concluir La desigualdad de Le Cam:

    dTV(law of S, P(λ))i=1npi2.d_{\mathrm{TV}}\bigl(\text{law of } S,\ \mathcal P(\lambda)\bigr) \leq \sum_{i=1}^np_i^2 .
  4. Dividendos. (a) Para pi=λnp_i = \frac\lambda n: el obligado es λ2n\frac{\lambda^2}n — la ley de lo raro eventos (Ejercicio 23.5) actualizados a un tasa explícita, uniforme en todos los eventos y válida para pip_i desigual también. (b) Las letras 500500 son entregados, cada uno extraviándose independientemente con probabilidad 1500\frac1{500}: acotó el error del modelo de Poisson del parámetro 11 y estimar el Probabilidad de que ninguna letra se extravíe. (c) Cerrar El problema: comparar las dos clases de universalidad. se reunieron aquí — gaussiano (muchos pequeños dispersos contribuciones; dos momentos coincidentes; Taylor) y Poisson (muchas contribuciones raras; una significa emparejado; un acoplamiento exacto de variación total) — y el método de reemplazo único detrás de ambos.
  5. (Error relativo y transformación del registro) Let (Xn)(X_n) ser i.i.d., positivo, media μ>0\mu > 0, varianza σ2\sigma^2 y Xˉn\bar X_n la media empírica. Mostrar por el método delta que

    n(lnXˉnlnμ)N(0, σ2μ2):\sqrt n\,\bigl(\ln\bar X_n - \ln\mu\bigr) \Longrightarrow \mathcal N\Bigl(0,\ \frac{\sigma^2}{\mu^2}\Bigr) :

    el parámetro asintótico de lnXˉn\ln\bar X_n es el coeficiente de variación σ/μ\sigma/\mu — error relativo, sin escala. Deducir un 95%95\% intervalo de confianza para μ\mu del multiplicativo formulario Xˉne±1.96σ/(μn)\bar X_n\cdot\eu^{\pm1.96\,\sigma/(\mu\sqrt n)}, y explique cuándo es preferible al uno aditivo.

  6. (El tercer momento dirige el error) Para XX \sim Bernoulli(pp) centrado, calcule E[(Xp)3]=p(1p)(12p)\E\bigl[(X - p)^3\bigr] = p(1-p)(1-2p). Utilizando el análisis de la Parte IV (el error de intercambio se debe a terceros momentos), explique ¿Por qué la aproximación normal de B(n,p)\mathcal B(n, p)? es asimétrico para p12p \neq \frac12 — sobrepasando por un lado, insuficiente por el otro — y por qué p=12p = \frac12 disfruta de la velocidad de momento coincidente más rápida. Verifique numéricamente el signo del sesgo en B(20,0.1)\mathcal B(20, 0.1)conN(2,1.8)\mathcal N(2, 1.8): compare P(S=0)=0.920\P(S = 0) = 0.9^{20} con la masa gaussiano de (,0.5)\intoo{-\infty}{0.5}.
Solución

Solución de Problema 23.1.

1. La familia (X1,,Xn,N1,,Nn)(X_1, \dots, X_n, N_1, \dots, N_n) es independiente: los dos bloques son independiente de cada uno otros por construcción y cada bloque es i.i.d. WiW_i es un función medible de las variables (Xj)j<i(X_j)_{j<i} y Sólo (Nj)j>i(N_j)_{j>i}, todos distintos de XiX_i y NiN_i: por el principio de coalición (Teorema 22.5), WiW_i es independiente del par (Xi,Ni)(X_i, N_i). las descomposiciones Hi=Wi+XinH_i = W_i + \frac{X_i}{\sqrt n} y Hi1=Wi+NinH_{i-1} = W_i + \frac{N_i}{\sqrt n} son inmediatos a partir de las definiciones: pasar de HiH_i a Hi1H_{i-1} intercambia el comando único XiX_i para NiN_i.

2. Taylor–Lagrange en el pedido 33: hay cc entre ww y w+hw + h con f(w+h)=f(w)+f(w)h+12f(w)h2+16f(c)h3f(w + h) = f(w) + f'(w)h + \frac12f''(w)h^2 + \frac16f'''(c)h^3, yf(c)M3\abs{f'''(c)} \leq M_3 da el límite.

3. Restando las dos expansiones en el común punto base w=Wiw = W_i:

f(Hi)f(Hi1)=f(Wi)XiNin+f(Wi)2Xi2Ni2n+Ri,RiM36Xi3+Ni3n3/2.f(H_i) - f(H_{i-1}) = f'(W_i)\,\frac{X_i - N_i}{\sqrt n} + \frac{f''(W_i)}{2}\,\frac{X_i^2 - N_i^2}{n} + R_i, \qquad \abs{R_i} \leq \frac{M_3}{6}\cdot \frac{\abs{X_i}^3 + \abs{N_i}^3}{n^{3/2}} .

Tome esperanzas de heredar. Por pregunta 1, f(Wi)f'(W_i) y f(Wi)f''(W_i) son independiente de (Xi,Ni)(X_i, N_i), por lo que los esperanzas de heredar mixtos factor:

E[f(Wi)XiNin]=E[f(Wi)]EXiENin=0,E[f(Wi)Xi2Ni2n]=E[f(Wi)]11n=0:\begin{align*} \E\Bigl[f'(W_i)\,\frac{X_i - N_i}{\sqrt n}\Bigr] &= \E\bigl[f'(W_i)\bigr]\,\frac{\E X_i - \E N_i}{\sqrt n} = 0, \\ \E\Bigl[f''(W_i)\,\frac{X_i^2 - N_i^2}{n}\Bigr] &= \E\bigl[f''(W_i)\bigr]\,\frac{1 - 1}{n} = 0 : \end{align*}

los dos primeros momentos de XiX_i y NiN_i fósforo, y sólo sobrevive el resto:

Ef(Hi)Ef(Hi1)ERiM36β+γn3/2.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \E\abs{R_i} \leq \frac{M_3}{6}\cdot\frac{\beta + \gamma}{n^{3/2}} .

El tercer momento gaussiano: γ=EN13=20x3ex2/22π ⁣dx=22π02ueu ⁣du=42π=22π\gamma = \E\abs{N_1}^3 = 2\int_0^\infty x^3\,\frac{\eu^{-x^2/2}}{\sqrt{2\pi}}\,\dd x = \frac{2}{\sqrt{2\pi}}\int_0^\infty 2u\,\eu^{-u}\dd u = \frac{4}{\sqrt{2\pi}} = \frac{2\sqrt2}{\sqrt\pi} (sustitución u=x2/2u = x^2/2, luego Γ(2)=1\Gamma(2) = 1).

4. Telescópico Ef(Tn)Ef(Gn)=i=1n(Ef(Hi)Ef(Hi1))\E f(T_n) - \E f(G_n) = \sum_{i=1}^n\bigl(\E f(H_i) - \E f(H_{i-1})\bigr) y aplicando la pregunta 3 a cada uno de los términos nn:

Ef(Tn)Ef(Gn)nM3(β+γ)6n3/2=M3(β+γ)6n.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq n \cdot \frac{M_3(\beta + \gamma)}{6\,n^{3/2}} = \frac{M_3\,(\beta + \gamma)}{6\,\sqrt n} .

5. GnG_n es N(0,1)\mathcal N(0,1) exactamente para cada nn (una suma normalizada de independiente estándar gaussianos, Ejercicio 23.3), entonces Ef(Gn)=Ef(N)\E f(G_n) = \E f(N) y la pregunta 4 dice Ef(Tn)Ef(N)M3(β+γ)6n0\abs{\E f(T_n) - \E f(N)} \leq \frac{M_3(\beta+\gamma)}{6\sqrt n} \to 0parafCb3f \in \mathcal C^3_b. Mejora. Dejemos queff esté acotado continuo, M=supfM = \sup\abs f, ε>0\varepsilon > 0. Elija A1A \geq 1con1A2ε\frac1{A^2} \leq \varepsilon: Chebyshev con V(Tn)=1\V(T_n) = 1 da P(Tn>A)ε\P(\abs{T_n} > A) \leq \varepsilon para todos los nn, y también P(N>A)ε\P(\abs N > A) \leq \varepsilon. Sea χ\chi C\mathcal C^\infty con 1[A,A]χ1[A1,A+1]\mathbf 1_{\intcc{-A}A} \leq \chi \leq \mathbf 1_{\intcc{-A-1}{A+1}} (una meseta lisa, construida por apaciguando 1[A12,A+12]\mathbf 1_{\intcc{-A-\frac12}{A+\frac12}}, Teorema 12.9); g=fχg = f\chi es continuo con soporte compacto, por lo tanto uniformemente continuo, por lo que es la apaciguamiento gη=gρηg_\eta = g * \rho_\eta es C\mathcal C^\infty con derivadas acotadas de todos los órdenes y ggηε\norm{g - g_\eta}_\infty \leq \varepsilon para η\eta lo suficientemente pequeño. Para T=TnT = T_n o NN, desde f=gf = g en adelante [A,A]\intcc{-A}A y fg2M\abs{f - g} \leq 2M en todas partes:

Ef(T)Egη(T)E(fg)(T)+ggη2MP(T>A)+ε(2M+1)ε.\bigl|\E f(T) - \E g_\eta(T)\bigr| \leq \E\abs{(f - g)(T)} + \norm{g - g_\eta}_\infty \leq 2M\,\P(\abs T > A) + \varepsilon \leq (2M + 1)\,\varepsilon .

Combinando con Egη(Tn)Egη(N)\E g_\eta(T_n) \to \E g_\eta(N) (pregunta Se aplica 4: gηCb3g_\eta \in \mathcal C^3_b):

lim supn  Ef(Tn)Ef(N)2(2M+1)ε,\limsup_n\;\bigl|\E f(T_n) - \E f(N)\bigr| \leq 2(2M + 1)\,\varepsilon ,

y ε\varepsilon era arbitrario: Ef(Tn)Ef(N)\E f(T_n) \to \E f(N) para cada continuo ff acotado, es decir, TnN(0,1)T_n \Rightarrow \mathcal N(0,1).

6. Distribución idéntica ingresada sólo por uno frase: “XiX_i y NiN_i tienen los mismos dos primeros momentos”. Entonces, dejemos que X1,,XnX_1, \dots, X_n sea independiente, centrado, con variaciones σi2\sigma_i^2 y tercio finito momentos, sn2=iσi2>0s_n^2 = \sum_i\sigma_i^2 > 0, y toma NiN(0,σi2)N_i \sim \mathcal N(0, \sigma_i^2) independiente de todo. Definir los híbridos con normalización sns_n: Hi=1sn(jiXj+j>iNj)H_i = \frac1{s_n}(\sum_{j\leq i}X_j + \sum_{j>i}N_j). en el ii-ésimo intercambio, EXi=ENi=0\E X_i = \E N_i = 0 y EXi2=ENi2=σi2\E X_i^2 = \E N_i^2 = \sigma_i^2nuevamente eliminan los términosff'yff'', y el resto da (usando ENi3=σi3γ\E\abs{N_i}^3 = \sigma_i^3\gamma por escala):

Ef(Hi)Ef(Hi1)M36sn3(EXi3+σi3γ).\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{M_3}{6\,s_n^3}\bigl(\E\abs{X_i}^3 + \sigma_i^3\gamma\bigr) .

Telescópico:

Ef(X1++Xnsn)Ef(N)M36sn3i=1n(EXi3+V(Xi)3/2γ).\Bigl|\E f\Bigl(\frac{X_1 + \dots + X_n}{s_n}\Bigr) - \E f(N)\Bigr| \leq \frac{M_3}{6\,s_n^3}\sum_{i=1}^n \Bigl(\E\abs{X_i}^3 + \V(X_i)^{3/2}\,\gamma\Bigr) .

Desde σi3=(EXi2)3/2EXi3\sigma_i^3 = (\E X_i^2)^{3/2} \leq \E\abs{X_i}^3 (la desigualdad potencia-media, es decir, Jensen para tt3/2t \mapsto t^{3/2}aplicado aXi2X_i^2), el lado derecho es como máximo M3(1+γ)6iEXi3sn3\frac{M_3(1 + \gamma)}{6}\cdot \frac{\sum_i\E\abs{X_i}^3}{s_n^3}: bajo Lyapunov condición 1sn3iEXi30\frac1{s_n^3}\sum_i\E\abs{X_i}^3 \to 0, el sumas normalizadas convergen en ley a N(0,1)\mathcal N(0,1) — el CLT sin distribución idéntica.

7. Vamos ρCc((0,1))\rho \in \mathcal C^\infty_c(\intoo01) con ρ=1\int\rho = 1 y establezca ψ(x)=x1ρ(s) ⁣ds\psi(x) = \int_x^1\rho(s)\dd s:ψ\psiesC\mathcal C^\infty, no creciente,ψ=1\psi = 1 en R\R_-, ψ=0\psi = 0 en [1,)\intco1\infty; deja K=ψK = \norm{\psi'''}_\infty. ParatRt \in \Ryδ>0\delta > 0 definir ψδ(x)=ψ(xtδ)\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta\bigr) y ψ~δ(x)=ψ(xtδ+1)\tilde\psi_\delta(x) = \psi\bigl(\frac{x - t}\delta + 1\bigr): estos sonCb3\mathcal C^3_b con tercera derivada delimitado por K/δ3K/\delta^3, y

1(,tδ]ψ~δ1(,t]ψδ1(,t+δ].\mathbf 1_{\intoc{-\infty}{t-\delta}} \leq \tilde\psi_\delta \leq \mathbf 1_{\intoc{-\infty}t} \leq \psi_\delta \leq \mathbf 1_{\intoc{-\infty}{t+\delta}} .

Límite superior: por la pregunta 4 aplicada a ψδ\psi_\delta (con M3=K/δ3M_3 = K/\delta^3),

P(Tnt)Eψδ(Tn)Eψδ(N)+K(β+γ)6δ3nΦ(t+δ)+K(β+γ)6δ3nΦ(t)+δ2π+K(β+γ)6δ3n,\P(T_n \leq t) \leq \E\psi_\delta(T_n) \leq \E\psi_\delta(N) + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n} \leq \Phi(t + \delta) + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n} \leq \Phi(t) + \frac{\delta}{\sqrt{2\pi}} + \frac{K(\beta + \gamma)}{6\,\delta^3\sqrt n},

porque Φ\Phi es Lipschitz con constante 12π\frac1{\sqrt{2\pi}} (su densidad está delimitado por 12π\frac1{\sqrt{2\pi}}). El límite inferior simétrico a través de ψ~δ\tilde\psi_\delta da la estimación de dos términos

suptRP(Tnt)Φ(t)K(β+γ)61δ3n+δ2π(δ>0 arbitrary).\sup_{t\in\R}\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq \frac{K(\beta + \gamma)}{6}\cdot\frac{1}{\delta^3\sqrt n} + \frac{\delta}{\sqrt{2\pi}} \qquad(\delta > 0\ \text{arbitrary}).

Los dos términos se equilibran cuando δ3n1/2δ\delta^{-3}n^{-1/2} \asymp \delta, es decir δ=n1/8\delta = n^{-1/8}: ambos son entonces O(n1/8)O(n^{-1/8}), una tarifa uniforme explícita válida para cada nn. (La tasa óptima de Berry–Esseen Cβ/nC\beta/\sqrt n requiere que Fourier suavice la desigualdad; intercambio de operaciones nitidez para la elementalidad completo.)

8. Para Xi=2Bi1X_i = 2B_i - 1 (señales de feria): centrado, variación 11 y Xi=1\abs{X_i} = 1, por lo que β=1\beta = 1. Pregunta 7 luego limita suptP(Snnt)Φ(t)\sup_t\abs{\P(\frac{S_n}{\sqrt n} \leq t) - \Phi(t)} explícita y uniformemente para cada finito nn — una declaración global, no asintótica, sobre la función de distribución. La estimación local de Problema 11.1, pregunta 7, da en cambio la información exacta asintóticas de un átomo individual, P(S2n=2k)ek2/nπn\P(S_{2n} = 2k) \sim \frac{\eu^{-k^2/n}}{\sqrt{\pi n}}: se resuelve probabilidades de tamaño n1/2n^{-1/2}, muy por debajo de las preguntas 7 Resolución n1/8n^{-1/8}, pero es puntual, asintótica. (sin error explícito en nn fijo) y vinculado a esto ley reticular particular. Precisión local versus global Uniformidad: los dos métodos son complementarios y la suma. la estimación local sobre k[ ⁣[an,bn] ⁣]k \in \intint{a\sqrt n}{b\sqrt n} recupera a De Moivre–Laplace en intervalos — con un tono más agudo tasa, pero sólo para esta ley.

9. El argumento del intercambio no usó nada sobre la ley. del XiX_i más allá de EXi=0\E X_i = 0, EXi2=1\E X_i^2 = 1 y el finitud de EXi3\E\abs{X_i}^3: si hubiéramos reemplazado el gaussianos NiN_i por cualquier otra familia i.i.d. con los mismos dos primeros momentos y tercer momento finito, el mismo telescopado obligado Ef(sumX)Ef(sumY)\abs{\E f(\text{sum}_X) - \E f(\text{sum}_Y)} por O(n1/2)O(n^{-1/2}) para cada ff suave. Estadísticas fluidas de grandes sumas independiente son, por lo tanto, universal: hasta un error cuantificado, dependen únicamente de la ley de los sumandos a través de dos números. Este es el principio de invariancia: demostrar un teorema límite para la ley más computable (la gaussiano, donde todo es exacto), luego transfiérelo a todas las leyes mediante intercambio. El mismo esquema — con sumas reemplazadas por funcionales más elaborados — impulsa el semicírculo de Wigner ley para matrices aleatorias, la universalidad de las raíces aleatorias polinomios y gran parte de la probabilidad moderna; el central El teorema del límite es su primer y más simple ejemplo.

10. ZZ es una función Borel de (Ni+1,,Nn)(N_{i+1}, \dots, N_n)únicamente, mientras queA=Wi+θhZA = W_i + \theta h - Zyhh son funciones del resto de variables del independiente familia (X1,,Xn,N1,,Nn)(X_1, \dots, X_n, N_1, \dots, N_n): por el principio de coalición (Teorema 22.5), ZZ es independiente de (A,h)(A, h). Como suma del independiente Nj/nN(0,1n)N_j/\sqrt n \sim \mathcal N(0, \frac1n), ZN(0,s2)Z \sim \mathcal N(0, s^2)cons2=nins^2 = \frac{n-i}n (Ejercicio 23.3), con densidad delimitado por 1s2π\frac1{s\sqrt{2\pi}}. la ley de ((A,h),Z)((A, h), Z) es el producto de las dos leyes marginales, por lo que Tonelli (transferencia) congela el primer bloque: con G(a)=Eg(a+Z)=g(a+z)φs(z) ⁣dzgL1s2πG(a) = \E\abs{g(a + Z)} = \int\abs{g(a + z)}\,\varphi_s(z)\,\dd z \leq \frac{\norm g_{L^1}}{s\sqrt{2\pi}}por cadaaa,

E[h3g(A+Z)]=E[h3G(A)]gL1s2πEh3=n2π(ni)gL1Eh3.\E\bigl[\abs h^3\abs{g(A + Z)}\bigr] = \E\bigl[\abs h^3\,G(A)\bigr] \leq \frac{\norm g_{L^1}}{s\sqrt{2\pi}}\,\E\abs h^3 = \sqrt{\frac{n}{2\pi(n-i)}}\,\norm g_{L^1}\,\E\abs h^3 .

11. La forma integral de la fórmula de Taylor sigue integrando f(w+h)f(w)=h01f(w+θh) ⁣dθf(w + h) - f(w) = h\int_0^1f'(w + \theta h)\,\dd\theta por partes dos veces en θ\theta. Tomando esperanzas de heredar en el intercambio ii, el los pedidos 0,1,20, 1, 2 se cancelan exactamente como en la pregunta 3, y el dos restos (para h=Xi/nh = X_i/\sqrt n y Ni/nN_i/\sqrt n) están delimitados, para in1i \leq n - 1, por pregunta 10 con g=fg = f''':

Ef(Hi)Ef(Hi1)01(1θ)22 ⁣dθ  n2π(ni)fL1β+γn3/2=β+γ6n3/2n2π(ni)fL1.\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \int_0^1\frac{(1-\theta)^2}2\,\dd\theta\; \sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1} \frac{\beta + \gamma}{n^{3/2}} = \frac{\beta + \gamma}{6\,n^{3/2}} \sqrt{\frac{n}{2\pi(n-i)}}\,\norm{f'''}_{L^1} .

Sumando, con i=1n1nni=nm=1n1m1/22n\sum_{i=1}^{n-1}\sqrt{\frac n{n-i}} = \sqrt n\sum_{m=1}^{n-1}m^{-1/2} \leq 2n, y sumando La pregunta 3 está destinada al último intercambio (i=ni = n, no gaussiano izquierda):

Ef(Tn)Ef(Gn)β+γ32πfL1n+M3(β+γ)6n3/2.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta + \gamma}{3\sqrt{2\pi}}\cdot \frac{\norm{f'''}_{L^1}}{\sqrt n} + \frac{M_3(\beta + \gamma)}{6\,n^{3/2}} .

Rampas: ψδ(x)=δ3ψ(xtδ)\psi_\delta'''(x) = \delta^{-3}\psi'''\bigl(\frac{x - t}\delta\bigr), entonces M3=Kδ3M_3 = K\delta^{-3} con K=ψK = \norm{\psi'''}_\infty y ψδL1=δ2ψL1=K1δ2\norm{\psi_\delta'''}_{L^1} = \delta^{-2} \norm{\psi'''}_{L^1} = K_1\delta^{-2} (sustitución). el sándwich de la pregunta 7 luego da

suptP(Tnt)Φ(t)K1(β+γ)32π1δ2n+K(β+γ)61δ3n3/2+δ2π.\sup_t\,\bigl|\P(T_n \leq t) - \Phi(t)\bigr| \leq \frac{K_1(\beta + \gamma)}{3\sqrt{2\pi}}\cdot \frac1{\delta^2\sqrt n} + \frac{K(\beta + \gamma)}{6}\cdot \frac1{\delta^3n^{3/2}} + \frac\delta{\sqrt{2\pi}} .

En δ=n1/6\delta = n^{-1/6} los términos primero y tercero son O(n1/6)O(n^{-1/6}) y el del medio O(n1)O(n^{-1}): un uniforme califica O(n1/6)O(n^{-1/6}), estrictamente mejor que la pregunta 7 n1/8n^{-1/8} — la mitad gaussiano del híbrido hizo lo mismo suavizado adicional.

12. EN13=0\E N_1^3 = 0 (integrando impar), y integración por partes da EN14=3EN12=3\E N_1^4 = 3\,\E N_1^2 = 3 (x3xφ(x) ⁣dx=3x2φ\int x^3\cdot x\varphi(x)\dd x = 3\int x^2\varphi). Paraffde claseC4\mathcal C^4 con derivados acotados, expanden cada swap al cuarto orden: el Los términos de tercer orden llevan el factor EXi3ENi3=0\E X_i^3 - \E N_i^3 = 0 (independencia los factoriza como en la pregunta 3), por lo que solo el resto de cuarto orden 01(1θ)36f(4)(w+θh)h4 ⁣dθ\int_0^1\frac{(1-\theta)^3}6f^{(4)}(w + \theta h)h^4\dd\thetasobrevive, con01(1θ)36 ⁣dθ=124\int_0^1 \frac{(1-\theta)^3}6\dd\theta = \frac1{24}yEh4=β4n2\E h^4 = \beta_4n^{-2}o3n23n^{-2}. La pregunta 10 (cong=f(4)g = f^{(4)}) limita los swapsin1i \leq n - 1 y suma como en la pregunta 11:

Ef(Tn)Ef(Gn)β4+3122πf(4)L1n+M4(β4+3)24n2.\bigl|\E f(T_n) - \E f(G_n)\bigr| \leq \frac{\beta_4 + 3}{12\sqrt{2\pi}}\cdot \frac{\norm{f^{(4)}}_{L^1}}{n} + \frac{M_4(\beta_4 + 3)}{24\,n^2} .

Con ψδ(4)L1=K2δ3\norm{\psi_\delta^{(4)}}_{L^1} = K_2\delta^{-3} y M4=Kδ4M_4 = K'\delta^{-4}, la función de distribución vinculada se convierte en Cδ3n1+Cδ4n2+δ2πC\delta^{-3}n^{-1} + C'\delta^{-4}n^{-2} + \frac\delta{\sqrt{2\pi}}; enδ=n1/4\delta = n^{-1/4} el Los términos externos son O(n1/4)O(n^{-1/4}) y el medio O(n1)O(n^{-1}): tasa O(n1/4)O(n^{-1/4}).

13. Con kk momentos coincidentes los supervivientes el resto por swap es del orden Ehk+1n(k+1)/2\E\abs h^{k+1} \asymp n^{-(k+1)/2}; los cargos encuadernados gaussiano oculto f(k+1)L1\norm{f^{(k+1)}}_{L^1} y la suma de los swaps aporta el factor 2n2n, dando f(k+1)L1n(k1)/2\asymp\norm{f^{(k+1)}}_{L^1}\, n^{-(k-1)/2}paraff suave. Costo de las rampas ψδ(k+1)L1δk\norm{\psi_\delta^{(k+1)}}_{L^1} \asymp \delta^{-k}, entonces el error de la función de distribución es δkn(k1)/2+δ\asymp \delta^{-k}n^{-(k-1)/2} + \delta, equilibrado enδ=n(k1)/(2k+2)\delta = n^{-(k-1)/(2k+2)}: tasan(k1)/(2k+2)n^{-(k-1)/(2k+2)}, que es n1/6n^{-1/6} para k=2k = 2, n1/4n^{-1/4} para k=3k = 3 y tiende a n1/2n^{-1/2} solo como kk \to \infty — pero k4k \geq 4 forzaría EX14=3\E X_1^4 = 3 y más allá, es decir, una ley que Ya imita al gaussiano. La saturación es estructural: el intercambio agrega errores de intercambio nn en valor absoluto, renunciando a toda cancelación entre intercambios. La prueba de Fourier compara funciones características, donde aparecen los errores con sus fases oscilantes; El suavizado de la desigualdad de Esseen convierte φTnφN\abs{\varphi_{T_n} - \varphi_N}, integrado contra ⁣dξξ\frac{\dd\xi}{\abs\xi}, en una función de distribución limitada sólo logarítmicamente costo y entrega el Cβn1/2C\beta n^{-1/2} de Berry-Esseen desde tres momentos. Optimidad de las operaciones de reemplazo para robustez — y, como muestra la Parte VII, para la portabilidad.

14. Σ\Sigma es semidefinido positivo simétrico; con Σ=PDPT\Sigma = PDP^{\mathsf T} (PP ortogonal, D0D \geq 0 diagonal, Ejercicio 20.8), el simétrico C=PDPTC = P\sqrt DP^{\mathsf T}satisfaceC2=ΣC^2 = \Sigma. Para cualquiertR2t \in \R^2,t,CZ=Ct,Z=(Ct)1Z1+(Ct)2Z2\langle t, CZ\rangle = \langle Ct, Z\rangle = (Ct)_1Z^1 + (Ct)_2Z^2 es una combinación lineal de independiente gaussianos, por lo tanto gaussiano (Ejercicio 23.3): N=CZN = CZ es un vector gaussiano; es la media es 00 y su covarianza E[NNT]=CE[ZZT]CT=CCT=Σ\E[NN^{\mathsf T}] = C\,\E[ZZ^{\mathsf T}]\,C^{\mathsf T} = CC^{\mathsf T} = \Sigma. Momentos:N3(N1+N2)34(N13+N23)\norm N^3 \leq (\abs{N_1} + \abs{N_2})^3 \leq 4(\abs{N_1}^3 + \abs{N_2}^3) (convexidad de x3x^3 en R+\R_+), y cada coordenada es un real gaussiano con momentos de todos los pedidos. (Ejercicio 11.10): γ<\gamma' < \infty. Finalmente cada t,Gn=1nit,Ni\langle t, G_n\rangle = \frac1{\sqrt n}\sum_i\langle t, N_i\rangle es una suma normalizada de i.i.d. N(0,tTΣt)\mathcal N(0, t^{\mathsf T}\Sigma t), por lo tanto exactamente N(0,tTΣt)\mathcal N(0, t^{\mathsf T}\Sigma t): GnG_n es un vector gaussiano con media 00 y covarianza Σ\Sigma, y su ley es N(0,Σ)\mathcal N(0, \Sigma) (Definición 23.10: la ley está determinada por estos datos).

15. Dejemos que ϕ(t)=f(w+th)\phi(t) = f(w + th), t[0,1]t \in \intcc01: ϕ\phi es C3\mathcal C^3 con

ϕ(t)=j,k,l{1,2}jklf(w+th)hjhkhl,ϕ(t)M3(jhj)3=M3(h1+h2)3.\phi'''(t) = \sum_{j,k,l\in\{1,2\}}\partial_{jkl}f(w + th)\,h_jh_kh_l, \qquad \abs{\phi'''(t)} \leq M_3\Bigl(\sum_j\abs{h_j}\Bigr)^3 = M_3(\abs{h_1} + \abs{h_2})^3 .

Taylor–Lagrange en el pedido 33 para ϕ\phi entre 00 y 11 da la primera desigualdad; Cauchy–Schwarz da h1+h22h\abs{h_1} + \abs{h_2} \leq \sqrt2\norm h, de donde el constante 22M36=2M33\frac{2\sqrt2M_3}6 = \frac{\sqrt2M_3}3.

16. Defina HiH_i y WiW_i como en la pregunta 1, ahora en R2\R^2; el argumento de la coalición no ha cambiado. en el ii-ésimo intercambio, los términos de primer orden dan jE[jf(Wi)](EXi,jENi,j)/n=0\sum_j\E[\partial_jf(W_i)]\,(\E X_{i,j} - \E N_{i,j})/ \sqrt n = 0 y los términos de segundo orden dan 12nj,kE[jkf(Wi)](ΣjkΣjk)=0\frac1{2n}\sum_{j,k}\E[\partial_{jk}f(W_i)]\,(\Sigma_{jk} - \Sigma_{jk}) = 0: coincidencia de medias y covarianzas. Pregunta 15 acota los dos restos:

Ef(Hi)Ef(Hi1)2M33EXi3+ENi3n3/2=2M3(β+γ)3n3/2,\bigl|\E f(H_i) - \E f(H_{i-1})\bigr| \leq \frac{\sqrt2M_3}3\cdot\frac{\E\norm{X_i}^3 + \E\norm{N_i}^3}{n^{3/2}} = \frac{\sqrt2M_3(\beta' + \gamma')}{3\,n^{3/2}},

y telescópico sobre los intercambios nn:

Ef(Snn)Ef(Gn)2M3(β+γ)3n,GnN(0,Σ) exactly.\Bigl|\E f\Bigl(\frac{S_n}{\sqrt n}\Bigr) - \E f(G_n)\Bigr| \leq \frac{\sqrt2\,M_3(\beta' + \gamma')}{3\sqrt n}, \qquad G_n \sim \mathcal N(0, \Sigma)\ \text{exactly} .

Actualización: ETn2=EX12=trΣ\E\norm{T_n}^2 = \E\norm{X_1}^2 = \operatorname{tr}\Sigma (los términos cruzados desaparecen independencia y centrado), entonces P(Tn>A)trΣ/A2\P(\norm{T_n} > A) \leq \operatorname{tr}\Sigma/A^2, y lo mismo paraNN: tirantez. Dado un continuo ff y ε>0\varepsilon > 0acotados, multiplíquelo por una meseta suaveχ\chiigual a11 en la bola de radio AA y apoyada en radio A+1A + 1 (apaciguar un indicador en R2\R^2, Teorema 12.9); g=fχg = f\chi es uniformemente continuo con soporte compacto, por lo que es bidimensional apaciguamiento gηg_\eta es C\mathcal C^\infty con límites derivados de todas las órdenes y ggηε\norm{g - g_\eta}_\infty \leq \varepsilonpara las pequeñasη\eta. Los tres-ε\varepsilon La cadena de la pregunta 5 luego se transfiere textualmente: Ef(Tn)Ef(N)\E f(T_n) \to \E f(N)para cada continuof ⁣:R2Rf \colon \R^2 \to \Racotado. Este es Teorema 23.12 parad=2d = 2, ahora demostrado — cambiando el lado bidimensional teorema de Lévy que el capítulo había dejado admitido.

17. Para continuo g ⁣:RRg \colon \R \to \R acotado, la aplicación xg(t,x)x \mapsto g(\langle t, x\rangle) está acotado continuo en R2\R^2, por lo que la pregunta 16 da Eg(t,Tn)Eg(t,N)\E g(\langle t, T_n\rangle) \to \E g(\langle t, N\rangle): cada la proyección converge en distribución, y t,NN(0,tTΣt)\langle t, N\rangle \sim \mathcal N(0, t^{\mathsf T}\Sigma t). (Este es la dirección fácil de Cramér–Wold: convergencia conjunta implica convergencia de todas las imágenes lineales). Aplicación: Vi=(ξi,ξi21)V_i = (\xi_i, \xi_i^2 - 1) son vectores centrados en i.i.d. (Eξ12=1\E\xi_1^2 = 1), con entradas de covarianza V(ξ1)=1\V(\xi_1) = 1,Cov(ξ1,ξ121)=Eξ13\operatorname{Cov}(\xi_1, \xi_1^2 - 1) = \E\xi_1^3 y V(ξ121)=Eξ141\V(\xi_1^2 - 1) = \E\xi_1^4 - 1; el tercer momento EV134(Eξ13+Eξ1213)\E\norm{V_1}^3 \leq 4\bigl(\E\abs{\xi_1}^3 + \E\abs{\xi_1^2 - 1}^3\bigr)es finito cuandoξ1L6\xi_1 \in L^6. La pregunta 16 produce la articulación mostrada gaussiano límite, y Teorema 23.11(2): los dos Las coordenadas límite son independiente exactamente cuando el la covarianza Eξ13\E\xi_1^3 desaparece — para leyes simétricas, desacoplamiento de la media empírica y la varianza empírica asintóticamente.

18. Escriba g(x)g(θ)=(g(θ)+η(x))(xθ)g(x) - g(\theta) = (g'(\theta) + \eta(x))(x - \theta)dondeη(x)=g(x)g(θ)xθg(θ)\eta(x) = \frac{g(x) - g(\theta)}{x - \theta} - g'(\theta)paraxθx \neq \theta y η(θ)=0\eta(\theta) = 0: diferenciabilidad en θ\theta significa precisamente η(x)0\eta(x) \to 0 como xθx \to \theta. Paso 1: θ^nθ\hat\theta_n \to \theta en probabilidad: para ε>0\varepsilon > 0 y cualquier A>0A > 0, eventualmente εnA\varepsilon\sqrt n \geq A, entonces P(θ^nθ>ε)P(n(θ^nθ)>A)P(σN>A)\P(\abs{\hat\theta_n - \theta} > \varepsilon) \leq \P(\abs{\sqrt n(\hat\theta_n - \theta)} > A) \to \P(\sigma\abs N > A) (las funciones de distribución convergen en los puntos continuidad ±A\pm A), y el lado derecho tiende a 00 como AA \to \infty. Paso 2:η(θ^n)0\eta(\hat\theta_n) \to 0 en probabilidad: dado ε>0\varepsilon' > 0, elija δ\delta con ηε\abs\eta \leq \varepsilon' en xθδ\abs{x - \theta} \leq \delta; luegoP(η(θ^n)>ε)P(θ^nθ>δ)0\P(\abs{\eta(\hat\theta_n)} > \varepsilon') \leq \P(\abs{\hat\theta_n - \theta} > \delta) \to 0. Paso 3:

n(g(θ^n)g(θ))=g(θ)n(θ^nθ)+η(θ^n)n(θ^nθ).\sqrt n\bigl(g(\hat\theta_n) - g(\theta)\bigr) = g'(\theta)\,\sqrt n(\hat\theta_n - \theta) + \eta(\hat\theta_n)\cdot\sqrt n(\hat\theta_n - \theta) .

Por la regla del producto de Slutsky (Ejercicio 23.8, con el secuencia η(θ^n)0\eta(\hat\theta_n) \to 0 en probabilidad y la convergente político n(θ^nθ)\sqrt n(\hat\theta_n - \theta)), el el segundo término converge en ley a 0N(0,σ2)=00\cdot\mathcal N(0, \sigma^2) = 0, por lo tanto a00 en probabilidad (Ejercicio 23.4(b)); el primero converge en derecho a g(θ)N(0,σ2)g'(\theta)\mathcal N(0, \sigma^2) (Slutsky otra vez, o el regla afín para funciones características); suma de slutsky La regla los reúne: el límite es N(0,g(θ)2σ2)\mathcal N(0, g'(\theta)^2\sigma^2).

19. (a) El CLT da n(Xˉnμ)N(0,σ2)\sqrt n(\bar X_n - \mu) \Rightarrow \mathcal N(0, \sigma^2); el método delta con g(x)=x2g(x) = x^2, g(μ)=2μg'(\mu) = 2\mu, da n(Xˉn2μ2)N(0,4μ2σ2)\sqrt n(\bar X_n^2 - \mu^2) \Rightarrow \mathcal N(0, 4\mu^2\sigma^2) — degenerar (límite 00) cuando μ=0\mu = 0. en ese caso la fluctuación vive una escala hacia arriba: nXˉn2=(nXˉn)2n\bar X_n^2 = (\sqrt n\,\bar X_n)^2, y parat>0t > 0

P(nXˉn2t)=P(tnXˉnt)Φ(tσ)Φ(tσ)=P(σ2N2t):\P\bigl(n\bar X_n^2 \leq t\bigr) = \P\bigl(-\sqrt t \leq \sqrt n\,\bar X_n \leq \sqrt t\bigr) \longrightarrow \Phi\Bigl(\frac{\sqrt t}\sigma\Bigr) - \Phi\Bigl(-\frac{\sqrt t}\sigma\Bigr) = \P(\sigma^2N^2 \leq t) :

nXˉn2σ2N2n\bar X_n^2 \Rightarrow \sigma^2N^2, el cuadrado de un gaussiano (una ley de “chi-cuadrado”) — cuando la primera derivada muere, el término de segundo orden de Taylor dicta un límite no gaussiano. (b) Aquí n(p^np)N(0,p(1p))\sqrt n(\hat p_n - p) \Rightarrow \mathcal N(0, p(1 - p))yg(p)=arcsinpg(p) = \arcsin\sqrt ptieneng(p)=12p(1p)g'(p) = \frac1{2\sqrt{p(1 - p)}}, entonces g(p)2p(1p)=14g'(p)^2\,p(1 - p) = \frac14: el límite es N(0,14)\mathcal N(0, \frac14)por cadap(0,1)p \in \intoo01. en el En la escala arcsin\arcsin, la barra de error asintótica 95%95\% es ±0.98n\pm \frac{0.98}{\sqrt n}, conocida de antemano — mientras que en Ejemplo 23.9 el ancho involucraba lo desconocido σ=p(1p)\sigma = \sqrt{p(1-p)}, en el peor de los casos por 12\frac12 o estimado: la transformación estabiliza la variación.

20. Vamos A={k:μ({k})>ν({k})}A^* = \{k : \mu(\{k\}) > \nu(\{k\})\} y Δk=μ({k})ν({k})\Delta_k = \mu(\{k\}) - \nu(\{k\}), entonces kΔk=0\sum_k\Delta_k = 0. Para cualquier ANA \subseteq \N: μ(A)ν(A)=kAΔkkAΔk\mu(A) - \nu(A) = \sum_{k\in A}\Delta_k \leq \sum_{k\in A^*}\Delta_k, con igualdad enA=AA = A^*; y desde el las partes positivas y negativas de (Δk)(\Delta_k) tienen iguales masa total, AΔk=12kΔk\sum_{A^*}\Delta_k = \frac12\sum_k\abs{\Delta_k}. Intercambio de manijasμ,ν\mu, \nu el cartel: dTV(μ,ν)=12kΔkd_{\mathrm{TV}}(\mu, \nu) = \frac12\sum_k\abs{\Delta_k}. Acoplamiento: para cualquierAA,

μ(A)ν(A)=E[1A(X)1A(Y)]=E[(1A(X)1A(Y))1XY]P(XY),\mu(A) - \nu(A) = \E\bigl[\mathbf 1_A(X) - \mathbf 1_A(Y)\bigr] = \E\bigl[(\mathbf 1_A(X) - \mathbf 1_A(Y))\,\mathbf 1_{X\neq Y}\bigr] \leq \P(X \neq Y),

y toma el supremum sobre AA.

21. Las dos leyes cargan: k=0k = 0: 1p1 - p versus ep\eu^{-p}, con ep>1p\eu^{-p} > 1 - p; k=1k = 1: pp versus pep<pp\,\eu^{-p} < p; k2k \geq 2: 00 contra el Poisson resto 1eppep01 - \eu^{-p} - p\eu^{-p} \geq 0. Por lo tanto

dTV=12[(ep1+p)+(ppep)+(1eppep)]=12(2p2pep)=p(1ep),d_{\mathrm{TV}} = \tfrac12\bigl[(\eu^{-p} - 1 + p) + (p - p\eu^{-p}) + (1 - \eu^{-p} - p\eu^{-p})\bigr] = \tfrac12\bigl(2p - 2p\eu^{-p}\bigr) = p(1 - \eu^{-p}),

y 1epp1 - \eu^{-p} \leq p da el p2p^2 cota.

22. Escriba Hi1=Wi+XiH_{i-1} = W_i + X_i y Hi=Wi+YiH_i = W_i + Y_iconWi=j<iYj+j>iXjW_i = \sum_{j<i}Y_j + \sum_{j>i}X_j, independiente del par (Xi,Yi)(X_i, Y_i) (coaliciones). Para ANA \subseteq \N, condicionado a los valores contables por independencia,

P(Hi1A)=k0P(Xi=k)P(Wi+kA),\P(H_{i-1} \in A) = \sum_{k\geq0}\P(X_i = k)\,\P(W_i + k \in A),

y lo mismo para HiH_i con YiY_i. Restando, con ck=P(Wi+kA)[0,1]c_k = \P(W_i + k \in A) \in \intcc01yΔk=P(Xi=k)P(Yi=k)\Delta_k = \P(X_i = k) - \P(Y_i = k) de suma cero:

P(Hi1A)P(HiA)=kΔk(ck12)12kΔk=dTV(B(1,pi),P(pi)).\abs{\P(H_{i-1} \in A) - \P(H_i \in A)} = \Bigl|\sum_k\Delta_k\bigl(c_k - \tfrac12\bigr)\Bigr| \leq \tfrac12\sum_k\abs{\Delta_k} = d_{\mathrm{TV}}\bigl(\mathcal B(1, p_i), \mathcal P(p_i)\bigr) .

Telescópico de H0=SH_0 = S a Hn=iYiP(λ)H_n = \sum_iY_i \sim \mathcal P(\lambda) (Ejercicio 23.1, iterado) y usando la pregunta 21:

P(SA)P(P(λ)A)i=1npi(1epi)i=1npi2for every A:\abs{\P(S \in A) - \P(\mathcal P(\lambda) \in A)} \leq \sum_{i=1}^np_i\bigl(1 - \eu^{-p_i}\bigr) \leq \sum_{i=1}^np_i^2 \qquad\text{for every } A :

La desigualdad de Le Cam. (El vínculo de acoplamiento de la pregunta 20 da una Ruta alternativa: acoplar cada pareja en un uniforme. variable para que P(XiYi)pi2\P(X_i \neq Y_i) \leq p_i^2 y enlazada P(SYi)\P(S \neq \sum Y_i); el intercambio no necesita construcción en todos.)

23. (a) Con pi=λnp_i = \frac\lambda n: dTV(law of S,P(λ))λ2nd_{\mathrm{TV}}(\text{law of }S, \mathcal P(\lambda)) \leq \frac{\lambda^2}n. Esto agudiza Ejercicio 23.5 tres veces: un error explícito en cada nn finito, uniformidad sobre todos los eventos AA a la vez (no un intervalo a la vez), y no hay necesidad de igual pip_i — solo ipi2\sum_ip_i^2 pequeño, por ejemplo pi2λmaxipi\sum p_i^2 \leq \lambda\max_ip_i: muchos eventos raros, ninguno dominante. (b) Aquí n=500n = 500, pi=1500p_i = \frac1{500}, λ=1\lambda = 1: el modelo de Poisson se equivoca como máximo 50015002=0.002500\cdot\frac1{500^2} = 0.002 en cada evento; en en particular, tomando A={0}A = \{0\},

P(no letter astray)=(11500)500,P(no letter astray)e10.002,\P(\text{no letter astray}) = \Bigl(1 - \frac1{500}\Bigr)^{500}, \qquad \Bigl|\P(\text{no letter astray}) - \eu^{-1}\Bigr| \leq 0.002,

entonces la respuesta es e10.368\eu^{-1} \approx 0.368 hasta un garantizado 0.0020.002 (la verdadera discrepancia es sobre 41044\cdot10^{-4}). (c) El El problema se cierra con un método con dos regímenes. Cuando nn contribuciones comparables cada una lleva variación 1n\frac1n, comparando momentos dos con el gaussiano comete los errores de swap o(1n)o(\frac1n) cada uno: se van las sumas gaussiano — con Taylor como herramienta de comparación local. Cuando las contribuciones nn son indicadores de probabilidad pip_i, comparando el significar con un átomo de Poisson hace que cada intercambio cueste pi2p_i^2: los recuentos de eventos raros van Poisson — con variación total como local exacto comparación. Mismos híbridos, mismo telescopio, diferentes locales estimación: el reemplazo es una estrategia, no un teorema, y los límites gaussiano y Poisson son sus dos más antiguos dividendos.

24. El CLT da n(Xˉnμ)N(0,σ2)\sqrt n(\bar X_n - \mu) \Rightarrow \mathcal N(0, \sigma^2)yg(x)=lnxg(x) = \ln x es diferenciable en μ>0\mu > 0 con g(μ)=1μg'(\mu) = \frac1\mu: el El método delta (Parte VI) produce n(lnXˉnlnμ)N(0,σ2/μ2)\sqrt n(\ln\bar X_n - \ln\mu) \Rightarrow \mathcal N(0, \sigma^2/\mu^2). Desenrollando el intervalo lnXˉnlnμ1.96σμn\abs{\ln\bar X_n - \ln\mu} \leq \frac{1.96\,\sigma}{\mu\sqrt n} por exponenciación:

μXˉne±1.96σ/(μn)with asymptotic probability 95%\mu \in \bar X_n\cdot \eu^{\pm1.96\,\sigma/(\mu\sqrt n)} \qquad\text{with asymptotic probability } 95\%

(en la práctica σ/μ\sigma/\mu se reemplaza por su empírico versión, Slutsky como en Ejercicio 23.8). el El intervalo multiplicativo es el natural cuando los datos son positivos con errores proporcionales a su tamaño — ingresos, concentraciones, vidas medias: cantidades que viven en una escala logarítmica, donde los intervalos aditivos simétricos podrían incluso cruzar el cero.

25.E[(Xp)3]=(1p)3p+(p)3(1p)=p(1p)[(1p)2p2]=p(1p)(12p)\E[(X - p)^3] = (1-p)^3p + (-p)^3(1 - p) = p(1-p)\bigl[(1-p)^2 - p^2\bigr] = p(1-p)(1 - 2p). en el análisis de intercambio (Parte IV), el término de error principal después hacer coincidir dos momentos lleva el tercero firmado momento: para p<12p < \frac12 es positivo (la ley se inclina derecha: raras excursiones grandes por encima de la media), y el la aproximación normal desplaza sistemáticamente la masa — subestimando la cola corta izquierda y sobreestimando la derecha — con error de orden n1/2n^{-1/2}; en p=12p = \frac12 se desvanece el tercer momento, los partidos de Bernoulli el gaussiano al tercer orden y la tasa mejora (Parte pregunta de momento coincidente de IV). Numéricamente: P(S=0)=0.920=0.1216\P(S = 0) = 0.9^{20} = 0.1216, mientras que gaussiano N(2,1.8)\mathcal N(2, 1.8) da Φ(0.521.8)=Φ(1.118)0.132\Phi\bigl(\frac{0.5 - 2}{\sqrt{1.8}}\bigr) = \Phi(-1.118) \approx 0.132: el curva normal, ignorante de la pared en 00 y de la sesgado hacia la derecha, pone demasiada masa en la parte inferior — el signo previsto del error, visible en n=20n = 20.