---
title: "Probabilidad: fundamentos y ley de los grandes números"
book: "Matemáticas universitarias — Grado 3"
subject: math
language: es
chapter: 22
exercises: 12
source: https://one-course.com/books/math/5/es/chapter/22-probabilidad-fundamentos-y-ley-de-los-grandes-numeros
---

# Capítulo 22 — Probabilidad: fundamentos y ley de los grandes números

En segundo año se construyó la probabilidad sobre espacios numerables; la teoría de la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) elimina ahora toda restricción. Un [espacio de probabilidad](#def-b3-probability-space) es un espacio medido de masa total $1$, las [variables aleatorias](#def-b3-probability-space) son aplicaciones [medibles](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable), la [esperanza](#def-b3-probability-space) es la integral de Lebesgue — y, de golpe, todo el arsenal analítico (el Capítulos [9](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#ch-b3-measure), [10](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ch-b3-lebesgue) y [11](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#ch-b3-product)) se aplica al azar. Este capítulo instala el diccionario, construye sucesiones infinitas de [variables aleatorias](#def-b3-probability-space) [independientes](#def-b3-probability-independence) (en $\intcc01$, a partir de dígitos binarios: el azar se esconde dentro de la [medida de Lebesgue](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-lebesgueouter)), demuestra los lemas de Borel–Cantelli y la [ley cero–uno](#thm-b3-probability-zeroone) de Kolmogorov, ordena los modos de convergencia y demuestra la [ley](#def-b3-probability-space) de los grandes números — el teorema que hace converger las frecuencias hacia las probabilidades y hace posible la estadística. El problema de fin de semana da la demostración de Etemadi de la [ley](#def-b3-probability-space) fuerte en su forma definitiva $L^1$.

## 22.1 El diccionario

**Definición 22.1.**

Un *espacio de probabilidad* es un espacio medido $(\Omega, \mathcal A, \P)$ con $\P(\Omega) =
1$; los elementos de $\mathcal A$ son *sucesos*, y una propiedad se cumple *casi seguramente* (c.s.) si su suceso tiene probabilidad $1$. Una *variable aleatoria* es una aplicación [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) $X \colon \Omega \to \R$ (o $\R^d$: un vector aleatorio); su *ley* es la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) de probabilidad imagen $\P_X =
X_*\P$ en $\R$ (el [Ejercicio 11.9](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-9)), determinada por la *función de distribución* $F_X(t) = \P(X \leq t)$ (el [Ejercicio 9.3](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#exo-b3-measure-3)). $X$ tiene *[densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma)* $f$ si $\P_X = f\,\dd\lambda$; es *discreta* si $\P_X$ es una combinación numerable de masas de Dirac. La *esperanza* es

$$
\E[X] = \int_\Omega X\,\dd\P
\qquad (X \geq 0 \text{ o } X \in L^1(\P)),
$$

y el *teorema de transferencia* (el [Ejercicio 11.9](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-9)) la calcula en la ley: $\E[g(X)] = \int_\R g\,\dd\P_X$ — $= \sum g(x_k)p_k$ en el caso discreto, $= \int
g(x)f(x)\dd x$ en el caso con [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma): las fórmulas de segundo año, ahora teoremas de una sola teoría. La *varianza* es $\V(X) =
\E[(X - \E X)^2] = \E[X^2] - (\E X)^2$ para $X \in L^2$.

**Ejemplo 22.2.**

Las [leyes](#def-b3-probability-space) estándar y sus transformadas destacables: Bernoulli $\mathcal B(p)$, binomial $\mathcal B(n, p)$, geométrica, Poisson $\mathcal P(\lambda)$ (discretas: las tablas de segundo año siguen siendo válidas); uniforme en $\intcc01$ (la propia [medida de Lebesgue](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-lebesgueouter)); exponencial $\mathcal E(\lambda)$ ([densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\lambda\eu^{-\lambda x}\mathbf 1_{x>0}$); la *gaussiana* $\mathcal N(m, \sigma^2)$ de [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\frac1{\sigma\sqrt{2\pi}}\exp\bigl(-\frac{(x -
m)^2}{2\sigma^2}\bigr)$ — una [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) de probabilidad por el [Problema 10.1](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#pb-b3-lebesgue-1), de media $m$ y varianza $\sigma^2$ (momentos gaussianos, el [Ejercicio 11.10](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-10)).

**Proposición 22.3 (Markov y Chebyshev).**

Para $X \geq 0$ y $a > 0$: $\P(X \geq a) \leq \frac{\E
X}{a}$; para $X \in L^2$: $\P\bigl(\abs{X - \E X} \geq
a\bigr) \leq \frac{\V(X)}{a^2}$.

**Demostración.** El [Ejercicio 10.5](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#exo-b3-lebesgue-5)(a); Chebyshev es Markov aplicado a $(X - \E X)^2$. ∎

## 22.2 Independencia

**Definición 22.4.**

Las sub-$\sigma$-álgebras $\mathcal A_1, \dots, \mathcal A_n
\subseteq \mathcal A$ son *independientes* si $\P(A_1\cap\dots\cap A_n) = \prod\P(A_i)$ para todos $A_i \in
\mathcal A_i$; los sucesos son independientes si lo son las $\sigma$-álgebras $\{\varnothing, A_i, A_i^c, \Omega\}$; las [variables aleatorias](#def-b3-probability-space) $X_1, \dots, X_n$ lo son si lo son las $\sigma$-álgebras $\sigma(X_i) =
X_i^{-1}(\mathcal B(\R))$. Una familia infinita es independiente si toda subfamilia finita lo es.

**Teorema 22.5.**

$X_1, \dots, X_n$ son [independientes](#def-b3-probability-independence) si y solo si la [ley](#def-b3-probability-space) del vector $(X_1, \dots, X_n)$ es la [medida producto](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#thm-b3-product-existence) $\P_{X_1}\otimes\cdots\otimes\P_{X_n}$. En tal caso, para $g_i \geq 0$ (o tales que los productos sean [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1)):

$$
\E\Bigl[\prod_ig_i(X_i)\Bigr] = \prod_i\E[g_i(X_i)],
$$

en particular, $\E[XY] = \E X\,\E Y$ y $\V(X_1 + \dots +
X_n) = \sum\V(X_i)$ para variables $L^2$ [independientes](#def-b3-probability-independence).

**Demostración.** Si las $X_i$ son [independientes](#def-b3-probability-independence), las dos [medidas](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) de probabilidad $\P_{(X_1,\dots,X_n)}$ y $\bigotimes\P_{X_i}$ coinciden en todos los productos $B_1\times\dots\times B_n$ de borelianos — un $\pi$-sistema que genera $\mathcal B(\R^n)$ (la [Proposición 11.2](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#prop-b3-product-sections)(b)) —, luego en todas partes (el [Teorema 9.7](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#thm-b3-measure-uniqueness)). Recíprocamente, una [ley](#def-b3-probability-space) producto factoriza todos los sucesos $\bigcap_iX_i^{-1}(B_i)$: [independencia](#def-b3-probability-independence). La fórmula de la [esperanza](#def-b3-probability-space) es entonces Tonelli/Fubini (el [Teorema 11.5](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#thm-b3-product-tonelli)) a través del teorema de transferencia; $\E[XY] = \E X\E Y$ es el caso $g_i =
\mathrm{id}$, y desarrollar el cuadrado da la aditividad de las varianzas (los términos cruzados son $\E[(X_i - \E X_i)(X_j - \E X_j)]
= 0$). ∎

**Teorema 22.6 (Existencia de sucesiones independientes).**

En $\bigl(\intcc01, \mathcal L, \lambda\bigr)$ existe una sucesión $(U_n)_{n\geq1}$ de [variables aleatorias](#def-b3-probability-space) [independientes](#def-b3-probability-independence), cada una uniforme en $\intcc01$. En consecuencia, para cualesquiera [leyes](#def-b3-probability-space) prescritas $(\mu_n)$ en $\R$ existen $(X_n)$ [independientes](#def-b3-probability-independence) con $\P_{X_n} = \mu_n$.

**Demostración.** *Dígitos.* Para $\omega \in \intcc01$, sean $(b_k(\omega))$ sus dígitos binarios ($\omega = \sum b_k2^{-k}$; elíjase el desarrollo que no termina en una cola de $1$ — la ambigüedad afecta solo a un conjunto numerable, luego nulo). Cada $b_k$ es una [variable aleatoria](#def-b3-probability-space) ($\{b_k = 1\}$ es una unión finita de intervalos diádicos) y el vector $(b_1, \dots, b_m)$ toma cada valor de $\{0,1\}^m$ en un intervalo diádico de longitud $2^{-m}$: los $b_k$ son Bernoulli$(\frac12)$ [independientes](#def-b3-probability-independence).

*Reagrupación.* Pártase $\N^*$ en infinitos conjuntos infinitos disjuntos $(I_n)$ (por ejemplo, mediante potencias de primos, o diagonales); sea $(k^n_j)_j$ una enumeración de $I_n$ y póngase

$$
U_n = \sum_{j\geq1} b_{k^n_j}\,2^{-j} .
$$

Cada $U_n$ es uniforme: sus dígitos binarios son bits equilibrados [independientes](#def-b3-probability-independence), de modo que $\P(U_n \in [l2^{-m}, (l+1)2^{-m})) = 2^{-m}$ para todo intervalo diádico, y los intervalos diádicos determinan la [ley](#def-b3-probability-space) (el [Teorema 9.7](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#thm-b3-measure-uniqueness)). Las $U_n$ son [independientes](#def-b3-probability-independence): son funciones de bloques disjuntos de la familia independiente $(b_k)$ — formalmente, los sucesos $\{U_n \in D_n\}$ para $D_n$ diádicos dependen de un número finito de dígitos de conjuntos disjuntos y factorizan; el argumento del $\pi$-sistema lo eleva a todos los borelianos.

*[Leyes](#def-b3-probability-space) arbitrarias.* Sea $G_n(u) = \inf\{t : F_{\mu_n}(t)
\geq u\}$ (la *función cuantil* de la función de distribución $F_{\mu_n}$); la equivalencia clave $G_n(u) \leq t
\iff u \leq F_{\mu_n}(t)$ ([continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por la derecha de $F$, monotonía) muestra que $X_n = G_n(U_n)$ es [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) con $\P(X_n \leq t) = \P(U_n \leq F_{\mu_n}(t)) =
F_{\mu_n}(t)$: [ley](#def-b3-probability-space) $\mu_n$; la [independencia](#def-b3-probability-independence) se hereda (funciones de variables [independientes](#def-b3-probability-independence), [Ejercicio 22.3](#exo-b3-probability-3)). ∎

**Ejemplo 22.7 (El problema de los cumpleaños, honestamente).**

Entre $n$ personas con cumpleaños [independientes](#def-b3-probability-independence) y uniformes sobre $N = 365$ días, la probabilidad de que todos los cumpleaños sean distintos vale

$$
p_n = \prod_{k=1}^{n-1}\Bigl(1 - \frac kN\Bigr),
$$

por condicionamientos sucesivos (o directamente: los $N(N-1)\cdots(N - n + 1)$ casos favorables entre los $N^n$ totales, un argumento de recuento que la fórmula del producto de la [independencia](#def-b3-probability-independence) hace riguroso). Tomando logaritmos y usando $-\ln(1 - x) = x +
O(x^2)$:

$$
\ln p_n = -\frac{n(n-1)}{2N} +
O\Bigl(\frac{n^3}{N^2}\Bigr),
\qquad\text{luego}\qquad
p_n \approx \eu^{-n^2/2N} .
$$

El punto de inflexión $p_n = \frac12$ se sitúa en $n \approx
\sqrt{2N\ln2} \approx 1.18\sqrt N$: para $N = 365$, $n = 23$ ($p_{23} = 0.4927$). Dos moralejas. La primera: las colisiones entre $n$ objetos en $N$ casillas aparecen a escala $n \sim \sqrt N$, no $n \sim N$ — el *escalado del cumpleaños* que rige las colisiones de las funciones de dispersión y el coste $\sqrt N$ de los ataques del cumpleaños en criptografía. La segunda: el cálculo es una plantilla: los $\binom n2$ sucesos de colisión por pares no son [independientes](#def-b3-probability-independence) y, sin embargo, la respuesta se comporta como si lo fueran ($\eu^{-\binom n2/N}$ es exactamente la heurística de pares [independientes](#def-b3-probability-independence)) — una primera instancia de la aproximación de Poisson, que el problema de fin de semana del [Capítulo 23](https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite#ch-b3-clt) hace rigurosa (desigualdad de Le Cam).

## 22.3 Borel–Cantelli y la ley cero–uno

**Teorema 22.8 (Borel–Cantelli).**

Sean $(A_n)$ sucesos y $\limsup A_n = \bigcap_N
\bigcup_{n\geq N}A_n$ («$A_n$ ocurre infinitas veces»).

1. Si $\sum\P(A_n) < \infty$ , entonces $\P(\limsup A_n) =  0$ .
2. Si $\sum\P(A_n) = \infty$ *y los $A_n$ son [independientes](#def-b3-probability-independence)* , entonces $\P(\limsup A_n) = 1$ .

**Demostración.** (1) es el [Ejercicio 9.4](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#exo-b3-measure-4). (2): para $N \leq M$, la [independencia](#def-b3-probability-independence) de los complementarios (el [Ejercicio 22.3](#exo-b3-probability-3)) da

$$
\P\Bigl(\bigcap_{n=N}^{M}A_n^c\Bigr) = \prod_{n=N}^M\bigl(1
- \P(A_n)\bigr) \leq
\exp\Bigl(-\sum_{n=N}^M\P(A_n)\Bigr) \xrightarrow[M \to
\infty]{} 0
$$

($1 - x \leq \eu^{-x}$; la serie diverge). Así, $\P\bigl(\bigcup_{n\geq N}A_n\bigr) = 1$ para todo $N$, y la intersección decreciente en $N$ sigue teniendo probabilidad $1$ ([continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por arriba, la [Proposición 9.6](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#prop-b3-measure-basics)). ∎

**Teorema 22.9 (Ley cero–uno de Kolmogorov).**

Sean $(X_n)$ [independientes](#def-b3-probability-independence) y $\mathcal T =
\bigcap_N\sigma(X_N, X_{N+1}, \dots)$ la *$\sigma$-álgebra de cola* (sucesos insensibles a cualquier número finito de las $X_n$: convergencia de $\sum X_n$, de $\frac{S_n}n$, valores de $\limsup$, …). Entonces todo $T \in \mathcal T$ cumple $\P(T) \in \{0,
1\}$.

**Demostración.** Fíjese $N$. Las $\sigma$-álgebras $\sigma(X_1, \dots, X_N)$ y $\sigma(X_{N+1}, \dots)$ son [independientes](#def-b3-probability-independence): los sucesos que dependen de bloques disjuntos factorizan sobre los $\pi$-sistemas generadores (cilindros $\bigcap_{i\leq N}\{X_i \in B_i\}$ y, respectivamente, condiciones finitas sobre las variables posteriores), y Dynkin (el [Teorema 9.4](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#thm-b3-measure-dynkin), aplicado dos veces, un lado cada vez) extiende la factorización. Un suceso de cola $T$ está en $\sigma(X_{N+1}, \dots)$ para todo $N$: $T$ es independiente de cada $\sigma(X_1, \dots, X_N)$, luego de la $\sigma$-álgebra que estas generan, $\sigma(X_1, X_2, \dots)$ (Dynkin una vez más: la unión de las $\sigma(X_1,\dots,X_N)$ es un $\pi$-sistema que la genera). Pero también $T \in \sigma(X_1, X_2, \dots)$: $T$ es independiente *de sí mismo*, $\P(T) = \P(T\cap T) =
\P(T)^2$: $\P(T) \in \{0, 1\}$. ∎

## 22.4 Modos de convergencia

**Definición 22.10.**

$X_n \to X$ *casi seguramente* si $\P(X_n \to X) = 1$; *en probabilidad* si $\P(\abs{X_n - X} \geq \varepsilon)
\to 0$ para todo $\varepsilon > 0$; *en $L^p$* si $\E\abs{X_n - X}^p \to 0$.

**Proposición 22.11.**

(a) la convergencia c.s. implica la convergencia en probabilidad; (b) la convergencia en $L^p$ implica la convergencia en probabilidad; (c) la convergencia en probabilidad implica la convergencia c.s. *a lo largo de una subsucesión*; (d) ninguna otra implicación es cierta en general.

**Demostración.** (a) $\P(\abs{X_n - X} \geq \varepsilon) \leq
\P\bigl(\sup_{m\geq n}\abs{X_m - X} \geq \varepsilon\bigr)
\downarrow \P\bigl(\limsup\{\abs{X_m - X} \geq
\varepsilon\}\bigr) = 0$ bajo convergencia c.s. ([continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por arriba; el suceso del límite superior excluye la convergencia). (b) Markov: $\P(\abs{X_n - X} \geq \varepsilon) \leq
\varepsilon^{-p}\,\E\abs{X_n - X}^p$. (c) Tómese $n_k$ con $\P(\abs{X_{n_k} - X} \geq 2^{-k}) \leq 2^{-k}$; Borel–Cantelli (1) hace que $\abs{X_{n_k} - X} < 2^{-k}$ a partir de cierto índice, c.s. (d) La máquina de escribir (el [Ejercicio 12.3](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#exo-b3-lp-3)) en $(\intcc01, \lambda)$ converge en $L^1$ y en probabilidad, pero en ningún punto; $n\mathbf 1_{\intoo0{1/n}} \to 0$ c.s. pero no en $L^1$; los detalles y los contraejemplos restantes están en el [Ejercicio 22.6](#exo-b3-probability-6). ∎

## 22.5 La ley de los grandes números

En todo lo que sigue, $(X_n)$ son [independientes](#def-b3-probability-independence) con la misma [ley](#def-b3-probability-space) (*i.i.d.*), $S_n = X_1 + \dots + X_n$.

**Teorema 22.12 (Ley débil de los grandes números).**

Si $X_1 \in L^2$, con $m = \E X_1$:

$$
\P\Bigl(\Bigl|\frac{S_n}{n} - m\Bigr| \geq
\varepsilon\Bigr) \leq
\frac{\V(X_1)}{n\,\varepsilon^2}
\xrightarrow[n\to\infty]{} 0 :
$$

$\frac{S_n}n \to m$ en probabilidad (y en $L^2$).

**Demostración.** $\E\frac{S_n}n = m$ y $\V\bigl(\frac{S_n}n\bigr) =
\frac{n\V(X_1)}{n^2}$ (el [Teorema 22.5](#thm-b3-probability-independence)); Chebyshev. ∎

**Teorema 22.13 (Ley fuerte de los grandes números).**

Si $X_1 \in L^1$, entonces

$$
\frac{S_n}{n} \xrightarrow[n\to\infty]{\text{c.s.}} \E[X_1].
$$

La demostramos aquí bajo la hipótesis más fuerte $X_1 \in
L^4$; el caso general ($L^1$: la demostración de Etemadi) es el problema de fin de semana.

**Demostración bajo $\E X_1^4 < \infty$.** Centrando ($X_i \mapsto X_i - m$), supóngase $m = 0$. Desarróllese:

$$
\E[S_n^4] = \sum_{i,j,k,l}\E[X_iX_jX_kX_l]
= n\,\E[X_1^4] + 3n(n-1)\,\bigl(\E[X_1^2]\bigr)^2 \leq
C\,n^2 ,
$$

puesto que la [independencia](#def-b3-probability-independence) y el centrado matan todo término que contenga un factor aislado ($\E[X_iX_jX_kX_l] =
\E[X_i]\E[\cdots] = 0$ salvo que los índices se emparejen: los únicos supervivientes son los $n$ términos $i=j=k=l$ y los $3n(n-1)$ términos con dos pares distintos). Markov:

$$
\P\Bigl(\Bigl|\frac{S_n}n\Bigr| \geq \varepsilon\Bigr)
= \P\bigl(S_n^4 \geq n^4\varepsilon^4\bigr)
\leq \frac{Cn^2}{n^4\varepsilon^4} =
\frac{C}{\varepsilon^4n^2},
$$

sumable: Borel–Cantelli (1) da, para cada racional $\varepsilon$, que $\abs{S_n/n} < \varepsilon$ a partir de cierto índice, c.s.; intersecando en $\varepsilon \in \Q_+^*$ (una cantidad numerable de sucesos de probabilidad $1$): $S_n/n \to 0$ c.s. ∎

**Ejemplo 22.14 (Lo que compra la ley fuerte).**

(a) *Frecuencias*: para lanzamientos de moneda i.i.d., la frecuencia observada de caras converge c.s. a $p$ — la justificación empírica de la propia probabilidad. (b) *Monte Carlo*: para $g \in
L^1(\intcc01)$ y $(U_n)$ uniformes i.i.d., ([Teorema 22.6](#thm-b3-probability-existence)), $\frac1n\sum_{k\leq n}g(U_k) \to \int_0^1g$ c.s.: integrales por muestreo, en cualquier dimensión, a la velocidad independiente de la dimensión $\sim n^{-1/2}$ que precisa el [Capítulo 23](https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite#ch-b3-clt). (c) *Números normales*: casi todo número real tiene, en su desarrollo binario, frecuencia asintótica $\frac12$ de unos (aplíquese la [ley](#def-b3-probability-space) fuerte a las variables de dígitos del [Teorema 22.6](#thm-b3-probability-existence)) — el teorema de Borel, un enunciado sobre los números de *todos* los días demostrado por la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure): el [Problema 22.1](#pb-b3-probability-1) lo [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) en todas las bases.

**Método 22.15.**

El orden de trabajo para los enunciados asintóticos sobre sucesiones aleatorias: (1) *¿es el suceso un suceso de cola?* Entonces su probabilidad vale $0$ o $1$ (el [Teorema 22.9](#thm-b3-probability-zeroone)) y solo hay que decidir cuál. (2) *Para demostrar enunciados c.s.*: Borel–Cantelli — probabilidades sumables para los sucesos «malos», mediante cotas de tipo Markov o Chebyshev sobre los momentos que existan; la [independencia](#def-b3-probability-independence) solo hace falta en el sentido recíproco. (3) *Subsucesión más sándwich*: demuéstrese la convergencia a lo largo de una subsucesión manejable y contrólese la oscilación intermedia por monotonía o desigualdades maximales — el esqueleto de la demostración de Etemadi. (4) Para los límites en distribución, espérese al [Capítulo 23](https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite#ch-b3-clt).

## 22.6 Ejercicios

**Ejercicio 22.1 ★.**

(a) Sea $X$ de función de distribución $F$ [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y estrictamente creciente. Demuéstrese que $F(X)$ es uniforme en $\intcc01$ y que $G(U) \sim F$ para $U$ uniforme, $G = F^{-1}$: simulación por inversión. (b) Calcúlense la función de distribución y la [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) de $X^2$ para $X$ uniforme en $\intcc{-1}1$, y de $-\frac1\lambda\ln
U$ para $U$ uniforme en $\intoo01$.

**Solución de Ejercicio 22.1.**

(a) Para $u \in \intoo01$: $\P(F(X) \leq u) = \P(X \leq
F^{-1}(u)) = F(F^{-1}(u)) = u$ (la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) y la monotonía estricta hacen de $F$ una biyección sobre $\intoo01$ con $\{F(X) \leq u\} = \{X \leq F^{-1}(u)\}$): $F(X)$ es uniforme. Recíprocamente, $\P(G(U) \leq t) = \P(U \leq F(t)) = F(t)$: para simular una [ley](#def-b3-probability-space), aplíquese la inversa de la función de distribución a una muestra uniforme.

(b) $Y = X^2$, $X$ uniforme en $\intcc{-1}1$: para $t \in
\intcc01$, $F_Y(t) = \P(-\sqrt t \leq X \leq \sqrt t) = \sqrt
t$: [densidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#ex-b3-lebesgue-gamma) $\frac1{2\sqrt t}\mathbf 1_{\intoo01}$. Y $\P\bigl(-\frac1\lambda\ln U \leq t\bigr) = \P(U \geq
\eu^{-\lambda t}) = 1 - \eu^{-\lambda t}$: la exponencial $\mathcal E(\lambda)$ — la inversión en acción.

**Ejercicio 22.2 ★.**

(a) Calcúlense la media y la varianza de las [leyes](#def-b3-probability-space) de Poisson $\mathcal
P(\lambda)$ y geométrica mediante el teorema de transferencia. (b) Demuéstrese que una [variable aleatoria](#def-b3-probability-space) positiva $T$ con $\P(T > t)
> 0$ para todo $t$ cumple la propiedad de *falta de memoria* $\P(T > t + s \mid
T > t) = \P(T > s)$ para todos $s, t \geq 0$ si y solo si $T$ es exponencial. *(La función de supervivencia satisface la ecuación funcional de Cauchy; la monotonía sustituye a la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity).)*

**Solución de Ejercicio 22.2.**

(a) Poisson: $\E X = \sum_{k\geq0}k\,\eu^{-\lambda}
\frac{\lambda^k}{k!} = \lambda$, $\E[X(X-1)] = \lambda^2$, de modo que $\V = \lambda^2 + \lambda - \lambda^2 = \lambda$. Geométrica ($\P(X = k) = p(1-p)^{k-1}$): $\E X = \frac1p$, $\V =
\frac{1-p}{p^2}$ (derívese dos veces la serie geométrica).

(b) $G(t) = \P(T > t)$ es no creciente con $G(0^+)\dots$ $G \colon \intco0\infty \to \intoc01$; la falta de memoria se lee $G(t + s) = G(t)G(s)$. Entonces $G(n t) = G(t)^n$ y $G(t/n) =
G(t)^{1/n}$: $G(q) = G(1)^q$ para $q \geq 0$ racional; escribiendo $G(1) = \eu^{-\lambda}$ ($\in \intoo01$: $G(1) = 1$ forzaría $G \equiv 1$, imposible para una [variable aleatoria](#def-b3-probability-space) finita; $G(1) = 0$ queda excluido por hipótesis) y encajonando un $t$ arbitrario entre racionales (monotonía): $G(t) =
\eu^{-\lambda t}$ — la [ley](#def-b3-probability-space) exponencial. El recíproco es un cálculo.

**Ejercicio 22.3 ★★.**

(a) Demuéstrese que si $X_1, \dots, X_n$ son [independientes](#def-b3-probability-independence) y $f_i$ son funciones borelianas, las $f_i(X_i)$ son [independientes](#def-b3-probability-independence). (b) Demuéstrese que unos sucesos $A_1, \dots, A_n$ son [independientes](#def-b3-probability-independence) si y solo si lo son sus complementarios, si y solo si los indicadores $\mathbf 1_{A_i}$ son [variables aleatorias](#def-b3-probability-space) [independientes](#def-b3-probability-independence). (c) (La [independencia](#def-b3-probability-independence) por pares es más débil) Dos monedas equilibradas: $A =$ la primera sale cara, $B =$ la segunda sale cara, $C =$ ambas coinciden. Demuéstrese que $A, B, C$ son [independientes](#def-b3-probability-independence) dos a dos pero no [independientes](#def-b3-probability-independence).

**Solución de Ejercicio 22.3.**

(a) $\sigma(f_i(X_i)) = f_i(X_i)^{-1}(\mathcal B) \subseteq
X_i^{-1}(\mathcal B) = \sigma(X_i)$ ($f_i$ borelianas), y las sub-$\sigma$-álgebras de $\sigma$-álgebras [independientes](#def-b3-probability-independence) son [independientes](#def-b3-probability-independence) (la identidad que las define vale a fortiori).

(b) $\sigma(A_i) = \{\varnothing, A_i, A_i^c, \Omega\} =
\sigma(A_i^c) = \sigma(\mathbf 1_{A_i})$: las tres afirmaciones expresan la [independencia](#def-b3-probability-independence) de las mismas $\sigma$-álgebras. (Que la factorización sobre los $A_i$ se propague a los complementarios es el argumento del $\lambda$-sistema contenido en la equivalencia de la [Definición 22.4](#def-b3-probability-independence) — o bien la inclusión-exclusión directa.)

(c) $\P(A) = \P(B) = \P(C) = \frac12$; $A\cap B = A\cap C =
B\cap C$ sobre los pares: cada intersección es «ambas caras» o análoga, de probabilidad $\frac14$: [independientes](#def-b3-probability-independence) dos a dos. Pero $\P(A\cap B\cap C) = \P(\text{CC}) = \frac14 \neq
\frac18$: no [independientes](#def-b3-probability-independence) — $C$ queda determinado por $A$ y $B$.

**Ejercicio 22.4 ★★.**

(a) (El mono infinito) Una sucesión i.i.d. de pulsaciones uniformes sobre un alfabeto finito contiene c.s. todo texto finito infinitas veces: demuéstrese con Borel–Cantelli (2) sobre bloques disjuntos. (b) (Rachas) Para bits equilibrados i.i.d., sea $R_n$ la longitud de la racha de unos que empieza en la posición $n$. Demuéstrese que, c.s., $R_n \geq (1+\varepsilon)\log_2n$ un número finito de veces, y $R_n
\geq \log_2 n$ infinitas veces *(ambas mitades de Borel–Cantelli; para la segunda, pásese a bloques disjuntos para ganar [independencia](#def-b3-probability-independence))*: la racha más larga entre los $n$ primeros dígitos crece como $\log_2n$.

**Solución de Ejercicio 22.4.**

(a) Sean $T$ el texto, de longitud $L$, y $q = a^{-L}$ ($a$ el tamaño del alfabeto). Los sucesos $E_k = \{$las posiciones $kL+1,
\dots, (k+1)L$ deletrean $T\}$ son [independientes](#def-b3-probability-independence) (bloques disjuntos de letras i.i.d.), cada uno de probabilidad $q > 0$: $\sum\P(E_k)
= \infty$, y Borel–Cantelli (2) da infinitas apariciones c.s.

(b) Cota superior: $\P\bigl(R_n \geq (1+\varepsilon)\log_2n\bigr)
\leq 2^{-(1+\varepsilon)\log_2n} = n^{-(1+\varepsilon)}$, sumable: por Borel–Cantelli (1), c.s. solo hay un número finito de tales $n$. Cota inferior: empaquétense bloques disjuntos — el $j$-ésimo, de longitud $\ell_j = \lceil\log_2s_j\rceil$, empezando en $s_j =
\sum_{i<j}\ell_i$; los sucesos «el bloque $j$ es todo unos» son [independientes](#def-b3-probability-independence) de probabilidad $2^{-\ell_j} \asymp
\frac1{s_j} \asymp \frac1{j\log_2 j}$, cuya suma diverge: Borel–Cantelli (2) da infinitos bloques de unos, es decir, $R_{s_j} \geq \log_2 s_j$ infinitas veces. En conjunto: la longitud máxima de racha entre los $n$ primeros dígitos es $(1 + o(1))\log_2n$ a.s.

**Ejercicio 22.5 ★★.**

Sean $(X_n)$ [independientes](#def-b3-probability-independence). (a) Demuéstrese que el radio de convergencia de $\sum X_n z^n$ es una constante c.s. (posiblemente $0$ o $\infty$). (b) Demuéstrense $\P(\sum X_n \text{ converge}) \in \{0, 1\}$ y $\P(S_n/n \to m) \in \{0,1\}$. (c) Dese un suceso relativo a $(X_n)$ que *no* sea un suceso de cola, y compruébese que la [ley cero–uno](#thm-b3-probability-zeroone) puede fallar para él.

**Solución de Ejercicio 22.5.**

(a) $R = \bigl(\limsup\abs{X_n}^{1/n}\bigr)^{-1}$ no cambia si se modifican un número finito de $X_n$: para todo $N$, $R$ es $\sigma(X_N, X_{N+1}, \dots)$-medible, es decir, [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) respecto de la cola. Entonces cada suceso $\{R \leq c\}$ tiene probabilidad $0$ o $1$ (el [Teorema 22.9](#thm-b3-probability-zeroone)), de modo que la función de distribución de $R$ solo toma los valores $0, 1$: salta en un único punto $c_0 \in
\intcc0{+\infty}$, y $R = c_0$ c.s.

(b) La convergencia de $\sum X_n$ y la de $\frac{S_n}n$ son insensibles a cambiar un número finito de términos (para la segunda: los términos modificados aportan $O(1/n) \to 0$): sucesos de cola; [ley cero–uno](#thm-b3-probability-zeroone).

(c) $\{X_1 > 0\}$ depende de $X_1$: para signos i.i.d. ($\P(X_1 = \pm1) = \frac12$), su probabilidad vale $\frac12
\notin \{0,1\}$ — ninguna contradicción, no es un suceso de cola.

**Ejercicio 22.6 ★★.**

En $(\intcc01, \lambda)$, exhíbanse — con demostración — [variables aleatorias](#def-b3-probability-space) tales que: (a) $X_n \to 0$ en probabilidad y en todo $L^p$, pero en ningún punto c.s.; (b) $X_n \to 0$ c.s. pero en ningún $L^p$; (c) $X_n \to 0$ en $L^1$ pero no en $L^2$; (d) y demuéstrese: si $X_n \to X$ en probabilidad y $\abs{X_n}
\leq Y \in L^1$, entonces $X_n \to X$ en $L^1$ *(subsucesiones, convergencia dominada y el truco de la subsubsucesión)*.

**Solución de Ejercicio 22.6.**

Trabájese en $(\intcc01, \lambda)$. (a) La máquina de escribir $\mathbf 1_{I_n}$ ([Ejercicio 12.3](https://one-course.com/books/math/5/es/chapter/12-los-espacios-lp#exo-b3-lp-3)): $\norm{X_n}_p^p = \lambda(I_n) \to 0$ (en todo $p < \infty$), luego también en probabilidad; en cada $\omega$ los valores $0$ y $1$ reaparecen ambos: no hay convergencia puntual en ningún punto. (b) $X_n = n\mathbf 1_{\intoo0{1/n}} \to 0$ fuera de $0$, pero $\norm{X_n}_p \geq n^{1 - 1/p} \geq 1$. (c) $X_n = \sqrt n\,\mathbf 1_{\intoo0{1/n}}$: $\E\abs{X_n} =
n^{-1/2} \to 0$, $\E X_n^2 = 1$. (d) De cualquier subsucesión extráigase (convergencia en probabilidad) una subsucesión ulterior que converja c.s. (la [Proposición 22.11](#prop-b3-probability-modes)(c)); la convergencia dominada da convergencia en $L^1$ a lo largo de ella, con el *mismo* límite $X$. Así, toda subsucesión de la sucesión numérica $\E\abs{X_n - X}$ tiene una subsubsucesión que tiende a $0$: la sucesión entera tiende a $0$.

**Ejercicio 22.7 ★★.**

Una encuesta de opinión estima una proporción desconocida $p$ mediante la frecuencia empírica $\hat p_n$ de $n$ extracciones [independientes](#def-b3-probability-independence). (a) Chebyshev: demuéstrese $\P(\abs{\hat p_n - p} \geq \varepsilon)
\leq \frac1{4n\varepsilon^2}$ (úsese $p(1-p) \leq \frac14$). (b) ¿Cuántas extracciones garantizan un error $\leq 3\%$ con probabilidad $\geq 95\%$ según esta cota? (La respuesta verdadera, vía el [Capítulo 23](https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite#ch-b3-clt), es de unas $1070$: Chebyshev es honesta pero burda.)

**Solución de Ejercicio 22.7.**

(a) $\hat p_n = \frac{S_n}n$ con $S_n$ binomial: $\V(\hat
p_n) = \frac{p(1-p)}n \leq \frac1{4n}$, y Chebyshev (la [Proposición 22.3](#prop-b3-probability-markov)) da la cota. (b) Resuélvase $\frac1{4n(0.03)^2} \leq 0.05$: $n \geq
\frac{1}{4\cdot0.0009\cdot0.05} \approx 5556$. El teorema central del límite justificará $n \approx 1070$ para la misma garantía: Chebyshev paga su generalidad con un factor $\approx 5$.

**Ejercicio 22.8 ★★★.**

(Bernstein) Para $f \in \mathcal C(\intcc01)$, defínase el polinomio de Bernstein $B_nf(x) =
\sum_{k=0}^n\binom nkx^k(1-x)^{n-k}f\bigl(\frac kn\bigr)$. (a) Reconózcase $B_nf(x) = \E\bigl[f\bigl(\frac
{S_n}n\bigr)\bigr]$ para $S_n$ binomial $\mathcal B(n, x)$. (b) Demuéstrese $B_nf \to f$ *uniformemente* en $\intcc01$: sepárese según $\{\abs{\frac{S_n}n - x} \leq \delta\}$ y su complementario, usando la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) uniforme y Chebyshev con la cota uniforme $\V(\frac{S_n}n) \leq \frac1{4n}$. (c) Conclúyase: una segunda demostración, probabilística, del teorema de aproximación de Weierstrass (el [Corolario 7.16](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#cor-b3-complete-weierstrass)), con la velocidad explícita $\norm{B_nf - f}_\infty \leq \frac32\,\omega_f(n^{-1/2})$ para el módulo de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) $\omega_f$ — demuéstrese al menos la forma $O(\omega_f(n^{-1/2}))$.

**Solución de Ejercicio 22.8.**

(a) Si $S_n \sim \mathcal B(n, x)$, el teorema de transferencia da $\E\bigl[f(\frac{S_n}n)\bigr] =
\sum_k\binom nkx^k(1-x)^{n-k}f(\frac kn) = B_nf(x)$.

(b)–(c) Sea $\omega = \omega_f$ el módulo de [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) ($\abs{f(u) - f(v)} \leq \omega(\abs{u - v})$, y $\omega(c
\delta) \leq (1 + c)\,\omega(\delta)$ encadenando pasos). Entonces, para todo $\delta > 0$,

$$
\abs{f(u) - f(x)} \leq \Bigl(1 + \frac{(u -
x)^2}{\delta^2}\Bigr)\omega(\delta)
$$

(si $\abs{u - x} \leq \delta$, es claro; en caso contrario, $\omega(\abs{u-x}) \leq (1 + \frac{\abs{u-x}}\delta)
\omega(\delta) \leq (1 + \frac{(u-x)^2}{\delta^2})
\omega(\delta)$). Tómense [esperanzas](#def-b3-probability-space) en $u = \frac{S_n}n$:

$$
\abs{B_nf(x) - f(x)} \leq
\Bigl(1 + \frac{\V(S_n/n)}{\delta^2}\Bigr)\omega(\delta)
\leq \Bigl(1 + \frac{1}{4n\delta^2}\Bigr)\omega(\delta) ;
$$

con $\delta = n^{-1/2}$: $\norm{B_nf - f}_\infty \leq
\frac54\,\omega\bigl(n^{-1/2}\bigr) \leq
\frac32\,\omega\bigl(n^{-1/2}\bigr) \to 0$ ([continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) uniforme en el [compacto](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-compact)): un teorema de Weierstrass probabilístico, con velocidad explícita y uniforme.

**Ejercicio 22.9 ★★★.**

(Coleccionista de cupones) Se extraen con reposición, uniformemente, cromos de $n$ tipos; sea $T_n$ el número de extracciones hasta ver todos los tipos. (a) Escríbase $T_n = \sum_{k=1}^{n}\tau_k$ con $\tau_k$ geométrica de parámetro $\frac{n - k + 1}n$ y las $\tau_k$ [independientes](#def-b3-probability-independence), y dedúzcanse $\E T_n = n\,H_n \sim n\ln n$ ($H_n$ el número armónico) y $\V(T_n) \leq
\frac{\pi^2}6n^2$. (b) Chebyshev: $\frac{T_n}{n\ln n} \to 1$ en probabilidad. (c) Afínese con Borel–Cantelli: demuéstrese directamente $\P(T_n >
\beta n\ln n) \leq n^{1 - \beta}$ para $\beta > 1$ *(cota de la unión sobre el suceso de que falte algún tipo tras $\beta n\ln n$ extracciones, usando $1 - x \leq \eu^{-x}$)*, y dedúzcase que, a lo largo de $n = 2^m$, c.s. $T_n \leq \beta n\ln
n$ a partir de cierto índice, para todo $\beta > 2$.

**Solución de Ejercicio 22.9.**

(a) Una vez recogidos $k - 1$ tipos, cada extracción es nueva con probabilidad $p_k = \frac{n-k+1}n$: $\tau_k$ es geométrica $(p_k)$, y las $\tau_k$ son [independientes](#def-b3-probability-independence) (las extracciones lo son). Sumas: $\E T_n = \sum_k\frac n{n-k+1} = nH_n \sim n\ln n$; $\V(T_n) = \sum\frac{1 - p_k}{p_k^2} \leq
n^2\sum_{j=1}^n\frac1{j^2} \leq \frac{\pi^2}6n^2$.

(b) Chebyshev: $\P\bigl(\abs{T_n - nH_n} \geq \varepsilon
n\ln n\bigr) \leq \frac{\pi^2n^2/6}{\varepsilon^2n^2\ln^2n}
\to 0$, y $\frac{nH_n}{n\ln n} \to 1$: $\frac{T_n}{n\ln n}
\to 1$ en probabilidad.

(c) Cota de la unión: $T_n > t$ significa que algún tipo no ha salido tras $\lceil t\rceil$ extracciones, de modo que $\P(T_n > t) \leq n(1 -
\frac1n)^{t} \leq n\,\eu^{-t/n}$; en $t = \beta n\ln n$: $\leq n^{1 - \beta}$. Para $\beta > 1$, $\sum_m
2^{m(1-\beta)} < \infty$: Borel–Cantelli da, a lo largo de $n =
2^m$, que c.s. $T_n \leq \beta n\ln n$ a partir de cierto índice — en particular, para todo $\beta > 2$ como se enunció (cualquier $\beta > 1$ sirve a lo largo de la subsucesión).

**Ejercicio 22.10 ★★.**

Usando la construcción por dígitos ([Teorema 22.6](#thm-b3-probability-existence)): (a) verifíquese por cálculo directo que $U = \sum b_{2k}2^{-k}$ (los dígitos de índice par de una $\omega$ uniforme) es uniforme e independiente de $V = \sum b_{2k-1}2^{-k}$; (b) dedúzcase una biyección [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) salvo conjuntos nulos entre $\intcc01$ y $\intcc01^2$ que conserve la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure), y coméntese: un número aleatorio uniforme contiene dos (y una infinidad numerable) [independientes](#def-b3-probability-independence) — compárese con la curva de Peano (el [Problema 6.1](https://one-course.com/books/math/5/es/chapter/6-topologia-general#pb-b3-topology-1)), que lograba la sobreyectividad, pero ni la conservación de la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) ni la inyectividad.

**Solución de Ejercicio 22.10.**

(a) Los dígitos de índice par $(b_{2k})_k$ son bits equilibrados i.i.d. (una subfamilia de la familia independiente de dígitos), de modo que $U =
\sum_kb_{2k}2^{-k}$ da a cada intervalo diádico su probabilidad correcta (como en el [Teorema 22.6](#thm-b3-probability-existence)): uniforme; análogamente $V$; y $(U, V)$ dependen de bloques de dígitos disjuntos: [independientes](#def-b3-probability-independence) (factorización en rectángulos diádicos y después Dynkin).

(b) $\Phi(\omega) = (U(\omega), V(\omega))$ es [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) con $\Phi_*\lambda = \lambda\otimes\lambda = \lambda_2$ (coincidencia en los rectángulos diádicos más unicidad). Entrelazar dígitos define una inversa definida fuera del conjunto (nulo) de los racionales diádicos de cualquiera de los dos factores: una biyección que conserva la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) entre subconjuntos de [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) total de $\intcc01$ y $\intcc01^2$. Contrástese con Peano (el [Problema 6.1](https://one-course.com/books/math/5/es/chapter/6-topologia-general#pb-b3-topology-1)): la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) forzaba la sobreyectividad sin inyectividad; renunciar a la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) a cambio de la mera [medibilidad](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) compra un isomorfismo de [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) — la dimensión es invisible para la teoría de la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) y visible para la [topología](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-topology).

**Ejercicio 22.11 ★★.**

(Récords) Sean $(X_n)_{n\geq1}$ i.i.d. de función de distribución [continua](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity), y dígase que hay un *récord* en el instante $n$ si $X_n > \max(X_1, \dots, X_{n-1})$ (el instante $1$ es un récord). Sea $R_n$ el indicador de récord. (a) Demuéstrese $\P(R_n = 1) = \frac1n$ *(por simetría, cada una de las $n!$ ordenaciones de $X_1, \dots, X_n$ es igualmente probable y los empates tienen probabilidad $0$)*. (b) Demuéstrese que los $R_n$ son *[independientes](#def-b3-probability-independence)* *(cuéntense las ordenaciones compatibles con posiciones de récord prescritas, o argúyase que el orden relativo de $X_1, \dots, X_{n-1}$ es independiente del rango de $X_n$ entre ellas)*. (c) Dedúzcase de Borel–Cantelli (el [Teorema 22.8](#thm-b3-probability-borelcantelli), ambas mitades) que hay infinitos récords c.s., pero que los récords en instantes consecutivos $n, n+1$ ocurren infinitas veces con probabilidad — ¡decídase cuál! — y calcúlese $\sum_n\P(R_n = 1, R_{n+1} = 1)$.

**Solución de Ejercicio 22.11.**

(a) La [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) de la distribución hace nulos los sucesos de empate (como en los argumentos de estadísticos de orden del capítulo), y las $n!$ ordenaciones relativas de $(X_1, \dots, X_n)$ son intercambiables, luego igualmente probables. $R_n = 1$ significa que el máximo ocupa la última posición: probabilidad $\frac{(n-1)!}{n!} = \frac1n$.

(b) Fíjese $n$ y condiciónese al orden relativo de $X_1,
\dots, X_{n-1}$: insertar $X_n$ en una de las $n$ posiciones de rango posibles es uniforme e independiente de ese orden (intercambiabilidad de la $n$-tupla). Por tanto, $R_n$ (el suceso «$X_n$ ocupa la primera posición») es independiente de toda la historia de récords $(R_1, \dots, R_{n-1})$, que es función del orden relativo de las $n - 1$ primeras variables. La inducción da la [independencia](#def-b3-probability-independence) [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) con $\P(R_n = 1) =
\frac1n$.

(c) $\sum\P(R_n = 1) = \sum\frac1n = \infty$ con [independencia](#def-b3-probability-independence): la segunda mitad de Borel–Cantelli da infinitos récords c.s. (los récords nunca cesan — pero se ralean logarítmicamente: $\E[\#\text{récords} \leq n] =
H_n \approx \ln n$). Récords consecutivos: $\P(R_n = R_{n+1}
= 1) = \frac1{n(n+1)}$ ([independencia](#def-b3-probability-independence)), y

$$
\sum_n\frac1{n(n+1)} = \sum_n\Bigl(\frac1n -
\frac1{n+1}\Bigr) = 1 < \infty :
$$

se aplica la primera mitad de Borel–Cantelli — solo hay, c.s., un número finito de pares de récords consecutivos.

**Ejercicio 22.12 ★★.**

(La racha más larga de caras) Lánzese una moneda equilibrada infinitas veces y sea $L_n$ la longitud de la racha más larga de caras consecutivas entre los $n$ primeros lanzamientos. (a) Demuéstrese que, para todo $\varepsilon > 0$, c.s. $L_n \leq
(1 + \varepsilon)\log_2n$ a partir de cierto índice *(la probabilidad de que alguna racha de longitud $\ell$ empiece entre los $n$ primeros lanzamientos es a lo sumo $n2^{-\ell}$; Borel–Cantelli a lo largo de $n =
2^k$)*. (b) Demuéstrese que, c.s., $L_n \geq (1 - \varepsilon)\log_2n$ a partir de cierto índice *(pártanse los $n$ primeros lanzamientos en $\lfloor n/\ell\rfloor$ bloques disjuntos de longitud $\ell =
\lceil(1 - \varepsilon)\log_2n\rceil$; los bloques son [independientes](#def-b3-probability-independence), cada uno todo caras con probabilidad $2^{-\ell}$, y la probabilidad de que ninguno sea todo caras es a lo sumo $\exp(-n2^{-\ell}/\ell)$; súmese de nuevo a lo largo de $n = 2^k$)*. (c) Conclúyase $\frac{L_n}{\log_2n} \to 1$ c.s.: en un millón de lanzamientos equilibrados cabe esperar una racha de unas $20$ caras — y un conjunto de datos sin ella es probablemente inventado.

**Solución de Ejercicio 22.12.**

(a) Una racha de longitud $\ell$ que empieza en la posición $i \leq n$ tiene probabilidad $2^{-\ell}$; cota de la unión: $\P(L_n \geq \ell)
\leq n2^{-\ell}$. Con $\ell_n = (1 +
\varepsilon)\log_2n$: $\P(L_n \geq \ell_n) \leq
n^{-\varepsilon}$. A lo largo de $n = 2^k$: $\sum_k2^{-k\varepsilon} < \infty$, de modo que c.s. $L_{2^k} <
(1+\varepsilon)k$ a partir de cierto índice (Borel–Cantelli); para $n$ general, tómese $2^{k-1} < n \leq 2^k$ y úsense la monotonía de $L_n$ y $\log_22^{k-1} \leq \log_2n$: $L_n \leq L_{2^k}
< (1 + \varepsilon)k \leq (1 + \varepsilon)\frac{k}{k-1}
\log_2n$, y el factor extra se absorbe agrandando ligeramente $\varepsilon$.

(b) Con $\ell = \lceil(1 - \varepsilon)\log_2n\rceil$ y $m = \lfloor n/\ell\rfloor$ bloques disjuntos: los bloques son [independientes](#def-b3-probability-independence), cada uno todo caras con probabilidad $2^{-\ell}
\geq n^{-(1-\varepsilon)}/2$, de modo que

$$
\P(L_n < \ell) \leq \bigl(1 - 2^{-\ell}\bigr)^{m}
\leq \exp\bigl(-m2^{-\ell}\bigr)
\leq \exp\Bigl(-c\,\frac{n^{\varepsilon}}{\log_2n}\Bigr)
$$

para cierta constante $c > 0$ y $n$ grande. Estas probabilidades son sumables a lo largo de $n = 2^k$ (de hecho, en todo $n$): Borel–Cantelli da c.s. $L_n \geq (1 -
\varepsilon)\log_2n$ a partir de cierto índice (la monotonía rellena los huecos entre los $2^k$ como en (a), sin daño).

(c) Ambas cotas a lo largo de una sucesión $\varepsilon = \frac1j$, intersecando una cantidad numerable de sucesos de [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) total: $\frac{L_n}{\log_2n} \to 1$ c.s. Para $n = 10^6$: $\log_2n
\approx 19.9$ — una racha de $\approx 20$ caras no es una anomalía sospechosa, sino una certeza matemática, y su ausencia es indicio de un humano fingiendo «azar» (rara vez se atreve nadie a escribir más de $5$ o $6$ caras seguidas).

## 22.7 Problema: la demostración de Etemadi de la ley fuerte

**Problema 22.1.**

Problema de fin de semana — la ley fuerte de los grandes números para variables i.i.d. integrables

La [ley](#def-b3-probability-space) fuerte de Kolmogorov — $\frac{S_n}n \to \E X_1$ c.s. para $X_n \in L^1$ i.i.d. — tuvo durante mucho tiempo solo demostraciones intrincadas; en 1981, N. Etemadi encontró una de una economía asombrosa, que no usa nada más allá de este capítulo (y que incluso debilita la [independencia](#def-b3-probability-independence) a la [independencia](#def-b3-probability-independence) dos a dos). La seguimos. Sean $(X_n)$ [independientes](#def-b3-probability-independence) dos a dos, idénticamente distribuidas e [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1); $m = \E X_1$, $S_n = X_1 + \dots + X_n$.

**Parte I — Reducciones.**

1. Demostrar que basta tratar $X_n \geq 0$ *(pártase $X_n = X_n^+ - X_n^-$: compruébese que las dos mitades vuelven a ser i.i.d. [independientes](#def-b3-probability-independence) dos a dos e [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1))* . Supóngase en adelante $X_n \geq 0$ .
2. (Truncamiento) Sean $Y_n = X_n\,\mathbf 1_{X_n \leq n}$ y $S_n^* = Y_1 + \dots + Y_n$. Demostrar $$\sum_{n\geq1}\P(X_n \neq Y_n) =  \sum_{n\geq1}\P(X_1 > n) \leq \E[X_1] < \infty$$ (el [Ejercicio 11.3](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-3)) y dedúzcase, vía Borel–Cantelli, que $\frac{S_n - S_n^*}{n} \to 0$ c.s.: basta demostrar $\frac{S^*_n}n \to m$ a.s.
3. Demostrar $\E Y_n = \E\bigl[X_1\mathbf 1_{X_1\leq  n}\bigr] \to m$ (convergencia monótona) y, por tanto, $\frac1n\sum_{k\leq n}\E Y_k \to m$ (Cesàro): basta demostrar $\frac{S_n^* - \E S_n^*}{n} \to 0$ a.s.

**Parte II — La estimación de la varianza.**

4. Demostrar $$\V(Y_n) \leq \E[Y_n^2] = \E\bigl[X_1^2\,\mathbf  1_{X_1 \leq n}\bigr]$$ y, usando la fórmula de las capas (la [Proposición 11.8](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#prop-b3-product-layercake)), la cota clave $$\sum_{n\geq1}\frac{\V(Y_n)}{n^2}  \leq \sum_{n\geq1}\frac1{n^2}\,  \E\bigl[X_1^2\mathbf 1_{X_1\leq n}\bigr]  \leq C\,\E[X_1] < \infty$$ *(intercámbiense la suma y la [esperanza](#def-b3-probability-space) — Tonelli para series — y acótese $\sum_{n \geq  x}\frac1{n^2} \leq \frac2{\max(x,1)}$ para la estimación [interior](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-interior) $x^2\sum_{n\geq x}n^{-2} \leq 2x$)*.

**Parte III — Convergencia a lo largo de subsucesiones geométricas.** Fíjese $\alpha > 1$ y sea $k_j =
\lfloor\alpha^j\rfloor$.

5. Usando la [independencia](#def-b3-probability-independence) dos a dos (las varianzas se suman, el [Teorema 22.5](#thm-b3-probability-independence) — compruébese que la aditividad de las varianzas solo necesita la [independencia](#def-b3-probability-independence) dos a dos) y Chebyshev, demuéstrese, para todo $\varepsilon > 0$: $$\sum_{j\geq1}\P\Bigl(\Bigl|  \frac{S^*_{k_j} - \E S^*_{k_j}}{k_j}\Bigr| \geq  \varepsilon\Bigr)  \leq  \frac1{\varepsilon^2}\sum_{j\geq1}\frac1{k_j^2}  \sum_{n\leq k_j}\V(Y_n)  = \frac1{\varepsilon^2}\sum_{n\geq1}\V(Y_n)  \sum_{j\,:\,k_j\geq n}\frac1{k_j^2} .$$
6. Demostrar $\sum_{j : k_j \geq n}k_j^{-2} \leq  \frac{C_\alpha}{n^2}$ *(serie geométrica; atención a la parte entera: $k_j \geq \frac{\alpha^j}2$ para el cuidado de tipo $\alpha^j \geq 2$)*, y conclúyase con la pregunta 4 y Borel–Cantelli: $$\frac{S^*_{k_j} - \E S^*_{k_j}}{k_j}  \xrightarrow[j\to\infty]{\text{c.s.}} 0,  \qquad\text{luego}\qquad  \frac{S^*_{k_j}}{k_j} \to m \ \text{c.s.}$$

**Parte IV — Sándwich y conclusión.**

7. Para $k_j \leq n \leq k_{j+1}$, úsese la monotonía de $S^*_n$ (¡sumandos no negativos!) para demostrar $$\frac{k_j}{k_{j+1}}\,\frac{S^*_{k_j}}{k_j}  \;\leq\; \frac{S^*_n}{n} \;\leq\;  \frac{k_{j+1}}{k_j}\,\frac{S^*_{k_{j+1}}}{k_{j+1}},$$ y dedúzcase, c.s.: $$\frac m\alpha \leq \liminf\frac{S^*_n}n \leq  \limsup\frac{S^*_n}n \leq \alpha\,m .$$
8. Hágase $\alpha \downarrow 1$ a lo largo de una sucesión y conclúyase $\frac{S_n^*}n \to m$ c.s. y, por tanto (Parte I), la *[ley](#def-b3-probability-space) fuerte de los grandes números*: $$\boxed{\ \frac{S_n}{n}  \xrightarrow[n\to\infty]{\text{c.s.}} \E[X_1].\ }$$
9. ¿Dónde bastó exactamente la [independencia](#def-b3-probability-independence) dos a dos (en lugar de la [independencia](#def-b3-probability-independence) [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) )? Enumérense los tres lugares donde se invocaron hipótesis de tipo [independencia](#def-b3-probability-independence) .

**Parte V — Dividendos.**

10. (Números normales de Borel) Demostrar que $\lambda$ -casi todo $x \in \intcc01$ es *normal en toda base* $b \geq 2$ : cada dígito $0, \dots, b-1$ aparece con frecuencia asintótica $\frac1b$ *(fíjense $b$ y un dígito, aplíquese la [ley](#def-b3-probability-space) fuerte a las variables indicadoras — justifíquese que los dígitos en base $b$ de una variable uniforme son i.i.d. uniformes en $\{0,\dots,b-1\}$, como en el [Teorema 22.6](#thm-b3-probability-existence) — e interséquense después los sucesos de probabilidad uno, en cantidad numerable)* . Exhíbase un número explícito no normal y reflexiónese: el teorema afirma la normalidad de casi todos los números y, sin embargo, demostrar la normalidad de $\sqrt2$ o de $\pi$ sigue abierto.
11. ( [Monte Carlo](#ex-b3-probability-sllnapps) , garantizado) Justifíquese por completo el método del [Ejemplo 22.14](#ex-b3-probability-sllnapps) (b) para $g \in L^1(\intcc01^d)$ : constrúyase la muestra uniforme i.i.d. en $\intcc01^d$ a partir del [Teorema 22.6](#thm-b3-probability-existence) y del [Ejercicio 22.10](#exo-b3-probability-10) , y enúnciese qué entrega la [ley](#def-b3-probability-space) fuerte.

**Parte VI — Lo que compra la [independencia](#def-b3-probability-independence) [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete): desigualdades maximales y series aleatorias.** Etemadi gasta solo [independencia](#def-b3-probability-independence) dos a dos; las partes restantes explotan la versión [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) (mutua). Sean $(Z_n)$ variables [independientes](#def-b3-probability-independence) centradas de $L^2$ y $S_k = Z_1 + \dots + Z_k$ (una notación nueva, sin relación con las $X_n$ anteriores).

12. (Desigualdad maximal de Kolmogorov) Para $\varepsilon  > 0$, demuéstrese $$\P\Bigl(\max_{1\leq k\leq n}\abs{S_k} \geq  \varepsilon\Bigr) \;\leq\;  \frac1{\varepsilon^2}\sum_{k=1}^n\V(Z_k) :$$ El precio de Chebyshev compra el máximo *(divídase el suceso según el primer índice $k$ con $\abs{S_k} \geq \varepsilon$; en ese trozo escríbase $S_n^2 \geq S_k^2 + 2S_k(S_n - S_k)$ y úsese la [independencia](#def-b3-probability-independence) de las coaliciones $(Z_1, \dots, Z_k)$ y $(Z_{k+1}, \dots, Z_n)$, el [Teorema 22.5](#thm-b3-probability-independence))*. Señálese el paso en que la [independencia](#def-b3-probability-independence) dos a dos ya no bastaría.
13. (Teorema de la serie única de Khinchin–Kolmogorov) Dedúzcase: si $\sum_n\V(Z_n) < \infty$ , entonces $\sum_nZ_n$ converge casi seguramente *(demuéstrese que, c.s., las sumas parciales forman una sucesión de Cauchy: hágase $m \to  \infty$ en la desigualdad maximal aplicada a $Z_{N+1}, \dots, Z_{N+m}$, y después $N \to  \infty$)* .
14. (Series de Rademacher) Sean $(\varepsilon_n)$ signos i.i.d., $\P(\varepsilon_n = \pm1) =  \frac12$ (el [Teorema 22.6](#thm-b3-probability-existence) ), y sean $(x_n)$ números reales. Demuéstrese que $\sum_nx_n\varepsilon_n$ converge c.s. en cuanto $\sum_nx_n^2 < \infty$ ; demuéstrese también que, sean cuales sean los $(x_n)$ , la probabilidad de que $\sum_nx_n\varepsilon_n$ converja vale $0$ o $1$ ( [Teorema 22.9](#thm-b3-probability-zeroone) ).
15. El recíproco, elementalmente. Póngase $T_n = \sum_{k\leq  n}x_k\varepsilon_k$ y $s_n^2 = \sum_{k\leq  n}x_k^2$, y supóngase $s_n \to \infty$. (a) Demuéstrese la *desigualdad de Paley–Zygmund*: para $Z \geq 0$ con $\E Z^2 < \infty$ y $0 < \theta <  1$, $$\P\bigl(Z > \theta\,\E Z\bigr) \;\geq\; (1 -  \theta)^2\,\frac{(\E Z)^2}{\E Z^2}$$ *(pártase $\E Z$ en el nivel $\theta\E Z$ y aplíquese Cauchy–Schwarz al trozo superior)*. (b) Demuéstrese $\E T_n^4 \leq 3s_n^4$. (c) Dedúzcase $\P\bigl(\abs{T_n} > \frac{s_n}2\bigr)  \geq \frac3{16}$ y conclúyase que $\sum_nx_n\varepsilon_n$ diverge c.s.; de ahí la dicotomía $$\sum_nx_n\varepsilon_n\ \text{converge c.s.}  \iff \sum_nx_n^2 < \infty .$$
16. (Serie armónica aleatoria) Conclúyase que $\sum_n\frac{\varepsilon_n}{n^s}$ converge c.s. si y solo si $s > \frac12$ . Para $\frac12 < s \leq  1$ la serie converge c.s. aunque $\sum_nn^{-s} = \infty$ : los signos aleatorios producen cancelación de intensidad raíz cuadrada — compárese con la serie alternada $\sum_n\frac{(-1)^n}{n^s}$ , que converge para *todo* $s > 0$ .

**Parte VII — Concentración: la desigualdad de Hoeffding.** La [ley](#def-b3-probability-space) fuerte dice $\frac{S_n}n \to m$; las desigualdades de concentración dicen cuán improbable es una desviación *para cada $n$ fijo*.

17. (Lema de Hoeffding) (a) Demuéstrese $\cosh\lambda \leq \eu^{\lambda^2/2}$ para todo $\lambda \in \R$, comparando las dos series término a término. (b) Sea $Z$ centrada con $a \leq Z \leq b$, $a < b$. Demuéstrese $$\E\,\eu^{\lambda Z} \leq  \exp\Bigl(\frac{\lambda^2(b - a)^2}8\Bigr)$$ *(acótese $\eu^{\lambda z}$ en $\intcc ab$ por su cuerda, tómense [esperanzas](#def-b3-probability-space) y estúdiese $\varphi(t)  = -pt + \log(1 - p + p\eu^t)$ con $p =  \frac{-a}{b-a}$ y $t = \lambda(b - a)$: demuéstrense $\varphi(0) = \varphi'(0) = 0$ y $\varphi''  \leq \frac14$)*.
18. (Desigualdad de Hoeffding) Sean $X_1, \dots, X_n$ [independientes](#def-b3-probability-independence) con $a_i \leq X_i \leq b_i$ y $S_n =  X_1 + \dots + X_n$. Demuéstrese, para $t > 0$, $$\P\bigl(S_n - \E S_n \geq t\bigr) \leq  \exp\Bigl(\frac{-2t^2}{\sum_{i=1}^n(b_i -  a_i)^2}\Bigr),$$ y la misma cota para la cola inferior *(Chebyshev exponencial: acótese $\E\,\eu^{\lambda(S_n - \E S_n)}$ usando la [independencia](#def-b3-probability-independence) y la pregunta 17, y optimícese después en $\lambda > 0$)*.
19. (La [ley](#def-b3-probability-space) fuerte, caso acotado, con velocidad) Sean las $X_i$ i.i.d. con valores en $\intcc ab$ y $m  = \E X_1$. Demuéstrese $$\P\Bigl(\Bigl|\frac{S_n}n - m\Bigr| \geq  \varepsilon\Bigr) \leq  2\exp\Bigl(\frac{-2n\varepsilon^2}{(b - a)^2}\Bigr)$$ y recupérese $\frac{S_n}n \to m$ c.s. por Borel–Cantelli: una segunda demostración de la [ley](#def-b3-probability-space) fuerte para variables acotadas — sin truncamiento, con una velocidad exponencial en cada $n$ finito, pero con sumandos acotados y [independencia](#def-b3-probability-independence) [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete). Compárense las hipótesis con las de Etemadi.
20. ([Monte Carlo](#ex-b3-probability-sllnapps), garantizado a $n$ fijo) Sean $g  \colon \intcc01^d \to \intcc01$ [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) y $(U_k)$ la muestra uniforme i.i.d. de la pregunta 11. Dado $\varepsilon, \delta > 0$, demuéstrese $$n \geq \frac{\log(2/\delta)}{2\varepsilon^2}  \implies  \P\Bigl(\Bigl|\frac1n\sum_{k=1}^ng(U_k) -  \int g\,\dd\lambda_d\Bigr| \geq \varepsilon\Bigr)  \leq \delta,$$ y evalúese el umbral para $\varepsilon =  \delta = 10^{-2}$. La cota no involucra $d$: compárese con la pregunta 11 y con las mallas deterministas.

**Parte VIII — ¿Cuán grande es un paseo aleatorio? Hacia el logaritmo iterado.** Sea $S_n = \varepsilon_1 +
\dots + \varepsilon_n$ el paseo aleatorio simple construido con signos equilibrados i.i.d.

21. (Colas subgaussianas) Demuéstrese $\E\,\eu^{\lambda S_n} =  (\cosh\lambda)^n \leq \eu^{n\lambda^2/2}$ y dedúzcase, para $x > 0$, $$\P(S_n \geq x) \leq \eu^{-x^2/(2n)},  \qquad  \P(\abs{S_n} \geq x) \leq 2\,\eu^{-x^2/(2n)} .$$
22. Dedúzcase, vía Borel–Cantelli, $$\limsup_{n\to\infty}\frac{\abs{S_n}}  {\sqrt{2n\log n}} \leq 1 \quad\text{c.s.}$$ *(para $\eta > 0$, súmense las cotas de cola en $x =  (1 + \eta)\sqrt{2n\log n}$ e interséquese después en $\eta = \frac1p$)*. En particular, el paseo vive a la escala del TCL $\sqrt n$ salvo un factor logarítmico — muy por debajo de la cota burda $\abs{S_n} \leq n$.
23. A lo largo de la subsucesión de duplicación $n_j = 2^j$, demuéstrese $$\limsup_{j\to\infty}\frac{S_{n_j}}  {\sqrt{2n_j\log\log n_j}} \leq 1 \quad\text{c.s.},$$ y reflexiónese: la *[ley](#def-b3-probability-space) del logaritmo iterado* (Khinchin; Hartman–Wintner para sumandos $L^2$ centrados generales) afirma que $$\limsup_{n\to\infty}\frac{S_n}  {\sqrt{2n\log\log n}} = 1 \quad\text{c.s.}$$ Explíquese con precisión qué separa la estimación por subsucesiones recién demostrada de la mitad superior de este enunciado (hay que controlar $\max_{n_j \leq n \leq  n_{j+1}}S_n$ dentro de cada bloque, lo que exige una desigualdad maximal a escala *exponencial*) y compruébese cuantitativamente que la desigualdad de la pregunta 12 es demasiado débil para ese fin. La mitad inferior descansa en el segundo lema de Borel–Cantelli aplicado a bloques [independientes](#def-b3-probability-independence); ambas mitades son material honesto de tercer año para un curso dedicado a la probabilidad.
24. (Desviación uniforme sobre una clase finita) Sean $A_1,  \dots, A_N$ sucesos de un experimento repetible, y estímese cada probabilidad por su frecuencia empírica $\hat p_i$ sobre $n$ repeticiones i.i.d. Combinando la desigualdad de Hoeffding con una cota de la unión, demuéstrese $$\P\Bigl(\max_{i\leq N}\,\abs{\hat p_i - \P(A_i)} >  \varepsilon\Bigr) \;\leq\; 2N\,\eu^{-2n\varepsilon^2},$$ y dedúzcase la regla del tamaño muestral: $n \geq  \frac{\ln(2N/\delta)}{2\varepsilon^2}$ garantiza que las $N$ estimaciones sean simultáneamente $\varepsilon$-precisas con probabilidad $\geq 1 -  \delta$. Calcúlese $n$ para $N = 10^6$, $\varepsilon =  0.01$, $\delta = 0.05$: el precio logarítmico de la uniformidad.
25. (La ventana armónica aleatoria) Combinando las dos mitades de la teoría de series aleatorias, demuéstrese que, para signos i.i.d. $(\varepsilon_n)$ , la serie $\sum_n\frac{\varepsilon_n}{n^\alpha}$ converge c.s. si $\alpha > \frac12$ y diverge c.s. si $\alpha \leq \frac12$ ; contrástese con la convergencia absoluta (que exige $\alpha > 1$ ): en la ventana $\alpha \in \intoc{\frac12}1$ , la convergencia es un fenómeno genuinamente probabilístico — cancelación, no tamaño.

**Solución de Problema 22.1.**

**1.** $X_n^{\pm}$ son funciones borelianas de $X_n$: siguen siendo [independientes](#def-b3-probability-independence) dos a dos (el [Ejercicio 22.3](#exo-b3-probability-3)(a)) e idénticamente distribuidas e [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1), con $\E X_1 = \E X_1^+ - \E
X_1^-$. Si el teorema vale para variables no negativas, aplíquese a ambas mitades y réstese: $\frac{S_n}n = \frac{S_n^+}n - \frac{S_n^-}n \to \E X_1^+ -
\E X_1^- = m$ a.s.

**2.** $\P(X_n \neq Y_n) = \P(X_n > n) = \P(X_1 > n)$ ([leyes](#def-b3-probability-space) idénticas), y $\sum_n\P(X_1 > n) \leq \sum_n\P(X_1
\geq n) \leq \E X_1 < \infty$ (el [Ejercicio 11.3](https://one-course.com/books/math/5/es/chapter/11-medidas-producto-fubini-cambio-de-variable#exo-b3-product-3)(a)). Borel–Cantelli (1): c.s. $X_n = Y_n$ para todo $n$ grande, de modo que $S_n - S_n^*$ es finalmente constante en $n$: $\frac{S_n - S_n^*}n \to 0$ c.s., y las dos sumas normalizadas comparten su comportamiento asintótico.

**3.** $X_1\mathbf 1_{X_1 \leq n} \nearrow X_1$: el teorema de convergencia monótona da $\E Y_n \to m$; las medias de Cesàro de una sucesión convergente convergen al mismo límite: $\frac{\E S_n^*}n =
\frac1n\sum_{k\leq n}\E Y_k \to m$. Basta, por tanto, demostrar $\frac{S^*_n - \E S^*_n}{n} \to 0$ c.s.

**4.** $\V(Y_n) \leq \E Y_n^2 = \E[X_1^2\mathbf
1_{X_1\leq n}]$. Por Tonelli para series,

$$
\sum_n\frac{\E[X_1^2\mathbf 1_{X_1\leq n}]}{n^2}
= \E\Bigl[X_1^2\!\!\sum_{n \geq \max(X_1, 1)}\!\frac1{n^2}
\Bigr]
\leq \E\Bigl[X_1^2\cdot\frac{4}{\max(X_1,1)}\Bigr]
\leq 4\,\E[X_1] < \infty,
$$

usando $\sum_{n\geq x}n^{-2} \leq \frac4x$ para $x \geq 1$ (para $x \geq 2$: $\leq \frac1{x-1} \leq \frac2x$; para $1
\leq x < 2$: $\leq \frac{\pi^2}6 \leq \frac4x$, pues $\frac4x > 2$), y $X_1^2/\max(X_1, 1) \leq X_1$ en ambos casos $X_1 \gtrless 1$.

**5.** La [independencia](#def-b3-probability-independence) dos a dos da $\E[(Y_i - \E
Y_i)(Y_j - \E Y_j)] = 0$ para $i \neq j$ (la fórmula del producto para dos variables), de modo que las varianzas se suman: $\V(S^*_k) =
\sum_{n\leq k}\V(Y_n)$. Chebyshev en cada $k_j$ y sumando:

$$
\sum_j\P\Bigl(\abs{S^*_{k_j} - \E S^*_{k_j}} \geq
\varepsilon k_j\Bigr)
\leq \frac1{\varepsilon^2}\sum_j\frac1{k_j^2}\sum_{n\leq
k_j}\V(Y_n)
= \frac1{\varepsilon^2}\sum_n\V(Y_n)\!\!\sum_{j : k_j\geq
n}\!\frac1{k_j^2}
$$

(Tonelli para la serie doble de términos no negativos).

**6.** $k_j = \lfloor\alpha^j\rfloor \geq
\frac{\alpha^j}2$ (válido en cuanto $\alpha^j \geq 1$, es decir, para todo $j \geq 0$: $\lfloor x\rfloor \geq \frac x2$ si $x \geq
1$). Por tanto,

$$
\sum_{j : k_j \geq n}\frac1{k_j^2}
\leq 4\sum_{j : \alpha^j \geq n}\alpha^{-2j}
\leq \frac{4}{1 - \alpha^{-2}}\cdot\frac1{n^2}
= \frac{C_\alpha}{n^2},
$$

(serie geométrica desde el primer $j$ con $\alpha^j \geq
n$). Combinando con las preguntas 4–5, la suma doble es finita; Borel–Cantelli (1), aplicado para cada racional $\varepsilon$ e intersecado, da $\frac{S^*_{k_j} - \E S^*_{k_j}}{k_j} \to 0$ c.s. y, con la pregunta 3, $\frac{S^*_{k_j}}{k_j} \to m$ c.s.

**7.** $Y_n \geq 0$ hace $n \mapsto S^*_n$ no decreciente: para $k_j \leq n \leq k_{j+1}$,

$$
\frac{S^*_{k_j}}{k_{j+1}} \leq \frac{S^*_n}{n} \leq
\frac{S^*_{k_{j+1}}}{k_j},
$$

que es el sándwich exhibido tras insertar $\frac{k_j}{k_{j+1}}$ y $\frac{k_{j+1}}{k_j}$. Como $\frac{k_{j+1}}{k_j} \to \alpha$, la pregunta 6 da, c.s.,

$$
\frac m\alpha \leq \liminf_n\frac{S^*_n}n \leq
\limsup_n\frac{S^*_n}n \leq \alpha m .
$$

**8.** Aplíquese la pregunta 7 para $\alpha = 1 + \frac1p$, $p
\in \N^*$: una cantidad numerable de sucesos c.s.; en su intersección, haciendo $p \to \infty$: $\lim\frac{S^*_n}n =
m$ c.s. Con las preguntas 1–3, $\frac{S_n}n \to \E X_1$ c.s.: la [ley](#def-b3-probability-space) fuerte de los grandes números, bajo [independencia](#def-b3-probability-independence) dos a dos.

**9.** Las hipótesis de tipo [independencia](#def-b3-probability-independence) aparecieron tres veces: (i) la aditividad de las varianzas (pregunta 5) — basta la de dos a dos; (ii) la idéntica distribución, en las sumas de truncamiento (pregunta 2) y en el cálculo de la media (pregunta 3) — sin [independencia](#def-b3-probability-independence) alguna; (iii) Borel–Cantelli (1) (preguntas 2 y 6) — válido sin ninguna [independencia](#def-b3-probability-independence). La [independencia](#def-b3-probability-independence) mutua [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) no se invocó nunca: la observación de Etemadi.

**10.** Fíjense una base $b$ y un dígito $r$. Los dígitos en base $b$, $(d_k)$, de una $\omega$ uniforme son i.i.d. uniformes en $\{0, \dots, b-1\}$ (cada valor del vector de dígitos ocupa un intervalo de longitud $b^{-m}$: el argumento del [Teorema 22.6](#thm-b3-probability-existence), palabra por palabra). La [ley](#def-b3-probability-space) fuerte aplicada a las variables acotadas i.i.d. $\mathbf
1_{d_k = r}$ da: c.s., la frecuencia del dígito $r$ tiende a $\frac1b$. Intersecando en la cantidad numerable de pares $(b, r)$: casi todo número es *simplemente normal en toda base*. Un número explícito no normal: $x = 0.100100100\ldots_2$ (frecuencia de unos $\frac13 \neq \frac12$). El contraste es humillante: casi todos los números son normales y, sin embargo, para $\sqrt2$, $\eu$ o $\pi$ la normalidad sigue sin demostrarse — la teoría de la [medida](https://one-course.com/books/math/5/es/chapter/9-teoria-de-la-medida#def-b3-measure-measure) cuenta sin exhibir.

**11.** Por el [Ejercicio 22.10](#exo-b3-probability-10) iterado, una sola variable uniforme produce una sucesión de *vectores* uniformes i.i.d. $U_k$ en $\intcc01^d$ (divídase el conjunto de dígitos de cada $U_n$ del [Teorema 22.6](#thm-b3-probability-existence) en $d$ subfamilias). Para $g \in L^1(\intcc01^d)$, las variables $g(U_k)$ son i.i.d. [integrables](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-l1) de media $\int g\,\dd\lambda_d$ (transferencia): la [ley](#def-b3-probability-space) fuerte da

$$
\frac1n\sum_{k=1}^ng(U_k)
\xrightarrow[n\to\infty]{\text{c.s.}}
\int_{\intcc01^d}g\,\dd\lambda_d :
$$

la integración de [Monte Carlo](#ex-b3-probability-sllnapps) converge casi seguramente, en toda dimensión — el tamaño del error es asunto del teorema central del límite (el [Capítulo 23](https://one-course.com/books/math/5/es/chapter/23-funciones-caracteristicas-y-teorema-central-del-limite#ch-b3-clt)).

**12.** Sea $A_k = \{\abs{S_k} \geq \varepsilon\} \cap
\bigcap_{j<k}\{\abs{S_j} < \varepsilon\}$: los $A_k$ son disjuntos con unión $A = \{\max_{k\leq n}\abs{S_k} \geq
\varepsilon\}$. Entonces

$$
\E S_n^2 \geq \sum_{k=1}^n\E\bigl[S_n^2\mathbf 1_{A_k}\bigr]
= \sum_{k=1}^n\E\Bigl[\bigl(S_k^2 + 2S_k(S_n - S_k) + (S_n
- S_k)^2\bigr)\mathbf 1_{A_k}\Bigr]
\geq \sum_{k=1}^n\E\bigl[S_k^2\mathbf 1_{A_k}\bigr],
$$

porque el término cruzado se anula: $S_k\mathbf 1_{A_k}$ es una función boreliana de la coalición $(Z_1, \dots, Z_k)$, que es independiente de $S_n - S_k$, función de $(Z_{k+1},
\dots, Z_n)$ (el [Teorema 22.5](#thm-b3-probability-independence)), de modo que $\E[S_k\mathbf 1_{A_k}(S_n - S_k)] = \E[S_k\mathbf
1_{A_k}]\,\E[S_n - S_k] = 0$. En $A_k$, $S_k^2 \geq
\varepsilon^2$, de donde $\E S_n^2 \geq
\varepsilon^2\sum_k\P(A_k) = \varepsilon^2\P(A)$; y $\E
S_n^2 = \sum_{k\leq n}\V(Z_k)$ (las varianzas se suman). El paso decisivo es la factorización: $S_k\mathbf 1_{A_k}$ es una función *no lineal* de todo el primer bloque, y su [independencia](#def-b3-probability-independence) del segundo bloque es [independencia](#def-b3-probability-independence) de coaliciones — la [independencia](#def-b3-probability-independence) dos a dos de las $Z_i$ solo descorrelaciona pares y no la justificaría.

**13.** Fíjese $N$ y aplíquese la pregunta 12 a $Z_{N+1},
\dots, Z_{N+m}$:

$$
\P\Bigl(\max_{N < k \leq N+m}\abs{S_k - S_N} >
\varepsilon\Bigr) \leq
\frac1{\varepsilon^2}\sum_{j=N+1}^{N+m}\V(Z_j) \leq
\frac{r_N}{\varepsilon^2},
\qquad r_N = \sum_{j>N}\V(Z_j) .
$$

Los sucesos crecen con $m$; la [continuidad](https://one-course.com/books/math/5/es/chapter/6-topologia-general#def-b3-topology-continuity) por abajo da $\P(\sup_{k>N}\abs{S_k - S_N} > \varepsilon) \leq
r_N/\varepsilon^2$, y $r_N \to 0$ por hipótesis. Por tanto, para cada $p \in \N^*$, $\P\bigl(\bigcap_N\{\sup_{k>N}
\abs{S_k - S_N} > \frac1p\}\bigr) \leq \inf_Np^2r_N = 0$: casi seguramente, para todo $p$ hay un $N$ con $\sup_{k>N}\abs{S_k - S_N} \leq \frac1p$ (interséquense los sucesos c.s. en $p$, en cantidad numerable), de modo que $\abs{S_k -
S_l} \leq \frac2p$ para todos $k, l > N$: las sumas parciales son c.s. de Cauchy, luego c.s. convergentes.

**14.** Las variables $Z_n = x_n\varepsilon_n$ son [independientes](#def-b3-probability-independence) (funciones borelianas de variables [independientes](#def-b3-probability-independence), el [Ejercicio 22.3](#exo-b3-probability-3)(a)), centradas y con $\V(Z_n) =
x_n^2$: la pregunta 13 se aplica cuando $\sum_nx_n^2 < \infty$ y da convergencia c.s. En general, para cada $N$ la convergencia de $\sum_nx_n\varepsilon_n$ no se ve afectada por los valores de $\varepsilon_1, \dots, \varepsilon_N$: el suceso de convergencia está en la $\sigma$-álgebra de cola de la sucesión independiente $(\varepsilon_n)$, de modo que la [ley cero–uno](#thm-b3-probability-zeroone) de Kolmogorov (el [Teorema 22.9](#thm-b3-probability-zeroone)) fuerza que su probabilidad valga $0$ o $1$.

**15.** (a) Partiendo en el nivel $\theta\E Z$ y aplicando Cauchy–Schwarz al trozo superior,

$$
\E Z = \E\bigl[Z\mathbf 1_{Z \leq \theta\E Z}\bigr] +
\E\bigl[Z\mathbf 1_{Z > \theta\E Z}\bigr]
\leq \theta\,\E Z + \sqrt{\E Z^2}\,
\sqrt{\P(Z > \theta\E Z)} ,
$$

de modo que $(1 - \theta)\E Z \leq \sqrt{\E Z^2\,\P(Z > \theta\E
Z)}$; elévese al cuadrado. (b) Desarróllese $T_n^4 =
\sum_{i,j,k,l}x_ix_jx_kx_l\,
\E[\varepsilon_i\varepsilon_j\varepsilon_k\varepsilon_l]$: la [esperanza](#def-b3-probability-space) vale $1$ cuando los índices se emparejan (los cuatro iguales, o dos pares distintos, esto último en $3$ disposiciones) y $0$ en caso contrario (un signo desemparejado tiene media nula y sale factor por [independencia](#def-b3-probability-independence)). Por tanto,

$$
\E T_n^4 = \sum_kx_k^4 + 3\sum_{i\neq j}x_i^2x_j^2 =
3s_n^4 - 2\sum_kx_k^4 \leq 3s_n^4 .
$$

(c) Paley–Zygmund con $Z = T_n^2$, $\E Z = s_n^2$, $\theta = \frac14$:

$$
\P\Bigl(\abs{T_n} > \frac{s_n}2\Bigr) = \P\Bigl(T_n^2 >
\frac{s_n^2}4\Bigr) \geq \Bigl(\frac34\Bigr)^2
\frac{s_n^4}{3s_n^4} = \frac3{16} .
$$

Si la serie convergiera con probabilidad positiva, convergería c.s. (pregunta 14), de modo que $\sup_n\abs{T_n} <
\infty$ c.s., y algún $M$ cumpliría $\P(\sup_n\abs{T_n} > M) < \frac3{16}$; pero en cuanto $s_n
> 2M$, $\P(\abs{T_n} > M) \geq \P(\abs{T_n} > \frac{s_n}2)
\geq \frac3{16}$: contradicción. Así, la divergencia es casi segura y, con la pregunta 14, la dicotomía es [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete).

**16.** Aquí $x_n = n^{-s}$ y $\sum_nn^{-2s} <
\infty$ exactamente cuando $s > \frac12$: por las preguntas 14–15, $\sum_n\frac{\varepsilon_n}{n^s}$ converge c.s. si y solo si $s > \frac12$ (para $s \leq \frac12$, divergencia c.s.). Para $\frac12 < s \leq 1$ la convergencia nunca es absoluta. La comparación es instructiva: unos signos perfectamente alternados cancelan con intensidad $n^{-s}$ para todo $s
> 0$, mientras que unos signos aleatorios típicos cancelan solo con intensidad raíz cuadrada — el paseo aleatorio de la pregunta 21 crece como $\sqrt n$, y la sumación de Abel convierte exactamente ese crecimiento en convergencia de $\sum\varepsilon_nn^{-s}$ para $s > \frac12$.

**17.** (a) $\cosh\lambda =
\sum_k\frac{\lambda^{2k}}{(2k)!}$ y $\eu^{\lambda^2/2} =
\sum_k\frac{\lambda^{2k}}{2^kk!}$; y $(2k)! \geq 2^kk!$ vale término a término, porque $\frac{(2k)!}{k!} =
\prod_{i=1}^k(k + i) \geq \prod_{i=1}^k(2i) = 2^kk!$ (cada factor cumple $k + i \geq 2i$ para $i \leq k$), de modo que, de hecho, $(2k)! \geq 2^k(k!)^2 \geq 2^kk!$. (b) Obsérvese $a \leq 0 \leq b$ ($Z$ está centrada) y, por convexidad de $z \mapsto \eu^{\lambda z}$, para $z \in \intcc ab$:

$$
\eu^{\lambda z} \leq \frac{b - z}{b - a}\,\eu^{\lambda a} +
\frac{z - a}{b - a}\,\eu^{\lambda b},
\qquad\text{luego}\qquad
\E\,\eu^{\lambda Z} \leq \frac{b\,\eu^{\lambda a} -
a\,\eu^{\lambda b}}{b - a}
= (1 - p)\eu^{-pt} + p\,\eu^{(1-p)t} = \eu^{\varphi(t)}
$$

con $p = \frac{-a}{b-a} \in \intcc01$, $t = \lambda(b -
a)$, $\varphi(t) = -pt + \log(1 - p + p\eu^t)$. Entonces $\varphi(0) = 0$, $\varphi'(t) = -p + \frac{p\eu^t}{1 - p +
p\eu^t}$ se anula en $0$ y $\varphi''(t) = \rho(1 -
\rho) \leq \frac14$ para $\rho = \frac{p\eu^t}{1 - p +
p\eu^t} \in \intcc01$: Taylor de orden $2$ da $\varphi(t) \leq \frac{t^2}8 = \frac{\lambda^2(b-a)^2}8$.

**18.** Para $\lambda > 0$, Markov aplicado a la variable positiva $\eu^{\lambda(S_n - \E S_n)}$ (la [Proposición 22.3](#prop-b3-probability-markov)) y la fórmula del producto para variables [independientes](#def-b3-probability-independence) dan

$$
\P(S_n - \E S_n \geq t) \leq \eu^{-\lambda
t}\prod_{i=1}^n\E\,\eu^{\lambda(X_i - \E X_i)}
\leq \exp\Bigl(-\lambda t +
\frac{\lambda^2}8\sum_i(b_i - a_i)^2\Bigr),
$$

por la pregunta 17(b) aplicada a cada $X_i - \E X_i
\in \intcc{a_i - \E X_i}{b_i - \E X_i}$ centrada (misma anchura). Minimizando el exponente en $\lambda = \frac{4t}{D}$, $D =
\sum_i(b_i - a_i)^2$, se obtiene $-\frac{2t^2}D$. La cola inferior se sigue aplicando el resultado a $(-X_i)$.

**19.** Tómense $t = n\varepsilon$ y $D = n(b - a)^2$:

$$
\P\Bigl(\Bigl|\frac{S_n}n - m\Bigr| \geq \varepsilon\Bigr)
\leq 2\exp\Bigl(\frac{-2n^2\varepsilon^2}{n(b-a)^2}\Bigr)
= 2\exp\Bigl(\frac{-2n\varepsilon^2}{(b-a)^2}\Bigr),
$$

que es sumable en $n$ (una serie de tipo geométrico): Borel–Cantelli (el [Teorema 22.8](#thm-b3-probability-borelcantelli)) da que c.s. $\abs{\frac{S_n}n - m} < \varepsilon$ a partir de cierto índice; intersecando en $\varepsilon = \frac1p$ resulta $\frac{S_n}n \to m$ c.s. Comparación: Etemadi solo pide $X_1 \in L^1$ e [independencia](#def-b3-probability-independence) dos a dos, y no entrega velocidad alguna; Hoeffding pide acotación e [independencia](#def-b3-probability-independence) [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete), y entrega una garantía exponencial explícita en cada $n$ finito — los dos teoremas responden a preguntas distintas sobre el mismo límite.

**20.** Las $g(U_k)$ son i.i.d. con valores en $\intcc01$ y media $\int g\,\dd\lambda_d$ (transferencia), de modo que la pregunta 18 con $b_i - a_i = 1$, $t = n\varepsilon$ da la cota bilátera $2\eu^{-2n\varepsilon^2} \leq \delta$ en cuanto $\eu^{2n\varepsilon^2} \geq \frac2\delta$, es decir, $n \geq \frac{\log(2/\delta)}{2\varepsilon^2}$. Para $\varepsilon = \delta = 10^{-2}$:

$$
n \geq \frac{\log 200}{2\cdot10^{-4}} =
\frac{5.2983\ldots}{0.0002} \approx 26\,492 :
$$

unas $26\,500$ muestras garantizan una precisión $1\%$ con confianza $99\%$ — en toda dimensión $d$ y para todo integrando [medible](https://one-course.com/books/math/5/es/chapter/10-la-integral-de-lebesgue#def-b3-lebesgue-measurable) con valores en $\intcc01$. La [ley](#def-b3-probability-space) fuerte de la pregunta 11 prometía convergencia sin ninguna garantía a $n$ finito; una malla determinista con $k$ puntos por eje cuesta $k^d$ evaluaciones, exponencial en $d$. La concentración es lo que hace de [Monte Carlo](#ex-b3-probability-sllnapps) un *método* y no una [esperanza](#def-b3-probability-space).

**21.** [Independencia](#def-b3-probability-independence) y fórmula del producto: $\E\,\eu^{\lambda S_n} = (\E\,\eu^{\lambda\varepsilon_1})^n
= (\cosh\lambda)^n \leq \eu^{n\lambda^2/2}$ por la pregunta 17(a). Markov sobre $\eu^{\lambda S_n}$:

$$
\P(S_n \geq x) \leq \eu^{-\lambda x + n\lambda^2/2}
= \eu^{-x^2/(2n)}
\qquad\text{en el óptimo } \lambda = \frac xn,
$$

y la cota simétrica para $-S_n$ (misma [ley](#def-b3-probability-space)) duplica la constante para $\abs{S_n}$.

**22.** Fíjese $\eta > 0$ y póngase $x_n = (1 +
\eta)\sqrt{2n\log n}$ para $n \geq 2$:

$$
\P(\abs{S_n} \geq x_n) \leq 2\exp\bigl(-(1 +
\eta)^2\log n\bigr) = \frac{2}{n^{(1+\eta)^2}},
$$

sumable, pues $(1 + \eta)^2 > 1$. Borel–Cantelli: c.s. $\abs{S_n} < (1 + \eta)\sqrt{2n\log n}$ para todo $n$ grande, de modo que $\limsup_n\frac{\abs{S_n}}{\sqrt{2n\log n}} \leq 1 +
\eta$ c.s.; intersecando los sucesos c.s. para $\eta =
\frac1p$, $p \in \N^*$, se obtiene la afirmación. El paseo de tamaño $n$ tiene amplitud típica $\sqrt n$ (su varianza), y hasta sus peores excursiones superan esa escala a lo sumo en $\sqrt{2\log n}$.

**23.** Con $n_j = 2^j$ y $x = (1 +
\eta)\sqrt{2n_j\log\log n_j}$ (definido para $j \geq 2$), la pregunta 21 da

$$
\P\bigl(S_{n_j} \geq x\bigr) \leq \exp\bigl(-(1 +
\eta)^2\log\log n_j\bigr) = (j\log 2)^{-(1+\eta)^2},
$$

sumable en $j$, pues $(1 + \eta)^2 > 1$: Borel–Cantelli y $\eta = \frac1p$ dan $\limsup_jS_{n_j}/\sqrt{2n_j
\log\log n_j} \leq 1$ c.s. Lo que falta para la mitad superior [completa](https://one-course.com/books/math/5/es/chapter/7-espacios-completos-baire-ascoli-stoneweierstrass#def-b3-complete-complete) es el puente entre los instantes de control: hay que demostrar que $\max_{n_j\leq n\leq n_{j+1}}S_n$ supera $(1+\eta)\sqrt{2n_j\log\log n_j}$ solo un número finito de veces, lo que exige una desigualdad maximal con colas *gaussianas* (la desigualdad de reflexión de Lévy o la de Ottaviani, no demostradas aquí). La pregunta 12 es cuantitativamente demasiado débil: acota la probabilidad por

$$
\frac{n_j}{(1+\eta)^2\,2n_j\log\log n_j}
= \frac{1}{2(1+\eta)^2\log(j\log2)},
$$

que tiende a $0$ pero *no es sumable* en $j$: Borel–Cantelli no puede concluir. La mitad inferior de la [ley](#def-b3-probability-space) del logaritmo iterado aplica el segundo lema de Borel–Cantelli a los incrementos [independientes](#def-b3-probability-independence) $S_{n_{j+1}} - S_{n_j}$, usando cotas inferiores ajustadas para colas de tipo gaussiano. Ambos refinamientos son probabilidad genuina de tercer año, un curso más allá; lo que este problema entrega sin ayuda es la escala exacta del logaritmo iterado a lo largo de tiempos geométricos.

**24.** Cada $\hat p_i$ es una media de $n$ variables indicadoras i.i.d. con valores en $\intcc01$ y media $\P(A_i)$: Hoeffding da $\P(\abs{\hat p_i - \P(A_i)} >
\varepsilon) \leq 2\eu^{-2n\varepsilon^2}$. La cota de la unión multiplica por $N$. Resolviendo $2N\eu^{-2n\varepsilon^2} \leq
\delta$: $n \geq \frac{\ln(2N/\delta)}{2\varepsilon^2}$. Numéricamente: $\ln\frac{2\cdot10^6}{0.05} =
\ln(4\cdot10^7) \approx 17.5$, de modo que $n \geq
\frac{17.5}{2\cdot10^{-4}} \approx 87\,600$: estimar *una* probabilidad con precisión $\pm1\%$ cuesta unas $18\,500$ muestras ($\ln(2/\delta)/2\varepsilon^2$), y *un millón* de probabilidades solo $\approx 4.7$ veces más — la uniformidad cuesta $\ln N$, no $N$: la observación que hace estadísticamente posible la minimización del riesgo empírico y, con ella, el aprendizaje automático.

**25.** Las variables $X_n = \frac{\varepsilon_n}
{n^\alpha}$ son [independientes](#def-b3-probability-independence), centradas y acotadas, con $\sum_n\V(X_n) = \sum_nn^{-2\alpha}$. Si $\alpha >
\frac12$: la serie de varianzas converge, y el teorema de la serie única (Parte VI) da la convergencia c.s. de $\sum X_n$. Si $\alpha \leq \frac12$: la serie de varianzas diverge, y la mitad recíproca (el argumento de Paley–Zygmund de la Parte VI, aplicable porque los sumandos están acotados por $1$) da la divergencia c.s. La convergencia absoluta pide $\sum n^{-\alpha} < \infty$: $\alpha > 1$. En $\intoc{\frac12}1$, la serie converge c.s. aunque $\sum\abs{X_n} = \infty$ con seguridad: los signos conspiran para cancelarse, con probabilidad uno — convergencia por cancelación, invisible para cualquier criterio absoluto y, por la [ley cero–uno](#thm-b3-probability-zeroone), con un veredicto determinista de todos modos.
