Matemáticas universitarias — Grado 2 · Bachelor Year 2
15Cálculo diferencial
El cálculo de dos variables del volumen del primer año madura hasta convertirse en el cálculo diferencial de aplicaciones entre espacios normados: la diferencial como mejor aproximación lineal, la regla de la cadena en toda su generalidad, el teorema de simetría de Schwarz demostrado, las fórmulas de Taylor y el análisis completo de segundo orden de los extremos. El teorema de la función inversa, corona de la teoría, se enuncia con su estrategia de demostración —un punto fijo de Banach— hecha explícita.
En todo el capítulo, U es un subconjunto abierto de Rn (o de un espacio normado; el caso de dimensión finita contiene todas las ideas) y f:U→Rm.
15.1 La diferencial
Definición 15.1
f es diferenciable en a cuando existe una aplicación lineal (continua) dfa:Rn→Rm con
f(a+h)=f(a)+dfa(h)+o(∥h∥)(h→0).
La aplicación dfa, la diferencial de f en a, es única; su matriz en las bases canónicas es la matriz jacobianaJf(a)=(∂xj∂fi(a)). La diferenciabilidad implica la continuidad y la existencia de todas las derivadas direccionales dfa(v)=limt→0tf(a+tv)−f(a); el recíproco es falso (Ejercicio 15.2). Para m=1, dfa(h)=⟨∇f(a),h⟩: el gradiente del primer año, entendido ahora como el vector que representa la diferencial.
Demostración. Componente a componente (basta m=1). La demostración del primer año para dos variables —moverse de una coordenada en una coordenada, aplicar el teorema del valor medio de una variable en cada tramo y usar la continuidad de las parciales en a— se generaliza palabra por palabra a n tramos:
donde h(j) congela las j primeras coordenadas de h y ξj está en el j-ésimo tramo; la continuidad convierte cada ∂xj∂f(ξj) en ∂xj∂f(a)+o(1), y el error es o(∥h∥). ∎
y ambos términos de error son o(∥h∥): el primero porque dgb es continua y ε1→0; el segundo porque ∥k∥≤C∥h∥ (aplicación lineal acotada más un término pequeño) y ε2(k)→0 cuando h→0. ∎
Ejemplo 15.4(Funciones radiales, de una vez por todas)
Sean r(x)=∥x∥2 sobre Rn∖{0} y f=g∘r con g una función C1 de una variable. Primero, r es diferenciable fuera de 0: de r2=∑xi2,
∂xi∂r=rxi,es decir,∇r(x)=∥x∥x,
el vector radial unitario (derívese r2 y divídase, o aplíquese la regla de la cadena a ⋅). Entonces la regla de la cadena da, para toda función radial,
∇f(x)=g′(∥x∥)∥x∥x.
Ejemplo resuelto: g(r)=r1 da ∇∥x∥1=−∥x∥3x, el campo del inverso del cuadrado de la gravitación y la electrostática: de dirección radial y magnitud ∥x∥21. Moraleja: los gradientes de las funciones radiales son radiales porque las curvas de nivel son esferas y el gradiente es ortogonal a ellas; en x=0, en cambio, rno es diferenciable (ninguna aplicación lineal candidata se ajusta a ∥h∥ desde todas las direcciones): los perfiles radiales suaves necesitan g′(0)=0 para cruzar el origen con elegancia.
Teorema 15.5(Desigualdad del valor medio)
Sea fdiferenciable sobre U y supongamos que el segmento [a,b]={a+t(b−a)} está contenido en U. Entonces
Demostración. La función φ(t)=f(a+t(b−a)) es diferenciable sobre [0,1] con φ′(t)=dfa+t(b−a)(b−a) (regla de la cadena), de norma≤M∥b−a∥ con M el supremo mostrado. Para f con valores en R concluye la desigualdad del valor medio de una variable; para valores vectoriales, aplíquese esta a t↦⟨u,φ(t)⟩ con u el vector unitario en la dirección de f(b)−f(a). Constancia: es localmente constante (segmentos dentro de bolas) más la conexidad (el conjunto donde f vale un valor dado es abierto y cerrado: Capítulo 4). ∎
Ejemplo 15.6(Una constante de Lipschitz a partir de la desigualdad del valor medio)
¿Es f(x,y)=sinxsinylipschitziana sobre R2, y con qué constante? Su gradiente es ∇f=(cosxsiny,sinxcosy), de norma al cuadrado
cos2xsin2y+sin2xcos2y≤sin2y+cos2y⋅1=1
(acótense cos2x y sin2x por 1 por separado), luego df(x,y)=∥∇f∥≤1 en todas partes, y el Teorema 15.5 sobre el segmento entre dos puntos cualesquiera da
∣f(b)−f(a)∣≤∥b−a∥2:
f es 1-lipschitziana, y la constante es óptima (cerca del origen, f(x,2π)=sinx tiene pendiente 1). Moraleja: la desigualdad del valor medio convierte una cota puntual de la diferencial en un módulo global de continuidad; la vía estándar hacia las estimaciones lipschitzianas en toda dimensión, y el motor que hay dentro del Ejercicio 15.12.
15.2 Derivadas segundas
Teorema 15.7(Schwarz)
Si f es C2 sobre U (todas las parciales segundas existen y son continuas), entonces, para todos i,j:
∂xi∂xj∂2f=∂xj∂xi∂2f.
Demostración. Bastan dos variables (x=xi, y=xj, las demás congeladas). Consideremos la diferencia segunda
Δ(h)=f(a+h,b+h)−f(a+h,b)−f(a,b+h)+f(a,b).
Fíjese h y póngase φ(x)=f(x,b+h)−f(x,b): entonces Δ(h)=φ(a+h)−φ(a), y dos aplicaciones del teorema del valor medio dan
con ξ∈(a,a+h) y η∈(b,b+h). Por continuidad, h2Δ(h)→∂y∂x∂2f(a,b) cuando h→0. El mismo cálculo con los papeles de las variables intercambiados (congelando primero la segunda variable) da h2Δ(h)→∂x∂y∂2f(a,b): los dos límites de la misma cantidad coinciden. ∎
Ejemplo 15.8(Por qué hace falta C2: el contraejemplo de Peano)
Sea f(x,y)=x2+y2xy(x2−y2), con f(0,0)=0. Fuera del origen, f es C∞; en el origen existen todas las parciales primeras y segundas, pero las mixtas discrepan. Calculemos a lo largo de los ejes: f(x,0)=f(0,y)=0, y para y=0,
las dos parciales mixtas existen y difieren. No hay contradicción con el Teorema 15.7: las parciales segundas de f no son continuas en 0 (pruébese a lo largo de y=tx). Moraleja: el teorema de Schwarz es un teorema genuino sobre la continuidad, no una identidad formal, y la hipótesis “C2” de Taylor–Young más abajo hace un trabajo real.
Teorema 15.9(Taylor–Young de orden 2)
Sean f:U→R de clase C2 y a∈U. Entonces, cuando h→0,
f(a+h)=f(a)+⟨∇f(a),h⟩+21⟨Hah,h⟩+o(∥h∥2),
donde Ha=(∂xi∂xj∂2f(a)) es la matriz hessiana (simétrica, por Schwarz).
Demostración. Aplíquese el teorema de Taylor–Young de una variable (volumen del primer año) a φ(t)=f(a+th) sobre [0,1]: por la regla de la cadena, φ′(t)=⟨∇f(a+th),h⟩ y φ′′(t)=⟨Ha+thh,h⟩, ambas continuas en t. Entonces φ(1)=φ(0)+φ′(0)+21φ′′(θ) (Taylor–Lagrange) con θ∈(0,1), y la continuidad de las parciales segundas convierte φ′′(θ) en φ′′(0)+o(1)⋅∥h∥2uniformemente: el desarrollo enunciado. ∎
Ejemplo 15.10(Un desarrollo por dos vías)
Desarrollemos f(x,y)=excosy en el origen hasta el orden 2. Por composición de desarrollos de una variable:
Por derivadas parciales:fx=excosy, fy=−exsiny, luego ∇f(0)=(1,0); y fxx=f, fyy=−f, fxy=−exsiny dan H0=diag(1,−1): el Teorema 15.9 reproduce 1+x+21(x2−y2). Los dos cálculos coinciden, y la vía de la composición fue más rápida: ninguna parcial segunda. Moraleja: el origen no es un punto crítico (∇f=0), de modo que, pese a la hessiana indefinida, no hay ningún punto de silla que declarar: manda el término lineal, y el test de segundo orden solo habla en los puntos críticos.
Teorema 15.11(Test de extremos de segundo orden, demostrado)
Sea f de clase C2 cerca de un punto crítico a (∇f(a)=0), con hessiana H=Ha.
Si H es definida positiva, a es un mínimo local estricto (definida negativa: máximo).
Si H tiene valores propios de ambos signos, a es un punto de silla: no hay extremo.
Si H es singular (y semidefinida), no hay conclusión.
El test “rt−s2” del primer año es el caso n=2: detH=rt−s2, y el signo de la traza se lee en r.
(2) A lo largo de un vector propiov+ con λ+>0: f(a+tv+)−f(a)=2λ+t2+o(t2)>0 para t pequeño; a lo largo de v− con λ−<0, la diferencia es negativa: ambos signos ocurren en todo entorno.
(3) f(x,y)=x2+y4, x2−y4 y x2+y3 comparten la misma hessiana singular semidefinida en 0 con tres comportamientos distintos. ∎
Ejemplo 15.12(Una clasificación completa, con lo global incluido)
Clasifiquemos todos los extremos de f(x,y)=x4+y4−4xy sobre R2. Puntos críticos:∇f=(4x3−4y,4y3−4x)=0 da y=x3 y x=y3=x9, luego x(x8−1)=0: las soluciones reales son (0,0), (1,1) y (−1,−1). Hessianas:H=(12x2−4−412y2). En (±1,±1): (12−4−412), de valores propios8 y 16: definida positiva, mínimos locales estrictos con f=−2. En (0,0): (0−4−40), de valores propios±4: un punto de silla. Globalidad: de 2∣xy∣≤x2+y2,
f es coerciva, así que alcanza un mínimo global (compacidad de los conjuntos de subnivel), necesariamente en un punto crítico: el valor −2, tanto en (1,1) como en (−1,−1), es el mínimo global; y no hay máximo (f no está acotada superiormente). Moraleja: el test local clasifica candidatos, pero solo un argumento de crecimiento convierte lo “local” en “global”: el patrón en dos pasos de toda demostración de optimización de este libro.
Método 15.13(Clasificar los extremos de f:Rn→R)
Resuélvase ∇f=0 (todos los puntos críticos; en un dominio con frontera, trátese la frontera aparte, como en el Ejercicio 15.7).
En cada punto crítico, calcúlense la hessiana y los signos de sus valores propios; en dimensión 2 basta detH y trH: si det<0, punto de silla; si det>0, extremo del tipo que indique el signo de la traza; si det=0, el test calla y hay que estudiar f a lo largo de curvas.
Para los enunciados globales, añádase un argumento de compacidad o de coercividad (f→+∞ en el infinito, o un conjunto de restricciones compacto) y compárense después los valores críticos.
15.3 El teorema de la función inversa
Teorema 15.14(Teorema de la función inversa)
Sean f:U→Rn de clase C1 y a∈U con dfainvertible. Entonces existen entornos abiertosV∋a y W∋f(a) tales que f:V→W es una biyección con inversa C1, y
d(f−1)f(x)=(dfx)−1(x∈V).
Demostración.Admitido a este nivel.∎
Observación 15.15(Por qué es cierto: la estrategia del punto fijo)
Resolver f(x)=y cerca de a se reescribe como la ecuación de punto fijo x=x+dfa−1(y−f(x))=:Φy(x); la aplicación Φy tiene diferencialid−dfa−1dfx, pequeña cerca de a por la continuidad de df, de modo que Φy es contractiva sobre una bola cerrada pequeña y el teorema del punto fijo de Banach (Teorema 4.12) proporciona la única solución local x=f−1(y). La continuidad y la diferenciabilidad de la inversa se siguen entonces de las estimaciones de la contracción. La contabilidad completa se lleva a cabo en el tercer año; la estrategia —y el enunciado— se usan libremente a partir de ahora. El teorema de la función implícita que lo acompaña (resolver F(x,y)=0 en y(x) cuando ∂y∂F es invertible) se sigue aplicando el teorema a (x,y)↦(x,F(x,y)).
Ejemplo 15.16(Coordenadas polares)
Φ(r,θ)=(rcosθ,rsinθ) tiene jacobiana
JΦ=(cosθsinθ−rsinθrcosθ),detJΦ=r:
invertible para r=0, de modo que Φ es un difeomorfismo local de clase C1 fuera del origen; la licencia para “pasar a coordenadas polares”, renovada para las integrales múltiples del Capítulo 20.
Ejemplo 15.17(Local en todas partes, global en ninguna)
Sea f(x,y)=(excosy,exsiny) sobre R2. Su jacobiana,
Jf=(excosyexsiny−exsinyexcosy),detJf=e2x>0,
no se anula nunca: por el Teorema 15.14, f es un difeomorfismo local C1 en todo punto del plano. Y sin embargo, f dista mucho de ser inyectiva: f(x,y+2π)=f(x,y), así que cada valor se alcanza infinitas veces; y tampoco es sobreyectiva, pues ∥f(x,y)∥=ex>0 se salta el origen. Moraleja: el teorema de la función inversa es irreduciblemente local; la invertibilidad de todas las dfa rinde un mosaico de inversas locales que no tiene por qué ensamblarse en una sola. (Quien conozca los números complejos reconocerá z↦ez; el mosaico es la familia de ramas del logaritmo.) Compárese con el Ejercicio 15.12, donde una hipótesis global cuantitativa sí fuerza una única inversa global.
Observación 15.18(Errores frecuentes)
(i) Las derivadas direccionales son baratas; las diferenciales, no: pueden existir todas las derivadas direccionales —e incluso no depender linealmente de la dirección— sin que haya diferenciabilidad (Ejercicio 15.2); solo el criterio C1 (Teorema 15.2) asciende las parciales a diferencial. (ii) Crítico no significa extremal: tanto los puntos de silla (Ejemplo 15.12) como el caso singular mudo (Teorema 15.11 (3)) se esconden tras ∇f=0. (iii) No hay igualdad del valor medio con valores vectoriales: solo sobrevive la desigualdad del Teorema 15.5 (Ejercicio 15.9); no escribas nunca f(b)−f(a)=dfc(b−a) para f con valores en Rm, m≥2. (iv) La invertibilidad local no es la inyectividad:Ejemplo 15.17. (v) El gradiente pertenece al producto escalar:∇f es el vector que representa dfa en un producto escalar elegido; cámbiese el producto (como en el ejemplo con pesos del capítulo de formas cuadráticas) y el gradiente gira, mientras que la diferencial —el objeto intrínseco— no se mueve.
Observación 15.19(Dónde se usa)
Todo lo que viene después de este capítulo es cálculo diferencial aplicado: el capítulo de ecuaciones diferenciales lineariza flujos y usa la fórmula del determinante de Liouville (demostrada en el problema de fin de semana de este capítulo); los capítulos de curvas y superficies estudian conjuntos de nivel y parametrizaciones a través del teorema de la función implícita; las integrales múltiples cambian de variable mediante jacobianas. El problema de fin de semana desarrolla el cálculo sobre el propio espacio de matrices —la diferencial del determinante, la de la inversa, la exponencial de matrices y el grupo ortogonal como conjunto de nivel liso—, la sombra en el segundo año de lo que el volumen del tercer año formaliza como variedades y grupos de Lie.
Jf=(2x2y−2y2x), detJf=4(x2+y2): invertible fuera del origen. (Esta f es z↦z2 disfrazada de real.)
JΦ=cosθsinθ0−rsinθrcosθ0001, det=r: invertible para r=0 (coordenadas cilíndricas).
Ejercicio 15.2★
Sea f(x,y)=x2+y2x3 (con f(0,0)=0). Demuestra que todas las derivadas direccionales de f en 0 existen, pero que f no es diferenciable en 0(la aplicación v↦ derivada direccional no es lineal).
Solución
Solución de Ejercicio 15.2.
Para v=(a,b)=0: tf(tv)−0=t⋅t2(a2+b2)t3a3=a2+b2a3: existe toda derivada direccional, con valor Dv=a2+b2a3. Pero v↦Dv no es lineal (D(1,0)=1, D(0,1)=0, D(1,1)=21=1): ninguna aplicación lineal puede producir esos valores, luego f no es diferenciable en 0 (la diferencial tendría que ser v↦Dv).
Ejercicio 15.3★
Halla y clasifica los puntos críticos de f(x,y)=x3+y3−3xy usando el Teorema 15.11, y los de g(x,y)=x4+y4−2(x−y)2.
Solución
Solución de Ejercicio 15.3.
f=x3+y3−3xy: puntos críticos (0,0) y (1,1) (cálculo del primer año). Hessianas: H=(6x−3−36y). En (0,0): signos propios mixtos (det=−9<0): punto de silla. En (1,1): det=27>0 y traza >0: definida positiva, mínimo local estricto; ahora justificado por el Teorema 15.11 en vez de decretado.
g=x4+y4−2(x−y)2: ∇g=(4x3−4(x−y),4y3+4(x−y)); puntos críticos (0,0), (2,−2) y (−2,2) (primer año). En (±2,∓2): H=(12⋅2−44420)=(204420): definida positiva (diagonalmente dominante; valores propios24,16): mínimos locales estrictos. En (0,0): H=(−444−4), singular y semidefinida negativa: el test calla; el estudio direccional (g(x,x)=2x4>0, g(x,−x)=2x4−8x2<0 para x pequeño) muestra un punto de tipo silla: no hay extremo.
Ejercicio 15.4★★
Sea f:Rn→R de clase C1 y homogénea de grado p: f(tx)=tpf(x) para t>0. Demuestra la identidad de Euler
⟨∇f(x),x⟩=pf(x),
y su recíproco para funciones C1 sobre Rn∖{0}.
Solución
Solución de Ejercicio 15.4.
Derívese t↦f(tx) en t=1: por la regla de la cadena, ⟨∇f(x),x⟩; y por homogeneidad, esa misma función es tpf(x), de derivada pf(x) en t=1: la identidad de Euler.
Recíproco: fíjese x=0 y sea φ(t)=f(tx)−tpf(x) sobre t>0. Entonces φ′(t)=⟨∇f(tx),x⟩−ptp−1f(x)=t1(⟨∇f(tx),tx⟩−ptpf(x)). La hipótesis —la identidad de Euler en el punto tx— evalúa el corchete como pf(tx)−ptpf(x)=pφ(t). Así pues, φ′=tpφ con φ(1)=0: la única solución de esa EDO lineal es φ≡0 (unicidad del primer año), es decir, f(tx)=tpf(x).
Ejercicio 15.5★★
Sean Asimétrica y f(x)=21⟨Ax,x⟩−⟨b,x⟩. Calcula ∇f y Hf; ¿cuándo es f convexa? Suponiendo A definida positiva, prueba que f tiene un único mínimo global en la solución de Ax=b: la razón de ser del descenso de gradiente.
Solución
Solución de Ejercicio 15.5.
Desarrollando f(x+h)−f(x)=⟨Ax−b,h⟩+21⟨Ah,h⟩ (simetría de A): ∇f(x)=Ax−b y Hf=A en todas partes. f es convexa si y solo si A es semidefinida positiva (el test de la hessiana, aquí global porque H es constante: la fórmula de Taylor de segundo orden es exacta). Si A es definida positiva, el único punto crítico es x∗=A−1b, y f(x∗+h)−f(x∗)=21⟨Ah,h⟩≥2λmin∥h∥2>0 para h=0: mínimo global estricto.
Ejercicio 15.6★★
(Multiplicador de Lagrange con una restricción, demostrado a mano) Sean f,g de clase C1 sobre R2 y supongamos que f alcanza en a un extremo local sobre el conjunto de nivel {g=0}, con ∇g(a)=0. Demuestra que ∇f(a)=λ∇g(a) para cierto λ. (Parametriza el conjunto de nivel cerca de a mediante el teorema de la función implícita y deriva t↦f(γ(t)).) Aplicación: extremos de f(x,y)=xy sobre la circunferencia x2+y2=1.
Solución
Solución de Ejercicio 15.6.
Como ∇g(a)=0, alguna parcial, digamos ∂y∂g(a)=0: el teorema de la función implícita (el compañero del Teorema 15.14) parametriza {g=0} cerca de a=(a1,a2) como γ(t)=(t,y(t)) con y de clase C1 y y′(t)=−∂yg∂xg(γ(t)) (derívese g(t,y(t))=0). La función de una variable t↦f(γ(t)) tiene un extremo local en t=a1:
los vectores ∇f(a) y ∇g(a) tienen coordenadas proporcionales: ∇f(a)=λ∇g(a) con λ=∂yg(a)∂yf(a).
Aplicación: sobre la circunferencia, que ∇(xy)=(y,x) sea paralelo a (2x,2y) fuerza y2=x2; con la restricción, los candidatos son ±(21,21) (de valor 21) y ±(21,−21) (de valor −21): máximo 21 y mínimo −21 (alcanzados: la circunferencia es compacta).
Ejercicio 15.7★★
Determina los extremos de f(x,y)=x2+y2−xy+x−y sobre R2, y después su máximo y su mínimo sobre el triángulo cerrado de vértices (0,0), (1,0) y (0,1)(puntos críticos interiores, luego los tres lados, luego los vértices).
Solución
Solución de Ejercicio 15.7.
∇f=(2x−y+1,2y−x−1)=0: resolviendo, x=−31, y=31. Hessiana (2−1−12), definida positiva: mínimo global de la f cuadrática, de valor f(−31,31)=−31.
Sobre el triángulo T: el punto crítico interior (−31,31)∈/T (x negativo). Lados: sobre y=0, x∈[0,1]: f=x2+x, creciente, con extremos 0 y 2. Sobre x=0: f=y2−y, con mínimo −41 en y=21, y valores 0 y 0 en los extremos. Sobre x+y=1: sustituyendo y=1−x, f=x2+(1−x)2−x(1−x)+x−(1−x)=3x2−x; sobre [0,1]: mínimo −121 en x=61, y valores 0 (en x=0) y 2 (en x=1). Vértices: f(0,0)=0, f(1,0)=2, f(0,1)=0. Globalmente sobre T: mínimo −41 en (0,21) y máximo 2 en (1,0).
Ejercicio 15.8★★★
Sea f:R2→R2, f(x,y)=(x+y2,y+x2). Prueba que f es un difeomorfismo local cerca de 0, calcula d(f−1)(0,0) y halla el mayor r tal que df sea invertible sobre la bola ∥(x,y)∥2<r(calcula detJf).
Solución
Solución de Ejercicio 15.8.
Jf=(12x2y1), detJf=1−4xy. En 0: det=1=0, luego difeomorfismo local (Teorema 15.14), con
d(f−1)(0,0)=(Jf(0))−1=I2.
Invertibilidad sobre una bola: hace falta 4∣xy∣<1 en todo punto; sobre ∥(x,y)∥2<r, ∣xy∣≤2x2+y2<2r2, de modo que r=21 sirve; y es el mayor posible: en (x,y)=(21,21), de norma21, se tiene detJf=0.
Ejercicio 15.9★★★
(Rolle falla, el valor medio sobrevive) Da una f:R→R2, de clase C1, con f(0)=f(2π) pero f′(t)=0 para todo t (no hay Rolle con valores vectoriales). Verifica después sobre tu ejemplo la desigualdad del valor medio del Teorema 15.5.
Solución
Solución de Ejercicio 15.9.
f(t)=(cost,sint): f(0)=f(2π)=(1,0), y sin embargo f′(t)=(−sint,cost) tiene norma1 y nunca se anula: no hay ningún punto donde la derivada se anule; Rolle no tiene análogo vectorial. La desigualdad del valor medio se cumple holgadamente: ∥f(2π)−f(0)∥=0≤2π⋅sup∥f′∥=2π.
Ejercicio 15.10★
Calcula la diferencial y el gradiente de f(x)=∥x∥22 y de g(x)=⟨Ax,x⟩ sobre Rn (A una matriz cuadrada, no necesariamente simétrica), así como la hessiana de cada una. ¿Para qué A es g convexa?
Solución
Solución de Ejercicio 15.10.
f(x+h)−f(x)=2⟨x,h⟩+∥h∥2: dfx=2⟨x,⋅⟩, ∇f(x)=2x y hessiana 2I (constante). Para g:
luego ∇g(x)=(A+AT)x y Hg=A+AT, constante. Por el Ejercicio 15.11, g es convexa si y solo si A+AT es semidefinida positiva: solo importa la parte simétrica de A, como confirma que g(x)=⟨2A+ATx,x⟩.
Ejercicio 15.11★★
Sea f:Rn→R de clase C2. Demuestra que f es convexa si y solo si su hessiana Hx es semidefinida positiva en todo x(redúcelo a una variable: t↦f(a+t(b−a)); usa Taylor–Lagrange en una dirección y, para el recíproco, evalúa φ′′).
Solución
Solución de Ejercicio 15.11.
f es convexa si y solo si su restricción a todo segmento es convexa, es decir, si y solo si toda φ(t)=f(a+tv) es convexa. Por la regla de la cadena, φ′′(t)=⟨Ha+tvv,v⟩.
Si todas las hessianas son semidefinidas positivas, φ′′≥0, luego cada φ es convexa (volumen del primer año) y f es convexa. Recíprocamente, si f es convexa, cada φ lo es, luego φ′′(0)≥0: ⟨Hav,v⟩≥0 para todo a y toda dirección v, o sea, todas las hessianas son semidefinidas positivas.
Ejercicio 15.12★★★
(Un teorema de inversión global) Sea g:Rn→Rn de clase C1 con ∣∣∣dgx∣∣∣≤k<1 para todo x, y sea f=id+g.
Prueba que ∥f(x)−f(y)∥≥(1−k)∥x−y∥: f es inyectiva, con inversa continua sobre su imagen.
Prueba que, para cada y∈Rn, la aplicación x↦y−g(x) es una contracción del espacio completoRn, y concluye por el teorema del punto fijo de Banach (Teorema 4.12) que f es sobreyectiva.
Concluye que f es una biyección de Rn con inversa (1−k)−1-lipschitziana: una contrapartida global del Teorema 15.14 (que, por el contrario, es puramente local).
Solución
Solución de Ejercicio 15.12.
Por la desigualdad del valor medio (Teorema 15.5) aplicada a g: ∥g(x)−g(y)∥≤k∥x−y∥, luego
∥f(x)−f(y)∥≥∥x−y∥−∥g(x)−g(y)∥≥(1−k)∥x−y∥:
f es inyectiva y f−1 (definida sobre la imagen) es 1−k1-lipschitziana.
Fíjese y; T(x)=y−g(x) cumple ∥T(x)−T(x′)∥=∥g(x′)−g(x)∥≤k∥x−x′∥: es una contracción del espacio completoRn. Banach (Teorema 4.12) da un punto fijo x∗=y−g(x∗), es decir, f(x∗)=y: f es sobreyectiva.
Así pues, f es una biyección de Rn con inversa 1−k1-lipschitziana: un teorema de inversión global, donde la pequeñez de dg en todas partes sustituye a la hipótesis de invertibilidad local del Teorema 15.14.
15.5 Problema: el cálculo de matrices — Jacobi, exponencial y el grupo ortogonal
Problema 15.1
El terreno de juego más limpio para el cálculo diferencial es el propio espacio Mn(R)≃Rn2: sus aplicaciones más naturales —producto, inversa, determinante, exponencial— tienen diferenciales de sorprendente elegancia. Este problema las calcula todas: la serie de Neumann, la diferencial de la inversa, la fórmula de Jacobi para el determinante con la fórmula de Liouville como dividendo, la exponencial de matrices con deteA=etrA y, por último, el grupo ortogonal On como conjunto de nivel liso con las matrices antisimétricas como espacio tangente: geometría diferencial en embrión. En todo el problema, ∣∣∣⋅∣∣∣ es la norma de operador subordinada a ∥⋅∥2, y ⟨X,Y⟩=tr(XTY) es el producto escalar de Frobenius.
Parte I — La serie de Neumann.
Demuestra la submultiplicatividad, ∣∣∣AB∣∣∣≤∣∣∣A∣∣∣∣∣∣B∣∣∣, y deduce que las aplicaciones polinómicas de A (productos de matrices, determinante, traza) son continuas sobre Mn(R).
Para ∣∣∣X∣∣∣<1, prueba que ∑k≥0Xk converge absolutamente en Mn(R) (Teorema 5.21), que su suma es (I−X)−1 y que
Deduce que GLn(R) es abierto: si A es invertible y ∣∣∣H∣∣∣<∣∣∣A−1∣∣∣1, entonces A+H es invertible. Deduce también que GLn(R) es denso en Mn(R)(perturba A mediante εI: det(A+εI) es un polinomio no nulo en ε).
Prueba que la aplicación de inversión Φ(A)=A−1 es continua sobre GLn(R).
Prueba que la aplicación A↦A2 es diferenciable con diferencialH↦AH+HA, y, más en general, que A↦Ak tiene diferencialH↦∑i=0k−1AiHAk−1−i. ¿Por qué no puede escribirse kAk−1H en general?
Demuestra que Φ(A)=A−1 es diferenciable sobre GLn(R) con
dΦA(H)=−A−1HA−1
(escribe (A+H)−1=(I+A−1H)−1A−1 y desarrolla con la pregunta 2). Contrasta la fórmula con el caso escalar n=1.
Para una curva C1t↦A(t)∈GLn(R), deduce (A(t)−1)′=−A−1A′A−1, y desarrolla t↦(I+tB)−1 hasta el primer orden en t=0.
Calcula la diferencial de f(A)=tr(Ak) e identifica su gradiente para el producto escalar de Frobenius:
dfA(H)=ktr(Ak−1H),∇f(A)=k(Ak−1)T.
Las mismas preguntas para f(A)=tr(ATA)=∥A∥F2: diferencial, gradiente y hessiana (constante); concluye que ∥⋅∥F2 es estrictamente convexa.
Parte III — La fórmula de Jacobi.
Demuestra que
det(I+H)=1+trH+O(∣∣∣H∣∣∣2)
(desarrolla det(e1+h1,…,en+hn) por multilinealidad en las columnas: los términos con al menos dos columnas h son O(∣∣∣H∣∣∣2)): d(det)I=tr.
Para A invertible, deduce
d(det)A(H)=det(A)tr(A−1H).
Prueba que para todaA (invertible o no), ∂aij∂det(A)=Cij, el cofactor (i,j)(desarrollo de Laplace por la fila i), de modo que, con la adjunta clásica adjA=com(A)T:
d(det)A(H)=tr(adj(A)H),∇(det)(A)=com(A),
lo que recupera la pregunta 11 cuando A es invertible (adjA=det(A)A−1). Esta es la fórmula de Jacobi: (detA(t))′=tr(adj(A(t))A′(t)).
(Fórmula de Liouville) Sea A(t) una curva C1 de matrices que satisface la ecuación diferencial lineal A′(t)=M(t)A(t). Demuestra que
(detA(t))′=tr(M(t))detA(t),y por tantodetA(t)=detA(0)exp(∫0ttrM)
(usa adj(A)A=det(A)I y la invariancia cíclica de la traza): la identidad del wronskiano que el capítulo de ecuaciones diferenciales usará sin parar.
Prueba que SLn(R)={det=1} es un conjunto de nivel liso: en todo A∈SLn(R), la diferenciald(det)A es una aplicación lineal sobreyectiva sobre R(evalúala en H=n1A).
Prueba que eA=∑k≥0k!Ak converge absolutamente para toda A, y normalmente sobre toda bola, con eA≤e∣∣∣A∣∣∣; y que eA depende continuamente de A.
Demuestra que AB=BA implica eA+B=eAeB(producto de Cauchy, legítimo por la convergencia absoluta); deduce que eA es siempre invertible, con inversa e−A: exp manda Mn(R) dentro de GLn(R).
Prueba que t↦etA es de clase C1 (de hecho C∞) con
dtdetA=AetA=etAA
(deriva la serie término a término sobre segmentos: la serie derivada converge normalmente).
Demuestra la identidad
det(eA)=etrA
(aplica la fórmula de Liouville, pregunta 13, a A(t)=etA). Comprobaciones de sensatez: n=1; A nilpotente; y que las matrices de traza nula aterrizan en SLn(R).
Prueba que eH=I+H+O(∣∣∣H∣∣∣2), de modo que exp es diferenciable en 0 con d(exp)0=id; concluye con el teorema de la función inversa (Teorema 15.14) que exp es un difeomorfismo C1 de un entorno de 0 sobre un entorno de I: toda matriz próxima a la identidad tiene logaritmo.
Prueba que exp manda las matrices simétricas a las matrices simétricasdefinidas positivas, de manera biyectiva (diagonaliza; la inversa es el logaritmo espectral).
Parte V — El grupo ortogonal como conjunto de nivel.
Sea F(A)=ATA, de Mn(R) en las matrices simétricasSn. Calcula dFA(H)=ATH+HTA y prueba que, en todo A∈On=F−1(I), esta diferencial es sobreyectiva sobre Sn(dada S∈Sn, prueba con H=21AS): On es un conjunto de nivel liso, de dimensión n2−2n(n+1)=2n(n−1).
Prueba que toda curva C1A(t)∈On con A(0)=I tiene velocidad A′(0)antisimétrica, y recíprocamente que, para K antisimétrica, la curva etK permanece en On: el espacio tangente de On en I es exactamente el de las matrices antisimétricas.
Prueba que deteK=1 para K antisimétrica (pregunta 18): la curva exponencial vive en el grupo de rotaciones SOn. Calcúlala por completo para n=2: con J=(01−10), demuestra que
eθJ=(cosθsinθ−sinθcosθ):
la exponencial de matriceses la rotación de ángulo θ, y las definiciones por series del coseno y del seno reaparecen dentro de una matriz.
(El truco de la densidad) Usando la densidad de GLn(R) (pregunta 3) y la continuidad, extiende de las matrices invertibles a todas la identidad
adj(AB)=adj(B)adj(A)
(para A,B invertibles, ambos miembros valen det(AB)(AB)−1; y ambos son polinómicos en las entradas).
Síntesis. Una frase para cada punto: (i) qué capítulos anteriores suministraron el motor de cada parte (la completitud y las álgebras normadas; el teorema espectral; el teorema de la función inversa); (ii) en qué fórmula de este problema se apoyará el capítulo de ecuaciones diferenciales, y dónde; (iii) qué dicen d(det)I=tr y deteA=etrA sobre la traza y el determinante como “volumen infinitesimal y global”; (iv) qué hace el volumen del tercer año con las preguntas 21–23 (grupos de Lie y sus álgebras de Lie).
Solución
Solución de Problema 15.1.
1.∥ABx∥≤∣∣∣A∣∣∣∥Bx∥≤∣∣∣A∣∣∣∣∣∣B∣∣∣∥x∥: tómese el supremo sobre ∥x∥=1. Los productos de matrices, det y tr son funciones polinómicas de las entradas, luego continuas (Mn(R)≃Rn2, con todas las normas equivalentes: Teorema 5.13).
2.∑Xk≤∑∣∣∣X∣∣∣k<∞: la serie converge absolutamente, luego converge (Teorema 5.21). De (I−X)∑k≤NXk=I−XN+1→I se sigue que la suma es (I−X)−1. Norma: ≤∑∣∣∣X∣∣∣k=1−∣∣∣X∣∣∣1; y
3.A+H=A(I+A−1H) con A−1H≤A−1∣∣∣H∣∣∣<1: invertible por la pregunta 2, de modo que la bola abierta de radio A−1−1 centrada en A está en GLn(R). Densidad: det(A+εI) es un polinomio de grado n en ε con coeficiente principal 1: tiene un número finito de raíces, así que hay εk→0 con A+εkI invertible, convergiendo a A.
4. Para ∣∣∣H∣∣∣<2∣∣∣A−1∣∣∣1:
(A+H)−1−A−1=[(I+A−1H)−1−I]A−1,
de norma a lo sumo 1−∣∣∣A−1H∣∣∣∣∣∣A−1H∣∣∣A−1≤2A−12∣∣∣H∣∣∣→0: Φ es continua en todo A∈GLn(R).
5.(A+H)2=A2+AH+HA+H2: la aplicación H↦AH+HA es lineal y el error H2 es O(∣∣∣H∣∣∣2). Desarrollando (A+H)k y ordenando por el número de factores H: la parte lineal es ∑i=0k−1AiHAk−1−i, y los términos con ≥2 factores H están acotados por (2k) productos de norma del orden de ∣∣∣A∣∣∣k−2∣∣∣H∣∣∣2: O(∣∣∣H∣∣∣2). La suma no puede colapsarse a kAk−1H porque H y A no tienen por qué conmutar: la suma es la derivada no conmutativa correcta.
dΦA(H)=−A−1HA−1, lineal en H. Para n=1: d(1/a)(h)=−h/a2, la derivada de siempre.
7. Regla de la cadena a lo largo de la curva: (A(t)−1)′=dΦA(t)(A′(t))=−A(t)−1A′(t)A(t)−1. En A(t)=I+tB, con t=0: (I+tB)−1=I−tB+O(t2).
8. Por la pregunta 5 y la invariancia cíclica de la traza:
dfA(H)=tr(i=0∑k−1AiHAk−1−i)=ktr(Ak−1H).
Frente al producto de Frobenius, dfA(H)=tr((∇f)TH) exige (∇f)T=kAk−1: ∇f(A)=k(Ak−1)T.
9.f(A+H)−f(A)=2tr(ATH)+tr(HTH): la diferencial es H↦2tr(ATH)=2⟨A,H⟩, luego ∇f(A)=2A; y el término de segundo orden es exactamente ∥H∥F2: la hessiana es el doble de la forma cuadrática identidad, definida positiva y constante, de modo que ∥⋅∥F2 es estrictamente convexa (aquí la fórmula de Taylor es exacta).
10. Por multilinealidad en las columnas, det(I+H)=∑S⊆{1,…,n}det(MS), donde MS tiene la columna hj para j∈S y ej en los demás casos. S=∅ da 1; S={j} da el determinante de I con la columna j sustituida por hj, a saber, su entrada j-ésima hjj, que suman trH; cada término con ∣S∣≥2 es un determinante con al menos dos columnas de tamaño O(∣∣∣H∣∣∣), luego O(∣∣∣H∣∣∣2) (las aplicaciones multilineales sobre un espacio de dimensión finita son acotadas), y hay un número finito de ellos. Por tanto, det(I+H)=1+trH+O(∣∣∣H∣∣∣2): d(det)I=tr.
11.det(A+H)=detAdet(I+A−1H)=detA(1+tr(A−1H)+O(∣∣∣H∣∣∣2)): la diferencial es H↦det(A)tr(A−1H).
12. Desarrollo de Laplace por la fila i: detA=∑jaijCij, y los cofactores Cij no involucran la fila i: ∂aij∂det=Cij. De ahí,
Para A invertible, adjA=det(A)A−1 recupera la pregunta 11. A lo largo de una curva C1, la regla de la cadena se lee (detA(t))′=tr(adj(A(t))A′(t)): la fórmula de Jacobi.
13. Con A′=MA y adj(A)A=det(A)I:
(detA)′=tr(adj(A)MA)=tr(Aadj(A)M)=detAtrM
(ciclicidad; y también AadjA=det(A)I). La EDO lineal escalar y′=tr(M(t))y tiene la única solución y(t)=y(0)exp(∫0ttrM) (primer año): la fórmula de Liouville.
14. En A∈SLn(R), tómese H=n1A: d(det)A(n1A)=n1det(A)tr(A−1A)=n1⋅1⋅n=1=0: la diferencial es una forma lineal no nula, luego sobreyectiva sobre R en todo punto del conjunto de nivel: SLn(R) es un conjunto de nivel liso (de dimensión n2−1).
15.∑kAk/k!≤∑∣∣∣A∣∣∣k/k!=e∣∣∣A∣∣∣: convergencia absoluta (el argumento de completitud de la pregunta 2), con convergencia normal sobre toda bola ∣∣∣A∣∣∣≤R (cota Rk/k! independiente de A). Cada suma parcial es continua (polinómica); el límite uniforme sobre bolas es continuo: A↦eA es continua, con eA≤e∣∣∣A∣∣∣.
donde la identidad del binomio exige AB=BA. Con B=−A: eAe−A=e0=I: toda eA∈GLn(R).
17. La serie ∑tkAk/k! y su serie derivada ∑tk−1Ak/(k−1)!=A∑tk−1Ak−1/(k−1)! convergen normalmente sobre todo segmento ∣t∣≤T (con cotas Tk∣∣∣A∣∣∣k/k!): el teorema de derivación de series (Teorema 10.11, aplicado entrada a entrada) da dtdetA=AetA; sacando factor A por la derecha se obtiene etAA. Iterando: es C∞.
18.A(t)=etA cumple A′(t)=AA(t): la fórmula de Liouville (pregunta 13) con M=A constante da detetA=ettrA (de valor 1 en t=0); en t=1, deteA=etrA. Comprobaciones: n=1 es la propia exponencial; una A nilpotente tiene trA=0 y eA unipotente de determinante1; y trA=0 da deteA=1: las matrices de traza nula van a parar a SLn(R).
19.eH−I−H=∑k≥2Hk/k!, de norma≤∣∣∣H∣∣∣2e∣∣∣H∣∣∣=O(∣∣∣H∣∣∣2): d(exp)0=id, invertible. Además, exp es C1: por la pregunta 5, la diferencial candidata H↦∑kk!1∑iAiHAk−1−i es una serie normalmente convergente de aplicaciones lineales que dependen continuamente de A (con cotas ∣∣∣A∣∣∣k−1/(k−1)! sobre bolas), luego las parciales existen y son continuas (Teorema 15.2 y el teorema de transferencia para series). El teorema de la función inversa (Teorema 15.14) se aplica en 0: exp es un difeomorfismo C1 de un entorno de 0 sobre un entorno de I; las matrices próximas a I tienen logaritmo.
20. Para S=PDPTsimétrica (teorema espectral): eS=PeDPT es simétrica con valores propioseλi>0: definida positiva. Sobreyectividad: una Q=Pdiag(μi)PT definida positiva (μi>0) es eS para S=Pdiag(lnμi)PT. Inyectividad: eS determina sus subespacios propios, que son exactamente los de S (sobre cada subespacio propio de S para λ, eS actúa como eλ; y λ distintos dan eλ distintos), y tomar ln de los valores propios recupera S. Así pues, exp es una biyección de las matrices simétricas sobre las definidas positivas.
21.F(A+H)=ATA+ATH+HTA+HTH: dFA(H)=ATH+HTA (con valores en Sn; error O(∣∣∣H∣∣∣2)). En A∈On y para S∈Sn, la elección H=21AS da
AT⋅21AS+21(AS)TA=21S+21ST=S:
sobreyectiva. On=F−1(I) es un conjunto de nivel liso de dimensión n2−dimSn=2n(n−1).
22. Derivando A(t)TA(t)=I en t=0 (con A(0)=I): A′(0)T+A′(0)=0: antisimétrica. Recíprocamente, para KT=−K: (etK)TetK=etKTetK=e−tKetK=I (traspóngase la serie término a término; los exponentes conmutan): la curva permanece en On, con velocidad K en t=0. El espacio tangente en I es el de las matrices antisimétricas, de la dimensión esperada 2n(n−1).
23.trK=0 para K antisimétrica, luego deteK=e0=1 (pregunta 18): la exponencial aterriza en SOn. Para n=2: J2=−I, luego J2m=(−1)mI y J2m+1=(−1)mJ, y
la rotación de ángulo θ: las series del seno y del coseno viven dentro de la exponencial de matrices.
24. Para A,B invertibles: adj(AB)=det(AB)(AB)−1=det(B)det(A)B−1A−1=adj(B)adj(A). Ambos miembros de la identidad son aplicaciones polinómicas (luego continuas) de las entradas de (A,B); coinciden sobre el subconjunto denso GLn×GLn de Mn×Mn (pregunta 3: aproxímese cada factor), luego coinciden en todas partes.
25. (i) La parte I funcionó con la completitud de los espacios normados de dimensión finita (las series absolutamente convergentes convergen); la parte IV, con lo mismo más el teorema espectral para la pregunta 20; y el logaritmo local de la parte V, con el teorema de la función inversa. (ii) El capítulo de ecuaciones diferenciales se apoya en la fórmula de Liouville (pregunta 13) para el wronskiano de los sistemas lineales, y en dtdetA=AetA (pregunta 17), que es el enunciado de que etA resuelve X′=AX. (iii) d(det)I=tr dice que la traza es la tasa infinitesimal de cambio de volumen, y deteA=etrA integra globalmente ese enunciado. (iv) El volumen del tercer año pone nombre a las estructuras: On y SLn(R) son grupos de Lie, sus espacios tangentes en I (las matrices antisimétricas y las de traza nula) son álgebras de Lie, y exp es el puente entre unos y otras.