---
title: "Genómica y secuenciación"
book: "Biología universitaria — tercer año"
subject: biology
language: es
chapter: 4
exercises: 12
source: https://one-course.com/books/biology/5/es/chapter/4-genomica-y-secuenciacion
---

# Capítulo 4 — Genómica y secuenciación

El primer genoma completo de un organismo de vida libre, las $1.8\,\mathrm{Mb}$ de una bacteria, se publicó en 1995 tras un año de trabajo de un equipo de cuarenta personas. El genoma humano, $3.2$ mil millones de pares de bases, le costó a un consorcio internacional trece años y unos tres mil millones de dólares, y se declaró terminado en 2003. Hoy una máquina de sobremesa lee un genoma humano en una noche por unos pocos centenares de dólares, un hospital secuencia el tumor de un paciente para elegir un fármaco y un museo extrae y lee el genoma de un hueso de cuarenta mil años. La tecnología que ha hecho esto posible, la matemática que convierte millones de [lecturas](#def-b3-genomics-ngs) cortas en un genoma y lo que los genomas terminados han enseñado sobre el tamaño, el contenido y la historia de nuestro ADN son el asunto de este capítulo. El capítulo siguiente retoma los algoritmos que comparan las secuencias ya obtenidas.

## 4.1 Leer el ADN

**Definición 4.1 (Secuenciación por terminación de cadena).**

La *secuenciación de Sanger* copia un molde de hebra sencilla a partir de un cebador con ADN-polimerasa en presencia de los cuatro nucleótidos normales y de una pequeña proporción de *didesoxinucleótidos*, que carecen del hidroxilo 3$'$ y terminan por tanto la cadena allí donde se incorporan. Cada didesoxinucleótido lleva un fluoróforo distinto. El producto es una mezcla de fragmentos, uno por cada posición del molde, y cada uno acaba en una base de identidad conocida; separados por tamaño en un capilar de gel, pasan por un detector en orden de longitud, y la secuencia de colores es la secuencia del molde. Una carrera lee $700\text{ a }900\,\mathrm{bp}$ con una tasa de error por debajo de $10^{-3}$; sigue siendo el método para verificar una construcción o un solo gen.

**Evidencia.** Sanger, Nicklen y Coulson publicaron el método en 1977 y lo usaron ese mismo año para leer los $5386\,\mathrm{bp}$ del fago $\phi$X174 — el primer genoma de ADN completo — y en 1981 los $16\,569\,\mathrm{bp}$ de la mitocondria humana. Fleischmann y colaboradores (1995) leyeron las $1.83\,\mathrm{Mb}$ de *Haemophilus influenzae* rompiendo todo el genoma en fragmentos al azar, secuenciando $24\,000$ de ellos y ensamblando las [lecturas](#def-b3-genomics-ngs) por ordenador — la estrategia de *escopetazo del genoma completo* que todos los proyectos posteriores ampliaron. ∎

![Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/img-449ad1d73146.jpg)

![Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/img-874706cdd095.jpg)

*Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas.*

![La secuenciación por terminación de cadena. Una base didesoxi termina la copia en cada posición donde se incorpora; los fragmentos, uno por longitud, se separan por tamaño y el color de cada base terminal se lee en orden.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/fig-7dadfdfec654.svg)

*La secuenciación por [terminación de cadena](#def-b3-genomics-sanger). Una base didesoxi termina la copia en cada posición donde se incorpora; los fragmentos, uno por longitud, se separan por tamaño y el color de cada base terminal se lee en orden.*

**Definición 4.2 (Secuenciación masiva en paralelo).**

Los instrumentos de segunda generación leen de millones a miles de millones de fragmentos a la vez. En la *secuenciación por síntesis* los fragmentos, con adaptadores ligados a sus extremos, se fijan a una celda de flujo de vidrio y se amplifican in situ en agrupaciones de moléculas idénticas; las agrupaciones se alargan luego una base por ciclo con nucleótidos fluorescentes y bloqueados de forma reversible, se fotografían, se desbloquean y se vuelven a alargar, de modo que cada ciclo añade una base a la *lectura* de cada agrupación. Las lecturas son de $100\text{ a }300\,\mathrm{bp}$, casi siempre desde los dos extremos de un fragmento (*extremos emparejados*), con una tasa de error de unos $10^{-3}$ por base, y una carrera rinde hasta $10^{12}$ bases. Los instrumentos de tercera generación, de *lectura larga*, leen moléculas sueltas sin amplificación: observando cómo una polimerasa incorpora nucleótidos fluorescentes en tiempo real, o haciendo pasar el ADN por un *nanoporo* proteico y registrando la corriente iónica, que cada secuencia de bases modula a su manera. Las lecturas de $10\text{ a }100\,\mathrm{kb}$ y más abarcan las repeticiones que las lecturas cortas no pueden, con una tasa bruta de error mayor que el consenso reduce.

![Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/img-1248e19cab5b.jpg)

![Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/img-7e84822a8975.jpg)

*Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de [nanoporos](#def-b3-genomics-ngs) de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.*

**Teorema 4.3 (Cobertura y huecos en un proyecto de escopetazo).**

Tómense $N$ [lecturas](#def-b3-genomics-ngs) de longitud $L$ en posiciones aleatorias de un genoma de longitud $G$, y sea $c = NL/G$ la *cobertura*, el número medio de [lecturas](#def-b3-genomics-ngs) que cubren una base. El número de [lecturas](#def-b3-genomics-ngs) que cubre una base dada sigue entonces una Poisson de media $c$: la fracción del genoma que queda sin secuenciar es

$$
P(\text{sin cubrir}) = e^{-c},
$$

y si dos [lecturas](#def-b3-genomics-ngs) se reconocen como solapadas solo cuando comparten al menos $T$ bases, de modo que $\theta = T/L$, el número esperado de *contigs* (islas de [lecturas](#def-b3-genomics-ngs) solapadas) es

$$
\text{contigs} = N\,e^{-c(1-\theta)},
$$

y su longitud media es $L\,\bigl(e^{c(1-\theta)} - 1\bigr)/c + L\theta$, aproximadamente.

**Demostración.** Los puntos de inicio de las [lecturas](#def-b3-genomics-ngs) caen al azar con densidad $N/G$ por base. Una base la cubren las [lecturas](#def-b3-genomics-ngs) que empiezan en las $L$ bases anteriores; el número de inicios en una ventana de longitud $L$ sigue una Poisson de media $LN/G
= c$, y la probabilidad de que no haya ninguno es $e^{-c}$. Una [lectura](#def-b3-genomics-ngs) es la más a la derecha de su contig si ninguna otra empieza dentro de las $L - T = L(1-\theta)$ bases posteriores a su propio inicio (una [lectura](#def-b3-genomics-ngs) que empezara más tarde se solaparía con ella en menos de $T$ y no se uniría); esa probabilidad es $e^{-c(1-\theta)}$, y, como cada contig tiene exactamente una [lectura](#def-b3-genomics-ngs) más a la derecha, el número esperado de contigs es $N e^{-c(1-\theta)}$. La longitud media de un contig se sigue de $G$ dividido por el número de contigs, corregido por la fracción no cubierta. ∎

**Ejemplo 4.4 (Cuánto basta).**

Con $c = 5$ la fracción sin secuenciar es $e^{-5} = 0.7\,\%$ — para un genoma de $3.2\,\mathrm{Gb}$, veinte millones de bases en algunas decenas de miles de huecos. Con $c = 10$ es $4.5\times 10^{-5}$, $150\,\mathrm{kb}$ en total. Los genomas humanos se secuencian de rutina a $c = 30$, no por los huecos de cobertura ($e^{-30} \approx 10^{-13}$), sino porque cada base ha de leerse varias veces en cada uno de los dos cromosomas para llamar con confianza una variante heterocigótica frente a una tasa de error de $10^{-3}$ por [lectura](#def-b3-genomics-ngs). Los genomas bacterianos se secuencian a $c = 50$–$100$ por la misma razón y porque es barato. La fórmula muestra además lo que la cobertura no puede arreglar: una repetición más larga que una [lectura](#def-b3-genomics-ngs) es un punto donde el grafo de solapamientos se ramifica, y ninguna cantidad de [lecturas](#def-b3-genomics-ngs) cortas lo resuelve. Para eso están las [lecturas](#def-b3-genomics-ngs) largas.

![Las dos magnitudes de Lander–Waterman frente a la cobertura: la fracción del genoma que no se lee nunca cae como e-c, y el número de contigs (aquí escalado por lectura) alcanza un máximo a baja cobertura y luego cae a medida que las islas se funden.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/fig-3d9931bc9e38.svg)

*Las dos magnitudes de Lander–Waterman frente a la cobertura: la fracción del genoma que no se lee nunca cae como $e^{-c}$, y el número de contigs (aquí escalado por [lectura](#def-b3-genomics-ngs)) alcanza un máximo a baja cobertura y luego cae a medida que las islas se funden.*

## 4.2 De las lecturas a un genoma

**Definición 4.5 (Ensamblaje y anotación).**

El *ensamblaje* reconstruye un genoma a partir de sus [lecturas](#def-b3-genomics-ngs) por solapamiento: en un *grafo de solapamientos* cada [lectura](#def-b3-genomics-ngs) es un nodo unido a las [lecturas](#def-b3-genomics-ngs) con las que se solapa; en un *grafo de De Bruijn*, usado para miles de millones de [lecturas](#def-b3-genomics-ngs) cortas, cada $k$-mero (subsecuencia de longitud $k$) es un nodo y el genoma es un camino a través de ellos. Las repeticiones más largas que la [lectura](#def-b3-genomics-ngs) rompen ambos, porque dan caminos ramificados. Los contigs se ordenan y se orientan en *andamios* mediante [lecturas](#def-b3-genomics-ngs) de extremos emparejados e información de largo alcance ([lecturas](#def-b3-genomics-ngs) largas, mapas ópticos, mapas de contacto cromosómico), y los andamios se colocan sobre los cromosomas. La calidad de un ensamblaje se resume en el *N50*: la longitud de contig tal que la mitad de las bases ensambladas están en contigs al menos así de largos. La *anotación* busca después los genes: en las bacterias, marcos de [lectura](#def-b3-genomics-ngs) abiertos más largos de lo esperable por azar; en los eucariotas, combinando señales de secuencia (sitios de corte, promotores, sesgo de codones), homología con proteínas conocidas y transcritos secuenciados a partir del ARN. El resultado, para una especie, es un *genoma de referencia* al que se alinea toda [lectura](#def-b3-genomics-ngs) posterior de esa especie en lugar de ensamblarla de nuevo.

**Método 4.6 (De una muestra a las variantes).**

Para un estudio de resecuenciación de un individuo frente a una referencia: (1) extráigase el ADN, fragméntese a $300\text{ a }500\,\mathrm{bp}$ y líguense adaptadores (la *genoteca*); (2) secúnciese a la cobertura necesaria (30$\times$ para un genoma humano, 100$\times$ para un exoma, que captura el $1.5\,\%$ del genoma que codifica proteína); (3) alinéese cada [lectura](#def-b3-genomics-ngs) con la referencia, tolerando desajustes; (4) en cada posición cuéntense las bases de las [lecturas](#def-b3-genomics-ngs): una posición en la que alrededor de la mitad de las [lecturas](#def-b3-genomics-ngs) discrepan de la referencia es una *variante* heterocigótica, una en la que discrepan casi todas es homocigótica y una en la que discrepan unas pocas es un error; (5) fíltrese por profundidad, calidad de base y equilibrio de hebras; (6) anótese cada variante con su efecto sobre algún gen (sinónima, de sentido erróneo, sin sentido, de corte, de desplazamiento del marco) y con su frecuencia en las bases de datos poblacionales; (7) para un diagnóstico, consérvense las variantes raras que se predicen dañinas en genes compatibles con el fenotipo, y confírmense por [secuenciación de Sanger](#def-b3-genomics-sanger).

## 4.3 Qué aspecto tienen los genomas

**Proposición 4.7 (Tamaño del genoma y número de genes).**

Los tamaños de genoma abarcan un factor de $10^{5}$ entre los eucariotas — $12\,\mathrm{Mb}$ en la levadura, $100\,\mathrm{Mb}$ en el gusano, $140\,\mathrm{Mb}$ en la mosca, $3.2\,\mathrm{Gb}$ en el ser humano, $16\,\mathrm{Gb}$ en una cebolla, $130\,\mathrm{Gb}$ en un pez pulmonado, $150\,\mathrm{Gb}$ en el lirio *Paris japonica* —, mientras que los números de genes apenas abarcan un factor de $10$: $6000$ en la levadura, $20\,000$ en el gusano, $14\,000$ en la mosca, unos $20\,000$ genes codificantes de proteína en el ser humano y $40\,000$ en el arroz. Es la *[paradoja del valor C](#prop-b3-genomics-sizes)*: el [tamaño del genoma](#prop-b3-genomics-sizes) no mide la complejidad, ni tampoco el número de genes. Lo que varía es el contenido no codificante — intrones, elementos transponibles, repeticiones satélite —, y el número de proteínas que un genoma puede producir se multiplica mucho más allá de su número de genes por el corte y empalme alternativo ([Capítulo 2](https://one-course.com/books/biology/5/es/chapter/2-arn-no-codificantes-y-regulacion-postranscripcional#ch-b3-rna-regulation)) y por la regulación, que es donde está escrita sobre todo la complejidad de un organismo. Los genomas bacterianos, en cambio, son compactos y su tamaño sí sigue al número de genes: alrededor de un gen por kilobase, con un $88\,\%$ codificante en *E. coli*.

**Ejemplo 4.8 (El genoma humano por contenido).**

De las $3.2\,\mathrm{Gb}$: exones codificantes de proteína, $1.5\,\%$; intrones y regiones no traducidas de los genes, alrededor del $35\,\%$; elementos transponibles y sus fósiles, alrededor del $45\,\%$ — retrotransposones LINE-1, $17\,\%$; elementos Alu, $10\,\%$ (más de un millón de copias de una secuencia de $300\,\mathrm{bp}$); retrovirus endógenos, $8\,\%$; duplicaciones segmentarias, $5\,\%$; repeticiones simples y satélites, incluidos los centrómeros, alrededor del $5\,\%$; y el resto, secuencia única no codificante, donde viven los elementos reguladores. Unos $100\text{ a }200$ genes codifican aún maquinaria LINE-1 activa, y se producen inserciones nuevas alrededor de una vez de cada veinte nacimientos. Cerca del $8\,\%$ del genoma está bajo una selección purificadora detectable — mucho más que los exones — y casi todo ello es regulador.

![El genoma humano por contenido, a escala. Los exones codificantes de proteína (rojo) son una astilla; casi la mitad del genoma desciende de elementos transponibles.](https://one-course.com/images/onecourse/chapters/biology-5/b3-genomics/fig-c4178708c9bc.svg)

*El genoma humano por contenido, a escala. Los exones codificantes de proteína (rojo) son una astilla; casi la mitad del genoma desciende de elementos transponibles.*

**Definición 4.9 (Genómica comparada).**

Los genes de dos especies que descienden de un solo gen de su antepasado común son *ortólogos*; los genes de una misma especie que descienden de una duplicación son *parálogos*. Los bloques de cromosoma en los que el orden de los genes se conserva entre especies son *sinténicos*; la sintenia permite localizar un gen en un genoma a partir de su posición en otro y revela los reordenamientos que separan dos cariotipos (unos $1000$ entre el ser humano y el ratón). Las secuencias conservadas entre especies lejanas que no codifican proteína — los *elementos no codificantes conservados*, algunos ultraconservados base a base a lo largo de $200\,\mathrm{bp}$ entre el ser humano y los peces — son en su mayoría potenciadores de genes del desarrollo. Las *duplicaciones del genoma completo* han marcado la historia de varios linajes: dos rondas en el origen de los vertebrados (los cuatro agrupamientos Hox de los mamíferos frente al único de los invertebrados), una en el antepasado de los salmónidos, otra en el linaje de la levadura y varias en las plantas con flor; los genes duplicados se pierden casi siempre a lo largo de decenas de millones de años, y los supervivientes divergen en función.

**Ejemplo 4.10 (Ser humano y chimpancé).**

La secuencia de copia única alineada difiere entre el ser humano y el chimpancé en el $1.2\,\%$ de las bases — unos $35$ millones de sustituciones — y en inserciones y deleciones que juntas suman otro $3\,\%$ de cada genoma. Dos personas difieren en cerca de una base de cada mil, unos $4\text{ a }5$ millones de sitios, más unos pocos miles de variantes estructurales; dos chimpancés, cuya población ha sido mayor durante más tiempo, en bastantes más. Un niño lleva unas $70$ mutaciones nuevas ausentes en ambos progenitores, cuatro quintas partes de ellas del padre, y el número sube unas dos por año de edad paterna — la aritmética del [Capítulo 3](https://one-course.com/books/biology/5/es/chapter/3-estabilidad-del-genoma-dano-reparacion-y-recombinacion-del-adn#ch-b3-dna-repair) aplicada a las muchas divisiones de la espermatogénesis.

## 4.4 Genomas y caracteres

**Definición 4.11 (Asociación de genoma completo).**

Un *polimorfismo de un solo nucleótido* (SNP) es una posición en la que cada una de dos bases aparece en al menos el $1\,\%$ de una población; unos diez millones son frecuentes en el ser humano. Un *estudio de asociación de genoma completo* (GWAS) genotipa centenares de miles de SNP en miles de personas con una enfermedad y miles sin ella, y pregunta en cada SNP si un alelo es más frecuente entre los casos. Como se hace un millón de pruebas, un resultado solo cuenta por debajo de un umbral de significación de unos $5\times 10^{-8}$ ($0.05$ dividido por el millón de pruebas efectivamente independientes). Los SNP asociados señalan una región, no una variante causal, porque los alelos vecinos viajan juntos (desequilibrio de ligamiento) a lo largo de decenas de kilobases. Para la mayoría de las enfermedades comunes, cada alelo asociado desplaza el riesgo un pequeño porcentaje y se sitúa sobre todo en secuencia reguladora; su efecto conjunto, sumado sobre miles de SNP como *puntuación poligénica*, explica una fracción de la heredabilidad y predice el riesgo más o menos tan bien como los antecedentes familiares.

**Observación 4.12 (Lo que la genómica ha dado y lo que no).**

La secuenciación ha sido decisiva allí donde un solo gen tiene un efecto grande: varios miles de enfermedades mendelianas tienen ya su gen, y secuenciar el exoma de un niño con un trastorno sin diagnosticar da un diagnóstico en cerca de un tercio de los casos. Los genomas de los tumores revelan qué conductores lleva un tumor y qué fármacos pueden funcionar ([Capítulo 11](https://one-course.com/books/biology/5/es/chapter/11-biologia-del-cancer#ch-b3-cancer-biology)); los genomas de los patógenos rastrean los brotes cepa a cepa ([Capítulo 12](https://one-course.com/books/biology/5/es/chapter/12-bacteriologia-crecimiento-fisiologia-y-genetica#ch-b3-bacteriology)); y los genomas antiguos han reescrito la prehistoria humana al mostrar que las personas de fuera de África llevan alrededor de un $2\,\%$ de ADN neandertal. Para las enfermedades comunes — diabetes, cardiopatía, esquizofrenia — la genómica ha dado miles de efectos pequeños y pocos mecanismos, y la promesa de predecir a partir del genoma de una persona sana sigue siendo modesta. El genoma es una lista de piezas; la biología de cómo interactúan no se lee en él.

## 4.5 Ejercicios

**Ejercicio 4.1 ★.**

Explíquese por qué un [didesoxinucleótido](#def-b3-genomics-sanger) termina una cadena de ADN en crecimiento, y por qué una reacción de Sanger debe contener a la vez la forma normal y la didesoxi de cada nucleótido.

**Solución de Ejercicio 4.1.**

Un [didesoxinucleótido](#def-b3-genomics-sanger) no tiene hidroxilo 3$'$, de modo que no puede formarse ningún enlace fosfodiéster con el nucleótido siguiente y la cadena se detiene. Con solo formas didesoxi toda cadena se detendría en la primera posición; con solo formas normales no se detendría ninguna. La mezcla convierte la terminación en un suceso aleatorio en cada posición, de manera que los productos forman una escalera completa, una longitud por cada base del molde.

**Ejercicio 4.2 ★.**

Una carrera produce $4\times 10^{8}$ [lecturas](#def-b3-genomics-ngs) emparejadas de $2\times 150\,\mathrm{bp}$. ¿Qué cobertura da eso de un genoma humano de $3.2\,\mathrm{Gb}$? ¿Y de un genoma bacteriano de $5\,\mathrm{Mb}$?

**Solución de Ejercicio 4.2.**

$4\times 10^{8}\times 300\,\mathrm{bp} = 1.2\times 10^{11}$ bases. Ser humano: $1.2\times 10^{11}/3.2\times 10^{9} \approx 38\times$. Bacteria: $1.2\times 10^{11}/5\times 10^{6} = 24\,000\times$.

**Ejercicio 4.3 ★.**

Defínanse contig, [andamio](#def-b3-genomics-assembly) y [N50](#def-b3-genomics-assembly). Un [ensamblaje](#def-b3-genomics-assembly) de $100\,\mathrm{Mb}$ tiene diez contigs de $8\,\mathrm{Mb}$ y $2000$ de $10\,\mathrm{kb}$. ¿Cuál es su [N50](#def-b3-genomics-assembly)?

**Solución de Ejercicio 4.3.**

Un contig es una secuencia contigua ensamblada a partir de [lecturas](#def-b3-genomics-ngs) solapadas; un [andamio](#def-b3-genomics-assembly) es un conjunto ordenado y orientado de contigs con huecos de tamaño estimado entre ellos; el [N50](#def-b3-genomics-assembly) es la longitud de contig a la que los contigs ordenados alcanzan la mitad de las bases ensambladas. Aquí los diez contigs de $8\,\mathrm{Mb}$ contienen ya $80\,\mathrm{Mb}$, más allá del punto medio de $50\,\mathrm{Mb}$ (el séptimo llega a $56\,\mathrm{Mb}$): [N50](#def-b3-genomics-assembly) $= 8\,\mathrm{Mb}$.

**Ejercicio 4.4 ★.**

Enúnciese la [paradoja del valor C](#prop-b3-genomics-sizes) con dos ejemplos, y dígase qué explica sobre todo el ADN sobrante de los genomas grandes.

**Solución de Ejercicio 4.4.**

El [tamaño del genoma](#prop-b3-genomics-sizes) no sigue a la complejidad del organismo: una cebolla tiene cinco veces el ADN de una persona y un pez pulmonado cuarenta veces; la levadura y el gusano difieren diez veces en ADN con números de genes parecidos. El exceso es no codificante: elementos transponibles y sus restos, intrones y repeticiones satélite.

**Ejercicio 4.5 ★★.**

Con el [Teorema 4.3](#thm-b3-genomics-lander-waterman), hállense la cobertura necesaria para dejar como mucho una base de cada millón sin secuenciar y el número esperado de contigs de un genoma de $5\,\mathrm{Mb}$ leído a $c = 8$ con [lecturas](#def-b3-genomics-ngs) de $150\,\mathrm{bp}$ y un solapamiento mínimo de $30\,\mathrm{bp}$.

**Solución de Ejercicio 4.5.**

$e^{-c} = 10^{-6}$ da $c = 6\ln 10 = 13.8$. Para $c = 8$: $N =
cG/L = 8\times 5\times 10^{6}/150 \approx 267\,000$ [lecturas](#def-b3-genomics-ngs), $\theta
= 30/150 = 0.2$, contigs $= N e^{-6.4} = 267\,000\times 0.00166
\approx 440$.

**Ejercicio 4.6 ★★.**

Una variante heterocigótica está cubierta por $30$ [lecturas](#def-b3-genomics-ngs). Suponiendo que cada [lectura](#def-b3-genomics-ngs) muestra uno u otro alelo con probabilidad $1/2$, ¿cuál es la probabilidad de que menos de $8$ [lecturas](#def-b3-genomics-ngs) muestren el alelo variante (de modo que pudiera confundirse con errores)? Úsese una aproximación normal de media $15$ y desviación típica $\sqrt{7.5}$. ¿Por qué es $30\times$ el estándar?

**Solución de Ejercicio 4.6.**

$P(X < 8) = P(X \le 7) \approx P\bigl(Z < (7.5 - 15)/2.74\bigr) =
P(Z < -2.74) \approx 0.003$. A $30\times$ los dos alelos de un heterocigoto se ven casi siempre muchas veces, la cobertura es desigual (las regiones ricas en GC reciben menos [lecturas](#def-b3-genomics-ngs), de modo que algunos sitios ven la mitad de la media) y quedan [lecturas](#def-b3-genomics-ngs) suficientes para separar un alelo real de los errores de $10^{-3}$.

**Ejercicio 4.7 ★★.**

Un genoma tiene una repetición de $6\,\mathrm{kb}$ presente en $500$ copias. Explíquese por qué un [ensamblaje](#def-b3-genomics-assembly) a partir de [lecturas](#def-b3-genomics-ngs) de $150\,\mathrm{bp}$ la colapsa, qué aspecto tiene el grafo resultante y qué longitud de [lectura](#def-b3-genomics-ngs) la resolvería.

**Solución de Ejercicio 4.7.**

Toda [lectura](#def-b3-genomics-ngs) de $150\,\mathrm{bp}$ del interior de la repetición es idéntica venga de la copia que venga, de modo que el ensamblador construye un solo nodo de $6\,\mathrm{kb}$ con $500$ caminos de entrada y $500$ de salida; no puede saber qué entrada se empareja con qué salida, y el [ensamblaje](#def-b3-genomics-assembly) se rompe en $500$ huecos, con la repetición presente una sola vez y con una cobertura $500$ veces la media. Las [lecturas](#def-b3-genomics-ngs) más largas que la repetición más los flancos únicos de ambos lados — $8\,\mathrm{kb}$ o más — abarcan cada copia y la resuelven.

**Ejercicio 4.8 ★★.**

Dos personas difieren en una base de cada mil. ¿Cuántas diferencias hay en sus exomas ($48\,\mathrm{Mb}$ de secuencia codificante)? Si dos tercios de las diferencias codificantes son sinónimas o benignas y el resto alteran una proteína, ¿cuántas variantes que alteran proteína lleva una persona respecto a otra?

**Solución de Ejercicio 4.8.**

$4.8\times 10^{7}/1000 = 48\,000$ diferencias codificantes; un tercio, unas $16\,000$, alteran la proteína.

**Ejercicio 4.9 ★★.**

Un GWAS prueba $10^{6}$ SNP con umbral $p < 5\times 10^{-8}$. ¿Cuántos falsos positivos se esperan si ningún SNP está realmente asociado? Un alelo de un SNP sube el riesgo de una enfermedad de frecuencia $2\,\%$ hasta el $2.3\,\%$. Explíquese por qué un efecto así es indetectable en un estudio de mil personas e inútil para un individuo, y sin embargo puede señalar un mecanismo.

**Solución de Ejercicio 4.9.**

Falsos positivos esperados, $10^{6}\times 5\times 10^{-8} = 0.05$. Un riesgo relativo de $1.15$ sobre una enfermedad del $2\,\%$ cambia unos pocos casos por millar; mil personas contienen unos veinte casos, demasiado pocos para verlo (la potencia crece con el número de casos y con el cuadrado del efecto). Para un individuo, $0.3$ puntos porcentuales no significan nada. Pero el alelo señala un gen cuyo cambio modesto de actividad altera el riesgo de enfermedad — el gen, y su vía, pueden ser una diana farmacológica cuya inhibición completa tenga un efecto grande.

**Ejercicio 4.10 ★★★.**

Los genomas bacterianos son codificantes en un $88\,\%$; el genoma humano, en un $1.5\,\%$. Dense tres hipótesis — de genética de poblaciones, estructural y reguladora — para la diferencia, y para cada una una observación genómica que la apoye o la debilite.

**Solución de Ejercicio 4.10.**

De genética de poblaciones: en las bacterias, con poblaciones enormes, la selección elimina incluso las inserciones ligeramente costosas; en los mamíferos, con poblaciones efectivas pequeñas, la deriva deja que se acumule ADN no codificante levemente deletéreo — lo apoya la correlación inversa entre [tamaño del genoma](#prop-b3-genomics-sizes) y tamaño de población entre linajes, y lo debilitan las excepciones. Estructural: los genomas eucariotas los invaden transposones que las bacterias, con su sesgo hacia la deleción y sin refugio meiótico para los elementos egoístas, depuran — lo apoya la correlación entre el [tamaño del genoma](#prop-b3-genomics-sizes) y el contenido de transposones. Reguladora: un desarrollo complejo necesita más ADN regulador — lo apoyan los [elementos no codificantes conservados](#def-b3-genomics-comparative) alrededor de los genes del desarrollo, y lo debilita el hecho de que solo el $8\,\%$ del genoma humano muestre selección alguna, de modo que la mayor parte del ADN no codificante no es regulador.

**Ejercicio 4.11 ★★★.**

Dedúzcase el recuento de contigs de Lander–Waterman para una mezcla de [lecturas](#def-b3-genomics-ngs) de dos longitudes: $N_{1}$ [lecturas](#def-b3-genomics-ngs) cortas de longitud $L_{1}$ y $N_{2}$ [lecturas](#def-b3-genomics-ngs) largas de longitud $L_{2}$, con los solapamientos contados con el mismo mínimo $T$. (Trátese cada [lectura](#def-b3-genomics-ngs) como la más a la derecha de su contig si ninguna [lectura](#def-b3-genomics-ngs) de cualquier tipo empieza dentro de su propia longitud menos $T$.) Muéstrese que unas pocas [lecturas](#def-b3-genomics-ngs) largas reducen el recuento de contigs más que el mismo número de bases en [lecturas](#def-b3-genomics-ngs) cortas.

**Solución de Ejercicio 4.11.**

Los inicios de ambos tipos caen con densidad total $\rho = (N_{1} +
N_{2})/G$. Una [lectura](#def-b3-genomics-ngs) de longitud $L_{i}$ es la más a la derecha de su contig si ninguna [lectura](#def-b3-genomics-ngs) de cualquier tipo empieza en las $L_{i} - T$ bases que la siguen: probabilidad $e^{-\rho(L_{i} - T)}$. De ahí que los contigs sean $= N_{1}
e^{-\rho(L_{1} - T)} + N_{2} e^{-\rho(L_{2} - T)}$. Una [lectura](#def-b3-genomics-ngs) larga es la más a la derecha con una probabilidad exponencialmente menor que una corta, y cada [lectura](#def-b3-genomics-ngs) larga elimina además la posibilidad de un hueco a lo largo de toda su longitud; el mismo número de bases en [lecturas](#def-b3-genomics-ngs) cortas añade muchos puntos de inicio, pero cada ventana protegida es corta, de modo que las [lecturas](#def-b3-genomics-ngs) largas ganan.

**Ejercicio 4.12 ★★★.**

Se sostiene que los cuatro agrupamientos Hox de los mamíferos descienden de uno solo por dos rondas de [duplicación del genoma completo](#def-b3-genomics-comparative) en la base de los vertebrados. Dígase qué patrón de [parálogos](#def-b3-genomics-comparative) a lo largo del genoma, y qué patrón en los genomas de las lampreas y de los cordados invertebrados, predice esa hipótesis, y cómo se la distinguiría de dos duplicaciones independientes del agrupamiento solo.

**Solución de Ejercicio 4.12.**

Dos duplicaciones del genoma completo predicen que el patrón cuádruple sea de todo el genoma: cuartetos de segmentos cromosómicos [parálogos](#def-b3-genomics-comparative) (paralogones) que llevan las mismas familias génicas en el mismo orden, con las duplicaciones fechadas en el mismo momento para todas las familias; un solo agrupamiento en el anfioxo y en *Ciona*, que divergieron antes de los sucesos; y en las lampreas, que divergieron alrededor de ellos, un estado intermedio o derivado de forma independiente. Las duplicaciones independientes solo del agrupamiento Hox predicen paralogones únicamente para Hox, vecinos con historias distintas y fechas de duplicación diferentes entre familias. Los paralogones de todo el genoma y la datación compartida, tal como se observan, favorecen la [duplicación del genoma completo](#def-b3-genomics-comparative).

## 4.6 Problema: dos genomas en una máquina

**Problema 4.1.**

Problema de fin de semana — una bacteria y un ser humano secuenciados en la misma carrera: las lecturas repartidas, la cobertura y los huecos calculados, los contigs contados, las variantes heterocigóticas llamadas frente a la tasa de error, el contenido del genoma humano pesado y un estudio de asociación dimensionado, hasta llegar al recuento de contigs a baja cobertura, a la cobertura que hace segura una llamada de variante y al número de mutaciones nuevas de un niño

Datos: una carrera rinde $6\times 10^{8}$ [lecturas](#def-b3-genomics-ngs) de $150\,\mathrm{bp}$. Un genoma bacteriano mide $4.6\,\mathrm{Mb}$; el genoma humano, $3.2\,\mathrm{Gb}$ (haploide). Solapamiento mínimo $T = 30\,\mathrm{bp}$. Tasa de error $10^{-3}$ por base y [lectura](#def-b3-genomics-ngs). Secuencia codificante humana, $48\,\mathrm{Mb}$; el genoma deriva en un $45\,\%$ de transposones, con $1.1$ millones de copias Alu de $300\,\mathrm{bp}$. Dos personas difieren en un sitio de cada $1000$. Tasa de mutación, $1.2\times 10^{-8}$ por base y generación.

**Parte I — La bacteria.**

1. A la bacteria se le da el $0.2\,\%$ de la carrera. ¿Cuántas [lecturas](#def-b3-genomics-ngs) , y qué cobertura?
2. ¿Qué fracción de su genoma queda sin secuenciar? ¿Cuántas bases son?
3. Calcúlense $\theta$ y el número esperado de contigs.
4. Un ensayo previo usó solo $30\,000$ [lecturas](#def-b3-genomics-ngs) . ¿Cobertura, fracción no cubierta y número de contigs?
5. El genoma contiene $7$ copias de un operón de ARNr de $5\,\mathrm{kb}$ . Explíquese qué les ocurre en el [ensamblaje](#def-b3-genomics-assembly) y cuántos extremos de contig produce esto por sí solo.
6. La bacteria tiene alrededor de un gen por kilobase. ¿Cuántos genes y, si el $88\,\%$ del genoma es codificante, cuál es la longitud media de un gen?

**Parte II — El ser humano.**

7. El resto de la carrera va a un genoma humano. ¿Cobertura del genoma diploide por copia haploide (es decir, bases totales divididas por $3.2\,\mathrm{Gb}$ )?
8. En un sitio heterocigótico cada uno de los dos alelos queda cubierto por alrededor de la mitad de las [lecturas](#def-b3-genomics-ngs) . Con la cobertura de la pregunta 7, ¿cuál es el número esperado de [lecturas](#def-b3-genomics-ngs) que muestran cada alelo?
9. Un error muestra una base equivocada en una [lectura](#def-b3-genomics-ngs) con probabilidad $10^{-3}$ . En un sitio homocigótico cubierto por $c$ [lecturas](#def-b3-genomics-ngs) , ¿cuál es el número esperado de [lecturas](#def-b3-genomics-ngs) que muestran una base equivocada concreta ( $10^{-3}/3$ cada una)? ¿Por qué una regla del tipo “llámese variante si al menos $3$ [lecturas](#def-b3-genomics-ngs) y al menos el $20\,\%$ de las [lecturas](#def-b3-genomics-ngs) la muestran” rechaza los errores a esta cobertura?
10. ¿Cuántos sitios heterocigóticos lleva una persona (la mitad de las diferencias entre dos genomas al azar están en cada uno, aproximadamente: tómese un sitio de cada $1500$ )? ¿Cuántos en secuencia codificante?
11. Las [lecturas](#def-b3-genomics-ngs) se alinean con una referencia. Explíquese por qué las [lecturas](#def-b3-genomics-ngs) procedentes de elementos Alu se alinean a menudo con la copia equivocada y qué consecuencia tiene esto para la [llamada de variantes](#met-b3-genomics-pipeline) dentro de ellas.
12. Se secuencia a un niño junto con sus dos progenitores. ¿Cuántas mutaciones nuevas cabe esperar? ¿Cuántas [lecturas](#def-b3-genomics-ngs) del niño, a esta cobertura, deben mostrar una variante ausente en *ambos* progenitores para creérsela, y por qué la cobertura de los progenitores es tan importante como la del niño?
13. Un laboratorio clínico captura el exoma ( $48\,\mathrm{Mb}$ ) y lo secuencia a $100\times$ . ¿Cuántas [lecturas](#def-b3-genomics-ngs) hacen falta, y por qué resulta más barato por paciente que un genoma a $28\times$ aunque su cobertura sea mayor?

**Parte III — El contenido de un genoma.**

14. ¿Qué fracción del genoma humano es Alu, y qué fracción de las [lecturas](#def-b3-genomics-ngs) de la pregunta 7 procede de elementos Alu?
15. La referencia mide $3.2\,\mathrm{Gb}$ , pero una célula diploide contiene $6.4\,\mathrm{Gb}$ ; y una cebolla de $16\,\mathrm{Gb}$ tiene unos $60\,000$ genes. ¿Cuál es la fracción codificante del genoma de la cebolla, si sus genes promedian $1.5\,\mathrm{kb}$ de secuencia codificante?
16. El ser humano y el chimpancé difieren en el $1.2\,\%$ de las bases alineadas. ¿Cuántas sustituciones son en $2.9\,\mathrm{Gb}$ de secuencia alineable? Repartidas por igual entre los dos linajes a lo largo de $6.5$ millones de años, ¿qué tasa de mutación por base y año implica esto, y por generación de $25$ años? Compárese con la medida directa dada en los datos.
17. Dos duplicaciones del genoma de los vertebrados deberían dar hasta cuatro copias de cada gen ancestral. El ser humano tiene unos $20\,000$ genes y el cordado invertebrado *Ciona* , unos $16\,000$ . ¿Qué fracción de los duplicados se ha perdido, bajo la hipótesis de que el antepasado tenía $16\,000$ ?
18. Explíquese por qué el número de genes es una mala medida de la complejidad de un organismo, usando como argumento el recuento de cortes y empalmes alternativos del [Capítulo 2](https://one-course.com/books/biology/5/es/chapter/2-arn-no-codificantes-y-regulacion-postranscripcional#ch-b3-rna-regulation) .
19. El $8\,\%$ del genoma está bajo selección purificadora pero solo el $1.5\,\%$ codifica proteína. ¿Qué es probablemente el resto, y cómo se pondría a prueba un elemento candidato?

**Parte IV — Un estudio de asociación.**

20. Se prueban $10^{6}$ SNP. Enúnciese el umbral de Bonferroni para un error por familia de $0.05$ , y el número esperado de falsos positivos con $p < 10^{-5}$ .
21. Una enfermedad tiene una prevalencia del $1\,\%$ . Un alelo de riesgo de frecuencia $0.3$ eleva la razón de posibilidades un $5\,\%$ . Calcúlese el riesgo de enfermedad de un portador de dos copias, de una copia y de ninguna, tomando el riesgo del no portador como $0.9\,\%$ . (Multiplíquense las razones de posibilidades.)
22. Se encuentran doscientos alelos de este tipo. Explíquese qué es una [puntuación poligénica](#def-b3-genomics-gwas) y por qué la puntuación de una persona del $1\,\%$ superior puede corresponder a un riesgo varias veces mayor aunque cada alelo no haga casi nada.
23. Explíquese por qué un SNP que alcanza significación no suele ser la variante causal, y qué experimento identificaría la causal en la región.
24. Se secuencia a $c = 0.5$ un genoma antiguo de un hueso de $40\,000$ años. ¿Qué fracción de él se lee? ¿Por qué puede responder de todos modos a preguntas sobre la historia de las poblaciones que un genoma moderno por sí solo no puede?
25. Resúmase: el número de contigs del [ensamblaje](#def-b3-genomics-assembly) de ensayo (pregunta 4), la cobertura por genoma haploide que da unas $15$ [lecturas](#def-b3-genomics-ngs) por alelo (preguntas 7–8) y el número de mutaciones nuevas de un niño (pregunta 12).

**Solución de Problema 4.1.**

**1.** $0.002\times 6\times 10^{8} = 1.2\times 10^{6}$ [lecturas](#def-b3-genomics-ngs); $c = 1.2\times 10^{6}\times 150/4.6\times 10^{6} \approx 39$. **2.** $e^{-39} \approx 10^{-17}$: en la práctica no queda ninguna base sin cubrir. **3.** $\theta = 0.2$; contigs $= 1.2\times 10^{6} e^{-31} \approx
0$: un solo contig en teoría, con huecos solo en las repeticiones. **4.** $c = 30\,000\times 150/4.6\times 10^{6} = 0.98$; sin cubrir, $e^{-0.98} = 0.38$, unas $1.7\,\mathrm{Mb}$; contigs $= 30\,000
\times e^{-0.78} \approx 13\,700$. **5.** Los siete operones dan [lecturas](#def-b3-genomics-ngs) idénticas y colapsan en un solo contig de $5\,\mathrm{kb}$, al que entran siete flancos izquierdos únicos y del que salen siete flancos derechos cuyo emparejamiento se desconoce: $14$ extremos de contig y siete huecos. **6.** Unos $4600$ genes; codificantes, $0.88\times 4.6\times 10^{6}
= 4.0\times 10^{6}$ bp, con un gen medio de $880\,\mathrm{bp}$. **7.** $0.998\times 6\times 10^{8}\times 150/3.2\times 10^{9}
\approx 28\times$. **8.** Unas $14$ [lecturas](#def-b3-genomics-ngs) por alelo. **9.** $28\times 10^{-3}/3 \approx 0.009$ [lecturas](#def-b3-genomics-ngs) que muestran una base equivocada dada — la probabilidad de tres o más es de unos $10^{-7}$ — y el $20\,\%$ de $28$ son $5.6$ [lecturas](#def-b3-genomics-ngs); un error no pasa ninguna de las dos pruebas, mientras que de un alelo heterocigótico real se esperan $14$. **10.** $3.2\times 10^{9}/1500 \approx 2.1\times 10^{6}$ sitios heterocigóticos; en secuencia codificante, $4.8\times 10^{7}/1500 \approx
32\,000$. **11.** Una [lectura](#def-b3-genomics-ngs) de $150\,\mathrm{bp}$ de un Alu casa casi igual de bien con muchas de los $1.1$ millones de copias, de modo que se coloca en la copia equivocada o se le da poca confianza de mapeo. Las diferencias entre copias parecen entonces variantes heterocigóticas, y las variantes verdaderas quedan escondidas entre ellas: las [llamadas de variantes](#met-b3-genomics-pipeline) dentro de los Alu suelen filtrarse, y esos elementos son puntos ciegos de la secuenciación de [lectura](#def-b3-genomics-ngs) corta. **12.** $1.2\times 10^{-8}\times 6.4\times 10^{9} \approx 77$ mutaciones nuevas. Unas $14$ [lecturas](#def-b3-genomics-ngs) deberían mostrar la variante en el niño; pero si el sitio de un progenitor solo está cubierto por cinco [lecturas](#def-b3-genomics-ngs), un alelo heterocigótico se pierde con probabilidad $2^{-5} = 3\,\%$ y una variante heredada se llama por error como nueva — de ahí que los progenitores deban secuenciarse tan a fondo como el niño. **13.** $4.8\times 10^{7}\times 100/150 = 3.2\times 10^{7}$ [lecturas](#def-b3-genomics-ngs), veinte veces menos que el genoma: el coste de secuenciación cae veinte veces, más de lo que cuesta el paso de captura. **14.** $1.1\times 10^{6}\times 300 = 3.3\times 10^{8}$ bp, cerca del $10\,\%$ del genoma; el $10\,\%$ de las [lecturas](#def-b3-genomics-ngs), unos $6\times
10^{7}$. **15.** $60\,000\times 1500 = 9\times 10^{7}$ bp; $9\times
10^{7}/1.6\times 10^{10} = 0.56\,\%$. **16.** $0.012\times 2.9\times 10^{9} = 3.5\times 10^{7}$ sustituciones, $1.7\times 10^{7}$ por linaje; tasa $1.7\times
10^{7}/(2.9\times 10^{9}\times 6.5\times 10^{6}) = 9\times 10^{-10}$ por base y año, $2.3\times 10^{-8}$ por generación de 25 años — unas dos veces la tasa de pedigrí de $1.2\times 10^{-8}$, una discrepancia conocida que sugiere generaciones más largas en el pasado o una separación más antigua. **17.** Cuatro copias de $16\,000$ serían $64\,000$; quedan $20\,000$, de modo que de las $48\,000$ copias adicionales solo sobreviven $4000$: se perdió el $92\,\%$ de los duplicados. **18.** El gusano y el ser humano tienen el mismo número de genes; la complejidad está en cómo se usan — el corte y empalme alternativo multiplica un gen en miles de proteínas ($38\,016$ para *Dscam*), la regulación combina factores de transcripción y potenciadores de maneras propias de cada tipo celular, los [ARN no codificantes](https://one-course.com/books/biology/5/es/chapter/2-arn-no-codificantes-y-regulacion-postranscripcional#def-b3-rna-regulation-ncrna) añaden capas y las proteínas interactúan en redes. **19.** Elementos reguladores (potenciadores, promotores, aislantes), genes de [ARN no codificante](https://one-course.com/books/biology/5/es/chapter/2-arn-no-codificantes-y-regulacion-postranscripcional#def-b3-rna-regulation-ncrna), señales de corte y de localización, orígenes y secuencias estructurales. Un potenciador candidato se pone a prueba colocándolo delante de un gen indicador en un embrión transgénico y mirando dónde se expresa el indicador, y después suprimiendo el elemento del genoma con CRISPR y midiendo los genes vecinos. **20.** $0.05/10^{6} = 5\times 10^{-8}$; con $p < 10^{-5}$, $10^{6}
\times 10^{-5} = 10$ falsos positivos esperados. **21.** No portador: $0.009/0.991 = 0.00908$ de posibilidades; con una copia, $0.00954$, riesgo $0.945\,\%$; con dos copias, $0.01001$, riesgo $0.99\,\%$. **22.** La puntuación suma, sobre los $200$ alelos, el número de copias de riesgo que lleva una persona ponderado por el logaritmo de la razón de posibilidades de cada alelo. El recuento tiene media $200\times 2\times 0.3 = 120$ y desviación típica $\sqrt{200\times 2\times 0.3\times 0.7} \approx 9$; el $1\,\%$ superior lleva unos $21$ alelos más que la media, y $1.05^{21} \approx
2.8$: casi el triple de posibilidades que una persona media, a partir de alelos que individualmente cambian el riesgo un $5\,\%$. **23.** Los alelos de un bloque de decenas de kilobases se heredan juntos (desequilibrio de ligamiento), de modo que cualquiera de ellos muestra la misma asociación; el SNP genotipado es simplemente el que estaba en la matriz. Para encontrar la variante causal: secuénciese la región en casos y controles, redúzcase el conjunto por estadística y pruébese después cada candidata — ensayos con gen indicador para la actividad potenciadora de cada alelo, edición de cada alelo en células y medida de la expresión de los genes vecinos, colocalización con señales de rasgos cuantitativos de expresión. **24.** Se lee el $1 - e^{-0.5} = 39\,\%$ del genoma. Da una muestra directa de una población en un momento conocido del pasado — frecuencias alélicas anteriores a migraciones y mestizajes posteriores, la longitud de los segmentos neandertales (largos, porque pocas generaciones de recombinación los habían roto) y con ello una fecha para el mestizaje —, cosa que los genomas modernos solo pueden inferir a través de modelos. **25.** Unos $13\,700$ contigs en el [ensamblaje](#def-b3-genomics-assembly) de ensayo; $28\times$ por genoma haploide, unas $14$ [lecturas](#def-b3-genomics-ngs) por alelo; y unas $77$ mutaciones nuevas en un niño.
