Biology · Libro 5 · Bachelor Year 3

Biología universitaria — tercer año

Biología universitaria — tercer año · Bachelor Year 3

4Genómica y secuenciación

El primer genoma completo de un organismo de vida libre, las 1.8Mb1.8\,\mathrm{Mb} de una bacteria, se publicó en 1995 tras un año de trabajo de un equipo de cuarenta personas. El genoma humano, 3.23.2 mil millones de pares de bases, le costó a un consorcio internacional trece años y unos tres mil millones de dólares, y se declaró terminado en 2003. Hoy una máquina de sobremesa lee un genoma humano en una noche por unos pocos centenares de dólares, un hospital secuencia el tumor de un paciente para elegir un fármaco y un museo extrae y lee el genoma de un hueso de cuarenta mil años. La tecnología que ha hecho esto posible, la matemática que convierte millones de lecturas cortas en un genoma y lo que los genomas terminados han enseñado sobre el tamaño, el contenido y la historia de nuestro ADN son el asunto de este capítulo. El capítulo siguiente retoma los algoritmos que comparan las secuencias ya obtenidas.

4.1 Leer el ADN

Definición 4.1 (Secuenciación por terminación de cadena)

La secuenciación de Sanger copia un molde de hebra sencilla a partir de un cebador con ADN-polimerasa en presencia de los cuatro nucleótidos normales y de una pequeña proporción de didesoxinucleótidos, que carecen del hidroxilo 3' y terminan por tanto la cadena allí donde se incorporan. Cada didesoxinucleótido lleva un fluoróforo distinto. El producto es una mezcla de fragmentos, uno por cada posición del molde, y cada uno acaba en una base de identidad conocida; separados por tamaño en un capilar de gel, pasan por un detector en orden de longitud, y la secuencia de colores es la secuencia del molde. Una carrera lee 700 a 900bp700\text{ a }900\,\mathrm{bp} con una tasa de error por debajo de 10310^{-3}; sigue siendo el método para verificar una construcción o un solo gen.

Evidencia. Sanger, Nicklen y Coulson publicaron el método en 1977 y lo usaron ese mismo año para leer los 5386bp5386\,\mathrm{bp} del fago ϕ\phiX174 — el primer genoma de ADN completo — y en 1981 los 16569bp16\,569\,\mathrm{bp} de la mitocondria humana. Fleischmann y colaboradores (1995) leyeron las 1.83Mb1.83\,\mathrm{Mb} de Haemophilus influenzae rompiendo todo el genoma en fragmentos al azar, secuenciando 2400024\,000 de ellos y ensamblando las lecturas por ordenador — la estrategia de escopetazo del genoma completo que todos los proyectos posteriores ampliaron.

Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas. Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas.
Izquierda: Frederick Sanger, que ideó los primeros métodos prácticos para leer proteínas y ADN y recibió un premio Nobel por cada uno. Derecha: una autorradiografía de un gel de secuenciación de la era anterior al capilar, con una calle por base y la secuencia leída de abajo arriba en la escalera de bandas.
La secuenciación por terminación de cadena. Una base didesoxi termina la copia en cada posición donde se incorpora; los fragmentos, uno por longitud, se separan por tamaño y el color de cada base terminal se lee en orden.
La secuenciación por terminación de cadena. Una base didesoxi termina la copia en cada posición donde se incorpora; los fragmentos, uno por longitud, se separan por tamaño y el color de cada base terminal se lee en orden.

Definición 4.2 (Secuenciación masiva en paralelo)

Los instrumentos de segunda generación leen de millones a miles de millones de fragmentos a la vez. En la secuenciación por síntesis los fragmentos, con adaptadores ligados a sus extremos, se fijan a una celda de flujo de vidrio y se amplifican in situ en agrupaciones de moléculas idénticas; las agrupaciones se alargan luego una base por ciclo con nucleótidos fluorescentes y bloqueados de forma reversible, se fotografían, se desbloquean y se vuelven a alargar, de modo que cada ciclo añade una base a la lectura de cada agrupación. Las lecturas son de 100 a 300bp100\text{ a }300\,\mathrm{bp}, casi siempre desde los dos extremos de un fragmento (extremos emparejados), con una tasa de error de unos 10310^{-3} por base, y una carrera rinde hasta 101210^{12} bases. Los instrumentos de tercera generación, de lectura larga, leen moléculas sueltas sin amplificación: observando cómo una polimerasa incorpora nucleótidos fluorescentes en tiempo real, o haciendo pasar el ADN por un nanoporo proteico y registrando la corriente iónica, que cada secuencia de bases modula a su manera. Las lecturas de 10 a 100kb10\text{ a }100\,\mathrm{kb} y más abarcan las repeticiones que las lecturas cortas no pueden, con una tasa bruta de error mayor que el consenso reduce.

Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica. Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.
Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.

Teorema 4.3 (Cobertura y huecos en un proyecto de escopetazo)

Tómense NN lecturas de longitud LL en posiciones aleatorias de un genoma de longitud GG, y sea c=NL/Gc = NL/G la cobertura, el número medio de lecturas que cubren una base. El número de lecturas que cubre una base dada sigue entonces una Poisson de media cc: la fracción del genoma que queda sin secuenciar es

P(sin cubrir)=ec,P(\text{sin cubrir}) = e^{-c},

y si dos lecturas se reconocen como solapadas solo cuando comparten al menos TT bases, de modo que θ=T/L\theta = T/L, el número esperado de contigs (islas de lecturas solapadas) es

contigs=Nec(1θ),\text{contigs} = N\,e^{-c(1-\theta)},

y su longitud media es L(ec(1θ)1)/c+LθL\,\bigl(e^{c(1-\theta)} - 1\bigr)/c + L\theta, aproximadamente.

Demostración. Los puntos de inicio de las lecturas caen al azar con densidad N/GN/G por base. Una base la cubren las lecturas que empiezan en las LL bases anteriores; el número de inicios en una ventana de longitud LL sigue una Poisson de media LN/G=cLN/G = c, y la probabilidad de que no haya ninguno es ece^{-c}. Una lectura es la más a la derecha de su contig si ninguna otra empieza dentro de las LT=L(1θ)L - T = L(1-\theta) bases posteriores a su propio inicio (una lectura que empezara más tarde se solaparía con ella en menos de TT y no se uniría); esa probabilidad es ec(1θ)e^{-c(1-\theta)}, y, como cada contig tiene exactamente una lectura más a la derecha, el número esperado de contigs es Nec(1θ)N e^{-c(1-\theta)}. La longitud media de un contig se sigue de GG dividido por el número de contigs, corregido por la fracción no cubierta.

Ejemplo 4.4 (Cuánto basta)

Con c=5c = 5 la fracción sin secuenciar es e5=0.7%e^{-5} = 0.7\,\% — para un genoma de 3.2Gb3.2\,\mathrm{Gb}, veinte millones de bases en algunas decenas de miles de huecos. Con c=10c = 10 es 4.5×1054.5\times 10^{-5}, 150kb150\,\mathrm{kb} en total. Los genomas humanos se secuencian de rutina a c=30c = 30, no por los huecos de cobertura (e301013e^{-30} \approx 10^{-13}), sino porque cada base ha de leerse varias veces en cada uno de los dos cromosomas para llamar con confianza una variante heterocigótica frente a una tasa de error de 10310^{-3} por lectura. Los genomas bacterianos se secuencian a c=50c = 50100100 por la misma razón y porque es barato. La fórmula muestra además lo que la cobertura no puede arreglar: una repetición más larga que una lectura es un punto donde el grafo de solapamientos se ramifica, y ninguna cantidad de lecturas cortas lo resuelve. Para eso están las lecturas largas.

Las dos magnitudes de Lander–Waterman frente a la cobertura: la fracción del genoma que no se lee nunca cae como e-c, y el número de contigs (aquí escalado por lectura) alcanza un máximo a baja cobertura y luego cae a medida que las islas se funden.
Las dos magnitudes de Lander–Waterman frente a la cobertura: la fracción del genoma que no se lee nunca cae como ece^{-c}, y el número de contigs (aquí escalado por lectura) alcanza un máximo a baja cobertura y luego cae a medida que las islas se funden.

4.2 De las lecturas a un genoma

Definición 4.5 (Ensamblaje y anotación)

El ensamblaje reconstruye un genoma a partir de sus lecturas por solapamiento: en un grafo de solapamientos cada lectura es un nodo unido a las lecturas con las que se solapa; en un grafo de De Bruijn, usado para miles de millones de lecturas cortas, cada kk-mero (subsecuencia de longitud kk) es un nodo y el genoma es un camino a través de ellos. Las repeticiones más largas que la lectura rompen ambos, porque dan caminos ramificados. Los contigs se ordenan y se orientan en andamios mediante lecturas de extremos emparejados e información de largo alcance (lecturas largas, mapas ópticos, mapas de contacto cromosómico), y los andamios se colocan sobre los cromosomas. La calidad de un ensamblaje se resume en el N50: la longitud de contig tal que la mitad de las bases ensambladas están en contigs al menos así de largos. La anotación busca después los genes: en las bacterias, marcos de lectura abiertos más largos de lo esperable por azar; en los eucariotas, combinando señales de secuencia (sitios de corte, promotores, sesgo de codones), homología con proteínas conocidas y transcritos secuenciados a partir del ARN. El resultado, para una especie, es un genoma de referencia al que se alinea toda lectura posterior de esa especie en lugar de ensamblarla de nuevo.

Método 4.6 (De una muestra a las variantes)

Para un estudio de resecuenciación de un individuo frente a una referencia: (1) extráigase el ADN, fragméntese a 300 a 500bp300\text{ a }500\,\mathrm{bp} y líguense adaptadores (la genoteca); (2) secúnciese a la cobertura necesaria (30×\times para un genoma humano, 100×\times para un exoma, que captura el 1.5%1.5\,\% del genoma que codifica proteína); (3) alinéese cada lectura con la referencia, tolerando desajustes; (4) en cada posición cuéntense las bases de las lecturas: una posición en la que alrededor de la mitad de las lecturas discrepan de la referencia es una variante heterocigótica, una en la que discrepan casi todas es homocigótica y una en la que discrepan unas pocas es un error; (5) fíltrese por profundidad, calidad de base y equilibrio de hebras; (6) anótese cada variante con su efecto sobre algún gen (sinónima, de sentido erróneo, sin sentido, de corte, de desplazamiento del marco) y con su frecuencia en las bases de datos poblacionales; (7) para un diagnóstico, consérvense las variantes raras que se predicen dañinas en genes compatibles con el fenotipo, y confírmense por secuenciación de Sanger.

4.3 Qué aspecto tienen los genomas

Proposición 4.7 (Tamaño del genoma y número de genes)

Los tamaños de genoma abarcan un factor de 10510^{5} entre los eucariotas — 12Mb12\,\mathrm{Mb} en la levadura, 100Mb100\,\mathrm{Mb} en el gusano, 140Mb140\,\mathrm{Mb} en la mosca, 3.2Gb3.2\,\mathrm{Gb} en el ser humano, 16Gb16\,\mathrm{Gb} en una cebolla, 130Gb130\,\mathrm{Gb} en un pez pulmonado, 150Gb150\,\mathrm{Gb} en el lirio Paris japonica —, mientras que los números de genes apenas abarcan un factor de 1010: 60006000 en la levadura, 2000020\,000 en el gusano, 1400014\,000 en la mosca, unos 2000020\,000 genes codificantes de proteína en el ser humano y 4000040\,000 en el arroz. Es la paradoja del valor C: el tamaño del genoma no mide la complejidad, ni tampoco el número de genes. Lo que varía es el contenido no codificante — intrones, elementos transponibles, repeticiones satélite —, y el número de proteínas que un genoma puede producir se multiplica mucho más allá de su número de genes por el corte y empalme alternativo (Capítulo 2) y por la regulación, que es donde está escrita sobre todo la complejidad de un organismo. Los genomas bacterianos, en cambio, son compactos y su tamaño sí sigue al número de genes: alrededor de un gen por kilobase, con un 88%88\,\% codificante en E. coli.

Ejemplo 4.8 (El genoma humano por contenido)

De las 3.2Gb3.2\,\mathrm{Gb}: exones codificantes de proteína, 1.5%1.5\,\%; intrones y regiones no traducidas de los genes, alrededor del 35%35\,\%; elementos transponibles y sus fósiles, alrededor del 45%45\,\% — retrotransposones LINE-1, 17%17\,\%; elementos Alu, 10%10\,\% (más de un millón de copias de una secuencia de 300bp300\,\mathrm{bp}); retrovirus endógenos, 8%8\,\%; duplicaciones segmentarias, 5%5\,\%; repeticiones simples y satélites, incluidos los centrómeros, alrededor del 5%5\,\%; y el resto, secuencia única no codificante, donde viven los elementos reguladores. Unos 100 a 200100\text{ a }200 genes codifican aún maquinaria LINE-1 activa, y se producen inserciones nuevas alrededor de una vez de cada veinte nacimientos. Cerca del 8%8\,\% del genoma está bajo una selección purificadora detectable — mucho más que los exones — y casi todo ello es regulador.

El genoma humano por contenido, a escala. Los exones codificantes de proteína (rojo) son una astilla; casi la mitad del genoma desciende de elementos transponibles.
El genoma humano por contenido, a escala. Los exones codificantes de proteína (rojo) son una astilla; casi la mitad del genoma desciende de elementos transponibles.

Definición 4.9 (Genómica comparada)

Los genes de dos especies que descienden de un solo gen de su antepasado común son ortólogos; los genes de una misma especie que descienden de una duplicación son parálogos. Los bloques de cromosoma en los que el orden de los genes se conserva entre especies son sinténicos; la sintenia permite localizar un gen en un genoma a partir de su posición en otro y revela los reordenamientos que separan dos cariotipos (unos 10001000 entre el ser humano y el ratón). Las secuencias conservadas entre especies lejanas que no codifican proteína — los elementos no codificantes conservados, algunos ultraconservados base a base a lo largo de 200bp200\,\mathrm{bp} entre el ser humano y los peces — son en su mayoría potenciadores de genes del desarrollo. Las duplicaciones del genoma completo han marcado la historia de varios linajes: dos rondas en el origen de los vertebrados (los cuatro agrupamientos Hox de los mamíferos frente al único de los invertebrados), una en el antepasado de los salmónidos, otra en el linaje de la levadura y varias en las plantas con flor; los genes duplicados se pierden casi siempre a lo largo de decenas de millones de años, y los supervivientes divergen en función.

Ejemplo 4.10 (Ser humano y chimpancé)

La secuencia de copia única alineada difiere entre el ser humano y el chimpancé en el 1.2%1.2\,\% de las bases — unos 3535 millones de sustituciones — y en inserciones y deleciones que juntas suman otro 3%3\,\% de cada genoma. Dos personas difieren en cerca de una base de cada mil, unos 4 a 54\text{ a }5 millones de sitios, más unos pocos miles de variantes estructurales; dos chimpancés, cuya población ha sido mayor durante más tiempo, en bastantes más. Un niño lleva unas 7070 mutaciones nuevas ausentes en ambos progenitores, cuatro quintas partes de ellas del padre, y el número sube unas dos por año de edad paterna — la aritmética del Capítulo 3 aplicada a las muchas divisiones de la espermatogénesis.

4.4 Genomas y caracteres

Definición 4.11 (Asociación de genoma completo)

Un polimorfismo de un solo nucleótido (SNP) es una posición en la que cada una de dos bases aparece en al menos el 1%1\,\% de una población; unos diez millones son frecuentes en el ser humano. Un estudio de asociación de genoma completo (GWAS) genotipa centenares de miles de SNP en miles de personas con una enfermedad y miles sin ella, y pregunta en cada SNP si un alelo es más frecuente entre los casos. Como se hace un millón de pruebas, un resultado solo cuenta por debajo de un umbral de significación de unos 5×1085\times 10^{-8} (0.050.05 dividido por el millón de pruebas efectivamente independientes). Los SNP asociados señalan una región, no una variante causal, porque los alelos vecinos viajan juntos (desequilibrio de ligamiento) a lo largo de decenas de kilobases. Para la mayoría de las enfermedades comunes, cada alelo asociado desplaza el riesgo un pequeño porcentaje y se sitúa sobre todo en secuencia reguladora; su efecto conjunto, sumado sobre miles de SNP como puntuación poligénica, explica una fracción de la heredabilidad y predice el riesgo más o menos tan bien como los antecedentes familiares.

Observación 4.12 (Lo que la genómica ha dado y lo que no)

La secuenciación ha sido decisiva allí donde un solo gen tiene un efecto grande: varios miles de enfermedades mendelianas tienen ya su gen, y secuenciar el exoma de un niño con un trastorno sin diagnosticar da un diagnóstico en cerca de un tercio de los casos. Los genomas de los tumores revelan qué conductores lleva un tumor y qué fármacos pueden funcionar (Capítulo 11); los genomas de los patógenos rastrean los brotes cepa a cepa (Capítulo 12); y los genomas antiguos han reescrito la prehistoria humana al mostrar que las personas de fuera de África llevan alrededor de un 2%2\,\% de ADN neandertal. Para las enfermedades comunes — diabetes, cardiopatía, esquizofrenia — la genómica ha dado miles de efectos pequeños y pocos mecanismos, y la promesa de predecir a partir del genoma de una persona sana sigue siendo modesta. El genoma es una lista de piezas; la biología de cómo interactúan no se lee en él.

4.5 Ejercicios

Ejercicio 4.1

Explíquese por qué un didesoxinucleótido termina una cadena de ADN en crecimiento, y por qué una reacción de Sanger debe contener a la vez la forma normal y la didesoxi de cada nucleótido.

Solución

Solución de Ejercicio 4.1.

Un didesoxinucleótido no tiene hidroxilo 3', de modo que no puede formarse ningún enlace fosfodiéster con el nucleótido siguiente y la cadena se detiene. Con solo formas didesoxi toda cadena se detendría en la primera posición; con solo formas normales no se detendría ninguna. La mezcla convierte la terminación en un suceso aleatorio en cada posición, de manera que los productos forman una escalera completa, una longitud por cada base del molde.

Ejercicio 4.2

Una carrera produce 4×1084\times 10^{8} lecturas emparejadas de 2×150bp2\times 150\,\mathrm{bp}. ¿Qué cobertura da eso de un genoma humano de 3.2Gb3.2\,\mathrm{Gb}? ¿Y de un genoma bacteriano de 5Mb5\,\mathrm{Mb}?

Solución

Solución de Ejercicio 4.2.

4×108×300bp=1.2×10114\times 10^{8}\times 300\,\mathrm{bp} = 1.2\times 10^{11} bases. Ser humano: 1.2×1011/3.2×10938×1.2\times 10^{11}/3.2\times 10^{9} \approx 38\times. Bacteria: 1.2×1011/5×106=24000×1.2\times 10^{11}/5\times 10^{6} = 24\,000\times.

Ejercicio 4.3

Defínanse contig, andamio y N50. Un ensamblaje de 100Mb100\,\mathrm{Mb} tiene diez contigs de 8Mb8\,\mathrm{Mb} y 20002000 de 10kb10\,\mathrm{kb}. ¿Cuál es su N50?

Solución

Solución de Ejercicio 4.3.

Un contig es una secuencia contigua ensamblada a partir de lecturas solapadas; un andamio es un conjunto ordenado y orientado de contigs con huecos de tamaño estimado entre ellos; el N50 es la longitud de contig a la que los contigs ordenados alcanzan la mitad de las bases ensambladas. Aquí los diez contigs de 8Mb8\,\mathrm{Mb} contienen ya 80Mb80\,\mathrm{Mb}, más allá del punto medio de 50Mb50\,\mathrm{Mb} (el séptimo llega a 56Mb56\,\mathrm{Mb}): N50 =8Mb= 8\,\mathrm{Mb}.

Ejercicio 4.4

Enúnciese la paradoja del valor C con dos ejemplos, y dígase qué explica sobre todo el ADN sobrante de los genomas grandes.

Solución

Solución de Ejercicio 4.4.

El tamaño del genoma no sigue a la complejidad del organismo: una cebolla tiene cinco veces el ADN de una persona y un pez pulmonado cuarenta veces; la levadura y el gusano difieren diez veces en ADN con números de genes parecidos. El exceso es no codificante: elementos transponibles y sus restos, intrones y repeticiones satélite.

Ejercicio 4.5 ★★

Con el Teorema 4.3, hállense la cobertura necesaria para dejar como mucho una base de cada millón sin secuenciar y el número esperado de contigs de un genoma de 5Mb5\,\mathrm{Mb} leído a c=8c = 8 con lecturas de 150bp150\,\mathrm{bp} y un solapamiento mínimo de 30bp30\,\mathrm{bp}.

Solución

Solución de Ejercicio 4.5.

ec=106e^{-c} = 10^{-6} da c=6ln10=13.8c = 6\ln 10 = 13.8. Para c=8c = 8: N=cG/L=8×5×106/150267000N = cG/L = 8\times 5\times 10^{6}/150 \approx 267\,000 lecturas, θ=30/150=0.2\theta = 30/150 = 0.2, contigs =Ne6.4=267000×0.00166440= N e^{-6.4} = 267\,000\times 0.00166 \approx 440.

Ejercicio 4.6 ★★

Una variante heterocigótica está cubierta por 3030 lecturas. Suponiendo que cada lectura muestra uno u otro alelo con probabilidad 1/21/2, ¿cuál es la probabilidad de que menos de 88 lecturas muestren el alelo variante (de modo que pudiera confundirse con errores)? Úsese una aproximación normal de media 1515 y desviación típica 7.5\sqrt{7.5}. ¿Por qué es 30×30\times el estándar?

Solución

Solución de Ejercicio 4.6.

P(X<8)=P(X7)P(Z<(7.515)/2.74)=P(Z<2.74)0.003P(X < 8) = P(X \le 7) \approx P\bigl(Z < (7.5 - 15)/2.74\bigr) = P(Z < -2.74) \approx 0.003. A 30×30\times los dos alelos de un heterocigoto se ven casi siempre muchas veces, la cobertura es desigual (las regiones ricas en GC reciben menos lecturas, de modo que algunos sitios ven la mitad de la media) y quedan lecturas suficientes para separar un alelo real de los errores de 10310^{-3}.

Ejercicio 4.7 ★★

Un genoma tiene una repetición de 6kb6\,\mathrm{kb} presente en 500500 copias. Explíquese por qué un ensamblaje a partir de lecturas de 150bp150\,\mathrm{bp} la colapsa, qué aspecto tiene el grafo resultante y qué longitud de lectura la resolvería.

Solución

Solución de Ejercicio 4.7.

Toda lectura de 150bp150\,\mathrm{bp} del interior de la repetición es idéntica venga de la copia que venga, de modo que el ensamblador construye un solo nodo de 6kb6\,\mathrm{kb} con 500500 caminos de entrada y 500500 de salida; no puede saber qué entrada se empareja con qué salida, y el ensamblaje se rompe en 500500 huecos, con la repetición presente una sola vez y con una cobertura 500500 veces la media. Las lecturas más largas que la repetición más los flancos únicos de ambos lados — 8kb8\,\mathrm{kb} o más — abarcan cada copia y la resuelven.

Ejercicio 4.8 ★★

Dos personas difieren en una base de cada mil. ¿Cuántas diferencias hay en sus exomas (48Mb48\,\mathrm{Mb} de secuencia codificante)? Si dos tercios de las diferencias codificantes son sinónimas o benignas y el resto alteran una proteína, ¿cuántas variantes que alteran proteína lleva una persona respecto a otra?

Solución

Solución de Ejercicio 4.8.

4.8×107/1000=480004.8\times 10^{7}/1000 = 48\,000 diferencias codificantes; un tercio, unas 1600016\,000, alteran la proteína.

Ejercicio 4.9 ★★

Un GWAS prueba 10610^{6} SNP con umbral p<5×108p < 5\times 10^{-8}. ¿Cuántos falsos positivos se esperan si ningún SNP está realmente asociado? Un alelo de un SNP sube el riesgo de una enfermedad de frecuencia 2%2\,\% hasta el 2.3%2.3\,\%. Explíquese por qué un efecto así es indetectable en un estudio de mil personas e inútil para un individuo, y sin embargo puede señalar un mecanismo.

Solución

Solución de Ejercicio 4.9.

Falsos positivos esperados, 106×5×108=0.0510^{6}\times 5\times 10^{-8} = 0.05. Un riesgo relativo de 1.151.15 sobre una enfermedad del 2%2\,\% cambia unos pocos casos por millar; mil personas contienen unos veinte casos, demasiado pocos para verlo (la potencia crece con el número de casos y con el cuadrado del efecto). Para un individuo, 0.30.3 puntos porcentuales no significan nada. Pero el alelo señala un gen cuyo cambio modesto de actividad altera el riesgo de enfermedad — el gen, y su vía, pueden ser una diana farmacológica cuya inhibición completa tenga un efecto grande.

Ejercicio 4.10 ★★★

Los genomas bacterianos son codificantes en un 88%88\,\%; el genoma humano, en un 1.5%1.5\,\%. Dense tres hipótesis — de genética de poblaciones, estructural y reguladora — para la diferencia, y para cada una una observación genómica que la apoye o la debilite.

Solución

Solución de Ejercicio 4.10.

De genética de poblaciones: en las bacterias, con poblaciones enormes, la selección elimina incluso las inserciones ligeramente costosas; en los mamíferos, con poblaciones efectivas pequeñas, la deriva deja que se acumule ADN no codificante levemente deletéreo — lo apoya la correlación inversa entre tamaño del genoma y tamaño de población entre linajes, y lo debilitan las excepciones. Estructural: los genomas eucariotas los invaden transposones que las bacterias, con su sesgo hacia la deleción y sin refugio meiótico para los elementos egoístas, depuran — lo apoya la correlación entre el tamaño del genoma y el contenido de transposones. Reguladora: un desarrollo complejo necesita más ADN regulador — lo apoyan los elementos no codificantes conservados alrededor de los genes del desarrollo, y lo debilita el hecho de que solo el 8%8\,\% del genoma humano muestre selección alguna, de modo que la mayor parte del ADN no codificante no es regulador.

Ejercicio 4.11 ★★★

Dedúzcase el recuento de contigs de Lander–Waterman para una mezcla de lecturas de dos longitudes: N1N_{1} lecturas cortas de longitud L1L_{1} y N2N_{2} lecturas largas de longitud L2L_{2}, con los solapamientos contados con el mismo mínimo TT. (Trátese cada lectura como la más a la derecha de su contig si ninguna lectura de cualquier tipo empieza dentro de su propia longitud menos TT.) Muéstrese que unas pocas lecturas largas reducen el recuento de contigs más que el mismo número de bases en lecturas cortas.

Solución

Solución de Ejercicio 4.11.

Los inicios de ambos tipos caen con densidad total ρ=(N1+N2)/G\rho = (N_{1} + N_{2})/G. Una lectura de longitud LiL_{i} es la más a la derecha de su contig si ninguna lectura de cualquier tipo empieza en las LiTL_{i} - T bases que la siguen: probabilidad eρ(LiT)e^{-\rho(L_{i} - T)}. De ahí que los contigs sean =N1eρ(L1T)+N2eρ(L2T)= N_{1} e^{-\rho(L_{1} - T)} + N_{2} e^{-\rho(L_{2} - T)}. Una lectura larga es la más a la derecha con una probabilidad exponencialmente menor que una corta, y cada lectura larga elimina además la posibilidad de un hueco a lo largo de toda su longitud; el mismo número de bases en lecturas cortas añade muchos puntos de inicio, pero cada ventana protegida es corta, de modo que las lecturas largas ganan.

Ejercicio 4.12 ★★★

Se sostiene que los cuatro agrupamientos Hox de los mamíferos descienden de uno solo por dos rondas de duplicación del genoma completo en la base de los vertebrados. Dígase qué patrón de parálogos a lo largo del genoma, y qué patrón en los genomas de las lampreas y de los cordados invertebrados, predice esa hipótesis, y cómo se la distinguiría de dos duplicaciones independientes del agrupamiento solo.

Solución

Solución de Ejercicio 4.12.

Dos duplicaciones del genoma completo predicen que el patrón cuádruple sea de todo el genoma: cuartetos de segmentos cromosómicos parálogos (paralogones) que llevan las mismas familias génicas en el mismo orden, con las duplicaciones fechadas en el mismo momento para todas las familias; un solo agrupamiento en el anfioxo y en Ciona, que divergieron antes de los sucesos; y en las lampreas, que divergieron alrededor de ellos, un estado intermedio o derivado de forma independiente. Las duplicaciones independientes solo del agrupamiento Hox predicen paralogones únicamente para Hox, vecinos con historias distintas y fechas de duplicación diferentes entre familias. Los paralogones de todo el genoma y la datación compartida, tal como se observan, favorecen la duplicación del genoma completo.

4.6 Problema: dos genomas en una máquina

Problema 4.1

Problema de fin de semana — una bacteria y un ser humano secuenciados en la misma carrera: las lecturas repartidas, la cobertura y los huecos calculados, los contigs contados, las variantes heterocigóticas llamadas frente a la tasa de error, el contenido del genoma humano pesado y un estudio de asociación dimensionado, hasta llegar al recuento de contigs a baja cobertura, a la cobertura que hace segura una llamada de variante y al número de mutaciones nuevas de un niño

Datos: una carrera rinde 6×1086\times 10^{8} lecturas de 150bp150\,\mathrm{bp}. Un genoma bacteriano mide 4.6Mb4.6\,\mathrm{Mb}; el genoma humano, 3.2Gb3.2\,\mathrm{Gb} (haploide). Solapamiento mínimo T=30bpT = 30\,\mathrm{bp}. Tasa de error 10310^{-3} por base y lectura. Secuencia codificante humana, 48Mb48\,\mathrm{Mb}; el genoma deriva en un 45%45\,\% de transposones, con 1.11.1 millones de copias Alu de 300bp300\,\mathrm{bp}. Dos personas difieren en un sitio de cada 10001000. Tasa de mutación, 1.2×1081.2\times 10^{-8} por base y generación.

Parte I — La bacteria.

  1. A la bacteria se le da el 0.2%0.2\,\% de la carrera. ¿Cuántas lecturas, y qué cobertura?
  2. ¿Qué fracción de su genoma queda sin secuenciar? ¿Cuántas bases son?
  3. Calcúlense θ\theta y el número esperado de contigs.
  4. Un ensayo previo usó solo 3000030\,000 lecturas. ¿Cobertura, fracción no cubierta y número de contigs?
  5. El genoma contiene 77 copias de un operón de ARNr de 5kb5\,\mathrm{kb}. Explíquese qué les ocurre en el ensamblaje y cuántos extremos de contig produce esto por sí solo.
  6. La bacteria tiene alrededor de un gen por kilobase. ¿Cuántos genes y, si el 88%88\,\% del genoma es codificante, cuál es la longitud media de un gen?

Parte II — El ser humano.

  1. El resto de la carrera va a un genoma humano. ¿Cobertura del genoma diploide por copia haploide (es decir, bases totales divididas por 3.2Gb3.2\,\mathrm{Gb})?
  2. En un sitio heterocigótico cada uno de los dos alelos queda cubierto por alrededor de la mitad de las lecturas. Con la cobertura de la pregunta 7, ¿cuál es el número esperado de lecturas que muestran cada alelo?
  3. Un error muestra una base equivocada en una lectura con probabilidad 10310^{-3}. En un sitio homocigótico cubierto por cc lecturas, ¿cuál es el número esperado de lecturas que muestran una base equivocada concreta (103/310^{-3}/3 cada una)? ¿Por qué una regla del tipo “llámese variante si al menos 33 lecturas y al menos el 20%20\,\% de las lecturas la muestran” rechaza los errores a esta cobertura?
  4. ¿Cuántos sitios heterocigóticos lleva una persona (la mitad de las diferencias entre dos genomas al azar están en cada uno, aproximadamente: tómese un sitio de cada 15001500)? ¿Cuántos en secuencia codificante?
  5. Las lecturas se alinean con una referencia. Explíquese por qué las lecturas procedentes de elementos Alu se alinean a menudo con la copia equivocada y qué consecuencia tiene esto para la llamada de variantes dentro de ellas.
  6. Se secuencia a un niño junto con sus dos progenitores. ¿Cuántas mutaciones nuevas cabe esperar? ¿Cuántas lecturas del niño, a esta cobertura, deben mostrar una variante ausente en ambos progenitores para creérsela, y por qué la cobertura de los progenitores es tan importante como la del niño?
  7. Un laboratorio clínico captura el exoma (48Mb48\,\mathrm{Mb}) y lo secuencia a 100×100\times. ¿Cuántas lecturas hacen falta, y por qué resulta más barato por paciente que un genoma a 28×28\times aunque su cobertura sea mayor?

Parte III — El contenido de un genoma.

  1. ¿Qué fracción del genoma humano es Alu, y qué fracción de las lecturas de la pregunta 7 procede de elementos Alu?
  2. La referencia mide 3.2Gb3.2\,\mathrm{Gb}, pero una célula diploide contiene 6.4Gb6.4\,\mathrm{Gb}; y una cebolla de 16Gb16\,\mathrm{Gb} tiene unos 6000060\,000 genes. ¿Cuál es la fracción codificante del genoma de la cebolla, si sus genes promedian 1.5kb1.5\,\mathrm{kb} de secuencia codificante?
  3. El ser humano y el chimpancé difieren en el 1.2%1.2\,\% de las bases alineadas. ¿Cuántas sustituciones son en 2.9Gb2.9\,\mathrm{Gb} de secuencia alineable? Repartidas por igual entre los dos linajes a lo largo de 6.56.5 millones de años, ¿qué tasa de mutación por base y año implica esto, y por generación de 2525 años? Compárese con la medida directa dada en los datos.
  4. Dos duplicaciones del genoma de los vertebrados deberían dar hasta cuatro copias de cada gen ancestral. El ser humano tiene unos 2000020\,000 genes y el cordado invertebrado Ciona, unos 1600016\,000. ¿Qué fracción de los duplicados se ha perdido, bajo la hipótesis de que el antepasado tenía 1600016\,000?
  5. Explíquese por qué el número de genes es una mala medida de la complejidad de un organismo, usando como argumento el recuento de cortes y empalmes alternativos del Capítulo 2.
  6. El 8%8\,\% del genoma está bajo selección purificadora pero solo el 1.5%1.5\,\% codifica proteína. ¿Qué es probablemente el resto, y cómo se pondría a prueba un elemento candidato?

Parte IV — Un estudio de asociación.

  1. Se prueban 10610^{6} SNP. Enúnciese el umbral de Bonferroni para un error por familia de 0.050.05, y el número esperado de falsos positivos con p<105p < 10^{-5}.
  2. Una enfermedad tiene una prevalencia del 1%1\,\%. Un alelo de riesgo de frecuencia 0.30.3 eleva la razón de posibilidades un 5%5\,\%. Calcúlese el riesgo de enfermedad de un portador de dos copias, de una copia y de ninguna, tomando el riesgo del no portador como 0.9%0.9\,\%. (Multiplíquense las razones de posibilidades.)
  3. Se encuentran doscientos alelos de este tipo. Explíquese qué es una puntuación poligénica y por qué la puntuación de una persona del 1%1\,\% superior puede corresponder a un riesgo varias veces mayor aunque cada alelo no haga casi nada.
  4. Explíquese por qué un SNP que alcanza significación no suele ser la variante causal, y qué experimento identificaría la causal en la región.
  5. Se secuencia a c=0.5c = 0.5 un genoma antiguo de un hueso de 4000040\,000 años. ¿Qué fracción de él se lee? ¿Por qué puede responder de todos modos a preguntas sobre la historia de las poblaciones que un genoma moderno por sí solo no puede?
  6. Resúmase: el número de contigs del ensamblaje de ensayo (pregunta 4), la cobertura por genoma haploide que da unas 1515 lecturas por alelo (preguntas 7–8) y el número de mutaciones nuevas de un niño (pregunta 12).
Solución

Solución de Problema 4.1.

1. 0.002×6×108=1.2×1060.002\times 6\times 10^{8} = 1.2\times 10^{6} lecturas; c=1.2×106×150/4.6×10639c = 1.2\times 10^{6}\times 150/4.6\times 10^{6} \approx 39. 2. e391017e^{-39} \approx 10^{-17}: en la práctica no queda ninguna base sin cubrir. 3. θ=0.2\theta = 0.2; contigs =1.2×106e310= 1.2\times 10^{6} e^{-31} \approx 0: un solo contig en teoría, con huecos solo en las repeticiones. 4. c=30000×150/4.6×106=0.98c = 30\,000\times 150/4.6\times 10^{6} = 0.98; sin cubrir, e0.98=0.38e^{-0.98} = 0.38, unas 1.7Mb1.7\,\mathrm{Mb}; contigs =30000×e0.7813700= 30\,000 \times e^{-0.78} \approx 13\,700. 5. Los siete operones dan lecturas idénticas y colapsan en un solo contig de 5kb5\,\mathrm{kb}, al que entran siete flancos izquierdos únicos y del que salen siete flancos derechos cuyo emparejamiento se desconoce: 1414 extremos de contig y siete huecos. 6. Unos 46004600 genes; codificantes, 0.88×4.6×106=4.0×1060.88\times 4.6\times 10^{6} = 4.0\times 10^{6} bp, con un gen medio de 880bp880\,\mathrm{bp}. 7. 0.998×6×108×150/3.2×10928×0.998\times 6\times 10^{8}\times 150/3.2\times 10^{9} \approx 28\times. 8. Unas 1414 lecturas por alelo. 9. 28×103/30.00928\times 10^{-3}/3 \approx 0.009 lecturas que muestran una base equivocada dada — la probabilidad de tres o más es de unos 10710^{-7} — y el 20%20\,\% de 2828 son 5.65.6 lecturas; un error no pasa ninguna de las dos pruebas, mientras que de un alelo heterocigótico real se esperan 1414. 10. 3.2×109/15002.1×1063.2\times 10^{9}/1500 \approx 2.1\times 10^{6} sitios heterocigóticos; en secuencia codificante, 4.8×107/1500320004.8\times 10^{7}/1500 \approx 32\,000. 11. Una lectura de 150bp150\,\mathrm{bp} de un Alu casa casi igual de bien con muchas de los 1.11.1 millones de copias, de modo que se coloca en la copia equivocada o se le da poca confianza de mapeo. Las diferencias entre copias parecen entonces variantes heterocigóticas, y las variantes verdaderas quedan escondidas entre ellas: las llamadas de variantes dentro de los Alu suelen filtrarse, y esos elementos son puntos ciegos de la secuenciación de lectura corta. 12. 1.2×108×6.4×109771.2\times 10^{-8}\times 6.4\times 10^{9} \approx 77 mutaciones nuevas. Unas 1414 lecturas deberían mostrar la variante en el niño; pero si el sitio de un progenitor solo está cubierto por cinco lecturas, un alelo heterocigótico se pierde con probabilidad 25=3%2^{-5} = 3\,\% y una variante heredada se llama por error como nueva — de ahí que los progenitores deban secuenciarse tan a fondo como el niño. 13. 4.8×107×100/150=3.2×1074.8\times 10^{7}\times 100/150 = 3.2\times 10^{7} lecturas, veinte veces menos que el genoma: el coste de secuenciación cae veinte veces, más de lo que cuesta el paso de captura. 14. 1.1×106×300=3.3×1081.1\times 10^{6}\times 300 = 3.3\times 10^{8} bp, cerca del 10%10\,\% del genoma; el 10%10\,\% de las lecturas, unos 6×1076\times 10^{7}. 15. 60000×1500=9×10760\,000\times 1500 = 9\times 10^{7} bp; 9×107/1.6×1010=0.56%9\times 10^{7}/1.6\times 10^{10} = 0.56\,\%. 16. 0.012×2.9×109=3.5×1070.012\times 2.9\times 10^{9} = 3.5\times 10^{7} sustituciones, 1.7×1071.7\times 10^{7} por linaje; tasa 1.7×107/(2.9×109×6.5×106)=9×10101.7\times 10^{7}/(2.9\times 10^{9}\times 6.5\times 10^{6}) = 9\times 10^{-10} por base y año, 2.3×1082.3\times 10^{-8} por generación de 25 años — unas dos veces la tasa de pedigrí de 1.2×1081.2\times 10^{-8}, una discrepancia conocida que sugiere generaciones más largas en el pasado o una separación más antigua. 17. Cuatro copias de 1600016\,000 serían 6400064\,000; quedan 2000020\,000, de modo que de las 4800048\,000 copias adicionales solo sobreviven 40004000: se perdió el 92%92\,\% de los duplicados. 18. El gusano y el ser humano tienen el mismo número de genes; la complejidad está en cómo se usan — el corte y empalme alternativo multiplica un gen en miles de proteínas (3801638\,016 para Dscam), la regulación combina factores de transcripción y potenciadores de maneras propias de cada tipo celular, los ARN no codificantes añaden capas y las proteínas interactúan en redes. 19. Elementos reguladores (potenciadores, promotores, aislantes), genes de ARN no codificante, señales de corte y de localización, orígenes y secuencias estructurales. Un potenciador candidato se pone a prueba colocándolo delante de un gen indicador en un embrión transgénico y mirando dónde se expresa el indicador, y después suprimiendo el elemento del genoma con CRISPR y midiendo los genes vecinos. 20. 0.05/106=5×1080.05/10^{6} = 5\times 10^{-8}; con p<105p < 10^{-5}, 106×105=1010^{6} \times 10^{-5} = 10 falsos positivos esperados. 21. No portador: 0.009/0.991=0.009080.009/0.991 = 0.00908 de posibilidades; con una copia, 0.009540.00954, riesgo 0.945%0.945\,\%; con dos copias, 0.010010.01001, riesgo 0.99%0.99\,\%. 22. La puntuación suma, sobre los 200200 alelos, el número de copias de riesgo que lleva una persona ponderado por el logaritmo de la razón de posibilidades de cada alelo. El recuento tiene media 200×2×0.3=120200\times 2\times 0.3 = 120 y desviación típica 200×2×0.3×0.79\sqrt{200\times 2\times 0.3\times 0.7} \approx 9; el 1%1\,\% superior lleva unos 2121 alelos más que la media, y 1.05212.81.05^{21} \approx 2.8: casi el triple de posibilidades que una persona media, a partir de alelos que individualmente cambian el riesgo un 5%5\,\%. 23. Los alelos de un bloque de decenas de kilobases se heredan juntos (desequilibrio de ligamiento), de modo que cualquiera de ellos muestra la misma asociación; el SNP genotipado es simplemente el que estaba en la matriz. Para encontrar la variante causal: secuénciese la región en casos y controles, redúzcase el conjunto por estadística y pruébese después cada candidata — ensayos con gen indicador para la actividad potenciadora de cada alelo, edición de cada alelo en células y medida de la expresión de los genes vecinos, colocalización con señales de rasgos cuantitativos de expresión. 24. Se lee el 1e0.5=39%1 - e^{-0.5} = 39\,\% del genoma. Da una muestra directa de una población en un momento conocido del pasado — frecuencias alélicas anteriores a migraciones y mestizajes posteriores, la longitud de los segmentos neandertales (largos, porque pocas generaciones de recombinación los habían roto) y con ello una fecha para el mestizaje —, cosa que los genomas modernos solo pueden inferir a través de modelos. 25. Unos 1370013\,700 contigs en el ensamblaje de ensayo; 28×28\times por genoma haploide, unas 1414 lecturas por alelo; y unas 7777 mutaciones nuevas en un niño.

Términos definidos en este capítulo

Ver los 479 términos del glosario