Biología · Glosario

¿Qué es Secuenciación masiva en paralelo?

Definición 4.2 Biología universitaria — tercer año · Capítulo 4 — Genómica y secuenciación

Los instrumentos de segunda generación leen de millones a miles de millones de fragmentos a la vez. En la secuenciación por síntesis los fragmentos, con adaptadores ligados a sus extremos, se fijan a una celda de flujo de vidrio y se amplifican in situ en agrupaciones de moléculas idénticas; las agrupaciones se alargan luego una base por ciclo con nucleótidos fluorescentes y bloqueados de forma reversible, se fotografían, se desbloquean y se vuelven a alargar, de modo que cada ciclo añade una base a la lectura de cada agrupación. Las lecturas son de 100 a 300bp100\text{ a }300\,\mathrm{bp}, casi siempre desde los dos extremos de un fragmento (extremos emparejados), con una tasa de error de unos 10310^{-3} por base, y una carrera rinde hasta 101210^{12} bases. Los instrumentos de tercera generación, de lectura larga, leen moléculas sueltas sin amplificación: observando cómo una polimerasa incorpora nucleótidos fluorescentes en tiempo real, o haciendo pasar el ADN por un nanoporo proteico y registrando la corriente iónica, que cada secuencia de bases modula a su manera. Las lecturas de 10 a 100kb10\text{ a }100\,\mathrm{kb} y más abarcan las repeticiones que las lecturas cortas no pueden, con una tasa bruta de error mayor que el consenso reduce.

Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica. Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.
Izquierda: una celda de flujo, el portaobjetos de vidrio sobre el que se hacen crecer y se leen miles de millones de agrupaciones de ADN a razón de una base por ciclo. Derecha: un secuenciador de nanoporos de bolsillo que lee moléculas sueltas como cambios de una corriente iónica.

Ejemplos

Ejemplo 4.4 (Cuánto basta)

Con c=5c = 5 la fracción sin secuenciar es e5=0.7%e^{-5} = 0.7\,\% — para un genoma de 3.2Gb3.2\,\mathrm{Gb}, veinte millones de bases en algunas decenas de miles de huecos. Con c=10c = 10 es 4.5×1054.5\times 10^{-5}, 150kb150\,\mathrm{kb} en total. Los genomas humanos se secuencian de rutina a c=30c = 30, no por los huecos de cobertura (e301013e^{-30} \approx 10^{-13}), sino porque cada base ha de leerse varias veces en cada uno de los dos cromosomas para llamar con confianza una variante heterocigótica frente a una tasa de error de 10310^{-3} por lectura. Los genomas bacterianos se secuencian a c=50c = 50100100 por la misma razón y porque es barato. La fórmula muestra además lo que la cobertura no puede arreglar: una repetición más larga que una lectura es un punto donde el grafo de solapamientos se ramifica, y ninguna cantidad de lecturas cortas lo resuelve. Para eso están las lecturas largas.

Leer en el capítulo →