Biología · Glosario

¿Qué es Alineamiento múltiple y perfiles?

Definición 5.11 Biología universitaria — tercer año · Capítulo 5 — Bioinformática y análisis de secuencias

Un alineamiento múltiple de secuencias dispone una familia de secuencias en columnas de residuos homólogos. La programación dinámica exacta sobre kk secuencias cuesta nkn^{k} y es imposible más allá de tres; los programas prácticos alinean de forma progresiva, primero el par más próximo según un árbol guía y luego secuencias y grupos al alineamiento creciente, con rondas de refinamiento. Un alineamiento terminado se resume en un perfil: para cada columna, la frecuencia de cada residuo y de los huecos. Un modelo oculto de Markov de perfil formaliza esto como una cadena de estados de coincidencia, uno por columna conservada, cada uno emitiendo residuos con sus propias probabilidades, con estados de inserción y de deleción que permiten residuos adicionales o ausentes en cada posición; el modelo de una familia (una entrada de Pfam) puntúa una secuencia nueva por la probabilidad del mejor camino a través de los estados, y encuentra homólogos muy por debajo de la zona crepuscular de la comparación por pares, porque una columna que solo tolera residuos hidrófobos lo dice, mientras que una secuencia aislada no puede.

Un modelo oculto de Markov de perfil de una familia de cuatro columnas. Cada estado de coincidencia M emite un residuo con las frecuencias propias de la columna; los estados de inserción I (con bucles sobre sí mismos) admiten residuos adicionales, y los de deleción D se saltan una columna. Puntuar una secuencia es hallar su camino más probable.
Un modelo oculto de Markov de perfil de una familia de cuatro columnas. Cada estado de coincidencia M emite un residuo con las frecuencias propias de la columna; los estados de inserción I (con bucles sobre sí mismos) admiten residuos adicionales, y los de deleción D se saltan una columna. Puntuar una secuencia es hallar su camino más probable.

Ejemplos

Ejemplo 5.7 (Identidad, similitud y la zona crepuscular)

Dos secuencias de proteína aleatorias alineadas de forma óptima con huecos alcanzan por azar entre el 15 a 20%15\text{ a }20\,\% de identidad. Por encima del 35%35\,\% de identidad a lo largo de cien residuos, dos proteínas son casi con seguridad homólogas; entre el 20%20\,\% y el 35%35\,\% está la zona crepuscular, donde la identidad por sí sola no decide y debe hacerlo la estadística de más abajo. Los homólogos pueden caer muy por debajo de la zona: las subunidades de la hemoglobina y la mioglobina comparten un 25%25\,\% de identidad, la lisozima y la α\alpha-lactalbúmina un 40%40\,\%, y muchos pares de proteínas con el mismo plegamiento comparten menos del 15%15\,\%, detectable solo comparando perfiles o estructuras.

Ejemplo 5.10 (Leer un valor E)

Una consulta de 250250 residuos contra una base de datos de 5×10105\times 10^{10} residuos tiene mn=1.25×1013243.5mn = 1.25\times 10^{13} \approx 2^{43.5}. Un acierto con una puntuación en bits de 6060 tiene E=243.560=216.5105E = 2^{43.5 - 60} = 2^{-16.5} \approx 10^{-5}: es homólogo con certeza prácticamente absoluta. Un acierto con S=40S' = 40 tiene E=23.511E = 2^{3.5} \approx 11: se esperan once puntuaciones así por azar, y el acierto no significa nada. El mismo alineamiento, con la misma puntuación en bits, buscado en una base de datos diez veces mayor, tiene un EE diez veces mayor — la significación es una propiedad de la búsqueda, no del par. El umbral de uso común es E<103E < 10^{-3} para un homólogo fiable; E0.01E \approx 0.0111 merece una segunda mirada con un método de perfil.

Leer en el capítulo →