Biología · Glosario

¿Qué es Matrices de sustitución?

Definición 5.5 Biología universitaria — tercer año · Capítulo 5 — Bioinformática y análisis de secuencias

Una matriz de sustitución da s(a,b)s(a,b) para cada par de aminoácidos como una puntuación de log-verosimilitudes:

s(a,b)=1λlogqabpapb,s(a,b) = \frac{1}{\lambda}\,\log\frac{q_{ab}}{p_{a}\,p_{b}},

donde qabq_{ab} es la frecuencia con la que aa y bb aparecen alineados en alineamientos fiables de proteínas emparentadas, papbp_{a} p_{b} la frecuencia con la que se emparejarían por azar y λ\lambda una escala elegida para que las entradas sean enteros cómodos. Una puntuación positiva significa que el par aparece más a menudo en homólogos que por azar; las puntuaciones de identidad son mayores para los aminoácidos raros (triptófano +11+11, cisteína +9+9 en BLOSUM62) y menores para los frecuentes (leucina +4+4, alanina +4+4), y las sustituciones conservadoras (isoleucina–valina +3+3) puntúan positivo mientras que las radicales (triptófano–glicina 2-2) puntúan negativo. Las matrices PAM (Dayhoff, 1978) se dedujeron de proteínas muy próximas y se extrapolaron a distancias mayores por multiplicación de matrices; las matrices BLOSUM (Henikoff y Henikoff, 1992) se contaron directamente en bloques de secuencias alineadas agrupadas a una identidad dada — BLOSUM62 a partir de bloques al 62%62\,\% — y son las predeterminadas porque se midieron, en lugar de extrapolarse, a la distancia a la que se usan.

Leer en el capítulo →