Biología · Glosario

¿Qué es Motivos y contenido de información?

Definición 5.12 Biología universitaria — tercer año · Capítulo 5 — Bioinformática y análisis de secuencias

Un motivo es un patrón corto — un sitio de factor de transcripción, una señal de corte, un sitio de fosforilación — representado por una matriz de pesos por posición con la frecuencia fi(b)f_{i}(b) de cada base o residuo bb en cada posición ii. El contenido de información de la posición ii es Ri=2HiR_{i} = 2 - H_{i} bits para el ADN, donde Hi=bfi(b)log2fi(b)H_{i} = -\sum_{b} f_{i}(b)\log_{2} f_{i}(b) es su entropía: 22 bits para una base invariante y 00 para una posición en la que las cuatro son igualmente probables. El total R=iRiR = \sum_{i} R_{i} se dibuja como un logotipo de secuencia, con cada posición una pila de letras cuya altura total es RiR_{i} y cuyas letras se dimensionan por frecuencia.

Un logotipo de secuencia de un motivo de promotor parecido a la caja TATA. La altura de cada pila es el contenido de información de esa posición, 2 - H_i bits; las cuatro primeras posiciones son casi invariantes y llevan la mayor parte de los 12 bits del motivo.
Un logotipo de secuencia de un motivo de promotor parecido a la caja TATA. La altura de cada pila es el contenido de información de esa posición, 2Hi2 - H_{i} bits; las cuatro primeras posiciones son casi invariantes y llevan la mayor parte de los 1212 bits del motivo.

Ejemplos

Ejemplo 5.14 (Coincidencias esperadas por azar)

Un sitio de restricción de seis bases fijas tiene R=12R = 12 bits y coincide con una posición al azar con probabilidad 46=2124^{-6} = 2^{-12}: unas 11001100 veces en un genoma de E. coli de 4.6Mb4.6\,\mathrm{Mb} leído en ambas hebras (el sitio es palindrómico, de modo que una vez por posición), y 7×1057\times 10^{5} veces en el genoma humano. Un factor eucariota cuyo motivo lleve 1010 bits coincide con 3×109×21033\times 10^{9}\times 2^{-10} \approx 3 millones de posiciones del genoma humano, varios miles de veces más que los genes que regula. Un motivo por sí solo es un predictor débil en un genoma grande; lo que permite una predicción son el estado de la cromatina, los motivos vecinos y la conservación del sitio entre especies.

Leer en el capítulo →