Biology · Livro 5 · Bachelor Year 3

Biologia universitária — 3.º ano

Biologia universitária — 3.º ano · Bachelor Year 3

4Genômica e sequenciamento

O primeiro genoma completo de um organismo de vida livre, os 1.8Mb1.8\,\mathrm{Mb} de uma bactéria, foi publicado em 1995 depois de um ano de trabalho de uma equipe de quarenta pessoas. O genoma humano, com 3.23.2 bilhões de pares de bases, custou treze anos e cerca de três bilhões de dólares a um consórcio internacional e foi declarado concluído em 2003. Hoje uma máquina de bancada lê um genoma humano numa noite por algumas centenas de dólares, um hospital sequencia o tumor de um paciente para escolher um fármaco, e um museu extrai e lê o genoma de um osso de quarenta mil anos. A tecnologia que tornou isso possível, a matemática que converte milhões de leituras curtas num genoma e o que os genomas prontos ensinaram sobre o tamanho, o conteúdo e a história de nosso DNA são o assunto deste capítulo. O capítulo seguinte retoma os algoritmos que comparam as sequências depois de obtidas.

4.1 Ler o DNA

Definição 4.1 (Sequenciamento por terminação de cadeia)

O sequenciamento de Sanger copia um molde de fita simples a partir de um iniciador com DNA-polimerase, na presença dos quatro nucleotídeos normais e de uma pequena proporção de didesoxinucleotídeos, que não têm a hidroxila 3' e por isso terminam a cadeia onde quer que sejam incorporados. Cada didesoxinucleotídeo carrega um corante fluorescente diferente. O produto é uma mistura de fragmentos, um para cada posição do molde, cada um terminando numa base de identidade conhecida; separados por tamanho num capilar de gel, eles passam por um detector em ordem de comprimento, e a sequência de cores é a sequência do molde. Uma corrida lê 700 a 900bp700\text{ a }900\,\mathrm{bp} com taxa de erro abaixo de 10310^{-3}; continua sendo o método para verificar uma construção ou um gene isolado.

Evidência. Sanger, Nicklen e Coulson publicaram o método em 1977 e o usaram naquele mesmo ano para ler os 5386bp5386\,\mathrm{bp} do fago ϕ\phiX174 — o primeiro genoma de DNA completo — e, em 1981, os 16569bp16\,569\,\mathrm{bp} da mitocôndria humana. Fleischmann e colaboradores (1995) leram os 1.83Mb1.83\,\mathrm{Mb} de Haemophilus influenzae quebrando o genoma inteiro em fragmentos aleatórios, sequenciando 2400024\,000 deles e montando as leituras por computador — a estratégia de sequenciamento aleatório do genoma inteiro que todos os projetos posteriores ampliaram.

À esquerda: Frederick Sanger, que idealizou os primeiros métodos práticos de leitura de proteínas e de DNA e recebeu um prêmio Nobel por cada um. À direita: uma autorradiografia de um gel de sequenciamento da era pré-capilar, uma raia por base, com a sequência lida de baixo para cima na escada de bandas. À esquerda: Frederick Sanger, que idealizou os primeiros métodos práticos de leitura de proteínas e de DNA e recebeu um prêmio Nobel por cada um. À direita: uma autorradiografia de um gel de sequenciamento da era pré-capilar, uma raia por base, com a sequência lida de baixo para cima na escada de bandas.
À esquerda: Frederick Sanger, que idealizou os primeiros métodos práticos de leitura de proteínas e de DNA e recebeu um prêmio Nobel por cada um. À direita: uma autorradiografia de um gel de sequenciamento da era pré-capilar, uma raia por base, com a sequência lida de baixo para cima na escada de bandas.
Sequenciamento por terminação de cadeia. Uma base didesoxi encerra a cópia em cada posição onde é incorporada; os fragmentos, um por comprimento, são separados por tamanho e a cor de cada base terminal é lida em ordem.
Sequenciamento por terminação de cadeia. Uma base didesoxi encerra a cópia em cada posição onde é incorporada; os fragmentos, um por comprimento, são separados por tamanho e a cor de cada base terminal é lida em ordem.

Definição 4.2 (Sequenciamento massivamente paralelo)

Os instrumentos de segunda geração leem de milhões a bilhões de fragmentos ao mesmo tempo. No sequenciamento por síntese os fragmentos, com adaptadores ligados às suas extremidades, são fixados numa célula de fluxo de vidro e amplificados no lugar em aglomerados de moléculas idênticas; os aglomerados são então estendidos uma base por ciclo com nucleotídeos fluorescentes reversivelmente bloqueados, fotografados, desbloqueados e estendidos de novo, de modo que cada ciclo acrescenta uma base à leitura de cada aglomerado. As leituras têm 100 a 300bp100\text{ a }300\,\mathrm{bp}, em geral vindas das duas pontas de um fragmento (extremidades pareadas), com taxa de erro de cerca de 10310^{-3} por base, e uma corrida dá até 101210^{12} bases. Os instrumentos de terceira geração, de leituras longas, leem moléculas isoladas sem amplificação: observando uma polimerase incorporar nucleotídeos fluorescentes em tempo real, ou passando o DNA por um nanoporo proteico e registrando a corrente iônica, que cada sequência de bases modula a seu modo. Leituras de 10 a 100kb10\text{ a }100\,\mathrm{kb} e mais atravessam as repetições que as leituras curtas não vencem, a uma taxa bruta de erro maior que o consenso reduz.

À esquerda: uma célula de fluxo, a lâmina de vidro sobre a qual bilhões de aglomerados de DNA são crescidos e lidos uma base por ciclo. À direita: um sequenciador de nanoporo do tamanho de um bolso, lendo moléculas isoladas como variações de uma corrente iônica. À esquerda: uma célula de fluxo, a lâmina de vidro sobre a qual bilhões de aglomerados de DNA são crescidos e lidos uma base por ciclo. À direita: um sequenciador de nanoporo do tamanho de um bolso, lendo moléculas isoladas como variações de uma corrente iônica.
À esquerda: uma célula de fluxo, a lâmina de vidro sobre a qual bilhões de aglomerados de DNA são crescidos e lidos uma base por ciclo. À direita: um sequenciador de nanoporo do tamanho de um bolso, lendo moléculas isoladas como variações de uma corrente iônica.

Teorema 4.3 (Cobertura e lacunas num projeto de sequenciamento aleatório)

Sejam NN leituras de comprimento LL tomadas em posições aleatórias ao longo de um genoma de comprimento GG, e seja c=NL/Gc = NL/G a cobertura, o número médio de leituras que cobrem uma base. Então uma dada base é coberta por um número de leituras que é Poisson de média cc: a fração do genoma que fica sem sequenciar é

P(descoberto)=ec,P(\text{descoberto}) = e^{-c},

e, se duas leituras só são reconhecidas como sobrepostas quando compartilham ao menos TT bases, de modo que θ=T/L\theta = T/L, o número esperado de contigs (ilhas de leituras sobrepostas) é

contigs=Nec(1θ),\text{contigs} = N\,e^{-c(1-\theta)},

e seu comprimento médio é L(ec(1θ)1)/c+LθL\,\bigl(e^{c(1-\theta)} - 1\bigr)/c + L\theta, aproximadamente.

Demonstração. Os pontos de início das leituras caem ao acaso com densidade N/GN/G por base. Uma base é coberta pelas leituras que começam nas LL bases anteriores a ela; o número de inícios numa janela de comprimento LL é Poisson de média LN/G=cLN/G = c, e a probabilidade de nenhum é ece^{-c}. Uma leitura é a mais à direita de seu contig se nenhuma outra leitura começa nas LT=L(1θ)L - T = L(1-\theta) bases depois de seu próprio início (uma leitura que começasse mais tarde a sobreporia em menos de TT e não seria unida); essa probabilidade é ec(1θ)e^{-c(1-\theta)} e, como cada contig tem exatamente uma leitura mais à direita, o número esperado de contigs é Nec(1θ)N e^{-c(1-\theta)}. O comprimento médio do contig segue de GG dividido pelo número de contigs, corrigido pela fração não coberta.

Exemplo 4.4 (Quanto basta)

Com c=5c = 5 a fração não sequenciada é e5=0.7%e^{-5} = 0.7\,\% — para um genoma de 3.2Gb3.2\,\mathrm{Gb}, vinte milhões de bases em algumas dezenas de milhares de lacunas. Com c=10c = 10 ela é 4.5×1054.5\times 10^{-5}, 150kb150\,\mathrm{kb} no total. Os genomas humanos são sequenciados de rotina a c=30c = 30, não por causa das lacunas de cobertura (e301013e^{-30} \approx 10^{-13}), mas porque cada base precisa ser lida várias vezes em cada um dos dois cromossomos para que uma variante heterozigota seja chamada com confiança contra uma taxa de erro de 10310^{-3} por leitura. Os genomas bacterianos são sequenciados a c=50c = 50100100 pela mesma razão e porque é barato. A fórmula também mostra o que a cobertura não resolve: uma repetição mais longa que uma leitura é um lugar onde o grafo de sobreposições se ramifica, e nenhuma quantidade de leituras curtas a resolve. É para isso que servem as leituras longas.

As duas quantidades de Lander–Waterman contra a cobertura: a fração do genoma que nunca é lida cai como e-c, e o número de contigs (aqui escalonado por leitura) tem um pico em cobertura baixa e depois cai à medida que as ilhas se fundem.
As duas quantidades de Lander–Waterman contra a cobertura: a fração do genoma que nunca é lida cai como ece^{-c}, e o número de contigs (aqui escalonado por leitura) tem um pico em cobertura baixa e depois cai à medida que as ilhas se fundem.

4.2 Das leituras a um genoma

Definição 4.5 (Montagem e anotação)

A montagem reconstrói um genoma a partir de suas leituras por sobreposição: num grafo de sobreposições cada leitura é um nó unido às leituras que a sobrepõem; num grafo de de Bruijn, usado para bilhões de leituras curtas, cada kk-mero (subsequência de comprimento kk) é um nó e o genoma é um caminho por eles. Os dois são rompidos por repetições mais longas que a leitura, que dão caminhos ramificados. Os contigs são ordenados e orientados em scaffolds por leituras de extremidades pareadas e por informação de longo alcance (leituras longas, mapas ópticos, mapas de contato cromossômico), e os scaffolds são colocados nos cromossomos. A qualidade de uma montagem é resumida pelo N50: o comprimento de contig tal que metade das bases montadas está em contigs pelo menos tão longos. A anotação então localiza os genes: nas bactérias, fases de leitura abertas mais longas do que o acaso daria; nos eucariontes, combinando sinais de sequência (sítios de splicing, promotores, viés de códons), homologia com proteínas conhecidas e transcritos sequenciados a partir do RNA. O resultado, para uma espécie, é um genoma de referência ao qual toda leitura posterior daquela espécie é alinhada, em vez de montada de novo.

Método 4.6 (De uma amostra às variantes)

Para um estudo de ressequenciamento de um indivíduo contra uma referência: (1) extraia o DNA, fragmente-o em 300 a 500bp300\text{ a }500\,\mathrm{bp} e ligue adaptadores (a biblioteca); (2) sequencie até a cobertura necessária (30×\times para um genoma humano, 100×\times para um exoma, que captura os 1.5%1.5\,\% do genoma que codificam proteína); (3) alinhe cada leitura à referência, tolerando discordâncias; (4) em cada posição conte as bases nas leituras: uma posição em que cerca de metade das leituras discorda da referência é uma variante heterozigota, aquela em que quase todas discordam é homozigota, e aquela em que poucas discordam é erro; (5) filtre por profundidade, qualidade de base e equilíbrio entre as fitas; (6) anote cada variante com seu efeito sobre qualquer gene (sinônima, de sentido trocado, sem sentido, de splicing, de mudança de fase) e com sua frequência em bancos populacionais; (7) para um diagnóstico, guarde as variantes raras previstas como danosas em genes compatíveis com o fenótipo, e confirme por sequenciamento de Sanger.

4.3 Como são os genomas

Proposição 4.7 (Tamanho do genoma e número de genes)

Os tamanhos de genoma abrangem um fator de 10510^{5} entre os eucariontes — 12Mb12\,\mathrm{Mb} na levedura, 100Mb100\,\mathrm{Mb} no verme, 140Mb140\,\mathrm{Mb} na mosca, 3.2Gb3.2\,\mathrm{Gb} num humano, 16Gb16\,\mathrm{Gb} numa cebola, 130Gb130\,\mathrm{Gb} num peixe pulmonado, 150Gb150\,\mathrm{Gb} no lírio Paris japonica —, ao passo que os números de genes mal abrangem um fator de 1010: 60006000 na levedura, 2000020\,000 no verme, 1400014\,000 na mosca, cerca de 2000020\,000 genes codificadores de proteína num humano, 4000040\,000 no arroz. Este é o paradoxo do valor C: o tamanho do genoma não mede complexidade, e o número de genes tampouco. O que varia é o conteúdo não codificante — íntrons, elementos transponíveis, repetições satélites — e o número de proteínas que um genoma pode produzir é multiplicado muito além de sua contagem de genes pelo splicing alternativo (Capítulo 2) e pela regulação, que é onde a complexidade de um organismo está escrita, na maior parte. Os genomas bacterianos, em contraste, são compactos, e seu tamanho de fato acompanha o número de genes: cerca de um gene por quilobase, 88%88\,\% codificante em E. coli.

Exemplo 4.8 (O genoma humano por conteúdo)

Dos 3.2Gb3.2\,\mathrm{Gb}: éxons codificadores de proteína, 1.5%1.5\,\%; íntrons e regiões não traduzidas dos genes, cerca de 35%35\,\%; elementos transponíveis e seus fósseis, cerca de 45%45\,\% — retrotranspósons LINE-1 17%17\,\%, elementos Alu 10%10\,\% (mais de um milhão de cópias de uma sequência de 300bp300\,\mathrm{bp}), retrovírus endógenos 8%8\,\%; duplicações segmentares 5%5\,\%; repetições simples e satélites, entre elas os centrômeros, cerca de 5%5\,\%; o resto é sequência não codificante única, onde vivem os elementos regulatórios. Uns 100 a 200100\text{ a }200 genes ainda codificam uma maquinaria LINE-1 ativa, e inserções novas ocorrem cerca de uma vez a cada vinte nascimentos. Cerca de 8%8\,\% do genoma está sob seleção purificadora detectável — bem mais que os éxons — e a maior parte disso é regulatória.

O genoma humano por conteúdo, em escala. Os éxons codificadores de proteína (vermelho) são uma lasca; quase metade do genoma descende de elementos transponíveis.
O genoma humano por conteúdo, em escala. Os éxons codificadores de proteína (vermelho) são uma lasca; quase metade do genoma descende de elementos transponíveis.

Definição 4.9 (Genômica comparativa)

Genes de duas espécies descendentes de um mesmo gene do ancestral comum são ortólogos; genes de uma mesma espécie descendentes de uma duplicação são parálogos. Blocos de cromossomo em que a ordem dos genes se conserva entre espécies são sintênicos; a sintenia permite localizar um gene num genoma a partir de sua posição em outro e revela os rearranjos que separam dois cariótipos (cerca de 10001000 entre humano e camundongo). As sequências conservadas entre espécies distantes que não codificam proteína alguma — os elementos não codificantes conservados, alguns ultraconservados base a base ao longo de 200bp200\,\mathrm{bp} entre humano e peixe — são em sua maioria intensificadores de genes do desenvolvimento. As duplicações do genoma inteiro marcaram a história de várias linhagens: duas rodadas na origem dos vertebrados (os quatro agrupamentos Hox dos mamíferos contra o único dos invertebrados), uma no ancestral dos salmonídeos, uma na linhagem das leveduras, várias nas plantas com flor; os genes duplicados são em sua maioria perdidos ao longo de dezenas de milhões de anos, e os sobreviventes divergem em função.

Exemplo 4.10 (Humano e chimpanzé)

A sequência de cópia única alinhada difere entre humano e chimpanzé em 1.2%1.2\,\% das bases — uns 3535 milhões de substituições — e por inserções e deleções que juntas somam mais 3%3\,\% de cada genoma. Dois humanos diferem em cerca de uma base em mil, uns 4 a 54\text{ a }5 milhões de sítios, além de alguns milhares de variantes estruturais; dois chimpanzés, cuja população foi maior por mais tempo, diferem em bem mais. Uma criança carrega cerca de 7070 mutações novas ausentes nos dois pais, quatro quintos delas vindas do pai, e o número sobe cerca de duas por ano de idade paterna — a aritmética do Capítulo 3 aplicada às muitas divisões da espermatogênese.

4.4 Genomas e características

Definição 4.11 (Associação genômica ampla)

Um polimorfismo de nucleotídeo único (SNP) é uma posição em que duas bases ocorrem, cada uma em ao menos 1%1\,\% de uma população; cerca de dez milhões são comuns nos humanos. Um estudo de associação genômica ampla (GWAS) genotipa centenas de milhares de SNPs em milhares de pessoas com uma doença e em milhares sem ela, e pergunta, em cada SNP, se um alelo é mais frequente nos casos. Como se fazem um milhão de testes, um resultado só conta abaixo de um limiar de significância de cerca de 5×1085\times 10^{-8} (0.050.05 dividido pelo milhão de testes efetivamente independentes). Os SNPs associados marcam uma região, e não uma variante causal, já que alelos vizinhos viajam juntos (desequilíbrio de ligação) ao longo de dezenas de quilobases. Para a maioria das doenças comuns, cada alelo associado desloca o risco em poucos por cento e a maior parte deles está em sequência regulatória; seu efeito combinado, somado ao longo de milhares de SNPs como um escore poligênico, explica uma fração da herdabilidade e prevê o risco mais ou menos tão bem quanto a história familiar.

Observação 4.12 (O que a genômica entregou e o que não entregou)

O sequenciamento foi decisivo onde um único gene tem grande efeito: vários milhares de doenças mendelianas já têm seu gene, e sequenciar o exoma de uma criança com um distúrbio sem diagnóstico dá um diagnóstico em cerca de um terço dos casos. Os genomas de tumores revelam quais condutores um tumor carrega e quais fármacos podem funcionar (Capítulo 11); os genomas de patógenos rastreiam surtos linhagem por linhagem (Capítulo 12); os genomas antigos reescreveram a pré-história humana, mostrando que as pessoas de fora da África carregam cerca de 2%2\,\% de DNA neandertal. Para as doenças comuns — diabetes, doença cardíaca, esquizofrenia — a genômica entregou milhares de efeitos pequenos e poucos mecanismos, e a promessa de prever a partir do genoma de uma pessoa saudável continua modesta. O genoma é uma lista de peças; a biologia de como as peças interagem não se lê nele.

4.5 Exercícios

Exercício 4.1

Explique por que um didesoxinucleotídeo termina uma cadeia de DNA em crescimento, e por que uma reação de Sanger precisa conter as formas normal e didesoxi de cada nucleotídeo.

Solução

Solução de Exercício 4.1.

Um didesoxinucleotídeo não tem a hidroxila 3', de modo que nenhuma ligação fosfodiéster pode ser feita com o nucleotídeo seguinte e a cadeia para. Só com formas didesoxi, toda cadeia pararia na primeira posição; só com formas normais, nenhuma pararia. A mistura torna a terminação um evento aleatório em cada posição, de modo que os produtos formam uma escada completa, um comprimento para cada base do molde.

Exercício 4.2

Uma corrida produz 4×1084\times 10^{8} leituras pareadas de 2×150bp2\times 150\,\mathrm{bp}. Que cobertura isso dá de um genoma humano de 3.2Gb3.2\,\mathrm{Gb}? E de um genoma bacteriano de 5Mb5\,\mathrm{Mb}?

Solução

Solução de Exercício 4.2.

4×108×300bp=1.2×10114\times 10^{8}\times 300\,\mathrm{bp} = 1.2\times 10^{11} bases. Humano: 1.2×1011/3.2×10938×1.2\times 10^{11}/3.2\times 10^{9} \approx 38\times. Bactéria: 1.2×1011/5×106=24000×1.2\times 10^{11}/5\times 10^{6} = 24\,000\times.

Exercício 4.3

Defina contig, scaffold e N50. Uma montagem de 100Mb100\,\mathrm{Mb} tem dez contigs de 8Mb8\,\mathrm{Mb} e 20002000 de 10kb10\,\mathrm{kb}. Qual é seu N50?

Solução

Solução de Exercício 4.3.

Um contig é uma sequência contígua montada a partir de leituras sobrepostas; um scaffold é um conjunto ordenado e orientado de contigs com lacunas de tamanho estimado entre eles; o N50 é o comprimento de contig em que os contigs ordenados alcançam metade das bases montadas. Aqui só os dez contigs de 8Mb8\,\mathrm{Mb} somam 80Mb80\,\mathrm{Mb}, além do ponto médio de 50Mb50\,\mathrm{Mb} (o sétimo chega a 56Mb56\,\mathrm{Mb}): N50 =8Mb= 8\,\mathrm{Mb}.

Exercício 4.4

Enuncie o paradoxo do valor C com dois exemplos, e diga o que responde principalmente pelo DNA em excesso dos genomas grandes.

Solução

Solução de Exercício 4.4.

O tamanho do genoma não acompanha a complexidade do organismo: uma cebola tem cinco vezes o DNA de um humano, um peixe pulmonado quarenta vezes; a levedura e o verme diferem dez vezes em DNA com números de genes semelhantes. O excesso é não codificante: elementos transponíveis e seus restos, íntrons, repetições satélites.

Exercício 4.5 ★★

Usando o Teorema 4.3, determine a cobertura necessária para deixar no máximo uma base em um milhão sem sequenciar, e o número esperado de contigs de um genoma de 5Mb5\,\mathrm{Mb} lido a c=8c = 8 com leituras de 150bp150\,\mathrm{bp} e sobreposição mínima de 30bp30\,\mathrm{bp}.

Solução

Solução de Exercício 4.5.

ec=106e^{-c} = 10^{-6}c=6ln10=13.8c = 6\ln 10 = 13.8. Para c=8c = 8: N=cG/L=8×5×106/150267000N = cG/L = 8\times 5\times 10^{6}/150 \approx 267\,000 leituras, θ=30/150=0.2\theta = 30/150 = 0.2, contigs =Ne6.4=267000×0.00166440= N e^{-6.4} = 267\,000\times 0.00166 \approx 440.

Exercício 4.6 ★★

Uma variante heterozigota é coberta por 3030 leituras. Supondo que cada leitura mostre um dos alelos com probabilidade 1/21/2, qual é a probabilidade de menos de 88 leituras mostrarem o alelo variante (de modo que ele pudesse ser tomado por erro)? Use uma aproximação normal com média 1515 e desvio padrão 7.5\sqrt{7.5}. Por que 30×30\times é o padrão?

Solução

Solução de Exercício 4.6.

P(X<8)=P(X7)P(Z<(7.515)/2.74)=P(Z<2.74)0.003P(X < 8) = P(X \le 7) \approx P\bigl(Z < (7.5 - 15)/2.74\bigr) = P(Z < -2.74) \approx 0.003. A 30×30\times os dois alelos de um heterozigoto são quase sempre vistos muitas vezes, a cobertura é desigual (regiões ricas em GC recebem menos leituras, de modo que alguns sítios ficam com metade da média) e restam leituras bastantes para separar um alelo verdadeiro dos erros de 10310^{-3}.

Exercício 4.7 ★★

Um genoma tem uma repetição de 6kb6\,\mathrm{kb} presente em 500500 cópias. Explique por que uma montagem a partir de leituras de 150bp150\,\mathrm{bp} a colapsa, como fica o grafo resultante e que comprimento de leitura a resolveria.

Solução

Solução de Exercício 4.7.

Toda leitura de 150bp150\,\mathrm{bp} vinda de dentro da repetição é idêntica venha da cópia que vier, de modo que o montador constrói um único nó de 6kb6\,\mathrm{kb} com 500500 caminhos entrando e 500500 saindo; ele não tem como dizer qual entrada casa com qual saída, e a montagem se parte em 500500 lacunas, com a repetição presente uma única vez e com cobertura 500500 vezes a média. Leituras mais longas que a repetição mais flancos únicos dos dois lados — 8kb8\,\mathrm{kb} ou mais — atravessam cada cópia e a resolvem.

Exercício 4.8 ★★

Dois humanos diferem em uma base em mil. Quantas diferenças há em seus exomas (48Mb48\,\mathrm{Mb} de sequência codificadora)? Se dois terços das diferenças codificadoras são sinônimas ou benignas e o resto altera uma proteína, quantas variantes que alteram proteína uma pessoa carrega em relação a outra?

Solução

Solução de Exercício 4.8.

4.8×107/1000=480004.8\times 10^{7}/1000 = 48\,000 diferenças codificadoras; um terço, cerca de 1600016\,000, altera a proteína.

Exercício 4.9 ★★

Um GWAS testa 10610^{6} SNPs com limiar p<5×108p < 5\times 10^{-8}. Quantos falsos positivos se esperam se nenhum SNP estiver de fato associado? Um alelo de SNP eleva o risco de uma doença de frequência 2%2\,\% para 2.3%2.3\,\%. Explique por que um efeito desses é indetectável num estudo de mil pessoas e inútil para um indivíduo, mas pode ainda assim apontar para um mecanismo.

Solução

Solução de Exercício 4.9.

Falsos positivos esperados 106×5×108=0.0510^{6}\times 5\times 10^{-8} = 0.05. Um risco relativo de 1.151.15 sobre uma doença de 2%2\,\% muda alguns casos por mil; mil pessoas contêm cerca de vinte casos, longe demais do bastante para vê-lo (o poder cresce com o número de casos e com o quadrado do efeito). Para um indivíduo, 0.30.3 ponto percentual não significa nada. Mas o alelo marca um gene cuja mudança modesta de atividade altera o risco da doença — o gene, e sua via, podem ser um alvo farmacológico cuja inibição completa tenha grande efeito.

Exercício 4.10 ★★★

Os genomas bacterianos são cerca de 88%88\,\% codificantes; o genoma humano, 1.5%1.5\,\%. Dê três hipóteses — de genética de populações, estrutural e regulatória — para a diferença e, para cada uma, uma observação genômica que a apoie ou a enfraqueça.

Solução

Solução de Exercício 4.10.

De genética de populações: nas bactérias, com populações enormes, a seleção remove até inserções levemente custosas; nos mamíferos, com populações efetivas pequenas, a deriva deixa acumular DNA não codificante levemente deletério — apoiada pela correlação inversa entre tamanho do genoma e tamanho populacional ao longo das linhagens, enfraquecida pelas exceções. Estrutural: os genomas eucariontes são invadidos por transpósons que as bactérias, com um viés a favor da deleção e sem refúgio meiótico para elementos egoístas, expurgam — apoiada pela correlação do tamanho do genoma com o conteúdo de transpósons. Regulatória: um desenvolvimento complexo precisa de mais DNA regulatório — apoiada pelos elementos não codificantes conservados em torno dos genes do desenvolvimento, enfraquecida pelo fato de que só 8%8\,\% do genoma humano mostra alguma seleção, de modo que a maior parte do DNA não codificante não é regulatória.

Exercício 4.11 ★★★

Deduza a contagem de contigs de Lander–Waterman para leituras de dois comprimentos misturados: N1N_{1} leituras curtas de comprimento L1L_{1} e N2N_{2} leituras longas de comprimento L2L_{2}, com as sobreposições contadas com o mesmo mínimo TT. (Trate cada leitura como a mais à direita de seu contig se nenhuma leitura de qualquer dos tipos começa dentro de seu próprio comprimento menos TT.) Mostre que algumas poucas leituras longas reduzem a contagem de contigs mais do que o mesmo número de bases em leituras curtas.

Solução

Solução de Exercício 4.11.

Os inícios dos dois tipos caem com densidade total ρ=(N1+N2)/G\rho = (N_{1} + N_{2})/G. Uma leitura de comprimento LiL_{i} é a mais à direita de seu contig se nenhuma leitura de qualquer dos tipos começa nas LiTL_{i} - T bases após ela: probabilidade eρ(LiT)e^{-\rho(L_{i} - T)}. Logo, contigs =N1eρ(L1T)+N2eρ(L2T)= N_{1} e^{-\rho(L_{1} - T)} + N_{2} e^{-\rho(L_{2} - T)}. Uma leitura longa é a mais à direita com probabilidade exponencialmente menor que uma curta, e cada leitura longa também elimina a chance de uma lacuna ao longo de todo o seu comprimento; o mesmo número de bases em leituras curtas acrescenta muitos pontos de início, mas cada janela protegida é curta, e por isso as leituras longas vencem.

Exercício 4.12 ★★★

Argumenta-se que os quatro agrupamentos Hox dos mamíferos descendem de um só agrupamento por duas rodadas de duplicação do genoma inteiro na base dos vertebrados. Diga que padrão de parálogos pelo genoma, e que padrão nos genomas das lampreias e dos cordados invertebrados, essa hipótese prevê, e como se a distinguiria de duas duplicações independentes só do agrupamento.

Solução

Solução de Exercício 4.12.

Duas duplicações do genoma inteiro preveem que o padrão de quatro cópias seja genômico: quartetos de segmentos cromossômicos parálogos (paralogons) carregando as mesmas famílias gênicas na mesma ordem, com as duplicações datadas do mesmo momento para todas as famílias; um único agrupamento no anfioxo e em Ciona, que divergiram antes dos eventos; e nas lampreias, que divergiram por volta deles, um estado intermediário ou derivado de forma independente. Duplicações independentes só do agrupamento Hox preveem paralogons apenas para o Hox, vizinhos com histórias diferentes e datas de duplicação diferentes entre as famílias. Os paralogons genômicos e a datação compartilhada, como se observa, favorecem a duplicação do genoma inteiro.

4.6 Problema: dois genomas numa máquina

Problema 4.1

Problema de fim de semana — uma bactéria e um humano sequenciados na mesma corrida: as leituras repartidas, a cobertura e as lacunas calculadas, os contigs contados, as variantes heterozigotas chamadas contra a taxa de erro, o conteúdo do genoma humano pesado e um estudo de associação dimensionado, terminando na contagem de contigs em cobertura baixa, na cobertura que torna segura a chamada de uma variante e no número de mutações novas numa criança

Dados: uma corrida dá 6×1086\times 10^{8} leituras de 150bp150\,\mathrm{bp}. Um genoma bacteriano tem 4.6Mb4.6\,\mathrm{Mb}; o genoma humano, 3.2Gb3.2\,\mathrm{Gb} (haploide). Sobreposição mínima T=30bpT = 30\,\mathrm{bp}. Taxa de erro 10310^{-3} por base por leitura. Sequência codificadora humana 48Mb48\,\mathrm{Mb}; o genoma é 45%45\,\% derivado de transpósons, com 1.11.1 milhão de cópias Alu de 300bp300\,\mathrm{bp}. Dois humanos diferem em um sítio em 10001000. Taxa de mutação 1.2×1081.2\times 10^{-8} por base por geração.

Parte I — A bactéria.

  1. A bactéria recebe 0.2%0.2\,\% da corrida. Quantas leituras, e que cobertura?
  2. Que fração de seu genoma fica sem sequenciar? Quantas bases são essas?
  3. Calcule θ\theta e o número esperado de contigs.
  4. Um ensaio piloto anterior usou apenas 3000030\,000 leituras. Cobertura, fração não coberta e número de contigs?
  5. O genoma contém 77 cópias de um óperon de rRNA de 5kb5\,\mathrm{kb}. Explique o que acontece com elas na montagem e quantas pontas de contig só isso produz.
  6. A bactéria tem cerca de um gene por quilobase. Quantos genes e, se 88%88\,\% do genoma é codificante, qual é o comprimento médio de um gene?

Parte II — O humano.

  1. O resto da corrida vai para um genoma humano. Qual a cobertura do genoma diploide por cópia haploide (isto é, o total de bases dividido por 3.2Gb3.2\,\mathrm{Gb})?
  2. Num sítio heterozigoto cada um dos dois alelos é coberto por cerca de metade das leituras. Com a cobertura da questão 7, qual é o número esperado de leituras que mostram cada alelo?
  3. Um erro mostra uma base errada numa leitura com probabilidade 10310^{-3}. Num sítio homozigoto coberto por cc leituras, qual é o número esperado de leituras que mostram uma base errada qualquer em particular (103/310^{-3}/3 cada)? Por que uma regra “chame uma variante se ao menos 33 leituras e ao menos 20%20\,\% das leituras a mostrarem” rejeita os erros nessa cobertura?
  4. Quantos sítios heterozigotos um humano carrega (metade das diferenças entre dois genomas aleatórios está em cada um, grosso modo: tome um sítio em 15001500)? Quantos em sequência codificadora?
  5. As leituras são alinhadas a uma referência. Explique por que as leituras vindas de elementos Alu muitas vezes se alinham à cópia errada e que consequência isso tem para a chamada de variantes dentro deles.
  6. Uma criança é sequenciada junto com os dois pais. Quantas mutações novas você espera? Quantas leituras na criança, nessa cobertura, precisam mostrar uma variante ausente nos dois pais para que ela seja aceita, e por que a cobertura dos pais é tão importante quanto a da criança?
  7. Um laboratório clínico captura o exoma (48Mb48\,\mathrm{Mb}) e o sequencia a 100×100\times. Quantas leituras isso exige, e por que sai mais barato por paciente do que um genoma a 28×28\times, embora sua cobertura seja maior?

Parte III — O conteúdo de um genoma.

  1. Que fração do genoma humano é Alu, e que fração das leituras da questão 7 vem de elementos Alu?
  2. A referência tem 3.2Gb3.2\,\mathrm{Gb}, mas uma célula diploide contém 6.4Gb6.4\,\mathrm{Gb}; e uma cebola de 16Gb16\,\mathrm{Gb} tem cerca de 6000060\,000 genes. Qual é a fração codificante do genoma da cebola, se seus genes têm em média 1.5kb1.5\,\mathrm{kb} de sequência codificadora?
  3. Humano e chimpanzé diferem em 1.2%1.2\,\% das bases alinhadas. Quantas substituições são essas em 2.9Gb2.9\,\mathrm{Gb} de sequência alinhável? Repartidas igualmente entre as duas linhagens ao longo de 6.56.5 milhões de anos, que taxa de mutação por base por ano isso implica, e por geração de 2525 anos? Compare com a medida direta dada nos dados.
  4. Duas duplicações do genoma dos vertebrados deveriam dar até quatro cópias de cada gene ancestral. Os humanos têm cerca de 2000020\,000 genes e o cordado invertebrado Ciona cerca de 1600016\,000. Que fração das duplicatas se perdeu, sob a hipótese de que o ancestral tinha 1600016\,000?
  5. Explique por que o número de genes é uma medida ruim de complexidade do organismo, usando a contagem de splicing alternativo do Capítulo 2 como um argumento.
  6. 8%8\,\% do genoma está sob seleção purificadora, mas apenas 1.5%1.5\,\% codifica proteína. O que provavelmente é o resto, e como você testaria um elemento candidato?

Parte IV — Um estudo de associação.

  1. 10610^{6} SNPs são testados. Enuncie o limiar de Bonferroni para um erro por família de 0.050.05, e o número esperado de falsos positivos a p<105p < 10^{-5}.
  2. Uma doença tem prevalência de 1%1\,\%. Um alelo de risco de frequência 0.30.3 eleva as chances em 5%5\,\%. Calcule o risco da doença para um portador de duas cópias, de uma cópia e de nenhuma, tomando o risco do não portador como 0.9%0.9\,\%. (Multiplique as chances.)
  3. Duzentos alelos desses são encontrados. Explique o que é um escore poligênico e por que o escore de uma pessoa no 1%1\,\% mais alto pode corresponder a um risco várias vezes maior, embora cada alelo quase nada faça.
  4. Explique por que um SNP que alcança significância em geral não é a variante causal, e que experimento identificaria a causal na região.
  5. Um genoma antigo de um osso de 4000040\,000 anos é sequenciado a c=0.5c = 0.5. Que fração dele é lida? Por que isso ainda pode responder a perguntas sobre história populacional que um genoma moderno sozinho não responde?
  6. Resuma: o número de contigs da montagem piloto (questão 4), a cobertura por genoma haploide que dá cerca de 1515 leituras por alelo (questões 7–8) e o número de mutações novas numa criança (questão 12).
Solução

Solução de Problema 4.1.

1. 0.002×6×108=1.2×1060.002\times 6\times 10^{8} = 1.2\times 10^{6} leituras; c=1.2×106×150/4.6×10639c = 1.2\times 10^{6}\times 150/4.6\times 10^{6} \approx 39. 2. e391017e^{-39} \approx 10^{-17}: na prática, nenhuma base fica descoberta. 3. θ=0.2\theta = 0.2; contigs =1.2×106e310= 1.2\times 10^{6} e^{-31} \approx 0: um contig em teoria, com lacunas apenas nas repetições. 4. c=30000×150/4.6×106=0.98c = 30\,000\times 150/4.6\times 10^{6} = 0.98; fração não coberta e0.98=0.38e^{-0.98} = 0.38, cerca de 1.7Mb1.7\,\mathrm{Mb}; contigs =30000×e0.7813700= 30\,000 \times e^{-0.78} \approx 13\,700. 5. Os sete óperons dão leituras idênticas e colapsam num único contig de 5kb5\,\mathrm{kb}, ao qual chegam sete flancos esquerdos únicos e do qual saem sete flancos direitos cujo pareamento é desconhecido: 1414 pontas de contig, sete lacunas. 6. Cerca de 46004600 genes; sequência codificadora 0.88×4.6×106=4.0×1060.88\times 4.6\times 10^{6} = 4.0\times 10^{6} bp, gene médio de 880bp880\,\mathrm{bp}. 7. 0.998×6×108×150/3.2×10928×0.998\times 6\times 10^{8}\times 150/3.2\times 10^{9} \approx 28\times. 8. Cerca de 1414 leituras por alelo. 9. 28×103/30.00928\times 10^{-3}/3 \approx 0.009 leitura mostrando uma dada base errada — a chance de três ou mais é de cerca de 10710^{-7} — e 20%20\,\% de 2828 são 5.65.6 leituras; um erro não passa em nenhum dos dois testes, ao passo que um alelo heterozigoto verdadeiro é esperado em 1414. 10. 3.2×109/15002.1×1063.2\times 10^{9}/1500 \approx 2.1\times 10^{6} sítios heterozigotos; em sequência codificadora, 4.8×107/1500320004.8\times 10^{7}/1500 \approx 32\,000. 11. Uma leitura de 150bp150\,\mathrm{bp} vinda de um Alu casa quase igualmente bem com muitas das 1.11.1 milhão de cópias, e por isso é colocada na cópia errada ou recebe baixa confiança de mapeamento. As diferenças entre as cópias passam então a parecer variantes heterozigotas, e as variantes verdadeiras ficam escondidas entre elas: as chamadas de variantes dentro de Alu costumam ser filtradas, e os elementos são pontos cegos do sequenciamento de leituras curtas. 12. 1.2×108×6.4×109771.2\times 10^{-8}\times 6.4\times 10^{9} \approx 77 mutações novas. Cerca de 1414 leituras deveriam mostrar a variante na criança; mas, se o sítio de um dos pais é coberto por apenas cinco leituras, um alelo heterozigoto passa despercebido com probabilidade 25=3%2^{-5} = 3\,\% e uma variante herdada é chamada de nova — por isso os pais precisam ser sequenciados tão profundamente quanto a criança. 13. 4.8×107×100/150=3.2×1074.8\times 10^{7}\times 100/150 = 3.2\times 10^{7} leituras, vinte vezes menos que o genoma: o custo de sequenciamento cai vinte vezes, mais do que o custo da etapa de captura. 14. 1.1×106×300=3.3×1081.1\times 10^{6}\times 300 = 3.3\times 10^{8} bp, cerca de 10%10\,\% do genoma; 10%10\,\% das leituras, uns 6×1076\times 10^{7}. 15. 60000×1500=9×10760\,000\times 1500 = 9\times 10^{7} bp; 9×107/1.6×1010=0.56%9\times 10^{7}/1.6\times 10^{10} = 0.56\,\%. 16. 0.012×2.9×109=3.5×1070.012\times 2.9\times 10^{9} = 3.5\times 10^{7} substituições, 1.7×1071.7\times 10^{7} por linhagem; taxa 1.7×107/(2.9×109×6.5×106)=9×10101.7\times 10^{7}/(2.9\times 10^{9}\times 6.5\times 10^{6}) = 9\times 10^{-10} por base por ano, 2.3×1082.3\times 10^{-8} por geração de 25 anos — cerca do dobro da taxa medida em genealogias, 1.2×1081.2\times 10^{-8}, uma discrepância conhecida que sugere gerações mais longas no passado ou uma separação mais antiga. 17. Quatro cópias de 1600016\,000 dariam 6400064\,000; 2000020\,000 permanecem, de modo que, das 4800048\,000 cópias extras, só 40004000 sobrevivem: 92%92\,\% das duplicatas se perderam. 18. O verme e o humano têm o mesmo número de genes; a complexidade está em como eles são usados — o splicing alternativo multiplica um gene em milhares de proteínas (3801638\,016 no Dscam), a regulação combina fatores de transcrição e intensificadores de maneiras específicas de cada tipo celular, os RNAs não codificantes acrescentam camadas, e as proteínas interagem em redes. 19. Elementos regulatórios (intensificadores, promotores, isolantes), genes de RNA não codificante, sinais de splicing e de localização, origens e sequências estruturais. Teste um candidato a intensificador colocando-o antes de um gene repórter num embrião transgênico e vendo onde o repórter é expresso, depois deletando o elemento no genoma com CRISPR e medindo os genes vizinhos. 20. 0.05/106=5×1080.05/10^{6} = 5\times 10^{-8}; a p<105p < 10^{-5}, 106×105=1010^{6} \times 10^{-5} = 10 falsos positivos esperados. 21. Chances do não portador 0.009/0.991=0.009080.009/0.991 = 0.00908; com uma cópia, chances 0.009540.00954, risco 0.945%0.945\,\%; com duas cópias, chances 0.010010.01001, risco 0.99%0.99\,\%. 22. O escore soma, sobre os 200200 alelos, o número de cópias de risco que a pessoa carrega, ponderado pelo logaritmo da razão de chances de cada alelo. A contagem tem média 200×2×0.3=120200\times 2\times 0.3 = 120 e desvio padrão 200×2×0.3×0.79\sqrt{200\times 2\times 0.3\times 0.7} \approx 9; o 1%1\,\% mais alto carrega cerca de 2121 alelos acima da média, e 1.05212.81.05^{21} \approx 2.8: quase o triplo das chances de uma pessoa média, a partir de alelos que individualmente mudam o risco em 5%5\,\%. 23. Os alelos dentro de um bloco de dezenas de quilobases são herdados juntos (desequilíbrio de ligação), de modo que qualquer um deles mostra a mesma associação; o SNP genotipado é apenas o que estava no arranjo. Para achar a variante causal: sequencie a região em casos e controles, estreite o conjunto estatisticamente e depois teste cada candidata — ensaios com repórter para a atividade intensificadora de cada alelo, edição de cada alelo em células com medida da expressão dos genes vizinhos, colocalização com sinais de loco de característica quantitativa de expressão. 24. 1e0.5=39%1 - e^{-0.5} = 39\,\% do genoma é lido. Ele dá uma amostra direta de uma população num momento conhecido do passado — frequências alélicas antes de migrações e mesclas posteriores, o comprimento dos segmentos neandertais (longos, porque poucas gerações de recombinação os haviam quebrado) e daí uma data para a mescla — coisas que os genomas modernos só conseguem inferir por modelos. 25. Cerca de 1370013\,700 contigs no piloto; 28×28\times por genoma haploide, cerca de 1414 leituras por alelo; umas 7777 mutações novas numa criança.

Termos definidos neste capítulo

Ver todos os 479 termos do glossário