Biology · Buku 5 · Bachelor Year 3

Biologi Universitas — Tahun 3

Biologi Universitas — Tahun 3 · Bachelor Year 3

4Genomika dan Pengurutan

Genom lengkap pertama sebuah organisme yang hidup bebas, yaitu 1.8Mb1.8\,\mathrm{Mb} milik sebuah bakteri, diterbitkan pada tahun 1995 sesudah setahun kerja sebuah tim beranggota empat puluh orang. Genom manusia, 3.23.2 miliar pasangan basa, menghabiskan tiga belas tahun kerja sebuah konsorsium internasional dan kira-kira tiga miliar dolar, lalu dinyatakan rampung pada tahun 2003. Kini sebuah mesin meja membaca genom manusia dalam semalam dengan biaya beberapa ratus dolar, sebuah rumah sakit mengurutkan tumor seorang pasien untuk memilih obat, dan sebuah museum mengekstraksi lalu membaca genom sepotong tulang berumur empat puluh ribu tahun. Teknologi yang memungkinkan semua itu, matematika yang mengubah jutaan bacaan pendek menjadi sebuah genom, dan apa yang diajarkan genom yang telah rampung tentang ukuran, isi, serta sejarah DNA kita adalah pokok bab ini. Bab sesudahnya membahas algoritma yang membandingkan urutannya begitu urutan itu ada di tangan.

4.1 Membaca DNA

Definisi 4.1 (Pengurutan lewat penghentian rantai)

Pengurutan Sanger menyalin cetakan beruntai tunggal mulai dari sebuah primer dengan DNA polimerase, dengan kehadiran keempat nukleotida normal dan sedikit dideoksinukleotida, yang tidak memiliki hidroksil 3' sehingga menghentikan rantainya di mana pun ia disisipkan. Tiap dideoksinukleotida mengusung zat warna berpendar yang berbeda. Hasilnya berupa campuran fragmen, satu fragmen bagi tiap kedudukan cetakannya, yang masing-masing berakhir pada basa yang jati dirinya diketahui; setelah dipisahkan menurut ukurannya di dalam kapiler gel, fragmen itu melewati detektor berurutan menurut panjangnya, dan deretan warnanya adalah urutan cetakannya. Sekali jalan terbaca 700 sampai 900bp700\text{ sampai }900\,\mathrm{bp} dengan laju galat di bawah 10310^{-3}; cara ini tetap dipakai untuk memastikan sebuah konstruk atau satu gen.

Bukti eksperimental. Sanger, Nicklen, dan Coulson menerbitkan metodenya pada tahun 1977 lalu memakainya pada tahun itu juga untuk membaca 5386bp5386\,\mathrm{bp} fag ϕ\phiX174 — genom DNA lengkap yang pertama — dan pada tahun 1981 membaca 16569bp16\,569\,\mathrm{bp} mitokondria manusia. Fleischmann dan rekan (1995) membaca 1.83Mb1.83\,\mathrm{Mb} Haemophilus influenzae dengan memecah seluruh genomnya menjadi fragmen acak, mengurutkan 2400024\,000 di antaranya, lalu merakit bacaannya dengan komputer — strategi senapan seluruh genom yang diperbesar setiap proyek berikutnya.

Kiri: Frederick Sanger, yang merancang metode praktis pertama untuk membaca protein dan DNA serta menerima hadiah Nobel untuk masing-masing. Kanan: autoradiograf sebuah gel pengurutan dari zaman sebelum kapiler, satu jalur tiap basa, urutannya dibaca ke atas dari tangga pitanya. Kiri: Frederick Sanger, yang merancang metode praktis pertama untuk membaca protein dan DNA serta menerima hadiah Nobel untuk masing-masing. Kanan: autoradiograf sebuah gel pengurutan dari zaman sebelum kapiler, satu jalur tiap basa, urutannya dibaca ke atas dari tangga pitanya.
Kiri: Frederick Sanger, yang merancang metode praktis pertama untuk membaca protein dan DNA serta menerima hadiah Nobel untuk masing-masing. Kanan: autoradiograf sebuah gel pengurutan dari zaman sebelum kapiler, satu jalur tiap basa, urutannya dibaca ke atas dari tangga pitanya.
Pengurutan lewat penghentian rantai. Sebuah basa dideoksi mengakhiri salinannya pada tiap kedudukan tempat ia disisipkan; fragmennya, satu tiap panjang, dipisahkan menurut ukuran, lalu warna tiap basa ujungnya dibaca berurutan.
Pengurutan lewat penghentian rantai. Sebuah basa dideoksi mengakhiri salinannya pada tiap kedudukan tempat ia disisipkan; fragmennya, satu tiap panjang, dipisahkan menurut ukuran, lalu warna tiap basa ujungnya dibaca berurutan.

Definisi 4.2 (Pengurutan paralel besar-besaran)

Instrumen generasi kedua membaca jutaan sampai miliaran fragmen sekaligus. Pada pengurutan lewat sintesis, fragmennya, yang ujungnya telah diligasi dengan adaptor, diikatkan pada sel alir kaca lalu diperbanyak di tempat menjadi gugusan molekul yang identik; gugusan itu lalu dipanjangkan satu basa tiap daur dengan nukleotida berpendar yang terblokir secara berbalik, dicitra, dibuka bloknya, lalu dipanjangkan lagi, sehingga tiap daur menambahkan satu basa pada bacaan setiap gugusan. Bacaannya sepanjang 100 sampai 300bp100\text{ sampai }300\,\mathrm{bp}, biasanya dari kedua ujung sebuah fragmen (ujung berpasangan), dengan laju galat kira-kira 10310^{-3} tiap basa, dan sekali jalan menghasilkan sampai 101210^{12} basa. Instrumen bacaan panjang generasi ketiga membaca molekul tunggal tanpa perbanyakan: dengan mengamati satu polimerase menyisipkan nukleotida berpendar secara waktu nyata, atau dengan menyusupkan DNA-nya melalui nanopori protein lalu merekam arus ionnya, yang dimodulasi tiap urutan basa dengan caranya sendiri. Bacaan sepanjang 10 sampai 100kb10\text{ sampai }100\,\mathrm{kb} dan lebih melintasi urutan berulang yang tak terjangkau bacaan pendek, dengan laju galat mentah yang lebih tinggi tetapi dikurangi oleh konsensus.

Kiri: sebuah sel alir, yaitu kaca preparat tempat miliaran gugusan DNA ditumbuhkan lalu dibaca satu basa tiap daur. Kanan: sebuah pengurut nanopori sebesar saku yang membaca molekul tunggal sebagai perubahan arus ion. Kiri: sebuah sel alir, yaitu kaca preparat tempat miliaran gugusan DNA ditumbuhkan lalu dibaca satu basa tiap daur. Kanan: sebuah pengurut nanopori sebesar saku yang membaca molekul tunggal sebagai perubahan arus ion.
Kiri: sebuah sel alir, yaitu kaca preparat tempat miliaran gugusan DNA ditumbuhkan lalu dibaca satu basa tiap daur. Kanan: sebuah pengurut nanopori sebesar saku yang membaca molekul tunggal sebagai perubahan arus ion.

Teorema 4.3 (Cakupan dan celah dalam proyek senapan)

Misalkan NN bacaan sepanjang LL diambil pada kedudukan acak sepanjang genom sepanjang GG, dan misalkan c=NL/Gc = NL/G adalah cakupan, yakni rata-rata cacah bacaan yang meliputi satu basa. Maka sebuah basa tertentu diliputi oleh cacah bacaan yang tersebar Poisson dengan rata-rata cc: bagian genom yang tak terurutkan adalah

P(tak tercakup)=ec,P(\text{tak tercakup}) = e^{-c},

dan bila dua bacaan diakui bertindihan hanya ketika keduanya berbagi sedikitnya TT basa, sehingga θ=T/L\theta = T/L, harapan cacah kontig (pulau bacaan yang bertindihan) adalah

kontig=Nec(1θ),\text{kontig} = N\,e^{-c(1-\theta)},

dan panjang rata-ratanya kira-kira L(ec(1θ)1)/c+LθL\,\bigl(e^{c(1-\theta)} - 1\bigr)/c + L\theta.

Bukti. Titik awal bacaan jatuh secara acak dengan kerapatan N/GN/G tiap basa. Sebuah basa diliputi bacaan yang mulai pada LL basa sebelumnya; cacah awalan di dalam jendela sepanjang LL tersebar Poisson dengan rata-rata LN/G=cLN/G = c, dan peluang tanpa satu pun awalan adalah ece^{-c}. Sebuah bacaan menjadi bacaan paling kanan pada kontignya bila tak ada bacaan lain yang mulai di dalam LT=L(1θ)L - T = L(1-\theta) basa sesudah awalannya sendiri (bacaan yang mulai lebih lambat akan bertindihan dengannya kurang dari TT sehingga tak disambungkan); peluangnya adalah ec(1θ)e^{-c(1-\theta)}, dan karena tiap kontig memiliki tepat satu bacaan paling kanan, harapan cacah kontignya adalah Nec(1θ)N e^{-c(1-\theta)}. Panjang kontig rata-ratanya menyusul dari GG dibagi cacah kontignya, dengan koreksi bagi bagian yang tak terliput.

Contoh 4.4 (Berapa yang memadai)

Pada c=5c = 5 bagian yang tak terurutkan adalah e5=0.7%e^{-5} = 0.7\,\% — bagi genom 3.2Gb3.2\,\mathrm{Gb}, dua puluh juta basa di dalam beberapa puluh ribu celah. Pada c=10c = 10 bagian itu 4.5×1054.5\times 10^{-5}, seluruhnya 150kb150\,\mathrm{kb}. Genom manusia lazimnya diurutkan pada c=30c = 30 bukan karena celah cakupannya (e301013e^{-30} \approx 10^{-13}) melainkan karena tiap basa harus dibaca beberapa kali pada masing-masing dari kedua kromosomnya agar varian heterozigot dapat dipanggil dengan yakin melawan laju galat 10310^{-3} tiap bacaan. Genom bakteri diurutkan pada c=50c = 50100100 karena alasan yang sama dan karena biayanya murah. Rumusnya juga memperlihatkan apa yang tak dapat diperbaiki cakupan: urutan berulang yang lebih panjang daripada sebuah bacaan adalah tempat graf pertindihannya bercabang, dan sebanyak apa pun bacaan pendek tak dapat menguraikannya. Untuk itulah bacaan panjang ada.

Kedua besaran Lander–Waterman terhadap cakupan: bagian genom yang tak pernah terbaca turun sebagai e-c, dan cacah kontig (di sini diskalakan tiap bacaan) memuncak pada cakupan rendah lalu turun seiring pulaunya menyatu.
Kedua besaran Lander–Waterman terhadap cakupan: bagian genom yang tak pernah terbaca turun sebagai ece^{-c}, dan cacah kontig (di sini diskalakan tiap bacaan) memuncak pada cakupan rendah lalu turun seiring pulaunya menyatu.

4.2 Dari bacaan menjadi genom

Definisi 4.5 (Perakitan dan anotasi)

Perakitan menyusun ulang sebuah genom dari bacaannya lewat pertindihan: pada graf pertindihan tiap bacaan menjadi simpul yang terhubung dengan bacaan yang bertindihan dengannya; pada graf de Bruijn, yang dipakai bagi miliaran bacaan pendek, tiap kk-mer (suburutan sepanjang kk) menjadi simpul dan genomnya adalah sebuah lintasan yang melewatinya. Keduanya terpatahkan oleh urutan berulang yang lebih panjang daripada bacaannya, yang memberi lintasan bercabang. Kontignya diurutkan dan diorientasikan menjadi perancah dengan bantuan bacaan berujung berpasangan serta keterangan jarak jauh (bacaan panjang, peta optis, peta sentuhan kromosom), lalu perancahnya ditempatkan pada kromosom. Mutu perakitannya diringkaskan oleh N50: yaitu panjang kontig yang membuat separuh basa yang terakit berada pada kontig yang sedikitnya sepanjang itu. Anotasi lalu mencari gennya: pada bakteri, kerangka baca terbuka yang lebih panjang daripada kebetulan; pada eukariot, dengan menggabungkan isyarat urutan (tapak sambung, promotor, bias kodon), homologi dengan protein yang telah dikenal, dan transkrip yang diurutkan dari RNA. Hasilnya, bagi sebuah spesies, adalah genom acuan yang kepadanya setiap bacaan berikutnya dari spesies itu disejajarkan alih-alih dirakit dari awal.

Metode 4.6 (Dari sebuah contoh menjadi varian)

Untuk kajian pengurutan ulang seorang individu terhadap sebuah acuan: (1) ekstraksilah DNA-nya, pecahlah menjadi 300 sampai 500bp300\text{ sampai }500\,\mathrm{bp}, ligasikanlah adaptor (pustakanya); (2) urutkan sampai cakupan yang diperlukan (30×\times bagi genom manusia, 100×\times bagi eksom, yang menangkap 1.5%1.5\,\% genom yang menyandikan protein); (3) sejajarkanlah tiap bacaan dengan acuannya, sambil membolehkan ketakcocokan; (4) pada tiap kedudukan hitunglah basa di dalam bacaannya: kedudukan yang kira-kira separuh bacaannya tidak sesuai dengan acuan adalah varian heterozigot, yang hampir semuanya tidak sesuai adalah varian homozigot, yang hanya beberapa tidak sesuai adalah galat; (5) saringlah menurut kedalaman, mutu basa, dan imbangan untainya; (6) anotasilah tiap varian dengan pengaruhnya pada gen mana pun (sinonim, salah arti, tak bermakna, sambung, geser kerangka) serta dengan frekuensinya di dalam pangkalan data populasi; (7) untuk sebuah diagnosis, simpanlah varian langka yang diramalkan merusak pada gen yang selaras dengan fenotipenya, lalu pastikanlah dengan pengurutan Sanger.

4.3 Rupa sebuah genom

Proposisi 4.7 (Ukuran genom dan cacah gen)

Ukuran genom terentang sampai faktor 10510^{5} di antara eukariot — 12Mb12\,\mathrm{Mb} bagi khamir, 100Mb100\,\mathrm{Mb} bagi cacing, 140Mb140\,\mathrm{Mb} bagi lalat, 3.2Gb3.2\,\mathrm{Gb} bagi manusia, 16Gb16\,\mathrm{Gb} bagi bawang, 130Gb130\,\mathrm{Gb} bagi ikan paru, 150Gb150\,\mathrm{Gb} bagi bakung Paris japonica — sedangkan cacah gennya nyaris hanya terentang sampai faktor 1010: 60006000 pada khamir, 2000020\,000 pada cacing, 1400014\,000 pada lalat, sekitar 2000020\,000 gen penyandi protein pada manusia, 4000040\,000 pada padi. Inilah paradoks nilai C: ukuran genom tidak mengukur kerumitan, dan cacah gen pun tidak. Yang berbeda-beda adalah isi tak penyandinya — intron, unsur yang dapat berpindah, ulangan satelit — dan cacah protein yang dapat dihasilkan sebuah genom dikalikan jauh melampaui cacah gennya oleh penyambungan alternatif (Bab 2) dan oleh pengaturan, dan di situlah kerumitan sebuah organisme sebagian besar tertulis. Sebaliknya genom bakteri bersifat padat dan ukurannya memang mengikuti cacah gennya: kira-kira satu gen tiap kilobasa, 88%88\,\% penyandi pada E. coli.

Contoh 4.8 (Genom manusia menurut isinya)

Dari 3.2Gb3.2\,\mathrm{Gb}-nya: ekson penyandi protein, 1.5%1.5\,\%; intron dan daerah tak tertranslasi gennya, kira-kira 35%35\,\%; unsur yang dapat berpindah beserta fosilnya, kira-kira 45%45\,\% — retrotransposon LINE-1 17%17\,\%, unsur Alu 10%10\,\% (lebih dari sejuta salinan urutan sepanjang 300bp300\,\mathrm{bp}), retrovirus endogen 8%8\,\%; penggandaan bersegmen 5%5\,\%; ulangan sederhana dan satelit, termasuk sentromernya, kira-kira 5%5\,\%; sisanya urutan tak penyandi yang tunggal, tempat unsur pengaturnya berada. Sekitar 100 sampai 200100\text{ sampai }200 gen masih menyandikan permesinan LINE-1 yang aktif, dan sisipan baru terjadi kira-kira sekali tiap dua puluh kelahiran. Sekitar 8%8\,\% genomnya berada di bawah seleksi pemurni yang terdeteksi — jauh lebih banyak daripada eksonnya — dan sebagian besar di antaranya bersifat mengatur.

Genom manusia menurut isinya, sesuai skala. Ekson penyandi protein (merah) hanya sekeping tipis; hampir separuh genomnya berasal dari unsur yang dapat berpindah.
Genom manusia menurut isinya, sesuai skala. Ekson penyandi protein (merah) hanya sekeping tipis; hampir separuh genomnya berasal dari unsur yang dapat berpindah.

Definisi 4.9 (Genomika perbandingan)

Gen pada dua spesies yang berasal dari satu gen pada moyang bersamanya disebut ortolog; gen di dalam satu spesies yang berasal dari sebuah penggandaan disebut paralog. Blok kromosom yang urutan gennya lestari antarspesies bersifat sintenik; sinteni memungkinkan sebuah gen ditemukan pada satu genom dari kedudukannya pada genom yang lain dan menyingkapkan penataan ulang yang memisahkan dua kariotipe (kira-kira 10001000 penataan ulang antara manusia dan mencit). Urutan yang lestari antarspesies yang berjauhan tetapi tidak menyandikan protein — unsur tak penyandi yang lestari, sebagian lestari sampai ke basanya sepanjang lebih dari 200bp200\,\mathrm{bp} antara manusia dan ikan — sebagian besar merupakan penguat gen perkembangan. Penggandaan seluruh genom telah menandai sejarah beberapa garis keturunan: dua putaran pada asal mula vertebrata (empat gugus Hox mamalia lawan satu gugus invertebrata), satu putaran pada moyang salmon, satu pada garis keturunan khamir, beberapa pada tumbuhan berbunga; gen gandanya sebagian besar hilang sepanjang puluhan juta tahun, dan yang bertahan menyimpang fungsinya.

Contoh 4.10 (Manusia dan simpanse)

Urutan bersalinan tunggal yang disejajarkan berbeda antara manusia dan simpanse pada 1.2%1.2\,\% basanya — sekitar 3535 juta substitusi — dan berbeda oleh sisipan serta delesi yang seluruhnya mencapai 3%3\,\% lagi dari tiap genom. Dua orang manusia berbeda pada kira-kira satu basa tiap seribu, sekitar 4 sampai 54\text{ sampai }5 juta tapak, ditambah beberapa ribu varian struktural; dua ekor simpanse, yang populasinya lebih besar sejak lebih lama, berbeda agak lebih banyak. Seorang anak mengusung sekitar 7070 mutasi baru yang tak dimiliki kedua tetuanya, empat perlimanya dari ayahnya, dan cacahnya naik kira-kira dua tiap tahun umur ayahnya — aritmetika Bab 3 yang diterapkan pada banyaknya pembelahan spermatogenesis.

4.4 Genom dan sifat

Definisi 4.11 (Asosiasi seluruh genom)

Sebuah polimorfisme nukleotida tunggal (SNP) adalah kedudukan yang dua basanya masing-masing muncul pada sedikitnya 1%1\,\% populasi; sekitar sepuluh juta di antaranya lazim pada manusia. Sebuah studi asosiasi seluruh genom (GWAS) menggenotipe ratusan ribu SNP pada ribuan orang berpenyakit dan ribuan orang tanpa penyakit itu, lalu bertanya pada tiap SNP apakah salah satu alelnya lebih sering pada kelompok kasusnya. Karena sejuta uji dilakukan, sebuah hasil baru berarti bila berada di bawah ambang kebermaknaan sekitar 5×1085\times 10^{-8} (0.050.05 dibagi sejuta uji yang secara efektif saling bebas). SNP yang berasosiasi menandai sebuah daerah, bukan varian penyebabnya, karena alel yang bertetangga berjalan bersama (ketakseimbangan pautan) sepanjang puluhan kilobasa. Bagi sebagian besar penyakit yang lazim, alel yang berasosiasi itu masing-masing menggeser risiko beberapa persen dan sebagian besar terletak pada urutan pengatur; pengaruh gabungannya, yang dijumlahkan atas ribuan SNP sebagai skor poligenik, menjelaskan sebagian kewarisannya dan meramalkan risiko kira-kira sebaik riwayat keluarga.

Catatan 4.12 (Apa yang telah dan belum diberikan genomika)

Pengurutan telah menentukan di tempat sebuah gen tunggal berpengaruh besar: beberapa ribu penyakit Mendel telah diketahui gennya, dan mengurutkan eksom seorang anak berkelainan yang belum terdiagnosis memberi diagnosis pada kira-kira sepertiga kasusnya. Genom kanker menyingkapkan pemacu mana yang diusung sebuah tumor dan obat mana yang mungkin berhasil (Bab 11); genom patogen melacak wabah galur demi galur (Bab 12); genom purba telah menulis ulang prasejarah manusia, dan memperlihatkan bahwa orang di luar Afrika mengusung sekitar 2%2\,\% DNA Neanderthal. Bagi penyakit yang lazim — diabetes, penyakit jantung, skizofrenia — genomika telah memberi ribuan pengaruh kecil dan sedikit mekanisme, dan janji peramalan dari genom seorang yang sehat masih sederhana. Genom adalah daftar suku cadang; biologi tentang bagaimana suku cadang itu berinteraksi tidak terbaca dari situ.

4.5 Latihan

Latihan 4.1

Jelaskanlah mengapa sebuah dideoksinukleotida menghentikan rantai DNA yang sedang tumbuh, dan mengapa sebuah reaksi Sanger harus memuat bentuk normal sekaligus bentuk dideoksi tiap nukleotidanya.

Solusi

Solusi Latihan 4.1.

Sebuah dideoksinukleotida tidak memiliki hidroksil 3', sehingga tak ada ikatan fosfodiester yang dapat dibuat ke nukleotida berikutnya dan rantainya berhenti. Dengan hanya bentuk dideoksi setiap rantai akan berhenti pada kedudukan pertama; dengan hanya bentuk normal tak satu pun akan berhenti. Campurannya menjadikan penghentian itu peristiwa acak pada tiap kedudukan, sehingga hasilnya membentuk tangga yang lengkap, satu panjang tiap basa cetakannya.

Latihan 4.2

Sekali jalan menghasilkan 4×1084\times 10^{8} bacaan berpasangan sepanjang 2×150bp2\times 150\,\mathrm{bp}. Berapa cakupan yang diberikannya bagi genom manusia 3.2Gb3.2\,\mathrm{Gb}? Bagi genom bakteri 5Mb5\,\mathrm{Mb}?

Solusi

Solusi Latihan 4.2.

4×108×300bp=1.2×10114\times 10^{8}\times 300\,\mathrm{bp} = 1.2\times 10^{11} basa. Manusia: 1.2×1011/3.2×10938×1.2\times 10^{11}/3.2\times 10^{9} \approx 38\times. Bakteri: 1.2×1011/5×106=24000×1.2\times 10^{11}/5\times 10^{6} = 24\,000\times.

Latihan 4.3

Definisikanlah kontig, perancah, dan N50. Sebuah perakitan sepanjang 100Mb100\,\mathrm{Mb} memiliki sepuluh kontig 8Mb8\,\mathrm{Mb} dan 20002000 kontig 10kb10\,\mathrm{kb}. Berapa N50-nya?

Solusi

Solusi Latihan 4.3.

Sebuah kontig adalah urutan bersinambung yang dirakit dari bacaan yang bertindihan; sebuah perancah adalah himpunan kontig yang terurut dan terorientasi dengan celah yang ukurannya ditaksir di antaranya; N50 adalah panjang kontig ketika kontig yang telah diurutkan mencapai separuh basa yang terakit. Di sini kesepuluh kontig 8Mb8\,\mathrm{Mb} saja sudah memuat 80Mb80\,\mathrm{Mb}, melewati titik tengah 50Mb50\,\mathrm{Mb} (kontig ketujuh mencapai 56Mb56\,\mathrm{Mb}): N50 =8Mb= 8\,\mathrm{Mb}.

Latihan 4.4

Nyatakanlah paradoks nilai C dengan dua contoh, lalu katakan apa yang sebagian besar menjelaskan kelebihan DNA genom yang besar.

Solusi

Solusi Latihan 4.4.

Ukuran genom tidak mengikuti kerumitan organismenya: bawang memiliki lima kali DNA manusia, ikan paru empat puluh kali; khamir dan cacing berbeda sepuluh kali lipat DNA-nya dengan cacah gen yang serupa. Kelebihannya bersifat tak penyandi: unsur yang dapat berpindah beserta sisanya, intron, ulangan satelit.

Latihan 4.5 ★★

Dengan Teorema 4.3, carilah cakupan yang dibutuhkan agar paling banyak satu basa dari sejuta tak terurutkan, dan harapan cacah kontig bagi genom 5Mb5\,\mathrm{Mb} yang dibaca pada c=8c = 8 dengan bacaan 150bp150\,\mathrm{bp} dan pertindihan minimum 30bp30\,\mathrm{bp}.

Solusi

Solusi Latihan 4.5.

ec=106e^{-c} = 10^{-6} memberi c=6ln10=13.8c = 6\ln 10 = 13.8. Untuk c=8c = 8: N=cG/L=8×5×106/150267000N = cG/L = 8\times 5\times 10^{6}/150 \approx 267\,000 bacaan, θ=30/150=0.2\theta = 30/150 = 0.2, kontignya =Ne6.4=267000×0.00166440= N e^{-6.4} = 267\,000\times 0.00166 \approx 440.

Latihan 4.6 ★★

Sebuah varian heterozigot diliputi 3030 bacaan. Dengan andaian tiap bacaan menampilkan salah satu alel dengan peluang 1/21/2, berapa peluang bahwa kurang dari 88 bacaan menampilkan alel variannya (sehingga varian itu mungkin dikira galat)? Pakailah hampiran normal dengan rata-rata 1515 dan simpangan baku 7.5\sqrt{7.5}. Mengapa 30×30\times menjadi bakunya?

Solusi

Solusi Latihan 4.6.

P(X<8)=P(X7)P(Z<(7.515)/2.74)=P(Z<2.74)0.003P(X < 8) = P(X \le 7) \approx P\bigl(Z < (7.5 - 15)/2.74\bigr) = P(Z < -2.74) \approx 0.003. Pada 30×30\times kedua alel sebuah heterozigot hampir selalu terlihat berkali-kali, cakupannya tak rata (daerah kaya GC memperoleh lebih sedikit bacaan, sehingga sebagian tapak hanya melihat separuh rata-ratanya), dan bacaan yang tersisa masih cukup untuk memisahkan alel yang sungguhan dari galat 10310^{-3}.

Latihan 4.7 ★★

Sebuah genom memiliki urutan berulang 6kb6\,\mathrm{kb} yang hadir dalam 500500 salinan. Jelaskanlah mengapa perakitan dari bacaan 150bp150\,\mathrm{bp} meruntuhkannya, seperti apa graf yang dihasilkannya, dan panjang bacaan berapa yang akan menguraikannya.

Solusi

Solusi Latihan 4.7.

Setiap bacaan 150bp150\,\mathrm{bp} dari dalam ulangannya identik dari salinan mana pun ia berasal, sehingga perakitnya membangun satu simpul 6kb6\,\mathrm{kb} dengan 500500 lintasan masuk dan 500500 lintasan keluar; ia tak dapat mengetahui pasangan mana masuk dengan mana keluar, dan perakitannya patah menjadi 500500 celah, dengan ulangannya hadir sekali dengan cakupan 500500 kali rata-ratanya. Bacaan yang lebih panjang daripada ulangannya ditambah sisi tunggal pada kedua ujungnya — 8kb8\,\mathrm{kb} atau lebih — melintasi tiap salinan dan menguraikannya.

Latihan 4.8 ★★

Dua orang manusia berbeda pada satu basa tiap seribu. Berapa selisihnya di dalam eksomnya (48Mb48\,\mathrm{Mb} urutan penyandi)? Bila dua pertiga selisih penyandinya bersifat sinonim atau jinak dan sisanya mengubah sebuah protein, berapa varian pengubah protein yang diusung seseorang terhadap orang lain?

Solusi

Solusi Latihan 4.8.

4.8×107/1000=480004.8\times 10^{7}/1000 = 48\,000 selisih penyandi; sepertiganya, sekitar 1600016\,000, mengubah proteinnya.

Latihan 4.9 ★★

Sebuah GWAS menguji 10610^{6} SNP pada ambang p<5×108p < 5\times 10^{-8}. Berapa harapan cacah positif palsunya bila tak ada satu pun SNP yang benar-benar berasosiasi? Sebuah alel SNP menaikkan risiko sebuah penyakit berfrekuensi 2%2\,\% menjadi 2.3%2.3\,\%. Jelaskanlah mengapa pengaruh semacam itu tak terdeteksi pada kajian yang melibatkan seribu orang dan tak berguna bagi seorang individu, tetapi toh dapat menunjuk pada sebuah mekanisme.

Solusi

Solusi Latihan 4.9.

Harapan cacah positif palsunya 106×5×108=0.0510^{6}\times 5\times 10^{-8} = 0.05. Risiko nisbi 1.151.15 pada penyakit berfrekuensi 2%2\,\% mengubah beberapa kasus tiap seribu; seribu orang memuat sekitar dua puluh kasus, jauh terlalu sedikit untuk melihatnya (dayanya tumbuh dengan cacah kasus dan dengan kuadrat pengaruhnya). Bagi seorang individu, 0.30.3 titik persen tak berarti. Namun alelnya menandai sebuah gen yang perubahan kecil keaktifannya mengubah risiko penyakit — gen itu, dan lintasannya, mungkin menjadi sasaran obat yang penghambatan tuntasnya berpengaruh besar.

Latihan 4.10 ★★★

Genom bakteri kira-kira 88%88\,\% penyandi; genom manusia 1.5%1.5\,\%. Berikanlah tiga hipotesis — genetika populasi, struktur, dan pengaturan — bagi selisih itu, dan bagi masing-masing sebuah pengamatan genom yang mendukung atau melemahkannya.

Solusi

Solusi Latihan 4.10.

Genetika populasi: pada bakteri, dengan populasi yang raksasa, seleksi menyingkirkan bahkan sisipan yang sedikit merugikan; pada mamalia, dengan populasi efektif yang kecil, hanyutan membiarkan DNA tak penyandi yang agak merugikan menumpuk — didukung oleh korelasi terbalik antargaris keturunan antara ukuran genom dan ukuran populasi, dilemahkan oleh kekecualiannya. Struktur: genom eukariot diserbu transposon yang justru dibersihkan bakteri, yang cenderung menghapus dan tak memberi perlindungan meiosis bagi unsur yang mementingkan diri — didukung oleh korelasi ukuran genom dengan kandungan transposonnya. Pengaturan: perkembangan yang rumit menuntut lebih banyak DNA pengatur — didukung oleh unsur tak penyandi yang lestari di sekitar gen perkembangan, dilemahkan oleh kenyataan bahwa hanya 8%8\,\% genom manusia yang memperlihatkan seleksi sama sekali, sehingga sebagian besar DNA tak penyandinya tidak bersifat mengatur.

Latihan 4.11 ★★★

Turunkanlah cacah kontig Lander–Waterman bagi bacaan dua panjang yang tercampur: N1N_{1} bacaan pendek sepanjang L1L_{1} dan N2N_{2} bacaan panjang sepanjang L2L_{2}, dengan pertindihan dihitung memakai minimum TT yang sama. (Perlakukanlah tiap bacaan sebagai bacaan paling kanan pada kontignya bila tak ada bacaan jenis mana pun yang mulai di dalam panjangnya sendiri dikurangi TT.) Tunjukkanlah bahwa sedikit bacaan panjang mengurangi cacah kontig lebih banyak daripada basa sebanyak itu berupa bacaan pendek.

Solusi

Solusi Latihan 4.11.

Awalan kedua jenisnya jatuh dengan kerapatan total ρ=(N1+N2)/G\rho = (N_{1} + N_{2})/G. Sebuah bacaan sepanjang LiL_{i} menjadi bacaan paling kanan pada kontignya bila tak ada bacaan jenis mana pun yang mulai di dalam LiTL_{i} - T basa sesudahnya: peluangnya eρ(LiT)e^{-\rho(L_{i} - T)}. Jadi kontignya =N1eρ(L1T)+N2eρ(L2T)= N_{1} e^{-\rho(L_{1} - T)} + N_{2} e^{-\rho(L_{2} - T)}. Sebuah bacaan panjang menjadi bacaan paling kanan dengan peluang yang secara eksponensial lebih kecil daripada bacaan pendek, dan tiap bacaan panjang juga menghapus peluang munculnya celah sepanjang seluruh panjangnya; basa sebanyak itu berupa bacaan pendek menambahkan banyak titik awal tetapi tiap jendela terlindungnya pendek, sehingga bacaan panjanglah yang unggul.

Latihan 4.12 ★★★

Keempat gugus Hox mamalia diperdebatkan berasal dari satu gugus lewat dua putaran penggandaan seluruh genom pada pangkal vertebrata. Nyatakanlah pola paralog seperti apa di seluruh genom, dan pola apa pada genom lamprei serta kordata invertebrata, yang diramalkan hipotesis itu, dan bagaimana orang akan membedakannya dari dua penggandaan bebas atas gugus itu saja.

Solusi

Solusi Latihan 4.12.

Dua penggandaan seluruh genom meramalkan bahwa pola empat kali lipat itu berlaku di seluruh genom: kuartet segmen kromosom paralog (paralogon) yang mengusung famili gen yang sama dengan urutan yang sama, dengan penggandaannya bertarikh sama bagi semua familinya; satu gugus saja pada amfioksus dan Ciona, yang menyimpang sebelum peristiwanya; serta pada lamprei, yang menyimpang di sekitar peristiwanya, keadaan antara atau keadaan yang berasal secara bebas. Penggandaan bebas gugus Hox saja meramalkan paralogon hanya bagi Hox, tetangga yang riwayatnya berbeda, dan tarikh penggandaan yang berbeda antarfamili. Paralogon seluruh genom dan penanggalan yang sama, seperti yang teramati, mendukung penggandaan seluruh genom.

4.6 Soal: Dua Genom pada Satu Mesin

Soal 4.1

Soal akhir pekan — sebuah bakteri dan seorang manusia yang diurutkan pada satu jalan yang sama: bacaannya dibagikan, lalu cakupan dan celahnya dihitung, kontignya dicacah, dan varian heterozigotnya dipanggil melawan laju galatnya, isi genom manusianya ditimbang, sebuah kajian asosiasi diukur, berakhir pada cacah kontig pada cakupan rendah, cakupan yang membuat pemanggilan varian aman, serta cacah mutasi baru pada seorang anak

Data: sekali jalan menghasilkan 6×1086\times 10^{8} bacaan 150bp150\,\mathrm{bp}. Sebuah genom bakteri sepanjang 4.6Mb4.6\,\mathrm{Mb}; genom manusia 3.2Gb3.2\,\mathrm{Gb} (haploid). Pertindihan minimum T=30bpT = 30\,\mathrm{bp}. Laju galat 10310^{-3} tiap basa tiap bacaan. Urutan penyandi manusia 48Mb48\,\mathrm{Mb}; genomnya 45%45\,\% berasal dari transposon, dengan 1.11.1 juta salinan Alu 300bp300\,\mathrm{bp}. Dua orang manusia berbeda pada satu tapak tiap 10001000. Laju mutasi 1.2×1081.2\times 10^{-8} tiap basa tiap generasi.

Bagian I — Bakterinya.

  1. Bakterinya diberi 0.2%0.2\,\% dari sekali jalan itu. Berapa bacaannya, dan berapa cakupannya?
  2. Berapa bagian genomnya yang tak terurutkan? Berapa basa jumlahnya?
  3. Hitunglah θ\theta dan harapan cacah kontignya.
  4. Sebuah rintisan sebelumnya hanya memakai 3000030\,000 bacaan. Berapa cakupan, bagian tak terliput, dan cacah kontignya?
  5. Genomnya memuat 77 salinan operon rRNA sepanjang 5kb5\,\mathrm{kb}. Jelaskanlah apa yang terjadi padanya di dalam perakitan dan berapa ujung kontig yang ditimbulkan hal ini saja.
  6. Bakterinya memiliki kira-kira satu gen tiap kilobasa. Berapa gennya, dan, bila 88%88\,\% genomnya penyandi, berapa panjang gen rata-ratanya?

Bagian II — Manusianya.

  1. Sisa jalannya diberikan kepada satu genom manusia. Berapa cakupan genom diploidnya tiap salinan haploid (yakni total basanya dibagi 3.2Gb3.2\,\mathrm{Gb})?
  2. Pada tapak heterozigot masing-masing kedua alelnya diliputi kira-kira separuh bacaannya. Dengan cakupan pertanyaan 7, berapa harapan cacah bacaan yang menampilkan tiap alelnya?
  3. Sebuah galat menampilkan basa yang keliru pada sebuah bacaan dengan peluang 10310^{-3}. Pada tapak homozigot yang diliputi cc bacaan, berapa harapan cacah bacaan yang menampilkan suatu basa keliru tertentu (103/310^{-3}/3 masing-masing)? Mengapa aturan “panggillah sebuah varian bila sedikitnya 33 bacaan dan sedikitnya 20%20\,\% bacaannya menampilkannya” menolak galat pada cakupan ini?
  4. Berapa tapak heterozigot yang diusung seorang manusia (kira-kira separuh selisih antara dua genom acak terletak pada masing-masing: ambillah satu tapak tiap 15001500)? Berapa pada urutan penyandi?
  5. Bacaannya disejajarkan dengan sebuah acuan. Jelaskanlah mengapa bacaan dari unsur Alu kerap tersejajarkan pada salinan yang keliru dan akibat apa yang ditimbulkannya bagi pemanggilan varian di dalamnya.
  6. Seorang anak diurutkan bersama kedua tetuanya. Berapa mutasi baru yang Anda harapkan? Berapa bacaan pada anaknya, pada cakupan ini, yang harus menampilkan varian yang tak dimiliki kedua tetuanya agar varian itu dipercaya, dan mengapa cakupan tetuanya sama pentingnya dengan cakupan anaknya?
  7. Sebuah laboratorium klinis menangkap eksomnya (48Mb48\,\mathrm{Mb}) lalu mengurutkannya pada 100×100\times. Berapa bacaan yang dibutuhkannya, dan mengapa hal itu lebih murah tiap pasien daripada genom pada 28×28\times walaupun cakupannya lebih tinggi?

Bagian III — Isi sebuah genom.

  1. Berapa bagian genom manusia yang berupa Alu, dan berapa bagian bacaan pertanyaan 7 yang berasal dari unsur Alu?
  2. Acuannya 3.2Gb3.2\,\mathrm{Gb} tetapi sebuah sel diploid memuat 6.4Gb6.4\,\mathrm{Gb}; dan bawang 16Gb16\,\mathrm{Gb} memiliki sekitar 6000060\,000 gen. Berapa bagian penyandi genom bawang itu, bila gennya rata-rata 1.5kb1.5\,\mathrm{kb} urutan penyandi?
  3. Manusia dan simpanse berbeda pada 1.2%1.2\,\% basa yang disejajarkan. Berapa substitusi jumlahnya di dalam 2.9Gb2.9\,\mathrm{Gb} urutan yang dapat disejajarkan? Bila dibagi rata di antara kedua garis keturunan sepanjang 6.56.5 juta tahun, laju mutasi tiap basa tiap tahun berapa yang tersirat, dan berapa tiap generasi 2525 tahun? Bandingkanlah dengan pengukuran langsung pada datanya.
  4. Dua penggandaan genom vertebrata semestinya memberi sampai empat salinan tiap gen moyangnya. Manusia memiliki sekitar 2000020\,000 gen dan kordata invertebrata Ciona sekitar 1600016\,000. Berapa bagian gandanya yang telah hilang, dengan hipotesis bahwa moyangnya memiliki 1600016\,000?
  5. Jelaskanlah mengapa cacah gen adalah ukuran yang buruk bagi kerumitan organisme, dengan cacah penyambungan alternatif Bab 2 sebagai salah satu argumennya.
  6. 8%8\,\% genomnya berada di bawah seleksi pemurni tetapi hanya 1.5%1.5\,\% yang menyandikan protein. Sisanya mungkin berupa apa, dan bagaimana Anda akan menguji satu unsur calonnya?

Bagian IV — Sebuah kajian asosiasi.

  1. 10610^{6} SNP diuji. Nyatakanlah ambang Bonferroni bagi galat sekeluarga sebesar 0.050.05, dan harapan cacah positif palsu pada p<105p < 10^{-5}.
  2. Sebuah penyakit berprevalensi 1%1\,\%. Sebuah alel risiko berfrekuensi 0.30.3 menaikkan odsnya sebesar 5%5\,\%. Hitunglah risiko penyakit bagi pembawa dua salinan, satu salinan, dan tanpa salinan, dengan risiko bukan pembawa sebesar 0.9%0.9\,\%. (Kalikanlah odsnya.)
  3. Dua ratus alel semacam itu ditemukan. Jelaskanlah apa itu skor poligenik, dan mengapa skor seseorang pada 1%1\,\% teratas dapat setara dengan risiko beberapa kali lipat walaupun tiap alelnya nyaris tak berbuat apa-apa.
  4. Jelaskanlah mengapa sebuah SNP yang mencapai kebermaknaan biasanya bukan varian penyebabnya, dan percobaan apa yang akan mengenali varian penyebabnya di daerah itu.
  5. Sebuah genom purba dari tulang berumur 4000040\,000 tahun diurutkan pada c=0.5c = 0.5. Berapa bagiannya yang terbaca? Mengapa hal itu masih dapat menjawab pertanyaan tentang sejarah populasi yang tak dapat dijawab genom modern saja?
  6. Ringkaskanlah: cacah kontig pada perakitan rintisannya (pertanyaan 4), cakupan tiap genom haploid yang memberi kira-kira 1515 bacaan tiap alel (pertanyaan 7–8), dan cacah mutasi baru pada seorang anak (pertanyaan 12).
Solusi

Solusi Soal 4.1.

1. 0.002×6×108=1.2×1060.002\times 6\times 10^{8} = 1.2\times 10^{6} bacaan; c=1.2×106×150/4.6×10639c = 1.2\times 10^{6}\times 150/4.6\times 10^{6} \approx 39. 2. e391017e^{-39} \approx 10^{-17}: praktis tak ada basa yang tak terliput. 3. θ=0.2\theta = 0.2; kontignya =1.2×106e310= 1.2\times 10^{6} e^{-31} \approx 0: satu kontig secara teori, celahnya hanya pada ulangan. 4. c=30000×150/4.6×106=0.98c = 30\,000\times 150/4.6\times 10^{6} = 0.98; tak terliput e0.98=0.38e^{-0.98} = 0.38, kira-kira 1.7Mb1.7\,\mathrm{Mb}; kontignya =30000×e0.7813700= 30\,000 \times e^{-0.78} \approx 13\,700. 5. Ketujuh operonnya memberi bacaan yang identik lalu runtuh menjadi satu kontig 5kb5\,\mathrm{kb}, yang dimasuki tujuh sisi kiri tunggal dan ditinggalkan lewat tujuh sisi kanan yang pasangannya tak diketahui: 1414 ujung kontig, tujuh celah. 6. Sekitar 46004600 gen; penyandinya 0.88×4.6×106=4.0×1060.88\times 4.6\times 10^{6} = 4.0\times 10^{6} bp, gen rata-ratanya 880bp880\,\mathrm{bp}. 7. 0.998×6×108×150/3.2×10928×0.998\times 6\times 10^{8}\times 150/3.2\times 10^{9} \approx 28\times. 8. Sekitar 1414 bacaan tiap alel. 9. 28×103/30.00928\times 10^{-3}/3 \approx 0.009 bacaan menampilkan suatu basa keliru tertentu — peluang tiga atau lebih kira-kira 10710^{-7} — dan 20%20\,\% dari 2828 adalah 5.65.6 bacaan; sebuah galat tak lolos uji mana pun, sedangkan alel heterozigot yang sungguhan diharapkan pada 1414. 10. 3.2×109/15002.1×1063.2\times 10^{9}/1500 \approx 2.1\times 10^{6} tapak heterozigot; pada urutan penyandi 4.8×107/1500320004.8\times 10^{7}/1500 \approx 32\,000. 11. Sebuah bacaan 150bp150\,\mathrm{bp} dari sebuah Alu cocok dengan banyak dari 1.11.1 juta salinannya nyaris sama baiknya, sehingga bacaan itu ditempatkan pada salinan yang keliru atau diberi keyakinan pemetaan yang rendah. Selisih antarsalinannya lalu tampak seperti varian heterozigot, dan varian yang sungguhan tersembunyi di antaranya: pemanggilan varian di dalam Alu biasanya disaring keluar, dan unsur itu menjadi titik buta pengurutan berbacaan pendek. 12. 1.2×108×6.4×109771.2\times 10^{-8}\times 6.4\times 10^{9} \approx 77 mutasi baru. Sekitar 1414 bacaan semestinya menampilkan variannya pada anak itu; tetapi bila tapak seorang tetua hanya diliputi lima bacaan, sebuah alel heterozigot terlewat dengan peluang 25=3%2^{-5} = 3\,\% dan varian yang diwarisi salah dipanggil sebagai varian baru — sehingga tetuanya harus diurutkan sedalam anaknya. 13. 4.8×107×100/150=3.2×1074.8\times 10^{7}\times 100/150 = 3.2\times 10^{7} bacaan, dua puluh kali lebih sedikit daripada genomnya: biaya pengurutannya turun dua puluh kali lipat, lebih besar daripada biaya langkah penangkapannya. 14. 1.1×106×300=3.3×1081.1\times 10^{6}\times 300 = 3.3\times 10^{8} bp, kira-kira 10%10\,\% genomnya; 10%10\,\% bacaannya, sekitar 6×1076\times 10^{7}. 15. 60000×1500=9×10760\,000\times 1500 = 9\times 10^{7} bp; 9×107/1.6×1010=0.56%9\times 10^{7}/1.6\times 10^{10} = 0.56\,\%. 16. 0.012×2.9×109=3.5×1070.012\times 2.9\times 10^{9} = 3.5\times 10^{7} substitusi, 1.7×1071.7\times 10^{7} tiap garis keturunan; lajunya 1.7×107/(2.9×109×6.5×106)=9×10101.7\times 10^{7}/(2.9\times 10^{9}\times 6.5\times 10^{6}) = 9\times 10^{-10} tiap basa tiap tahun, 2.3×1082.3\times 10^{-8} tiap generasi 25 tahun — kira-kira dua kali laju silsilah 1.2×1081.2\times 10^{-8}, yakni percanggahan yang telah dikenal dan menyarankan generasi masa lalu yang lebih panjang atau perpisahan yang lebih tua. 17. Empat salinan dari 1600016\,000 akan menjadi 6400064\,000; 2000020\,000 tersisa, sehingga dari 4800048\,000 salinan tambahannya hanya 40004000 yang bertahan: 92%92\,\% gandanya hilang. 18. Cacing dan manusia memiliki cacah gen yang sama; kerumitannya terletak pada cara gen itu dipakai — penyambungan alternatif mengalikan satu gen menjadi ribuan protein (3801638\,016 bagi Dscam), pengaturan menggabungkan faktor transkripsi dan penguat dengan cara yang khas tipe sel, RNA tak penyandi menambahkan lapisan, dan proteinnya berinteraksi di dalam jejaring. 19. Unsur pengatur (penguat, promotor, isolator), gen RNA tak penyandi, isyarat penyambungan dan penempatan, titik asal, serta urutan struktural. Ujilah sebuah calon penguat dengan menempatkannya di depan gen pelapor di dalam embrio transgenik lalu melihat di mana pelapornya diekspresikan, kemudian menghapus unsurnya di dalam genom dengan CRISPR lalu mengukur gen tetangganya. 20. 0.05/106=5×1080.05/10^{6} = 5\times 10^{-8}; pada p<105p < 10^{-5}, 106×105=1010^{6} \times 10^{-5} = 10 positif palsu diharapkan. 21. Ods bukan pembawanya 0.009/0.991=0.009080.009/0.991 = 0.00908; ods satu salinan 0.009540.00954, risikonya 0.945%0.945\,\%; ods dua salinan 0.010010.01001, risikonya 0.99%0.99\,\%. 22. Skornya menjumlahkan, atas 200200 alelnya, cacah salinan risiko yang diusung seseorang dengan bobot log rasio ods tiap alel. Cacahnya berrata-rata 200×2×0.3=120200\times 2\times 0.3 = 120 dan bersimpangan baku 200×2×0.3×0.79\sqrt{200\times 2\times 0.3\times 0.7} \approx 9; 1%1\,\% teratasnya mengusung sekitar 2121 alel lebih banyak daripada rata-rata, dan 1.05212.81.05^{21} \approx 2.8: nyaris tiga kali lipat ods orang rata-rata, dari alel yang secara sendiri-sendiri mengubah risiko sebesar 5%5\,\%. 23. Alel di dalam satu blok sepanjang puluhan kilobasa diwarisi bersama (ketakseimbangan pautan), sehingga alel mana pun di antaranya memperlihatkan asosiasi yang sama; SNP yang digenotipe sekadar SNP yang kebetulan ada pada lariknya. Untuk menemukan varian penyebabnya: urutkanlah daerah itu pada kasus dan kendalinya, sempitkanlah himpunannya secara statistik, lalu ujilah tiap calonnya — uji pelapor bagi keaktifan penguat tiap alelnya, penyuntingan tiap alel di dalam sel lalu pengukuran ekspresi gen di dekatnya, penempatan bersama dengan isyarat sifat kuantitatif ekspresi. 24. 1e0.5=39%1 - e^{-0.5} = 39\,\% genomnya terbaca. Genom itu memberi contoh langsung sebuah populasi pada waktu yang diketahui di masa lalu — frekuensi alel sebelum perpindahan dan pembauran berikutnya, panjang segmen Neanderthal (panjang, karena baru sedikit generasi rekombinasi yang memecahnya) dan karenanya tarikh pembaurannya — yang hanya dapat disimpulkan genom modern lewat model. 25. Sekitar 1370013\,700 kontig pada rintisannya; 28×28\times tiap genom haploid, sekitar 1414 bacaan tiap alel; sekitar 7777 mutasi baru pada seorang anak.

Istilah yang didefinisikan dalam bab ini

Lihat semua 479 istilah di glosarium