Biologie · Begrippenlijst

Wat is Massaal parallelle sequencing?

Definitie 4.2 Universitaire biologie — jaar 3 · Hoofdstuk 4 — Genomica en sequencing

Instrumenten van de tweede generatie lezen miljoenen tot miljarden fragmenten tegelijk. Bij sequencing door synthese worden de fragmenten, met adapters aan hun uiteinden geligeerd, aan een glazen stroomcel gebonden en daar ter plaatse vermenigvuldigd tot clusters van identieke moleculen; die clusters worden vervolgens per cyclus met één base verlengd met fluorescerende, omkeerbaar geblokkeerde nucleotiden, afgebeeld, gedeblokkeerd en opnieuw verlengd, zodat elke cyclus één base toevoegt aan de read van elk cluster. De reads zijn 100 tot 300bp100\text{ tot }300\,\mathrm{bp} lang, meestal vanaf beide uiteinden van een fragment (gepaarde uiteinden), met een foutenpercentage van ongeveer 10310^{-3} per base, en één run levert tot 101210^{12} basen op. Instrumenten van de derde generatie met lange reads lezen afzonderlijke moleculen zonder vermenigvuldiging: door één polymerase in reële tijd fluorescerende nucleotiden te zien inbouwen, of door het DNA door een eiwit-nanoporie te rijgen en de ionenstroom te registreren, die elke opeenvolging van basen op haar eigen manier moduleert. Reads van 10 tot 100kb10\text{ tot }100\,\mathrm{kb} en meer overspannen de herhalingen waar korte reads niet overheen komen, tegen een hoger ruw foutenpercentage dat de consensus terugbrengt.

Links: een stroomcel, het glazen plaatje waarop miljarden DNA-clusters worden gekweekt en per cyclus met één base worden gelezen. Rechts: een nanoporiesequencer ter grootte van een broekzak, die afzonderlijke moleculen leest als veranderingen in een ionenstroom. Links: een stroomcel, het glazen plaatje waarop miljarden DNA-clusters worden gekweekt en per cyclus met één base worden gelezen. Rechts: een nanoporiesequencer ter grootte van een broekzak, die afzonderlijke moleculen leest als veranderingen in een ionenstroom.
Links: een stroomcel, het glazen plaatje waarop miljarden DNA-clusters worden gekweekt en per cyclus met één base worden gelezen. Rechts: een nanoporiesequencer ter grootte van een broekzak, die afzonderlijke moleculen leest als veranderingen in een ionenstroom.

Voorbeelden

Voorbeeld 4.4 (Hoeveel genoeg is)

Bij c=5c = 5 is het ongesequencede deel e5=0.7%e^{-5} = 0.7\,\% — voor een genoom van 3.2Gb3.2\,\mathrm{Gb} twintig miljoen basen in enkele tienduizenden gaten. Bij c=10c = 10 is het 4.5×1054.5\times 10^{-5}, in totaal 150kb150\,\mathrm{kb}. Menselijke genomen worden standaard bij c=30c = 30 gesequenced, niet vanwege dekkingsgaten (e301013e^{-30} \approx 10^{-13}) maar omdat elke base op elk van de twee chromosomen meermalen moet worden gelezen om een heterozygote variant met vertrouwen vast te stellen tegen een foutenpercentage van 10310^{-3} per read. Bacteriële genomen worden bij c=50c = 50100100 gesequenced om dezelfde reden en omdat het goedkoop is. De formule laat ook zien wat dekking niet kan oplossen: een herhaling die langer is dan een read is een plaats waar de overlapgraaf zich vertakt, en geen enkele hoeveelheid korte reads lost dat op. Daar zijn lange reads voor.

Lees in het hoofdstuk →