---
title: "Évolution moléculaire et phylogénomique"
book: "Biologie universitaire — 3e année"
subject: biology
language: fr
chapter: 25
exercises: 12
source: https://one-course.com/books/biology/5/fr/chapter/25-evolution-moleculaire-et-phylogenomique
---

# Chapitre 25 — Évolution moléculaire et phylogénomique

En 1968 Motoo Kimura fit un calcul qui troubla une discipline. En comparant les hémoglobines, les cytochromes et d’autres protéines de mammifères dont les ancêtres communs étaient datés par les fossiles, il trouva que les acides aminés avaient été remplacés au rythme d’environ une substitution par site et par milliard d’années — ce qui, sur un génome de mammifère et par génération, revenait à une nouvelle substitution fixée dans la population tous les deux ans environ. Haldane avait montré dix ans plus tôt que la sélection naturelle ne peut fixer qu’environ une substitution toutes les trois cents générations avant que le coût en descendants perdus devienne impayable. L’arithmétique ne laissait qu’une issue : la plupart des changements qui s’accumulent dans l’ADN ne sont pas mus par la sélection, mais sont neutres, fixés par hasard dans des populations finies, à un rythme qui — comme le montre le premier théorème de ce chapitre — est simplement le taux de mutation. La [théorie neutraliste](#thm-b3-molecular-evolution-neutral) est devenue l’hypothèse nulle de l’évolution moléculaire, la référence face à laquelle on détecte la sélection ; l’[horloge moléculaire](#prop-b3-molecular-evolution-clock) est devenue un moyen de dater ce que les fossiles ne pouvaient pas ; et les génomes séquencés depuis ont donné les outils pour voir, gène par gène, où la sélection a agi, comment des gènes neufs naissent d’anciens, et pourquoi l’arbre d’un gène n’est pas toujours celui de son espèce.

## 25.1 Dérive, mutation et taux neutre

**Théorème 25.1 (Le taux de substitution neutre).**

Dans une population diploïde de $N$ individus, une nouvelle mutation sans effet sur la valeur sélective a une probabilité $1/2N$ de finir par remplacer tous les autres allèles (la *fixation*) et $1 - 1/2N$ d’être perdue. Si chacune des $2N$ copies du gène mute au taux $\mu$ par génération, $2N\mu$ nouvelles mutations neutres apparaissent par génération et, à long terme, le rythme d’accumulation des substitutions vaut

$$
k = 2N\mu\times\frac{1}{2N} = \mu :
$$

le *[taux de substitution](#thm-b3-molecular-evolution-neutral)* neutre égale le taux de mutation, indépendamment de la taille de la population. Une mutation destinée à se fixer met en moyenne $4N$ générations à le faire, de sorte que les grandes populations tiennent plus de variation en transit mais ne la fixent pas plus vite. Pour une mutation d’avantage sélectif $s$, la formule de Kimura donne la [probabilité de fixation](#thm-b3-molecular-evolution-neutral)

$$
P(s) = \frac{1 - \mathrm{e}^{-2s}}{1 - \mathrm{e}^{-4Ns}} \approx 2s
\quad (4Ns \gg 1),
$$

de sorte qu’un avantage de $1\,\%$ se fixe avec une probabilité d’environ $2\,\%$ — quarante fois la chance d’une mutation neutre dans une population de deux mille individus, mais tout de même perdue quarante-neuf fois sur cinquante ; et un désavantage $s < 0$ avec $4N|s| \gg 1$ ne se fixe pour ainsi dire jamais, tandis qu’un désavantage avec $4N|s| \ll 1$ se comporte comme neutre : la sélection ne voit que ce que la dérive ne noie pas, et la frontière est $|s| \sim
1/4N$ — l’*effectivement neutre*.

**Démonstration.** La neutralité : une copie présente aujourd’hui sera l’ancêtre de toute la population dans un lointain avenir, et par symétrie chacune des $2N$ copies a la même chance de l’être ; le nouveau mutant est une copie, d’où $1/2N$. Le taux : substitutions par génération $=$ (mutations apparaissant par génération) $\times$ (probabilité que chacune se fixe) $= 2N\mu/2N$. La formule de Kimura découle de l’approximation de diffusion pour la variation de fréquence allélique sous la dérive et la sélection, admise ici ; ses limites se vérifient directement : quand $s \to 0$, $(2s)/(4Ns) = 1/2N$, la valeur neutre ; pour $4Ns \gg 1$ le dénominateur vaut $1$ et le numérateur $\approx 2s$. Le temps de fixation : la fréquence d’un allèle neutre suit une marche au hasard de variance $p(1-p)/2N$ par génération, et le temps attendu pour atteindre $1$ depuis $1/2N$, sachant qu’on y parvient, vaut $4N$ générations (Kimura et Ohta, 1969), admis. ∎

![La probabilité de fixation de Kimura en fonction du coefficient de sélection mis à l’échelle, pour N = 1000. Près de zéro la courbe passe par la valeur neutre ; à droite elle monte vers 2s ; à gauche elle tombe d’une falaise. La sélection n’agit que sur ce que la dérive ne peut cacher.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/fig-dccf3007ff3c.svg)

*La [probabilité de fixation](#thm-b3-molecular-evolution-neutral) de Kimura en fonction du coefficient de sélection mis à l’échelle, pour $N = 1000$. Près de zéro la courbe passe par la valeur neutre ; à droite elle monte vers $2s$ ; à gauche elle tombe d’une falaise. La sélection n’agit que sur ce que la dérive ne peut cacher.*

**Faits expérimentaux.** Kimura (1968) puis King et Jukes (1969) ont tiré l’argument des taux : le rythme observé de substitution des acides aminés dans les protéines de mammifères impliquait plus de substitutions par génération que ne l’autorisait le coût de la sélection de Haldane, de sorte que la plupart devaient être neutres. Les prédictions de la théorie ont ensuite tenu : les taux sont les plus élevés là où la fonction contraint le moins — sites synonymes, introns, [pseudogènes](#def-b3-molecular-evolution-duplication), troisième position du codon — et les plus bas dans les [histones](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) et l’ubiquitine, qui changent d’un résidu en cent millions d’années ; le niveau de variation à l’intérieur d’une espèce suit la mutation et la taille de population ; et le rythme de substitution par an est à peu près constant entre lignées de tailles de population très différentes, comme l’exige la formule $k = \mu$ et comme une explication sélectionniste ne le fait pas. La controverse qui a suivi ne l’a pas renversée : elle a fixé le taux neutre comme l’hypothèse nulle face à laquelle on mesure la sélection. ∎

![À gauche : Motoo Kimura (1924–1994), qui a montré que l’essentiel du changement moléculaire est fixé par hasard et au taux de mutation (photographie, 1986, CC BY 4.0). À droite : un poisson des glaces de l’Antarctique, dont le sang est empêché de geler par une glycoprotéine antigel assemblée, il y a une dizaine de millions d’années, à partir d’un gène d’enzyme digestive dupliqué et d’une série de répétitions.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/img-155e3db867ae.jpg)

![À gauche : Motoo Kimura (1924–1994), qui a montré que l’essentiel du changement moléculaire est fixé par hasard et au taux de mutation (photographie, 1986, CC BY 4.0). À droite : un poisson des glaces de l’Antarctique, dont le sang est empêché de geler par une glycoprotéine antigel assemblée, il y a une dizaine de millions d’années, à partir d’un gène d’enzyme digestive dupliqué et d’une série de répétitions.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/img-2002e8221dec.jpg)

*À gauche : Motoo Kimura (1924–1994), qui a montré que l’essentiel du changement moléculaire est fixé par hasard et au taux de mutation (photographie, 1986, CC BY 4.0). À droite : un poisson des glaces de l’Antarctique, dont le sang est empêché de geler par une glycoprotéine antigel assemblée, il y a une dizaine de millions d’années, à partir d’un gène d’enzyme digestive dupliqué et d’une série de répétitions.*

## 25.2 L’horloge moléculaire

**Proposition 25.2 (L’horloge et ses irrégularités).**

Si les substitutions s’accumulent à un taux constant $k$ par site et par an dans deux lignées séparées depuis $T$ années, la fraction de sites où elles diffèrent vaut, pour de petites valeurs, $d \approx 2kT$ : la divergence de deux séquences est une *[horloge moléculaire](#prop-b3-molecular-evolution-clock)* (Zuckerkandl et Pauling, 1965), qu’on peut *calibrer* par une séparation datée par un fossile puis lire pour des séparations sans fossile. L’horloge est stochastique — un processus de Poisson, de sorte que $d$ a une variance à peu près égale à sa moyenne sur un nombre fixé de sites — et elle est irrégulière de trois façons connues. Chaque protéine a son propre taux, fixé par la fraction de ses sites que la fonction laisse changer : fibrinopeptides à $8$, hémoglobine $1$, cytochrome $c$ $0.3$, [histone](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) H4 $0.01$ substitutions par site et par milliard d’années. Les taux diffèrent entre lignées : puisque le taux neutre est $\mu$ par génération, les animaux à générations courtes (rongeurs) accumulent plus de changement par an que ceux à générations longues (primates, baleines) — l’*[effet du temps de génération](#prop-b3-molecular-evolution-clock)*, en partie compensé parce que les taux de mutation par génération montent avec la durée des générations. Et $d$ sature : une fois que beaucoup de sites ont changé, les changements suivants frappent des sites déjà changés, de sorte qu’il faut corriger la différence brute pour les coups multiples, comme le font les distances du chapitre sur l’[alignement](https://one-course.com/books/biology/5/fr/chapter/5-bio-informatique-et-analyse-des-sequences#def-b3-bioinformatics-alignment). Les *[horloges relâchées](#prop-b3-molecular-evolution-clock)* modernes laissent le taux varier d’une branche à l’autre dans un modèle statistique et sont calibrées par de nombreux fossiles à la fois ; elles datent la séparation de l’humain et du chimpanzé à six ou sept millions d’années, celle des ordres de mammifères placentaires près de la fin du Crétacé, et celle des animaux et des champignons au Précambrien, avec des incertitudes de dix à vingt pour cent qui viennent surtout des fossiles.

**Démonstration.** Chaque lignée accumule $kT$ substitutions par site, de sorte que la différence entre elles vaut $2kT$ là où les sites n’ont pas été frappés deux fois ; une paire datée par un fossile donne $k = d/2T$. La variance de Poisson et les taux par protéine sont ceux de Zuckerkandl et Pauling, de Dickerson (1971) et des ajustements de Kimura à des jeux de protéines de vertébrés ; la correction de saturation est la formule de Jukes–Cantor du chapitre sur l’[alignement](https://one-course.com/books/biology/5/fr/chapter/5-bio-informatique-et-analyse-des-sequences#def-b3-bioinformatics-alignment), $d_{\text{vrai}} =
-\tfrac{3}{4}\ln(1 - \tfrac{4}{3}p)$. La variation des taux entre lignées a été montrée par les tests de taux relatifs : avec un groupe externe $O$ et deux espèces $A$, $B$, la différence $d_{AO} - d_{BO}$ devrait être nulle sous une horloge stricte, et ne l’est pas pour les rongeurs face aux primates. ∎

![L’horloge moléculaire, protéine par protéine. Chacune tourne à son propre rythme, fixé par la part de la molécule que la fonction laisse libre de changer : un fibrinopeptide, coupé et jeté quand le sang coagule, change des centaines de fois plus vite que l’histone qui empaquette l’ADN.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/fig-8a26015574c1.svg)

*L’[horloge moléculaire](#prop-b3-molecular-evolution-clock), protéine par protéine. Chacune tourne à son propre rythme, fixé par la part de la molécule que la fonction laisse libre de changer : un fibrinopeptide, coupé et jeté quand le sang coagule, change des centaines de fois plus vite que l’[histone](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) qui empaquette l’ADN.*

## 25.3 Lire la sélection dans les séquences

**Définition 25.3 (Le rapport dN/dS).**

Dans un gène codant, une substitution est *synonyme* si elle laisse l’acide aminé inchangé et *non synonyme* si elle le change. Comme le code génétique laisse la plupart des troisièmes positions et certaines premières positions changer silencieusement, environ un quart des mutations possibles d’un gène typique sont synonymes. Soit $d_{S}$ le nombre de substitutions synonymes par site synonyme et $d_{N}$ les substitutions non synonymes par site non synonyme, chacun corrigé pour les coups multiples. Les changements synonymes sont proches de la neutralité, de sorte que $d_{S}$ estime $2\mu T$ — l’horloge ; et le rapport

$$
\omega = \frac{d_{N}}{d_{S}}
$$

mesure ce que la sélection a fait à la protéine : $\omega = 1$ si les changements d’acide aminé sont aussi libres que les silencieux (aucune contrainte, comme dans un [pseudogène](#def-b3-molecular-evolution-duplication)) ; $\omega < 1$ sous *sélection purificatrice*, la plupart des changements étant retirés — le gène typique a $\omega \approx 0.1$ à $0.2$, les [histones](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) $0.001$ ; $\omega > 1$ sous *sélection positive*, les changements d’acide aminé étant favorisés plus vite que la dérive seule ne l’autorise — le sillon de liaison à l’[antigène](https://one-course.com/books/biology/5/fr/chapter/16-immunite-adaptative-et-vaccination#def-b3-adaptive-immunity-lymphocytes) des molécules du CMH, les protéines de surface des [virus](https://one-course.com/books/biology/5/fr/chapter/13-virologie#def-b3-virology-virus) en course aux armements avec les [anticorps](https://one-course.com/books/biology/5/fr/chapter/16-immunite-adaptative-et-vaccination#def-b3-adaptive-immunity-antibody), les protéines du spermatozoïde et de l’ovule lors de la fécondation, et le lysozyme des ruminants, recruté pour digérer les bactéries dans l’estomac. Calculé le long d’une branche d’un arbre ou site par site, $\omega$ cartographie où et quand une protéine a été changée par la sélection plutôt que par le hasard.

![Les ordres de grandeur de . Presque tous les gènes se tiennent bien au-dessous de un, leurs acides aminés gardés par la sélection purificatrice ; un pseudogène dérive à un ; les rares qui dépassent un sont les protéines engagées dans une course aux armements ou récemment recrutées pour un nouveau travail.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/fig-9579debf7ec9.svg)

*Les ordres de grandeur de $\omega$. Presque tous les gènes se tiennent bien au-dessous de un, leurs acides aminés gardés par la [sélection purificatrice](#def-b3-molecular-evolution-dnds) ; un [pseudogène](#def-b3-molecular-evolution-duplication) dérive à un ; les rares qui dépassent un sont les protéines engagées dans une course aux armements ou récemment recrutées pour un nouveau travail.*

**Méthode 25.4 (Estimer dN/dSd_{N}/d_{S}dN​/dS​).**

(1) Aligner les deux séquences codantes codon par codon (aligner les protéines, puis revenir à l’ADN, pour qu’aucun trou ne casse le cadre de lecture). (2) Pour chaque codon, compter les *sites* synonymes et non synonymes : chacune de ses trois positions est notée par la fraction des changements possibles qui sont silencieux — une troisième position à dégénérescence quadruple compte pour un site synonyme, une position où tout changement modifie l’acide aminé pour un site non synonyme, une position à dégénérescence double pour un tiers de l’un et deux tiers de l’autre. Sommer sur les codons : $S$ sites synonymes et $N$ sites non synonymes, avec $S + N = 3 \times$ le nombre de codons. (3) Compter les *différences* synonymes et non synonymes entre les séquences, en résolvant les codons qui diffèrent à deux positions par une moyenne sur les chemins possibles. (4) $p_{S} =$ différences$/S$, $p_{N} =$ différences$/N$ ; corriger chacun pour les coups multiples par Jukes–Cantor. (5) $\omega =
d_{N}/d_{S}$ ; tester $\omega \ne 1$ face à la variance d’échantillonnage, qui est grande quand $d_{S}$ est petit — deux séquences très proches donnent un rapport peu fiable, et deux très lointaines ont un $d_{S}$ saturé. (6) Pour le où et le quand : ajuster un $\omega$ par branche d’un arbre, ou par site avec un mélange de classes de sites, et tester si une classe à $\omega > 1$ améliore l’ajustement.

## 25.4 Des gènes neufs à partir d’anciens

**Définition 25.5 (Duplication, familles et transfert).**

La plupart des gènes neufs sont des copies d’anciens. Une *duplication génique* — par enjambement inégal, par rétrotransposition, ou par le doublement d’un génome entier, comme il en est arrivé deux fois à l’origine des vertébrés puis encore chez l’ancêtre des téléostéens et dans bien des lignées de plantes — laisse deux [paralogues](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative) là où il y en avait un ; des gènes d’espèces différentes descendant d’un même gène ancestral sont des [orthologues](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative). Le sort ordinaire de la copie est la décrépitude : libérée de toute contrainte ($\omega \to 1$) elle accumule un codon stop ou un décalage du cadre de lecture et devient un *pseudogène*, le génome humain en portant quelque vingt mille. Parfois les deux survivent : par *néofonctionnalisation*, une copie acquérant une fonction nouvelle tandis que l’autre garde l’ancienne (la glycoprotéine antigel du poisson des glaces, issue d’un gène de trypsinogène ; les opsines rouge et verte des primates, issues d’une duplication vieille de quarante millions d’années qui a donné la vision trichromatique décrite dans le volume de première année ; les cristallines du cristallin, issues d’enzymes métaboliques) ; ou par *sous-fonctionnalisation*, chaque copie gardant une part de l’expression ou de l’activité de l’ancêtre, de sorte que les deux sont nécessaires. Des duplications répétées bâtissent des *familles de gènes* — les globines, les groupes Hox du chapitre sur le développement, les mille gènes de [récepteurs olfactifs](https://one-course.com/books/biology/5/fr/chapter/18-les-systemes-sensoriels#def-b3-sensory-systems-chemical) d’une souris, dont un tiers sont des pseudogènes chez l’humain. L’autre source de gènes neufs est le *transfert horizontal* : les bactéries acquièrent des gènes de bactéries sans parenté par des [plasmides](https://one-course.com/books/biology/5/fr/chapter/6-genie-genetique-et-biotechnologies#def-b3-genetic-engineering-tools), des phages et de l’ADN libre, et c’est ainsi que la [résistance aux antibiotiques](https://one-course.com/books/biology/5/fr/chapter/12-bacteriologie-croissance-physiologie-et-genetique#def-b3-bacteriology-resistance) franchit les espèces dans un hôpital et pourquoi l’« espèce » d’une bactérie est un génome central entouré d’un nuage mouvant ; chez les eucaryotes le transfert est plus rare mais réel — l’[ADN-T](https://one-course.com/books/biology/5/fr/chapter/6-genie-genetique-et-biotechnologies#def-b3-genetic-engineering-plants) qu’*[Agrobacterium](https://one-course.com/books/biology/5/fr/chapter/6-genie-genetique-et-biotechnologies#def-b3-genetic-engineering-plants)* insère dans les plantes, des gènes bactériens chez les rotifères bdelloïdes, et les antiques transferts en bloc qu’ont été la mitochondrie et le chloroplaste. Là où le transfert est courant, l’histoire du vivant est un réseau, et l’arbre tiré d’un gène quelconque est l’arbre de ce gène.

![Les sorts d’un gène dupliqué. Libérée de toute contrainte, la copie supplémentaire se délabre d’ordinaire ; parfois la sélection la rattrape pour une fonction nouvelle, ou les deux copies se partagent l’ancienne.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/fig-3dfe38e01677.svg)

*Les sorts d’un gène dupliqué. Libérée de toute contrainte, la copie supplémentaire se délabre d’ordinaire ; parfois la sélection la rattrape pour une fonction nouvelle, ou les deux copies se partagent l’ancienne.*

**Faits expérimentaux.** Ohno (1970) a proposé la duplication comme source principale des gènes neufs avant qu’une seule famille eût été séquencée ; les globines l’ont confirmé, leur arbre des chaînes $\alpha$, $\beta$, $\gamma$, $\delta$, de la myoglobine et des globines de plantes et de bactéries accordant les dates de duplication à la radiation des vertébrés. Chen, DeVries et Cheng (1997) ont montré que le gène antigel du poisson des glaces partage sa séquence signal et ses séquences flanquantes avec le trypsinogène et que les répétitions antigel sont nées de l’expansion d’un morceau de neuf nucléotides à cheval sur une jonction intron–exon : une protéine neuve faite des pièces détachées d’une enzyme digestive, datée par l’horloge du gel de l’océan Austral. Thornton et ses collègues (2006) ont reconstruit la séquence ancestrale des récepteurs des stéroïdes, synthétisé la protéine vieille de 450 millions d’années, et trouvé qu’elle ne répondait qu’aux œstrogènes ; deux substitutions ultérieures, identifiées et éprouvées, ont fait basculer la préférence de la copie dupliquée vers le cortisol — un ancêtre ressuscité, et le chemin entre lui et ses descendants parcouru au laboratoire. ∎

## 25.5 Arbres de gènes et arbres d’espèces

**Proposition 25.6 (Le tri incomplet des lignées).**

L’arbre d’un gène n’est pas nécessairement celui des espèces qui le portent. Considérons trois espèces d’[arbre d’espèces](#prop-b3-molecular-evolution-ils) $((A,B),C)$, la séparation $A$–$B$ étant précédée d’une population ancestrale de taille $N$ qui a duré $T$ générations avant la séparation d’avec $C$. Deux copies du gène, l’une venue d’$A$ et l’autre de $B$, suivies vers le passé, *coalescent* en un ancêtre commun au taux $1/2N$ par génération ; la probabilité qu’elles n’aient pas encore coalescé quand elles entrent dans la population ancestrale des trois vaut $\mathrm{e}^{-T/2N}$, et alors les trois lignées coalescent dans un ordre au hasard, de sorte que deux fois sur trois l’arbre du gène groupe $A$ ou $B$ avec $C$. La probabilité que l’arbre du gène soit en désaccord avec celui des espèces vaut donc

$$
P_{\text{discord}} = \tfrac{2}{3}\,\mathrm{e}^{-T/2N} .
$$

Pour l’humain, le chimpanzé et le gorille, avec un $T$ de quelques centaines de milliers de générations et un $N$ voisin de $50\,000$, environ un tiers du génome soutient un arbre où l’humain est plus proche du gorille, ou le chimpanzé du gorille, que ne le dit l’arbre des espèces — ce qu’on observe. Ce *[tri incomplet des lignées](#prop-b3-molecular-evolution-ils)*, joint à la duplication, à la perte et au transfert horizontal, est la raison pour laquelle la *phylogénomique* infère l’arbre des espèces à partir de milliers d’[arbres de gènes](#prop-b3-molecular-evolution-ils) sous un modèle du coalescent, plutôt que de les concaténer et d’en tirer un seul ; il permet aussi d’estimer les tailles de population ancestrales elles-mêmes à partir de la fraction d’arbres discordants, et de lire d’anciennes hybridations (l’ADN de Néandertal chez l’humain moderne, les flux de gènes entre ours, entre papillons) dans des arbres qui divergent dans un sens que la dérive seule ne produirait pas.

**Démonstration.** Deux lignées d’une population diploïde de $N$ individus choisissent leurs parents parmi $2N$ copies à chaque génération et en partagent une avec la probabilité $1/2N$ ; sur $T$ générations la chance de ne jamais le faire vaut $(1 - 1/2N)^{T} \approx
\mathrm{e}^{-T/2N}$. Trois lignées qui entrent dans la population ancestrale commune sont échangeables, de sorte que le premier couple à coalescer est chacun des trois couples avec la probabilité $1/3$ ; seul le couple $(A,B)$ correspond à l’arbre des espèces, d’où $2/3$ de cas discordants. Ni le taux du coalescent ni l’échangeabilité ne dépendent du gène, de sorte que la formule vaut indépendamment pour chaque locus neutre, et que la fraction d’arbres discordants sur un génome estime $\mathrm{e}^{-T/2N}$. ∎

![Des arbres de gènes dans un arbre d’espèces. Les tubes gris sont les populations ; les traits sont l’ascendance d’un gène. Les lignées qui ne se rencontrent pas dans la courte population ancestrale entrent ensemble dans la plus profonde et s’apparient au hasard — de sorte qu’un tiers du génome de trois espèces resserrées raconte une autre histoire que les espèces elles-mêmes.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/fig-c765799699bf.svg)

*Des [arbres de gènes](#prop-b3-molecular-evolution-ils) dans un [arbre d’espèces](#prop-b3-molecular-evolution-ils). Les tubes gris sont les populations ; les traits sont l’ascendance d’un gène. Les lignées qui ne se rencontrent pas dans la courte population ancestrale entrent ensemble dans la plus profonde et s’apparient au hasard — de sorte qu’un tiers du génome de trois espèces resserrées raconte une autre histoire que les espèces elles-mêmes.*

**Exemple 25.7 (Lire l’histoire d’un génome).**

Les cinq cents espèces de cichlidés du lac Victoria sont apparues dans les quinze mille ans qui ont suivi le remplissage du lac — trop vite pour que la mutation fournisse les différences qui les séparent. Leurs génomes montrent comment : les variants qui distinguent un fouilleur de fond d’un brouteur d’algues étaient présents comme variation permanente chez les poissons de rivière qui ont colonisé le lac, triés et recombinés, et augmentés par hybridation entre lignées ; les gènes des opsines ont été accordés aux eaux claires ou troubles par des substitutions dont le $\omega$ de leurs branches montre qu’elles ont été sélectionnées ; et les [arbres de gènes](#prop-b3-molecular-evolution-ils) se contredisent d’un bout à l’autre du génome exactement selon le motif que prédisent le [tri incomplet des lignées](#prop-b3-molecular-evolution-ils) et le flux de gènes. Une radiation n’est pas l’apparition de gènes neufs mais la redistribution d’allèles anciens en combinaisons neuves sous une sélection neuve — ce que les séquences enregistrent, allèle par allèle, pour qui sait lire un arbre qui est en vérité une forêt.

![Des cichlidés d’un lac africain : des centaines d’espèces en quelques milliers d’années, leurs différences tirées pour l’essentiel de la variation que leurs ancêtres communs portaient déjà.](https://one-course.com/images/onecourse/chapters/biology-5/b3-molecular-evolution/img-b1df65c42eed.jpg)

*Des cichlidés d’un lac africain : des centaines d’espèces en quelques milliers d’années, leurs différences tirées pour l’essentiel de la variation que leurs ancêtres communs portaient déjà.*

**Remarque 25.8 (Le hasard comme référence).**

La [théorie neutraliste](#thm-b3-molecular-evolution-neutral) n’affirme pas que la sélection est sans importance ; elle énonce ce qui arrive quand la sélection est absente, assez précisément pour qu’on puisse l’éprouver. Parce que le taux neutre est le taux de mutation, la divergence mesure le temps ; parce que le changement neutre remplit les sites que la sélection laisse libres, $\omega$ mesure la contrainte ; parce que les lignées neutres coalescent à un taux connu, le désaccord des [arbres de gènes](#prop-b3-molecular-evolution-ils) mesure la taille de populations que personne n’a vues. La sélection est alors ce qui reste quand on a soustrait le hasard — un gène dont l’$\omega$ dépasse un, un balayage qui a vidé une région de sa variation, un arbre qui diverge dans un sens que la dérive ne peut expliquer. L’antigel du poisson des glaces de l’Antarctique, le lysozyme stomacal du ruminant, la troisième opsine du primate sont les exceptions trouvées ainsi, et chacune est l’histoire d’un gène copié et d’un nouveau travail. Le reste du génome est une horloge.

## 25.6 Exercices

**Exercice 25.1 ★.**

Énoncer le [taux de substitution](#thm-b3-molecular-evolution-neutral) neutre et expliquer avec des mots pourquoi il ne dépend pas de la taille de la population.

**Solution de Exercice 25.1.**

$k = \mu$ : le [taux de substitution](#thm-b3-molecular-evolution-neutral) neutre par site et par génération égale le taux de mutation. À chaque génération $2N\mu$ nouvelles mutations neutres apparaissent et chacune a une probabilité $1/2N$ de se fixer ; une population plus grande fait plus de mutations et donne à chacune une chance proportionnellement plus petite, et les deux effets s’annulent exactement.

**Exercice 25.2 ★.**

Définir [orthologue](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative), [paralogue](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative) et [pseudogène](#def-b3-molecular-evolution-duplication), avec un exemple de chacun tiré de la famille des globines.

**Solution de Exercice 25.2.**

[Orthologues](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative) : des gènes de deux espèces descendus d’un seul gène de leur ancêtre commun — la $\beta$-globine humaine et la $\beta$-globine de souris. [Paralogues](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative) : des gènes d’un même génome descendus d’une duplication — l’$\alpha$- et la $\beta$-globine humaines, ou $\beta$ et $\gamma$. [Pseudogène](#def-b3-molecular-evolution-duplication) : une copie délabrée qui ne code plus de protéine — le gène $\psi\beta$ du groupe de la $\beta$-globine humaine, codons stop compris.

**Exercice 25.3 ★.**

Que mesure $\omega = d_{N}/d_{S}$ ? Interpréter $\omega = 0.02$, $\omega = 1.0$ et $\omega = 2.5$, et nommer un gène de chaque sorte.

**Solution de Exercice 25.3.**

$\omega$ compare le rythme des substitutions qui changent un acide aminé à celui des substitutions silencieuses, qui est la référence neutre. $0.02$ : [sélection purificatrice](#def-b3-molecular-evolution-dnds) forte, $98\,\%$ des changements d’acide aminé retirés — l’actine, l’[histone](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) H3. $1.0$ : aucune contrainte — un [pseudogène](#def-b3-molecular-evolution-duplication). $2.5$ : [sélection positive](#def-b3-molecular-evolution-dnds), changements d’acide aminé favorisés — le sillon de liaison au peptide du CMH, l’enveloppe du VIH, le lysozyme des ruminants.

**Exercice 25.4 ★.**

Pourquoi Kimura a-t-il conclu que la plupart des substitutions sont neutres ? Redire l’argument avec les nombres de l’ouverture du chapitre.

**Solution de Exercice 25.4.**

Les protéines comparées entre mammifères changent à raison d’environ une substitution par site et par milliard d’années ; sur un génome d’un milliard de sites codants et une génération de quelques années, cela fait de l’ordre d’une substitution fixée par génération, soit une tous les deux ans. Le coût de la sélection de Haldane autorise environ une substitution sélectionnée toutes les trois cents générations. Les rythmes diffèrent d’un facteur cent ou plus, de sorte que presque tous les changements fixés doivent être neutres.

**Exercice 25.5 ★★.**

$N = 5000$. Calculer la [probabilité de fixation](#thm-b3-molecular-evolution-neutral) d’une nouvelle mutation avec $s
= 0$, $s = 0.001$, $s = 0.01$ et $s = -0.001$, à l’aide de la formule de Kimura, et commenter lesquelles sont effectivement neutres.

**Solution de Exercice 25.5.**

Neutre : $1/2N = 10^{-4}$. $s = 0.001$, $4Ns = 20$ : $(1 - \mathrm{e}^{-0.002})/
(1 - \mathrm{e}^{-20}) = 0.002$. $s = 0.01$ : $0.0198$. $s = -0.001$ : $(1 -
\mathrm{e}^{0.002})/(1 - \mathrm{e}^{20}) = 0.002\,\mathrm{e}^{-20} =
4\times 10^{-12}$. Aucune n’est effectivement neutre : il faudrait pour cela $|4Ns|
\lesssim 1$, c’est-à-dire $|s| \lesssim 5\times 10^{-5}$ ; un coefficient de sélection d’un dixième de pour cent est déjà décisif dans une population de cinq mille.

**Exercice 25.6 ★★.**

Deux espèces diffèrent en $12\,\%$ des sites d’un gène dont le taux neutre vaut $2 \times 10^{-9}\,$ par site et par an. Estimer leur temps de divergence avec et sans la correction de Jukes–Cantor. Pour quelle différence brute la correction atteint-elle un facteur deux ?

**Solution de Exercice 25.6.**

Non corrigé : $T = 0.12/(2\times 2\times 10^{-9}) = 30\,\mathrm{Myr}$. Jukes–Cantor : $d = -\tfrac{3}{4}\ln(1 - 0.16) = 0.131$, $T =
33\,\mathrm{Myr}$. La correction atteint un facteur deux quand $-\tfrac{3}{4}
\ln(1 - 4p/3) = 2p$, vers $p \approx 0.6$ : à ce stade la différence brute a perdu l’essentiel de son information.

**Exercice 25.7 ★★.**

Un gène de 300 codons a 700 sites non synonymes et 200 sites synonymes. Entre deux espèces il montre 7 différences non synonymes et 10 synonymes. Calculer $p_{N}$, $p_{S}$ et $\omega$ (non corrigés). Quel régime de sélection ? Et si les comptes étaient 35 et 10 ?

**Solution de Exercice 25.7.**

$p_{N} = 7/700 = 0.010$, $p_{S} = 10/200 = 0.050$, $\omega = 0.2$ : [sélection purificatrice](#def-b3-molecular-evolution-dnds) qui retire quatre cinquièmes des changements d’acide aminé. Avec $35$ et $10$ : $p_{N} = 0.05$, $\omega = 1$ : aucune contrainte décelable — un [pseudogène](#def-b3-molecular-evolution-duplication), ou un gène où une [sélection positive](#def-b3-molecular-evolution-dnds) à certains sites compense une [sélection purificatrice](#def-b3-molecular-evolution-dnds) à d’autres.

**Exercice 25.8 ★★.**

Les séquences neutres de l’humain et du chimpanzé diffèrent en $1.2\,\%$ ; la séparation date de $6.5\,\mathrm{Myr}$, le temps de génération vaut $25\,\mathrm{yr}$. Estimer le taux de mutation par site et par génération, et le nombre de mutations nouvelles dans un génome diploïde de $6\times 10^{9}$ bases à chaque génération.

**Solution de Exercice 25.8.**

$k = d/2T = 0.012/(1.3\times 10^{7}) = 9.2\times 10^{-10}$ par site et par an ; $\mu = 25k = 2.3\times 10^{-8}$ par site et par génération ; $6\times
10^{9}\times 2.3\times 10^{-8} \approx 140$ mutations nouvelles par génome diploïde et par génération. Le séquençage direct de parents et d’enfants en trouve environ soixante-dix : l’estimation par la divergence est gonflée par le polymorphisme déjà présent dans la population ancestrale, qui ajoute quelques centaines de milliers de générations à la séparation apparente.

**Exercice 25.9 ★★.**

Avec $N = 50\,000$ et $T = 100\,000$ générations entre les deux séparations, calculer la fraction d’[arbres de gènes](#prop-b3-molecular-evolution-ils) discordants avec l’arbre des espèces pour l’humain, le chimpanzé et le gorille. Quel $T$ la porterait à $10\,\%$ ?

**Solution de Exercice 25.9.**

$\mathrm{e}^{-T/2N} = \mathrm{e}^{-1} = 0.37$ ; fraction discordante $\tfrac{2}{3}
\times 0.37 = 0.25$. Pour $10\,\%$ : $\mathrm{e}^{-T/2N} = 0.15$, $T =
2N\ln(1/0.15) = 190\,000$ générations.

**Exercice 25.10 ★★★.**

Montrer que la formule de Kimura se réduit à $1/2N$ quand $s \to 0$ et à $2s$ pour $4Ns \gg 1$, et que pour $s < 0$ avec $4N|s| \gg 1$ elle se comporte comme $2|s|\,\mathrm{e}^{-4N|s|}$. En déduire à quel point une mutation doit être délétère, dans une population de $10^{4}$, pour que sa [probabilité de fixation](#thm-b3-molecular-evolution-neutral) soit cent fois plus faible que celle d’une mutation neutre.

**Solution de Exercice 25.10.**

Quand $s \to 0$ : $1 - \mathrm{e}^{-2s} \approx 2s$ et $1 - \mathrm{e}^{-4Ns}
\approx 4Ns$, rapport $1/2N$. Pour $4Ns \gg 1$ le dénominateur vaut $1$ et le numérateur $\approx 2s$. Pour $s < 0$ avec $4N|s| \gg 1$ : numérateur $1 -
\mathrm{e}^{2|s|} \approx -2|s|$, dénominateur $1 - \mathrm{e}^{4N|s|} \approx
-\mathrm{e}^{4N|s|}$, donc $P \approx 2|s|\,\mathrm{e}^{-4N|s|}$. Cent fois sous la neutre dans $N = 10^{4}$ : $2|s|\,\mathrm{e}^{-4\times 10^{4}|s|} =
5\times 10^{-7}$ ; $|s| = 1.6\times 10^{-4}$ donne $3.2\times 10^{-4}\times
\mathrm{e}^{-6.4} = 5.3\times 10^{-7}$. Donc $|s| \approx 1.6\times 10^{-4}$, $4N|s| \approx 6.5$ : un désavantage d’un centième de pour cent suffit, chez dix mille individus, à rendre la fixation cent fois plus rare que le hasard.

**Exercice 25.11 ★★★.**

Un test de taux relatifs : un groupe externe $O$ est à la distance corrigée $0.30$ de la souris et $0.24$ de l’humain, et la souris et l’humain sont à $0.20$ l’un de l’autre. Calculer les longueurs de branche de la souris et de l’humain depuis leur séparation (en supposant le point de séparation équidistant d’$O$ sur les deux chemins), et leur rapport. Avec une génération de souris de $0.5\,\mathrm{yr}$ et une génération humaine de $25\,\mathrm{yr}$, que prédirait une horloge stricte par génération pour ce rapport, et que dit l’observation des taux de mutation par génération ?

**Solution de Exercice 25.11.**

Avec le point de séparation à la distance $a$ d’$O$ sur les deux chemins, $a + m =
0.30$, $a + h = 0.24$, $m + h = 0.20$ : $m - h = 0.06$, donc $m = 0.13$, $h
= 0.07$, rapport $1.9$. Une horloge stricte par génération donnerait le rapport des nombres de générations, $25/0.5 = 50$. Le $1.9$ observé signifie que la souris n’a accumulé que le double du changement humain par an malgré cinquante fois plus de générations : le taux de mutation par génération doit être quelque $25$ fois plus élevé chez l’humain — plus de divisions cellulaires germinales par génération — de sorte que par an les deux lignées ne diffèrent que d’un facteur deux.

**Exercice 25.12 ★★★.**

Un gène dupliqué est libéré de toute contrainte ($\omega = 1$) au taux neutre $k = 2 \times 10^{-9}\,$ par site et par an. Dans une séquence codante de 1000 bases, au bout de combien d’années environ attend-on le premier codon stop ou décalage du cadre (supposer qu’environ $4\,\%$ des mutations ponctuelles au hasard dans une séquence codante créent un codon stop, et négliger les indels) ? Comparer au temps dont dispose la sélection pour trouver une fonction nouvelle, et expliquer pourquoi la plupart des duplicats meurent.

**Solution de Exercice 25.12.**

Les substitutions créant un stop arrivent à $1000\times 2\times 10^{-9}\times
0.04 = 8\times 10^{-8}$ par an : la première est attendue au bout d’environ $12\,\mathrm{Myr}$ (les décalages du cadre divisent cela à peu près par deux). Dans cette fenêtre une mutation bénéfique, une sur $10^{3}$ à $10^{5}$ de toutes les mutations, a bien moins de chances d’arriver qu’un codon stop, et même quand elle arrive elle ne se fixe qu’avec la probabilité $2s$. La copie est donc d’ordinaire morte avant que la sélection ait pu lui trouver un usage — la demi-vie observée des duplicats chez les vertébrés est de quelques millions d’années.

## 25.7 Problème : le rythme du changement

**Problème 25.1.**

Problème du week-end — l’histoire d’un génome en chiffres : le taux de mutation tiré de la divergence humain–chimpanzé, la charge de substitution de Kimura, les chances de fixation des mutations sélectionnées, l’$\omega$ d’un gène tiré de comptes de codons, l’horloge lue pour une duplication, et la discordance des arbres de gènes chez les grands singes, pour finir sur le taux de mutation, l’$\omega$ du gène et la fraction discordante

Données : divergence neutre humain–chimpanzé $d = 0.012$ ; séparation il y a $6.5\,\mathrm{Myr}$ ; génération $25\,\mathrm{yr}$ ; génome diploïde de $6\times
10^{9}$ bases, $1.5\,\%$ de codant. Population ancestrale $N =
50\,000$. Gène : 400 codons, 920 sites non synonymes et 280 sites synonymes ; différences humain–souris 46 non synonymes et 84 synonymes. Séparation humain–souris $90\,\mathrm{Myr}$. Globine : $\alpha$ et $\beta$ diffèrent en $55\,\%$ des sites d’acides aminés (brut) ; taux de l’hémoglobine $1 \times 10^{-9}$ par site et par an. Grands singes : $T$ entre les séparations du gorille et du chimpanzé $80\,000$ générations. Limite de Haldane : une substitution sélectionnée par 300 générations.

**Partie I — Le taux.**

1. À partir de $d = 2kT$ , calculer $k$ par site et par an, puis $\mu$ par site et par génération.
2. Mutations nouvelles par génome diploïde et par génération, et combien d’entre elles tombent dans du codant.
3. Substitutions fixées par génération dans tout le génome au taux neutre (la population fixe $\mu$ par site et par génération). Comparer à la limite de Haldane et tirer la conclusion de Kimura.
4. Dans une population de $N = 50\,000$ , combien de mutations neutres nouvelles apparaissent par site et par génération dans toute la population, et quelle fraction d’entre elles se fixera un jour ?
5. Combien de temps met une mutation neutre destinée à se fixer, en générations et en années ? Comparer au temps écoulé depuis la séparation humain–chimpanzé.
6. Expliquer pourquoi, malgré la question 5, la divergence entre deux espèces mesure le temps écoulé depuis leur séparation et non celui écoulé depuis la fixation de leurs allèles.

**Partie II — Les chances de la sélection.**

7. [Probabilité de fixation](#thm-b3-molecular-evolution-neutral) d’une mutation neutre dans $N = 50\,000$ , et d’une mutation à $s = 0.001$ , $s = 0.01$ , $s = 0.1$ .
8. Pour quel $s$ a-t-on $4Ns = 1$ ? Interpréter la frontière.
9. Une mutation délétère à $s = -0.001$ : [probabilité de fixation](#thm-b3-molecular-evolution-neutral) rapportée à la neutre. Et à $s = -10^{-5}$ ?
10. Si une fraction $10^{-5}$ des mutations nouvelles d’un gène sont bénéfiques avec $s = 0.01$ et le reste neutre, quelle fraction des substitutions de ce gène est adaptative ? Commenter la rareté avec laquelle la sélection se voit dans la séquence, même quand elle agit.
11. Calculer $p_{N}$ et $p_{S}$ pour le gène humain–souris, corriger chacun par Jukes–Cantor, et donner $\omega$ .
12. Interpréter $\omega$ ; et estimer le taux neutre qu’implique le $d_{S}$ du gène (par site et par an) à l’aide du temps de séparation. Est-ce cohérent avec la question 1 ?

**Partie III — Horloges et copies.**

13. Corriger la différence entre les globines $\alpha$ et $\beta$ pour les coups multiples (employer $d = -\ln(1 - p)$ , la version protéique à nombreux états), et dater la duplication avec le taux de l’hémoglobine.
14. La date tombe près de l’origine des vertébrés à mâchoires ( $450\text{ à }500\,\mathrm{Myr}$ ). Qu’autorisent des chaînes $\alpha$ et $\beta$ séparées qu’une chaîne unique n’autorise pas ?
15. Les fibrinopeptides changent à $8\times 10^{-9}$ par site et par an. Deux espèces séparées depuis $40\,\mathrm{Myr}$ : différence brute attendue ? Pourquoi cette protéine est-elle inutile pour dater des séparations de $500\,\mathrm{Myr}$ ?
16. L’ [histone](https://one-course.com/books/biology/5/fr/chapter/1-chromatine-et-epigenetique#def-b3-chromatin-epigenetics-nucleosome) H4 change à $10^{-11}$ : combien de substitutions sur 100 sites en $1000\,\mathrm{Myr}$ ? Pourquoi est-elle inutile pour dater des séparations récentes ?
17. Un gène dupliqué dérive avec $\omega = 1$ dès la duplication. Si $4\,\%$ des substitutions dans du codant créent un stop, et que le gène a 1200 sites au taux $2\times  10^{-9}$ par site et par an, estimer le temps attendu jusqu’au premier codon stop.
18. Pourquoi une [duplication du génome entier](https://one-course.com/books/biology/5/fr/chapter/4-genomique-et-sequencage#def-b3-genomics-comparative) donne-t-elle aux duplicats une meilleure chance de survie qu’une simple duplication en tandem ?

**Partie IV — Des arbres dans des arbres.**

19. Probabilité qu’une lignée humaine et une lignée de chimpanzé ne coalescent pas dans les $80\,000$ générations qui précèdent la séparation du gorille.
20. Fraction d’ [arbres de gènes](#prop-b3-molecular-evolution-ils) discordants avec l’arbre des espèces. Observé : environ $30\,\%$ . Est-ce cohérent ?
21. Parmi les arbres discordants, quelle fraction groupe l’humain avec le gorille, et quelle fraction le chimpanzé avec le gorille ? Qu’indiquerait un écart marqué à l’égalité ?
22. Si la population ancestrale avait valu $N = 10\,000$ , quelle fraction discordante attendre ? Que dit donc la fraction observée des effectifs de nos ancêtres ?
23. Pourquoi concaténer mille gènes en un seul [alignement](https://one-course.com/books/biology/5/fr/chapter/5-bio-informatique-et-analyse-des-sequences#def-b3-bioinformatics-alignment) donne-t-il un arbre assuré mais possiblement faux, et que fait à la place une méthode fondée sur le coalescent ?
24. L’ADN de Néandertal chez les humains non africains fait environ $2\,\%$ et les arbres qui le portent groupent certains Européens avec les Néandertaliens plus souvent que les Africains. Pourquoi n’est-ce pas un [tri incomplet des lignées](#prop-b3-molecular-evolution-ils) ?
25. Résumer : $\mu$ (question 1), l’ $\omega$ du gène (question 11), et la fraction discordante (question 20).

**Solution de Problème 25.1.**

**1.** $k = 0.012/(2\times 6.5\times 10^{6}) = 9.2\times 10^{-10}$ par site et par an ; $\mu = 25k = 2.3\times 10^{-8}$ par site et par génération. **2.** $6\times 10^{9}\times 2.3\times 10^{-8} \approx 140$ mutations nouvelles par génome diploïde ; $1.5\,\%$ d’entre elles, environ $2$, dans du codant. **3.** Par génome haploïde, $3\times 10^{9}\times 2.3\times 10^{-8}
\approx 70$ substitutions fixées par génération, contre le $1/300$ de Haldane : vingt mille fois plus que ce que la sélection pourrait mener, de sorte que l’écrasante majorité est neutre. **4.** $2N\mu = 10^{5}\times 2.3\times 10^{-8} = 2.3\times 10^{-3}$ mutations nouvelles par site et par génération dans la population ; $1/2N =
10^{-5}$ d’entre elles se fixeront. **5.** $4N = 200\,000$ générations, $5\,\mathrm{Myr}$ — presque aussi longtemps que le temps écoulé depuis la séparation. **6.** La divergence compte les mutations apparues le long des deux lignées séparées depuis leur ancêtre commun ; chacune se fixe dans sa propre lignée, et le rythme à long terme vaut $\mu$ quel que soit le temps que chacune met, puisque les mutations apparaissent régulièrement et que le retard ne fait que différer le flux sans le changer. (La seule correction concerne le polymorphisme présent à la séparation, qui rend l’ancêtre commun de deux allèles plus vieux que la séparation des espèces.) **7.** Neutre $10^{-5}$ ; $s = 0.001$ : $0.002$ ; $s = 0.01$ : $0.0198$ ; $s = 0.1$ : $1 - \mathrm{e}^{-0.2} = 0.18$. **8.** $s = 1/4N = 5\times 10^{-6}$ : en dessous la dérive noie la sélection et la mutation se comporte comme neutre ; au-dessus la sélection gouverne les chances. **9.** $s = -0.001$ : $P = 0.002\,\mathrm{e}^{-200}$, nulle à toutes fins utiles — $10^{-85}$ de la neutre. $s = -10^{-5}$, $4N|s| = 2$ : $P =
2\times 10^{-5}/(\mathrm{e}^{2} - 1) = 3.1\times 10^{-6}$, $31\,\%$ de la neutre : les mutations faiblement délétères se fixent bel et bien. **10.** Substitutions bénéfiques par site et par génération : $2N\times
10^{-5}\mu\times 2s = 10^{5}\times 10^{-5}\times 0.02\,\mu = 0.02\mu$ ; neutres : $\approx\mu$. Fraction adaptative $0.02/1.02 \approx 2\,\%$. Bien que chaque mutation bénéfique ait deux mille fois plus de chances de se fixer qu’une neutre, elles sont si rares qu’une substitution sur cinquante seulement est adaptative : la sélection agit et se voit à peine. **11.** $p_{N} = 46/920 = 0.050$, $p_{S} = 84/280 = 0.30$. Corrigés : $d_{N} = -\tfrac{3}{4}\ln(1 - 0.0667) = 0.052$, $d_{S} = -\tfrac{3}{4}
\ln(1 - 0.40) = 0.38$. $\omega = 0.14$. **12.** [Sélection purificatrice](#def-b3-molecular-evolution-dnds) qui retire environ $86\,\%$ des changements d’acide aminé — un gène typique. $k = d_{S}/2T = 0.38/(1.8\times
10^{8}) = 2.1\times 10^{-9}$ par site et par an : le double de la valeur humain–chimpanzé, comme on l’attend d’une comparaison qui inclut la lignée des rongeurs à l’horloge rapide ; le même ordre de grandeur. **13.** $d = -\ln(1 - 0.55) = 0.80$ par site ; $T = 0.80/(2\times
10^{-9}) = 400\,\mathrm{Myr}$. **14.** Deux chaînes différentes font le tétramère $\alpha_{2}\beta_{2}$, dont la liaison coopérative de l’oxygène, l’[effet Bohr](https://one-course.com/books/biology/5/fr/chapter/7-biologie-structurale-des-proteines#prop-b3-structural-biology-mechanism) et le contrôle allostérique par le 2,3-bisphosphoglycérate dépendent de l’interface entre sous-unités dissemblables ; et le groupe $\beta$ a pu ensuite se diversifier en chaînes embryonnaires, fœtales et adultes d’affinités différentes. **15.** $2kT = 2\times 8\times 10^{-9}\times 4\times 10^{7} = 0.64$ substitution par site ; avec la saturation entre vingt acides aminés la différence brute vaut environ $0.95(1 - \mathrm{e}^{-0.64/0.95}) \approx 0.47$. À $500\,\mathrm{Myr}$, $d = 8$ : chaque site a changé bien des fois et la différence brute se tient à son plafond de $95\,\%$, sans porter aucune information sur le temps. **16.** $10^{-11}\times 10^{9}\times 100\times 2 = 2$ substitutions entre deux lignées sur 100 sites en un milliard d’années. Pour une séparation de $10\,\mathrm{Myr}$ l’espérance vaut $0.02$ : presque toujours aucune différence, donc aucune résolution. **17.** $1200\times 2\times 10^{-9}\times 0.04 = 9.6\times 10^{-8}$ par an : le premier stop est attendu au bout d’environ $10\,\mathrm{Myr}$. **18.** Doubler le génome entier double tous les gènes à la fois, de sorte que la stœchiométrie des protéines qui interagissent est préservée et qu’aucun déséquilibre de dosage ne sélectionne contre les copies ; un duplicat en tandem isolé change la dose d’un seul gène et est souvent délétère, ou aussitôt redondant et libre de se délabrer. **19.** $\mathrm{e}^{-80\,000/100\,000} = \mathrm{e}^{-0.8} = 0.45$. **20.** $\tfrac{2}{3}\times 0.45 = 0.30$ : cohérent avec les $30\,\%$ observés. **21.** La moitié chacune, $15\,\%$ de tous les arbres groupant l’humain avec le gorille et $15\,\%$ le chimpanzé avec le gorille. Un net excès de l’un indiquerait un flux de gènes entre ces deux espèces après leur séparation, que la dérive ne peut produire. **22.** $N = 10\,000$ : $\mathrm{e}^{-4} = 0.018$, discordance $1.2\,\%$. Les $30\,\%$ observés exigent donc une population ancestrale de quelque cinquante mille — plusieurs fois l’effectif efficace des humains d’aujourd’hui. **23.** La concaténation suppose que chaque gène a l’arbre des espèces ; avec le [tri incomplet des lignées](#prop-b3-molecular-evolution-ils) les gènes ont de nombreux arbres, et pour des branches internes courtes l’arbre de gène le plus fréquent peut différer de l’arbre des espèces, de sorte que plus de données rendent la mauvaise réponse plus assurée. Une méthode fondée sur le coalescent calcule, pour chaque [arbre d’espèces](#prop-b3-molecular-evolution-ils) candidat, la distribution attendue des [arbres de gènes](#prop-b3-molecular-evolution-ils), et retient l’[arbre d’espèces](#prop-b3-molecular-evolution-ils) qui explique le mieux les fréquences observées. **24.** Le [tri incomplet des lignées](#prop-b3-molecular-evolution-ils) s’est produit dans la population ancestrale commune de tous les humains modernes, de sorte qu’il rendrait toutes les populations humaines également apparentées aux Néandertaliens. Un excès chez les non-Africains signifie que des allèles néandertaliens sont entrés après le départ d’Afrique des ancêtres des non-Africains : un métissage, il y a quelque cinquante mille ans. **25.** $\mu \approx 2.3\times 10^{-8}$ par site et par génération ; $\omega \approx 0.14$ ; environ $30\,\%$ des [arbres de gènes](#prop-b3-molecular-evolution-ils) sont discordants avec l’arbre des espèces.
