II. 3. La métagénomique shotgun – une image plus complète, mais pas toute la vérité
La métagénomique shotgun lit la totalité de l'ADN de l'échantillon et donne une image plus riche, mais les incertitudes d'interprétation ne disparaissent pas – elles se déplacent.
Lorsque les premiers scanners à rayons X sont apparus dans les années 1970, la radiologie a été révolutionnée. La radiographie conventionnelle ne donnait qu'une image bidimensionnelle et composite du corps ; la tomodensitométrie montrait des coupes transversales, riches en détails, avec reconstruction tridimensionnelle. Les cliniciens étaient enthousiastes – mais il est vite apparu qu'une image plus détaillée ne signifiait pas en soi de meilleures décisions cliniques, si les résultats ne pouvaient pas être interprétés ou si la portée clinique de petites anomalies restait inconnue. Un compte rendu détaillé que nous ne savons pas replacer dans son contexte n'aide pas – il nuit parfois activement, en conduisant à des interventions inutiles. La métagénomique shotgun est confrontée aujourd'hui exactement à cette tentation.
La métagénomique shotgun ne séquence pas un gène particulier, mais la totalité du contenu en ADN de l'échantillon. Cela permet en principe d'identifier simultanément bactéries, virus, champignons, archées et ADN de l'organisme hôte [164], et même de cartographier les gènes fonctionnels – voies métaboliques, gènes de résistance aux antibiotiques. La technologie est véritablement impressionnante [446], [443].
Ses limites ne sont pourtant pas moins notables :
- Influence décisive du protocole d'extraction de l'ADN : des chercheurs ayant examiné le même échantillon avec 21 méthodes différentes ont obtenu des images microbiennes complètement différentes. La procédure d'extraction détermine à elle seule le résultat – avant même la première étape de séquençage [164].
- Prédominance de l'ADN de l'hôte : dans les échantillons de selles, l'ADN des cellules humaines noie souvent le signal microbien. Les souches bactériennes rares restent ainsi invisibles, à moins d'appliquer des étapes spécifiques de « déplétion de l'ADN de l'hôte » – lesquelles peuvent toutefois introduire de nouveaux biais [165].
- Rôle décisif du pipeline bio-informatique : traiter les mêmes données brutes de séquençage avec des logiciels différents (MetaPhlAn, Kraken, DIAMOND, etc.) produit des profils taxonomiques et fonctionnels sensiblement différents les uns des autres. L'étude comparative internationale CAMI (Critical Assessment of Metagenome Interpretation) a montré que les performances dépendent fortement de l'outil retenu et de son paramétrage : les profileurs taxonomiques diffèrent surtout dans l'estimation des abondances et dans la détection des taxons peu abondants, et la présence de souches étroitement apparentées dégrade aussi sensiblement la précision de l'assemblage et du binning [166].
- Présence de gènes fonctionnels ≠ fonction : le shotgun montre si un gène métabolique donné est présent dans l'échantillon – mais pas si ce gène est actif, exprimé, ni s'il assure effectivement le processus en question dans l'intestin. Déduire l'activité fonctionnelle de la présence d'un gène n'est possible qu'indirectement.
- Coût élevé, résultats lents : l'analyse métagénomique complète est considérablement plus coûteuse et plus longue que l'analyse 16S, ce qui la rend moins adaptée au suivi clinique.
Reprenons les mêmes milliers de jeux LEGO éparpillés – mais chaque pièce est désormais photographiée et mesurée. En principe, on dispose de bien plus de données. Le problème : certaines photos portent des empreintes humaines (ADN de l'hôte), la qualité dépend des réglages de l'appareil (protocole), et lancer un autre logiciel produit des identifications complètement différentes à partir des mêmes photos (pipeline). L'image plus détaillée est effectivement plus riche – mais les incertitudes d'interprétation ne disparaissent pas ; elles se déplacent.
Algorithmes d'analyse : interpolation et hallucination
En métagénomique shotgun, l'incertitude algorithmique est plus complexe d'un cran [164], [166], car l'analyse ne porte pas seulement sur la détermination de la composition mais aussi sur l'annotation fonctionnelle. Les logiciels (par exemple MetaPhlAn, Kraken, HUMAnN) génèrent des profils taxonomiques et fonctionnels à partir des données brutes de séquençage – mais ces deux étapes sont marquées par des erreurs d'interpolation et d'hallucination.
Au niveau taxonomique, l'interpolation signifie que le programme apparie un fragment de génome inconnu au génome connu le plus proche et l'attribue à cette espèce [166]. Si la base de données est incomplète – et des portions importantes du microbiome intestinal manquent encore de séquences de référence –, le programme attribue la séquence à un taxon sur la base d'une estimation plutôt que d'une mesure. Dans l'annotation fonctionnelle, la logique est similaire : si un fragment de gène présente 60–70 % de similarité avec un gène métabolique connu, le logiciel lui attribue la fonction correspondante – alors qu'avec 30–40 % de divergence, l'activité biochimique réelle peut être tout autre.
L'hallucination propre au shotgun survient surtout à l'intersection des taxons rares et de la contamination par l'ADN de l'hôte : des fragments d'ADN humain sont parfois identifiés comme des séquences bactériennes lorsque l'algorithme d'appariement à la base de données de référence ne parvient pas à les filtrer correctement. Dans l'étude comparative CAMI, cela a conduit différents pipelines à donner des identifications d'espèces mutuellement contradictoires dans jusqu'à 50 % des cas à partir du même échantillon.
Qu'est-ce que cela signifie pour le patient ?
La promesse séduisante de la métagénomique shotgun est l'exhaustivité : elle montre non seulement qui est présent, mais en principe aussi de quelles capacités fonctionnelles ces micro-organismes disposent [164], [166]. C'est indéniablement un niveau plus profond que le séquençage d'amplicons 16S. En pratique, cependant, ces données plus riches s'accompagnent des mêmes difficultés d'interprétation – et les accentuent à certains égards.
La plus grande idée fausse concernant l'analyse shotgun est que la richesse des données inclurait par nature la clarté clinique. Ce n'est pas le cas [164], [166]. La présence d'un gène métabolique dans le microbiome intestinal signifie seulement que le gène est là – ni qu'il est actif, ni qu'il est exprimé en quantité suffisante, ni que le métabolite produit atteint les tissus en quantités cliniquement pertinentes. Chaque étape de la chaîne « gène → protéine → fonction → effet clinique » exige sa propre méthode de mesure.
Le prix de l'analyse shotgun – plus de 200 000 à 400 000 HUF selon les données du marché hongrois de 2024 – peut faire naître l'attente d'une réponse plus précise ou plus fiable quant aux chances de succès d'une FMT ou d'autres interventions. Cette attente n'est actuellement pas fondée : la préparation de l'échantillon et le choix du pipeline bio-informatique modifient à eux seuls sensiblement l'image microbienne obtenue [164], [166]. Le prix reflète la complexité de la technologie – non la qualité de l'aide à la décision clinique.
Là où le shotgun possède un véritable avantage sur le 16S : dans des questions cliniques spécifiques et définies à l'avance. Par exemple, identifier des gènes de résistance aux antibiotiques en cas de suspicion d'infection nosocomiale, ou explorer les communautés virales et fongiques chez des patients immunodéprimés – ce sont là des indications où la connaissance de l'ensemble du contenu en ADN a de véritables implications thérapeutiques. Pour la sélection en vue d'une FMT ou le diagnostic général de dysbiose, en revanche, aucune étude comparative publiée ne démontre à ce jour une utilité clinique du shotgun supérieure à celle du 16S ; la littérature méthodologique montre en outre que la préparation de l'échantillon et l'interprétation bio-informatique introduisent à elles seules une variabilité technique importante dans les résultats métagénomiques [164], [166].
La métagénomique shotgun – quatre pièges méthodologiques
La métagénomique shotgun fournit une image plus complète que le 16S en séquençant l'ADN total, mais elle a ses propres limites bien documentées :
1. La préparation de l'échantillon biaise fortement les résultats. Costea et al. 2017 (Nature Biotechnology) ont comparé les mêmes échantillons de selles traités selon 21 protocoles d'extraction différents et ont obtenu des profils de microbiome entièrement différents – la méthode d'extraction détermine à elle seule le résultat [164]. En l'absence de standard industriel, la comparaison entre études devient presque impossible.
2. Excès d'ADN humain (de l'hôte) dans l'échantillon. Surtout dans les échantillons tissulaires ou cutanés, l'ADN humain écrase proportionnellement le signal microbien. Des étapes chimiques de déplétion de l'ADN de l'hôte sont utilisées pour y remédier, mais elles peuvent introduire de nouveaux biais [184]. Le problème est moindre pour les échantillons de selles, sans être nul – en particulier dans les états où la muqueuse est sensible (par exemple une MICI active).
3. Le choix du pipeline bio-informatique est déterminant. Le référentiel international CAMI (Critical Assessment of Metagenome Interpretation) a démontré systématiquement que les mêmes données brutes traitées par des logiciels différents (MetaPhlAn, Kraken, MEGAHIT, mOTUs, etc.) donnent des portraits de microbiome différents. Le choix du pipeline et de ses paramètres modifie donc à lui seul sensiblement le résultat [166].
4. Biais général, dépendant de la méthode. McLaren et al. 2019 (eLife) ont documenté de façon exhaustive que les mesures du microbiome contiennent régulièrement des biais systématiques, dépendants de la méthode, qui empêchent de comparer directement des résultats issus de protocoles différents sans procédures de correction [165]. Deux analyses shotgun du même patient dans des laboratoires différents peuvent ne pas aboutir à la même conclusion.
Le message clinique est le même que pour le 16S : la métagénomique shotgun, elle aussi, ne convient au suivi longitudinal que si la même méthode de prélèvement, le même laboratoire et le même algorithme d'analyse sont utilisés d'un bout à l'autre.
La métagénomique shotgun est comme un scanner : détaillée, impressionnante – mais la richesse du détail n'équivaut pas à elle seule à de meilleures décisions cliniques. La valeur d'un compte rendu ne dépend pas de sa résolution, mais de l'existence d'une question clinique dont la réponse change le traitement.
Références
[164] Costea PI, Zeller G, Sunagawa S et al. Towards Standards for Human Fecal Sample Processing in Metagenomic Studies. Nature Biotechnology. 2017. Link
Vingt et un protocoles représentatifs d'extraction d'ADN ont été testés sur des échantillons fécaux identiques et comparés aux effets de la préparation des banques et du stockage, au regard de la variation biologique intra-individuelle. L'extraction d'ADN exerçait le plus fort effet technique sur les résultats métagénomiques. Les protocoles ont été classés selon la quantité et la qualité d'ADN et les biais de diversité de la communauté et du rapport Gram-positif/Gram-négatif. Les auteurs recommandent, pour les études métagénomiques des selles humaines, une méthode d'extraction d'ADN standardisée et transférable, validée à l'aide d'une communauté mock de composition connue.
[165] McLaren MR, Willis AD, Callahan BJ. Consistent and Correctable Bias in Metagenomic Sequencing Experiments. eLife. 2019. Link
Les mesures de séquençage de gènes marqueurs et de métagénomique sont systématiquement biaisées en faveur de la détection de certains taxons, ce qui rend les abondances taxonomiques issues de protocoles différents quantitativement incomparables et propices à des conclusions biologiques erronées. Les auteurs proposent un modèle mathématique du biais expérimental fondé sur les propriétés d'expériences réelles et le valident avec des données 16S rRNA et de métagénomique shotgun issues de communautés bactériennes définies. Le modèle s'ajuste mieux aux données expérimentales que les cadres antérieurs, plus complexes, et ouvre une voie à la correction du biais.
[166] Sczyrba A, Hofmann P, Belmann P et al. Critical Assessment of Metagenome Interpretation -- A Benchmark of Metagenomics Software. Nature Methods. 2017. Link
Le défi Critical Assessment of Metagenome Interpretation (CAMI) a évalué les logiciels de métagénomique à l'aide de jeux de données réalistes très complexes issus d'environ 700 micro-organismes nouvellement séquencés et d'environ 600 virus et plasmides nouveaux. L'assemblage et le binning donnaient de bons résultats pour les espèces représentées par des génomes individuels, mais se dégradaient nettement en présence de souches étroitement apparentées. Le profilage taxonomique et le binning étaient performants aux rangs taxonomiques élevés, avec une chute marquée en dessous du niveau de la famille. Les réglages des paramètres influençaient fortement les performances, soulignant l'importance de la reproductibilité. CAMI fournit une feuille de route pour le choix des logiciels.
[184] Marotz CA, Sanders JG, Zuniga C et al. Improving Saliva Shotgun Metagenomics by Chemical Host DNA Depletion. Microbiome. 2018. Link
Afin de permettre le séquençage métagénomique shotgun d'échantillons oraux dominés par l'ADN de l'hôte, trois kits commerciaux de déplétion de l'hôte, une filtration par taille et une nouvelle méthode associant lyse osmotique et monoazoture de propidium (lyPMA) ont été comparés sur de la salive humaine. La lyPMA s'est révélée la méthode la plus efficace, réduisant la proportion de lectures alignées sur l'hôte de 89,29 ± 0,03 % dans les échantillons non traités à 8,53 ± 0,10 %. De plus, les échantillons traités par lyPMA présentaient le biais taxonomique le plus faible par rapport aux contrôles non traités. La méthode est recommandée pour l'enrichissement en ADN microbien à partir d'échantillons oraux riches en matériel de l'hôte dans les études métagénomiques.
[443] Qin J, Li R, Raes J et al. A human gut microbial gene catalogue established by metagenomic sequencing. Nature. 2010. Link
Le séquençage métagénomique sur plateforme Illumina d'échantillons fécaux de 124 individus européens (576,7 Gb de séquence) a produit un catalogue de 3,3 millions de gènes microbiens non redondants, environ 150 fois plus vaste que le complément génique humain. Les gènes étaient largement partagés entre les individus, avec plus de 99% d'origine bactérienne. La cohorte hébergeait un nombre estimé de 1 000–1 150 espèces bactériennes prévalentes, chaque individu portant au moins 160 espèces. L'étude définit un métagénome intestinal minimal et un génome bactérien intestinal minimal à partir des fonctions présentes chez tous les individus et chez la plupart des bactéries. Ces résultats établissent une référence fondatrice du potentiel génétique du microbiote intestinal humain.
[446] Turnbaugh PJ, Ley RE, Hamady M, Fraser-Liggett CM, Knight R, Gordon JI. The Human Microbiome Project. Nature. 2007. Link
Cadre stratégique exposant l'approche du Human Microbiome Project pour caractériser les composantes microbiennes du paysage génétique et métabolique humain. L'initiative vise à établir comment le microbiote contribue à la physiologie normale et à la prédisposition aux maladies. Elle constitue la déclaration programmatique fondatrice de la recherche sur le microbiome à grande échelle en population.

