II. Diagnostic du microbiote

II. 2. Le séquençage d'amplicons fondé sur l'ARNr 16S – puissant mais limité

Le séquençage de l'ARNr 16S est peu coûteux et bien validé : il révèle de façon fiable les grands groupes bactériens – mais il ne voit qu'une partie de l'écosystème intestinal.

Anecdote

À la fin du XIXe siècle, les géologues ont compris que les fossiles trouvés dans différentes strates rocheuses pouvaient révéler à quelle époque telle ou telle espèce avait vécu. La méthode était brillante – mais elle comportait une limite fondamentale : elle ne pouvait donner à voir que les organismes ayant laissé des restes fossiles. Les mollusques, les champignons et la plupart des microbes disparaissaient sans laisser de trace. Le registre fossile était réel, mais il était incomplet. L'analyse de l'ARNr 16S fonctionne selon une logique comparable : elle montre de façon fiable ce qu'elle peut montrer – mais elle ne voit qu'une partie de l'écosystème intestinal [456].

Le gène de l'ARN ribosomique 16S est présent chez tous les procaryotes, mais sa séquence diffère d'une espèce à l'autre – c'est ce qui rend l'identification bactérienne possible. Dans le séquençage d'amplicons, l'ADN est extrait d'un échantillon de selles, un segment défini du gène 16S (une région dite variable, V1–V9) est amplifié puis séquencé. Le résultat est une carte de composition : quel taxon bactérien est présent, et dans quelle proportion, dans l'échantillon.

Les avantages de la méthode sont réels. Elle peut être appliquée à un grand nombre d'échantillons pour un coût relativement faible. Elle s'appuie sur des bases de données bien validées (SILVA, Greengenes). Elle est capable d'identifier les phylums les plus caractéristiques du microbiome intestinal humain. À des fins de recherche – en particulier dans les études de population – c'est un outil éprouvé [162].

La méthode présente des limites cliniquement significatives et documentées sur le plan méthodologique. Elles sont examinées en détail dans la sous-section « Les cinq limites fondamentales » ci-dessous. Une limite mérite d'être soulignée à part :

Limites de l'identification au niveau de l'espèce : la plupart des analyses 16S ne permettent une identification fiable que jusqu'au niveau du genre ; la différenciation au niveau de l'espèce ou de la souche est souvent impossible. Cela peut être déterminant en clinique, car des souches pathogènes et inoffensives peuvent coexister au sein d'un même genre.

Imaginez des milliers de jeux LEGO différents dont toutes les pièces seraient lancées en l'air simultanément ; à partir des pièces éparpillées sur le sol, il faudrait ensuite déterminer exactement quels jeux étaient présents et combien de pièces comptait chacun d'eux. La difficulté est aggravée par le fait qu'on ne peut pas ramasser chaque pièce – certaines ont roulé sous le lit, d'autres sont restées collées entre elles, et certaines ressemblent tellement à d'autres qu'on ne peut pas les distinguer à l'œil nu. Voilà l'essence de l'analyse de l'ARNr 16S : nous lisons dans l'ADN intestinal quel « jeu » bactérien était présent – mais nous n'examinons de chacun qu'un seul élément caractéristique (une région variable du gène 16S), et non le jeu entier. Le résultat est une image réelle mais incomplète : elle montre les grands groupes, mais des éléments semblables peuvent être confondus, les pièces sous le lit (souches non cultivables) restent invisibles, et nous ne pouvons pas dire exactement combien de pièces de chaque jeu étaient présentes.

Algorithmes d'analyse : interpolation et hallucination

Lorsqu'un logiciel traite les données brutes du séquençage 16S – des millions de courts fragments d'ADN –, il passe par deux étapes critiques : le regroupement (formation d'OTU ou d'ASV) et l'appariement avec une base de données [163]. Dans la formation d'OTU, les séquences semblables sont regroupées en une seule unité ; la méthode ASV, à l'inverse, prend en compte les différences jusqu'au niveau du nucléotide isolé. Les deux approches identifient des « espèces » différentes à partir des mêmes données.

Lors de l'appariement avec la base de données, le programme attribue une séquence inconnue à une bactérie connue – mais seulement s'il existe une référence suffisamment proche dans la base. S'il n'y en a aucune, le logiciel interpole : il déduit ce que l'organisme inconnu « pourrait être » à partir de son plus proche parent connu. C'est une approximation utile – mais ce n'est pas une mesure. L'interpolation signifie que ce que nous voyons dans le rapport relève en partie de l'observation véritable et en partie de l'estimation algorithmique [163]. Les deux sont généralement impossibles à distinguer dans le résultat final.

Un cas plus grave survient lorsque le programme hallucine : il « identifie » une bactérie qui n'est en réalité pas présente dans l'échantillon, l'ayant appariée à tort à une entrée de la base de données sur la foi d'une similarité de séquence. Cela se produit en particulier avec les taxons peu abondants, où une seule « lecture erronée » peut apparaître dans le rapport sous forme d'une présence exprimée en pourcentage. Le phénomène n'est pas théorique : dans les études de reproductibilité, des taxons « détectés » apparaissent régulièrement dans les témoins négatifs – lesquels, en théorie, ne devraient contenir aucune bactérie [456].

Qu'est-ce que cela signifie pour le patient ?

Lorsqu'une personne fait réaliser un test du microbiome fondé sur l'ARNr 16S, le rapport obtenu contient généralement des camemberts en couleurs, des pourcentages et des plages de référence [162]. L'interprétation semble d'une simplicité tentante : cette valeur est basse, nous sommes au-dessus ou en dessous de la plage « optimale ». La réalité est pourtant nettement plus complexe.

Premièrement, définir une « plage de référence » n'a rien de trivial. Le microbiome humain sain présente une variabilité interindividuelle extrêmement élevée – la composition du microbiote intestinal de deux personnes parfaitement en bonne santé peut différer considérablement au niveau de l'espèce, alors que l'une comme l'autre sont fonctionnellement stables et en bonne santé. Se comparer à un microbiome « moyen sain » peut donc induire en erreur : l'« optimum » individuel est différent pour chaque personne [325], [163], [162].

Deuxièmement, l'analyse 16S montre seulement qui est présent – et non ce que ces micro-organismes font [163]. La présence d'une bactérie ne signifie pas qu'elle est active, qu'elle produit des métabolites en quantités fonctionnellement pertinentes, ni qu'elle participe actuellement à un processus pathologique. Plusieurs étapes séparent une carte génétique de l'activité fonctionnelle – et le 16S n'en mesure aucune.

Rien de tout cela ne signifie que le test est sans valeur. Comparé à lui-même – même méthode, même laboratoire, même protocole de prélèvement, répété dans le temps –, il peut réellement montrer comment la composition du microbiome évolue en réponse à un traitement (une FMT, par exemple). C'est dans cette application longitudinale, de suivi, que le diagnostic 16S possède aujourd'hui son utilité clinique la plus convaincante [163].

Les cinq limites fondamentales de la technologie de l'ARNr 16S

Malgré son élégance technologique, le séquençage d'amplicons fondé sur l'ARNr 16S comporte cinq limites documentées sur le plan méthodologique qui affectent la fiabilité clinique :

1. Contamination par les réactifs et le laboratoire (« kit-ome »). L'ADN provenant des kits de laboratoire, des réactifs et des équipements peut produire un bruit de fond supérieur à celui de l'échantillon lui-même – surtout pour les échantillons à faible biomasse [456], [183]. Les échantillons de selles sont habituellement assez riches pour diluer la contamination, mais les échantillons cutanés ou muqueux peuvent être fortement faussés.

2. Faible biomasse – erreur élevée. Plus le contenu bactérien est faible, plus la part relative de l'ADN contaminant est élevée, et le résultat peut devenir totalement trompeur [183]. Sur le plan clinique, les conditions de prélèvement (moment, méthode, conservation) influencent directement le résultat.

3. Le choix de la région V modifie le profil. Les régions hypervariables du gène 16S (V1–V2, V3–V4, V4, V6–V8, etc.) sont ciblées par différents couples d'amorces « universelles ». Le même échantillon analysé avec un ciblage de région V différent produit des profils de communauté différents ; certains groupes bactériens sont bien détectés par une région et mal par une autre [457]. Deux laboratoires utilisant des amorces différentes peuvent rapporter des « microbiotes » différents pour un même patient.

4. Variabilité entre laboratoires. Le consortium MBQC (Microbiome Quality Control) a démontré que des échantillons identiques traités dans différents laboratoires, avec des kits et des pipelines bio-informatiques différents, donnent des résultats substantiellement différents [162]. Conséquence clinique : les tests de prestataires différents ne sont pas directement comparables.

5. Proportions relatives, et non comptages absolus. Le 16S (comme le shotgun) fournit des données compositionnelles : les proportions relatives des taxons, non leur nombre absolu de cellules. Si un taxon « augmente » dans le rapport, cela peut en réalité refléter une diminution d'autres taxons [458]. La quantification absolue (calibration par qPCR ou par cytométrie en flux) peut donner une image différente – ce point est traité en détail au chapitre II.4.

Ces limites ne disqualifient pas le 16S comme outil de recherche, mais elles justifient la prudence interprétative dans la décision clinique.

Perle clinique

L'analyse de l'ARNr 16S ressemble surtout à une carte n'indiquant que les noms des villes – sans les routes, sans le trafic, sans l'état des bâtiments. Elle montre qui est présent dans l'intestin, mais ne dit pas ce que ces micro-organismes font. Pour la décision clinique, cette carte seule suffit rarement.

Références

[162] Sinha R, Abu-Ali G, Vogtmann E et al. Assessment of Variation in Microbial Community Amplicon Sequencing by the Microbiome Quality Control (MBQC) Project Consortium. Nature Biotechnology. 2017. Link

L'étude de référence du Microbiome Quality Control (MBQC) a évalué la variabilité du profilage taxonomique entre 15 laboratoires et 9 protocoles bio-informatiques à l'aide d'échantillons de selles en aveugle, de chémostat et de communautés artificielles. La variabilité dépendait avant tout du type et de l'origine de l'échantillon biologique, puis de l'extraction d'ADN, de l'environnement de manipulation des échantillons et du pipeline bio-informatique. L'analyse des communautés artificielles a révélé des différences quantitatives d'efficacité d'extraction et de classification bio-informatique. Ces résultats soulignent la nécessité d'une standardisation permettant la méta-analyse des études de microbiome à l'échelle des populations.

[163] Gloor GB, Macklaim JM, Pawlowsky-Glahn V, Egozcue JJ. Microbiome datasets are compositional: and this is not optional. Front Microbiol. 2017. Link

Les jeux de données de microbiome générés par séquençage à haut débit d'amplicons 16S rRNA, de métagénomes ou de métatranscriptomes sont intrinsèquement compositionnels, car l'instrument impose un total arbitraire. La revue explique les pathologies qui surviennent lorsque des données compositionnelles sont analysées par des méthodes non compositionnelles et fournit des orientations pour appliquer l'analyse de données compositionnelles à l'ensemble du flux de travail des études de microbiome. Le cadre compositionnel est présenté comme essentiel, et non optionnel, pour une inférence valide.

[183] Eisenhofer R, Minich JJ, Marotz C et al. Contamination in Low Microbial Biomass Microbiome Studies: Issues and Recommendations. Trends Microbiol. 2019. Link

Afin d'évaluer l'impact d'une biomasse microbienne décroissante sur le séquençage du gène 16S rRNA, les auteurs ont généré une série de dilutions d'une communauté artificielle et testé quatre approches computationnelles de décontamination : filtrage à partir des séquences des contrôles négatifs, filtrage par abondance relative, filtrage par corrélation inverse avec la concentration en ADN (Decontam) et modélisation des sources de contamination (SourceTracker). Comme attendu, la proportion d'ADN bactérien contaminant augmentait à mesure que la biomasse initiale diminuait, atteignant 80,1 % dans l'échantillon le plus dilué. Ce benchmark fournit des recommandations pratiques pour le choix des méthodes de décontamination dans les études de microbiote à faible biomasse et souligne les limites des approches in silico.

[325] Falony G, Joossens M, Vieira-Silva S, et al. Population-level analysis of gut microbiome variation. Science. 2016. Link

Un bref résumé de la publication citée est en cours de préparation.

[456] Salter SJ, Cox MJ, Turek EM et al. Reagent and Laboratory Contamination Can Critically Impact Sequence-Based Microbiome Analyses. BMC Biology. 2014. Link

L'ADN contaminant se révèle ubiquitaire dans les kits d'extraction d'ADN et les réactifs de laboratoire couramment utilisés, sa composition variant fortement selon les kits et les lots. Cette contamination fausse de manière critique les résultats obtenus à partir d'échantillons à faible biomasse microbienne, tant dans les analyses du gène 16S rRNA que dans la métagénomique shotgun. Les auteurs fournissent une liste étendue des genres potentiellement contaminants et des recommandations d'atténuation, et appellent à la prudence dans l'application des techniques fondées sur le séquençage aux environnements microbiens à faible biomasse.

[457] Yang B, Wang Y, Qian PY. Sensitivity and Correlation of Hypervariable Regions in 16S rRNA Genes in Phylogenetic Analysis. BMC Bioinformatics. 2016. Link

Cette étude a développé un pipeline bioinformatique in silico afin d'évaluer avec quelle fiabilité les régions hypervariables du gène 16S rRNA représentent la séquence de pleine longueur en analyse phylogénétique, en utilisant la distance géodésique pour comparer quantitativement la topologie des différents arbres phylogénétiques. Le principal résultat est que les régions V4-V6 étaient les plus fiables pour l'analyse phylogénétique de la plupart des phylums bactériens, tandis que V2 et V8 étaient les moins fiables.

[458] Vandeputte D, Kathagen G, D'hoe K et al. Quantitative Microbiome Profiling Links Gut Community Variation to Microbial Load. Nature. 2017. Link

Les analyses classiques du microbiote fécal fondées sur le séquençage ne fournissent que des abondances relatives, ce qui entrave le lien entre les caractéristiques du microbiome et les paramètres quantitatifs de l'hôte lorsque la charge microbienne varie d'un échantillon à l'autre. Les auteurs soutiennent que le profilage relatif peut masquer une modification de l'abondance microbienne totale, signal clé associé à la maladie, et plaident pour un profilage quantitatif du microbiome associant la composition relative à des mesures de densité cellulaire, afin de permettre une caractérisation authentique des interactions hôte–microbiote.

Auteurs:
PG
Dr. Patay Gábor
médecin, spécialiste du microbiote
BA
Dr. Bezzegh Attila
directeur médical, microbiologiste clinique
AM
Dra. Anna Munar
médecin, spécialiste de l'exposome
MicroBiome Bank — contenu professionnel validé médicalement. Dernière mise à jour : 2026.