Assemblage du transcriptome De Novo basé sur ARN-Seq et découverte de gènes de la tige charnue Cistanche Deserticola-Ⅰ
Jul 24, 2024
Arrière-plans
La Cistanche deserticola est une plante parasite totalement non photosynthétique avec une grande valeur médicinale et est principalement distribuée dans le désert du nord-ouest de la Chine. Sa tige charnue séchée est un tonique essentiel dansmédecine traditionnelle chinoiseavec pour rôle principal d'améliorer la fonction sexuelle masculine et de renforcer l'immunité, mais peu d'études mécanistiques ont été menées en partie à cause du manque de ressources génomiques et transcriptomiques.

CISTANCHE TUBULOSA NATUREL MÉDECINE TRADITIONNELLE CHINOIS PHGS75% ECH 30% ACT 12%
Résultats
Dans cette étude, nous avons effectué un séquençage profond du transcriptome dans la tige charnue de C. deserticola, et environ 80 millions de lectures ont été générées à l'aide du séquençage d'extrémité de paire Illumina sur la plateforme HiSeq2000. En utilisant l'assembleur Trinity, nous avons obtenu 95 787 séquences de transcription avec des longueurs de transcription allant de 200 pb à 15 698 pb, ayant une longueur moyenne de 950 bases et une longueur N50 de 1 519 bases. 63 957 transcrits ont été identifiés comme étant activement exprimés avec un FPKM supérieur ou égal à 0,5, dans lesquels 30 098 transcrits ont été annotés avec des descriptions de gènes ou des termes d'ontologie de gènes par des analyses de similarité de séquences sur plusieurs bases de données publiques (Uniprot, NR et Nt au NCBI et KEGG). . En outre, nous avons identifié des gènes enzymatiques clés impliqués dans la biosynthèse de la lignine et des glycosides phényléthanoïdes (PhG), connus pour être les principaux ingrédients actifs. Quatre gènes de phénylalanine ammoniaque-lyase (PAL), la première enzyme clé dans la biosynthèse de la lignine et du PhG, ont été identifiés sur la base d'une comparaison de séquences et d'une analyse phylogénétique. Deux voies de biosynthèse des PhG ont également été proposées pour la première fois.
Conclusions
Au total, nous avons réalisé une analyse globale du transcriptome de la tige charnue de C. deserticola en utilisant la technologie RNA-seq. Une collection de gènes enzymatiques liés à la biosynthèse de la lignine et des glycosides phényléthanoïdes ont été identifiés à partir des transcrits assemblés et annotés, et la famille de gènes PAL a également été prédite. Les données de séquence de cette étude constitueront une ressource précieuse pour mener de futures recherches sur la biosynthèse des glycosides phényléthanoïdes et des études génomiques fonctionnelles sur cette plante médicinale importante.
Introduction
C. deserticola est un genre mondial de plantes vivaces du désert de la famille des Orobanchaceae et est une espèce totalement non photosynthétique et pousse généralement une plante holoparasite souterraine. Il est parasité sur les racines du psammophyte Haloxylon ammodendron (Chenopodiaceae), qui habite principalement les déserts et semi-déserts en raison de sa haute tolérance à la sécheresse et à la salinité. C. deserticola présente une forte résistance aux conditions environnementales difficiles et est principalement répartie dans le nord-ouest de la Chine, en particulier en Mongolie intérieure, au Gansu et au Xinjiang. Il est considéré comme une espèce sauvage en voie de disparition ces dernières années en raison de la consommation accrue par l’homme. C. deserticola, souvent appelé ginseng du désert, est communément appelé orobanche du désert et la tige charnue séchée est largement utilisée comme tonique traditionnellement important en Chine et au Japon depuis de nombreuses années. Il a été initialement enregistré dans Shen Nong Ben Cao Jing (Dictionnaire de la matière médicale chinoise, 1977) il y a environ 1 800 ans et était considéré comme l'une des principales sources de laCistanche, plante médicinale chinoise.

CISTANCHE TUBULOSA NATUREL POUR AMÉLIORER LA FONCTION SEXUELLE PHGS75% ECH 30% ACT 12%
Les extraits de C. deserticola possèdent un large éventail de fonctions médicinales, notamment pour une utilisation dans l'amélioration de la fonction sexuelle, la tonification des reins, la protection du foie, l'activité apéritive, l'amélioration de la mémoire, l'activité immunomodulatrice, antioxydante, l'activité anti-inflammatoire, antivirale, etc. Les principaux composants bioactifs de C. deserticola sont les glycosides phényléthanoïdes (PheG, PhG). À ce jour, plus de 20 glycosides phényléthanoïdes ont été isolés de la tige succulente de C.deserticola. Parmi eux,Actéoside et échinacosidesont deux composants principaux ayant des activités pharmacologiques significatives et sont documentés comme normes de qualité de C. deserticola dans la pharmacopée chinoise (éditions 2005 et 2010). Trois composants chimiques des PhG sont l'acide organique, le saccharide et le phényléthanoïde. Cependant, les détails concernant les voies de biosynthèse des phényléthanoïdes restent mal compris chez C.deserticola.
Malgré l'importance commerciale et médicinale de C.deserticola, les données génomiques et transcriptomiques de cette espèce sont très limitées. Aucun EST n'est disponible dans la base de données NCBI et les informations complètes sur le génome de cette espèce restent indisponibles, à l'exception de la séquence du génome des chloroplastes. Les données transcriptomiques limitées entravent l'étude des mécanismes de biosynthèse du PhG. La technologie RNA-seq peut générer des séquences des parties exprimées du génome ciblé et identifier les gènes [18] à l'aide des plateformes technologiques NGS (telles que Applied Biosystems SOLiD, Illumina HiSeq et Roche 454). Il devient de plus en plus populaire dans l’assemblage de transcriptome de novo, car il s’agit d’une approche rentable et puissante avec une haute résolution et une large plage dynamique, d’autant plus qu’elle présente l’avantage d’explorer des transcriptions de faible abondance. En raison de ses divers avantages, l’ARN-seq est particulièrement intéressant pour les organismes non modèles dotés de ressources génétiques limitées. Cependant, il n’existe pas de recherche détaillée sur le transcriptome de C. deserticola par RNA-seq.
Dans cette étude, nous avons séquencé globalement le transcriptome de la tige de C. deserticola à l'aide de la plateforme Illumina Hiseq2000 et obtenu 7,9 G de données brutes. Par assemblage et annotation, nous avons extrait les gènes impliqués dans la biosynthèse du PhG et les gènes responsables de l'ensemble de la biosynthèse de la lignine. Notre analyse ARN-seq a généré le premier transcriptome consensuel de C. deserticola et a fourni de nouvelles informations sur une compréhension globale de la valeur médicinale de C. deserticola. De plus, la méthode décrite ici peut être largement appliquée au profil des transcriptomes afin de faciliter la découverte de gènes impliqués dans des voies spécifiques de biosynthèse de composants médicinaux dans une autre plante médicinale aux ressources génomiques très limitées.
Matériels et méthodes
Collecte de matériel végétal
La tige succulente fraîche de C. deserticola au stade de l'excavation a été collectée dans une base végétale de la ville de BayanHot de la Ligue Alxa en Mongolie intérieure, dans le nord-ouest de la Chine. Le permis de collecte a été obtenu auprès du propriétaire (HongKui CongRong Group) de la base végétale. Le spécimen de référence a été déposé au Core Genomic Facility de l’Institut de génomique de Pékin, Académie chinoise des sciences. Après le nettoyage, les tissus succulents de la tige ont été coupés en petits morceaux et immédiatement congelés dans de l'azote liquide, puis stockés à -80 degré jusqu'à un traitement ultérieur.
Extraction d'ARN, construction de bibliothèques d'ADNc et séquençage d'Illumina
L'ARN total a été extrait de la tige succulente à l'aide du réactif TRIzol (Invitrogen Inc., Californie, États-Unis) conformément aux instructions du fabricant. Les échantillons résultants ont été traités avec de la DNase I pour éliminer tout ADN génomique. Les ARN extraits ont été quantifiés à l'aide d'un bioanalyseur Agilent 2100 (Agilent Technologies) et leur intégrité a été vérifiée par électrophorèse sur gel d'agarose dénaturant avec coloration au bromure d'éthidium. Des échantillons d'ARN avec des ratios A260/A280 compris entre 1,9 et 2,1, des ratios d'ARN 28S : 18S supérieurs à 1,0 et des indices d'intégrité de l'ARN (RIN) -8.5 ont été utilisés dans des analyses ultérieures.
Les bibliothèques d'ARN-seq ont été générées à l'aide des kits de préparation d'échantillons d'ARN Illumina Truseq. L'ARN poly (A) + a été isolé de l'ARN total en utilisant des billes Dynal ligo (dT) 25 conformément aux instructions du fabricant. Après purification, un tampon de fragmentation a été ajouté pour briser l’ARNm en fragments courts. L'ADNc du premier brin a été synthétisé en utilisant ces courts fragments comme modèles, ainsi que la transcriptase inverse SuperScript III et l'amorce hexamère aléatoire N6. L'ADNc du deuxième brin a ensuite été synthétisé à l'aide d'un tampon, de dNTP, de RNaseH et d'ADN polymérase I. L'ADNc double brin résultant a été soumis à une réparation terminale à l'aide de l'ADN polymérase T4, de l'ADN polymérase I du fragment de Klenow et de la polynucléotide kinase T4, et ligaturé à adaptateurs utilisant l'ADN ligase T4. Les fragments ligaturés par l'adaptateur ont été purifiés à l'aide d'un kit d'extraction QiaQuick PCR et élués avec du tampon EB. Après analyse par électrophorèse sur gel d'agarose, les fragments appropriés ont été sélectionnés comme modèles pour l'amplification PCR. Le séquençage de la bibliothèque d'ADNc résultante a été réalisé avec un système Illumina HiSeq 2000.
Assemblage de novo des transcriptions et quantification de l’expression génique
Les lectures brutes générées à partir du séquençage ont été nettoyées en supprimant les séquences d'adaptateur (ATCTCGTATGCCCGTC) à l'aide d'une méthode interne. Nous avons ensuite effectué un processus de filtrage rigoureux de faible qualité. Premièrement, les bases avec un score de qualité phred inférieur à 20 seraient coupées à partir de la fin 3' de la séquence, jusqu'à tomber sur une base avec une qualité supérieure (supérieure ou égale à 20). Si la longueur de lecture était inférieure à 50 pb, elle serait ignorée. Deuxièmement, les lectures seront filtrées davantage selon le critère selon lequel 70 % des bases d'une lecture ont des scores de haute qualité (supérieurs ou égaux à 20). Troisièmement, seules les lectures appariées ont été utilisées pour un assemblage ultérieur. L'assemblage de transcription de novo a été réalisé à l'aide de la version Trinity _20130216 [30] qui comprenait trois modules logiciels successifs : Inchworm, Chrysalis et Butterfly. Les paramètres d'assemblage ont été définis comme ci-dessous : -seqType fq-JM 300G -min_contig_length 200-CPU 20-inchworm_cpu {{21} }bflyCPU 20.
Pour quantifier l'abondance des transcriptions, les lectures séquencées de fin de paire ont été réalignées sur les transcriptions assemblées à l'aide d'un script dans Trinity. Les lectures cartographiées ont été utilisées pour la quantification par le logiciel RSEM (RNA-Seq by Expectation Maximization). L'abondance des gènes ou des isoformes était représentée par la valeur du fragment par kilobase de transcrit par million de fragments cartographiés (FPKM), les transcrits dont la valeur FPKM était égale ou supérieure à 0,05 ont été définis comme exprimés.
Annotation fonctionnelle des transcriptions exprimées
Il n'existe aucun ensemble d'annotations génétiques de C. deserticola, à l'exception du génome des chloroplastes [1]. Nous avons annoté les transcriptions exprimées en les comparant aux ensembles de données Genbank Nt, Genbank Nr et TAIR10_ pep_20101214_mis à jour séparément à l'aide du programme BLAST (E< = 1e-20). Meanwhile, all expressed transcripts were translated into potential proteins according to ORF prediction by TransDecoder and predicated for the conserved domains based on the Pfam database.
Annotation des voies Gene Ontology et KEGG Par alignement de similarité de séquence sur la base de données Uniprot (l'annotation Gene Ontology (GO) de tous les transcrits assemblés a été obtenue en utilisant un fichier d'association téléchargé depuis (ftp://ftp.ebi.ac.uk/pub/ databases/GO/goa/UNIPROT/gene_association. goa_uniprot.gz). Le regroupement des termes GO des gènes exprimés a été réalisé à l'aide de scripts personnalisés, et nous avons annoté les gènes au quatrième niveau pour le Catégories CC, BP et MF séparément.
Les informations sur la voie KEGG ont été attribuées à toutes les séquences protéiques prédites à l'aide de l'outil en ligne KAAS (KEGG Automatic Annotation Server) (34). Des séquences au format fasta ont été soumises à la demande du KAAS et les fichiers résultants de toutes les informations sur les voies liées au transcriptome de la tige de C. deserticola ont été téléchargés. 13 ensembles de données génétiques d'organismes végétaux dans KEGG ont été utilisés pour l'annotation à l'aide de la méthode BBH (bi-directionnel best hit).

EXTRAIT NATUREL DE CISTANCHE TUBULOSA CISTANCHE PHGS75% ECH 30% ACT 12%
Analyse RT-qPCR
Après digestion avec la DNase I, environ 5 µg d'ARN total ont été convertis en ADNc premier brin via la réaction de transcription inverse avec des amorces oligo (dT) 15 et le système de transcription inverse GoScript (Promega). Les produits d'ADNc ont ensuite été dilués 10- fois avec de l'eau désionisée sans nucléase avant d'être utilisés comme matrice dans la PCR en temps réel. Des ADNc spécifiques ont été amplifiés par le système GoTaq 2-Step RT-qPCR (Promega) dans un volume de 20 ul. L'amplification PCR a été réalisée à une température d'hybridation de 60 degrés avec le système de détection PCR en temps réel 7500 (Applied Biosystems) conformément aux instructions du fabricant. Les abondances relatives de transcription ont été calculées par la méthode du seuil de cycle comparatif avec le gène "comp10579_c0" comme standard interne, à l'aide du logiciel 7500 Manager.
Les paires d'amorces pour RT-PCR ont été conçues sur la base d'un logiciel en ligne (//primer3.ut.ee/) et sont répertoriées dans l'ensemble de données S1.
Résultats
Séquençage de l'ARN et assemblage du transcriptome de novo de la tige charnue de C. deserticola
La tige de C. deserticola est largement utilisée depuis de nombreuses années comme tonique traditionnellement important en Chine et au Japon. Pour obtenir un aperçu global de l'expression des gènes dans la tige charnue de C. deserticola, nous avons collecté des échantillons de tige de C. deserticola de la même base végétale en 2013 et 2014, respectivement. Les ARN totaux ont été extraits et les ARN polyA+ ont été purifiés pour construire des bibliothèques de séquences d'ARN à extrémités appariées. 79 433 734 et 86 019 176 lectures d'extrémité de paire correspondant à près de 8 milliards et 8,6 milliards de bases de la séquence ont été obtenues à l'aide du séquençage Illumina HiSeq 2000

plate-forme dans des échantillons de 2013- années et 2014- années (Tableau 1). Après avoir supprimé les séquences d'adaptateurs et filtré les lectures de faible qualité (voir les détails dans Méthodes), 64 831 040 lectures d'extrémité de paire de haute qualité au cours de l'échantillon de 2013- ans ont été utilisées pour l'assemblage du transcriptome de novo. À l’aide de l’assembleur de séquences Trinity [30], 51 719 gènes et 95 787 séquences de transcription ont été générés avec des longueurs de transcription allant de 200 pb à 15 698 pb. La longueur moyenne des transcriptions assemblées est de 950 bases et la longueur N50 est de 1 519 bases. Le nombre de transcriptions de différentes longueurs a révélé que 57, 32% des transcriptions assemblées mesuraient environ 500 pb ou plus (Fig. 1A). Les lectures de paire de haute qualité dans l'échantillon de 2014- ans ont été mappées sur le transcriptome assemblé. En outre, nous avons constaté que le nombre de transcrits pour chaque gène assemblé variait et que 69 % des gènes comportant une isoforme étaient exprimés, tandis que 31 % des gènes exprimaient deux transcrits ou plus (Fig. 1B).
Quantification d'expression et annotation fonctionnelle des transcriptions assemblées
L'abondance des gènes ou des transcrits a été quantifiée à l'aide du package RSEM, dans lequel les lectures séquencées ont été réalignées sur les séquences de gènes ou de transcrits assemblés à l'aide de Bowtie, et ces lectures cartographiées ont été utilisées pour la quantification. La valeur FPKM pour chaque gène ou transcrit a été calculée, et finalement, nous avons identifié 63 957 et 52 857 transcrits activement exprimés (valeur FPKM supérieure ou égale à 0,5) dans des échantillons de tiges charnues de C. deserticola dans 2{{17} }13 et 2014, respectivement. 44 776 relevés de notes (70,01 % dans l'échantillon de 2013-années, 84,71 % dans l'échantillon de 2014-années) ont été couramment exprimés dans les deux répétitions, et la corrélation (coefficient de corrélation de Pearson : 0,91979) de leurs données d'expression était montré sur la figure S1. Les données brutes de séquençage ont été téléchargées dans la base de données NCBI SRA (numéros d'accès : SRX857402 et SRX858938). Nous avons utilisé les gènes exprimés identifiés dans l'échantillon de 2013- ans pour une analyse plus approfondie. Les informations d'annotation fonctionnelle pour toutes les transcriptions exprimées ont été obtenues à l'aide de deux méthodes. Premièrement, tous les transcrits exprimés ont été alignés sur des bases de données connues de nucléotides (GenBank nt) et de séquences peptidiques (GenBank nr et Arabidopsis peptide) séparément par l'algorithme BLAST. Sur 63 957 transcriptions exprimées,

29 220 (45,7 %) ont été annotés et ont montré une homologie avec des séquences dans l'une des trois bases de données thématiques avec un seuil de valeur E 1e-20. Pendant ce temps, les régions codantes candidates pour toutes les séquences de transcription exprimées ont été prédites à l'aide du logiciel TransDecoder, et les ORF les plus longs pour chaque transcription ont été utilisés pour la recherche de domaine Pfam. En conséquence, 21 358 (33,4 %) relevés de notes ont été annotés sur la base de la base de données Pfam. Au total, 30 098 (47,1 %) transcriptions correspondaient de manière significative aux gènes connus dans les bases de données publiques en combinant les deux méthodes ci-dessus. La liste complète des transcriptions exprimées avec annotation de fonction a été affichée dans les données supplémentaires (ensemble de données S2).
Nous avons étudié les 20 transcriptions les plus fortement exprimées (Tableau 2) correspondant à 18,99 % de toutes les lectures de séquençage et avons constaté que la plupart d'entre elles sont des gènes répondant à des gènes abiotiques.

stimulus de stress. La déshydrine (DHN), une classe de protéines de stress hydrophiles et thermostables avec un nombre élevé d'acides aminés chargés qui appartiennent à la famille des LEA (Late Embryogenesis Abundant) du groupe II, est le gène le plus fortement exprimé. Trois transcrits différents de Dehyrin (comp28713_c0_seq1/2/4) ont été détectés comme étant fortement exprimés dans les tiges charnues, ce qui pourrait être impliqué dans la protection des cellules contre les dommages causés par le stress dû à la sécheresse. D'autres gènes liés au stress, tels que la protéine de choc thermique, la protéine liée aux agents pathogènes et la métallothionéine, ont également été trouvés fortement exprimés, ce qui peut être lié à son environnement de survie difficile. De plus, certains gènes constitutifs, notamment le gène de l'ARN ribosomal 26S (comp22329_c2_seq1), la protéine réprimée par l'auxine/associée à la dormance (comp20999_c0_seq1), Le facteur ADP-ribosylation (comp20499_ c0_seq1) a également été fortement transcrit.

CISTANCHE TUBULOSA NATUREL POUR AMÉLIORER L'IMMUNITÉ PHGS75% ECH 30% ACT 12%







