La comparaison entre QPCR et RNA-seq révèle les défis de la quantification de l'expression HLA Partie 2
May 25, 2023
Normalisation
Nous avons utilisé des estimations d'expression en transcriptions par million (TPM), qui est la normalisation standard produite par Salmon et correspond à la quantité relative d'une transcription donnée dans un échantillon. Pour un gène donné, l'estimation est simplement la somme des TPM pour ses transcrits. Dans certains cas, lorsque nous montrons des estimations transformées normales standard, nous avons effectué une transformation normale de rang des données RNAseq à l'aide du package GenABEL R (Aulchenko et al. 2007), qui est généralement appliqué, par exemple, dans les modèles linéaires de cartographie eQTL (Delaneau et al. 2017).
La cartographie QTL est une méthode pour étudier le mécanisme de régulation de l'expression génique en comparant l'association entre l'expression génique et le polymorphisme génique dans une population. Le modèle linéaire est une méthode de cartographie eQTL couramment utilisée, qui peut utiliser un modèle de régression linéaire pour estimer la corrélation entre l'expression génique et le polymorphisme génique.
Le système immunitaire est un système biologique complexe qui protège le corps contre les infections et les maladies telles que le cancer. La régulation de l'expression des gènes joue un rôle important dans le système immunitaire et peut affecter le développement, la différenciation et la fonction des cellules immunitaires.
Par conséquent, des modèles linéaires de cartographie eQTL peuvent être utilisés pour analyser la relation entre les mécanismes de régulation de l'expression génique et l'immunité. Par exemple, l'étude de la corrélation entre un certain génotype et l'expression d'un gène immunitaire clé dans une population peut révéler l'influence de ce génotype dans la régulation de l'expression des gènes immunitaires. De telles recherches peuvent apporter des éclaircissements importants pour le traitement et la prévention des maladies immunitaires. Cela montre l'importance de l'immunité, nous devons donc améliorer notre immunité chaque jour. La viande hachée a également des effets anti-virus, anticancéreux et autres, qui peuvent renforcer l'immunité La capacité du système à résister et à améliorer l'immunité du corps.

Cliquez sur les avantages pour la santé de cistanche
Lire l'alignement sur le génome de référence
Pour l'analyse de la couverture de lecture des gènes HLA rapportée à la Fig. S7, nous avons aligné les lectures sur le génome de référence GRCh38 avec STAR v2.7.3a (Dobin et al. 2013), en utilisant les annotations du gène Gencode v37. Pour contrôler le biais de cartographie au niveau des gènes HLA, nous avons ensuite traité les fichiers BAM avec hlmapper v4.3 (Castelli et al. 2018).
Simulation
Données de terrain
Pour générer des données simulées, nous avons d'abord exécuté Salmon v1.3.0 (Patro et al. 2017) sur l'échantillon réel #66K00003 pour apprendre les niveaux d'expression des transcriptions Gencode v37. Ensuite, nous avons utilisé le package Polyester (v1.26.0) pour générer 50 échantillons synthétiques avec des niveaux d'expression identiques à l'échelle du transcriptome, à l'exception de HLA-A, -B et -C. Les niveaux d'expression de ces gènes étaient basés sur 50 individus choisis au hasard à partir de nos données réelles (pour lesquelles nous disposons de données sur les allèles HLA). Pour chaque gène HLA, nous avons sélectionné les isoformes qui représentaient au moins 90 % de l'expression totale du transcrit codant pour les protéines dans une exécution de Salmon sur l'ensemble de données réelles (ce qui n'a donné qu'un seul transcrit par gène) et avons personnalisé les séquences de transcrit en fonction de la Allèles HLA portés par chaque individu.
Cette procédure nous a permis de générer synthétiquement 50 individus avec des niveaux d'expression de fond identiques, mais avec une expression HLA variable et avec un polymorphisme HLA intégré dans les lectures simulées.
Pour refléter nos données réelles, trente millions de lectures appariées de 126 bp avec une taille moyenne de fragment de 261 bp ont été simulées pour chaque individu, en utilisant les valeurs par défaut pour d'autres paramètres de polyester (par exemple, l'écart type de la longueur du fragment=25 bp, taux d'erreur=0.005, distribution uniforme des lectures et aucun biais). Polyester sort des fichiers FASTA, à partir desquels nous avons produit des fichiers FASTQ avec un score de qualité constant (symbole "F" correspondant).
Métriques de précision
Les TPM ont été calculés sur des comptages simulés compte tenu des longueurs de transcription et de la taille moyenne des fragments de 261 pb. Le rapport "Estimated TPM/True TPM" est utilisé pour évaluer les performances de récupération des niveaux d'expression simulés et nous permet d'observer une sous-estimation ou une surestimation.
Graphique
Nous avons préparé tous les tracés de cet article en utilisant le package ggplot2 v3.3.2 (Wickham 2016) dans R.

Résultats
Précision de la quantification HLA RNA‑seq
Étant donné l'absence d'une méthode qui peut être considérée comme l'étalon-or expérimental pour la quantification de l'expression HLA à partir des données RNA-seq, nous avons initialement évalué l'exactitude des méthodes de quantification RNA-seq pour HLA en utilisant des données simulées où les niveaux d'expression réels sont connus puisqu'ils sont générés dans un ordinateur pour émuler de vraies expériences. Cela a été fait pour choisir la meilleure approche de calcul parmi les méthodes basées sur l'ARN-seq, permettant un contraste ultérieur avec les approches non-ARN-seq.
Nous avons simulé une expérience RNA-seq pour 50 personnes en utilisant le package Polyester (Frazee et al. 2015). Ces individus synthétiques ont les mêmes niveaux d'expression pour tous les gènes du génome, à l'exception de HLA-A, -B et -C, pour lesquels nous avons fait varier les niveaux d'expression. Nous avons également personnalisé les séquences de transcription HLA annotées de Gencode v37 pour introduire une variation génétique réelle observée chez des individus choisis au hasard à partir d'un ensemble de données de 96 individus (qui ont été génotypés HLA par séquençage Sanger comme décrit ci-dessous). Les transcrits personnalisés résultants avaient une identité de séquence médiane avec une référence supérieure à 95 % pour tous les locus HLA.
Nous avons comparé les estimations de l'expression HLA obtenues par deux méthodes bioinformatiques : (1) "Ref transcriptome", qui utilise Salmon (Patro et al. 2017) pour aligner les lectures sur le transcriptome de référence standard, en quantifiant l'abondance des transcrits et (2) "Personnalisé", qui utilise également Salmon, mais mappe les lectures sur les transcriptions HLA personnalisées, reflétant le génotype HLA de l'individu (Fig. 1). L'approche "Personnalisée" prolonge notre stratégie précédente (Aguiar et al. 2019) en utilisant une transcription personnalisée, plutôt qu'une seule séquence codante canonique pour chaque allèle porté par l'individu.

La méthode "Ref transcriptome" sous-estimait les niveaux d'expression, en particulier pour les allèles présentant une proportion plus importante de différences de séquences concernant le génome de référence (Fig. 1). Ceci est attendu car un taux d'inadéquation plus élevé entre les lectures et la référence a un impact négatif sur l'alignement (Brandt et al. 2015). Cette approche a également surestimé l'expression de HLA-C pour certains individus, une conséquence de la cartographie des lectures de HLA-B sur les transcrits de référence HLA-C (Fig. S1). L'approche "Personnalisée", quant à elle, contrôle le biais de cartographie et atteint une précision optimale.
Bien que notre simulation fournisse des résultats encourageants concernant la quantification de l'expression HLA à l'aide de RNAseq, nous devons tenir compte de certaines mises en garde. Nous avons modifié la séquence des isoformes annotées en fonction des allèles HLA des individus en utilisant un seul ensemble d'isoformes pour tous les allèles d'un gène HLA donné. Ces séquences ont été utilisées à la fois dans la simulation des lectures ainsi que dans la quantification de l'expression ; ainsi, nous nous attendons à une précision optimale. Dans un scénario réel, différents allèles HLA pourraient être associés à différentes isoformes. Plus loin dans cet article, nous discutons d'un exemple spécifique que nous avons observé pour HLA-A, conformément à l'hypothèse selon laquelle certaines isoformes sont exclusives à des allèles spécifiques. Néanmoins, étant donné que nous nous intéressons principalement aux estimations d'expression au niveau des gènes et des allèles HLA, nous nous attendons à ce que les séquences personnalisées représentent une amélioration par rapport à un seul transcriptome de référence en réduisant le biais de cartographie.
Estimation de l'expression HLA à partir de données réelles d'ARN‑seq
Nous avons effectué une estimation de l'expression sur les données d'ARN-seq du transcriptome entier pour 96 personnes, pour lesquelles la qPCR pour HLAA, -B et -C, et les niveaux d'expression de surface HLA-C ont été précédemment estimés (Kulkarni et al. 2013 ; Ramsuran et al. 2015, 2017), et pourraient être utilisés pour comparer avec les résultats RNAseq (voir Fig. S2 pour les analyses QC sur les données RNA-seq).
Compte tenu de la plus grande précision de l'approche personnalisée dans la simulation, nous comparons cette méthode d'estimations d'expression basées sur l'ARN-seq à celle d'autres approches non-ARN-seq, mais fournissons les résultats pour les approches basées sur le transcriptome de référence dans les "informations supplémentaires". " Nous avons personnalisé les séquences de transcription en fonction des génotypes HLA individuels obtenus par séquençage Sanger. Nous avons exécuté HLApers (Aguiar et al. 2019) et Kourami (Lee et Kingsford 2018) pour déduire les allèles directement à partir des données ARN-seq et confirmer les appels Sanger (voir "Matériels et méthodes").
Les estimations de l'expression au niveau du gène montrent que HLA-B a l'expression la plus élevée parmi les loci HLA de notre ensemble de données, suivi de HLA-C et HLA-A (Fig. 2A). Cet ordre est cohérent avec l'ensemble de données GTEx sur le sang total (GTEx Consortium 2020) et avec une précédente méthode RNAseq de capture HLA appliquée aux PBMC (Yamamoto et al. 2020). Cependant, ce modèle diffère de celui observé par Boegel et al (2018), qui ont observé des niveaux similaires entre les gènes en utilisant une stratégie différente pour traiter la cartographie des lectures sur plusieurs loci, ce qui peut contribuer au manque de distinction entre les loci en termes de niveau d'expression. ). Les études futures devront démêler la contribution des différences dans les méthodologies ou la composition des types de cellules à ces différences.

Comparer RNA‑seq et qPCR sur des données réelles
Nous avons ensuite comparé les estimations d'expression d'ARN-seq à celles obtenues avec qPCR (Fig. 2B). Bien que la corrélation entre l'expression de l'ARN-seq et de la qPCR soit statistiquement significative pour tous les gènes (p=0.024, 0.002, 0,000000016, pour HLA-A, -B et -C, respectivement ; test de Spearman pour l'association positive), l'ampleur des corrélations était modeste pour HLA-A et -B, et plus élevée pour -C. L'utilisation d'une référence personnalisée pour l'ARN-seq a légèrement augmenté la corrélation avec la qPCR par rapport à une référence standard (Fig. S3). Cela concorde avec notre observation précédente selon laquelle les estimations de l'expression au niveau des gènes ne sont pas substantiellement différentes entre les approches basées sur le génome de référence ou personnalisées pour les gènes HLA de classe I (Aguiar et al. 2019), le principal avantage des approches personnalisées étant les estimations au niveau Niveau d'allèle HLA, que nous explorons ci-dessous. L'utilisation de la correction des biais chez le saumon (biais GC, biais spécifique à la séquence et biais spécifique à la position) améliore la corrélation avec la qPCR, avec l'impact le plus élevé pour HLA-B (comparer les Fig. 2B et S4, pour les données corrigées et non corrigées, respectivement).

Comparaison des niveaux d'ARNm avec l'expression de surface
Étant donné que l'expression de l'ARN est informative sur les étapes initiales de la signalisation cellulaire et de la réponse aux stimuli, l'analyse de sa relation avec les phénotypes moléculaires en aval (tels que l'expression des protéines à la surface cellulaire) peut nous aider à comprendre le rôle de la régulation post-transcriptionnelle et post-traductionnelle sur Expression HLA. Des différences entre les abondances d'ARN et de protéines sont attendues car elles sont soumises à des modes de régulation distincts. Les effets techniques peuvent également introduire des différences puisque les techniques d'ARN et de protéines diffèrent et sont affectées par des types d'erreur non corrélés (Li et Biggin 2015 ; Kaur et al. 2017 ; Carey et al. 2019). De plus, dans le cas de notre étude, l'expression des gènes a été mesurée sur les PBMC totaux, tandis que l'expression des protéines a été mesurée sur des cellules CD3 plus triées. Avec cette différence à l'esprit, nous avons mesuré le degré auquel la protéine HLA sur la surface cellulaire peut être prédite par l'expression de l'ARNm. Cette analyse a été réalisée exclusivement pour HLA-C car c'est le seul locus pour lequel un anticorps capable de lier tous les allèles avec des affinités égales est disponible. Fait intéressant, il y avait une forte corrélation entre l'ARNm et l'expression des protéines pour HLAC, avec une corrélation légèrement plus élevée pour l'ARN-seq (Fig. 2C).
Expression au niveau des allèles HLA
Les gènes HLA abritent des éléments régulateurs associés à la transcription constitutive et à la transcription activée dynamiquement (René et al. 2016). En conséquence, l'expression de HLA varie selon les tissus et peut être modulée par des réseaux de régulation déclenchés par différents stimuli (Anderson 2018 ; Carey et al. 2019). On s'intéresse de plus en plus à comprendre si des allèles HLA distincts sont associés à différents niveaux d'expression de base et programmes de régulation (Aguiar et al. 2019 ; Gutierrez-Arcelus et al. 2020), et si cette variation contribue aux phénotypes de la maladie ou aux résultats de la transplantation (Petersdorf et 2014, 2015 ; René et al. 2016 ; Bettens et al. 2022 ; Johansson et al. 2022). Par conséquent, les estimations d'expression au niveau des allèles HLA pour la qPCR et l'ARN-seq ont été comparées. Étant donné que les allèles individuels sont souvent assez rares dans l'ensemble de données, nous les avons regroupés par lignées alléliques (c'est-à-dire des groupes d'allèles définis phylogénétiquement par la relation des exons) (Elsner et al. 2002).
Nous avons classé les lignées en fonction de leurs niveaux d'expression sur la base des données RNA-seq et qPCR et évalué la concordance des classements entre les méthodes (Fig. 3). Notre approche personnalisée d'ARN-seq fournit directement des estimations au niveau des allèles, puisque les séquences d'allèles HLA sont utilisées pour indexer les alignements, nous avons donc ordonné les lignées alléliques en fonction de leurs niveaux d'expression médians. Parce que nos estimations d'expression qPCR sont au niveau du gène et ne fournissent pas directement des estimations au niveau de l'allèle, nous avons ordonné les lignées alléliques en fonction de leurs effets dans un modèle linéaire des niveaux d'expression expliqués par le génotype HLA (voir Ramsuran et al. 2015). Sur la figure 3, les valeurs d'expression sont tracées deux fois pour chaque niveau pour chaque allèle de l'individu, et pour la qPCR, il s'agit simplement de l'expression au niveau du gène tracée deux fois, reflétant la présence de deux allèles.

L'ordre des estimations d'expression est plus similaire entre RNA-seq et qPCR pour HLA-C qu'il ne l'est pour -A et -B (différence d'ordre absolue moyenne, où la différence d'ordre fait référence à la différence observée dans les positions dans un ordre classé des valeurs d'expression , entre RNA-seq et quantification qPCR, de 2,3 pour HLA-C, 3,1 pour -A et 3,9 pour -B), suivant un modèle similaire d'accord avec celui de l'expression au niveau du gène, pour lequel nous avons trouvé la corrélation la plus élevée entre RNA-seq et qPCR pour HLA-C.
Parmi les lignées avec la plus grande différence entre RNA-seq et qPCR se trouve A*11. Nous avons mesuré l'expression de surface sur un sous-ensemble d'hétérozygotes pour A * 03 ou A * 11 en utilisant un anticorps qui a une affinité égale pour les deux lignées et avons observé que la qPCR est corrélée de manière plus robuste avec l'expression de surface cellulaire de ces deux allotypes que l'ARN-seq (Fig. S5). Ensuite, nous présentons une évaluation plus approfondie des ordres d'allèles grâce à des comparaisons avec des études antérieures sur l'expression de l'ARNm HLA.
Bien qu'il soit intéressant de comparer les différences d'expression entre les allèles HLA, diverses études montrent que la variation d'expression au sein d'un allèle ou d'une lignée allélique est souvent assez élevée et que les différences entre les allèles de rangs différents sont souvent faibles et non significatives. En conséquence, il peut être irréaliste de s'attendre à un maintien des rangs sur plusieurs allèles, et il peut être préférable de comparer les estimations d'expression pour les allèles aux extrêmes d'expression.
Pour nos données d'ARN-seq, nous comparons nos estimations avec celles de deux approches précédentes d'ARN-seq adaptées à HLA sur les PBMC. Il y a une bonne concordance globale avec Yamamoto et al. (2020), où A*24, A*02, C*04 et C*06 sont fortement exprimés, et A*03, C*03 et B*15 sont exprimés à de faibles niveaux, bien que nous observions également des différences telles comme pour B*35, ce qui serait plus en accord avec nos données qPCR. Lorsque nous comparons nos données RNA-seq avec Johansson et al. (2021), cependant, nous voyons beaucoup plus de différences, bien qu'ils aient de très petits échantillons pour de nombreuses lignées.
Nous comparons également nos résultats avec ceux de deux études qPCR précédentes qui appliquaient des amorces spécifiques d'allèles. Betten et al. (2014) ont utilisé des amorces spécifiques d'allèles pour certaines lignées HLAC et ont vu C * 04 et C * 06 comme fortement exprimés, tandis que C * 07 et C * 03 étaient exprimés à de faibles niveaux, en concordance avec ce que nous avons pour les deux ARN-seq et qPCR. René et al. (2015) ont appliqué des amorces spécifiques d'allèles pour HLA-A et ont observé A*02 (élevé) et A*29 (faible) aux extrêmes d'expression, ce qui correspond davantage à nos résultats RNAseq qu'à notre qPCR ; cependant, nous voyons de nombreuses différences dans d'autres lignées alléliques
Dans certains cas, nous pouvons également évaluer la concordance avec des études fonctionnelles. Par exemple, des analyses antérieures des sites de liaison des facteurs de transcription (TFBS) et de l'activité du promoteur (revue dans Anderson 2018), et des études sur la régulation des miARN (Kulkarni et al. 2011), montrent que C*03 et C*07 sont des allèles faiblement exprimés, ce qui concorde avec nos observations pour l'ARN-seq et la qPCR.
Sources potentielles de différences
Nous avons ensuite cherché à savoir si le traitement des échantillons utilisés pour l'ARN-seq aurait pu contribuer aux différences entre les estimations d'expression obtenues avec la qPCR et l'ARN-seq.
Une préoccupation spécifique était la durée de stockage des échantillons dans un congélateur à -80 degrés (environ 4 ans entre les tests qPCR et RNA-seq), ainsi que d'autres étapes spécifiques à l'expérience RNA-seq, y compris la décongélation des échantillons. Pour résoudre ce problème, nous avons effectué une deuxième expérience RNAseq sur du sang frais redessiné à partir de 11 individus, qui constituent un sous-ensemble des 96 analysés dans cette étude, et nous avons comparé les estimations d'expression entre les deux points de temps. Même si ce deuxième test comporte des différences techniques et biologiques concernant la première expérience RNA-seq (Fig. S6A et B), la corrélation à l'échelle du transcriptome dans les estimations d'expression entre les points temporels est élevée (Fig. S6C).
Bien que l'évaluation de la corrélation avec 11 individus puisse être bruyante, les corrélations au niveau des gènes HLA sont parmi les plus grandes corrélations génétiques entre les deux échantillons (Fig. S6D et F). Nous avons également calculé les rapports d'allèles intra-individuels, qui sont le rapport d'expression entre les deux allèles HLA d'un individu hétérozygote, et les avons comparés entre les points dans le temps. La corrélation était supérieure à 0.94 pour HLA-A, -B et -C (Fig. S6E). Par conséquent, nous n'avons vu aucune preuve d'une contribution majeure de la dégradation de l'ARN pour expliquer la faible corrélation entre l'ARN-seq et la qPCR dans notre échantillon d'origine.
Une autre contribution possible aux différences entre l'ARN-seq et la qPCR est que l'allèle HLA spécifique peut être plus biaisé dans une méthode ou dans l'autre, auquel cas les individus porteurs de tels allèles contribueraient à de grandes différences. Par exemple, pour les individus porteurs de A*03, ou pour les homozygotes pour C*07, il existe une relation négative entre qPCR et RNA-seq (Fig. 4A).

Une source supplémentaire de différences entre les méthodes pourrait provenir du fait que, dans notre approche RNA-seq, nous personnalisons tous les transcrits annotés Gencode pour chaque allèle HLA ; cependant, la véritable diversité des transcrits et son association avec des allèles HLA spécifiques ne sont pas bien comprises. Par exemple, Kulkarni et al. (2017) ont montré que A*01 et A*11 produisent des 3′-UTR plus courts. Pour déterminer si nous pouvons reproduire ce financement dans nos données RNA-seq, nous avons cartographié les lectures sur le génome de référence et corrigé le biais de cartographie des gènes HLA avec un hla-mapper (Castelli et al. 2018). En effet, pour les individus porteurs de A * 01 ou A * 11, la couverture de lecture au 3′-UTR de HLA-A montre une forte baisse à ~ 120 pb avant la fin du gène annoté (Fig. S7).

Étant donné que les valeurs de transcription par million (TPM) sont calculées en tenant compte de la longueur de référence, l'utilisation d'une référence plus longue que la véritable transcription conduit à une sous-estimation de l'expression. Nous avons tenté de contrôler la possibilité de telles transcriptions plus courtes en incluant une version de chaque transcription HLA-A avec un 3′-UTR raccourci dans notre index pour l'alignement de lecture. Cependant, nous n'avons trouvé aucune preuve d'expression de l'isoforme plus courte (Fig. S8), peut-être parce que ces isoformes plus courtes sont contenues dans les isoformes de longueur normale, et l'implémentation de Salmon attribue toutes les lectures à l'isoforme plus grande. Fait intéressant, l'expression au niveau de l'isoforme révèle une isoforme avec un 5′-UTR plus long exclusif à A * 11, qui contribue à une grande proportion de l'expression totale de cet allèle (Fig. S8).
Nous avons également testé une normalisation de nos estimations d'expression, dans laquelle nous avons ajusté les longueurs de lecture compte tenu de la couverture de lecture prenant en charge une extrémité 3'-UTR proximale ou distale (moyenne pondérée des longueurs de transcription utilisant la couverture de lecture comme poids). Bien que nous observions un gain allant jusqu'à 20 % dans les niveaux d'expression des individus porteurs de A*01 et/ou A*11, nous ne constatons qu'une légère amélioration de la corrélation avec la qPCR après cet ajustement (à partir de rho=0. 20 sur la Fig. 2 à rho=0.24 sur la Fig. 4B).
A*01 et A*11 sont parmi les allèles avec les plus grandes différences de rang entre RNA-seq et qPCR (Fig. 3), et une représentation imparfaite de leurs transcrits associés dans l'annotation peut introduire un biais dans nos estimations de RNA-seq.
Enfin, les méthodes de normalisation utilisées pour obtenir les estimations d'expression finales à partir des données brutes de qPCR peuvent également être une source de différences entre les estimations de qPCR et d'ARN-voir. Les tests PCR quantitatifs pour les gènes HLA de classe I amplifient généralement les régions des exons 1 à 4, et la normalisation par l'expression d'un gène domestique tel que B2M (2- microglobuline) est généralement effectuée (comme ce fut le cas dans la présente étude ). La justification de cette procédure est que si les niveaux d'expression sont standardisés par une référence exprimée de manière stable, les estimations pour différents individus sont placées sur la même échelle, permettant ainsi des comparaisons entre les individus.
B2M code pour la chaîne légère dans la molécule HLA de classe I, et il est plausible que les gènes B2M et HLA de classe I aient une certaine coordination d'expression, car ils partagent des architectures de promoteurs similaires (Kobayashi et van den Elsen 2{{1{{12} }}}12 ; Vijayan et al. 2019), et peut être régulé par des facteurs de transcription partagés (par exemple, NLRC5/CITA induit l'expression à la fois de HLA de classe I et de B2M dans les lignées cellulaires Jurkat (Meissner et al. 2{{20}}10). La normalisation de l'expression du gène HLA par des valeurs corrélées peut introduire un biais dans nos estimations de qPCR, en particulier pour HLA-B, pour lequel nous constatons une forte corrélation avec l'expression B2M (Fig. 4C). La mise à l'échelle d'une variable par une variable différente mais corrélée peut introduire une perturbation en amenant les valeurs extrêmes au milieu de la distribution et en réduisant la variance ; conformément à cette hypothèse, les coefficients de variation des données qPCR sont 0,61 et 0,50 pour HLA-A et -C, respectivement, mais chute à 0,17 pour HLA-B (à titre de comparaison, les CV pour les données RNA-seq sont de 0,20, 0,14 et 0,29 pour HLA-A, -B et -C , respectivement). Cependant, en utilisant la même conception qPCR, Ramsuran et al. (2017) ont normalisé l'expression de HLA-B par les gènes B2M, GAPDH, 18 s et b-Actine, et ont observé des résultats très cohérents, ce qui ne prend pas en charge l'impact de la normalisation B2M sur les estimations de la qPCR.
Discussion
Des estimations fiables de l'expression du transcrit HLA peuvent contribuer à diverses questions de recherche, et bien que les résultats de la maladie soient fréquemment explorés dans le contexte de la variation du codage HLA, les niveaux d'expression sont également susceptibles d'expliquer la variation des résultats cliniques (examinés dans Dendrou et al. 2018 ; et dans Johansson et al. 2022). Les niveaux d'expression ont également le potentiel d'éclairer les décisions lors de la planification de la transplantation de cellules souches hématopoïétiques ; par exemple, si une correspondance parfaite n'est pas disponible dans la sélection des donneurs allogéniques, il semble avantageux de sélectionner ceux qui ne correspondent pas aux allèles à faible expression (Petersdorf et al. 2014, 2015). Des estimations fiables de l'expression du transcrit peuvent également aider à l'identification des eQTL qui sous-tendent le contrôle de l'expression HLA, qui pourraient être intégrés dans les résultats de GWAS, en demandant si les occurrences connues dans la région du CMH coïncident avec les eQTL pour les gènes HLA (voir, par exemple, le tableau S6 dans Aguiar et al. 2019). Plus généralement, de meilleures estimations de l'expression du transcrit HLA nous aideront à comprendre l'architecture génétique de la régulation HLA, en identifiant la contribution relative des variants agissant en cis (c'est-à-dire ceux qui se trouvent à proximité du gène HLA qu'ils régulent) et des variants transactants (ceux à distance localisations génomiques, y compris sur d'autres chromosomes). Cela fournira des informations sur le degré auquel la variation de l'expression HLA est une propriété spécifique d'un allèle par rapport à une caractéristique interindividuelle indépendante de l'identité allélique (voir Bettens et al. 2022).
Les techniques de PCR quantitative nous ont permis de découvrir des associations entre l'expression HLA et les phénotypes de la maladie. Plus récemment, l'ARN-seq est devenu la méthode de choix pour évaluer l'expression des gènes dans de grands ensembles de données de transcriptome entier de différentes populations. Être capable d'extraire des informations précises pour l'expression HLA à partir de ces données est un défi important, et de nombreuses méthodes ont été proposées pour atteindre cet objectif. Cependant, la mesure dans laquelle les résultats issus des analyses RNA-seq concordent avec ceux accumulés par l'utilisation de la qPCR est actuellement inconnue. Bien que ces méthodes ciblent le même phénotype moléculaire (abondance d'ARN), elles diffèrent nettement par les techniques expérimentales utilisées, les formes d'analyse et de normalisation des données, les procédures bioinformatiques et les biais auxquels elles sont soumises.
À notre connaissance, des études antérieures comparant les approches HLAtailored RNA-seq avec la qPCR incluaient de petits échantillons. Par exemple, Johansson et al. (2021) ont validé leur ARN-seq ciblé HLA avec qPCR sur seulement 5 échantillons à HLA-C, finançant un coefficient de corrélation de Pearson de 0,9, ce qui n'était pas significatif (p=0.08) .
Dans la présente étude, nous avons comparé les estimations quantitatives d'expression PCR et RNA-seq pour le gène classique HLA de classe I HLA-A, -B et -C dans un ensemble apparié de 96 individus. Nous avons trouvé des corrélations modestes mais significatives dans l'expression sur un échantillon de 96 individus. Étant donné l'absence d'étalon-or avec lequel comparer ces estimations, les erreurs d'estimation et les biais associés aux deux méthodes peuvent contribuer au résultat global.
Nous avons exploré les effets de divers facteurs pouvant expliquer la faible corrélation entre les estimations d'ARN-seq et de qPCR, telles qu'une mauvaise estimation de l'expression d'allèles HLA spécifiques et la normalisation par un seul gène domestique dans la qPCR. Nos résultats ne peuvent pas être généralisés à chaque conception de qPCR ou pipeline de séquençage d'ARN, pour lesquels il existe une grande variété d'approches différentes. Cependant, à notre connaissance, il s'agit de la première comparaison directe entre qPCR et RNA-seq pour l'estimation de l'expression HLA.
Notre étude suggère des domaines qui nécessitent une amélioration dans la détermination de l'expression du transcrit HLA. Les comparaisons entre l'ARN-seq et la qPCR, par exemple, doivent utiliser un traitement uniforme des échantillons selon les méthodes (par exemple, même protocole d'isolement de l'ARN, temps de stockage/décongélation, intégrité de l'ARN) pour limiter les différences d'artefacts associées à ces méthodes. La cartographie des lectures courtes sur des génomes ou des transcriptomes de référence uniques génère des biais, et des stratégies qui cartographient les lectures représentant le polymorphisme HLA sont nécessaires. Étant donné qu'il existe plusieurs stratégies pour y parvenir (Boegel et al. 2012 ; Lee et al. 2018 ; Aguiar et al. 2019 ; Gutierrez-Arcelus et al. 2020 ; Darby et al. 2020), il sera essentiel de comparer les précision relative de ces approches.
Il est également nécessaire de développer des méthodes qui tiennent compte de manière adéquate de la variation des isoformes, non seulement pour fournir une autre couche d'informations, mais également des estimations d'expression plus précises, car la normalisation du nombre de lectures par une longueur de transcription incorrecte est une source potentielle d'erreur. Dans ce contexte, les données à lecture longue, qui génèrent directement des informations de transcription complètes, peuvent être un outil puissant (Cornaby et al. 2022). Enfin, la variation du nombre de copies, une caractéristique connue pour certains locus HLA (par exemple, DRB), doit également être prise en compte lors de la quantification des niveaux d'expression.
Remerciements
Nous remercions Tatiana Torres (Université de São Paulo), Yang Luo (Harvard Medical School) et les membres du Joint Biology Consortium de Boston pour leurs discussions utiles.
Contribution de l'auteur
Diogo Meyer, Mary Carrington, Richard M. Single et Vitor RC Aguiar ont contribué à la conception et à la conception de l'étude. La préparation du matériel, la collecte de données et les expériences ont été réalisées par Maureen P. Martin, Veron Ramsuran, Smita Kulkarni, Arman Bashirova, Danillo G. Augusto et Mary Carrington. L'analyse des données a été réalisée par Vitor RC Aguiar, Erick Castelli, Richard M. Single, Maria Gutierrez-Arcelus et Diogo Meyer. Le manuscrit a été écrit par Vitor RC Aguiar et Diogo Meyer. Tous les auteurs ont lu, apporté des contributions et approuvé le manuscrit final.
Financement
L'Agence de financement de São Paulo (FAPESP, http://www.fapesp. br/en/) a financé DM (2012/18010-0 et 2013/22007-7) et VRCA (2014/{{ 5}} et 2016/24734-1). Les National Institutes of Health, États-Unis, ont financé DM (NIH R01 GM075091), qui a soutenu une partie du postdoc VRCA. Le Conselho Nacional de Desenvolvimento Científco e Tecnológico (CNPq) et le ministère de la Santé du Brésil ont financé les expériences de séquençage de l'ARN et les voyages de recherche, dans le cadre d'une proposition conjointe États-Unis-Brésil attribuée à MC et DM (470043/{{13} }). NIH/NIAID R01AI157850 prend en charge SK. La réalité virtuelle a été financée par le Conseil sud-africain de la recherche médicale (SAMRC) avec des fonds du Département des sciences et de la technologie (DST) ; et également soutenu en partie par le Réseau d'Afrique subsaharienne pour l'excellence de la recherche sur la tuberculose et le VIH (SANTHE), une initiative DELTAS Africa (Grant # DEL-15-006) par l'AAS.
Ce projet a été financé en tout ou en partie par des fonds fédéraux du Frederick National Laboratory for Cancer Research, sous le contrat n° HHSN261200800001E. Le contenu de cette publication ne reflète pas nécessairement les opinions ou les politiques du ministère de la Santé et des Services sociaux, et la mention de noms commerciaux, de produits commerciaux ou d'organisations n'implique pas l'approbation du gouvernement américain. Cette recherche a été financée en partie par le programme de recherche intra-muros du NIH, Frederick National Lab, Center for Cancer Research.
Disponibilité des données
Les données RNA-seq présentées dans la présente publication ont été déposées et sont disponibles dans la base de données dbGaP sous dbGaP accession phs003177.v1.p1.
Les références
1. Aguiar VRC, César J, Delaneau O, et al (2019) Estimation de l'expression et cartographie eQTL pour les gènes HLA avec un pipeline personnalisé. PLoS Genet 15:e1008091.
2. Alcina A, Abad-Grau MDM, Fedetz M et al (2012) Variante de risque de sclérose en plaques HLA-DRB1 * 1501 associée à une expression élevée du gène DRB1 dans différentes populations humaines. PLoS One 7:e29819.
3. Anderson SK (2018) Évolution moléculaire des éléments contrôlant l'expression de HLA-C : Adaptation à un rôle de ligand du récepteur de type immunoglobuline des cellules tueuses régulant la fonction des cellules tueuses naturelles. HLA 92:271–278.
4. Apps R, Meng Z, Del Prete GQ et al (2015) Niveaux d'expression relatifs des protéines HLA de classe I dans les cellules normales et infectées par le VIH. J Immunol 194:3594–3600.
5. Apps R, Qi Y, Carlson JM, et al (2013) Influence du niveau d'expression HLA-C sur le contrôle du VIH. Sciences 340 : 87–91.
6. Arshad N, Laurent-Rolle M, Ahmed WS et al (2023) Les protéines accessoires SARS-CoV-2 ORF7a et ORF3a utilisent des mécanismes distincts pour réguler à la baisse l'expression de surface du CMH-I. Proc Natl Acad Sci USA 120:e2208525120.
7. Aulchenko YS, Ripke S, Isaacs A, van Duijn CM (2007) GenABEL : une bibliothèque R pour l'analyse d'association à l'échelle du génome. Bioinformatique 23: 1294–1296.
8. Bachtel ND, Umviligihozo G, Pickering S, et al (2018) La régulation négative du HLA-C par le VIH -1 s'adapte au génotype HLA de l'hôte. PLoS Pathog 14:e1007257.
9. Bettens F, Brunet L, Tiercy JM (2014) Variabilité hautement allélique dans l'expression de l'ARNm HLA-C : association avec les haplotypes étendus HLA. Gènes Immun 15 : 176–181.
10. Bettens F, Ongen H, Rey G et al (2022) Régulation de l'expression HLA de classe I par des variations de gènes non codants. PLoS Genet 18:e1010212
11.Boegel S, Bukur T, Castle JC, Sahin U (2018) In Silico Typing of Classical and Non-classical HLA Alleles from Standard RNA-Seq Reads. Méthodes Mol Biol 1802 : 177–191.
For more information:1950477648nn@gmail.com






