Coinfection VIH-1/VHB Prédiction multicible précise à l'aide d'un modèle de prédiction d'ensemble basé sur un réseau de neurones Ⅲ

Aug 02, 2023

3. Débat

Environ 2 milliards de personnes dans le monde ont été infectées par le virus de l'hépatite B (VHB), dont plus de 350 millions souffrent deinfection chronique,et entre 500,000et 700 000 personnes meurent chaque année d'une infection par le VHB. De plus, en 2019, environ 38 millions de personnes dans le monde vivaient avec le VIH, dont 1,8 million d'enfants de moins de 15 ans. En 2019, près de 690000 personnes dans le monde sont décédées de maladies liées au sida. En raison des voies de transmission similaires du VIH et du VHB, les deux virus à diffusion hématogène, l'incidence élevée de la co-infection entraîne des problèmes de santé mondiaux majeurs. Contrairement aux infections uniques de ces virus, les co-infections peuvent entraîner diverses maladies liées au foie, un dysfonctionnement des organes non hépatiques et la mort. Le traitement des patients co-infectés est compliqué en raison des effets secondaires des médicaments antiviraux, entraînant une résistance aux médicaments, une toxicité hépatique et une absence de réponse efficace. De plus, les personnes co-infectées doivent être traitées avec plusieurs médicaments en même temps, ce qui entraîne ladiagnostic complexe, traitement, etcontrôle du VIH et du VHBco-infections. Par conséquent, la recherche et le développement denouveaux médicamentsavecplusieurs cibles est un problème urgent. 

Echinacoside in cistanche (8)

CLIQUEZ ICI POUR CONNAÎTRE CISTANCHE POUR LA PRÉVENTION DES INFECTIONS

Cependant, la méthodologie traditionnelle de découverte de médicaments utilisant des expériences pour sélectionner des médicaments candidats est coûteuse et prend du temps. Avec le développement des algorithmes d'apprentissage automatique et d'apprentissage en profondeur, des innovations rapides dans le dépistage virtuel ont été réalisées. L'extraction de caractéristiques moléculaires est l'une des procédures les plus importantes pour l'application de modèles d'apprentissage automatique pour le criblage de composés à grande échelle. Les réseaux de neurones de graphes (GNN) ont ouvert des percées pour l'apprentissage des connexions interatomiques en raison de leur capacité de représentation des structures de graphes spatiaux des molécules.


Dans cette étude, nous avons comparé trois types de réseaux de neurones graphiques pour leur capacité à extraire des caractéristiques moléculaires en remplaçant les couches de sortie de ces réseaux de neurones par un algorithme d'apprentissage supervisé optimal, GBDT. Le modèle d'ensemble DMPNN plus GBDT a été sélectionné pour la pêche multicible VIH-1/VHB sur la base de la combinaison de 12 classificateurs binaires. L'étude de preuve de principe a démontré que l'intégration de DMPNN et de GBDT peut améliorer efficacement les performances de prédiction concernant les cibles du VIH-1 et du VHB par rapport à l'apprentissage automatique unique ou aux algorithmes de réseau neuronal unique. De plus, 22 médicaments anti-VIH-1 approuvés et 8 médicaments contre le VHB approuvés devaient avoir des cibles multiples potentielles, dont 8 validés par des références. De plus, pour vérifier nos prédictions cibles des dix nouveaux composés, des simulations d'amarrage moléculaire ont été adoptées pour fournir une inspection détaillée du mode de liaison pour chaque composé, où six composés ont été prédits pour avoir des relations jumelles avec les cibles du VIH et du VHB, qui ont été vérifiées. par l'algorithme d'amarrage moléculaire. Ainsi, les résultats ont montré qu'il est possible de concevoir des inhibiteurs spécifiques ciblant simultanément le VIH-1 et le VHB. De plus, notre modèle d'ensemble a la possibilité de détecter efficacement les co-inhibiteurs multi-cibles de la co-infection VIH/VHB et a des applications potentielles pour le criblage virtuel de médicaments multi-cibles pour le traitement d'autres maladies complexes.

Flavonoid (8)

4. Matériels et méthodes

4.1. Préparation de l'ensemble de données

La base de données ChEMBL [35] (version 32) et la base de données des cibles thérapeutiques (TTD) ont été utilisées pour sélectionner les cibles cliniques liées au VIH-1 et au VHB. Les mots clés "HIV-1", "Human Immunodeficiency Virus type-1", "HBV" et "Hepatitis B Virus" ont été utilisés comme conditions de récupération. Ensuite, les résultats de la recherche ont été filtrés davantage si le nombre de composés liés à la cible était inférieur à 30. Pendant ce temps, les composés avec une mesure quantitative de l'activité biologique (IC50, EC50, Ki ou Kd) inférieure ou égale à 10 µM étaient étiqueté "actif" ; en revanche, ceux avec une mesure quantitative d'activité biologique supérieure à 10 µM ont été étiquetés "inactifs".


4.2. Extraction de caractéristiques moléculaires par Graph Neural Network

Le Simplified Molecular Input Line Entry System56 (SMILES) [55] des composés a été téléchargé à partir de la base de données ChEMBL, et l'outil RDKit [56] a été utilisé pour traiter ces composés codant pour SMILES afin d'obtenir des graphes moléculaires et des empreintes Morgan [34]. Ensuite, trois modèles de réseaux neuronaux de graphes (GCN, GGNN, DMPNN) ont été adoptés pour apprendre la représentation des structures moléculaires, où chaque graphe est composé de nœuds et d'arêtes. Les nœuds sont décrits par le type d'atome, les éléments atomiques, le nombre d'atomes supplémentaires, le nombre d'électrons de valence, les propriétés aromatiques et d'autres propriétés. La matrice d'adjacence représente la connectivité entre les paires d'atomes, indépendamment des liaisons simples ou doubles. Dans le réseau de neurones convolutifs de graphe (GCN), les états des nœuds de graphe sont mis à jour à l'aide de la méthode d'intégration : hi t=U(hi t−1 , mi t ), où le ième nœud a été mis à jour par le précédent node state hi t−1 avec le message state mi t . Le réseau de neurones à graphes fermés (GGNN) utilise les unités récurrentes de porte (GRU) [57] dans l'étape de propagation. De plus, le MPNN dirigé contient trois opérations principales : transmission de messages, mise à jour de nœud et lecture :

image

où Mt est la fonction de message, Ut est la fonction de mise à jour du nœud et N(i) est l'ensemble des voisins du nœud i dans le graphe G. La phase de lecture utilise une fonction de lecture R pour calculer le vecteur caractéristique du graphe entier :

image

La fonction de message, la fonction de mise à jour et la fonction de lecture sont toutes différenciables. R opère sur l'ensemble des états des nœuds et est insensible à l'arrangement des nœuds, ce qui conduit à un MPNN invariant à l'isomorphisme du graphe. Plutôt que d'utiliser des messages associés à des sommets (atomes) dans le MPNN générique, le MPNN dirigé (DMPNN) utilise des messages associés à des arêtes dirigées (liaisons) dans les molécules, ce qui éviterait que les messages soient chancelants, c'est-à-dire pour éviter des boucles inutiles dans le trajectoire de passage des messages [58]. Dans notre étude, DMPNN a démontré des performances supérieures dans l'extraction des propriétés moléculaires.

Cistanche tubulosa-Anti Fatigue

4.3. Modèle de prédiction multicible

Dans cette étude, pour générer un classificateur multicible, trois modèles d'ensemble basés sur un réseau neuronal graphique intégrant la représentation graphique et la représentation Morgan des structures moléculaires ont été évalués dans 12 ensembles de données de classificateur binaire. La couche de sortie d'origine de chaque GNN a été remplacée par l'arbre de décision d'amplification de gradient (GBDT), qui a obtenu les meilleures performances de prédiction parmi tous les autres apprenants supervisés : SVM, RF et XGBoost. Ensuite, en combinant ces 12 classificateurs binaires, le prédicteur multicible pour identifier les associations cible-composé VIH-1/VHB a été généré, qui est nommé DMPNN plus GBDT.


4.4. Méthodes d'apprentissage automatique

Pour sélectionner la coopération du réseau de neurones du graphe dans les duos collaborants, six types d'algorithmes d'apprentissage automatique ont été évalués pour la performance de la tâche de classification de cible binaire : forêt aléatoire (RF), machines à vecteurs de support (SVM), Bayes naïf (NB) , arbre de décision d'amplification de gradient (GBDT) et algorithme d'amplification de gradient extrême (XGBoost). Le réglage des hyperparamètres de toutes les méthodes d'apprentissage automatique a été optimisé à l'aide de la validation croisée {{0}} fois dans une recherche exhaustive sur un espace d'hyperparamètres limité. Dans la classification RF, pour un échantillon donné, chaque arbre de décision prédit une étiquette, et la prédiction finale de l'échantillon est l'étiquette de la plupart des prédictions d'arbre, dans laquelle le nombre d'arbres de décision a été fixé à 10{{18 }}0. La classification SVM construit la meilleure séparation de deux classes en maximisant la distance (binaire) entre les instances qui appartiennent à des classes différentes. Pour cet algorithme, un hyperparamètre "coût" utilisé pour contrôler les erreurs a été optimisé par les valeurs candidates 0.{{30}}1, 0.1, 1, 10, et 100. GBDT est un membre de la famille de renforcement de l'apprentissage d'ensemble, qui itère à l'aide d'un algorithme de distribution vers l'avant. En supposant que l'apprenant fort de l'itération précédente est ft−1(x), la fonction de perte est L(y, ft−1(x)), et le but de cette itération est de trouver un arbre de décision apprenant ht(x), minimisant la fonction de perte L(y, ft(x))=L(y, ft−1(x) plus ht(x)). Pour cet algorithme, le nombre d'arbres de décision a été fixé à 1000 ; la profondeur maximale de l'arbre de décision a été sélectionnée parmi 3, 5, 10 ; le taux d'apprentissage a été échantillonné à partir de (0, 1); et le nombre minimum d'échantillons pour diviser un nœud interne était un candidat parmi 2, 3, 4 et 5. Enfin, 3 paramètres XGBoost ont été réglés, c'est-à-dire le taux d'apprentissage, la profondeur maximale et le poids minimum de l'enfant à partir de 5 valeurs candidates 0,01 , 0,05, 0,1, 0,15 et 0,2.

Anti fatigue Cistanche extract

4.5. Indicateurs de performance

Cette étude a évalué le cadre proposé DMPNN plus GBDT avec des performances de prédiction avec les deux autres réseaux de neurones de graphes dans la validation de prédiction à cible unique. Le score F1 et l'ASC ont été adoptés pour évaluer les performances de chaque modèle. Le score F1 est la moyenne harmonique de précision (PPV) et de rappel (TPR), le score AUC est défini comme l'aire sous la courbe des caractéristiques de fonctionnement du récepteur (ROC) pour la métrique de performance de classification. La courbe ROC est définie comme la courbe connexe des points taux de vrais positifs (TPR) et taux de faux positifs (FPR).

image

où TP signifie vrais positifs, TN signifie vrais négatifs, FP signifie faux positifs et FN signifie faux négatifs, avec positif et négatif se référant respectivement aux marqueurs de composés actifs et inactifs.

Pour évaluer les performances globales de notre classificateur multicible combiné à 12 classificateurs binaires à cible unique dans la tâche de prédiction de cible VIH-1/VHB, la capacité d'identifier les composés actifs connus parmi les associations cibles de composés connues NPV, TPR et la capacité d'aucune interaction connue manquante FNR a été utilisée comme métrique.


image

4.6. Déséquilibre des données

Comme le montre la figure 2, les ensembles de données utilisés dans cette étude sont déséquilibrés. Nous avons adopté la méthode d'apprentissage sensible aux coûts pour augmenter l'importance de certaines catégories dans les tâches d'entraînement à la classification en punissant les erreurs de classification dans ces catégories notamment, en ajustant les paramètres dans les méthodes d'apprentissage automatique. Pour XGBoost, le paramètre "scale_pos_weight" a été défini sur le rapport du nombre de cas négatifs et de cas positifs. Comme pour SVM et RF, le paramètre "class_weight" a été défini sur "balanced". Il n'y a pas de paramètre technique pour équilibrer les données dans l'algorithme NB. Cependant, pour les modèles d'arbre de décision, qui utilisent des règles de partition basées sur des variables de classe pour créer des arbres de classification, ils peuvent obtenir de bonnes performances en séparant de force les échantillons de différentes catégories. Par conséquent, dans GDBT, nous définissons le paramètre "poids de l'échantillon_" en fonction de la proportion d'échantillons négatifs et d'échantillons positifs dans différents ensembles de données, ce qui réduit artificiellement l'impact des grands ensembles d'échantillons.


5. Conclusions

Dans cet article, nous avons proposé un modèle de prédiction basé sur un réseau neuronal graphique en intégrant un algorithme d'apprentissage supervisé efficace qui est une excellente implémentation de la stratégie de gradient boosting, GBDT. En combinant 12 ensembles de données de classification optimale binaire, 1 modèle de prédiction à cibles multiples a été construit. Afin d'évaluer les performances de notre modèle d'ensemble de prédiction multicible, cinq ensembles de données externes ont été construits pour les évaluations de prédiction, qui ont tous atteint le PPV et le TPR satisfaits, ce qui signifie la prédiction relativement très précise des cibles potentielles sur le VIH-1 et VHB. En outre, nos recherches ont donné une rétrospective des médicaments connus contre le VIH -1 et le VHB pour détecter des cibles potentiellement possibles, ont également exploré de nouveaux composés pour leurs cibles jumelles du VIH -1 et du VHB, résultant en six nouveaux composés potentiels pour le traitement co-infection du VIH-1 et du VHB. En conclusion, le modèle de réseau neuronal utilisé dans cette étude pourrait identifier efficacement les co-inhibiteurs du VIH -1 et du VHB et avoir une application potentielle pour le dépistage virtuel de médicaments multicibles pour le traitement de la co-infection VIH/VHB.


Contributions des auteurs : LZ et YW ont conçu et conçu le modèle de réseau de graphes et mis en œuvre l'étude simulée et l'analyse de l'ensemble de données réelles ; YL a écrit les codes des expériences ; LZ, YW et XC ont écrit tout le manuscrit. Tous les auteurs ont suffisamment participé au travail pour en assumer la responsabilité. Tous les auteurs ont lu et accepté la version publiée du manuscrit.

Financement : Cette recherche a été financée par la Fondation nationale des sciences naturelles de Chine (n° 3161194 et n° 72271028).

Déclaration du comité d'examen institutionnel : sans objet.

Déclaration de consentement éclairé : non applicable.


Les références

1. ONUSIDA. AIDSinfo 2020. Disponible en ligne :https://aidsinfo.unaids.org/(consulté le 12 janvier 2022).

2. Bendavid, E.; Jeune, SD ; Katzenstein, DA; Bayoumi, AM ; Ponceuses, GD ; Owens, DK Rentabilité de la surveillance du VIHStratégies dans les pays à ressources limitées : une analyse de l'Afrique australe.Cambre. Interne. Méd.2008, 168, 1910–1918. [RéfCroisée] [PubMed] 

3. Charles, M.; Boyle, BA Excès et accès : la controverse persistante concernant le VIH et les soins de santé en Afrique.SIDA Lire.2002, 12, 288–292. 4. Xia, H.; Wang, Y.; Soleil, HL ; Gao, LY ; Cao, Y.; Zaongo, SD ; Zeng, RN ; Wu, H.; Zhang, MJ; Ma, P. Innocuité et efficacité deImmunothérapie allogénique par cellules tueuses naturelles sur des non-répondeurs immunologiques du virus de l'immunodéficience humaine de type 1 : ARapport bref.Menton. Méd. J2020, 133, 2803–2807. [RéfCroisée] [PubMed] 5. Zaongo, SD ; Xia, H.; Ma, P. Stratégies et innocuité de la thérapie génique du VIH : que savons-nous des publications récentes ?sidaTour.2020, 23, 195–202. [RéfCroisée] [PubMed] 6. Falkenhagen, A.; Joshi, S. Stratégies génétiques pour le traitement et la prévention du VIH.Mol. Là. Acides nucléiques2018, 13, 514–533. [RéfCroisée] 7. Janeway, CA, Jr. ; Travers, P.; Walport, M.; Shlomchik, MJImmunobiologie : le système immunitaire dans la santé et la maladie, 5e éd.;Garland Science : New York, NY, États-Unis, 2001.8. Hoffmann, CJ; Thio, CL Implications cliniques de la co-infection par le VIH et l'hépatite B en Asie et en Afrique.Lancette infectée. Dis.2007, 7, 402–409. [RéfCroisée] 9. Singh, CP ; Crane, M. ; Audsley, J.; Avihingsanon, A.; Sasadeusz, J.; Lewin, SR Co-infection par le VIH et le virus de l'hépatite B : épidémiologie,Pathogenèse et traitement.sida2017, 31, 2035–2052. [RéfCroisée] 10. Cheng, Z.; Lin, P.; Cheng, N. Coinfection VHB/VIH : impact sur le développement et le traitement clinique des maladies du foie.Devant.Méd.2021, 8, 713981. [RéfCroisée] 


Service d'assistance :

E-mail :wallence.suen@wecistanche.com

Whatsapp/Tél : plus 86 15292862950

Boutique:

https://www.xjcistanche.com/cistanche-shop


Vous pourriez aussi aimer