Microsoft Word – Deep Learning par rapport aux modèles traditionnels_Abdel Hai_Final.Partie 2
Jan 03, 2024
Pour préparer les données pour les modèles d'apprentissage automatique, les techniques de prétraitement des données suivantes ont été utilisées.
Les données et la mémoire sont étroitement liées. Dans la société moderne, nous recevons chaque jour une grande quantité d’informations et de données, notamment des textes, des images, des vidéos, etc. Pour traiter et organiser efficacement ces données, nous devons avoir une bonne mémoire.
D’une part, les données peuvent nous fournir un support mémoire. Par exemple, lorsque nous apprenons de nouvelles connaissances, nous pouvons comprendre et maîtriser les points de connaissance plus rapidement et mieux en mémorisant des données et des faits pertinents. Ce type de méthode d’apprentissage peut nous aider à développer une mémoire solide et à maintenir la capacité de contrôler les connaissances pendant longtemps.
D’un autre côté, les données peuvent également nous aider à entraîner et à améliorer la mémoire. Grâce à diverses méthodes d'entraînement de la mémoire, nous pouvons utiliser les données de manière flexible pour effectuer un entraînement de la mémoire, améliorer dans une certaine mesure notre capacité de mémoire et ainsi mieux nous adapter au développement de la société et aux besoins du travail et de la vie.
On voit que la relation entre les données et la mémoire est très étroite et importante. Ce n’est qu’en traitant et en utilisant les données de manière active et efficace que nous pourrons mieux utiliser nos capacités de mémoire et obtenir de meilleurs résultats. Par conséquent, nous devons traiter activement la relation entre les données et la mémoire, suivre des formations et des applications pertinentes et améliorer constamment nos capacités. On voit que nous devons améliorer la mémoire, et Cistanche deserticola peut améliorer considérablement la mémoire, car Cistanche deserticola peut également réguler l'équilibre des neurotransmetteurs, comme en augmentant les niveaux d'acétylcholine et de facteurs de croissance. Ces substances sont très importantes pour la mémoire et l'apprentissage. En outre, la viande peut également améliorer la circulation sanguine et favoriser l'apport d'oxygène, ce qui peut garantir que le cerveau reçoive suffisamment de nutriments et d'énergie, améliorant ainsi sa vitalité et son endurance.

Cliquez sur connaître les moyens d'améliorer la fonction cérébrale
Les caractéristiques catégorielles étaient codées à chaud ; les caractéristiques continues et discrètes ont été normalisées à l'aide de techniques de normalisation min-max,32 définies comme :
![]()
Il y avait un nombre différent d'enregistrements lors de chaque rencontre pour chacune des caractéristiques suivantes. Ainsi, les valeurs statistiques suivantes ont été calculées à la place. Pour les tensions artérielles diastolique et systolique, nous avons calculé les valeurs minimales, maximales et moyennes.
Pour l'IMC, le minimum, le maximum, la moyenne et le coefficient de variance ont été utilisés. Ces valeurs statistiques ont été normalisées et utilisées comme caractéristiques. De plus, le nombre de caractéristiques différait lors des rencontres en raison du nombre différent de tests de laboratoire, de diagnostics et de procédures. Une rencontre peut comporter plusieurs diagnostics et/ou codes de procédure, voire aucun.
Pour remédier à cela et unifier la dimensionnalité des vecteurs de caractéristiques, les techniques de représentation des données suivantes ont été utilisées pour améliorer l'apprentissage des modèles. Pour les codes de diagnostic et de procédure, nous avons utilisé la représentation d'encodages uniques, où chaque valeur était définie sur 0 ou 1, indiquant si un code de diagnostic/procédure existait ou non pour chaque rencontre. Nous avons légèrement modifié cette technique de représentation des données pour les tests en laboratoire car chaque test avait un résultat associé.
Par conséquent, nous avons remplacé 1, qui indiquait qu’un code existe, par le résultat du laboratoire. Les résultats de laboratoire ont été normalisés à l'aide de l'équation 1. Étant donné que les résultats provenaient d'unités et de mesures différentes, lors de la normalisation des résultats de laboratoire, nous avons considéré séparément le minimum et le maximum pour chaque code de laboratoire. Cette technique a créé un tableau clairsemé de haute dimension en raison des nombreux codes uniques.
Ensuite, nous avons utilisé l'algorithme de décomposition en valeurs singulières (SVD) pour apprendre une dimensionnalité intégrée et réduite. Le SVD a été utilisé car il ne suppose pas de matrice carrée comme entrée et est meilleur pour les données clairsemées.33 Les tests de laboratoire ont été réduits à 50 composants, procédure les codes ont été réduits à 45 composants et les codes de diagnostic à 25 composants.
Différentes composantes ont été explorées et le rapport de somme des variances a été observé pour déterminer le nombre optimal de composantes pour réduire la dimensionnalité. Toutes les fonctionnalités ont été concaténées dans un vecteur de fonctionnalités pour chaque rencontre. SVD a été appliqué à chaque rencontre séparément pour réduire et unifier les dimensions ; la dimension des rencontres a été réduite à 50 fonctionnalités par rencontre.

Ensuite, nous avons concaténé toutes les rencontres pour un patient donné dans un vecteur de caractéristiques classé séquentiellement par date d'admission. La répartition par classe était de 27 511 patients sans réadmission (classe négative) et 9 130 patients réadmis (classe positive).
Approches expérimentales
Nous avons mené des expériences approfondies en utilisant les données du DSE pour atteindre les objectifs suivants :
- Prédire si les patients diabétiques seront réadmis dans les 30 jours
- Comparer les performances des méthodes DL utilisées avec plusieurs modèles traditionnels
- Analyser combien de rencontres antérieures (c'est-à-dire données historiques) dans un délai de 2 ans est optimal pour prédire la réadmission
- Évaluer les effets de l'incorporation de tous les tests de laboratoire dans les données par rapport à l'apprentissage à partir d'un sous-ensemble de tests choisis par un expert du domaine
Dans cette étude, les modèles DL prennent en entrée un tenseur dimensionnel 3-3- � x � x � pour représenter f caractéristiques pour chacune des e rencontres pour p patients. En revanche, dans les modèles traditionnels, les données sont généralement représentées sous la forme d'une matrice dimensionnelle 2-, avec toutes les caractéristiques de toutes les rencontres correspondant à un seul patient concaténé dans un long vecteur de caractéristiques.
La dimensionnalité de chaque rencontre a été réduite et unifiée à 50 caractéristiques, donc dans un modèle profond, la taille est de 50. Dans un modèle traditionnel, le vecteur de caractéristiques est constitué de toutes les rencontres et est donc de taille x 50.
Les patients ont un nombre différent de rencontres, ce qui entraîne des dimensions non uniformes ; par conséquent, les vecteurs de caractéristiques ont été complétés par des 0 pour obtenir une forme unifiée. La représentation des données utilisée comme entrée pour les modèles DL et traditionnels est illustrée respectivement sur les panneaux gauche et droit de la figure 1.
Pour modéliser des données séquentielles hétérogènes, nous avons développé 2 variantes de modèles DL et comparé les deux à plusieurs modèles traditionnels utilisés comme références. Les modèles DL utilisés dans notre étude étaient : 1) les réseaux 1-way Long Short-Term Memory (LSTM), qui sont une variante du réseau neuronal récurrent (RNN) capable d'apprendre des données non séquentielles en fonction de l'ordre ; et 2) Unité récurrente bidirectionnelle (GRU), qui est une autre variante de RNN.
Les modèles traditionnels utilisés comme références étaient les suivants : 1) Random Forest (RF), une méthode d'ensemble pour la classification et la régression ; pendant l'entraînement, il construit plusieurs arbres de décision30 ; RF atteint fréquemment les performances de pointe de la littérature existante sur les prédictions utilisant des données médicales. 2) Perceptron multicouche (MLP), un modèle de réseau neuronal simple qui ne prend pas en compte les informations temporelles.
MLP se compose de plusieurs couches de perceptron, effectue un apprentissage par rétropropagation et utilise une fonction d'activation non linéaire.31 3) Régression logistique (LR), un modèle interprétable fréquemment utilisé dans la littérature existante sur les prédictions de réadmission et appliqué aux données médicales ; et 4) AdaBoost, qui est moins sujet au surajustement car ses paramètres d'entrée ne sont pas optimisés conjointement.

Les modèles DL ont été implémentés à l'aide des bibliothèques Python "Keras", une API de haut niveau de "TensorFlow". La bibliothèque « Scikit-learn » a été utilisée pour implémenter des modèles traditionnels en Python.
L'architecture du modèle proposé, LSTM, comprend 128 neurones, une couche séquentielle, une couche de remodelage utilisée pour remodeler l'entrée en un tenseur dimensionnel 3- et une couche de masquage avec une valeur de masque de 0 utilisé pour ignorer les pas de temps pour lesquels les données manquaient.
Étant donné qu'un remplissage avec 0 a été effectué pour unifier les dimensions, la couche de masquage a été utilisée pour éviter tout calcul avec les valeurs manquantes dans toutes les couches suivant la couche de masquage. Par conséquent, les valeurs manquantes n'ont pas été prises en compte lors de l'apprentissage.
De plus, un décrochage a été ajouté entre les couches masquées et de sortie. L'utilisation de cette technique pour sélectionner aléatoirement un pourcentage donné à supprimer est une technique de régularisation courante qui aide le modèle à apprendre des modèles généraux dans les données.
Le RNN est une variante des réseaux neuronaux, constitués de neurones cachés capables d'analyser les données temporelles du DSE.32 Le RNN comprend la même structure que le réseau neuronal de base, mais les neurones de la même couche sont connectés, permettant à un neurone d'apprendre à partir du même réseau neuronal. couches voisines, en plus d’apprendre des sorties des couches précédentes et des données d’entrée. Ainsi, les neurones RNN incluent deux sources d’entrées, le présent et le passé récent. Le processus d’apprentissage est défini comme :

Pour calculer la valeur �" d'un neurone caché, �, une fonction de transformation non linéaire, ReLU, est appliquée à la � valeur pondérée de son neurone caché gauche � "#$ et à la � valeur pondérée de son entrée �".
Les prédictions sont calculées à l’aide de la fonction asigmoïde de la « somme pondérée de tous les neurones cachés avec un biais supplémentaire ». L'inconvénient du RNN est qu'il souffre du problème du gradient de disparition, ce qui signifie que les poids restent inchangés, ce qui rend difficile la convergence du modèle, ce qui rend le modèle difficile à apprendre.
Pour résoudre ce problème, une couche LSTM a été introduite dans laquelle les neurones sigmoïdes du RNN sont remplacés par une structure de mémoire à court terme plus complexe. LSTM partage les mêmes pondérations entre les couches, ce qui réduit le nombre de paramètres calculés par le réseau.

Le GRU est une solution alternative pour éliminer le problème de gradient. Il remplace le simple neurone par une unité fermée, qui possède moins de paramètres que les neurones LSTM car elle ne possède pas de porte de sortie.33
For more information:1950477648nn@gmail.com






