Reconnaissance vocale des voyelles à partir de l'électroencéphalographie du rat à l'aide d'un réseau neuronal à mémoire longue et à court terme, partie 3
Dec 28, 2023
Classificateurs d'apprentissage automatique
Les performances de BiLSTM ont été comparées à celles des classificateurs d'apprentissage automatique conventionnels : SVM avec noyau linéaire (SVM_lin), SVM avec noyau de fonction de base radiale (SVM_rbf), forêts aléatoires (RF), NB et KNN.
Random Forest est un algorithme d’apprentissage automatique actuellement largement utilisé dans divers domaines d’analyse et de prédiction de données. Comparé à d’autres algorithmes d’apprentissage automatique, il offre une meilleure robustesse et précision, tout en réduisant efficacement le surapprentissage. Ces dernières années, le champ d’application des forêts aléatoires s’est élargi et peut même être utilisé pour prédire certaines capacités de la mémoire humaine.
Dans le domaine de la psychologie cognitive, la mémoire constitue une direction de recherche très importante. Les scientifiques recherchaient un moyen simple et efficace d’évaluer les niveaux de mémoire humaine. Ces dernières années, l’émergence des forêts aléatoires a apporté de nouvelles idées et méthodes dans ce domaine.
Random Forest peut entraîner un modèle pour prédire une variable, qui peut être tout ce que vous souhaitez prédire, y compris la capacité de mémoire. Les scientifiques peuvent intégrer des facteurs pertinents dans un modèle de forêt aléatoire pour prédire les résultats d'une personne à un test de mémoire. Ces facteurs peuvent être des facteurs tels que l’âge, le niveau d’éducation, le sexe, le poids, etc., ou des indicateurs biologiques tels que la structure du cerveau. Selon les recherches, il existe une certaine relation entre ces facteurs et la capacité de mémoire humaine.
En collectant et en analysant de grandes quantités de données de test auprès de sujets, les scientifiques peuvent créer un modèle qui prédit la capacité de mémoire dans un modèle de forêt aléatoire. La prédiction des résultats peut fournir des informations précieuses sur les performances futures d'un sujet à un certain test de mémoire.
En résumé, l’algorithme de forêt aléatoire offre aux scientifiques une nouvelle façon d’évaluer les niveaux de mémoire humaine. À l’avenir, ses applications pourraient jouer un rôle important dans la psychologie cognitive, les neurosciences et dans d’autres domaines. Nous avons des raisons de croire que la combinaison de forêts aléatoires et d’autres techniques peut offrir une perspective plus large et une compréhension plus approfondie de la recherche sur la fonction cérébrale humaine. On voit que nous devons améliorer la mémoire, et Cistanche deserticola peut améliorer considérablement la mémoire, car Cistanche deserticola peut également réguler l'équilibre des neurotransmetteurs, comme en augmentant les niveaux d'acétylcholine et de facteurs de croissance. Ces substances sont très importantes pour la mémoire et l'apprentissage. En outre, la viande peut également améliorer la circulation sanguine et favoriser l'apport d'oxygène, ce qui peut garantir que le cerveau reçoive suffisamment de nutriments et d'énergie, améliorant ainsi sa vitalité et son endurance.

Cliquez sur connaître les moyens d'améliorer la fonction cérébrale
SVM [74] vise à déterminer l'hyperplan séparé de manière optimale en maximisant la marge, qui est la distance entre les vecteurs supports. En utilisant l'astuce du noyau, SVM est capable de mapper l'espace des fonctionnalités de dimensions faibles à élevées ; par conséquent, il peut effectuer efficacement une classification linéaire et une classification non linéaire.
RF [75] fonctionne en construisant plusieurs arbres de décision pendant la phase de formation et en générant la classe finale qui combine les résultats de chaque arbre de décision. NB [76, 77] est un classificateur probabiliste basé sur le théorème de Bayes et la probabilité conditionnelle qui suppose généralement que toutes les caractéristiques sont indépendantes les unes des autres.
KNN [78] est une approche non paramétrique qui classe l'entrée en fonction de la classe majoritaire de ses k voisins les plus proches dans l'espace des caractéristiques. Habituellement, la valeur k est sélectionnée comme un nombre impair pour éviter les classes à égalité.
Pour entraîner et évaluer les modèles d'apprentissage automatique ci-dessus, le même CV 10- a été utilisé que dans BiLSTM. Tous les modèles d'apprentissage automatique ont été implémentés à l'aide de la bibliothèque Scikit-Learn [73] en Python.
analyses statistiques
Toutes les analyses statistiques ont été effectuées à l'aide du logiciel SPSS (SPSS version 20.0, SPSS Inc., Armonk, NY, USA) et du logiciel MATLAB version 2017b (Mathworks, Inc., MA, USA).
Les données ont été analysées avec des statistiques paramétriques puisque toutes les données de l'étude ont montré une distribution normale dans le test de Shapiro-Wilk (p > 0,05). L'ANOVA a été utilisée pour analyser la signification statistique des TFR en fonction des différents stimuli vocaliques.
De plus, une ANOVA à mesures répétées a été réalisée pour comparer les performances de chaque classificateur. Par la suite, des comparaisons par paires utilisant des tests t appariés ont été effectuées entre le réseau BiLSTM et d'autres classificateurs classiques d'apprentissage automatique, et une correction de Bonferroni a été effectuée pour ajuster l'inflation du taux d'erreur de type I.
La signification statistique de la valeur p a été fixée à 0.0 1 lors de la comparaison du TFR des réponses EEG, tandis que le niveau de signification de la valeur p a été fixé à 0,05 lors de la comparaison des performances entre le réseau BiLSTM et d'autres classificateurs d'apprentissage automatique.
Résultats
Potentiels évoqués auditifs en réponse aux voyelles
Au total, 19 rats Sprague-Dawley ont subi une intervention chirurgicale d'implantation d'électrodes péridurales, et tous les rats ont survécu à l'intervention chirurgicale. En conséquence, les réponses EEG à cinq voyelles anglaises ont été enregistrées chez 19 rats anesthésiés à l'isoflurane. Pour extraire les formes d'onde moyennes de l'AEP, toutes les réponses neuronales ont été moyennées sur les sujets pour chaque stimulus. La figure 4 présente les formes d'onde AEP moyennes pour chaque voyelle provenant de l'AAF bilatéral.
Comme prévu, chaque voyelle catégorique évoquait des activités neuronales distinctes dans l'AAF bilatéral avec des amplitudes et des latences maximales variables. L'amplitude maximale des AEP, définie comme la tension la plus élevée enregistrée après les stimuli vocaliques, était la plus petite pour /i/ (61,74 ㎶ dans l'AAF gauche et 61,27 ㎶ dans l'AAF droit), tandis que les AEP en réponse à /a/ présentaient les amplitudes maximales les plus grandes. (92,12 ㎶ en AAF gauche et 90,18 ㎶ en AAF droit).
La latence maximale, définie comme la durée entre le début du stimulus et l'amplitude maximale, était d'environ {{0}},39 s à 0,5 s, la plus courte en /i/(0. 39 s dans les AAF gauche et droit), et le plus long dans le son /o/ (0,51 s dans les AAF gauche et droit). Comme le montre la figure 4, des formes d'onde AEP similaires ont été observées à partir des AAF gauche et droit.

Analyse temps-fréquence des signaux EEG
L'analyse temps-fréquence est une méthode puissante pour analyser les signaux EEG non stationnaires sur un plan temps-fréquence et est utilisée pour fournir des informations qualitatives pour la classification de l'EEG [79, 80]. Par conséquent, le TFR de l'EEG en moyenne générale a été calculé pour chaque son afin d'identifier les changements liés à la reconnaissance des voyelles dans l'amplitude et la phase des oscillations EEG à des fréquences spécifiques (Fig. 5A).
À partir de l'analyse TFR, une activation de puissance élevée a été observée autour des bandes delta (1 à 4 Hz), thêta (4 à 8 Hz) et alpha (8 à 12 Hz) à 0.3–{{8} },6 s à partir du début du stimulus, quelle que soit la stimulation sonore de la parole.

De plus, un test ANOVA avec une correction de Bonferroni a été réalisé pour analyser les composantes statistiquement significatives du TFR en fonction de chaque stimulus vocalique.
Par la suite, la puissance des zones statistiquement significatives (p < {{0}}.01) a été représentée par la valeur F (Fig. 5B). Dans l'analyse, la plupart des bandes de fréquences EEG de 0,2 à 0,8 s étaient significativement différentes selon les stimuli vocaliques.
De plus, une partie du TFR de {{0}},8–1 s était également statistiquement différente pour chaque stimulus. Compte tenu des formes d'onde AEP et des résultats des tests ANOVA, il a été déduit que les AEP de 0,2 à 0,8 s après le stimulus vocalique étaient les réponses neuronales les plus informatives et étaient liées à la reconnaissance des voyelles.
Formation modèle et évaluation des réseaux BiLSTM
Sur la base des résultats de la figure 5B, les données EEG filtrées passe-bande entre 1 et 6 0 Hz avec une fenêtre temporelle de 0,2 à 0,8 s ont été sélectionnées. Ensuite, les scores z des données EEG sélectionnées ont été utilisés comme entrée dans le réseau BiLSTM.
Toutes les données EEG ont été divisées en 10 volets au sein de chaque sujet pour évaluer les réseaux BiLSTM. Par conséquent, les performances du test ont été obtenues par pli en utilisant le modèle entraîné avec les plis restants dans un schéma CV 10-.
Les performances du réseau ont été évaluées à l'aide de mesures de précision, du score f{{0}} et de la statistique kappa de Cohen κ (Fig. 6 et Tableau 1). La précision moyenne de la discrimination EEG à cinq classes du réseau BiLSTM était de 75,18 ± 7,06 % et le f1-score était de 0,74 ± 0,08. . Le κ de Cohen était de 0,68 ± 0,09, ce qui a été interprété comme un accord modéré [81].
Pour analyser plus en détail les performances du réseau BiLSTM, la matrice de confusion de la figure 7 a été tracée. Cela indiquait que de nombreuses erreurs étaient dues à une mauvaise classification des réponses EEG en /u/ comme /a/ et /e/ comme /o/. Cependant, le réseau BiLSTM a classé la plupart des réponses EEG avec une précision de plus de 50 %, une précision élevée dans la classification EEG en cinq classes.

Comparaison du réseau BiLSTM avec d'autres méthodes d'apprentissage automatique
Pour valider l'efficacité des réseaux BiLSTM dans la classification de l'EEG pour la reconnaissance des voyelles, les résultats ont été comparés à ceux d'autres méthodes conventionnelles d'apprentissage automatique. La figure 6 et le tableau 1 montrent les performances des classificateurs d'apprentissage automatique.
Le RF a démontré la précision de classification la plus élevée parmi les algorithmes d'apprentissage automatique conventionnels (précision : 63,21 ± 7,41 %, f1-score : 0,62 ± 0.09, et celui de Cohen. : 0,52 ± 0,1). Dans l'analyse statistique, les performances de classification de RF n'étaient pas significativement supérieures à celles de SVM_lin et SVM_rbf, alors qu'elles montraient des performances supérieures à celles de NB et KNN.
Cependant, lorsque les performances des algorithmes d'apprentissage automatique conventionnels, y compris RF, ont été comparées à celles de BiLSTM, il était évident que le réseau BiLSTM était supérieur pour toutes les métriques utilisées dans l'étude (p < 0,01).
Dans la matrice de confusion, les algorithmes d’apprentissage automatique conventionnels ne peuvent pas bien distinguer certaines réponses EEG. En particulier, tous les algorithmes d’apprentissage automatique classiques avaient du mal à distinguer le son /u/. Il a été noté que les algorithmes ont montré une tendance à mal classer le son /u/ comme /a/ en moyenne 30 % du temps (25,96 % au NB à 36,97 % au KNN), ce qui entraîne une diminution des performances globales de classification (Fig. 7). .

Discussion
Dans cette étude, les réponses EEG épidurales de rat à cinq voyelles catégoriques (/a/, /e/, /i/, /o/ et /u/) ont été discriminées à l'aide du réseau BiLSTM. Des classifications en cinq classes de signaux EEG épiduraux ont été réalisées sur la base d'un seul essai, ce qui est connu pour être difficile. Pour maximiser les performances d'apprentissage, cette étude a tenté de déterminer les composants EEG spécifiques qui pourraient être liés à la reconnaissance des sons de la parole dans le cerveau du rat et a utilisé ces composants EEG comme caractéristiques d'entrée. En conséquence, une performance relativement élevée dans la classification des AEP en cinq voyelles différentes a été obtenue en utilisant BiLSTM. Une comparaison des performances de classification du réseau BiLSTM avec d'autres algorithmes d'apprentissage automatique a montré que le réseau BiLSTM surpassait les autres classificateurs classiques. Ces résultats indiquent que le réseau BiLSTM, entraîné avec des composants EEG liés à la reconnaissance vocale, classe de manière fiable les AEP pour chaque voyelle catégorielle avec un haut degré de précision. À notre connaissance, les réseaux LSTM n'ont pas été appliqués à la classification des réponses EEG à des stimuli auditifs, et il s'agit de la première étude à utiliser un algorithme d'apprentissage profond pour analyser les signaux EEG provenant de l'AAF de rat.

Actuellement, seules quelques études ont utilisé l’architecture LSTM pour obtenir des résultats de pointe en matière de classification basée sur l’EEG. L'architecture LSTM convient à la classification basée sur l'EEG car sa structure en forme de chaîne peut capturer la séquence temporelle des données EEG (82). Au début, la recherche s'est concentrée sur l'amélioration des résultats de classification à travers diverses architectures LSTM ; cependant, les caractéristiques d'entrée étaient toujours extraites manuellement, comme dans les méthodes conventionnelles d'apprentissage automatique [83, 84].
Tsiouris et al. ont évalué les performances de diverses combinaisons d'éléments du réseau LSTM pour trouver les architectures LSTM les plus efficaces pour détecter les crises d'épilepsie, obtenant ainsi des résultats presque parfaits dans la prédiction des crises (sensibilité de 100 % et spécificité de 99,86 %) [83]. Le LSTM étant une structure puissante pour le traitement des données séquentielles, certaines études utilisent des données EEG brutes comme caractéristiques d'entrée avec un prétraitement minimal. Comme le réseau LSTM apprend directement les caractéristiques des données EEG brutes, les performances des études de reconnaissance des émotions se sont améliorées d'au moins 12 % [85], et les résultats des études de classification de l'imagerie motrice se sont également améliorés [86], par rapport à d'autres études traditionnelles. techniques d’extraction de caractéristiques.
De plus, l'architecture BiLSTM a été utilisée pour la classification basée sur l'EEG car elle peut accéder aux informations des états passés et futurs. Par conséquent, en détectant divers états cérébraux reflétés dans les données EEG, tels que les convulsions, le sommeil, etc. [63-67], le réseau BiLSTM a généralement surpassé le réseau LSTM qui capture uniquement les informations passées de la séquence dans le sens direct. Pour cette raison, des performances élevées ont été rapportées dans une récente classification basée sur l'EEG utilisant les réseaux BiLSTM. Sharma et coll. atteint une précision de classification de 82,01 % pour quatre types d'émotions basées sur l'algorithme BiLSTM et des statistiques d'ordre supérieur [87]. De plus, les réseaux BiLSTM ont réussi à classer les types d'épilepsie et les stades du sommeil (88, 89).
Semblable aux études précédentes, cette étude a obtenu des résultats relativement bons en utilisant les réseaux BiLSTM. L'algorithme proposé a réussi à discriminer les réponses EEG à cinq voyelles avec des valeurs de précision élevées, un score f{{0}} et un κ de Cohen de 75,18 %, 74,43 % et 0,68, respectivement. La valeur du κ de Cohen pour la classification en cinq classes est supérieure à celle observée dans la plupart des études actuelles [90]. Comme l'illustre la figure 6, la méthode BiLSTM a produit la valeur la plus élevée pour toutes les métriques par rapport aux autres méthodes d'apprentissage automatique. De plus, pour déterminer la différence statistique dans les performances de classification, les résultats d'ANOVA mesurés de manière répétée ont été analysés entre BiLSTM et d'autres méthodes classiques d'apprentissage automatique en utilisant toutes les valeurs métriques. Grâce à une analyse statistique, il a été déterminé que les performances de classification du réseau BiLSTM étaient significativement supérieures à celles des autres méthodes classiques d'apprentissage automatique (p < 0,01). Ce résultat était également cohérent avec la matrice de confusion. Comme le montre la figure 7, le réseau BiLSTM a bien prédit les véritables étiquettes des cinq voyelles, contrairement aux méthodes classiques d'apprentissage automatique.
La prédiction acquise grâce au classificateur d’apprentissage automatique conventionnel était particulièrement médiocre pour classer le son /u/ ; le /u/sound a été principalement interprété à tort comme /a/. Même RF, qui a montré les meilleures performances parmi les cinq classificateurs d'apprentissage automatique conventionnels, avait un taux de classification de 34,48 % pour le son /u/, avec un taux d'erreur de classification de 33,89 % du son /u/ en tant que son /a/. Comme on peut le voir sur la figure 4, les sons /a/ et /u/ avaient une latence maximale similaire, ce qui est l'une des principales caractéristiques des formes d'onde AEP (latence maximale du son /a/ : 0,448, crête latence du son /u/ : 0.444). Lorsque la classification a été effectuée sur la base de signaux EEG à essai unique peu prétraités, il semble que de telles similitudes n'aient pas pu être distinguées par les algorithmes d'apprentissage automatique conventionnels, alors que le réseau BiLSTM pouvait les distinguer.
Étant donné que le réseau BiLSTM peut accéder simultanément à tous les contextes passés et futurs, des informations riches peuvent être apprises grâce à ce réseau. De plus, même si les caractéristiques reflétant les caractéristiques des réponses EEG à chaque voyelle ont été extraites directement des directions avant et arrière de la couche LSTM, les performances de classification ont été améliorées. Dans cette étude, nous pouvons obtenir de bons résultats de classification en utilisant une architecture BiLSTM simple sans processus d’extraction de caractéristiques artisanal supplémentaire.
Classer les réponses ERP aux stimuli de la parole dans un seul essai est très difficile en raison des caractéristiques du faible SNR de l'EEG. Bien que l'un des principaux avantages de la méthode d'apprentissage profond soit sa capacité à apprendre des fonctionnalités de haut niveau sans extraction de fonctionnalités de base, nous avons tenté de sélectionner les signaux EEG les plus pertinents liés à la reconnaissance vocale pour obtenir de meilleures performances. Dans cette étude, des formes d'onde AEP distinctes correspondant à chaque stimulus sonore vocal ont été observées avec l'activation à haute puissance de la bande basse fréquence, y compris les bandes delta, thêta et alpha, dans les analyses TFR. Il est largement reconnu que les oscillations neuronales dans la bande alpha jouent un rôle important dans le traitement auditif. Mazaheri et al. ont rapporté que l'atténuation de l'activité alpha est étroitement liée à la discrimination des cibles auditives [91].
Staruss et al. ont prouvé que les oscillations alpha corticales constituent un mécanisme essentiel pour inhiber sélectivement le traitement du bruit afin d'améliorer l'attention sélective auditive envers les signaux cibles (92). Précédemment, nous avons également constaté que le pouvoir alpha était fortement activé dans les zones temporales bilatérales après des stimuli sonores spécifiques statistiquement différents en termes de type de son [48]. De plus, les bandes delta et thêta sont connues pour être associées à la formation de la segmentation et à l'influence perceptuelle des informations acoustiques (93).
Bien que cette étude soit basée sur des données expérimentales sur des animaux, des composantes similaires liées à la parole, par rapport aux études précédentes sur des sujets humains, ont été observées dans les analyses TFR. De plus, dans l'analyse statistique, toutes les bandes EEG se sont révélées significatives dans 1 après les stimuli et représenté les composantes EEG liées à la perception sonore. Ces résultats étaient quelque peu différents de ceux des études précédentes, suggérant que seules des bandes EEG spécifiques, telles que la bande alpha, étaient liées à la perception sonore. On s'attend à ce que même des changements subtils dans toutes les activités de la bande EEG soient enregistrés via l'enregistrement EEG péridural, car il fournit un SNR plus élevé en réduisant la conduction volumique et en éliminant les artefacts inhérents aux enregistrements EEG extracrâniens.
Dans cette étude, les composants EEG liés à la reconnaissance des sons vocaux chez le rat ont été déterminés et les composants AEP ont été classés avec succès à l'aide du réseau BiLSTM. Cependant, cette étude présentait certaines limites. Premièrement, le nombre de matières incluses était trop faible, notamment pour l’apprentissage profond. De plus, cette étude n'a pas évalué les performances de chaque classificateur avec une validation externe, mais a plutôt utilisé 10-CV pour surmonter les tailles d'échantillon limitées. En outre, nous ne pouvons pas exclure la possibilité que le système auditif du rat réagisse continuellement aux sons, puisqu'un seul énoncé de chaque voyelle a été utilisé dans cette étude. De plus, les réponses EEG acquises étaient affectées par les effets anesthésiques. Bien qu'une dose anesthésique minimale ait été utilisée, un ralentissement de la fréquence avec une augmentation de la puissance delta est une observation typique des modifications de l'EEG après l'inhalation d'isoflurane (94). Par conséquent, les composants EEG de reconnaissance des voyelles suggérés dans cette étude peuvent être différents des signaux EEG acquis chez des rats éveillés. Cependant, nous pensons que la qualité du signal EEG est suffisamment bonne puisque l'EEG a été enregistré via l'implantation d'électrodes péridurales et qu'il n'a pas été contaminé par des artefacts de mouvement.
Conclusions
En conclusion, cette étude a extrait des composants neuronaux significatifs liés à la perception catégorique de la parole. De plus, sur la base des caractéristiques des réseaux LSTM, il a été prouvé que le réseau BiLSTM était adapté à la classification des réponses EEG avec des AEP peu prétraités. Étant donné que cette étude est une recherche pionnière avec des données animales, elle pourrait ne pas être directement transférable à d'autres applications pratiques telles que les interfaces cerveau-ordinateur ou d'autres aides à la communication pour les humains.

Par conséquent, de futures études avec des données EEG humaines sont nécessaires pour vérifier l'efficacité du réseau BiLSTM dans la classification de la reconnaissance vocale basée sur l'EEG auditif. De plus, il doit être réévalué pour un réglage optimal des paramètres et une extraction des fonctionnalités. On s'attend à ce que cette étude fournisse une nouvelle approche pour analyser les signaux EEG ainsi que des informations précieuses concernant les mécanismes de perception et de reconnaissance de la parole dans le cerveau.

Les références
1. Wernicke C. Le complexe symptomatique de l'aphasie. Dans : Cohen RS, Wartofsky MW, éditeurs. Actes du Colloque de Boston pour la philosophie des sciences 1966/1968. Dordrecht : Springer Pays-Bas ; 1969. pp. 34-97.
2. Shi Z, Yan S, Ding Y, Zhou C, Qian S, Wang Z et al. Le champ auditif antérieur est nécessaire à la catégorisation des sons dans la tâche de conditionnement de la peur des rats adultes. Neuroscies avant. 2019 ; 13 : 1374.
3. Liberman AM, Harris KS, Hoffman HS, Griffith BC. La discrimination des sons de la parole à l'intérieur et à travers les frontières des phonèmes. J Exp Psychol. 1957 ; 54 : 358-368.
4. Johnson K. Phonétique acoustique et auditive. Chichester : Wiley-Blackwell ; 2012.
5. Green PA, Brandley NC, Nowicki S. Perception catégorique dans la communication et la prise de décision animales. Comportement Ecol. 2020 ; 31 : 859–867.
6. Craik A, He Y, Contreras-Vidal JL. Apprentissage profond pour les tâches de classification de l'électroencéphalogramme (EEG) : une revue. J Neural Ing. 2019 ; 16 : 28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. La négativité des mésappariements (MMN) dans la recherche fondamentale sur le traitement auditif central : une revue. Neurophysiologie clinique. Elsevier; 2007. pp. 2544-2590.
8. Garrido MI, Kilner JM, Stephan KE, Friston KJ. La négativité du décalage : un examen des mécanismes sous-jacents. Neurophysiologie clinique. Elsevier; 2009. p. 453-463
For more information:1950477648nn@gmail.com






