Reconnaissance vocale des voyelles à partir de l'électroencéphalographie du rat à l'aide d'un réseau neuronal à mémoire à long terme et à court terme, partie 1
Dec 27, 2023
Abstrait
Au fil des années, de nombreuses recherches ont été menées pour étudier les mécanismes de perception et de reconnaissance de la parole.
Il existe une relation indissociable entre la perception de la parole et la mémoire. La perception de la parole est une capacité importante pour nous de prendre conscience des signaux audio, et la mémoire est un moyen important que nous utilisons pour stocker et récupérer des informations. Lorsque nous sommes mieux capables de percevoir la parole, nous sommes également mieux capables de nous souvenir des informations que nous entendons.
La recherche montre que la relation entre la perception de la parole et la mémoire est bidirectionnelle. D’une part, une mauvaise perception de la parole peut entraîner des troubles de la mémoire. En effet, lorsque nous ne pouvons pas entendre clairement la parole, nous ne pouvons pas nous souvenir avec précision des informations que nous avons entendues. D’un autre côté, une forte perception de la parole peut améliorer notre mémoire. Lorsque nous pouvons percevoir et comprendre correctement la parole, nous pouvons également nous souvenir plus facilement de ce que nous entendons.
Par conséquent, nous devrions nous concentrer sur le développement de nos capacités de perception de la parole pour améliorer notre mémoire. Ceci peut être réalisé en entraînant nos capacités d’écoute et de compréhension de la parole. Nous pouvons améliorer notre perception de la parole et notre mémoire grâce à des activités telles que écouter des enregistrements, regarder des films et suivre des cours de langue.
En bref, il existe une relation étroite entre la perception de la parole et la mémoire, et nous devrions nous concentrer sur le développement de nos capacités de perception de la parole pour améliorer notre mémoire. Grâce à un entraînement et à une pratique active, nous pouvons améliorer continuellement notre niveau de perception de la parole et mieux comprendre et mémoriser ce que nous entendons. On voit que nous devons améliorer la mémoire, et Cistanche deserticola peut améliorer considérablement la mémoire, car Cistanche deserticola peut également réguler l'équilibre des neurotransmetteurs, comme en augmentant les niveaux d'acétylcholine et de facteurs de croissance. Ces substances sont très importantes pour la mémoire et l'apprentissage. En outre, la viande peut également améliorer la circulation sanguine et favoriser l'apport d'oxygène, ce qui peut garantir que le cerveau reçoive suffisamment de nutriments et d'énergie, améliorant ainsi sa vitalité et son endurance.

Cliquez sur Connaître pour améliorer la mémoire à court terme
L'électroencéphalographie (EEG) est un outil puissant pour identifier l'activité cérébrale ; par conséquent, il a été largement utilisé pour déterminer la base neuronale de la reconnaissance vocale.
En particulier, pour la classification de la reconnaissance vocale, les approches basées sur l’apprentissage profond sont à l’honneur car elles peuvent automatiquement apprendre et extraire des caractéristiques représentatives grâce à un apprentissage de bout en bout.
Cette étude visait à identifier des composants particuliers potentiellement liés à la représentation des phonèmes dans le cerveau du rat et à discriminer l'activité cérébrale pour chaque stimulus vocalique sur la base d'un seul essai en utilisant un réseau bidirectionnel de mémoire à long terme et à court terme (BiLSTM) et des méthodes classiques d'apprentissage automatique.
Dix-neuf rats Sprague-Dawley mâles soumis à une chirurgie d'implantation de microélectrodes pour enregistrer les signaux EEG des champs auditifs antérieurs bilatéraux ont été utilisés. Cinq stimuli vocaliques différents ont été choisis, /a/, /e/, /i/, /o/ et /u/, qui ont des fréquences de formants très différentes. L'EEG enregistré sous des stimuli vocaliques donnés aléatoirement a été peu prétraité et normalisé par une transformation du score z pour être utilisé comme entrée pour la classification de la reconnaissance vocale.
Le réseau BiLSTM a montré les meilleures performances parmi les classificateurs en atteignant une précision globale, un score f{{0}} et des valeurs κ de Cohen de 75,18 %, 0,75 et 0,68, respectivement, en utilisant une approche de validation croisée 10-fold.
Ces résultats indiquent que les couches LSTM peuvent modéliser efficacement des données séquentielles, telles que l'EEG ; par conséquent, des fonctionnalités informatives peuvent être dérivées via BiLSTM formé avec un apprentissage de bout en bout sans aucune méthode d’extraction de fonctionnalités supplémentaire conçue à la main.
Introduction
La parole transporte de grandes quantités d'informations vers le cerveau, et c'est l'une des caractéristiques typiques du cerveau que de reconnaître et de catégoriser les sons des animaux qui se comportent.
Compte tenu de son importance, des tentatives d'étude des mécanismes de reconnaissance des sons de la parole sont menées depuis plus de 100 ans. L'une des premières études neurolinguistiques sur la reconnaissance de la parole a été menée dans les années 1870 par un neuropsychiatre allemand qui a découvert le rôle crucial du gyrus temporal supérieur dans la perception de la parole, en déduisant que les déficits de reconnaissance de la parole étaient associés à des lésions du gyrus temporal supérieur gauche. 1].
On sait désormais que la reconnaissance vocale repose majoritairement sur les lobes temporaux dorsolatéraux, dont le gyrus temporal supérieur, qui contient le cortex auditif primaire (A1) et le champ auditif antérieur (FAA) [2].

Bien que la manière dont les phonèmes sont codés et interprétés dans le cerveau reste controversée, il est largement admis que la reconnaissance des sons est catégorique. Autrement dit, la discrimination est meilleure pour les stimuli appartenant à des catégories phonétiques différentes que pour les stimuli appartenant à la même catégorie, même si les différences acoustiques sont équivalentes [3, 4].
Non seulement les systèmes de perception des humains, mais aussi des animaux, classent les stimuli sonores qui varient continuellement en un ensemble de catégories discrètes [5].
Avec les progrès des études neurophysiologiques, l'électroencéphalographie (EEG) a été largement utilisée dans la recherche impliquant les neurosciences et l'ingénierie neuronale [6].
La haute résolution temporelle et la sensibilité aux différents états fonctionnels du cerveau font de l’EEG un outil puissant pour étudier l’activité cérébrale en temps réel, et l’on s’intéresse de plus en plus à l’éclairage des bases neuronales de la perception catégorielle. Traditionnellement, les signaux EEG sont enregistrés de manière non invasive à partir du cuir chevelu dans les études sur l'homme. Au niveau de la perception du son ou de la parole, la négativité des mésappariements (MMN), une composante du potentiel évoqué auditif (PEA), provoquée par des sons étranges, est largement utilisée pour étudier les corrélats neuronaux de la perception catégorielle (7, 8). Naatanen et coll. preuves fondamentales de représentations vocaliques dépendantes du langage dans le cerveau humain [9].
Une autre étude a examiné la perception catégorielle des tons lexicaux et a constaté que le contraste entre catégories provoquait une distinction MMN plus grande qu'au sein d'une catégorie [10]. Lors d'expérimentations animales, des signaux EEG plus précis ont été obtenus grâce à des procédures invasives.
Par exemple, les corrélats neuronaux de la perception catégorielle et les représentations neuronales de divers sons ont été étudiés à l'aide de l'enregistrement extracellulaire du potentiel d'action.
Les neurones projetant le striatum des oiseaux chanteurs affichent des réponses auditives catégoriques et sont très sensibles aux changements de durée des notes [11]. De plus, Kilgard et al.ont étudié des représentations neuronales distinctes des consonnes et des voyelles en utilisant un enregistrement intraparenchymateux dans le cerveau du rat. En enregistrant les réponses multi-unités et unitaires du colliculus inférieur et de A1, ils ont suggéré que le pic compte les sons des voyelles, tandis que le timing du pic code les sons des consonnes (12, 13).
Les effets de l'entraînement à la discrimination sonore dans un modèle d'autisme chez le rat ont également été étudiés sur la base de découvertes antérieures corrélant les réponses neuronales aux stimuli sonores avec la capacité de perception sonore [14].
De plus, une étude récente a démontré que l'électrocorticographie enregistrée avec un réseau multicanal est en corrélation avec l'exposition passive à un son spécifique, même dans le cortex auditif de rats anesthésiés [15].
Des approches d'apprentissage automatique ont été utilisées pour utiliser l'EEG dans une grande variété d'études. L'utilisation de méthodes d'apprentissage automatique permet d'étudier des informations riches, inhérentes et difficiles à découvrir à partir des signaux EEG [6].
Par conséquent, la classification basée sur l'EEG peut être effectuée dans les domaines suivants grâce à des algorithmes d'apprentissage automatique conventionnels (par exemple, machine à vecteurs de support (SVM), k-voisins les plus proches (KNN) et Bayes naïf (NB)) : imagerie motrice, reconnaissance des émotions, détection de la maladie mentale, détection du potentiel lié à un événement (ERP), etc. [16, 17].

De plus, ces dernières années, en raison des progrès croissants des unités de traitement graphique et de la disponibilité de grands ensembles de données, il est devenu possible d'effectuer une classification basée sur l'EEG en utilisant divers réseaux d'apprentissage profond [6, 18, 19]. Par rapport aux méthodes d'apprentissage automatique conventionnelles , les réseaux d'apprentissage profond peuvent automatiquement détecter et extraire les représentations appropriées à partir des données d'entrée [20, 21].
Par conséquent, même avec des connaissances expertes préalables insuffisantes, des résultats prometteurs peuvent être obtenus grâce à des algorithmes d’apprentissage profond qui ne nécessitent pas de processus d’extraction de fonctionnalités artisanal supplémentaire [22, 23].
Par exemple, dans les domaines de la parole, des images et de la vidéo, les résultats ont été considérablement améliorés grâce à l’application d’algorithmes d’apprentissage profond [24-26]. Cependant, il n'est pas clair si de tels résultats plus performants accompagnent toujours le domaine de classification basé sur l'EEG lors de l'utilisation d'approches d'apprentissage en profondeur au lieu des méthodes traditionnelles d'apprentissage automatique (27).
Roy et al. ont montré que dans la plupart des études (à l'exclusion de quatre études sur 102), l'approche d'apprentissage profond conduisait à des performances plus élevées que l'approche d'apprentissage automatique traditionnelle, et l'amélioration la plus élevée en termes de précision était de 35,3 % [18, 28].
En outre, parmi les différents domaines d’études de classification basées sur l’EEG, les études de classification ERP sont activement menées en appliquant à la fois des méthodes conventionnelles d’apprentissage automatique et d’apprentissage profond.
Dans une première étude, la méthode traditionnelle de grande moyenne a été utilisée pour améliorer le faible rapport signal/bruit (SNR), l'une des limites des signaux EEG, et pour obtenir des signaux ERP.
Dans ces études, plusieurs composants ERP ont été traités comme des ensembles de fonctionnalités pour la classification [29, 30]. Dans les études animales, les caractéristiques ERP telles que l'amplitude maximale et la latence sont également utilisées pour discriminer les signaux ERP (31, 32).
Cependant, la classification basée sur l'EEG à essai unique a également reçu beaucoup d'attention, car il est connu que les données EEG au niveau d'essai unique possèdent des informations plus fonctionnelles et plus riches que les signaux ERP obtenus par la méthode traditionnelle de grande moyenne (33, 34).
Par conséquent, dans des études ultérieures, les caractéristiques extraites par divers algorithmes tels que les algorithmes basés sur les ondelettes [35], les modèles de mélange gaussien [36] et le filtrage spatial [37] pour la classification à l'aide de méthodes d'apprentissage automatique conventionnelles [38, 39]. Cependant, l'extraction de la valeur optimale Les caractéristiques fabriquées à la main à partir de l'EEG à essai unique prennent du temps et demandent beaucoup de travail, car des étapes de traitement supplémentaires doivent être exécutées. Dans ce contexte, les méthodes d’apprentissage profond peuvent atténuer ce problème en permettant un apprentissage de bout en bout.
L'architecture d'apprentissage profond la plus répandue est un réseau neuronal convolutif (CNN), suivi d'un réseau neuronal récurrent (RNN). Le CNN est un type spécial d'architecture d'apprentissage en profondeur largement utilisé pour la classification basée sur l'EEG à essai unique [6]. Les entrées CNN sont dérivées de données EEG brutes ou prétraitées, principalement sous la forme suivante : nombre de canaux × nombre de points dans le temps dans un seul essai.
De plus, des résultats considérables en matière de classification ont été démontrés et il est connu qu’elle fonctionne mieux lorsqu’elle utilise des images de spectrogramme comme entrées [40–44]. Contrairement à CNN, RNN est une architecture hautement préférée, en particulier lors du traitement de données séquentielles (comme dans les applications de traitement du langage naturel) car la connexion récurrente de l'architecture d'apprentissage RNN permet d'utiliser les informations précédentes du réseau de manière récursive comme données d'entrée actuelles [45]. ].
La mémoire à long terme (LSTM) est une sorte d'architecture RNN proposée par Hochreiter et Schmidhuber pour surmonter les problèmes de gradient d'explosion et de disparition du RNN [46]. Le LSTM bidirectionnel (BiLSTM) est un développement ultérieur du LSTM qui combine les couches cachées avant et arrière pour accéder à la fois aux informations précédentes et suivantes.
Bien que le modèle BiLSTM soit beaucoup plus complexe et puisse nécessiter une puissance de calcul supplémentaire, il devrait mieux résoudre les tâches de modélisation et de classification séquentielles que le LSTM [47].
Auparavant, nous avions essayé de classer les signaux EEG sur la base d'un seul essai pour trois voyelles, /a/, /o/ et /u/, en utilisant des techniques d'apprentissage automatique pour le cerveau humain.
Après l'application d'algorithmes de traitement du signal appropriés, y compris la décomposition en mode empirique multivarié (MEMD), les réponses EEG ont été efficacement classées en fonction de chaque voyelle à l'aide d'un classificateur d'analyse discriminante linéaire (LDA). À partir de la représentation temps-fréquence (TFR) des signaux EEG, il a également été déterminé que les composantes de la bande alpha étaient les réponses neuronales les plus liées à la perception des voyelles [48].
Cependant, en raison du faible SNR des signaux EEG humains, la représentation des phonèmes dans le cerveau doit être évaluée davantage à l'aide d'une technique d'enregistrement plus invasive, permettant l'acquisition de signaux EEG plus fiables.
De plus, il est nécessaire de mener des études plus approfondies sur les performances de classification de chaque algorithme d'apprentissage automatique dans la classification des réponses EEG à différents phonèmes.
L'objectif principal de cette étude était de déterminer les composants EEG spécifiques qui pourraient être liés à la représentation de la parole dans le cerveau du rat afin d'éclairer davantage les réponses cérébrales à la reconnaissance des sons de la parole.
Pour acquérir des signaux EEG plus précis, des signaux EEG périduraux en réponse à des stimuli auditifs ont été enregistrés dans l'AAF, qui est connu pour jouer un rôle essentiel dans la perception et la catégorisation auditives [2]. En outre, cette étude a tenté de discriminer différentes réponses cérébrales pour chaque son de la parole sur la base d'un seul essai en utilisant les réseaux LSTM et d'autres techniques conventionnelles d'apprentissage automatique.
Il a été émis l'hypothèse que le réseau BiLSTM serait approprié pour classer les réponses EEG aux stimuli vocaliques et surpasserait les autres classificateurs classiques car le réseau peut fonctionner de manière robuste dans la modélisation des dépendances à long terme de données séquentielles telles que l'EEG. À la connaissance de l'auteur, les réseaux LSTM n'ont pas été appliqués à la classification des réponses EEG aux stimuli auditifs, et il s'agit de la première étude à utiliser un algorithme d'apprentissage profond pour analyser les signaux EEG épiduraux provenant de l'AAF.

De plus, à l’aide de l’algorithme d’apprentissage profond, les réponses EEG ont été classées comme des stimuli auditifs en utilisant un apprentissage de bout en bout avec des signaux EEG peu prétraités sans méthodes d’extraction de caractéristiques supplémentaires.
For more information:1950477648nn@gmail.com






