Recherche sur la reconnaissance audio basée sur le réseau neuronal profond dans l'enseignement de la musique

Oct 10, 2023

Le solfège est un cours de base important pour les étudiants en musique, et la formation à la reconnaissance audio en est l'un des maillons importants. Avec l’amélioration des performances des ordinateurs, la reconnaissance audio a été largement utilisée dans les appareils portables intelligents. Ces dernières années, le développement du deep learning a accéléré le processus de recherche sur la reconnaissance audio. Cependant, il y a beaucoup d'interférences sonores dans un environnement d'enseignement musical, ce qui conduit à des performances audio de la classe… euh, qui ne peuvent pas répondre à la demande réelle. Pour résoudre ce problème, un système de reconnaissance audio amélioré basé sur YOLO-v4 est proposé, qui améliore principalement la structure du réseau.

Le chant à vue et l’entraînement de l’oreille sont indissociables de la mémoire. Dans le processus d’apprentissage de la musique, le chant à vue et l’entraînement de l’oreille sont des compétences très importantes. Le but de la formation auditive au chant à vue est de permettre aux étudiants de mettre en pratique leurs compétences musicales et leur mémoire en écoutant et en chantant des notes spécifiées.

Le contenu principal de l'entraînement de l'oreille au chant à vue comprend la hauteur, le rythme, la voix, la mélodie, l'harmonie, etc. Grâce à l'entraînement de l'oreille au chant à vue, nous pouvons exercer continuellement nos oreilles, nous permettant d'identifier plus précisément diverses notes et rythmes et de les convertir rapidement. les notes que nous entendons en symboles sur la carte musicale, améliorant ainsi notre capacité à nous souvenir.

Le chant à vue et l’entraînement auditif peuvent également nous aider à mieux comprendre et maîtriser les lois de la musique. Lorsque nous utilisons nos oreilles pour ressentir et comprendre directement la musique, nous pouvons comprendre le rythme et la mélodie de la musique plus profondément, améliorant ainsi plus rapidement notre capacité de mémoire.

De plus, le chant à vue et l’entraînement de l’oreille peuvent également nous aider à développer un bon sens musical et de fortes émotions musicales. Grâce à la formation, notre compréhension et nos sentiments de la musique deviendront de plus en plus profonds, améliorant ainsi notre amour et notre appréciation de la musique.

La mémoire est un facteur très important dans le processus d’apprentissage de la musique. Une bonne mémoire est l’une des conditions nécessaires pour apprendre n’importe quel instrument et composer de la musique. Grâce au chant à vue et à l’entraînement de l’oreille, nous pouvons améliorer notre mémoire et mieux maîtriser les techniques et compétences musicales. Face à un répertoire complexe, nous pouvons mémoriser les notes et les rythmes plus rapidement, ce qui nous aide à mieux interpréter les œuvres musicales.

Bref, entraînement de l’oreille chantante et mémoire sont indissociables, et les deux se complètent. Grâce à une formation continue en chant à vue et en entraînement auditif, nous pouvons améliorer nos compétences musicales et nos capacités de mémoire pour mieux maîtriser la musique. On peut voir que nous devons améliorer la mémoire, et la Cistanche deserticola peut améliorer considérablement la mémoire, car la Cistanche deserticola est une matière médicinale traditionnelle chinoise qui a de nombreux effets uniques, dont l'un est d'améliorer la mémoire. L’efficacité de la viande hachée vient des différents ingrédients actifs qu’elle contient, notamment des acides, des polysaccharides, des flavonoïdes, etc. Ces ingrédients peuvent favoriser la santé cérébrale de diverses manières.

increase memory

Cliquez sur connaître les moyens d'améliorer la fonction cérébrale

Premièrement, le numéro de cepstre de fréquence Mel est utilisé pour traiter l’audio original et extraire les caractéristiques correspondantes. fr, essayez d'appliquer le modèle YOLO-v4 dans le domaine de l'apprentissage profond au domaine de la reconnaissance audio et améliorez-le en le combinant avec le module de pool de pyramide spatiale pour renforcer la capacité de généralisation des données dans différents formats audio. Deuxièmement, la méthode d’empilement dans l’apprentissage d’ensemble est utilisée pour fusionner les sous-modèles indépendants de deux canaux différents. Les résultats expérimentaux montrent que par rapport à d'autres technologies d'apprentissage profond, le modèle YOLO-v4 amélioré peut améliorer les performances de reconnaissance audio et offre de meilleures performances dans le traitement des données de différents formats audio, ce qui montre une meilleure capacité de généralisation.

1. Présentation

La musique est une forme d’art abstrait dont le son est le moyen d’expression. Dans le processus d'enseignement de la musique, le solfège peut renforcer la capacité de mémoire musicale des élèves, leur permettre d'identifier avec précision les œuvres musicales et ainsi d'obtenir une meilleure « perception musicale ». En tant que maillon important du solfège, la formation à la reconnaissance audio est très difficile pour les étudiants juniors. C'est parce que les étudiants doivent maîtriser toutes sortes de clés, distinguer la longueur et la durée représentées par différentes notes, ainsi que la différence de hauteur entre les différentes notes.

L'analyse du signal audio basée sur des appareils intelligents embarqués attire de plus en plus l'attention des chercheurs [1–7]. Les appareils portables intelligents dotés de fonctions de reconnaissance audio peuvent aider les étudiants à résoudre les problèmes ci-dessus et à bénéficier d'une assistance à l'enseignement musical. La tâche de reconnaissance audio doit prétraiter les signaux audio collectés… se reposer, en extraire des caractéristiques précieuses pour en distinguer les partitions musicales, et… enfin les classer en fonction de ces caractéristiques. La classification est une méthode très importante d'exploration de données [8–10]. La classification fait référence à la génération d'une fonction de cation classique selon certaines règles basées sur les données de l'ensemble d'entraînement. Cette fonction peut mapper les données de l'ensemble de test sur l'une des catégories données, réalisant ainsi la prédiction de catégorie de données inconnues. À l'heure actuelle, les classiques courants incluent les arbres de décision, la régression logistique, la machine à vecteurs de support (SVM), Naive Bayes, l'algorithme du k-plus proche voisin (KNN), le réseau neuronal BP et l'apprentissage en profondeur [11-13].

Les méthodes d'apprentissage automatique précédentes devaient souvent extraire manuellement les fonctionnalités qui peuvent représenter les données d'origine en tant qu'entrée de la classe. Cependant, l'apprentissage profond peut extraire automatiquement les caractéristiques de grande dimension des échantillons (sans extraction manuelle des caractéristiques), à condition que les données d'entrée couvrent autant que possible les informations des données d'origine, ce qui convient aux données à grande échelle. *La méthode d'apprentissage en profondeur peut réaliser des tâches de reconnaissance audio spécifiques à l'aide d'une grande quantité de données audio collectées par des appareils intelligents. *Le réseau neuronal convolutif (CNN), en tant que sorte d'architecture d'apprentissage profond, est largement utilisé dans la classification d'images, la reconnaissance vocale, le traitement du langage naturel et d'autres domaines en raison de ses performances supérieures dans l'apprentissage de caractéristiques locales [14]. Différent des autres modèles de réseaux neuronaux (tels que la machine de Boltzmann et le réseau neuronal récurrent), le CNN se caractérise en ce que le fonctionnement principal est une opération de convolution. *Le réseau YOLO tire les leçons de la structure du réseau de classification CNN et présente de bons avantages dans le domaine de la reconnaissance d'images, qui a attiré l'attention de nombreux chercheurs.

*Par conséquent, cette étude tente d'appliquer le modèle YOLO-v4 au domaine de la reconnaissance audio et améliore sa structure de réseau. De plus, la méthode d'empilement dans l'apprentissage d'ensemble est utilisée pour fusionner deux sous-modèles indépendants de canaux différents, et les performances de classification du système fusionné sont encore améliorées par rapport au sous-modèle unique.

2. Travaux connexes

De nos jours, avec l'émergence d'un grand nombre d'appareils intelligents, d'excellentes performances informatiques et le développement de la technologie d'apprentissage profond ont favorisé conjointement le processus de recherche dans le domaine audio. Combiné avec les principaux contenus de recherche de cette étude, l'état actuel de la recherche sera présenté sous deux aspects : le réseau neuronal convolutif et la reconnaissance audio.

*La structure du réseau neuronal convolutif est issue d'une étude de Yann LeCun en 1998 appelée réseau neuronal artificiel Le Net-5. *Le réseau neuronal convolutif, comme d'autres réseaux neuronaux, peut être entraîné par l'algorithme de rétropropagation [15]. En 2012, Alex Krizhevsky et d’autres ont adopté pour la première fois la technologie CNN dans des tâches complexes de vision par ordinateur. En utilisant 3 couches entièrement connectées, 5 couches de convolution et un classificateur Softmax, un réseau neuronal convolutif à 8 couches est construit, nommé AlexNet. AlexNet utilise la fonction d'activation ReLU et, en même temps, utilise également la régularisation (abandon) pour éviter le surajustement. En 2014, l'équipe de vision par ordinateur de Google a proposé le réseau GoogLeNet [16], avec une profondeur de réseau de 22 couches, qui contient une nouvelle structure, incident. Il intègre les caractéristiques de différentes profondeurs et de la même échelle, et la précision de détection est améliorée. Sur la base du réseau GoogLeNet, les algorithmes YOLO et SSD sont apparus. Les deux méthodes sont basées sur un seul réseau de bout en bout, qui peut compléter l'entrée de l'image originale jusqu'à la sortie de la position et de la catégorie de l'objet.

Dans le domaine de la reconnaissance audio, Yang et Zhao [17] ont proposé une méthode de classification de scènes acoustiques basée sur la machine à vecteurs de support (SVM), qui améliore la texture sonore pour améliorer la précision de la classification. Greco et coll. [18] ont proposé un système de reconnaissance vocale basé sur la méthode heuristique d’apprentissage profond. Demir et coll. [19] ont proposé une nouvelle méthode CNN en cascade pyramidale pour la classification des bruits environnementaux. Zhu et coll. [20] ont proposé un algorithme YOLO-v4 amélioré pour les instruments d'imagerie sonore, qui a amélioré efficacement la précision de la détection des images de nuages ​​de phase acoustique. *Les méthodes ci-dessus montrent toutes d'excellentes performances dans la gestion des tâches de reconnaissance audio dans une seule scène acoustique, mais il existe de nombreuses perturbations sonores dans l'environnement d'enseignement musical et il est nécessaire de traiter une variété de données de formats audio différents.

*Par conséquent, cette étude propose un système de reconnaissance audio basé sur le modèle de réseau amélioré YOLO-v4. *Les principales innovations et contributions sont les suivantes : (1) essayer d'appliquer l'architecture réseau YOLO-v4, excellente dans le domaine de l'apprentissage profond, au domaine de la reconnaissance audio, et l'améliorer en combinant le module de pool de pyramide spatiale. * L'architecture réseau YOLO-v4 améliorée utilise efficacement les informations spatiales contenues dans les fichiers audio, renforçant ainsi la capacité de généralisation des données dans différents formats audio. (2) *La méthode d'empilement dans l'apprentissage d'ensemble est utilisée pour fusionner deux sous-modèles indépendants de canaux différents, et les performances de classification du système fusionné sont améliorées.

3. Extraction et traitement des fonctionnalités audio

Extraire la meilleure représentation des paramètres du signal audio est l’une des tâches importantes pour produire de meilleures performances de reconnaissance. *e L'extraction de caractéristiques à cette étape est très importante pour la classification du classificateur à l'étape suivante, car elle affectera directement l'efficacité de la classification.

Dans la tâche de classification, en particulier la tâche de classification audio, le coefficient du cepstre de fréquence Mel (MFCC) qui décrit la forme spectrale a une longue histoire. Bien que le processus d'extraction MFCC entraîne une compression des données avec perte, son effet de classification et de reconnaissance est tout à fait disponible même lorsque le débit de données est très faible. De plus, par rapport à d’autres caractéristiques de classification, le MFCC est largement utilisé car il correspond davantage à la courbe de réponse en fréquence auditive des oreilles humaines.

improve your memory

*La raison pour laquelle les êtres humains peuvent juger différents environnements dans des environnements sonores complexes réside dans le mérite de la cochlée. *La cochlée peut être considérée comme une banque de filtres pour aider les gens à filtrer l'audio à 20-20 kHz. *Le problème est que la sensibilité de la cochlée aux fréquences de la plage auditive n'est pas linéaire, mais il existe une relation de cartographie. Le MFCC peut simuler la réponse en fréquence de l'oreille humaine. L'extraction des fonctionnalités MFCC comprend sept étapes et l'ensemble du processus est illustré à la figure 1.

Les signaux audio courants présentent le phénomène selon lequel l'énergie basse fréquence est grande, mais l'énergie haute fréquence est petite. S'il est transmis directement, cela entraînera un rapport signal/bruit élevé aux basses fréquences et un rapport signal/bruit insuffisant aux hautes fréquences. Pour compenser cette perte de signal audio lors de la transmission, une préaccentuation est introduite pour compenser le signal d'entrée afin que les caractéristiques haute fréquence du signal audio puissent être mises en évidence. La préaccentuation est généralement obtenue à l'aide d'un filtre passe-haut [21-23].

improve memory

Le cadrage divise les échantillons audio obtenus par conversion analogique-numérique (ADC) en petites images d'une durée comprise entre 20 et 40 millisecondes. Une fois la préaccentuation et le cadrage terminés, il est nécessaire d'ajouter une fenêtre de Hamming à chaque image. Le fenêtrage consiste à contrôler la quantité de traitement de données, et seules les données de la fenêtre sont traitées à la fois. *La plage de fréquences dans le spectre de transformée de Fourier rapide est très large, ce qui fait que le signal vocal ne suit pas l'échelle linéaire [24-26]. *par conséquent, il est nécessaire de passer le banc de filtres à échelle Mel comme indiqué sur la figure 2.

La figure 2 montre un ensemble de filtres triangulaires, qui sont utilisés pour calculer la somme pondérée des composantes spectrales des filtres afin que la sortie traitée se rapproche de l'échelle Mel. *La réponse amplitude-fréquence de chaque filtre est triangulaire. *e Le spectre Mel d'une fréquence f donnée est calculé comme suit :

boost memory

13 caractéristiques différentielles de premier ordre représentent les changements entre les images du cepstre dans les caractéristiques MFCC, tandis que 39 caractéristiques différentielles de second ordre représentent les changements entre les images dans les caractéristiques différentielles de premier ordre. *La différence du premier ordre est calculée comme suit :

10 ways to improve memory

4. Structure du réseau SPP-YOLO-v4

4.1. Module de pool de pyramide spatiale (SPP). SPP peut éviter la distorsion des informations causée par la mise à l'échelle, l'étirement, le découpage et d'autres opérations et fournir une sortie qui n'est pas affectée par la taille d'entrée, ce qui ne peut pas être obtenu par la technologie de regroupement de fenêtres coulissantes [27]. Deuxièmement, SPP peut regrouper avec plusieurs échelles, tandis que le pooling à fenêtre glissante n'utilise qu'une seule échelle de fenêtre. *La structure de base du module SPP est illustrée à la figure 3. On peut voir que, parce que la taille d'entrée est flexible, SPP peut combiner les caractéristiques des données dans différents formats audio. *La dimension du vecteur de caractéristiques transformé est la même que celle de la couche entièrement connectée tout en atténuant le problème de généralisation.

4.2. SPP-YOLO-v4. YOLO-v4 est un algorithme de détection en une seule étape en temps réel de haute précision intégrant YOLO-v1, YOLO-v2 et YOLO-v3. YOLO-v4 construit le réseau partiel inter-étages CSP (CSPNet) dans le module résiduel, dans lequel la couche de fonctionnalités est l'entrée et les informations sur les fonctionnalités de la couche supérieure sont la sortie. *montre que les objectifs d'apprentissage de YOLO-v4 dans le module ResNet sont différents entre la sortie et l'entrée. *Par conséquent, un apprentissage résiduel est réalisé et les paramètres du modèle sont réduits, de sorte que la capacité d'apprentissage des fonctionnalités est améliorée. Compte tenu de l'environnement d'application de l'enseignement musical, certaines modifications sont apportées en fonction du réseau d'origine, et la structure finale du réseau est illustrée à la figure 4.

Tout d’abord, la couche de fonctionnalités est convoluée trois fois, puis la couche de fonctionnalités d’entrée est regroupée au maximum en utilisant le maximum de cœurs regroupés de différentes tailles. Après convolution et suréchantillonnage, différentes couches de fonctionnalités sont connectées en série pour réaliser la fusion de fonctionnalités. *en, effectuez un sous-échantillonnage, compressez la hauteur et la largeur, et enfin empilez-les avec la couche de fonctionnalités précédente pour réaliser davantage de fusion de fonctionnalités (5 fois). *Le module de classification utilise les fonctionnalités extraites du réseau pour effectuer des jugements de classification. Prenons l'exemple de la grille 13 × 13, ce qui équivaut à diviser le spectrogramme Mel d'entrée en 13 × 13 carrés ; ensuite, chaque carré sera prédéfini avec trois images préalables. *Les résultats de classification du réseau ajusteront les positions de ces trois cases antérieures et enfin filtreront par l'algorithme de suppression non maximale (NMS) [28], pour obtenir les résultats de classification finaux.

short term memory how to improve

5. Système de reconnaissance audio basé sur SPPYOLO-v4

5.1. Architecture du système. Comme le montre la figure 5, après l'entrée audio, le système de reconnaissance audio proposé divise d'abord les données de séquence audio en deux parties. *La première partie provient du canal stéréo, tandis que la seconde partie est compressée en mono. *Les signaux audio des deux canaux sont extraits par spectrogramme MFCC et entrés dans le modèle SPP-YOLO-v4 en tant que fonctionnalités. *fr, deux groupes de modèles SPP-YOLO-v4 sont intégrés et la méthode d'empilement est adoptée dans l'intégration. Après l'apprentissage intégré des deux modèles, les résultats de la classification audio sont enfin sortis. *Les détails du modèle SPP-YOLO-v4 sont présentés dans la figure 4.

5.2. Empiler l’apprentissage intégré. Comme le montre la figure 5, le système utilise une technologie d'apprentissage d'ensemble pour obtenir le résultat final de la classification. *L'idée de base de l'apprentissage d'ensemble est de former un classificateur fort grâce à la combinaison de plusieurs classificateurs faibles. Même si certains classificateurs faibles font des prédictions erronées, ils peuvent être corrigés par d'autres classificateurs faibles avec des prédictions correctes, obtenant ainsi pour effet d'améliorer les performances du système.

En supposant que x est une entrée, mi (i � 1, 2, . . . , k) est un groupe de classificateurs et la sortie des classificateurs est la distribution de probabilité mi (x, cj) de chaque classe cj (i � 1, 2, . . . , k), la sortie finale y(x) du classificateur intégré peut être exprimée comme

ways to improve memory

memory enhancement

objectif de classement. À l'heure actuelle, les algorithmes d'apprentissage d'ensemble populaires incluent l'empilement, l'ensachage, l'amplification, la sélection d'ensemble, etc. *L'algorithme d'apprentissage d'ensemble sélectionné dans cette étude est la méthode d'empilement.

L'empilement est un processus d'apprentissage de second ordre avec le résultat du processus d'apprentissage de premier ordre comme entrée, également connu sous le nom de « méta-apprentissage ». *La méthode d'empilement est devenue une méthode d'apprentissage d'ensemble populaire, non seulement parce que sa mise en œuvre est assez simple, mais aussi parce qu'elle peut améliorer considérablement la capacité de généralisation du système, ce qui est tout à fait cohérent avec l'objectif de cette étude. *Le principe de base de la méthode d'empilement est illustré à la figure 6.

6. Expérience et analyse des résultats

6.1. Environnement expérimental et ensemble de données. *La plate-forme matérielle de cette étude est le processeur Intel Core i3-M350 Dualcore 2,20 GHz, 8 Go de mémoire DDR2, le GPU Nvidia RTX2080Ti et 11 Go de mémoire vidéo. *L'outil de développement intégré PyCharm est développé en langage Python 3.5.0. *Le framework d'annotation YOLO écrit en Python est utilisé pour convertir le format numérique afin qu'il puisse être lu par YOLO. *Les méthodes de comparaison sont le modèle de mélange gaussien (GMM), CNN et R-CNN.

improving brain function

*L'ensemble de données expérimentales est constitué de fichiers audio enregistrés dans l'environnement d'enseignement réel. *L'ensemble de données se compose de types audio de quatre étiquettes différentes (D1, D2, D3 et D4). Tous les fichiers audio sont découpés en 30-secondes clips. *Il existe 12 formats de fichiers audio, dont MPEG, MP3 et WMA. Chaque enregistrement est effectué à un endroit différent et la durée moyenne d'enregistrement est de 3 à 5 minutes. *L'équipement d'enregistrement comprend un microphone intra-auriculaire Soundman OKM II Classic/studio A3 à deux canaux et un enregistreur de forme d'onde Roland Edirol R09 avec un taux d'échantillonnage de 44,1 kHz et une résolution de 24- bits.

*L'ensemble de données utilisé contient 1 404 fichiers audio et le nombre de fichiers audio de chaque type est de 351. Environ 70 % des données sont utilisées pour entraîner le modèle de reconnaissance audio et les 30 % restants sont utilisés pour les tests. *Les paramètres du système sont indiqués dans le tableau 1.

increase brain power

increase memory power

6.3. Vérification des performances du SPP-YOLO-v4. Pour vérifier l'effet de promotion du YOLO-v4 amélioré proposé (SPP-YOLO-v4) sur la capacité de généralisation, il est comparé au modèle YOLO-v4 traditionnel. Dans l'expérience, 3 des 12 formats de fichiers audio ont été sélectionnés : MPEG, MP3 et WMA. *La capacité de généralisation de SPP-YOLOv4 est indiquée dans le tableau 2.

D'après le tableau 2, on peut constater que la précision globale de SPP-YOLO-v4 est supérieure à celle du YOLO-v4 traditionnel, ce qui vérifie sa capacité de généralisation pour les données dans différents formats audio. *C'est parce que par rapport à la méthode originale, le SPP de SPP-YOLO-v4 contient plus de couches, mais cela augmente également le temps de traitement.

6.4. Comparaison des résultats des tests. Le tableau 3 fournit les résultats de la perte d'entraînement, du mAP, etc. pour toutes les catégories après 8000 séries d'entraînement. On peut voir que le modèle de formation de la méthode proposée peut identifier efficacement les types audio. Elle présente certains avantages en termes de précision, de taux de rappel et de score F1, et sa valeur de perte est également la plus faible de toutes les méthodes, seulement 0,0122. *Par conséquent, la stabilité et la précision de la méthode proposée sont meilleures. *est principalement dû à la haute résolution et au champ récepteur (RF) de SPP-YOLO-v4, et l'ajout du module SPP dans la couche de connexion conserve les avantages apportés par SPP. En termes de temps de formation, SPP-YOLO-v4 n'est que légèrement supérieur à GMM. *e CNN doit entraîner de nombreuses opérations de convolution, son temps de formation est donc plus long.

supplements to boost memory

Enfin, l’expérience utilise des données provenant de 12 formats audio différents pour tester et comparer les quatre méthodes. Le tableau 4 fournit les valeurs de précision du test et de durée du test. On peut voir que la précision moyenne de la méthode proposée dans cette étude est de 99,0 % et le temps de détection moyen est de 0,449ss. *Par conséquent, la méthode proposée obtient de meilleures performances parmi les quatre méthodes comparées. On peut conclure que le suréchantillonnage et la mise en commun maximale de SPP-YOLO-v4 ont apporté des avantages significatifs. Le regroupement maximum sélectionne la valeur maximale des zones adjacentes pour supprimer légèrement certains bruits de fréquence maximale dans la séquence audio. *Par conséquent, le sous-échantillonnage par convolution peut être mieux exploité dans la couche d'échantillonnage suivante. *Grâce à ces avantages, SPP peut améliorer les performances du réseau fédérateur.

improve short term memory

7. Conclusions

*Cette étude présente un système de reconnaissance audio adapté à un environnement d'enseignement musical. Utilisez SPP pour améliorer l'architecture du réseau YOLO-v4, c'est-à-dire utilisez SPP pour sélectionner des zones locales à différentes échelles de la même couche de convolution afin d'apprendre les caractéristiques du système multi-échelle. De plus, la méthode d’empilement dans l’apprentissage d’ensemble est utilisée pour fusionner des sous-modèles indépendants de deux canaux différents. *Les résultats expérimentaux montrent que la méthode proposée peut améliorer la précision de la reconnaissance des types audio et offre de meilleures performances pour différents formats de fichiers audio. En raison des conditions limitées d'enregistrement audio, il existe peu de types audio dans l'ensemble de données expérimentales et les performances de classification des fichiers audio enregistrés par différents appareils doivent encore être vérifiées. D'autres tests seront effectués sur ces deux questions à l'avenir.

Disponibilité des données

*Les données utilisées pour étayer les conclusions de cette étude sont disponibles auprès de l’auteur correspondant sur demande.

Les conflits d'intérêts

*Les auteurs déclarent n'avoir aucun conflit d'intérêts.


Les références

[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li et M. Zhou, « Traduction automatique neuronale de dépendance à dépendance », Transactions IEEE/ACM sur l'audio, la parole et le langage Traitement, vol. 26, non. 11, p. 2132-2141, 2018.

[2] J. Zou, W. Li, C. Chen et Q. Du, « Classification de scènes utilisant des caractéristiques locales et globales avec fusion de représentations collaboratives », Sciences de l'information, vol. 348, non. 2, pages 209 à 226, 2016.

[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur et A. Mertins, « Classification améliorée des scènes audio basée sur l'intégration d'arbres d'étiquettes et les réseaux neuronaux convolutifs », Transactions IEEE/ACM sur Traitement de l'audio, de la parole et du langage, vol. 25, non. 6, pages 1278 à 1290, 2017.

[4] S. Bayatli, « Pondération non supervisée des règles de transfert dans la traduction automatique basée sur des règles utilisant une approche d'entropie maximale », Journal of Information Science and Engineering, vol. 36, non. 2, p. 309-322, 2020.

[5] A. Rakotomamonjy, « Apprentissage de représentation supervisé pour la classification de scènes audio », Transactions IEEE/ACM sur le traitement audio, vocal et linguistique, vol. 25, non. 6, pages 1253 à 1265, 2017.

[6] W. Yang et S. Krishnan, « Combinaison de caractéristiques temporelles par modèle binaire local pour la classification des scènes acoustiques », Transactions IEEE/ACM sur le traitement audio, vocal et linguistique, vol. 25, non. 6, pages 1315 à 1321, 2017.

[7] AS Dhanjal et W. Singh, « Un système de traduction automatique automatique pour la parole multilingue vers la langue des signes indienne », Outils et applications multimédias, vol. 81, non. 3, pages 4283 à 4321, 2021.

[8] MA. Alamir, "Un nouveau modèle de classification de scènes acoustiques utilisant la fusion tardive de réseaux de neurones convolutifs et de différents classificateurs d'ensemble", Applied Acoustics, vol. 172, non. 3, p. 112-122, 2020.

[9] JG Makin, DA Moses et EF Chang, « Traduction automatique de l'activité corticale en texte avec un cadre codeur-décodeur », Nature Neuroscience, vol. 23, non. 4, pages 575 à 582, 2020.

[10] S. Waldekar et G. Saha, « Classification des scènes acoustiques basée sur la fusion à deux niveaux », Applied Acoustics, vol. 170, non. 5, numéro d’article 107502, 2020.


For more information:1950477648nn@gmail.com


Vous pourriez aussi aimer