Analyse efficace des sentiments basée sur la mémoire à long et à court terme des avis sur le commerce électronique, partie 2
Jan 18, 2024
Mohammed et coll. [20] ont présenté un modèle d'analyse sentimentale en utilisant word2vec et LSTM pour les avis sur les hôtels.
Mahomet est le prophète et fondateur de l'Islam. Il est connu comme un homme sage, sage et sage. Sa mémoire est très puissante, ce qui le rend très efficace pour traiter les informations et exprimer ses pensées.
La mémoire de Mahomet a beaucoup à voir avec son éducation et son expérience. Selon les archives, il était souvent plongé dans la réflexion et la réflexion dans sa jeunesse. Cette curiosité et cette soif de connaissances l’ont aidé à construire une solide base de connaissances et une solide capacité de mémoire.
De plus, l’intelligence de Mahomet a également joué un rôle important dans ses capacités de mémoire. Il est intelligent, plein d’esprit, perspicace et possède une capacité de réflexion logique, ce qui est très avantageux lorsqu’il s’agit d’informations complexes. Cet avantage l’a aidé à mieux gérer et contrôler le processus de mémoire, améliorant ainsi sa mémoire.
Cependant, la mémoire de Mahomet n'était pas innée mais améliorée grâce à un travail acharné et à la pratique. Il effectue souvent un entraînement de la mémoire, comme la lecture répétée, la dictée et la parole, pour l'aider à comprendre et à maîtriser les connaissances plus profondément.
La mémoire de Mahomet n'était pas seulement un talent naturel, elle s'est améliorée grâce à un travail acharné et à la pratique. Cela montre que chacun de nous peut améliorer sa mémoire et améliorer son apprentissage et son efficacité au travail grâce à l'apprentissage et à la pratique. Comme Mahomet, travaillons activement et dur pour améliorer continuellement nos capacités de mémoire, afin d'obtenir une plus grande réussite dans la vie et au travail ! On voit que nous devons améliorer la mémoire, et Cistanche deserticola peut améliorer considérablement la mémoire, car Cistanche deserticola peut également réguler l'équilibre des neurotransmetteurs, comme en augmentant les niveaux d'acétylcholine et de facteurs de croissance. Ces substances sont très importantes pour la mémoire et l’apprentissage. En outre, la viande peut également améliorer la circulation sanguine et favoriser l'apport d'oxygène, ce qui peut garantir que le cerveau reçoive suffisamment de nutriments et d'énergie, améliorant ainsi sa vitalité et son endurance.

Cliquez sur Connaître pour améliorer la mémoire à court terme
Pour cette étude, les données ont été collectées en explorant le site Web de voyage à l'aide de sélénium et de déchets. +e Le but principal de cette expérience était d'analyser la précision en modifiant les paramètres de word2vec et LSTM. Les résultats ont montré qu'une précision moyenne de 85,96 pouvait être obtenue en utilisant les paramètres, ce qui a donné des résultats prometteurs.
Zhao et coll. [21] ont introduit une nouvelle technique pour analyser les sentiments des clients à partir des avis sur les sites de commerce électronique. + La technique optimisée proposée « le réseau neuronal Elman basé sur l'algorithme de chauve-souris improvisé de recherche locale (LSIBA-ENN) » comporte quatre étapes et détecte la polarité et classe les sentiments des avis. Les données +e pour cette recherche ont été collectées en utilisant l'outil de suppression de sites Web sur les sites de commerce électronique pour extraire les avis des clients.
En plus du prétraitement des données, cette étude utilise « la fréquence de classe inverse modifiée basée sur la fréquence LogTerm (LTF-MICF) et l'algorithme de réchauffement de la Terre basé sur la mutation hybride (HMEWA) » pour la pondération des termes et la sélection des caractéristiques. La méthodologie proposée a surpassé les autres techniques de base en termes de précision des prévisions.
Jiang [22] a proposé un modèle pour classer les sentiments des avis obtenus à partir de la plateforme de commerce électronique Taobao. L'étude utilise l'algorithme d'apprentissage automatique ainsi qu'une machine vectorielle de support pour la classification et l'optimisation améliorée des essaims de particules (IPSO) pour optimiser les paramètres. Les données +e pour l'étude ont été recueillies en explorant les commentaires du site Web. Les résultats expérimentaux ont démontré que l'approche combinée du SVM et de l'IPSO avait une plus grande précision. Cependant, la majorité des modèles existants souffrent d'un surajustement [23-25], d'une faible vitesse de convergence [26-28] et de problèmes de gradient de disparition [29-31].
3. Étude expérimentale
+Cette section donne un aperçu clair de la méthodologie utilisée dans le projet pour la classification des sentiments. + La technique utilisée est un réseau de mémoire à long terme, utilisé pour classer un grand nombre d'avis de bases de données Amazon. + L'intégration utilisée est word2vec, qui a été formée sur mesure en fonction de la base de données.
Le réglage du mot 2vec en fonction de l'ensemble de données améliore les performances globales du modèle. L'avantage de l'utilisation de LSTM est qu'il donne de meilleurs résultats même pour les données d'évaluation non structurées. Il est capable d'obtenir des fonctionnalités utiles pour les ressources contenant des dépendances à long terme.
Les données +e sont collectées à partir de l'ensemble de données d'évaluation Amazon, qui sont ensuite prétraitées. Les intégrations Word2vec constituent une étape importante dans le prétraitement des données. Des données d'entraînement et de test ont été créées. + Les données de formation sont divisées en ensembles de données de formation et de validation. + Le modèle word2vec personnalisé est formé par base de données. +e vecteur de caractéristiques est obtenu, qui est ensuite utilisé comme couche d'intégration pour le modèle LSTM.
Keras est utilisé pour construire le modèle séquentiel LSTM avec des fonctionnalités maximales égales à 50,000 et une taille d'intégration égale à 16. +emodel est ensuite entraîné pendant 10 époques. Le modèle +e est testé sur la base des mesures de performances sklearn. + Le processus d’obtention des fonctionnalités est représenté dans la figure 2.
3.1. Base de données. Pour générer des résultats précis, l'ensemble de données utilisé doit être vaste et enrichi. L'ensemble de données +e a été collecté à partir de la section en ligne sur les téléphones portables et les accessoires de l'ensemble de données Amazon Reviews (2018). L'ensemble de données +e comprend un total de 938 261 avis, parmi lesquels 47 901 concernent des produits uniques et 153 124 sont des avis d'utilisateurs uniques. + L'ensemble de données se compose initialement de 7 colonnes, à savoir une note qui varie de 1 à 5, l'heure de l'évaluation, l'ID de l'évaluateur, l'ID du produit et le résumé du texte de l'évaluation.
Après avoir supprimé les doublons, l'ensemble de données se compose de 938 254 enregistrements et le tableau 2 montre un extrait des enregistrements de l'ensemble de données d'origine.
3.2. Méthodologie. Nous avons personnalisé notre modèle word2vec pour qu'il soit utilisé avec le modèle LSTM pour la classification. Word2vec est une intégration de mots utilisée pour représenter un mot par une collection de plusieurs termes d'un vecteur. Il s’agit de mapper un mot dans un espace vectoriel. +e l'ensemble de données est chargé dans un bloc de données pandas. Pour développer un modèle word2vec personnalisé, la première étape est le prétraitement des données.
Nous regardons uniquement le texte de la note et de l'évaluation et abandonnons tout le reste. Le texte +e est nettoyé en supprimant la ponctuation. Un sous-échantillon du texte est créé à partir de près de 200 000 avis et la méthode du texte propre est appliquée pour convertir chaque avis en une liste de mots. +Cette liste de mots sert désormais d'entrée au modèle genism word2vec.
Nous avons construit un modèle skip-gram word2vec personnalisé et instancié le modèle avec des dimensions : la taille des vecteurs de mots égale à 100, la taille de la fenêtre égale à 15, min_compte comme 2 pour les mots apparaissant moins de 2 fois dans notre corpus, négatif égal à 5 et taux d'échantillonnage égal à 1e−5. Nous avons utilisé toutes ces dimensions pour construire un vocabulaire à partir de nos phrases de révision.

Nous entraînons notre modèle word2vec pour 1000 époques. +fr nous calculons la perte à chaque époque. + La perte est élevée au début et diminue vers la dernière époque. + La perte à l'époque 0 est de 2239394,0 et la perte à l'époque 1000 est de 11504,0. + Le modèle enregistré est ensuite rechargé et des opérations sont effectuées dessus.
Par exemple, si nous voulons trouver des mots similaires au bruit dans notre ensemble de données, nous obtenons une annulation et un casque.
De même, on peut également trouver la similitude entre certains mots tels que écouteurs et casque qui est {{0}}.48756, et la similitude entre les mots charge et chargeur est 0,89264.
Pour réduire les dimensions de nos données, nous avons utilisé la visualisation TSNE pour tracer les données en deux dimensions. Désormais, ces vecteurs de mots peuvent être utilisés pour une classification plus approfondie. + Ces intégrations sont ensuite utilisées comme fonctionnalités pour une diffusion ultérieure.
3.2.1. Préparation des données pour LSTM. Notre ensemble de données comprend 938 254 enregistrements, la plupart des avis ayant une répartition des scores supérieure à 3. Nous avons d'abord calculé le nombre de mots pour chaque avis. + La moyenne moyenne est utilisée comme statistique pour trouver la durée moyenne des avis. + La longueur moyenne de l'examen est de 44,59 et la longueur maximale est de 4303.
Nous avons créé un ensemble de données composé d'avis contenant 100 mots ou moins. Les avis dont la longueur est supérieure à 20 mais inférieure à 100 sont classés dans la catégorie des avis courts et les reprises sont classées dans la catégorie des avis longs. Le nombre d'avis courts est de 411 313 et celui d'avis longs de 100 239. Les hyperparamètres utilisés dans le modèle sont décrits dans le tableau 3.
Ensuite, nous avons défini la note de sentiment comme positive si la note est supérieure ou égale à 3 ; sinon, la note est négative. Nous avons pris en compte le texte de la critique et les sentiments pour créer l'ensemble de données sur le train. + Les données de test se composent de produits ayant au moins plus de 10 avis.
Après distribution, l'ensemble de données de formation comprenait un total de 203 891 enregistrements, parmi lesquels 175 910 appartenaient à la classe positive et 27 981 à la classe négative. L'ensemble de données de test comprenait un total de 686 345 enregistrements, parmi lesquels 592 118 appartenaient à la classe positive et 94 227 à la classe négative.
Dans cette étude, nous avons utilisé Keras pour construire notre modèle LSTM, qui prend un maximum de 50 000 fonctionnalités comme entrée dans la couche d'intégration. La mémoire à long terme (LSTM) est un type de réseau neuronal récurrent qui utilise un mécanisme interne qui régule le flux d'informations. Ce mécanisme interne est constitué de portes qui doivent être entraînées de manière à pouvoir filtrer avec précision les informations non pertinentes et conserver les informations utiles.

La figure 3 montre l'architecture de base du modèle LSTM dans notre méthodologie proposée.
Ht−1 et Xt sont les entrées de l'unité LSTM ; Ht−1, communément appelée mémoire à court terme, prend la sortie des états précédents comme entrée. +e cellule mémoire ou mémoire à long terme, Ct −1, aide à transporter les informations pertinentes tout au long du processus d'une séquence. L'architecture +eLSTM combine trois portes : la porte d'oubli, la porte d'entrée et la porte de sortie. Dans l'unité LSTM, les fonctions tanh et sigmoïde sont utilisées pour obtenir ces portes.
Les données du train +e ont ensuite été divisées en données de train et de validation de longueur égale. + La longueur des données a été calculée à 1 01945 et la distribution des classes était de {1 : 87955, 0 : 13990}. Pour créer les ensembles de données de test et de validation du train TensorFlow, nous devons convertir nos données de train en séquences. Nous les avons complétées jusqu'à une longueur maximale de 100 afin que toutes les séquences aient la même longueur. +e former et tester les étiquettes

For more information:1950477648nn@gmail.com






