Key points are not available for this paper at this time.
Derzeit können Modelle zur Spracherkennung von Emotionen aufgrund der Komplexität von Emotionen nicht die gewünschten Leistungen erbringen. In den meisten der bisherigen Studien gibt es ein häufiges Problem, dass einige spezifische Emotionen stark falsch klassifiziert werden. In diesem Artikel schlagen wir ein neuartiges Rahmenwerk vor, das ein kaskadiertes Aufmerksamkeitsnetzwerk und eine adversariale gemeinsame Verluststrategie zur Spracherkennung von Emotionen integriert, um die Verwirrungen zu diskriminieren, indem wir den Fokus stärker auf die Emotionen legen, die schwer korrekt zu klassifizieren sind. Zunächst extrahieren wir log-Mels, Deltas und Delta-Deltas von log-Mels als 3D-Merkmale, um die Störungen durch externe Faktoren effektiv zu reduzieren. Als nächstes führen wir ein kaskadiertes Aufmerksamkeitsnetzwerk ein, um effektive emotionale Merkmale zu extrahieren, wobei die spatiotemporale Aufmerksamkeit selektiv die gezielten emotionalen Regionen aus den Eingangsmerkmalen lokalisiert. In diesen gezielten Regionen erfasst die Selbstaufmerksamkeit mit Kopf-Fusion die langzeitlichen Abhängigkeiten der zeitlichen Merkmale. Schließlich wird eine adversariale gemeinsame Verluststrategie vorgeschlagen, um die emotionalen Einbettungen mit hoher Ähnlichkeit durch die generierten harten Triplets auf adversariale Weise zu unterscheiden. Um unsere vorgeschlagene Methode zu bewerten, werden Experimente mit den IEMOCAP-, CASIA- und EMODB-Korpora durchgeführt. Die experimentellen Ergebnisse zeigen, dass unsere vorgeschlagene Methode die State-of-the-Art-Ansätze auf allen Datensätzen signifikant übertrifft.
Liu et al. (Sun,) haben diese Frage untersucht.