ArtikelSchreib-Tools

KI kann raten, wie deine Nachricht ankommt. Was du wirklich fühlst, kann sie nicht lesen.

Die Genauigkeitswerte, warum selbst geschulte Menschen sich uneinig sind, und das neue EU-Gesetz, das Text anders behandelt als dein Gesicht oder deine Stimme.

Von Samet Durgun · Mitgründer von Subtext · 12 Min. Lesezeit

Ich baue mit an Subtext, einer App, die Menschen hilft, Nachrichten zu lesen und herauszufinden, wie sie antworten sollen. Ich hatte also einen ziemlich eigennützigen Grund, mich durch die Forschung zu KI-Tonerkennung zu graben: die Benchmarks, die ACL-Paper, die Kritik aus der Psychologie und das EU-Gesetz, das einen Teil dieses Feldes inzwischen verbietet. Gewicht meine Position entsprechend. Jede Behauptung unten verlinkt zur Quelle, sodass du meine Lesart überprüfen kannst, anstatt mir zu vertrauen.

Heutige KI ist gut darin, vorherzusagen, wie eine Nachricht bei einem Leser ankommen könnte. Sie hat keine verlässliche Möglichkeit zu wissen, was die schreibende Person fühlt. Alles unten ist Detailarbeit an der Lücke zwischen diesen beiden Sätzen.

Tonerkennung ist fünf verschiedene Aufgaben

Der Begriff klingt nach einem einzigen Feature. Darunter liegen getrennte Probleme, die mit jeder Stufe schwieriger werden.

Sentiment ist die einfache Stufe. Dabei geht es darum, ob ein Text positiv, negativ oder neutral ist. Jeder große Cloud-Anbieter verkauft das. Googles API1 liefert einen Score von minus eins bis plus eins, dazu eine Magnitude für die emotionale Stärke, Amazon Comprehend2 sortiert Text in positiv, negativ, neutral oder gemischt, und Microsofts Azure-Dienst3 fügt Opinion Mining auf Aspektebene hinzu, sodass ein Satz wie “die App ist super, aber der Support war furchtbar” korrekt aufgeteilt wird, statt zu einem Brei gemittelt zu werden.

Emotionserkennung, die nächste Stufe, umfasst Wut, Freude, Angst, Trauer und ihre vielen Verwandten. Schwieriger, wie die Zahlen gleich zeigen werden.

Zwischenmenschlicher Ton ist das, was dich interessiert, wenn du deinem Vermieter schreibst. Klingt das warm, direkt, defensiv, vorwurfsvoll. Forschende haben schon 20184 Frust, Formalität und Höflichkeit in Arbeits-E-Mails modelliert, und es funktionierte einigermaßen gut, weil sie das als getrennte Dimensionen behandelten statt als ein einziges Emotionslabel.

Dann kommen Sarkasmus und Subtext, die mehr vom Kontext abhängen als von den Wörtern. Ganz unten steht der private emotionale Zustand der schreibenden Person, das, was die meiste Werbung suggeriert und das, wofür die Forschung am wenigsten hergibt.

Wenn eine Produktseite also behauptet, sie erkenne Ton, und die meisten Tonchecker checken deinen Ton nie, ist meine erste Frage, welche dieser fünf Stufen gemeint ist. Subtext gehört in diese dritte Kategorie, den zwischenmenschlichen Ton, bei dem es darum geht, ob eine Nachricht warm, direkt, defensiv oder vorwurfsvoll bei der Person ankommt, die sie liest. Das ist weder ein Sentiment-Score noch eine Behauptung über die privaten Gefühle von irgendjemandem.

Die Genauigkeitswerte, die es nie auf die Landingpage schaffen

Der Referenzdatensatz für feingranulare Emotionen in Text ist Googles GoEmotions5: 58.000 Reddit-Kommentare, die Demszkys Team von Hand mit 27 Emotionen plus neutral gelabelt und 2020 auf der ACL vorgestellt hat. Die BERT-Baseline kam auf einen makro-F1 von 0,46 über das gesamte Label-Set. Spätere Arbeit6 mit stärkeren Modellen und Datentricks drückte das auf etwa 0,49 bis 0,51 hoch. Jahre an Fortschritt, und die besten spezialisierten Modelle verfehlen immer noch einen großen Teil der feingranularen Labels.

Bittet man einen allgemeinen Chatbot um dieselbe 28-Wege-Sortierung, fällt sein Benchmark-Score deutlich unter die feinjustierten kleinen Modelle, teils weil frei formulierende Modelle Labels außerhalb der Taxonomie erfinden und sich nicht auf die Schwellenwerte des Tests kalibrieren. Was vernichtend klingt, bis man erfährt, dass in einer Studie von 20257 menschliche Gutachter sich oft eher auf die Seite von GPT-4s Labels schlugen als auf die offiziellen des Datensatzes. Manchmal widerspricht das Modell dem Benchmark, weil der Benchmark die schwächere Partei ist.

Grobe Positiv-negativ-Klassifikation erzielt durchweg deutlich höhere Werte. Der Einbruch passiert genau dort, wo die interessanten Unterscheidungen liegen, etwa Verärgerung gegen Wut oder Enttäuschung gegen Missbilligung.

Auch Menschen sind sich beim Ton uneinig

Der Teil, der für mich das ganze Thema neu gerahmt hat, ist das, was passiert, sobald man die Menschen prüft. Das GoEmotions-Paper berichtet im Anhang die Übereinstimmung zwischen den eigenen menschlichen Labellern, und für die meisten Emotionen liegt Cohens Kappa bei etwa 0,1 bis 0,5. Dankbarkeit ist einfach, bei 0,75. Trauer landet bei 0,09, nahe an zufälligem Labeln. Wenn geschulte Menschen, die denselben Satz lesen, sich nicht einigen können, ob er Enttäuschung oder Missbilligung ausdrückt, wird ein Modell mit einem Makro-F1 von 0,46 gegen ihre Labels an einem Lösungsschlüssel gemessen, der genau an diesen Stellen weich ist. Kappa und F1 messen verschiedene Dinge, deshalb ist der menschliche Wert keine harte Obergrenze, aber er zeigt dir, dass ein Teil der Fehler des Modells an der Aufgabe selbst liegt.

Cohens Kappa, GoEmotions’ eigene menschliche Labeller Dankbarkeit: 0,75. Trauer: 0,09, nahe an zufälligem Labeln.

Ein Kappa von 1,0 ist vollständige Übereinstimmung, 0 ist Zufall. Wenn geschulte Menschen sich nicht einigen können, ob ein Satz Enttäuschung oder Missbilligung ist, wird der Makro-F1 von 0,46 eines Modells an einem Lösungsschlüssel gemessen, der genau an diesen Stellen weich ist.

Es geht noch tiefer. Wessen Gefühl messen wir überhaupt? Ein Datensatz namens EmoBank8 hat dieselben Sätze zweimal annotiert, einmal aus Sicht der schreibenden Person und einmal aus Sicht der lesenden, weil sich das als zwei unterschiedliche Variablen herausstellt. Dieselben Forschenden fanden 2017 heraus, dass die Annotation aus Schreiberperspektive insgesamt die bessere Qualität lieferte. Und die große SemEval-2025-Emotionsaufgabe9, die mehr als 30 Sprachen aus sieben Sprachfamilien abdeckte, zielt bewusst auf wahrgenommene Emotion, also auf das, was ein durchschnittlicher Leser dem Text zuschreiben würde, und ausdrücklich nicht auf das, was die schreibende Person innerlich fühlte.

Der schärfste Test kam 2025. Eine ACL-Studie10 bat Autorinnen und Autoren, ihre eigenen Emotionen zu labeln, dann sollten fremde Menschen und LLMs raten. Beide blieben hinter den Selbstauskünften der Autoren zurück, und die LLMs schlugen die menschlichen Fremden fast durchweg. Beide Hälften dieses Befunds zählen. KI ist inzwischen besser als eine zufällige Person darin, dich allein aus Text zu lesen, und sie kann trotzdem nicht zuverlässig rekonstruieren, was du gefühlt hast. Subtext ist für die Hälfte dieses Befunds gebaut, die sich hält. Es liest, wie deine Nachricht wahrscheinlich ankommt, nicht, was du gefühlt hast, als du sie geschrieben hast.

Eine praktische Konsequenz zeigt sich in einem Vergleich von 2023 in Heliyon11, der acht kommerzielle Emotions-APIs über dieselben Datensätze laufen ließ und sie uneins miteinander fand, mit Rankings, die zwischen Datensätzen wechselten. Jeder Anbieter, der “95 Prozent genaue Emotionserkennung” zitiert, ohne Labels, Daten und Sprache zu nennen, zitiert eine Zahl, die das Gewicht der Behauptung nicht tragen kann.

Modelle glänzen bei Emotionstests und verfehlen trotzdem die Person

Zwei Forschungsergebnisse wirken widersprüchlich, bis man trennt, was sie eigentlich messen.

In einer Studie von 2025 in Communications Psychology12 absolvierten sechs Modelle, darunter ChatGPT-4, Gemini 1.5 Flash, Claude 3.5 Haiku und DeepSeek V3, fünf standardisierte Tests emotionaler Intelligenz, wie sie für Menschen verwendet werden. Die Modelle erreichten im Schnitt 81 Prozent richtig, gegen 56 Prozent menschlichen Durchschnitt aus den Validierungsstudien der Tests. In Nature Human Behaviour13 erreichte oder übertraf GPT-4 Menschen bei klassischen Theory-of-Mind-Aufgaben wie dem Erkennen falscher Überzeugungen und indirekter Bitten, stolperte aber beim Erkennen von Fauxpas. Und in JAMA Internal Medicine14 lasen lizenzierte Gutachter Antworten auf echte Patientenfragen und bevorzugten die des Chatbots gegenüber denen der Ärzte in 78,6 Prozent der Fälle, mit einer 9,8-mal höheren Wahrscheinlichkeit, als einfühlsam bewertet zu werden. Einen Vorbehalt behalte ich im Hinterkopf. Die Antworten des Chatbots waren im Schnitt 211 Wörter lang gegen 52 bei den Ärzten, und die Präferenz schrumpfte, wenn Ärzte länger schrieben. Bei Menschen ist, ob emotionale Intelligenz wirklich bei der Arbeit zählt, noch mal eine andere Frage.

Gleichzeitig findet EmoBench15, ein Benchmark, der eigens gebaut wurde, um emotionales Schlussfolgern statt bloßes Mustererkennen zu verlangen, weiterhin eine klare Lücke zwischen Modellen und durchschnittlichen Menschen.

Beide Befunde können gleichzeitig stimmen, weil Wissen über Emotionen und das Wissen um die Emotion einer bestimmten Person zwei verschiedene Fähigkeiten sind. Ein Modell hat mehr über Eifersucht, Trauer und unangenehme Entschuldigungen am Arbeitsplatz gelesen als jeder lebende Mensch. Was ihm fehlt, ist Kontext über die eine Person, die diese eine Nachricht geschrieben hat.

Vier Menschen könnten dieselben Worte tippen: “Herzlichen Glückwunsch. Ich freue mich für dich.” Eine Person meint es so. Eine andere ist neidisch. Eine dritte ist untröstlich und tapfer. Die vierte ist sarkastisch. Jede Version ist auf dem Bildschirm identisch, also kann kein Textmodell sie trennen, und ein fremder Mensch auch nicht. Diese Information liegt außerhalb der Wörter.

Kontext leistet den größten Teil der Arbeit

Nimm die Antwort “Passt schon.”

Für sich allein könnte das Zustimmung sein, Enttäuschung, Verärgerung, Gleichgültigkeit oder eine Tür, die sich leise schließt. Setz sie nach “Du hast den Termin jetzt zum dritten Mal verschoben” und die Lesart wird schnell enger. Am Wort hat sich nichts verändert. Am Kontext schon.

Die Sarkasmusforschung landet immer wieder beim selben Schluss, nämlich dass selbst Menschen oft das umgebende Gespräch brauchen, um zu erkennen, ob ein Text sarkastisch gemeint ist1617, weshalb neuere Evaluationen Modelle an ganzen Dialogen testen statt an isolierten Sätzen. Die praktische Regel, die ich für jedes Ton-Tool daraus ableite, folgt direkt. Gib ihm den Verlauf, die Beziehung und den Einsatz. Eine einzelne Nachricht isoliert zu beurteilen heißt, das Modell höflich zum Scheitern zu bringen. Das ist auch, warum Subtext den ganzen Verlauf liest, nicht nur eine Zeile, denn die meiste Lesart sitzt im Kontext, nicht in den Wörtern, die gelesen werden.

Ton ist kulturell, und die meisten Modelle sind mit amerikanischem Englisch aufgewachsen

Ein Benchmark von 2025 namens BESSTIE18 testete Modelle auf Sentiment und Sarkasmus über australisches, britisches und indisches Englisch hinweg. Die Leistung war bei indischem Englisch durchweg schwächer, Sarkasmus der schwierigste Fall, und die Modelle hatten Mühe, von einer Varietät zur anderen zu verallgemeinern.

Das Ergebnis deckt sich mit alltäglicher Erfahrung. “Kindly do the needful” liest sich im indischen Berufsenglisch anders als für ein Modell, das auf amerikanische Büronormen kalibriert ist. Nach 13 Jahren in Berlin kann ich die deutsche Variante ergänzen. Direktheit, die hier als Respekt vor deiner Zeit gilt, kann von Software, die mit amerikanischer Höflichkeit großgezogen wurde, als kalt markiert werden. Labels wie unhöflich, warm oder zu direkt sind kulturelle Urteile im Kostüm der Objektivität. Ein Ton-Tool, das ignoriert, wer an wen schreibt, und in welcher Kultur, wird selbstbewusst beide Seiten falsch lesen.

Eine verwandte Verzerrung zeigt sich bei der Moderation von Inhalten, einer anderen Aufgabe als die Sentiment-Bewertung. Sap und Kolleginnen und Kollegen untersuchten weit verbreitete Hassrede-Datensätze19 und fanden, dass Tweets in African American English, manchmal African American Vernacular English oder AAVE genannt, von trainierten Klassifizierern bis zu doppelt so oft als beleidigend eingestuft wurden wie vergleichbare Tweets in anderen Varietäten, ohne dass die Annotierenden je gesehen hätten, wer sie geschrieben hat. Die Lücke steckt im Toxizitäts-Klassifizierer, nicht im Sentiment-Klassifizierer, ein Benchmark wie BESSTIE würde sie also nicht sichtbar machen. Ein Moderationssystem, das mit diesen Daten trainiert wurde, flaggt alltägliche AAVE-Formulierungen häufiger als beleidigend als dieselbe Nachricht anders formuliert.

Gesichtserkennung ist da, wo Emotions-KI den Faden verloren hat

Alles bisher Gesagte betrifft Text. Der gesichtsscannende Zweig dieser Branche hat eine deutlich schlechtere Bilanz, und das prägt, wie Regulierer heute die ganze Kategorie behandeln.

2019 prüften die Psychologin Lisa Feldman Barrett und Kolleginnen über tausend Studien20 und kamen zu dem Schluss, dass sich aus Gesichtsbewegungen nicht verlässlich ableiten lässt, wie jemand sich fühlt. Menschen ziehen die Stirn kraus, während sie sich konzentrieren, lächeln, während sie ängstlich sind, und weinen bei Hochzeiten. Im selben Jahr wurden Fotos von 400 NBA-Spielern durch zwei kommerzielle Systeme gejagt, und beide lasen mehr negative Emotion in die Gesichter Schwarzer Spieler21 hinein als in die weißer Spieler bei vergleichbarem Gesichtsausdruck.

Die Branche hat es bemerkt. Microsoft zog die Emotionsinferenz aus seiner Face API zurück22, 2022. HireVue strich 2021 die Gesichtsanalyse aus seinen Einstellungstests, nachdem die Bürgerrechtsorganisation EPIC eine Beschwerde bei der FTC eingereicht hatte23. Text-Tools sind eine andere Technologie, aber sie erben diese Skepsis, und sie verdienen sie sich, sobald sie beanspruchen, innere Zustände zu lesen statt Formulierungen.

Die EU hat eine Grenze gezogen, und Text steht außerhalb

Seit dem 2. Februar 2025 verbietet Artikel 5 Absatz 1 Buchstabe f24 des EU-KI-Gesetzes KI, die Emotionen von Menschen am Arbeitsplatz und in Bildungseinrichtungen ableitet, mit engen Ausnahmen für medizinische und sicherheitsrelevante Anwendungen wie Müdigkeitserkennung bei Fahrern. Wer gegen die verbotenen Praktiken verstößt, riskiert Bußgelder von bis zu 7 Prozent des weltweiten Jahresumsatzes.

Der Geltungsbereich zählt für alle, die solche Tools bauen oder nutzen. Leitlinien der Europäischen Kommission koppeln das Verbot an biometrische Daten25: Gesichter, Stimmen, Tippdynamik, Körperhaltung. Ein System, das Emotionen aus geschriebenem Text ableitet, steht ausdrücklich außerhalb des Verbots26. Zu analysieren, wie eine E-Mail ankommen könnte, ist legal. Eine Webcam auf Angestellte zu richten, um ihre Stimmung zu bewerten, ist verboten. Diese Linie folgt der Wissenschaft ziemlich gut, und für Subtext übersetzt sie sich in eine Design-Vorgabe, die wir ohnehin gewählt hätten: nur Text, keine Biometrie, keine Überwachung am Arbeitsplatz.

Wofür die heutigen Tools taugen

Grammarlys Tonerkennung27 ist das klarste Beispiel für Endnutzer, und ihre Formulierung ist die direkteste am Markt. Sie analysiert Wortwahl, Formulierung, Zeichensetzung und Großschreibung27, um dir zu sagen, wie deine Nachricht bei einer lesenden Person wahrscheinlich ankommt, über mehr als 40 Töne hinweg. Wahrscheinlich ankommt. Diese Formulierung leistet echte wissenschaftliche Arbeit.

Die Cloud-APIs von Google, Amazon, Microsoft und IBM28 sind dafür gebaut, Support-Tickets, Bewertungen und Umfrageantworten in großen Mengen zu verarbeiten. IBM hat seinen eigenständigen Tone Analyzer 2023 eingestellt und Emotion in sein breiteres Sprachprodukt eingegliedert. Das sind die richtigen Tools für “wie fühlen sich Kunden bei unserem Checkout” und die falschen für “klingt mein Text passiv-aggressiv.”

Allgemeine LLMs sind die leistungsfähigste Option für persönliche Nachrichten, weil sie Kontext nutzen, mehrere Töne gleichzeitig verarbeiten und ihre Lesart erklären können. Sie sind auch am schlechtesten kalibriert, also behandle jede Prozentangabe zur Sicherheit als Bauchgefühl, nicht als Messwert. Auf der Sprachseite hat Hume AI29 2024 eine Series B über 50 Millionen Dollar eingesammelt, um stimmliche Modulation zu messen, vor allem damit Sprachinterfaces mit passendem Tempo und Ton reagieren können. Ein engerer Einsatzbereich, und ein vertretbarerer als die Behauptung, verborgene Gefühle zu erkennen.

Was das für Subtext bedeutet

Subtext analysiert die Nachrichten, die Menschen am meisten beschäftigen, etwa den Text vom Chef, vom Date oder von der Mutter. Ich lasse die Forschung festlegen, wie das aussehen sollte.

Die Ausgabe muss über Wahrnehmung sprechen. “Das kann abweisend ankommen” ist eine Behauptung, die die Evidenz trägt. “Sie ist wütend auf dich” ist eine, die sie nicht trägt, und die ACL-Studie mit Selbstauskünften ist der Beleg dafür. Wir lassen Nachrichten außerdem mehrere Töne gleichzeitig tragen, weil echte Nachrichten das tun. Warm und defensiv ist eine normale Kombination, und die neueren Benchmarks behandeln Emotion genau deshalb als Mehrfachlabel.

Belege schlagen Urteile. Ein brauchbares Tool zeigt auf die Wörter, die einen Eindruck erzeugen, so wie “wie ich schon erklärt habe” in einer angespannten E-Mail leise die Schwerarbeit übernimmt, damit du entscheiden kannst, ob das der Eindruck ist, den du willst. Unsicherheit bleibt sichtbar. Wenn eine Nachricht mehrdeutig ist, ist die Mehrdeutigkeit oft der genaueste Befund, und sie zu einem selbstbewussten Label zu runden wäre gefälschte Präzision. Kontext kommt zuerst. Wir lesen lieber den Verlauf und fragen, wer die empfangende Person ist, als einen Satz zu bewerten, der frei im Raum schwebt, denn dieselben neun Wörter bedeuten für eine Führungskraft etwas anderes als für ein Situationship.

In der Praxis tippst du deinen Entwurf rein oder machst einen Screenshot des Verlaufs, und Subtext sagt dir, was deine Nachricht wahrscheinlich signalisiert, zeigt auf die Wörter, die das tun, und bietet Versionen, die immer noch wie du klingen. Subtext im Browser ausprobierenSubtext im Browser ausprobieren

Meine Einschätzung ist, dass diese Kategorie kleiner ist als die Pitch-Decks und nützlicher, als Skeptiker zugeben. Gedankenlesen bleibt außer Reichweite. Formulierungen zu lesen ist heute verfügbar, und der meiste Schaden in geschriebener Kommunikation entsteht ohnehin genau dort. Das schien mir ein guter genug Grund zu bauen.


Arbeitest du an einem dieser Tools und findest, ich habe deinen Benchmark falsch gelesen? Sag es mir auf LinkedIn.

Samet Durgun ist Mitgründer von Subtext, einer App, die den emotionalen Ton deiner Nachrichten erkennt und sie in deinen eigenen Worten neu schreibt. Er lebt in Berlin.


Quellen

Jeder Link oben führt zur Primärquelle, wo es eine gibt, nummeriert in der Reihenfolge des Auftretens. Zwei Einträge sind ohne Link zitiert, weil ich keine stabile URL bestätigen konnte, und die letzten beiden sind weiterführende Lektüre statt oben gemachter Behauptungen.

  1. Google Cloud. Natural Language API basics: sentiment score and magnitude.
  2. AWS. Amazon Comprehend: sentiment analysis.
  3. Microsoft. Azure Language: sentiment analysis and opinion mining.
  4. Chhaya et al. (2018). Frustrated, Polite, or Formal: Quantifying Feelings and Tone in Email. PEOPLES Workshop, NAACL 2018.
  5. Demszky et al. (2020). GoEmotions: A Dataset of Fine-Grained Emotions. ACL 2020.
  6. Wang et al. (2024). Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning. arXiv.
  7. Rethinking Emotion Annotations in the Era of Large Language Models (2025).
  8. Buechel and Hahn (2017). EmoBank, a corpus annotated from both writer and reader perspectives, and “Readers vs. Writers vs. Texts,” Linguistic Annotation Workshop 2017.
  9. Muhammad et al. (2025). SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection. SemEval 2025.
  10. Li et al. (2025). Can Third Parties Read Our Emotions? ACL 2025.
  11. Abu-Salih et al. (2023). Emotion detection of social data: APIs comparative study. Heliyon.
  12. Schlegel, Sommer, and Mortillaro (2025). Large language models are proficient in solving and creating emotional intelligence tests. Communications Psychology.
  13. Strachan et al. (2024). Testing theory of mind in large language models and humans. Nature Human Behaviour.
  14. Ayers et al. (2023). Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum. JAMA Internal Medicine.
  15. Sabour et al. (2024). EmoBench: Evaluating the Emotional Intelligence of Large Language Models. ACL 2024.
  16. Feng et al. (2024). Affect Recognition in Conversations Using Large Language Models. SIGDIAL 2024.
  17. Hazarika et al. (2018). CASCADE: Contextual Sarcasm Detection in Online Discussion Forums. COLING 2018.
  18. Srirag et al. (2025). BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English. Findings of ACL 2025.
  19. Sap et al. (2019). The Risk of Racial Bias in Hate Speech Detection. ACL 2019.
  20. Barrett et al. (2019). Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements. Psychological Science in the Public Interest.
  21. Rhue (2019). Racial Influence on Automated Perceptions of Emotions. SSRN working paper.
  22. Microsoft (2022). Framework for building AI systems responsibly, announcing the retirement of emotion inference in the Face API.
  23. EPIC. In re HireVue, FTC complaint (2019).
  24. EU AI Act, Article 5: Prohibited AI Practices, applicable since February 2, 2025.
  25. Lewis Silkin (2025). Understanding the EU AI Act’s prohibited practices, on the Commission’s February 2025 guidelines.
  26. Future of Privacy Forum (2026). Red Lines under the EU AI Act: the prohibition of emotion recognition in the workplace and education.
  27. Grammarly. Tone detector product page and how the tone detector works.
  28. IBM. Watson Natural Language Understanding.
  29. Hume AI.
  30. Northeastern University (2021). You can’t determine emotion from someone’s facial movements, and neither can AI.
  31. The Guardian (2024). Are you 80% angry and 2% sad? Why “emotional AI” is fraught with problems.