記事書くためのツール

AIはメッセージの響き方を推測できる。でも、あなたが本当に感じていることは読み取れない。

精度の数字、訓練を受けた人間同士でも意見が割れる理由、そしてテキストを顔や声とは別扱いにするEUの新しい法律について。

Samet Durgun · Subtextの共同創業者 · 9分で読めます

私はSubtextを共同でつくっています。メッセージを読み解いて、どう返信すればいいかを考える手助けをするアプリです。だから、AIのトーン検知に関する研究を掘り下げるのには、下心がありました。ベンチマーク、ACLの論文、心理学からの批判、そしてこの分野の一部をいま禁じているEUの法律まで。

短く言えば、二文で済みます。いまのAIは、メッセージが読み手にどう届くかを予測するのは得意です。書き手が実際に何を感じているかを、確実に知る方法は持っていません。ここから先は、その二文のあいだにある差についての詳細です。

トーン検知は、ひとつではなく5つの仕事

この言葉は、ひとつの機能のように聞こえます。でも中身を見ると、リストを下るほど難しくなる、別々の問題の集まりです。

感情極性(センチメント)はいちばん簡単なほうです。このテキストはポジティブか、ネガティブか、ニュートラルか。大手クラウド各社はどこも扱っています。GoogleのAPI1 はマイナス1からプラス1までのスコアと、感情の強さを示すマグニチュードを返します。Amazon Comprehend2 はテキストをポジティブ、ネガティブ、ニュートラル、混在のいずれかに分類し、MicrosoftのAzureサービス3 はアスペクト単位の意見マイニングまで加えます。だから「このアプリはいいけど、サポートは最悪だった」のような一文も、平均でぼやけさせず正しく分割できます。

感情検知(エモーション)はその次の段階です。怒り、喜び、恐れ、悲しみ、そのたくさんの親戚たち。これは難しくなります。数字を見ればわかる通りです。

対人関係のトーンは、大家さんにメッセージを送るときに気にする類のものです。これは温かく聞こえるか、単刀直入か、身構えているか、責めているように聞こえるか。研究者たちは2018年の時点ですでに4、仕事のメールにおけるいら立ち、フォーマルさ、丁寧さをモデル化していて、それなりにうまくいっていました。理由は、これらをひとつの感情ラベルではなく、別々の次元として扱ったからです。

その次に来るのが皮肉と言外の意味で、これは言葉そのものより文脈に左右されます。そしていちばん下にあるのが、書き手の心のなかにある感情状態です。マーケティングの多くが匂わせているのはこれで、研究がいちばん裏づけていないのもこれです。

だから、あるプロダクトのページが「トーンを検知します」と書いているのを見ると、私が最初に思うのは、この5つのうちどれを指しているのか、ということです。

ランディングページには絶対に載らない精度の数字

テキストの細かい感情分類における基準データセットは、GoogleのGoEmotions5です。Redditのコメント58,000件に、27種類の感情とニュートラルを人手でラベル付けしたもので、2020年のACLで発表されました。そのBERTベースラインは、全ラベルを通してマクロF1で0.46というスコアでした。その後の研究6は、より強力なモデルとデータの工夫でそれを0.49から0.51あたりまで押し上げています。何年も進歩を重ねて、それでも最良の専門モデルですら、細かいラベルの多くを取りこぼしています。

一般的なチャットボットに同じ28分類をやらせると、ベンチマークのスコアはファインチューニング済みの小型モデルより大きく下がります。理由の一部は、自由形式のモデルが分類体系にないラベルをつくってしまい、テストの閾値に合わせて調整もされていないからです。手厳しい話に聞こえますが、2025年のある研究7では、人間の審査員がデータセットの公式ラベルより、GPT-4のラベルを支持することが多々ありました。モデルがベンチマークと食い違うのは、ベンチマークのほうが分が悪い場合もある、ということです。

ポジティブかネガティブかという粗い分類なら、全体を通してスコアはずっと高くなります。崩れるのはまさに、興味深い区別が存在するところです。いら立ちと怒りの違い、失望と不満の違い。

トーンについては、人間同士も意見が割れる

このテーマ全体の見え方を変えたのは、人間のほうを確認したときでした。GoEmotionsの論文は、自分たちの人間のラベル付け担当者同士の一致度を報告していて、ほとんどの感情でコーエンのカッパ係数はだいたい0.1から0.5のあいだに収まっています。感謝は0.75で簡単なほうです。悲嘆は0.09で、ほぼランダムにラベルを付けているのと変わりません。訓練を受けた人間同士が同じ文を読んでも、それが失望を表しているのか不満を表しているのか一致しないなら、そのラベルに対して0.46というスコアを出すモデルは、課題そのものの天井に頭をぶつけているところです。

話はもっと深いところまで続きます。そもそも、誰の感情を測っているのでしょうか。EmoBank8というデータセットは、同じ文に対して書き手視点と読み手視点の二重にアノテーションをつけました。この二つは別の変数だとわかったからです。同じ研究者たちは2017年に、書き手視点でアノテーションしたほうが全体の質が高くなることも見つけています。そして7つの語族にまたがる30以上の言語を対象にした大規模なSemEval 2025のタスク9は、意図して「知覚された感情」を狙っています。つまり、一般的な読み手がそのテキストに帰属させるであろう感情であって、書き手が内心で感じていたものではない、とはっきり定義したうえでです。

もっとも鋭いテストは2025年に行われました。あるACLの研究10は、書き手本人に自分の感情をラベル付けしてもらい、そのうえで見ず知らずの人間とLLMに推測させました。どちらも本人の申告には届かず、LLMはほぼ全面的に見ず知らずの人間を上回りました。この結果は両方の半分がそれぞれ大事です。いまのAIは、テキストだけからあなたを読み取る点で、見知らぬ他人よりも優れています。それでいて、あなたが実際に感じたことを確実に再構成することはできません。

実務上の帰結がひとつあります。Heliyonに載った2023年の比較研究11は、商用の感情検知API8製品を同じデータセットにかけたところ、互いに意見が食い違い、順位もデータセットごとに入れ替わりました。ラベルもデータも言語も明かさずに「感情検知の精度95パーセント」と謳うベンダーは、その主張の重みに見合わない数字を掲げていることになります。

モデルは感情のテストで満点を取り、それでも本人を見逃す

二つの研究結果は、それぞれが何を測っているかを切り分けるまでは、矛盾しているように見えます。

Communications Psychology12に載った2025年の研究では、ChatGPT-4、Gemini 1.5 Flash、Claude 3.5 Haiku、DeepSeek V3を含む6つのモデルが、人間の評価に使われる標準的な感情知能テスト5種類を受けました。モデルの平均正答率は81パーセントで、テストの検証研究における人間の平均56パーセントを上回っています。Nature Human Behaviour13では、GPT-4が誤信念や間接的な依頼の察知といった古典的な心の理論課題で人間と同等かそれ以上の成績を出しましたが、失言(フォーパス)の認識ではつまずいています。そしてJAMA Internal Medicine14では、免許を持つ評価者が実際の患者からの質問への回答を読み、医師よりチャットボットの回答を好んだ割合が78.6パーセントに達し、共感的だと評価される確率は9.8倍でした。ただし留意点がひとつあります。チャットボットの回答は平均211語、医師は平均52語で、医師が長く書いた場合はこの選好差が縮まっています。

一方で、パターン認識ではなく感情の推論を要求するようにつくられたベンチマークEmoBench15は、モデルと平均的な人間のあいだにいまもはっきりした差があることを示しています。

この二つの結果はどちらも成り立ちます。感情について知っていることと、誰かの感情を知ることは、別のスキルだからです。モデルは、嫉妬や悲嘆や職場の気まずい謝罪について、生きているどの人間よりもたくさん読んでいます。モデルに欠けているのは、この特定のメッセージを書いた、その一人についての文脈です。

4人が同じ言葉を打てます。「おめでとう。よかったね」。一人は本気でそう思っています。もう一人はあなたに恨みを抱いています。三人目は傷ついていて、それを気丈に隠しています。四人目は皮肉で言っています。画面の上ではどのバージョンもまったく同じなので、テキストモデルにこれらを区別することはできませんし、見ず知らずの人間にもできません。その情報は、言葉の外側にあります。

仕事の大半をこなしているのは文脈

「わかった」という返信を例にとります。

これだけを見れば、同意にも、失望にも、いら立ちにも、無関心にも、静かに閉じていくドアにも読めます。これを「締め切りをまた延ばしたね、もう3回目だよ」のあとに置くと、読み方は一気に絞られます。言葉そのものは何も変わっていません。変わったのは文脈です。

皮肉に関する研究は、決まって同じ結論に着地します。人間でさえ、皮肉の意図をつかむには周囲の会話が必要になることが多いのです1617。だからこそ、新しい評価は単独の文ではなく、対話全体でモデルを試すようになっています。ここから、トーンを扱うツールへの実務的なルールが直接導けます。やりとり全体と、関係性と、そこにある利害を渡すこと。単独のメッセージだけを切り出して判定させるのは、モデルに丁寧に失敗してもらうようなものです。

トーンは文化的なもので、たいていのモデルはアメリカ英語で育っている

BESSTIE18という2025年のベンチマークは、オーストラリア英語、イギリス英語、インド英語をまたいで、モデルの感情極性と皮肉の検知をテストしました。インド英語での成績は一貫して悪く、なかでも皮肉がいちばん難しいケースで、モデルはひとつの変種から別の変種へとうまく一般化できませんでした。

この結果は、日常の経験とも一致します。「Kindly do the needful(よしなにお願いします)」は、インドのビジネス英語ではひとつの読み方をされますが、アメリカのオフィス規範で調整されたモデルには、また違って読まれます。ベルリンに13年住んだ身として、ドイツ語版も付け加えられます。ここでは、時間への敬意として扱われる率直さが、アメリカ的な丁寧さで育ったソフトウェアには冷たいと判定されることがあります。失礼、温かい、直接的すぎる、といったラベルは、客観という衣装をまとった文化的な判断です。誰が誰に、どの文化のなかで書いているかを無視するトーンツールは、自信満々に両方の側を読み違えます。

顔を読むところで、感情AIは道を見失った

ここまではすべてテキストの話でした。この業界のなかで顔をスキャンする枝分かれは、もっと荒れた実績を残していて、それが規制当局によるこのカテゴリー全体の扱い方を形づくっています。

2019年、心理学者のLisa Feldman Barrettと共同研究者たちは、1,000件を超える研究をレビューし19、顔の動きから人がどう感じているかを確実に推し量ることはできない、と結論づけました。人は集中しているときに顔をしかめ、不安なときに笑い、結婚式で泣きます。同じ年、NBA選手400人の写真を2つの商用システムにかけた研究では、似たような表情でも黒人選手の顔のほうにより多くのネガティブな感情を読み込む20ことが、両方のシステムで見つかりました。

業界も気づきました。Microsoftは2022年、Face APIから感情推定機能を退役させました21。HireVueは2021年、デジタル権利団体EPICがFTCに苦情を申し立てた22あと、採用審査から表情分析を外しました。テキスト系のツールはまったく別の技術ですが、この懐疑の目は引き継いでいます。そして、言葉ではなく内心の状態を読み取ると主張するたびに、その懐疑を自ら招いています。

EUは一線を引いたが、テキストはその外側にある

2025年2月2日以降、EU AI法の第5条1項(f)23は、職場や学校で人の感情を推定するAIを禁じています。ドライバーの疲労検知のような医療・安全用途には、限定的な例外があります。この禁止事項に違反すると、全世界年間売上高の最大7パーセントの罰金が科されます。

この適用範囲は、こうしたツールをつくる人にも使う人にも重要です。欧州委員会のガイドラインは、この禁止を生体データに結びつけています24。顔、声、キー入力のリズム、姿勢です。書かれたテキストから感情を推定するシステムは、この禁止の対象外だと明記されています25。メールがどう受け取られそうかを分析するのは合法です。従業員にウェブカメラを向けて機嫌を採点するのは禁止です。この線引きは、科学的な実態にかなり忠実に沿っていて、Subtextにとっては、もともと選んでいたであろう設計上の制約そのものになっています。テキストのみ、生体データは使わない、職場監視もしない、という制約です。

いまのツールが得意なこと

Grammarlyのトーン検知機能26は、消費者向けの例としてもっともわかりやすく、その打ち出し方は市場のなかでも静かにいちばん誠実です。語彙の選び方、言い回し、句読点、大文字表記26を分析して、あなたのメッセージが読み手にどう聞こえそうかを、40種類を超えるトーンにわたって教えてくれます。「聞こえそう」。この言い回しが、しっかり科学的な仕事をしています。

GoogleAmazonMicrosoftIBM27のクラウドAPIは、量をさばくためにつくられています。サポートチケット、レビュー、アンケートの回答です。IBMは2023年に単体だったTone Analyzerを退役させ、感情分析をより大きな言語プロダクトの中に統合しました。これらは「顧客はうちの決済フローをどう感じているか」には向いていて、「この文章、受動攻撃的に聞こえないか」には向いていないツールです。

個人的なメッセージに関しては、汎用LLMがいちばん有能な選択肢です。文脈を使え、複数のトーンを同時に扱え、自分の読み取りを説明できるからです。ただし、キャリブレーションはいちばんできていないので、確信度のパーセンテージはどれも雰囲気の目安くらいに扱うべきです。音声のほうでは、Hume AI28が2024年に5,000万ドルのシリーズBを調達し、声の抑揚を測定する技術に投資しています。主な目的は、音声インターフェースがふさわしいペースとトーンで応答できるようにすることです。隠れた感情を検知すると主張するより狭い用途ですが、その分、擁護しやすい用途でもあります。

この研究がSubtextをどう形づくっているか

Subtextが分析するのは、人がいちばん気にかけているメッセージです。上司から、デート相手から、母親からのテキスト。この研究が、それがどう動くべきかを決めています。

出力は、知覚についての話でなければなりません。「これは冷たく受け取られるかもしれません」は、根拠が支持できる主張です。「彼女はあなたに怒っています」は支持できない主張で、ACLの本人申告研究がその領収書です。私たちはまた、メッセージが複数のトーンを同時に帯びることも許容しています。実際のメッセージがそうだからです。温かさと身構えの併存はふつうに起こる組み合わせで、新しいベンチマークが感情をマルチラベルとして扱っているのも、まさにこの理由からです。

判定より根拠です。役に立つツールは、印象をつくっている言葉そのものを指し示します。「前にも説明した通り」という一言が、張り詰めたメールの中でこっそり大きな仕事をしているように。そうすれば、その印象が自分の望むものかどうかを、自分で決められます。不確かさも見えたままにしておきます。あるメッセージが曖昧なとき、その曖昧さこそがいちばん正確な発見であることが多く、それを自信満々のラベルに丸め込むのは、偽物の精密さです。文脈が最優先です。宙に浮いた一文を採点するより、やりとり全体を読んで、相手が誰なのかを尋ねるほうを、私たちは選びます。同じ9語でも、上司相手と、まだ何者でもない相手とでは、意味がまったく変わってくるからです。

このカテゴリーの正直なバージョンは、ピッチデックが語るよりも小さく、懐疑派が認めるよりも役に立ちます。心を読むことは、いまも手の届かないところにあります。言葉遣いを読むことは、いま現実に可能で、書かれたコミュニケーションでの被害の大半は、そもそもそこから始まっています。それだけで、つくる理由としては十分だと感じました。


こうしたツールをつくっていて、私がベンチマークを読み違えていると思ったら、LinkedInで教えてください。

Samet DurgunはSubtextの共同創業者です。メッセージの感情的なトーンを捉えて、あなた自身の言葉で書き直すアプリをつくっています。ベルリン在住。


出典

本文中のリンクは、一次情報が存在するかぎり、そこへ直接向かっています。番号は登場順です。2件は、安定したURLを確認できなかったためリンクなしで引用しています。最後の2件は、本文中の主張の根拠ではなく、さらに読みたい人向けの参考文献です。

  1. Google Cloud。Natural Language API basics: sentiment score and magnitude
  2. AWS。Amazon Comprehend: sentiment analysis
  3. Microsoft。Azure Language: sentiment analysis and opinion mining
  4. Chhaya et al.(2018)。Frustrated, Polite, or Formal: Quantifying Feelings and Tone in Email。PEOPLES Workshop, NAACL 2018。
  5. Demszky et al.(2020)。GoEmotions: A Dataset of Fine-Grained Emotions。ACL 2020。
  6. Wang et al.(2024)。Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning。arXiv。
  7. Rethinking Emotion Annotations in the Era of Large Language Models(2025)。
  8. Buechel and Hahn(2017)。EmoBank、書き手視点と読み手視点の両方からアノテーションを行ったコーパス、および「Readers vs. Writers vs. Texts」、Linguistic Annotation Workshop 2017。
  9. Muhammad et al.(2025)。SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection。SemEval 2025。
  10. Li et al.(2025)。Can Third Parties Read Our Emotions? ACL 2025。
  11. Abu-Salih et al.(2023)。Emotion detection of social data: APIs comparative study。Heliyon。
  12. Schlegel, Sommer, and Mortillaro(2025)。Large language models are proficient in solving and creating emotional intelligence tests。Communications Psychology。
  13. Strachan et al.(2024)。Testing theory of mind in large language models and humans。Nature Human Behaviour。
  14. Ayers et al.(2023)。Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum。JAMA Internal Medicine。
  15. Sabour et al.(2024)。EmoBench: Evaluating the Emotional Intelligence of Large Language Models。ACL 2024。
  16. Feng et al.(2024)。Affect Recognition in Conversations Using Large Language Models。SIGDIAL 2024。
  17. Hazarika et al.(2018)。CASCADE: Contextual Sarcasm Detection in Online Discussion Forums。COLING 2018。
  18. Srirag et al.(2025)。BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English。Findings of ACL 2025。
  19. Barrett et al.(2019)。Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements。Psychological Science in the Public Interest。
  20. Rhue(2019)。Racial Influence on Automated Perceptions of Emotions。SSRNのワーキングペーパー。
  21. Microsoft(2022)。Framework for building AI systems responsibly、Face APIにおける感情推定機能の退役を発表したもの。
  22. EPIC。In re HireVue, FTC complaint(2019)。
  23. EU AI法、Article 5: Prohibited AI Practices、2025年2月2日より適用。
  24. Lewis Silkin(2025)。Understanding the EU AI Act’s prohibited practices, on the Commission’s February 2025 guidelines
  25. Future of Privacy Forum(2026)。Red Lines under the EU AI Act: the prohibition of emotion recognition in the workplace and education
  26. Grammarly。トーン検知の製品ページ、およびトーン検知の仕組みについて
  27. IBM。Watson Natural Language Understanding
  28. Hume AI
  29. Northeastern University(2021)。You can’t determine emotion from someone’s facial movements, and neither can AI
  30. The Guardian(2024)。Are you 80% angry and 2% sad? Why “emotional AI” is fraught with problems