記事書くためのツール

AIはメッセージの響き方を推測できる。でも、あなたが本当に感じていることは読み取れない。

精度の数字、訓練を受けた人間同士でも意見が割れる理由、そしてテキストを顔や声とは別扱いにするEUの新しい法律について。

文 Samet Durgun · Subtextの共同創業者 · 9分で読めます

私はSubtextを共同でつくっています。メッセージを読み解いて、どう返信すればいいかを考える手助けをするアプリです。だから、AIのトーン検知に関する研究を掘り下げるのには、下心がありました。ベンチマーク、ACLの論文、心理学からの批判、そしてこの分野の一部をいま禁じているEUの法律まで。自分がこれを売っているのだから、この利害関係を差し引いて読んでください。以下のすべての主張には出典へのリンクがついているので、私を信じるより確認するほうがいいです。

いまのAIは、メッセージが読み手にどう届くかを予測するのは得意です。書き手が実際に何を感じているかを、確実に知る方法は持っていません。ここから先は、その二文のあいだにある差についての詳細です。

トーン検知は、ひとつではなく5つの仕事

この言葉は、ひとつの機能のように聞こえます。でも中身を見ると、リストを下るほど難しくなる、別々の問題の集まりです。

感情極性(センチメント)はいちばん簡単なほうです。テキストがポジティブか、ネガティブか、ニュートラルかを問うものです。大手クラウド各社はどこも扱っています。GoogleのAPI1 はマイナス1からプラス1までのスコアと、感情の強さを示すマグニチュードを返します。Amazon Comprehend2 はテキストをポジティブ、ネガティブ、ニュートラル、混在のいずれかに分類し、MicrosoftのAzureサービス3 はアスペクト単位の意見マイニングまで加えます。だから「このアプリはいいけど、サポートは最悪だった」のような一文も、平均でぼやけさせず正しく分割できます。

その次の段階である感情検知(エモーション)は、怒り、喜び、恐れ、悲しみと、そのたくさんの親戚たちを扱います。これは難しくなります。数字を見ればわかる通りです。

対人関係のトーンは、大家さんにメッセージを送るときに気にする類のものです。これは温かく聞こえるか、単刀直入か、身構えているか、責めているように聞こえるか。研究者たちは2018年の時点ですでに4、仕事のメールにおけるいら立ち、フォーマルさ、丁寧さをモデル化していて、それなりにうまくいっていました。理由は、これらをひとつの感情ラベルではなく、別々の次元として扱ったからです。

その次に来るのが皮肉と言外の意味で、これは言葉そのものより文脈に左右されます。そしていちばん下にあるのが、書き手の心のなかにある感情状態です。マーケティングの多くが匂わせているのはこれで、研究がいちばん裏づけていないのもこれです。

だから、あるプロダクトのページが「トーンを検知します」と書いているのを見ると、しかもトーンチェッカーのほとんどは、トーンを読んでいないのが実情なので、私が最初に思うのは、この5つのうちどれを指しているのか、ということです。Subtextが担っているのは、この3番目のバケツ、対人関係のトーンです。メッセージが受け手にとって温かく聞こえるか、単刀直入か、身構えているか、責めているように聞こえるかを問うものです。感情のスコアではありませんし、誰かの内心についての主張でもありません。

ランディングページには絶対に載らない精度の数字

テキストの細かい感情分類における基準データセットは、GoogleのGoEmotions5です。Demszkyのチームが27種類の感情とニュートラルを人手でラベル付けしたRedditのコメント58,000件で、2020年のACLで発表されました。そのBERTベースラインは、全ラベルを通してマクロF1で0.46というスコアでした。その後の研究6は、より強力なモデルとデータの工夫でそれを0.49から0.51あたりまで押し上げています。何年も進歩を重ねて、それでも最良の専門モデルですら、細かいラベルの多くを取りこぼしています。

一般的なチャットボットに同じ28分類をやらせると、ベンチマークのスコアはファインチューニング済みの小型モデルより大きく下がります。理由の一部は、自由形式のモデルが分類体系にないラベルをつくってしまい、テストの閾値に合わせて調整もされていないからです。手厳しい話に聞こえますが、2025年のある研究7では、人間の審査員がデータセットの公式ラベルより、GPT-4のラベルを支持することが多々ありました。モデルがベンチマークと食い違うのは、ベンチマークのほうが分が悪い場合もある、ということです。

ポジティブかネガティブかという粗い分類なら、全体を通してスコアはずっと高くなります。崩れるのはまさに、いら立ちと怒りの違いや失望と不満の違いのように、興味深い区別が存在するところです。

トーンについては、人間同士も意見が割れる

このテーマ全体の見え方を変えたのは、人間のほうを確認したときでした。GoEmotionsの論文の付録は、自分たちの人間のラベル付け担当者同士の一致度を報告していて、ほとんどの感情でコーエンのカッパ係数はだいたい0.1から0.5のあいだに収まっています。感謝は0.75で簡単なほうです。悲嘆は0.09で、ほぼランダムにラベルを付けているのと変わりません。訓練を受けた人間同士が同じ文を読んでも、それが失望を表しているのか不満を表しているのか一致しないなら、その人たちのラベルに対してマクロF1で0.46というスコアを出すモデルは、まさにそうした箇所があいまいな正解表で採点されていることになります。カッパ係数とF1は別のものを測っているので、人間の数字がそのまま越えられない天井になるわけではありません。それでも、モデルの取りこぼしの一部は課題そのものに由来することがわかります。

コーエンのカッパ係数、GoEmotions自身の人間のラベル付け担当者 感謝: 0.75。悲嘆: 0.09、ほぼランダムにラベルを付けているのと同じ水準。

カッパ係数1.0は完全な一致、0はランダムを意味します。訓練を受けた人間同士でも、ある文が失望なのか不満なのか一致しないなら、モデルのマクロF1 0.46は、まさにそうした箇所があいまいな正解表に照らして採点されているのです。

話はもっと深いところまで続きます。そもそも、誰の感情を測っているのでしょうか。EmoBank8というデータセットは、同じ文に対して書き手視点と読み手視点の二重にアノテーションをつけました。この二つは別の変数だとわかったからです。同じ研究者たちは2017年に、書き手視点でアノテーションしたほうが全体の質が高くなることも見つけています。そして7つの語族にまたがる30以上の言語を対象にした大規模なSemEval 2025のタスク9は、意図して「知覚された感情」を狙っています。つまり、一般的な読み手がそのテキストに帰属させるであろう感情であって、書き手が内心で感じていたものではない、とはっきり定義したうえでです。

もっとも鋭いテストは2025年に行われました。あるACLの研究10は、書き手本人に自分の感情をラベル付けしてもらい、そのうえで見ず知らずの人間とLLMに推測させました。どちらも本人の申告には届かず、LLMはほぼ全面的に見ず知らずの人間を上回りました。この結果は両方の半分がそれぞれ大事です。いまのAIは、テキストだけからあなたを読み取る点で、見知らぬ他人よりも優れています。それでいて、あなたが実際に感じたことを確実に再構成することはできません。Subtextがつくられているのは、この発見のうち今も成り立っているほうの半分のためです。あなたのメッセージがどう受け取られそうかを読み取るのであって、それを書いていたときに何を感じていたかを読み取るのではありません。

実務上の帰結のひとつは、Heliyonに載った2023年の比較研究11に表れています。この研究で商用の感情検知API8製品を同じデータセットにかけたところ、互いに意見が食い違い、順位もデータセットごとに入れ替わりました。ラベルもデータも言語も明かさずに「感情検知の精度95パーセント」と謳うベンダーは、その主張の重みに見合わない数字を掲げていることになります。

モデルは感情のテストで満点を取り、それでも本人を見逃す

二つの研究結果は、それぞれが何を測っているかを切り分けるまでは、矛盾しているように見えます。

Communications Psychology12に載った2025年の研究では、ChatGPT-4、Gemini 1.5 Flash、Claude 3.5 Haiku、DeepSeek V3を含む6つのモデルが、人間の評価に使われる標準的な感情知能テスト5種類を受けました。モデルの平均正答率は81パーセントで、テストの検証研究における人間の平均56パーセントを上回っています。Nature Human Behaviour13では、GPT-4が誤信念や間接的な依頼の察知といった古典的な心の理論課題で人間と同等かそれ以上の成績を出しましたが、失言(フォーパス)の認識ではつまずいています。そしてJAMA Internal Medicine14では、免許を持つ評価者が実際の患者からの質問への回答を読み、医師よりチャットボットの回答を好んだ割合が78.6パーセントに達し、共感的だと評価される確率は9.8倍でした。ここで私が留意しておきたい点が一つあります。チャットボットの回答は平均211語、医師は平均52語で、医師が長く書いた場合はこの選好差が縮まっています。人間について言えば、感情知能は本当に職場で重要なのかは、また別の問題です。

一方で、パターン認識ではなく感情の推論を要求するようにつくられたベンチマークEmoBench15は、モデルと平均的な人間のあいだにいまもはっきりした差があることを示しています。

この二つの結果はどちらも成り立ちます。感情について知っていることと、誰かの感情を知ることは、別のスキルだからです。モデルは、嫉妬や悲嘆や職場の気まずい謝罪について、生きているどの人間よりもたくさん読んでいます。モデルに欠けているのは、この特定のメッセージを書いた、その一人についての文脈です。

4人が同じ言葉を打てます。「おめでとう。よかったね」。一人は本気でそう思っています。もう一人はあなたに恨みを抱いています。三人目は傷ついていて、それを気丈に隠しています。四人目は皮肉で言っています。画面の上ではどのバージョンもまったく同じなので、テキストモデルにこれらを区別することはできませんし、見ず知らずの人間にもできません。その情報は、言葉の外側にあります。

仕事の大半をこなしているのは文脈

「わかった」という返信を例にとります。

これだけを見れば、同意にも、失望にも、いら立ちにも、無関心にも、静かに閉じていくドアにも読めます。これを「締め切りをまた延ばしたね、もう3回目だよ」のあとに置くと、読み方は一気に絞られます。言葉そのものは何も変わっていません。変わったのは文脈です。

皮肉に関する研究は、決まって同じ結論に着地します。人間でさえ、テキストが皮肉かどうかをつかむには周囲の会話が必要になることが多いのです1617。だからこそ、新しい評価は単独の文ではなく、対話全体でモデルを試すようになっています。ここから、私がトーンを扱うツールのために導き出す実務的なルールが直接わかります。やりとり全体と、関係性と、そこにある利害を渡すこと。単独のメッセージだけを切り出して判定させるのは、モデルに丁寧に失敗してもらうようなものです。これは、Subtextが一行ではなくスレッド全体を読む理由でもあります。読み取りの大半を決めているのは、言葉そのものではなく文脈だからです。

トーンは文化的なもので、たいていのモデルはアメリカ英語で育っている

BESSTIE18という2025年のベンチマークは、オーストラリア英語、イギリス英語、インド英語をまたいで、モデルの感情極性と皮肉の検知をテストしました。インド英語での成績は一貫して悪く、なかでも皮肉がいちばん難しいケースで、モデルはひとつの変種から別の変種へとうまく一般化できませんでした。

この結果は、日常の経験とも一致します。「Kindly do the needful(よしなにお願いします)」は、インドのビジネス英語ではひとつの読み方をされますが、アメリカのオフィス規範で調整されたモデルには、また違って読まれます。ベルリンに13年住んだ身として、ドイツ語版も付け加えられます。ここでは、時間への敬意として扱われる率直さが、アメリカ的な丁寧さで育ったソフトウェアには冷たいと判定されることがあります。失礼、温かい、直接的すぎる、といったラベルは、客観という衣装をまとった文化的な判断です。誰が誰に、どの文化のなかで書いているかを無視するトーンツールは、自信満々に両方の側を読み違えます。

関連するバイアスは、感情極性の判定とは別の作業であるコンテンツモデレーションでも見られます。Sapたちは広く使われているヘイトスピーチのデータセットを調査し19、アフリカ系アメリカ人英語、いわゆるAfrican American Vernacular English(AAVE)と呼ばれることもある変種で書かれたツイートが、他の変種の同等のツイートよりも最大で2倍の頻度で、学習済みの分類器によって攻撃的だとラベル付けされていたことを見つけました。しかもラベル付け担当者は、誰が書いたのかを一度も目にしていません。この差は毒性を判定する分類器のなかにあり、感情極性を判定する分類器のなかにはないため、BESSTIEのようなベンチマークでは表面化しません。そのデータで学習されたモデレーションシステムは、ごくふつうのAAVEの言い回しを、別の言葉で言い換えた同じ内容のメッセージよりも高い頻度で攻撃的だと判定します。

顔を読むところで、感情AIは道を見失った

ここまではすべてテキストの話でした。この業界のなかで顔をスキャンする枝分かれは、もっと荒れた実績を残していて、それが規制当局によるこのカテゴリー全体の扱い方を形づくっています。

2019年、心理学者のLisa Feldman Barrettと共同研究者たちは、1,000件を超える研究をレビューし20、顔の動きから人がどう感じているかを確実に推し量ることはできない、と結論づけました。人は集中しているときに顔をしかめ、不安なときに笑い、結婚式で泣きます。同じ年、NBA選手400人の写真を2つの商用システムにかけた研究では、似たような表情でも黒人選手の顔のほうにより多くのネガティブな感情を読み込む21ことが、両方のシステムで見つかりました。

業界も気づきました。Microsoftは2022年、Face APIから感情推定機能を退役させました22。HireVueは2021年、デジタル権利団体EPICがFTCに苦情を申し立てた23あと、採用審査から表情分析を外しました。テキスト系のツールはまったく別の技術ですが、この懐疑の目は引き継いでいます。そして、言葉ではなく内心の状態を読み取ると主張するたびに、その懐疑を自ら招いています。

EUは一線を引いたが、テキストはその外側にある

2025年2月2日以降、EU AI法の第5条1項(f)24は、職場や学校で人の感情を推定するAIを禁じています。ドライバーの疲労検知のような医療・安全用途には、限定的な例外があります。この禁止事項に違反すると、全世界年間売上高の最大7パーセントの罰金が科されます。

この適用範囲は、こうしたツールをつくる人にも使う人にも重要です。欧州委員会のガイドラインは、この禁止を生体データに結びつけています25。顔、声、キー入力のリズム、姿勢です。書かれたテキストから感情を推定するシステムは、この禁止の対象外だと明記されています26。メールがどう受け取られそうかを分析するのは合法です。従業員にウェブカメラを向けて機嫌を採点するのは禁止です。この線引きは、科学的な実態にかなり忠実に沿っていて、Subtextにとっては、もともと選んでいたであろう設計上の制約そのものになっています。テキストのみ、生体データは使わない、職場監視もしない、という制約です。

いまのツールが得意なこと

Grammarlyのトーン検知機能27は、消費者向けの例としてもっともわかりやすく、その打ち出し方は市場のなかでもいちばん率直です。語彙の選び方、言い回し、句読点、大文字表記27を分析して、あなたのメッセージが読み手にどう聞こえそうかを、40種類を超えるトーンにわたって教えてくれます。「聞こえそう」。この言い回しが、しっかり科学的な仕事をしています。

Google、Amazon、Microsoft、IBM28のクラウドAPIは、サポートチケット、レビュー、アンケートの回答を大量に処理するためにつくられています。IBMは2023年に単体だったTone Analyzerを退役させ、感情分析をより大きな言語プロダクトの中に統合しました。これらは「顧客はうちの決済フローをどう感じているか」には向いていて、「この文章、受動攻撃的に聞こえないか」には向いていないツールです。

個人的なメッセージに関しては、汎用LLMがいちばん有能な選択肢です。文脈を使え、複数のトーンを同時に扱え、自分の読み取りを説明できるからです。ただし、キャリブレーションはいちばんできていないので、確信度のパーセンテージはどれも雰囲気の目安くらいに扱うべきです。音声のほうでは、Hume AI29が2024年に5,000万ドルのシリーズBを調達し、声の抑揚を測定する技術に投資しています。主な目的は、音声インターフェースがふさわしいペースとトーンで応答できるようにすることです。隠れた感情を検知すると主張するより狭い用途ですが、その分、擁護しやすい用途でもあります。

この研究がSubtextをどう形づくっているか

Subtextが分析するのは、上司から、デート相手から、あるいは母親からのテキストのように、人がいちばん気にかけているメッセージです。それがどう動くべきかは、この研究に委ねています。

出力は、知覚についての話でなければなりません。「これは冷たく受け取られるかもしれません」は、根拠が支持できる主張です。「彼女はあなたに怒っています」は支持できない主張で、ACLの本人申告研究がその領収書です。私たちはまた、メッセージが複数のトーンを同時に帯びることも許容しています。実際のメッセージがそうだからです。温かさと身構えの併存はふつうに起こる組み合わせで、新しいベンチマークが感情をマルチラベルとして扱っているのも、まさにこの理由からです。

判定より根拠です。役に立つツールは、印象をつくっている言葉そのものを指し示します。「前にも説明した通り」という一言が、張り詰めたメールの中でこっそり大きな仕事をしているように。そうすれば、その印象が自分の望むものかどうかを、自分で決められます。不確かさも見えたままにしておきます。あるメッセージが曖昧なとき、その曖昧さこそがいちばん正確な発見であることが多く、それを自信満々のラベルに丸め込むのは、偽物の精密さです。文脈が最優先です。宙に浮いた一文を採点するより、やりとり全体を読んで、相手が誰なのかを尋ねるほうを、私たちは選びます。同じ9語でも、上司相手と、まだ何者でもない相手とでは、意味がまったく変わってくるからです。

私の見立てでは、このカテゴリーはピッチデックが語るよりも小さく、懐疑派が認めるよりも役に立ちます。心を読むことは、いまも手の届かないところにあります。言葉遣いを読むことは、いま現実に可能で、書かれたコミュニケーションでの被害の大半は、そもそもそこから始まっています。それだけで、つくる理由としては十分だと感じました。

実務的には、下書きを貼り付けるか、スレッドをスクリーンショットしたら、Subtextがあなたのメッセージが何を信号として送り出そうとしているかを名指して、その印象をつくっている言葉を指し示し、それでもあなたらしく聞こえる書き方をいくつか出します。ブラウザでSubtextを試すブラウザでSubtextを試す


こうしたツールをつくっていて、私がベンチマークを読み違えていると思ったら、LinkedInで教えてください。

Samet DurgunはSubtextの共同創業者です。メッセージの感情的なトーンを捉えて、あなた自身の言葉で書き直すアプリをつくっています。ベルリン在住。


出典

本文中のリンクは、一次情報が存在するかぎり、そこへ直接向かっています。番号は登場順です。2件は、安定したURLを確認できなかったためリンクなしで引用しています。最後の2件は、本文中の主張の根拠ではなく、さらに読みたい人向けの参考文献です。

  1. Google Cloud。Natural Language API basics: sentiment score and magnitude。
  2. AWS。Amazon Comprehend: sentiment analysis。
  3. Microsoft。Azure Language: sentiment analysis and opinion mining。
  4. Chhaya et al.(2018)。Frustrated, Polite, or Formal: Quantifying Feelings and Tone in Email。PEOPLES Workshop, NAACL 2018。
  5. Demszky et al.(2020)。GoEmotions: A Dataset of Fine-Grained Emotions。ACL 2020。
  6. Wang et al.(2024)。Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning。arXiv。
  7. Rethinking Emotion Annotations in the Era of Large Language Models(2025)。
  8. Buechel and Hahn(2017)。EmoBank、書き手視点と読み手視点の両方からアノテーションを行ったコーパス、および「Readers vs. Writers vs. Texts」、Linguistic Annotation Workshop 2017。
  9. Muhammad et al.(2025)。SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection。SemEval 2025。
  10. Li et al.(2025)。Can Third Parties Read Our Emotions? ACL 2025。
  11. Abu-Salih et al.(2023)。Emotion detection of social data: APIs comparative study。Heliyon。
  12. Schlegel, Sommer, and Mortillaro(2025)。Large language models are proficient in solving and creating emotional intelligence tests。Communications Psychology。
  13. Strachan et al.(2024)。Testing theory of mind in large language models and humans。Nature Human Behaviour。
  14. Ayers et al.(2023)。Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum。JAMA Internal Medicine。
  15. Sabour et al.(2024)。EmoBench: Evaluating the Emotional Intelligence of Large Language Models。ACL 2024。
  16. Feng et al.(2024)。Affect Recognition in Conversations Using Large Language Models。SIGDIAL 2024。
  17. Hazarika et al.(2018)。CASCADE: Contextual Sarcasm Detection in Online Discussion Forums。COLING 2018。
  18. Srirag et al.(2025)。BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English。Findings of ACL 2025。
  19. Sap et al.(2019)。The Risk of Racial Bias in Hate Speech Detection。ACL 2019。
  20. Barrett et al.(2019)。Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements。Psychological Science in the Public Interest。
  21. Rhue(2019)。Racial Influence on Automated Perceptions of Emotions。SSRNのワーキングペーパー。
  22. Microsoft(2022)。Framework for building AI systems responsibly、Face APIにおける感情推定機能の退役を発表したもの。
  23. EPIC。In re HireVue, FTC complaint(2019)。
  24. EU AI法、Article 5: Prohibited AI Practices、2025年2月2日より適用。
  25. Lewis Silkin(2025)。Understanding the EU AI Act’s prohibited practices, on the Commission’s February 2025 guidelines。
  26. Future of Privacy Forum(2026)。Red Lines under the EU AI Act: the prohibition of emotion recognition in the workplace and education。
  27. Grammarly。トーン検知の製品ページ、およびトーン検知の仕組みについて。
  28. IBM。Watson Natural Language Understanding。
  29. Hume AI。
  30. Northeastern University(2021)。You can’t determine emotion from someone’s facial movements, and neither can AI。
  31. The Guardian(2024)。Are you 80% angry and 2% sad? Why “emotional AI” is fraught with problems。