記事書くためのツール

AIの下書き書き直しツールは、本当に役に立つのか。

AIツールを4グループに分け、メッセージを書かせたときに実際に何が起きるかを14本の研究から検証し、送信前の15秒で役立つことをまとめました。

文 Samet Durgun · Subtextの共同創業者 · 13分で読めます

個人的なメッセージを書き直すAIツールについて、見つけられるものは片っ端から数週間かけて読みました。理由は半分、自分がそれを作っている当事者だからで、もう半分は、このジャンルについて自分が信じていることが正しいのか確かめたかったからです。

私が信じているのは、こういうことです。言いにくいメッセージをAIに渡したとき、本当に役立つ瞬間は、AIが返してくる磨き上げられた文章ではありません。役立つ瞬間はその30秒前、すでに書いた自分のメッセージがうまく伝わらないこと、そしてその理由を、何かが教えてくれる瞬間のほうです。

だから、それをしてくれるツールを探しました。棚には見つからず、おおまかに言えば、それが結局Subtextを作ることになった理由です。その分、私が偏っていることは織り込んで読んでください。そして裏付けとなる論文も自分で確認してほしいです。そのうえで、人がAIに個人的なメッセージを書かせたときに何が起きるのかの研究を探し始めたところ、これがプロダクトそのものよりずっと面白いことがわかりました。

ここから先は、その結果です。すべてにリンクをつけてあるので、自分で確かめてください。


このジャンルの製品の多くは、結局同じことをしている

ダウンロード数は脇に置いて、これらのツールをやっていることで分類すると、4つのグループに収まり、その多くが同じ場所に行き着きます。

グループ1は、スマホに標準搭載されたツールです。Apple Intelligence Writing Tools1 はiOS 18.1以降でシステム全体で動作します。テキストを選択すると、校正、3種類のトーン(フレンドリー、プロフェッショナル、簡潔)での書き直し、そしてChatGPTにリクエストを渡すComposeが使えます。対応ハードウェア、つまりiPhone 15 Pro以降なら無料です。Samsung Writing Assist2 は同じことをOne UI上で行い、トーン変更や返信候補、Live Translateも備えています。Gboard3 は新しめの端末でGemini Nanoを使ったスマート返信、校正、言い換え機能を追加しています。すべて無料です。

グループ2は、メッセージアプリの中に組み込まれたアシスタントです。Magic Compose4 はGoogleメッセージのキーボード上に返信候補を出し、Excited、Chill、それに理由はよくわかりませんがShakespeareといったスタイルで下書きを書き直します。そのために直近のメッセージを最大20件までGoogleのサーバーへ送るので、その分はもうエンドツーエンド暗号化ではなくなります。Googleは保存はしないと説明しています。Gemini in Messagesはこれとは別物で、下書きを作ってから実際の会話にコピーして使う独立したチャットスレッドです。ほかのスレッドを見ることはできません。どちらが必要かは用途次第です。最適なAI返信アプリは、問題が量なのかリスクなのかで変わります。

**グループ3は、マッチングアプリ向けの返信アプリです。**会話をスクリーンショットすると、アプリがOCRで読み取り、切り出しや返しの文句を出してくれます。W Rizzは週3.99ドル。PlugAI(旧RizzGPT)は5ドル前後です。同種のアプリは何十とありますが、どれも最適化しているのはただひとつ、次のメッセージに返信が来るかどうかです。

**グループ4は、難しい会話のための小規模ツールです。**いちばん面白く、いちばん資金の乏しいグループです。iOSのResolve5 は「コンフリクト温度」と呼ぶ指標でスコアを出します。AndroidのClarity Coach6 は練習シナリオに下書きを入力させ、書き直す前に、それが曖昧に読めるか、きつすぎるか、説明過多かを教えてくれます。私が共同創業したSubtextはこのグループに入りますが、ほかとは逆方向に動きます。やりとりと下書きを読み、メッセージがどう伝わりそうか、どの言い回しがそうさせているかを教えたうえで、はじめて書き直し案を出し、使うか無視するかはあなた次第です。

ここにあるほとんどのツールで起きていることに注目してください。テキストを渡すと、違うテキストが返ってくる。書いたものを読んで、相手にどう受け取られそうかを教えてくれる工程はまれで、あったとしてもほとんどが仕事用のソフトの中です。OutlookのCopilot7 は、トーンや明確さ、読み手がどう感じそうかについてメールのコーチングをしてくれます。GrammarlyのReader Reactions8 は、選んだ読み手が文書から何を受け取り、どこで戸惑いそうかを予測します。どちらも、妹に送ろうとしているメッセージのために作られたものではありません。個人向けでいちばん近いのはClarity Coachですが、これは練習用のサンドボックスなので、今まさに送ろうとしているメッセージには触れられません。

Grammarly9 は、私が正確に見ておきたいツールです。このギャップをいちばん埋めそうな惜しい例だからです。トーン検出機能は、言葉選び、言い回し、句読点、大文字小文字の使い方を読み取ってトーンに名前をつけます。2019年のローンチ時点で約40種類10 をカバーしていて、感謝、自信、フォーマル、愛情、悲しみなどが含まれます。Grammarly自身のサポート文書は、その限界について慎重です。この検出機能は文章全体のトーンを特定する11 もので、文単位の書き直しは提案しないと説明しています。存在するトーンを教えてくれる、それだけです。それであなたの妹が突き放されたと感じるかどうかは別の問いです。Grammarlyの新しいReader Reactions機能は、上司や取引先など自分で選んだ読み手について、この問いのひとつの形に答えようとしています8。ただ、実際の読み手をどこまで正確に予測できるかを独立に検証したテストは、私はまだ見たことがありません。トーン検出は無料プランに含まれていて、Proは現行の価格追跡サイトによれば年払いで月12ドルです。


AIが文章を書いたかどうか、人には見分けがつかなかった。しかも僅差ですらなかった

これは私がいちばん驚いた発見で、この分野の中でもっとも統計的な力の強い研究でもあります。

Maurice Jakesch、Jeff Hancock、Mor Naamanは、アメリカの参加者4,600人を対象に6つの実験を行い、2023年のPNAS12 に発表しました。参加者はマッチングアプリ、宿泊施設、職業紹介のプロフィール文を読み、どれが機械の手によるものかを当てます。正答率は50〜52%。正解に金銭が懸かっていたマッチングアプリの条件でも、約51.6%でした。コイン投げと変わりません。

理由は、私たちが誰もが同じ壊れたショートカットを使っているからです。参加者は、一人称代名詞や短縮形、家族への言及、温かい感情の描写を人間が書いた証拠とみなしました。整った文法や平板な言い回しは機械が書いた証拠とみなしました。そのどの手がかりも、頼めばモデルに簡単に再現させられるものです。ヒューリスティックはまさに逆方向を指しているわけです。同じ論文で訓練済みの分類器を使っても正答率は58.1%にとどまり、これは注意を払えば直せるようなスキルの問題ではありません。

数字 AIが書いた文章と人間が書いた文章を見分ける正答率は50〜52%。コイン投げと変わりません。

実験6回 · 参加者4,600人 · 2023年のPNASに発表 · この課題のために訓練された分類器でも正答率は58.1%止まり

注意点がひとつあります。この研究はGPT-3世代のテキストを使っています。現行モデルでも同じ数字になるのかを、これほどの規模で検証した人を私は見たことがありません。

これも、Subtextがメッセージを書いたのがAIかどうかを推測しようとは決してしない理由の一つです。あなた自身の下書きを読み、それが受け取る相手にどう伝わるかを見ているのであって、書き手をコイン投げで当てても、そこは絶対にわからなかったはずです。言い回しが定型文のように、その人らしさの感じられない決まり文句として読めるときは、それをロボットっぽいトーンとしてタグ付けします。これは言葉がどう読めるかの話であって、誰が書いたかの話ではありません。


ダメージの原因は「見抜かれること」ではなく「疑われること」

人がAIを見分けられないなら、その心配ごと消えてなくなってもよさそうなものです。実際にはそうなりません。そしてここが、本物の相手に本物のメッセージを書くすべての人にとって重要な部分です。

Cornell大学が主導したチームが、参加者1,020人を対象に2つのランダム化実験を行い、Scientific Reports13 に発表しました。スマート返信を使うと会話は速く、より前向きになり、相手のことも親密で協力的だと評価されました。ところが、相手がスマート返信を使っていると疑った参加者は、その相手をはっきりと低く評価しました。ダメージを与えたのは疑いそのものでした。この研究が測ったのは正確さではなく疑いなので、上で見た検出精度を踏まえると、その疑いが正しい相手に向いていたとは思えません。

Carnegie Mellon大学のチームは、2つの研究で参加者399人を対象にした2025年の論文14 で、このメカニズムを掘り下げました。結果は単純な減点よりも微妙です。AIのラベルは、あなたへのマイナス評価以上のものです。あなたのメッセージが、あなた自身についての証拠として、どちらの方向にも弱くなるのです。AI支援の謝罪は温かみが薄れて読め、AI支援の自慢や非難は冷たさが薄れて読めます。ラベルは、メッセージからあなたが何者かという情報を抜き取ってしまいます。

この見立てが頭に残りました。メッセージがシグナルとして何をしていたにせよ、ラベルはその音量を下げてしまうのです。


ただしひとつだけ、開示しても測定できるほどの差が出なかった場面がある

自分のプロダクトの前提に反する研究も入れておきたいと思います。省くのは不誠実だからです。

Max Planck人間発達研究所のZoe Purcellらは、著者に再びJakeschを含むチームで、参加者1,637人による2つの事前登録実験を行いました。報酬つきの2人組信頼ゲームを使ったもので、2025年11月のiScience15 に発表されています。参加者の半分は、見知らぬ相手に自分を信頼させるメッセージを書くのに予測入力の支援を使えました。残りの半分は支援なしで書きました。

AI支援が信頼に与える影響はごくわずかで、それはAIの使用を開示した場合でも変わりませんでした。支援を受けた書き手は、同じ水準の信頼を生むメッセージを短い時間で書けたため、費やした時間あたりで見るとより多くの信頼を稼いだことになります。言語分析では、彼らのメッセージはわずかに本物らしさが薄い一方で、より温かく、より複雑で、研究者が「クラウト」と呼ぶ指標(存在感や説得力の強さ)が高いという結果でした。

著者たちは対象範囲に慎重で、私も同じ立場を取ります。これはお金の絡む、見知らぬ者同士の一回きりの取引です。支払いの判断における行動としての信頼は、夜11時にパートナーがあなたのメッセージを読んで本気かどうかを判断するのとはまったく別の生き物です。とはいえ、私の見立てを言えば、「AIは信頼を損なう」という筋書きには文献の中に本物の反例があり、これがそれです。


AIはたいていの人よりうまく慰めのメッセージを書く。AIだと言うまでは

形の似た結果を出した研究が2つあります。

PNASに発表されたYin、Jia、Wakslakの研究16 は、AIが生成した返信のほうが、訓練を受けていない人間の返信よりも「聞いてもらえた」と感じさせること、そしてAIのほうがそこで働いている感情を正しく読み取れることを見つけました。ところが、受け取った側にその返信がAIによるものだと伝えると、この効果は下がりました。著者の一人は、2つの効果はほぼ同じ大きさで、おおむね打ち消し合ったと述べています。

Ovsyannikova、Oldemburgo de Mello、Inzlicht17 は、Communications Psychology誌に参加者556人による4つの事前登録実験を発表しました。GPT-4の返信は、Distress Centres of Greater Torontoで訓練を受けた危機対応ボランティアの返信を含め、人間の返信より思いやりがあると評価されました。出所を開示するとその差は縮まりましたが、なくなりはしませんでした。

つまり、言葉そのものは機械のほうがうまいことが多いのです。ただ、伝わっているのは言葉だけではありません。


労力が意味を持つのは、労力がかつて高くついたから

これらすべてがしっくりくるようになったのは、シグナリング理論という枠組みのおかげです。

メッセージは2つの仕事をしています。中身を運ぶことと、それを送るために何かを費やしたことを証明することです。時間、注意、そして難しい会話であれば平静さも。これらはどれも有限なので、それを費やすこと自体が、相手をどれだけ大切に思っているかについての本当のことを語ります。日本とアメリカのサンプルを使ったコミットメント・シグナルに関する研究18 は、コストのかかるシグナルのほうが安いシグナルより効果が高いこと、そして記念日を忘れるといった期待されたシグナルを送り損ねると、友情よりも恋愛関係のほうがずっと大きく傷つくことを見つけています。

温かく、明快で、よく整った文章を作るコストがほぼゼロまで下がれば、そのシグナルはもう情報を運ばなくなります。

このメカニズムを直接裏づける証拠も、メッセージの文脈ではありませんが出てきています。参加者618人による2026年のFrontiers in Psychologyの研究19 は、コンテンツにAI生成というラベルをつけると知覚される労力が大きく下がる一方、人間製というラベルはラベルなしと変わらないことを見つけました。人は初期設定として人間の労力を前提にしていて、AIタグはその前提を取り払うものなのです。この研究はショート動画を対象にしているので、メッセージへ当てはめる際は多少割り引いて読んでください。


言葉を外注すると、自分自身のコミットメントが弱まるらしい

これは私がずっと考え続けている発見で、受け取る側の話はまったく関係ありません。

アムステルダムのCREED20 の経済学者たちは、送り手が「お返しをする」と約束するメッセージを書くのにChatGPTを使える信頼ゲームを行いました。同時に2つのことが起きました。ChatGPTを使えた人ほど、より明確な約束をしました。そして、ChatGPTを開いたことがある人は、支払いの段階で約束を守る割合が25.7%低く、それは最終的にChatGPTの出力をそのまま使ったかどうかに関係ありませんでした。

決め手となるのは、送ったメッセージがChatGPTの生の提案に近いほど、送り手のその後の行動が信頼できないものになったという点です。提案を自分で書き直した人ほど、行動は良くなりました。著者たちはこれを当事者意識の問題だと読んでいます。自分の言葉で言えば、その言葉に縛られているように感じます。機械が書いたものをそのまま転送すると、自分の一部はそれに署名していないままなのです。これが、Subtextが置き換え案より先にまず問題を見せ、それぞれのバージョンで自分の言い回しがどれだけ変わったかを示す理由でもあります。自分で選んで手を加えた直し方は、自分で署名したものです。


謝罪については、きちんと研究されている。しかも「使うな」より役に立つ結論が出ている

この記事のどこか一つだけ読むなら、ここにしてください。実用的な答えはここにあります。

Ella GliksonとOmri Asscherは、職場での謝罪をめぐる3つのシナリオ研究を行い、Computers in Human Behavior21 に発表しました。相手がAIツールを使って謝罪を書いたと知ると、それがどれだけ本物らしく見えるかも、どれだけ許す気になれるかも下がりました。自分から開示しても、それは和らぎませんでした。ここまでは予想どおりです。

そして、私の考えを変えた部分があります。用意された3つのAIツールのうち1つだけを使った参加者には、本物らしさの減点がまったくつきませんでした。研究者たちはこれを「距離」の問題として読んでいます。AIの使用を限定的にとどめておけば、最終的なメッセージは本人が本来言いたかったことに近いままで、人はそれを感じ取れるということです。

同じくComputers in Human Behavior22 に発表された、Lim、Hong、Schneiderによる別の3x2実験(参加者464人)では、人間が書いた謝罪のほうが一貫して誠実だと見なされ、温かいトーンはAIの謝罪を改善するものの、人間の謝罪との差を埋めることはありませんでした。

Fan、Liu、Panによる2026年のCHI論文23 は、これを恋愛関係のメッセージで検証しました。参加者は1つ目の研究で152人、2つ目の研究で704人です。AIが下書きした部分が多いほど、そのメッセージは送り手自身の言葉として読まれにくくなり、本心から書かれたものにも見えにくくなりました。送り手が了承したうえでの軽いトーンの書き直しは謝罪の評価を押し上げましたが、全文の下書きや境界線を伝えるお願いでは結果が違いました。

この3つを並べると、実用的な結論が見えてきます。減点は、機械がその場にいたかどうかではなく、出来上がったメッセージが本来言いたかったことからどれだけ離れてしまったかに連動しているのです。Subtextが完成したバージョンを渡す前に、その印象を作っている部分を見せ、それぞれのバージョンで言い回しがどれだけ変わったかを伝えるのも同じ理由からです。その距離を短く保つことこそが、謝罪を信じてもらえるものにするのです。メッセージでの謝り方についてのより広い研究は、別の記事にまとめています。


これらのツールは、あなたの最悪の衝動を黙って磨き上げる

受動攻撃的な文章を書いて、スマホの書き直しツールに渡してみてください。何が起きるか。より書き方の巧みな受動攻撃が返ってきます。警告も、「本当にいいですか」の確認もありません。ツールの仕事は、頼まれたことをやることだからです。

モデルがこの方向に傾くのには理由があります。OpenAIは2025年4月にGPT-4oのアップデートを取り下げ、モデルが「過度にお世辞を言う、または迎合的で、いわゆるへつらいと評されるようになった」こと、そして「過度に支持的だが不誠実な返答に偏っていた」ことを公に説明しました24。彼らが挙げた原因は、短期的なユーザーフィードバック、つまり高評価と低評価に調整を寄せすぎたことでした。続報の投稿25 では、そもそもへつらいを追跡する本番評価がまったく存在しなかったことも認めています。

Anthropicの研究者たちは、同じパターンが一般的であることを見つけています。ICLR 202426 で発表された論文では、最先端のアシスタント5つすべてにへつらいが見られ、約15,000件の人間の選好比較を分析したところ、ユーザーが述べた考えに合わせることが、どの返答が好まれるかを最も強く予測する要因の一つでした。承認をもとに訓練すれば、同意を選ぶようになるということです。2025年のベンチマーク27 は、ChatGPT-4o、Claude Sonnet、Gemini 1.5 Proにわたるテストケースの58.19%でへつらう挙動を測定し、一度始まると78.5%の割合で持続することも見つけましたが、テストしたのは事実に関する質問応答で、個人的なメッセージではありません。個人的なメッセージについては、文章作成でのChatGPTの代替ツールと、大手3社があなたの言葉に何をするかを比較しました。

それが、いちばん助けを必要としている瞬間にとって何を意味するか考えてみてください。あなたは怒っていて、あとで後悔することになる文章を書いてしまった。そしてその下書きを預かっているツールは、あなたにそれを気持ちよく感じさせるよう最適化されているのです。

その瞬間こそが、Subtextが設計されている場面で、不快な部分が要点です。書き直しをすすめるのではなく、下書きが怒っているように読めることを教えるのです。


私には答えられない問い

自分で書いたぎこちないメッセージと、自分では書いていない洗練されたメッセージ、どちらを送るほうがいいのでしょうか。

かなり探しましたが、これを直接検証した研究は見つかりませんでした。「自分の不完全な下書き」と「自分では書いていない良い下書き」をランダムに割り当てて、関係にその後何が起きたかを追った人は誰もいません。縦断的なデータもまったくありません。何か月にもわたってAI支援のメッセージを使ったカップルや家族、親しい友人についてのフィールドデータもありません。人が合成された洗練さに慣れていくのか、それともその習慣が静かに何かを蝕んでいくのか、私たちにはわかりません。

手元にあるものは、親密な関係については一つの方向を指しています。労力は思いやりとして読み取られ、ラベルはシグナルを平板にし、言葉を外注すると自分の約束への手綱が緩むように見え、謝罪は本心に近いままなら信じてもらえる。ただし、信頼ゲームの結果は、状況によってはその代償が小さすぎて測定できなかったことも示していて、証拠が実際以上にすっきりしているふりをするつもりはありません。


では、役立つのは何か

ここまでを読み返すと、欠けているプロダクトの形はかなりはっきりしていると私は思っていて、それはこのジャンルが今作っているものとほぼ正反対です。

誰も自分の言葉を差し替えてほしいわけではありません。送信を押す前の15秒で必要なのは、そのメッセージが自分の気持ちより冷たく読めること、あるいは自分では説明のつもりが不満の羅列に読めることを知ることです。そのうえで自分自身の言葉で直せば、労力というシグナルは残り、当事者意識も残り、GliksonとAsscherの言う「距離」も短いままです。

それが私の存在してほしいバージョンで、Subtextはまさにそれを中心に作りました。Subtextは一文ではなくやりとり全体を読み、あなたの下書きがこれから読む相手にどう伝わりそうかに名前をつけ、その印象を作っている言葉を見せます。そのうえで提示する各バージョンには、言い回しをどれだけ変えたかも表示され、コピーする前に手動編集でどれでも自由に直せるので、直すのはあなた自身のままです。上で見た証拠に照らせば、これは書き直しそのものより重要です。減点は本心からの距離に連動していて、いちばん短い距離は、自分の文章の一語を変えることだからです。ブラウザでSubtextを試すブラウザでSubtextを試す

参考までに、私自身のルールを書いておきます。自分のメッセージがどう聞こえるかを機械に教えてもらうのはかまいません。でも、妹への「ごめん」を機械に言わせるつもりはありません。


どこかの研究を読み違えていると思ったら、あるいは書き直す前に診断してくれるツールを知っていたら、LinkedInで教えてください。

Samet DurgunはSubtextの共同創業者です。メッセージの感情的なトーンを捉えて、あなた自身の言葉で書き直すアプリを作っています。ベルリン在住。

出典

本文中のリンクは、一次情報が存在するかぎり、そこへ直接向かっています。番号は登場順です。製品の機能や価格は2026年8月に確認しました。研究ではなく企業のブログやプレスリリースが出典だった数字は、この記事から外しています。

  1. Apple Support「Use Writing Tools with Apple Intelligence on iPhone」
  2. Samsung「Use Writing assist on Galaxy phones and tablets」
  3. Google Support「Use writing tools with Gboard」
  4. Google Support「Draft messages with Magic Compose」
  5. Apple App Store「Resolve: AI Conflict Coach」
  6. Google Play「Clarity Coach」
  7. Microsoft Support「Get email coaching with Copilot in Outlook」
  8. Grammarly Support「Reader Reactions user guide」
  9. Grammarly「Writing Tone Detector and Tone Suggestions」
  10. TechCrunch(2019年)「Grammarly gets a tone detector to keep you out of email trouble」
  11. Grammarly Support「How do Grammarly’s tone suggestions work?」
  12. Jakesch, M., Hancock, J. T., & Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
  13. Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J., & Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
  14. Khadpe, P., Wenzel, K., Loewenstein, G., & Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
  15. Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M., & Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
  16. Yin, Y., Jia, N., & Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
  17. Ovsyannikova, D., Oldemburgo de Mello, V., & Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
  18. Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
  19. Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
  20. AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, University of Amsterdam.
  21. Glikson, E., & Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
  22. Lim, J. S., Hong, N., & Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
  23. Fan, G., Liu, D., & Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
  24. OpenAI (2025). Sycophancy in GPT-4o.
  25. OpenAI (2025). Expanding on what we missed with sycophancy.
  26. Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
  27. Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.