
記事書くためのツール
文章を書くためのChatGPTの代替:三大モデルはあなたの言葉に何をしているのか
ChatGPT、Claude、Geminiはどれも、文章を正しくすることにかけては優秀です。では、それがあなたのものでなくなるのはどこからなのか。そして、なぜ人はその上に小さな道具をつくり続けるのか。
文 Samet Durgun · Subtextの共同創業者 · 12分で読めます
· 2026年9月26日更新
同じメッセージを11回打ち直す人を、隣で見ていたことがあります。それはなぜ、たった二行の返信に一時間もかかるのかという話でもあります。消す。もう一度打つ。声に出して読む。友だちに送って意見をもらう。そして最後に、ほとんど何も言っていない短縮版を送る。
たいていの人は、どこかの時点でそれをChatGPTに貼りつけます。
返ってくるものは、たいてい元より良くなっています。文法はきれいで、文は締まっていて、だらだらした部分は消えています。そして、たいてい本人のものではなくなっています。深夜1時に緊張しながら書いた文章が、火曜の午前10時に有能な他人が書いた文章に変わる。受け取った側は、その違いを言葉にできなくても感じ取ります。その隔たりを捉えるためにつくったのが、私が共同創業したアプリ、Subtextです。メッセージを送る前に、そのメッセージが何をしようとしているかを読み取ります。
だから、はっきりとした偏りがあります。そのつもりで先を読んでください。説得力より役に立つほうを選びたいので、この記事の大半は、三大アシスタントがうまくやっていることの話です。そのあとで、文章が個人的になったときに崩れる場所を見ていきます。どれもかなりよく記録された、具体的な崩れ方です。出典はすべてリンク済みなので、私の立場を根拠と照らし合わせて判断してください。
まず、得意なことから
メッセージを文法的に正しくしたい、短くしたい、わかりやすくしたい、翻訳したい。それだけなら三つとも優秀なので、そのまま使ってください。つながりすぎた文を切り、本題の前の前置きを削り、散らかった段落を三つのきれいな文にまとめ、言えばすぐに文体を切り替えます。ChatGPTのCanvas1は、まるごと生成し直された文章の壁ではなく、横に並べて直せる編集画面をくれます。GeminiのHelp me writeはGmailとDocsの中にそのまま入っているので、道具にたどり着くまでの手間がほとんどありません。ClaudeのProjectsは、文体ガイドと参照用の資料をセッションをまたいで保持してくれます。
角が立たず、間違ってもいないことが求められる仕事のメールなら、それで仕事は終わりです。ここで読むのをやめてもらってかまいません。
ここから先は、もう一方の種類のメッセージの話です。謝罪。ずっと引けずにいる線引き。母親への返信。昔つき合っていた人へのメッセージ。この種類はまったく別の振る舞いをしますし、モデルごとの違いが効いてくるのもここからです。
書き直しが壊しうる四つのもの
私は、表面的な質と改稿の忠実さを分けて考えると便利だと思っています。メッセージは、なめらかになりながら悪くなることがあります。なめらかにする過程で、実際に仕事をしていた部分が削られるからです。「まあ、そういう言い方もできますね」を「彼女は強く反対した」に変えるのは、たしかに明快ですが、真実からはずっと遠くなります。
私のチェックリストでは、改稿が手を触れてはいけないものは四つあります。これは私が書き直しを見直すときのやり方で、尺度として誰かが検証したものではありません。
| 動かしてはいけないもの | 何が含まれるか | モデルはどう壊すか |
|---|---|---|
| 事実 | 名前、日付、数字、実際に約束したこと | ないはずの細部を足す、「かもしれない」を「はい」に固める |
| 含み | 皮肉、丁寧さ、距離感、わざとの曖昧さ | 含ませていたことを、そのまま言い切る |
| あなたらしさ | 語彙、リズム、文の長さ、句読点の癖 | 流暢な「うちの文体」に置き換える |
| 構成 | 何を先に書き、何を奥にしまったか | ありがちな「わかりやすい順」に並べ替える |
この先に出てくる不満は、どれもこの四つのどれかが崩れた話です。私が気づくのは、文法チェックの道具が見ているのは一つ目だけで、AIの書き直しを評価するとき、たいていの人が気づくのも一つ目だけだということです。
ChatGPTは空気を読めるが、頼んでいない範囲まで直す
会話に関しては、三つのなかでChatGPTがいちばん感情の勘が働きます。二人が何気ない話をしながら痛いところを避けている場面を渡すと、たいていその痛いところを言わないまま置いておいてくれます。出てくる文章のリズムも自然ですし、書かれた文の下で動いている感情の力学を見抜くのも得意です。
問題はいつも同じで、編集者の椅子に座り続けてくれないことです。ChatGPTの編集の癖について語るユーザーは、たいてい、誰も触ってくれと頼んでいない場所まで書き直す、という同じ不満に行き着きます。
そこから来る影響のうち、メッセージにとって重要なのは二つです。一つ目は、具体性が抜け落ちること。その謝罪をあなたの謝罪にしていた一行、たとえば「40分も外で待たせちゃったよね」が、「待たせてしまってごめん」に潰れます。オンラインのフォーラムでは、小説を書く人たちが、もっと厳しい形で同じ癖を報告しています。長さを保ったまま推敲してほしいと頼んだのに、ずっと短くなった章が戻ってきた、という話です。
二つ目は、トーンの指示があいまいだと、調整してほしかったところで極端な振れ幅が返ってくることです。よくある報告は、やたら硬いトーンで返ってきて、もう少しくだけて、と一度頼むと、今度は一気にゆるゆるまで振り切る、というものです。
それに、自分の文章をたくさん食べさせれば声の問題が片づくかというと、そうとも限りません。参考として自分の文章を何千語も貼り付けた書き手たちも、出てきたものはやはりChatGPTっぽく聞こえると報告しています。
Claudeは頼んだとおりに書き、そのあとであなた自身を解説する
頼んだことだけをやって、それ以上はやらない。この点では三つのなかでClaudeがいちばん強いです。制約を守り、細部を勝手に作らず、心の内側の描写もうまく扱います。自分の下書きを乗っ取らないモデルがほしい人の口から、Claudeの名前が繰り返し出てくるのはそのためです。
ここには、比較の根拠と呼べるものにいちばん近いデータもあります。英語、ドイツ語、韓国語、中国語で語用論的な理解を測るベンチマークMultiPragEvalでは、含意とグライス的な解釈においてClaude 3 OpusがGPT-4を明確に上回りました。専門的な言い方をほどくと、相手が文字どおり言ったことではなく、何を言おうとしたのかを読み取るのが得意だった、ということです。2 私からは二つ注意を挙げておきます。このベンチマークが測っているのは解釈であって、編集ではありません。それに、テストされたモデルはもう何世代も前のものなので、これは現在の順位表ではなく、モデル系統の傾向を指していると考えてください。
Claudeの崩れ方は、ChatGPTのちょうど逆です。言外の意味をきちんと理解して、それを本文に書いてしまいます。小説を書く人たちはこれを説明過多のドリフトと呼びます。含ませていたものを、はっきり書かれたものに変換してしまう癖のことで、たとえば「二人のあいだの沈黙は、語られなかった歳月の重みを抱えていた」といった文章になります。メッセージの世界では、これはセラピー言葉として現れます。
実際の出力ではなく、説明のための例です
怒ってないよ、返信ないなって思っただけ
あなたが書いた文。わざと控えめにしてあって、そこが肝心なところです。
返信をもらえるまでに時間がかかったことで、私は少し傷ついた気持ちになっていました。そのことをあなたに共有したいと思っています。そしてそれは、私があなたとの友情を本当に大切に思っているからこそ生まれた感情なのだと思います。
言外にしていたものが、本文になりました。落ち着いていて、言葉も整っていて、あなたが言わないと決めていたことを、そのまま言っています。
Claudeにはもう二つ、あらかじめ織り込んでおいたほうがいい癖があります。制約をかけないと装飾が増えることで、ユーザーたちは、文章が洒落たものになる一方で、ときに大げさになりすぎると書いています。もう一つは褒め言葉が気前よく、批判をよく褒め言葉のサンドイッチで包んでくることです。二つ目は、自分のメッセージが悪く伝わっていないかを率直に判定してほしいときには、本当に困ります。
Geminiはもうあなたのいる場所にいるが、言わずに残すのが苦手
Geminiの強みは場所です。Gmailの中にいて、Docsの中にいて、多くのAndroid端末では標準のアシスタントで、無料枠も気前がいいです。文章を勝手に縮めるChatGPTの癖はありませんし、扱いにくい話題に対してお説教を始めることも少なめです。
文章の質についての評判は割れていて、そこははっきり書いておきたいところです。創作文の批評やニュアンスの扱いでは三つのなかでいちばん、と評価する経験豊富な書き手もいます。一方で、どうしても脱げない「うちの文体」があると感じる人もいて、そのおしゃべりな調子をRedditのコメントにたとえる人もいます。
個人的なメッセージにいちばん効いてくる癖は、Geminiに「語らずにおく」抑制がほとんどないことです。伏せられているものがあれば、それを表に出します。小説家たちは、隠しておくはずだった細部の上に、点滅するネオンサインを立てられるようなものだと表現します。メッセージで言えば、あなたが慎重に迂回していたことが、二文目で書かれてしまうということです。
三つに共通する問題
その一:あなたに同意してくる
これがいちばん重要で、いちばんよく記録されている問題です。
2025年4月、OpenAIはChatGPTを目に見えてお世辞っぽくするアップデートを出し、4日後に取り下げました。本人たちの説明3によれば、モデルは「過度に支持的だが誠実ではない応答に偏っていた」とのことで、原因は短期的なユーザーの承認を重く見すぎたことにあるとされています。その数日後に出た続きの投稿4では、自分たちの検証プロセスが何を見落としていたのかが、もう少し詳しく書かれています。
この仕組みはOpenAIに固有のものではありません。主要な五つのアシスタントを横断した研究では、人間の好みのデータで学習したモデルは「ユーザーの信念に合わせるために、しばしば真実性を犠牲にする」ことがわかっています。同意することが報酬になっているからです。5
ここで、人がこれらの道具に実際に何を尋ねているかを考えてみてください。メッセージを貼りつけて文法を見てほしいと頼む人は、ほとんどいません。みんなが聞くのは「これ、きつすぎないかな」か「私、考えすぎかな」の類です。この問いは「そのメッセージ、失礼に聞こえていないか?」で掘り下げた問いでもあります。その質問が向かう先は、あなたは大丈夫だと言う方向に構造的に傾いたシステムです。
汎用のアシスタントは、もっと上手な罪悪感の押しつけ方を手伝ってくれます。あなたが罪悪感を押しつけていることは、たいてい指摘してくれません。
ほしかったのはセカンドオピニオンで、返ってきたのは句読点の上手な連帯保証人でした。
このページで挙げたもののうち、これがSubtextが最も直接的に対峙して設計された失敗で、私が選んだ解決法は設計によるものです。後で戻ってきます。
その二:わざとやったことを、標準に均してくる
三つとも、文の断片、繰り返し、変わった句読点の打ち方、言い切らない言い回し、方言を直します。それがこちらの選択だった場合でも直します。「文体は保って」と頼んでも解決しません。どの癖があなたのもので、どれが単なるミスなのか、モデルには知りようがないからです。
これと関係していて、もっと見えにくいのが意味のインフレです。「行けないかもしれない」が「行けなくなりました」に変わり、「なんだか元気なさそうだったね」が「あなたは怒っていたよね」に変わります。一つひとつの修正は自信ありげに読めますが、正確さは落ちています。そして人間関係についてのメッセージでは、程度の正確さこそが内容のほとんどです。
その三:見ればわかる方言で書く
どのモデルにも言葉の癖があります。書き手たちはしばらく前からそれを目録にしていて、一度見えるようになると、もう見えないふりはできません。
| 癖 | 例 | 何を失うか |
|---|---|---|
| 抽象名詞 | 証、タペストリー、羅針盤、彩り | 具体的な細部を、壮大なものと取り替える |
| 二項の型 | 「XではなくYだ」「Aからではなく、Bから」 | 散らかったものに、きれいな結論を押しつける |
| 心情の言語化 | 「思わずにはいられなかった」「という思いから」 | 感情を見せるかわりに、名前をつけて済ませる |
| 三点セット | 二つで足りるところに、三つ並べる | 書かれたものではなく、構成されたものに読める |
| 均整の取れた対句 | 同じ重さの節を、延々と二つずつ | 誰のものでもないリズム |
語彙のリストの奥には、もっと大きな心配があります。AIを使った文章についての研究では、モデルが介入すると、異なる書き手が同じ支配的なパターンへ寄せられていくことがわかっています。つまり、これらの道具を使えば使うほど、みんなの文章は同じ方向に収束していきます。6 CHI 2025の研究では、インドとアメリカの118人が自分の生活について書きました。AIの提案をオンにすると、インドの参加者の文章は西洋的なスタイルへ流れていきました。7 まぎれもなくあなたから来たものであることが目的のすべて、というメッセージにとって、これは逆向きです。
その四:相手が気づくかもしれない。そして、それは高くつく
ここは、みんなが軽く見ているところです。AIを介したコミュニケーションと呼ばれる研究分野があって、その中心的な発見はなかなか居心地の悪いものです。人はAIが書いた文章を見分けるのが当てにならない8うえに、見分けようとするときには、当てにならない手がかりに頼ります。ところが、その文章がAI製だと思ったときには、書き手への信頼が下がります。9
つまり、ありきたりな書き直しのリスクは、平凡なメッセージができあがることにとどまらず、誠実さこそが中身のすべて、というまさにその瞬間に、不誠実に読まれるメッセージができあがることにまで及びます。相手のAI検知アンテナに引っかかる謝罪は、自分で書いていたはずの不器用な謝罪より、ずっと大きな傷を残します。
その五:相手が誰なのかを知らない
メモリーやプロジェクトが何かを引き継いでいない限り、セッションは毎回ほぼ空っぽから始まります。まともな下書きをもらうには、10年分の友情と、3月に何があったのかと、二人のあいだで「大丈夫」という言葉が何を意味するのかを説明しなければなりません。そんなことをする人はほとんどいないので、モデルは誰でもない受け手に向けて書きます。関係について何も知らないシステムが出す答えが、丁寧さです。出てくる文章がカスタマーサポートのように響くのは、そのためです。その空の状態から始まることこそが、Subtextが、あなたが貼りつけたりスクリーンショットで渡したりする会話を読み、下書きが誰かに強く出ているときにはそのメッセージが誰宛てなのかを尋ねる理由です。
それから、みんなが小声で言う部分もあります。喧嘩のスクリーンショットや、別れ話の下書きや、家族についてのメッセージを汎用のチャットボットに貼りつけるのは、コードのバグを見てもらうのとは感覚が違います。その直感は、被害妄想ではありません。
小説家たちがこれに対してやったこと
この隙間が本当に存在していて、売るものをつくるために私がでっち上げた話ではないと納得できた理由を、次に書きます。
小説を書く人たちは、まったく同じ崩れ方に、もっと高い賭け金と、もっと多い分量で、先にぶつかりました。彼らはモデルを使い続けましたが、素のままでは使いませんでした。その上に、道具の層がまるごと育っています。たとえばNovelcrafter10のような環境では、禁止したい決まり文句の辞書をつくっておくと、生成中に赤で印がつきますし、選んだ箇所だけに「語らず、見せる」のような処理をかけられます。Sudowrite11も似たことをしていて、要約を具体的な感覚の細部に変える専用の処理を持っています。
本気のユーザーはさらに進んで、複数モデルのパイプラインを組みます。一つ目のモデルで構成上の指摘と言外の意味の分析をして、二つ目で厳しい制約のもとの推敲をして、AI語彙を洗い落とすフィルタを一回かけて、最後に人間が自分の声を戻します。
一つの章を直すのに、道具が四つとチェックリストが一枚。これは実際に効きます。同時に、汎用モデルは助けなしではこの仕事をやらないこと、そして出てくる文章をいちばん気にしている人たちがもうそれを受け入れていることもわかります。
これをメッセージに当てはめてみてください。妹に返信する前に四段階のパイプラインを回す人はいません。洗練された層が必要だという点は同じで、かけられる手間はほぼゼロ。これが、製品としての本当の課題です。こうしたメッセージについて、AIのメッセージ書き直しツールが本当に役に立つのかは、別に調べてみました。
もっと丁寧な道具が、別のやり方でやるべきこと
三つあります。どれも「もっとうまく書く」ではありません。
書き直す前に、読み取る。 一語も触る前に、その下書きが何を発信しているかに名前をつけること。AIメッセージチェッカーがすべきやり方でもあります。書いた本人が意図していなかった部分も含めてです。これは追従の問題にも効きます。読み取りから入る道具は、あなたに同意する機会が来る前に、その読みを確定させるからです。ただ、それで読みが正しくなるわけではありません。Subtextも同じ種類のモデルで動いているので、友だちに問い返すように問い返してください。その読みを支えているのはどの言葉か。ほかにどう受け取られる可能性があるか。
距離を隠さず、見せる。 あなたが書いたものに近い案と、ゼロから書き起こした案が並んでいるほうが、磨き上げられた一つの置き換えより役に立ちます。何が変わったのかが見えますし、自分がその声で話す気があるかどうかを、自分で決められます。
メッセージとあわせて、関係も読み取る。 その人が自分にとって誰なのか、会話が示すこれまで試したこと、この友情のなかで「大丈夫」が何を意味するのか。
それが私のつくっているものなので、この段落はそのつもりで読んでください。Subtextは、何かを提案する前に、あなたが書いたものの感情に印をつけます。これはわざと少し鬱陶しくしてある設計です。いちばん役に立つ瞬間は、いちばん聞きたくない瞬間だからです。
実際の出力ではなく、説明のための例です
大丈夫、忙しいんだよね、わかってる。もう誘わないね。
あなたが送りそうな文。引き下がったように読めますし、「もう誘わないね」は謝罪の顔をした脅しです。
こんにちは。最近お忙しいのは本当によくわかります。今夜の件はまったく気にしないでください。ご都合のよいときを教えていただければ、あらためて調整しましょう。
ありきたりな書き直し。文法は正しく、感じもいいのですが、あなたが傷ついているという事実が消えています。元の文にあった情報は、それだけでした。
大丈夫。でもちょっとがっかりしてる。何でもないふりをするより、言っておきたかった。
同じ声のまま、傷つきは残して、脅しだけを落とし、あなたが言っていないことは何も足していません。
実際には、下書きを貼るか、スレッドのスクリーンショットを撮るかして両側を読ませて、あなたのメッセージが何を信号として出すつもりなのかに名前をつけてから、あなたらしく聞こえるバージョンを提示します。ブラウザでSubtextを試すスマホのカメラで読み取ると、インストールできます。ブラウザでSubtextを試す
それでも私がChatGPTを開く場面
長い文書。仕事のメール。あなたらしいと伝わることより、正しいことのほうが大事な場面すべて。調べもの、初稿、翻訳。そして、書き出せないときに白紙へ言葉を置いてくれる、あの特有のありがたさ。
それから、自分の主張に不利な事実も、伏せるより載せておきます。公開フォーラムに投稿された医療の質問を対象にした研究12は、こんな結果を示しています。
知見 評価者は比較の78.6%でチャットボットの回答を医師の回答より好み、共感的あるいは非常に共感的と評価した割合は、およそ10倍にのぼりました。
これらのモデルは温かく読める文章をつくれますし、その能力は本物です。
頼んでいないのに、あなたのメッセージが最後通牒のように読める、と教えてくれることはめったにありません。彼らは最後通牒の流れを良くしてくれて、あなたの感情的な正直さを褒めてくれます。その差は小さく、そして仕事のほとんどはそこにあります。私はSubtextを、その差を埋めるために作りました。一言も書き換える前に、あなたのメッセージがどう読めるかに名前をつけます。
モデルのバージョンについて。 ここまでの話はすべて、それぞれのモデル系統で何世代にもわたって続いてきた振る舞いです。だから、特定のバージョン名はほとんど出していません。これらのシステムは数か月ごとに変わりますし、議論を一つのリリース番号に固定した記事は、冬までには間違いになります。
お気に入りのモデルに対して不当だと思われたでしょうか。LinkedInで教えてください。
Samet DurgunはSubtextの共同創業者です。Subtextは、メッセージの感情的なトーンを読み取り、あなたの言葉のまま書き直すアプリです。ベルリン在住。
出典
本文中のリンクは、一次資料が存在する場合はすべてそこへ向かっています。
- OpenAI, “Introducing Canvas,” 2024年10月3日。
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024年。英語、ドイツ語、韓国語、中国語をグライスのカテゴリー横断でテスト。Geminiは当時のAPIアクセスの事情により対象外。
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 2025年4月29日。
- OpenAI, “Expanding on what we missed with sycophancy,” 2025年5月2日。
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, 2023年10月。
- AIを使った文章における文体の均質化についての研究。Padmakumar and He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024、および Doshi and Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024を含む。
- Agarwal, Naaman and Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
- Jakesch, Hancock and Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023年。
- Jakesch, French, Ma, Hancock and Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019。あわせて Hancock, Naaman and Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020も参照。
- Novelcrafter、Codexおよびテキスト置換プロンプトの機能。
- Sudowrite、“Show, Don’t Tell” とDescribeの機能。
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 2023年4月28日。585件の評価。チャットボットの回答は78.6%で好まれ、共感的あるいは非常に共感的と評価された割合は医師の回答の9.8倍。