記事書くためのツール

AIはあなたのメッセージのスクリーンショットを読み取れる。でも、いつも正しく読めているとは限らない。

スクリーンショットの中の小さな文字、ダークモードの文字、非ラテン文字を読み取るときに公表されている誤り率、3つのスクリーンショット対応アプリがアップロードした画像について明記していること、そしてメタデータを消すことに測定できるような効果があるのかどうかをまとめました。

文 Samet Durgun · Subtextの共同創業者 · 15分で読めます

チャットのスクリーンショットをAIツールに貼り付ければ、たいていはそのまま動きます。誰が何を言ったかを教えてくれ、冗談を理解し、筋の通った返信の下書きを作ってくれます。この「たいてい」の部分に数字をつけている人は誰もいません。そしてこれは、このサイトの別の場所ですでに扱っている問いとは分けて考える価値があります。モデルが言葉を手にしたあとで、誰が何ターンにもわたって話しているかを整理したり、答えられていない質問を追ったり、皮肉を読み取ったりすることは、受け取ったメッセージを読むや返信の前にスレッド全体を読むことについての研究のテーマです。この記事が扱うのはその手前の段階、つまりモデルがそもそも画像を正しく読めているのかどうかです。

私はSubtextを共同開発しています。チャットのスクリーンショットを入力の一つとして受け取る、トーン確認と返信下書きのアプリです。だから、ここで都合のいい答えが出てほしいという動機は私にもあります。ただ、そういう答えは持ち合わせていません。以下にまとめたのは、もっと狭くて、あまり心地よくない問いについて私が検証できたことです。いまの画像を扱えるモデルは、スマホのスクリーンショットを、文字起こし済みのテキストとしてではなく画像として、どれだけ正確に読めるのか。そして、スクリーンショットをこうしたアプリのどれかに渡すと、その画像に何が起きるのか。以下の出典はすべて、私自身が実際に開いて確認したものです。

スクリーンショットを読むとは、まず画像を読むことであり、言語を読むことはそのあとに来る

チャットのスクリーンショットは光の像であって、コンピューターがすでに解析できる文字の塊ではありません。モデルがメッセージの内容について考える前に、そのメッセージアプリがたまたま使っていたフォント、サイズ、コントラスト、レイアウトがどんなものであれ、ピクセルを正しく文字に変換しなければなりません。この工程が光学文字認識、いわゆるOCRで、ほかのどんな画像を読むのとも同じ画像認識のしくみに乗っています。AIとメッセージングについての精度の主張の大半は、この工程のあとに起きる推論のほうを扱っています。この工程そのものを扱っているものはほとんどありません。

実際に存在する数字

もっとも直接的なテストは、2023年に行われた、複数のベンチマークにまたがるGPT-4VのOCR能力の評価です1。英語のシーンテキストでは、CUTE80ベンチマークで単語正解率88.0%、より難しい3つの英語セットでは62.0%から66.0%でした。同じ4つのベンチマークで、専門のOCRシステムは68.2%から98.6%でした。中国語のシーンテキスト、ReCTSベンチマークでは、GPT-4Vのスコアはゼロでした。同じ論文の中の別の多言語テストでは、テキスト検出のF1スコアが英語で82.49%、フランス語で83.42%に達した一方、アラビア語では16.55%、中国語では1.36%にとどまりました。論文自身も「多様なOCRタスクを扱ううえでの汎用性はあるものの、GPT-4Vは既存の最先端OCRモデルを上回ってはいない」、そして「非ラテン言語を扱う際には限界が見られた」とはっきり述べています1。

これは一世代分のモデルを、選定済みのシーンテキストのデータセットでテストしたものであり、メッセージのスクリーンショットではありません。だから、これは一般的な問題の下限として読むべきであって、いま使えるどれかのアプリについての判定として読むべきではありません。それでも、AIは画像の中の非ラテン文字を、ラテン文字と同じくらいうまく読めるという単純な主張に対して、もっとも直接的で確かめられる数字であることに変わりはありません。この根拠から言えば、そうはなっていません。

解像度も関係します。同じ論文は「入力画像の解像度と認識性能のあいだに正の相関がある」ことを見つけていて1、これは圧縮されたり大きく縮小されたりしたスクリーンショットには不利にはたらきます。そしてそれは、モデルが一語でも読む前に、画像が再保存や再共有をくり返されるたびに多くのスマホがつくり出しているものそのものです。2025年のあるプレプリントは、これをもっと絞り込んでテストしていますが、対象はチャットのスクリーンショットではなく、サイズを揃えて表示した単独の日本語の漢字だけです。マルチモーダルモデルは、専用のOCR手法とおよそ300ppiで並ぶ性能を示しましたが、「150ppiを下回ると性能は大きく落ちる」とされています2。この閾値が、圧縮されたスマホのスクリーンショットの中の小さな文字にも当てはまるかどうかは、検証されていません。文字が小さく解像度が低いほど、専用に作られたOCRよりもこうしたモデルのほうが速く性能を落とすという方向性については、二本の別々の論文の意見が一致しています。

ダークモードそのもの、そしてもっと広くコントラストの低い文字については、同じスクリーンショットのライトモード版と比べてマルチモーダルモデルの精度を測った公表済みの評価を見つけられませんでした。従来型のOCRのパイプラインは、処理の前にダークな画像を反転させるのがふつうです。コントラストの反転は、その古い技術では誤読を引き起こす要因として知られているからで、これは根底にある懸念がそれなりに筋の通ったものであることを示唆しています。いま人々がチャットのスクリーンショットを読ませるのに使っているマルチモーダルモデルについて、同等のテストを行った例は、少なくとも私が見つけられた範囲では誰もやっていません。だから、裏づけられない数字を挙げることはしません。

絵文字も同じ画像の中にありますが、それについての研究は、人がふだん立てる問いとは別の問いに答えています。問題は、ある形をモデルが絵文字だと見分けられるかどうかよりも、それがどの絵文字なのかを見分けられるかどうかのほうです。同じ文字が、どこでも同じ絵柄を描くわけではないからです。Unicodeコンソーシアムが標準化しているのはコードポイントとその意味であって、絵柄そのものではありません。Apple、Google、Samsung、そのほかすべてのベンダーが、それぞれ独自のグリフを描いています3。絵文字入りのツイートを投稿した直後のTwitterユーザー710人を対象にした調査では、少なくとも25%が、自分の絵文字が別の人のスマホでは違って見えることを知らず、自分のツイートの一つが実際に別のプラットフォームでどう表示されるかを見せられたあと、20%が編集していたか、そもそも送っていなかったと答えました3。この差は、同じ文字を二台の違うスマホで見ている二人のあいだにすでに存在しています。スクリーンショットは、その差をさらに狭めます。送り手側のプラットフォームが描いたものが静止画に固定されてしまい、そのプラットフォーム独自のフォントがすでにピクセルに焼き込まれていないかぎり、その画像を読むモデルは、もとがどの絵文字だったのかを復元できません。この組み合わせ、プラットフォームをまたぐあいまいさとスクリーンショットの圧縮とが合わさることで、モデルが絵文字の背後にある感情を取り違える頻度が変わるのかどうかは、まだ誰もテストしていないようです。

このサイトのワークフローのページではカバーしていない失敗のパターン

チャットの特定の機能がいくつか、上で見たピクセルレベルの問題とは別に、それぞれのやり方で正しい読み取りを難しくしています。以下の内容の一部は研究に基づいていますが、一部はインターフェースがどう動くかの単なる説明であり、専用の研究の裏づけはありません。片方がもう片方の重みを借りてしまわないよう、両者は分けて書いています。

グループチャットと、複数人が参加するスレッド。 一対一のスクリーンショットなら、モデルは発言を二つの視覚的なグループ、片方ともう片方に仕分けるだけで済みます。グループのスレッドは、そのパターンを崩します。3人以上が同じ吹き出しの色を共有することがあり、送り手の名前は連続する発言のうち最初の一件の上にだけ表示され、そのあとの行には出ないことがあり、切り取られたアイコンだけが誰の発言かを示す唯一の手がかりになることもあります。グループチャットのスクリーンショットの中で発言を正しく割り当てられるかどうかについて、モデルの精度を直接テストした研究は見つかりませんでした。もっとも近い研究は、関連はしているものの別の問題、つまり文字起こしされた会議記録の中での発言者特定を測っていて、スクリーンショットの吹き出しではありません。その領域は会話のスレッド全体を読むことについてのページですでに扱っています。ここに書いたのは、同じ問題のスクリーンショット版についての機械的な説明であり、検証済みの知見ではありません。1行あたりの視覚的な手がかりが少ないまま話し手の数が増えるほど、見た目だけでも発言の割り当ては難しくなるはずで、それがどれだけ難しくなるかを測った人がいるかどうかにかかわらず、そう言えます。

タップリアクションと絵文字リアクション。 誰かほかの人の吹き出しの隅につけられた小さな絵文字、ハート、笑い、親指を立てたマークには、二つの別々のリスクがあります。一つ目は、モデルがその小さく、時には重なり合った絵柄をそもそも正しく識別できるかどうかで、これを直接テストしたものは見つかりませんでした。二つ目は、正しく読み取れたとして、そのリアクションが何を意味するのかで、こちらは研究されています。650,000件を超える、リアクションのついたTelegramのメッセージを分析した研究は、もとのメッセージがニュートラルに読めるものでもネガティブに読めるものでも、ポジティブなリアクションが反応の大半を占めることを見つけ、絵文字リアクションは「感情のミラーリングやコンテンツへの共鳴を示す指標として確実に機能しているわけではない」と結論づけています4。これは一つのプラットフォーム、一つの話題領域、暗号資産関連のチャンネルからの大きなサンプルで、まだプレプリントの段階なので、細かい数字は暫定的なものとして扱ってください。ただ、スクリーンショットを読むという点にとって大事な要点は、こうした留保があっても変わりません。リアクションの絵文字を正しく言い当てられたとしても、それがモデルであれ人であれ、そのリアクションが実際に何を示しているのかは誰にもわからないということです。

引用返信とスレッド表示。 たいていのメッセージアプリでは、以前の特定のメッセージに返信でき、引用された部分は新しいメッセージの上に、小さく、色を薄くしたブロックとして表示されます。スクリーンショットの中では、この見た目の処理、サイズを縮める、色を薄くする、時には縦線を入れる、が、ある行が引用された文脈であって、見た目上そのターンに見える誰かからの新しいメッセージではない、と示す唯一の手がかりです。画像の切り取り方が数ピクセル違うだけで、この区別は消えてしまうことがあります。モデルが引用された断片を新しいメッセージと取り違える、あるいはその逆をどれくらいの頻度でやってしまうかを測った研究は見つかりませんでした。これは、インターフェースがスレッドをどう表現しているかに組み込まれた、もっともらしい機械的な失敗のパターンであって、検証済みのものではありません。

消えるメッセージと一時的なメッセージ。 一時的なメッセージは、一度見られたら記録を残さないよう設計されていますが、スクリーンショットはまさにそれを打ち消します。AIについての問いが出てくるよりも前に、フォレンジックの研究者たちは、この前提自体がユーザーの想定よりも危ういことをすでに示していました。WhatsApp、Snapchat、Telegramの消えるメッセージ機能を直接テストしたある研究は、試した複数のシナリオで、削除されたはずの内容を端末のデータやクラウドのバックアップから復元しています5。これはプラットフォームについての発見であって、AIがそのスクリーンショットを読むこととは関係がなく、モデルの精度については何も測っていません。この研究がAIとは関係なく示しているのは、一時的なコンテンツが意図された削除より長く残ってしまう経路は、スクリーンショットだけではないということです。アプリ自身の画面上のぼかしや「スクリーンショットが撮影されました」というバナーが、モデルがコンテンツと取り違えかねない見た目上のノイズを生むかどうかも、これまた専用の研究の裏づけのない、もっともらしい懸念にとどまります。

スタンプ。 スタンプは、言葉よりもポーズや表情によって意味を運んでいて、それが機械にとって読み取りを難しくしていますが、実は人間にとっても同じです。実際のプロジェクトのチャットでスタンプを使っていた学生の議論グループ5つを対象にした研究は、参加者のうち7人へのスタンプの使い方についてのインタビューもふまえたうえで、調べたスタンプの34.7%で、送り手の意図と受け手の理解が食い違っていたことを見つけました。主な原因は、絵柄そのものにある表情や体の動きのあいまいさです6。これは、アジアの一つの大学の学生という、一つの集団を対象にした小規模な質的研究であり、測っているのは人間側の読み違えであって、モデルの読み違えではありません。それでも、すでに知り合っている人同士のあいだでさえスタンプがあいまいな信号であることを示す実際の根拠であり、画像だけからどれだけうまく読み取れるかについて、人間であれ機械であれ、期待できる上限を低く設定するものです。

会話の途中での言語の切り替え。 一つのメッセージの中で、あるいは同じスレッドの中のメッセージ同士で言語を切り替えることは、バイリンガルやマルチリンガルのテキストのやり取りではよくあることで、言語モデル全般にとって難しいケースとして文献にも記録されています。2025年のある分野横断的なサーベイ論文は「多くのLLMはいまも混在言語の入力に苦戦している」とはっきり述べていますが7、一つの吹き出しの中に二つの言語が入ったスクリーンショットにそのまま当てはめられる数字はありません。このサーベイが述べているより広いマルチリンガルテキストの問題とは別に、コードスイッチングをスクリーンショット読み取りの問題として切り出してテストした研究は見つかりませんでした。これは、土台となる技術における現実の、文献に記録された難しさであり、それをまだ誰も直接テストしていないケースにここで当てはめている、と受け取ってください。

3つのスクリーンショット対応アプリが、あなたのアップロードについて明記していること

チャットのスクリーンショットを読むように作られているアプリは、Subtextだけではありません。役に立つ比較になるのは、マーケティングがほのめかしていることではなく、それぞれの現行のドキュメントが、アップロードされた画像に何が起きると明記しているかです。AIライティングツールの広い分野は別のページにまとめてあります。ここでは、そこに名前を挙げた3つのプロダクトを、それぞれ自身のプライバシーページと突き合わせて、一つの狭い問い、保持、削除、モデルの学習への利用について確認しました。

Keys AI Texting Coachは、Charmed Inc.が、デート相手やメッセージ全般へのアドバイスのためにスクリーンショットを読む用途でつくったアプリですが、いまはもう稼働していないようです。AppleのiTunes lookupサービスは、そのApp Store掲載(app id 1510154956)について、2026年9月27日時点で結果を0件返していますし8、判明しているウェブドメインは、かつてプライバシーポリシーがあったパスを含め、すべてのパスをドメインパーキングのページにリダイレクトしています。このアプリの現行のプライバシーポリシーは、どの経路からも見つけられませんでした。かつてスクリーンショットの扱いについて何と書いていたにせよ、今日それを確かめることはできませんし、もう読み込めなくなったページから主張を組み立て直すこともしません。

Meiは、Androidの標準メッセージアプリで、AIアシスタントをオプションとして備えています。最終更新2023年10月3日、2026年9月27日に確認した現行の利用規約は9、「画像、写真、音声、動画」を含むメッセージの内容が「通信という唯一の目的のために」サーバーに保存され、「それ以外の用途には使わない」と述べています。別の箇所では、オプションのAIアシスタントが実際に受け取るものについて、同じ文書が、文脈としてAIに送られる直近20件のメッセージには「絵文字、リアクション、URL」が含まれるものの、「添付ファイル、音声メッセージ、画像を伴うメッセージはその対象として収集しない」としています。合わせて読むと、Meiの自社ドキュメントは、AIによる提案機能はスクリーンショットを含め画像の内容をまったく処理していないと述べていることになります。写真についての保存条項は、AIに送られるものではなく、アプリ内での通常のメッセージ配信に関するものです。オプトインの別のAIアシスタント機能は、これとは違う動きをします。ユーザーがそれをオンにすると、Meiは端末のSMSとMMSのメッセージデータベース全体を、各メッセージの本文に加えて、ハッシュ化された電話番号や連絡先の名前とともにアップロードし、そのポリシーはそのデータが「AIモデルの学習に使われる」と述べています。この条項はスクリーンショットや画像を名指ししてはいませんが、連絡先のメタデータだけでなく、メッセージ本文全般の学習について述べたものです。

ConfiTextのプライバシーポリシーは、発効2026年2月10日、2026年9月27日に確認したもので10、「アプリ内に入力したテキスト」だけを対象にしていて、9つの節のどこにも写真や画像、スクリーンショットへの言及がありません。自社のマーケティングサイトが説明している入力方法はただ一つ、ユーザーがすでに書いたメッセージを貼り付けることだけで、スクリーンショットや写真のアップロード機能はページのどこにも出てきません。現状では、保持についての問いはConfiTextには当てはまらないようです。このプロダクトは、自社の現行サイトによれば、そもそもスクリーンショットを入力として受け付けていません。

この3つをあわせると、内訳はこうなります。もう存在していないらしいアプリが一つ、自社のドキュメントによればAIが実際に読むものから画像を除外しているものの、アシスタントをオンにすると本文の学習は行う、というアプリが一つ、そしてそもそもスクリーンショットを受け付けないアプリが一つです。これは、スクリーンショットを読むアプリが保持をどう扱うべきかを決めるものではありません。ただ、名指しした3つの競合のスクリーンショットについてのポリシーを比べると、最初の前提が想定していたよりも一致点は少なく、当てはめられる範囲も狭かったということです。

メタデータを消すのは常識なのか、それとも実証されていることなのか

スマホのカメラが撮る写真はどれも、EXIFデータ、つまり端末のモデル名、タイムスタンプ、時には位置情報を、ファイルに埋め込んで持つことがあります。写真を共有する前にこのデータを消せというアドバイスは、ネット上のいたるところにあります。そのデータを消すこと、あるいはスクリーンショットに写っている内容を手作業で黒塗りすることが、単に紙の上での理論上の露出を防ぐだけでなく、現実のプライバシー被害の測定可能な減少につながるかどうかを調べた統制実験を探しましたが、見つかりませんでした。存在するのは、どんな項目があり、それをどう消すかを説明する記述的なセキュリティ系の文章であり、メタデータを消した人と消さなかった人の結果を比べた実験ではありません。このアドバイスは、理にかなってはいるが検証はされていないものとして受け取ってください。効果が測定された保護策としてではありません。

Subtext自身がスクリーンショットのメタデータに何をしているかについては、バックエンドのシステムプロンプトとツール定義そのものを読みました。これは、このサイト自身のルールが、プロダクトについてのどんな主張をする前にも確認を求めているのと同じファイルです(functions/src/subtext_prompts.ts)。そのコードの中には、スクリーンショットのファイルのメタデータを読んだり、消したり、調べたり、何らかの形で触れたりする処理は一つもありません。画像は、ほかのどんな画像とも同じように、視覚的な入力として、土台となる画像を扱えるモデルにそのまま渡されていて、私が読んだプロンプトやツール定義のどこにも、メタデータを別処理する工程は出てきません。これは機能があると述べているのではなく、機能がないことを述べています。Subtextがスクリーンショットのメタデータに何かをしているという証拠はどちらの方向でも見つからず、コードが示していない機能をあると主張するつもりもありません。Subtext自身がスクリーンショットをどれだけ正確に読めるかについての独立した評価も存在せず、これは上に挙げたどのアプリにも共通する空白です。プライバシーポリシーが確認していること、そしてこのサイトの二つのワークフローのページがすでに述べていることは、スクリーンショットを含むあらゆる添付ファイルに当てはまる一般的なルールです。会話とそれに添付されたものは、最後に使ってから5日後、ピン留めした場合は90日後に自動で削除され、アップロードされたものがAIモデルの学習に使われることはありません。

ここまでをまとめると

四つの要素を並べると、この景色がでこぼこなのは、たまたまではなく、もとからそういう設計だということがわかります。実際に確かめられる精度の数字がある唯一の部分、つまり画像を扱えるモデルの中の一般的なOCR性能は、一様ではありません。英語では強く、非ラテン文字と低解像度の文字では測定できるほど弱く、しかもテストされているのは実際のチャットのスクリーンショットではなく選定済みのベンチマークです。上で挙げた6つの追加の失敗パターンのうち4つは、隣接した問いについての実際の研究を引いています。正しく読み取れたあとにリアクションが実際に何を示すか、消えるはずのアプリがそもそもどれだけ確実にコンテンツを消せているか、人はどれくらいの頻度でお互いのスタンプを読み違えるか、そして言語モデルは混在言語のテキストをどれくらいまずく扱うか、です。この4つの研究はいずれも、モデルがスクリーンショットからそれを読み取るという、まさにそのケースをテストしたわけではありません。残りの2つ、グループチャットでの発言の割り当てと引用返信の取り違えには、隣接するものも含めて研究による裏づけが一切なく、インターフェースがどう動くかについての機械的な説明があるだけです。競合アプリの確認では、最初の前提が想定していたよりも比べられるものが少ないという結果になりました。一つは消えていて、一つは自社の説明によれば自社のAI機能から画像を除外しており、一つはそもそもスクリーンショットを受け付けていません。そしてメタデータについての問いは、誰もが繰り返す助言でありながら、誰も測っていないらしいものだとわかりました。

だからといって、モデルがあなたのスクリーンショットを読むことが、ふだんの使用において信頼できないということにはなりません。ここでいちばん大規模で直接的な研究でも、モデルは英語のシーンテキストの大半を正しく読めていました。これが意味しているのは、画像を扱えるモデルはチャットのスクリーンショットを、ふつうに打たれたテキストと同じくらい確実に読める、という具体的な主張のほうに、実際の、数字で示せる例外があり、その一部は小さくなく、しかも誰もまったく測っていない難しいケースがいくつもある、ということです。

ここまでが、いまの時点でわかっていることです。Subtextも、これをやっているアプリの一つにすぎず、上に挙げたほかのアプリより検証が進んでいるわけでも、遅れているわけでもありません。ブラウザでSubtextを試すブラウザでSubtextを試す

2026年9月27日に確認。

出典

  1. Shi, Peng, Liao, Lin, Chen, Liu, Zhang and Jin(2023)。Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation。arXiv。シーンテキストおよび文書OCRのベンチマークによる評価で、対象は2023年時点の一世代分のモデルであり、メッセージのスクリーンショットではない。
  2. Inoue(2025)。Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity。arXivのプレプリント、単著。フォントサイズと解像度を制御したうえで、単独の漢字100文字を対象にテストしたものであり、チャットのスクリーンショットを対象にしたものではない。
  3. Miller Hillberg, Levonian, Kluver, Terveen and Hecht(2018)。What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms。Proceedings of the ACM on Human-Computer Interaction, CSCW。絵文字を含むツイートを投稿した直後のTwitterユーザー710人を対象にした調査であり、モデルがそれを読み取れるかどうかのテストではない。
  4. Tardelli, Alvisi, Cima, Cresci and Tesconi(2025)。Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance。arXivのプレプリント。暗号資産関連のTelegramメッセージにつけられた650,000件を超えるリアクションが対象で、プラットフォームも話題領域もひとつに限られている。
  5. Heath, MacDermott and Akinbi(2023)。Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data?。Forensic Science International: Digital Investigation。WhatsApp、Snapchat、Telegramそれぞれの削除機能そのものをテストしたものであり、AIがスクリーンショットを読み取ることについての検証ではない。
  6. Tang, Hew, Herring and Chen(2021)。(Mis)communication through stickers in online group discussions: A multiple-case study。Discourse & Communication。ひとつの大学における5つの議論グループと7人へのインタビューを対象にしたもので、測っているのは人間側の読み違えであり、モデルの読み違えではない。
  7. Sheth, Sinha, Patil, Beniwal and Singh(2025)。Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities。arXivのプレプリントによるサーベイ論文で、スクリーンショットに特化したテストは含まれていない。
  8. Apple。iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956、2026年9月27日に確認。結果は0件で、このアプリはもう掲載されていないとみられる。
  9. Mei。Terms of Service and Privacy Policy、最終更新2023年10月3日、2026年9月27日に確認。
  10. ConfiText。Privacy Policy、発効2026年2月10日、2026年9月27日に確認。