記事書くためのツール

音声メモの文字起こしは、まだテキストメッセージではない

音声入力は音声メモを文字にしますが、言いよどみや言い直し、思いついた順番はそのまま残りがちです。研究でわかっていることと、書き直しの工程が加えるもの。

文 Samet Durgun · Subtextの共同創業者 · 16分で読めます

話し言葉には、言いよどみ、言い始めのやり直し、文の途中での訂正が含まれますが、きちんと書かれた文章にはたいていありません。そのため、音声メモをそのまま文字にしただけでは、まだメッセージとは呼べません。スマホは話した内容を文字にしてくれますし、Otter、WhatsAppの文字起こし、オープンな音声モデルをもとにしたアプリも同じです。ただ、とりとめのない音声メモの文字起こしは、とりとめのないメッセージのままです。「えーと」も、途中でした訂正も、思いついた順番も、そのまま残ります。音声メモをわかりやすいテキストメッセージにするアプリは、文字起こしのあとに、もう一つの仕事をしなければなりません。あなたが何を言いたかったのかを見極めて、それを書くことです。

前半は研究です。言語学者は話し言葉と書き言葉の違いを測り、音声認識の研究者は文字起こしがどこで、誰に対して失敗するのかを測り、いくつかの研究は、人はなぜ音声メモを送り、受け取った側はなぜ後回しにするのかを調べてきました。後半では、すでに手元にある音声入力ツールが何をするのか、書き直しの工程が何を加えるのか、そしてSubtextが音声メモをどう扱うのかを書きます。

私はSubtextの共同創業者で、音声は、入力した下書き、会話のスクリーンショットと並ぶ3つの入り口の一つです。だからこの問いの答えには利害があります。以下の出典はすべて、私が実際に開いたものです。要旨までしか読めなかったものは、そう明記したうえで、その要旨から数字は引いていません。

話し言葉は、書き言葉とは違う作られ方をする

自発的な発話には、書き言葉なら省かれるものがたくさん含まれます。Elizabeth Shribergが、アメリカ英語の自発的な発話のコーパスを複数使って非流暢性を調べた概観では、その割合は単語の最大10%、発話の3分の1超にのぼります1。形としては、フィラー(「uh」「um」)、繰り返し(「I I think」)、文の途中で語を置き換える言い直し、そして節を途中でやめてやり直す言い始めのやり直しがあり、最後のものを彼女は削除に分類しています。彼女が調べた、人間同士の2つのコーパス(くだけた電話での会話と、旅行計画の電話)では、単語あたりの割合は約6%でした1。同じコーパスについての彼女のSRIの論文が手作業でラベルをつけたのは、40,515語と12,762語のサンプルです2。押しながら話すボタンでコンピュータに話しかけるコーパスでは、割合は1%未満に下がり、彼女はその低下の一部をボタンのせいだとしています。話し手は先に発話を組み立ててから録音できたからです1。音声メモでは、一度タップして話し始めるので、組み立ては声に出しながら行われます。

話し言葉のフィラーと、話し手による差の大きさ

話し言葉のフィラーは単なる雑音ではなく、それが取り除きにくい理由の一つです。Herbert ClarkとJean Fox Treeは、複数の大規模コーパスをもとに、「uh」と「um」はそれ自体が語であり、ほかの語と同じように計画され発せられて、話し手が次の語を探したり、何を言うかを決めたりするあいだの短い遅れや長い遅れを告げるために使われる、と論じました3。話し手による差も非常に大きいです。London-Lundコーパスは、1961年から1976年に録音された、主に学者同士のイギリス英語の対面会話50件、約170,000語からなります。そこで1人あたり1,000語を超えて話した65人は、1,000語あたりのフィラーが1.2から88.5まで開き、中央値は17.3でした3。ほぼきれいな文字起こしになる人もいれば、12語ほどごとにフィラーが入る人もいます。

非流暢性は、組み立ての負担がいちばん重いところに集まります。Shribergは、先行研究を引いて、句の初めのほうで起こりやすいと述べています1。音声メモでは、それは冒頭にあたり、そのメッセージが何のためのものかをまだ決めているところです。文章なら、その冒頭は誰かの目に触れる前に消せます。音声メモでは、全体を録り直さないかぎり、たいていそのまま届いてしまいます。

音声認識の誤りは、話し手によってどう違うか

文字起こしは、あなたが話した誤りの上に、自分の誤りを重ねます。私が見つけた中でもっとも明確な測定は、PNASの2020年の研究です。Amazon、Apple、Google、IBM、Microsoftの5つの商用音声認識システムに、白人42人と黒人73人のアメリカ人話者によるインタビュー音声19.8時間を処理させています4。平均の単語誤り率は、白人の話者で0.19、黒人の話者で0.35で、どのシステムでもこの差が出ました。最良だったMicrosoftは0.15と0.27、最悪だったAppleは0.23と0.45でした。黒人の話者のクリップでは、20%を超えるものが、単語の少なくとも半分を間違えて返ってきました。白人の話者のクリップでは、それが2%未満です4。著者らは、この差を、音を単語に対応づける部分である音響モデルに求め、学習データに含まれる黒人話者の音声が少なすぎることを指摘しています。

同じ論文にある2つ目のパターンは、音声メモに関わります。システムは男性の話者に対してやや成績が悪く、著者らはその理由を、よりくだけた話し方で、発音が短く縮まりやすく、非流暢性も多いことに求めています4。友人に送る音声メモの話し方そのものです。

アクセント、第二言語、誰も言っていない言葉

音声認識は、アクセントや第二言語の発話でも成績が落ちます。JASA Express Lettersの2024年の論文は、OpenAIのWhisperモデルを英語のさまざまなアクセントで検証し、英語が母語の話者のほうが第二言語の話者より精度が高く、アメリカ英語のほうがイギリス英語やオーストラリア英語より良く、会話より読み上げの音声のほうが良いと報告しています5。私が読めたのは要旨だけなので、方向だけを引き、数字は引いていません。Whisperは680,000時間の音声で学習され、開発者らは、このモデルが人間に近い「accuracy and robustness」に迫っていると説明しています6。Whisper自身のドキュメントには、「performance varies widely depending on the language」とも書かれています7。話者全体の平均は、疲れているときに第二言語で録った音声メモについては、ほとんど何も教えてくれません。その言語が英語なら、正しいメッセージでも、ネイティブの読み手にはぶっきらぼうに読めることがあり、文字起こしはそれを教えてくれません。

Whisperは、誰も言っていない言葉を足すこともあります。2024年の研究は、アメリカの機関で録音された、失語症のある人とない人437人による短い英語のクリップ13,140件を、2023年4月と5月に、OpenAIのホスト型Whisper APIにかけました。文字起こしのおよそ1%に、音声にない句や文がまるごと含まれていて、そのうち38%には、暴力や、権威があるかのような偽りの主張など、明確な害が少なくとも一つ含まれていました。長い間があるクリップほど、リスクが高くなりました。Whisperが文章を作り出した187件のクリップでは、Google、Amazon、Microsoft、AssemblyAI、RevAIからは同等の作り話は出ませんでした。クリップはインタビューで音声メモではなく、研究が検証したのも2023年時点のAPIです8。

人はなぜ音声メモを送るのか

人が音声メモを送るのは、送る側にとって早いからです。私が見つけた中で最大の研究は、ウルム大学のもので、Amazon Mechanical Turkで募集した、主にアメリカの1,003人への2020年の調査と、ヘビーユーザー6人への2週間のフィールド調査からなります9。調査では、83%が音声メッセージを受け取ったことがあり、73%が送ったことがありました。送る理由は、音声メッセージを録音したことのある人による735件の自由回答から集められ、4つのテーマに分けられています。テーマごとの件数の合計は735件を超えるので、複数のテーマにまたがる回答もありました。利便性(スマホでは話すほうが打つより早い)が359件。声が運び、文字が失う口調や感情が229件。運転中など、打つのが不便だったり危険だったりする状況が203件。そして、受け手が音声を求めていた、あるいは音声のほうが楽だったという理由が34件です。

速さを測った実験室の研究があります。大学生48人(うち24人は英語の母語話者)がiPhoneで短いフレーズを書き写し、英語の音声入力は1分あたり153語で、キーボードの52語の2.93倍でした。ただし音声入力のほうが、最終的なテキストに残った未修正の誤りがやや多く、0.55%対0.35%でした。課題は決まったフレーズの書き写しで、メッセージを組み立てる作業については、ほとんど何も語りません。著者のうち2人はBaiduに勤めており、サーバ側の認識エンジンであるDeep Speech 2は、iPhone 6 Plusのアプリ経由で試されました。論文は2017年に発表されています10。

音声メモは、負担を送る側から受け取る側へ移す

ウルムのフィールド調査では、2週間に記録された438件の音声メッセージは、1.5秒から7分強まで幅があり、中央値は17.5秒でした9。著者らは、受け手が聞く前に支払われるコストも指摘しています。音は消えていくので、録音は見直しも編集も面倒で、言い間違えれば、メッセージ全体を録り直すことになります9。フィールド調査で中断された12件の録音のうち、5件がまさにそれでした。

著者らは、音声メッセージがコミュニケーションに必要な労力を受け手の側に移すと述べ、原文では「shift the effort necessary for communication towards the receiver」と書いています9。作るのは早く、取り出すのは、同じ内容のテキストを読むより時間も手間もかかります。フィールド調査の参加者の大半は、仕事中の音声メッセージを後回しにしていました。テキストは一目で把握できますが、録音はできないからです。2020年に著者らが提案した解決策は自動の文字起こしで、録音に埋もれた約束の日時や場所を、ざっと目で追って見つけられるようにするものでした。

受け取った側が音声メモを後回しにする理由

受け手は流し読みができないので、聞いたものを聞き返します。同じフィールド調査では、受け取った音声メッセージは平均1.37回再生され、1件は13回再生されていました9。読むなら、聞き返しはいりません。190件の研究、参加者18,573人の2019年のメタ分析は、英語のノンフィクションの黙読の平均を、1分あたり238語としています11。会話の速さは、大規模な電話コーパスでは、通話全体で数えると1分あたり約196語、話し手自身の発話区間の中では約164語です12。読み手は、ペースも自分で決められますし、知りたい問いのところへ飛ぶこともできます。聞き手は、話し手の速さで、話し手の順番のまま、言葉を受け取ります。

音声メモはあまり好かれておらず、送るより受け取るほうが、少しだけ好かれています。YouGovが2022年5月5日と6日に実施し、同年6月に公表した、イギリスの成人2,149人への世論調査では、そのうちスマートフォンを使う1,956人に音声メモについて尋ねています。送ることを好むと答えたのは16%、好まないと答えたのは36%でした。受け取ることについては、好むが22%、好まないが25%、どちらとも言えないが29%でした13。受け取ることを好む人が好まない人より多かったのは、18歳から24歳だけで、43%対28%です。それでもこの層の半数は送ることを好まず、好む人は30%でした。スマートフォンを使う人全体では、63%が一度も送ったことがありませんでした。

音声メモは何分から長すぎるのか?

2022年5月のYouGovによる、イギリスのスマートフォン利用者への世論調査では、回答した人の65%が、1分の音声メモは長すぎると答えました。受け取るのを好まず、かつ回答した人のうち57%は、30秒でもいらだつと答えています。スマートフォン利用者全体では、27%が、どこからが限度なのかわからないと答えました。長いメッセージをどう受け取りたいかを尋ねると、78%がテキスト、14%が音声メモを選びましたが、これは表明された好みを記録しただけです13。録音が相手への負担になることを、送り手が承知しているように見える場合もあります。ドイツとスペインのWhatsAppのチャットを分析した2024年の研究は、人々がメッセージの前、中、後に、音声を選んだ理由を説明していることを見いだしました。著者らはこうした説明を、音声メモを謝る価値のあるものとして位置づけることも含め、社会的な働きをしていると述べています14。この3つの出典を通して、送り手は労力を節約し、受け手がそれを払い、そのことを謝る送り手もいます。

Appleの音声入力は、音声メモをどう扱うか

音声入力は、言った順に言葉を出します。Appleの音声入力では、それが仕事のすべてです。AppleのiOS 27向けiPhoneユーザガイドは、音声入力を、iPhone上で処理され、インターネット接続は不要で、多くの言語に対応し、言語が対応していれば、コンマ、ピリオド、疑問符を自動で挿入するものと説明しています15。最新の機種では、デバイス上のモデルが、英語について、スペル、句読点、大文字小文字を改善します。それ以外はすべて、声で出すコマンドです。「new line」と言い、「delete」に続けて語句を言います。デバイス上での処理という説明には、条件があります。Appleのプライバシーのページによると、キーボード設定に音声入力がデバイス上で処理されると表示されない場合、音声入力した内容はAppleのサーバに送られ、「Siriと音声入力の改善」に同意しないかぎり保存されません。また、リクエストの履歴と文字起こしは、Apple Accountではなくランダムなデバイス識別子に紐づけて、最長2年間保持されることがあるとも書かれています16。この二つがどう整合するのかは、ページには書かれていません。書き直しは、Appleの別の機能である作文ツール(Writing Tools)の仕事で、こちらはテキストがどう届くかの読み取りを返しません。

GoogleとMicrosoftの音声入力は何をするか

Googleの基本的なGboardの音声入力は、Appleの音声入力と同じく、話した言葉をそのまま出します。マイクをタップして、書きたい内容を話し、句読点も声で言います。ただし、音声入力と句読点の入力は、すべての言語で使えるわけではありません17。高度な音声入力は、Pixel 6以降で、話しながら句読点を加えます。Pixel 9(9aを除く)以降では、声のコマンドで、音声入力した内容を校正、言い換え、短縮、延長できます。Googleによれば、これはデバイス上で動作し、英語、フランス語、イタリア語、日本語、スペイン語に対応していて、ドイツ語は近日対応予定です18。Windowsでは、MicrosoftのヘルプページによるとCopilot+ PCの機能である流動ディクテーション(Fluid dictation)が、話しながら文法、句読点、フィラーを修正します19。高度な音声入力が書き直すのは、声のコマンドを出したときだけです。流動ディクテーションはコマンドなしで動きますが、Copilot+ PCに限られ、ヘルプページにはメッセージの並べ替えへの言及がありません。ここで引いたApple、Google、Microsoftのヘルプページには、とりとめのない音声メモ全体を、初期設定で送れるメッセージにする機能は見つかりませんでした。

文字起こしアプリとメッセンジャーは何をするか

文字起こしアプリのOtterは、スマホのキーボードより一歩先に進んでいます。音声からテキストへのページには、話者ラベルとタイムスタンプのついた文字起こし、ハイライトつきの自動生成の要約、抽出された要点とアクションアイテムが載っています20。Otterのヘルプセンターは、対応言語として英語、スペイン語、フランス語、ドイツ語、日本語、中国語(簡体字)を挙げていて21、これは音声からテキストへのページの記載より多くなっています。会議向けに作られているので、話された内容を短くまとめるもので、その2つのページには、あなたが送りたかった内容を下書きしてくれる機能は見つかりませんでした。オープンな音声モデルが土台になっているアプリもあります。Whisper自体が出すのは、文字起こしと言語ラベルです7。その上に作られたアプリは、さまざまです。MacWhisperは、文字起こしの上に、フィラーの除去、要約、カスタムプロンプトを載せると宣伝していて、この工程にはローカルのモデルとクラウドのモデルを選べます22。

メッセンジャーは、受け取った音声メモの文字起こしを始めています。WhatsAppは2024年11月に、音声メッセージの文字起こしを加えました。文字起こしはデバイス上で生成されるので、WhatsApp自身は読めず、「設定」の「チャット」でオンにして、メッセージを長押しして使います23。投稿によると、文字起こしは一部の限られた言語から始まり、現在の対応一覧は私には確認できませんでした。言語が対応しているなら、ウルムの著者らが指摘した、ざっと目で追うという問題には、これが答えになります。ただ、手に入るのは、他人が考えながら声に出したものの文字起こしです。会議中に読むことはできても、返信を書くのは、やはりあなたです。

書き直しの工程が加えるもの

書き直しの工程は、文字起こしを、打つのに手間がかからなかったら打っていたはずのメッセージに変えます。ClarkとFox Treeが述べたフィラーを落とし、Shribergの分類にある繰り返しと言い始めのやり直しをまとめ、途中でした訂正を、訂正された部分を置き換えるかたちで、あるべき場所に置きます。順番も並べ替えます。話し言葉の説明は、思いついた順に出てくる傾向があり、文脈が先で依頼が最後だったり、依頼が先で理由があとに続いたりします。書かれたメッセージは、要点から始められます。

この工程が手を触れてはいけないものが、二つあります。一つ目は意味です。音声メモをなめらかにした結果、別の依頼になってしまう書き直しは、文字起こしより悪いです。文字起こしは、少なくともあなたが言ったことを言っているからです。二つ目はトーンです。あなたが温かかったのなら、あるいは率直だったのなら、冗談を言っていたのなら、書かれたバージョンも同じ人であるべきです。ここでの失敗のしかたは、AIに頼むと、メッセージはロボットっぽくなるのかで扱ったもので、書き直しが丁寧で、ありきたりな文章になって返ってくることです。

文字起こしには決して求められない判断もあります。音声メモで話したことの一部は、受け手のためではなく、自分のためのものでした。何かに触れるべきかを声に出して迷ったからといって、触れるつもりだったことにはなりません。書き直しの工程は、どこまでがメッセージで、どこからが下書きだったのかを決めなければならず、その判断は両方向で外れえます。やめようと自分に言い聞かせていた一文を残してしまうことも、言うつもりだった一文を落としてしまうこともあります。どのツールでも、Subtextを含めて、それがどれくらいの頻度で起きるかを測った研究は見つかりませんでした。

Subtextは音声メモをどう扱うか

Subtextは、アプリで録音した音声メモを文字にしたうえで、あなたが言いたかったことからメッセージを書き、最大3つのバージョンを返します。それぞれに、意図したとおりに届く見込みを示す「送って大丈夫」スコアがつきます。バージョンは、あなたの意味と、あなたらしさを保つように作られています。最初の下書きでは、1つは問題を直しつつあなたの言葉に近いまま、1つはより温かい仕上げ、または別のアプローチ、1つはより大きく書き直したものです。言い回しが意図したより冷たく、または鋭く読める場合は、アプリが問題に名前をつけ、原因になっている言葉に印をつけます。あなたに代わって送られるものは何もありません。

モデルへの指示は、文字起こしで生じる不具合も対象にしていて、私はこの記事を書く前にバックエンドのプロンプトを読みました。メッセージが音声で入力されたものとして印がついているとき、モデルには、聞き間違いや、くっついてしまった語、不自然な句読点、余計なフィラーがあるものと想定し、それを読み通して意図された言い回しにたどり着き、あなたの落ち度として指摘せずに、黙って直すよう指示されています。プロンプトが示すのは、モデルが何をするよう指示されているかです。Subtextの音声の文字起こしや書き直しについて、独立した評価は見つかりませんでした。そのため、ここに書いたことはすべて、アプリが見せるものと、そのプロンプトおよびプライバシーポリシーの記載に基づいています。上の研究はどれも、Subtextの音声を文字にする音声モデルであるDeepgramを検証していないので、アクセント、第二言語の発話、くだけた話し方についての誤りのパターンが、それにどこまで当てはまるのかは、私にはわかりません。送る前に、メッセージを読み返してください。

Subtextでは音声の録音はどうなるのか?

Subtextは、文字起こしのために音声の録音をDeepgramに送るので、音声はスマホの外に出ます。2026年7月26日に更新されたプライバシーポリシーは、複数の事業者を挙げています。音声の録音にはDeepgram、テキスト、画像、音声の文字起こしにはAnthropic、アカウントと会話にはGoogle Firebase、そして読み上げをオンにした場合だけOpenAIです。ポリシーにはさらに、ウェブ検索がオンのとき、あなたのリクエストから取り出した検索語が、Anthropicを通じて第三者の検索事業者に送られること、ウェブ検索はアプリの設定でオフにできることも書かれています24。送信したものがAIモデルの学習に使われることはなく、AIの事業者も学習に使ってはならないとされ、Subtextは音声についても、Deepgramのモデル改善のオプトアウトを設定している、とあります。Subtextは、会話の自社コピーを、最後に使ってから5日後に、ピン留めした場合は90日後に、サーバから削除するとしています。オプトアウトを設定したDeepgramは、文字起こしに必要な時間だけ音声を保持し、Anthropicは入力と出力を30日以内に削除し、フラグが立ったリクエストを最長2年間、関連する安全性スコアを最長7年間保持することがあるとも書かれています。さらに、Subtextには、これらのどの事業者ともゼロリテンションの取り決めがないとあります24。ほかのアシスタントがあなたのテキストをどう扱うかの比較は、AI文章アシスタントのうち、あなたのメッセージを学習に使うものにあります。

Subtextが対応する言語は?

Subtextは、あなたが話した言語でメッセージを書き、17以上の言語に対応し、その言語に丁寧さの段階があれば、あなたが使った段階を保ちます。ドイツ語の音声メモは、ドイツ語のメッセージとして返ってきます。受け取った音声メモの要約は、それが届いた言語で書かれます。Google Playの編集部は、この流れを「Hot Tip」という記事で取り上げていて、マイクのアイコンをタップして話し、もう一度タップすると、元のメッセージがどう伝わったかのタグと、コピーボタンのついた、整えられたメッセージが返ってくると説明しています25。2026年10月4日にページを開いたとき、ドイツのストアの掲載では、295件のレビューで星4.3、ダウンロードは50,000件以上でした。これはGoogle Playの数字だけで、星の数は国によって違います。Subtextは有料で、最初に数回の無料分析があります。録音した音声メモは、送れるメッセージになって返ってきます。

届いた長い音声メッセージには、どう返信するか?

Subtextは、ほかの人から届いた音声メッセージも読みます。素のままの文字起こしが、いちばん「足りる」に近づくのは、こちら側です。WhatsAppのデバイス上の文字起こしなら、言語が対応していれば、2分の録音を読めます23。ただ、相手が何を求めているのかは、教えてくれません。ウルムの研究自身の例は、音声に埋もれた日付と場所でした9。友人や上司からの長い音声メモも同じ形で、問いは途中のどこかにあり、その周りに理由が並びます。返信で止まってしまう人にとって、読む工程は、返信が詰まる5つの場所の一つで、ウルムのフィールド調査の参加者の大半も、録音は一目で把握できないので、仕事中の音声メッセージを後回しにしていました9。

届いた音声メッセージをSubtextに入れると、文字にして、その人があなたに何を求めているのかを1行でまとめ、2つから5つの行動ポイントを加えます。そのうえで、流れを引き継ぐ返信を下書きできますが、送り手のトーンにラベルはつけません。バックエンドのプロンプトは、添付された音声ファイルを、相手からあなたに送られたものである可能性が高いものとして扱い、モデルが誰が誰なのかわからないときは、尋ねるよう指示しています。要約の質は、その下にある文字起こしの質を超えません。また、1行は文脈がなければ読み取りにくく、このテキストはどういう意味かが示すとおりです。強いアクセントや雑音の多い録音では、スタジオ録音の英語より文字起こしに誤りが多くなるので、大事な内容への返信の前には、元の音声を再生してください。テキストとスクリーンショットも同じ要約の工程を通るので、受け取ったメッセージにも、同じ1行の要約がつきます。

いちばん近い実験は、古くて小さい

書き直しの工程や要約にいちばん近い実験として私が見つけた2つは、2003年と2005年のもので、どちらも小規模です。2003年の、DARPAが資金を出した実験では、英語が母語の28人が、電話と放送の音声から起こした150語から250語の文章を、そのままの文字起こしと、手作業で整えたものとで読みました。読み手は、整えたテキストのほうが理解しやすいと評価しましたが、それについての質問への答えは、より正確でも速くもなりませんでした。著者らはこれを、読み手がもともと上限近くの得点だったためとしています。不完全な認識結果を自動で整えたものは、整えていないものより読みにくいと評価される傾向がありましたが、その差はわずかでした26。整える作業は、非流暢性を取り除き、句読点を直しましたが、テキストをメッセージに書き直したわけではありません。

2005年には、16人が、自動で抽出された要約をもとに、15件のボイスメールについての質問に答えました。音声認識から作った要約では、発信者の名前が正しく得られたのは57%で、人間の文字起こしから作った要約の94%を下回りましたが、通話の理由は、どちらも同じく78%で伝わりました。要約が音声認識から作られたときのほうが、元の音声を求める頻度は高く、53%対30%でした27。これらは2005年の音声認識で作られた、ボイスメールの抽出型の要約なので、この研究が与えるのは見込みだけです。どちらの研究も、誰かが送るメッセージを測ってはいません。

証拠が尽きるところ

強い証拠があるのは、両端です。話し言葉には、書き言葉にはない非流暢性が、測られた割合で含まれていて、音声認識は話し手によって誤りの多さが違い、上の数字がそれを示しています。真ん中は薄くなります。書き直した音声メモが、生の文字起こしよりどれだけ良く届くのか、あるいは書き直しが途中でどれくらいの頻度で意味を変えるのかを測った研究は、見つかりませんでした。音声メッセージについての研究は一握りで、最大のものはアメリカのクラウドワーキングのプラットフォームから集めた調査標本、フィールド調査は6人です。YouGovの世論調査は、1つの国で1つの年のものです。そして音声メモの研究は、デバイス上の文字起こしより前のものなので、そこで述べられた労力の移動は、いまはメッセンジャー自身によって部分的に埋められています。

結局は、あなたの話し方しだいです。きれいな文で話す人なら、音声入力で足り、スマホにはもう入っています。あのコーパスの話し手たちのように、ClarkとFox Treeが数えたフィラーや、Shribergが分類した言い直しを交えて話すなら、文字起こしは、あなたの下書きの過程を受け手にそのまま渡してしまい、それをメッセージに変えるのが、書き直しの工程です。Subtextは、その工程を担うアプリの一つで、録音した音声メモにも、受け取ったものにも使えます。返信を何度も直してしまうことが悩みなら、短い返信に1時間かかる理由がその堂々巡りを扱っています。ブラウザでSubtextを試すブラウザでSubtextを試す

出典

登場順に番号を振っています。ページは2026年10月4日と5日に確認し、Subtextのプライバシーポリシーは2026年10月10日にもう一度開きました。

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 to 169. アメリカ英語の会話のコーパス研究。非流暢性の割合と種類。
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. 学会発表論文。PDFに発行年はなく、引用文献は1996年まで。手作業でラベルをつけたコーパスは、30人の話者による40,515語(Switchboard)と、523人の話者による12,762語(AMEX、SRIの従業員と旅行代理店の通話)。DARPAとNSFの助成を受けている。. 2026年10月5日に確認。
  3. Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 to 111. London-Lundコーパスにおける話者ごとのフィラーの割合。
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 to 7689. 5つの商用システム、白人42人と黒人73人の話者、音声19.8時間。
  5. Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. 要旨のみ。確認時には全文を読めなかった。
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv preprint.
  7. OpenAI. Whisper README. GitHub. . 2026年10月4日に確認。
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). アメリカの機関で録音された、失語症のある人とない人437人の音声セグメント13,140件を、2023年4月と5月にWhisper APIにかけた。Pulitzer CenterとCornell’s Center for Social Sciencesの助成を受けている。
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. 1,003人への調査と、6人への2週間のフィールド調査。
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. 2017年12月発行。大学生48人(言語ごとに24人)がiPhoneでフレーズを書き写した実験室研究。著者のうち2人はBaidu USAに勤めており、同社のサーバ側の音声システムDeep Speech 2は、Baiduのサーバ上で動き、iPhone 6 Plusのアプリ経由で試された。
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190件の研究、参加者18,573人。
  12. Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboardの電話会話。
  13. YouGov. How many Britons like voice notes? 2022年6月14日。イギリスの成人2,149人への世論調査、実施は2022年5月5日と6日、うち1,956人がスマートフォン利用者。長さに関する数字は、回答した人に占める割合。結果の表は にある。https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. 2026年10月4日と5日に確認。パーセンテージはYouGovの記事本文に従っている。結果の表では、好まないの合計が、端数処理のためわずかに異なる。
  14. Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 to 71. ドイツ語とスペイン語のWhatsAppチャット。要旨は出版社のCrossrefの記録から読み、全文は有料で読めなかった。
  15. Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . 2026年10月4日に確認。
  16. Apple. Siri, Dictation & Privacy. Legal、最終更新2026年9月14日。. 2026年10月5日に確認。
  17. Google. Type with your voice. Gboard Help. . 2026年10月4日に確認。
  18. Google. Use advanced voice typing features. Gboard Help. . 2026年10月5日に確認。
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . 2026年10月5日に確認。
  20. Otter.ai. Convert Speech to Text. . 2026年10月4日に確認。
  21. Otter.ai. Supported languages. Otter Help Center、記事の編集は2026年5月6日。. 2026年10月5日に確認。
  22. MacWhisper. Homepage. 日付のない宣伝ページなので、製品が何を宣伝しているかはわかるが、どう動くかはわからない。. 2026年10月5日に確認。
  23. WhatsApp. Introducing Voice Message Transcripts. 2024年11月21日。. 2026年10月4日に確認。
  24. Subtext, Terms, privacy and your account. プライバシーポリシーの最終更新は2026年7月26日。2026年10月10日に確認。
  25. Google Play. Hot Tip: Speak your mind with Subtext. . 2026年10月4日に確認。私が開いたどのストアでも、掲載は295件のレビューと50K+のダウンロードを示し、ドイツのストアでは星4.3だった。
  26. Jones, D. A., ほか共著者6名 (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 to 1588. 英語が母語の32人を募集し、28人を分析。DARPAがAir Force契約F19628-00-C-0002のもとで資金を提供。
  27. Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). 16人の参加者と15件のボイスメールによる理解度テスト。数字は著者がホストするPDFから読み取った。EPSRCのROPA助成、GR/R23954の資金を受けている。