ArtigosFerramentas de escrita

Por que a transcrição de um áudio não é uma mensagem de texto

O ditado simples transforma um áudio em texto, mas costuma manter as hesitações, os recomeços e a ordem em que você pensou nas coisas. O que a pesquisa diz e o que uma etapa de reescrita acrescenta.

Por Samet Durgun · Cofundador da Subtext · 21 min de leitura

A fala carrega hesitações, falsos começos e correções no meio da frase que a escrita pronta quase nunca tem, então a transcrição simples de um áudio ainda não é uma mensagem. O celular digita o que você disse, e o Otter, as transcrições do WhatsApp e os aplicativos feitos sobre modelos abertos de fala também, mas a transcrição de um áudio cheio de rodeios continua sendo uma mensagem cheia de rodeios. Ela mantém o “hã”, a correção que você fez no meio e a ordem em que as coisas passaram pela sua cabeça. Um aplicativo que transforma um áudio em uma mensagem de texto clara precisa fazer um segundo trabalho depois da transcrição. Precisa entender o que você quis dizer e escrever isso.

A primeira metade é pesquisa. Linguistas mediram como a língua falada difere da escrita, pesquisadores de reconhecimento de fala mediram onde a transcrição falha e para quem, e alguns estudos perguntaram por que as pessoas mandam áudios e por que quem recebe os deixa para depois. A segunda metade é o que as ferramentas de ditado que as pessoas já têm fazem, o que uma etapa de reescrita acrescenta e o que o Subtext faz com um áudio.

Como cofundador do Subtext, em que a voz é uma de três formas de entrada, ao lado de um rascunho digitado e de um print de uma conversa, eu não sou neutro quanto à resposta. Abri todas as fontes abaixo. Onde só consegui chegar a um resumo, eu digo isso e não cito nenhum número dele.

A fala é produzida de um jeito diferente da escrita

A fala espontânea está cheia de material que a escrita deixa de fora. O levantamento de Elizabeth Shriberg sobre disfluência em vários corpora de fala espontânea do inglês americano põe a taxa em até dez por cento das palavras e em mais de um terço dos enunciados1. As formas são pausas preenchidas (“uh”, “um”), repetições (“I I think”), reparos em que uma palavra é trocada no meio da frase e falsos começos, que ela classifica como apagamentos, em que uma oração é abandonada e recomeçada. Nos dois corpora de conversa entre pessoas que ela examinou, conversas telefônicas informais e ligações de planejamento de viagem, a taxa por palavra ficou em cerca de seis por cento1, em amostras de 40.515 e 12.762 palavras que o artigo dela do SRI sobre os mesmos corpora rotulou à mão2. Em um corpus de pessoas que falavam com um computador por um botão de apertar para falar, a taxa caiu para menos de um por cento, e ela atribui parte da queda ao botão. Os falantes podiam planejar o enunciado primeiro e gravar depois1. Em um áudio você toca uma vez e fala, e o planejamento acontece em voz alta.

As hesitações da fala e o quanto os falantes variam

As hesitações da fala não são ruído, e isso é parte do motivo de serem difíceis de tirar. Herbert Clark e Jean Fox Tree argumentaram, a partir de vários corpora grandes, que “uh” e “um” são palavras de pleno direito, planejadas e produzidas como qualquer outra, usadas para anunciar um atraso curto ou longo enquanto o falante procura a próxima palavra ou decide o que dizer3. Elas também variam enormemente de falante para falante. No corpus London-Lund, com cerca de 170.000 palavras de 50 conversas presenciais em inglês britânico gravadas entre 1961 e 1976, em sua maioria entre acadêmicos, os 65 falantes que produziram mais de 1.000 palavras cada ficaram entre 1,2 e 88,5 hesitações por 1.000 palavras, com mediana de 17,33. Algumas transcrições saem quase limpas, outras trazem uma hesitação a cada dúzia de palavras.

A disfluência também se concentra onde o planejamento é mais pesado. Shriberg observa, citando trabalhos anteriores, que ela é mais provável no início de uma frase1. Em um áudio, esse início é a abertura, em que você ainda está decidindo para que serve a mensagem. Na escrita, dá para apagar essa abertura antes de alguém ver. Em um áudio ela costuma seguir junto, a menos que você grave a mensagem inteira de novo.

Como os erros do reconhecimento de fala variam conforme o falante

A transcrição soma seus próprios erros aos que você falou. A medição mais clara que encontrei é um estudo de 2020 na PNAS que passou cinco reconhecedores de fala comerciais, da Amazon, da Apple, do Google, da IBM e da Microsoft, por 19,8 horas de áudio de entrevistas com 42 falantes americanos brancos e 73 negros4. A taxa média de erro de palavras foi de 0,19 para falantes brancos e 0,35 para falantes negros, e todos os sistemas mostraram a diferença. O de melhor desempenho, a Microsoft, ficou em 0,15 e 0,27. O pior, a Apple, ficou em 0,23 e 0,45. Mais de 20 por cento dos trechos de falantes negros voltaram com pelo menos metade das palavras erradas, contra menos de 2 por cento dos trechos de falantes brancos4. Os autores atribuíram a diferença aos modelos acústicos, a parte que associa som a palavras, e apontam a falta de áudio de falantes negros nos dados de treinamento.

Um segundo padrão do mesmo artigo importa para os áudios. Os sistemas tiveram desempenho um pouco pior com falantes homens, o que os autores atribuem a um estilo mais informal, com pronúncias mais curtas e reduzidas e mais disfluências4, o registro de um áudio para um amigo.

Sotaques, segundas línguas e palavras que ninguém disse

O reconhecimento de fala também vai pior com sotaques e com a fala em segunda língua. Um artigo de 2024 na JASA Express Letters testou o modelo Whisper, da OpenAI, em sotaques do inglês e relatou maior precisão para falantes nativos do que para quem tem o inglês como segunda língua, resultados melhores para o inglês americano do que para o britânico ou o australiano, e resultados melhores na fala lida do que na conversa5. Só consegui chegar ao resumo, então cito a direção e nenhum número. O Whisper foi treinado com 680.000 horas de áudio, e os autores dele descrevem os modelos como chegando perto do nível humano em “accuracy and robustness”6. A própria documentação acrescenta que “performance varies widely depending on the language”, ou seja, o desempenho varia muito conforme o idioma7. Uma média entre falantes diz pouco sobre um áudio gravado com cansaço na sua segunda língua. Se essa língua for o inglês, uma mensagem correta ainda pode soar abrupta para um leitor nativo, e a transcrição não vai avisar.

O Whisper também pode acrescentar palavras que ninguém disse. Um estudo de 2024 passou 13.140 trechos curtos de inglês, de 437 participantes gravados em instituições dos EUA, com e sem afasia, pela API hospedada do Whisper, da OpenAI, em abril e maio de 2023. Aproximadamente um por cento das transcrições continha frases inteiras que não estavam no áudio, e 38 por cento delas traziam pelo menos um dano explícito, como violência ou uma falsa alegação de autoridade. Trechos com pausas longas corriam mais risco. Nos 187 trechos em que o Whisper tinha inventado texto, Google, Amazon, Microsoft, AssemblyAI e RevAI não produziram invenções comparáveis. Os trechos eram entrevistas, não mensagens de voz, e o estudo testou a API como ela era em 20238.

Por que as pessoas mandam áudios

As pessoas mandam áudios porque são rápidos para quem manda. O maior estudo que encontrei é da Universidade de Ulm, uma pesquisa de 2020 com 1.003 pessoas recrutadas pelo Amazon Mechanical Turk, a maioria nos Estados Unidos, mais um estudo de campo de duas semanas com seis usuários frequentes9. Na pesquisa, 83 por cento tinham recebido uma mensagem de voz e 73 por cento tinham enviado uma. Os motivos para enviar, tirados de 735 respostas abertas de quem tinha gravado uma mensagem de voz, se organizaram em quatro temas. A soma dos temas passa de 735 respostas, então algumas respostas se encaixaram em mais de um. A conveniência, já que falar é mais rápido do que digitar no celular, foi citada 359 vezes. O tom e a emoção que a voz carrega e o texto perde, 229. Situações em que digitar é incômodo ou inseguro, como dirigir, 203. E o destinatário, que tinha pedido voz ou achava mais fácil, 34.

Um estudo de laboratório mediu a velocidade. Seus 48 estudantes universitários, 24 deles falantes nativos de inglês, copiaram frases curtas em um iPhone, e a entrada de fala em inglês rodou a 153 palavras por minuto contra 52 no teclado, 2,93 vezes mais rápido, embora a fala tenha deixado um pouco mais de erros sem correção no texto final, 0,55 por cento contra 0,35 por cento. A tarefa era copiar frases prontas, o que diz pouco sobre compor uma mensagem. Dois dos autores trabalhavam para a Baidu, cujo reconhecedor no servidor, o Deep Speech 2, foi testado por um aplicativo em um iPhone 6 Plus, em um artigo publicado em 201710.

O áudio transfere o esforço de quem manda para quem recebe

No estudo de campo de Ulm, 438 mensagens de voz registradas ao longo de duas semanas foram de 1,5 segundo a pouco mais de sete minutos, com mediana de 17,5 segundos9. Os autores também apontam um custo pago antes de qualquer destinatário ouvir. O som é passageiro, então uma gravação é incômoda de revisar e editar, e um deslize da língua significa gravar a mensagem inteira de novo9. Cinco das doze gravações abortadas no estudo de campo deles foram exatamente isso.

Os autores escrevem que as mensagens de voz “shift the effort necessary for communication towards the receiver”, ou seja, transferem para o destinatário o esforço necessário para a comunicação9. Compor é rápido, recuperar o conteúdo leva mais tempo e esforço do que ler um texto com o mesmo conteúdo, e a maioria dos participantes do estudo de campo adiava as mensagens de voz no trabalho porque um texto se capta de relance e uma gravação não. A solução que propuseram, em 2020, eram transcrições automáticas, para que a data e o local de um compromisso enterrados em uma gravação pudessem ser achados com uma olhada.

Por que os destinatários deixam para depois

Quem recebe não consegue passar os olhos por cima, então volta ao que ouviu. No mesmo estudo de campo, as pessoas ouviram uma mensagem de voz recebida 1,37 vez em média, e uma mensagem foi tocada 13 vezes9. Ler não exige reouvir. Uma metanálise de 2019 com 190 estudos e 18.573 participantes põe a leitura silenciosa média de não ficção em inglês em 238 palavras por minuto11. A fala em conversa corre a cerca de 196 palavras por minuto quando se conta a ligação inteira e a cerca de 164 dentro dos turnos do próprio falante, em um grande corpus telefônico12. O leitor também controla o ritmo e pode pular para a pergunta. O ouvinte recebe as palavras na velocidade de quem fala, na ordem de quem fala.

As pessoas não gostam muito deles, e gostam um pouco mais de receber do que de enviar. Uma pesquisa da YouGov com 2.149 adultos do Reino Unido, realizada em 5 e 6 de maio de 2022 e publicada em junho daquele ano, perguntou sobre áudios aos usuários de smartphone entre eles, 1.956 pessoas. Delas, 16 por cento gostavam de enviar e 36 por cento não gostavam de enviar. Quanto a receber, 22 por cento gostavam, 25 por cento não gostavam e 29 por cento eram ambivalentes13. Só entre os de 18 a 24 anos mais gente gostava de receber do que não gostava, 43 a 28 por cento, e mesmo nesse grupo metade não gostava de enviar contra 30 por cento que gostavam. De todos os usuários de smartphone, 63 por cento nunca tinham enviado um.

A partir de quanto tempo um áudio é longo demais?

Em uma pesquisa da YouGov de maio de 2022 com usuários de smartphone do Reino Unido, 65 por cento dos que responderam disseram que um áudio de um minuto é longo demais, e entre os que não gostam de receber áudios e responderam, 57 por cento se frustravam com 30 segundos. Entre todos os usuários de smartphone, 27 por cento não sabiam onde ficava o limite. Perguntados como preferiam receber uma mensagem longa, 78 por cento escolheram texto e 14 por cento um áudio, o que registra apenas uma preferência declarada13. Alguns remetentes parecem saber que a gravação é uma imposição. Uma análise de 2024 de conversas de WhatsApp na Alemanha e na Espanha encontrou pessoas justificando a escolha do áudio antes, dentro e depois da mensagem, e os autores descrevem essas justificativas como trabalho social, incluindo apresentar o áudio como algo pelo qual vale pedir desculpas14. Nessas três fontes, quem manda economiza esforço e quem recebe paga por ele, e alguns remetentes pedem desculpas por isso.

O que o Ditado da Apple faz com um áudio

O Ditado dá as palavras na ordem em que você as disse, e para o Ditado da Apple esse é o trabalho inteiro. O guia do iPhone da Apple para o iOS 27 descreve o Ditado como processado no próprio aparelho, sem conexão com a internet, em muitos idiomas, inserindo vírgulas, pontos finais e pontos de interrogação automaticamente onde o idioma é compatível15. Nos celulares mais novos, um modelo no aparelho melhora ortografia, pontuação e uso de maiúsculas, em inglês. Todo o resto é comando falado. Você diz “new line”, você diz “delete” seguido da frase. A afirmação de que roda no aparelho tem uma condição. A página de privacidade da Apple diz que, se os ajustes do teclado não mostrarem que o Ditado é processado no aparelho, o que você dita é enviado aos servidores da Apple e não é guardado, a menos que você ative Melhorar a Siri e o Ditado. Ela diz também que a Apple pode guardar o histórico de pedidos e as transcrições, ligados a um identificador aleatório do aparelho e não à sua Conta Apple, por até dois anos16. A página não explica como as duas coisas se encaixam. Reescrever é trabalho das Ferramentas de Escrita da Apple, que são um recurso à parte e não fazem nenhuma leitura de como o texto vai ser recebido.

O que a digitação por voz do Google e da Microsoft faz

A digitação por voz básica do Gboard, do Google, como o Ditado da Apple, dá as palavras do jeito que você falou. Você toca no microfone, diz o que quer escrever e fala a pontuação, embora a digitação por voz e a pontuação não estejam disponíveis em todos os idiomas17. A digitação por voz avançada, no Pixel 6 e posteriores, acrescenta pontuação enquanto você fala, e no Pixel 9 (exceto o 9a) e posteriores um comando falado pode revisar, reformular, encurtar ou alongar o que você ditou. O Google diz que isso roda no aparelho, em inglês, francês, italiano, japonês e espanhol, com o alemão em breve18. No Windows, a página de ajuda da Microsoft diz que o ditado fluido, um recurso de Copilot+ PCs, corrige gramática, pontuação e palavras de preenchimento enquanto você fala19. A digitação por voz avançada só reescreve quando você dá um comando falado. O ditado fluido funciona sem comando, mas só em Copilot+ PCs, e a página de ajuda dele não menciona reordenar a mensagem. Nas páginas de ajuda da Apple, do Google e da Microsoft citadas aqui, não encontrei nenhum recurso que, por padrão, transforme um áudio longo e cheio de rodeios em uma mensagem pronta para enviar.

O que os aplicativos de transcrição e os mensageiros fazem

O Otter, um aplicativo de transcrição, vai um passo além do teclado do celular. A página de fala para texto dele descreve uma transcrição com rótulos de falantes e marcações de tempo, um resumo gerado automaticamente com destaques e pontos-chave e itens de ação extraídos20. A central de ajuda do Otter lista inglês, espanhol, francês, alemão, japonês e chinês (simplificado) como idiomas compatíveis21, o que é mais do que diz a página de fala para texto. Ele foi feito para reuniões, então condensa o que foi dito, e não encontrei nessas duas páginas nenhum recurso que redija o que você pretendia enviar. Modelos abertos de fala ficam por baixo de alguns aplicativos. O próprio Whisper produz uma transcrição e um rótulo de idioma7. Os aplicativos feitos sobre ele variam. O MacWhisper anuncia remoção de palavras de preenchimento, resumos e prompts personalizados em cima da transcrição, e oferece modelos locais ou na nuvem para essa etapa22.

Os mensageiros começaram a transcrever os áudios que você recebe. O WhatsApp acrescentou transcrições de mensagens de voz em novembro de 2024, geradas no aparelho, de modo que o próprio WhatsApp não consegue lê-las, ativadas em Configurações e Conversas e acionadas por um toque longo na mensagem23. A publicação diz que as transcrições começaram em alguns idiomas selecionados, e não consegui confirmar a lista atual. Isso responde ao problema de passar os olhos que os autores de Ulm identificaram, nos idiomas cobertos. O que você recebe é a transcrição do pensamento em voz alta de outra pessoa. Dá para ler numa reunião, mas a resposta ainda é você quem tem que escrever.

O que uma etapa de reescrita acrescenta

Uma etapa de reescrita transforma a transcrição na mensagem que você teria digitado se digitar não custasse nada. Ela tira as hesitações que Clark e Fox Tree descrevem, junta as repetições e os falsos começos da taxonomia de Shriberg e coloca a correção que você fez no meio da fala onde ela pertence, no lugar da coisa que corrigiu. Ela também reordena. As explicações faladas tendem a chegar como ocorreram a você, com o contexto primeiro e o pedido por último, ou o pedido primeiro e as razões vindo atrás. Uma mensagem escrita pode abrir com o ponto principal.

Há duas coisas que a etapa precisa deixar intactas. A primeira é o sentido. Uma reescrita que alisa o seu áudio até virar um pedido diferente é pior do que a transcrição, porque a transcrição ao menos disse o que você disse. A segunda é o tom. Se você estava carinhoso, ou direto, ou brincando, a versão escrita tem que ser a mesma pessoa. O modo de falha aqui é o que aparece em a IA faz as suas mensagens soarem como um robô, em que a reescrita volta educada e genérica.

Há também um julgamento que uma transcrição nunca precisa fazer. Parte do que você disse no áudio era para você, não para o destinatário. Pensar em voz alta se deve mencionar algo não quer dizer que você queria mencionar. Uma etapa de reescrita tem que decidir o que era a mensagem e o que era rascunho, e essa decisão pode dar errado nos dois sentidos, ao manter uma frase de que você estava tentando se convencer a desistir ou ao cortar uma que você queria dizer. Não encontrei nenhum estudo que medisse com que frequência isso acontece em qualquer ferramenta, o Subtext incluído.

O que o Subtext faz com um áudio

O Subtext transcreve o áudio que você grava no aplicativo, depois escreve a mensagem a partir do que você quis dizer e devolve até três versões, cada uma com uma nota de segurança para enviar, que diz a chance de ela chegar como você quis. As versões são feitas para manter o seu sentido e a sua personalidade. Num primeiro rascunho, uma fica perto das suas palavras com os problemas corrigidos, uma é um polimento mais caloroso ou uma abordagem diferente, e uma é uma reescrita mais completa. Se a redação soa mais fria ou mais ríspida do que você queria, o aplicativo nomeia o problema e marca as palavras que o causam. O Subtext não envia nada por você.

As instruções do modelo cobrem artefatos de transcrição, e li os prompts do backend antes de escrever isto. Quando uma mensagem é sinalizada como ditada, o modelo é instruído a esperar palavras ouvidas errado ou emendadas, pontuação estranha e hesitações soltas, a passar por cima delas até chegar à redação pretendida e a corrigi-las em silêncio, sem apontá-las como algo que você fez de errado. O prompt mostra o que o modelo é instruído a fazer. Não encontrei nenhuma avaliação independente da transcrição ou da reescrita de voz do Subtext, então tudo isto se apoia no que o aplicativo mostra e no que os prompts e a política de privacidade dele dizem. Como nenhum dos estudos acima testou a Deepgram, o modelo de fala que transcreve o áudio do Subtext, não sei dizer até que ponto os padrões de erro para sotaques, fala em segunda língua e estilo informal valem para ela, então leia a mensagem de volta antes de enviar.

O que acontece com uma gravação de voz no Subtext?

O Subtext envia a gravação de voz para a Deepgram para transcrição, então o áudio sai do celular. A política de privacidade dele, atualizada em 26 de julho de 2026, nomeia vários fornecedores, entre eles a Deepgram para gravações de voz, a Anthropic para texto, imagens e transcrições de voz, o Google Firebase para contas e conversas, e a OpenAI só se você ativar a leitura em voz alta. A política acrescenta que, quando a busca na web está ativada, termos de busca tirados do seu pedido passam pela Anthropic até provedores de busca de terceiros, e que você pode desativar a busca na web nos ajustes do aplicativo24. Ela diz que nada do que você envia é usado para treinar um modelo de IA e que nenhum dos fornecedores de IA dele pode treinar com isso, com o Subtext ainda ativando a opção de recusa de melhoria de modelo da Deepgram para voz. Diz que o Subtext apaga a sua própria cópia de uma conversa dos servidores cinco dias depois da última vez que você a usou, ou 90 dias se você a fixar. Diz que a Deepgram, com essa recusa ativada, guarda o áudio só pelo tempo que leva para transcrevê-lo, e que a Anthropic apaga entradas e saídas em até 30 dias, e pode guardar pedidos sinalizados por até dois anos e as pontuações de segurança relacionadas por até sete anos. Diz que o Subtext não tem acordo de retenção zero com nenhum deles24. Como os outros assistentes tratam o seu texto está comparado em quais assistentes de escrita com IA treinam com as suas mensagens.

Quais idiomas o Subtext aceita?

O Subtext escreve a mensagem no idioma em que você falou, em 17+ idiomas, e mantém o nível de formalidade que você usou quando o idioma marca algum. Um áudio em alemão volta como uma mensagem em alemão. O resumo de um áudio que você recebeu é escrito no idioma em que ele chegou. Os editores do Google Play destacaram esse fluxo em um texto “Hot Tip” que descreve tocar no ícone do microfone, falar, tocar de novo e receber uma mensagem refinada, com etiquetas de como o original soou e um botão de copiar25. Quando abri a página em 4 de outubro de 2026, a ficha na loja alemã mostrava 4,3 estrelas em 295 avaliações e mais de 50.000 downloads, contagem só do Google Play; a nota em estrelas muda de país para país. O Subtext é pago, com algumas análises grátis para começar. Um áudio gravado volta como uma mensagem pronta para enviar.

Como responder a um áudio longo que alguém te mandou?

O Subtext também lê os áudios que outras pessoas mandam para você, e é nesse lado que uma transcrição simples chega mais perto de bastar. A transcrição no aparelho do WhatsApp deixa você ler uma gravação de dois minutos nos idiomas cobertos23. O que ela não faz é dizer o que a pessoa quer. O exemplo do próprio estudo de Ulm era uma data e um lugar enterrados no áudio9. Um áudio longo de um amigo ou de um gestor tem o mesmo formato, a pergunta em algum lugar no meio e as razões em volta. Para quem trava nas respostas, a etapa de leitura é um dos cinco lugares em que uma resposta fica presa, e a maioria dos participantes do estudo de campo de Ulm adiava as mensagens de voz no trabalho porque uma gravação não se capta de relance9.

Solte uma mensagem de voz recebida no Subtext e ele a transcreve, resume em uma linha o que a pessoa quer de você e acrescenta de dois a cinco pontos de ação. Depois ele pode redigir uma resposta que retoma o fio, e não rotula o tom de quem enviou. Os prompts do backend tratam um arquivo de voz que você anexa como provavelmente enviado a você pela outra pessoa e, se o modelo não tem certeza de quem é quem, ele é instruído a perguntar. O resumo é tão bom quanto a transcrição por baixo, e uma linha é difícil de ler sem o contexto, como mostra o que essa mensagem quer dizer. Com um sotaque forte ou uma gravação ruidosa, a transcrição terá mais erros do que com um inglês de estúdio, então ouça o original antes de responder qualquer coisa que importe. Texto e prints passam pela mesma etapa de resumo, então uma mensagem que você recebeu recebe o mesmo resumo de uma linha.

Os experimentos mais próximos são antigos e pequenos

Os dois experimentos mais próximos de uma etapa de reescrita ou de um resumo que encontrei são de 2003 e 2005, e ambos são pequenos. Em 2003, um experimento financiado pela DARPA pediu a 28 falantes nativos de inglês que lessem trechos de 150 a 250 palavras de fala telefônica e de transmissão, como transcrições literais e como transcrições limpas à mão. Os leitores acharam o texto limpo mais fácil de entender, mas responderam a perguntas sobre ele sem mais precisão nem rapidez, o que os autores atribuem ao fato de os leitores já chegarem perto do teto. A limpeza automática de uma saída imperfeita do reconhecedor tendeu a ser avaliada como mais difícil do que a versão não limpa, ainda que só por pouco26. A limpeza removia disfluências e corrigia a pontuação, mas não reescrevia o texto até virar uma mensagem.

Em 2005, 16 pessoas responderam a perguntas sobre 15 mensagens de caixa postal a partir de resumos extraídos automaticamente. Os resumos feitos a partir de fala reconhecida acertaram o nome de quem ligou em 57 por cento das vezes, contra 94 por cento dos resumos feitos a partir de transcrições humanas, enquanto o motivo da ligação passou igualmente bem, em 78 por cento. As pessoas pediram o áudio original com mais frequência quando o resumo vinha de fala reconhecida, 53 por cento das vezes contra 30 por cento27. Eram resumos extrativos de mensagens de caixa postal feitos com o reconhecimento de fala de 2005, então o estudo só estabelece uma expectativa. Nenhum dos dois estudos mediu uma mensagem que alguém enviaria.

Onde a evidência acaba

A evidência forte está nas duas pontas. A língua falada carrega disfluência a uma taxa medida que a escrita não tem, e o reconhecimento de fala erra mais para alguns falantes do que para outros, como mostram os números acima. O meio é mais fraco. Não encontrei nenhum estudo que medisse quanto melhor um áudio reescrito chega do que uma transcrição bruta, nem com que frequência uma reescrita muda o sentido no caminho. A pesquisa sobre mensagens de voz é um punhado de estudos, o maior com uma amostra de pesquisa de uma plataforma americana de crowdsourcing e um estudo de campo com seis pessoas. A pesquisa da YouGov é de um país e de um ano. E os estudos sobre áudios são anteriores às transcrições no aparelho, então a transferência de esforço que descrevem hoje foi em parte reduzida pelos próprios mensageiros.

Na prática, tudo depende de como você fala. Se você fala em frases limpas, o ditado basta, e o seu celular já tem. Se você fala como os falantes daqueles corpora, com as hesitações que Clark e Fox Tree contaram e os recomeços que Shriberg catalogou, a transcrição entrega ao destinatário o seu processo de rascunho, e uma etapa de reescrita é o que a transforma em mensagem. O Subtext é um aplicativo que faz essa etapa, para o áudio que você grava e para o que você recebeu, e se o seu problema é uma resposta que você não para de editar, por que uma resposta curta leva uma hora é sobre esse ciclo. Experimente o Subtext no navegadorExperimente o Subtext no navegador

Fontes

Numeradas na ordem em que aparecem pela primeira vez. As páginas foram checadas em 4 e 5 de outubro de 2026, e a política de privacidade do Subtext foi aberta de novo em 10 de outubro de 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 a 169. Estudo de corpus de conversas em inglês americano; taxas e tipos de disfluência.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Artigo de conferência; o PDF não traz ano, e as referências citadas vão até 1996. Corpora rotulados à mão, com 40.515 palavras de 30 falantes (Switchboard) e 12.762 palavras de 523 falantes (AMEX, ligações entre funcionários do SRI e agentes de viagem). Financiado pela DARPA e pela NSF. . Checado em 5 de outubro de 2026.
  3. Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 a 111. Taxas de hesitação por falante do corpus London-Lund.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 a 7689. Cinco sistemas comerciais, 42 falantes brancos e 73 negros, 19,8 horas de áudio.
  5. Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Só o resumo; o texto completo não estava acessível quando conferi.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Pré-publicação no arXiv.
  7. OpenAI. Whisper README. GitHub. . Checado em 4 de outubro de 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 trechos de áudio de 437 participantes gravados em instituições dos EUA, com e sem afasia, passados pela API do Whisper em abril e maio de 2023. Financiado pelo Pulitzer Center e pelo Center for Social Sciences da Cornell.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Pesquisa com 1.003 pessoas e estudo de campo de duas semanas com 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publicado em dezembro de 2017. Estudo de laboratório com 48 estudantes universitários, 24 por idioma, copiando frases em um iPhone. Dois autores trabalhavam para a Baidu USA, cujo sistema de fala no servidor, o Deep Speech 2, rodava em um servidor da Baidu e foi testado por um aplicativo em um iPhone 6 Plus.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 estudos, 18.573 participantes.
  12. Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversas telefônicas do Switchboard.
  13. YouGov. How many Britons like voice notes? 14 de junho de 2022. Pesquisa com 2.149 adultos do Reino Unido, trabalho de campo em 5 e 6 de maio de 2022, 1.956 deles usuários de smartphone; os números sobre duração são parcelas dos entrevistados que responderam. Tabelas de resultados em . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Checado em 4 e 5 de outubro de 2026. As porcentagens seguem o texto do artigo da YouGov; as tabelas de resultados dão totais um pouco diferentes para quem não gosta, por arredondamento.
  14. Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 a 71. Conversas de WhatsApp em alemão e espanhol; resumo lido pelo registro da Crossref da editora, texto completo atrás de acesso pago.
  15. Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Checado em 4 de outubro de 2026.
  16. Apple. Siri, Dictation & Privacy. Página jurídica, atualizada pela última vez em 14 de setembro de 2026. . Checado em 5 de outubro de 2026.
  17. Google. Type with your voice. Ajuda do Gboard. . Checado em 4 de outubro de 2026.
  18. Google. Use advanced voice typing features. Ajuda do Gboard. . Checado em 5 de outubro de 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Checado em 5 de outubro de 2026.
  20. Otter.ai. Convert Speech to Text. . Checado em 4 de outubro de 2026.
  21. Otter.ai. Supported languages. Otter Help Center, artigo editado em 6 de maio de 2026. . Checado em 5 de outubro de 2026.
  22. MacWhisper. Homepage. Página de marketing, sem data, então mostra o que o produto anuncia e não como ele se comporta. . Checado em 5 de outubro de 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21 de novembro de 2024. . Checado em 4 de outubro de 2026.
  24. Subtext, Termos, privacidade e sua conta. Política de privacidade atualizada pela última vez em 26 de julho de 2026. Checada em 10 de outubro de 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Checado em 4 de outubro de 2026; a ficha mostrava 295 avaliações e 50K+ downloads em todas as lojas que abri, e 4,3 estrelas na alemã.
  26. Jones, D. A., e seis coautores (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 a 1588. 32 falantes nativos de inglês recrutados, 28 analisados. Patrocinado pela DARPA sob o contrato F19628-00-C-0002 da Força Aérea.
  27. Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Teste de compreensão com 16 participantes e 15 mensagens de correio de voz; números lidos do PDF hospedado pelos autores. Financiado por um prêmio ROPA do EPSRC, GR/R23954.