ArtigosFerramentas de escrita
Porque é que a transcrição de uma nota de voz não é uma mensagem
O ditado transforma uma nota de voz em texto, mas tende a manter as palavras de enchimento, os recomeços e a ordem em que foste pensando. O que diz a investigação e o que acrescenta uma reescrita.
Por Samet Durgun · Cofundador da Subtext · 21 min de leitura
· Atualizado a 10 de outubro de 2026
A fala traz palavras de enchimento, falsos começos e correções a meio da frase que a escrita acabada quase não tem, por isso a transcrição simples de uma nota de voz ainda não é uma mensagem. Os telemóveis escrevem o que disseste, e o Otter, as transcrições do WhatsApp e as apps construídas sobre modelos abertos de fala também, mas a transcrição de uma nota de voz dispersa continua a ser uma mensagem dispersa. Mantém o “hum”, a correção que fizeste a meio e a ordem em que te foram ocorrendo as coisas. Uma app que transforma uma nota de voz numa mensagem de texto clara tem de fazer um segundo trabalho depois da transcrição. Tem de perceber o que querias dizer e escrever isso.
A primeira metade é investigação. Os linguistas mediram como a língua falada difere da escrita, os investigadores de reconhecimento de fala mediram onde a transcrição falha e para quem, e alguns estudos perguntaram porque é que as pessoas enviam notas de voz e porque é que quem as recebe as vai adiando. A segunda metade é o que fazem as ferramentas de ditado que as pessoas já têm, o que acrescenta um passo de reescrita e o que o Subtext faz com uma nota de voz.
Como cofundador do Subtext, onde a voz é uma de três formas de entrada, ao lado de um rascunho escrito e de uma captura de ecrã de uma conversa, tenho interesse na resposta. Todas as fontes abaixo são fontes que abri. Onde só consegui chegar a um resumo, digo-o e não cito nenhum valor retirado dele.
A fala produz-se de forma diferente da escrita
A fala espontânea está cheia de material que a escrita deixa de fora. O levantamento de disfluências de Elizabeth Shriberg em vários corpora de fala espontânea do inglês americano aponta uma taxa de até dez por cento das palavras e mais de um terço dos enunciados1. As formas são as pausas preenchidas (“uh”, “um”), as repetições (“I I think”), as reparações em que uma palavra é substituída a meio da frase e os falsos começos, que ela classifica como supressões, em que uma oração é abandonada e recomeçada. Nos dois corpora de conversa entre humanos que examinou, conversas telefónicas informais e chamadas de planeamento de viagens, a taxa por palavra rondava os seis por cento1, em amostras de 40.515 e 12.762 palavras que o seu artigo da SRI sobre os mesmos corpora rotulou à mão2. Num corpus de pessoas a falar com um computador através de um botão de premir para falar, a taxa descia para menos de um por cento, e ela atribui parte da descida ao botão. Os falantes podiam planear o enunciado primeiro e só depois gravá-lo1. Numa nota de voz tocas uma vez e falas, e o planeamento acontece em voz alta.
As palavras de enchimento e quanto os falantes diferem
As palavras de enchimento faladas não são ruído, o que explica em parte porque é difícil tirá-las. Herbert Clark e Jean Fox Tree defenderam, a partir de vários corpora grandes, que “uh” e “um” são palavras por direito próprio, planeadas e produzidas como quaisquer outras, usadas para anunciar um atraso curto ou longo enquanto o falante procura a palavra seguinte ou decide o que dizer3. Variam também enormemente de falante para falante. No corpus London-Lund, cerca de 170.000 palavras de 50 conversas presenciais britânicas gravadas entre 1961 e 1976, sobretudo entre académicos, os 65 falantes que produziram mais de 1.000 palavras cada um iam de 1,2 a 88,5 palavras de enchimento por 1.000 palavras, com uma mediana de 17,33. Algumas transcrições saem quase limpas, outras trazem uma palavra de enchimento a cada dúzia de palavras.
A disfluência concentra-se também onde o planeamento é mais pesado. Shriberg observa, citando trabalho anterior, que é mais provável no início de uma frase1. Numa nota de voz, esse é o arranque, em que ainda estás a decidir para que serve a mensagem. Na escrita podes apagar esse arranque antes de alguém o ver. Numa nota de voz, esse arranque costuma seguir com o resto, a menos que voltes a gravar a mensagem toda.
Como os erros do reconhecimento de fala variam consoante o falante
A transcrição acrescenta os seus próprios erros aos que disseste. A medição mais clara que encontrei é um estudo de 2020 na PNAS que passou cinco reconhecedores de fala comerciais, da Amazon, da Apple, da Google, da IBM e da Microsoft, por 19,8 horas de áudio de entrevistas com 42 falantes americanos brancos e 73 negros4. A taxa média de erro por palavra foi de 0,19 para os falantes brancos e 0,35 para os negros, e todos os sistemas mostraram a diferença. O melhor, a Microsoft, teve 0,15 e 0,27. O pior, a Apple, teve 0,23 e 0,45. Mais de 20% dos clipes dos falantes negros voltaram com pelo menos metade das palavras erradas, contra menos de 2% dos clipes dos falantes brancos4. Os autores atribuem a diferença aos modelos acústicos, a parte que associa som a palavras, e apontam a falta de áudio de falantes negros nos dados de treino.
Um segundo padrão no mesmo artigo importa para as notas de voz. Os sistemas tiveram um desempenho ligeiramente pior com falantes masculinos, o que os autores atribuem a um estilo mais informal, com pronúncias mais curtas e reduzidas e mais disfluências4, o registo de uma nota de voz a um amigo.
Sotaques, segundas línguas e palavras que ninguém disse
O reconhecimento de fala também se sai pior com sotaques e com fala numa segunda língua. Um artigo de 2024 na JASA Express Letters testou o modelo Whisper da OpenAI em vários sotaques do inglês e registou maior exatidão para falantes nativos do que para falantes com inglês como segunda língua, melhores resultados para o inglês americano do que para o britânico ou o australiano, e melhores resultados com fala lida do que com conversa5. Só consegui chegar ao resumo, por isso cito a direção e nenhum número. O Whisper foi treinado com 680.000 horas de áudio, e os seus autores descrevem os modelos como próximos do nível humano em “accuracy and robustness”6. A sua própria documentação acrescenta que “performance varies widely depending on the language”7. Uma média entre falantes diz pouco sobre a nota de voz de alguém cansado na sua segunda língua. Se essa língua for o inglês, uma mensagem correta pode ainda assim soar abrupta a um leitor nativo, e uma transcrição não te vai dizer isso.
O Whisper também pode acrescentar palavras que ninguém disse. Um estudo de 2024 passou 13.140 clipes curtos em inglês de 437 participantes gravados em instituições dos EUA, com e sem afasia, pela API alojada do Whisper da OpenAI em abril e maio de 2023. Cerca de um por cento das transcrições continha expressões ou frases inteiras que não estavam no áudio, e 38% delas traziam pelo menos um dano explícito, como violência ou uma falsa alegação de autoridade. Os clipes com pausas longas corriam mais risco. Nos 187 clipes em que o Whisper tinha inventado texto, a Google, a Amazon, a Microsoft, a AssemblyAI e a RevAI não produziram invenções comparáveis. Os clipes eram entrevistas, não notas de voz, e o estudo testou a API tal como era em 20238.
Porque é que as pessoas enviam notas de voz
As pessoas enviam notas de voz porque são rápidas para quem envia. O maior estudo que encontrei é da Universidade de Ulm, um inquérito de 2020 a 1.003 pessoas recrutadas através do Amazon Mechanical Turk, sobretudo nos Estados Unidos, mais um estudo de campo de duas semanas com seis utilizadores frequentes9. No inquérito, 83% tinham recebido uma mensagem de voz e 73% tinham enviado uma. Os motivos para enviar, tirados de 735 respostas abertas de pessoas que tinham gravado uma mensagem de voz, agruparam-se em quatro temas. As contagens dos temas somam mais do que as 735 respostas, por isso algumas respostas couberam em mais de um tema. A conveniência, porque falar é mais rápido do que escrever num telemóvel, foi referida 359 vezes. O tom e a emoção que uma voz leva e o texto perde, 229. As situações em que escrever é incómodo ou perigoso, como conduzir, 203. E o recetor, que tinha pedido voz ou achava mais fácil, 34.
Um estudo de laboratório mediu a velocidade. Os seus 48 estudantes universitários, 24 deles falantes nativos de inglês, copiaram frases curtas num iPhone, e a entrada de fala em inglês correu a 153 palavras por minuto contra 52 no teclado, 2,93 vezes mais depressa, embora a fala deixasse ligeiramente mais erros por corrigir no texto final, 0,55% contra 0,35%. A tarefa era copiar frases dadas, o que diz pouco sobre compor uma mensagem. Dois dos autores trabalhavam para a Baidu, cujo reconhecedor do lado do servidor, o Deep Speech 2, foi testado através de uma app para iPhone 6 Plus, num artigo publicado em 201710.
As notas de voz passam o esforço de quem envia para quem recebe
No estudo de campo de Ulm, as 438 mensagens de voz registadas ao longo de duas semanas iam de 1,5 segundos a pouco mais de sete minutos, com uma mediana de 17,5 segundos9. Os autores apontam também um custo pago antes de qualquer destinatário ouvir. O som é transitório, por isso uma gravação é trabalhosa de rever e editar, e um deslize de língua obriga a gravar a mensagem toda outra vez9. Cinco das doze gravações abortadas no estudo de campo foram exatamente isso.
Os autores escrevem que as mensagens de voz “shift the effort necessary for communication towards the receiver”9. Compor é rápido, voltar a encontrar a informação leva mais tempo e esforço do que ler um texto com o mesmo conteúdo, e a maioria dos participantes do estudo de campo adiava as mensagens de voz no trabalho porque um texto se apreende de relance e uma gravação não. A solução que propuseram, em 2020, eram transcrições automáticas, para que a data e o local de um compromisso enterrados numa gravação se pudessem encontrar lendo o texto na diagonal.
Porque é que quem as recebe as adia
Quem recebe não consegue ler na diagonal, por isso volta atrás no que ouviu. No mesmo estudo de campo, as pessoas ouviram uma mensagem de voz recebida 1,37 vezes em média, e uma mensagem foi ouvida 13 vezes9. Ler não precisa de repetição. Uma meta-análise de 2019 com 190 estudos e 18.573 participantes situa a leitura silenciosa média de não ficção em inglês em 238 palavras por minuto11. A fala em conversa corre a cerca de 196 palavras por minuto se contares a chamada inteira e a cerca de 164 dentro dos turnos do próprio falante, num grande corpus telefónico12. O leitor também controla o ritmo e pode saltar para a pergunta. O ouvinte recebe as palavras à velocidade de quem fala, pela ordem de quem fala.
As pessoas não gostam muito delas, e gostam um pouco mais de as receber do que de as enviar. Uma sondagem da YouGov a 2.149 adultos do Reino Unido, feita a 5 e 6 de maio de 2022 e publicada em junho desse ano, perguntou aos utilizadores de smartphone entre eles, 1.956 pessoas, sobre notas de voz. Desses, 16% gostavam de as enviar e 36% não gostavam. Quanto a recebê-las, 22% gostavam, 25% não gostavam e 29% eram ambivalentes13. Só entre os 18 e os 24 anos havia mais pessoas a gostar de as receber do que a não gostar, 43% contra 28%, e mesmo nesse grupo metade não gostava de as enviar, contra 30% que gostava. De todos os utilizadores de smartphone, 63% nunca tinham enviado uma.
Quanto tempo é demasiado para uma nota de voz?
Numa sondagem da YouGov de maio de 2022 a utilizadores de smartphone do Reino Unido, 65% dos que responderam disseram que uma nota de voz de um minuto é demasiado longa, e entre os que não gostam de as receber e responderam, 57% ficavam frustrados com 30 segundos. Entre todos os utilizadores de smartphone, 27% não sabiam onde ficava o limite. Quando lhes perguntaram como preferiam receber uma mensagem longa, 78% escolheram texto e 14% uma nota de voz, o que regista apenas uma preferência declarada13. Alguns remetentes parecem saber que a gravação é uma imposição. Uma análise de 2024 a conversas de WhatsApp na Alemanha e em Espanha encontrou pessoas a justificar a escolha do áudio antes, dentro e depois da mensagem, e os autores descrevem estas justificações como trabalho social, incluindo enquadrar a nota de voz como algo por que vale a pena pedir desculpa14. Nestas três fontes, quem envia poupa esforço e quem recebe paga-o, e alguns remetentes pedem desculpa por isso.
O que o Ditado da Apple faz com uma nota de voz
O Ditado dá-te as palavras pela ordem em que as disseste, e no caso do Ditado da Apple esse é o trabalho todo. O guia do iPhone da Apple para o iOS 27 descreve o Ditado como processado no telemóvel, sem ligação à internet, em muitos idiomas, inserindo vírgulas, pontos finais e pontos de interrogação automaticamente nos idiomas em que isso é suportado15. Nos telemóveis mais recentes, um modelo no dispositivo melhora a ortografia, a pontuação e as maiúsculas, em inglês. Tudo o resto é um comando de voz. Dizes “nova linha”, dizes “apagar” seguido da frase. A alegação de processamento no dispositivo tem uma condição. A página de privacidade da Apple diz que, se as definições do teclado não mostrarem que o Ditado é processado no dispositivo, o que ditas é enviado para os servidores da Apple e não é guardado, a menos que atives Melhorar Siri e Ditado. Diz também que a Apple pode guardar o histórico de pedidos e as transcrições, associados a um identificador aleatório do dispositivo e não à tua Conta Apple, até dois anos16. A página não diz como as duas coisas se conciliam. Reescrever é trabalho das Ferramentas de escrita da Apple, que são um conjunto à parte e que não dão nenhuma leitura de como um texto é recebido.
O que fazem a escrita por voz da Google e da Microsoft
A escrita por voz básica do Gboard da Google, tal como o Ditado da Apple, dá-te as palavras como as disseste. Tocas no microfone, dizes o que queres escrever e dizes a pontuação, embora a escrita por voz e a pontuação não estejam disponíveis em todos os idiomas17. A escrita por voz avançada, nos Pixel 6 e posteriores, acrescenta pontuação enquanto falas, e nos Pixel 9 (excluindo o 9a) e posteriores um comando falado pode rever, reformular, encurtar ou alongar o que ditaste. A Google diz que isto corre no dispositivo, em inglês, francês, italiano, japonês e espanhol, com o alemão em breve18. No Windows, a página de ajuda da Microsoft diz que o Ditado fluido, uma funcionalidade dos PC Copilot+, corrige a gramática, a pontuação e as palavras de enchimento enquanto falas19. A escrita por voz avançada só reescreve quando lhe dás um comando falado. O Ditado fluido funciona sem comando, mas só em PC Copilot+, e a sua página de ajuda não menciona reordenar a mensagem. Nas páginas de ajuda da Apple, da Google e da Microsoft aqui citadas não encontrei nenhuma funcionalidade que, por defeito, transforme uma nota de voz inteira e dispersa numa mensagem pronta a enviar.
O que fazem as apps de transcrição e as aplicações de mensagens
O Otter, uma app de transcrição, vai um passo além do teclado do telemóvel. A sua página de fala para texto descreve uma transcrição com etiquetas de falante e marcas de tempo, um resumo gerado automaticamente com destaques e pontos-chave e itens de ação extraídos20. O centro de ajuda do Otter lista inglês, espanhol, francês, alemão, japonês e chinês (simplificado) como idiomas suportados21, o que é mais do que diz a página de fala para texto. Foi feito para reuniões, por isso condensa o que foi dito, e não encontrei nessas duas páginas nenhuma funcionalidade que redija o que querias enviar. Há modelos abertos de fala por baixo de algumas apps. O próprio Whisper produz uma transcrição e uma etiqueta de idioma7. As apps construídas sobre ele variam. O MacWhisper anuncia remoção de palavras de enchimento, resumos e prompts personalizados sobre a transcrição, e oferece modelos locais ou na nuvem para esse passo22.
As aplicações de mensagens começaram a transcrever as notas de voz que recebes. O WhatsApp acrescentou transcrições de mensagens de voz em novembro de 2024, geradas no dispositivo para que o próprio WhatsApp não as consiga ler, ativadas nas Definições, em Conversas, e acionadas com um toque longo na mensagem23. O post diz que as transcrições começaram em alguns idiomas selecionados, e não consegui confirmar a lista atual. Isso responde ao problema de ler na diagonal que os autores de Ulm identificaram, onde o idioma é coberto. O que recebes é a transcrição do pensamento em voz alta de outra pessoa. Podes lê-la numa reunião, mas continuas a ter de escrever a resposta.
O que acrescenta um passo de reescrita
Um passo de reescrita transforma a transcrição na mensagem que terias escrito se escrever não custasse nada. Tira as palavras de enchimento que Clark e Fox Tree descrevem, junta as repetições e os falsos começos da taxonomia de Shriberg e põe a correção que fizeste a meio no sítio a que pertence, a substituir aquilo que corrigiu. Também reordena. As explicações faladas tendem a chegar como te foram ocorrendo, o contexto primeiro e o pedido no fim, ou o pedido primeiro e as razões a arrastar-se depois. Uma mensagem escrita pode abrir com o essencial.
Há duas coisas que o passo tem de deixar intactas. A primeira é o significado. Uma reescrita que alisa a tua nota de voz num pedido diferente é pior do que a transcrição, porque a transcrição ao menos dizia o que disseste. A segunda é o tom. Se o teu tom era caloroso, ou direto, ou brincalhão, a versão escrita deve soar à mesma pessoa. O modo de falha aqui é o tratado em a IA põe as tuas mensagens a soar a robô, em que uma reescrita volta educada e genérica.
Há também um juízo que uma transcrição nunca tem de fazer. Parte do que disseste numa nota de voz era para ti, não para o destinatário. Pensar em voz alta se deves mencionar uma coisa não quer dizer que querias mencioná-la. Um passo de reescrita tem de decidir o que era a mensagem e o que era o rascunho, e essa decisão pode correr mal nos dois sentidos, ficando com uma frase que estavas a convencer-te a não dizer ou largando uma que querias mesmo dizer. Não encontrei nenhum estudo que medisse com que frequência isso acontece com qualquer ferramenta, incluindo o Subtext.
O que o Subtext faz com uma nota de voz
O Subtext transcreve a nota de voz que gravas na app, depois escreve a mensagem a partir do que querias dizer e devolve até três versões, cada uma com uma nota de envio que indica a probabilidade de ser recebida como querias. As versões são feitas para manter o teu significado e a tua personalidade. Num primeiro rascunho, uma fica perto das tuas palavras com os problemas corrigidos, outra é um polimento mais caloroso ou uma abordagem diferente, e outra é uma reescrita mais completa. Se a formulação soar mais fria ou mais seca do que pretendias, a app nomeia o problema e marca as palavras responsáveis. A app não envia nada por ti.
As instruções do modelo cobrem artefactos de transcrição, e li os prompts do backend antes de escrever isto. Quando uma mensagem é assinalada como ditada, o modelo é instruído a esperar palavras mal ouvidas ou fundidas, pontuação estranha e palavras de enchimento perdidas, a ler através delas até à formulação pretendida e a corrigi-las em silêncio, sem as assinalar como algo que fizeste mal. O prompt mostra o que o modelo é instruído a fazer. Não encontrei nenhuma avaliação independente da transcrição de voz ou da reescrita do Subtext, por isso tudo isto assenta no que a app mostra e no que dizem os seus prompts e a sua política de privacidade. Como nenhum dos estudos acima testou a Deepgram, o modelo de fala que transcreve o áudio do Subtext, não posso dizer até que ponto os padrões de erro para sotaques, fala numa segunda língua e estilo informal se aplicam a ela, por isso relê a mensagem antes de a enviares.
O que acontece a uma gravação de voz no Subtext?
O Subtext envia uma gravação de voz à Deepgram para transcrição, por isso o áudio sai do telemóvel. A sua política de privacidade, atualizada a 26 de julho de 2026, nomeia vários fornecedores, entre eles a Deepgram para gravações de voz, a Anthropic para texto, imagens e transcrições de voz, a Google Firebase para contas e conversas e a OpenAI só se ativares a leitura em voz alta. A política acrescenta que, quando a pesquisa na web está ativa, os termos de pesquisa tirados do teu pedido passam pela Anthropic para fornecedores de pesquisa terceiros, e que podes desativar a pesquisa na web nas definições da app24. Diz que nada do que submetes é usado para treinar um modelo de IA e que nenhum dos seus fornecedores de IA pode treinar com isso, e que o Subtext também ativa a opção de recusa de melhoria de modelo da Deepgram para a voz. Diz que o Subtext apaga a sua própria cópia de uma conversa dos seus servidores cinco dias depois da última vez que a usaste, ou 90 dias se a fixares. Diz que a Deepgram, com essa recusa ativa, só guarda o áudio o tempo que demora a transcrevê-lo, e que a Anthropic apaga entradas e saídas no prazo de 30 dias, e pode guardar pedidos assinalados até dois anos e as pontuações de segurança associadas até sete anos. Diz que o Subtext não tem acordo de retenção zero com nenhum deles24. Como outros assistentes tratam o teu texto é comparado em que assistentes de escrita com IA treinam com as tuas mensagens.
Que idiomas suporta o Subtext?
O Subtext escreve a mensagem no idioma em que falaste, em 17+ idiomas, e mantém o nível de formalidade que usaste onde o idioma o marca. Uma nota de voz em alemão volta como uma mensagem em alemão. O resumo de uma nota de voz que recebeste é escrito no idioma em que chegou. Os editores da Google Play destacaram este fluxo num artigo “Hot Tip” que descreve tocar no ícone do microfone, falar, voltar a tocar e receber uma mensagem refinada, com etiquetas sobre como o original soou e um botão de copiar25. Quando abri a página a 4 de outubro de 2026, a ficha na loja alemã mostrava 4,3 estrelas em 295 avaliações e mais de 50.000 descarregamentos, uma contagem só da Google Play, e o valor das estrelas difere de país para país. Usar o Subtext custa dinheiro, e algumas análises são gratuitas para começar. Uma nota de voz gravada volta como uma mensagem que podes enviar.
Como respondes a uma mensagem de voz longa que alguém te enviou?
O Subtext também lê as mensagens de voz que outras pessoas te enviam, e é neste lado que uma transcrição simples chega mais perto de bastar. A transcrição no dispositivo do WhatsApp deixa-te ler uma gravação de dois minutos nos idiomas que cobre23. O que não faz é dizer-te o que a pessoa quer. O exemplo do próprio estudo de Ulm era uma data e um local enterrados no áudio9. Uma nota de voz longa de um amigo ou de um chefe tem a mesma forma, a pergunta algures a meio e as razões à volta. Para quem adia as respostas, o passo de leitura é um dos cinco sítios em que uma resposta encrava, e a maioria dos participantes do estudo de campo de Ulm adiava as mensagens de voz no trabalho porque uma gravação não se apreende de relance9.
Se largares uma mensagem de voz recebida no Subtext, ele transcreve-a, resume numa linha o que a pessoa quer de ti e acrescenta de dois a cinco pontos de ação. Pode depois redigir uma resposta que pega no fio, e não rotula o tom de quem enviou. Os prompts do backend tratam um ficheiro de voz que anexas como provavelmente enviado a ti pela outra pessoa, e se o modelo não tiver a certeza de quem é quem, é instruído a perguntar. O resumo é tão bom quanto a transcrição por baixo, e uma linha lê-se mal sem o seu contexto, como mostra o que quer dizer esta mensagem. Com um sotaque forte ou uma gravação com ruído, a transcrição trará mais erros do que com inglês de estúdio, por isso ouve o original antes de responderes a qualquer coisa que importe. O texto e as capturas de ecrã passam pelo mesmo passo de resumo, por isso uma mensagem que recebeste recebe o mesmo resumo de uma linha.
As experiências mais próximas são antigas e pequenas
As duas experiências mais próximas de um passo de reescrita ou de um resumo que encontrei são de 2003 e 2005, e ambas são pequenas. Em 2003, uma experiência financiada pela DARPA fez 28 falantes nativos de inglês lerem passagens de 150 a 250 palavras de fala telefónica e de emissões, como transcrições literais e como transcrições limpas à mão. Os leitores classificaram o texto limpo como mais fácil de perceber, mas responderam a perguntas sobre ele sem mais exatidão nem rapidez, o que os autores atribuem ao facto de os leitores já terem pontuações próximas do máximo. A limpeza automática da saída imperfeita de um reconhecedor tendia a ser classificada como mais difícil do que a versão não limpa, embora só marginalmente26. A limpeza removia disfluências e corrigia a pontuação, mas não reescrevia o texto numa mensagem.
Em 2005, 16 pessoas responderam a perguntas sobre 15 mensagens de caixa de correio de voz a partir de resumos extraídos automaticamente. Os resumos construídos a partir de fala reconhecida acertaram o nome de quem ligou 57% das vezes, contra 94% nos resumos construídos a partir de transcrições humanas, enquanto o motivo da chamada passou igualmente bem, 78%. As pessoas pediram o áudio original mais vezes quando o resumo vinha de fala reconhecida, 53% das vezes contra 30%27. Eram resumos extrativos de mensagens de caixa de correio de voz feitos com o reconhecimento de fala de 2005, por isso o estudo só estabelece uma expectativa. Nenhum dos estudos mediu uma mensagem que alguém enviaria.
Onde a evidência acaba
A evidência forte está nas duas pontas. A língua falada traz disfluência a uma taxa medida que a escrita não tem, e o reconhecimento de fala comete mais erros com uns falantes do que com outros, com os números acima a prová-lo. O meio é mais ténue. Não encontrei nenhum estudo que medisse quanto melhor é recebida uma nota de voz reescrita do que uma transcrição em bruto, nem com que frequência uma reescrita muda o significado pelo caminho. A investigação sobre mensagens de voz é um punhado de estudos, o maior com uma amostra de inquérito tirada de uma plataforma de crowdsourcing norte-americana e um estudo de campo com seis pessoas. A sondagem da YouGov é de um país e de um ano. E os estudos sobre notas de voz são anteriores às transcrições no dispositivo, por isso a mudança de esforço que descrevem está agora em parte atenuada pelas próprias aplicações de mensagens.
Na prática, tudo depende de como falas. Se falas em frases limpas, o ditado chega, e o teu telemóvel já o tem. Se falas como os falantes desses corpora, com as palavras de enchimento que Clark e Fox Tree contaram e os recomeços que Shriberg catalogou, uma transcrição entrega ao destinatário o teu processo de rascunho, e um passo de reescrita é o que a transforma numa mensagem. O Subtext é uma app que faz esse passo, para a nota de voz que gravas e para a que recebeste, e se o teu problema é uma resposta que não paras de editar, porque é que uma resposta curta demora uma hora trata desse ciclo. Experimentar o Subtext no browserDigitaliza com a câmara do telemóvel para instalar.Experimentar o Subtext no browser
Fontes
Numeradas pela ordem em que aparecem acima. As páginas foram verificadas a 4 e 5 de outubro de 2026, e a política de privacidade do Subtext foi aberta de novo a 10 de outubro de 2026.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 a 169. Estudo de corpus de conversação em inglês americano; taxas e tipos de disfluência.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Artigo de conferência; o PDF não traz o ano e as referências citadas chegam a 1996. Corpora rotulados à mão com 40.515 palavras de 30 falantes (Switchboard) e 12.762 palavras de 523 falantes (AMEX, chamadas entre funcionários da SRI e agentes de viagens). Financiado pela DARPA e pela NSF. . Verificado a 5 de outubro de 2026.
- Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 a 111. Taxas de palavras de enchimento por falante a partir do corpus London-Lund.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 a 7689. Cinco sistemas comerciais, 42 falantes brancos e 73 negros, 19,8 horas de áudio.
- Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Só o resumo; o texto completo não estava acessível quando verifiquei.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Pré-publicação no arXiv.
- OpenAI. Whisper README. GitHub. . Verificado a 4 de outubro de 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 segmentos de áudio de 437 participantes gravados em instituições dos EUA, com e sem afasia, passados pela API do Whisper em abril e maio de 2023. Financiado pelo Pulitzer Center e pelo Center for Social Sciences da Cornell.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Inquérito a 1.003 pessoas e estudo de campo de duas semanas com 6.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publicado em dezembro de 2017. Estudo de laboratório com 48 estudantes universitários, 24 por idioma, a copiar frases num iPhone. Dois autores trabalhavam para a Baidu USA, cujo sistema de fala do lado do servidor, o Deep Speech 2, corria num servidor da Baidu e foi testado através de uma app para iPhone 6 Plus.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 estudos, 18.573 participantes.
- Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversas telefónicas Switchboard.
- YouGov. How many Britons like voice notes? 14 de junho de 2022. Sondagem a 2.149 adultos do Reino Unido, trabalho de campo a 5 e 6 de maio de 2022, 1.956 deles utilizadores de smartphone; os valores de duração são partes dos inquiridos que deram uma resposta. Tabelas de resultados em . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Verificado a 4 e 5 de outubro de 2026. As percentagens seguem o texto do artigo da YouGov; as tabelas de resultados dão totais ligeiramente diferentes para quem não gosta, por arredondamento.
- Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 a 71. Conversas de WhatsApp em alemão e em espanhol; resumo lido através do registo Crossref da editora, texto completo atrás de paywall.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Verificado a 4 de outubro de 2026.
- Apple. Siri, Dictation & Privacy. Legal, última atualização a 14 de setembro de 2026. . Verificado a 5 de outubro de 2026.
- Google. Type with your voice. Gboard Help. . Verificado a 4 de outubro de 2026.
- Google. Use advanced voice typing features. Gboard Help. . Verificado a 5 de outubro de 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Verificado a 5 de outubro de 2026.
- Otter.ai. Convert Speech to Text. . Verificado a 4 de outubro de 2026.
- Otter.ai. Supported languages. Otter Help Center, artigo editado a 6 de maio de 2026. . Verificado a 5 de outubro de 2026.
- MacWhisper. Homepage. Página de marketing, sem data, por isso mostra o que o produto anuncia e não como se comporta. . Verificado a 5 de outubro de 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 de novembro de 2024. . Verificado a 4 de outubro de 2026.
- Subtext, Terms, privacy and your account. Política de privacidade atualizada a 26 de julho de 2026. Verificado a 10 de outubro de 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Verificado a 4 de outubro de 2026; a ficha mostrava 295 avaliações e mais de 50 mil descarregamentos em todas as lojas que abri, e 4,3 estrelas na alemã.
- Jones, D. A., e seis coautores (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 a 1588. 32 falantes nativos de inglês recrutados, 28 analisados. Patrocinado pela DARPA ao abrigo do contrato F19628-00-C-0002 da Força Aérea.
- Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Teste de compreensão com 16 participantes e 15 mensagens de caixa de correio de voz; valores lidos do PDF alojado pelos autores. Financiado por uma bolsa EPSRC ROPA, GR/R23954.