ArtículosHerramientas de escritura

Por qué la transcripción de una nota de voz no es un mensaje

El dictado convierte una nota de voz en texto, pero suele dejar las muletillas, los arranques en falso y el orden en que se te fue ocurriendo todo. Qué dice la investigación y qué agrega un paso de reescritura.

Por Samet Durgun · Cofundador de Subtext · 21 min de lectura

Al hablar sueltas muletillas, arranques en falso y correcciones a media frase que la escritura ya terminada casi no tiene, así que la transcripción de una nota de voz todavía no es un mensaje. El celular va a escribir lo que dijiste, y también lo hacen Otter, las transcripciones de WhatsApp y las apps hechas sobre modelos de voz abiertos, pero la transcripción de una nota de voz que da muchas vueltas sigue siendo un mensaje que da muchas vueltas. Conserva los “eh”, la corrección que hiciste a la mitad y el orden en que se te fueron ocurriendo las cosas. Una app que convierte una nota de voz en un mensaje claro tiene que hacer un segundo trabajo después de transcribir. Tiene que entender qué querías decir y escribir eso.

La primera mitad es investigación. Lingüistas han medido en qué se distingue el lenguaje hablado del escrito, investigadores de reconocimiento de voz han medido dónde falla la transcripción y para quién, y unos cuantos estudios han preguntado por qué la gente manda notas de voz y por qué quienes las reciben las dejan para después. La segunda mitad es lo que hacen las herramientas de dictado que la gente ya tiene, lo que agrega un paso de reescritura y lo que hace Subtext con una nota de voz.

Como cofundador de Subtext, donde la voz es una de tres formas de entrar junto con un borrador escrito y la captura de una conversación, tengo un interés en la respuesta. Abrí todas las fuentes de abajo. Donde solo pude llegar a un resumen, lo digo y no cito ninguna cifra de él.

El habla se produce distinto a la escritura

El habla espontánea está llena de material que la escritura deja fuera. La revisión que hizo Elizabeth Shriberg de las disfluencias en varios corpus de habla espontánea del inglés estadounidense calcula la tasa en hasta diez por ciento de las palabras y más de un tercio de los enunciados1. Las formas son las pausas llenas (“uh”, “um”), las repeticiones (“yo yo creo”), las reparaciones, donde una palabra se cambia a media oración, y los arranques en falso, que ella clasifica como supresiones, donde una cláusula se abandona y se empieza de nuevo. En los dos corpus de conversación entre personas que examinó, llamadas telefónicas informales y llamadas para planear viajes, la tasa por palabra fue de alrededor de seis por ciento1, en muestras de 40,515 y 12,762 palabras que su artículo de SRI sobre los mismos corpus etiquetó a mano2. En un corpus de personas que le hablaban a una computadora con un botón de presionar para hablar, la tasa bajó a menos de uno por ciento, y ella atribuye parte de la caída al botón. Los hablantes podían planear el enunciado primero y grabarlo después1. En una nota de voz tocas una vez y hablas, y la planeación ocurre en voz alta.

Las muletillas orales y cuánto varían los hablantes

Las muletillas orales no son ruido, y eso explica en parte por qué cuesta quitarlas. Herbert Clark y Jean Fox Tree sostuvieron, a partir de varios corpus grandes, que “uh” y “um” son palabras por derecho propio, planeadas y producidas como cualquier otra, que se usan para anunciar una demora corta o larga mientras el hablante busca la siguiente palabra o decide qué decir3. También varían muchísimo de un hablante a otro. En el corpus de Londres-Lund, unas 170,000 palabras de 50 conversaciones británicas cara a cara grabadas entre 1961 y 1976, sobre todo entre académicos, los 65 hablantes que produjeron más de 1,000 palabras cada uno iban de 1.2 a 88.5 muletillas por cada 1,000 palabras, con una mediana de 17.33. Algunas transcripciones salen casi limpias y otras traen una muletilla cada doce palabras.

La disfluencia también se concentra donde la planeación pesa más. Shriberg señala, con base en trabajos anteriores, que es más probable al principio de una frase1. En una nota de voz ese es el arranque, cuando todavía estás decidiendo para qué es el mensaje. Al escribir puedes borrar ese arranque antes de que alguien lo vea. En una nota de voz casi siempre le llega a quien la recibe, a menos que grabes todo el mensaje otra vez.

Cómo cambian los errores del reconocimiento de voz según el hablante

La transcripción suma sus propios errores a los que dijiste al hablar. La medición más clara que encontré es un estudio de 2020 en PNAS que puso a prueba cinco sistemas comerciales de reconocimiento de voz, de Amazon, Apple, Google, IBM y Microsoft, con 19.8 horas de audio de entrevistas de 42 hablantes blancos y 73 hablantes negros de Estados Unidos4. La tasa promedio de error por palabra fue de 0.19 para los hablantes blancos y de 0.35 para los negros, y todos los sistemas mostraron la brecha. El de mejor desempeño, Microsoft, sacó 0.15 y 0.27. El peor, Apple, sacó 0.23 y 0.45. Más de 20 por ciento de los clips de los hablantes negros salió con al menos la mitad de las palabras mal, contra menos de 2 por ciento de los clips de los hablantes blancos4. Los autores rastrearon la brecha hasta los modelos acústicos, la parte que convierte el sonido en palabras, y señalan que los datos de entrenamiento tienen muy poco audio de hablantes negros.

Otro patrón del mismo artículo importa para las notas de voz. Los sistemas funcionaron algo peor con los hablantes hombres, lo que los autores atribuyen a un estilo más informal, con pronunciaciones más cortas y reducidas y más disfluencias4, el registro de una nota de voz a un amigo.

Acentos, segundas lenguas y palabras que nadie dijo

El reconocimiento de voz también rinde peor con acentos y con el habla en una segunda lengua. Un artículo de 2024 en JASA Express Letters probó el modelo Whisper de OpenAI con distintos acentos del inglés y reportó mayor precisión con hablantes nativos que con quienes tienen el inglés como segunda lengua, mejores resultados con el inglés estadounidense que con el británico o el australiano, y mejores resultados con habla leída que con conversación5. Solo pude llegar al resumen, así que cito la dirección y ningún número. Whisper se entrenó con 680,000 horas de audio, y sus autores describen los modelos como cercanos a la “accuracy and robustness” humanas6. Su propia documentación agrega que “performance varies widely depending on the language”7. Un promedio entre hablantes dice poco sobre una nota de voz grabada con cansancio en tu segunda lengua. Si esa lengua es el inglés, un mensaje correcto todavía puede sonar seco para quien lo lee como nativo, y la transcripción no te lo va a decir.

Whisper también puede agregar palabras que nadie dijo. Un estudio de 2024 procesó 13,140 clips cortos en inglés de 437 participantes grabados en instituciones de Estados Unidos, con y sin afasia, con la API alojada de Whisper de OpenAI en abril y mayo de 2023. Más o menos uno por ciento de las transcripciones contenía frases u oraciones enteras que no estaban en el audio, y 38 por ciento de ellas traía al menos un daño explícito, como violencia o una falsa afirmación de autoridad. Los clips con pausas largas corrían más riesgo. En los 187 clips donde Whisper había inventado texto, Google, Amazon, Microsoft, AssemblyAI y RevAI no produjeron invenciones comparables. Los clips eran entrevistas, no notas de voz, y el estudio probó la API tal como era en 20238.

Por qué la gente manda notas de voz

La gente manda notas de voz porque a quien las manda le resultan rápidas. El estudio más grande que encontré es de la Universidad de Ulm, una encuesta de 2020 a 1,003 personas reclutadas por Amazon Mechanical Turk, sobre todo en Estados Unidos, más un estudio de campo de dos semanas con seis usuarios intensivos9. En la encuesta, 83 por ciento había recibido un mensaje de voz y 73 por ciento había enviado uno. Las razones para enviarlos, tomadas de 735 respuestas abiertas de personas que habían grabado un mensaje de voz, se acomodaron en cuatro temas. Los conteos de los temas suman más que las 735 respuestas, así que algunas respuestas cayeron en más de un tema. La comodidad, porque hablar le gana a teclear en un celular, se mencionó 359 veces. El tono y la emoción que lleva una voz y que el texto pierde, 229. Las situaciones donde teclear es incómodo o inseguro, como manejar, 203. Y quien recibe, que había pedido voz o la encontraba más fácil, 34.

Un estudio de laboratorio midió la velocidad. Sus 48 estudiantes universitarios, 24 de ellos hablantes nativos de inglés, copiaron frases cortas en un iPhone, y la entrada de voz en inglés fue de 153 palabras por minuto contra 52 con el teclado, 2.93 veces más rápida, aunque la voz dejó un poco más de errores sin corregir en el texto final, 0.55 por ciento contra 0.35 por ciento. La tarea era copiar frases dadas, lo que dice poco sobre redactar un mensaje. Dos de los autores trabajaban para Baidu, cuyo reconocedor en el servidor, Deep Speech 2, se probó con una app para iPhone 6 Plus, en un artículo publicado en 201710.

Las notas de voz pasan el esfuerzo de quien envía a quien recibe

En el estudio de campo de Ulm, los 438 mensajes de voz registrados durante dos semanas iban de 1.5 segundos a poco más de siete minutos, con una mediana de 17.5 segundos9. Los autores también señalan un costo que se paga antes de que lo escuche cualquier destinatario. El sonido es pasajero, así que una grabación es incómoda de revisar y editar, y un desliz de la lengua obliga a grabar todo el mensaje otra vez9. Cinco de las doce grabaciones abortadas en su estudio de campo fueron justo eso.

Los autores escriben que los mensajes de voz “shift the effort necessary for communication towards the receiver”9. Componer es rápido, recuperar la información lleva más tiempo y esfuerzo que leer un texto con el mismo contenido, y la mayoría de sus participantes de campo posponía los mensajes de voz en el trabajo porque un texto se capta de un vistazo y una grabación no. La solución que propusieron en 2020 eran las transcripciones automáticas, para que la fecha y el lugar de una cita enterrados en una grabación se pudieran encontrar leyendo por encima.

Por qué quienes las reciben las posponen

Quien recibe no puede leer por encima, así que vuelve a escuchar lo que oyó. En el mismo estudio de campo, la gente reprodujo un mensaje de voz recibido 1.37 veces en promedio, y un mensaje se reprodujo 13 veces9. Leer no necesita la repetición. Un metaanálisis de 2019 de 190 estudios con 18,573 participantes calcula la lectura silenciosa promedio de no ficción en inglés en 238 palabras por minuto11. El habla conversacional va a unas 196 palabras por minuto si cuentas toda la llamada y a unas 164 dentro de los turnos propios de un hablante, en un corpus telefónico grande12. Además, quien lee controla el ritmo y puede saltar a la pregunta. Quien escucha recibe las palabras a la velocidad de quien habla, en el orden de quien habla.

A la gente no le entusiasman, y le gusta un poco más recibirlas que enviarlas. Una encuesta de YouGov a 2,149 adultos del Reino Unido, realizada el 5 y el 6 de mayo de 2022 y publicada ese junio, preguntó por las notas de voz a quienes usaban smartphone, 1,956 personas. De ellas, a 16 por ciento le gustaba enviarlas y a 36 por ciento no le gustaba enviarlas. En cuanto a recibirlas, a 22 por ciento le gustaba, a 25 por ciento no le gustaba y 29 por ciento se mostró ambivalente13. Solo entre los de 18 a 24 años hubo más gente a la que le gusta recibirlas que a la que no, 43 contra 28 por ciento, e incluso en ese grupo a la mitad no le gustaba enviarlas, contra 30 por ciento a quienes sí. De todos los usuarios de smartphone, 63 por ciento nunca había enviado una.

¿Cuánto es demasiado para una nota de voz?

En una encuesta de YouGov de mayo de 2022 a usuarios de smartphone del Reino Unido, 65 por ciento de quienes respondieron dijo que una nota de voz de un minuto es demasiado larga, y entre quienes dicen que no les gusta recibirlas y respondieron, a 57 por ciento le frustraban 30 segundos. Entre todos los usuarios de smartphone, 27 por ciento no sabía dónde estaba el límite. Al preguntarles cómo preferían recibir un mensaje largo, 78 por ciento eligió texto y 14 por ciento una nota de voz, lo que solo registra una preferencia declarada13. Algunos remitentes parecen saber que la grabación es una imposición. Un análisis de 2024 de chats de WhatsApp en Alemania y España encontró que la gente justifica su elección del audio antes, durante y después del mensaje, y los autores describen esas justificaciones como un trabajo social, que incluye presentar la nota de voz como algo por lo que vale la pena disculparse14. En estas tres fuentes, quien envía se ahorra el esfuerzo y quien recibe lo paga, y algunos remitentes se disculpan por eso.

Qué hace el Dictado de Apple con una nota de voz

El dictado te da las palabras en el orden en que las dijiste, y para el Dictado de Apple ese es todo el trabajo. El manual del iPhone para iOS 27 describe el Dictado como un proceso que ocurre en el teléfono, sin conexión a internet, en muchos idiomas, y que inserta comas, puntos y signos de interrogación automáticamente donde el idioma lo admite15. En los teléfonos más nuevos, un modelo en el dispositivo mejora la ortografía, la puntuación y las mayúsculas, en inglés. Todo lo demás es un comando hablado. Dices “nueva línea”, dices “eliminar” seguido de la frase. Lo del procesamiento en el dispositivo tiene una condición. La página de privacidad de Apple dice que si la configuración del teclado no indica que el Dictado se procesa en el dispositivo, lo que dictas se envía a los servidores de Apple y no se guarda, a menos que actives “Mejorar Siri y Dictado”. También dice que Apple puede conservar el historial de solicitudes y las transcripciones, vinculados a un identificador aleatorio del dispositivo y no a tu cuenta de Apple, hasta por dos años16. La página no explica cómo encajan las dos cosas. Reescribir es trabajo de las Herramientas de escritura de Apple, que son otra función y que no leen cómo va a caer un texto.

Qué hacen el dictado por voz de Google y la escritura por voz de Microsoft

El dictado por voz básico de Gboard, como el Dictado de Apple, te da las palabras tal como las dijiste. Tocas el micrófono, dices lo que quieres escribir y dictas la puntuación, aunque el dictado por voz y la puntuación no están disponibles en todos los idiomas17. El dictado por voz avanzado, en el Pixel 6 y posteriores, agrega puntuación mientras hablas, y en el Pixel 9 (sin contar el 9a) y posteriores un comando hablado puede corregir, parafrasear, acortar o alargar lo que dictaste. Google dice que esto corre en el dispositivo, en inglés, francés, italiano, japonés y español, y que el alemán llegará pronto18. En Windows, la página de ayuda de Microsoft dice que el dictado fluido, una función de las Copilot+ PC, corrige la gramática, la puntuación y las palabras de relleno mientras hablas19. El dictado por voz avanzado reescribe solo cuando le das un comando hablado. El dictado fluido funciona sin comando, pero solo en las Copilot+ PC, y su página de ayuda no menciona reordenar el mensaje. En las páginas de ayuda de Apple, Google y Microsoft que cito aquí no encontré ninguna función que convierta por defecto una nota de voz larga y enredada en un mensaje listo para enviar.

Qué hacen las apps de transcripción y las de mensajería

Otter, una app de transcripción, va un paso más allá que el teclado de un celular. Su página de voz a texto describe una transcripción con etiquetas de hablante y marcas de tiempo, un resumen generado automáticamente con puntos destacados, y puntos clave y tareas pendientes extraídos20. El centro de ayuda de Otter enumera inglés, español, francés, alemán, japonés y chino (simplificado) como idiomas admitidos21, lo que es más de lo que dice la página de voz a texto. Está hecha para reuniones, así que condensa lo que se dijo, y en esas dos páginas no encontré ninguna función que redacte lo que querías mandar. Debajo de algunas apps hay modelos de voz abiertos. Whisper por sí solo produce una transcripción y una etiqueta de idioma7. Las apps hechas sobre él varían. MacWhisper anuncia eliminación de muletillas, resúmenes e indicaciones personalizadas encima de la transcripción, y ofrece modelos locales o en la nube para ese paso22.

Las apps de mensajería ya empezaron a transcribir las notas de voz que recibes. WhatsApp agregó las transcripciones de mensajes de voz en noviembre de 2024, generadas en el dispositivo para que la propia WhatsApp no pueda leerlas, que se activan en Ajustes > Chats > Transcripciones de mensajes de voz y se piden con una pulsación larga sobre el mensaje23. La publicación dice que las transcripciones arrancaron en unos cuantos idiomas selectos, y no pude confirmar la lista actual. Eso resuelve el problema de leer por encima que identificaron los autores de Ulm, donde el idioma está cubierto. Lo que obtienes es la transcripción de alguien más pensando en voz alta. La puedes leer en una junta, pero la respuesta la sigues teniendo que escribir tú.

Qué agrega un paso de reescritura

Un paso de reescritura convierte la transcripción en el mensaje que habrías tecleado si teclear no costara nada. Quita las muletillas que describen Clark y Fox Tree, junta las repeticiones y los arranques en falso de la clasificación de Shriberg, y pone la corrección que hiciste a media frase donde le toca, en lugar de lo que corregía. También reordena. Las explicaciones habladas suelen llegar como se te fueron ocurriendo, primero el contexto y al final la petición, o primero la petición y las razones detrás. Un mensaje escrito puede abrir con lo importante.

Hay dos cosas que el paso tiene que dejar intactas. La primera es el significado. Una reescritura que suaviza tu nota de voz hasta volverla otra petición es peor que la transcripción, porque la transcripción por lo menos decía lo que dijiste. La segunda es el tono. Si estabas siendo cálido, o directo, o bromeando, la versión escrita tiene que ser la misma persona. La falla aquí es la que se cubre en si la IA hace que tus mensajes suenen a robot, donde la reescritura regresa cortés y genérica.

También hay un juicio que una transcripción nunca tiene que hacer. Parte de lo que dijiste en una nota de voz era para ti, no para quien la recibe. Preguntarte en voz alta si mencionar algo no significa que quisieras mencionarlo. Un paso de reescritura tiene que decidir qué era el mensaje y qué era el borrador, y esa decisión puede salir mal en las dos direcciones, al dejar una frase que ibas descartando mientras hablabas o al quitar una que sí querías decir. No encontré ningún estudio que midiera con qué frecuencia pasa eso con alguna herramienta, Subtext incluido.

Qué hace Subtext con una nota de voz

Subtext transcribe la nota de voz que grabas en la app, escribe el mensaje a partir de lo que quisiste decir y te devuelve hasta tres versiones, cada una con una puntuación de “listo para enviar” sobre qué tan probable es que caiga como querías. Las versiones están hechas para conservar tu significado y tu personalidad. En un primer borrador, una se queda cerca de tus palabras con los problemas arreglados, otra es un pulido más cálido o un enfoque distinto, y otra es una reescritura más completa. Si la redacción suena más fría o más cortante de lo que querías, la app nombra el problema y marca las palabras responsables. No se envía nada por ti.

Las instrucciones del modelo cubren los artefactos de la transcripción, y leí los prompts del backend antes de escribir esto. Cuando un mensaje está marcado como dictado, al modelo se le indica que espere palabras mal oídas o pegadas, puntuación rara y muletillas sueltas, que las pase por alto para llegar a la redacción que querías, y que las corrija en silencio sin señalarlas como algo que hiciste mal. El prompt muestra lo que se le indica hacer al modelo. No encontré ninguna evaluación independiente de la transcripción de voz ni de la reescritura de Subtext, así que todo esto se apoya en lo que muestra la app y en lo que dicen sus prompts y su política de privacidad. Como ninguno de los estudios de arriba probó Deepgram, el modelo de voz que transcribe el audio de Subtext, no puedo decir hasta qué punto los patrones de error con acentos, con habla en segunda lengua y con estilo casual aplican a él, así que lee el mensaje antes de enviarlo.

¿Qué pasa con una grabación de voz en Subtext?

Subtext manda la grabación de voz a Deepgram para transcribirla, así que el audio sale del teléfono. Su política de privacidad, actualizada el 26 de julio de 2026, nombra varios proveedores, entre ellos Deepgram para las grabaciones de voz, Anthropic para texto, imágenes y transcripciones de voz, Google Firebase para las cuentas y las conversaciones, y OpenAI solo si activas la lectura en voz alta. La política agrega que, cuando la búsqueda web está activada, los términos de búsqueda sacados de tu solicitud pasan por Anthropic a proveedores de búsqueda de terceros, y que puedes desactivar la búsqueda web en los ajustes de la app24. Dice que nada de lo que envías se usa para entrenar un modelo de IA y que ninguno de sus proveedores de IA puede entrenar con ello, y que además Subtext activa la exclusión de Deepgram de la mejora de modelos para la voz. Dice que Subtext borra su propia copia de una conversación de sus servidores cinco días después de la última vez que la usas, o 90 días si la fijas. Dice que Deepgram, con esa exclusión activada, conserva el audio solo el tiempo que toma transcribirlo, y que Anthropic borra las entradas y las salidas en un plazo de 30 días, y puede conservar solicitudes marcadas hasta por dos años y las puntuaciones de seguridad relacionadas hasta por siete años. Dice que Subtext no tiene un acuerdo de retención cero con ninguno de ellos24. Cómo manejan tu texto otros asistentes se compara en qué asistentes de escritura con IA entrenan con tus mensajes.

¿Qué idiomas admite Subtext?

Subtext escribe el mensaje en el idioma en que hablaste, en 17+ idiomas, y mantiene el nivel de formalidad que usaste donde el idioma lo marca. Una nota de voz en alemán regresa como un mensaje en alemán. El resumen de una nota de voz que recibiste se escribe en el idioma en que llegó. Los editores de Google Play destacaron este flujo en una nota de “Hot Tip” que describe tocar el ícono del micrófono, hablar, volver a tocar y obtener un mensaje pulido con etiquetas de cómo cayó el original y un botón para copiar25. Cuando abrí la página el 4 de octubre de 2026, la ficha en la tienda de Alemania mostraba 4.3 estrellas con 295 reseñas y más de 50,000 descargas, un conteo solo de Google Play, y la cifra de estrellas cambia según el país. Usar Subtext cuesta dinero, y unos cuantos análisis son gratis para empezar. Una nota de voz grabada regresa como un mensaje que ya puedes enviar.

¿Cómo respondes un mensaje de voz largo que te mandaron?

Subtext también lee los mensajes de voz que te mandan otras personas, y en este lado es donde una transcripción simple se acerca más a ser suficiente. La transcripción en el dispositivo de WhatsApp te deja leer una grabación de dos minutos donde tu idioma está cubierto23. Lo que no hace es decirte qué quiere la persona. El ejemplo del propio estudio de Ulm era una fecha y un lugar enterrados en el audio9. Una nota de voz larga de un amigo o de un jefe tiene la misma forma, la pregunta en algún punto de en medio y las razones alrededor. Para quienes se atoran con las respuestas, leer es uno de los cinco lugares donde una respuesta se atora, y la mayoría de los participantes de campo de Ulm posponía los mensajes de voz en el trabajo porque una grabación no se capta de un vistazo9.

Mete en Subtext un mensaje de voz recibido y lo transcribe, resume en una línea qué quiere la persona de ti y agrega de dos a cinco puntos de acción. Después puede redactar una respuesta que retome el hilo, y no le pone etiqueta al tono de quien lo mandó. Los prompts del backend tratan un archivo de voz que adjuntas como uno que lo más probable es que te haya mandado la otra persona, y si el modelo no está seguro de quién es quién, tiene instrucciones de preguntar. El resumen vale lo que valga la transcripción de abajo, y una sola línea es difícil de leer sin su contexto, como muestra qué significa este mensaje. Con un acento marcado o una grabación con ruido, la transcripción va a traer más errores que con inglés de estudio, así que escucha el original antes de responder algo que importe. Los textos y las capturas pasan por el mismo paso de resumen, así que un mensaje que recibiste recibe el mismo resumen de una línea.

Los experimentos más cercanos son viejos y chicos

Los dos experimentos más cercanos que encontré a un paso de reescritura o a un resumen son de 2003 y 2005, y los dos son pequeños. En 2003, un experimento financiado por DARPA hizo que 28 hablantes nativos de inglés leyeran pasajes de 150 a 250 palabras de habla telefónica y de noticieros, como transcripciones literales y como transcripciones limpiadas a mano. Los lectores calificaron el texto limpio como más fácil de entender, pero contestaron las preguntas sobre él con la misma exactitud y rapidez, lo que los autores atribuyen a que los lectores ya sacaban casi la calificación máxima. La limpieza automática de la salida imperfecta de un reconocedor tendió a calificarse como más difícil que la versión sin limpiar, aunque apenas26. La limpieza quitaba disfluencias y arreglaba la puntuación, pero no reescribía el texto para convertirlo en un mensaje.

En 2005, 16 personas contestaron preguntas sobre 15 mensajes de buzón de voz a partir de resúmenes extraídos automáticamente. Los resúmenes hechos a partir de habla reconocida acertaron el nombre de quien llamaba 57 por ciento de las veces contra 94 por ciento de los resúmenes hechos a partir de transcripciones humanas, mientras que el motivo de la llamada se entendía igual de bien, en 78 por ciento. La gente pidió el audio original más seguido cuando el resumen venía de habla reconocida, 53 por ciento de las veces contra 30 por ciento27. Eran resúmenes extractivos de buzón de voz hechos con reconocimiento de voz de 2005, así que el estudio solo fija una expectativa. Ninguno de los dos estudios midió un mensaje que alguien fuera a enviar.

Hasta dónde llega la evidencia

La evidencia sólida está en los dos extremos. El lenguaje hablado trae disfluencia a una tasa medida que la escritura no tiene, y el reconocimiento de voz comete más errores con unos hablantes que con otros, con las cifras de arriba para mostrarlo. El medio es más delgado. No encontré ningún estudio que midiera cuánto mejor cae una nota de voz reescrita que una transcripción cruda, ni con qué frecuencia una reescritura cambia el significado en el camino. La investigación sobre mensajería de voz es un puñado de estudios, el más grande con una muestra de encuesta sacada de una plataforma estadounidense de trabajo colectivo y un estudio de campo de seis personas. La encuesta de YouGov es de un país y de un año. Y los estudios sobre notas de voz son anteriores a las transcripciones en el dispositivo, así que el traslado de esfuerzo que describen ahora lo cierran en parte las propias apps de mensajería.

En la práctica todo depende de cómo hablas. Si hablas en oraciones limpias, el dictado basta, y tu celular ya lo tiene. Si hablas como los hablantes de esos corpus, con las muletillas que contaron Clark y Fox Tree y los reinicios que catalogó Shriberg, una transcripción le entrega a quien la recibe tu proceso de redacción, y un paso de reescritura es lo que la convierte en un mensaje. Subtext es una app que hace ese paso, para la nota de voz que grabas y para la que recibiste, y si tu problema es una respuesta que no dejas de editar, por qué una respuesta corta te toma una hora trata de ese ciclo. Prueba Subtext en tu navegadorPrueba Subtext en tu navegador

Fuentes

Numeradas en el orden de su primera aparición. Las páginas se revisaron el 4 y el 5 de octubre de 2026, y la política de privacidad de Subtext se volvió a abrir el 10 de octubre de 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 a 169. Estudio de corpus de conversación en inglés estadounidense; tasas y tipos de disfluencia.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Artículo de congreso; el PDF no trae año y sus referencias llegan hasta 1996. Corpus etiquetados a mano de 40,515 palabras de 30 hablantes (Switchboard) y 12,762 palabras de 523 hablantes (AMEX, llamadas entre empleados de SRI y agentes de viajes). Financiado por DARPA y la NSF. . Revisado el 5 de octubre de 2026.
  3. Clark, H. H., y Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 a 111. Tasas de muletillas por hablante del corpus de Londres-Lund.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., y Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 a 7689. Cinco sistemas comerciales, 42 hablantes blancos y 73 hablantes negros, 19.8 horas de audio.
  5. Graham, C., y Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Solo el resumen; el texto completo no estaba disponible al revisar.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., y Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Preprint de arXiv.
  7. OpenAI. Whisper README. GitHub. . Revisado el 4 de octubre de 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., y Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13,140 segmentos de audio de 437 participantes grabados en instituciones de Estados Unidos, con y sin afasia, procesados con la API de Whisper en abril y mayo de 2023. Financiado por el Pulitzer Center y el Center for Social Sciences de Cornell.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., y Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Encuesta a 1,003 personas y estudio de campo de dos semanas con 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., y Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publicado en diciembre de 2017. Estudio de laboratorio con 48 estudiantes universitarios, 24 por idioma, que copiaron frases en un iPhone. Dos autores trabajaban para Baidu USA, cuyo sistema de voz en el servidor, Deep Speech 2, corría en un servidor de Baidu y se probó con una app para iPhone 6 Plus.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 estudios, 18,573 participantes.
  12. Yuan, J., Liberman, M., y Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversaciones telefónicas de Switchboard.
  13. YouGov. How many Britons like voice notes? 14 de junio de 2022. Encuesta a 2,149 adultos del Reino Unido, trabajo de campo el 5 y el 6 de mayo de 2022, 1,956 de ellos usuarios de smartphone; las cifras de duración son proporciones de quienes respondieron. Tablas de resultados en . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Revisado el 4 y el 5 de octubre de 2026. Los porcentajes siguen el texto del artículo de YouGov; las tablas de resultados dan totales ligeramente distintos para quienes no las disfrutan, por redondeo.
  14. Sampietro, A., y König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 a 71. Chats de WhatsApp en alemán y en español; resumen leído en el registro de Crossref de la editorial, texto completo de paga.
  15. Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Revisado el 4 de octubre de 2026.
  16. Apple. Siri, Dictation & Privacy. Legal, última actualización el 14 de septiembre de 2026. . Revisado el 5 de octubre de 2026.
  17. Google. Type with your voice. Gboard Help. . Revisado el 4 de octubre de 2026.
  18. Google. Use advanced voice typing features. Gboard Help. . Revisado el 5 de octubre de 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Revisado el 5 de octubre de 2026.
  20. Otter.ai. Convert Speech to Text. . Revisado el 4 de octubre de 2026.
  21. Otter.ai. Supported languages. Otter Help Center, artículo editado el 6 de mayo de 2026. . Revisado el 5 de octubre de 2026.
  22. MacWhisper. Homepage. Página de marketing sin fecha, así que muestra lo que el producto anuncia y no cómo funciona. . Revisado el 5 de octubre de 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21 de noviembre de 2024. . Revisado el 4 de octubre de 2026.
  24. Subtext, Términos, privacidad y tu cuenta. Política de privacidad actualizada por última vez el 26 de julio de 2026. Revisada el 10 de octubre de 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Revisado el 4 de octubre de 2026; la ficha mostraba 295 reseñas y más de 50K descargas en todas las tiendas que abrí, y 4.3 estrellas en la de Alemania.
  26. Jones, D. A., y seis coautores (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 a 1588. 32 hablantes nativos de inglés reclutados, 28 analizados. Patrocinado por DARPA bajo el contrato F19628-00-C-0002 de la Fuerza Aérea.
  27. Koumpis, K., y Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Prueba de comprensión con 16 participantes y 15 mensajes de buzón de voz; cifras leídas del PDF alojado por los autores. Financiado por una beca ROPA de la EPSRC, GR/R23954.