ArtículosHerramientas de escritura

Por qué la transcripción de una nota de voz no es un mensaje de texto

El dictado convierte una nota de voz en texto, pero suele conservar las muletillas, los reinicios y el orden en que se te ocurrió todo. Qué dice la investigación y qué añade reescribir.

Por Samet Durgun · Cofundador de Subtext · 21 min de lectura

El habla trae muletillas, falsos comienzos y rectificaciones a mitad de frase que la escritura ya terminada casi nunca tiene, así que la transcripción de una nota de voz todavía no es un mensaje. El móvil escribirá lo que dijiste, y también lo harán Otter, las transcripciones de WhatsApp y las apps basadas en modelos de voz abiertos, pero la transcripción de una nota de voz que divaga sigue siendo un mensaje que divaga. Conserva los “eh”, la corrección que hiciste a medias y el orden en que se te fueron ocurriendo las cosas. Una app que convierta una nota de voz en un mensaje de texto claro tiene que hacer un segundo trabajo después de transcribir. Tiene que averiguar qué querías decir y escribir eso.

La primera mitad es investigación. Los lingüistas han medido en qué se diferencia el lenguaje hablado del escrito, los investigadores del reconocimiento de voz han medido dónde falla la transcripción y para quién, y unos pocos estudios han preguntado por qué la gente manda notas de voz y por qué quien las recibe las deja para luego. La segunda mitad cuenta qué hacen las herramientas de dictado que la gente ya tiene, qué añade un paso de reescritura y qué hace Subtext con una nota de voz.

Como cofundador de Subtext, donde la voz es una de las tres formas de entrar junto a un borrador escrito y una captura de una conversación, tengo interés en la respuesta. Todas las fuentes de abajo son fuentes que abrí. Cuando solo pude llegar a un resumen, lo digo y no cito ninguna cifra de él.

El habla se produce de forma distinta a la escritura

El habla espontánea está llena de material que la escritura deja fuera. El repaso que hizo Elizabeth Shriberg de la disfluencia en varios corpus de habla espontánea del inglés americano sitúa la tasa en hasta un diez por ciento de las palabras y en más de un tercio de los enunciados1. Las formas son pausas llenas (“uh”, “um”), repeticiones (“I I think”), reparaciones en las que se cambia una palabra a mitad de frase y falsos comienzos, que ella clasifica como supresiones, en los que se abandona una oración y se empieza de nuevo. En los dos corpus de conversaciones entre personas que examinó, llamadas telefónicas informales y llamadas para planificar viajes, la tasa por palabra rondó el seis por ciento1, en muestras de 40.515 y 12.762 palabras que su artículo del SRI sobre los mismos corpus etiquetó a mano2. En un corpus de personas que hablaban con un ordenador mediante un botón de pulsar para hablar, la tasa bajó a menos del uno por ciento, y ella atribuye parte de la caída al botón. Los hablantes podían planificar el enunciado primero y grabarlo después1. En una nota de voz pulsas una vez y hablas, y la planificación ocurre en voz alta.

Las muletillas habladas y cuánto cambian de un hablante a otro

Las muletillas habladas no son ruido, y eso explica en parte por qué cuesta quitarlas. Herbert Clark y Jean Fox Tree sostuvieron, a partir de varios corpus grandes, que “uh” y “um” son palabras con derecho propio, planificadas y producidas como cualquier otra, que se usan para anunciar un retraso corto o largo mientras el hablante busca la palabra siguiente o decide qué decir3. También varían enormemente de un hablante a otro. En el corpus London-Lund, unas 170.000 palabras de 50 conversaciones cara a cara en inglés británico grabadas entre 1961 y 1976, sobre todo entre académicos, los 65 hablantes que produjeron más de 1.000 palabras cada uno iban de 1,2 a 88,5 muletillas por cada 1.000 palabras, con una mediana de 17,33. Algunas transcripciones salen casi limpias, otras llevan una muletilla cada doce palabras.

La disfluencia también se concentra donde la planificación pesa más. Shriberg señala, citando trabajos anteriores, que es más probable al comienzo de una frase1. En una nota de voz eso es la apertura, cuando aún estás decidiendo para qué sirve el mensaje. Al escribir puedes borrar esa apertura antes de que la vea nadie. En una nota de voz suele enviarse tal cual, salvo que grabes el mensaje entero otra vez.

Cómo cambian los errores del reconocimiento de voz según el hablante

La transcripción añade sus propios errores a los que dijiste. La medición más clara que encontré es un estudio de 2020 en PNAS que pasó cinco reconocedores de voz comerciales, de Amazon, Apple, Google, IBM y Microsoft, por 19,8 horas de audio de entrevistas de 42 hablantes estadounidenses blancos y 73 negros4. La tasa media de error por palabra fue de 0,19 para los hablantes blancos y de 0,35 para los negros, y todos los sistemas mostraron la brecha. El que mejor funcionó, Microsoft, sacó 0,15 y 0,27. El peor, Apple, sacó 0,23 y 0,45. Más del 20 por ciento de los clips de hablantes negros salió con al menos la mitad de las palabras mal, frente a menos del 2 por ciento de los clips de hablantes blancos4. Los autores atribuyen la brecha a los modelos acústicos, la parte que traduce el sonido en palabras, y señalan que los datos de entrenamiento tienen muy poco audio de hablantes negros.

Otro patrón del mismo artículo importa para las notas de voz. Los sistemas funcionaron algo peor con hablantes hombres, algo que los autores atribuyen a un estilo más informal, con pronunciaciones más cortas y reducidas y más disfluencias4, el registro de una nota de voz a un amigo.

Acentos, segundas lenguas y palabras que nadie dijo

El reconocimiento de voz también rinde peor con acentos y con habla en una segunda lengua. Un artículo de 2024 en JASA Express Letters probó el modelo Whisper de OpenAI con distintos acentos del inglés y comunicó mayor precisión para hablantes nativos que para quienes tienen el inglés como segunda lengua, mejores resultados para el inglés americano que para el británico o el australiano, y mejores resultados con habla leída que con conversación5. Solo pude llegar al resumen, así que cito la dirección y ninguna cifra. Whisper se entrenó con 680.000 horas de audio, y sus autores dicen que los modelos se acercan a la “accuracy and robustness” de las personas6. Su propia documentación añade que el rendimiento varía mucho según el idioma (“performance varies widely depending on the language”)7. Un promedio entre hablantes dice poco de una nota de voz cansada en tu segunda lengua. Si esa lengua es el inglés, un mensaje correcto aún puede sonar brusco para un lector nativo, y la transcripción no te lo va a decir.

Whisper también puede añadir palabras que nadie dijo. Un estudio de 2024 pasó 13.140 clips cortos en inglés de 437 participantes grabados en instituciones de Estados Unidos, con afasia y sin ella, por la API alojada de Whisper de OpenAI en abril y mayo de 2023. Más o menos el uno por ciento de las transcripciones contenía frases enteras que no estaban en el audio, y el 38 por ciento de ellas llevaba al menos un daño explícito, como violencia o una falsa afirmación de autoridad. Los clips con pausas largas corrían más riesgo. En los 187 clips en los que Whisper había inventado texto, Google, Amazon, Microsoft, AssemblyAI y RevAI no produjeron invenciones comparables. Los clips eran entrevistas, no notas de voz, y el estudio probó la API tal como era en 20238.

Por qué la gente manda notas de voz

La gente manda notas de voz porque a quien las envía le resultan rápidas. El estudio más grande que encontré es de la Universidad de Ulm, una encuesta de 2020 a 1.003 personas reclutadas en Amazon Mechanical Turk, sobre todo en Estados Unidos, más un estudio de campo de dos semanas con seis usuarios intensivos9. En la encuesta, el 83 por ciento había recibido un mensaje de voz y el 73 por ciento había mandado uno. Los motivos para enviarlos, sacados de 735 respuestas abiertas de personas que habían grabado un mensaje de voz, se agruparon en cuatro temas. Los recuentos de los temas suman más que las 735 respuestas, así que algunas respuestas cayeron en más de un tema. La comodidad, porque hablar gana a teclear en un móvil, se nombró 359 veces. El tono y la emoción que lleva la voz y pierde el texto, 229. Las situaciones en que teclear es incómodo o inseguro, como conducir, 203. Y quien recibe, que había pedido voz o la encontraba más fácil, 34.

Un estudio de laboratorio midió la velocidad. Sus 48 estudiantes universitarios, 24 de ellos hablantes nativos de inglés, copiaron frases cortas en un iPhone, y la entrada de voz en inglés fue a 153 palabras por minuto frente a 52 con el teclado, 2,93 veces más rápido, aunque la voz dejó algo más de errores sin corregir en el texto final, el 0,55 por ciento frente al 0,35 por ciento. La tarea era copiar frases dadas, lo que dice poco sobre redactar un mensaje. Dos de los autores trabajaban para Baidu, cuyo reconocedor en servidor, Deep Speech 2, se probó mediante una app para iPhone 6 Plus, en un artículo publicado en 201710.

Las notas de voz pasan el esfuerzo de quien envía a quien recibe

En el estudio de campo de Ulm, 438 mensajes de voz registrados durante dos semanas iban de 1,5 segundos a algo más de siete minutos, con una mediana de 17,5 segundos9. Los autores señalan además un coste que se paga antes de que ningún destinatario lo oiga. El sonido es transitorio, así que revisar y editar una grabación es engorroso, y un desliz al hablar obliga a grabar el mensaje entero otra vez9. Cinco de las doce grabaciones abortadas en su estudio de campo eran justo eso.

Los autores escriben que los mensajes de voz “shift the effort necessary for communication towards the receiver”, es decir, trasladan hacia quien recibe el esfuerzo que exige comunicarse9. Componer es rápido, recuperar el contenido lleva más tiempo y esfuerzo que leer un texto con el mismo contenido, y la mayoría de sus participantes en el estudio de campo posponía los mensajes de voz en el trabajo porque un texto se capta de un vistazo y una grabación no. La solución que propusieron en 2020 eran las transcripciones automáticas, para poder encontrar repasando el texto la fecha y el lugar de una cita enterrados en una grabación.

Por qué quien las recibe las deja para luego

Quien recibe no puede leer en diagonal, así que vuelve atrás sobre lo que oyó. En el mismo estudio de campo, la gente reprodujo un mensaje de voz recibido 1,37 veces de media, y un mensaje se reprodujo 13 veces9. Leer no necesita repetir nada. Un metaanálisis de 2019 de 190 estudios con 18.573 participantes fija la lectura silenciosa media de no ficción en inglés en 238 palabras por minuto11. El habla conversacional va a unas 196 palabras por minuto si cuentas la llamada entera y a unas 164 dentro de los turnos de un mismo hablante, en un corpus telefónico grande12. Además, quien lee controla el ritmo y puede saltar a la pregunta. Quien escucha recibe las palabras a la velocidad del hablante y en su orden.

A la gente no le entusiasman, y le entusiasma algo más recibirlas que enviarlas. Una encuesta de YouGov a 2.149 adultos del Reino Unido, realizada el 5 y el 6 de mayo de 2022 y publicada ese junio, preguntó por las notas de voz a los usuarios de smartphone entre ellos, 1.956 personas. De ellos, al 16 por ciento le gustaba enviarlas y al 36 por ciento no. En cuanto a recibirlas, al 22 por ciento le gustaba, al 25 por ciento no y el 29 por ciento se mostraba ambivalente13. Solo entre los de 18 a 24 años había más gente a la que le gustaba recibirlas que a la que no, 43 frente a 28 por ciento, e incluso en ese grupo a la mitad no le gustaba enviarlas, frente al 30 por ciento a quien sí. De todos los usuarios de smartphone, el 63 por ciento nunca había enviado una.

¿Cuándo es demasiado larga una nota de voz?

En una encuesta de YouGov de mayo de 2022 a usuarios de smartphone del Reino Unido, el 65 por ciento de quienes dieron una respuesta dijo que una nota de voz de un minuto es demasiado larga, y entre quienes no disfrutan recibiéndolas y dieron una respuesta, el 57 por ciento se frustraba con 30 segundos. Entre todos los usuarios de smartphone, el 27 por ciento no sabía dónde estaba el límite. Al preguntarles cómo preferían recibir un mensaje largo, el 78 por ciento eligió texto y el 14 por ciento una nota de voz, lo que solo registra una preferencia declarada13. Algunos remitentes parecen saber que la grabación es una imposición. Un análisis de 2024 de chats de WhatsApp en Alemania y España encontró a gente justificando su elección del audio antes, dentro y después del mensaje, y los autores describen esas justificaciones como un trabajo de relación con el otro, que incluye presentar la nota de voz como algo que merece una disculpa14. En estas tres fuentes, quien envía se ahorra esfuerzo y quien recibe lo paga, y algunos remitentes se disculpan por ello.

Qué hace el Dictado de Apple con una nota de voz

El dictado te da las palabras en el orden en que las dijiste, y para el Dictado de Apple ese es todo el trabajo. La guía del iPhone de Apple para iOS 27 describe el Dictado como un proceso que se hace en el teléfono sin conexión a internet, en muchos idiomas, y que inserta comas, puntos y signos de interrogación automáticamente donde el idioma lo admite15. En los teléfonos más nuevos un modelo en el dispositivo mejora la ortografía, la puntuación y las mayúsculas, en inglés. Todo lo demás es una orden hablada. Dices “nueva línea”, dices “eliminar” seguido de la frase. Lo del procesamiento en el dispositivo tiene una condición. La página de privacidad de Apple dice que si los ajustes de teclado no indican que el Dictado se procesa en el dispositivo, lo que dictas se envía a los servidores de Apple y no se guarda salvo que actives “Mejorar Siri y Dictado”. También dice que Apple puede conservar el historial de peticiones y las transcripciones, vinculados a un identificador aleatorio del dispositivo y no a tu cuenta de Apple, hasta dos años16. La página no explica cómo encajan las dos cosas. Reescribir es trabajo de las herramientas de escritura de Apple, que son aparte y que no dan ninguna lectura de cómo llega un texto.

Qué hacen la escritura por voz de Google y la de Microsoft

El Escribir por voz básico de Gboard, de Google, igual que el Dictado de Apple, te da las palabras tal como las dijiste. Tocas el micrófono, dices lo que quieres escribir y dictas la puntuación, aunque Escribir por voz y la puntuación no están disponibles en todos los idiomas17. Sus funciones avanzadas de Escribir por voz, en el Pixel 6 y posteriores, añaden la puntuación mientras hablas, y en el Pixel 9 (salvo el 9a) y posteriores una orden hablada puede corregir, reformular, acortar o alargar lo que dictaste. Google dice que esto se ejecuta en el dispositivo, en inglés, francés, italiano, japonés y español, y que el alemán llegará pronto18. En Windows, la página de ayuda de Microsoft dice que el dictado fluido, una función de los Copilot+ PC, corrige la gramática, la puntuación y las muletillas mientras hablas19. Las funciones avanzadas de Escribir por voz solo reescriben cuando les das una orden hablada. El dictado fluido funciona sin orden, pero solo en Copilot+ PC, y su página de ayuda no menciona reordenar el mensaje. En las páginas de ayuda de Apple, Google y Microsoft que cito aquí no encontré ninguna función que convierta por defecto una nota de voz entera y divagante en un mensaje listo para enviar.

Qué hacen las apps de transcripción y los mensajeros

Otter, una app de transcripción, va un paso más allá que el teclado de un móvil. Su página de voz a texto describe una transcripción con etiquetas de hablante y marcas de tiempo, un resumen generado automáticamente con puntos destacados, y puntos clave y tareas extraídos20. El centro de ayuda de Otter enumera inglés, español, francés, alemán, japonés y chino (simplificado) como idiomas admitidos21, más de los que dice la página de voz a texto. Está pensada para reuniones, así que condensa lo dicho, y en esas dos páginas no encontré ninguna función que redacte lo que querías enviar. Debajo de algunas apps hay modelos de voz abiertos. El propio Whisper produce una transcripción y una etiqueta de idioma7. Las apps que se basan en él varían. MacWhisper anuncia sobre la transcripción la eliminación de muletillas, resúmenes y prompts personalizados, y ofrece modelos locales o en la nube para ese paso22.

Los mensajeros han empezado a transcribir las notas de voz que recibes. WhatsApp añadió las transcripciones de mensajes de voz en noviembre de 2024, generadas en el dispositivo para que el propio WhatsApp no pueda leerlas, que se activan en Ajustes y Chats y se piden con una pulsación larga sobre el mensaje23. La publicación dice que las transcripciones empezaron en unos pocos idiomas seleccionados, y no pude confirmar la lista actual. Eso responde al problema de leer en diagonal que identificaron los autores de Ulm, donde el idioma está cubierto. Lo que obtienes es la transcripción de otra persona pensando en voz alta. Puedes leerla en una reunión, pero la respuesta aún tienes que escribirla tú.

Qué añade un paso de reescritura

Un paso de reescritura convierte la transcripción en el mensaje que habrías escrito si teclear no costara nada. Quita las muletillas que describen Clark y Fox Tree, junta las repeticiones y los falsos comienzos de la taxonomía de Shriberg, y pone la corrección que hiciste a medias en su sitio, sustituyendo lo que corregía. También reordena. Las explicaciones habladas tienden a llegar como se te ocurrieron, con el contexto primero y la petición al final, o la petición primero y las razones detrás. Un mensaje escrito puede empezar por lo importante.

Hay dos cosas que el paso tiene que dejar tal cual. La primera es el significado. Una reescritura que suaviza tu nota de voz hasta convertirla en otra petición es peor que la transcripción, porque la transcripción al menos decía lo que dijiste. La segunda es el tono. Si fuiste cálido, o tajante, o bromeaste, la versión escrita tiene que ser la misma persona. El fallo aquí es el que trata ¿la IA hace que tus mensajes suenen a robot?, cuando una reescritura vuelve educada y genérica.

También hay un juicio que una transcripción nunca tiene que hacer. Parte de lo que dijiste en una nota de voz era para ti, no para quien la recibe. Preguntarte en voz alta si mencionar algo no significa que quisieras mencionarlo. Un paso de reescritura tiene que decidir qué era el mensaje y qué era borrador, y esa decisión puede salir mal en las dos direcciones, conservando una frase que estabas descartando o quitando una que querías decir. No encontré ningún estudio que midiera con qué frecuencia ocurre con ninguna herramienta, Subtext incluido.

Qué hace Subtext con una nota de voz

Subtext transcribe la nota de voz que grabas en la app, escribe el mensaje a partir de lo que querías decir y devuelve hasta tres versiones, cada una con una puntuación de “listo para enviar” que indica lo probable que es que llegue como querías. Las versiones están pensadas para conservar tu significado y tu personalidad. En un primer borrador, una se queda cerca de tus palabras con los problemas arreglados, otra es un pulido más cálido o un enfoque distinto, y otra es una reescritura más completa. Si la redacción suena más fría o más cortante de lo que querías, la app nombra el problema y marca las palabras que fallan. No envía nada por ti.

Las instrucciones del modelo cubren los defectos típicos de la transcripción, y leí los prompts del backend antes de escribir esto. Cuando un mensaje se marca como dictado, al modelo se le dice que espere palabras mal oídas o fusionadas, puntuación rara y muletillas sueltas, que las lea hasta llegar a la redacción prevista y que las arregle en silencio, sin señalarlas como algo que hiciste mal. El prompt muestra lo que se le dice al modelo que haga. No encontré ninguna evaluación independiente de la transcripción ni de la reescritura de voz de Subtext, así que todo esto se apoya en lo que muestra la app y en lo que dicen sus prompts y su política de privacidad. Como ninguno de los estudios de arriba probó Deepgram, el modelo de voz que transcribe el audio de Subtext, no puedo decir hasta qué punto se trasladan a él los patrones de error de acentos, habla en segunda lengua y estilo informal, así que lee el mensaje antes de enviarlo.

¿Qué pasa con una grabación de voz en Subtext?

Subtext envía la grabación de voz a Deepgram para transcribirla, así que el audio sale del teléfono. Su política de privacidad, actualizada el 26 de julio de 2026, nombra varios proveedores, entre ellos Deepgram para las grabaciones de voz, Anthropic para texto, imágenes y transcripciones de voz, Google Firebase para cuentas y conversaciones, y OpenAI solo si activas la lectura en voz alta. La política añade que, cuando la búsqueda web está activada, los términos de búsqueda sacados de tu petición pasan por Anthropic a proveedores de búsqueda de terceros, y que puedes desactivar la búsqueda web en los ajustes de la app24. Dice que nada de lo que envías se usa para entrenar un modelo de IA y que ninguno de sus proveedores de IA puede entrenar con ello, y que Subtext además activa la exclusión de la mejora de modelos de Deepgram para la voz. Dice que Subtext borra su copia de una conversación de sus servidores cinco días después de la última vez que la usas, o a los 90 días si la fijas. Dice que Deepgram, con esa exclusión activada, conserva el audio solo el tiempo que tarda en transcribirlo, y que Anthropic borra las entradas y salidas en 30 días, y puede conservar peticiones marcadas hasta dos años y las puntuaciones de seguridad relacionadas hasta siete años. Dice que Subtext no tiene un acuerdo de retención cero con ninguno de ellos24. Cómo tratan otros asistentes tu texto se compara en qué asistentes de escritura con IA entrenan con tus mensajes.

¿Qué idiomas admite Subtext?

Subtext escribe el mensaje en el idioma en que hablaste, en 17+ idiomas, y mantiene el nivel de formalidad que usaste donde el idioma lo marca. Una nota de voz en alemán vuelve como un mensaje en alemán. El resumen de una nota de voz que recibiste se escribe en el idioma en que llegó. Los editores de Google Play destacaron este flujo en un artículo “Hot Tip” que describe pulsar el icono del micrófono, hablar, pulsar otra vez y obtener un mensaje refinado con etiquetas sobre cómo sonaba el original y un botón de copiar25. Cuando abrí la página el 4 de octubre de 2026, la ficha de la tienda alemana mostraba 4,3 estrellas con 295 reseñas y más de 50.000 descargas, un recuento solo de Google Play; la cifra de estrellas cambia según el país. Subtext es de pago, y unos pocos análisis son gratis para empezar. Una nota de voz grabada vuelve como un mensaje que puedes enviar.

¿Cómo respondes a un mensaje de voz largo que te enviaron?

Subtext también lee los mensajes de voz que te mandan otras personas, y este es el lado en el que una transcripción sin más se acerca más a ser suficiente. La transcripción de WhatsApp en el dispositivo te deja leer una grabación de dos minutos donde tu idioma está cubierto23. Lo que no hace es decirte qué quiere la persona. El propio ejemplo del estudio de Ulm era una fecha y un lugar enterrados en el audio9. Una nota de voz larga de un amigo o de un jefe tiene la misma forma, con la pregunta en algún punto del medio y las razones alrededor. Para quien se atasca al responder, leer es uno de los cinco sitios donde se atasca una respuesta, y la mayoría de los participantes en el estudio de campo de Ulm posponía los mensajes de voz en el trabajo porque una grabación no se capta de un vistazo9.

Si pasas a Subtext un mensaje de voz recibido, lo transcribe, resume en una línea qué quiere de ti la persona y añade de dos a cinco puntos de acción. Después puede redactar una respuesta que retome el hilo, y no etiqueta el tono de quien lo envió. Los prompts del backend tratan un archivo de voz que adjuntas como un mensaje que lo más probable es que te haya enviado la otra persona, y si el modelo no está seguro de quién es quién, tiene instrucciones de preguntar. El resumen vale lo que valga la transcripción que tiene debajo, y una línea cuesta de leer sin su contexto, como muestra ¿qué significa este mensaje?. Con un acento marcado o una grabación con ruido, la transcripción llevará más errores que con inglés grabado en un estudio, así que escucha el original antes de responder a algo que importe. El texto y las capturas pasan por el mismo paso de resumen, así que un mensaje que recibiste recibe el mismo resumen de una línea.

Los experimentos más cercanos son antiguos y pequeños

Los dos experimentos más cercanos a un paso de reescritura o a un resumen que encontré son de 2003 y 2005, y los dos son pequeños. En 2003, un experimento financiado por DARPA hizo que 28 hablantes nativos de inglés leyeran pasajes de 150 a 250 palabras de habla telefónica y de emisiones de radio y televisión, como transcripciones literales y como transcripciones limpiadas a mano. Los lectores valoraron el texto limpiado como más fácil de entender, pero respondieron a preguntas sobre él sin más acierto ni rapidez, algo que los autores atribuyen a que los lectores ya puntuaban cerca del máximo. La limpieza automática de la salida imperfecta de un reconocedor tendió a valorarse como más difícil que la versión sin limpiar, aunque por muy poco26. La limpieza quitaba disfluencias y arreglaba la puntuación, pero no reescribía el texto hasta convertirlo en un mensaje.

En 2005, 16 personas respondieron preguntas sobre 15 mensajes de buzón de voz a partir de resúmenes extraídos automáticamente. Los resúmenes hechos con habla reconocida acertaron el nombre de quien llamaba el 57 por ciento de las veces, frente al 94 por ciento de los resúmenes hechos con transcripciones humanas, mientras que el motivo de la llamada llegaba igual de bien, en un 78 por ciento. La gente pedía el audio original más a menudo cuando el resumen venía del habla reconocida, el 53 por ciento de las veces frente al 30 por ciento27. Eran resúmenes extractivos de buzón de voz hechos con reconocimiento de voz de 2005, así que el estudio solo fija una expectativa. Ninguno de los dos estudios midió un mensaje que alguien fuera a enviar.

Dónde se acaba la evidencia

La evidencia sólida está en los dos extremos. El lenguaje hablado lleva disfluencias a un ritmo medido y la escritura no, y el reconocimiento de voz comete más errores con unos hablantes que con otros, con las cifras de arriba para demostrarlo. El medio es más delgado. No encontré ningún estudio que midiera cuánto mejor llega una nota de voz reescrita que una transcripción en bruto, ni con qué frecuencia una reescritura cambia el significado por el camino. La investigación sobre mensajería de voz son un puñado de estudios, el mayor con una muestra de encuesta sacada de una plataforma de microtareas de Estados Unidos y un estudio de campo de seis personas. La encuesta de YouGov es de un país y de un año. Y los estudios sobre notas de voz son anteriores a las transcripciones en el dispositivo, así que el traspaso de esfuerzo que describen ahora lo cierran en parte los propios mensajeros.

En la práctica todo depende de cómo hables. Si hablas en frases limpias, el dictado basta, y tu teléfono ya lo tiene. Si hablas como los hablantes de esos corpus, con las muletillas que contaron Clark y Fox Tree y los reinicios que catalogó Shriberg, una transcripción le entrega a quien recibe tu proceso de redacción, y un paso de reescritura es lo que la convierte en mensaje. Subtext es una app que hace ese paso, para la nota de voz que grabas y la que recibiste, y si tu problema es una respuesta que no dejas de editar, ¿por qué una respuesta de dos líneas me lleva una hora? trata de ese bucle. Prueba Subtext en tu navegadorPrueba Subtext en tu navegador

Fuentes

Numeradas en el orden en que aparecen por primera vez. Las páginas se comprobaron el 4 y el 5 de octubre de 2026, y la política de privacidad de Subtext se volvió a abrir el 10 de octubre de 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 a 169. Estudio de corpus de conversación en inglés americano; tasas y tipos de disfluencia.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Artículo de conferencia; el PDF no lleva año y sus referencias citadas llegan hasta 1996. Corpus etiquetados a mano de 40.515 palabras de 30 hablantes (Switchboard) y 12.762 palabras de 523 hablantes (AMEX, llamadas entre empleados de SRI y agentes de viajes). Financiado por DARPA y NSF. . Comprobado el 5 de octubre de 2026.
  3. Clark, H. H. y Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 a 111. Tasas de muletillas por hablante del corpus London-Lund.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D. y Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 a 7689. Cinco sistemas comerciales, 42 hablantes blancos y 73 negros, 19,8 horas de audio.
  5. Graham, C. y Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Solo el resumen; el texto completo no estaba accesible cuando lo comprobé.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C. y Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Preprint en arXiv.
  7. OpenAI. Whisper README. GitHub. . Comprobado el 4 de octubre de 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H. y Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 segmentos de audio de 437 participantes grabados en instituciones de Estados Unidos, con afasia y sin ella, procesados con la API de Whisper en abril y mayo de 2023. Financiado por el Pulitzer Center y el Center for Social Sciences de Cornell.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F. y Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Encuesta a 1.003 personas y estudio de campo de dos semanas con 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A. y Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publicado en diciembre de 2017. Estudio de laboratorio con 48 estudiantes universitarios, 24 por idioma, copiando frases en un iPhone. Dos autores trabajaban para Baidu USA, cuyo sistema de voz en servidor, Deep Speech 2, se ejecutó en un servidor de Baidu y se probó mediante una app para iPhone 6 Plus.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 estudios, 18.573 participantes.
  12. Yuan, J., Liberman, M. y Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversaciones telefónicas de Switchboard.
  13. YouGov. How many Britons like voice notes? 14 de junio de 2022. Encuesta a 2.149 adultos del Reino Unido, trabajo de campo el 5 y el 6 de mayo de 2022, 1.956 de ellos usuarios de smartphone; las cifras sobre la duración son porcentajes de quienes dieron una respuesta. Tablas de resultados en . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Comprobado el 4 y el 5 de octubre de 2026. Los porcentajes siguen el texto del artículo de YouGov; las tablas de resultados dan totales algo distintos para quienes lo rechazan, por el redondeo.
  14. Sampietro, A. y König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 a 71. Chats de WhatsApp en alemán y en español; resumen leído a través del registro Crossref de la editorial, texto completo de pago.
  15. Apple. Dictate text on iPhone. Guía del usuario del iPhone, iOS 27. . Comprobado el 4 de octubre de 2026.
  16. Apple. Siri, Dictation & Privacy. Legal, última actualización el 14 de septiembre de 2026. . Comprobado el 5 de octubre de 2026.
  17. Google. Type with your voice. Gboard Help. . Comprobado el 4 de octubre de 2026.
  18. Google. Use advanced voice typing features. Gboard Help. . Comprobado el 5 de octubre de 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Comprobado el 5 de octubre de 2026.
  20. Otter.ai. Convert Speech to Text. . Comprobado el 4 de octubre de 2026.
  21. Otter.ai. Supported languages. Centro de ayuda de Otter, artículo editado el 6 de mayo de 2026. . Comprobado el 5 de octubre de 2026.
  22. MacWhisper. Página de inicio. Página de marketing sin fecha, así que muestra lo que anuncia el producto y no cómo rinde. . Comprobado el 5 de octubre de 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21 de noviembre de 2024. . Comprobado el 4 de octubre de 2026.
  24. Subtext, Terms, privacy and your account. Política de privacidad actualizada por última vez el 26 de julio de 2026. Comprobado el 10 de octubre de 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Comprobado el 4 de octubre de 2026; la ficha mostraba 295 reseñas y más de 50K descargas en todas las tiendas que abrí, y 4,3 estrellas en la alemana.
  26. Jones, D. A. y otros seis coautores (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 a 1588. 32 hablantes nativos de inglés reclutados, 28 analizados. Patrocinado por DARPA con el contrato F19628-00-C-0002 de la Fuerza Aérea.
  27. Koumpis, K. y Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Prueba de comprensión con 16 participantes y 15 mensajes de buzón de voz; cifras leídas del PDF alojado por los autores. Financiado por una ayuda EPSRC ROPA, GR/R23954.