ArticlesOutils d'écriture
Pourquoi la transcription d'une note vocale n'est pas un message texte
La dictée simple transforme une note vocale en texte, mais tend à garder les mots de remplissage, les reprises et l'ordre où les idées vous sont venues. Ce que dit la recherche, et ce qu'ajoute une réécriture.
Par Samet Durgun · Cofondateur de Subtext · 22 min de lecture
· Mis à jour le 10 octobre 2026
La parole contient des mots de remplissage, des faux départs et des corrections en pleine phrase que l’écrit achevé ne contient généralement pas, alors la transcription brute d’une note vocale n’est pas encore un message. Les téléphones saisissent ce que vous avez dit, tout comme Otter, les transcriptions de WhatsApp et les applications bâties sur des modèles vocaux ouverts, mais la transcription d’une note vocale décousue reste un message décousu. Elle garde le « euh », la correction que vous avez faite à mi-chemin et l’ordre dans lequel les idées vous sont venues. Une application qui transforme une note vocale en message texte clair doit faire un second travail après la transcription. Elle doit comprendre ce que vous vouliez dire, puis l’écrire.
La première moitié porte sur la recherche. Des linguistes ont mesuré en quoi la langue parlée diffère de la langue écrite, des chercheurs en reconnaissance vocale ont mesuré où la transcription échoue et pour qui, et quelques études se sont demandé pourquoi les gens envoient des notes vocales et pourquoi les destinataires les remettent à plus tard. La seconde moitié porte sur ce que font les outils de dictée que les gens ont déjà, sur ce qu’ajoute une étape de réécriture et sur ce que Subtext fait d’une note vocale.
Comme cofondateur de Subtext, où la voix est l’une des trois façons d’entrer, à côté d’un brouillon tapé et de la capture d’écran d’une conversation, j’ai un intérêt dans la réponse. Chaque source ci-dessous est une source que j’ai ouverte. Quand je n’ai pu consulter qu’un résumé, je le dis et je n’en cite aucun chiffre.
La parole se produit autrement que l’écriture
Le parler spontané est plein de matière que l’écrit laisse de côté. Le survol que fait Elizabeth Shriberg des disfluences dans plusieurs corpus d’anglais américain parlé spontané établit le taux à jusqu’à dix pour cent des mots et à plus du tiers des énoncés1. Les formes sont les pauses remplies (« euh », « hum »), les répétitions (« je je pense »), les reprises où un mot est remplacé en milieu de phrase, et les faux départs, qu’elle range parmi les suppressions, où une proposition est abandonnée puis recommencée. Dans les deux corpus d’échanges entre humains qu’elle a examinés, des conversations téléphoniques informelles et des appels pour planifier un voyage, le taux par mot était d’environ six pour cent1, dans des échantillons de 40 515 et de 12 762 mots que son article du SRI sur les mêmes corpus a annotés à la main2. Dans un corpus de personnes qui parlent à un ordinateur en appuyant sur un bouton pour parler, le taux tombait sous un pour cent, et elle attribue une partie de la baisse au bouton. Les locuteurs pouvaient planifier l’énoncé d’abord, puis l’enregistrer1. Dans une note vocale, vous touchez une fois et vous parlez, et la planification se fait à voix haute.
Les mots de remplissage à l’oral, et à quel point les gens diffèrent
Les mots de remplissage à l’oral ne sont pas du bruit, et c’est en partie pourquoi il est difficile de les retirer. Herbert Clark et Jean Fox Tree ont soutenu, à partir de plusieurs grands corpus, que les « uh » et les « um » de l’anglais sont des mots à part entière, planifiés et produits comme les autres, qui servent à annoncer un court ou un long délai pendant que la personne cherche le mot suivant ou décide quoi dire3. Ils varient aussi énormément d’une personne à l’autre. Dans le corpus London-Lund, environ 170 000 mots tirés de 50 conversations britanniques en face à face enregistrées entre 1961 et 1976, surtout entre universitaires, les 65 locuteurs qui ont produit plus de 1 000 mots chacun allaient de 1,2 à 88,5 mots de remplissage par 1 000 mots, avec une médiane de 17,33. Certaines transcriptions sortent presque propres, d’autres portent un mot de remplissage tous les douze mots environ.
La disfluence se concentre aussi là où la planification est la plus lourde. Shriberg note, en citant des travaux antérieurs, qu’elle est plus probable au début d’une phrase1. Dans une note vocale, c’est l’ouverture, là où vous décidez encore à quoi sert le message. À l’écrit, vous pouvez effacer cette ouverture avant que quiconque la voie. Dans une note vocale, elle part en général, à moins que vous réenregistriez le message au complet.
Les erreurs de reconnaissance vocale varient selon la personne qui parle
La transcription ajoute ses propres erreurs à celles que vous avez prononcées. La mesure la plus claire que j’ai trouvée est une étude de 2020 parue dans PNAS, qui a fait passer cinq systèmes commerciaux de reconnaissance vocale, ceux d’Amazon, d’Apple, de Google, d’IBM et de Microsoft, sur 19,8 heures d’entrevues enregistrées de 42 locuteurs américains blancs et de 73 locuteurs américains noirs4. Le taux moyen d’erreur de mots était de 0,19 pour les locuteurs blancs et de 0,35 pour les locuteurs noirs, et chaque système montrait l’écart. Le meilleur, celui de Microsoft, a obtenu 0,15 et 0,27. Le pire, celui d’Apple, a obtenu 0,23 et 0,45. Plus de 20 % des extraits des locuteurs noirs sont revenus avec au moins la moitié des mots erronés, contre moins de 2 % des extraits des locuteurs blancs4. Les auteurs attribuent l’écart aux modèles acoustiques, la partie qui associe les sons aux mots, et pointent un manque d’audio de locuteurs noirs dans les données d’entraînement.
Un deuxième constat du même article compte pour les notes vocales. Les systèmes s’en sortaient un peu moins bien avec les hommes, ce que les auteurs attribuent à un style plus informel, avec des prononciations plus courtes et plus réduites et plus de disfluences4, le registre d’une note vocale à un ami.
Accents, langues secondes et mots que personne n’a dits
La reconnaissance vocale se débrouille aussi moins bien avec les accents et la parole en langue seconde. Un article de 2024 dans JASA Express Letters a testé le modèle Whisper d’OpenAI sur différents accents anglais et rapporte une exactitude plus élevée chez les locuteurs natifs que chez ceux dont l’anglais est une langue seconde, de meilleurs résultats pour l’anglais américain que pour le britannique ou l’australien, et de meilleurs résultats pour la parole lue que pour la conversation5. Je n’ai pu consulter que le résumé, alors je cite la direction et aucun chiffre. Whisper a été entraîné sur 680 000 heures d’audio, et ses auteurs décrivent les modèles comme approchant le niveau humain d’« accuracy and robustness »6. Sa propre documentation ajoute que « performance varies widely depending on the language »7. Une moyenne sur l’ensemble des locuteurs dit peu de chose d’une note vocale faite, par une personne fatiguée, dans sa langue seconde. Si cette langue est l’anglais, un message correct peut quand même paraître abrupt à un lecteur natif, et une transcription ne vous le dira pas.
Whisper peut aussi ajouter des mots que personne n’a dits. Une étude de 2024 a fait passer 13 140 courts extraits en anglais, issus de 437 participants enregistrés dans des établissements américains, avec et sans aphasie, par l’API hébergée de Whisper d’OpenAI, en avril et en mai 2023. Environ un pour cent des transcriptions contenaient des expressions ou des phrases entières absentes de l’audio, et 38 % de ces transcriptions comportaient au moins un préjudice explicite, comme de la violence ou une fausse affirmation d’autorité. Les extraits avec de longues pauses étaient plus à risque. Sur les 187 extraits où Whisper avait inventé du texte, Google, Amazon, Microsoft, AssemblyAI et RevAI n’ont produit aucune invention comparable. Les extraits étaient des entrevues, pas des notes vocales, et l’étude a testé l’API telle qu’elle était en 20238.
Pourquoi les gens envoient des notes vocales
Les gens envoient des notes vocales parce que c’est rapide pour l’expéditeur. La plus grande étude que j’ai trouvée vient de l’Université d’Ulm, un sondage de 2020 auprès de 1 003 personnes recrutées par Amazon Mechanical Turk, surtout aux États-Unis, plus une étude de terrain de deux semaines auprès de six grands utilisateurs9. Dans le sondage, 83 % avaient déjà reçu un message vocal et 73 % en avaient envoyé un. Les raisons d’envoi, tirées de 735 réponses ouvertes de personnes qui avaient enregistré un message vocal, se sont classées en quatre thèmes. Le total des thèmes dépasse les 735 réponses, alors certaines réponses relevaient de plus d’un thème. La commodité, puisque parler bat taper sur un téléphone, a été nommée 359 fois. Le ton et l’émotion que porte la voix et que le texte perd, 229 fois. Les situations où taper est malcommode ou dangereux, comme conduire, 203 fois. Et le destinataire, qui avait demandé un message vocal ou qui trouvait ça plus facile, 34 fois.
Une étude en laboratoire a mesuré la vitesse. Ses 48 étudiants universitaires, dont 24 de langue maternelle anglaise, copiaient de courtes phrases sur un iPhone, et la saisie vocale en anglais allait à 153 mots à la minute contre 52 au clavier, soit 2,93 fois plus vite, même si la voix laissait un peu plus d’erreurs non corrigées dans le texte final, 0,55 % contre 0,35 %. La tâche consistait à copier des phrases données, ce qui dit peu de chose sur la rédaction d’un message. Deux des auteurs travaillaient pour Baidu, dont le système de reconnaissance côté serveur, Deep Speech 2, a été testé au moyen d’une application sur iPhone 6 Plus, dans un article publié en 201710.
Les notes vocales font passer l’effort de l’expéditeur au destinataire
Dans l’étude de terrain d’Ulm, les 438 messages vocaux consignés sur deux semaines duraient de 1,5 seconde à un peu plus de sept minutes, avec une médiane de 17,5 secondes9. Les auteurs soulignent aussi un coût payé avant que quiconque écoute le message. Le son est transitoire, alors un enregistrement est lourd à réviser et à modifier, et un lapsus oblige à réenregistrer le message au complet9. Cinq des douze enregistrements abandonnés de leur étude de terrain étaient exactement dans ce cas.
Les auteurs écrivent que les messages vocaux « déplacent l’effort nécessaire à la communication vers le destinataire »9. Composer est rapide, mais récupérer l’information demande plus de temps et d’effort que lire un texte de même contenu, et la plupart des participants à leur étude de terrain remettaient à plus tard les messages vocaux au travail, parce qu’un texte se saisit d’un coup d’œil et qu’un enregistrement ne le permet pas. Leur solution proposée, en 2020, était des transcriptions automatiques, pour qu’on puisse trouver en parcourant le texte la date et le lieu d’un rendez-vous enfouis dans un enregistrement.
Pourquoi les destinataires les remettent à plus tard
Les destinataires ne peuvent pas lire en diagonale, alors ils reviennent sur ce qu’ils ont entendu. Dans la même étude de terrain, les gens écoutaient un message vocal reçu 1,37 fois en moyenne, et un message a été écouté 13 fois9. La lecture n’exige pas de réécoute. Une méta-analyse de 2019 portant sur 190 études et 18 573 participants établit la lecture silencieuse moyenne d’un texte non romanesque en anglais à 238 mots à la minute11. La parole conversationnelle va à environ 196 mots à la minute si l’on compte tout l’appel et à environ 164 dans les tours de parole d’une même personne, dans un grand corpus de conversations téléphoniques12. Le lecteur contrôle aussi le rythme et peut sauter directement à la question. L’auditeur reçoit les mots à la vitesse de la personne qui parle, dans son ordre.
Les gens ne les aiment pas beaucoup, un peu plus à la réception qu’à l’envoi. Un sondage YouGov auprès de 2 149 adultes britanniques, réalisé les 5 et 6 mai 2022 et publié en juin de la même année, a interrogé sur les notes vocales ceux d’entre eux qui avaient un téléphone intelligent, soit 1 956 personnes. De ce nombre, 16 % aimaient en envoyer et 36 % n’aimaient pas ça. Pour en recevoir, 22 % aimaient ça, 25 % n’aimaient pas ça et 29 % étaient ambivalents13. Seulement chez les 18 à 24 ans, plus de gens aimaient en recevoir que n’aimaient pas ça, 43 contre 28 %, et même dans ce groupe, la moitié n’aimait pas en envoyer, contre 30 % qui aimaient ça. Parmi tous les utilisateurs de téléphones intelligents, 63 % n’en avaient jamais envoyé.
Quelle durée est trop longue pour une note vocale?
Dans un sondage YouGov de mai 2022 auprès d’utilisateurs britanniques de téléphones intelligents, 65 % de ceux qui ont donné une réponse jugeaient qu’une note vocale d’une minute est trop longue, et parmi ceux qui n’aiment pas en recevoir et qui ont répondu, 57 % étaient frustrés par 30 secondes. Chez tous les utilisateurs de téléphones intelligents, 27 % ne savaient pas où se situait la limite. Quand on leur demandait comment ils préféraient recevoir un long message, 78 % choisissaient le texte et 14 % une note vocale, ce qui ne mesure qu’une préférence déclarée13. Certains expéditeurs semblent savoir que l’enregistrement est un dérangement. Une analyse de 2024 de conversations WhatsApp en Allemagne et en Espagne a observé des gens qui justifient leur choix de l’audio avant, pendant et après le message, et les auteurs décrivent ces justifications comme un travail relationnel, notamment en présentant la note vocale comme quelque chose dont il vaut la peine de s’excuser14. Dans ces trois sources, l’expéditeur économise de l’effort et le destinataire le paie, et certains expéditeurs s’en excusent.
Ce que la Dictée d’Apple fait d’une note vocale
La Dictée vous donne les mots dans l’ordre où vous les avez dits, et pour la Dictée d’Apple, c’est tout le travail. Le Guide de l’utilisateur de l’iPhone d’Apple pour iOS 27 décrit la Dictée comme traitée sur le téléphone, sans connexion Internet, dans de nombreuses langues, et insérant automatiquement virgules, points et points d’interrogation dans les langues prises en charge15. Sur les téléphones les plus récents, un modèle sur l’appareil améliore l’orthographe, la ponctuation et les majuscules, en anglais. Tout le reste passe par une commande vocale. Vous dites « nouvelle ligne », vous dites « supprimer » suivi de l’expression. L’affirmation du traitement sur l’appareil a une condition. La page de confidentialité d’Apple dit que si les réglages Clavier n’indiquent pas que la Dictée est traitée sur l’appareil, ce que vous dictez est envoyé aux serveurs d’Apple et n’est pas conservé, à moins que vous choisissiez « Améliorer Siri et Dictée ». Elle dit aussi qu’Apple peut conserver l’historique des requêtes et les transcriptions, liés à un identifiant d’appareil aléatoire et non à votre compte Apple, jusqu’à deux ans16. La page ne dit pas comment les deux s’articulent. La réécriture, c’est le travail des Outils d’écriture d’Apple, distincts de la Dictée, qui ne donnent aucune lecture de la façon dont un texte sera reçu.
Ce que font la saisie vocale de Google et celle de Microsoft
La saisie vocale de base de Gboard, chez Google, vous donne comme la Dictée d’Apple les mots tels que vous les avez dits. Touchez le micro, dites ce que vous voulez écrire et prononcez la ponctuation, même si la saisie vocale et la ponctuation ne sont pas offertes dans toutes les langues17. Ses fonctionnalités avancées de saisie vocale, sur Pixel 6 et les modèles suivants, ajoutent la ponctuation pendant que vous parlez, et sur Pixel 9 (le 9a exclu) et les modèles suivants, une commande vocale peut corriger, reformuler, raccourcir ou allonger ce que vous avez dicté. Google dit que cela fonctionne sur l’appareil, en anglais, en français, en italien, en japonais et en espagnol, l’allemand s’ajoutant bientôt18. Sous Windows, la page d’aide de Microsoft dit que la dictée fluide, une fonctionnalité des PC Copilot+, corrige la grammaire, la ponctuation et les mots de remplissage pendant que vous parlez19. Les fonctionnalités avancées de saisie vocale ne réécrivent que sur commande vocale. La dictée fluide fonctionne sans commande, mais seulement sur les PC Copilot+, et sa page d’aide ne mentionne pas de réordonner le message. Dans les pages d’aide d’Apple, de Google et de Microsoft citées ici, je n’ai trouvé aucune fonctionnalité qui transforme par défaut une note vocale décousue en message prêt à envoyer.
Ce que font les applications de transcription et les messageries
Otter, une application de transcription, va un cran plus loin qu’un clavier de téléphone. Sa page de conversion de la parole en texte décrit une transcription avec étiquettes de locuteurs et horodatages, un résumé généré automatiquement avec points saillants, et des points clés et des tâches à faire extraits20. Le centre d’aide d’Otter énumère l’anglais, l’espagnol, le français, l’allemand, le japonais et le chinois (simplifié) comme langues prises en charge21, ce qui dépasse ce que dit la page de conversion de la parole en texte. Otter est conçue pour les réunions, alors elle condense ce qui a été dit, et je n’ai trouvé sur ces deux pages aucune fonctionnalité qui rédige ce que vous aviez l’intention d’envoyer. Des modèles vocaux ouverts se trouvent sous le capot de certaines applications. Whisper lui-même produit une transcription et une étiquette de langue7. Les applications bâties dessus varient. MacWhisper annonce la suppression des mots de remplissage, des résumés et des consignes personnalisées par-dessus la transcription, et offre des modèles locaux ou dans le nuage pour cette étape22.
Les messageries ont commencé à transcrire les notes vocales que vous recevez. WhatsApp a ajouté les transcriptions de messages vocaux en novembre 2024, générées sur l’appareil pour que WhatsApp lui-même ne puisse pas les lire, activées sous Paramètres, puis Discussions, et déclenchées par un appui long sur le message23. Le billet dit que les transcriptions ont d’abord été offertes dans quelques langues choisies, et je n’ai pas pu confirmer la liste actuelle. Cela répond au problème du survol que les auteurs d’Ulm ont cerné, là où la langue est couverte. Ce que vous obtenez, c’est la transcription de la pensée à voix haute de quelqu’un d’autre. Vous pouvez la lire en réunion, mais vous devez quand même écrire la réponse.
Ce qu’ajoute une étape de réécriture
Une étape de réécriture transforme la transcription en message que vous auriez tapé si taper ne coûtait rien. Elle retire les mots de remplissage que décrivent Clark et Fox Tree, ramène à un seul énoncé les répétitions et les faux départs de la taxonomie de Shriberg, et place la correction faite à mi-chemin là où elle va, à la place de ce qu’elle corrigeait. Elle réordonne aussi. Les explications orales arrivent souvent comme elles vous sont venues, le contexte d’abord et la demande à la fin, ou la demande d’abord et les raisons qui traînent derrière. Un message écrit peut commencer par l’essentiel.
Deux choses que l’étape doit laisser intactes. La première est le sens. Une réécriture qui adoucit votre note vocale au point d’en faire une autre demande est pire que la transcription, parce que la transcription disait au moins ce que vous aviez dit. La seconde est le ton. Si vous étiez chaleureux, ou direct, ou en train de plaisanter, la version écrite doit être la même personne. Le risque ici est celui que décrit un autre article sur les textos qui sonnent comme un robot, où une réécriture revient polie et générique.
Il y a aussi un jugement qu’une transcription n’a jamais à poser. Une partie de ce que vous avez dit dans une note vocale était pour vous, pas pour le destinataire. Se demander à voix haute s’il faut mentionner quelque chose ne veut pas dire que vous aviez l’intention de le mentionner. Une étape de réécriture doit décider ce qui était le message et ce qui relevait du brouillon, et cette décision peut se tromper dans les deux sens, en gardant une phrase dont vous essayiez de vous dissuader ou en retirant une que vous vouliez dire. Je n’ai trouvé aucune étude qui ait mesuré la fréquence de ces erreurs avec quelque outil que ce soit, Subtext compris.
Ce que Subtext fait d’une note vocale
Subtext transcrit la note vocale que vous enregistrez dans l’application, puis écrit le message à partir de ce que vous vouliez dire et redonne jusqu’à trois versions, chacune avec un score « prêt à envoyer » qui dit la probabilité qu’elle soit reçue comme vous l’entendiez. Les versions sont conçues pour garder votre sens et votre personnalité. Pour un premier brouillon, une version reste proche de vos mots avec les problèmes corrigés, une est un polissage plus chaleureux ou une approche différente, et une est une réécriture plus complète. Si la formulation paraît plus froide ou plus sèche que vous le vouliez, l’application nomme le problème et marque les mots en cause. Rien n’est envoyé à votre place.
Les consignes du modèle couvrent les artefacts de transcription, et j’ai lu les consignes du backend avant d’écrire ceci. Quand un message est signalé comme dicté, on dit au modèle de s’attendre à des mots mal entendus ou fusionnés, à une ponctuation étrange et à des mots de remplissage égarés, de passer outre pour retrouver la formulation voulue, et de les corriger en silence sans les signaler comme une faute de votre part. La consigne montre ce qu’on dit au modèle de faire. Je n’ai trouvé aucune évaluation indépendante de la transcription vocale ou de la réécriture de Subtext, alors tout cela repose sur ce que montre l’application et sur ce que disent ses consignes et sa politique de confidentialité. Comme aucune des études ci-dessus n’a testé Deepgram, le modèle vocal qui transcrit l’audio de Subtext, je ne peux pas dire jusqu’où les tendances d’erreurs liées aux accents, à la parole en langue seconde et au style décontracté s’appliquent à lui, alors relisez le message avant de l’envoyer.
Qu’arrive-t-il à un enregistrement vocal dans Subtext?
Subtext envoie un enregistrement vocal à Deepgram pour la transcription, alors l’audio quitte le téléphone. Sa politique de confidentialité, mise à jour le 26 juillet 2026, nomme plusieurs fournisseurs, dont Deepgram pour les enregistrements vocaux, Anthropic pour le texte, les images et les transcriptions vocales, Google Firebase pour les comptes et les conversations, et OpenAI seulement si vous activez la lecture à voix haute. La politique ajoute que, lorsque la recherche Web est activée, des termes de recherche tirés de votre demande passent par Anthropic vers des fournisseurs de recherche tiers, et que vous pouvez désactiver la recherche Web dans les réglages de l’application24. Elle dit que rien de ce que vous soumettez n’est utilisé pour entraîner un modèle d’IA et qu’aucun de ses fournisseurs d’IA n’a le droit de s’en servir pour l’entraîner, Subtext activant aussi pour la voix l’option de retrait de l’amélioration des modèles chez Deepgram. Elle dit que Subtext supprime sa propre copie d’une conversation de ses serveurs cinq jours après votre dernière utilisation, ou 90 jours si vous l’épinglez. Elle dit que Deepgram, avec ce retrait activé, ne garde l’audio que le temps de le transcrire, qu’Anthropic supprime les entrées et les sorties dans un délai de 30 jours, et qu’Anthropic peut conserver des requêtes signalées jusqu’à deux ans et les scores de sécurité associés jusqu’à sept ans. Elle dit que Subtext n’a conclu aucune entente de rétention zéro avec aucun d’eux24. La façon dont les autres assistants traitent votre texte est comparée dans quels assistants d’écriture IA s’entraînent sur vos messages.
Quelles langues Subtext prend-il en charge?
Subtext écrit le message dans la langue que vous avez parlée, dans 17+ langues, et garde le niveau de formalité que vous avez employé là où la langue en marque un. Une note vocale en allemand revient sous forme de message en allemand. Le résumé d’une note vocale que vous avez reçue est écrit dans la langue où elle est arrivée. Les éditeurs de Google Play ont mis ce parcours de l’avant dans un article « Hot Tip » qui décrit comment toucher l’icône du micro, parler, toucher de nouveau, puis obtenir un message peaufiné, avec des étiquettes sur la façon dont l’original est ressorti et un bouton de copie25. Quand j’ai ouvert la page le 4 octobre 2026, la fiche de la boutique allemande affichait 4,3 étoiles pour 295 avis et plus de 50 000 téléchargements, un compte propre à Google Play; la note en étoiles diffère selon le pays. Utiliser Subtext est payant, et quelques analyses sont gratuites pour commencer. Une note vocale enregistrée revient sous la forme d’un message que vous pouvez envoyer.
Comment répondre à un long message vocal qu’on vous a envoyé?
Subtext lit aussi les messages vocaux que d’autres personnes vous envoient, et c’est de ce côté qu’une simple transcription se rapproche le plus de suffire. La transcription sur l’appareil de WhatsApp vous permet de lire un enregistrement de deux minutes là où votre langue est couverte23. Ce qu’elle ne fait pas, c’est vous dire ce que la personne veut. L’exemple de l’étude d’Ulm était une date et un lieu enfouis dans l’audio9. Une longue note vocale d’un ami ou d’un supérieur a la même forme, la question quelque part au milieu et les raisons tout autour. Pour les gens qui tardent à répondre, l’étape de lecture est l’un des cinq endroits où une réponse reste bloquée, et la plupart des participants à l’étude de terrain d’Ulm remettaient à plus tard les messages vocaux au travail parce qu’on ne peut pas saisir un enregistrement d’un coup d’œil9.
Déposez un message vocal reçu dans Subtext, et il le transcrit, résume en une ligne ce que la personne attend de vous et ajoute de deux à cinq points d’action. Il peut ensuite rédiger une réponse qui reprend le fil, et il n’étiquette pas le ton de l’expéditeur. Les consignes du backend traitent un fichier vocal que vous joignez comme un fichier probablement envoyé par l’autre personne, et si le modèle ne sait pas qui est qui, on lui dit de poser la question. Le résumé vaut ce que vaut la transcription en dessous, et une seule ligne se lit mal sans son contexte, comme le montre ce que veut dire un texto. Pour un accent prononcé ou un enregistrement bruyant, la transcription contiendra plus d’erreurs que pour de l’anglais de studio, alors écoutez l’original avant de répondre à quoi que ce soit d’important. Les textes et les captures d’écran passent par la même étape de résumé, alors un message que vous avez reçu obtient le même résumé d’une ligne.
Les expériences les plus proches sont anciennes et petites
Les deux expériences les plus proches d’une étape de réécriture ou d’un résumé que j’ai trouvées datent de 2003 et de 2005, et toutes deux sont petites. En 2003, une expérience financée par la DARPA a fait lire à 28 locuteurs natifs de l’anglais des passages de 150 à 250 mots de parole téléphonique et radiodiffusée, sous forme de transcriptions mot à mot et de versions nettoyées à la main. Les lecteurs ont jugé le texte nettoyé plus facile à comprendre, mais ils n’ont pas répondu plus justement ni plus vite aux questions à son sujet, ce que les auteurs attribuent au fait que les lecteurs avaient déjà des résultats proches du maximum. Le nettoyage automatique d’une sortie imparfaite de système de reconnaissance tendait à être jugé plus difficile que la version non nettoyée, mais de justesse seulement26. Le nettoyage retirait les disfluences et corrigeait la ponctuation, sans réécrire le texte en message.
En 2005, 16 personnes ont répondu à des questions sur 15 messages de boîte vocale à partir de résumés extraits automatiquement. Les résumés construits à partir de la parole reconnue trouvaient correctement le nom de la personne qui appelait dans 57 % des cas, contre 94 % pour ceux construits à partir de transcriptions humaines, alors que le motif de l’appel passait aussi bien dans les deux cas, à 78 %. Les gens demandaient plus souvent l’audio original quand le résumé venait de la parole reconnue, 53 % du temps contre 30 %27. C’étaient des résumés extractifs de messages de boîte vocale faits avec la reconnaissance vocale de 2005, alors l’étude ne fixe qu’une attente. Aucune des deux études n’a mesuré un message que quelqu’un enverrait.
Là où les preuves s’arrêtent
Les preuves solides se trouvent aux deux extrémités. La langue parlée porte une disfluence, à un taux mesuré, que l’écrit n’a pas, et la reconnaissance vocale fait plus d’erreurs pour certains locuteurs que pour d’autres, chiffres à l’appui plus haut. Le milieu est plus mince. Je n’ai trouvé aucune étude qui ait mesuré de combien une note vocale réécrite passe mieux qu’une transcription brute, ni à quelle fréquence une réécriture change le sens en chemin. La recherche sur la messagerie vocale tient en une poignée d’études, la plus grande reposant sur un échantillon de sondage tiré d’une plateforme américaine de microtravail et sur une étude de terrain de six personnes. Le sondage YouGov porte sur un pays et une année. Et les études sur les notes vocales précèdent les transcriptions sur l’appareil, alors le déplacement d’effort qu’elles décrivent est maintenant en partie comblé par les messageries elles-mêmes.
En pratique, tout dépend de votre façon de parler. Si vous parlez en phrases nettes, la dictée suffit, et votre téléphone l’a déjà. Si vous parlez comme les locuteurs de ces corpus, avec les mots de remplissage que Clark et Fox Tree ont comptés et les reprises que Shriberg a cataloguées, une transcription remet au destinataire votre travail de brouillon, et c’est une étape de réécriture qui en fait un message. Subtext est une application qui fait cette étape, pour la note vocale que vous enregistrez et pour celle que vous avez reçue, et si votre problème est une réponse que vous n’arrêtez pas de retoucher, pourquoi une réponse courte prend une heure parle de cette boucle. Essayer Subtext dans votre navigateurScannez-le avec l'appareil photo de votre téléphone pour installer.Essayer Subtext dans votre navigateur
Sources
Numérotées dans l’ordre de leur première apparition. Pages vérifiées les 4 et 5 octobre 2026; la politique de confidentialité de Subtext a été rouverte le 10 octobre 2026.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 à 169. Étude de corpus de conversations en anglais américain; fréquences et types de disfluences.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Communication de conférence; le PDF n’indique aucune année, et les références qu’il cite vont jusqu’à 1996. Corpus annotés à la main de 40 515 mots de 30 locuteurs (Switchboard) et de 12 762 mots de 523 locuteurs (AMEX, appels entre des employés de SRI et des agents de voyages). Financé par la DARPA et la NSF. . Vérifié le 5 octobre 2026.
- Clark, H. H., et Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 à 111. Taux de mots de remplissage par locuteur tirés du corpus London-Lund.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., et Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 à 7689. Cinq systèmes commerciaux, 42 locuteurs blancs et 73 locuteurs noirs, 19,8 heures d’audio.
- Graham, C., et Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Résumé seulement; le texte complet n’était pas accessible au moment de la vérification.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., et Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Prépublication arXiv.
- OpenAI. Whisper README. GitHub. . Vérifié le 4 octobre 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., et Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13 140 segments audio de 437 participants enregistrés dans des établissements américains, avec et sans aphasie, traités par l’API Whisper en avril et en mai 2023. Financé par le Pulitzer Center et le Center for Social Sciences de Cornell.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., et Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Sondage de 1 003 personnes et étude de terrain de deux semaines auprès de 6 personnes.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., et Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publié en décembre 2017. Étude en laboratoire auprès de 48 étudiants universitaires, 24 par langue, qui copient des phrases sur un iPhone. Deux auteurs travaillaient pour Baidu USA, dont le système vocal côté serveur, Deep Speech 2, tournait sur un serveur de Baidu et a été testé au moyen d’une application sur iPhone 6 Plus.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 études, 18 573 participants.
- Yuan, J., Liberman, M., et Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversations téléphoniques Switchboard.
- YouGov. How many Britons like voice notes? 14 juin 2022. Sondage auprès de 2 149 adultes britanniques, réalisé les 5 et 6 mai 2022, dont 1 956 utilisateurs de téléphones intelligents; les chiffres sur la durée sont des parts des répondants qui ont donné une réponse. Tableaux de résultats à . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Vérifié les 4 et 5 octobre 2026. Les pourcentages suivent le texte de l’article de YouGov; les tableaux de résultats donnent des totaux légèrement différents pour ceux qui n’aiment pas ça, en raison de l’arrondi.
- Sampietro, A., et König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 à 71. Conversations WhatsApp en allemand et en espagnol; résumé lu dans la notice Crossref de l’éditeur, texte complet payant.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Vérifié le 4 octobre 2026.
- Apple. Siri, Dictation & Privacy. Juridique, dernière mise à jour le 14 septembre 2026. . Vérifié le 5 octobre 2026.
- Google. Type with your voice. Gboard Help. . Vérifié le 4 octobre 2026.
- Google. Use advanced voice typing features. Gboard Help. . Vérifié le 5 octobre 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Vérifié le 5 octobre 2026.
- Otter.ai. Convert Speech to Text. . Vérifié le 4 octobre 2026.
- Otter.ai. Supported languages. Otter Help Center, article modifié le 6 mai 2026. . Vérifié le 5 octobre 2026.
- MacWhisper. Homepage. Page de marketing, sans date, alors elle montre ce que le produit annonce et non son rendement. . Vérifié le 5 octobre 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 novembre 2024. . Vérifié le 4 octobre 2026.
- Subtext, Conditions, confidentialité et votre compte. Politique de confidentialité mise à jour pour la dernière fois le 26 juillet 2026. Vérifié le 10 octobre 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Vérifié le 4 octobre 2026; la fiche affichait 295 avis et plus de 50 000 téléchargements sur chaque boutique que j’ai ouverte, et 4,3 étoiles sur la boutique allemande.
- Jones, D. A., et six coauteurs (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 à 1588. 32 locuteurs natifs de l’anglais recrutés, 28 analysés. Parrainé par la DARPA en vertu du contrat F19628-00-C-0002 de l’Air Force.
- Koumpis, K., et Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Test de compréhension auprès de 16 participants et de 15 messages de boîte vocale; chiffres lus dans le PDF hébergé par l’auteur. Financé par une bourse ROPA de l’EPSRC, GR/R23954.