ArticlesOutils d'écriture
Pourquoi la transcription d'une note vocale n'est pas un texto
La dictée transforme une note vocale en texte, mais tend à garder les euh, les faux départs et l'ordre dans lequel vos idées sont venues. Ce que dit la recherche, et ce qu'ajoute une étape de réécriture.
Par Samet Durgun · Cofondateur de Subtext · 21 min de lecture
· Mis à jour le 10 octobre 2026
L’oral contient des mots de remplissage, des faux départs et des corrections en pleine phrase que l’écrit abouti évite en grande partie, si bien que la transcription brute d’une note vocale n’est pas encore un message. Les téléphones écrivent ce que vous dites, tout comme Otter, les transcriptions de WhatsApp et les applis bâties sur des modèles vocaux ouverts, mais la transcription d’une note vocale décousue reste un message décousu. Elle garde les « euh », la correction que vous avez faite à mi-phrase et l’ordre dans lequel les choses vous sont venues. Une appli qui transforme une note vocale en texto clair doit faire un deuxième travail après la transcription. Elle doit comprendre ce que vous vouliez dire, puis l’écrire.
La première moitié de cet article est de la recherche. Des linguistes ont mesuré en quoi la langue parlée diffère de la langue écrite, des chercheurs en reconnaissance vocale ont mesuré où la transcription échoue et pour qui, et quelques études ont demandé pourquoi les gens envoient des notes vocales et pourquoi les destinataires les remettent à plus tard. La seconde moitié porte sur ce que font les outils de dictée que les gens ont déjà, sur ce qu’ajoute une étape de réécriture, et sur ce que Subtext fait d’une note vocale.
Je suis cofondateur de Subtext, où la voix est l’une des trois façons d’entrer, à côté d’un brouillon tapé et de la capture d’écran d’une conversation, donc je ne suis pas neutre sur la réponse. Chaque source ci-dessous est une source que j’ai ouverte. Quand je n’ai pu atteindre qu’un résumé, je le dis et je n’en cite aucun chiffre.
L’oral ne se produit pas comme l’écrit
La parole spontanée est pleine d’éléments que l’écriture laisse de côté. L’étude d’ensemble d’Elizabeth Shriberg sur les disfluences, à travers plusieurs corpus d’anglais américain parlé spontané, chiffre le taux de disfluences jusqu’à dix pour cent des mots, et à plus d’un tiers des énoncés1. Les formes sont les pauses remplies (« euh », « hum »), les répétitions (« je je pense »), les réparations où un mot est remplacé au milieu d’une phrase, et les faux départs, qu’elle range parmi les suppressions, où une proposition est abandonnée puis recommencée. Dans les deux corpus d’échanges entre humains qu’elle a examinés, des conversations téléphoniques informelles et des appels pour organiser un voyage, le taux par mot était d’environ six pour cent1, sur des échantillons de 40 515 et de 12 762 mots que son article du SRI sur les mêmes corpus décrit comme étiquetés à la main2. Dans un corpus de personnes qui parlaient à un ordinateur en appuyant sur un bouton pour parler, le taux tombait sous un pour cent, et elle attribue une partie de la baisse au bouton. Les locuteurs pouvaient planifier l’énoncé d’abord, puis l’enregistrer1. Dans une note vocale, vous appuyez une fois et vous parlez, et la planification se fait à voix haute.
Les mots de remplissage à l’oral, et leurs écarts d’un locuteur à l’autre
Les mots de remplissage à l’oral ne sont pas du bruit, ce qui explique en partie pourquoi ils sont difficiles à retirer. Herbert Clark et Jean Fox Tree ont soutenu, à partir de plusieurs grands corpus, que « uh » et « um » sont des mots à part entière, planifiés et produits comme les autres, qui servent à annoncer un retard court ou long pendant que le locuteur cherche le mot suivant ou décide de ce qu’il va dire3. Ils varient aussi énormément d’un locuteur à l’autre. Dans le corpus London-Lund, environ 170 000 mots tirés de 50 conversations britanniques en face à face enregistrées entre 1961 et 1976, surtout entre universitaires, les 65 locuteurs qui ont produit plus de 1 000 mots chacun allaient de 1,2 à 88,5 mots de remplissage pour 1 000 mots, avec une médiane de 17,33. Certaines transcriptions sortent presque propres, d’autres portent un mot de remplissage tous les douze mots environ.
Les disfluences se concentrent aussi là où la planification pèse le plus. Shriberg note, en citant des travaux antérieurs, qu’elles sont plus probables au début d’une phrase1. Dans une note vocale, c’est l’ouverture, au moment où vous décidez encore à quoi sert le message. À l’écrit, vous pouvez supprimer cette ouverture avant que quiconque la voie. Dans une note vocale, elle part en général avec le reste, sauf si vous réenregistrez tout le message.
Les erreurs de reconnaissance vocale selon les locuteurs
La transcription ajoute ses propres erreurs à celles que vous avez prononcées. La mesure la plus nette que j’ai trouvée est une étude de 2020 parue dans PNAS, qui a fait passer cinq systèmes commerciaux de reconnaissance vocale, ceux d’Amazon, d’Apple, de Google, d’IBM et de Microsoft, sur 19,8 heures d’audio d’entretiens avec 42 locuteurs américains blancs et 73 locuteurs américains noirs4. Le taux d’erreur moyen par mot était de 0,19 pour les locuteurs blancs et de 0,35 pour les locuteurs noirs, et chaque système montrait cet écart. Le meilleur, Microsoft, obtenait 0,15 et 0,27. Le pire, Apple, 0,23 et 0,45. Plus de 20 % des extraits des locuteurs noirs revenaient avec au moins la moitié des mots faux, contre moins de 2 % de ceux des locuteurs blancs4. Les auteurs attribuent l’écart aux modèles acoustiques, la partie qui associe les sons aux mots, et y voient la conséquence d’un manque d’audio de locuteurs noirs dans les données d’entraînement.
Un second constat du même article compte pour les notes vocales. Les systèmes s’en sortaient un peu moins bien avec les locuteurs masculins, ce que les auteurs attribuent à un style plus informel, avec des prononciations plus courtes et plus réduites et davantage de disfluences4, le registre d’une note vocale envoyée à un ami.
Accents, langues secondes et mots que personne n’a dits
La reconnaissance vocale se comporte aussi moins bien avec les accents et la parole en langue seconde. Un article de 2024 dans JASA Express Letters a testé le modèle Whisper d’OpenAI sur plusieurs accents anglais et rapporte une meilleure précision pour les locuteurs natifs que pour ceux dont l’anglais est une langue seconde, de meilleurs résultats pour l’anglais américain que pour le britannique ou l’australien, et de meilleurs résultats sur la parole lue que sur la conversation5. Je n’ai pu atteindre que le résumé, donc je cite la tendance et aucun chiffre. Whisper a été entraîné sur 680 000 heures d’audio, et ses auteurs disent que les modèles approchent le niveau humain en matière de précision et de robustesse (« accuracy and robustness »)6. Sa propre documentation ajoute, en anglais, que « performance varies widely depending on the language », soit que les performances varient beaucoup selon la langue7. Une moyenne sur l’ensemble des locuteurs dit peu de chose d’une note vocale enregistrée à bout de fatigue dans votre seconde langue. Si cette langue est l’anglais, un message correct peut quand même sembler abrupt à un lecteur natif, et une transcription ne vous le dira pas.
Whisper peut aussi ajouter des mots que personne n’a dits. Une étude de 2024 a fait passer 13 140 courts extraits en anglais, issus de 437 participants enregistrés dans des établissements américains, avec et sans aphasie, dans l’API Whisper hébergée d’OpenAI en avril et mai 2023. Environ un pour cent des transcriptions contenaient des expressions ou des phrases entières absentes de l’audio, et 38 % d’entre elles portaient au moins un préjudice explicite, comme de la violence ou une fausse revendication d’autorité. Les extraits comportant de longues pauses couraient plus de risques. Sur les 187 extraits où Whisper avait inventé du texte, Google, Amazon, Microsoft, AssemblyAI et RevAI n’ont produit aucune invention comparable. Les extraits étaient des entretiens, pas des notes vocales, et l’étude a testé l’API telle qu’elle était en 20238.
Pourquoi les gens envoient des notes vocales
Les gens envoient des notes vocales parce que c’est rapide pour l’expéditeur. La plus vaste étude que j’ai trouvée vient de l’université d’Ulm, une enquête de 2020 auprès de 1 003 personnes recrutées via Amazon Mechanical Turk, surtout aux États-Unis, plus une étude de terrain de deux semaines auprès de six gros utilisateurs9. Dans l’enquête, 83 % avaient reçu un message vocal et 73 % en avaient envoyé un. Les raisons d’envoyer, tirées de 735 réponses ouvertes de personnes ayant enregistré un message vocal, se classaient en quatre thèmes. Le total des thèmes dépasse les 735 réponses, donc certaines réponses relevaient de plusieurs thèmes. La commodité, puisque parler va plus vite que taper sur un téléphone, a été citée 359 fois. Le ton et l’émotion que porte une voix et que le texte perd, 229. Les situations où taper est malcommode ou dangereux, comme conduire, 203. Et le destinataire, qui avait demandé de la voix ou la trouvait plus facile, 34.
Une étude en laboratoire a mesuré la vitesse. Ses 48 étudiants, dont 24 de langue maternelle anglaise, recopiaient de courtes phrases sur un iPhone, et la saisie vocale en anglais allait à 153 mots par minute contre 52 au clavier, soit 2,93 fois plus vite, même si la voix laissait un peu plus d’erreurs non corrigées dans le texte final, 0,55 % contre 0,35 %. La tâche consistait à recopier des phrases imposées, ce qui dit peu de chose de la rédaction d’un message. Deux des auteurs travaillaient pour Baidu, dont le système de reconnaissance côté serveur, Deep Speech 2, a été testé via une appli iPhone 6 Plus, dans un article publié en 201710.
Les notes vocales déplacent l’effort de l’expéditeur vers le destinataire
Dans l’étude de terrain d’Ulm, 438 messages vocaux consignés sur deux semaines allaient de 1,5 seconde à un peu plus de sept minutes, avec une médiane de 17,5 secondes9. Les auteurs soulignent aussi un coût payé avant que quiconque l’entende. Le son est fugace, donc un enregistrement est pénible à réécouter et à corriger, et un lapsus oblige à réenregistrer tout le message9. Cinq des douze enregistrements abandonnés dans leur étude de terrain étaient exactement cela.
Les auteurs écrivent que les messages vocaux « shift the effort necessary for communication towards the receiver », c’est-à-dire qu’ils reportent sur le destinataire l’effort que demande la communication9. Composer est rapide, retrouver une information prend plus de temps et d’effort que lire un texte de même contenu, et la plupart de leurs participants à l’étude de terrain remettaient à plus tard les messages vocaux au travail, parce qu’un texte se saisit d’un coup d’œil et pas un enregistrement. Leur remède proposé, en 2020, était des transcriptions automatiques, pour qu’on puisse retrouver en parcourant le texte la date et le lieu d’un rendez-vous enfouis dans un enregistrement.
Pourquoi les destinataires les repoussent
Les destinataires ne peuvent pas survoler, donc ils reviennent sur ce qu’ils ont entendu. Dans la même étude de terrain, les gens rejouaient un message vocal reçu 1,37 fois en moyenne, et un message l’a été 13 fois9. Lire n’exige pas de réécoute. Une méta-analyse de 2019 portant sur 190 études et 18 573 participants situe la lecture silencieuse moyenne d’un texte documentaire en anglais à 238 mots par minute11. La parole conversationnelle va à environ 196 mots par minute si l’on compte tout l’appel, et à environ 164 dans les tours de parole d’un même locuteur, dans un grand corpus téléphonique12. Le lecteur règle aussi son rythme et peut sauter à la question. L’auditeur reçoit les mots à la vitesse du locuteur, dans l’ordre du locuteur.
Les gens ne les aiment guère, et un peu plus à la réception qu’à l’envoi. Un sondage YouGov auprès de 2 149 adultes britanniques, réalisé les 5 et 6 mai 2022 et publié en juin, a interrogé sur les notes vocales ceux d’entre eux qui avaient un smartphone, soit 1 956 personnes. Parmi elles, 16 % aimaient en envoyer et 36 % n’aimaient pas ça. Pour en recevoir, 22 % aimaient, 25 % n’aimaient pas et 29 % étaient ambivalents13. Seuls les 18 à 24 ans étaient plus nombreux à aimer en recevoir qu’à ne pas aimer, 43 contre 28 %, et même dans ce groupe, la moitié n’aimait pas en envoyer contre 30 % qui aimaient. Sur l’ensemble des utilisateurs de smartphone, 63 % n’en avaient jamais envoyé.
Quelle durée est trop longue pour une note vocale ?
Dans un sondage YouGov de mai 2022 auprès d’utilisateurs britanniques de smartphone, 65 % de ceux qui ont répondu jugeaient qu’une note vocale d’une minute est trop longue, et parmi ceux qui n’aiment pas en recevoir et ont répondu, 57 % étaient agacés dès 30 secondes. Sur l’ensemble des utilisateurs de smartphone, 27 % ne savaient pas où placer la limite. Quand on leur demandait comment ils préféraient recevoir un long message, 78 % choisissaient le texte et 14 % la note vocale, ce qui ne reflète qu’une préférence déclarée13. Certains expéditeurs semblent savoir que l’enregistrement est une contrainte. Une analyse de 2024 de conversations WhatsApp en Allemagne et en Espagne a trouvé des gens qui justifient leur choix de l’audio avant, pendant et après le message, et les auteurs décrivent ces justifications comme un travail social, qui inclut de présenter la note vocale comme quelque chose dont il faut s’excuser14. Dans ces trois sources, l’expéditeur économise de l’effort et le destinataire le paie, et certains expéditeurs s’en excusent.
Ce que fait la Dictée d’Apple d’une note vocale
La Dictée donne les mots dans l’ordre où vous les avez dits, et pour la Dictée d’Apple, c’est là tout son travail. Le guide de l’iPhone pour iOS 27 décrit la Dictée comme traitée sur le téléphone, sans connexion internet, dans de nombreuses langues, avec insertion automatique des virgules, des points et des points d’interrogation là où la langue le permet15. Sur les téléphones les plus récents, un modèle sur l’appareil améliore l’orthographe, la ponctuation et les majuscules, en anglais. Tout le reste passe par une commande vocale. Vous dites « nouvelle ligne », vous dites « supprimer » suivi de la phrase. L’affirmation selon laquelle tout est traité sur l’appareil a une condition. La page de confidentialité d’Apple dit que si les Réglages du clavier n’indiquent pas que la Dictée est traitée sur l’appareil, ce que vous dictez est envoyé aux serveurs d’Apple et n’est pas conservé sauf si vous activez Améliorer Siri et la dictée. Elle dit aussi qu’Apple peut garder un historique des requêtes et des transcriptions, associé à un identifiant d’appareil aléatoire et non à votre compte Apple, jusqu’à deux ans16. La page n’explique pas comment les deux se concilient. La réécriture relève des Outils d’écriture d’Apple, des outils distincts, qui ne donnent aucune lecture de la façon dont un texte sera reçu.
Ce que font la saisie vocale de Google et celle de Microsoft
La saisie vocale de base de Gboard, chez Google, comme la Dictée d’Apple, donne les mots tels que vous les avez dits. Touchez le micro, dites ce que vous voulez écrire et dictez la ponctuation, même si la saisie vocale et la ponctuation ne sont pas disponibles dans toutes les langues17. Ses fonctionnalités avancées de saisie vocale, sur Pixel 6 et les suivants, ajoutent la ponctuation pendant que vous parlez, et sur Pixel 9 (sauf le 9a) et les suivants, une commande vocale peut relire, reformuler, raccourcir ou allonger ce que vous avez dicté. Google dit que cela tourne sur l’appareil, en anglais, en français, en italien, en japonais et en espagnol, l’allemand arrivant bientôt18. Sous Windows, la page d’aide de Microsoft dit que la dictée fluide, une fonctionnalité des PC Copilot+, corrige la grammaire, la ponctuation et les mots de remplissage pendant que vous parlez19. La saisie vocale avancée ne réécrit que sur commande vocale. La dictée fluide fonctionne sans commande, mais seulement sur les PC Copilot+, et sa page d’aide ne mentionne pas de réorganisation du message. Dans les pages d’aide d’Apple, de Google et de Microsoft citées ici, je n’ai trouvé aucune fonctionnalité qui transforme par défaut une note vocale décousue entière en message prêt à envoyer.
Ce que font les applis de transcription et les messageries
Otter, une appli de transcription, va un cran plus loin qu’un clavier de téléphone. Sa page de transcription vocale décrit une transcription avec étiquettes de locuteur et horodatage, un résumé généré automatiquement avec les temps forts, et des points clés et des actions à mener extraits20. Le centre d’aide d’Otter liste l’anglais, l’espagnol, le français, l’allemand, le japonais et le chinois (simplifié) comme langues prises en charge21, soit plus que ce que dit la page de transcription vocale. Otter est conçu pour les réunions, donc il condense ce qui a été dit, et je n’ai trouvé sur ces deux pages aucune fonctionnalité qui rédige ce que vous vouliez envoyer. Des modèles vocaux ouverts se cachent sous certaines applis. Whisper lui-même produit une transcription et une étiquette de langue7. Les applis bâties dessus varient. MacWhisper annonce la suppression des mots de remplissage, des résumés et des prompts personnalisés par-dessus la transcription, et propose des modèles locaux ou dans le cloud pour cette étape22.
Les messageries ont commencé à transcrire les notes vocales que vous recevez. WhatsApp a ajouté les transcriptions de messages vocaux en novembre 2024, générées sur l’appareil, si bien que WhatsApp lui-même ne peut pas les lire, activables dans Paramètres puis Discussions et déclenchées par un appui long sur le message23. L’article précise que les transcriptions ont démarré dans quelques langues choisies, et je n’ai pas pu confirmer la liste actuelle. Cela répond au problème de lecture rapide que les auteurs d’Ulm avaient identifié, là où la langue est couverte. Ce que vous obtenez, c’est la transcription de la pensée à voix haute de quelqu’un d’autre. Vous pouvez la lire en réunion, mais vous devez toujours écrire la réponse.
Ce qu’ajoute une étape de réécriture
Une étape de réécriture transforme la transcription en message que vous auriez tapé si taper ne coûtait rien. Elle retire les mots de remplissage que décrivent Clark et Fox Tree, réduit à une seule formulation les répétitions et les faux départs de la typologie de Shriberg, et place la correction que vous avez faite à mi-phrase là où elle doit être, à la place de ce qu’elle corrigeait. Elle réordonne aussi. Les explications orales arrivent en général comme elles vous sont venues, le contexte d’abord et la demande à la fin, ou la demande d’abord et les raisons qui traînent derrière. Un message écrit peut commencer par l’essentiel.
Il y a deux choses que l’étape doit laisser intactes. La première est le sens. Une réécriture qui lisse votre note vocale en une demande différente est pire que la transcription, parce que la transcription disait au moins ce que vous aviez dit. La seconde est le ton. Si vous étiez chaleureux, ou direct, ou en train de plaisanter, la version écrite doit être la même personne. Le risque ici est celui traité dans L’IA rend-elle vos textos robotiques ?, où la réécriture revient polie et générique.
Il y a aussi un jugement qu’une transcription n’a jamais à porter. Une partie de ce que vous avez dit dans une note vocale était pour vous, pas pour le destinataire. Se demander à voix haute s’il faut mentionner quelque chose ne veut pas dire que vous aviez l’intention de le mentionner. Une étape de réécriture doit décider ce qui était le message et ce qui relevait du brouillon, et cette décision peut tourner mal dans les deux sens, en gardant une phrase dont vous étiez en train de vous dissuader ou en supprimant une que vous vouliez. Je n’ai trouvé aucune étude qui ait mesuré la fréquence de ces erreurs avec un outil quelconque, Subtext compris.
Ce que Subtext fait d’une note vocale
Subtext transcrit la note vocale que vous enregistrez dans l’app, puis écrit le message à partir de ce que vous vouliez dire et renvoie jusqu’à trois versions, chacune avec un score « prêt à envoyer » qui indique la probabilité qu’elle soit reçue comme vous l’entendiez. Les versions sont construites pour garder votre sens et votre personnalité. Sur un premier brouillon, l’une reste proche de vos mots avec les problèmes corrigés, une autre est un polissage plus chaleureux ou une approche différente, et la dernière est une réécriture plus complète. Si la formulation se lit plus froide ou plus sèche que vous ne le vouliez, l’app nomme le problème et marque les mots en cause. Rien n’est envoyé à votre place.
Les instructions du modèle couvrent les artefacts de transcription, et j’ai lu les prompts du backend avant d’écrire ceci. Quand un message est signalé comme dicté, on dit au modèle de s’attendre à des mots mal entendus ou collés, à une ponctuation étrange et à des mots de remplissage parasites, de passer outre pour retrouver la formulation voulue, et de les corriger en silence, sans les signaler comme une faute de votre part. Le prompt montre ce qu’on dit au modèle de faire. Je n’ai trouvé aucune évaluation indépendante de la transcription vocale ou de la réécriture de Subtext, donc tout ceci repose sur ce que montre l’app et sur ce que disent ses prompts et sa politique de confidentialité. Comme aucune des études ci-dessus n’a testé Deepgram, le modèle vocal qui transcrit l’audio de Subtext, je ne peux pas dire jusqu’où les profils d’erreurs liés aux accents, à la parole en langue seconde et au style familier s’appliquent à lui, alors relisez le message avant de l’envoyer.
Que devient un enregistrement vocal dans Subtext ?
Subtext envoie un enregistrement vocal à Deepgram pour la transcription, donc l’audio quitte le téléphone. Sa politique de confidentialité, mise à jour le 26 juillet 2026, nomme plusieurs prestataires, dont Deepgram pour les enregistrements vocaux, Anthropic pour le texte, les images et les transcriptions vocales, Google Firebase pour les comptes et les conversations, et OpenAI seulement si vous activez la lecture à voix haute. La politique ajoute que, quand la recherche web est activée, des termes de recherche tirés de votre demande passent par Anthropic vers des prestataires de recherche tiers, et que vous pouvez désactiver la recherche web dans les réglages de l’app24. Elle dit que rien de ce que vous envoyez ne sert à entraîner un modèle d’IA et qu’aucun de ses prestataires d’IA n’a le droit de s’entraîner dessus, Subtext ayant aussi activé le refus d’amélioration du modèle chez Deepgram pour la voix. Elle dit que Subtext supprime de ses serveurs sa propre copie d’une conversation cinq jours après votre dernière utilisation, ou 90 jours si vous l’épinglez. Elle dit que Deepgram, avec ce refus activé, ne garde l’audio que le temps de le transcrire, et qu’Anthropic supprime les entrées et les sorties sous 30 jours, et peut conserver jusqu’à deux ans les requêtes signalées et jusqu’à sept ans les scores de sécurité associés. Elle dit que Subtext n’a conclu d’accord de zéro conservation avec aucun d’eux24. Comment les autres assistants traitent votre texte est comparé dans quels assistants d’écriture IA s’entraînent sur vos messages.
Quelles langues Subtext prend-il en charge ?
Subtext écrit le message dans la langue que vous avez parlée, dans 17+ langues, et garde le niveau de formalité que vous avez employé là où la langue en marque un. Une note vocale en allemand revient en message allemand. Le résumé d’une note vocale que vous avez reçue est écrit dans la langue dans laquelle elle est arrivée. Les éditeurs de Google Play ont mis ce parcours en avant dans un article « Hot Tip » qui décrit le geste de toucher l’icône du micro, parler, toucher de nouveau, et obtenir un message affiné avec des étiquettes sur la façon dont l’original était perçu et un bouton de copie25. Quand j’ai ouvert la page le 4 octobre 2026, la fiche de la boutique allemande affichait 4,3 étoiles pour 295 avis et plus de 50 000 téléchargements, un décompte Google Play seulement, et la note en étoiles diffère selon les pays. Utiliser Subtext est payant, avec quelques analyses gratuites pour commencer. Une note vocale enregistrée revient sous la forme d’un message que vous pouvez envoyer.
Comment répondre à un long message vocal qu’on vous a envoyé ?
Subtext lit aussi les messages vocaux que d’autres personnes vous envoient, et c’est là qu’une simple transcription se rapproche le plus du suffisant. La transcription sur l’appareil de WhatsApp vous permet de lire un enregistrement de deux minutes là où votre langue est couverte23. Ce qu’elle ne fait pas, c’est vous dire ce que la personne attend de vous. L’exemple de l’étude d’Ulm était une date et un lieu enfouis dans l’audio9. Une longue note vocale d’un ami ou d’un manager a la même forme, la question quelque part au milieu et les raisons tout autour. Pour ceux qui bloquent sur les réponses, la lecture est l’une des cinq étapes où une réponse reste coincée, et la plupart des participants de terrain d’Ulm remettaient à plus tard les messages vocaux au travail parce qu’un enregistrement ne se saisit pas d’un coup d’œil9.
Déposez un message vocal reçu dans Subtext et il le transcrit, résume en une ligne ce que la personne attend de vous, et ajoute de deux à cinq points d’action. Il peut ensuite rédiger une réponse qui reprend le fil, et il n’étiquette pas le ton de l’expéditeur. Les prompts du backend traitent un fichier vocal que vous joignez comme le plus probablement envoyé par l’autre personne, et si le modèle ne sait pas qui est qui, il a pour consigne de demander. Le résumé vaut ce que vaut la transcription en dessous, et une ligne se lit mal sans son contexte, comme le montre Que veut dire ce texto ?. Pour un accent marqué ou un enregistrement bruité, la transcription contiendra plus d’erreurs que pour de l’anglais de studio, donc écoutez l’original avant de répondre à tout ce qui compte. Les textes et les captures d’écran passent par la même étape de résumé, donc un message que vous avez reçu reçoit le même résumé en une ligne.
Les expériences les plus proches sont anciennes et petites
Les deux expériences les plus proches d’une étape de réécriture ou d’un résumé que j’aie trouvées datent de 2003 et de 2005, et toutes deux sont petites. En 2003, une expérience financée par la DARPA a fait lire à 28 anglophones natifs des passages de 150 à 250 mots de parole téléphonique et radiodiffusée, sous forme de transcriptions mot à mot et de versions nettoyées à la main. Les lecteurs ont jugé le texte nettoyé plus facile à comprendre, mais ils répondaient aux questions à son sujet sans plus de justesse ni de rapidité, ce que les auteurs attribuent au fait que les lecteurs frôlaient déjà le maximum. Le nettoyage automatique d’une sortie imparfaite du système de reconnaissance tendait à être jugé plus difficile que la version non nettoyée, mais à peine26. Le nettoyage retirait les disfluences et corrigeait la ponctuation, sans réécrire le texte en message.
En 2005, 16 personnes ont répondu à des questions sur 15 messages de messagerie vocale à partir de résumés extraits automatiquement. Les résumés construits à partir de la parole reconnue donnaient le nom de l’appelant juste dans 57 % des cas contre 94 % pour les résumés construits à partir de transcriptions humaines, tandis que le motif de l’appel passait aussi bien dans les deux cas, à 78 %. Les gens demandaient plus souvent l’audio original quand le résumé venait de la parole reconnue, 53 % du temps contre 30 %27. C’étaient des résumés extractifs de messages de messagerie vocale réalisés avec la reconnaissance vocale de 2005, donc l’étude ne fixe qu’une attente. Aucune des deux études n’a mesuré un message que quelqu’un enverrait.
Là où les preuves s’arrêtent
Les preuves solides se trouvent aux deux extrémités. La langue parlée porte des disfluences à un taux mesuré que l’écrit n’a pas, et la reconnaissance vocale fait plus d’erreurs pour certains locuteurs que pour d’autres, avec les chiffres ci-dessus pour le montrer. Le milieu est plus mince. Je n’ai trouvé aucune étude qui ait mesuré de combien une note vocale réécrite passe mieux qu’une transcription brute, ni à quelle fréquence une réécriture change le sens en route. La recherche sur les messages vocaux tient en une poignée d’études, la plus grande avec un échantillon d’enquête tiré d’une plateforme américaine de microtravail et une étude de terrain sur six personnes. Le sondage YouGov porte sur un pays et une année. Et les études sur les notes vocales précèdent les transcriptions sur l’appareil, donc le déplacement d’effort qu’elles décrivent est aujourd’hui en partie comblé par les messageries elles-mêmes.
En pratique, tout dépend de votre façon de parler. Si vous parlez en phrases nettes, la dictée suffit, et votre téléphone l’a déjà. Si vous parlez comme les locuteurs de ces corpus, avec les mots de remplissage que Clark et Fox Tree ont comptés et les reprises que Shriberg a cataloguées, une transcription remet au destinataire votre processus de brouillon, et une étape de réécriture est ce qui en fait un message. Subtext est une app qui fait cette étape, pour la note vocale que vous enregistrez et pour celle que vous avez reçue, et si votre difficulté est une réponse que vous n’arrêtez pas de retoucher, Pourquoi une réponse de deux lignes me prend une heure ? parle de cette boucle. Essayer Subtext dans votre navigateurScannez-le avec l'appareil photo de votre téléphone pour installer.Essayer Subtext dans votre navigateur
Sources
Numérotées dans l’ordre de première apparition. Pages vérifiées les 4 et 5 octobre 2026, et la politique de confidentialité de Subtext rouverte le 10 octobre 2026.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 à 169. Étude de corpus de conversations en anglais américain, avec les taux et les types de disfluences.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Article de conférence ; le PDF ne porte aucune année, et ses références citées vont jusqu’en 1996. Corpus étiquetés à la main de 40 515 mots de 30 locuteurs (Switchboard) et de 12 762 mots de 523 locuteurs (AMEX, appels entre des employés de SRI et des agents de voyage). Financé par la DARPA et la NSF. . Vérifié le 5 octobre 2026.
- Clark, H. H., et Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 à 111. Taux de mots de remplissage par locuteur dans le corpus London-Lund.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., et Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 à 7689. Cinq systèmes commerciaux, 42 locuteurs blancs et 73 locuteurs noirs, 19,8 heures d’audio.
- Graham, C., et Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Résumé seulement ; le texte intégral n’était pas accessible lors de la vérification.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., et Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. Prépublication arXiv.
- OpenAI. Whisper README. GitHub. . Vérifié le 4 octobre 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., et Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13 140 segments audio de 437 participants enregistrés dans des établissements américains, avec et sans aphasie, passés dans l’API Whisper en avril et mai 2023. Financé par le Pulitzer Center et le Center for Social Sciences de Cornell.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., et Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Enquête auprès de 1 003 personnes et étude de terrain de deux semaines auprès de 6.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., et Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publié en décembre 2017. Étude en laboratoire auprès de 48 étudiants, 24 par langue, recopiant des phrases sur un iPhone. Deux auteurs travaillaient pour Baidu USA, dont le système vocal côté serveur, Deep Speech 2, tournait sur un serveur Baidu et a été testé via une appli iPhone 6 Plus.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 études, 18 573 participants.
- Yuan, J., Liberman, M., et Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversations téléphoniques Switchboard.
- YouGov. How many Britons like voice notes? 14 juin 2022. Sondage auprès de 2 149 adultes britanniques, enquête les 5 et 6 mai 2022, dont 1 956 utilisateurs de smartphone ; les chiffres sur la durée sont des parts des répondants qui ont donné une réponse. Tableaux de résultats à . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Vérifié les 4 et 5 octobre 2026. Les pourcentages suivent le texte de l’article de YouGov ; les tableaux de résultats donnent des totaux légèrement différents pour ceux qui n’aiment pas, à cause des arrondis.
- Sampietro, A., et König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 à 71. Conversations WhatsApp en allemand et en espagnol ; résumé lu via la notice Crossref de l’éditeur, texte intégral payant.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Vérifié le 4 octobre 2026.
- Apple. Siri, Dictation & Privacy. Mentions légales, dernière mise à jour le 14 septembre 2026. . Vérifié le 5 octobre 2026.
- Google. Type with your voice. Gboard Help. . Vérifié le 4 octobre 2026.
- Google. Use advanced voice typing features. Gboard Help. . Vérifié le 5 octobre 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Vérifié le 5 octobre 2026.
- Otter.ai. Convert Speech to Text. . Vérifié le 4 octobre 2026.
- Otter.ai. Supported languages. Otter Help Center, article modifié le 6 mai 2026. . Vérifié le 5 octobre 2026.
- MacWhisper. Homepage. Page marketing, sans date, donc elle montre ce que le produit annonce et non ses performances. . Vérifié le 5 octobre 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 novembre 2024. . Vérifié le 4 octobre 2026.
- Subtext, Conditions, confidentialité et votre compte. Politique de confidentialité mise à jour le 26 juillet 2026. Vérifié le 10 octobre 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Vérifié le 4 octobre 2026 ; la fiche affichait 295 avis et plus de 50 000 téléchargements sur chaque boutique que j’ai ouverte, et 4,3 étoiles sur la boutique allemande.
- Jones, D. A., et six coauteurs (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 à 1588. 32 anglophones natifs recrutés, 28 analysés. Financé par la DARPA dans le cadre du contrat F19628-00-C-0002 de l’Air Force.
- Koumpis, K., et Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Test de compréhension avec 16 participants et 15 messages de messagerie vocale ; chiffres lus dans le PDF hébergé par les auteurs. Financé par une bourse EPSRC ROPA, GR/R23954.