ArtikelenSchrijftools
Waarom een transcript van een spraakbericht nog geen tekstbericht is
Dicteren zet een spraakbericht om in tekst, maar bewaart vaak de stopwoorden, de herstarts en de volgorde waarin je dingen bedacht. Wat het onderzoek zegt en wat een herschrijfstap toevoegt.
Door Samet Durgun · Medeoprichter van Subtext · 19 min leestijd
· Bijgewerkt op 10 oktober 2026
Gesproken taal bevat stopwoorden, valse starts en correcties midden in de zin die geschreven tekst meestal niet heeft, dus een kaal transcript van een spraakbericht is nog geen bericht. Telefoons typen uit wat je zei, en Otter, de transcripties van WhatsApp en apps op basis van open spraakmodellen doen dat ook, maar een transcript van een rommelig spraakbericht blijft een rommelig bericht. Het bewaart de “euh”, de correctie die je halverwege maakte en de volgorde waarin je dingen toevallig bedacht. Een app die van een spraakbericht een helder tekstbericht maakt, moet na de transcriptie een tweede taak doen. Hij moet uitzoeken wat je bedoelde en dat opschrijven.
De eerste helft is onderzoek. Taalkundigen hebben gemeten hoe gesproken taal verschilt van geschreven taal, onderzoekers van spraakherkenning hebben gemeten waar transcriptie faalt en voor wie, en een paar studies vroegen waarom mensen spraakberichten sturen en waarom ontvangers ze uitstellen. De tweede helft gaat over wat de dicteertools doen die mensen al hebben, wat een herschrijfstap toevoegt en wat Subtext met een spraakbericht doet.
Als medeoprichter van Subtext, waar spraak een van de drie ingangen is naast een getypt concept en een screenshot van een gesprek, heb ik belang bij het antwoord. Elke bron hieronder heb ik geopend. Waar ik alleen bij een samenvatting kon, zeg ik dat en haal ik er geen cijfer uit aan.
Gesproken taal ontstaat anders dan geschreven taal
Spontane spraak zit vol materiaal dat schrijven weglaat. Het overzicht van Elizabeth Shriberg van disfluenties in meerdere corpora van spontaan gesproken Amerikaans Engels komt uit op maximaal tien procent van de woorden en meer dan een derde van de uitingen1. De vormen zijn gevulde pauzes (“euh”, “uhm”), herhalingen (“ik ik denk”), herstellingen waarbij midden in een zin een woord wordt vervangen, en valse starts, die zij onder weglatingen indeelt, waarbij een zin wordt afgebroken en opnieuw begonnen. In de twee corpora met gesprekken tussen mensen die zij onderzocht, informele telefoongesprekken en telefoontjes over reisplanning, lag het aandeel rond zes procent van de woorden1, in steekproeven van 40.515 en 12.762 woorden die in haar SRI-paper over dezelfde corpora met de hand zijn gelabeld2. In een corpus van mensen die via een push-to-talk-knop met een computer spraken, daalde het tot onder één procent, en zij schrijft een deel van die daling toe aan de knop. Sprekers konden de uiting eerst plannen en daarna opnemen1. In een spraakbericht tik je één keer en praat je, en het plannen gebeurt hardop.
Stopwoorden in spraak en hoe sterk sprekers verschillen
Gesproken stopwoorden zijn geen ruis, en dat is deels waarom ze lastig te verwijderen zijn. Herbert Clark en Jean Fox Tree betoogden op basis van meerdere grote corpora dat de Engelse “uh” en “um” woorden op zich zijn, net als andere woorden gepland en uitgesproken, en dat ze een korte of lange vertraging aankondigen terwijl de spreker naar het volgende woord zoekt of bepaalt wat hij gaat zeggen3. Ze verschillen ook enorm per spreker. In het London-Lund-corpus, ongeveer 170.000 woorden uit 50 Britse gesprekken in persoon, opgenomen tussen 1961 en 1976, voornamelijk onder academici, lag het aantal stopwoorden bij de 65 sprekers die elk meer dan 1.000 woorden produceerden tussen 1,2 en 88,5 per 1.000 woorden, met een mediaan van 17,33. Sommige transcripten komen er bijna schoon uit, andere hebben om de twaalf woorden een stopwoord.
Disfluentie clustert ook waar het plannen het zwaarst is. Shriberg merkt op, onder verwijzing naar eerder werk, dat het vaker voorkomt vroeg in een zinsdeel1. In een spraakbericht is dat de opening, waar je nog bepaalt waar het bericht voor dient. Bij schrijven kun je die opening schrappen voordat iemand haar ziet. In een spraakbericht gaat ze meestal mee, tenzij je het hele bericht opnieuw opneemt.
Hoe fouten in spraakherkenning per spreker verschillen
Transcriptie voegt bovenop wat je zei eigen fouten toe. De duidelijkste meting die ik vond is een studie uit 2020 in PNAS die vijf commerciële spraakherkenners, van Amazon, Apple, Google, IBM en Microsoft, losliet op 19,8 uur interviewaudio van 42 witte en 73 zwarte Amerikaanse sprekers4. De gemiddelde woordfoutenratio was 0,19 voor witte en 0,35 voor zwarte sprekers, en elk systeem liet het verschil zien. De beste, Microsoft, scoorde 0,15 en 0,27. De slechtste, Apple, scoorde 0,23 en 0,45. Bij meer dan 20 procent van de fragmenten van zwarte sprekers kwam minstens de helft van de woorden fout terug, tegen minder dan 2 procent van de fragmenten van witte sprekers4. De auteurs herleiden het verschil tot de akoestische modellen, het deel dat geluid aan woorden koppelt, en wijzen op te weinig audio van zwarte sprekers in de trainingsdata.
Een tweede patroon in hetzelfde paper doet ertoe voor spraakberichten. De systemen deden het wat slechter bij mannelijke sprekers, wat de auteurs toeschrijven aan een informelere stijl met kortere, sterker gereduceerde uitspraak en meer disfluenties4, het register van een spraakbericht aan een vriend.
Accenten, tweede talen en woorden die niemand zei
Spraakherkenning doet het ook slechter bij accenten en spraak in een tweede taal. Een paper uit 2024 in JASA Express Letters testte het Whisper-model van OpenAI op Engelse accenten en meldde een hogere nauwkeurigheid voor moedertaalsprekers dan voor sprekers met Engels als tweede taal, betere resultaten voor Amerikaans Engels dan voor Brits of Australisch, en betere resultaten bij voorgelezen spraak dan bij gesprekken5. Ik kon alleen de samenvatting inzien, dus ik noem de richting en geen getal. Whisper is getraind op 680.000 uur audio, en de makers zeggen dat de modellen de “accuracy and robustness” van een mens benaderen6. De eigen documentatie voegt toe dat “performance varies widely depending on the language”7. Een gemiddelde over sprekers zegt weinig over een vermoeid spraakbericht in je tweede taal. Is die taal Engels, dan kan een correct bericht bij een moedertaalspreker toch bot overkomen, en een transcript vertelt je dat niet.
Whisper kan ook woorden toevoegen die niemand zei. Een studie uit 2024 liet 13.140 korte Engelse fragmenten van 437 deelnemers, opgenomen bij Amerikaanse instellingen, met en zonder afasie, door de gehoste Whisper-API van OpenAI lopen, in april en mei 2023. Ongeveer één procent van de transcripties bevatte hele frasen of zinnen die niet in de audio stonden, en 38 procent daarvan bevatte minstens één expliciete vorm van schade, zoals geweld of een valse claim van autoriteit. Fragmenten met lange pauzes liepen meer risico. Op de 187 fragmenten waarop Whisper tekst had verzonnen, produceerden Google, Amazon, Microsoft, AssemblyAI en RevAI geen vergelijkbare verzinsels. De fragmenten waren interviews, geen spraakberichten, en de studie testte de API zoals die in 2023 was8.
Waarom mensen spraakberichten sturen
Mensen sturen spraakberichten omdat ze voor de afzender snel zijn. De grootste studie die ik vond komt van de Universiteit Ulm, een enquête uit 2020 onder 1.003 mensen die via Amazon Mechanical Turk werden geworven, vooral in de Verenigde Staten, plus een veldstudie van twee weken met zes zware gebruikers9. In de enquête had 83 procent een spraakbericht ontvangen en 73 procent er een gestuurd. De redenen om te sturen, uit 735 open antwoorden van mensen die een spraakbericht hadden opgenomen, vielen in vier thema’s. De aantallen per thema tellen op tot meer dan de 735 antwoorden, dus sommige antwoorden vielen onder meer dan één thema. Gemak, omdat praten op een telefoon sneller is dan typen, werd 359 keer genoemd. De toon en emotie die een stem meedraagt en tekst verliest, 229. Situaties waarin typen onhandig of onveilig is, zoals autorijden, 203. En de ontvanger, die om spraak had gevraagd of het makkelijker vond, 34.
Een laboratoriumstudie mat de snelheid. De 48 universiteitsstudenten, van wie 24 moedertaalsprekers van het Engels, schreven korte zinnen over op een iPhone, en Engelse spraakinvoer ging met 153 woorden per minuut tegen 52 op het toetsenbord, 2,93 keer sneller, hoewel spraak iets meer ongecorrigeerde fouten in de uiteindelijke tekst achterliet, 0,55 procent tegen 0,35 procent. De taak was het overschrijven van vaste zinnen, wat weinig zegt over het opstellen van een bericht. Twee van de auteurs werkten voor Baidu, waarvan de herkenner aan serverzijde, Deep Speech 2, via een app op een iPhone 6 Plus werd getest, in een paper dat in 2017 verscheen10.
Spraakberichten verschuiven de inspanning van afzender naar ontvanger
In de veldstudie van Ulm liepen 438 spraakberichten die in twee weken werden vastgelegd van 1,5 seconde tot iets meer dan zeven minuten, met een mediaan van 17,5 seconden9. De auteurs wijzen ook op een kostenpost die wordt betaald voordat een ontvanger iets hoort. Geluid is vluchtig, dus een opname is omslachtig na te lopen en te bewerken, en een verspreking betekent het hele bericht opnieuw opnemen9. Vijf van de twaalf afgebroken opnames in hun veldstudie waren precies dat.
De auteurs schrijven dat spraakberichten “shift the effort necessary for communication towards the receiver”9. Opstellen gaat snel, terugzoeken kost meer tijd en moeite dan het lezen van een tekst met dezelfde inhoud, en de meeste deelnemers aan hun veldstudie stelden spraakberichten op het werk uit, omdat een tekst in één oogopslag te overzien is en een opname niet. Hun voorgestelde oplossing, in 2020, waren automatische transcripten, zodat de datum en locatie van een afspraak die in een opname verstopt zit, al scannend te vinden zijn.
Waarom ontvangers ze uitstellen
Ontvangers kunnen niet vluchtig doorlezen, dus ze luisteren opnieuw naar wat ze hoorden. In dezelfde veldstudie speelden mensen een ontvangen spraakbericht gemiddeld 1,37 keer af, en één bericht werd 13 keer afgespeeld9. Lezen heeft dat herhalen niet nodig. Een meta-analyse uit 2019 van 190 studies met 18.573 deelnemers komt uit op een gemiddelde stille leessnelheid van 238 woorden per minuut voor Engelse non-fictie11. Gespreksspraak gaat met ongeveer 196 woorden per minuut als je het hele gesprek meetelt en met ongeveer 164 binnen de eigen beurt van een spreker, in een groot telefooncorpus12. De lezer bepaalt ook het tempo en kan naar de vraag springen. De luisteraar krijgt de woorden op de snelheid van de spreker, in de volgorde van de spreker.
Mensen zijn er niet dol op, en iets meer op ontvangen dan op sturen. Een peiling van YouGov onder 2.149 Britse volwassenen, afgenomen op 5 en 6 mei 2022 en die juni gepubliceerd, vroeg de smartphonegebruikers onder hen, 1.956 mensen, naar spraakberichten. Daarvan vond 16 procent het prettig om ze te sturen en 36 procent vervelend. Over het ontvangen vond 22 procent het prettig, 25 procent vervelend en 29 procent had gemengde gevoelens13. Alleen onder 18- tot 24-jarigen vonden meer mensen het prettig om ze te ontvangen dan vervelend, 43 tegen 28 procent, en zelfs in die groep vond de helft het vervelend om ze te sturen tegen 30 procent die het prettig vond. Van alle smartphonegebruikers had 63 procent er nog nooit een gestuurd.
Hoe lang is te lang voor een spraakbericht?
In een peiling van YouGov onder Britse smartphonegebruikers in mei 2022 zei 65 procent van wie antwoord gaf dat een spraakbericht van een minuut te lang is, en van wie het ontvangen vervelend vindt en antwoord gaf, was 57 procent gefrustreerd door 30 seconden. Onder alle smartphonegebruikers wist 27 procent niet waar de grens lag. Gevraagd hoe ze een lang bericht het liefst ontvangen, koos 78 procent tekst en 14 procent een spraakbericht, wat alleen een uitgesproken voorkeur vastlegt13. Sommige afzenders lijken te weten dat de opname een last is. Een analyse uit 2024 van WhatsApp-gesprekken in Duitsland en Spanje liet zien dat mensen hun keuze voor audio verantwoorden voor, in en na het bericht, en de auteurs beschrijven die verantwoordingen als sociaal werk, waaronder het presenteren van het spraakbericht als iets waarvoor je je verontschuldigt14. In deze drie bronnen bespaart de afzender moeite en betaalt de ontvanger ervoor, en sommige afzenders verontschuldigen zich daarvoor.
Wat de dicteerfunctie van Apple met een spraakbericht doet
De dicteerfunctie geeft je de woorden in de volgorde waarin je ze zei, en voor het dicteren van Apple is dat de hele taak. De iPhone-gebruikershandleiding van Apple voor iOS 27 beschrijft dicteren als verwerkt op de telefoon zonder internetverbinding, in veel talen, waarbij komma’s, punten en vraagtekens automatisch worden ingevoegd waar de taal dat ondersteunt15. Op de nieuwste telefoons verbetert een model op het apparaat spelling, interpunctie en hoofdletters, in het Engels. Al het andere is een gesproken commando. Je zegt een commando voor een nieuwe regel, of een commando om een frase te verwijderen. De claim over het apparaat heeft een voorwaarde. De privacypagina van Apple zegt dat wat je dicteert, als de toetsenbordinstellingen niet laten zien dat dicteren op het apparaat wordt verwerkt, naar de servers van Apple wordt gestuurd en niet wordt bewaard, tenzij je kiest voor “Verbeter Siri en de dicteerfunctie”. Ze zegt ook dat Apple verzoekgeschiedenis en transcripten mag bewaren, gekoppeld aan een willekeurige apparaat-ID en niet aan je Apple Account, tot twee jaar16. De pagina zegt niet hoe die twee zich tot elkaar verhouden. Herschrijven is de taak van de aparte Schrijfhulp van Apple, die niet zegt hoe een tekst overkomt.
Wat spraakgestuurd typen van Google en Microsoft doet
Het gewone spraakgestuurd typen in Gboard van Google geeft je, net als het dicteren van Apple, de woorden zoals je ze zei. Tik op de microfoon, zeg wat je wilt schrijven en spreek de interpunctie uit, al zijn spraakgestuurd typen en interpunctie niet in elke taal beschikbaar17. Het geavanceerde spraakgestuurd typen, op Pixel 6 en nieuwer, voegt interpunctie toe terwijl je praat, en op Pixel 9 (de 9a niet meegerekend) en nieuwer kan een gesproken commando nalezen, anders formuleren, inkorten of verlengen wat je dicteerde. Google zegt dat dit op het apparaat draait, in het Engels, Frans, Italiaans, Japans en Spaans, met Duits binnenkort18. Op Windows zegt de helppagina van Microsoft dat Vloeiend dicteren, een functie van Copilot+-pc’s, grammatica, interpunctie en stopwoorden corrigeert terwijl je praat19. Geavanceerd spraakgestuurd typen herschrijft alleen als je een gesproken commando geeft. Vloeiend dicteren werkt zonder commando, maar alleen op Copilot+-pc’s, en de helppagina noemt het herschikken van het bericht niet. In de helppagina’s van Apple, Google en Microsoft die ik hier aanhaal, vond ik geen functie die standaard een heel rommelig spraakbericht omzet in een bericht dat je kunt versturen.
Wat transcriptie-apps en berichtendiensten doen
Otter, een transcriptie-app, gaat een stap verder dan een telefoontoetsenbord. De pagina over spraak naar tekst beschrijft een transcript met sprekerslabels en tijdstempels, een automatisch gegenereerde samenvatting met hoogtepunten, en uitgelichte kernpunten en actiepunten20. Het helpcentrum van Otter noemt Engels, Spaans, Frans, Duits, Japans en Chinees (vereenvoudigd) als ondersteunde talen21, wat meer is dan de pagina over spraak naar tekst zegt. Het is gebouwd voor vergaderingen, dus het vat samen wat er is gezegd, en ik vond op die twee pagina’s geen functie die opstelt wat je wilde versturen. Open spraakmodellen zitten onder sommige apps. Whisper zelf levert een transcript en een taallabel7. De apps die erop gebouwd zijn, verschillen. MacWhisper adverteert met het verwijderen van stopwoorden, samenvattingen en eigen prompts bovenop het transcript, en biedt daarvoor lokale of cloudmodellen aan22.
De berichtendiensten zijn begonnen de spraakberichten die je ontvangt te transcriberen. WhatsApp voegde in november 2024 transcripten van spraakberichten toe, op het apparaat gegenereerd zodat WhatsApp ze zelf niet kan lezen, in te schakelen onder Instellingen en Chats en op te roepen door lang op het bericht te drukken23. Het bericht zegt dat de transcripten in een paar geselecteerde talen begonnen, en ik kon de huidige lijst niet bevestigen. Dat lost het scanprobleem op dat de Ulmse auteurs signaleerden, waar de taal gedekt is. Wat je krijgt is een transcript van het hardop denken van iemand anders. Je kunt het in een vergadering lezen, maar het antwoord moet je nog steeds zelf schrijven.
Wat een herschrijfstap toevoegt
Een herschrijfstap zet het transcript om in het bericht dat je zou hebben getypt als typen niets kostte. Hij laat de stopwoorden vallen die Clark en Fox Tree beschrijven, vouwt de herhalingen en valse starts uit de indeling van Shriberg samen, en zet de correctie die je halverwege maakte op haar plek, in plaats van het ding dat ze corrigeerde. Hij herschikt ook. Gesproken uitleg komt vaak binnen in de volgorde waarin het bij je opkwam, eerst de context en het verzoek als laatste, of eerst het verzoek met de redenen erachteraan. Een geschreven bericht kan met de kern openen.
Twee dingen moet de stap met rust laten. Het eerste is de betekenis. Een herschrijving die je spraakbericht gladstrijkt tot een ander verzoek is erger dan het transcript, want het transcript zei tenminste wat jij zei. Het tweede is toon. Was je warm, of botweg, of aan het grappen, dan moet de geschreven versie dezelfde persoon zijn. De fout die hier dreigt, wordt behandeld in laat AI je appjes als een robot klinken?, waar een herschrijving beleefd en generiek terugkomt.
Er is ook een afweging die een transcript nooit hoeft te maken. Een deel van wat je in een spraakbericht zei, was voor jezelf, niet voor de ontvanger. Hardop afvragen of je iets moet noemen, betekent niet dat je het wilde noemen. Een herschrijfstap moet bepalen wat het bericht was en wat het voorwerk, en die beslissing kan twee kanten op misgaan, door een zin te houden waar je jezelf van aan het afbrengen was of door een zin te laten vallen die je wel bedoelde. Ik vond geen studie die mat hoe vaak dat gebeurt met welke tool dan ook, Subtext inbegrepen.
Wat Subtext met een spraakbericht doet
Subtext transcribeert het spraakbericht dat je in de app opneemt, schrijft dan het bericht vanuit wat je bedoelde en geeft tot drie versies terug, elk met een score voor hoe veilig het is om te versturen, naar de kans dat het aankomt zoals je het bedoelde. De versies zijn gebouwd om je betekenis en je persoonlijkheid te behouden. Bij een eerste concept blijft één versie dicht bij je woorden met de problemen opgelost, is één een warmere afwerking of een andere aanpak, en is één een uitgebreidere herschrijving. Leest de formulering kouder of scherper dan je bedoelde, dan benoemt de app het probleem en markeert hij de woorden die ervoor zorgen. Er wordt niets voor je verstuurd.
De instructies voor het model dekken transcriptiefouten, en ik heb de backend-prompts gelezen voordat ik dit schreef. Is een bericht gemarkeerd als gedicteerd, dan krijgt het model te horen dat het verkeerd verstane of aaneengeplakte woorden, vreemde interpunctie en losse stopwoorden moet verwachten, daar doorheen moet lezen naar de bedoelde formulering en ze stilzwijgend moet herstellen zonder ze te benoemen als iets wat jij fout deed. De prompt laat zien wat het model te horen krijgt. Ik vond geen onafhankelijke evaluatie van de spraaktranscriptie of de herschrijving van Subtext, dus dit alles rust op wat de app laat zien en wat zijn prompts en privacybeleid zeggen. Omdat geen van de studies hierboven Deepgram testte, het spraakmodel dat de audio van Subtext transcribeert, kan ik niet zeggen hoe ver de foutpatronen voor accenten, spraak in een tweede taal en een informele stijl daarop doorwerken, dus lees het bericht terug voor je het verstuurt.
Wat gebeurt er met een spraakopname in Subtext?
Subtext stuurt een spraakopname voor transcriptie naar Deepgram, dus de audio verlaat de telefoon. Het privacybeleid, bijgewerkt op 26 juli 2026, noemt meerdere aanbieders, onder wie Deepgram voor spraakopnamen, Anthropic voor tekst, afbeeldingen en spraaktranscripties, Google Firebase voor accounts en gesprekken, en OpenAI alleen als je voorlezen aanzet. Het beleid voegt toe dat als webzoeken aan staat, zoektermen uit je verzoek via Anthropic naar zoekaanbieders van derden gaan, en dat je webzoeken in de instellingen van de app kunt uitzetten24. Het zegt dat niets wat je indient wordt gebruikt om een AI-model te trainen en dat geen van zijn AI-aanbieders erop mag trainen, waarbij Subtext ook de opt-out van Deepgram voor modelverbetering voor spraak heeft ingesteld. Het zegt dat Subtext zijn eigen kopie van een gesprek vijf dagen nadat je het voor het laatst gebruikte van zijn servers verwijdert, of na 90 dagen als je het vastzet. Het zegt dat Deepgram, met die opt-out ingesteld, audio alleen bewaart zolang het duurt om die te transcriberen, en dat Anthropic invoer en uitvoer binnen 30 dagen verwijdert en gemarkeerde verzoeken tot twee jaar en bijbehorende veiligheidsscores tot zeven jaar mag bewaren. Het zegt dat Subtext met geen van hen een zero-retention-afspraak heeft24. Hoe andere assistenten met je tekst omgaan, vergelijk ik in welke AI-schrijfassistenten trainen op je berichten.
Welke talen ondersteunt Subtext?
Subtext schrijft het bericht in de taal waarin je sprak, in 17+ talen, en houdt de mate van formaliteit aan die je gebruikte waar de taal daar een onderscheid in maakt. Een spraakbericht in het Duits komt terug als een Duits bericht. De samenvatting van een spraakbericht dat je ontving, wordt geschreven in de taal waarin het binnenkwam. De redactie van Google Play lichtte deze werkwijze uit in een “Hot Tip”-stuk dat beschrijft hoe je op het microfoonpictogram tikt, spreekt, nog eens tikt en een verfijnd bericht krijgt met labels over hoe het origineel overkwam en een kopieerknop25. Toen ik de pagina op 4 oktober 2026 opende, toonde de vermelding in de Duitse store 4,3 sterren bij 295 beoordelingen en meer dan 50.000 downloads, alleen een telling van Google Play; het sterrencijfer verschilt per land. Subtext gebruiken kost geld, en een paar analyses zijn gratis om mee te beginnen. Een opgenomen spraakbericht komt terug als een bericht dat je kunt versturen.
Hoe antwoord je op een lang spraakbericht dat iemand je stuurde?
Subtext leest ook de spraakberichten die anderen je sturen, en dit is de kant waar een kaal transcript het dichtst bij genoeg komt. Het transcript op het apparaat van WhatsApp laat je een opname van twee minuten lezen waar je taal gedekt is23. Wat het niet doet, is zeggen wat de persoon van je wil. Het eigen voorbeeld van de Ulm-studie was een datum en een plaats die in de audio verstopt zaten9. Een lang spraakbericht van een vriend of een manager heeft dezelfde vorm, de vraag ergens in het midden en de redenen eromheen. Voor mensen die op antwoorden blijven hangen is de leesstap een van de vijf plekken waar een antwoord vastloopt, en de meeste deelnemers aan de veldstudie in Ulm stelden spraakberichten op het werk uit omdat een opname niet in één oogopslag te overzien is9.
Voeg een ontvangen spraakbericht toe aan Subtext en het wordt getranscribeerd, vat in één regel samen wat de persoon van je wil en voegt twee tot vijf actiepunten toe. Daarna kan het een antwoord opstellen dat de draad oppakt, en het labelt de toon van de afzender niet. De backend-prompts behandelen een spraakbestand dat je bijvoegt als hoogstwaarschijnlijk door de ander aan jou gestuurd, en als het model niet zeker weet wie wie is, moet het ernaar vragen. De samenvatting is zo goed als de transcriptie eronder, en één regel is moeilijk te lezen zonder context, zoals Wat betekent dit bericht? laat zien. Bij een sterk accent of een rumoerige opname bevat de transcriptie meer fouten dan bij studio-Engels, dus speel het origineel af voor je antwoordt op iets wat ertoe doet. Tekst en screenshots gaan door dezelfde samenvattingsstap, dus een bericht dat je ontving krijgt dezelfde samenvatting van één regel.
De dichtstbijzijnde experimenten zijn oud en klein
De twee experimenten die het dichtst bij een herschrijfstap of een samenvatting komen, zijn van 2003 en 2005, en beide zijn klein. In 2003 liet een door DARPA gefinancierd experiment 28 moedertaalsprekers van het Engels passages van 150 tot 250 woorden uit telefoon- en omroepspraak lezen, als letterlijke transcripten en als met de hand opgeschoonde. Lezers beoordeelden de opgeschoonde tekst als makkelijker te begrijpen, maar ze beantwoordden vragen erover niet nauwkeuriger of sneller, wat de auteurs toeschrijven aan lezers die al dicht bij de top scoorden. Automatisch opschonen van onvolmaakte uitvoer van een spraakherkenner werd doorgaans als moeilijker beoordeeld dan de onopgeschoonde versie, al was het verschil marginaal26. Het opschonen verwijderde disfluenties en herstelde interpunctie, maar herschreef de tekst niet tot een bericht.
In 2005 beantwoordden 16 mensen vragen over 15 voicemails aan de hand van automatisch geëxtraheerde samenvattingen. Samenvattingen op basis van herkende spraak kregen de naam van de beller in 57 procent van de gevallen goed, tegen 94 procent bij samenvattingen op basis van menselijke transcripten, terwijl de reden van het telefoontje even goed overkwam, met 78 procent. Mensen vroegen vaker om de originele audio als de samenvatting uit herkende spraak kwam, 53 procent van de keren tegen 30 procent27. Het waren extractieve samenvattingen van voicemail, gemaakt met spraakherkenning uit 2005, dus de studie schept alleen een verwachting. Geen van beide studies mat een bericht dat iemand zou versturen.
Waar het bewijs ophoudt
Het sterke bewijs zit aan de twee uiteinden. Gesproken taal bevat disfluentie in een gemeten mate die geschreven taal niet heeft, en spraakherkenning maakt voor sommige sprekers meer fouten dan voor andere, met de cijfers hierboven als bewijs. Het midden is dunner. Ik vond geen studie die mat hoeveel beter een herschreven spraakbericht aankomt dan een kaal transcript, of hoe vaak een herschrijving onderweg de betekenis verandert. Het onderzoek naar spraakberichten is een handvol studies, de grootste met een enquêtesteekproef van een Amerikaans crowdworkingplatform en een veldstudie van zes mensen. De YouGov-peiling betreft één land en één jaar. En de studies naar spraakberichten dateren van voor transcripten op het apparaat, dus de verschuiving van inspanning die ze beschrijven is nu deels gedicht door de berichtendiensten zelf.
In de praktijk komt het neer op hoe je praat. Praat je in nette zinnen, dan is dicteren genoeg, en je telefoon kan het al. Praat je zoals de sprekers in die corpora, met de stopwoorden die Clark en Fox Tree telden en de herstarts die Shriberg catalogiseerde, dan geeft een transcript de ontvanger je denkproces, en een herschrijfstap maakt er een bericht van. Subtext is een app die die stap doet, voor het spraakbericht dat je opneemt en voor het spraakbericht dat je ontving, en als je probleem een antwoord is dat je blijft bewerken, gaat waarom een kort antwoord een uur kost over die lus. Probeer Subtext in je browserScan hem met de camera van je telefoon om te installeren.Probeer Subtext in je browser
Bronnen
Genummerd in de volgorde van eerste vermelding. De pagina’s zijn gecontroleerd op 4 en 5 oktober 2026, en het privacybeleid van Subtext is op 10 oktober 2026 opnieuw geopend.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 tot 169. Corpusstudie van Amerikaans-Engelse gesprekken; aantallen en soorten disfluenties.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Conferentiepaper; de pdf vermeldt geen jaar en de aangehaalde referenties lopen tot 1996. Met de hand gelabelde corpora van 40.515 woorden van 30 sprekers (Switchboard) en 12.762 woorden van 523 sprekers (AMEX, gesprekken tussen SRI-medewerkers en reisagenten). Gefinancierd door DARPA en NSF. . Gecontroleerd op 5 oktober 2026.
- Clark, H. H., en Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 tot 111. Aantal stopwoorden per spreker uit het London-Lund-corpus.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., en Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 tot 7689. Vijf commerciële systemen, 42 witte en 73 zwarte sprekers, 19,8 uur audio.
- Graham, C., en Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Alleen de samenvatting; de volledige tekst was bij controle niet bereikbaar.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., en Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-preprint.
- OpenAI. Whisper README. GitHub. . Gecontroleerd op 4 oktober 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., en Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 audiosegmenten van 437 deelnemers, opgenomen bij Amerikaanse instellingen, met en zonder afasie, in april en mei 2023 door de Whisper-API gehaald. Gefinancierd door het Pulitzer Center en het Center for Social Sciences van Cornell.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., en Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Enquête onder 1.003 mensen en een veldstudie van twee weken met 6.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., en Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Gepubliceerd in december 2017. Laboratoriumstudie met 48 universiteitsstudenten, 24 per taal, die zinnen overschreven op een iPhone. Twee auteurs werkten voor Baidu USA, waarvan het spraaksysteem aan serverzijde, Deep Speech 2, op een Baidu-server draaide en via een app op een iPhone 6 Plus werd getest.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 studies, 18.573 deelnemers.
- Yuan, J., Liberman, M., en Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard-telefoongesprekken.
- YouGov. How many Britons like voice notes? 14 juni 2022. Peiling onder 2.149 Britse volwassenen, veldwerk op 5 en 6 mei 2022, van wie 1.956 smartphonegebruikers; de cijfers over de lengte zijn aandelen van de respondenten die antwoord gaven. Resultatentabellen op . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Gecontroleerd op 4 en 5 oktober 2026. De percentages volgen de artikeltekst van YouGov; de resultatentabellen geven door afronding iets andere totalen voor het vervelend vinden.
- Sampietro, A., en König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 tot 71. Duitse en Spaanse WhatsApp-gesprekken; samenvatting gelezen via het Crossref-record van de uitgever, volledige tekst achter een betaalmuur.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Gecontroleerd op 4 oktober 2026.
- Apple. Siri, Dictation & Privacy. Legal, laatst bijgewerkt op 14 september 2026. . Gecontroleerd op 5 oktober 2026.
- Google. Type with your voice. Gboard Help. . Gecontroleerd op 4 oktober 2026.
- Google. Use advanced voice typing features. Gboard Help. . Gecontroleerd op 5 oktober 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Gecontroleerd op 5 oktober 2026.
- Otter.ai. Convert Speech to Text. . Gecontroleerd op 4 oktober 2026.
- Otter.ai. Supported languages. Otter Help Center, artikel bewerkt op 6 mei 2026. . Gecontroleerd op 5 oktober 2026.
- MacWhisper. Homepage. Marketingpagina zonder datum, dus ze toont wat het product adverteert en niet hoe het presteert. . Gecontroleerd op 5 oktober 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 november 2024. . Gecontroleerd op 4 oktober 2026.
- Subtext, Terms, privacy and your account. Privacybeleid laatst bijgewerkt op 26 juli 2026. Gecontroleerd op 10 oktober 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Gecontroleerd op 4 oktober 2026; de vermelding toonde in elke store die ik opende 295 beoordelingen en 50K+ downloads, en 4,3 sterren in de Duitse.
- Jones, D. A., en zes medeauteurs (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 tot 1588. 32 moedertaalsprekers van het Engels geworven, 28 geanalyseerd. Gesponsord door DARPA onder Air Force-contract F19628-00-C-0002.
- Koumpis, K., en Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Begripstest met 16 deelnemers en 15 voicemails; cijfers gelezen uit de pdf op de site van de auteur. Gefinancierd door een EPSRC ROPA-toekenning, GR/R23954.