ArtiklerSkriveværktøjer

Hvorfor en transskription af en talebesked ikke er en tekstbesked

Almindelig diktering gør en talebesked til tekst, men beholder som regel fyldord, genstarter og den rækkefølge, du kom i tanke om tingene i. Hvad forskningen siger, og hvad et omskrivningstrin tilfører.

Af Samet Durgun · Medstifter af Subtext · 18 min læsning

Tale rummer fyldord, falske starter og rettelser midt i en sætning, som færdig skrift for det meste ikke gør, så en almindelig transskription af en talebesked er endnu ikke en besked. Telefoner skriver gerne det, du sagde, og det gør Otter, WhatsApps transskriptioner og apps bygget på åbne talemodeller også, men en transskription af en rodet talebesked er stadig en rodet besked. Den beholder “øh”, rettelsen, du lavede halvvejs, og den rækkefølge, du tilfældigvis kom i tanke om tingene i. En app, der gør en talebesked til en klar tekstbesked, skal udføre et andet arbejde efter transskriptionen. Den skal finde ud af, hvad du mente, og skrive det.

Den første halvdel er forskning. Sprogforskere har målt, hvordan talesprog adskiller sig fra skriftsprog, forskere i talegenkendelse har målt, hvor transskription svigter og for hvem, og nogle få studier har spurgt, hvorfor folk sender talebeskeder, og hvorfor modtagerne udskyder dem. Den anden halvdel er, hvad de dikteringsværktøjer, folk allerede har, gør, hvad et omskrivningstrin tilfører, og hvad Subtext gør med en talebesked.

Som medstifter af Subtext, hvor tale er én af tre indgange ved siden af et skrevet udkast og et screenshot af en samtale, har jeg en interesse i svaret. Hver eneste kilde nedenfor har jeg selv åbnet. Hvor jeg kun kunne nå et abstract, siger jeg det og citerer ingen tal fra det.

Tale bliver til på en anden måde end skrift

Spontan tale er fuld af stof, som skrift udelader. Elizabeth Shribergs oversigt over disfluens på tværs af flere korpusser med spontan amerikansk engelsk tale lander på op til ti procent af ordene og mere end en tredjedel af ytringerne1. Formerne er fyldte pauser (“uh”, “um”), gentagelser (“jeg jeg tror”), rettelser, hvor et ord skiftes ud midt i en sætning, og falske starter, som hun placerer under udeladelser, hvor en sætning opgives og begyndes forfra. I de to korpusser med samtaler mellem mennesker, som hun undersøgte, uformelle telefonsamtaler og opkald om rejseplanlægning, lå raten pr. ord på omkring seks procent1, i prøver på 40.515 og 12.762 ord, som hendes SRI-artikel om de samme korpusser havde mærket manuelt2. I et korpus med folk, der talte med en computer via en knap, man holder inde for at tale, faldt raten til under én procent, og hun tilskriver en del af faldet knappen. Talerne kunne planlægge ytringen først og derefter optage den1. I en talebesked trykker du én gang og taler, og planlægningen sker højt.

Fyldord i tale og hvor meget talere afviger fra hinanden

Fyldord i tale er ikke støj, og det er en del af grunden til, at de er svære at fjerne. Herbert Clark og Jean Fox Tree argumenterede ud fra flere store korpusser for, at “uh” og “um” er ord i egen ret, planlagt og frembragt som alle andre og brugt til at melde en kort eller lang forsinkelse, mens taleren leder efter det næste ord eller beslutter, hvad der skal siges3. De varierer også enormt fra taler til taler. I London-Lund-korpusset, omkring 170.000 ord fra 50 britiske samtaler ansigt til ansigt optaget mellem 1961 og 1976, mest blandt akademikere, lå de 65 talere, der hver frembragte mere end 1.000 ord, fra 1,2 til 88,5 fyldord pr. 1.000 ord, med en median på 17,33. Nogle transskriptioner kommer næsten rene ud, andre rummer et fyldord for hvert tolvte ord.

Disfluens samler sig også, hvor planlægningen er tungest. Shriberg bemærker, med henvisning til tidligere arbejde, at den er mere sandsynlig tidligt i en frase1. I en talebesked er det åbningen, hvor du stadig er ved at afgøre, hvad beskeden skal bruges til. I skrift kan du slette den åbning, før nogen ser den. I en talebesked går den som regel med, medmindre du optager hele beskeden igen.

Sådan afviger talegenkendelsens fejl fra taler til taler

Transskription lægger sine egne fejl oven i dem, du talte. Den tydeligste måling, jeg fandt, er et studie fra 2020 i PNAS, som kørte fem kommercielle talegenkendere, fra Amazon, Apple, Google, IBM og Microsoft, over 19,8 timers interviewlyd fra 42 hvide og 73 sorte amerikanske talere4. Den gennemsnitlige ordfejlsrate var 0,19 for hvide talere og 0,35 for sorte talere, og alle systemer viste forskellen. Det bedste system, Microsoft, scorede 0,15 og 0,27. Det dårligste, Apple, scorede 0,23 og 0,45. Mere end 20 procent af klippene med sorte talere kom tilbage med mindst halvdelen af ordene forkerte, mod under 2 procent af klippene med hvide talere4. Forfatterne sporede forskellen til de akustiske modeller, den del der kobler lyd til ord, og peger på for lidt lyd fra sorte talere i træningsdataene.

Et andet mønster i samme artikel har betydning for talebeskeder. Systemerne klarede sig noget dårligere på mandlige talere, hvilket forfatterne tilskriver en mere uformel stil med kortere, mere reducerede udtaler og flere disfluenser4, altså det register, en talebesked til en ven har.

Accenter, andetsprog og ord, ingen har sagt

Talegenkendelse klarer sig også dårligere på accenter og på tale på et andetsprog. En artikel fra 2024 i JASA Express Letters testede OpenAIs Whisper-model på tværs af engelske accenter og rapporterede højere nøjagtighed for modersmålstalere end for talere med engelsk som andetsprog, bedre resultater for amerikansk engelsk end for britisk eller australsk og bedre resultater på oplæst tale end på samtale5. Jeg kunne kun nå abstractet, så jeg citerer retningen og intet tal. Whisper blev trænet på 680.000 timers lyd, og dens forfattere beskriver modellerne som tæt på menneskelig “accuracy and robustness”6. Dens egen dokumentation tilføjer, at “performance varies widely depending on the language”7. Et gennemsnit på tværs af talere siger lidt om en træt talebesked på dit andetsprog. Hvis det sprog er engelsk, kan en korrekt besked stadig læses som brysk for en modersmålslæser, og en transskription fortæller dig det ikke.

Whisper kan også tilføje ord, ingen har sagt. Et studie fra 2024 kørte 13.140 korte engelske klip fra 437 deltagere optaget på amerikanske institutioner, med og uden afasi, gennem OpenAIs hostede Whisper-API i april og maj 2023. Cirka én procent af transskriptionerne indeholdt hele vendinger eller sætninger, der ikke var i lyden, og 38 procent af dem bar mindst én eksplicit skade, som vold eller en falsk påstand om autoritet. Klip med lange pauser var mere udsatte. På de 187 klip, hvor Whisper havde opfundet tekst, frembragte Google, Amazon, Microsoft, AssemblyAI og RevAI ingen tilsvarende opfindelser. Klippene var interviews, ikke talebeskeder, og studiet testede API’et, som det var i 20238.

Hvorfor folk sender talebeskeder

Folk sender talebeskeder, fordi de er hurtige for afsenderen. Det største studie, jeg fandt, er fra Universitetet i Ulm, en undersøgelse fra 2020 af 1.003 personer rekrutteret via Amazon Mechanical Turk, mest i USA, plus et feltstudie over to uger med seks storbrugere9. I undersøgelsen havde 83 procent modtaget en talebesked, og 73 procent havde sendt en. Grundene til at sende, hentet fra 735 åbne svar fra folk, der havde optaget en talebesked, faldt i fire temaer. Temaernes antal giver tilsammen mere end de 735 svar, så nogle svar faldt under mere end ét. Bekvemmelighed, eftersom det er hurtigere at tale end at skrive på en telefon, blev nævnt 359 gange. Den tone og følelse, en stemme bærer og tekst mister, 229. Situationer, hvor det er besværligt eller usikkert at skrive, for eksempel under kørsel, 203. Og modtageren, som havde bedt om tale eller fandt det lettere, 34.

Et laboratoriestudie målte hastigheden. Dets 48 universitetsstuderende, 24 af dem med engelsk som modersmål, kopierede korte sætninger på en iPhone, og indtaling på engelsk kørte med 153 ord i minuttet mod 52 på tastaturet, 2,93 gange hurtigere, selvom tale efterlod lidt flere urettede fejl i den endelige tekst, 0,55 procent mod 0,35 procent. Opgaven var at kopiere faste sætninger, hvilket siger lidt om at skrive en besked fra bunden. To af forfatterne arbejdede for Baidu, hvis serverbaserede genkender, Deep Speech 2, blev testet gennem en iPhone 6 Plus-app, i en artikel udgivet i 201710.

Talebeskeder flytter arbejdet fra afsenderen til modtageren

I Ulm-feltstudiet varierede 438 talebeskeder, logget over to uger, fra 1,5 sekunder til lidt over syv minutter, med en median på 17,5 sekunder9. Forfatterne peger også på en pris, der betales, før nogen modtager hører noget. Lyd er flygtig, så en optagelse er besværlig at gennemgå og redigere, og en forsnakkelse betyder, at hele beskeden skal optages igen9. Fem af de tolv afbrudte optagelser i deres feltstudie var netop det.

Forfatterne beskriver det sådan, at talebeskeder “shift the effort necessary for communication towards the receiver”9. Det går hurtigt at lave beskeden, det tager mere tid og kræfter at hente indholdet end at læse en tekst med samme indhold, og de fleste af deres feltdeltagere udskød talebeskeder på arbejdet, fordi en tekst kan tages ind med et blik, og en optagelse kan ikke. Deres foreslåede løsning, i 2020, var automatiske transskriptioner, så datoen og stedet for en aftale, begravet i en optagelse, kunne findes ved at skimme.

Hvorfor modtagere udskyder dem

Modtagere kan ikke skimme, så de går tilbage over det, de hørte. I det samme feltstudie afspillede folk en modtaget talebesked i gennemsnit 1,37 gange, og én besked blev afspillet 13 gange9. At læse kræver ikke genafspilning. En metaanalyse fra 2019 af 190 studier med 18.573 deltagere sætter den gennemsnitlige stille læsning af engelsk sagprosa til 238 ord i minuttet11. Samtaletale kører med omkring 196 ord i minuttet, når man tæller hele opkaldet, og omkring 164 inden for en talers egne indlæg, i et stort telefonkorpus12. Læseren styrer også tempoet og kan springe til spørgsmålet. Lytteren får ordene i talerens tempo og i talerens rækkefølge.

Folk er ikke begejstrede for dem, og lidt mere glade for at modtage end for at sende. En YouGov-måling blandt 2.149 voksne briter, gennemført den 5. og 6. maj 2022 og offentliggjort i juni samme år, spurgte smartphonebrugerne blandt dem, 1.956 personer, om talebeskeder. Af dem kunne 16 procent lide at sende dem, og 36 procent kunne ikke lide det. Hvad angår at modtage dem, kunne 22 procent lide det, 25 procent kunne ikke, og 29 procent var delte13. Kun blandt 18- til 24-årige var der flere, der kunne lide at modtage dem, end der ikke kunne, 43 mod 28 procent, og selv i den gruppe kunne halvdelen ikke lide at sende dem mod 30 procent, der kunne. Af alle smartphonebrugere havde 63 procent aldrig sendt en.

Hvor lang er for lang til en talebesked?

I en YouGov-måling fra maj 2022 blandt britiske smartphonebrugere sagde 65 procent af dem, der svarede, at en talebesked på ét minut er for lang, og blandt dem, der ikke bryder sig om at modtage dem og svarede, var 57 procent frustrerede over 30 sekunder. Blandt alle smartphonebrugere vidste 27 procent ikke, hvor grænsen gik. Spurgt om, hvordan de foretrak at modtage en lang besked, valgte 78 procent tekst og 14 procent en talebesked, hvilket kun viser, hvad folk siger, at de foretrækker13. Nogle afsendere ser ud til at vide, at optagelsen er en byrde. En analyse fra 2024 af WhatsApp-samtaler i Tyskland og Spanien fandt folk, der begrundede deres valg af lyd før, inde i og efter beskeden, og forfatterne beskriver de begrundelser som socialt arbejde, blandt andet ved at fremstille talebeskeden som noget, der kalder på en undskyldning14. På tværs af de tre kilder sparer afsenderen kræfter, og modtageren betaler for det, og nogle afsendere undskylder for det.

Hvad Apples diktering gør med en talebesked

Diktering giver dig ordene i den rækkefølge, du sagde dem, og for Apples diktering er det hele jobbet. Apples iPhone-vejledning til iOS 27 beskriver diktering som behandlet på telefonen uden internetforbindelse, på mange sprog, med automatisk indsættelse af kommaer, punktummer og spørgsmålstegn, hvor sproget understøttes15. På de nyeste telefoner forbedrer en model på enheden stavning, tegnsætning og store bogstaver, på engelsk. Alt andet er en talt kommando. Du siger “ny linje”, du siger “slet” efterfulgt af udtrykket. Påstanden om behandling på enheden har en betingelse. Apples privatlivsside siger, at hvis tastaturindstillingerne ikke viser, at diktering behandles på enheden, sendes det, du dikterer, til Apples servere og gemmes ikke, medmindre du slår Gør Siri og Diktering bedre til. Den siger også, at Apple kan gemme anmodningshistorik og transskriptioner, knyttet til en tilfældig enhedsidentifikator og ikke til din Apple-konto, i op til to år16. Siden siger ikke, hvordan de to hænger sammen. At omskrive er opgaven for Apples separate Skriveværktøjer, som giver ingen aflæsning af, hvordan en tekst lander.

Hvad Googles og Microsofts stemmeindtastning gør

Googles grundlæggende stemmeindtastning i Gboard giver, ligesom Apples diktering, dig ordene, som du sagde dem. Tryk på mikrofonen, sig, hvad du vil have skrevet, og sig tegnsætningen, selvom stemmeindtastning og tegnsætning ikke er tilgængelige på alle sprog17. Den avancerede stemmeindtastning, på Pixel 6 og nyere, tilføjer tegnsætning, mens du taler, og på Pixel 9 (undtagen 9a) og nyere kan en talt kommando korrekturlæse, omformulere, forkorte eller forlænge det, du dikterede. Google siger, at det kører på enheden, på engelsk, fransk, italiensk, japansk og spansk, med tysk på vej18. På Windows siger Microsofts hjælpeside, at Flydende diktat, en funktion i Stemmeskrivning på Copilot+ PC’er, retter grammatik, tegnsætning og fyldord, mens du taler19. Avanceret stemmeindtastning omskriver kun, når du giver en talt kommando. Flydende diktat kører uden kommando, men kun på Copilot+ PC’er, og dens hjælpeside nævner ikke at omordne beskeden. I de hjælpesider fra Apple, Google og Microsoft, jeg har citeret her, fandt jeg ingen funktion, der som standard gør en hel rodet talebesked til en besked, der kan sendes.

Hvad transskriptionsapps og beskedtjenester gør

Otter, en transskriptionsapp, går et skridt videre end et telefontastatur. Dens side om tale til tekst beskriver en transskription med talermærker og tidsstempler, et automatisk genereret resumé med højdepunkter og uddragne hovedpunkter og handlingspunkter20. Otters hjælpecenter opregner engelsk, spansk, fransk, tysk, japansk og kinesisk (forenklet) som understøttede sprog21, hvilket er flere, end siden om tale til tekst angiver. Den er bygget til møder, så den komprimerer det, der blev sagt, og jeg fandt ingen funktion på de to sider, der skriver det, du havde tænkt dig at sende. Åbne talemodeller ligger under nogle apps. Whisper selv frembringer en transskription og et sprogmærke7. De apps, der er bygget på den, varierer. MacWhisper reklamerer med fjernelse af fyldord, resuméer og egne prompts oven på transskriptionen og tilbyder lokale eller cloudbaserede modeller til det trin22.

Beskedtjenesterne er begyndt at transskribere de talebeskeder, du modtager. WhatsApp tilføjede transskriptioner af talebeskeder i november 2024, genereret på enheden, så WhatsApp selv ikke kan læse dem, slået til under Indstillinger og Chats og udløst ved et langt tryk på beskeden23. Opslaget siger, at transskriptionerne startede på nogle få udvalgte sprog, og jeg kunne ikke bekræfte den nuværende liste. Det løser det skimmeproblem, Ulm-forfatterne pegede på, hvor sproget er dækket. Det, du får, er en transskription af en andens tænkning højt. Du kan læse den i et møde, men du skal stadig selv skrive svaret.

Hvad et omskrivningstrin tilfører

Et omskrivningstrin gør transskriptionen til den besked, du ville have skrevet, hvis det ikke kostede noget at skrive. Det fjerner de fyldord, Clark og Fox Tree beskriver, slår de gentagelser og falske starter, der står i Shribergs inddeling, sammen til ét, og placerer den rettelse, du lavede halvvejs, hvor den hører hjemme, så den erstatter det, den rettede. Det omordner også. Talte forklaringer ankommer typisk, som de faldt dig ind, med konteksten først og anmodningen sidst, eller med anmodningen først og begrundelserne hægtet på bagefter. En skrevet besked kan lede med pointen.

To ting må trinnet lade være med at røre ved. Den første er meningen. En omskrivning, der glatter din talebesked ud til en anden anmodning, er værre end transskriptionen, for transskriptionen sagde i det mindste, hvad du sagde. Den anden er tonen. Hvis du var varm, eller direkte, eller sjov, skal den skrevne version være det samme menneske. Fejlen her er den, der er beskrevet i får AI dine beskeder til at lyde som en robot, hvor en omskrivning kommer tilbage høflig og intetsigende.

Der er også en vurdering, en transskription aldrig behøver at foretage. Noget af det, du sagde i en talebesked, var til dig selv og ikke til modtageren. At spekulere højt over, om du skal nævne noget, betyder ikke, at du ville nævne det. Et omskrivningstrin må afgøre, hvad der var beskeden, og hvad der var kladdearbejdet, og den afgørelse kan gå galt i begge retninger, enten ved at beholde en sætning, du var ved at tale dig selv fra, eller ved at droppe en, du mente. Jeg fandt intet studie, der målte, hvor ofte det sker med noget værktøj, Subtext medregnet.

Hvad Subtext gør med en talebesked

Subtext transskriberer den talebesked, du optager i appen, skriver derefter beskeden ud fra det, du mente, og giver op til tre versioner tilbage, hver med en score for, om den er klar til at sende, altså hvor sandsynligt det er, at den lander, som du mente. Versionerne er bygget til at bevare din mening og din personlighed. På et første udkast holder én sig tæt på dine ord med problemerne rettet, én er en varmere finpudsning eller en anden tilgang, og én er en mere gennemgribende omskrivning. Hvis formuleringen læses koldere eller skarpere, end du havde tænkt, navngiver appen problemet og markerer de ord, der er skyld i det. Intet bliver sendt for dig.

Modellens instruktioner dækker transskriptionsartefakter, og jeg læste promptene i backenden, før jeg skrev det her. Når en besked er markeret som dikteret, får modellen besked på at forvente misforståede eller sammensmeltede ord, mærkelig tegnsætning og løse fyldord, at læse igennem dem til den tilsigtede formulering og at rette dem uden at sige noget og uden at markere dem som noget, du har gjort forkert. Prompten viser, hvad modellen får besked på at gøre. Jeg fandt ingen uafhængig evaluering af Subtexts transskription af tale eller omskrivning, så alt det her hviler på det, appen viser, og det, dens prompts og privatlivspolitik siger. Da intet af studierne ovenfor testede Deepgram, talemodellen, der transskriberer Subtexts lyd, kan jeg ikke sige, hvor langt fejlmønstrene for accenter, tale på andetsprog og afslappet stil gælder for den, så læs beskeden igennem igen, før du sender den.

Hvad sker der med en stemmeoptagelse i Subtext?

Subtext sender en stemmeoptagelse til Deepgram til transskription, så lyden forlader telefonen. Privatlivspolitikken, opdateret 26. juli 2026, navngiver flere leverandører, blandt dem Deepgram til stemmeoptagelser, Anthropic til tekst, billeder og transskriptioner af tale, Google Firebase til konti og samtaler og OpenAI kun, hvis du slår oplæsning til. Politikken tilføjer, at når websøgning er slået til, sendes søgetermer hentet fra din anmodning gennem Anthropic til tredjepartssøgeudbydere, og at du kan slå websøgning fra i appens indstillinger24. Den siger, at intet, du indsender, bruges til at træne en AI-model, og at ingen af dens AI-leverandører må træne på det, og at Subtext desuden har slået Deepgrams modelforbedring fra for stemme. Den siger, at Subtext sletter sin egen kopi af en samtale fra sine servere fem dage efter, du sidst brugte den, eller efter 90 dage, hvis du fastgør den. Den siger, at Deepgram, med det fravalg sat, kun gemmer lyd, så længe transskriptionen tager, og at Anthropic sletter input og output inden for 30 dage og kan gemme markerede anmodninger i op til to år og tilhørende sikkerhedsscorer i op til syv år. Den siger, at Subtext ikke har nogen aftale om nulopbevaring med nogen af dem24. Hvordan andre assistenter håndterer din tekst, er sammenlignet i hvilke AI-skriveassistenter der træner på dine beskeder.

Hvilke sprog understøtter Subtext?

Subtext skriver beskeden på det sprog, du talte, på 17+ sprog, og bevarer det formalitetsniveau, du brugte, hvor sproget markerer et. En talebesked på tysk kommer tilbage som en tysk besked. Resuméet af en talebesked, du har modtaget, er skrevet på det sprog, den kom på. Google Plays redaktører fremhævede det her forløb i et “Hot Tip”-stykke, der beskriver at trykke på mikrofonikonet, tale, trykke igen og få en forfinet besked med mærkater for, hvordan originalen virker, og en kopiknap25. Da jeg åbnede siden den 4. oktober 2026, viste fortegnelsen i den tyske butik 4,3 stjerner fra 295 anmeldelser og mere end 50.000 downloads, en Google Play-optælling alene; stjernetallet afviger fra land til land. Det koster penge at bruge Subtext, og nogle få analyser er gratis til at komme i gang. En optaget talebesked kommer tilbage som en besked, du kan sende.

Hvordan svarer du på en lang talebesked, nogen har sendt dig?

Subtext læser også de talebeskeder, andre sender dig, og det er her, en almindelig transskription kommer tættest på at være nok. WhatsApps transskription på enheden lader dig læse en optagelse på to minutter, hvor dit sprog er dækket23. Det, den ikke gør, er at fortælle dig, hvad personen vil have. Ulm-studiets eget eksempel var en dato og et sted begravet i lyden9. En lang talebesked fra en ven eller en chef har den samme form, med spørgsmålet et sted i midten og begrundelserne omkring. For folk, der går i stå med svar, er læsetrinnet ét af fem steder, hvor et svar sætter sig fast, og de fleste af Ulm-feltdeltagerne udskød talebeskeder på arbejdet, fordi en optagelse ikke kan tages ind med et blik9.

Læg en modtaget talebesked ind i Subtext, og den transskriberer den, opsummerer på én linje, hvad personen vil have af dig, og tilføjer to til fem handlingspunkter. Den kan derefter skrive et udkast til et svar, der samler tråden op, og den sætter ikke mærke på afsenderens tone. Promptene i backenden behandler en lydfil, du vedhæfter, som sandsynligvis sendt til dig af den anden person, og hvis modellen er i tvivl om, hvem der er hvem, har den besked på at spørge. Resuméet er kun så godt som transskriptionen under det, og én linje er svær at læse uden sin sammenhæng, som hvad betyder den her tekst viser. Ved en kraftig accent eller en støjfyldt optagelse vil transskriptionen rumme flere fejl end for engelsk i studiekvalitet, så afspil originalen, før du svarer på noget, der betyder noget. Tekst og screenshots går gennem det samme resumétrin, så en besked, du har modtaget, får det samme resumé på én linje.

De nærmeste eksperimenter er gamle og små

De to eksperimenter, jeg fandt, der ligger tættest på et omskrivningstrin eller et resumé, er fra 2003 og 2005, og begge er små. I 2003 lod et DARPA-finansieret eksperiment 28 engelske modersmålstalere læse passager på 150 til 250 ord af tale fra telefonsamtaler og tv- og radioudsendelser, som ordrette transskriptioner og som håndrensede. Læserne vurderede den rensede tekst som lettere at forstå, men de svarede ikke mere præcist eller hurtigere på spørgsmål om den, hvilket forfatterne tilskriver, at læserne allerede scorede tæt på toppen. Automatisk rensning af ufuldkomment genkenderoutput blev tilbøjeligt vurderet som sværere end den urensede version, dog kun marginalt26. Rensningen fjernede disfluenser og rettede tegnsætning, men omskrev ikke teksten til en besked.

I 2005 besvarede 16 personer spørgsmål om 15 telefonsvarerbeskeder ud fra automatisk uddragne resuméer. Resuméer bygget på genkendt tale fik opringerens navn rigtigt i 57 procent af tilfældene mod 94 procent for resuméer bygget på menneskelige transskriptioner, mens årsagen til opkaldet kom lige godt igennem, med 78 procent. Folk bad oftere om den oprindelige lyd, når resuméet kom fra genkendt tale, 53 procent af gangene mod 30 procent27. Det var uddragsresuméer af telefonsvarerbeskeder lavet med talegenkendelse fra 2005, så studiet sætter kun en forventning. Ingen af studierne målte en besked, nogen ville sende.

Hvor evidensen holder op

Den stærke evidens ligger i de to ender. Talesprog bærer disfluens i en målt rate, som skrift ikke gør, og talegenkendelse laver flere fejl for nogle talere end for andre, med tallene ovenfor som belæg. Midten er tyndere. Jeg fandt intet studie, der målte, hvor meget bedre en omskrevet talebesked lander end en rå transskription, eller hvor ofte en omskrivning ændrer meningen undervejs. Forskningen i talebeskeder er en håndfuld studier, det største med en spørgeskemastikprøve hentet fra en amerikansk platform for crowdworkere og et feltstudie med seks personer. YouGov-målingen dækker ét land og ét år. Og talebeskedstudierne er ældre end transskription på enheden, så den forskydning af arbejdet, de beskriver, er nu delvist lukket af beskedtjenesterne selv.

I praksis kommer det an på, hvordan du taler. Hvis du taler i rene sætninger, er diktering nok, og din telefon har den allerede. Hvis du taler, som talerne i de korpusser gjorde, med de fyldord, Clark og Fox Tree talte, og de genstarter, Shriberg katalogiserede, giver en transskription modtageren din kladdeproces, og et omskrivningstrin er det, der gør den til en besked. Subtext er én app, der gør det trin, for den talebesked, du optager, og den, du har modtaget, og hvis dit problem er et svar, du bliver ved med at redigere, handler hvorfor et kort svar tager en time om den løkke. Prøv Subtext i browserenPrøv Subtext i browseren

Kilder

Nummereret i den rækkefølge, de optræder første gang. Siderne blev tjekket den 4. og 5. oktober 2026, og Subtexts privatlivspolitik blev åbnet igen den 10. oktober 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 til 169. Korpusstudie af amerikansk engelsk samtale; rater og typer af disfluens.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferenceartikel; PDF’en har intet årstal, og de citerede referencer går til 1996. Manuelt mærkede korpusser på 40.515 ord fra 30 talere (Switchboard) og 12.762 ord fra 523 talere (AMEX, opkald mellem SRI-ansatte og rejsebureauer). Finansieret af DARPA og NSF. . Tjekket 5. oktober 2026.
  3. Clark, H. H., og Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 til 111. Fyldordsrater pr. taler fra London-Lund-korpusset.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., og Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 til 7689. Fem kommercielle systemer, 42 hvide og 73 sorte talere, 19,8 timers lyd.
  5. Graham, C., og Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Kun abstractet; fuldteksten kunne ikke nås, da jeg tjekkede.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., og Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-preprint.
  7. OpenAI. Whisper README. GitHub. . Tjekket 4. oktober 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., og Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 lydsegmenter fra 437 deltagere optaget på amerikanske institutioner, med og uden afasi, kørt gennem Whisper-API’et i april og maj 2023. Finansieret af Pulitzer Center og Cornells Center for Social Sciences.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., og Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Undersøgelse af 1.003 personer og et feltstudie over to uger med 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., og Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Udgivet december 2017. Laboratoriestudie med 48 universitetsstuderende, 24 pr. sprog, der kopierede sætninger på en iPhone. To forfattere arbejdede for Baidu USA, hvis serverbaserede talesystem, Deep Speech 2, kørte på en Baidu-server og blev testet gennem en iPhone 6 Plus-app.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 studier, 18.573 deltagere.
  12. Yuan, J., Liberman, M., og Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard-telefonsamtaler.
  13. YouGov. How many Britons like voice notes? 14. juni 2022. Måling blandt 2.149 voksne briter, feltarbejde 5. og 6. maj 2022, heraf 1.956 smartphonebrugere; længdetallene er andele af respondenter, der gav et svar. Resultattabeller på . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Tjekket 4. og 5. oktober 2026. Procenterne følger YouGovs artikeltekst; resultattabellerne giver lidt andre totaler for dem, der ikke bryder sig om det, på grund af afrunding.
  14. Sampietro, A., og König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 til 71. Tyske og spanske WhatsApp-samtaler; abstractet læst gennem udgiverens Crossref-optegnelse, fuldteksten ligger bag betalingsmur.
  15. Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Tjekket 4. oktober 2026.
  16. Apple. Siri, Dictation & Privacy. Legal, sidst opdateret 14. september 2026. . Tjekket 5. oktober 2026.
  17. Google. Type with your voice. Gboard Help. . Tjekket 4. oktober 2026.
  18. Google. Use advanced voice typing features. Gboard Help. . Tjekket 5. oktober 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Tjekket 5. oktober 2026.
  20. Otter.ai. Convert Speech to Text. . Tjekket 4. oktober 2026.
  21. Otter.ai. Supported languages. Otter Help Center, artikel redigeret 6. maj 2026. . Tjekket 5. oktober 2026.
  22. MacWhisper. Homepage. Marketingside uden dato, så den viser, hvad produktet reklamerer med, og ikke hvordan det yder. . Tjekket 5. oktober 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21. november 2024. . Tjekket 4. oktober 2026.
  24. Subtext, Terms, privacy and your account. Privatlivspolitikken sidst opdateret 26. juli 2026. Tjekket 10. oktober 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Tjekket 4. oktober 2026; fortegnelsen viste 295 anmeldelser og 50K+ downloads i hver butik, jeg åbnede, og 4,3 stjerner i den tyske.
  26. Jones, D. A., og seks medforfattere (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 til 1588. 32 engelske modersmålstalere rekrutteret, 28 analyseret. Sponsoreret af DARPA under Air Force-kontrakt F19628-00-C-0002.
  27. Koumpis, K., og Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Forståelsestest med 16 deltagere og 15 telefonsvarerbeskeder; tal aflæst fra PDF’en på forfatterens eget site. Finansieret af en EPSRC ROPA-bevilling, GR/R23954.