ArtiklerSkriveverktøy

Hvorfor en transkripsjon av et talenotat ikke er en tekstmelding

Vanlig diktering gjør et talenotat om til tekst, men beholder ofte fyllordene, omstartene og rekkefølgen du kom på ting i. Hva forskningen sier, og hva et omskrivingssteg tilfører.

Av Samet Durgun · Medgrunnlegger av Subtext · 18 min lesetid

Tale har fyllord, falske starter og rettelser midt i setningen som ferdig skrift stort sett ikke har, så en vanlig transkripsjon av et talenotat er ennå ikke en melding. Telefoner skriver ned det du sa, og det gjør Otter, transkripsjonene i WhatsApp og apper bygget på åpne talemodeller også, men en transkripsjon av et rotete talenotat er fortsatt en rotete melding. Den beholder «øh», rettelsen du gjorde halvveis og rekkefølgen du tilfeldigvis kom på ting i. En app som gjør et talenotat om til en klar tekstmelding, må gjøre en jobb til etter transkripsjonen. Den må finne ut hva du mente og skrive det.

Den første halvdelen er forskning. Språkforskere har målt hvordan talespråk skiller seg fra skriftspråk, forskere på talegjenkjenning har målt hvor transkripsjon svikter og for hvem, og noen få studier har spurt hvorfor folk sender talenotater og hvorfor mottakerne utsetter dem. Den andre halvdelen tar for seg hva dikteringsverktøyene folk allerede har faktisk gjør, hva et omskrivingssteg tilfører og hva Subtext gjør med et talenotat.

Som medgrunnlegger av Subtext, der tale er én av tre veier inn ved siden av et skrevet utkast og et skjermbilde av en samtale, har jeg en egeninteresse i svaret. Hver kilde nedenfor er en jeg har åpnet. Der jeg bare kom til et sammendrag, sier jeg det og siterer ingen tall derfra.

Tale blir til på en annen måte enn skrift

Spontan tale er full av stoff som skrift utelater. Elizabeth Shribergs oversikt over disfluens i flere korpus av spontan amerikansk engelsk tale setter raten til opptil ti prosent av ordene og mer enn en tredel av ytringene1. Formene er fylte pauser («uh», «um»), gjentakelser («I I think»), reparasjoner der et ord byttes ut midt i en setning, og falske starter, som hun fører under slettinger, der en setningsdel forlates og begynnes på nytt. I de to korpusene med samtaler mellom mennesker som hun undersøkte, uformelle telefonsamtaler og samtaler om reiseplanlegging, var raten per ord omtrent seks prosent1, i utvalg på 40 515 og 12 762 ord som SRI-artikkelen hennes om de samme korpusene hadde merket for hånd2. I et korpus der folk snakket til en datamaskin og trykket på en knapp for å snakke, falt raten til under én prosent, og hun tilskriver en del av fallet knappen. Talerne kunne planlegge ytringen først og så ta den opp1. I et talenotat trykker du én gang og snakker, og planleggingen skjer høyt.

Fyllord i tale og hvor mye talere varierer

Fyllord i tale er ikke støy, og det er en del av grunnen til at de er vanskelige å fjerne. Herbert Clark og Jean Fox Tree argumenterte ut fra flere store korpus for at «uh» og «um» er egne ord, planlagt og produsert som alle andre, brukt til å varsle om en kort eller lang forsinkelse mens taleren leter etter neste ord eller bestemmer seg for hva som skal sies3. De varierer også enormt fra taler til taler. I London-Lund-korpuset, omtrent 170 000 ord fra 50 britiske samtaler ansikt til ansikt tatt opp mellom 1961 og 1976, for det meste blant akademikere, varierte de 65 talerne som hadde produsert mer enn 1 000 ord hver, fra 1,2 til 88,5 fyllord per 1 000 ord, med en median på 17,33. Noen transkripsjoner blir nesten rene, andre har et fyllord for hvert tolvte ord.

Disfluens samler seg også der planleggingen er tyngst. Shriberg bemerker, med henvisning til tidligere arbeid, at den er mer sannsynlig tidlig i en frase1. I et talenotat er det åpningen, der du fortsatt bestemmer deg for hva meldingen skal brukes til. I skrift kan du slette den åpningen før noen ser den. I et talenotat blir den som regel sendt med, med mindre du tar opp hele meldingen på nytt.

Hvordan feil i talegjenkjenning varierer mellom talere

Transkripsjon legger til sine egne feil oppå dem du sa. Den klareste målingen jeg fant er en studie i PNAS fra 2020 som kjørte fem kommersielle talegjenkjennere, fra Amazon, Apple, Google, IBM og Microsoft, over 19,8 timer intervjulyd fra 42 hvite og 73 svarte amerikanske talere4. Gjennomsnittlig ordfeilrate var 0,19 for hvite talere og 0,35 for svarte talere, og alle systemene viste gapet. Den beste, Microsoft, fikk 0,15 og 0,27. Den dårligste, Apple, fikk 0,23 og 0,45. Mer enn 20 prosent av de svarte talernes klipp kom tilbake med minst halvparten av ordene feil, mot færre enn 2 prosent av de hvite talernes klipp4. Forfatterne sporet gapet til de akustiske modellene, delen som kobler lyd til ord, og peker på for lite lyd fra svarte talere i treningsdataene.

Et annet mønster i samme artikkel har betydning for talenotater. Systemene gjorde det noe dårligere på mannlige talere, noe forfatterne tilskriver en mer uformell stil med kortere, mer reduserte uttaler og flere disfluenser4, altså registeret i et talenotat til en venn.

Aksenter, andrespråk og ord ingen sa

Talegjenkjenning gjør det også dårligere på aksenter og tale på andrespråk. En artikkel fra 2024 i JASA Express Letters testet OpenAIs Whisper-modell på tvers av engelske aksenter og rapporterte høyere treffsikkerhet for morsmålstalere enn for talere med engelsk som andrespråk, bedre resultater for amerikansk engelsk enn for britisk eller australsk, og bedre resultater på opplest tale enn på samtale5. Jeg kom bare til sammendraget, så jeg siterer retningen og ingen tall. Whisper ble trent på 680 000 timer lyd, og forfatterne beskriver modellene som nær menneskelig «accuracy and robustness»6. Dokumentasjonen legger selv til at «performance varies widely depending on the language»7. Et gjennomsnitt over talere sier lite om et slitent talenotat på ditt andrespråk. Hvis det språket er engelsk, kan en korrekt melding fortsatt lese som brå for en morsmålsleser, og en transkripsjon forteller deg ikke det.

Whisper kan også legge til ord ingen sa. En studie fra 2024 kjørte 13 140 korte engelske klipp fra 437 deltakere tatt opp ved amerikanske institusjoner, med og uten afasi, gjennom OpenAIs nettbaserte Whisper-API i april og mai 2023. Rundt én prosent av transkripsjonene inneholdt hele fraser eller setninger som ikke fantes i lyden, og 38 prosent av dem bar minst én eksplisitt skade, som vold eller en falsk påstand om autoritet. Klipp med lange pauser var mer utsatt. På de 187 klippene der Whisper hadde funnet på tekst, produserte Google, Amazon, Microsoft, AssemblyAI og RevAI ingen sammenlignbare påfunn. Klippene var intervjuer, ikke talenotater, og studien testet API-et slik det var i 20238.

Hvorfor folk sender talenotater

Folk sender talenotater fordi de er raske for avsenderen. Den største studien jeg fant er fra Universitetet i Ulm, en undersøkelse fra 2020 av 1 003 personer rekruttert gjennom Amazon Mechanical Turk, for det meste i USA, pluss en feltstudie over to uker med seks storbrukere9. I undersøkelsen hadde 83 prosent mottatt en talemelding og 73 prosent hadde sendt en. Grunnene til å sende, hentet fra 735 åpne svar fra folk som hadde tatt opp en talemelding, falt i fire temaer. Antallene per tema summerer seg til mer enn 735 svar, så noen svar havnet under mer enn ett tema. Bekvemmelighet, siden det å snakke slår å skrive på en telefon, ble nevnt 359 ganger. Tonen og følelsen en stemme bærer og tekst mister, 229. Situasjoner der det er upraktisk eller utrygt å skrive, som når man kjører bil, 203. Og mottakeren, som hadde bedt om tale eller syntes det var lettere, 34.

En laboratoriestudie målte farten. De 48 universitetsstudentene, 24 av dem med engelsk som morsmål, skrev av korte fraser på en iPhone, og engelsk taleinntasting gikk med 153 ord i minuttet mot 52 på tastaturet, 2,93 ganger raskere, selv om tale lot litt flere uopprettede feil stå igjen i den endelige teksten, 0,55 prosent mot 0,35 prosent. Oppgaven var å skrive av gitte fraser, noe som sier lite om å skrive en melding. To av forfatterne jobbet for Baidu, hvis gjenkjenner på tjenersiden, Deep Speech 2, ble testet gjennom en app på en iPhone 6 Plus, i en artikkel utgitt i 201710.

Talenotater flytter innsatsen fra avsenderen til mottakeren

I feltstudien fra Ulm varierte de 438 talemeldingene som ble loggført over to uker fra 1,5 sekunder til drøyt syv minutter, med en median på 17,5 sekunder9. Forfatterne peker også på en kostnad som betales før noen mottaker har hørt noe. Lyd er flyktig, så et opptak er tungvint å gå gjennom og redigere, og en forsnakkelse betyr at hele meldingen må tas opp på nytt9. Fem av de tolv avbrutte opptakene i feltstudien deres var nettopp det.

Forfatterne skriver at talemeldinger «shift the effort necessary for communication towards the receiver»9. Å lage dem går raskt, å hente dem fram igjen tar mer tid og krefter enn å lese en tekst med samme innhold, og de fleste feltdeltakerne utsatte talemeldinger på jobb fordi en tekst kan tas inn med et blikk og et opptak ikke kan det. Løsningen de foreslo i 2020 var automatiske transkripsjoner, slik at dato og sted for en avtale som lå gjemt i et opptak, kunne finnes ved å skanne.

Hvorfor mottakere utsetter dem

Mottakere kan ikke skumlese, så de går tilbake over det de hørte. I samme feltstudie spilte folk av en mottatt talemelding 1,37 ganger i gjennomsnitt, og én melding ble spilt av 13 ganger9. Lesing trenger ikke avspilling på nytt. En metaanalyse fra 2019 av 190 studier med 18 573 deltakere setter gjennomsnittlig stille lesing av engelsk sakprosa til 238 ord i minuttet11. Samtaletale går med omtrent 196 ord i minuttet når man regner hele samtalen og omtrent 164 innenfor en talers egne replikker, i et stort telefonkorpus12. Leseren styrer også tempoet og kan hoppe til spørsmålet. Lytteren får ordene i talerens tempo og i talerens rekkefølge.

Folk er ikke begeistret for dem, og litt mer begeistret for å motta enn for å sende. En YouGov-måling blant 2 149 voksne briter, gjennomført 5. og 6. mai 2022 og publisert i juni samme år, spurte smarttelefonbrukerne blant dem, 1 956 personer, om talenotater. Av disse likte 16 prosent å sende dem og 36 prosent mislikte å sende dem. Å motta dem likte 22 prosent, 25 prosent mislikte det og 29 prosent var ambivalente13. Bare blant 18 til 24-åringer var det flere som likte å motta dem enn som mislikte det, 43 mot 28 prosent, og selv i den gruppen mislikte halvparten å sende mot 30 prosent som likte det. Av alle smarttelefonbrukere hadde 63 prosent aldri sendt ett.

Hvor langt er for langt for et talenotat?

I en YouGov-måling fra mai 2022 blant britiske smarttelefonbrukere sa 65 prosent av dem som ga et svar, at et talenotat på ett minutt er for langt, og blant dem som misliker å motta dem og ga et svar, var 57 prosent frustrerte over 30 sekunder. Blant alle smarttelefonbrukere visste 27 prosent ikke hvor grensen gikk. Spurt om hvordan de helst ville motta en lang melding, valgte 78 prosent tekst og 14 prosent et talenotat, noe som bare registrerer en oppgitt preferanse13. Noen avsendere ser ut til å vite at opptaket er en belastning. En analyse fra 2024 av WhatsApp-samtaler i Tyskland og Spania fant at folk redegjorde for valget av lyd før, inni og etter meldingen, og forfatterne beskriver disse redegjørelsene som sosialt arbeid, blant annet ved å framstille talenotatet som noe man bør be om unnskyldning for14. På tvers av disse tre kildene sparer avsenderen krefter og mottakeren betaler for det, og noen avsendere beklager det.

Hva Apples Diktering gjør med et talenotat

Diktering gir deg ordene i den rekkefølgen du sa dem, og for Apples Diktering er det hele jobben. Apples iPhone-håndbok for iOS 27 beskriver Diktering som behandlet på telefonen uten internettforbindelse, på mange språk, og som setter inn komma, punktum og spørsmålstegn automatisk der språket støttes15. På de nyeste telefonene forbedrer en modell på enheten stavemåte, tegnsetting og store bokstaver, på engelsk. Alt annet er en talekommando. Du sier «ny linje», du sier «slett» etterfulgt av frasen. Påstanden om behandling på enheten har en betingelse. Apples personvernside sier at hvis Tastaturinnstillinger ikke viser at Diktering behandles på enheten, sendes det du dikterer til Apples tjenere og lagres ikke med mindre du velger å bidra til Forbedre Siri og Diktering. Den sier også at Apple kan beholde forespørselshistorikk og avskrifter, knyttet til en tilfeldig enhetsidentifikator og ikke til Apple-kontoen din, i opptil to år16. Siden sier ikke hvordan de to henger sammen. Omskriving er jobben til Apples separate Skriveverktøy, som gir ingen lesning av hvordan en tekst lander.

Hva Googles og Microsofts taleverktøy gjør

Googles grunnleggende stemmestyrte skriving i Gboard gir deg, som Apples Diktering, ordene slik du sa dem. Trykk på mikrofonen, si hva du vil ha skrevet og si tegnsettingen høyt, selv om stemmestyrt skriving og tegnsetting ikke finnes på alle språk17. Den avanserte stemmestyrte skrivingen, på Pixel 6 og nyere, setter inn tegnsetting mens du snakker, og på Pixel 9 (unntatt 9a) og nyere kan en talekommando korrekturlese, omformulere, forkorte eller forlenge det du dikterte. Google sier at dette kjører på enheten, på engelsk, fransk, italiensk, japansk og spansk, med tysk på vei18. På Windows sier Microsofts hjelpeside at flytende diktering, en funksjon på Copilot+ PC, retter grammatikk, tegnsetting og fyllord mens du snakker19. Avansert stemmestyrt skriving skriver bare om når du gir den en talekommando. Flytende diktering kjører uten kommando, men bare på Copilot+ PC-er, og hjelpesiden nevner ikke at meldingen stokkes om. I hjelpesidene fra Apple, Google og Microsoft som er sitert her, fant jeg ingen funksjon som som standard gjør et helt rotete talenotat om til en melding som kan sendes.

Hva transkripsjonsapper og meldingsapper gjør

Otter, en transkripsjonsapp, går et skritt lenger enn et telefontastatur. Siden deres om tale til tekst beskriver en transkripsjon med talermerking og tidsstempler, et automatisk generert sammendrag med høydepunkter, og uttrukne hovedpunkter og handlingspunkter20. Otters hjelpesenter lister engelsk, spansk, fransk, tysk, japansk og kinesisk (forenklet) som støttede språk21, noe som er flere enn siden om tale til tekst oppgir. Den er bygget for møter, så den trekker sammen det som ble sagt, og jeg fant ingen funksjon på de to sidene som skriver et utkast av det du ville sende. Åpne talemodeller ligger under noen apper. Whisper alene gir en transkripsjon og en språketikett7. Appene bygget på den varierer. MacWhisper reklamerer med fjerning av fyllord, sammendrag og egendefinerte prompter oppå transkripsjonen, og tilbyr lokale eller skybaserte modeller til det steget22.

Meldingsappene har begynt å transkribere talenotatene du mottar. WhatsApp la til transkripsjoner av talemeldinger i november 2024, laget på enheten slik at WhatsApp selv ikke kan lese dem, slått på under Innstillinger og Chatter og utløst ved å trykke og holde på meldingen23. Innlegget sier at transkripsjonene startet på noen få utvalgte språk, og jeg kunne ikke bekrefte den gjeldende listen. Det svarer på skanneproblemet Ulm-forfatterne pekte på, der språket er dekket. Det du får, er en transkripsjon av en annens tenking høyt. Du kan lese den i et møte, men du må fortsatt skrive svaret selv.

Hva et omskrivingssteg tilfører

Et omskrivingssteg gjør transkripsjonen om til meldingen du ville ha skrevet hvis det å skrive var gratis. Det fjerner fyllordene Clark og Fox Tree beskriver, slår sammen gjentakelsene og de falske startene i Shribergs taksonomi, og setter rettelsen du gjorde halvveis der den hører hjemme, slik at den erstatter det den rettet. Det stokker også om. Muntlige forklaringer kommer gjerne slik de falt deg inn, med bakgrunnen først og ønsket sist, eller ønsket først og begrunnelsene på slep. En skrevet melding kan åpne med poenget.

To ting må steget la være i fred. Den første er meningen. En omskriving som glatter talenotatet ditt til en annen forespørsel, er verre enn transkripsjonen, fordi transkripsjonen i det minste sa det du sa. Den andre er tonen. Var du varm, eller direkte, eller spøkte du, skal den skrevne versjonen være det samme mennesket. Feilmodusen her er den som er behandlet i får KI meldingene dine til å høres ut som en robot, der en omskriving kommer tilbake høflig og generisk.

Det finnes også en vurdering en transkripsjon aldri trenger å gjøre. Noe av det du sa i et talenotat var til deg selv, ikke til mottakeren. At du lurer høyt på om du skal nevne noe, betyr ikke at du mente å nevne det. Et omskrivingssteg må avgjøre hva som var meldingen og hva som var utkastet, og den avgjørelsen kan gå galt i begge retninger, ved å beholde en setning du var i ferd med å snakke deg bort fra eller ved å droppe en du mente. Jeg fant ingen studie som målte hvor ofte det skjer med noe verktøy, Subtext inkludert.

Hva Subtext gjør med et talenotat

Subtext transkriberer talenotatet du tar opp i appen, skriver så meldingen ut fra det du mente og gir tilbake opptil tre versjoner, hver med en trygg-å-sende-poengsum for hvor sannsynlig det er at den lander slik du mente. Versjonene er laget for å beholde meningen din og personligheten din. På et første utkast holder én seg nær ordene dine med problemene rettet, én er en varmere finpuss eller en annen tilnærming, og én er en fyldigere omskriving. Hvis formuleringen lyder kaldere eller skarpere enn du mente, navngir appen problemet og markerer ordene som er skyld i det. Ingenting sendes for deg.

Instruksjonene til modellen dekker transkripsjonsartefakter, og jeg leste backend-promptene før jeg skrev dette. Når en melding er merket som diktert, får modellen beskjed om å vente seg feilhørte eller sammensmeltede ord, merkelig tegnsetting og løse fyllord, om å lese gjennom dem til den tiltenkte ordlyden, og om å rette dem stille uten å flagge dem som noe du har gjort galt. Prompten viser hva modellen får beskjed om å gjøre. Jeg fant ingen uavhengig evaluering av Subtexts talegjenkjenning eller omskriving, så alt dette hviler på det appen viser og på det promptene og personvernerklæringen sier. Siden ingen av studiene ovenfor testet Deepgram, talemodellen som transkriberer lyden i Subtext, kan jeg ikke si hvor langt feilmønstrene for aksenter, tale på andrespråk og uformell stil gjelder for den, så les meldingen over før du sender.

Hva skjer med et lydopptak i Subtext?

Subtext sender et lydopptak til Deepgram for transkripsjon, så lyden forlater telefonen. Personvernerklæringen, oppdatert 26. juli 2026, nevner flere leverandører, blant dem Deepgram for lydopptak, Anthropic for tekst, bilder og talentranskripsjoner, Google Firebase for kontoer og samtaler, og OpenAI bare hvis du slår på opplesning. Erklæringen legger til at når nettsøk er på, går søkeord hentet fra forespørselen din via Anthropic til tredjeparts søkeleverandører, og at du kan slå av nettsøk i innstillingene i appen24. Den sier at ingenting du sender inn brukes til å trene en KI-modell og at ingen av KI-leverandørene får trene på det, og at Subtext i tillegg har satt Deepgrams fravalg mot modellforbedring for tale. Den sier at Subtext sletter sin egen kopi av en samtale fra serverne fem dager etter at du sist brukte den, eller etter 90 dager hvis du fester den. Den sier at Deepgram, med det fravalget satt, bare beholder lyd så lenge det tar å transkribere den, og at Anthropic sletter inndata og utdata innen 30 dager, og kan beholde flaggede forespørsler i opptil to år og tilhørende sikkerhetsvurderinger i opptil sju år. Den sier at Subtext ikke har noen avtale om null datalagring med noen av dem24. Hvordan andre assistenter behandler teksten din, er sammenlignet i hvilke KI-skriveassistenter som trener på meldingene dine.

Hvilke språk støtter Subtext?

Subtext skriver meldingen på språket du snakket, på 17+ språk, og beholder formalitetsnivået du brukte der språket markerer et. Et talenotat på tysk kommer tilbake som en melding på tysk. Sammendraget av et talenotat du mottok, skrives på språket det kom på. Google Plays redaktører løftet fram denne flyten i en «Hot Tip»-artikkel som beskriver hvordan du trykker på mikrofonikonet, snakker, trykker igjen og får en finpusset melding med tagger for hvordan originalen kom over, og en kopieringsknapp25. Da jeg åpnet siden 4. oktober 2026, viste oppføringen i den tyske butikken 4,3 stjerner fra 295 anmeldelser og mer enn 50 000 nedlastinger, og det er bare Google Plays tall, mens stjernetallet varierer fra land til land. Å bruke Subtext koster penger, og noen få analyser er gratis for å komme i gang. Et innspilt talenotat kommer tilbake som en melding du kan sende.

Hvordan svarer du på en lang talemelding noen har sendt deg?

Subtext leser også talemeldingene andre sender deg, og dette er siden der en vanlig transkripsjon kommer nærmest å være nok. Transkripsjonen på enheten i WhatsApp lar deg lese et opptak på to minutter der språket ditt er dekket23. Det den ikke gjør, er å fortelle deg hva personen vil ha. Ulm-studiens eget eksempel var en dato og et sted gjemt i lyden9. Et langt talenotat fra en venn eller en sjef har samme form, med spørsmålet et sted midt i og begrunnelsene rundt. For folk som stopper opp på svar, er lesesteget ett av fem steder et svar setter seg fast, og de fleste av feltdeltakerne i Ulm utsatte talemeldinger på jobb fordi et opptak ikke kan tas inn med et blikk9.

Slipp en mottatt talemelding inn i Subtext, så transkriberer den den, oppsummerer i én linje hva personen vil ha fra deg, og legger til to til fem handlingspunkter. Den kan så skrive et utkast til svar som tar opp tråden, og den setter ikke etikett på avsenderens tone. Backend-promptene behandler en lydfil du legger ved som mest sannsynlig sendt til deg av den andre personen, og hvis modellen er usikker på hvem som er hvem, har den beskjed om å spørre. Sammendraget er bare så godt som transkripsjonen under, og én linje er vanskelig å tolke uten sammenhengen, slik hva betyr denne teksten viser. For en sterk aksent eller et støyfylt opptak vil transkripsjonen ha flere feil enn for engelsk fra et studio, så spill av originalen før du svarer på noe som betyr noe. Tekst og skjermbilder går gjennom det samme sammendragssteget, så en melding du mottok får den samme oppsummeringen på én linje.

De nærmeste eksperimentene er gamle og små

De to eksperimentene jeg fant som kommer nærmest et omskrivingssteg eller et sammendrag, er fra 2003 og 2005, og begge er små. I 2003 lot et DARPA-finansiert eksperiment 28 personer med engelsk som morsmål lese passasjer på 150 til 250 ord med telefon- og kringkastingstale, som ordrette transkripsjoner og som tekst renset for hånd. Leserne vurderte den rensede teksten som lettere å forstå, men de svarte ikke mer presist eller raskere på spørsmål om den, noe forfatterne tilskriver at leserne allerede skåret nær toppen. Automatisk rensing av ufullkommen utdata fra en gjenkjenner ble tendensielt vurdert som vanskeligere enn den urensede versjonen, men bare marginalt26. Rensingen fjernet disfluenser og rettet tegnsettingen, men skrev ikke teksten om til en melding.

I 2005 besvarte 16 personer spørsmål om 15 talepostmeldinger ut fra automatisk uttrukne sammendrag. Sammendrag bygget på gjenkjent tale fikk anroperens navn riktig 57 prosent av gangene mot 94 prosent for sammendrag bygget på menneskelige transkripsjoner, mens grunnen til anropet kom like godt fram, med 78 prosent. Folk ba om originallyden oftere når sammendraget kom fra gjenkjent tale, 53 prosent av gangene mot 30 prosent27. Det var ekstraktive sammendrag av talepost laget med talegjenkjenning fra 2005, så studien setter bare en forventning. Ingen av studiene målte en melding noen ville ha sendt.

Der belegget stopper

Det sterke belegget ligger i de to endene. Talespråk bærer disfluens i en målt rate som skrift ikke gjør, og talegjenkjenning gjør flere feil for noen talere enn for andre, med tallene ovenfor som bevis. Midten er tynnere. Jeg fant ingen studie som målte hvor mye bedre et omskrevet talenotat lander enn en rå transkripsjon, eller hvor ofte en omskriving endrer meningen på veien. Forskningen på talemeldinger er en håndfull studier, den største med et undersøkelsesutvalg trukket fra en amerikansk plattform for crowdworkere, og en feltstudie på seks. YouGov-målingen gjelder ett land og ett år. Og talenotatstudiene er eldre enn transkripsjoner på enheten, så forskyvningen av innsats de beskriver, er nå delvis lukket av meldingsappene selv.

I praksis kommer det an på hvordan du snakker. Snakker du i rene setninger, er diktering nok, og telefonen din har den allerede. Snakker du slik talerne i disse korpusene gjorde, med fyllordene Clark og Fox Tree telte og omstartene Shriberg katalogiserte, gir en transkripsjon mottakeren utkastprosessen din, og et omskrivingssteg er det som gjør den til en melding. Subtext er én app som gjør det steget, for talenotatet du tar opp og det du mottok, og hvis problemet ditt er et svar du stadig redigerer, handler hvorfor et kort svar tar en time om den løkken. Prøv Subtext i nettleserenPrøv Subtext i nettleseren

Kilder

Nummerert i den rekkefølgen de først forekommer. Sidene ble sjekket 4. og 5. oktober 2026, og personvernerklæringen til Subtext ble åpnet på nytt 10. oktober 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 til 169. Korpusstudie av amerikansk engelsk samtale; rater og typer av disfluens.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferanseartikkel; PDF-en har ikke noe årstall, og de siterte referansene går til 1996. Korpus merket for hånd med 40 515 ord fra 30 talere (Switchboard) og 12 762 ord fra 523 talere (AMEX, samtaler mellom SRI-ansatte og reisebyråer). Finansiert av DARPA og NSF. . Sjekket 5. oktober 2026.
  3. Clark, H. H., og Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 til 111. Fyllordrater per taler fra London-Lund-korpuset.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., og Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 til 7689. Fem kommersielle systemer, 42 hvite og 73 svarte talere, 19,8 timer lyd.
  5. Graham, C., og Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Bare sammendrag; fulltekst var ikke tilgjengelig da jeg sjekket.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., og Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-forhåndsutgivelse.
  7. OpenAI. Whisper README. GitHub. . Sjekket 4. oktober 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., og Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13 140 lydsegmenter fra 437 deltakere tatt opp ved amerikanske institusjoner, med og uten afasi, kjørt gjennom Whisper-API-et i april og mai 2023. Finansiert av Pulitzer Center og Cornells Center for Social Sciences.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., og Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Undersøkelse av 1 003 personer og en feltstudie over to uker med 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., og Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publisert desember 2017. Laboratoriestudie med 48 universitetsstudenter, 24 per språk, som skrev av fraser på en iPhone. To forfattere jobbet for Baidu USA, hvis talesystem på tjenersiden, Deep Speech 2, kjørte på en Baidu-tjener og ble testet gjennom en app på en iPhone 6 Plus.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 studier, 18 573 deltakere.
  12. Yuan, J., Liberman, M., og Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard-telefonsamtaler.
  13. YouGov. How many Britons like voice notes? 14. juni 2022. Måling av 2 149 voksne briter, feltarbeid 5. og 6. mai 2022, 1 956 av dem smarttelefonbrukere; lengdetallene er andeler av respondentene som ga et svar. Resultattabeller på . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Sjekket 4. og 5. oktober 2026. Prosentene følger YouGovs artikkeltekst; resultattabellene gir litt andre totaler for misliker, på grunn av avrunding.
  14. Sampietro, A., og König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 til 71. Tyske og spanske WhatsApp-samtaler; sammendraget lest gjennom utgiverens Crossref-oppføring, fulltekst bak betalingsmur.
  15. Apple. Dictate text on iPhone. Brukerhåndbok for iPhone, iOS 27. . Sjekket 4. oktober 2026.
  16. Apple. Siri, Dictation & Privacy. Juridisk, sist oppdatert 14. september 2026. . Sjekket 5. oktober 2026.
  17. Google. Type with your voice. Hjelp for Gboard. . Sjekket 4. oktober 2026.
  18. Google. Use advanced voice typing features. Hjelp for Gboard. . Sjekket 5. oktober 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Sjekket 5. oktober 2026.
  20. Otter.ai. Convert Speech to Text. . Sjekket 4. oktober 2026.
  21. Otter.ai. Supported languages. Otter Help Center, artikkel redigert 6. mai 2026. . Sjekket 5. oktober 2026.
  22. MacWhisper. Homepage. Markedsføringsside uten dato, så den viser hva produktet reklamerer med og ikke hvordan det presterer. . Sjekket 5. oktober 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21. november 2024. . Sjekket 4. oktober 2026.
  24. Subtext, Vilkår, personvern og kontoen din. Personvernerklæringen sist oppdatert 26. juli 2026. Sjekket 10. oktober 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Sjekket 4. oktober 2026; oppføringen viste 295 anmeldelser og 50 000+ nedlastinger i hver butikk jeg åpnet, og 4,3 stjerner i den tyske.
  26. Jones, D. A., og seks medforfattere (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 til 1588. 32 personer med engelsk som morsmål rekruttert, 28 analysert. Sponset av DARPA under Air Force-kontrakt F19628-00-C-0002.
  27. Koumpis, K., og Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Forståelsestest med 16 deltakere og 15 talepostmeldinger; tallene er lest fra PDF-en som forfatterne selv har lagt ut. Finansiert av en EPSRC ROPA-tildeling, GR/R23954.