ArtiklarSkrivverktyg
Varför en transkription av en röstanteckning inte är ett sms
Vanlig diktering gör en röstanteckning till text men behåller oftast utfyllnadsord, omstarter och den ordning du kom på sakerna i. Vad forskningen säger, och vad ett omskrivningssteg tillför.
Av Samet Durgun · Medgrundare av Subtext · 18 min läsning
· Uppdaterad 10 oktober 2026
Tal innehåller utfyllnadsljud, felstarter och rättelser mitt i meningen som färdig text oftast saknar, så en vanlig transkription av en röstanteckning är ännu inget meddelande. Telefoner skriver ut det du sa, och det gör Otter, WhatsApps transkriptioner och appar byggda på öppna talmodeller också, men en transkription av en långrandig röstanteckning är fortfarande ett långrandigt meddelande. Den behåller ”öh”, rättelsen du gjorde halvvägs och den ordning du råkade komma på sakerna i. En app som gör en röstanteckning till ett tydligt textmeddelande har ett andra jobb efter transkriptionen. Den måste förstå vad du menade och skriva det.
Första halvan är forskning. Språkforskare har mätt hur talat språk skiljer sig från skrivet, forskare inom taligenkänning har mätt var transkription brister och för vem, och några studier har frågat varför folk skickar röstanteckningar och varför mottagare skjuter upp dem. Andra halvan handlar om vad de dikteringsverktyg som folk redan äger gör, vad ett omskrivningssteg tillför och vad Subtext gör med en röstanteckning.
Som medgrundare av Subtext, där röst är ett av tre sätt att komma in, vid sidan av ett skrivet utkast och en skärmdump av en konversation, har jag ett intresse av svaret. Varje källa nedan är en jag har öppnat. Där jag bara kom åt ett abstrakt säger jag det och citerar ingen siffra ur det.
Tal skapas på ett annat sätt än skrift
Spontant tal är fullt av material som skrift lämnar utanför. Elizabeth Shriberg har i en översikt över disfluens i flera korpusar med spontant amerikanskt engelskt tal kommit fram till att andelen ligger på upp till tio procent av orden och över en tredjedel av yttrandena1. Formerna är fyllda pauser (”uh”, ”um”), upprepningar (”I I think”), rättelser där ett ord byts ut mitt i en mening och felstarter, som hon för under borttagningar, där en sats överges och påbörjas på nytt. I de två korpusarna med samtal mellan människor som hon undersökte, informella telefonsamtal och samtal om reseplanering, låg andelen per ord på omkring sex procent1, i urval om 40 515 och 12 762 ord som hennes SRI-artikel om samma korpusar handmärkte2. I en korpus där människor talade med en dator via en knapp som man håller in för att tala föll andelen till under en procent, och hon tillskriver en del av nedgången knappen. Talarna kunde planera yttrandet först och sedan spela in det1. I en röstanteckning trycker du en gång och pratar, och planeringen sker högt.
Utfyllnadsljud i tal och hur mycket talare skiljer sig åt
Utfyllnadsljud i tal är inte brus, vilket är en del av varför de är svåra att ta bort. Herbert Clark och Jean Fox Tree argumenterade utifrån flera stora korpusar för att ”uh” och ”um” är egna ord, planerade och producerade som alla andra, som används för att annonsera en kort eller lång fördröjning medan talaren söker nästa ord eller bestämmer vad hen ska säga3. De varierar också enormt mellan talare. I London-Lund-korpusen, omkring 170 000 ord från 50 brittiska samtal ansikte mot ansikte inspelade mellan 1961 och 1976, mest bland akademiker, låg de 65 talare som producerade över 1 000 ord vardera mellan 1,2 och 88,5 utfyllnadsljud per 1 000 ord, med medianen 17,33. Vissa transkriptioner blir nästan rena, andra har ett utfyllnadsljud var tolfte ord.
Disfluens samlas också där planeringen är tyngst. Shriberg noterar, med hänvisning till tidigare arbete, att den är mer sannolik tidigt i en fras1. I en röstanteckning är det inledningen, där du fortfarande avgör vad meddelandet ska vara till för. I skrift kan du radera den inledningen innan någon ser den. I en röstanteckning följer den oftast med om du inte spelar in hela meddelandet på nytt.
Hur taligenkänningens fel skiljer sig mellan talare
Transkriptionen lägger till egna fel ovanpå dem du talade. Den tydligaste mätningen jag hittade är en studie i PNAS från 2020 som körde fem kommersiella taligenkänningssystem, från Amazon, Apple, Google, IBM och Microsoft, över 19,8 timmar intervjuljud från 42 vita och 73 svarta amerikanska talare4. Den genomsnittliga ordfelsfrekvensen var 0,19 för vita talare och 0,35 för svarta talare, och varje system visade gapet. Det bästa systemet, Microsoft, fick 0,15 och 0,27. Det sämsta, Apple, fick 0,23 och 0,45. Mer än 20 procent av de svarta talarnas klipp kom tillbaka med minst hälften av orden fel, mot färre än 2 procent av de vita talarnas klipp4. Författarna spårade gapet till de akustiska modellerna, den del som kopplar ljud till ord, och pekar på att träningsdata innehåller för lite ljud från svarta talare.
Ett andra mönster i samma artikel spelar roll för röstanteckningar. Systemen presterade något sämre för manliga talare, vilket författarna tillskriver en mer informell stil med kortare, mer reducerade uttal och fler disfluenser4, registret i en röstanteckning till en vän.
Accenter, andraspråk och ord som ingen sa
Taligenkänning presterar också sämre på accenter och tal på andraspråk. En artikel från 2024 i JASA Express Letters testade OpenAI:s modell Whisper över engelska accenter och rapporterade högre träffsäkerhet för modersmålstalare än för talare med engelska som andraspråk, bättre resultat för amerikansk engelska än för brittisk eller australisk, och bättre resultat på uppläst tal än på samtal5. Jag kom bara åt abstraktet, så jag anger riktningen och ingen siffra. Whisper tränades på 680 000 timmar ljud, och dess upphovsmän beskriver modellerna som att de närmar sig mänsklig ”accuracy and robustness”6. Dess egen dokumentation tillägger att ”performance varies widely depending on the language”7. Ett genomsnitt över talare säger lite om en trött röstanteckning på ditt andraspråk. Är det språket engelska kan ett korrekt meddelande ändå läsas som abrupt av en modersmålsläsare, och en transkription säger inte det.
Whisper kan också lägga till ord som ingen sa. En studie från 2024 körde 13 140 korta engelska klipp från 437 deltagare inspelade vid amerikanska institutioner, med och utan afasi, genom OpenAI:s molnbaserade Whisper-API i april och maj 2023. Ungefär en procent av transkriptionerna innehöll hela fraser eller meningar som inte fanns i ljudet, och 38 procent av dem innehöll minst en uttryckligt skadlig formulering, som våld eller ett falskt påstående om auktoritet. Klipp med långa pauser löpte större risk. På de 187 klipp där Whisper hade hittat på text gav Google, Amazon, Microsoft, AssemblyAI och RevAI inga jämförbara påhitt. Klippen var intervjuer, inte röstanteckningar, och studien testade API:et som det var 20238.
Varför folk skickar röstanteckningar
Folk skickar röstanteckningar för att de går fort för avsändaren. Den största studie jag hittade kommer från Ulms universitet, en enkät från 2020 med 1 003 personer rekryterade via Amazon Mechanical Turk, mest i USA, plus en fältstudie på två veckor med sex flitiga användare9. I enkäten hade 83 procent tagit emot ett röstmeddelande och 73 procent hade skickat ett. Skälen till att skicka, hämtade från 735 öppna svar av personer som hade spelat in ett röstmeddelande, sorterades i fyra teman. Antalet per tema blir fler än de 735 svaren, så vissa svar föll under mer än ett tema. Bekvämlighet, eftersom det går fortare att prata än att skriva på en telefon, nämndes 359 gånger. Tonen och känslan som en röst förmedlar och text tappar, 229. Situationer där det är krångligt eller osäkert att skriva, som när man kör bil, 203. Och mottagaren, som hade bett om röst eller tyckte det var enklare, 34.
En labbstudie mätte hastigheten. Dess 48 universitetsstudenter, 24 av dem med engelska som modersmål, skrev av korta fraser på en iPhone, och talinmatning på engelska gick i 153 ord i minuten mot 52 på tangentbordet, 2,93 gånger snabbare, men tal lämnade något fler orättade fel i den slutliga texten, 0,55 procent mot 0,35 procent. Uppgiften var att skriva av givna fraser, vilket säger lite om att formulera ett meddelande. Två av författarna arbetade för Baidu, vars serversidiga igenkännare, Deep Speech 2, testades genom en app på iPhone 6 Plus, i en artikel publicerad 201710.
Röstanteckningar flyttar arbetet från avsändaren till mottagaren
I fältstudien från Ulm varierade de 438 röstmeddelanden som loggades under två veckor från 1,5 sekunder till drygt sju minuter, med medianen 17,5 sekunder9. Författarna pekar också på en kostnad som betalas innan någon mottagare hör något. Ljud är flyktigt, så en inspelning är besvärlig att gå igenom och redigera, och ett felsägande betyder att hela meddelandet spelas in på nytt9. Fem av de tolv avbrutna inspelningarna i deras fältstudie var just det.
Författarna skriver att röstmeddelanden ”shift the effort necessary for communication towards the receiver”9. Att formulera går fort, att hämta ut innehållet tar mer tid och kraft än att läsa en text med samma innehåll, och de flesta av deras fältdeltagare sköt upp röstmeddelanden på jobbet eftersom en text går att ta in med en blick och en inspelning inte. Deras föreslagna lösning, 2020, var automatiska transkriptioner, så att datum och plats för en tid som låg gömda i en inspelning kunde hittas genom att skumma.
Varför mottagare skjuter upp dem
Mottagare kan inte skumma, så de går tillbaka över det de hörde. I samma fältstudie spelade folk upp ett mottaget röstmeddelande i genomsnitt 1,37 gånger, och ett meddelande spelades upp 13 gånger9. Läsning kräver ingen omspelning. En metaanalys från 2019 av 190 studier med 18 573 deltagare sätter genomsnittet för tyst läsning av engelsk sakprosa till 238 ord i minuten11. Samtalstal går i omkring 196 ord i minuten om man räknar hela samtalet och omkring 164 inom talarens egna turer, i en stor telefonkorpus12. Läsaren styr också tempot och kan hoppa till frågan. Lyssnaren får orden i talarens takt och i talarens ordning.
Folk är inte förtjusta i dem, och lite mer förtjusta i att ta emot än i att skicka. En YouGov-undersökning av 2 149 vuxna britter, genomförd 5 och 6 maj 2022 och publicerad i juni samma år, ställde frågor om röstanteckningar till de smartphoneanvändare som ingick, 1 956 personer. Av dem tyckte 16 procent om att skicka dem och 36 procent tyckte inte om att skicka dem. När det gällde att ta emot dem tyckte 22 procent om det, 25 procent inte och 29 procent var kluvna13. Bara bland 18 till 24-åringar var det fler som gillade att ta emot dem än som ogillade det, 43 mot 28 procent, och även i den gruppen ogillade hälften att skicka mot 30 procent som gillade det. Av alla smartphoneanvändare hade 63 procent aldrig skickat en.
Hur lång är för lång för en röstanteckning?
I en YouGov-undersökning från maj 2022 av brittiska smartphoneanvändare sa 65 procent av dem som svarade att en röstanteckning på en minut är för lång, och bland dem som inte gillar att ta emot dem och som svarade var 57 procent frustrerade över 30 sekunder. Bland alla smartphoneanvändare visste 27 procent inte var gränsen gick. På frågan hur de helst tog emot ett långt meddelande valde 78 procent text och 14 procent en röstanteckning, vilket bara visar en uttryckt preferens13. Vissa avsändare verkar veta att inspelningen är en belastning för mottagaren. En analys från 2024 av WhatsApp-chattar i Tyskland och Spanien visade att folk redogjorde för sitt val av ljud före, i och efter meddelandet, och författarna beskriver de redogörelserna som socialt arbete, bland annat genom att rama in röstanteckningen som något man bör be om ursäkt för14. I de tre källorna sparar avsändaren kraft och mottagaren betalar för det, och en del avsändare ber om ursäkt för det.
Vad Apples diktering gör med en röstanteckning
Diktering ger dig orden i den ordning du sa dem, och för Apples diktering är det hela uppdraget. Apples användarhandbok för iPhone med iOS 27 beskriver diktering som bearbetad på telefonen utan internetanslutning, på många språk, och att den automatiskt sätter in kommatecken, punkter och frågetecken där språket stöds15. På de nyaste telefonerna förbättrar en modell på enheten stavning, skiljetecken och versaler, på engelska. Allt annat är ett talat kommando. Du säger ”new line”, du säger ”delete” följt av frasen. Påståendet om bearbetning på enheten har ett villkor. Apples integritetssida säger att om inställningarna för Tangentbord inte visar att diktering bearbetas på enheten skickas det du dikterar till Apples servrar och lagras inte om du inte väljer att delta i Förbättra Siri och diktering. Den säger också att Apple kan spara förfrågningshistorik och transkriptioner, kopplade till en slumpmässig enhetsidentifierare och inte till ditt Apple-konto, i upp till två år16. Sidan säger inte hur de två hänger ihop. Omskrivning är jobbet för Apples separata Skrivverktyg, som ger ingen läsning av hur en text landar.
Vad Googles och Microsofts röstinmatning gör
Googles grundläggande voice typing i Gboard ger dig, precis som Apples diktering, orden som du sa dem. Tryck på mikrofonen, säg vad du vill ha skrivet och säg skiljetecknen, även om voice typing och skiljetecken inte finns på alla språk17. Dess advanced voice typing, på Pixel 6 och senare, lägger till skiljetecken medan du talar, och på Pixel 9 (utom 9a) och senare kan ett talat kommando korrekturläsa, formulera om, förkorta eller förlänga det du dikterade. Google säger att detta körs på enheten, på engelska, franska, italienska, japanska och spanska, med tyska på väg18. På Windows säger Microsofts hjälpsida att Fluid dictation, en funktion för Copilot+ PC, rättar grammatik, skiljetecken och utfyllnadsord medan du talar19. Advanced voice typing skriver bara om när du ger ett talat kommando. Fluid dictation körs utan kommando, men bara på Copilot+ PC, och dess hjälpsida nämner inte att meddelandet ordnas om. I de hjälpsidor från Apple, Google och Microsoft som jag hänvisar till här hittade jag ingen funktion som i grundläget gör en hel långrandig röstanteckning till ett meddelande som går att skicka.
Vad transkriptionsappar och chattappar gör
Otter, en transkriptionsapp, går ett steg längre än ett telefontangentbord. Dess sida om tal till text beskriver en transkription med talaretiketter och tidsstämplar, en automatiskt genererad sammanfattning med höjdpunkter och utdragna nyckelpunkter och åtgärdspunkter20. Otters hjälpcenter listar engelska, spanska, franska, tyska, japanska och kinesiska (förenklad) som språk som stöds21, vilket är fler än sidan om tal till text anger. Den är byggd för möten, så den kondenserar det som sades, och jag hittade ingen funktion på de två sidorna som skriver ett utkast av det du menade att skicka. Öppna talmodeller ligger under en del appar. Whisper producerar själv en transkription och en språkangivelse7. Apparna som bygger på den varierar. MacWhisper marknadsför borttagning av utfyllnadsord, sammanfattningar och egna prompter ovanpå transkriptionen och erbjuder lokala eller molnbaserade modeller för det steget22.
Chattapparna har börjat transkribera röstanteckningarna du får. WhatsApp lade till transkriptioner av röstmeddelanden i november 2024, genererade på enheten så att WhatsApp självt inte kan läsa dem, påslagna under Inställningar och Chattar och startade med ett långt tryck på meddelandet23. Inlägget säger att transkriptionerna började på några utvalda språk, och jag kunde inte bekräfta den nuvarande listan. Det svarar på skumningsproblemet som författarna från Ulm pekade ut, där språket täcks. Det du får är en transkription av någon annans tänkande högt. Du kan läsa den under ett möte, men du måste fortfarande skriva svaret.
Vad ett omskrivningssteg tillför
Ett omskrivningssteg gör transkriptionen till det meddelande du hade skrivit om det inte kostat något att skriva. Det tar bort utfyllnadsljuden som Clark och Fox Tree beskriver, slår ihop upprepningarna och felstarterna i Shribergs indelning, och lägger rättelsen du gjorde halvvägs där den hör hemma, så att den ersätter det den rättade. Det ordnar också om. Talade förklaringar tenderar att komma i den ordning de föll dig in, sammanhanget först och önskemålet sist, eller önskemålet först och skälen släpande efter. Ett skrivet meddelande kan inleda med poängen.
Två saker måste steget lämna orörda. Den första är innebörden. En omskrivning som jämnar ut din röstanteckning till en annan begäran är sämre än transkriptionen, eftersom transkriptionen åtminstone sa det du sa. Den andra är tonen. Var du varm, rak eller skämtade ska den skrivna versionen vara samma person. Det som kan gå fel här är det som behandlas i får AI dina sms att låta som en robot, där en omskrivning kommer tillbaka artig och generisk.
Det finns också en bedömning som en transkription aldrig behöver göra. En del av det du sa i en röstanteckning var till dig, inte till mottagaren. Att fundera högt över om du ska ta upp något betyder inte att du tänkte ta upp det. Ett omskrivningssteg måste avgöra vad som var meddelandet och vad som var utkastet, och det beslutet kan gå fel åt båda hållen, genom att behålla en mening du var på väg att prata dig ur eller genom att stryka en du menade. Jag hittade ingen studie som mätt hur ofta det händer med något verktyg, Subtext inräknat.
Vad Subtext gör med en röstanteckning
Subtext transkriberar röstanteckningen du spelar in i appen, skriver sedan meddelandet utifrån vad du menade och ger tillbaka upp till tre versioner, var och en med en poäng för tryggt att skicka som visar hur sannolikt det är att den landar som du menade. Versionerna är byggda för att behålla din innebörd och din personlighet. På ett första utkast ligger en nära dina ord med problemen rättade, en är en varmare putsning eller ett annat angreppssätt, och en är en fullare omskrivning. Om formuleringen läses kallare eller skarpare än du tänkt sätter appen namn på problemet och markerar orden som orsakar det. Inget skickas åt dig.
Modellens instruktioner täcker transkriptionsartefakter, och jag läste backend-prompterna innan jag skrev det här. När ett meddelande flaggas som dikterat får modellen veta att den ska räkna med felhörda eller hopsmälta ord, märklig interpunktion och lösryckta utfyllnadsord, läsa igenom dem till den avsedda formuleringen och rätta dem i tysthet, utan att flagga dem som något du gjort fel. Prompten visar vad modellen ska göra. Jag hittade ingen oberoende utvärdering av Subtexts rösttranskription eller omskrivning, så allt det här vilar på det appen visar och på vad dess prompter och integritetspolicy säger. Eftersom ingen av studierna ovan testade Deepgram, talmodellen som transkriberar Subtexts ljud, kan jag inte säga hur långt felmönstren för accenter, tal på andraspråk och vardaglig stil gäller för den, så läs meddelandet en gång till innan du skickar det.
Vad händer med en röstinspelning i Subtext?
Subtext skickar en röstinspelning till Deepgram för transkription, så ljudet lämnar telefonen. Integritetspolicyn, uppdaterad 26 juli 2026, namnger flera leverantörer, bland dem Deepgram för röstinspelningar, Anthropic för text, bilder och rösttranskriptioner, Google Firebase för konton och konversationer, och OpenAI bara om du slår på uppläsning. Policyn tillägger att när webbsökning är på går sökord hämtade ur din förfrågan via Anthropic till sökleverantörer från tredje part, och att du kan stänga av webbsökning i appens inställningar24. Den säger att inget du skickar in används för att träna en AI-modell och att ingen av dess AI-leverantörer får träna på det, och att Subtext dessutom har aktiverat Deepgrams avanmälan från modellförbättring för röst. Den säger att Subtext raderar sin egen kopia av en konversation från sina servrar fem dagar efter att du senast använde den, eller 90 dagar om du fäster den. Den säger att Deepgram, med den avanmälan satt, behåller ljud bara så länge det tar att transkribera det, och att Anthropic raderar indata och utdata inom 30 dagar och kan behålla flaggade förfrågningar i upp till två år och tillhörande säkerhetspoäng i upp till sju år. Den säger att Subtext inte har någon överenskommelse om noll lagring med någon av dem24. Hur andra assistenter hanterar din text jämförs i vilka AI-skrivassistenter som tränar på dina meddelanden.
Vilka språk stöder Subtext?
Subtext skriver meddelandet på det språk du pratade, på 17+ språk, och behåller den formalitetsnivå du använde där språket markerar en sådan. En röstanteckning på tyska kommer tillbaka som ett tyskt meddelande. Sammanfattningen av en röstanteckning du fått skrivs på det språk den kom på. Google Plays redaktion lyfte fram det här flödet i en ”Hot Tip” som beskriver hur man trycker på mikrofonikonen, talar, trycker igen och får ett förfinat meddelande med taggar om hur originalet kom över och en kopieringsknapp25. När jag öppnade sidan den 4 oktober 2026 visade annonsen i den tyska butiken 4,3 stjärnor från 295 recensioner och över 50 000 nedladdningar, en räkning bara för Google Play, och stjärnbetyget skiljer sig mellan länder. Subtext kostar pengar, och några analyser är gratis att börja med. En inspelad röstanteckning kommer tillbaka som ett meddelande du kan skicka.
Hur svarar du på ett långt röstmeddelande som någon skickat dig?
Subtext läser också de röstmeddelanden som andra skickar dig, och här kommer en vanlig transkription närmast att räcka. WhatsApps transkription på enheten låter dig läsa en inspelning på två minuter där ditt språk täcks23. Vad den inte gör är att tala om vad personen vill. Ulm-studiens eget exempel var ett datum och en plats gömda i ljudet9. En lång röstanteckning från en vän eller en chef har samma form, frågan någonstans i mitten och skälen runt omkring. För den som fastnar på svar är läsningen ett av fem ställen där ett svar kan fastna, och de flesta av Ulms fältdeltagare sköt upp röstmeddelanden på jobbet eftersom en inspelning inte går att ta in med en blick9.
Släpp in ett mottaget röstmeddelande i Subtext så transkriberar den det, sammanfattar på en rad vad personen vill ha av dig och lägger till två till fem åtgärdspunkter. Den kan sedan skriva ett svarsförslag som tar upp tråden, och den sätter ingen etikett på avsändarens ton. Backend-prompterna behandlar en röstfil du bifogar som troligast skickad till dig av den andra personen, och är modellen osäker på vem som är vem ska den fråga. Sammanfattningen är bara så bra som transkriptionen under den, och en rad är svår att läsa utan sitt sammanhang, vilket vad betyder det här sms:et visar. För en stark accent eller en bullrig inspelning får transkriptionen fler fel än för engelska inspelad i studio, så spela upp originalet innan du svarar på något som spelar roll. Text och skärmdumpar går genom samma sammanfattningssteg, så ett meddelande du fått får samma sammanfattning på en rad.
De närmaste experimenten är gamla och små
De två närmaste experimenten jag hittade till ett omskrivningssteg eller en sammanfattning är från 2003 och 2005, och båda är små. 2003 lät ett DARPA-finansierat experiment 28 personer med engelska som modersmål läsa textstycken om 150 till 250 ord av telefon- och sändningstal, som ordagranna transkriptioner och som handrensade. Läsarna bedömde den rensade texten som lättare att förstå, men de svarade inte mer exakt eller snabbare på frågor om den, vilket författarna förklarar med att läsarna redan låg nära taket. Automatisk rensning av ofullkomliga utdata från en igenkännare tenderade att bedömas som svårare än den orensade versionen, men bara marginellt26. Rensningen tog bort disfluenser och rättade skiljetecken men skrev inte om texten till ett meddelande.
2005 besvarade 16 personer frågor om 15 röstbrevlådemeddelanden utifrån automatiskt utdragna sammanfattningar. Sammanfattningar byggda på igenkänt tal fick rätt på uppringarens namn 57 procent av gångerna mot 94 procent för sammanfattningar byggda på mänskliga transkriptioner, medan skälet till samtalet kom fram lika bra, 78 procent. Folk bad om originalljudet oftare när sammanfattningen kom från igenkänt tal, 53 procent av gångerna mot 30 procent27. Det var extraktiva sammanfattningar av röstbrevlådemeddelanden gjorda med taligenkänning från 2005, så studien sätter bara en förväntan. Ingen av studierna mätte ett meddelande som någon skulle skicka.
Där beläggen tar slut
De starka beläggen finns i de två ändarna. Talat språk bär disfluens i en uppmätt takt som skrift inte gör, och taligenkänning gör fler fel för vissa talare än för andra, med siffrorna ovan som stöd. Mitten är tunnare. Jag hittade ingen studie som mätt hur mycket bättre en omskriven röstanteckning landar än en rå transkription, eller hur ofta en omskrivning ändrar innebörden på vägen. Forskningen om röstmeddelanden är en handfull studier, den största med ett enkätunderlag hämtat från en amerikansk plattform för crowdwork och en fältstudie på sex personer. YouGov-undersökningen gäller ett land och ett år. Och studierna om röstanteckningar kom före transkriptioner på enheten, så den förskjutning av arbete de beskriver är nu delvis undanröjd av chattapparna själva.
I praktiken handlar det om hur du pratar. Pratar du i rena meningar räcker diktering, och din telefon har den redan. Pratar du som talarna i de korpusarna, med utfyllnadsljuden som Clark och Fox Tree räknade och omstarterna som Shriberg katalogiserade, ger en transkription mottagaren din skrivprocess, och ett omskrivningssteg är det som gör den till ett meddelande. Subtext är en app som gör det steget, för röstanteckningen du spelar in och för den du fått, och är ditt problem ett svar du hela tiden redigerar, handlar varför ett kort svar tar en timme om den loopen. Prova Subtext i webbläsarenSkanna den med mobilkameran för att installera.Prova Subtext i webbläsaren
Källor
Numrerade i den ordning de först förekommer. Sidorna kontrollerades 4 och 5 oktober 2026, och Subtexts integritetspolicy öppnades på nytt 10 oktober 2026.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 till 169. Korpusstudie av amerikanskt engelskt samtal; andelar och typer av disfluens.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferensartikel; PDF-filen saknar årtal och dess citerade referenser går till 1996. Handmärkta korpusar om 40 515 ord från 30 talare (Switchboard) och 12 762 ord från 523 talare (AMEX, samtal mellan SRI-anställda och reseagenter). Finansierad av DARPA och NSF. . Kontrollerad 5 oktober 2026.
- Clark, H. H., och Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 till 111. Andel utfyllnadsljud per talare från London-Lund-korpusen.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., och Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 till 7689. Fem kommersiella system, 42 vita och 73 svarta talare, 19,8 timmar ljud.
- Graham, C., och Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Enbart abstrakt; fulltexten gick inte att nå när jag kontrollerade.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., och Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-preprint.
- OpenAI. Whisper README. GitHub. . Kontrollerad 4 oktober 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., och Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13 140 ljudsegment från 437 deltagare inspelade vid amerikanska institutioner, med och utan afasi, körda genom Whisper-API:et i april och maj 2023. Finansierad av Pulitzer Center och Cornells Center for Social Sciences.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., och Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Enkät med 1 003 personer och en fältstudie på två veckor med 6.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., och Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Publicerad december 2017. Labbstudie med 48 universitetsstudenter, 24 per språk, som skrev av fraser på en iPhone. Två av författarna arbetade för Baidu USA, vars serversidiga talsystem, Deep Speech 2, kördes på en Baidu-server och testades genom en app på iPhone 6 Plus.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 studier, 18 573 deltagare.
- Yuan, J., Liberman, M., och Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Telefonsamtal i Switchboard.
- YouGov. How many Britons like voice notes? 14 juni 2022. Undersökning av 2 149 vuxna britter, fältarbete 5 och 6 maj 2022, 1 956 av dem smartphoneanvändare; längdsiffrorna är andelar av de svarande som gav ett svar. Resultattabeller på . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Kontrollerad 4 och 5 oktober 2026. Procentsatserna följer YouGovs artikeltext; resultattabellerna ger något andra summor för ogillande, på grund av avrundning.
- Sampietro, A., och König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 till 71. Tyska och spanska WhatsApp-chattar; abstraktet läst via förlagets Crossref-post, fulltexten ligger bakom betalvägg.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Kontrollerad 4 oktober 2026.
- Apple. Siri, Dictation & Privacy. Legal, senast uppdaterad 14 september 2026. . Kontrollerad 5 oktober 2026.
- Google. Type with your voice. Gboard Help. . Kontrollerad 4 oktober 2026.
- Google. Use advanced voice typing features. Gboard Help. . Kontrollerad 5 oktober 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Kontrollerad 5 oktober 2026.
- Otter.ai. Convert Speech to Text. . Kontrollerad 4 oktober 2026.
- Otter.ai. Supported languages. Otter Help Center, artikel redigerad 6 maj 2026. . Kontrollerad 5 oktober 2026.
- MacWhisper. Homepage. Marknadsföringssida utan datum, så den visar vad produkten marknadsför och inte hur den presterar. . Kontrollerad 5 oktober 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 november 2024. . Kontrollerad 4 oktober 2026.
- Subtext, Villkor, integritet och ditt konto. Integritetspolicy senast uppdaterad 26 juli 2026. Kontrollerad 10 oktober 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Kontrollerad 4 oktober 2026; annonsen visade 295 recensioner och över 50 000 nedladdningar i varje butik jag öppnade, och 4,3 stjärnor i den tyska.
- Jones, D. A., och sex medförfattare (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 till 1588. 32 personer med engelska som modersmål rekryterades, 28 analyserades. Sponsrad av DARPA under flygvapnets kontrakt F19628-00-C-0002.
- Koumpis, K., och Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Förståelsetest med 16 deltagare och 15 röstbrevlådemeddelanden; siffrorna lästa ur den PDF som författarna själva lagt ut. Finansierad av ett EPSRC ROPA-anslag, GR/R23954.