ArtikkelitKirjoitustyökalut

Miksi ääniviestin litteraatti ei ole tekstiviesti

Pelkkä sanelu muuttaa ääniviestin tekstiksi mutta säilyttää helposti täytesanat, uudelleenaloitukset ja sen järjestyksen, jossa asiat tulivat mieleesi. Mitä tutkimus kertoo ja mitä uudelleenkirjoitusvaihe lisää.

Kirjoittanut Samet Durgun · Subtextin perustajakumppani · 14 min lukuaika

Puheessa on täytesanoja, väärin aloitettuja lauseita ja kesken lauseen tehtyjä korjauksia, joita valmis kirjoitettu teksti sisältää harvoin, joten ääniviestin pelkkä litteraatti ei ole vielä viesti. Puhelin kirjoittaa sanomasi tekstiksi, samoin Otter, WhatsAppin litteraatit ja avoimiin puhemalleihin perustuvat sovellukset, mutta rönsyilevän ääniviestin litteraatti on edelleen rönsyilevä viesti. Siihen jää ”öö”, kesken sanottu korjaus ja se järjestys, jossa asiat sattuivat tulemaan mieleesi. Sovelluksella, joka muuttaa ääniviestin selkeäksi tekstiviestiksi, on litteroinnin jälkeen toinen tehtävä. Sen pitää selvittää, mitä tarkoitit, ja kirjoittaa se.

Ensimmäinen puolisko on tutkimusta. Kielitieteilijät ovat mitanneet, miten puhuttu kieli eroaa kirjoitetusta, puheentunnistuksen tutkijat ovat mitanneet, missä litterointi epäonnistuu ja kenen kohdalla, ja muutama tutkimus on kysynyt, miksi ihmiset lähettävät ääniviestejä ja miksi vastaanottajat lykkäävät niiden kuuntelua. Toinen puolisko käsittelee sitä, mitä ihmisten jo omistamat sanelutyökalut tekevät, mitä uudelleenkirjoitusvaihe lisää ja mitä Subtext tekee ääniviestille.

Olen Subtextin toinen perustaja. Sovelluksessa ääni on yksi kolmesta tavasta aloittaa, kirjoitetun luonnoksen ja keskustelusta otetun kuvakaappauksen rinnalla, joten minulla on oma intressi vastaukseen. Jokaisen alla olevan lähteen olen avannut itse. Jos pääsin vain tiivistelmään, sanon sen enkä lainaa siitä yhtään lukua.

Puhe syntyy eri tavalla kuin kirjoitus

Spontaani puhe on täynnä ainesta, jonka kirjoitus jättää pois. Elizabeth Shriberg kävi läpi epäsujuvuuksia useissa spontaania amerikanenglantia sisältävissä korpuksissa, ja hänen mukaansa niitä on enimmillään kymmenen prosenttia sanoista ja yli kolmanneksessa lausumista1. Muotoja ovat täytetyt tauot (”uh”, ”um”), toistot (”I I think”), korjaukset, joissa sana vaihdetaan kesken lauseen, ja väärät aloitukset, jotka hän lukee poistoihin ja joissa lause jätetään kesken ja aloitetaan uudestaan. Kahdessa ihmisten välisessä korpuksessa, jotka hän tutki, eli epävirallisissa puhelinkeskusteluissa ja matkasuunnittelupuheluissa, sanakohtainen osuus oli noin kuusi prosenttia1, otoksissa, joissa oli 40 515 ja 12 762 sanaa ja jotka hänen samoista korpuksista tekemänsä SRI-artikkeli oli merkinnyt käsin2. Korpuksessa, jossa ihmiset puhuivat tietokoneelle painettavan puhepainikkeen kautta, osuus putosi alle prosenttiin, ja hän selittää pudotuksesta osan painikkeella. Puhuja pystyi suunnittelemaan lausuman ensin ja äänittämään sen vasta sitten1. Ääniviestissä napautat kerran ja puhut, ja suunnittelu tapahtuu ääneen.

Puheen täytesanat ja puhujien väliset erot

Puheen täytesanat eivät ole kohinaa, ja se on osa syytä, miksi niitä on vaikea siivota pois. Herbert Clark ja Jean Fox Tree perustelivat useilla suurilla korpuksilla, että ”uh” ja ”um” ovat omia sanojaan, joita suunnitellaan ja tuotetaan kuten muitakin ja joilla ilmoitetaan lyhyestä tai pitkästä viiveestä, kun puhuja etsii seuraavaa sanaa tai päättää, mitä sanoo3. Puhujien väliset erot ovat myös valtavat. London-Lund-korpuksessa, jossa on noin 170 000 sanaa 50:stä brittiläisestä kasvokkaisesta keskustelusta, jotka äänitettiin vuosina 1961-1976 ja joiden osallistujat olivat enimmäkseen akateemikkoja, ne 65 puhujaa, jotka tuottivat yli 1 000 sanaa kukin, käyttivät täytesanoja 1,2:sta 88,5:een 1 000 sanaa kohti, ja mediaani oli 17,33. Osa litteraateista tulee lähes puhtaana, osassa on täytesana noin joka kahdennellatoista sanalla.

Epäsujuvuudet keskittyvät myös kohtiin, joissa suunnittelu on raskainta. Shriberg toteaa aiempaan tutkimukseen viitaten, että ne ovat todennäköisempiä lauseen alussa1. Ääniviestissä se on aloitus, jossa vielä päätät, mihin viestiä tarvitset. Kirjoittaessa voit poistaa aloituksen ennen kuin kukaan näkee sen. Ääniviestissä se menee yleensä perille, ellet äänitä koko viestiä uudestaan.

Puheentunnistuksen virheet vaihtelevat puhujan mukaan

Litterointi lisää omat virheensä niiden päälle, jotka puhuit. Selvin löytämäni mittaus on PNAS-lehden vuoden 2020 tutkimus, jossa viisi kaupallista puheentunnistinta, Amazonin, Applen, Googlen, IBM:n ja Microsoftin, ajettiin 19,8 tunnin haastatteluäänitteillä 42 valkoiselta ja 73 mustalta yhdysvaltalaiselta puhujalta4. Keskimääräinen sanavirhesuhde oli 0,19 valkoisilla ja 0,35 mustilla puhujilla, ja jokaisessa järjestelmässä oli sama ero. Paras, Microsoft, sai 0,15 ja 0,27. Huonoin, Apple, sai 0,23 ja 0,45. Yli 20 prosentissa mustien puhujien klipeistä vähintään puolet sanoista meni väärin, kun valkoisten klipeistä näin kävi alle 2 prosentissa4. Tekijät jäljittävät eron akustisiin malleihin, eli osaan, joka muuntaa äänen sanoiksi, ja viittaavat siihen, että mustien puhujien ääntä on opetusaineistossa liian vähän.

Saman artikkelin toinen havainto koskee ääniviestejä. Järjestelmät pärjäsivät hieman huonommin miespuhujilla, minkä tekijät selittävät epämuodollisemmalla tyylillä, lyhyemmillä ja enemmän supistuneilla ääntämyksillä ja useammalla epäsujuvuudella4, eli sillä rekisterillä, jolla puhuu ääniviestin ystävälle.

Aksentit, toinen kieli ja sanat, joita kukaan ei sanonut

Puheentunnistus pärjää huonommin myös aksenteilla ja toisella kielellä puhutulla puheella. JASA Express Lettersissä vuonna 2024 julkaistussa artikkelissa testattiin OpenAI:n Whisper-mallia englannin eri aksenteilla, ja siinä raportoitiin korkeampi tarkkuus äidinkielisillä kuin niillä, joilla englanti on toinen kieli, parempia tuloksia amerikanenglannilla kuin brittiläisellä tai australialaisella ja parempia tuloksia luetulla puheella kuin keskustelulla5. Pääsin vain tiivistelmään, joten mainitsen suunnan enkä lukua. Whisperiä opetettiin 680 000 tunnilla ääntä, ja sen tekijöiden mukaan mallit lähestyvät ihmisen ”accuracy and robustness” -tasoa6. Sen oma dokumentaatio lisää, että suorituskyky vaihtelee kielen mukaan, alkuperäisessä sanamuodossa ”performance varies widely depending on the language”7. Puhujien keskiarvo kertoo vähän väsyneestä ääniviestistä, jonka puhut toisella kielelläsi. Jos kieli on englanti, oikeinkin kirjoitettu viesti voi silti kuulostaa äidinkieliselle lukijalle tylyltä, eikä litteraatti kerro sitä sinulle.

Whisper voi myös lisätä sanoja, joita kukaan ei sanonut. Vuoden 2024 tutkimuksessa ajettiin OpenAI:n isännöimän Whisper-rajapinnan läpi huhti- ja toukokuussa 2023 13 140 lyhyttä englanninkielistä klippiä, jotka oli äänitetty 437 osallistujalta yhdysvaltalaisissa laitoksissa, afasian kanssa ja ilman. Noin yhdessä prosentissa litteraateista oli kokonaisia fraaseja tai lauseita, joita äänessä ei ollut, ja 38 prosentissa niistä oli vähintään yksi selvästi haitallinen sisältö, kuten väkivaltaa tai väärä väite auktoriteetista. Klipeillä, joissa oli pitkiä taukoja, riski oli suurempi. Niillä 187 klipillä, joissa Whisper oli keksinyt tekstiä, Google, Amazon, Microsoft, AssemblyAI ja RevAI eivät tuottaneet vastaavia keksintöjä. Klipit olivat haastatteluja eivätkä ääniviestejä, ja tutkimus testasi rajapintaa sellaisena kuin se oli vuonna 20238.

Miksi ihmiset lähettävät ääniviestejä

Ihmiset lähettävät ääniviestejä, koska ne ovat lähettäjälle nopeita. Suurin löytämäni tutkimus on Ulmin yliopiston vuoden 2020 kysely, jossa oli 1 003 Amazon Mechanical Turkin kautta rekrytoitua ihmistä, enimmäkseen Yhdysvalloista, sekä kaksiviikkoinen kenttätutkimus kuudesta ahkerasta käyttäjästä9. Kyselyssä 83 % oli vastaanottanut ääniviestin ja 73 % oli lähettänyt sellaisen. Lähettämisen syyt, jotka perustuivat 735 avoimeen vastaukseen ääniviestin äänittäneiltä, jakautuivat neljään teemaan. Teemojen lukumäärät ovat yhteensä suurempia kuin 735, koska osa vastauksista kuului useampaan teemaan. Mukavuus, koska puhuminen on puhelimella nopeampaa kuin kirjoittaminen, mainittiin 359 kertaa. Sävy ja tunne, jonka ääni välittää ja teksti hukkaa, 229. Tilanteet, joissa kirjoittaminen on hankalaa tai vaarallista, kuten ajaminen, 203. Ja vastaanottaja, joka oli pyytänyt ääntä tai jolle se oli helpompi, 34.

Laboratoriotutkimus mittasi nopeuden. Sen 48 yliopisto-opiskelijaa, joista 24 oli englannin äidinkielisiä, kopioivat lyhyitä fraaseja iPhonella, ja englanninkielinen puhesyöttö eteni 153 sanaa minuutissa, kun näppäimistöllä vauhti oli 52, eli 2,93 kertaa nopeammin. Puhe jätti kuitenkin lopulliseen tekstiin hieman enemmän korjaamattomia virheitä, 0,55 prosenttia verrattuna 0,35 prosenttiin. Tehtävänä oli annettujen fraasien kopiointi, mikä kertoo vähän viestin laatimisesta. Kaksi kirjoittajista työskenteli Baidulle, jonka palvelinpuolen tunnistinta Deep Speech 2 testattiin iPhone 6 Plus -sovelluksen kautta, artikkelissa, joka julkaistiin vuonna 201710.

Ääniviestit siirtävät vaivan lähettäjältä vastaanottajalle

Ulmin kenttätutkimuksessa kahden viikon aikana kirjatut 438 ääniviestiä vaihtelivat 1,5 sekunnista runsaaseen seitsemään minuuttiin, ja mediaani oli 17,5 sekuntia9. Kirjoittajat huomauttavat myös kustannuksesta, joka maksetaan ennen kuin yksikään vastaanottaja kuulee viestiä. Ääni on ohikiitävää, joten äänitteen tarkistaminen ja muokkaaminen on hankalaa, ja kielenlipsahdus tarkoittaa koko viestin äänittämistä uudestaan9. Viisi kenttätutkimuksen kahdestatoista keskeytetystä äänityksestä oli juuri sellaisia.

Kirjoittajien mukaan ääniviestit ”shift the effort necessary for communication towards the receiver”9, eli siirtävät viestinnän vaatiman vaivan vastaanottajalle. Laatiminen on nopeaa, mutta sisällön poimiminen äänitteestä vie enemmän aikaa ja vaivaa kuin saman sisällön lukeminen tekstinä, ja useimmat heidän kenttätutkimuksensa osallistujista lykkäsivät ääniviestien kuuntelua töissä, koska tekstin voi omaksua yhdellä silmäyksellä ja äänitettä ei. Heidän vuonna 2020 ehdottamansa ratkaisu oli automaattiset litteraatit, jotta äänitteeseen hautautuneen tapaamisen päivämäärän ja paikan voisi löytää silmäilemällä.

Miksi vastaanottajat lykkäävät niitä

Vastaanottajat eivät voi silmäillä, joten he kuuntelevat kuulemansa uudelleen. Samassa kenttätutkimuksessa saatu ääniviesti toistettiin keskimäärin 1,37 kertaa, ja yksi viesti toistettiin 13 kertaa9. Lukeminen ei vaadi uudelleentoistoa. Vuoden 2019 meta-analyysin mukaan 190 tutkimuksessa, joihin osallistui 18 573 ihmistä, englanninkielisen tietokirjallisuuden hiljainen lukeminen on keskimäärin 238 sanaa minuutissa11. Keskustelupuhe etenee suuressa puhelinkorpuksessa noin 196 sanaa minuutissa, kun lasketaan koko puhelu, ja noin 164 puhujan omilla vuoroilla12. Lukija myös hallitsee tahtia ja voi hypätä suoraan kysymykseen. Kuuntelija saa sanat puhujan nopeudella ja puhujan järjestyksessä.

Ihmiset eivät erityisemmin pidä ääniviesteistä, ja vähän enemmän he pitävät vastaanottamisesta kuin lähettämisestä. YouGovin kyselyssä, johon vastasi 2 149 brittiaikuista ja joka tehtiin 5. ja 6. toukokuuta 2022 ja julkaistiin kesäkuussa, kysyttiin ääniviesteistä älypuhelinten käyttäjiltä, joita oli 1 956. Heistä 16 % piti niiden lähettämisestä ja 36 % ei pitänyt. Vastaanottamisesta 22 % piti, 25 % ei pitänyt ja 29 % suhtautui asiaan kahtalaisesti13. Vain 18-24-vuotiaiden joukossa useampi piti vastaanottamisesta kuin ei pitänyt, 43 prosenttia 28 prosenttia vastaan, ja silti tässäkin ryhmässä puolet ei pitänyt lähettämisestä, kun 30 % piti. Kaikista älypuhelinten käyttäjistä 63 % ei ollut koskaan lähettänyt sellaista.

Kuinka pitkä on liian pitkä ääniviesti?

Toukokuun 2022 YouGovin kyselyssä brittiläisistä älypuhelinten käyttäjistä 65 % vastanneista sanoi, että minuutin ääniviesti on liian pitkä, ja niistä, jotka eivät pidä niiden vastaanottamisesta ja vastasivat, 57 % turhautui jo 30 sekunnista. Kaikista älypuhelinten käyttäjistä 27 % ei tiennyt, missä raja on. Kun kysyttiin, miten he mieluiten vastaanottavat pitkän viestin, 78 % valitsi tekstin ja 14 % ääniviestin, mikä kertoo vain ilmoitetun mieltymyksen13. Jotkut lähettäjät näyttävät tietävän, että äänite on rasite. Saksalaisten ja espanjalaisten WhatsApp-keskustelujen vuoden 2024 analyysissä ihmiset perustelivat äänen valintaa ennen viestiä, sen aikana ja sen jälkeen, ja kirjoittajat kuvaavat näitä perusteluja sosiaaliseksi työksi, johon kuuluu ääniviestin esittäminen jonakin, mitä kannattaa pyydellä anteeksi14. Näiden kolmen lähteen perusteella lähettäjä säästää vaivaa ja vastaanottaja maksaa sen, ja jotkut lähettäjät pyytävät siitä anteeksi.

Mitä Applen sanelu tekee ääniviestille

Sanelu antaa sanat siinä järjestyksessä kuin ne sanoit, ja Applen sanelun koko tehtävä on tämä. Applen iPhonen käyttöohje iOS 27:lle kuvaa sanelun käsittelyn tapahtuvan puhelimessa ilman internetyhteyttä, monilla kielillä, ja pilkut, pisteet ja kysymysmerkit lisätään automaattisesti, kun kieli tukee sitä15. Uusimmissa puhelimissa laitteella toimiva malli parantaa oikeinkirjoitusta, välimerkkejä ja isoja kirjaimia, englanniksi. Kaikki muu on puhuttu komento. Sanot ”new line”, sanot ”delete” ja sen perään lausuman. Laitteella tapahtuvaa käsittelyä koskee ehto. Applen tietosuojasivun mukaan jos näppäimistöasetuksissa ei näy, että sanelua käsitellään laitteella, sanelemasi lähetetään Applen palvelimille eikä sitä tallenneta, ellet osallistu Paranna Siriä ja sanelua -ohjelmaan. Sivu sanoo myös, että Apple voi säilyttää pyyntöhistoriaa ja litteraatteja, jotka on liitetty satunnaiseen laitetunnisteeseen eikä Apple-tiliisi, enintään kaksi vuotta16. Sivu ei kerro, miten nämä kaksi sopivat yhteen. Uudelleenkirjoitus on Applen erillisten Writing Tools -työkalujen tehtävä, eivätkä ne kerro mitään siitä, miten teksti osuu perille.

Mitä Googlen puhekirjoitus ja Microsoftin äänikirjoitus tekevät

Googlen perusversio Gboardin puhekirjoituksesta antaa Applen sanelun tavoin sanat sellaisina kuin ne sanoit. Napauta mikrofonia, sano, mitä haluat kirjoitettavan, ja sano välimerkit ääneen, vaikka puhekirjoitus ja välimerkit eivät ole saatavilla kaikilla kielillä17. Sen lisäominaisuudet lisäävät välimerkit puhuessasi Pixel 6:ssa ja uudemmissa, ja Pixel 9:ssä (ei 9a:ssa) ja uudemmissa puhuttu komento voi oikolukea, muotoilla uudelleen, lyhentää tai pidentää sanelemasi. Google sanoo tämän toimivan laitteella englanniksi, ranskaksi, italiaksi, japaniksi ja espanjaksi, ja saksa on tulossa pian18. Windowsissa Microsoftin ohjesivu kertoo, että Sujuva sanelu (Fluid dictation), Copilot+ PC -koneiden ominaisuus, korjaa kieliopin, välimerkit ja täytesanat puhuessasi19. Puhekirjoituksen lisäominaisuudet kirjoittavat uudelleen vain, kun annat puhutun komennon. Sujuva sanelu toimii ilman komentoa, mutta vain Copilot+ PC -koneilla, eikä sen ohjesivu mainitse viestin uudelleenjärjestämistä. Tässä siteeraamillani Applen, Googlen ja Microsoftin ohjesivuilla en löytänyt ominaisuutta, joka muuttaisi kokonaisen rönsyilevän ääniviestin lähetettäväksi viestiksi oletuksena.

Mitä litterointisovellukset ja viestisovellukset tekevät

Otter, litterointisovellus, menee askeleen pidemmälle kuin puhelimen näppäimistö. Sen puheesta tekstiksi -sivu kuvaa litteraattia, jossa on puhujamerkinnät ja aikaleimat, automaattisesti luotu yhteenveto kohokohtineen sekä poimitut pääkohdat ja tehtävät20. Otterin ohjekeskus listaa tuetuiksi kieliksi englannin, espanjan, ranskan, saksan, japanin ja kiinan (yksinkertaistettu)21, mikä on enemmän kuin puheesta tekstiksi -sivu kertoo. Se on tehty kokouksia varten, joten se tiivistää sanotun, enkä löytänyt noilta kahdelta sivulta ominaisuutta, joka luonnostelisi sen, mitä aioit lähettää. Joidenkin sovellusten pohjalla on avoimia puhemalleja. Whisper itse tuottaa litteraatin ja kielimerkinnän7. Sen päälle rakennetut sovellukset vaihtelevat. MacWhisper mainostaa litteraatin päälle täytesanojen poistoa, yhteenvetoja ja omia kehotteita ja tarjoaa tähän vaiheeseen paikallisia tai pilvimalleja22.

Viestisovellukset ovat alkaneet litteroida saamasi ääniviestit. WhatsApp lisäsi ääniviestien litteraatit marraskuussa 2024, ne luodaan laitteella niin, ettei WhatsApp itse voi lukea niitä, ne otetaan käyttöön kohdasta Asetukset ja Keskustelut ja käynnistetään painamalla viestiä pitkään23. WhatsAppin kirjoitus sanoo, että litteraatit alkoivat muutamalla valitulla kielellä, enkä pystynyt vahvistamaan nykyistä listaa. Tämä vastaa Ulmin kirjoittajien tunnistamaan silmäilyongelmaan, kun kieli on katettu. Saat litteraatin jonkun toisen ääneen ajattelusta. Voit lukea sen kokouksessa, mutta vastaus pitää silti kirjoittaa itse.

Mitä uudelleenkirjoitusvaihe lisää

Uudelleenkirjoitusvaihe muuttaa litteraatin viestiksi, jonka olisit kirjoittanut, jos kirjoittaminen olisi vaivatonta. Se poistaa Clarkin ja Fox Treen kuvaamat täytesanat, tiivistää Shribergin luokittelun toistot ja väärät aloitukset ja asettaa kesken sanotun korjauksen paikalleen, korvaamaan sen, mitä se korjasi. Se myös järjestää uudelleen. Puhutut selitykset tulevat tavallisesti siinä järjestyksessä kuin ne juolahtivat mieleesi, ensin tausta ja pyyntö viimeisenä, tai pyyntö ensin ja perustelut perässä. Kirjoitettu viesti voi aloittaa asian ytimestä.

Kaksi asiaa vaiheen on jätettävä rauhaan. Ensimmäinen on merkitys. Uudelleenkirjoitus, joka siloittaa ääniviestisi toiseksi pyynnöksi, on litteraattia huonompi, koska litteraatti sanoi sentään sen, mitä sanoit. Toinen on sävy. Jos olit lämmin, suora tai vitsailit, kirjoitetun version pitää olla sama ihminen. Tässä virhe on sama kuin kirjoituksessa tekeekö tekoäly teksteistäsi robottimaisia, jossa uudelleenkirjoitus palaa kohteliaana ja yleisenä.

On myös harkinta, jota litteraatin ei koskaan tarvitse tehdä. Osa ääniviestissä sanomastasi oli sinua varten, ei vastaanottajaa. Ääneen pohtiminen, mainitsetko jotain, ei tarkoita, että aioit mainita sen. Uudelleenkirjoitusvaiheen pitää päättää, mikä oli viesti ja mikä luonnostelua, ja päätös voi mennä väärin kumpaankin suuntaan, joko pitämällä lauseen, jota olit puhumassa itseltäsi pois, tai pudottamalla lauseen, jonka tarkoitit. En löytänyt tutkimusta, joka olisi mitannut, kuinka usein näin käy missään työkalussa, Subtext mukaan lukien.

Mitä Subtext tekee ääniviestille

Subtext litteroi sovelluksessa äänittämäsi ääniviestin, kirjoittaa sitten viestin siitä, mitä tarkoitit, ja palauttaa enintään kolme versiota, joilla jokaisella on voit lähettää -pisteet siitä, kuinka todennäköisesti viesti menee perille niin kuin tarkoitit. Versiot on tehty säilyttämään merkityksesi ja persoonallisuutesi. Ensimmäisessä luonnoksessa yksi pysyy lähellä sanojasi ja ongelmat korjattuina, yksi on lämpimämpi viilaus tai toinen lähestymistapa ja yksi on perusteellisempi uudelleenkirjoitus. Jos sanamuoto kuulostaa kylmemmältä tai terävämmältä kuin tarkoitit, sovellus nimeää ongelman ja merkitsee sanat, jotka sen aiheuttavat. Mitään ei lähetetä puolestasi.

Mallin ohjeissa on huomioitu litteroinnin virheet, ja luin taustajärjestelmän kehotteet ennen tämän kirjoittamista. Kun viesti on merkitty saneltuna, mallille kerrotaan odottaa väärin kuultuja tai yhteen sulautuneita sanoja, outoja välimerkkejä ja ylimääräisiä täytesanoja, lukea niiden läpi tarkoitettuun sanamuotoon ja korjata ne hiljaa merkitsemättä niitä jonakin, minkä teit väärin. Kehote näyttää, mitä mallia käsketään tekemään. En löytänyt riippumatonta arviota Subtextin äänen litteroinnista tai uudelleenkirjoituksesta, joten kaikki tämä perustuu siihen, mitä sovellus näyttää ja mitä sen kehotteet ja tietosuojaseloste sanovat. Koska yksikään yllä olevista tutkimuksista ei testannut Deepgramia, puhemallia, joka litteroi Subtextin äänen, en voi sanoa, kuinka pitkälle aksenttien, toisen kielen puheen ja rennon tyylin virhekuviot yltävät siihen, joten lue viesti takaisin ennen kuin lähetät sen.

Mitä Subtextissa tapahtuu ääninauhoitukselle?

Subtext lähettää ääninauhoituksen Deepgramille litterointia varten, joten ääni poistuu puhelimesta. Sen tietosuojaseloste, päivitetty 26. heinäkuuta 2026, nimeää useita palveluntarjoajia, muun muassa Deepgramin ääninauhoituksille, Anthropicin teksteille, kuville ja äänilitteraateille, Google Firebasen tileille ja keskusteluille sekä OpenAI:n vain jos otat ääneen lukemisen käyttöön. Seloste lisää, että kun verkkohaku on päällä, pyynnöstäsi johdetut hakusanat kulkevat Anthropicin kautta kolmansien osapuolten hakupalveluille ja että verkkohaun voi kytkeä pois sovelluksen asetuksista24. Selosteen mukaan mitään lähettämääsi ei käytetä tekoälymallin kouluttamiseen eikä yksikään sen tekoälypalveluntarjoaja saa kouluttaa sillä, ja Subtext on lisäksi asettanut Deepgramin mallin parantamisesta kieltäytymisen äänelle. Se sanoo, että Subtext poistaa oman kopionsa keskustelusta palvelimiltaan viisi päivää sen jälkeen, kun viimeksi käytit sitä, tai 90 päivän kuluttua, jos kiinnität sen. Se sanoo, että Deepgram säilyttää tuon kieltäytymisen ollessa asetettuna äänen vain niin kauan kuin litterointi kestää ja että Anthropic poistaa syötteet ja tulosteet 30 päivän kuluessa ja voi säilyttää merkityt pyynnöt enintään kaksi vuotta ja niihin liittyvät turvapisteet enintään seitsemän vuotta. Lisäksi seloste kertoo, ettei Subtextilla ole nollasäilytyssopimusta yhdenkään niistä kanssa24. Miten muut avustajat käsittelevät tekstiäsi, vertaillaan kirjoituksessa mitkä tekoälykirjoitusavustajat kouluttavat viesteilläsi.

Mitä kieliä Subtext tukee?

Subtext kirjoittaa viestin kielellä, jota puhuit, 17+ kielellä, ja säilyttää käyttämäsi muodollisuuden tason, kun kieli sellaisen merkitsee. Saksankielinen ääniviesti palaa saksankielisenä viestinä. Saamasi ääniviestin yhteenveto kirjoitetaan kielellä, jolla se saapui. Google Playn toimittajat nostivat tämän kulun esiin ”Hot Tip” -jutussa, joka kuvaa mikrofonikuvakkeen napauttamista, puhumista, uutta napautusta ja sitä, että saat hiotun viestin, merkinnät siitä, miltä alkuperäinen kuulosti, ja kopiointipainikkeen25. Kun avasin sivun 4. lokakuuta 2026, saksalaisen kaupan listauksessa oli 4,3 tähteä 295 arvostelusta ja yli 50 000 latausta, ja luku on vain Google Playn laskema, sillä tähtiarvio vaihtelee maittain. Subtextin käyttö maksaa, ja muutama analyysi on ilmainen alkuun. Äänitetty ääniviesti palaa viestinä, jonka voit lähettää.

Miten vastaat pitkään ääniviestiin, jonka joku lähetti sinulle?

Subtext lukee myös ääniviestit, joita muut sinulle lähettävät, ja tämä on se puoli, jossa pelkkä litteraatti tulee lähimmäksi riittävää. WhatsAppin laitteella tehtävä litteraatti antaa lukea kaksiminuuttisen äänitteen, kun kieli on katettu23. Se ei kerro, mitä ihminen haluaa. Ulmin tutkimuksen oma esimerkki oli äänitteeseen hautautunut päivämäärä ja paikka9. Ystävän tai esihenkilön pitkällä ääniviestillä on sama muoto, kysymys jossain keskellä ja perustelut sen ympärillä. Niille, jotka jäävät jumiin vastauksissa, lukeminen on yksi viidestä kohdasta, joissa vastaus tökkii, ja useimmat Ulmin kenttätutkimuksen osallistujat lykkäsivät ääniviestien kuuntelua töissä, koska äänitettä ei voi omaksua yhdellä silmäyksellä9.

Vie saamasi ääniviesti Subtextiin, ja se litteroi sen, tiivistää yhdellä rivillä, mitä ihminen sinulta haluaa, ja lisää kahdesta viiteen toimintakohtaa. Sen jälkeen se voi luonnostella vastauksen, joka tarttuu langanpäähän, eikä se nimeä lähettäjän sävyä. Taustajärjestelmän kehotteet käsittelevät liittämääsi ääniliitettä todennäköisimmin toisen osapuolen sinulle lähettämänä, ja jos malli on epävarma siitä, kuka on kuka, sitä neuvotaan kysymään. Yhteenveto on yhtä hyvä kuin sen alla oleva litterointi, ja yhtä riviä on vaikea lukea ilman asiayhteyttä, kuten mitä tämä viesti tarkoittaa osoittaa. Vahvalla aksentilla tai meluisalla äänitteellä litteraatissa on enemmän virheitä kuin studioenglannissa, joten kuuntele alkuperäinen, ennen kuin vastaat mihinkään, millä on väliä. Teksti ja kuvakaappaukset kulkevat saman yhteenvetovaiheen läpi, joten saamasi viesti saa saman yhden rivin yhteenvedon.

Lähimmät kokeet ovat vanhoja ja pieniä

Kaksi lähintä löytämääni koetta uudelleenkirjoitusvaiheeseen tai yhteenvetoon ovat vuosilta 2003 ja 2005, ja molemmat ovat pieniä. Vuonna 2003 DARPA:n rahoittamassa kokeessa 28 englannin äidinkielistä luki 150-250 sanan otteita puhelin- ja yleisradiopuheesta, sanatarkkoina litteraatteina ja käsin siistittyinä. Lukijat arvioivat siistityn tekstin helpommin ymmärrettäväksi, mutta he eivät vastanneet kysymyksiin siitä yhtään tarkemmin tai nopeammin, minkä tekijät selittävät sillä, että lukijat saivat jo valmiiksi lähes huippupisteet. Epätäydellisen tunnistimen tuotoksen automaattisesti siistitty versio arvioitiin yleensä vaikeammaksi kuin siistimätön, joskin vain niukasti26. Siistiminen poisti epäsujuvuudet ja korjasi välimerkit mutta ei kirjoittanut tekstiä viestiksi.

Vuonna 2005 16 ihmistä vastasi kysymyksiin 15 vastaajaviestistä automaattisesti poimituista yhteenvedoista. Tunnistetusta puheesta tehdyt yhteenvedot saivat soittajan nimen oikein 57 prosentissa tapauksista, kun ihmisen tekemistä litteraateista tehdyissä osuus oli 94 %, kun taas soiton syy välittyi yhtä hyvin, 78 prosentissa. Ihmiset pyysivät alkuperäistä ääntä useammin, kun yhteenveto tuli tunnistetusta puheesta, 53 prosentissa tapauksista verrattuna 30 prosenttiin27. Kyse oli vastaajaviestien poimivista yhteenvedoista, jotka oli tehty vuoden 2005 puheentunnistuksella, joten tutkimus asettaa vain odotuksen. Kumpikaan tutkimus ei mitannut viestiä, jonka joku lähettäisi.

Missä näyttö loppuu

Vahva näyttö on molemmissa päissä. Puhuttu kieli sisältää epäsujuvuuksia mitatulla osuudella, jota kirjoituksessa ei ole, ja puheentunnistus tekee joillekin puhujille enemmän virheitä kuin toisille, kuten yllä olevat luvut osoittavat. Keskiosa on ohuempi. En löytänyt tutkimusta, joka olisi mitannut, kuinka paljon paremmin uudelleenkirjoitettu ääniviesti osuu perille kuin raaka litteraatti, tai kuinka usein uudelleenkirjoitus muuttaa merkitystä matkalla. Ääniviestitutkimus on kourallinen tutkimuksia, joista suurimman kyselyotos on poimittu yhdysvaltalaiselta joukkotyöalustalta ja kenttätutkimus koskee kuutta ihmistä. YouGovin kysely koskee yhtä maata ja yhtä vuotta. Ja ääniviestitutkimukset edeltävät laitteella tehtäviä litteraatteja, joten niiden kuvaama vaivan siirtymä on nyt osin korjaantunut viestisovellusten omin toimin.

Käytännössä kaikki riippuu siitä, miten puhut. Jos puhut puhtain lausein, sanelu riittää, ja puhelimessasi se on jo. Jos puhut niin kuin niiden korpusten puhujat, täytesanojen kanssa, jotka Clark ja Fox Tree laskivat, ja uudelleenaloituksineen, jotka Shriberg luetteloi, litteraatti ojentaa vastaanottajalle luonnosprosessisi, ja uudelleenkirjoitusvaihe tekee siitä viestin. Subtext on yksi sovellus, joka tekee tuon vaiheen sekä äänittämällesi että saamallesi ääniviestille, ja jos ongelmasi on vastaus, jota editoit loputtomiin, miksi lyhyt vastaus vie tunnin käsittelee juuri sitä kehää. Kokeile Subtextiä selaimessaKokeile Subtextiä selaimessa

Lähteet

Numeroitu siinä järjestyksessä kuin ne esiintyvät tekstissä. Sivut tarkistettiin 4. ja 5. lokakuuta 2026, ja Subtextin tietosuojaseloste avattiin uudelleen 10. lokakuuta 2026.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153-169. Amerikanenglantia sisältävän keskustelun korpustutkimus, epäsujuvuuksien osuudet ja tyypit.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferenssiartikkeli, PDF:ssä ei ole vuotta, ja siinä viitatut lähteet ulottuvat vuoteen 1996. Käsin merkityt korpukset, 40 515 sanaa 30 puhujalta (Switchboard) ja 12 762 sanaa 523 puhujalta (AMEX, SRI:n työntekijöiden ja matkatoimistojen välisiä puheluita). Rahoittajina DARPA ja NSF. . Tarkistettu 5. lokakuuta 2026.
  3. Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73-111. Täytesanojen osuudet puhujaa kohti London-Lund-korpuksesta.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684-7689. Viisi kaupallista järjestelmää, 42 valkoista ja 73 mustaa puhujaa, 19,8 tuntia ääntä.
  5. Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Vain tiivistelmä, kokotekstiä ei saanut auki tarkistaessani.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-ennakkojulkaisu.
  7. OpenAI. Whisper README. GitHub. . Tarkistettu 4. lokakuuta 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13 140 äänisegmenttiä 437 osallistujalta, äänitetty yhdysvaltalaisissa laitoksissa, afasian kanssa ja ilman, ajettu Whisper-rajapinnan läpi huhti- ja toukokuussa 2023. Rahoittajina Pulitzer Center ja Cornellin yliopiston Center for Social Sciences.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Kysely 1 003 ihmiselle ja kaksiviikkoinen kenttätutkimus kuudella.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Julkaistu joulukuussa 2017. Laboratoriotutkimus 48 yliopisto-opiskelijalla, 24 kieltä kohti, fraasien kopiointi iPhonella. Kaksi kirjoittajaa työskenteli Baidu USA:lle, jonka palvelinpuolen puhejärjestelmä Deep Speech 2 pyöri Baidun palvelimella ja jota testattiin iPhone 6 Plus -sovelluksen kautta.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 tutkimusta, 18 573 osallistujaa.
  12. Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard-puhelinkeskustelut.
  13. YouGov. How many Britons like voice notes? 14. kesäkuuta 2022. Kysely 2 149 brittiaikuiselle, kenttätyö 5. ja 6. toukokuuta 2022, joista 1 956 älypuhelinten käyttäjiä. Pituuslukemat ovat osuuksia niistä vastaajista, jotka vastasivat kysymykseen. Tulostaulukot osoitteessa . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Tarkistettu 4. ja 5. lokakuuta 2026. Prosenttiluvut seuraavat YouGovin artikkelin tekstiä, ja tulostaulukoiden kokonaisluvut ovat pyöristyksen takia hieman erilaiset inhoamisen osalta.
  14. Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51-71. Saksalaisia ja espanjalaisia WhatsApp-keskusteluja, tiivistelmä luettu kustantajan Crossref-tietueesta, kokoteksti maksumuurin takana.
  15. Apple. Dictate text on iPhone. iPhonen käyttöohje, iOS 27. . Tarkistettu 4. lokakuuta 2026.
  16. Apple. Siri, Dictation & Privacy. Oikeudellinen sivu, päivitetty viimeksi 14. syyskuuta 2026. . Tarkistettu 5. lokakuuta 2026.
  17. Google. Type with your voice. Gboardin ohje. . Tarkistettu 4. lokakuuta 2026.
  18. Google. Use advanced voice typing features. Gboardin ohje. . Tarkistettu 5. lokakuuta 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft-tuki. . Tarkistettu 5. lokakuuta 2026.
  20. Otter.ai. Convert Speech to Text. . Tarkistettu 4. lokakuuta 2026.
  21. Otter.ai. Supported languages. Otterin ohjekeskus, artikkelia muokattu 6. toukokuuta 2026. . Tarkistettu 5. lokakuuta 2026.
  22. MacWhisper. Homepage. Markkinointisivu ilman päiväystä, joten se kertoo, mitä tuote mainostaa, eikä sitä, miten se toimii. . Tarkistettu 5. lokakuuta 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21. marraskuuta 2024. . Tarkistettu 4. lokakuuta 2026.
  24. Subtext, Ehdot, tietosuoja ja tilisi. Tietosuojaseloste päivitetty viimeksi 26. heinäkuuta 2026. Tarkistettu 10. lokakuuta 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Tarkistettu 4. lokakuuta 2026, listauksessa oli 295 arvostelua ja 50K+ latausta jokaisessa avaamassani kaupassa ja 4,3 tähteä saksalaisessa.
  26. Jones, D. A., and six co-authors (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585-1588. 32 englannin äidinkielistä rekrytoitu, 28 analysoitu. DARPA:n sponsoroima Air Forcen sopimuksella F19628-00-C-0002.
  27. Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Ymmärtämiskoe, 16 osallistujaa ja 15 vastaajaviestiä, luvut luettu kirjoittajan ylläpitämästä PDF:stä. Rahoittajana EPSRC:n ROPA-apuraha GR/R23954.