ArticoliStrumenti di scrittura
Perché la trascrizione di un vocale non è ancora un messaggio
La dettatura trasforma un vocale in testo, ma di solito tiene intercalari, ripartenze e l'ordine in cui ti sono venute le idee. Cosa dice la ricerca e cosa aggiunge una riscrittura.
Di Samet Durgun · Cofondatore di Subtext · 20 min di lettura
· Aggiornato il 10 ottobre 2026
Il parlato è pieno di intercalari, false partenze e correzioni a metà frase che la scrittura rifinita in genere non ha, quindi la trascrizione di un vocale non è ancora un messaggio. I telefoni scrivono quello che hai detto, e lo fanno anche Otter, le trascrizioni di WhatsApp e le app costruite su modelli vocali aperti, ma la trascrizione di un vocale sconclusionato resta un messaggio sconclusionato. Si porta dietro gli “ehm”, la correzione che hai fatto a metà e l’ordine in cui ti sono venute in mente le cose. Un’app che trasforma un vocale in un messaggio di testo chiaro deve fare un secondo lavoro dopo la trascrizione. Deve capire cosa intendevi e scrivere quello.
La prima metà dell’articolo è ricerca. I linguisti hanno misurato come la lingua parlata si differenzia da quella scritta, chi lavora sul riconoscimento vocale ha misurato dove la trascrizione sbaglia e per chi, e qualche studio ha chiesto perché le persone mandano vocali e perché chi li riceve li rimanda. La seconda metà racconta cosa fanno gli strumenti di dettatura che le persone hanno già, cosa aggiunge un passaggio di riscrittura e cosa fa Subtext con un vocale.
Da co-fondatore di Subtext, dove la voce è uno dei tre modi per iniziare insieme a una bozza scritta e a uno screenshot di una conversazione, ho un interesse nella risposta. Ogni fonte qui sotto è una che ho aperto. Dove ho potuto raggiungere solo un abstract, lo dico e non cito nessun dato ricavato da lì.
Il parlato nasce in modo diverso dalla scrittura
Il parlato spontaneo è pieno di materiale che la scrittura lascia fuori. La rassegna di Elizabeth Shriberg sulle disfluenze in diversi corpora di inglese americano spontaneo indica una frequenza fino al dieci per cento delle parole e in più di un terzo degli enunciati1. Le forme sono le pause piene (“uh”, “um”), le ripetizioni (“I I think”), le correzioni, in cui una parola viene sostituita a metà frase, e le false partenze, che lei classifica tra le cancellazioni, in cui una frase viene abbandonata e ricominciata. Nei due corpora di conversazioni tra persone che ha esaminato, telefonate informali e telefonate per pianificare viaggi, la frequenza per parola era di circa il sei per cento1, su campioni di 40.515 e 12.762 parole che il suo articolo dell’SRI sugli stessi corpora ha etichettato a mano2. In un corpus di persone che parlavano con un computer tramite un pulsante da tenere premuto per parlare, la frequenza scendeva sotto l’uno per cento, e lei attribuisce parte del calo al pulsante. I parlanti potevano prima pianificare l’enunciato e poi registrarlo1. In un vocale tocchi una volta e parli, e la pianificazione avviene ad alta voce.
Gli intercalari parlati e quanto cambiano da persona a persona
Gli intercalari parlati non sono rumore, ed è in parte per questo che sono difficili da togliere. Herbert Clark e Jean Fox Tree hanno sostenuto, a partire da diversi grandi corpora, che “uh” e “um” sono parole a pieno titolo, pianificate e prodotte come le altre, usate per annunciare un ritardo breve o lungo mentre chi parla cerca la parola successiva o decide cosa dire3. Variano anche moltissimo da persona a persona. Nel corpus London-Lund, circa 170.000 parole tratte da 50 conversazioni faccia a faccia tra britannici registrate tra il 1961 e il 1976, per lo più tra accademici, i 65 parlanti che hanno prodotto più di 1.000 parole ciascuno andavano da 1,2 a 88,5 intercalari ogni 1.000 parole, con una mediana di 17,33. Alcune trascrizioni escono quasi pulite, altre hanno un intercalare ogni dozzina di parole.
La disfluenza si concentra anche dove la pianificazione pesa di più. Shriberg osserva, citando lavori precedenti, che è più probabile all’inizio di una frase1. In un vocale è l’apertura, quando stai ancora decidendo a cosa serve il messaggio. Nella scrittura puoi cancellare quell’apertura prima che qualcuno la veda. In un vocale di solito parte così com’è, a meno che tu non registri di nuovo tutto il messaggio.
Come cambiano gli errori del riconoscimento vocale da un parlante all’altro
La trascrizione aggiunge i propri errori a quelli che hai pronunciato tu. La misurazione più chiara che ho trovato è uno studio del 2020 su PNAS che ha messo alla prova cinque sistemi commerciali di riconoscimento vocale, di Amazon, Apple, Google, IBM e Microsoft, su 19,8 ore di audio di interviste con 42 parlanti americani bianchi e 73 neri4. Il tasso medio di errore sulle parole era 0,19 per i parlanti bianchi e 0,35 per i neri, e ogni sistema mostrava il divario. Il migliore, Microsoft, otteneva 0,15 e 0,27. Il peggiore, Apple, 0,23 e 0,45. Più del 20 per cento delle clip dei parlanti neri tornava con almeno metà delle parole sbagliate, contro meno del 2 per cento delle clip dei parlanti bianchi4. Gli autori fanno risalire il divario ai modelli acustici, la parte che associa i suoni alle parole, e indicano che nei dati di addestramento c’è troppo poco audio di parlanti neri.
Un secondo schema nello stesso articolo conta per i vocali. I sistemi andavano un po’ peggio con i parlanti uomini, cosa che gli autori attribuiscono a uno stile più informale, con pronunce più brevi e più ridotte e più disfluenze4, il registro di un vocale a un amico.
Accenti, seconde lingue e parole che nessuno ha detto
Il riconoscimento vocale va peggio anche con gli accenti e con il parlato in una seconda lingua. Un articolo del 2024 su JASA Express Letters ha messo alla prova il modello Whisper di OpenAI su vari accenti inglesi e ha riportato una precisione più alta per i madrelingua che per chi parla inglese come seconda lingua, risultati migliori per l’inglese americano che per quello britannico o australiano, e migliori sul parlato letto che sulla conversazione5. Ho potuto raggiungere solo l’abstract, quindi cito la direzione e nessun numero. Whisper è stato addestrato su 680.000 ore di audio, e i suoi autori dicono che i modelli si avvicinano a quelli umani per “accuracy and robustness”6. La sua stessa documentazione aggiunge che “performance varies widely depending on the language”7. Una media sui parlanti dice poco di un vocale registrato da stanchi nella tua seconda lingua. Se quella lingua è l’inglese, un messaggio corretto può comunque sembrare brusco a un madrelingua, e una trascrizione non te lo dirà.
Whisper può anche aggiungere parole che nessuno ha detto. Uno studio del 2024 ha fatto passare 13.140 brevi clip in inglese di 437 partecipanti registrati in istituzioni statunitensi, con e senza afasia, dall’API ospitata di Whisper di OpenAI, ad aprile e maggio 2023. Circa l’uno per cento delle trascrizioni conteneva frasi o periodi interi che non erano nell’audio, e il 38 per cento di questi portava almeno un danno esplicito, come violenza o una falsa pretesa di autorità. Le clip con pause lunghe erano più a rischio. Sulle 187 clip in cui Whisper aveva inventato del testo, Google, Amazon, Microsoft, AssemblyAI e RevAI non hanno prodotto invenzioni paragonabili. Le clip erano interviste, non vocali, e lo studio ha testato l’API com’era nel 20238.
Perché le persone mandano vocali
Le persone mandano vocali perché per chi li manda sono veloci. Lo studio più grande che ho trovato viene dall’Università di Ulm, un’indagine del 2020 su 1.003 persone reclutate tramite Amazon Mechanical Turk, per lo più negli Stati Uniti, più uno studio sul campo di due settimane con sei utenti assidui9. Nell’indagine, l’83 per cento aveva ricevuto un messaggio vocale e il 73 per cento ne aveva mandato uno. I motivi per mandarli, ricavati da 735 risposte aperte di chi aveva registrato un messaggio vocale, si sono raggruppati in quattro temi. I conteggi dei temi sommano più delle 735 risposte, quindi alcune risposte rientravano in più di un tema. La comodità, dato che parlare batte digitare su un telefono, è stata citata 359 volte. Il tono e l’emozione che la voce porta e il testo perde, 229. Le situazioni in cui digitare è scomodo o pericoloso, come guidare, 203. E il destinatario, che aveva chiesto un vocale o lo trovava più facile, 34.
Uno studio di laboratorio ha misurato la velocità. I suoi 48 studenti universitari, 24 dei quali madrelingua inglesi, copiavano frasi brevi su un iPhone, e l’input vocale in inglese andava a 153 parole al minuto contro 52 sulla tastiera, 2,93 volte più veloce, anche se il parlato lasciava un po’ più di errori non corretti nel testo finale, 0,55 per cento contro 0,35 per cento. Il compito era copiare frasi date, il che dice poco sul comporre un messaggio. Due degli autori lavoravano per Baidu, il cui riconoscitore lato server, Deep Speech 2, è stato testato tramite un’app per iPhone 6 Plus, in un articolo pubblicato nel 201710.
I vocali spostano la fatica dal mittente al destinatario
Nello studio sul campo di Ulm, 438 messaggi vocali registrati in due settimane andavano da 1,5 secondi a poco più di sette minuti, con una mediana di 17,5 secondi9. Gli autori segnalano anche un costo che si paga prima che un destinatario ascolti qualsiasi cosa. Il suono è transitorio, quindi una registrazione è scomoda da rivedere e correggere, e un lapsus significa registrare di nuovo tutto il messaggio9. Cinque delle dodici registrazioni interrotte nel loro studio sul campo erano esattamente questo.
Gli autori scrivono che i messaggi vocali “shift the effort necessary for communication towards the receiver”, cioè spostano la fatica verso chi riceve9. Comporre è veloce, ritrovare un’informazione in una registrazione richiede più tempo e fatica che leggere un testo con lo stesso contenuto, e la maggior parte dei partecipanti allo studio sul campo rimandava i messaggi vocali al lavoro perché un testo si coglie con un’occhiata e una registrazione no. La soluzione che proponevano, nel 2020, erano le trascrizioni automatiche, in modo che la data e il luogo di un appuntamento sepolti in una registrazione si potessero trovare scorrendo il testo.
Perché chi li riceve li rimanda
Chi riceve non può darci una scorsa veloce, quindi riascolta. Nello stesso studio sul campo, le persone riproducevano un messaggio vocale ricevuto in media 1,37 volte, e un messaggio è stato riprodotto 13 volte9. Leggere non richiede il riascolto. Una meta-analisi del 2019 su 190 studi con 18.573 partecipanti indica per la lettura silenziosa di saggistica inglese una media di 238 parole al minuto11. Il parlato conversazionale va a circa 196 parole al minuto se si conta l’intera telefonata e a circa 164 nei turni di un singolo parlante, in un grande corpus di telefonate12. Chi legge controlla anche il ritmo e può saltare alla domanda. Chi ascolta riceve le parole alla velocità di chi parla, nell’ordine di chi parla.
Alle persone non piacciono granché, e piace un po’ di più riceverli che mandarli. Un sondaggio YouGov su 2.149 adulti britannici, svolto il 5 e 6 maggio 2022 e pubblicato a giugno di quell’anno, ha chiesto dei vocali agli utenti di smartphone tra loro, 1.956 persone. Di questi, al 16 per cento piaceva mandarli e al 36 per cento no. Quanto a riceverli, al 22 per cento piaceva, al 25 per cento no e il 29 per cento era ambivalente13. Solo tra chi ha da 18 a 24 anni più persone apprezzavano riceverli che no, 43 contro 28 per cento, e anche in quel gruppo la metà non amava mandarli contro il 30 per cento a cui piaceva. Tra tutti gli utenti di smartphone, il 63 per cento non ne aveva mai mandato uno.
Quanto è troppo lungo un vocale?
In un sondaggio YouGov di maggio 2022 tra gli utenti di smartphone britannici, il 65 per cento di chi ha dato una risposta ha detto che un vocale di un minuto è troppo lungo, e tra chi non ama riceverli e ha risposto, il 57 per cento si irritava già a 30 secondi. Tra tutti gli utenti di smartphone, il 27 per cento non sapeva dove fosse il limite. Alla domanda su come preferissero ricevere un messaggio lungo, il 78 per cento ha scelto il testo e il 14 per cento un vocale, il che registra solo una preferenza dichiarata13. Alcuni mittenti sembrano sapere che la registrazione è un’imposizione. Un’analisi del 2024 di chat WhatsApp in Germania e Spagna ha trovato persone che giustificano la scelta dell’audio prima, dentro e dopo il messaggio, e gli autori descrivono queste giustificazioni come un lavoro sociale, compreso presentare il vocale come qualcosa per cui scusarsi14. In queste tre fonti chi manda risparmia fatica e chi riceve la paga, e alcuni mittenti si scusano per questo.
Cosa fa la Dettatura di Apple con un vocale
La dettatura ti dà le parole nell’ordine in cui le hai dette, e per la Dettatura di Apple questo è tutto il lavoro. Il Manuale utente di iPhone di Apple per iOS 27 descrive la Dettatura come elaborata sul telefono senza connessione a internet, in molte lingue, con virgole, punti e punti interrogativi inseriti in automatico dove la lingua è supportata15. Sui telefoni più recenti un modello sul dispositivo migliora ortografia, punteggiatura e maiuscole, in inglese. Tutto il resto è un comando vocale. Dici “new line”, dici “delete” seguito dalla frase. L’elaborazione sul dispositivo ha una condizione. La pagina di Apple sulla privacy dice che se le impostazioni della tastiera non mostrano che la Dettatura viene elaborata sul dispositivo, quello che detti viene inviato ai server di Apple e non viene archiviato, a meno che tu non abbia attivato “Migliora Siri e Dettatura”. Dice anche che Apple può conservare la cronologia delle richieste e le trascrizioni, collegate a un identificatore casuale del dispositivo e non al tuo Apple Account, fino a due anni16. La pagina non dice come le due cose stiano insieme. Riscrivere è compito degli Strumenti di scrittura di Apple, un’altra funzione, che non leggono come arriva un testo.
Cosa fanno la digitazione vocale di Google e quella di Microsoft
La digitazione vocale di base di Gboard di Google, come la Dettatura di Apple, ti dà le parole come le hai dette. Tocchi il microfono, dici cosa vuoi scrivere e pronunci la punteggiatura, anche se la digitazione vocale e la punteggiatura non sono disponibili in tutte le lingue17. La sua digitazione vocale avanzata, su Pixel 6 e successivi, aggiunge la punteggiatura mentre parli, e su Pixel 9 (escluso il 9a) e successivi un comando vocale può correggere, riformulare, accorciare o allungare quello che hai dettato. Google dice che funziona sul dispositivo, in inglese, francese, italiano, giapponese e spagnolo, con il tedesco in arrivo18. Su Windows, la pagina di aiuto di Microsoft dice che la dettatura fluida, una funzione dei PC Copilot+, corregge grammatica, punteggiatura e intercalari mentre parli19. La digitazione vocale avanzata riscrive solo quando le dai un comando vocale. La dettatura fluida funziona senza comando, ma solo sui PC Copilot+, e la sua pagina di aiuto non parla di riordinare il messaggio. Nelle pagine di aiuto di Apple, Google e Microsoft citate qui non ho trovato nessuna funzione che trasformi di default un intero vocale sconclusionato in un messaggio da inviare.
Cosa fanno le app di trascrizione e i messenger
Otter, un’app di trascrizione, fa un passo oltre la tastiera di un telefono. La sua pagina dedicata al passaggio da parlato a testo descrive una trascrizione con etichette dei parlanti e timestamp, un riassunto generato in automatico con i punti salienti, e punti chiave e azioni da fare estratti20. Il centro assistenza di Otter elenca inglese, spagnolo, francese, tedesco, giapponese e cinese (semplificato) come lingue supportate21, più di quante ne indichi la pagina sul parlato e testo. È pensata per le riunioni, quindi condensa quello che è stato detto, e in quelle due pagine non ho trovato nessuna funzione che prepari una bozza di quello che volevi mandare. Sotto alcune app ci sono modelli vocali aperti. Whisper stesso produce una trascrizione e un’etichetta della lingua7. Le app costruite sopra variano. MacWhisper pubblicizza la rimozione degli intercalari, riassunti e prompt personalizzati sopra la trascrizione, e offre modelli locali o cloud per quel passaggio22.
I messenger hanno iniziato a trascrivere i vocali che ricevi. WhatsApp ha aggiunto le trascrizioni dei messaggi vocali a novembre 2024, generate sul dispositivo in modo che nemmeno WhatsApp possa leggerle, da attivare in Impostazioni e poi Chat e da avviare con una pressione prolungata sul messaggio23. Il post dice che le trascrizioni sono partite in poche lingue selezionate, e non ho potuto confermare l’elenco attuale. Questo risponde al problema dello scorrere il testo che gli autori di Ulm avevano individuato, dove la lingua è coperta. Quello che ottieni è la trascrizione di qualcun altro che pensa ad alta voce. Puoi leggerla in una riunione, ma la risposta devi scriverla tu.
Cosa aggiunge un passaggio di riscrittura
Un passaggio di riscrittura trasforma la trascrizione nel messaggio che avresti scritto se scrivere non costasse fatica. Toglie gli intercalari descritti da Clark e Fox Tree, riunisce le ripetizioni e le false partenze della tassonomia di Shriberg, e mette la correzione fatta a metà dove va, al posto di ciò che correggeva. Riordina anche. Le spiegazioni parlate tendono ad arrivare come ti sono venute in mente, prima il contesto e per ultima la richiesta, oppure prima la richiesta e poi i motivi a seguire. Un messaggio scritto può partire dal punto.
Ci sono due cose che il passaggio deve lasciare stare. La prima è il significato. Una riscrittura che leviga il tuo vocale fino a farne una richiesta diversa è peggio della trascrizione, perché la trascrizione almeno diceva quello che avevi detto. La seconda è il tono. Se eri caloroso, o diretto, o scherzavi, la versione scritta deve essere la stessa persona. Il rischio qui è quello visto in se l’AI fa suonare i tuoi messaggi come un robot, dove una riscrittura torna educata e generica.
C’è anche un giudizio che una trascrizione non deve mai dare. Parte di quello che hai detto in un vocale era per te, non per chi lo riceve. Chiederti ad alta voce se menzionare una cosa non significa che volessi menzionarla. Un passaggio di riscrittura deve decidere cosa era il messaggio e cosa era la stesura, e quella decisione può sbagliare in due direzioni, tenendo una frase da cui ti stavi dissuadendo o togliendone una che volevi. Non ho trovato nessuno studio che misuri quanto spesso succede con uno strumento qualsiasi, Subtext compreso.
Cosa fa Subtext con un vocale
Subtext trascrive il vocale che registri nell’app, poi scrive il messaggio a partire da quello che intendevi e ti restituisce fino a tre versioni, ciascuna con un punteggio di sicurezza per l’invio che indica quanto è probabile che arrivi come volevi. Le versioni sono costruite per mantenere il tuo significato e la tua personalità. Su una prima bozza, una resta vicina alle tue parole con i problemi sistemati, una è una rifinitura più calda o un approccio diverso, e una è una riscrittura più completa. Se la formulazione suona più fredda o più tagliente di quanto volessi, l’app dà un nome al problema e segna le parole responsabili. Non viene inviato nulla al posto tuo.
Le istruzioni del modello coprono gli artefatti di trascrizione, e ho letto i prompt del backend prima di scrivere questo. Quando un messaggio è segnalato come dettato, al modello viene detto di aspettarsi parole sentite male o fuse, punteggiatura strana e intercalari residui, di leggere attraverso di essi fino alla formulazione voluta, e di correggerli in silenzio senza segnalarli come qualcosa che hai sbagliato tu. Il prompt mostra cosa viene detto di fare al modello. Non ho trovato nessuna valutazione indipendente della trascrizione o della riscrittura vocale di Subtext, quindi tutto questo poggia su quello che l’app mostra e su quello che dicono i suoi prompt e la sua informativa sulla privacy. Dato che nessuno degli studi qui sopra ha testato Deepgram, il modello vocale che trascrive l’audio di Subtext, non posso dire fino a che punto gli schemi di errore per accenti, parlato in seconda lingua e stile informale valgano anche per lui, quindi rileggi il messaggio prima di inviarlo.
Cosa succede a una registrazione vocale in Subtext?
Subtext invia una registrazione vocale a Deepgram per la trascrizione, quindi l’audio lascia il telefono. La sua informativa sulla privacy, aggiornata il 26 luglio 2026, nomina diversi fornitori, tra cui Deepgram per le registrazioni vocali, Anthropic per testo, immagini e trascrizioni vocali, Google Firebase per account e conversazioni, e OpenAI solo se attivi la lettura ad alta voce. L’informativa aggiunge che quando la ricerca web è attiva, i termini di ricerca ricavati dalla tua richiesta passano da Anthropic a fornitori di ricerca terzi, e che puoi disattivare la ricerca web nelle impostazioni dell’app24. Dice che nulla di quello che invii viene usato per addestrare un modello di AI e che nessuno dei suoi fornitori di AI può addestrarsi su di esso, e che Subtext imposta anche l’opt-out di Deepgram dal miglioramento del modello per la voce. Dice che Subtext cancella la propria copia di una conversazione dai suoi server cinque giorni dopo l’ultimo utilizzo, o 90 giorni se la fissi. Dice che Deepgram, con quell’opt-out impostato, conserva l’audio solo il tempo necessario a trascriverlo, e che Anthropic cancella input e output entro 30 giorni, e può conservare le richieste segnalate fino a due anni e i relativi punteggi di sicurezza fino a sette anni. Dice che Subtext non ha nessun accordo di conservazione zero con nessuno di loro24. Come gli altri assistenti trattano i tuoi testi è messo a confronto in quali assistenti di scrittura AI si addestrano sui tuoi messaggi.
Quali lingue supporta Subtext?
Subtext scrive il messaggio nella lingua in cui hai parlato, in 17+ lingue, e mantiene il livello di formalità che hai usato dove la lingua ne ha uno marcato. Un vocale in tedesco torna come messaggio in tedesco. Il riassunto di un vocale che hai ricevuto è scritto nella lingua in cui è arrivato. I redattori di Google Play hanno messo in evidenza questo flusso in un articolo “Hot Tip” che descrive come toccare l’icona del microfono, parlare, toccare di nuovo e ottenere un messaggio rifinito con tag su come suonava l’originale e un pulsante per copiare25. Quando ho aperto la pagina il 4 ottobre 2026 la scheda sullo store tedesco mostrava 4,3 stelle da 295 recensioni e più di 50.000 download, un conteggio solo di Google Play, e il punteggio in stelle cambia da paese a paese. Usare Subtext costa, e poche analisi sono gratuite per iniziare. Un vocale registrato torna come un messaggio che puoi inviare.
Come rispondi a un lungo messaggio vocale che ti hanno mandato?
Subtext legge anche i messaggi vocali che ti mandano gli altri, ed è il lato in cui una semplice trascrizione si avvicina di più all’essere sufficiente. La trascrizione sul dispositivo di WhatsApp ti permette di leggere una registrazione di due minuti dove la tua lingua è coperta23. Quello che non fa è dirti cosa vuole la persona. L’esempio dello studio di Ulm era una data e un luogo sepolti nell’audio9. Un lungo vocale di un amico o di un capo ha la stessa forma, la domanda da qualche parte nel mezzo e i motivi tutto intorno. Per chi si blocca sulle risposte, la lettura è uno dei cinque punti in cui una risposta si incastra, e la maggior parte dei partecipanti allo studio di Ulm rimandava i vocali al lavoro perché una registrazione non si coglie con un’occhiata9.
Se metti in Subtext un messaggio vocale ricevuto, lo trascrive, riassume in una riga cosa vuole da te la persona e aggiunge da due a cinque punti d’azione. Poi può preparare una risposta che riprende il filo, e non etichetta il tono del mittente. I prompt del backend trattano un file vocale che alleghi come probabilmente mandato a te dall’altra persona, e se il modello non è sicuro di chi sia chi, ha l’istruzione di chiedere. Il riassunto vale quanto la trascrizione che c’è sotto, e una riga è difficile da leggere senza il suo contesto, come mostra cosa significa questo messaggio. Con un accento forte o una registrazione rumorosa la trascrizione avrà più errori che con un inglese da studio, quindi riascolta l’originale prima di rispondere a qualcosa che conta. Testo e screenshot passano per lo stesso passaggio di riassunto, quindi un messaggio che hai ricevuto ottiene lo stesso riassunto in una riga.
Gli esperimenti più vicini sono vecchi e piccoli
I due esperimenti più vicini a un passaggio di riscrittura o a un riassunto che ho trovato sono del 2003 e del 2005, ed entrambi sono piccoli. Nel 2003, un esperimento finanziato dalla DARPA ha fatto leggere a 28 madrelingua inglesi brani da 150 a 250 parole di parlato telefonico e radiotelevisivo, sia come trascrizioni letterali sia come versioni ripulite a mano. I lettori hanno giudicato il testo ripulito più facile da capire, ma hanno risposto alle domande sul testo senza più precisione né più rapidità, cosa che gli autori attribuiscono al fatto che i lettori avevano già punteggi vicini al massimo. La pulizia automatica dell’output imperfetto di un riconoscitore tendeva a essere giudicata più difficile della versione non ripulita, anche se solo di poco26. La pulizia toglieva le disfluenze e correggeva la punteggiatura, ma non riscriveva il testo trasformandolo in un messaggio.
Nel 2005, 16 persone hanno risposto a domande su 15 messaggi in segreteria a partire da riassunti estratti automaticamente. I riassunti costruiti dal parlato riconosciuto hanno indovinato il nome di chi chiamava il 57 per cento delle volte contro il 94 per cento dei riassunti costruiti da trascrizioni umane, mentre il motivo della chiamata passava ugualmente bene, al 78 per cento. Le persone chiedevano l’audio originale più spesso quando il riassunto veniva dal parlato riconosciuto, il 53 per cento delle volte contro il 30 per cento27. Erano riassunti estrattivi di messaggi in segreteria fatti con il riconoscimento vocale del 2005, quindi lo studio fissa solo un’aspettativa. Nessuno dei due studi ha misurato un messaggio che qualcuno avrebbe inviato.
Dove si ferma la ricerca
Le prove solide stanno ai due estremi. Il parlato porta disfluenze a una frequenza misurata che la scrittura non ha, e il riconoscimento vocale sbaglia di più per alcuni parlanti che per altri, con le cifre qui sopra a dimostrarlo. Il centro è più sottile. Non ho trovato nessuno studio che misuri di quanto meglio arrivi un vocale riscritto rispetto a una trascrizione grezza, né quanto spesso una riscrittura cambi il significato per strada. La ricerca sui messaggi vocali è una manciata di studi, il più grande con un campione di indagine tratto da una piattaforma statunitense di crowdworking e uno studio sul campo di sei persone. Il sondaggio YouGov riguarda un solo paese e un solo anno. E gli studi sui vocali sono precedenti alle trascrizioni sul dispositivo, quindi lo spostamento di fatica che descrivono è ora in parte colmato dai messenger stessi.
In pratica dipende da come parli. Se parli per frasi pulite, la dettatura basta, e il tuo telefono ce l’ha già. Se parli come i parlanti di quei corpora, con gli intercalari contati da Clark e Fox Tree e le ripartenze catalogate da Shriberg, una trascrizione consegna a chi legge il tuo processo di stesura, e un passaggio di riscrittura è ciò che lo trasforma in un messaggio. Subtext è un’app che fa questo passaggio, per il vocale che registri e per quello che hai ricevuto, e se il tuo problema è una risposta che continui a rimaneggiare, perché una risposta breve richiede un’ora parla di quel giro. Prova Subtext nel browserInquadralo con la fotocamera del telefono per installare l'app.Prova Subtext nel browser
Fonti
Numerate nell’ordine in cui compaiono sopra. Le pagine sono state verificate il 4 e il 5 ottobre 2026, e l’informativa sulla privacy di Subtext è stata riaperta il 10 ottobre 2026.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), da 153 a 169. Studio di corpus sulla conversazione in inglese americano; frequenze e tipi di disfluenza.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Articolo di conferenza; il PDF non riporta l’anno e i riferimenti citati arrivano al 1996. Corpora etichettati a mano di 40.515 parole da 30 parlanti (Switchboard) e 12.762 parole da 523 parlanti (AMEX, telefonate tra dipendenti SRI e agenti di viaggio). Finanziato da DARPA e NSF. . Verificato il 5 ottobre 2026.
- Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), da 73 a 111. Frequenze degli intercalari per parlante dal corpus London-Lund.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), da 7684 a 7689. Cinque sistemi commerciali, 42 parlanti bianchi e 73 neri, 19,8 ore di audio.
- Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Solo abstract; il testo completo non era raggiungibile al momento del controllo.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv preprint.
- OpenAI. Whisper README. GitHub. . Verificato il 4 ottobre 2026.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 segmenti audio di 437 partecipanti registrati in istituzioni statunitensi, con e senza afasia, passati dall’API di Whisper ad aprile e maggio 2023. Finanziato dal Pulitzer Center e dal Center for Social Sciences della Cornell.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Indagine su 1.003 persone e studio sul campo di due settimane su 6.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Pubblicato a dicembre 2017. Studio di laboratorio su 48 studenti universitari, 24 per lingua, che copiavano frasi su un iPhone. Due autori lavoravano per Baidu USA, il cui sistema vocale lato server, Deep Speech 2, girava su un server Baidu ed è stato testato tramite un’app per iPhone 6 Plus.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 studi, 18.573 partecipanti.
- Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Conversazioni telefoniche Switchboard.
- YouGov. How many Britons like voice notes? 14 giugno 2022. Sondaggio su 2.149 adulti britannici, rilevazione il 5 e 6 maggio 2022, 1.956 dei quali utenti di smartphone; le cifre sulla durata sono quote di chi ha dato una risposta. Tabelle dei risultati su . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Verificato il 4 e 5 ottobre 2026. Le percentuali seguono il testo dell’articolo di YouGov; le tabelle dei risultati danno totali leggermente diversi per chi non ama, per arrotondamento.
- Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), da 51 a 71. Chat WhatsApp in tedesco e in spagnolo; abstract letto tramite il record Crossref dell’editore, testo completo a pagamento.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Verificato il 4 ottobre 2026.
- Apple. Siri, Dictation & Privacy. Legal, ultimo aggiornamento 14 settembre 2026. . Verificato il 5 ottobre 2026.
- Google. Type with your voice. Gboard Help. . Verificato il 4 ottobre 2026.
- Google. Use advanced voice typing features. Gboard Help. . Verificato il 5 ottobre 2026.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Verificato il 5 ottobre 2026.
- Otter.ai. Convert Speech to Text. . Verificato il 4 ottobre 2026.
- Otter.ai. Supported languages. Otter Help Center, articolo modificato il 6 maggio 2026. . Verificato il 5 ottobre 2026.
- MacWhisper. Homepage. Pagina di marketing senza data, quindi mostra cosa pubblicizza il prodotto e non come funziona. . Verificato il 5 ottobre 2026.
- WhatsApp. Introducing Voice Message Transcripts. 21 novembre 2024. . Verificato il 4 ottobre 2026.
- Subtext, Termini, privacy e il tuo account. Informativa sulla privacy aggiornata il 26 luglio 2026. Verificato il 10 ottobre 2026.
- Google Play. Hot Tip: Speak your mind with Subtext. . Verificato il 4 ottobre 2026; la scheda mostrava 295 recensioni e 50K+ download su ogni store aperto, e 4,3 stelle su quello tedesco.
- Jones, D. A., e cinque coautori (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, da 1585 a 1588. 32 madrelingua inglesi reclutati, 28 analizzati. Sponsorizzato dalla DARPA con il contratto Air Force F19628-00-C-0002.
- Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Test di comprensione con 16 partecipanti e 15 messaggi in segreteria; cifre lette dal PDF ospitato dall’autore. Finanziato da un premio EPSRC ROPA, GR/R23954.