ArtikelSchreib-Tools

Warum das Transkript einer Sprachnachricht noch keine Textnachricht ist

Einfaches Diktieren macht aus einer Sprachnachricht Text, behält aber meist Füllwörter, Neuansätze und die Reihenfolge, in der dir die Dinge eingefallen sind. Was die Forschung sagt und was ein Umschreibschritt ergänzt.

Von Samet Durgun · Mitgründer von Subtext · 19 Min. Lesezeit

Gesprochene Sprache enthält Füllwörter, Satzabbrüche und Korrekturen mitten im Satz, die fertige Texte meist nicht haben. Das reine Transkript einer Sprachnachricht ist deshalb noch keine Nachricht. Handys tippen mit, was du gesagt hast, und das tun auch Otter, die Transkripte von WhatsApp und Apps auf Basis offener Spracherkennungsmodelle, aber das Transkript einer abschweifenden Sprachnachricht ist immer noch eine abschweifende Nachricht. Es behält das „ähm“, die Korrektur, die du auf halbem Weg gemacht hast, und die Reihenfolge, in der dir die Dinge zufällig eingefallen sind. Eine App, die aus einer Sprachnachricht eine klare Textnachricht macht, muss nach der Transkription eine zweite Aufgabe erledigen. Sie muss herausfinden, was du gemeint hast, und das aufschreiben.

Die erste Hälfte ist Forschung. Die Sprachwissenschaft hat gemessen, wie sich gesprochene von geschriebener Sprache unterscheidet, die Spracherkennungsforschung hat gemessen, wo die Transkription versagt und bei wem, und ein paar Studien haben gefragt, warum Menschen Sprachnachrichten schicken und warum Empfangende sie aufschieben. Die zweite Hälfte handelt davon, was die Diktierfunktionen leisten, die die meisten schon besitzen, was ein Umschreibschritt ergänzt und was Subtext mit einer Sprachnachricht macht.

Ich bin Mitgründer von Subtext, wo Sprache einer von drei Wegen hinein ist, neben einem getippten Entwurf und einem Screenshot eines Gesprächs, und habe deshalb ein Interesse an der Antwort. Jede Quelle unten habe ich selbst geöffnet. Wo ich nur ein Abstract erreichen konnte, sage ich das und zitiere keine Zahl daraus.

Sprache entsteht anders als Schrift

Spontane Sprache ist voller Material, das die Schrift weglässt. Elizabeth Shriberg beziffert in ihrer Übersicht zu Disfluenzen in mehreren Korpora spontaner amerikanisch-englischer Sprache die Rate auf bis zu zehn Prozent der Wörter und mehr als ein Drittel der Äußerungen1. Die Formen sind gefüllte Pausen („uh“, „um“), Wiederholungen („I I think“), Selbstkorrekturen, bei denen mitten im Satz ein Wort ersetzt wird, und Satzabbrüche, die sie unter Tilgungen einordnet, bei denen ein Teilsatz aufgegeben und neu begonnen wird. In den beiden Korpora zu Gesprächen zwischen Menschen, die sie untersuchte, informellen Telefongesprächen und Anrufen zur Reiseplanung, lag die Rate pro Wort bei etwa sechs Prozent1, in Stichproben von 40.515 und 12.762 Wörtern, die in ihrem SRI-Papier zu denselben Korpora von Hand annotiert wurden2. In einem Korpus von Menschen, die über eine Sprechtaste mit einem Computer redeten, fiel die Rate unter ein Prozent, und sie führt einen Teil des Rückgangs auf die Taste zurück. Die Sprechenden konnten die Äußerung erst planen und dann aufnehmen1. Bei einer Sprachnachricht tippst du einmal und redest, und das Planen passiert laut.

Gesprochene Füllwörter und wie stark sich Sprechende unterscheiden

Gesprochene Füllwörter sind kein Rauschen, und das ist ein Grund, warum sie sich so schwer herausfiltern lassen. Herbert Clark und Jean Fox Tree argumentierten anhand mehrerer großer Korpora, dass „uh“ und „um“ eigene Wörter sind, so geplant und gebildet wie alle anderen, und dass sie eine kurze oder lange Verzögerung ankündigen, während die sprechende Person nach dem nächsten Wort sucht oder entscheidet, was sie sagen will3. Außerdem unterscheiden sie sich enorm von Person zu Person. Im London-Lund-Korpus, rund 170.000 Wörter aus 50 britischen Gesprächen von Angesicht zu Angesicht, aufgenommen zwischen 1961 und 1976, überwiegend unter Akademikern, reichten die 65 Sprechenden, die jeweils mehr als 1.000 Wörter beisteuerten, von 1,2 bis 88,5 Füllwörtern pro 1.000 Wörter, bei einem Median von 17,33. Manche Transkripte kommen fast sauber heraus, andere tragen etwa alle zwölf Wörter ein Füllwort.

Disfluenzen häufen sich auch dort, wo die Planung am aufwendigsten ist. Shriberg merkt unter Verweis auf frühere Arbeiten an, dass sie früh in einer Phrase wahrscheinlicher sind1. In einer Sprachnachricht ist das der Anfang, an dem du noch entscheidest, wozu die Nachricht überhaupt dient. Beim Schreiben kannst du diesen Anfang löschen, bevor ihn jemand sieht. In einer Sprachnachricht geht er meistens mit raus, es sei denn, du nimmst die ganze Nachricht noch einmal auf.

Wie sich Fehler der Spracherkennung nach Sprechenden unterscheiden

Die Transkription fügt zu dem, was du gesprochen hast, eigene Fehler hinzu. Die klarste Messung, die ich gefunden habe, ist eine Studie von 2020 in PNAS, die fünf kommerzielle Spracherkenner von Amazon, Apple, Google, IBM und Microsoft über 19,8 Stunden Interviewaudio von 42 weißen und 73 Schwarzen amerikanischen Sprechenden laufen ließ4. Die durchschnittliche Wortfehlerrate lag bei 0,19 für weiße und 0,35 für Schwarze Sprechende, und jedes System zeigte die Lücke. Am besten schnitt Microsoft ab, mit 0,15 und 0,27. Am schlechtesten Apple, mit 0,23 und 0,45. Bei mehr als 20 Prozent der Clips Schwarzer Sprechender kam mindestens die Hälfte der Wörter falsch zurück, bei den weißen Sprechenden bei weniger als 2 Prozent der Clips4. Die Autorinnen und Autoren führen die Lücke auf die akustischen Modelle zurück, also den Teil, der Klang auf Wörter abbildet, und verweisen auf zu wenig Audio von Schwarzen Sprechenden in den Trainingsdaten.

Ein zweites Muster in derselben Arbeit ist für Sprachnachrichten wichtig. Die Systeme schnitten bei männlichen Sprechern etwas schlechter ab, was die Autorinnen und Autoren auf einen informelleren Stil mit kürzeren, stärker reduzierten Aussprachen und mehr Disfluenzen zurückführen4, das Register einer Sprachnachricht an einen Freund.

Akzente, Zweitsprachen und Wörter, die niemand gesagt hat

Spracherkennung schneidet auch bei Akzenten und bei Sprache in der Zweitsprache schlechter ab. Eine Arbeit von 2024 in JASA Express Letters testete OpenAIs Whisper-Modell an englischen Akzenten und berichtete höhere Genauigkeit für Muttersprachler als für Sprechende mit Englisch als Zweitsprache, bessere Ergebnisse für amerikanisches Englisch als für britisches oder australisches und bessere Ergebnisse bei vorgelesener Sprache als im Gespräch5. Ich konnte nur das Abstract erreichen, deshalb nenne ich die Richtung und keine Zahl. Whisper wurde mit 680.000 Stunden Audio trainiert, und seine Autoren beschreiben, dass die Modelle sich der menschlichen „accuracy and robustness“ annähern6. Die eigene Dokumentation ergänzt, dass „performance varies widely depending on the language“7. Ein Durchschnitt über viele Sprechende sagt wenig über eine müde Sprachnachricht in deiner Zweitsprache. Wenn diese Sprache Englisch ist, kann eine korrekte Nachricht auf Muttersprachler trotzdem schroff wirken, und ein Transkript sagt dir das nicht.

Whisper kann außerdem Wörter hinzufügen, die niemand gesagt hat. Eine Studie von 2024 ließ 13.140 kurze englische Clips von 437 Teilnehmenden, aufgenommen an US-Einrichtungen, mit und ohne Aphasie, im April und Mai 2023 durch OpenAIs gehostete Whisper-API laufen. Etwa ein Prozent der Transkriptionen enthielt ganze Phrasen oder Sätze, die im Audio nicht vorkamen, und 38 Prozent davon trugen mindestens einen ausdrücklichen Schaden in sich, etwa Gewalt oder die falsche Behauptung einer Autorität. Clips mit langen Pausen waren stärker gefährdet. Bei den 187 Clips, bei denen Whisper Text erfunden hatte, lieferten Google, Amazon, Microsoft, AssemblyAI und RevAI keine vergleichbaren Erfindungen. Die Clips waren Interviews, keine Sprachnachrichten, und die Studie testete die API so, wie sie 2023 war8.

Warum Menschen Sprachnachrichten schicken

Menschen schicken Sprachnachrichten, weil sie für die Absendenden schnell gehen. Die größte Studie, die ich gefunden habe, stammt von der Universität Ulm, eine Umfrage von 2020 unter 1.003 Personen, rekrutiert über Amazon Mechanical Turk, überwiegend in den Vereinigten Staaten, dazu eine zweiwöchige Feldstudie mit sechs Vielnutzern9. In der Umfrage hatten 83 Prozent schon eine Sprachnachricht erhalten und 73 Prozent schon eine gesendet. Die Gründe fürs Senden, entnommen aus 735 offenen Antworten von Personen, die eine Sprachnachricht aufgenommen hatten, ordneten sich in vier Themen. Die Zahlen der Themen ergeben mehr als die 735 Antworten, manche Antworten fielen also unter mehr als ein Thema. Bequemlichkeit, weil Sprechen auf dem Handy schneller ist als Tippen, wurde 359 Mal genannt. Der Ton und die Emotion, die eine Stimme transportiert und Text verliert, 229 Mal. Situationen, in denen Tippen umständlich oder unsicher ist, etwa beim Autofahren, 203 Mal. Und die empfangende Person, die um Sprache gebeten hatte oder es einfacher fand, 34 Mal.

Eine Laborstudie hat die Geschwindigkeit gemessen. Ihre 48 Studierenden, 24 davon englische Muttersprachler, tippten kurze Phrasen auf einem iPhone ab, und die englische Spracheingabe lief mit 153 Wörtern pro Minute gegen 52 auf der Tastatur, um den Faktor 2,93 schneller, auch wenn die Sprache etwas mehr unkorrigierte Fehler im endgültigen Text hinterließ, 0,55 Prozent gegen 0,35 Prozent. Die Aufgabe war das Abschreiben vorgegebener Phrasen, was wenig darüber sagt, wie man eine Nachricht verfasst. Zwei der Autoren arbeiteten für Baidu, dessen serverseitiger Erkenner Deep Speech 2 über eine App auf einem iPhone 6 Plus getestet wurde, in einer Arbeit, die 2017 erschien10.

Sprachnachrichten verlagern den Aufwand auf die empfangende Person

In der Ulmer Feldstudie reichten 438 Sprachnachrichten, die über zwei Wochen protokolliert wurden, von 1,5 Sekunden bis knapp über sieben Minuten, bei einem Median von 17,5 Sekunden9. Die Autorinnen und Autoren weisen außerdem auf Kosten hin, die anfallen, bevor eine empfangende Person etwas hört. Schall ist flüchtig, deshalb ist eine Aufnahme umständlich durchzusehen und zu bearbeiten, und ein Versprecher bedeutet, die ganze Nachricht neu aufzunehmen9. Fünf der zwölf abgebrochenen Aufnahmen in ihrer Feldstudie waren genau das.

Die Autoren schreiben, dass Sprachnachrichten den Aufwand zur Empfängerseite verschieben, mit ihren Worten „shift the effort necessary for communication towards the receiver“9. Das Verfassen geht schnell, das Abrufen kostet mehr Zeit und Mühe als das Lesen eines Textes mit demselben Inhalt, und die meisten ihrer Feldteilnehmenden schoben Sprachnachrichten bei der Arbeit auf, weil ein Text auf einen Blick erfasst werden kann und eine Aufnahme nicht. Ihr Vorschlag für eine Lösung, 2020, waren automatische Transkripte, damit Datum und Ort eines Termins, die in einer Aufnahme vergraben sind, durch Überfliegen gefunden werden können.

Warum Empfangende sie aufschieben

Empfangende können nicht überfliegen, also hören sie noch einmal nach, was sie gehört haben. In derselben Feldstudie spielten Menschen eine erhaltene Sprachnachricht im Durchschnitt 1,37 Mal ab, und eine Nachricht wurde 13 Mal abgespielt9. Beim Lesen braucht es die Wiederholung nicht. Eine Metaanalyse von 2019 mit 190 Studien und 18.573 Teilnehmenden beziffert das durchschnittliche stille Lesen englischer Sachtexte auf 238 Wörter pro Minute11. Gesprächssprache läuft mit etwa 196 Wörtern pro Minute, wenn man das ganze Gespräch zählt, und mit etwa 164 innerhalb der eigenen Redebeiträge einer Person, in einem großen Telefonkorpus12. Wer liest, bestimmt außerdem das Tempo und kann direkt zur Frage springen. Wer zuhört, bekommt die Wörter im Tempo der sprechenden Person, in deren Reihenfolge.

Beliebt sind sie nicht, und das Empfangen ist ein wenig beliebter als das Senden. Eine YouGov-Umfrage unter 2.149 britischen Erwachsenen, durchgeführt am 5. und 6. Mai 2022 und im Juni desselben Jahres veröffentlicht, fragte die Smartphone-Nutzenden darunter, 1.956 Personen, nach Sprachnachrichten. Davon sendeten 16 Prozent sie gern und 36 Prozent ungern. Beim Empfangen mochten es 22 Prozent, 25 Prozent mochten es nicht und 29 Prozent waren zwiegespalten13. Nur bei den 18- bis 24-Jährigen mochten mehr Menschen das Empfangen als es nicht mochten, 43 zu 28 Prozent, und selbst in dieser Gruppe mochte die Hälfte das Senden nicht, gegen 30 Prozent, die es mochten. Von allen Smartphone-Nutzenden hatten 63 Prozent noch nie eine gesendet.

Wie lang ist zu lang für eine Sprachnachricht?

In einer YouGov-Umfrage unter britischen Smartphone-Nutzenden vom Mai 2022 sagten 65 Prozent derjenigen, die eine Antwort gaben, eine einminütige Sprachnachricht sei zu lang, und unter denen, die das Empfangen nicht mögen und antworteten, waren 57 Prozent schon bei 30 Sekunden frustriert. Über alle Smartphone-Nutzenden hinweg wussten 27 Prozent nicht, wo die Grenze liegt. Gefragt, wie sie eine lange Nachricht am liebsten erhalten, wählten 78 Prozent Text und 14 Prozent eine Sprachnachricht, was nur eine geäußerte Präferenz festhält13. Manche Sendende scheinen zu wissen, dass die Aufnahme eine Zumutung ist. Eine Analyse von WhatsApp-Chats aus Deutschland und Spanien von 2024 fand, dass Menschen ihre Wahl von Audio vor, in und nach der Nachricht begründen, und die Autoren beschreiben diese Begründungen als Beziehungsarbeit, zu der auch gehört, die Sprachnachricht als etwas darzustellen, wofür eine Entschuldigung angebracht ist14. Über diese drei Quellen hinweg spart die sendende Person Aufwand und die empfangende zahlt dafür, und manche Sendende entschuldigen sich dafür.

Was Apples Diktierfunktion mit einer Sprachnachricht macht

Die Diktierfunktion gibt dir die Wörter in der Reihenfolge, in der du sie gesagt hast, und bei Apples Diktierfunktion ist das schon die ganze Aufgabe. Apples iPhone-Handbuch für iOS 27 beschreibt die Diktierfunktion als auf dem Handy verarbeitet, ohne Internetverbindung, in vielen Sprachen, wobei Kommas, Punkte und Fragezeichen automatisch gesetzt werden, wo die Sprache das unterstützt15. Auf den neuesten Handys verbessert ein Modell auf dem Gerät Rechtschreibung, Zeichensetzung und Großschreibung, auf Englisch. Alles andere ist ein gesprochener Befehl. Du sagst „neue Zeile“, du sagst „löschen“ und dann die Phrase. Die Aussage zur Verarbeitung auf dem Gerät hat eine Bedingung. Apples Datenschutzseite sagt, dass das, was du diktierst, an Apples Server geschickt wird, wenn die Tastatureinstellungen nicht anzeigen, dass die Diktierfunktion auf dem Gerät verarbeitet wird, und nicht gespeichert wird, es sei denn, du willigst in „Siri und Diktierfunktion verbessern“ ein. Sie sagt auch, dass Apple Anfrageverlauf und Transkripte aufbewahren kann, verknüpft mit einer zufälligen Gerätekennung und nicht mit deinem Apple Account, bis zu zwei Jahre16. Die Seite sagt nicht, wie beides zusammenpasst. Das Umschreiben ist Aufgabe von Apples separaten Schreibwerkzeugen, die keine Einschätzung geben, wie ein Text ankommt.

Was die Spracheingabe von Google und Microsoft leistet

Googles einfache Spracheingabe in Gboard gibt dir wie Apples Diktierfunktion die Wörter so, wie du sie gesagt hast. Tippe auf das Mikrofon, sag, was geschrieben werden soll, und sprich die Satzzeichen mit, wobei Spracheingabe und Satzzeichen nicht in jeder Sprache verfügbar sind17. Die erweiterte Spracheingabe auf dem Pixel 6 und neuer setzt beim Sprechen Satzzeichen, und auf dem Pixel 9 (ohne 9a) und neuer kann ein Sprachbefehl das Diktierte korrigieren, umformulieren, kürzen oder verlängern. Google sagt, das laufe auf dem Gerät, auf Englisch, Französisch, Italienisch, Japanisch und Spanisch, Deutsch folge bald18. Unter Windows sagt Microsofts Hilfeseite, dass Flüssiges Diktat, eine Funktion von Copilot+ PCs, Grammatik, Zeichensetzung und Füllwörter korrigiert, während du sprichst19. Die erweiterte Spracheingabe schreibt nur um, wenn du einen Sprachbefehl gibst. Flüssiges Diktat läuft ohne Befehl, aber nur auf Copilot+ PCs, und seine Hilfeseite erwähnt kein Umordnen der Nachricht. In den hier zitierten Hilfeseiten von Apple, Google und Microsoft habe ich keine Funktion gefunden, die eine ganze abschweifende Sprachnachricht standardmäßig in eine sendefertige Nachricht verwandelt.

Was Transkriptions-Apps und Messenger leisten

Otter, eine Transkriptions-App, geht einen Schritt weiter als eine Handytastatur. Die Seite zur Sprache-zu-Text-Funktion beschreibt ein Transkript mit Sprecherlabels und Zeitstempeln, eine automatisch erzeugte Zusammenfassung mit Highlights sowie extrahierte Kernpunkte und Aufgaben20. Otters Hilfecenter nennt Englisch, Spanisch, Französisch, Deutsch, Japanisch und Chinesisch (vereinfacht) als unterstützte Sprachen21, mehr, als die Seite zur Sprache-zu-Text-Funktion nennt. Die App ist für Meetings gebaut, verdichtet also, was gesagt wurde, und auf diesen beiden Seiten habe ich keine Funktion gefunden, die entwirft, was du senden wolltest. Offene Spracherkennungsmodelle stecken unter manchen Apps. Whisper selbst erzeugt ein Transkript und ein Sprachlabel7. Die darauf aufbauenden Apps unterscheiden sich. MacWhisper wirbt mit dem Entfernen von Füllwörtern, Zusammenfassungen und eigenen Prompts auf dem Transkript und bietet für diesen Schritt lokale oder Cloud-Modelle an22.

Die Messenger haben begonnen, die Sprachnachrichten zu transkribieren, die du erhältst. WhatsApp hat im November 2024 Transkripte für Sprachnachrichten eingeführt, auf dem Gerät erzeugt, sodass WhatsApp sie selbst nicht lesen kann, einschaltbar unter Einstellungen und Chats und ausgelöst durch langes Drücken auf die Nachricht23. Der Beitrag sagt, die Transkripte starteten in einigen ausgewählten Sprachen, und ich konnte die aktuelle Liste nicht bestätigen. Das löst das Problem, das die Ulmer Autorinnen und Autoren benannt haben, nämlich dass sich eine Aufnahme nicht überfliegen lässt, sofern die Sprache abgedeckt ist. Was du bekommst, ist ein Transkript des lauten Denkens eines anderen. Du kannst es in einem Meeting lesen, aber die Antwort musst du immer noch selbst schreiben.

Was ein Umschreibschritt ergänzt

Ein Umschreibschritt macht aus dem Transkript die Nachricht, die du getippt hättest, wenn Tippen nichts kosten würde. Er streicht die Füllwörter, die Clark und Fox Tree beschreiben, fasst die Wiederholungen und Satzabbrüche aus Shribergs Einteilung zusammen und setzt die Korrektur, die du auf halbem Weg gemacht hast, dorthin, wo sie hingehört, nämlich an die Stelle dessen, was sie korrigiert hat. Er ordnet auch um. Gesprochene Erklärungen kommen tendenziell so heraus, wie sie dir eingefallen sind, erst der Kontext und zuletzt die Bitte, oder erst die Bitte und die Gründe hinterher. Eine geschriebene Nachricht kann mit der Kernaussage beginnen.

Zwei Dinge muss der Schritt in Ruhe lassen. Das erste ist die Bedeutung. Ein Umschreiben, das deine Sprachnachricht zu einer anderen Bitte glättet, ist schlechter als das Transkript, denn das Transkript hat wenigstens gesagt, was du gesagt hast. Das zweite ist der Ton. Wenn du warm warst oder direkt oder scherzhaft, sollte die geschriebene Fassung derselbe Mensch sein. Die Gefahr ist die, um die es in Klingen deine Nachrichten mit KI wie von einem Roboter? geht, nämlich ein Umschreiben, das höflich und austauschbar zurückkommt.

Dazu kommt ein Urteil, das ein Transkript nie fällen muss. Einiges von dem, was du in einer Sprachnachricht gesagt hast, war für dich und nicht für die empfangende Person. Laut zu überlegen, ob du etwas erwähnen sollst, heißt nicht, dass du es erwähnen wolltest. Ein Umschreibschritt muss entscheiden, was die Nachricht war und was das Entwerfen, und diese Entscheidung kann in beide Richtungen schiefgehen, indem ein Satz bleibt, den du dir gerade ausreden wolltest, oder einer wegfällt, den du meintest. Ich habe keine Studie gefunden, die gemessen hätte, wie oft das bei irgendeinem Werkzeug passiert, Subtext eingeschlossen.

Was Subtext mit einer Sprachnachricht macht

Subtext transkribiert die Sprachnachricht, die du in der App aufnimmst, schreibt dann die Nachricht aus dem, was du gemeint hast, und gibt bis zu drei Versionen zurück, jede mit einem „kann so raus“-Wert dafür, wie wahrscheinlich sie so ankommt, wie du es gemeint hast. Die Versionen sind darauf angelegt, deine Bedeutung und deine Persönlichkeit zu erhalten. Bei einem ersten Entwurf bleibt eine nah an deinen Worten mit behobenen Problemen, eine ist ein wärmerer Feinschliff oder ein anderer Ansatz, und eine ist eine gründlichere Neufassung. Wenn die Formulierung kälter oder schärfer klingt, als du wolltest, benennt die App das Problem und markiert die Wörter, die dafür verantwortlich sind. Nichts wird für dich gesendet.

Die Anweisungen an das Modell decken Transkriptionsartefakte ab, und ich habe die Backend-Prompts gelesen, bevor ich das hier schrieb. Wenn eine Nachricht als diktiert gekennzeichnet ist, wird dem Modell gesagt, es solle falsch verstandene oder verschmolzene Wörter, seltsame Zeichensetzung und verirrte Füllwörter erwarten, sich bis zur gemeinten Formulierung durchlesen und das stillschweigend korrigieren, ohne es dir als Fehler anzukreiden. Der Prompt zeigt, was dem Modell gesagt wird. Eine unabhängige Bewertung von Subtexts Spracherkennung oder Umschreiben habe ich nicht gefunden, alles hier beruht also auf dem, was die App zeigt und was ihre Prompts und ihre Datenschutzerklärung sagen. Da keine der obigen Studien Deepgram getestet hat, das Spracherkennungsmodell, das Subtexts Audio transkribiert, kann ich nicht sagen, wie weit sich die Fehlermuster bei Akzenten, Sprache in der Zweitsprache und lockerem Stil darauf übertragen, also lies die Nachricht vor dem Senden noch einmal durch.

Was passiert in Subtext mit einer Sprachaufnahme?

Subtext schickt eine Sprachaufnahme zur Transkription an Deepgram, das Audio verlässt also das Handy. Die Datenschutzerklärung, aktualisiert am 26. Juli 2026, nennt mehrere Anbieter, darunter Deepgram für Sprachaufnahmen, Anthropic für Text, Bilder und Sprachtranskripte, Google Firebase für Konten und Gespräche und OpenAI nur, wenn du das Vorlesen einschaltest. Die Erklärung ergänzt, dass bei eingeschalteter Websuche Suchbegriffe aus deiner Anfrage über Anthropic an Suchanbieter Dritter gehen und dass du die Websuche in den Einstellungen der App ausschalten kannst24. Laut Erklärung wird nichts, was du einreichst, zum Training eines KI-Modells verwendet, und keiner ihrer KI-Anbieter darf damit trainieren, wobei Subtext für Sprache außerdem das Opt-out von Deepgram für die Modellverbesserung gesetzt hat. Laut Erklärung löscht Subtext seine eigene Kopie eines Gesprächs fünf Tage nach deiner letzten Nutzung von seinen Servern, oder nach 90 Tagen, wenn du es anpinnst. Laut Erklärung bewahrt Deepgram Audio mit gesetztem Opt-out nur so lange auf, wie die Transkription dauert, und Anthropic löscht Eingaben und Ausgaben innerhalb von 30 Tagen und kann markierte Anfragen bis zu zwei Jahre und zugehörige Sicherheitsbewertungen bis zu sieben Jahre aufbewahren. Laut Erklärung hat Subtext mit keinem von ihnen eine Zero-Retention-Vereinbarung24. Wie andere Assistenten mit deinem Text umgehen, vergleicht welche KI-Schreibassistenten mit deinen Nachrichten trainieren.

Welche Sprachen unterstützt Subtext?

Subtext schreibt die Nachricht in der Sprache, in der du gesprochen hast, in 17+ Sprachen, und behält die Förmlichkeit bei, die du gewählt hast, wo die Sprache eine Unterscheidung kennt. Eine Sprachnachricht auf Deutsch kommt als deutsche Nachricht zurück. Die Zusammenfassung einer Sprachnachricht, die du erhalten hast, wird in der Sprache geschrieben, in der sie ankam. Die Redaktion von Google Play hat diesen Ablauf in einem „Hot Tip“-Beitrag vorgestellt, der beschreibt, wie man auf das Mikrofonsymbol tippt, spricht, erneut tippt und eine verfeinerte Nachricht mit Tags dazu erhält, wie das Original ankam, plus eine Schaltfläche zum Kopieren25. Als ich die Seite am 4. Oktober 2026 öffnete, zeigte der Eintrag im deutschen Store 4,3 Sterne bei 295 Bewertungen und mehr als 50.000 Downloads, nur eine Zahl von Google Play, und die Sternezahl unterscheidet sich je nach Land. Subtext ist kostenpflichtig, mit ein paar kostenlosen Analysen zum Einstieg. Eine aufgenommene Sprachnachricht kommt zurück als eine Nachricht, die du senden kannst.

Wie antwortest du auf eine lange Sprachnachricht, die dir jemand geschickt hat?

Subtext liest auch die Sprachnachrichten, die andere dir schicken, und auf dieser Seite reicht ein einfaches Transkript am ehesten aus. Das Transkript von WhatsApp auf dem Gerät lässt dich eine zweiminütige Aufnahme lesen, wo deine Sprache abgedeckt ist23. Was es nicht tut, ist dir zu sagen, was die Person von dir will. Das Beispiel der Ulmer Studie war ein Datum und ein Ort, die im Audio vergraben waren9. Eine lange Sprachnachricht von einem Freund oder einer Führungskraft hat dieselbe Form, die Frage irgendwo in der Mitte und die Gründe drumherum. Für Menschen, die bei Antworten hängen bleiben, ist das Lesen eine von fünf Stellen, an denen eine Antwort stecken bleibt, und die meisten Feldteilnehmenden in Ulm schoben Sprachnachrichten bei der Arbeit auf, weil sich eine Aufnahme nicht auf einen Blick erfassen lässt9.

Gib Subtext eine erhaltene Sprachnachricht, und es transkribiert sie, fasst in einer Zeile zusammen, was die Person von dir will, und ergänzt zwei bis fünf Handlungspunkte. Danach kann es eine Antwort entwerfen, die den Faden aufnimmt, und es benennt den Ton des Absenders nicht. Die Backend-Prompts behandeln eine Sprachdatei, die du anhängst, als höchstwahrscheinlich von der anderen Person an dich geschickt, und wenn das Modell unsicher ist, wer wer ist, soll es nachfragen. Die Zusammenfassung ist nur so gut wie die Transkription darunter, und eine Zeile ist ohne ihren Kontext schwer zu lesen, wie was dieser Text bedeutet zeigt. Bei einem starken Akzent oder einer verrauschten Aufnahme wird die Transkription mehr Fehler enthalten als bei Studio-Englisch, also spiel das Original ab, bevor du auf etwas Wichtiges antwortest. Text und Screenshots laufen durch denselben Zusammenfassungsschritt, deshalb bekommt eine Nachricht, die du erhalten hast, dieselbe einzeilige Zusammenfassung.

Die nächsten Experimente sind alt und klein

Die zwei nächsten Experimente, die ich zu einem Umschreibschritt oder einer Zusammenfassung gefunden habe, stammen von 2003 und 2005, und beide sind klein. 2003 ließ ein von DARPA gefördertes Experiment 28 englische Muttersprachler Passagen von 150 bis 250 Wörtern aus Telefon- und Rundfunksprache lesen, als wörtliche Transkripte und als von Hand bereinigte. Die Lesenden bewerteten den bereinigten Text als leichter verständlich, beantworteten Fragen dazu aber nicht genauer oder schneller, was die Autoren darauf zurückführen, dass die Lesenden ohnehin schon fast die Höchstpunktzahl erreichten. Die automatische Bereinigung unvollkommener Erkennerausgaben wurde tendenziell als schwerer bewertet als die unbereinigte Fassung, wenn auch nur geringfügig26. Die Bereinigung entfernte Disfluenzen und korrigierte die Zeichensetzung, schrieb den Text aber nicht zu einer Nachricht um.

2005 beantworteten 16 Personen Fragen zu 15 Voicemails anhand automatisch extrahierter Zusammenfassungen. Zusammenfassungen aus erkannter Sprache hatten den Namen der anrufenden Person in 57 Prozent der Fälle richtig, gegen 94 Prozent bei Zusammenfassungen aus menschlichen Transkripten, während der Anrufgrund gleich gut ankam, bei 78 Prozent. Menschen verlangten das Original-Audio öfter, wenn die Zusammenfassung aus erkannter Sprache stammte, in 53 Prozent der Fälle gegen 30 Prozent27. Das waren extraktive Zusammenfassungen von Voicemails mit der Spracherkennung von 2005, die Studie setzt also nur eine Erwartung. Keine der beiden Studien hat eine Nachricht gemessen, die jemand senden würde.

Wo die Belege enden

Die starken Belege liegen an den beiden Enden. Gesprochene Sprache enthält Disfluenzen in einer gemessenen Rate, die Schrift nicht hat, und Spracherkennung macht bei manchen Sprechenden mehr Fehler als bei anderen, wie die Zahlen oben zeigen. Die Mitte ist dünner. Ich habe keine Studie gefunden, die gemessen hätte, wie viel besser eine umgeschriebene Sprachnachricht ankommt als ein rohes Transkript oder wie oft ein Umschreiben dabei die Bedeutung verändert. Die Forschung zu Sprachnachrichten besteht aus einer Handvoll Studien, die größte mit einer Umfragestichprobe von einer US-Crowdworking-Plattform und einer Feldstudie mit sechs Personen. Die YouGov-Umfrage gilt für ein Land und ein Jahr. Und die Studien zu Sprachnachrichten sind älter als Transkripte auf dem Gerät, die beschriebene Verlagerung des Aufwands ist also inzwischen teilweise von den Messengern selbst aufgefangen worden.

In der Praxis kommt es darauf an, wie du sprichst. Wenn du in sauberen Sätzen sprichst, reicht Diktieren, und dein Handy hat es schon. Wenn du so sprichst wie die Sprechenden in diesen Korpora, mit den Füllwörtern, die Clark und Fox Tree gezählt haben, und den Neustarts, die Shriberg katalogisiert hat, gibt ein Transkript der empfangenden Person deinen Entwurfsprozess, und ein Umschreibschritt macht daraus eine Nachricht. Subtext ist eine App, die diesen Schritt übernimmt, für die Sprachnachricht, die du aufnimmst, und für die, die du erhalten hast, und wenn dein Problem eine Antwort ist, die du immer wieder überarbeitest, geht es in warum eine kurze Antwort eine Stunde dauert genau um diese Schleife. Subtext im Browser ausprobierenSubtext im Browser ausprobieren

Quellen

Nummeriert in der Reihenfolge des ersten Auftretens. Die Seiten wurden am 4. und 5. Oktober 2026 geprüft, und die Datenschutzerklärung von Subtext wurde am 10. Oktober 2026 noch einmal geöffnet.

  1. Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 bis 169. Korpusstudie zu gesprochenem amerikanischem Englisch; Raten und Arten von Disfluenzen.
  2. Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferenzbeitrag; das PDF nennt kein Jahr, und die zitierten Referenzen reichen bis 1996. Von Hand annotierte Korpora mit 40.515 Wörtern von 30 Sprechenden (Switchboard) und 12.762 Wörtern von 523 Sprechenden (AMEX, Anrufe zwischen Mitarbeitenden von SRI und Reisebüros). Gefördert von DARPA und NSF. . Geprüft am 5. Oktober 2026.
  3. Clark, H. H. und Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 bis 111. Füllwortraten pro Sprechenden aus dem London-Lund-Korpus.
  4. Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D. und Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 bis 7689. Fünf kommerzielle Systeme, 42 weiße und 73 Schwarze Sprechende, 19,8 Stunden Audio.
  5. Graham, C. und Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Nur das Abstract; der Volltext war bei der Prüfung nicht erreichbar.
  6. Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C. und Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv-Preprint.
  7. OpenAI. Whisper README. GitHub. . Geprüft am 4. Oktober 2026.
  8. Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H. und Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 13.140 Audiosegmente von 437 Teilnehmenden, aufgenommen an US-Einrichtungen, mit und ohne Aphasie, im April und Mai 2023 durch die Whisper-API gelaufen. Gefördert vom Pulitzer Center und von Cornells Center for Social Sciences.
  9. Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F. und Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. Umfrage unter 1.003 Personen und eine zweiwöchige Feldstudie mit 6.
  10. Ruan, S., Wobbrock, J. O., Liou, K., Ng, A. und Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Veröffentlicht im Dezember 2017. Laborstudie mit 48 Studierenden, 24 pro Sprache, die Phrasen auf einem iPhone abtippten. Zwei Autoren arbeiteten für Baidu USA, dessen serverseitiges Spracherkennungssystem Deep Speech 2 auf einem Baidu-Server lief und über eine App auf einem iPhone 6 Plus getestet wurde.
  11. Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 Studien, 18.573 Teilnehmende.
  12. Yuan, J., Liberman, M. und Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard-Telefongespräche.
  13. YouGov. How many Britons like voice notes? 14. Juni 2022. Umfrage unter 2.149 britischen Erwachsenen, Feldzeit 5. und 6. Mai 2022, davon 1.956 Smartphone-Nutzende; die Längenangaben sind Anteile derjenigen, die geantwortet haben. Ergebnistabellen unter . https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. Geprüft am 4. und 5. Oktober 2026. Die Prozentwerte folgen dem Artikeltext von YouGov; die Ergebnistabellen weisen durch Rundung leicht abweichende Summen für das Nichtmögen aus.
  14. Sampietro, A. und König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 bis 71. Deutsche und spanische WhatsApp-Chats; Abstract über den Crossref-Eintrag des Verlags gelesen, Volltext hinter einer Bezahlschranke.
  15. Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . Geprüft am 4. Oktober 2026.
  16. Apple. Siri, Dictation & Privacy. Legal, zuletzt aktualisiert am 14. September 2026. . Geprüft am 5. Oktober 2026.
  17. Google. Type with your voice. Gboard Help. . Geprüft am 4. Oktober 2026.
  18. Google. Use advanced voice typing features. Gboard Help. . Geprüft am 5. Oktober 2026.
  19. Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . Geprüft am 5. Oktober 2026.
  20. Otter.ai. Convert Speech to Text. . Geprüft am 4. Oktober 2026.
  21. Otter.ai. Supported languages. Otter Help Center, Artikel bearbeitet am 6. Mai 2026. . Geprüft am 5. Oktober 2026.
  22. MacWhisper. Homepage. Marketingseite ohne Datum, sie zeigt also, was das Produkt bewirbt, und nicht, wie es abschneidet. . Geprüft am 5. Oktober 2026.
  23. WhatsApp. Introducing Voice Message Transcripts. 21. November 2024. . Geprüft am 4. Oktober 2026.
  24. Subtext, Nutzungsbedingungen, Datenschutz und dein Konto. Datenschutzerklärung zuletzt aktualisiert am 26. Juli 2026. Geprüft am 10. Oktober 2026.
  25. Google Play. Hot Tip: Speak your mind with Subtext. . Geprüft am 4. Oktober 2026; der Eintrag zeigte in jedem Store, den ich öffnete, 295 Bewertungen und 50K+ Downloads, und im deutschen Store 4,3 Sterne.
  26. Jones, D. A. und sechs weitere Autorinnen und Autoren (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 bis 1588. 32 englische Muttersprachler rekrutiert, 28 ausgewertet. Gefördert von DARPA im Rahmen des Air-Force-Vertrags F19628-00-C-0002.
  27. Koumpis, K. und Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). Verständnistest mit 16 Teilnehmenden und 15 Voicemails; Zahlen aus dem vom Autor gehosteten PDF gelesen. Gefördert durch einen EPSRC-ROPA-Award, GR/R23954.