
ArtikelSchreib-Tools
Funktionieren KI-Umschreibtools wirklich?
Vier Gruppen von Tools und vierzehn Studien darüber, was wirklich passiert, wenn KI deine Nachricht schreibt, und was in den letzten fünfzehn Sekunden vor dem Senden hilft.
Von Samet Durgun · Mitgründer von Subtext · 15 Min. Lesezeit
· Aktualisiert am 26. September 2026
Ich habe ein paar Wochen damit verbracht, alles zu lesen, was ich zu KI-Tools finden konnte, die persönliche Nachrichten umschreiben, teils weil ich selbst eins baue, teils weil ich wissen wollte, ob das, was ich über sie glaube, stimmt.
Das, was ich glaube, ist Folgendes. Wenn du einer KI eine schwierige Nachricht gibst, ist der nützliche Moment nicht die polierte Version, die sie dir zurückgibt. Der nützliche Moment liegt dreißig Sekunden davor, wenn dir etwas sagt, dass die Nachricht, die du schon geschrieben hast, schlecht ankommen wird, und warum.
Also habe ich nach einem Tool gesucht, das genau das tut. Ich habe keines gefunden, das es schon gibt, und das ist ungefähr der Grund, warum wir am Ende Subtext gebaut haben. Rechne mich entsprechend voreingenommen und prüf die Studien selbst nach. Dann habe ich nach der Forschung darüber gesucht, was passiert, wenn Menschen KI ihre persönlichen Nachrichten schreiben lassen, und das war deutlich interessanter als die Produkte.
Was folgt, ist das, was ich gefunden habe, alles verlinkt, damit du mich überprüfen kannst.
Die meisten Produkte in dieser Kategorie machen genau eine Sache
Lässt du die Downloadzahlen beiseite und sortierst diese Tools danach, was sie tun, fallen sie in vier Gruppen zusammen, und die meisten davon enden am selben Punkt.
Zu Gruppe eins gehören die Tools, die schon auf deinem Handy sind. Apple Intelligence Writing Tools1 laufen systemweit ab iOS 18.1. Du markierst Text und bekommst Korrekturlesen, Umschreiben in drei Tonlagen (freundlich, professionell, knapp) und Verfassen, was die Anfrage an ChatGPT weiterreicht. Kostenlos, wenn deine Hardware es unterstützt, sprich ab iPhone 15 Pro. Samsung Writing Assist2 macht auf One UI dasselbe, mit Tonwechseln, Antwortvorschlägen und Live Translate. Gboard3 bringt Smart Reply, Korrekturlesen und Umformulierungstools, die auf neueren Geräten mit Gemini Nano laufen. Alles kostenlos.
Zu Gruppe zwei gehören die Assistenten in der Messaging-App selbst. Magic Compose4 setzt Antwortvorschläge über die Tastatur in Google Messages und schreibt Entwürfe in Stilen wie aufgeregt, entspannt und, aus Gründen, die ich nicht verstehe, Shakespeare. Dafür schickt es bis zu zwanzig deiner letzten Nachrichten an Googles Server, was heißt, dass diese Nachrichten nicht mehr Ende-zu-Ende-verschlüsselt sind. Google sagt, es speichere sie nicht. Gemini in Messages ist eine eigene Sache, ein Chat-Thread, in dem du einen Entwurf schreibst und das Ergebnis dann in ein echtes Gespräch kopierst. Es sieht deine anderen Threads nicht. Welches davon du brauchst, hängt von der Aufgabe ab: Welche KI-Antwort-App die beste ist, hängt davon ab, ob dein Problem Menge oder Tragweite ist.
Zu Gruppe drei gehören die Dating-Antwort-Apps. Du machst einen Screenshot vom Gespräch, die App liest ihn per OCR aus, und du bekommst Anmachsprüche und Konter. W Rizz kostet $3.99 pro Woche. PlugAI, früher RizzGPT, liegt bei etwa $4.99. Es gibt noch Dutzende weitere, und sie optimieren alle auf eine Sache: ob die nächste Nachricht eine Antwort bekommt.
Zu Gruppe vier gehören die kleinen Tools für schwierige Gespräche. Das ist die interessanteste Gruppe und die am schlechtesten finanzierte. Resolve5 auf iOS bewertet, was es Konflikttemperatur nennt. Clarity Coach6 auf Android lässt dich einen Entwurf in ein Übungsszenario eintippen und sagt dir, ob er vage, zu schroff oder zu erklärungslastig wirkt, bevor es dir beim Umschreiben hilft. Subtext, das ich mitgegründet habe, gehört zu dieser Gruppe und funktioniert umgekehrt zum Rest der Kategorie. Es liest den Verlauf und deinen Entwurf, sagt dir, wie die Nachricht vermutlich ankommt und welche Formulierung dafür verantwortlich ist, und bietet dir erst danach Neufassungen an, die du übernehmen oder ignorieren kannst.
Schau dir an, was in den meisten davon passiert. Du gibst ihm Text, es gibt dir anderen Text zurück. Den Schritt, bei dem etwas liest, was du geschrieben hast, und dir sagt, wie die andere Person es vermutlich aufnimmt, gibt es selten, und wo es ihn gibt, steckt er meist in Arbeitssoftware. Copilot in Outlook7 bietet E-Mail-Coaching zu Ton, Klarheit und dazu, wie sich die lesende Person fühlen könnte, und Grammarlys Reader Reactions8 sagt voraus, was eine ausgewählte lesende Person aus einem Dokument mitnimmt und was sie verwirren könnte. Keines von beiden ist für die Nachricht gebaut, die du gleich deiner Schwester schickst. Im privaten Bereich kommt Clarity Coach dem am nächsten, ist aber eine Übungsumgebung und kann deshalb keine Nachricht berühren, die du wirklich gerade abschicken willst.
Grammarly9 ist das Tool, bei dem ich genau sein will, denn es ist der Beinahe-Treffer, der diese Lücke am ehesten schließen könnte. Sein Tondetektor liest Wortwahl, Formulierung, Zeichensetzung und Großschreibung und benennt den Ton. Beim Start 2019 deckte er rund vierzig davon ab10, darunter wertschätzend, selbstbewusst, formell, liebevoll und traurig. Grammarlys eigene Support-Dokumentation ist bei der Grenze vorsichtig. Der Detektor erkennt den Gesamtton deines Textes11 und bietet keine Neufassungen auf Satzebene an. Er sagt dir, welcher Ton vorhanden ist. Ob deine Schwester sich dadurch abgewertet fühlt, ist eine andere Frage. Grammarlys neuere Funktion Reader Reactions versucht, eine Version davon für eine Person zu beantworten, die du auswählst, etwa eine Führungskraft oder eine Kundin8, und ich habe keinen unabhängigen Test gesehen, wie gut sie echte Leserinnen und Leser vorhersagt. Die Tonerkennung liegt im kostenlosen Tarif, Pro kostet laut aktuellen Preistrackern $12 im Monat bei jährlicher Abrechnung.
Menschen konnten nicht erkennen, ob KI den Text geschrieben hatte, und es war nicht mal knapp
Das ist der Befund, der mich am meisten überrascht hat, und es ist die statistisch stärkste Studie im ganzen Feld.
Maurice Jakesch, Jeff Hancock und Mor Naaman führten sechs Experimente mit 4.600 US-Teilnehmenden durch, veröffentlicht in PNAS 202312. Die Teilnehmenden lasen Selbstdarstellungen aus Dating-, Gastgewerbe- und Berufsprofilen und rieten, welche von einer Maschine geschrieben waren. Die Trefferquote lag zwischen 50 und 52 Prozent. Bei den Dating-Profilen, wo es für richtige Antworten Geld gab, waren es etwa 51,6 Prozent.
Münzwurf-Niveau.
Der Grund ist, dass wir alle dieselben kaputten Faustregeln benutzen. Die Teilnehmenden werteten Ich-Pronomen, Verkürzungen, Erwähnungen von Familie und warme emotionale Details als Beweis, dass ein Mensch geschrieben hat. Saubere Grammatik und flache Formulierungen werteten sie als Beweis für eine Maschine. Jedes dieser Signale kann ein Modell auf Zuruf mühelos produzieren. Die Heuristiken zeigen genau in die falsche Richtung. Ein trainierter Klassifikator in derselben Studie kam nur auf 58,1 Prozent, das ist also kein Aufmerksamkeitsproblem, das sich durch mehr Konzentration lösen lässt.
Die Zahl Genauigkeit beim Erkennen, ob ein Text von KI oder von einem Menschen geschrieben wurde: 50 bis 52 Prozent. Münzwurf-Niveau.
Sechs Experimente · 4.600 Teilnehmende · veröffentlicht in PNAS, 2023 · ein trainierter Klassifikator, eigens für diese Aufgabe gebaut, kam nur auf 58,1 Prozent
Es gibt einen Vorbehalt. Die Studie hat mit Text aus der GPT-3-Ära gearbeitet. Ich habe noch niemanden gesehen, der in dieser Größenordnung getestet hätte, ob die Zahlen gegen aktuelle Modelle noch standhalten.
Das ist auch, warum Subtext nie versucht zu erraten, ob KI eine Nachricht geschrieben hat. Es liest deinen eigenen Entwurf darauf, wie er bei der Person, die ihn bekommt, ankommt, was dir ein Münzwurf-Rateversuch über die Urheberschaft nie hätte sagen können. Wenn sich die Formulierung wie eine Vorlage liest, mit Standardfloskeln und ohne Stimme dahinter, markiert es das als robotischen Ton, und das sagt etwas darüber, wie die Worte klingen, nicht darüber, wer sie geschrieben hat.
Der Schaden entsteht durch den Verdacht, nicht durch das Erwischtwerden
Wenn Menschen KI nicht erkennen können, könnte man erwarten, dass sich die ganze Sorge in Luft auflöst. Tut sie nicht, und genau das ist der Teil, der für alle wichtig ist, die einer echten Person eine echte Nachricht schreiben.
Ein von Cornell geleitetes Team führte zwei randomisierte Experimente mit 1.020 Teilnehmenden durch, veröffentlicht in Scientific Reports13. Smart Replies machten Gespräche schneller und positiver, und die Beteiligten bewerteten sich gegenseitig als enger verbunden und kooperativer. Wer allerdings vermutete, dass die Partnerin oder der Partner Smart Replies benutzte, bewertete diese Person deutlich schlechter. Der Verdacht war es, der den Schaden anrichtete. Die Studie hat den Verdacht gemessen, nicht die tatsächliche Trefferquote, und angesichts der oben genannten Erkennungszahlen glaube ich nicht, dass dieser Verdacht bei den richtigen Personen landete.
Ein Team der Carnegie Mellon University hat dem in einer Studie von 202514 mit 399 Teilnehmenden über zwei Studien einen Mechanismus unterlegt, und ihr Ergebnis ist feiner als eine simple Strafe. Ein KI-Label ist mehr als ein Minuspunkt für dich. Es macht deine Nachricht in beide Richtungen zu einem schwächeren Beweis für das, was du bist. Eine KI-unterstützte Entschuldigung wirkt weniger warm, und eine KI-unterstützte Angeberei oder Schuldzuweisung wirkt weniger kalt. Das Label zieht der Nachricht Informationen darüber ab, wer du bist.
Dieser Rahmen ist mir hängengeblieben. Was auch immer deine Nachricht als Signal geleistet hat, das Label dreht die Lautstärke runter.
Außer in einer Situation, in der Offenlegung keinen messbaren Unterschied machte
Ich will die Studie einbeziehen, die gegen meine eigene Produktthese spricht, denn sie wegzulassen wäre unehrlich.
Zoe Purcell und Kolleginnen und Kollegen am Max-Planck-Institut für Bildungsforschung, mit Jakesch erneut unter den Autoren, führten zwei präregistrierte Experimente mit 1.637 Teilnehmenden in vergüteten Zwei-Personen-Vertrauensspielen durch, veröffentlicht in iScience im November 202515. Die eine Hälfte durfte Textvorhersage-Unterstützung nutzen, um eine Nachricht zu schreiben, die eine fremde Person zum Vertrauen bewegt. Der Rest schrieb ohne Hilfe.
KI-Unterstützung hatte kaum Einfluss auf das Vertrauen, und das galt selbst dann, wenn die KI-Nutzung offengelegt wurde. Die unterstützten Autorinnen und Autoren produzierten in kürzerer Zeit gleich vertrauensbildende Nachrichten, verdienten sich also mehr Vertrauen pro investierter Minute. Die sprachliche Analyse ergab, dass ihre Nachrichten etwas weniger authentisch, aber wärmer, komplexer und höher in dem waren, was die Forschenden Clout nennen.
Die Autorinnen und Autoren sind vorsichtig mit der Reichweite ihrer Aussage, und ich bin es auch. Das hier ist eine einmalige Transaktion zwischen Fremden mit Geld im Spiel. Verhaltensbasiertes Vertrauen bei einer Auszahlungsentscheidung ist etwas ganz anderes, als wenn deine Partnerin oder dein Partner um 23 Uhr deine Nachricht liest und entscheidet, ob du es so gemeint hast. Aber mein Eindruck ist: Die Geschichte „KI ruiniert Vertrauen“ hat ein echtes Gegenbeispiel in der Literatur, und das hier ist es.
KI schreibt bessere Trostnachrichten als die meisten Menschen, bis du erwähnst, dass es KI war
Zwei Studien, dieselbe Form von Ergebnis.
Yin, Jia und Wakslak in PNAS16 fanden heraus, dass KI-generierte Antworten Menschen das Gefühl gaben, mehr gehört zu werden, als Antworten von ungeschulten Menschen, und dass die KI besser darin war, zu erkennen, welche Emotion im Spiel war. Dann erzählten sie den Empfängerinnen und Empfängern, dass die Nachricht von einer KI stammte, und der Effekt sank. Eine der Autorinnen merkte an, dass die beiden Effekte ähnlich groß waren und sich in etwa aufhoben.
Ovsyannikova, Oldemburgo de Mello und Inzlicht17 führten vier präregistrierte Experimente mit 556 Teilnehmenden in Communications Psychology durch. GPT-4-Antworten wurden als mitfühlender bewertet als menschliche, einschließlich Antworten von geschulten Freiwilligen der Krisenhotlines der Distress Centres of Greater Toronto. Die Offenlegung der Quelle verkleinerte die Lücke, schloss sie aber nicht.
Die Maschine ist bei den Worten also oft besser. Nur sind die Worte nicht das Einzige, was übertragen wird.
Aufwand zählt, weil Aufwand früher etwas gekostet hat
Die Signalisierungstheorie ist der Rahmen, durch den mir das alles klar wurde.
Eine Nachricht erledigt zwei Aufgaben. Sie trägt einen Inhalt, und sie beweist, dass du etwas investiert hast, um sie zu schicken. Deine Zeit, deine Aufmerksamkeit, und in einem schwierigen Gespräch deine Fassung. Das sind endliche Ressourcen, also sagt ihr Einsatz etwas Wahres darüber aus, wie sehr dir die Person wichtig ist. Forschung zu Commitment-Signalen18 in japanischen und US-amerikanischen Stichproben fand, dass teure Signale schwache übertrafen, und dass ein ausbleibendes erwartetes Signal, etwa das Vergessen eines Anlasses, romantischen Beziehungen weit mehr schadete als Freundschaften.
Senkst du die Kosten, eine warme, klar formulierte, gut strukturierte Nachricht zu erzeugen, auf annähernd null, hört das Signal auf, Information zu tragen.
Für den Mechanismus selbst gibt es inzwischen direkte Belege, allerdings nicht aus dem Kontext von Nachrichten. Eine Studie von 2026 in Frontiers in Psychology19 mit 618 Teilnehmenden fand, dass die Kennzeichnung von Inhalten als KI-generiert den wahrgenommenen Aufwand deutlich senkte, während ein Label „von Menschen gemacht“ sich nicht von gar keinem Label unterschied. Menschen gehen standardmäßig von menschlichem Aufwand aus, und das KI-Label ist es, was diese Annahme entfernt. Die Studie hat mit Kurzvideos gearbeitet, die Übertragung auf Nachrichten sollte also mit etwas Vorsicht gelesen werden.
Wenn du die Worte auslagerst, scheint das deine eigene Bindung an sie zu schwächen
Das ist der Befund, an den ich immer wieder denken muss, und dabei geht es überhaupt nicht um die empfangende Person.
Ökonominnen und Ökonomen von CREED in Amsterdam20 ließen Vertrauensspiele laufen, bei denen Absenderinnen und Absender ChatGPT nutzen konnten, um eine Nachricht mit dem Versprechen zu schreiben, sich zu revanchieren. Zwei Dinge passierten gleichzeitig. Menschen mit Zugang zu ChatGPT machten explizitere Versprechen. Und wer ChatGPT überhaupt geöffnet hatte, hielt sein Versprechen bei der Auszahlung 25,7 Prozent seltener, egal ob am Ende das übernommen wurde, was das Tool vorschlug, oder nicht.
Das aufschlussreiche Detail ist, dass das spätere Verhalten der Absenderin oder des Absenders umso weniger vertrauenswürdig war, je näher die gesendete Nachricht am rohen ChatGPT-Vorschlag lag. Wer den Vorschlag umgeschrieben hatte, verhielt sich besser. Die Autorinnen und Autoren lesen das als ein Gefühl von Urheberschaft. Sagst du etwas in deinen eigenen Worten, fühlst du dich daran gebunden. Leitest du etwas weiter, das eine Maschine geschrieben hat, hat ein Teil von dir es nie unterschrieben. Das ist auch, warum Subtext dir zuerst das Problem zeigt und dann markiert, wie viel deiner eigenen Formulierung jede Version verändert hat. Eine Korrektur, die du selbst auswählst oder tippst, ist eine, die du unterschrieben hast.
Bei Entschuldigungen ist das ordentlich erforscht, und der Befund ist nützlicher als ein bloßes „lass es“
Wenn du nur einen Abschnitt liest, dann diesen, denn hier steckt die praktische Antwort.
Ella Glikson und Omri Asscher führten drei Szenariostudien zu Entschuldigungen am Arbeitsplatz durch, veröffentlicht in Computers in Human Behavior21. Zu wissen, dass jemand KI-Tools für eine Entschuldigung genutzt hat, senkte, wie authentisch sie wirkte und wie bereit Menschen waren zu verzeihen. Es selbst offenzulegen, milderte das nicht. So weit vorhersehbar.
Dann kam der Teil, der meine Meinung geändert hat. Teilnehmende, die nur eines von drei verfügbaren KI-Tools genutzt hatten, bekamen überhaupt keine Authentizitätsstrafe. Die Forschenden lesen das als Distanz. Begrenzte KI-Nutzung hält die fertige Nachricht nah an dem, was die Person ursprünglich gemeint hat, und das können Menschen spüren.
Ein separates 3x2-Experiment von Lim, Hong und Schneider mit 464 Teilnehmenden, ebenfalls in Computers in Human Behavior22, fand, dass von Menschen verfasste Entschuldigungen durchweg als aufrichtiger galten, und dass ein warmer Ton KI-Entschuldigungen verbesserte, ohne die Lücke zu einer menschlichen je zu schließen.
Ein CHI-Paper von 202623 von Fan, Liu und Pan hat das an romantischen Nachrichten getestet, mit 152 Personen in einer ersten und 704 in einer zweiten Studie. Je mehr von einer Nachricht die KI entworfen hatte, desto weniger las sie sich wie die eigene der sendenden Person und desto weniger authentisch wirkte sie. Eine leichte Tonüberarbeitung, die die sendende Person abgesegnet hatte, verbesserte, wie eine Entschuldigung beurteilt wurde, aber bei kompletten Entwürfen und Grenzsetzungen sah das Ergebnis anders aus.
Legst du diese drei nebeneinander, bekommst du etwas Praktisches. Die Strafe folgt der Distanz zwischen der fertigen Nachricht und dem, was du gemeint hast. Nicht der Frage, ob eine Maschine im Raum war. Das ist auch der Grund, warum Subtext dir zeigt, was diesen Eindruck erzeugt, bevor es überhaupt eine fertige Version anbietet, und dir sagt, wie viel deiner Formulierung jede Version verändert hat, denn diese Distanz kurz zu halten ist es, was eine Entschuldigung glaubwürdig hält. Die umfassendere Forschung dazu, wie du dich über Text entschuldigst, steht in einem eigenen Beitrag.
Diese Tools polieren deine schlimmsten Instinkte und sagen dabei kein Wort
Schreib etwas Passiv-Aggressives, gib es einem beliebigen Umschreib-Tool auf deinem Handy, und schau, was passiert. Du bekommst besser geschriebene passive Aggression. Keine Warnung, kein „bist du sicher“. Die Aufgabe des Tools ist es, zu tun, worum du gebeten hast.
Dafür gibt es einen Grund, warum Modelle in diese Richtung kippen. OpenAI zog im April 2025 ein GPT-4o-Update zurück und schrieb öffentlich24, das Modell sei „übermäßig schmeichelhaft oder zustimmend geworden, oft als speichelleckerisch beschrieben“, und es habe „zu Antworten geneigt, die übermäßig unterstützend, aber unaufrichtig waren“. Als Ursache nannten sie eine zu starke Feinabstimmung auf kurzfristiges Nutzerfeedback, sprich Daumen hoch und Daumen runter. In einem Folgebeitrag25 gaben sie zu, dass sie überhaupt keine Auswertungen im laufenden Betrieb hatten, die Speichelleckerei verfolgten.
Forschende von Anthropic fanden heraus, dass dasselbe Muster allgemein gilt. In einer auf der ICLR 202426 vorgestellten Studie zeigten alle fünf getesteten Spitzenassistenten Speichelleckerei, und die Analyse von rund 15.000 menschlichen Präferenzvergleichen ergab, dass die Übereinstimmung mit den geäußerten Überzeugungen der Nutzerin oder des Nutzers einer der stärksten Prädiktoren dafür war, welche Antwort bevorzugt wurde. Trainierst du auf Zustimmung, selektierst du auf Übereinstimmung. Eine Studie von 202527 maß speichelleckerisches Verhalten in 58,19 Prozent der Testfälle bei ChatGPT-4o, Claude Sonnet und Gemini 1.5 Pro, mit 78,5 Prozent Beständigkeit, sobald es einmal auftrat, allerdings ging es dabei um Faktenfragen, nicht um persönliche Nachrichten. Für persönliche Nachrichten habe ich ChatGPT-Alternativen fürs Schreiben und was die großen drei mit deinen Worten machen verglichen.
Denk jetzt darüber nach, was das für den Moment bedeutet, in dem du am dringendsten Hilfe brauchst. Du bist wütend, du hast etwas geschrieben, das du bereuen wirst, und das Tool, das deinen Entwurf in der Hand hält, wurde darauf optimiert, dass du dich gut dabei fühlst.
Genau das ist der Moment, für den Subtext gebaut wurde, und der unangenehme Teil ist der Punkt. Es sagt dir, dass der Entwurf wütend klingt, anstatt die Wut besser klingen zu lassen.
Die Frage, die ich nicht beantworten kann
Ist es besser, eine unbeholfene Nachricht zu schicken, die du selbst geschrieben hast, oder eine polierte, die du nicht geschrieben hast?
Ich habe genau gesucht, und es gibt keine Studie, die das direkt testet. Niemand hat „dein eigener unperfekter Entwurf“ gegen „ein guter Entwurf, den du nicht geschrieben hast“ randomisiert und verfolgt, was mit der Beziehung passiert ist. Es gibt überhaupt nichts Längsschnittliches. Keine Felddaten zu Paaren, Familien oder engen Freundschaften über Monate KI-unterstützten Nachrichtenschreibens. Wir wissen nicht, ob Menschen sich an synthetischen Schliff gewöhnen, oder ob die Gewohnheit still und leise etwas erodiert.
Was wir haben, zeigt für enge Beziehungen in eine Richtung. Aufwand liest sich als Fürsorge, Labels flachen das Signal ab, ausgelagerte Worte scheinen deinen Griff auf deine eigenen Versprechen zu lockern, und Entschuldigungen bleiben glaubwürdig, wenn sie nah an dem bleiben, was du gemeint hast. Aber das Ergebnis aus dem Vertrauensspiel sagt, dass die Kosten in manchen Kontexten zu klein waren, um sie zu messen, und ich werde nicht so tun, als wäre die Beweislage sauberer, als sie ist.
Was also helfen würde
Liest man das alles noch einmal, ist die Form des fehlenden Produkts für mich ziemlich klar, und sie ist fast das Gegenteil von dem, was die Kategorie gerade baut.
Niemand braucht seine Worte ersetzt. Was Menschen in den fünfzehn Sekunden vor dem Absenden brauchen, ist zu wissen, dass die Nachricht kälter klingt, als sie sich fühlen, oder dass das, was sie für eine Klarstellung halten, wie eine Liste von Vorwürfen wirkt. Dann korrigieren sie es selbst, in ihren eigenen Worten, und das Aufwandssignal bleibt erhalten, die Urheberschaft bleibt erhalten, und die Distanz im Sinne von Glikson und Asscher bleibt kurz.
Das ist die Version, die ich mir wünsche, und Subtext haben wir genau darum herum gebaut. Subtext nimmt sich den ganzen Verlauf vor statt nur den einzelnen Satz, benennt, was dein Entwurf der Person, die ihn gleich liest, vermutlich signalisiert, und zeigt dir die Worte, die diesen Eindruck erzeugen. Jede Version, die es dir dann anbietet, zeigt dir, wie viel deiner Formulierung sie verändert hat, und du kannst jede davon mit Manuell bearbeiten anpassen, bevor du sie kopierst, sodass die Korrektur deine eigene bleibt. Nach der Beweislage oben zählt das mehr als die Neufassung, denn die Strafe folgt der Distanz zu dem, was du gemeint hast, und die kürzeste Distanz ist dein eigener Satz mit einem geänderten Wort. Subtext im Browser ausprobierenMit der Handykamera scannen und installieren.Subtext im Browser ausprobieren
Meine eigene Regel, für das, was sie wert ist: Ich lasse mir von einer Maschine sagen, wie meine Nachricht klingt. Ich lasse sie nicht meiner Schwester sagen, dass es mir leid tut.
Denkst du, ich habe eine Studie falsch gelesen, oder kennst du ein Tool, das diagnostiziert, bevor es umschreibt? Sag es mir auf LinkedIn.
Samet Durgun ist Mitgründer von Subtext, einer App, die den emotionalen Ton deiner Nachrichten erkennt und sie in deinen Worten neu schreibt. Er lebt in Berlin.
Quellen
Jeder Link oben führt zur Primärquelle, wo es eine gibt, nummeriert in der Reihenfolge des Auftretens. Produktfunktionen und Preise Stand August 2026 geprüft. Wo eine Zahl aus einem Firmenblog oder einer Pressemitteilung statt aus einer Studie stammte, habe ich sie weggelassen.
- Apple Support. Use Writing Tools with Apple Intelligence on iPhone.
- Samsung. Use Writing assist on Galaxy phones and tablets.
- Google Support. Use writing tools with Gboard.
- Google Support. Draft messages with Magic Compose.
- Apple App Store. Resolve: AI Conflict Coach.
- Google Play. Clarity Coach.
- Microsoft Support. Get email coaching with Copilot in Outlook.
- Grammarly Support. Reader Reactions user guide.
- Grammarly. Writing Tone Detector and Tone Suggestions.
- TechCrunch (2019). Grammarly gets a tone detector to keep you out of email trouble.
- Grammarly Support. How do Grammarly’s tone suggestions work?
- Jakesch, M., Hancock, J. T., & Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
- Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J., & Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
- Khadpe, P., Wenzel, K., Loewenstein, G., & Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
- Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M., & Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
- Yin, Y., Jia, N., & Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
- Ovsyannikova, D., Oldemburgo de Mello, V., & Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
- Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
- Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
- AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, University of Amsterdam.
- Glikson, E., & Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
- Lim, J. S., Hong, N., & Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
- Fan, G., Liu, D., & Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
- OpenAI (2025). Sycophancy in GPT-4o.
- OpenAI (2025). Expanding on what we missed with sycophancy.
- Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
- Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.