ArtikelSchreib-Tools
KI kann einen Screenshot deiner Nachrichten lesen. Sie liest ihn nicht immer richtig.
Die veröffentlichten Fehlerquoten beim Lesen von kleiner Schrift, Text im Dunkelmodus und nicht-lateinischer Schrift in einem Screenshot, was drei Screenshot-Apps über deinen Upload verraten, und ob das Entfernen von Metadaten überhaupt etwas Messbares bewirkt.
Von Samet Durgun · Mitgründer von Subtext · 13 Min. Lesezeit
Fügst du den Screenshot eines Chats in ein KI-Tool ein, funktioniert das meistens einfach so. Es sagt dir, wer was gesagt hat, versteht den Witz und entwirft eine Antwort, die Sinn ergibt. „Meistens“ ist der Teil, auf den niemand eine Zahl setzt, und es lohnt sich, ihn von einer anderen Frage zu trennen, die diese Website an anderer Stelle schon behandelt. Sobald ein Modell die Worte vor sich hat, behandeln die Seite darüber, die Nachricht zu lesen, die du bekommen hast und die Forschung dazu, einen ganzen Gesprächsverlauf zu lesen, bevor du antwortest, wer über mehrere Wortmeldungen hinweg spricht, wie man eine nie beantwortete Frage im Blick behält, und wie man Sarkasmus erkennt. In diesem Text geht es um den Schritt davor, ob das Modell das Bild überhaupt zuerst richtig liest.
Ich baue Subtext mit, eine App zur Tonprüfung und zum Entwerfen von Antworten, die unter anderem einen Chat-Screenshot als Eingabe nimmt, ich habe hier also allen Grund, mir eine günstige Antwort zu wünschen. Die habe ich nicht. Es folgt, was ich zu einer engeren, weniger schmeichelhaften Frage überprüfen konnte, nämlich wie gut die bildfähigen Modelle von heute darin sind, einen Handy-Screenshot als Bild zu lesen, nicht als Transkript, und was mit einem Screenshot passiert, sobald du ihn einer dieser Apps übergibst. Jede Quelle unten habe ich selbst geöffnet.
Einen Screenshot zu lesen ist zuerst ein Bildproblem, kein Sprachproblem
Ein Chatscreenshot ist ein Bild aus Licht, kein Textblock, den ein Computer schon direkt einlesen kann. Bevor ein Modell darüber nachdenken kann, was eine Nachricht sagt, muss es Pixel korrekt in Zeichen verwandeln, in welcher Schriftart, Größe, welchem Kontrast und Layout die Messaging-App auch immer verwendet hat. Dieser Schritt heißt optische Zeichenerkennung, kurz OCR, und läuft über dasselbe Bildverarbeitungssystem, das auch jedes andere Bild liest. Die meisten Genauigkeitsbehauptungen rund um KI und Nachrichten betreffen das Schlussfolgern, das nach diesem Schritt passiert. Nur wenige betreffen den Schritt selbst.
Die Zahlen, die es gibt
Der direkteste Test ist eine Auswertung von GPT-4Vs OCR-Fähigkeit über mehrere Benchmarks aus dem Jahr 20231. Bei englischem Szenentext erreichte es 88,0 % Wortgenauigkeit auf dem CUTE80-Benchmark und zwischen 62,0 % und 66,0 % auf drei schwereren englischen Testsätzen, gegen 68,2 % bis 98,6 % eines spezialisierten OCR-Systems auf denselben vier Benchmarks. Bei chinesischem Szenentext, dem ReCTS-Benchmark, kam GPT-4V auf null. In einem separaten mehrsprachigen Test aus demselben Paper erreichte sein Text-Spotting-F1-Score 82,49 % für Englisch und 83,42 % für Französisch, gegen 16,55 % für Arabisch und 1,36 % für Chinesisch. Das Paper stellt unumwunden fest, „dass GPT-4V trotz seiner Vielseitigkeit bei unterschiedlichen OCR-Aufgaben bestehende OCR-Spitzenmodelle nicht übertrifft“, und dass es „bei nicht-lateinischen Sprachen Schwächen zeigte“1.
Das ist eine Modellgeneration, getestet an kuratierten Szenentext-Datensätzen, nicht an Messaging-Screenshots, lies es also als Untergrenze für das allgemeine Problem, nicht als Urteil über eine heute verfügbare App. Es ist trotzdem die direkteste, überprüfbare Zahl gegen die schlichte Behauptung, KI lese nicht-lateinische Schriften in einem Bild genauso gut wie lateinische. Nach dieser Evidenz stimmt das nicht.
Auch die Auflösung spielt eine Rolle. Dasselbe Paper fand „einen positiven Zusammenhang zwischen der Auflösung des Eingabebilds und der Erkennungsleistung“1, was gegen ein komprimiertes oder stark herunterskaliertes Bild arbeitet, genau das, was viele Handys erzeugen, wenn ein Bild erneut gespeichert oder weitergeleitet wird, noch bevor das Modell ein einziges Wort liest. Ein enger gefasstes Preprint von 2025 testete das genauer, allerdings nur an einzelnen japanischen Kanji-Zeichen in kontrollierter Größe, nicht an Chat-Screenshots. Multimodale Modelle erreichten das Niveau einer dedizierten OCR-Methode bei etwa 300 Pixel pro Zoll (ppi), und „ihre Leistung verschlechtert sich deutlich unterhalb von 150 ppi“2. Ob diese Schwelle auch für kleinen Text in einem komprimierten Handy-Screenshot gilt, ist ungetestet. Dass kleinerer und niedriger aufgelöster Text bei diesen Modellen schneller schwächelt als bei speziell dafür gebauter OCR, ist der Teil, in dem sich zwei unabhängige Paper einig sind.
Speziell zum Dunkelmodus, und allgemeiner zu kontrastarmem Text, konnte ich keine veröffentlichte Auswertung finden, die die Genauigkeit multimodaler Modelle gegen die Hell-Modus-Version derselben Screenshots misst. Klassische OCR-Pipelines drehen dunkle Bilder vor der Verarbeitung routinemäßig um, weil Kontrastumkehr in dieser älteren Technologie ein bekannter Auslöser für Lesefehler ist, was dafür spricht, dass die zugrundeliegende Sorge berechtigt ist. Niemand hat den entsprechenden Test an den multimodalen Modellen durchgeführt, die Menschen heute zum Lesen eines Chatscreenshots nutzen, jedenfalls nicht in irgendetwas, das ich finden konnte, also nenne ich keine Zahl, die ich nicht belegen kann.
Emojis stecken im selben Bild, und die Forschung dazu beantwortet eine andere Frage als die, die Menschen normalerweise stellen. Es geht weniger darum, ob ein Modell erkennt, dass eine Form ein Emoji ist, und mehr darum, welches Emoji es vor sich hat, denn dasselbe Zeichen zeichnet nicht überall dasselbe Bild. Das Unicode-Konsortium standardisiert den Codepoint und seine Bedeutung, nicht die grafische Umsetzung. Apple, Google, Samsung und jeder andere Anbieter zeichnen ihre eigene Glyphe dafür3. In einer Befragung von 710 Twitter-Nutzenden, die gerade einen Tweet mit Emoji gepostet hatten, wusste mindestens 25 % nicht, dass ihr Emoji auf dem Handy einer anderen Person anders aussehen kann, und nachdem man ihnen gezeigt hatte, wie einer ihrer eigenen Tweets auf einer anderen Plattform tatsächlich dargestellt wurde, sagten 20 %, sie hätten ihn bearbeitet oder gar nicht erst gesendet3. Diese Lücke besteht schon zwischen zwei Menschen, die auf zwei verschiedenen Handys auf dasselbe Zeichen schauen. Ein Screenshot verengt sie weiter. Was auch immer die Plattform der sendenden Person gezeichnet hat, wird zu einem Standbild verdichtet, und ein Modell, das dieses Bild liest, kann nicht mehr rekonstruieren, welches Emoji darunterlag, wenn nicht schon die plattformeigene Schriftart in den Pixeln steckt. Ob diese Kombination, plattformübergreifende Mehrdeutigkeit plus Screenshot-Kompression, verändert, wie oft ein Modell das falsche Gefühl hinter einem Emoji benennt, ist ein Test, den anscheinend noch niemand durchgeführt hat.
Fehlerarten, die die Workflow-Seiten hier nicht abdecken
Eine Handvoll konkreter Chat-Funktionen erschwert das richtige Lesen auf ihre eigene Weise, über das Problem auf Pixelebene oben hinaus. Manches vom Folgenden stützt sich auf eine Studie. Manches ist eine schlichte Beschreibung, wie die Oberfläche funktioniert, ohne eigens dafür gemachte Forschung dahinter, und ich habe versucht, beides auseinanderzuhalten, damit das eine sich nicht das Gewicht des anderen ausleiht.
Gruppenchats und Threads mit mehreren Beteiligten. Ein Eins-zu-eins-Screenshot gibt einem Modell zwei visuelle Gruppen vor, in die es Sprache einsortieren kann, die eine Seite und die andere. Ein Gruppen-Thread bricht dieses Muster auf. Drei oder mehr Personen können sich eine Sprechblasenfarbe teilen, der Name einer sendenden Person erscheint manchmal nur über der ersten Nachricht einer Serie und nicht über jeder folgenden Zeile, und ein beschnittener Avatar kann der einzige visuelle Hinweis darauf sein, wer gerade spricht. Ich habe keine Studie gefunden, die die Genauigkeit eines Modells speziell bei der korrekten Zuordnung von Zeilen in einem Gruppenchat-Screenshot testet. Die nächstliegende Forschung misst ein verwandtes, aber anderes Problem, die Sprecherzuordnung in schriftlichen Meeting-Transkripten, nicht in gescreenshotteten Sprechblasen, und das behandelt bereits die Seite darüber, einen ganzen Gesprächsverlauf zu lesen. Was hier steht, ist eine mechanische Beschreibung der Screenshot-Version desselben Problems, kein getesteter Befund. Mehr Sprechende, die sich weniger visuelle Hinweise pro Zeile teilen, ist auf den ersten Blick eine schwerere Zuordnungsaufgabe, ob das nun jemand gemessen hat oder nicht.
Tap-Reaktionen und Emoji-Reaktionen. Ein kleines Emoji, das in der Ecke der Sprechblase einer anderen Person klebt, ein Herz, ein Lachen, ein Daumen hoch, birgt zwei getrennte Risiken. Das erste ist, ob ein Modell die kleine, manchmal überlappende Glyphe überhaupt korrekt erkennt, wofür ich keinen direkten Test gefunden habe. Das zweite ist, was die Reaktion bedeutet, sobald sie korrekt gelesen ist, und dieser Teil wurde untersucht. Eine Analyse von mehr als 650.000 Telegram-Nachrichten mit Reaktionen fand, dass positive Reaktionen die Antworten dominierten, unabhängig davon, ob die zugrunde liegende Nachricht sich neutral oder negativ las, und kam zu dem Schluss, dass Emoji-Reaktionen „nicht zuverlässig als Indikator für emotionales Mitschwingen oder eine Resonanz mit dem Inhalt funktionieren“4. Das ist eine große Stichprobe von einer Plattform und einem Themenbereich, Krypto-bezogenen Kanälen, und es bleibt ein Preprint, behandle die genauen Zahlen also als vorläufig. Der Punkt, der für das Lesen eines Screenshots zählt, gilt trotz dieser Einschränkungen. Das Reaktions-Emoji korrekt zu benennen, sagt niemandem, weder Modell noch Mensch, was die Reaktion tatsächlich bedeutet.
Zitierte Antworten und die Thread-Oberfläche. Die meisten Messaging-Apps lassen dich auf eine bestimmte frühere Nachricht antworten und stellen den zitierten Ausschnitt als kleineren, blasseren Block über der neuen Nachricht dar. In einem Screenshot ist diese optische Behandlung, kleinere Größe, hellere Farbe, manchmal eine vertikale Linie, das einzige Signal dafür, dass eine Zeile zitierter Kontext ist und keine neue Nachricht von der Person, nach der es optisch aussieht. Schneidest du das Bild ein paar Pixel anders zu, kann dieser Unterschied verschwinden. Ich habe keine Studie gefunden, die misst, wie oft ein Modell einen zitierten Ausschnitt mit einer neuen Nachricht verwechselt oder umgekehrt. Das ist eine plausible mechanische Fehlerart, die darin angelegt ist, wie die Oberfläche Threads darstellt, keine getestete.
Verschwindende und selbstlöschende Nachrichten. Eine selbstlöschende Nachricht soll nach dem Ansehen keine Spur hinterlassen, und genau das hebelt ein Screenshot aus. Noch bevor überhaupt eine KI-Frage ins Spiel kommt, hatten Forensikerinnen und Forensiker schon gezeigt, dass diese Grundannahme wackliger ist, als Nutzende annehmen. Eine Studie, die die Funktionen für sich selbst löschende Nachrichten bei WhatsApp, Snapchat und Telegram direkt testete, stellte in mehreren der ausprobierten Szenarien angeblich gelöschte Inhalte aus Gerätedaten und Cloud-Backups wieder her5. Das ist ein Befund über die Plattformen, nicht darüber, wie KI einen Screenshot davon liest, und er misst nichts über die Genauigkeit eines Modells. Was er unabhängig von jeder KI zeigt, ist, dass ein Screenshot nicht der einzige Weg ist, auf dem ein selbstlöschender Inhalt seine vorgesehene Löschung überlebt. Ob die eigene Unschärfe-Funktion einer App auf dem Bildschirm oder ein Banner mit „Screenshot erstellt“ optische Artefakte erzeugt, die ein Modell für Inhalt halten könnte, ist, auch das, eine plausible Sorge ohne eigens dafür gemachte Studie dahinter.
Sticker. Ein Sticker trägt Bedeutung eher über Haltung und Mimik als über Worte, was ihn für eine Maschine schwerer lesbar macht, und, wie sich zeigt, auch für Menschen. Eine Studie mit fünf studentischen Diskussionsgruppen, die Sticker in echten Projektchats nutzten, gestützt auf Interviews mit sieben der Teilnehmenden zu ihrer eigenen Sticker-Nutzung, fand bei 34,7 % der untersuchten Sticker eine Diskrepanz zwischen dem, was die sendende Person meinte, und dem, was die empfangende Person verstand, vor allem wegen mehrdeutiger Gesichts- und Körperausdrücke in der grafischen Gestaltung selbst6. Das ist eine kleine, qualitative Studie an einer Population, Studierenden an einer asiatischen Hochschule, und sie misst menschliches Missverstehen, nicht das eines Modells. Es ist trotzdem ein echter Beleg dafür, dass ein Sticker ein mehrdeutiges Signal ist, selbst zwischen Menschen, die sich bereits kennen, was eine niedrige Obergrenze dafür setzt, wie gut irgendeine lesende Instanz, ob Mensch oder Maschine, allein aus dem Bild abschneiden sollte.
Sprachwechsel mitten im Gespräch. Innerhalb einer Nachricht oder zwischen Nachrichten im selben Verlauf die Sprache zu wechseln, auch Code-Switching genannt, ist beim zwei- und mehrsprachigen Schreiben von Nachrichten üblich und ein dokumentiert schwerer Fall für Sprachmodelle im Allgemeinen. Ein Survey-Paper von 2025 zum Feld stellt unumwunden fest, „die meisten LLMs tun sich mit sprachlich gemischten Eingaben weiterhin schwer“7, ohne eine Zahl, die sich sauber auf einen Screenshot mit zwei Sprachen in einer Sprechblase übertragen ließe. Ich konnte keine Studie finden, die Code-Switching speziell als Screenshot-Leseproblem isoliert, abgesehen von dem breiteren mehrsprachigen Textproblem, das das Survey-Paper beschreibt. Behandle das als reale, dokumentierte Schwierigkeit der zugrunde liegenden Technologie, hier angewendet auf einen Fall, den noch niemand direkt getestet hat.
Was drei Screenshot-Apps über deinen Upload sagen
Subtext ist nicht die einzige App, die dafür gebaut ist, einen Chatscreenshot zu lesen, und der nützliche Vergleich ist, was die jeweils aktuelle Dokumentation über das Schicksal eines Uploads sagt, nicht das, was das Marketing andeutet. Das weitere Feld der KI-Schreibwerkzeuge ist an anderer Stelle kartiert; hier habe ich drei dort genannte Produkte gegen ihre eigenen Datenschutzseiten geprüft, zu einer einzigen engen Frage, Aufbewahrung, Löschung und Verwendung beim Training eines Modells.
Keys AI Texting Coach, von Charmed Inc. rund um das Lesen von Screenshots für Dating- und Nachrichtenberatung gebaut, gibt es offenbar nicht mehr. Apples eigener iTunes-Lookup-Dienst liefert für den App-Store-Eintrag, App-ID 1510154956, null Ergebnisse, Stand 27. September 20268, und die bekannte Webdomain leitet jeden Pfad, auch den, der früher die Datenschutzerklärung enthielt, auf eine Domain-Parking-Seite um. Ich konnte über keinen Kanal eine aktuelle Datenschutzerklärung für diese App finden. Was auch immer sie einst zum Umgang mit Screenshots sagte, kann ich heute nicht überprüfen, und ich rekonstruiere keine Behauptung von einer Seite, die nicht mehr lädt.
Mei, eine Standard-Nachrichten-App für Android mit einem optionalen KI-Assistenten, hält in ihren aktuellen Nutzungsbedingungen fest, zuletzt geändert am 3. Oktober 2023 und geprüft am 27. September 20269, dass Nachrichteninhalte einschließlich „Bilder, Fotos, Audio oder Videos“ auf ihren Servern gespeichert werden, „ausschließlich zum Zweck der Kommunikation“, und „von uns in keiner anderen Weise verwendet“ werden. An anderer Stelle, wo beschrieben wird, was ihr optionaler KI-Assistent tatsächlich erhält, sagt dasselbe Dokument, die letzten 20 als Kontext an die KI geschickten Nachrichten umfassten „Emojis, Reaktionen und URLs“, aber „Nachrichten mit Anhängen, Sprachnachrichten und Bilder werden dafür nicht erfasst“. Zusammengelesen sagt Meis eigene Dokumentation, dass die KI-Vorschlagsfunktion Bildinhalte überhaupt nicht verarbeitet, Screenshots eingeschlossen. Die Speicherklausel zu Fotos betrifft die gewöhnliche Nachrichtenzustellung innerhalb der App, nicht irgendetwas, das an die KI geschickt wird. Eine separate, optionale KI-Assistenzfunktion arbeitet anders. Schaltet eine nutzende Person sie ein, lädt Mei die komplette SMS- und MMS-Nachrichtendatenbank des Geräts hoch, einschließlich des Texts jeder Nachricht, dazu gehashte Telefonnummern und die Namen der Kontakte, und die Richtlinie erklärt, diese Daten würden „zum Training von KI-Modellen verwendet“. Diese Klausel nennt nicht eigens Screenshots oder Bilder, betrifft aber das Training an Nachrichtentext im Allgemeinen, nicht nur an Kontakt-Metadaten.
ConfiTexts Datenschutzerklärung, in Kraft seit 10. Februar 2026 und geprüft am 27. September 202610, behandelt nur „Text, den du in der App eingibst“, und erwähnt in keinem ihrer neun Abschnitte Fotos, Bilder oder Screenshots. Die eigene Marketing-Seite beschreibt genau eine Eingabemethode, das Einfügen einer Nachricht, die die nutzende Person bereits geschrieben hat, und nirgendwo auf der Seite taucht eine Funktion zum Hochladen von Screenshots oder Fotos auf. Beim aktuellen Stand scheint die Frage der Aufbewahrung auf ConfiText gar nicht zuzutreffen. Das Produkt nimmt, laut seiner eigenen aktuellen Website, von vornherein keinen Screenshot als Eingabe.
Zählt man alle drei zusammen, gibt es eine App, die es offenbar nicht mehr gibt, eine, deren eigene Dokumentation Bilder aus dem ausschließt, was ihre KI tatsächlich liest, aber auf Nachrichtentext trainiert, sobald ihr Assistent eingeschaltet ist, und eine, die überhaupt keinen Screenshot annimmt. Das klärt nicht, wie eine screenshot-lesende App mit Aufbewahrung umgehen sollte. Es bedeutet aber, dass der Vergleich der Screenshot-Richtlinien von drei namentlich genannten Wettbewerbern weniger Übereinstimmung und weniger Anwendbarkeit ergab, als die Ausgangsannahme unterstellte.
Hilft das Entfernen von Metadaten wirklich, oder ist das nur gesunder Menschenverstand?
Jedes Foto, das eine Handykamera aufnimmt, kann EXIF-Daten tragen, Gerätemodell, Zeitstempel, manchmal Standort, eingebettet in die Datei. Der Rat, diese Daten vor dem Teilen eines Fotos zu entfernen, steht überall im Netz. Ich habe nach einer kontrollierten Studie gesucht, die misst, ob das Entfernen dieser Daten, oder das manuelle Schwärzen der sichtbaren Inhalte eines Screenshots, einen messbaren Rückgang an realem Datenschutzschaden bewirkt, gegenüber einer nur theoretischen Gefährdung, die eine Schwärzung bloß auf dem Papier schließt. Ich habe keine gefunden. Was es gibt, ist beschreibende Sicherheitsliteratur, die erklärt, welche Felder es gibt und wie man sie entfernt, kein Experiment, das Ergebnisse für Menschen, die Metadaten entfernt haben, mit denen vergleicht, die es nicht getan haben. Behandle den Rat als vernünftig und ungetestet, nicht als gemessenen Schutz.
Was Subtext selbst mit den Metadaten eines Screenshots macht, dazu habe ich direkt die System-Prompts und Tool-Definitionen des Backends gelesen, dieselbe Datei, die die eigenen Regeln dieser Website vor jeder Produktbehauptung zu prüfen verlangen (functions/src/subtext_prompts.ts). Nichts in diesem Code liest, entfernt, prüft oder berührt sonst irgendwie die Datei-Metadaten eines Screenshots. Bilder werden dem zugrunde liegenden bildfähigen Modell als visuelle Eingabe übergeben, genau wie jedes andere Bild auch, und nirgendwo in den Prompts oder Tool-Definitionen, die ich gelesen habe, taucht ein separater Schritt zur Metadaten-Verarbeitung auf. Ich formuliere das als Abwesenheit, nicht als Funktion. Ich habe keinen Beleg dafür gefunden, dass Subtext in irgendeine Richtung etwas mit den Metadaten eines Screenshots macht, und ich behaupte keine Fähigkeit, die der Code nicht zeigt. Es gibt auch keine unabhängige Auswertung dazu, wie genau Subtext selbst einen Screenshot liest, dieselbe Lücke, die durch jede oben genannte App verläuft. Was die Datenschutzerklärung bestätigt, und was die beiden Workflow-Seiten dieser Website bereits festhalten, ist die allgemeine Regel, die für jeden Anhang gilt, Screenshots eingeschlossen. Ein Gespräch, und alles, was daran hängt, löscht sich fünf Tage nach der letzten Nutzung von selbst, oder nach 90 Tagen, wenn es angepinnt ist, und nichts Hochgeladenes wird zum Training eines KI-Modells verwendet.
Was sich daraus ergibt
Setzt man die vier Teile zusammen, ist das Bild ungleichmäßig, und das mit Absicht, nicht durch Zufall. Der eine Teil mit einer echten, überprüfbaren Genauigkeitszahl, die allgemeine OCR-Leistung in einem bildfähigen Modell, ist gemischt. Stark bei Englisch, messbar schwächer bei nicht-lateinischen Schriften und bei niedrig aufgelöstem Text, getestet an kuratierten Benchmarks, nicht an echten Chatscreenshots. Vier der sechs zusätzlichen Fehlerarten oben stützen sich auf echte Forschung zu einer angrenzenden Frage. Was eine Reaktion tatsächlich bedeutet, sobald sie korrekt gelesen ist, wie zuverlässig selbstlöschende Apps Inhalte überhaupt erst entfernen, wie oft Menschen sich gegenseitig bei Stickern missverstehen, und wie schlecht Sprachmodelle im Allgemeinen mit sprachlich gemischtem Text umgehen. Keine dieser vier Studien hat den konkreten Fall getestet, dass ein Modell es von einem Screenshot abliest. Die anderen beiden, Zuordnung im Gruppenchat und Verwechslung bei zitierten Antworten, haben überhaupt keine Forschung hinter sich, weder angrenzend noch sonst wie, nur eine mechanische Beschreibung, wie die Oberfläche funktioniert. Der Wettbewerbsvergleich fand weniger zum Vergleichen, als die Ausgangsannahme unterstellte. Eine App verschwunden, eine, die Bilder nach eigener Aussage von ihrer KI-Funktion ausschließt, eine, die nie überhaupt Screenshots akzeptiert hat. Und die Metadaten-Frage entpuppte sich als Rat, den alle wiederholen und den offenbar niemand gemessen hat.
Nichts davon heißt, dass ein Modell, das deinen Screenshot liest, im allgemeinen Gebrauch unzuverlässig ist. Die größte, direkteste Studie hier hat trotzdem gemessen, dass ein Modell die meisten englischen Szenentexte korrekt liest. Es heißt, dass die konkrete Behauptung, ein bildfähiges Modell lese einen Chatscreenshot genauso zuverlässig wie reinen getippten Text, echte, quantifizierte Ausnahmen hat, manche davon groß, und mehrere schwere Fälle, die noch niemand gemessen hat.
So ist der Stand heute. Subtext ist eine weitere App, die das macht, nicht besser und nicht schlechter belegt als die anderen oben.
Subtext im Browser ausprobierenMit der Handykamera scannen und installieren.Subtext im Browser ausprobieren
Stand: 27. September 2026.
Quellen
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang and Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Szenentext- und Dokument-OCR-Benchmarks gegen eine Modellgeneration von 2023, nicht gegen Messaging-Screenshots.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv-Preprint, ein einzelner Autor. Testet 100 isolierte japanische Kanji-Zeichen bei kontrollierter Schriftgröße und Auflösung, keine Chat-Screenshots.
- Miller Hillberg, Levonian, Kluver, Terveen and Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Befragung von 710 Twitter-Nutzenden zu ihren eigenen Tweets mit Emoji, kein Test, ob ein Modell sie liest.
- Tardelli, Alvisi, Cima, Cresci and Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv-Preprint. Über 650.000 Reaktionen auf Krypto-bezogene Telegram-Nachrichten, eine Plattform und ein Themenbereich.
- Heath, MacDermott and Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Testet das eigene Löschverhalten von WhatsApp, Snapchat und Telegram, nicht das Lesen eines Screenshots durch KI.
- Tang, Hew, Herring and Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Fünf Diskussionsgruppen und sieben Interviewte an einer Universität; misst menschliches Missverstehen, nicht das eines Modells.
- Sheth, Sinha, Patil, Beniwal and Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv-Preprint, ein Survey-Paper, kein screenshot-spezifischer Test.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, geprüft am 27. September 2026. Lieferte null Ergebnisse; die App scheint nicht mehr gelistet zu sein.
- Mei. Terms of Service and Privacy Policy, zuletzt geändert am 3. Oktober 2023, geprüft am 27. September 2026.
- ConfiText. Privacy Policy, in Kraft seit 10. Februar 2026, geprüft am 27. September 2026.