ArtikelenSchrijftools
AI kan een screenshot van je berichten lezen. Het leest ze niet altijd goed.
De gepubliceerde foutpercentages voor het lezen van kleine tekst, tekst in dark mode en tekst in niet-Latijnse schriften op een screenshot, wat drie screenshot-apps zeggen over je upload, en of het verwijderen van metadata iets meetbaars oplevert.
Door Samet Durgun · Medeoprichter van Subtext · 14 min leestijd
Plak een screenshot van een chat in een AI-tool en meestal werkt het gewoon. Het vertelt je wie wat zei, snapt de grap, en stelt een antwoord op dat ergens op slaat. “Meestal” is het deel waar niemand een getal op plakt, en het is de moeite waard om dat te scheiden van een andere vraag die deze site al elders behandelt. Zodra een model de woorden voor zich heeft, is uitzoeken wie er aan het woord is over meerdere beurten, een vraag volgen die nooit beantwoord werd, sarcasme lezen, het onderwerp van de pagina over het bericht dat je hebt ontvangen lezen en het onderzoek achter het lezen van een hele draad voor je antwoordt. Dit stuk gaat over de stap ervoor, of het model de afbeelding om te beginnen correct leest.
Ik bouw mee aan Subtext, een app die toon checkt en antwoorden opstelt, en die een screenshot van een chat als een van de inputs gebruikt, dus ik heb reden om hier een gunstig antwoord te willen. Dat heb ik niet. Wat volgt is wat ik kon verifiëren op een smallere, minder vleiende vraag, hoe goed de multimodale modellen van vandaag zijn in het lezen van een screenshot van een telefoon als afbeelding, niet als transcript, en wat er met een screenshot gebeurt zodra je hem aan een van deze apps geeft. Elke bron hieronder heb ik zelf geopend.
Een screenshot lezen is eerst een beeldprobleem, dan pas een taalprobleem
Een screenshot van een chat is een plaatje van licht, geen blok tekst dat een computer al kan parsen. Voordat een model kan redeneren over wat een bericht zegt, moet het eerst pixels correct omzetten in tekens, in wat voor lettertype, grootte, contrast en indeling de berichten-app ook gebruikte. Die stap is optische tekenherkenning (OCR), en die draait op hetzelfde visuele systeem dat elke andere afbeelding leest. De meeste nauwkeurigheidsclaims over AI en appen gaan over de redenering die na deze stap komt. Weinig gaan over de stap zelf.
De cijfers die er wel zijn
De meest directe test is een evaluatie uit 2023 van de OCR-vaardigheid van GPT-4V op verschillende benchmarks1. Op Engelse scene-tekst scoorde het 88,0 procent woordnauwkeurigheid op de CUTE80-benchmark en tussen de 62,0 en 66,0 procent op drie moeilijkere Engelse sets, tegenover 68,2 tot 98,6 procent van een gespecialiseerd OCR-systeem op dezelfde vier benchmarks. Op Chinese scene-tekst, de ReCTS-benchmark, scoorde GPT-4V nul. In een aparte meertalige test in hetzelfde paper haalde de F1-score voor tekstdetectie 82,49 procent voor Engels en 83,42 procent voor Frans, tegenover 16,55 procent voor Arabisch en 1,36 procent voor Chinees. Het paper stelt ronduit dat “GPT-4V, ondanks zijn veelzijdigheid in het uitvoeren van uiteenlopende OCR-taken, niet beter presteert dan bestaande toonaangevende OCR-systemen,” en dat het “beperkingen vertoonde bij niet-Latijnse talen”1.
Dat is één modelgeneratie, getest op samengestelde scene-tekst-datasets, geen appberichten-screenshots, dus lees het als een ondergrens voor het algemene probleem, niet als een oordeel over een app die vandaag beschikbaar is. Het blijft wel het meest directe, controleerbare cijfer tegen de simpele bewering dat AI niet-Latijnse schriften in een afbeelding net zo goed leest als Latijnse. Op basis van dit bewijs doet het dat niet.
Resolutie doet er ook toe. Hetzelfde paper vond “een positieve correlatie tussen de resolutie van de invoerafbeelding en de herkenningsprestaties”1, wat in het nadeel werkt van een gecomprimeerde of sterk verkleinde screenshot, precies wat veel telefoons opleveren als een afbeelding opnieuw wordt opgeslagen of doorgestuurd, voordat het model ook maar één woord leest. Een smallere preprint uit 2025 testte dit preciezer, al ging het alleen om losse Japanse kanji-tekens weergegeven op gecontroleerde groottes, niet om chatscreenshots. Multimodale modellen evenaarden een gespecialiseerde OCR-methode bij ongeveer 300 pixels per inch, en “hun prestaties gaan flink achteruit onder 150 ppi”2. Of die drempel ook geldt voor kleine tekst in een gecomprimeerde telefoonscreenshot, is niet getest. De richting, kleinere en lager-resolutie tekst die sneller achteruitgaat voor deze modellen dan voor speciaal gebouwde OCR, is het punt waarop twee aparte papers het eens zijn.
Specifiek over dark mode, en over tekst met weinig contrast in het algemeen, kon ik geen gepubliceerde evaluatie vinden die de nauwkeurigheid van multimodale modellen meet tegenover de light-mode-versie van dezelfde screenshots. Klassieke OCR-pijplijnen keren donkere afbeeldingen standaard om voor ze verwerkt worden, omdat omgekeerd contrast in die oudere technologie een bekende oorzaak van leesfouten is, wat suggereert dat de onderliggende zorg redelijk is. Niemand heeft de equivalente test gedaan op de multimodale modellen die mensen nu gebruiken om een chatscreenshot te lezen, in elk geval niet in iets wat ik kon vinden, dus ga ik geen cijfer noemen dat ik niet kan onderbouwen.
Emoji zitten in diezelfde afbeelding, en het onderzoek ernaar beantwoordt een andere vraag dan die mensen meestal stellen. Het gaat minder om of een model kan zien dat een vorm een emoji is, en meer om welke emoji het precies ziet, omdat hetzelfde teken niet overal hetzelfde plaatje tekent. Het Unicode Consortium standaardiseert het codepunt en de betekenis ervan, niet de tekening. Apple, Google, Samsung en elke andere leverancier tekenen er hun eigen glyph voor3. In een enquête onder 710 Twitter-gebruikers die net een tweet met een emoji hadden geplaatst, wist minstens 25 procent niet dat hun emoji er op de telefoon van iemand anders anders uit kon zien, en nadat ze te zien kregen hoe een van hun eigen tweets er daadwerkelijk uitzag op een ander platform, zei 20 procent dat ze hem zouden hebben aangepast of helemaal niet verstuurd3. Die kloof bestaat al tussen twee mensen die naar hetzelfde teken kijken op twee verschillende telefoons. Een screenshot maakt die kloof nog kleiner. Wat het platform van de afzender ook tekende, wordt platgeslagen tot een stilstaand beeld, en een model dat die afbeelding leest, kan niet meer achterhalen welke onderliggende emoji het was zonder dat het eigen lettertype van het platform al in de pixels gebakken zit. Of die combinatie, cross-platform-ambiguïteit plus screenshotcompressie, verandert hoe vaak een model de verkeerde emotie achter een emoji noemt, is een test die niemand tot nu toe lijkt te hebben gedaan.
Faalpatronen die de workflow-pagina’s hier niet behandelen
Een handvol specifieke chatfuncties maakt correct lezen op hun eigen manier moeilijker, los van het probleem op pixelniveau hierboven. Een deel van wat volgt steunt op een studie. Een deel is een simpele beschrijving van hoe de interface werkt, zonder gericht onderzoek erachter, en ik heb geprobeerd de twee gescheiden te houden zodat de een niet het gewicht van de ander leent.
Groepschats en gesprekken met meerdere deelnemers. Een screenshot van een gesprek tussen twee mensen geeft een model twee visuele groepen om spraak in te sorteren, de ene kant en de andere. Een groepsdraad doorbreekt dat patroon. Drie of meer mensen kunnen dezelfde kleur tekstballon delen, de naam van een afzender verschijnt soms alleen boven het eerste bericht van een reeks en niet bij elke volgende regel, en een uitgesneden avatar kan het enige visuele signaal zijn voor wie er spreekt. Ik vond geen studie die de nauwkeurigheid van een model test op het correct toewijzen van regels specifiek binnen een screenshot van een groepschat. Het dichtstbijzijnde onderzoek meet een verwant maar ander probleem, sprekersattributie in geschreven vergadertranscripten, niet in geschreenshotte tekstballonnen, en dat terrein wordt al behandeld op de pagina over het lezen van een hele gespreksdraad. Wat hier staat, is een mechanische beschrijving van de screenshotversie van hetzelfde probleem, geen geteste bevinding. Meer sprekers die minder visuele signalen per regel delen, is op het eerste gezicht een moeilijkere toewijzingstaak, of iemand nu gemeten heeft hoeveel moeilijker of niet.
Tikreacties en emoji-reacties. Een kleine emoji vastgeprikt in de hoek van andermans tekstballon, een hartje, een lach, een duim omhoog, brengt twee aparte risico’s met zich mee. Het eerste is of een model om te beginnen het kleine, soms overlappende symbool correct kan identificeren, waar ik geen directe test van vond. Het tweede is wat de reactie betekent zodra hij correct gelezen is, en dat deel is wel onderzocht. Een analyse van meer dan 650.000 Telegram-berichten met een reactie erop vond dat positieve reacties de respons domineerden, ongeacht of het onderliggende bericht neutraal of negatief overkwam, met als conclusie dat emoji-reacties “niet betrouwbaar functioneren als indicatoren van emotionele weerspiegeling of resonantie van de inhoud”4. Dat is een grote steekproef van één platform en één onderwerpsgebied, cryptogerelateerde kanalen, en het blijft een preprint, dus behandel de precieze cijfers als voorlopig. Het punt dat ertoe doet voor iemand die een screenshot leest, blijft overeind ondanks die kanttekeningen. De reactie-emoji correct benoemen, vertelt niemand, model of mens, wat de reactie daadwerkelijk signaleert.
Citaten van eerdere berichten en de threading-interface. De meeste berichten-apps laten je reageren op een specifiek eerder bericht, en tonen het geciteerde fragment als een kleiner, dofferer blok boven het nieuwe bericht. In een screenshot is die visuele behandeling, kleinere afmeting, lichtere kleur, soms een verticale lijn, het enige signaal dat een regel geciteerde context is in plaats van een nieuw bericht van wie het er visueel naar uitziet dat aan de beurt is. Snijd de afbeelding een paar pixels anders bij en het onderscheid kan verdwijnen. Ik vond geen studie die meet hoe vaak een model een geciteerd fragment aanziet voor een nieuw bericht, of andersom. Dit is een aannemelijk mechanisch faalpatroon dat is ingebakken in hoe de interface threading weergeeft, geen geteste bevinding.
Verdwijnende en tijdelijke berichten. Een tijdelijk bericht is bedoeld om geen spoor achter te laten zodra het bekeken is, en dat is precies wat een screenshot ondermijnt. Nog voor er een AI-vraag in beeld komt, hadden forensische onderzoekers al laten zien dat de onderliggende aanname wankeler is dan gebruikers aannemen. Door de functies voor verdwijnende berichten van WhatsApp, Snapchat en Telegram rechtstreeks te testen, herstelde één studie zogenaamd verwijderde inhoud uit apparaatgegevens en cloudback-ups in verschillende van de geteste scenario’s5. Dat is een bevinding over de platforms, niet over AI die een screenshot ervan leest, en het meet niets over de nauwkeurigheid van een model. Wat het wel vaststelt, los van AI, is dat een screenshot niet de enige manier is waarop tijdelijke inhoud zijn beoogde verwijdering overleeft. Of de eigen wazige weergave van een app of een banner als “screenshot gemaakt” visuele artefacten toevoegt die een model voor inhoud zou kunnen aanzien, is, ook hier, een aannemelijke zorg zonder gericht onderzoek erachter.
Stickers. Een sticker draagt betekenis meer via houding en gezichtsuitdrukking dan via woorden, wat hem moeilijker leesbaar maakt voor een machine en, zo blijkt, ook voor mensen. Een studie onder vijf groepen studenten die stickers gebruikten in echte projectchats, aangevuld met interviews met zeven van de deelnemers over hun eigen stickergebruik, vond een mismatch tussen wat de afzender bedoelde en wat de ontvanger begreep bij 34,7 procent van de onderzochte stickers, vooral door dubbelzinnige gezichts- en lichaamsuitdrukkingen in de tekening zelf6. Dat is een kleine, kwalitatieve studie van één populatie, universiteitsstudenten op één Aziatische instelling, en het meet menselijk misverstaan, niet dat van een model. Het is nog steeds echt bewijs dat een sticker een dubbelzinnig signaal is, zelfs tussen mensen die elkaar al kennen, wat een laag plafond zet voor hoe goed welke lezer dan ook, mens of machine, geacht zou moeten worden te presteren op basis van alleen de afbeelding.
Code-switching midden in een gesprek. Halverwege één bericht van taal wisselen, of tussen berichten in dezelfde draad, komt vaak voor bij tweetalig en meertalig appen en is een gedocumenteerd lastig geval voor taalmodellen in het algemeen. Een overzichtsstudie uit 2025 stelt ronduit dat “de meeste LLM’s nog steeds moeite hebben met gemengdtalige invoer”7, zonder een cijfer dat zich netjes laat vertalen naar een screenshot met twee talen in één tekstballon. Ik kon geen studie vinden die code-switching specifiek isoleert als een probleem bij het lezen van screenshots, los van het bredere meertalige-tekstprobleem dat het overzicht beschrijft. Behandel dit als een reële, gedocumenteerde moeilijkheid in de onderliggende technologie, hier toegepast op een geval dat nog niemand rechtstreeks heeft getest.
Wat drie screenshot-apps zeggen over je upload
Subtext is niet de enige app die gebouwd is om een chatscreenshot te lezen, en de nuttige vergelijking is wat de eigen, actuele documentatie van elke app zegt dat er met een upload gebeurt, niet wat de marketing suggereert. Het bredere veld van AI-schrijftools is apart in kaart gebracht; hier heb ik drie daar genoemde producten gecontroleerd tegen hun eigen privacypagina’s, voor één smalle vraag, namelijk bewaring, verwijdering en gebruik om een model te trainen.
Keys AI Texting Coach, gebouwd door Charmed Inc. rond het lezen van screenshots voor advies over daten en appen, lijkt niet meer in de lucht te zijn. Apple’s eigen iTunes-opzoekdienst geeft nul resultaten voor de App Store-vermelding, app-id 1510154956, per 27 september 20268, en het bekende webdomein stuurt elk pad, inclusief het pad waar ooit het privacybeleid stond, door naar een domain-parkingpagina. Ik kon voor deze app via geen enkel kanaal een actueel privacybeleid vinden. Wat er ooit ook stond over de omgang met screenshots, ik kan het vandaag niet verifiëren, en ik reconstrueer geen bewering vanaf een pagina die niet meer laadt.
Mei, een standaard Android-berichten-app met een optionele AI-assistent, stelt in de huidige voorwaarden, laatst gewijzigd op 3 oktober 2023 en gecontroleerd op 27 september 20269, dat berichtinhoud, inclusief “afbeeldingen, foto’s, audio of video’s,” wordt opgeslagen op de servers “met als enige doel communicatie” en “door ons op geen enkele andere manier gebruikt.” Apart daarvan, bij de beschrijving van wat de optionele AI-assistent daadwerkelijk ontvangt, zegt hetzelfde document dat de laatste 20 berichten die als context naar de AI gaan “emoji’s, reacties en URL’s” bevatten, maar dat “berichten met bijlagen, spraakberichten en afbeeldingen niet worden verzameld” voor dat doel. Samen gelezen zegt Mei’s eigen documentatie dat de AI-suggestiefunctie helemaal geen beeldinhoud verwerkt, screenshots inbegrepen. De opslagclausule over foto’s gaat over gewone berichtbezorging binnen de app, niet over iets dat naar de AI gestuurd wordt. Een aparte, optionele AI-assistentfunctie werkt anders. Zet een gebruiker die aan, dan uploadt Mei de hele SMS- en MMS-berichtendatabase van het apparaat, inclusief de tekst van elk bericht, plus gehashte telefoonnummers en de namen van contacten, en het beleid stelt dat die data “wordt gebruikt om AI-modellen te trainen.” Die clausule noemt geen screenshots of afbeeldingen specifiek, maar gaat over trainen op berichttekst in het algemeen, niet alleen op contactmetadata.
ConfiText’s privacybeleid, van kracht sinds 10 februari 2026 en gecontroleerd op 27 september 202610, gaat alleen over “tekst die je invoert in de app” en noemt foto’s, afbeeldingen of screenshots nergens in zijn negen secties. De eigen marketingsite beschrijft precies één invoermethode, het plakken van een bericht dat de gebruiker al geschreven had, en nergens op de pagina staat een functie voor het uploaden van een screenshot of foto. Zoals de zaken er nu voor staan, lijkt de bewaarvraag niet van toepassing op ConfiText. Het product neemt, volgens de eigen actuele site, om te beginnen geen screenshot als input.
Van de drie is de tussenstand dus één app die niet meer lijkt te bestaan, één waarvan de eigen documentatie afbeeldingen uitsluit van wat de AI daadwerkelijk leest maar wel op berichttekst traint zodra de assistent aanstaat, en één die helemaal geen screenshot als input neemt. Dat legt niet vast hoe een screenshot-lezende app met bewaring zou moeten omgaan. Het betekent wel dat het vergelijken van de screenshotbeleidsregels van drie met naam genoemde concurrenten minder overeenstemming, en minder toepasbaarheid, opleverde dan het uitgangspunt vooraf aannam.
Metadata verwijderen, gezond verstand of gemeten effect
Elke foto die een telefooncamera maakt, kan EXIF-data bevatten, apparaatmodel, tijdstip, soms locatie, ingebed in het bestand. Het advies om die data te verwijderen voordat je een foto deelt, staat overal online. Ik zocht naar een gecontroleerde studie die meet of het verwijderen van die data, of het handmatig onherkenbaar maken van de zichtbare inhoud van een screenshot, een meetbare afname oplevert in privacyschade in de praktijk, tegenover een theoretische blootstelling die een redactie alleen op papier afsluit. Ik vond er geen. Wat wel bestaat, is beschrijvend, technisch schrijfwerk dat uitlegt welke velden bestaan en hoe je ze verwijdert, geen experiment dat de uitkomsten vergelijkt van mensen die metadata verwijderden tegenover mensen die dat niet deden. Behandel het advies als redelijk en ongetest, niet als een gemeten bescherming.
Over wat Subtext zelf doet met de metadata van een screenshot, heb ik de systeemprompts en tooldefinities van de backend rechtstreeks gelezen, hetzelfde bestand dat de eigen regels van deze site voorschrijven te checken voor elke productbewering (functions/src/subtext_prompts.ts). Niets in die code leest, verwijdert, inspecteert of raakt anderszins de bestandsmetadata van een screenshot aan. Afbeeldingen worden aan het onderliggende multimodale model gegeven als visuele input, op dezelfde manier als elke andere afbeelding, en nergens in de prompts of tooldefinities die ik las, staat een aparte stap voor het verwerken van metadata. Ik noem dat een afwezigheid, geen functie. Ik vond geen bewijs dat Subtext iets doet met de metadata van een screenshot, in welke richting dan ook, en ik claim geen mogelijkheid die de code niet laat zien. Er bestaat ook geen onafhankelijke evaluatie van hoe nauwkeurig Subtext zelf een screenshot leest, hetzelfde gat dat door elke hierboven genoemde app heen loopt. Wat het privacybeleid wel bevestigt, en wat de twee workflow-pagina’s op deze site al stellen, is de algemene regel die voor elke bijlage geldt, screenshots inbegrepen. Een gesprek, en alles wat eraan vastzit, verwijdert zichzelf vijf dagen na het laatste gebruik, of na 90 dagen als het is vastgezet, en niets wat je instuurt wordt gebruikt om een AI-model te trainen.
Wat dit bij elkaar optelt
Leg de vier onderdelen bij elkaar en het beeld is bewust ongelijk, niet toevallig. Het ene onderdeel met een echt, controleerbaar nauwkeurigheidscijfer, algemene OCR-prestaties in een multimodaal model, is gemengd. Sterk in het Engels, meetbaar zwakker bij niet-Latijnse schriften en bij tekst met een lage resolutie, getest op samengestelde benchmarks, niet op echte chatscreenshots. Vier van de zes extra faalpatronen hierboven citeren echt onderzoek naar een aanverwante vraag, namelijk wat een reactie daadwerkelijk signaleert zodra hij correct gelezen is, hoe betrouwbaar tijdelijke apps inhoud om te beginnen wissen, hoe vaak mensen elkaars stickers verkeerd lezen, en hoe slecht taalmodellen in het algemeen omgaan met gemengdtalige tekst. Geen van die vier studies testte het precieze geval van een model dat het van een screenshot afleest. De andere twee, groepschatattributie en verwarring rond citaten, hebben helemaal geen onderzoek achter zich, aanverwant of anderszins, alleen een mechanische beschrijving van hoe de interface werkt. De concurrentiecheck vond minder om te vergelijken dan het uitgangspunt aannam. Eén app verdwenen, één die volgens eigen zeggen afbeeldingen uitsluit van de eigen AI-functie, één die nooit screenshots accepteerde. En de metadatavraag bleek advies te zijn dat iedereen herhaalt en niemand lijkt te hebben gemeten.
Niets hiervan betekent dat een model dat je screenshot leest onbetrouwbaar is in algemeen gebruik. De grootste, meest directe studie hier mat nog steeds dat een model het meeste Engelse scene-tekst correct las. Het betekent dat de specifieke bewering, dat een multimodaal model een chatscreenshot even betrouwbaar leest als gewoon getypte tekst, echte, gekwantificeerde uitzonderingen heeft, sommige daarvan groot, en verschillende lastige gevallen die niemand ooit gemeten heeft.
Dat is waar de zaken vandaag staan. Subtext is nog een app die dit doet, niet meer en niet minder geverifieerd dan de rest hierboven.
Probeer Subtext in je browserScan hem met de camera van je telefoon om te installeren.Probeer Subtext in je browser
Gecontroleerd op 27 september 2026.
Bronnen
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang en Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Benchmarks voor scene-tekst en document-OCR tegen één modelgeneratie uit 2023, geen screenshots van appberichten.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv preprint, enige auteur. Test op 100 losse Japanse kanji-tekens bij gecontroleerd lettertype en resolutie, geen chatscreenshots.
- Miller Hillberg, Levonian, Kluver, Terveen en Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Enquête onder 710 Twitter-gebruikers over hun eigen tweets met emoji, geen test van een model dat ze leest.
- Tardelli, Alvisi, Cima, Cresci en Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv preprint. Meer dan 650.000 reacties op cryptogerelateerde Telegram-berichten, één platform en één onderwerpsgebied.
- Heath, MacDermott en Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Test van het eigen verwijdergedrag van WhatsApp, Snapchat en Telegram, geen AI die een screenshot ervan leest.
- Tang, Hew, Herring en Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Vijf discussiegroepen en zeven geïnterviewden op één universiteit; meet menselijk misverstaan, niet dat van een model.
- Sheth, Sinha, Patil, Beniwal en Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv preprint-overzicht, geen screenshot-specifieke test.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, gecontroleerd op 27 september 2026. Gaf nul resultaten; de app lijkt niet langer vermeld te staan.
- Mei. Terms of Service and Privacy Policy, laatst gewijzigd op 3 oktober 2023, gecontroleerd op 27 september 2026.
- ConfiText. Privacy Policy, van kracht sinds 10 februari 2026, gecontroleerd op 27 september 2026.