ArtiklerSkriveværktøjer
AI kan læse et screenshot af dine beskeder. Den læser det ikke altid rigtigt.
De publicerede fejlrater for at læse lille, mørk tilstand og ikke-latinsk tekst i et screenshot, hvad tre screenshot-apps siger om din upload, og om det at fjerne metadata gør nogen målbar forskel.
Af Samet Durgun · Medstifter af Subtext · 14 min læsning
Sæt et screenshot af en samtale ind i et AI-værktøj, og det plejer bare at virke. Det fortæller dig, hvem der sagde hvad, forstår vittigheden og skriver et svar, der giver mening. “Plejer” er den del, ingen sætter et tal på, og det er værd at skille fra et andet spørgsmål, dette site allerede dækker andetsteds. Når en model først har ordene foran sig, hører det til under siden om at læse den besked, du har fået og forskningen bag at læse en hel tråd, før du svarer at finde ud af, hvem der taler på tværs af flere beskeder, følge et spørgsmål, der aldrig blev besvaret, og læse sarkasme. Dette indlæg handler om det trin, der kommer før, om modellen overhovedet læser billedet rigtigt.
Jeg er med til at bygge Subtext, en app til tonetjek og svarudkast, der tager et screenshot af en samtale som et af sine input, så jeg har en grund til at ønske et godt svar her. Det har jeg ikke. Det, der følger, er det, jeg kunne efterprøve på et snævrere og mindre flatterende spørgsmål, hvor gode nutidens synsmodeller er til at læse et telefonscreenshot som et billede, ikke som en transskription, og hvad der sker med et screenshot, når du giver det til en af de her apps. Hver kilde nedenfor er en, jeg selv har åbnet.
At læse et screenshot er et billedproblem, før det er et sprogproblem
Et screenshot af en samtale er et billede af lys, ikke en tekstblok, en computer allerede kan parse. Før en model kan ræsonnere om, hvad en besked siger, skal den først omsætte pixels til korrekte tegn, i hvilken skrifttype, størrelse, kontrast og layout beskedappen nu engang har brugt. Det trin er optisk tegngenkendelse (OCR), der kører på det samme synssystem, der læser ethvert andet billede. De fleste nøjagtighedspåstande om AI og beskeder handler om den ræsonnering, der sker efter det trin. Få handler om selve trinnet.
De tal, der findes
Den mest direkte test er en evaluering fra 2023 af GPT-4V’s OCR-evner på tværs af flere benchmarks1. På engelsk scene-tekst scorede den 88,0 procent ordnøjagtighed på CUTE80-benchmarken og mellem 62,0 og 66,0 procent på tre sværere engelske sæt, mod et specialiseret OCR-systems 68,2 til 98,6 procent på de samme fire benchmarks. På kinesisk scene-tekst, ReCTS-benchmarken, scorede GPT-4V nul. I en separat flersproget test i samme artikel nåede dens F1-score for tekstgenkendelse i billeder op på 82,49 procent for engelsk og 83,42 procent for fransk, mod 16,55 procent for arabisk og 1,36 procent for kinesisk. Artiklen fastslår ligeud, at “på trods af sin alsidighed i forskellige OCR-opgaver overgår GPT-4V ikke eksisterende, førende OCR-modeller,” og at den “viste svagheder, når den håndterede ikke-latinske sprog”1.
Det er én modelgeneration, testet på kuraterede scene-tekst-datasæt, ikke screenshots af beskeder, så læs det som et gulv under det generelle problem, ikke en dom over nogen app, der findes i dag. Det er stadig det mest direkte, efterprøvelige tal imod den enkle påstand, at AI læser ikke-latinske skrifttyper inde i et billede lige så godt, som den læser latinske. Ud fra denne evidens gør den ikke.
Opløsning betyder også noget. Samme artikel fandt “en positiv sammenhæng mellem inputbilledets opløsning og genkendelsespræstationen”1, hvilket taler imod et komprimeret eller kraftigt nedskaleret screenshot, præcis det, mange telefoner producerer, når et billede bliver gemt igen eller delt videre, endnu før modellen har læst et eneste ord. En smallere preprint fra 2025 testede det her mere præcist, dog kun på enkelte japanske kanji-tegn gengivet i kontrollerede størrelser, ikke på screenshots af samtaler. Multimodale modeller matchede en dedikeret OCR-metode ved omkring 300 pixel pr. tomme, og “deres præstation forringes markant under 150 ppi”2. Om den tærskel holder for lille tekst inde i et komprimeret telefonscreenshot, er ikke testet. Retningen, at mindre og lavere opløst tekst forringes hurtigere for de her modeller end for dedikeret OCR, er det, to separate artikler er enige om.
På mørk tilstand specifikt, og på lav-kontrast-tekst mere generelt, kunne jeg ikke finde en publiceret evaluering, der måler multimodale modellers nøjagtighed mod lys-tilstand-udgaver af de samme screenshots. Klassiske OCR-pipelines vender rutinemæssigt mørke billeder om, før de behandles, fordi omvendt kontrast er en kendt kilde til fejllæsninger i den ældre teknologi, hvilket tyder på, at bekymringen i bund og grund er rimelig. Ingen har kørt den tilsvarende test på de multimodale modeller, folk nu bruger til at læse et screenshot af en samtale, i hvert fald ikke noget, jeg kunne finde, så jeg vil ikke angive et tal, jeg ikke kan understøtte.
Emoji sidder inde i det samme billede, og forskningen i dem svarer på et andet spørgsmål, end det folk normalt stiller. Det handler mindre om, hvorvidt en model kan se, at en form er en emoji, og mere om, hvilken emoji den kigger på, for det samme tegn tegner ikke det samme billede alle steder. Unicode-konsortiet standardiserer kodepunktet og dets betydning, ikke selve grafikken. Apple, Google, Samsung og alle andre leverandører tegner deres egen glyf for det3. I en undersøgelse af 710 Twitter-brugere, der lige havde postet et tweet med en emoji, vidste mindst 25 procent ikke, at deres emoji kunne se anderledes ud på en andens telefon, og efter at have set, hvordan et af deres egne tweets faktisk blev vist på en anden platform, sagde 20 procent, at de ville have redigeret det eller slet ikke sendt det3. Det gab findes mellem to mennesker, der kigger på det samme tegn på to forskellige telefoner. Et screenshot indsnævrer det yderligere. Hvad end afsenderens platform tegnede, bliver fladt til et stillbillede, og en model, der læser det billede, kan ikke gennemskue, hvilken bagvedliggende emoji det var, uden platformens egen skrifttype allerede bagt ind i pixlerne. Om den kombination, tvetydighed på tværs af platforme plus screenshot-komprimering, ændrer, hvor tit en model navngiver den forkerte følelse bag en emoji, er en test, ingen ser ud til at have kørt endnu.
Fejltyper, de øvrige sider her ikke dækker
En håndfuld specifikke chatfunktioner gør korrekt læsning sværere på hver deres måde, ud over pixel-niveau-problemet ovenfor. Noget af det, der følger, hviler på et studie. Noget er en ren beskrivelse af, hvordan interfacet virker, uden dedikeret forskning bag, og jeg har forsøgt at holde de to adskilt, så den ene ikke låner den andens vægt.
Gruppechats og tråde med flere deltagere. Et en-til-en-screenshot giver en model to visuelle grupper at sortere talen i, den ene side og den anden. En gruppetråd bryder det mønster. Tre eller flere personer kan dele én boblefarve, en afsenders navn optræder måske kun over den første besked i en serie og ikke på hver linje bagefter, og en beskåret avatar kan være det eneste visuelle spor til, hvem der taler. Jeg fandt ikke noget studie, der tester modellers nøjagtighed på at tilskrive linjer korrekt inde i et screenshot af en gruppechat specifikt. Den nærmeste forskning måler et beslægtet, men andet problem, at tilskrive taler i skriftlige mødereferater, ikke boblede screenshots, og det område er allerede dækket på siden om at læse en hel samtaletråd. Det, der står her, er en mekanisk beskrivelse af screenshot-udgaven af det samme problem, ikke et testet fund. Flere talere, der deler færre visuelle spor pr. linje, er umiddelbart en sværere tilskrivningsopgave, uanset om nogen har målt, hvor meget sværere.
Tryk-reaktioner og emoji-reaktioner. En lille emoji fastgjort til hjørnet af en andens boble, et hjerte, en latter, en tommelfinger op, bærer to separate risici. Den første er, om en model overhovedet kan identificere den lille, nogle gange overlappende glyf korrekt, hvilket jeg ikke fandt nogen direkte test af. Den anden er, hvad reaktionen betyder, når den først er læst korrekt, og den del er blevet undersøgt. En analyse af mere end 650.000 Telegram-beskeder med reaktioner fandt, at positive reaktioner dominerede svarene, uanset om den underliggende besked læste som neutral eller negativ, og konkluderede, at emoji-reaktioner “ikke pålideligt fungerer som indikatorer for følelsesmæssig spejling eller genklang i indholdet”4. Det er en stor stikprøve fra én platform og ét emneområde, kryptorelaterede kanaler, og det er stadig en preprint, så behandl de præcise tal som foreløbige. Pointen, der betyder noget for en screenshot-læser, holder uanset de forbehold. At navngive reaktionsemojien korrekt fortæller hverken en model eller et menneske, hvad reaktionen faktisk signalerer.
Citerede svar og tråd-UI. De fleste beskedapps lader dig svare på en bestemt tidligere besked og viser det citerede uddrag som en mindre, mattere blok over den nye. I et screenshot er den visuelle behandling, mindre størrelse, lysere farve, nogle gange en lodret streg, det eneste signal om, at en linje er citeret kontekst frem for en ny besked fra den, det visuelt ser ud til at være. Beskær billedet nogle få pixels anderledes, og forskellen kan forsvinde. Jeg fandt intet studie, der måler, hvor ofte en model forveksler et citeret uddrag med en ny besked eller omvendt. Det her er en sandsynlig mekanisk fejltype, indbygget i den måde, interfacet repræsenterer tråde på, ikke en testet én.
Forsvindende og selvudslettende beskeder. En selvudslettende besked er designet til ikke at efterlade nogen spor, når den først er set, hvilket er præcis det, et screenshot omgår. Før noget AI-spørgsmål overhovedet kommer ind i billedet, havde forskere inden for digital efterforskning allerede vist, at selve præmissen er mere vaklende, end brugere går ud fra. Ved direkte at teste WhatsApp, Snapchat og Telegrams funktioner til selvudslettende beskeder genfandt et studie angiveligt slettet indhold fra enhedsdata og cloud-backups i flere af de scenarier, det afprøvede5. Det er et fund om platformene, ikke om AI, der læser et screenshot af en, og det måler ingenting om en models nøjagtighed. Det, det derimod fastslår, uafhængigt af al AI, er, at et screenshot ikke er den eneste måde, selvudslettende indhold overlever sin tiltænkte sletning på. Om en apps egen sløring på skærmen eller et “screenshot taget”-banner introducerer visuelle artefakter, en model kunne forveksle med indhold, er, igen, en sandsynlig bekymring uden dedikeret studie bag.
Stickers. En sticker bærer mening gennem positur og udtryk mere end gennem ord, hvilket gør den sværere at læse for en maskine og, viser det sig, for mennesker med. Et studie af fem studerendes diskussionsgrupper, der brugte stickers i rigtige projektchats, og som trak på interviews med syv af deltagerne om deres egen brug af stickers, fandt et misforhold mellem, hvad afsenderen mente, og hvad modtageren forstod, i 34,7 procent af de undersøgte stickers, primært på grund af tvetydige ansigts- og kropsudtryk i selve tegningen6. Det er et lille, kvalitativt studie af én befolkningsgruppe, universitetsstuderende på én asiatisk institution, og det måler menneskelig fejllæsning, ikke en models. Det er stadig reel evidens for, at en sticker er et tvetydigt signal, selv mellem mennesker, der allerede kender hinanden, hvilket sætter et lavt loft for, hvor godt nogen læser, menneske eller maskine, bør forventes at klare sig ud fra billedet alene.
Sprogskift midt i samtalen. At skifte sprog inde i én besked, eller mellem beskeder i samme tråd, er almindeligt i tosproget og flersproget sms-skrivning og et dokumenteret svært tilfælde for sprogmodeller generelt. En oversigtsartikel fra 2025 over feltet fastslår ligeud, at “de fleste LLM’er stadig kæmper med input på blandede sprog”7, uden et tal, der uden videre ville overføre sig til et screenshot med to sprog inde i én talebobbel. Jeg kunne ikke finde et studie, der isolerer sprogskift som specifikt et screenshot-læsningsproblem, ud over det bredere flersprogede tekstproblem, oversigtsartiklen beskriver. Betragt det her som en reel, dokumenteret vanskelighed i selve teknologien, anvendt her på et tilfælde, ingen endnu har testet direkte.
Hvad tre screenshot-apps siger om din upload
Subtext er ikke den eneste app, der er bygget til at læse et screenshot af en samtale, og den nyttige sammenligning er, hvad hver enkelt apps egen nuværende dokumentation siger sker med en upload, ikke hvad markedsføringen antyder. Det bredere felt af AI-skriveværktøjer er kortlagt separat; her tjekkede jeg tre produkter nævnt der, op mod deres egne privatlivssider, for ét snævert spørgsmål, nemlig opbevaring, sletning og brug til at træne en model.
Keys AI Texting Coach, bygget af Charmed Inc. omkring at læse screenshots til dating- og beskedråd, ser ikke længere ud til at være aktiv. Apples egen iTunes-opslagstjeneste returnerer nul resultater for dens App Store-opslag, app-id 1510154956, pr. 27. september 20268, og dens kendte webdomæne omdirigerer hver eneste sti, inklusive den, der plejede at rumme dens privatlivspolitik, til en side, der bare parkerer domænet. Jeg kunne ikke finde en nuværende privatlivspolitik for den her app gennem nogen kanal. Hvad den end engang sagde om håndtering af screenshots, kan jeg ikke efterprøve det i dag, og jeg genskaber ikke en påstand ud fra en side, der ikke længere loader.
Mei, en standard-beskedapp til Android med en valgfri AI-assistent, oplyser i sine nuværende vilkår, sidst ændret 3. oktober 2023 og tjekket 27. september 20269, at beskedindhold, herunder “billeder, fotos, lyd eller videoer,” bliver gemt på dens servere “udelukkende med det formål at kommunikere” og “ikke bruges af os på nogen anden måde.” Separat, i beskrivelsen af, hvad dens valgfrie AI-assistent rent faktisk modtager, siger det samme dokument, at de sidste 20 beskeder, der sendes til AI’en som kontekst, inkluderer “emojis, reaktioner og URL’er,” men at “beskeder med vedhæftninger, talebeskeder og billeder ikke bliver indsamlet” til det formål. Læst sammen siger Meis egen dokumentation, at dens AI-forslagsfunktion slet ikke behandler billedindhold, screenshots inklusive. Lagringsklausulen om fotos handler om almindelig beskedlevering inde i appen, ikke noget, der sendes til AI’en. En separat AI-assistentfunktion, som brugeren selv skal slå til, fungerer anderledes. Når en bruger slår den til, uploader Mei hele enhedens database af sms- og mms-beskeder, inklusive teksten i hver besked, plus hashede telefonnumre og kontakters navne, og politikken oplyser, at de data bliver “brugt til at træne AI-modeller.” Den klausul nævner ikke screenshots eller billeder specifikt, men den handler om at træne på beskedtekst bredt, ikke kun på kontaktmetadata.
ConfiTexts privatlivspolitik, gældende fra 10. februar 2026 og tjekket 27. september 202610, adresserer kun “tekst, du indtaster i appen,” og nævner hverken fotos, billeder eller screenshots noget sted i sine ni afsnit. Dens eget marketingsite beskriver præcis én inputmetode, at indsætte en besked, brugeren allerede har skrevet, og ingen screenshot- eller fotouploadfunktion optræder noget sted på siden. Som tingene står, ser opbevaringsspørgsmålet ikke ud til at gælde for ConfiText. Produktet tager, ifølge dets eget nuværende site, slet ikke et screenshot som input.
På tværs af de tre er regnestykket én app, der ikke længere ser ud til at eksistere, én, hvis egen dokumentation udelukker billeder fra det, dens AI rent faktisk læser, men som træner på beskedtekst, når dens assistent er slået til, og én, der slet ikke tager imod et screenshot. Det afgør ikke, hvordan en screenshot-læsende app bør håndtere opbevaring. Det betyder, at det at sammenligne tre navngivne konkurrenters screenshot-politikker gav mindre enighed, og mindre anvendelighed, end præmissen antog fra starten.
At fjerne metadata er sund fornuft, men er det også målt?
Ethvert foto, et telefonkamera tager, kan bære EXIF-data, altså enhedsmodel, tidsstempel, nogle gange lokation, indlejret i filen. Rådet om at fjerne de data, før du deler et foto, findes overalt online. Jeg ledte efter et kontrolleret studie, der måler, om det at fjerne de data, eller manuelt overstrege det synlige indhold i et screenshot, giver et målbart fald i reel privatlivsskade, sammenlignet med en teoretisk eksponering, som en overstregning kun lukker på papiret. Jeg fandt ikke et. Det, der findes, er beskrivende sikkerhedstekster, der forklarer, hvilke felter der findes, og hvordan man fjerner dem, ikke et eksperiment, der sammenligner udfald for folk, der fjernede metadata, med folk, der ikke gjorde. Betragt rådet som fornuftigt og utestet, ikke som en målt beskyttelse.
Om hvad Subtext selv gør med et screenshots metadata læste jeg backendens systemprompter og værktøjsdefinitioner direkte, den samme fil, dette sites egne regler kræver, at man tjekker, før man fremsætter nogen produktpåstand (functions/src/subtext_prompts.ts). Intet i den kode læser, fjerner, undersøger eller på anden måde rører ved et screenshots filmetadata. Billeder afleveres til den underliggende synsmodel som visuelt input, på samme måde som ethvert andet billede ville blive, og der optræder ikke noget separat trin til metadatabehandling nogen steder i de prompter eller værktøjsdefinitioner, jeg læste. Jeg siger det som et fravær, ikke som en funktion. Jeg fandt ingen beviser for, at Subtext gør noget som helst med et screenshots metadata, i nogen retning, og jeg påstår ikke en evne, koden ikke viser. Der findes heller ingen uafhængig evaluering af, hvor præcist Subtext selv læser et screenshot, det samme hul, der løber gennem hver eneste app nævnt ovenfor. Det, privatlivspolitikken bekræfter, og det, de to sider om arbejdsgange på dette site allerede fastslår, er den generelle regel, der gælder for enhver vedhæftning, screenshots inklusive. En samtale, og alt, der er vedhæftet den, sletter sig selv fem dage efter sidste brug, eller halvfems dage, hvis den er fastgjort, og intet uploadet bliver brugt til at træne en AI-model.
Hvad det samlet betyder
Sæt de fire dele sammen, og billedet er ujævnt med vilje, ikke ved et uheld. Den ene del med et reelt, efterprøveligt nøjagtighedstal, generel OCR-præstation inde i en synsmodel, er blandet: stærk på engelsk, målbart svagere på ikke-latinske skrifttyper og på lavopløst tekst, testet på kuraterede benchmarks, ikke egentlige screenshots af samtaler. Fire af de seks ekstra fejltyper ovenfor citerer reel forskning i et tilstødende spørgsmål: hvad en reaktion faktisk signalerer, når den først er læst korrekt, hvor pålideligt selvudslettende apps rent faktisk sletter indhold, hvor ofte folk fejllæser hinandens stickers, og hvor dårligt sprogmodeller generelt håndterer tekst på blandede sprog. Ingen af de fire studier testede det præcise tilfælde, at en model læser det af et screenshot. De to andre, tilskrivning i gruppechats og forveksling af citerede svar, har slet ingen forskning bag sig, hverken tilstødende eller på anden måde, kun en mekanisk beskrivelse af, hvordan interfacet fungerer. Konkurrenttjekket fandt mindre at sammenligne, end præmissen antog: én app forsvundet, én der udelukker billeder fra sin egen AI-funktion efter eget udsagn, én der aldrig tog imod screenshots overhovedet. Og spørgsmålet om metadata viste sig at være et råd, alle gentager, og som ingen ser ud til at have målt.
Intet af det her betyder, at en model, der læser dit screenshot, er upålidelig i almindelig brug. Det største, mest direkte studie her målte stadig, at en model læste det meste engelske scene-tekst korrekt. Det betyder, at den specifikke påstand, at en synsmodel læser et screenshot af en samtale lige så pålideligt, som den læser almindelig, indtastet tekst, har reelle, kvantificerede undtagelser, nogle af dem store, og adskillige svære tilfælde, ingen overhovedet har målt.
Sådan står tingene i dag. Subtext er endnu en app, der gør det her, hverken mere eller mindre efterprøvet end de øvrige ovenfor.
Prøv Subtext i browserenScan den med telefonens kamera for at installere.Prøv Subtext i browseren
Tjekket 27. september 2026.
Kilder
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang og Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Scene-tekst- og dokument-OCR-benchmarks mod én modelgeneration fra 2023, ikke screenshots af beskeder.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv-preprint, enkeltforfatter. Tester 100 isolerede japanske kanji-tegn i kontrolleret skriftstørrelse og opløsning, ikke screenshots af samtaler.
- Miller Hillberg, Levonian, Kluver, Terveen og Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Spørgeskemaundersøgelse blandt 710 Twitter-brugere om deres egne tweets med emoji, ikke en test af, at en model læser dem.
- Tardelli, Alvisi, Cima, Cresci og Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv-preprint. Over 650.000 reaktioner på kryptorelaterede Telegram-beskeder, én platform og ét emneområde.
- Heath, MacDermott og Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Tester WhatsApp, Snapchat og Telegrams egen sletteadfærd, ikke AI’s læsning af et screenshot.
- Tang, Hew, Herring og Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Fem diskussionsgrupper og syv interviewpersoner på ét universitet; måler menneskelig fejllæsning, ikke en models.
- Sheth, Sinha, Patil, Beniwal og Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv-preprint-oversigtsartikel, ingen screenshot-specifik test.
- Apple. iTunes Lookup API-resultat for Keys AI Texting Coach, app-id 1510154956, tjekket 27. september 2026. Nul resultater returneret; appen ser ikke længere ud til at være listet.
- Mei. Vilkår for brug og privatlivspolitik, sidst ændret 3. oktober 2023, tjekket 27. september 2026.
- ConfiText. Privatlivspolitik, gældende fra 10. februar 2026, tjekket 27. september 2026.