ArtiklerSkriveverktøy

KI kan lese et skjermbilde av meldingene dine. Den leser det ikke alltid riktig.

De publiserte feilratene for å lese liten, mørk modus og ikke-latinsk tekst i et skjermbilde, hva tre skjermbilde-apper sier om opplastingen din, og om det å fjerne metadata gjør noen målbar forskjell.

Av Samet Durgun · Medgrunnlegger av Subtext · 14 min lesetid

Lim inn et skjermbilde av en samtale i et KI-verktøy, og det pleier bare å virke. Det forteller deg hvem som sa hva, skjønner vitsen og skriver et svar som gir mening. “Pleier” er delen ingen setter et tall på, og det er verdt å skille fra et annet spørsmål dette nettstedet allerede dekker et annet sted. Når en modell først har ordene foran seg, hører det til under siden om å lese meldingen du har fått og forskningen bak å lese en hel tråd før du svarer å finne ut hvem som snakker på tvers av flere meldinger, følge et spørsmål som aldri ble besvart, og lese sarkasme. Dette innlegget handler om steget som kommer før, om modellen i det hele tatt leser bildet riktig.

Jeg er med og bygger Subtext, en app for tonesjekk og svarutkast som tar et skjermbilde av en samtale som ett av sine input, så jeg har en grunn til å ønske et godt svar her. Det har jeg ikke. Det som følger, er det jeg kunne etterprøve på et snevrere og mindre flatterende spørsmål, hvor gode dagens synsmodeller er til å lese et telefonskjermbilde som et bilde, ikke som en utskrift, og hva som skjer med et skjermbilde når du gir det til en av disse appene. Hver kilde nedenfor er en jeg selv har åpnet.

Å lese et skjermbilde er et bildeproblem før det er et språkproblem

Et skjermbilde av en samtale er et bilde av lys, ikke en tekstblokk en datamaskin allerede kan tolke. Før en modell kan resonnere om hva en melding sier, må den først omgjøre piksler til riktige tegn, i hvilken skrifttype, størrelse, kontrast og layout meldingsappen nå tilfeldigvis brukte. Det steget er optisk tegngjenkjenning (OCR), som kjører på det samme synssystemet som leser ethvert annet bilde. De fleste nøyaktighetspåstander om KI og meldinger handler om resonneringen som skjer etter det steget. Få handler om selve steget.

Tallene som finnes

Den mest direkte testen er en evaluering fra 2023 av GPT-4Vs OCR-evner på tvers av flere benchmarker1. På engelsk scene-tekst scoret den 88,0 prosent ordnøyaktighet på CUTE80-benchmarken og mellom 62,0 og 66,0 prosent på tre vanskeligere engelske sett, mot et spesialisert OCR-systems 68,2 til 98,6 prosent på de samme fire benchmarkene. På kinesisk scene-tekst, ReCTS-benchmarken, scoret GPT-4V null. I en separat flerspråklig test i samme artikkel nådde F1-scoren for tekstgjenkjenning i bilder 82,49 prosent for engelsk og 83,42 prosent for fransk, mot 16,55 prosent for arabisk og 1,36 prosent for kinesisk. Artikkelen slår rett ut fast at “til tross for sin allsidighet i ulike OCR-oppgaver presterer ikke GPT-4V bedre enn eksisterende, ledende OCR-modeller,” og at den “viste svakheter når den håndterte ikke-latinske språk”1.

Det er én modellgenerasjon, testet på kuraterte scene-tekst-datasett, ikke skjermbilder av meldinger, så les det som et gulv under det generelle problemet, ikke en dom over noen app som finnes i dag. Det er likevel det mest direkte, etterprøvbare tallet mot den enkle påstanden om at KI leser ikke-latinske skriftsystemer inne i et bilde like godt som den leser latinske. Ut fra dette beviset gjør den ikke det.

Oppløsning betyr også noe. Samme artikkel fant “en positiv sammenheng mellom oppløsningen på inputbildet og gjenkjenningsytelsen”1, noe som taler imot et komprimert eller kraftig nedskalert skjermbilde, akkurat det mange telefoner produserer når et bilde blir lagret på nytt eller delt videre, enda før modellen har lest et eneste ord. En smalere preprint fra 2025 testet dette mer presist, riktignok bare på enkelttegn av japansk kanji gjengitt i kontrollerte størrelser, ikke på skjermbilder av samtaler. Multimodale modeller matchet en dedikert OCR-metode ved omtrent 300 piksler per tomme, og “ytelsen deres forverres betydelig under 150 ppi”2. Om den terskelen holder for liten tekst inne i et komprimert telefonskjermbilde, er ikke testet. Retningen, at mindre og lavere oppløst tekst forverres raskere for disse modellene enn for dedikert OCR, er det to separate artikler er enige om.

På mørk modus spesifikt, og på lav-kontrast-tekst mer generelt, klarte jeg ikke å finne en publisert evaluering som måler multimodale modellers nøyaktighet mot lys-modus-versjoner av de samme skjermbildene. Klassiske OCR-pipeliner snur rutinemessig mørke bilder om før de behandles, fordi omvendt kontrast er en kjent kilde til feillesing i den eldre teknologien, noe som tyder på at bekymringen i bunn og grunn er rimelig. Ingen har kjørt den tilsvarende testen på de multimodale modellene folk nå bruker til å lese et skjermbilde av en samtale, i hvert fall ikke noe jeg kunne finne, så jeg kommer ikke til å oppgi et tall jeg ikke kan underbygge.

Emoji sitter inne i det samme bildet, og forskningen på dem svarer på et annet spørsmål enn det folk vanligvis stiller. Det handler mindre om hvorvidt en modell kan se at en form er en emoji, og mer om hvilken emoji den ser på, for det samme tegnet tegner ikke det samme bildet overalt. Unicode-konsortiet standardiserer kodepunktet og betydningen, ikke selve grafikken. Apple, Google, Samsung og alle andre leverandører tegner sin egen glyf for det3. I en undersøkelse av 710 Twitter-brukere som nettopp hadde postet et tweet med en emoji, visste minst 25 prosent ikke at emojien deres kunne se annerledes ut på en annens telefon, og etter å ha fått se hvordan et av deres egne tweets faktisk ble vist på en annen plattform, sa 20 prosent at de ville ha redigert det eller ikke sendt det i det hele tatt3. Det gapet finnes mellom to mennesker som ser på det samme tegnet på to forskjellige telefoner. Et skjermbilde snevrer det ytterligere inn. Det plattformen til avsenderen tegnet, blir flatt til et stillbilde, og en modell som leser det bildet, kan ikke gjenskape hvilken underliggende emoji det var, uten at plattformens egen skrifttype allerede er bakt inn i pikslene. Om den kombinasjonen, tvetydighet på tvers av plattformer pluss skjermbilde-komprimering, endrer hvor ofte en modell navngir feil følelse bak en emoji, er en test ingen ser ut til å ha kjørt ennå.

Feiltyper de andre sidene her ikke dekker

En håndfull spesifikke chatfunksjoner gjør korrekt lesing vanskeligere på hver sin måte, utover pikselnivå-problemet ovenfor. Noe av det som følger, hviler på et studie. Noe er en ren beskrivelse av hvordan grensesnittet virker, uten dedikert forskning bak, og jeg har forsøkt å holde de to fra hverandre, slik at den ene ikke låner den andres tyngde.

Gruppechatter og tråder med flere deltakere. Et en-til-en-skjermbilde gir en modell to visuelle grupper å sortere talen inn i, den ene siden og den andre. En gruppetråd bryter det mønsteret. Tre eller flere personer kan dele én boblefarge, en avsenders navn dukker kanskje bare opp over den første meldingen i en rekke og ikke på hver linje etterpå, og et beskåret avatarbilde kan være det eneste visuelle sporet til hvem som snakker. Jeg fant ingen studie som tester modellers nøyaktighet på å tilskrive linjer riktig inne i et skjermbilde av en gruppechat spesifikt. Den nærmeste forskningen måler et beslektet, men annet problem, å tilskrive talere i skriftlige møtereferater, ikke bobler i skjermbilder, og det området er allerede dekket på siden om å lese en hel samtaletråd. Det som står her, er en mekanisk beskrivelse av skjermbilde-versjonen av det samme problemet, ikke et testet funn. Flere talere som deler færre visuelle spor per linje, er umiddelbart en vanskeligere tilskrivningsoppgave, uansett om noen har målt hvor mye vanskeligere.

Trykk-reaksjoner og emoji-reaksjoner. En liten emoji festet til hjørnet av en annens boble, et hjerte, en latter, en tommel opp, bærer to separate risikoer. Den første er om en modell i det hele tatt kan identifisere den lille, noen ganger overlappende glyfen riktig, noe jeg ikke fant noen direkte test av. Den andre er hva reaksjonen betyr når den først er lest riktig, og den delen er blitt undersøkt. En analyse av mer enn 650 000 Telegram-meldinger med reaksjoner fant at positive reaksjoner dominerte svarene, uansett om den underliggende meldingen leste som nøytral eller negativ, og konkluderte med at emoji-reaksjoner “ikke pålitelig fungerer som indikatorer på følelsesmessig speiling eller resonans i innholdet”4. Det er et stort utvalg fra én plattform og ett emneområde, kryptorelaterte kanaler, og det er fortsatt en preprint, så behandle de nøyaktige tallene som foreløpige. Poenget som betyr noe for en skjermbilde-leser, holder uansett disse forbeholdene. Å navngi reaksjonsemojien riktig forteller verken en modell eller et menneske hva reaksjonen faktisk signaliserer.

Siterte svar og tråd-grensesnitt. De fleste meldingsapper lar deg svare på en bestemt tidligere melding, og viser det siterte utdraget som en mindre, mattere blokk over den nye. I et skjermbilde er den visuelle behandlingen, mindre størrelse, lysere farge, noen ganger en loddrett strek, det eneste signalet om at en linje er sitert kontekst i stedet for en ny melding fra den det visuelt ser ut til å være. Beskjær bildet noen få piksler annerledes, og forskjellen kan forsvinne. Jeg fant ingen studie som måler hvor ofte en modell forveksler et sitert utdrag med en fersk melding eller omvendt. Dette er en sannsynlig mekanisk feiltype, innebygd i måten grensesnittet representerer tråder på, ikke en testet én.

Forsvinnende og selvslettende meldinger. En selvslettende melding er designet for ikke å etterlate noen spor når den først er sett, som er akkurat det et skjermbilde omgår. Før noe KI-spørsmål i det hele tatt kommer inn i bildet, hadde forskere innen digital etterforskning allerede vist at selve premisset er mer vaklende enn brukere antar. Ved å teste WhatsApp, Snapchat og Telegrams funksjoner for selvslettende meldinger direkte, gjenvant ett studie angivelig slettet innhold fra enhetsdata og skylagringsbackuper i flere av scenarioene det prøvde5. Det er et funn om plattformene, ikke om KI som leser et skjermbilde av en, og det måler ingenting om en modells nøyaktighet. Det det derimot fastslår, uavhengig av all KI, er at et skjermbilde ikke er den eneste måten selvslettende innhold overlever sin tiltenkte sletting på. Om en apps egen sløring på skjermen eller et “skjermbilde tatt”-varsel introduserer visuelle artefakter en modell kunne forveksle med innhold, er, igjen, en rimelig bekymring uten noe dedikert studie bak.

Klistremerker. Et klistremerke bærer mening gjennom positur og uttrykk mer enn gjennom ord, noe som gjør det vanskeligere å lese for en maskin og, viser det seg, for mennesker også. Et studie av fem studentdiskusjonsgrupper som brukte klistremerker i ekte prosjektchatter, og som bygget på intervjuer med sju av deltakerne om deres egen bruk av klistremerker, fant et misforhold mellom hva avsenderen mente og hva mottakeren forsto, i 34,7 prosent av de undersøkte klistremerkene, hovedsakelig på grunn av tvetydige ansikts- og kroppsuttrykk i selve tegningen6. Det er et lite, kvalitativt studie av én populasjon, universitetsstudenter ved én asiatisk institusjon, og det måler menneskelig feillesing, ikke en modells. Det er likevel reelt belegg for at et klistremerke er et tvetydig signal, selv mellom mennesker som allerede kjenner hverandre, noe som setter et lavt tak for hvor godt noen leser, menneske eller maskin, bør forventes å klare seg ut fra bildet alene.

Språkbytte midt i samtalen. Å bytte språk inne i én melding, eller mellom meldinger i samme tråd, er vanlig i tospråklig og flerspråklig meldingsskriving og et dokumentert vanskelig tilfelle for språkmodeller generelt. En oversiktsartikkel fra 2025 over feltet slår rett ut fast at “de fleste LLM-er fortsatt sliter med input på blandede språk”7, uten et tall som uten videre ville overføres til et skjermbilde med to språk inne i én tekstboble. Jeg kunne ikke finne et studie som isolerer språkbytte som spesifikt et skjermbilde-lesingsproblem, utover det bredere flerspråklige tekstproblemet oversiktsartikkelen beskriver. Betrakt dette som en reell, dokumentert vanskelighet i selve teknologien, anvendt her på et tilfelle ingen ennå har testet direkte.

Hva tre skjermbilde-apper sier om opplastingen din

Subtext er ikke den eneste appen bygget for å lese et skjermbilde av en samtale, og den nyttige sammenligningen er hva hver enkelt apps egen nåværende dokumentasjon sier skjer med en opplasting, ikke hva markedsføringen antyder. Det bredere feltet av KI-skriveverktøy er kartlagt separat; her sjekket jeg tre produkter nevnt der, opp mot deres egne personvernsider, for ett snevert spørsmål, nemlig oppbevaring, sletting og bruk til å trene en modell.

Keys AI Texting Coach, bygget av Charmed Inc. rundt å lese skjermbilder for dating- og meldingsråd, ser ikke lenger ut til å være aktiv. Apples egen iTunes-oppslagstjeneste returnerer null resultater for App Store-oppføringen, app-id 1510154956, per 27. september 20268, og det kjente webdomenet omdirigerer hver eneste sti, inkludert den som pleide å romme personvernerklæringen, til en side som bare parkerer domenet. Jeg klarte ikke å finne en gjeldende personvernerklæring for denne appen gjennom noen kanal. Hva den enn en gang sa om håndtering av skjermbilder, kan jeg ikke etterprøve i dag, og jeg gjenskaper ikke en påstand fra en side som ikke lenger laster.

Mei, en standard-meldingsapp for Android med en valgfri KI-assistent, opplyser i sine nåværende vilkår, sist endret 3. oktober 2023 og sjekket 27. september 20269, at meldingsinnhold, inkludert “bilder, foto, lyd eller video,” blir lagret på serverne dens “utelukkende med det formål å kommunisere” og “ikke brukt av oss på noen annen måte.” Separat, i beskrivelsen av hva den valgfrie KI-assistenten faktisk mottar, sier det samme dokumentet at de siste 20 meldingene som sendes til KI-en som kontekst, inkluderer “emojier, reaksjoner og URL-er,” men at “meldinger med vedlegg, talemeldinger og bilder ikke samles inn” til det formålet. Lest sammen sier Meis egen dokumentasjon at KI-forslagsfunksjonen ikke behandler bildeinnhold i det hele tatt, skjermbilder inkludert. Lagringsklausulen om bilder gjelder vanlig meldingslevering inne i appen, ikke noe som sendes til KI-en. En separat KI-assistentfunksjon, som brukeren selv må slå på, fungerer annerledes. Når en bruker slår den på, laster Mei opp hele enhetens database av SMS- og MMS-meldinger, inkludert teksten i hver melding, pluss hashede telefonnumre og kontakters navn, og retningslinjene sier at disse dataene blir “brukt til å trene KI-modeller.” Den klausulen navngir ikke skjermbilder eller bilder spesifikt, men den handler om å trene på meldingstekst bredt, ikke bare på kontaktmetadata.

ConfiTexts personvernerklæring, gjeldende fra 10. februar 2026 og sjekket 27. september 202610, omhandler bare “tekst du skriver inn i appen,” og nevner verken foto, bilder eller skjermbilder noe sted i sine ni seksjoner. Nettsiden dens beskriver nøyaktig én inputmetode, å lime inn en melding brukeren allerede har skrevet, og ingen funksjon for skjermbilde- eller fotoopplasting dukker opp noe sted på siden. Slik ting står, ser ikke oppbevaringsspørsmålet ut til å gjelde for ConfiText. Produktet tar, ifølge sin egen nåværende side, ikke imot et skjermbilde som input i det hele tatt.

På tvers av de tre er regnestykket én app som ikke lenger ser ut til å eksistere, én hvis egen dokumentasjon utelukker bilder fra det KI-en faktisk leser, men som trener på meldingstekst når assistenten er slått på, og én som ikke tar imot et skjermbilde i det hele tatt. Det avgjør ikke hvordan en skjermbilde-lesende app bør håndtere oppbevaring. Det betyr at det å sammenligne tre navngitte konkurrenters skjermbilde-retningslinjer ga mindre enighet, og mindre anvendelighet, enn premisset antok fra starten.

Å fjerne metadata er sunn fornuft, men er det også målt?

Ethvert bilde et telefonkamera tar, kan bære EXIF-data, altså enhetsmodell, tidsstempel, noen ganger posisjon, innebygd i filen. Rådet om å fjerne disse dataene før du deler et bilde, finnes overalt på nettet. Jeg lette etter et kontrollert studie som måler om det å fjerne disse dataene, eller manuelt sladde det synlige innholdet i et skjermbilde, gir et målbart fall i reell personvernskade, sammenlignet med en teoretisk eksponering som en sladding bare lukker på papiret. Jeg fant ikke noe. Det som finnes, er beskrivende sikkerhetstekster som forklarer hvilke felt som finnes og hvordan man fjerner dem, ikke et eksperiment som sammenligner utfall for folk som fjernet metadata, mot folk som ikke gjorde det. Behandle rådet som fornuftig og utestet, ikke som en målt beskyttelse.

Om hva Subtext selv gjør med metadataene til et skjermbilde, leste jeg backendens systemprompter og verktøysdefinisjoner direkte, den samme filen dette nettstedets egne regler krever at man sjekker før noen produktpåstand (functions/src/subtext_prompts.ts). Ingenting i den koden leser, fjerner, undersøker eller på annen måte rører ved filmetadataene til et skjermbilde. Bilder overleveres til den underliggende synsmodellen som visuelt input, på samme måte som ethvert annet bilde ville blitt, og det finnes ikke noe eget steg for metadatabehandling noe sted i promptene eller verktøysdefinisjonene jeg leste. Jeg sier dette som et fravær, ikke som en funksjon. Jeg fant ingen bevis for at Subtext gjør noe som helst med metadataene til et skjermbilde, i noen retning, og jeg påstår ikke en evne koden ikke viser. Det finnes heller ingen uavhengig evaluering av hvor presist Subtext selv leser et skjermbilde, det samme hullet som løper gjennom hver eneste app nevnt ovenfor. Det personvernerklæringen bekrefter, og det de to sidene om arbeidsflyt på dette nettstedet allerede fastslår, er den generelle regelen som gjelder for ethvert vedlegg, skjermbilder inkludert. En samtale, og alt som er vedlagt den, sletter seg selv fem dager etter siste bruk, eller nitti dager hvis den er festet, og ingenting som er lastet opp, brukes til å trene en KI-modell.

Hva det hele betyr

Sett de fire delene sammen, og bildet er ujevnt med vilje, ikke ved et uhell. Den ene delen med et reelt, etterprøvbart nøyaktighetstall, generell OCR-ytelse inne i en synsmodell, er blandet: sterk på engelsk, målbart svakere på ikke-latinske skriftsystemer og på lavoppløst tekst, testet på kuraterte benchmarker, ikke faktiske skjermbilder av samtaler. Fire av de seks ekstra feiltypene ovenfor siterer reell forskning på et tilstøtende spørsmål: hva en reaksjon faktisk signaliserer når den først er lest riktig, hvor pålitelig selvslettende apper faktisk sletter innhold, hvor ofte folk feilleser hverandres klistremerker, og hvor dårlig språkmodeller generelt håndterer tekst på blandede språk. Ingen av de fire studiene testet det eksakte tilfellet at en modell leser det av et skjermbilde. De to andre, tilskrivning i gruppechatter og forveksling av siterte svar, har ingen forskning bak seg i det hele tatt, tilstøtende eller på annen måte, bare en mekanisk beskrivelse av hvordan grensesnittet fungerer. Konkurrentsjekken fant mindre å sammenligne enn premisset antok: én app borte, én som utelukker bilder fra sin egen KI-funksjon etter eget utsagn, én som aldri tok imot skjermbilder i det hele tatt. Og spørsmålet om metadata viste seg å være et råd alle gjentar, og som ingen ser ut til å ha målt.

Ingenting av dette betyr at en modell som leser skjermbildet ditt, er upålitelig i vanlig bruk. Det største, mest direkte studiet her målte fortsatt at en modell leste det meste av engelsk scene-tekst riktig. Det betyr at den spesifikke påstanden, at en synsmodell leser et skjermbilde av en samtale like pålitelig som den leser vanlig, tastet tekst, har reelle, kvantifiserte unntak, noen av dem store, og flere vanskelige tilfeller ingen har målt i det hele tatt.

Slik står saken i dag. Subtext er nok en app som gjør dette, verken mer eller mindre verifisert enn de andre ovenfor. Prøv Subtext i nettleserenPrøv Subtext i nettleseren

Sjekket 27. september 2026.

Kilder

  1. Shi, Peng, Liao, Lin, Chen, Liu, Zhang og Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Scene-tekst- og dokument-OCR-benchmarker mot én modellgenerasjon fra 2023, ikke skjermbilder av meldinger.
  2. Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv-preprint, enkeltforfatter. Tester 100 isolerte japanske kanji-tegn i kontrollert skriftstørrelse og oppløsning, ikke skjermbilder av samtaler.
  3. Miller Hillberg, Levonian, Kluver, Terveen og Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Spørreundersøkelse blant 710 Twitter-brukere om deres egne tweeter med emoji, ikke en test av at en modell leser dem.
  4. Tardelli, Alvisi, Cima, Cresci og Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv-preprint. Over 650 000 reaksjoner på kryptorelaterte Telegram-meldinger, én plattform og ett emneområde.
  5. Heath, MacDermott og Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Tester WhatsApp, Snapchat og Telegrams egen sletteoppførsel, ikke KIs lesing av et skjermbilde.
  6. Tang, Hew, Herring og Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Fem diskusjonsgrupper og sju intervjuobjekter ved ett universitet; måler menneskelig feillesing, ikke en modells.
  7. Sheth, Sinha, Patil, Beniwal og Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv-preprint-oversiktsartikkel, ingen skjermbilde-spesifikk test.
  8. Apple. iTunes Lookup API-resultat for Keys AI Texting Coach, app-id 1510154956, sjekket 27. september 2026. Null resultater returnert; appen ser ikke lenger ut til å være oppført.
  9. Mei. Vilkår for bruk og personvernerklæring, sist endret 3. oktober 2023, sjekket 27. september 2026.
  10. ConfiText. Personvernerklæring, gjeldende fra 10. februar 2026, sjekket 27. september 2026.