ArtiklarSkrivverktyg

AI kan läsa en skärmbild av dina sms. Den läser inte alltid rätt.

De publicerade felfrekvenserna för att läsa liten text, mörkt läge och icke-latinsk skrift i en skärmbild, vad tre appar som läser skärmbilder säger om din uppladdning, och om det gör någon mätbar skillnad att rensa bort metadata.

Av Samet Durgun · Medgrundare av Subtext · 13 min läsning

Klistra in en skärmbild av en chatt i ett AI-verktyg och det brukar bara fungera. Den berättar vem som sa vad, fattar skämtet, och skriver ett svarsutkast som går ihop. “Brukar” är den del ingen sätter en siffra på, och den är värd att skilja från en annan fråga den här sajten redan täcker på annat håll. När en modell väl har orden framför sig, att räkna ut vem som säger vad genom en tråd, hålla koll på en fråga som aldrig fick svar, läsa sarkasm, är ämnet för sidan om att läsa meddelandet du fått och forskningen bakom att läsa en hel tråd innan du svarar. Den här texten handlar om steget före: om modellen överhuvudtaget läser bilden rätt.

Jag är med och bygger Subtext, en app för tonkoll och svarsutkast som tar en skärmbild av en chatt som en av sina indata, så jag har skäl att vilja ha ett fördelaktigt svar här. Det har jag inte. Det som följer är vad jag kunde verifiera på en snävare, mindre smickrande fråga: hur bra dagens modeller med synförmåga är på att läsa en mobilskärmbild som en bild, inte en transkription, och vad som händer med en skärmbild när du väl lämnar den till en av de här apparna. Varje källa nedan är en jag har öppnat själv.

Att läsa en skärmbild är ett bildproblem innan det är ett språkproblem

En skärmbild av en chatt är en bild av ljus, inte ett textblock en dator redan kan tolka. Innan en modell kan resonera om vad ett meddelande säger måste den först omvandla pixlar till tecken korrekt, i vilket typsnitt, storlek, kontrast och layout meddelandeappen än råkade använda. Det steget är optisk teckenigenkänning (OCR), som rider på samma synsystem som läser vilken annan bild som helst. De flesta precisionspåståenden om AI och meddelanden gäller resonemanget som sker efter det här steget. Få gäller själva steget.

Siffrorna som finns

Det mest direkta testet är en utvärdering från 2023 av GPT-4V:s OCR-förmåga över flera benchmarks1. På engelsk scentext fick den 88,0 procents ordprecision på CUTE80-benchmarken och mellan 62,0 och 66,0 procent på tre svårare engelska set, mot ett specialiserat OCR-systems 68,2 till 98,6 procent på samma fyra benchmarks. På kinesisk scentext, ReCTS-benchmarken, fick GPT-4V noll. I ett separat flerspråkigt test i samma artikel nådde dess textdetekterings-F1 82,49 procent för engelska och 83,42 procent för franska, mot 16,55 procent för arabiska och 1,36 procent för kinesiska. Artikeln slår fast rakt ut att GPT-4V, “trots sin mångsidighet inom olika OCR-uppgifter, inte presterar bättre än dagens bästa OCR-modeller”, och att den “visade begränsningar när den hanterade icke-latinska språk”1.

Det är en modellgeneration, testad på utvalda scentext-dataset, inte meddelandeskärmbilder, så läs det som ett golv under det generella problemet, inte en dom över någon app som finns i dag. Det är ändå den mest direkta, kontrollerbara siffran mot det enkla påståendet att AI läser icke-latinsk skrift i en bild lika bra som den läser latinsk skrift. Enligt den här evidensen gör den inte det.

Upplösning spelar också roll. Samma artikel fann “ett positivt samband mellan bildens upplösning och igenkänningsprestandan”1, vilket talar emot en komprimerad eller kraftigt nedskalad skärmbild, precis vad många telefoner producerar när en bild sparas om eller delas vidare, innan modellen ens har läst ett enda ord. En snävare preprint från 2025 testade det här mer precist, men bara på enskilda japanska kanji-tecken renderade i kontrollerade storlekar, inte på chattskärmbilder. Multimodala modeller matchade en dedikerad OCR-metod vid ungefär 300 pixlar per tum, och “deras prestanda försämras kraftigt under 150 ppi”2. Om den tröskeln gäller för liten text inuti en komprimerad mobilskärmbild är otestat. Riktningen, att mindre och lågupplöst text försämras snabbare för de här modellerna än för ändamålsbyggd OCR, är det två separata artiklar är överens om.

Specifikt för mörkt läge, och för lågkontrasttext mer generellt, kunde jag inte hitta någon publicerad utvärdering som mäter multimodala modellers precision mot ljust-läge-varianter av samma skärmbilder. Klassiska OCR-pipelines vänder rutinmässigt på mörka bilder innan bearbetning, eftersom omvänd kontrast är en känd utlösare för felläsningar i den äldre tekniken, vilket antyder att oron är rimlig. Ingen har kört motsvarande test på de multimodala modeller folk nu använder för att läsa en chattskärmbild, i alla fall inte i något jag kunde hitta, så jag tänker inte ange en siffra jag inte kan belägga.

Emoji sitter i samma bild, och forskningen om dem svarar på en annan fråga än den folk brukar ställa. Det handlar mindre om huruvida en modell kan avgöra att en form är en emoji, och mer om vilken emoji den tittar på, eftersom samma tecken inte ritar samma bild överallt. Unicode-konsortiet standardiserar kodpunkten och dess betydelse, inte konstverket. Apple, Google, Samsung och alla andra leverantörer ritar sin egen bild för den3. I en enkät med 710 Twitter-användare som just postat en tweet med en emoji visste minst 25 procent inte att deras emoji kunde se annorlunda ut på någon annans telefon, och efter att ha fått se hur en av deras egna tweets faktiskt renderades på en annan plattform sa 20 procent att de skulle ha redigerat den eller inte skickat den alls3. Det glappet finns mellan två personer som tittar på samma tecken på två olika telefoner. En skärmbild gör det ännu smalare. Vad avsändarens plattform än ritade plattas ut till en stillbild, och en modell som läser den bilden kan inte återskapa vilken underliggande emoji det var utan att plattformens eget typsnitt redan är inbränt i pixlarna. Om den kombinationen, tvärplattformstvetydighet plus skärmbildskomprimering, ändrar hur ofta en modell namnger fel känsla bakom en emoji är ett test ingen verkar ha kört ännu.

Felkällor som arbetsflödessidorna här inte täcker

En handfull specifika chattfunktioner gör korrekt läsning svårare på sitt eget sätt, utöver pixelproblemet ovan. En del av det som följer vilar på en studie. En del är bara en beskrivning av hur gränssnittet fungerar, utan någon dedikerad forskning bakom sig, och jag har försökt hålla isär de två så att den ena inte lånar tyngd av den andra.

Gruppchattar och trådar med flera deltagare. En skärmbild av en tvåpersonschatt ger en modell två visuella grupper att sortera repliker i, ena sidan och den andra. En grupptråd bryter det mönstret. Tre eller fler personer kan dela en pratbubblefärg, ett avsändarnamn kan visas bara ovanför det första meddelandet i en följd och inte på varje rad efter det, och en beskuren profilbild kan vara den enda visuella ledtråden för vem som talar. Jag hittade ingen studie som testar modellprecision på att attribuera rader korrekt inuti en gruppchattskärmbild specifikt. Den närmaste forskningen mäter ett besläktat men annat problem, talarattribution i skriftliga mötestranskript, inte skärmbildade pratbubblor, och den marken täcks redan på sidan om att läsa en hel konversationstråd. Det som står här är en mekanisk beskrivning av skärmbildsversionen av samma problem, inte ett testat fynd. Fler talare som delar färre visuella ledtrådar per rad är uppenbart en svårare attributionsuppgift, oavsett om någon har mätt hur mycket svårare.

Tryckreaktioner och emojireaktioner. En liten emoji fäst i hörnet av någon annans pratbubbla, ett hjärta, ett skratt, en tumme upp, bär på två separata risker. Den första är om en modell överhuvudtaget kan identifiera den lilla, ibland överlappande symbolen korrekt, vilket jag inte hittade något direkt test av. Den andra är vad reaktionen betyder när den väl är korrekt läst, och den delen har studerats. En analys av mer än 650 000 Telegram-meddelanden med reaktioner fann att positiva reaktioner dominerade svaren oavsett om det underliggande meddelandet lästes som neutralt eller negativt, och drog slutsatsen att emojireaktioner “inte fungerar tillförlitligt som indikatorer på känslomässig spegling eller resonans med innehållet”4. Det är ett stort urval från en plattform och ett ämnesområde, kryptorelaterade kanaler, och det är fortfarande en preprint, så behandla de exakta siffrorna som preliminära. Poängen som spelar roll för en skärmbildsläsare gäller ändå, oavsett de förbehållen. Att namnge reaktionsemojin korrekt talar inte om för någon, modell eller person, vad reaktionen faktiskt signalerar.

Citerade svar och gränssnittet för trådning. De flesta meddelandeappar låter dig svara på ett specifikt tidigare meddelande, och visar då det citerade utdraget som ett mindre, blekare block ovanför det nya. I en skärmbild är den visuella behandlingen, mindre storlek, ljusare färg, ibland en vertikal linje, den enda signalen om att en rad är citerat sammanhang snarare än ett nytt meddelande från den det visuellt ser ut att vara någons tur att skriva. Beskär bilden några pixlar annorlunda och skillnaden kan försvinna. Jag hittade ingen studie som mäter hur ofta en modell förväxlar ett citerat utdrag med ett nytt meddelande, eller tvärtom. Det här är en trolig mekanisk felkälla inbyggd i hur gränssnittet representerar trådning, inte en testad sådan.

Försvinnande och efemära meddelanden. Ett efemärt meddelande är designat för att inte lämna något spår efter att det har visats, vilket är precis det en skärmbild sätter ur spel. Innan någon AI-fråga ens kommer in i bilden hade rättstekniska forskare redan visat att grundpremissen är skörare än användare antar. Genom att testa WhatsApps, Snapchats och Telegrams funktioner för försvinnande meddelanden direkt återskapade en studie förment raderat innehåll från enhetsdata och molnbackuper i flera av de scenarier den prövade5. Det är ett fynd om plattformarna, inte om AI som läser en skärmbild av en, och det mäter ingenting om en modells precision. Vad det väl fastslår, oberoende av all AI, är att en skärmbild inte är det enda sättet efemärt innehåll överlever sin avsedda radering. Om en apps egen suddningseffekt på skärmen eller en banderoll om att “en skärmbild har tagits” introducerar visuella artefakter en modell skulle kunna förväxla med innehåll är, återigen, en trolig oro utan någon dedikerad studie bakom sig.

Klistermärken. Ett klistermärke bär mening genom pose och uttryck mer än genom ord, vilket gör det svårare att läsa för en maskin och, visar det sig, för människor också. En studie av fem studentdiskussionsgrupper som använde klistermärken i verkliga projektchattar, byggd på intervjuer med sju av deltagarna om deras eget bruk av klistermärken, fann en missmatchning mellan vad avsändaren menade och vad mottagaren förstod i 34,7 procent av de granskade klistermärkena, främst på grund av tvetydiga ansikts- och kroppsuttryck i själva konstverket6. Det är en liten, kvalitativ studie av en population, universitetsstudenter vid ett asiatiskt lärosäte, och den mäter mänsklig felläsning, inte en modells. Det är ändå verklig evidens för att ett klistermärke är en tvetydig signal även mellan personer som redan känner varandra, vilket sätter ett lågt tak för hur bra någon läsare, mänsklig eller maskinell, rimligen borde kunna göra utifrån bilden ensam.

Att växla språk mitt i en konversation. Att växla språk inuti ett meddelande, eller mellan meddelanden i samma tråd, är vanligt i tvåspråkig och flerspråkig sms:ning och ett dokumenterat svårt fall för språkmodeller generellt. En översikt av fältet från 2025 slår fast rakt ut att “de flesta stora språkmodeller fortfarande har svårt med blandspråkig indata”7, utan någon siffra som renodlat skulle överföras till en skärmbild med två språk inuti en och samma pratbubbla. Jag kunde inte hitta någon studie som isolerar språkväxling som ett specifikt skärmbildsläsningsproblem, utöver det bredare flerspråkighetsproblem översikten beskriver. Behandla det här som en verklig, dokumenterad svårighet i den underliggande tekniken, tillämpad här på ett fall ingen ännu har testat direkt.

Vad tre appar som läser skärmbilder säger om din uppladdning

Subtext är inte den enda appen byggd för att läsa en chattskärmbild, och den användbara jämförelsen är vad varje apps egen nuvarande dokumentation säger händer med en uppladdning, inte vad marknadsföringen antyder. Det bredare fältet av AI-skrivverktyg kartläggs separat; här kollade jag tre produkter som nämns där, mot deras egna integritetssidor, för en avgränsad fråga: lagring, radering, och användning för att träna en modell.

Keys AI Texting Coach, byggd av Charmed Inc. kring att läsa skärmbilder för dejting- och meddelanderåd, verkar inte längre vara i drift. Apples egen iTunes-uppslagstjänst ger noll träffar för dess App Store-listning, app-id 1510154956, per den 27 september 20268, och dess kända webbdomän omdirigerar varje sökväg, inklusive den som en gång innehöll dess integritetspolicy, till en parkeringssida för domänen. Jag kunde inte hitta någon aktuell integritetspolicy för den här appen via någon kanal. Vad den än en gång sa om hantering av skärmbilder kan jag inte verifiera i dag, och jag rekonstruerar inte ett påstående från en sida som inte längre laddas.

Mei, en Android-app för standardmeddelanden med en valfri AI-assistent, uppger i sina nuvarande villkor, senast ändrade 3 oktober 2023 och kontrollerade 27 september 20269, att meddelandeinnehåll inklusive “bilder, foton, ljud eller video” lagras på dess servrar “uteslutande i syfte att möjliggöra kommunikation” och “används av oss på inget annat sätt.” Separat, när samma dokument beskriver vad dess valfria AI-assistent faktiskt tar emot, säger det att de senaste 20 meddelandena som skickas till AI:n som sammanhang inkluderar “emojier, reaktioner och webbadresser,” men att “meddelanden med bilagor, röstmeddelanden och bilder inte samlas in” för det syftet. Läst tillsammans säger Meis egen dokumentation att dess AI-förslagsfunktion inte bearbetar bildinnehåll alls, skärmbilder inräknat. Lagringsklausulen om foton gäller vanlig meddelandeleverans inuti appen, inte något som skickas till AI:n. En separat AI-assistentfunktion som man själv väljer att slå på fungerar annorlunda: när en användare slår på den laddar Mei upp enhetens hela sms- och mms-databas, inklusive texten i varje meddelande, plus hashade telefonnummer och kontakters namn, och policyn anger att den datan “används för att träna AI-modeller.” Den klausulen namnger inte skärmbilder eller bilder specifikt, men den handlar om att träna på meddelandetext brett, inte bara på kontaktmetadata.

ConfiTexts integritetspolicy, gällande från 10 februari 2026 och kontrollerad 27 september 202610, behandlar bara “text du skriver in i appen” och nämner varken foton, bilder eller skärmbilder någonstans i sina nio avsnitt. Dess egen marknadsföringssajt beskriver exakt en indatametod, att klistra in ett meddelande användaren redan skrivit, och ingen funktion för att ladda upp en skärmbild eller ett foto syns någonstans på sidan. Som det ser ut nu verkar lagringsfrågan inte gälla ConfiText. Produkten, enligt dess egen nuvarande sajt, tar överhuvudtaget inte emot en skärmbild som indata.

Av de tre är facit en app som inte längre verkar existera, en vars egen dokumentation utesluter bilder från vad dess AI faktiskt läser men som tränar på meddelandetext när assistenten är påslagen, och en som inte tar emot en skärmbild alls. Det avgör inte hur en app som läser skärmbilder bör hantera lagring. Det betyder att jämförelsen mellan tre namngivna konkurrenters skärmbildspolicyer gav mindre samstämmighet, och mindre tillämpbarhet, än vad premissen antog från början.

Att rensa metadata är sunt förnuft, inte något uppmätt

Varje foto en mobilkamera tar kan bära EXIF-data, enhetsmodell, tidsstämpel, ibland plats, inbäddad i filen. Råd om att rensa bort den datan innan man delar ett foto finns överallt på nätet. Jag letade efter en kontrollerad studie som mäter om att ta bort den datan, eller manuellt redigera bort synligt innehåll i en skärmbild, ger en mätbar minskning av verklig integritetsskada, i motsats till en teoretisk exponering som en redigering bara stänger på papperet. Jag hittade ingen. Det som finns är beskrivande säkerhetstexter som förklarar vilka fält som finns och hur man tar bort dem, inte ett experiment som jämför utfall för folk som rensade metadata mot folk som inte gjorde det. Behandla rådet som rimligt och otestat, inte som ett uppmätt skydd.

När det gäller vad Subtext själv gör med en skärmbilds metadata läste jag backendens systemprompter och verktygsdefinitioner direkt, samma fil den här sajtens egna regler kräver att man kollar innan något produktpåstående (functions/src/subtext_prompts.ts). Ingenting i den koden läser, rensar, granskar eller på annat sätt rör en skärmbilds filmetadata. Bilder lämnas till den underliggande modellen med synförmåga som visuell indata, på samma sätt som vilken annan bild som helst, och inget separat steg för metadatabearbetning syns någonstans i de prompter eller verktygsdefinitioner jag läste. Jag anger det som en frånvaro, inte en funktion. Jag hittade inga belägg för att Subtext gör något med en skärmbilds metadata, i någon riktning, och jag påstår inte en förmåga koden inte visar. Det finns inte heller någon oberoende utvärdering av hur precist Subtext själv läser en skärmbild, samma lucka som går igenom varje app som nämns ovan. Vad integritetspolicyn väl bekräftar, och vad de två arbetsflödessidorna på den här sajten redan anger, är den generella regeln som gäller för varje bilaga inklusive en skärmbild. En konversation, och allt som är fäst vid den, raderar sig själv fem dagar efter senaste användning eller nittio dagar om den är fastnålad, och ingenting som laddas upp används för att träna en AI-modell.

Vad det här summerar till

Lägg ihop de fyra delarna och bilden är ojämn med flit, inte av misstag. Den enda delen med en verklig, kontrollerbar precisionssiffra, generell OCR-prestanda inuti en modell med synförmåga, är blandad: stark på engelska, mätbart svagare på icke-latinsk skrift och på lågupplöst text, testad på utvalda benchmarks, inte faktiska chattskärmbilder. Fyra av de sex extra felkällorna ovan citerar riktig forskning om en näraliggande fråga: vad en reaktion faktiskt signalerar när den väl är korrekt läst, hur tillförlitligt efemära appar raderar innehåll överhuvudtaget, hur ofta folk misstolkar varandras klistermärken, och hur illa språkmodeller hanterar blandspråkig text generellt. Ingen av de fyra studierna testade det exakta fallet att en modell läser det från en skärmbild. De andra två, gruppchattattribution och förväxling av citerade svar, har ingen forskning bakom sig alls, näraliggande eller på annat sätt, bara en mekanisk beskrivning av hur gränssnittet fungerar. Konkurrentkollen hittade mindre att jämföra än premissen antog: en app försvunnen, en som utesluter bilder från sin egen AI-funktion enligt egen utsago, en som aldrig tog emot skärmbilder alls. Och metadatafrågan visade sig vara ett råd alla upprepar och som ingen verkar ha mätt.

Inget av det här betyder att en modell som läser din skärmbild är opålitlig i vanlig användning. Den största, mest direkta studien här mätte fortfarande att en modell läste det mesta av engelsk scentext korrekt. Det betyder att det specifika påståendet, att en modell med synförmåga läser en chattskärmbild lika tillförlitligt som den läser vanlig skriven text, har verkliga, kvantifierade undantag, en del av dem stora, och flera svåra fall som ingen har mätt alls.

Så ser läget ut i dag. Subtext är ännu en app som gör det här, varken mer eller mindre verifierad än resten ovan. Prova Subtext i webbläsarenProva Subtext i webbläsaren

Kontrollerad 27 september 2026.

Källor

  1. Shi, Peng, Liao, Lin, Chen, Liu, Zhang och Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Scentext- och dokument-OCR-benchmarks mot en modellgeneration från 2023, inte meddelandeskärmbilder.
  2. Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv preprint, ensam författare. Testar 100 isolerade japanska kanji-tecken vid kontrollerad typsnittsstorlek och upplösning, inte chattskärmbilder.
  3. Miller Hillberg, Levonian, Kluver, Terveen och Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Enkät med 710 Twitter-användare om deras egna tweets med emoji, inte ett test av en modell som läser dem.
  4. Tardelli, Alvisi, Cima, Cresci och Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv preprint. Över 650 000 reaktioner på kryptorelaterade Telegram-meddelanden, en plattform och ett ämnesområde.
  5. Heath, MacDermott och Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Testar WhatsApps, Snapchats och Telegrams eget raderingsbeteende, inte AI som läser en skärmbild.
  6. Tang, Hew, Herring och Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Fem diskussionsgrupper och sju intervjupersoner vid ett universitet; mäter mänsklig felläsning, inte en modells.
  7. Sheth, Sinha, Patil, Beniwal och Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv preprint-översikt, inget skärmbildsspecifikt test.
  8. Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, kontrollerad 27 september 2026. Noll träffar returnerades; appen verkar inte längre vara listad.
  9. Mei. Terms of Service and Privacy Policy, senast ändrad 3 oktober 2023, kontrollerad 27 september 2026.
  10. ConfiText. Privacy Policy, gällande från 10 februari 2026, kontrollerad 27 september 2026.