ArtikkelitKirjoitustyökalut

Tekoäly osaa lukea kuvakaappauksen viesteistäsi. Se ei aina lue sitä oikein.

Julkaistut virhelukemat pienen tekstin, tumman tilan ja ei-latinalaisten kirjainten lukemisessa kuvakaappauksesta, mitä kolme kuvakaappauksia lukevaa sovellusta kertovat lataamastasi kuvasta, ja tekeekö metatietojen poistaminen mitään mitattavaa.

Kirjoittanut Samet Durgun · Subtextin perustajakumppani · 11 min lukuaika

Liitä kuvakaappaus keskustelusta tekoälytyökaluun, ja se yleensä vain toimii. Se kertoo, kuka sanoi mitä, ymmärtää vitsin ja luonnostelee vastauksen, joka on järkevä. “Yleensä” on se osa, jolle kukaan ei anna lukua, ja se kannattaa erottaa toisesta kysymyksestä, jonka tämä sivusto käsittelee jo muualla. Kun mallilla on sanat jo edessään, sen selvittäminen kuka puhuu missäkin vuorossa, kesken jääneen kysymyksen seuraaminen, sarkasmin lukeminen, on aihe sivuilla saamasi viestin lukeminen ja tutkimus koko ketjun lukemisesta ennen vastaamista. Tämä juttu käsittelee aiempaa vaihetta, sitä lukeeko malli kuvan oikein ylipäätään.

Olen mukana rakentamassa Subtextia, sävyä tarkistavaa ja vastauksia luonnostelevaa sovellusta, joka ottaa kuvakaappauksen keskustelusta yhtenä syötteenään, joten minulla on syy toivoa tähän suotuisaa vastausta. Sellaista ei ole. Seuraavassa on se, minkä pystyin vahvistamaan kapeammasta ja vähemmän mairittelevasta kysymyksestä: kuinka hyviä nykyiset kuvia tulkitsevat mallit ovat lukemaan puhelimen kuvakaappauksen kuvana, ei tekstinä, ja mitä kuvakaappaukselle tapahtuu, kun annat sen jollekin näistä sovelluksista. Jokainen alla oleva lähde on sellainen, jonka avasin itse.

Kuvakaappauksen lukeminen on kuvaongelma ennen kuin se on kieliongelma

Keskustelusta otettu kuvakaappaus on kuva valosta, ei tekstilohko, jonka tietokone voi jo jäsentää. Ennen kuin malli voi päätellä, mitä viesti sanoo, sen täytyy muuttaa pikselit oikeiksi merkeiksi, missä tahansa fontissa, koossa, kontrastissa ja asettelussa, jota viestisovellus sattuu käyttämään. Tämä vaihe on optista merkintunnistusta eli OCR:ää, joka ratsastaa samalla näköjärjestelmällä, joka lukee minkä tahansa muun kuvan. Suurin osa tekoälyä ja viestittelyä koskevista tarkkuusväitteistä koskee päättelyä, joka tapahtuu tämän vaiheen jälkeen. Harva koskee itse vaihetta.

Luvut, joita on olemassa

Suorin testi on vuoden 2023 arviointi GPT-4V:n OCR-kyvyistä useilla vertailutesteillä1. Englanninkielisessä ympäristötekstissä se sai 88,0 prosentin sanatarkkuuden CUTE80-vertailutestissä ja 62,0-66,0 prosenttia kolmessa vaikeammassa englanninkielisessä aineistossa, kun erikoistunut OCR-järjestelmä sai samoissa neljässä vertailutestissä 68,2-98,6 prosenttia. Kiinankielisessä ympäristötekstissä, ReCTS-vertailutestissä, GPT-4V sai nolla pistettä. Saman artikkelin erillisessä monikielisessä testissä sen tekstinhavaitsemisen F1-pisteet olivat 82,49 prosenttia englannille ja 83,42 prosenttia ranskalle, kun taas arabialle luku oli 16,55 prosenttia ja kiinalle 1,36 prosenttia. Artikkeli toteaa suoraan, että se “ei monipuolisuudestaan huolimatta erilaisten OCR-tehtävien käsittelyssä ylitä olemassa olevia huippuluokan OCR-malleja,” ja että se “osoitti rajoituksia ei-latinalaisten kielten käsittelyssä”1.

Tämä on yksi mallisukupolvi, testattu kuratoiduilla ympäristötekstiaineistoilla, ei viestisovellusten kuvakaappauksilla, joten lue se lattiana yleisen ongelman alla, ei tuomiona mistään tänään saatavilla olevasta sovelluksesta. Se on silti suorin ja tarkistettavissa oleva luku sitä yksinkertaista väitettä vastaan, että tekoäly lukee ei-latinalaisia kirjoitusjärjestelmiä kuvan sisällä yhtä hyvin kuin se lukee latinalaisia. Tämän näytön perusteella ei lue.

Resoluutiolla on myös väliä. Sama artikkeli havaitsi “positiivisen korrelaation syötekuvan resoluution ja tunnistuksen suorituskyvyn välillä”1, mikä toimii pakattua tai voimakkaasti pienennettyä kuvakaappausta vastaan, juuri sitä mitä moni puhelin tuottaa, kun kuva tallennetaan uudelleen tai jaetaan eteenpäin, ennen kuin malli lukee ainuttakaan sanaa. Kapeampi vuoden 2025 preprint testasi tätä täsmällisemmin, tosin vain yksittäisillä japanilaisilla kanji-merkeillä, jotka renderöitiin kontrolloiduissa koissa, ei keskustelun kuvakaappauksilla. Multimodaaliset mallit ylsivät omistetun OCR-menetelmän tasolle noin 300 pikselin tuumatiheydellä, ja “niiden suorituskyky heikkenee merkittävästi alle 150 ppi:n”2. Onko tuo kynnysarvo voimassa pienelle tekstille pakatun puhelimen kuvakaappauksen sisällä, on testaamatta. Suunta, jossa pienempi ja matalamman resoluution teksti heikkenee näillä malleilla nopeammin kuin tarkoitusta varten rakennetulla OCR:llä, on se osa, josta kaksi erillistä artikkelia ovat samaa mieltä.

Nimenomaan tummasta tilasta, ja yleisemmin matalakontrastisesta tekstistä, en löytänyt julkaistua arviointia, joka mittaisi multimodaalisten mallien tarkkuutta samojen kuvakaappausten vaalean tilan vastineita vasten. Klassiset OCR-putket kääntävät tumman kuvan värit rutiininomaisesti ennen käsittelyä, koska kontrastin kääntyminen on tunnettu virhelukemien laukaisija tuossa vanhemmassa teknologiassa, mikä viittaa siihen, että taustalla oleva huoli on perusteltu. Kukaan ei ole tehnyt vastaavaa testiä multimodaalisille malleille, joita ihmiset nyt käyttävät kuvakaappauksen lukemiseen, ainakaan missään löytämässäni, joten en aio esittää lukua, jota en pysty perustelemaan.

Emojit istuvat saman kuvan sisällä, ja niitä koskeva tutkimus vastaa eri kysymykseen kuin siihen, jota ihmiset yleensä kysyvät. Kyse ei ole niinkään siitä, osaako malli tunnistaa muodon emojiksi, vaan enemmän siitä, mitä emojia se oikeasti katsoo, koska sama merkki ei piirry samana kuvana kaikkialla. Unicode-konsortio standardoi koodipisteen ja sen merkityksen, ei itse taideteosta. Apple, Google, Samsung ja jokainen muu valmistaja piirtää siihen oman glyyfinsä3. Kyselyssä 710 Twitter-käyttäjälle, jotka olivat juuri julkaisseet emojin sisältävän twiitin, vähintään 25 prosenttia ei tiennyt, että heidän emojinsa voi näyttää erilaiselta jonkun toisen puhelimessa, ja kun heille näytettiin, miltä yksi heidän omista twiiteistään oikeasti näytti toisella alustalla, 20 prosenttia sanoi, että olisi muokannut sitä tai jättänyt sen kokonaan lähettämättä3. Tuo kuilu on olemassa kahden ihmisen välillä, jotka katsovat samaa merkkiä kahdella eri puhelimella. Kuvakaappaus kaventaa sitä entisestään. Mitä tahansa lähettäjän alusta piirsikin, se litistyy yhdeksi pysäytyskuvaksi, eikä malli, joka lukee sen kuvan, pysty palauttamaan, mikä emoji taustalla oikeasti oli, ilman alustan omaa fonttia joka on jo paistettu pikseleihin. Muuttaako tuo yhdistelmä, alustojen välinen moniselitteisyys plus kuvakaappauksen pakkaus, kuinka usein malli nimeää väärän tunteen emojin takana, on testi jota kukaan ei näytä vielä tehneen.

Vikatilat, joita tämän sivuston työnkulkusivut eivät käsittele

Kourallinen tiettyjä keskustelusovellusten ominaisuuksia tekee oikeasta lukemisesta vaikeampaa omalla tavallaan, yllä kuvatun pikselitason ongelman lisäksi. Osa seuraavasta nojaa tutkimukseen. Osa on pelkkä kuvaus siitä, miten käyttöliittymä toimii, ilman sen taustalla olevaa erityistä tutkimusta, ja olen yrittänyt pitää nämä kaksi erillään, jotta toinen ei lainaa toisen painoarvoa.

Ryhmäkeskustelut ja usean osallistujan ketjut. Kahdenkeskinen kuvakaappaus antaa mallille kaksi visuaalista ryhmää, joihin puheen voi lajitella, toisen puolen ja toisen. Ryhmäketju rikkoo tuon kaavan. Kolme tai useampi ihminen voi jakaa saman puhekuplan värin, lähettäjän nimi saattaa näkyä vain ensimmäisen viestin yläpuolella yhtäjaksoisessa sarjassa eikä jokaisen sitä seuraavan rivin kohdalla, ja rajattu profiilikuva voi olla ainoa visuaalinen vihje siitä, kuka puhuu. En löytänyt tutkimusta, joka olisi testannut mallin tarkkuutta rivien oikeassa kohdentamisessa nimenomaan ryhmäkeskustelun kuvakaappauksen sisällä. Lähin tutkimus mittaa sukua olevaa mutta eri ongelmaa, puhujan tunnistamista kirjallisissa kokouspöytäkirjoissa, ei kuvakaappauksen puhekuplia, ja se maaperä on jo katettu sivulla koko keskusteluketjun lukemisesta. Tässä on saman ongelman kuvakaappausversion mekaaninen kuvaus, ei testattu löydös. Useampi puhuja jakamassa vähemmän visuaalisia vihjeitä riviä kohden on jo lähtökohtaisesti vaikeampi kohdennustehtävä, mitattiinpa kukaan kuinka paljon vaikeampi.

Napautusreaktiot ja emoji-reaktiot. Pieni emoji, joka on kiinnitetty jonkun toisen puhekuplan kulmaan, sydän, nauru, peukku, kantaa mukanaan kaksi erillistä riskiä. Ensimmäinen on se, osaako malli ylipäätään tunnistaa oikein pienen, joskus päällekkäisen glyyfin, mistä en löytänyt suoraa testiä. Toinen on se, mitä reaktio tarkoittaa kun se on luettu oikein, ja sitä osaa on tutkittu. Yli 650 000 reaktion sisältäneen Telegram-viestin analyysi havaitsi, että positiiviset reaktiot hallitsivat vastauksia riippumatta siitä, luettiinko taustalla oleva viesti neutraaliksi vai kielteiseksi, ja päätteli, että emoji-reaktiot “eivät toimi luotettavina merkkeinä tunteiden peilautumisesta tai sisällön resonanssista”4. Tämä on suuri otos yhdeltä alustalta ja yhdeltä aihealueelta, kryptoaiheisilta kanavilta, ja se on yhä preprint, joten suhtaudu täsmällisiin lukuihin alustavina. Se, mikä on tärkeää kuvakaappauksen lukijalle, pätee näistä varauksista huolimatta. Reaktioemojin nimeäminen oikein ei kerro kenellekään, mallille eikä ihmiselle, mitä reaktio oikeasti signaloi.

Lainatut vastaukset ja ketjutuksen käyttöliittymä. Useimmat viestisovellukset antavat vastata tiettyyn aiempaan viestiin, ja tällöin lainattu pätkä näkyy pienempänä, himmeämpänä lohkona uuden viestin yläpuolella. Kuvakaappauksessa tuo visuaalinen käsittely, pienempi koko, vaaleampi väri, joskus pystyviiva, on ainoa merkki siitä, että rivi on lainattua kontekstia eikä uusi viesti siltä, jonka vuorolta se visuaalisesti näyttää. Rajaa kuva muutaman pikselin verran eri tavalla, ja ero voi kadota. En löytänyt tutkimusta, joka mittaisi kuinka usein malli erehtyy pitämään lainatun pätkän tuoreena viestinä tai toisin päin. Tämä on uskottava mekaaninen vikatila, joka on sisäänrakennettu siihen, miten käyttöliittymä esittää ketjutuksen, ei testattu sellainen.

Katoavat ja väliaikaiset viestit. Väliaikainen viesti on suunniteltu jättämättä jälkeä sen jälkeen kun se on nähty, ja juuri sen kuvakaappaus kumoaa. Ennen kuin mikään tekoälykysymys tulee kuvaan mukaan, rikostekniset tutkijat olivat jo osoittaneet, että taustalla oleva oletus on horjuvampi kuin käyttäjät luulevat. Kun WhatsAppin, Snapchatin ja Telegramin katoavien viestien ominaisuuksia testattiin suoraan, yksi tutkimus palautti oletetusti poistettua sisältöä laitteen datasta ja pilvivarmuuskopioista useassa kokeilluista skenaarioista5. Se on löydös alustoista, ei tekoälystä joka lukee kuvakaappauksen niistä, eikä se mittaa mitään mallin tarkkuudesta. Se, minkä se vahvistaa, riippumatta mistään tekoälystä, on että kuvakaappaus ei ole ainoa tapa, jolla väliaikainen sisältö elää pidempään kuin sen oli tarkoitus. Se, tuoko sovelluksen oma ruudulla näkyvä sumennus tai “kuvakaappaus otettu” -ilmoitus visuaalisia artefakteja, jotka malli voisi erehtyä pitämään sisältönä, on jälleen uskottava huoli, jonka takana ei ole omistettua tutkimusta.

Tarrat. Tarra kantaa merkitystä enemmän asennon ja ilmeen kuin sanojen kautta, mikä tekee siitä vaikeamman luettavan koneelle, ja kuten käy ilmi, myös ihmisille. Tutkimus viidestä opiskelijoiden keskusteluryhmästä, jotka käyttivät tarroja oikeissa projektikeskusteluissa, ja joka nojasi seitsemän osallistujan haastatteluihin heidän omasta tarrankäytöstään, havaitsi ristiriidan sen välillä mitä lähettäjä tarkoitti ja mitä vastaanottaja ymmärsi 34,7 prosentissa tarkastelluista tarroista, pääasiassa taideteoksen omien moniselitteisten kasvon- ja vartalonilmeiden takia6. Se on pieni, laadullinen tutkimus yhdestä väestöstä, yliopisto-opiskelijoista yhdessä aasialaisessa oppilaitoksessa, ja se mittaa ihmisen väärinlukemista, ei mallin. Se on silti todellista näyttöä siitä, että tarra on moniselitteinen signaali jopa ihmisten välillä, jotka jo tuntevat toisensa, mikä asettaa matalan katon sille, kuinka hyvin kenen tahansa lukijan, ihmisen tai koneen, pitäisi odottaa onnistuvan pelkän kuvan perusteella.

Kielten vaihtaminen kesken keskustelun. Kielen vaihtaminen kesken yhden viestin, tai viestien välillä samassa ketjussa, on yleistä kaksi- ja monikielisessä viestittelyssä ja dokumentoitu vaikea tapaus kielimalleille yleensä. Vuoden 2025 alan katsaus toteaa suoraan, että “useimmat kielimallit kamppailevat yhä sekakielisten syötteiden kanssa”7, ilman lukua joka siirtyisi puhtaasti kuvakaappaukseen, jossa on kaksi kieltä yhden puhekuplan sisällä. En löytänyt tutkimusta, joka eristäisi kielten vaihtamisen nimenomaan kuvakaappauksen lukemisen ongelmaksi, laajemman monikielisen tekstin ongelman lisäksi, jota katsaus kuvaa. Kohtele tätä todellisena, dokumentoituna vaikeutena taustalla olevassa teknologiassa, sovellettuna tässä tapaukseen, jota kukaan ei ole vielä testannut suoraan.

Mitä kolme kuvakaappauksia lukevaa sovellusta kertovat lataamastasi kuvasta

Subtext ei ole ainoa sovellus, joka on rakennettu lukemaan keskustelun kuvakaappaus, ja hyödyllinen vertailu on se, mitä kunkin oma ajantasainen dokumentaatio sanoo tapahtuvan lataukselle, ei se mitä sen markkinointi antaa ymmärtää. Tekoälyn kirjoitustyökalujen laajempi kenttä on kartoitettu erikseen; tässä tarkistin kolme siellä mainittua tuotetta niiden omia tietosuojasivuja vasten, yhden kapean kysymyksen osalta: säilytys, poistaminen ja käyttö mallin kouluttamisessa.

Keys AI Texting Coach, jonka Charmed Inc. rakensi kuvakaappausten lukemisen ympärille deittailu- ja viestintäneuvontaa varten, ei enää vaikuta olevan käytössä. Applen oma iTunes-hakupalvelu palauttaa nolla tulosta sen App Store -listaukselle, sovellustunnus 1510154956, tilanteen mukaan 27. syyskuuta 20268, ja sen tunnettu verkkotunnus ohjaa jokaisen polun, mukaan lukien sen, jolla ennen oli sen tietosuojaseloste, verkkotunnuksen parkkisivulle. En löytänyt tälle sovellukselle ajantasaista tietosuojaselostetta millään kanavalla. Mitä se ikinä ennen sanoikaan kuvakaappausten käsittelystä, en pysty vahvistamaan sitä tänään, enkä rakenna väitettä sivulta, joka ei enää lataudu.

Mei, Android-käyttöjärjestelmän oletusviestisovellus valinnaisella tekoälyavustajalla, toteaa nykyisissä ehdoissaan, viimeksi muutettu 3. lokakuuta 2023 ja tarkistettu 27. syyskuuta 20269, että viestisisältö, mukaan lukien “kuvat, valokuvat, ääni tai videot”, tallennetaan sen palvelimille “yksinomaan viestinnän tarkoitukseen” ja että sitä “emme käytä millään muulla tavalla.” Erikseen, kuvatessaan mitä sen valinnainen tekoälyavustaja oikeasti vastaanottaa, sama dokumentti sanoo, että viimeiset 20 tekoälylle kontekstiksi lähetettyä viestiä sisältävät “emojit, reaktiot ja URL-osoitteet,” mutta että “liitteitä, ääniviestejä ja kuvia sisältävät viestit eivät kerry” tähän tarkoitukseen. Yhdessä luettuna Mein oma dokumentaatio sanoo, ettei sen tekoälyn ehdotusominaisuus käsittele kuvasisältöä lainkaan, kuvakaappaukset mukaan lukien. Tallennuslauseke valokuvista koskee tavallista viestin toimitusta sovelluksen sisällä, ei mitään tekoälylle lähetettyä. Erillinen, valinnaisesti käyttöön otettava tekoälyavustinominaisuus toimii eri tavalla: kun käyttäjä ottaa sen käyttöön, Mei lataa laitteen koko SMS- ja MMS-viestitietokannan, mukaan lukien jokaisen viestin tekstin, sekä tiivistetyt puhelinnumerot ja yhteystietojen nimet, ja seloste toteaa, että tuota dataa “käytetään tekoälymallien kouluttamiseen.” Tuo lauseke ei nimeä kuvakaappauksia tai kuvia erikseen, mutta se koskee kouluttamista viestitekstillä laajasti, ei vain yhteystietojen metadatalla.

ConfiTextin tietosuojaseloste, voimassa 10. helmikuuta 2026 ja tarkistettu 27. syyskuuta 202610, käsittelee vain “tekstiä, jonka syötät sovellukseen,” eikä mainitse valokuvia, kuvia tai kuvakaappauksia missään yhdeksästä osiostaan. Sen oma markkinointisivusto kuvaa täsmälleen yhden syötemenetelmän, käyttäjän jo kirjoittaman viestin liittämisen, eikä sivulla näy missään kuvakaappauksen tai valokuvan latausominaisuutta. Asioiden näin ollessa säilytyskysymys ei näytä koskevan ConfiTextiä. Tuote ei oman ajantasaisen sivustonsa mukaan ota kuvakaappausta syötteeksi ylipäätään.

Näistä kolmesta laskuri näyttää yhtä sovellusta, joka ei enää näytä olevan olemassa, yhtä jonka oma dokumentaatio sulkee kuvat pois siitä mitä sen tekoäly oikeasti lukee mutta joka kuitenkin kouluttaa viestitekstillä kun sen avustin on kytketty päälle, ja yhtä joka ei ota kuvakaappausta vastaan lainkaan. Se ei ratkaise, miten kuvakaappauksia lukevan sovelluksen pitäisi käsitellä säilytystä. Se kuitenkin tarkoittaa, että kolmen nimetyn kilpailijan kuvakaappauskäytäntöjen vertailu tuotti vähemmän yhteneväisyyttä, ja vähemmän sovellettavuutta, kuin lähtökohta oletti.

Metatietojen poistaminen on maalaisjärkeä, ei jotain mitattua

Jokainen puhelimen kamera ottama valokuva voi kantaa EXIF-dataa, laitteen mallia, aikaleimaa, joskus sijaintia, upotettuna tiedostoon. Neuvoa poistaa tämä data ennen kuvan jakamista näkee verkossa kaikkialla. Etsin kontrolloitua tutkimusta, joka mittaisi tuottaako tuon datan poistaminen, tai kuvakaappauksen näkyvän sisällön käsin peittäminen, mitattavan pudotuksen todellisen maailman yksityisyyshaitassa, verrattuna teoreettiseen altistukseen, jonka peittäminen vain sulkee paperilla. En löytänyt sellaista. Se mitä on olemassa, on kuvailevaa tietoturvakirjoitusta, joka selittää mitä kenttiä on olemassa ja miten ne poistetaan, ei koetta, joka vertaisi lopputulemia niiden ihmisten välillä, jotka poistivat metatiedot, ja niiden, jotka eivät. Kohtele neuvoa järkevänä ja testaamattomana, ei mitattuna suojana.

Siitä, mitä Subtext itse tekee kuvakaappauksen metatiedoille, luin taustajärjestelmän system-promptit ja työkalumäärittelyt suoraan, saman tiedoston jonka tämän sivuston omat säännöt vaativat tarkistamaan ennen mitä tahansa tuoteväitettä (functions/src/subtext_prompts.ts). Mikään tuossa koodissa ei lue, poista, tarkasta tai muuten koske kuvakaappauksen tiedostometatietoihin. Kuvat annetaan taustalla olevalle kuvia tulkitsevalle mallille visuaalisena syötteenä, samalla tavalla kuin mikä tahansa muu kuva annettaisiin, eikä erillistä metatietojen käsittelyvaihetta näy missään lukemissani prompteissa tai työkalumäärittelyissä. Totean tämän poissaolona, en ominaisuutena. En löytänyt näyttöä siitä, että Subtext tekisi mitään kuvakaappauksen metatiedoille, kumpaankaan suuntaan, enkä väitä ominaisuutta, jota koodi ei osoita. Riippumatonta arviointia siitä, kuinka tarkasti Subtext itse lukee kuvakaappauksen, ei myöskään ole olemassa, sama aukko joka kulkee jokaisen yllä mainitun sovelluksen läpi. Se, minkä tietosuojaseloste vahvistaa, ja minkä tämän sivuston kaksi työnkulkusivua jo toteavat, on yleissääntö joka koskee jokaista liitettä, kuvakaappaus mukaan lukien. Keskustelu, ja kaikki siihen liitetty, poistuu automaattisesti viisi päivää viimeisen käytön jälkeen tai 90 päivän jälkeen, jos se on kiinnitetty, eikä mitään ladattua käytetä tekoälymallin kouluttamiseen.

Mitä tästä kaikesta jää käteen

Kun nämä neljä palaa laittaa yhteen, kuva on epätasainen tarkoituksella, ei vahingossa. Se yksi osa, jolla on todellinen ja tarkistettavissa oleva tarkkuusluku, kuvia tulkitsevan mallin yleinen OCR-suorituskyky, on kaksijakoinen: vahva englannissa, mitattavasti heikompi ei-latinalaisissa kirjoitusjärjestelmissä ja matalaresoluutioisessa tekstissä, testattu kuratoiduilla vertailutesteillä, ei oikeilla keskustelun kuvakaappauksilla. Neljä yllä olevista kuudesta lisävikatilasta viittaa todelliseen tutkimukseen lähikysymyksestä: mitä reaktio oikeasti signaloi kun se on luettu oikein, kuinka luotettavasti väliaikaiset sovellukset ylipäätään pyyhkivät sisällön, kuinka usein ihmiset lukevat toistensa tarrat väärin, ja kuinka huonosti kielimallit käsittelevät sekakielistä tekstiä yleensä. Yksikään näistä neljästä tutkimuksesta ei testannut täsmälleen tapausta, jossa malli lukee sen kuvakaappauksesta. Kaksi muuta, ryhmäkeskustelun kohdentaminen ja lainatun vastauksen sekoittuminen, eivät nojaa mihinkään tutkimukseen lainkaan, lähikysymykseen tai muuhun, vain mekaaniseen kuvaukseen siitä miten käyttöliittymä toimii. Kilpailijatarkistus löysi vähemmän vertailtavaa kuin lähtökohta oletti: yksi sovellus poissa, yksi joka sulkee kuvat pois omasta tekoälyominaisuudestaan oman kertomansa mukaan, yksi joka ei koskaan hyväksynyt kuvakaappauksia lainkaan. Ja metatietokysymys osoittautui neuvoksi, jota kaikki toistavat ja jota kukaan ei näytä mitanneen.

Mikään tästä ei tarkoita, että mallisi lukisi kuvakaappauksesi epäluotettavasti yleisessä käytössä. Suurin ja suorin tässä esitelty tutkimus mittasi silti mallin lukevan suurimman osan englanninkielisestä ympäristötekstistä oikein. Se tarkoittaa, että täsmällisellä väitteellä, jonka mukaan kuvia tulkitseva malli lukee keskustelun kuvakaappauksen yhtä luotettavasti kuin se lukee tavallista kirjoitettua tekstiä, on todellisia, määrällisesti osoitettuja poikkeuksia, osa niistä suuria, ja useita vaikeita tapauksia joita kukaan ei ole mitannut lainkaan.

Siihen tilanne tänään pysähtyy. Subtext on yksi sovellus lisää, joka tekee tätä, ei sen paremmin eikä huonommin varmennettu kuin muut yllä. Kokeile Subtextiä selaimessaKokeile Subtextiä selaimessa

Tarkistettu 27. syyskuuta 2026.

Lähteet

  1. Shi, Peng, Liao, Lin, Chen, Liu, Zhang & Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Ympäristötekstin ja dokumenttien OCR-vertailutestejä yhtä vuoden 2023 mallisukupolvea vastaan, ei viestisovellusten kuvakaappauksia.
  2. Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv preprint, yksi kirjoittaja. Testaa 100 yksittäistä japanilaista kanji-merkkiä kontrolloidussa fonttikoossa ja resoluutiossa, ei keskustelun kuvakaappauksia.
  3. Miller Hillberg, Levonian, Kluver, Terveen & Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Kysely 710 Twitter-käyttäjälle heidän omista emojin sisältävistä twiiteistään, ei testi mallin lukemisesta.
  4. Tardelli, Alvisi, Cima, Cresci & Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv preprint. Yli 650 000 reaktiota kryptoaiheisissa Telegram-viesteissä, yksi alusta ja yksi aihealue.
  5. Heath, MacDermott & Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Testaa WhatsAppin, Snapchatin ja Telegramin omaa poistokäyttäytymistä, ei tekoälyn kuvakaappauksen lukemista.
  6. Tang, Hew, Herring & Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Viisi keskusteluryhmää ja seitsemän haastateltavaa yhdessä yliopistossa; mittaa ihmisen väärinlukemista, ei mallin.
  7. Sheth, Sinha, Patil, Beniwal & Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv preprint survey, ei kuvakaappauskohtaista testiä.
  8. Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, tarkistettu 27. syyskuuta 2026. Palautti nolla tulosta; sovellus ei enää näytä olevan listattuna.
  9. Mei. Terms of Service and Privacy Policy, viimeksi muutettu 3. lokakuuta 2023, tarkistettu 27. syyskuuta 2026.
  10. ConfiText. Privacy Policy, voimassa 10. helmikuuta 2026, tarkistettu 27. syyskuuta 2026.