YazılarYazma araçları
Yapay zekâ mesajlarının ekran görüntüsünü okuyabilir. Ama her zaman doğru okumaz.
Küçük, koyu modda ve Latin olmayan yazıyı bir ekran görüntüsünde okumanın yayımlanmış hata oranları, üç ekran görüntüsü uygulamasının yüklediğin dosya hakkında söyledikleri ve meta veriyi silmenin ölçülebilir bir fark yaratıp yaratmadığı.
Yazan: Samet Durgun · Subtext'in kurucu ortağı · 12 dk okuma
Bir sohbetin ekran görüntüsünü yapay zekâ aracına yapıştır, genelde sorunsuz çalışır. Kim ne demiş söyler, şakayı anlar ve mantıklı bir cevap taslağı yazar. Kimsenin bir rakama bağlamadığı kısım tam olarak bu “genelde”, ve bunu bu sitenin başka bir yerde zaten ele aldığı farklı bir sorudan ayırmakta fayda var. Model kelimeleri önüne aldıktan sonra, sırayla kimin konuştuğunu çözmek, cevapsız kalan bir soruyu takip etmek, alayı okumak, gelen mesajı okumaya dair sayfanın ve cevap vermeden önce bütün bir konuşma dizisini okumanın arkasındaki araştırmanın konusu. Bu yazı ise daha önceki adımla ilgili, modelin resmi baştan doğru okuyup okumadığıyla.
Girdilerinden biri olarak sohbet ekran görüntüsü alan, ton kontrolü yapan ve cevap taslağı yazan bir uygulama olan Subtext’i birlikte kuruyorum, o yüzden burada lehime bir cevap istememin bir sebebi var. Böyle bir cevabım yok. Aşağıda, daha dar ve daha az pohpohlayıcı bir soru üzerinde doğrulayabildiklerim yer alıyor. Bugünün çok modlu (multimodal) modellerinin bir telefon ekran görüntüsünü bir döküm olarak değil bir görüntü olarak okumakta ne kadar iyi olduğu, ve bir ekran görüntüsünü bu uygulamalardan birine verdiğinde ona ne olduğu. Aşağıdaki her kaynağı kendim açtım.
Ekran görüntüsünü okumak, bir dil sorunundan önce bir görüntü sorunu
Bir sohbet ekran görüntüsü, bilgisayarın zaten ayrıştırabileceği bir metin bloğu değil, ışıktan oluşan bir resimdir. Bir model bir mesajın ne dediği üzerine akıl yürütebilmeden önce, mesajlaşma uygulamasının kullandığı yazı tipi, boyut, kontrast ve düzen ne olursa olsun, pikselleri doğru karakterlere çevirmesi gerekiyor. Bu adımın adı optik karakter tanıma (OCR), başka herhangi bir resmi okuyanla aynı görüntü işleme sistemine dayanıyor. Yapay zekâ ve mesajlaşma hakkındaki doğruluk iddialarının çoğu bu adımdan sonra gelen akıl yürütmeyle ilgili. Çok azı adımın kendisiyle ilgili.
Var olan rakamlar
En doğrudan test, GPT-4V’nin OCR becerisini birkaç kıyaslama testi üzerinden değerlendiren 2023 tarihli bir çalışma1. İngilizce sahne metninde CUTE80 kıyaslama testinde %88,0 kelime doğruluğu, üç daha zor İngilizce sette ise %62,0 ile %66,0 arası puan almış; özel bir OCR sisteminin aynı dört kıyaslama testindeki %68,2 ile %98,6 arasındaki puanına karşı. Çince sahne metninde, ReCTS kıyaslama testinde, GPT-4V sıfır puan almış. Aynı makaledeki ayrı bir çok dilli testte, metin tespiti F1 skoru İngilizce için %82,49’a, Fransızca için %83,42’ye ulaşmış; Arapça için %16,55, Çince için ise %1,36’da kalmış. Makale açıkça şunu söylüyor: “GPT-4V, çeşitli OCR görevlerini ele almaktaki çok yönlülüğüne rağmen, mevcut en gelişmiş OCR modellerini geride bırakamıyor” ve “Latin olmayan dillerle karşılaştığında sınırlılıklar gösteriyor”1.
Bu, tek bir model kuşağı, özenle seçilmiş sahne metni veri setleri üzerinde test edilmiş, mesajlaşma ekran görüntüleri üzerinde değil; o yüzden bunu genel sorunun altındaki bir taban olarak oku, bugün var olan herhangi bir uygulama hakkında bir hüküm olarak değil. Yine de yapay zekânın bir görüntü içindeki Latin olmayan yazıları, Latin yazıları okuduğu kadar iyi okuduğu düz iddiasına karşı elimizdeki en doğrudan, kontrol edilebilir rakam bu. Bu kanıta göre, okumuyor.
Çözünürlük de önemli. Aynı makale, “girdi görüntüsünün çözünürlüğü ile tanıma performansı arasında pozitif bir korelasyon” bulmuş1, bu da sıkıştırılmış ya da ağır biçimde küçültülmüş bir ekran görüntüsünün aleyhine işliyor; birçok telefonun bir görüntü yeniden kaydedildiğinde ya da yeniden paylaşıldığında ürettiği tam da bu, model daha tek bir kelime okumadan önce. 2025 tarihli daha dar kapsamlı bir ön baskı bunu daha kesin biçimde test etmiş, gerçi yalnızca kontrollü boyutlarda oluşturulmuş tekil Japonca kanji karakterleri üzerinde, sohbet ekran görüntüleri üzerinde değil. Çok modlu modeller, özel bir OCR yöntemiyle yaklaşık 300 inç başına piksel değerinde eşleşmiş, ve “performansları 150 ppi’nin altında belirgin biçimde kötüleşiyor”2. Bu eşiğin sıkıştırılmış bir telefon ekran görüntüsündeki küçük yazı için de geçerli olup olmadığı test edilmemiş. Küçük ve düşük çözünürlüklü yazının bu modellerde, amaca özel OCR’a kıyasla daha hızlı bozulması yönündeki bulguda iki ayrı makale hemfikir.
Özellikle koyu mod ve daha genel olarak düşük kontrastlı yazı konusunda, çok modlu model doğruluğunu aynı ekran görüntülerinin açık mod eşdeğerlerine karşı ölçen yayımlanmış bir değerlendirme bulamadım. Klasik OCR hatları, işlemeden önce koyu görüntüleri rutin olarak tersine çeviriyor, çünkü kontrastın tersine çevrilmesi o eski teknolojide bilinen bir yanlış okuma tetikleyicisi; bu da altta yatan endişenin makul olduğunu düşündürüyor. Bugün insanların bir sohbet ekran görüntüsünü okumak için kullandığı çok modlu modeller üzerinde kimse eşdeğer bir test yapmamış, en azından bulabildiğim hiçbir yerde, o yüzden destekleyemeyeceğim bir rakam söylemeyeceğim.
Emojiler de aynı görüntünün içinde oturuyor ve onlar üzerine yapılan araştırma, insanların genelde sorduğundan farklı bir soruyu cevaplıyor. Mesele bir modelin bir şeklin emoji olduğunu anlayıp anlayamaması değil, daha çok hangi emojiye baktığı, çünkü aynı karakter her yerde aynı resmi çizmiyor. Unicode Konsorsiyumu kod noktasını ve anlamını standartlaştırıyor, görseli değil. Apple, Google, Samsung ve diğer her tedarikçi onun için kendi glifini çiziyor3. Az önce emoji içeren bir tweet atmış 710 Twitter kullanıcısıyla yapılan bir ankette, en az %25’i kendi emojisinin başka birinin telefonunda farklı görünebileceğini bilmiyordu; kendi tweetlerinden birinin başka bir platformda gerçekte nasıl göründüğü kendilerine gösterildikten sonra ise %20’si onu düzenleyeceğini ya da hiç göndermeyeceğini söyledi3. Bu fark, aynı karaktere iki farklı telefondan bakan iki kişi arasında zaten var. Bir ekran görüntüsü bunu daha da daraltıyor. Gönderenin platformunun çizdiği her neyse durağan bir görüntüye düzleşiyor, ve o görüntüyü okuyan bir model, platformun kendi yazı tipi piksellerin içine zaten işlenmemişse, altında hangi emojinin yattığını geri çıkaramıyor. Platformlar arası belirsizlik ile ekran görüntüsü sıkıştırmasının bu birleşimi, bir modelin bir emojinin arkasındaki duyguyu ne sıklıkla yanlış adlandırdığını değiştirir mi, bunu henüz kimsenin test etmediği görülüyor.
Buradaki iş akışı sayfalarının değinmediği hata türleri
Birkaç özel sohbet özelliği, yukarıdaki piksel düzeyindeki sorunun ötesinde, doğru okumayı kendi başına zorlaştırıyor. Aşağıdakilerin bir kısmı bir çalışmaya dayanıyor. Bir kısmı ise arkasında özel bir araştırma olmayan, arayüzün nasıl çalıştığına dair düz bir tarif; ikisini birbirinden ayrı tutmaya çalıştım ki biri diğerinin ağırlığını ödünç almasın.
Grup sohbetleri ve çok katılımcılı konuşma dizileri. Birebir bir ekran görüntüsü, bir modele konuşmayı ayıracağı iki görsel grup verir, bir taraf ve öteki taraf. Bir grup konuşma dizisi bu örüntüyü bozuyor. Üç ya da daha fazla kişi aynı balon rengini paylaşabiliyor, bir göndericinin adı bir dizinin yalnızca ilk mesajının üstünde görünüp sonraki her satırda görünmeyebiliyor, ve kırpılmış bir avatar kimin konuştuğuna dair tek görsel ipucu olabiliyor. Bir grup sohbeti ekran görüntüsü içinde satırları doğru atfetmede model doğruluğunu test eden bir çalışma bulamadım. En yakın araştırma ilişkili ama farklı bir sorunu ölçüyor, ekran görüntüsü alınmış balonlarda değil yazılı toplantı dökümlerinde konuşmacı atfı, ve o zemin zaten bütün bir konuşma dizisini okumaya dair sayfada ele alınmış. Burada olan, aynı sorunun ekran görüntüsü versiyonunun mekanik bir tarifi, test edilmiş bir bulgu değil. Satır başına daha az görsel ipucunu daha fazla konuşmacının paylaşması, kimse ne kadar zor olduğunu ölçmüş olsun ya da olmasın, görünüşte daha zor bir atfetme görevi.
Dokunma tepkileri ve emoji tepkileri. Başkasının balonunun köşesine iliştirilmiş küçük bir emoji, bir kalp, bir kahkaha, bir başparmak, iki ayrı risk taşıyor. Birincisi, bir modelin bu küçük, bazen üst üste binen glifi baştan doğru tanıyıp tanıyamadığı, ki bunun doğrudan bir testini bulamadım. İkincisi, doğru okunduktan sonra tepkinin ne anlama geldiği, ve bu kısım çalışılmış. 650.000’den fazla tepki taşıyan Telegram mesajının analizi, altındaki mesaj nötr ya da olumsuz okunsun okunmasın olumlu tepkilerin cevaplara hâkim olduğunu bulmuş ve emoji tepkilerinin “içeriğin duygusal olarak yansıtılmasının ya da karşılık bulmasının güvenilir bir göstergesi olarak işlev görmediği” sonucuna varmış4. Bu, tek bir platformdan ve tek bir konu alanından, kripto para ile ilgili kanallardan, gelen büyük bir örneklem, ve hâlâ bir ön baskı, o yüzden kesin rakamları geçici say. Bir ekran görüntüsü okuyucusu için önemli olan nokta bu çekincelerden bağımsız olarak geçerli. Tepki emojisini doğru adlandırmak, ne modele ne de insana, tepkinin gerçekte neye işaret ettiğini söylemiyor.
Alıntılanan cevaplar ve konuşma dizisi arayüzü. Çoğu mesajlaşma uygulaması, belirli bir önceki mesaja cevap vermene izin veriyor ve alıntılanan parçayı yeni mesajın üstünde daha küçük, daha soluk bir blok olarak gösteriyor. Bir ekran görüntüsünde bu görsel işlem, küçültülmüş boyut, açılmış renk, bazen dikey bir çizgi, bir satırın görsel olarak kimin sırasıymış gibi durduğundan bağımsız olarak yeni bir mesaj değil alıntılanan bir bağlam olduğunun tek işareti. Görüntüyü birkaç piksel farklı kırp, ayrım kaybolabilir. Bir modelin alıntılanan bir parçayı yeni bir mesajla ya da tam tersini ne sıklıkla karıştırdığını ölçen bir çalışma bulamadım. Bu, arayüzün konuşma dizisini nasıl temsil ettiğinin içine gömülü, makul ama test edilmemiş mekanik bir hata biçimi.
Kaybolan ve geçici mesajlar. Geçici bir mesaj, görüldükten sonra hiçbir iz bırakmayacak şekilde tasarlanmış, tam olarak bir ekran görüntüsünün alt ettiği şey de bu. Ortaya herhangi bir yapay zekâ sorusu girmeden önce, adli bilişim araştırmacıları altta yatan varsayımın kullanıcıların sandığından daha kırılgan olduğunu zaten göstermişti. WhatsApp, Snapchat ve Telegram’ın kaybolan mesaj özelliklerini doğrudan test eden bir çalışma, denediği senaryoların birkaçında sözde silinmiş içeriği cihaz verisinden ve bulut yedeklerinden geri getirmiş5. Bu, platformlar hakkında bir bulgu, yapay zekânın birinin ekran görüntüsünü okuması hakkında değil, ve bir modelin doğruluğu hakkında hiçbir şey ölçmüyor. Herhangi bir yapay zekâdan bağımsız olarak gösterdiği şey, bir ekran görüntüsünün, geçici içeriğin amaçlanan silinmesinden daha uzun ömürlü olmasının tek yolu olmadığı. Bir uygulamanın kendi ekran üstü bulanıklaştırmasının ya da bir “ekran görüntüsü alındı” bandının, bir modelin içerik sanabileceği görsel bozulmalar getirip getirmediği de, yine, arkasında özel bir çalışma olmayan makul bir endişe.
Çıkartmalar. Bir çıkartma (sticker), anlamını kelimelerden çok poz ve ifadeyle taşıyor, bu da onu bir makine için, ve anlaşılan insanlar için de, daha zor bir okuma haline getiriyor. Gerçek proje sohbetlerinde çıkartma kullanan beş öğrenci tartışma grubunu inceleyen ve katılımcılardan yedisiyle kendi çıkartma kullanımları üzerine yapılan görüşmelere dayanan bir çalışma, incelenen çıkartmaların %34,7’sinde göndericinin kastettiği ile alıcının anladığı arasında bir uyuşmazlık bulmuş, bunun başlıca sebebi de görselin kendisindeki belirsiz yüz ve beden ifadeleri6. Bu, tek bir popülasyonun, bir Asya kurumundaki üniversite öğrencilerinin, küçük ve nitel bir çalışması, ve bir modelin değil insanın yanlış okumasını ölçüyor. Yine de bir çıkartmanın, birbirini zaten tanıyan insanlar arasında bile belirsiz bir sinyal olduğuna dair gerçek bir kanıt bu; bu da yalnızca görüntüden yola çıkarak herhangi bir okuyucudan, insan ya da makine, ne kadar iyi performans beklenmesi gerektiği için düşük bir tavan koyuyor.
Konuşma ortasında dil değiştirme. Tek bir mesajın içinde ya da aynı konuşma dizisindeki mesajlar arasında dil değiştirmek, iki dilli ve çok dilli mesajlaşmada yaygın ve dil modelleri için genel olarak belgelenmiş zor bir durum. 2025 tarihli bir alan taraması açıkça şunu söylüyor: “çoğu büyük dil modeli karışık dilli girdilerle hâlâ zorlanıyor”7, bir konuşma balonunun içinde iki dil olan bir ekran görüntüsüne temiz biçimde aktarılabilecek bir rakam vermeden. Taramanın tarif ettiği daha geniş çok dilli metin sorununun dışında, kod değiştirmeyi (code-switching) özel olarak bir ekran görüntüsü okuma sorunu olarak ayıran bir çalışma bulamadım. Bunu, altta yatan teknolojideki gerçek, belgelenmiş bir güçlük olarak ele al; burada kimsenin henüz doğrudan test etmediği bir duruma uygulanmış hâliyle.
Üç ekran görüntüsü uygulaması, yüklediğin dosya hakkında ne diyor
Subtext, bir sohbet ekran görüntüsünü okumak için kurulmuş tek uygulama değil, ve yararlı karşılaştırma, pazarlamasının ima ettiği değil her birinin kendi güncel belgelerinin bir yükleme için ne olduğunu söylediği. Yapay zekâ yazma araçlarının daha geniş alanı ayrı bir yazıda haritalanmış; burada orada adı geçen üç ürünü, kendi gizlilik sayfalarına karşı, tek bir dar soru için kontrol ettim: saklama, silme ve bir modeli eğitmede kullanım.
Keys AI Texting Coach, Charmed Inc. tarafından flört ve mesajlaşma tavsiyesi için ekran görüntüsü okumak üzere kurulmuş, artık yayında değil gibi görünüyor. Apple’ın kendi iTunes arama servisi, 1510154956 uygulama kimliğine sahip App Store kaydı için 27 Eylül 2026 itibarıyla sıfır sonuç döndürüyor8, ve bilinen web alan adı, bir zamanlar gizlilik politikasını barındıran adres de dahil her yolu bir alan adı parklama sayfasına yönlendiriyor. Bu uygulama için hiçbir kanaldan güncel bir gizlilik politikası bulamadım. Ekran görüntüsü işleme konusunda bir zamanlar ne söylediyse, bugün doğrulayamıyorum, ve artık yüklenmeyen bir sayfadan bir iddiayı yeniden kurmuyorum.
Mei, isteğe bağlı bir yapay zekâ asistanı olan bir Android varsayılan mesajlaşma uygulaması, 3 Ekim 2023’te son değiştirilmiş ve 27 Eylül 2026’da kontrol edilmiş güncel şartlarında9, “görüntüler, fotoğraflar, ses ya da videolar” dahil mesaj içeriğinin sunucularında “yalnızca iletişim amacıyla” saklandığını ve “tarafımızca başka hiçbir şekilde kullanılmadığını” belirtiyor. Ayrıca, isteğe bağlı yapay zekâ asistanının gerçekte neyi aldığını tarif ederken, aynı belge, yapay zekâya bağlam olarak gönderilen son 20 mesajın “emojileri, tepkileri ve URL’leri” içerdiğini, ama bu amaç için “ekli dosya, sesli mesaj ve görüntü içeren mesajların toplanmadığını” söylüyor. Birlikte okunduğunda, Mei’nin kendi belgeleri, yapay zekâ öneri özelliğinin görüntü içeriğini, ekran görüntüleri dahil, hiç işlemediğini söylüyor. Fotoğraflarla ilgili saklama maddesi, yapay zekâya gönderilen herhangi bir şeyi değil, uygulama içindeki sıradan mesaj iletimini ilgilendiriyor. Ayrı, isteğe bağlı olarak açılan bir yapay zekâ asistanı özelliği farklı çalışıyor. Bir kullanıcı onu açtığında, Mei cihazın bütün SMS ve MMS mesaj veritabanını, her mesajın metni dahil, artı hash’lenmiş telefon numaralarını ve kişilerin adlarını yüklüyor, ve politika bu verinin “yapay zekâ modellerini eğitmek için kullanıldığını” belirtiyor. Bu madde ekran görüntülerini ya da görüntüleri özel olarak adlandırmıyor, ama genel olarak mesaj metni üzerinde eğitimle ilgili, yalnızca kişi meta verisiyle değil.
ConfiText’in 10 Şubat 2026’da yürürlüğe girmiş ve 27 Eylül 2026’da kontrol edilmiş gizlilik politikası10, yalnızca “uygulamaya girdiğin metni” ele alıyor ve dokuz bölümünün hiçbirinde fotoğraflardan, görüntülerden ya da ekran görüntülerinden bahsetmiyor. Kendi pazarlama sitesi tam olarak tek bir girdi yöntemi tarif ediyor, kullanıcının zaten yazdığı bir mesajı yapıştırması, ve sayfanın hiçbir yerinde bir ekran görüntüsü ya da fotoğraf yükleme özelliği görünmüyor. Şu haliyle, saklama sorusu ConfiText için geçerli görünmüyor. Ürün, kendi güncel sitesine göre, baştan itibaren girdi olarak bir ekran görüntüsü almıyor.
Üçü arasında durum şöyle: artık var olmadığı görülen bir uygulama, kendi belgelerine göre yapay zekâsının gerçekte okuduğu şeyden görüntüleri dışlayan ama asistanı açıldığında mesaj metni üzerinde eğitim yapan bir uygulama, ve baştan itibaren hiç ekran görüntüsü almayan bir uygulama. Bu, bir ekran görüntüsü okuyan uygulamanın saklamayı nasıl ele alması gerektiğini çözmüyor. Gösterdiği şey, adı geçen üç rakibin ekran görüntüsü politikalarını karşılaştırmanın, baştaki varsayımdan daha az uyum ve daha az uygulanabilirlik ortaya çıkardığı.
Meta veriyi silmek sağduyu mu, yoksa ölçülmüş bir şey mi
Bir telefon kamerasının çektiği her fotoğraf, dosyanın içine gömülü EXIF verisi taşıyabilir: cihaz modeli, zaman damgası, bazen konum. Bir fotoğrafı paylaşmadan önce bu veriyi silme tavsiyesi internette her yerde. O veriyi kaldırmanın ya da bir ekran görüntüsünün görünür içeriğini elle karartmanın, bir karartmanın kâğıt üzerinde yalnızca kapattığı teorik bir açığa karşı, gerçek dünyadaki gizlilik zararında ölçülebilir bir düşüş yarattığını ölçen kontrollü bir çalışma aradım. Bulamadım. Var olan şey, hangi alanların var olduğunu ve nasıl kaldırılacağını anlatan betimleyici bir güvenlik yazısı, meta veriyi silen insanlarla silmeyenlerin sonuçlarını karşılaştıran bir deney değil. Tavsiyeyi makul ve test edilmemiş say, ölçülmüş bir koruma değil.
Subtext’in kendisinin bir ekran görüntüsünün meta verisiyle ne yaptığı konusunda, backend’in sistem promptlarını ve araç tanımlarını doğrudan okudum; bu sitenin kendi kuralının her ürün iddiasından önce kontrol etmeyi istediği aynı dosya (functions/src/subtext_prompts.ts). O kodun hiçbir yerinde bir ekran görüntüsünün dosya meta verisini okuyan, silen, inceleyen ya da başka türlü ona dokunan bir şey yok. Görüntüler, başka herhangi bir görüntüyle aynı şekilde, altta yatan çok modlu modele görsel girdi olarak veriliyor, ve okuduğum promptlarda ya da araç tanımlarında hiçbir yerde ayrı bir meta veri işleme adımı görünmüyor. Bunu bir yokluk olarak belirtiyorum, bir özellik olarak değil. Subtext’in bir ekran görüntüsünün meta verisiyle herhangi bir yönde bir şey yaptığına dair hiçbir kanıt bulamadım, ve kodun göstermediği bir yeteneği iddia etmiyorum. Subtext’in kendisinin bir ekran görüntüsünü ne kadar doğru okuduğuna dair bağımsız bir değerlendirme de yok, yukarıda adı geçen her uygulamada karşımıza çıkan aynı boşluk. Gizlilik politikasının doğruladığı ve bu sitedeki iki iş akışı sayfasının zaten belirttiği şey, ekran görüntüsü dahil her eke uygulanan genel kural. Bir konuşma, ekindeki her şeyle birlikte, onu son kullanımından beş gün sonra, sabitlenmişse 90 gün sonra kendi kendine siliniyor, ve gönderdiğin hiçbir şey bir yapay zekâ modelini eğitmek için kullanılmıyor.
Bütün bunlar bir araya gelince ne çıkıyor
Dört parçayı bir araya getirince ortaya çıkan tablo, kazara değil tasarım gereği dengesiz. Gerçek, kontrol edilebilir bir doğruluk rakamı olan tek parça, çok modlu bir modelin içindeki genel OCR performansı, karışık çıkıyor: İngilizcede güçlü, Latin olmayan yazılarda ve düşük çözünürlüklü metinde ölçülebilir biçimde daha zayıf, ve gerçek sohbet ekran görüntüleri üzerinde değil özenle seçilmiş kıyaslama testleri üzerinde test edilmiş. Yukarıdaki altı ek hata biçiminden dördü, komşu bir soru üzerine gerçek araştırmaya dayanıyor: bir tepki doğru okunduktan sonra gerçekte neye işaret ettiği, geçici mesaj uygulamalarının içeriği baştan ne kadar güvenilir bildiği, insanların birbirinin çıkartmalarını ne sıklıkla yanlış okuduğu, ve dil modellerinin karışık dilli metni genel olarak ne kadar kötü idare ettiği. Bu dört çalışmadan hiçbiri, bir modelin bunu bir ekran görüntüsünden okuduğu tam durumu test etmedi. Diğer iki tanesi, grup sohbeti atfı ve alıntılanan cevap karışıklığı, arkalarında hiç araştırma yok, komşu ya da başka türlü, sadece arayüzün nasıl çalıştığına dair mekanik bir tarif var. Rakip kontrolü, baştaki varsayımın öngördüğünden daha az karşılaştırılabilir şey buldu: bir uygulama yok olmuş, biri kendi ifadesine göre kendi yapay zekâ özelliğinden görüntüleri dışlıyor ama asistanı açıldığında eğitim yapıyor, biri de baştan hiç ekran görüntüsü kabul etmiyor. Ve meta veri sorusu, herkesin tekrarladığı ama kimsenin ölçmediği görülen bir tavsiye olduğu ortaya çıktı.
Bunların hiçbiri, bir modelin ekran görüntünü okumasının genel kullanımda güvenilmez olduğu anlamına gelmiyor. Buradaki en büyük, en doğrudan çalışma yine de bir modelin çoğu İngilizce sahne metnini doğru okuduğunu ölçtü. Bunun gösterdiği, çok modlu bir modelin bir sohbet ekran görüntüsünü düz yazılmış metin kadar güvenilir okuduğu iddiasının gerçek, rakamlarla ölçülmüş istisnaları olduğu, bazıları büyük, ve kimsenin hiç ölçmediği birkaç zor durum barındırdığı.
Bugün itibarıyla durum bu. Subtext bunu yapan bir uygulama daha, yukarıdakilerden ne daha çok ne daha az doğrulanmış.
Subtext'i tarayıcıda deneKurmak için telefonunun kamerasıyla okut.Subtext'i tarayıcıda dene
27 Eylül 2026 itibarıyla kontrol edildi.
Kaynaklar
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang ve Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Sahne metni ve belge OCR’ı kıyaslama testleri, tek bir 2023 model kuşağına karşı, mesajlaşma ekran görüntülerine karşı değil.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv ön baskı, tek yazarlı. Kontrollü yazı tipi boyutu ve çözünürlükte 100 tekil Japonca kanji karakterini test ediyor, sohbet ekran görüntülerini değil.
- Miller Hillberg, Levonian, Kluver, Terveen ve Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. 710 Twitter kullanıcısının kendi emoji içeren tweetleri üzerine anket, bir modelin onları okumasının testi değil.
- Tardelli, Alvisi, Cima, Cresci ve Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv ön baskı. Kripto para ile ilgili Telegram mesajlarında 650.000’den fazla tepki, tek bir platform ve tek bir konu alanı.
- Heath, MacDermott ve Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. WhatsApp, Snapchat ve Telegram’ın kendi silme davranışını test ediyor, yapay zekânın bir ekran görüntüsünü okumasını değil.
- Tang, Hew, Herring ve Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Bir üniversitede beş tartışma grubu ve yedi görüşülen kişi; bir modelin değil insanın yanlış okumasını ölçüyor.
- Sheth, Sinha, Patil, Beniwal ve Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv ön baskı taraması, ekran görüntüsüne özel bir test yok.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, 27 Eylül 2026’da kontrol edildi. Sıfır sonuç döndü; uygulama artık listede görünmüyor.
- Mei. Terms of Service and Privacy Policy, son değişiklik 3 Ekim 2023, 27 Eylül 2026’da kontrol edildi.
- ConfiText. Privacy Policy, 10 Şubat 2026’dan itibaren yürürlükte, 27 Eylül 2026’da kontrol edildi.