블로그글쓰기 도구

AI는 문자 스크린샷을 읽을 수 있어요. 항상 제대로 읽지는 않고요.

스크린샷 속 작은 글씨, 다크 모드, 비라틴 문자를 읽는 정확도로 발표된 수치, 스크린샷 앱 세 곳이 업로드에 대해 실제로 밝히는 것, 그리고 메타데이터를 지우는 게 측정 가능한 차이를 만드는지를 정리했어요.

글 Samet Durgun · Subtext 공동 창업자 · 14분 읽기

대화 스크린샷을 AI 도구에 붙여넣으면 대개는 그냥 잘 작동해요. 누가 무슨 말을 했는지 알려주고, 농담도 알아채고, 말이 되는 답장 초안까지 써줘요. 아무도 숫자로 말하지 않는 부분이 바로 이 “대개는”이고, 이건 이 사이트가 다른 곳에서 이미 다룬 질문과는 구분해둘 만해요. 모델이 일단 단어를 손에 넣고 나서 누가 말하고 있는지 턴마다 가려내는 일, 답을 못 받은 질문을 놓치지 않는 일, 비꼬는 말을 읽어내는 일은 받은 메시지를 읽는 법을 다룬 글과 답장 전에 스레드 전체를 읽어야 하는 이유를 다룬 연구에서 다뤘어요. 이 글은 그보다 앞선 단계, 즉 모델이 애초에 그 이미지를 제대로 읽어내는지를 다뤄요.

저는 대화 스크린샷을 입력값 중 하나로 받는 어조 확인 및 답장 초안 작성 앱 Subtext를 함께 만들어요. 그러니 여기서 유리한 답을 바라는 이유가 있는 셈이에요. 그런 답은 없어요. 아래에 나오는 건 더 좁고 덜 근사한 질문, 즉 요즘의 비전 모델이 휴대폰 스크린샷을 대화록이 아니라 이미지로서 얼마나 잘 읽어내는지, 그리고 그 스크린샷을 이런 앱 중 하나에 건넸을 때 무슨 일이 일어나는지에 대해 제가 확인할 수 있었던 내용이에요. 아래 모든 출처는 제가 직접 열어본 거예요.

스크린샷을 읽는 건 언어 문제이기 전에 이미지 문제예요

대화 스크린샷은 빛을 담은 그림이지, 컴퓨터가 이미 파싱할 수 있는 텍스트 덩어리가 아니에요. 모델이 메시지가 무슨 뜻인지 추론하려면, 그 전에 메시지 앱이 어떤 글꼴, 크기, 대비, 레이아웃을 썼든 상관없이 픽셀을 정확한 글자로 바꿔내야 해요. 이 단계가 바로 광학 문자 인식(OCR)이고, 다른 어떤 그림을 읽을 때와 같은 비전 시스템 위에서 돌아가요. AI와 메시지에 대한 정확도 주장 대부분은 이 단계 다음에 일어나는 추론을 다뤄요. 이 단계 자체를 다루는 주장은 드물어요.

존재하는 수치들

가장 직접적인 테스트는 GPT-4V의 OCR 능력을 여러 벤치마크에 걸쳐 평가한 2023년 연구예요1. 영어 장면 텍스트에서는 CUTE80 벤치마크에서 단어 정확도 88.0%를 기록했고, 더 어려운 영어 세트 세 개에서는 62.0%에서 66.0% 사이였는데, 같은 네 개 벤치마크에서 전문 OCR 시스템은 68.2%에서 98.6%를 기록했어요. 중국어 장면 텍스트를 다루는 ReCTS 벤치마크에서는 GPT-4V가 0점을 받았어요. 같은 논문의 별도 다국어 테스트에서는, 텍스트 검출 F1 점수가 영어에서 82.49%, 프랑스어에서 83.42%였던 반면 아랍어에서는 16.55%, 중국어에서는 1.36%에 그쳤어요. 논문은 “다양한 OCR 작업을 다루는 다재다능함에도 불구하고, GPT-4V는 기존의 최신 OCR 모델들을 능가하지 못한다”고, 그리고 “비라틴 문자 언어를 다룰 때 한계를 보였다”고 분명히 적고 있어요1.

이건 한 모델 세대를, 메시지 스크린샷이 아니라 정제된 장면 텍스트 데이터셋으로 테스트한 결과라, 오늘 나와 있는 어떤 앱에 대한 판결이 아니라 이 문제 전반의 바닥선 정도로 읽어야 해요. 그래도 AI가 이미지 안의 비라틴 문자를 라틴 문자만큼 잘 읽는다는 평범한 주장에 맞설, 가장 직접적이고 확인 가능한 수치인 건 맞아요. 이 근거로 보면, 그렇지 않아요.

해상도도 중요해요. 같은 논문은 “입력 이미지 해상도와 인식 성능 사이에 양의 상관관계가 있다”는 걸 발견했는데1, 이건 압축되거나 크게 축소된 스크린샷에는 불리하게 작용해요. 그리고 이건 모델이 단어 하나를 읽기도 전에, 사진이 다시 저장되거나 다시 공유될 때 많은 휴대폰이 만들어내는 바로 그 상황이에요. 더 좁혀서, 2025년의 한 프리프린트는 이걸 더 정밀하게 테스트했는데, 다만 대화 스크린샷이 아니라 정해진 크기로 렌더링한 일본어 한자 낱글자만을 대상으로 했어요. 멀티모달 모델은 약 300ppi에서 전용 OCR 방식과 맞먹었고, “150ppi 아래로 내려가면 성능이 크게 떨어졌다”고 해요2. 그 기준선이 압축된 휴대폰 스크린샷 속 작은 글씨에도 그대로 적용되는지는 검증되지 않았어요. 다만 글씨가 작고 해상도가 낮을수록 이런 모델이 전용으로 만들어진 OCR보다 더 빨리 무너진다는 방향성에는 두 논문이 따로따로 동의해요.

다크 모드, 그리고 더 넓게는 대비가 낮은 텍스트에 대해서는, 같은 스크린샷의 라이트 모드 버전과 비교해 멀티모달 모델의 정확도를 잰 발표된 평가를 찾지 못했어요. 예전 방식의 OCR 파이프라인은 어두운 이미지를 처리하기 전에 으레 반전시키는데, 명암 반전이 그 구식 기술에서 오독을 일으키는 요인으로 알려져 있기 때문이에요. 이건 이 우려 자체가 근거 있다는 걸 시사해요. 지금 사람들이 대화 스크린샷을 읽는 데 쓰는 멀티모달 모델을 대상으로 같은 테스트를 한 사람은, 적어도 제가 찾은 범위 안에서는 아무도 없었고, 그래서 뒷받침할 수 없는 수치를 말하지는 않을게요.

이모지도 같은 이미지 안에 있는데, 이모지에 대한 연구는 사람들이 보통 묻는 질문과는 다른 질문에 답해요. 모델이 어떤 모양을 이모지라고 알아볼 수 있는지보다, 그게 어떤 이모지인지가 더 문제예요. 같은 글자라도 어디서나 같은 그림으로 그려지지는 않으니까요. 유니코드 컨소시엄은 코드 포인트와 그 의미를 표준화할 뿐, 그림 자체는 표준화하지 않아요. Apple, Google, Samsung을 비롯한 모든 제조사가 저마다 다른 글리프를 그려요3. 이모지가 든 트윗을 막 올린 트위터 사용자 710명을 대상으로 한 설문에서, 적어도 25%는 자기 이모지가 다른 사람의 휴대폰에서 다르게 보일 수 있다는 걸 몰랐고, 자기 트윗 하나가 다른 플랫폼에서 실제로 어떻게 보이는지 확인한 뒤에는 20%가 고쳤거나 아예 보내지 않았을 거라고 답했어요3. 이 간극은 서로 다른 두 휴대폰에서 같은 글자를 보는 두 사람 사이에도 존재해요. 스크린샷은 그 간극을 더 좁혀요. 보낸 사람의 플랫폼이 그려낸 그림이 정지 이미지 하나로 납작해지고 나면, 그 이미지를 읽는 모델은 픽셀 안에 이미 구워진 그 플랫폼 고유의 폰트 없이는 원래 어떤 이모지였는지 되짚어낼 수 없어요. 플랫폼 간 모호함에 스크린샷 압축까지 겹치는 이 조합이 이모지 뒤에 있는 감정을 모델이 얼마나 자주 잘못 짚게 만드는지는, 아직 아무도 테스트한 적이 없는 것 같아요.

이 사이트의 다른 글이 다루지 않는 실패 유형들

몇 가지 특정한 채팅 기능은 위에서 다룬 픽셀 수준의 문제와는 별개로, 저마다의 방식으로 정확한 읽기를 더 어렵게 만들어요. 아래 나오는 내용 중 일부는 연구에 기대고 있어요. 일부는 뒷받침하는 전용 연구 없이 인터페이스가 어떻게 작동하는지를 그대로 설명한 것뿐이고, 둘을 서로 헷갈리지 않도록 나눠두려 했어요.

단체 채팅방과 여러 명이 참여하는 스레드. 1대1 스크린샷은 모델에게 발화를 나눠 담을 시각적 그룹을 두 개, 이쪽과 저쪽만 줘요. 단체 스레드는 이 패턴을 깨요. 세 명 이상이 같은 말풍선 색을 나눠 쓸 수 있고, 보낸 사람 이름은 한 줄로 이어지는 메시지 묶음의 첫 줄 위에만 나오고 그 뒤로는 안 나올 수 있고, 잘린 프로필 사진이 누가 말하는지 알려주는 유일한 시각적 단서일 수도 있어요. 단체 채팅 스크린샷 안에서 줄마다 화자를 정확히 가려내는 모델의 정확도를 테스트한 연구는 찾지 못했어요. 가장 가까운 연구는 관련은 있지만 다른 문제, 즉 스크린샷 속 말풍선이 아니라 글로 옮긴 회의록 안에서의 화자 식별을 재는데, 그 내용은 대화 스레드 전체를 읽는 걸 다룬 글에서 이미 다뤘어요. 여기 있는 건 같은 문제의 스크린샷 버전을 기계적으로 설명한 것이지, 검증된 결과가 아니에요. 화자는 더 많은데 줄마다 남는 시각적 단서는 더 적다는 건, 그 차이를 실제로 잰 사람이 있든 없든 겉보기에도 더 어려운 식별 과제예요.

탭 반응과 이모지 반응. 다른 사람의 말풍선 모서리에 붙는 작은 이모지, 하트나 웃음이나 엄지척 같은 반응은 서로 다른 위험을 두 가지 안고 있어요. 첫 번째는 모델이 애초에 그 작고 때로는 겹쳐 보이는 글리프를 정확히 알아볼 수 있는지인데, 이걸 직접 테스트한 자료는 찾지 못했어요. 두 번째는 정확히 읽어낸 다음 그 반응이 무슨 뜻인지인데, 이 부분은 연구된 적이 있어요. 반응이 달린 텔레그램 메시지 65만 건 이상을 분석한 연구는, 바탕이 되는 메시지가 중립적으로 읽히든 부정적으로 읽히든 상관없이 긍정적인 반응이 압도적으로 많았다는 걸 발견했고, 이모지 반응이 “콘텐츠에 대한 감정적 동조나 공명을 안정적으로 나타내는 지표로 기능하지 않는다”고 결론지었어요4. 이건 크립토 관련 채널이라는 플랫폼 하나, 주제 영역 하나에서 나온 큰 표본이고 아직 프리프린트 단계라서, 정확한 수치는 잠정적인 걸로 받아들이세요. 다만 스크린샷을 읽는 문제에서 중요한 지점은 이런 단서를 감안해도 그대로 남아요. 반응 이모지를 정확히 알아맞히는 것만으로는, 모델이든 사람이든, 그 반응이 실제로 무엇을 신호하는지는 알 수 없어요.

인용 답장과 스레드 표시 방식. 대부분의 메시지 앱은 예전 메시지 하나를 콕 집어 답장할 수 있게 해주는데, 인용된 부분을 새 메시지 위에 더 작고 더 흐릿한 블록으로 보여줘요. 스크린샷 안에서는 이렇게 작아진 크기, 옅어진 색, 때로는 세로줄 하나 같은 시각적 처리가, 그 줄이 겉보기에 누구 차례인 것처럼 보이든 상관없이 새 메시지가 아니라 인용된 맥락이라는 걸 알려주는 유일한 신호예요. 이미지를 몇 픽셀만 다르게 잘라내도 그 구분은 사라질 수 있어요. 모델이 인용된 부분을 새 메시지로 착각하는 빈도나 그 반대의 빈도를 잰 연구는 찾지 못했어요. 이건 인터페이스가 스레드를 표현하는 방식에 내재된, 그럴듯하긴 하지만 검증되지 않은 기계적 실패 유형이에요.

사라지는 메시지. 사라지는 메시지는 한 번 보고 나면 기록을 남기지 않도록 설계돼 있는데, 스크린샷은 정확히 그걸 무력화해요. AI 질문이 끼어들기 훨씬 전부터, 포렌식 연구자들은 이 전제 자체가 사용자들이 생각하는 것보다 허술하다는 걸 이미 보여줬어요. WhatsApp, Snapchat, Telegram의 사라지는 메시지 기능을 직접 테스트한 한 연구는, 시도한 여러 시나리오에서 이미 삭제됐어야 할 내용을 기기 데이터와 클라우드 백업에서 복구해냈어요5. 이건 플랫폼에 대한 발견이지 AI가 그 스크린샷을 읽는 것에 대한 발견이 아니고, 모델의 정확도에 대해서는 아무것도 재지 않아요. 이게 AI와 상관없이 확실히 보여주는 건, 사라지는 콘텐츠가 원래 의도된 삭제보다 오래 남는 방법이 스크린샷 하나만은 아니라는 거예요. 앱 자체의 화면 블러 처리나 “스크린샷을 찍었어요” 배너가 모델이 콘텐츠로 착각할 만한 시각적 흔적을 남기는지는, 이번에도 그럴듯하지만 뒷받침하는 전용 연구는 없는 우려예요.

스티커. 스티커는 말보다 자세와 표정으로 뜻을 전달하는데, 그래서 기계에게도 더 어려운 읽기 과제고, 알고 보면 사람에게도 마찬가지예요. 실제 프로젝트 채팅에서 스티커를 쓴 학생 토론 그룹 다섯 개를 대상으로 하고, 그중 참여자 일곱 명과의 인터뷰까지 곁들인 한 연구는, 살펴본 스티커의 34.7%에서 보낸 사람의 의도와 받는 사람의 이해가 어긋났다는 걸 발견했는데, 주된 원인은 그림 자체의 표정과 몸짓이 모호하다는 점이었어요6. 이건 아시아의 한 대학 학생이라는 하나의 집단을 대상으로 한 작고 질적인 연구고, 모델이 아니라 사람의 오독을 재요. 그래도 이미 서로를 아는 사람들 사이에서조차 스티커가 모호한 신호라는 건 실제 근거고, 이건 사람이든 기계든 이미지 하나만 보고 얼마나 잘 읽어낼 수 있을지에 대한 기대치 자체를 낮게 잡아줘요.

대화 중간의 코드 스위칭. 메시지 하나 안에서, 또는 같은 스레드 안의 메시지들 사이에서 언어를 바꾸는 건 이중언어나 다중언어로 문자할 때 흔한 일이고, 언어 모델 일반에서 어려운 사례로 이미 기록돼 있어요. 이 분야를 다룬 2025년 서베이는 “대부분의 LLM은 여전히 언어가 섞인 입력을 어려워한다”고 분명히 적고 있는데7, 말풍선 하나 안에 언어 두 개가 섞인 스크린샷에 그대로 옮길 수 있는 수치는 없어요. 서베이가 설명하는 더 넓은 다국어 텍스트 문제를 빼면, 코드 스위칭만 따로 떼어 스크린샷 읽기 문제로 다룬 연구는 찾지 못했어요. 이건 바탕 기술에 실제로 기록된 어려움을, 아직 아무도 직접 테스트하지 않은 사례에 적용해본 거라고 받아들이세요.

스크린샷 앱 세 곳은 당신의 업로드에 대해 뭐라고 말할까요

대화 스크린샷을 읽도록 만들어진 앱이 Subtext만은 아니고, 쓸모 있는 비교는 각 앱의 마케팅이 암시하는 게 아니라 지금 각자의 공식 문서가 업로드된 것에 대해 뭐라고 말하는지예요. AI 글쓰기 도구 전반은 따로 정리해뒀고, 여기서는 거기 이름이 나온 제품 세 개를 각자의 개인정보처리방침에 비추어, 보관, 삭제, 모델 학습에 쓰이는지라는 좁은 질문 하나로 확인해봤어요.

Keys AI Texting Coach는 Charmed Inc.가 데이트와 메시지 조언을 위해 스크린샷을 읽는 걸 중심으로 만든 앱인데, 더 이상 서비스되지 않는 것으로 보여요. Apple 자체의 iTunes 조회 서비스는 2026년 9월 27일 기준으로 앱스토어 등록 정보(앱 ID 1510154956)에 대해 결과 0건을 돌려주고8, 알려진 웹 도메인은 예전에 개인정보처리방침이 있던 경로를 포함해 모든 경로를 도메인 판매 안내 페이지로 리다이렉트해요. 이 앱의 현재 개인정보처리방침은 어떤 경로로도 찾을 수 없었어요. 예전에 스크린샷 처리에 대해 뭐라고 했든, 지금은 그걸 확인할 방법이 없고, 더 이상 열리지 않는 페이지에서 주장을 재구성하지는 않을게요.

Mei는 선택적으로 AI 비서를 쓸 수 있는 Android 기본 메시지 앱인데, 2023년 10월 3일에 마지막으로 수정되고 2026년 9월 27일에 확인한 현재 약관에서9, “이미지, 사진, 오디오 또는 비디오”를 포함한 메시지 콘텐츠가 “오직 소통이라는 목적만을 위해” 자사 서버에 저장되고 “그 밖의 어떤 용도로도 쓰이지 않는다”고 밝혀요. 별도로, 선택적 AI 비서가 실제로 무엇을 받는지 설명하는 대목에서는, 같은 문서가 AI에게 맥락으로 전달되는 최근 20개 메시지에 “이모지, 반응, URL”이 포함되지만 그 목적으로는 “첨부 파일, 음성 메시지, 이미지가 있는 메시지는 수집되지 않는다”고 적어요. 둘을 함께 읽으면, Mei 자체 문서는 스크린샷을 포함해 이미지 콘텐츠를 AI 제안 기능이 전혀 처리하지 않는다고 말하는 셈이에요. 사진에 대한 저장 조항은 앱 안의 일반적인 메시지 전달에 관한 것이지, AI로 보내지는 것에 관한 게 아니에요. 별도의 옵트인 AI 비서 기능은 다르게 작동해요. 사용자가 그걸 켜면 Mei는 각 메시지의 텍스트를 포함한 기기 전체의 SMS와 MMS 메시지 데이터베이스를, 해시된 전화번호와 연락처 이름까지 함께 업로드하고, 정책은 그 데이터가 “AI 모델 학습에 쓰인다”고 명시해요. 이 조항은 스크린샷이나 이미지를 콕 집어 말하진 않지만, 연락처 메타데이터만이 아니라 메시지 텍스트 전반의 학습을 다루고 있어요.

ConfiText의 개인정보처리방침은 2026년 2월 10일부터 적용되고 2026년 9월 27일에 확인했는데10, “앱 안에 입력한 텍스트”만 다루고 아홉 개 항목 어디에서도 사진, 이미지, 스크린샷을 언급하지 않아요. 자체 마케팅 사이트도 입력 방식을 딱 하나, 사용자가 이미 써둔 메시지를 붙여넣는 것만 설명하고, 스크린샷이나 사진 업로드 기능은 페이지 어디에도 안 보여요. 지금으로서는 보관 질문 자체가 ConfiText에는 적용되지 않는 것 같아요. 이 제품은 자체 현재 사이트에 따르면 애초에 스크린샷을 입력으로 받지 않아요.

이 셋을 합쳐 보면, 더 이상 존재하지 않는 것으로 보이는 앱 하나, 자체 문서상으로는 AI가 실제로 읽는 것에서 이미지를 빼놓지만 비서를 켜면 메시지 텍스트로 학습은 하는 앱 하나, 그리고 스크린샷을 아예 받지 않는 앱 하나가 나와요. 이게 스크린샷을 읽는 앱이 보관을 어떻게 다뤄야 하는지를 정해주지는 않아요. 다만 이름을 밝힌 경쟁 제품 세 곳의 스크린샷 정책을 비교해봤더니, 애초에 가정했던 것보다 서로 합의된 부분도, 적용 가능한 부분도 더 적었다는 뜻이에요.

메타데이터 지우기는 상식이지, 측정된 사실은 아니에요

휴대폰 카메라로 찍은 모든 사진은 기기 모델, 촬영 시각, 때로는 위치까지 파일 안에 EXIF 데이터로 담아둘 수 있어요. 사진을 공유하기 전에 이 데이터를 지우라는 조언은 온라인 어디에나 있어요. 저는 이 데이터를 지우는 것, 또는 스크린샷에 보이는 내용을 손으로 가리는 것이, 서류상으로만 막아주는 이론적 노출과 달리 실제 프라이버시 피해를 측정 가능한 수준으로 줄여주는지 잰 통제된 연구를 찾아봤어요. 찾지 못했어요. 있는 건 어떤 항목이 존재하고 그걸 어떻게 지우는지 설명하는 서술형 보안 글이지, 메타데이터를 지운 사람과 안 지운 사람의 결과를 비교한 실험이 아니었어요. 이 조언은 합리적이지만 검증되지 않은 걸로 받아들이고, 측정된 보호 수단으로는 받아들이지 마세요.

Subtext 자체가 스크린샷의 메타데이터로 뭘 하는지에 대해서는, 이 사이트 자체 규칙이 어떤 제품 주장을 하기 전에도 확인하도록 요구하는 그 파일, 백엔드의 시스템 프롬프트와 도구 정의(functions/src/subtext_prompts.ts)를 직접 읽었어요. 그 코드 어디에도 스크린샷 파일의 메타데이터를 읽거나, 지우거나, 들여다보거나, 달리 건드리는 부분은 없어요. 이미지는 다른 어떤 이미지와 마찬가지로 시각 입력값으로 그대로 비전 모델에 전달되고, 제가 읽은 프롬프트나 도구 정의 어디에도 별도의 메타데이터 처리 단계는 나오지 않아요. 이건 어떤 기능이 있다는 게 아니라 없다는 걸 말하는 거예요. Subtext가 스크린샷의 메타데이터로 뭔가를 한다는 증거는 어느 방향으로도 찾지 못했고, 코드가 보여주지 않는 기능을 있다고 주장하는 것도 아니에요. Subtext 자체가 스크린샷을 얼마나 정확히 읽는지에 대한 독립적인 평가도 존재하지 않는데, 이건 위에 이름을 든 모든 앱을 관통하는 같은 공백이에요. 개인정보처리방침이 확인해주는 것, 그리고 이 사이트의 두 워크플로 글이 이미 밝히고 있는 것은, 스크린샷을 포함한 모든 첨부 파일에 적용되는 일반 규칙이에요. 대화는 거기 딸린 것까지 포함해서 마지막으로 사용한 지 5일 뒤에, 고정해두면 90일 뒤에 스스로 사라지고, 업로드한 건 무엇도 AI 모델 학습에 쓰이지 않아요.

정리하면

이 네 조각을 함께 놓고 보면, 이 그림은 우연이 아니라 원래 고르지 않게 나온 거예요. 실제로 확인 가능한 정확도 수치가 있는 유일한 부분, 즉 비전 모델 안의 일반적인 OCR 성능은 엇갈려요. 영어에서는 강하고, 비라틴 문자와 저해상도 텍스트에서는 눈에 띄게 약한데, 실제 대화 스크린샷이 아니라 정제된 벤치마크로 테스트된 결과예요. 위에서 다룬 여섯 가지 추가 실패 유형 중 네 개는 인접한 질문에 대한 실제 연구를 인용해요. 반응을 정확히 읽어낸 다음 그게 실제로 뭘 신호하는지, 사라지는 메시지 앱이 애초에 콘텐츠를 얼마나 확실하게 지우는지, 사람들이 서로의 스티커를 얼마나 자주 잘못 읽는지, 그리고 언어 모델이 언어가 섞인 텍스트를 일반적으로 얼마나 못 다루는지예요. 이 네 연구 중 어느 것도 모델이 스크린샷에서 그걸 읽어내는 정확히 그 사례를 테스트하지는 않았어요. 나머지 둘, 단체 채팅 화자 식별과 인용 답장 혼동은 인접한 것이든 아니든 뒷받침하는 연구가 전혀 없고, 인터페이스가 어떻게 작동하는지에 대한 기계적 설명만 있어요. 경쟁 제품 확인에서는 처음 가정했던 것보다 비교할 거리가 더 적게 나왔어요. 앱 하나는 사라졌고, 하나는 자체 설명으로는 AI 기능에서 이미지를 빼놓고, 하나는 애초에 스크린샷을 받지도 않아요. 그리고 메타데이터 문제는 다들 되풀이하지만 아무도 측정한 적이 없는 것처럼 보이는 조언으로 드러났어요.

이 중 어느 것도 일반적인 쓰임에서 모델이 당신의 스크린샷을 읽는 게 못 미덥다는 뜻은 아니에요. 여기서 가장 크고 가장 직접적인 연구도 여전히 모델이 대부분의 영어 장면 텍스트를 정확히 읽어낸다고 측정했어요. 이게 뜻하는 건, 비전 모델이 대화 스크린샷을 그냥 입력된 텍스트만큼 믿음직하게 읽어낸다는 구체적인 주장에는 실제로 수치화된 예외가 있고, 그중 일부는 크며, 아직 아무도 측정하지 않은 어려운 사례도 여럿 있다는 거예요.

오늘 기준으로 상황은 이래요. Subtext도 이 일을 하는 앱 중 하나고, 위에 나온 다른 앱들보다 더 검증된 것도 덜 검증된 것도 아니에요. 브라우저에서 Subtext 써보기브라우저에서 Subtext 써보기

2026년 9월 27일 기준으로 확인했어요.

출처

  1. Shi, Peng, Liao, Lin, Chen, Liu, Zhang and Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. 2023년의 한 모델 세대를 대상으로 한 장면 텍스트와 문서 OCR 벤치마크로, 메시지 스크린샷을 다룬 건 아니에요.
  2. Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. arXiv 프리프린트, 저자 한 명. 정해진 글꼴 크기와 해상도로 따로 뗀 일본어 한자 100자를 테스트했고, 채팅 스크린샷은 다루지 않았어요.
  3. Miller Hillberg, Levonian, Kluver, Terveen and Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. 트위터 사용자 710명에게 자신이 올린, 이모지가 든 트윗에 대해 물어본 설문 조사로, 모델이 그걸 읽는 걸 테스트한 건 아니에요.
  4. Tardelli, Alvisi, Cima, Cresci and Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv 프리프린트. 크립토 관련 텔레그램 메시지에 달린 반응 65만 건 이상을 다뤘고, 플랫폼 하나, 주제 영역 하나에 한정돼요.
  5. Heath, MacDermott and Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. WhatsApp, Snapchat, Telegram 자체의 삭제 동작을 테스트한 거지, AI가 스크린샷을 읽는 걸 다룬 게 아니에요.
  6. Tang, Hew, Herring and Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. 한 대학의 토론 그룹 다섯 개와 인터뷰 참여자 일곱 명을 대상으로 했고, 사람의 오독을 측정한 거지 모델의 오독을 잰 게 아니에요.
  7. Sheth, Sinha, Patil, Beniwal and Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv 프리프린트 서베이로, 스크린샷에 특화된 테스트는 없어요.
  8. Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, 2026년 9월 27일 확인. 결과가 0건으로 나왔고, 이 앱은 더 이상 등록돼 있지 않은 것으로 보여요.
  9. Mei. Terms of Service and Privacy Policy, 2023년 10월 3일에 마지막으로 수정됨, 2026년 9월 27일 확인.
  10. ConfiText. Privacy Policy, 2026년 2월 10일부터 적용, 2026년 9월 27일 확인.