ArtigosFerramentas de escrita
A IA consegue ler um print das suas mensagens. Nem sempre lê certo.
As taxas de erro publicadas para ler texto pequeno, no modo escuro e em idiomas não latinos num print, o que três apps de leitura de print dizem sobre o que você envia, e se tirar os metadados faz alguma diferença mensurável.
Por Samet Durgun · Cofundador da Subtext · 16 min de leitura
Cole o print de uma conversa numa ferramenta de IA e, na maioria das vezes, funciona sem mais. Ela diz quem falou o quê, pega a piada e escreve uma resposta que faz sentido. “Na maioria das vezes” é a parte que ninguém mede, e vale a pena separar isso de uma pergunta diferente que este site já trata em outro lugar. Depois que o modelo já tem as palavras na sua frente, descobrir quem está falando em cada troca, acompanhar uma pergunta que nunca foi respondida, ler sarcasmo, é o assunto da página sobre ler a mensagem que você recebeu antes de responder e da pesquisa sobre ler a conversa inteira antes de responder. Este texto é sobre o passo anterior, se o modelo lê a imagem certo, antes de mais nada.
Eu sou cofundador do Subtext, um app de verificação de tom e de redação de respostas que recebe um print da conversa como uma das suas entradas, então eu tenho motivo para querer uma resposta favorável aqui. Eu não tenho uma. O que vem a seguir é o que consegui verificar sobre uma pergunta mais estreita e menos lisonjeira, a de quão bons os modelos de hoje com capacidade de visão são para ler um print de celular como imagem, e não como transcrição, e o que acontece a um print depois que você entrega ele para um desses apps. Toda fonte abaixo é uma que eu mesmo abri.
Ler um print é um problema de imagem antes de ser um problema de idioma
Um print de uma conversa é uma imagem feita de luz, não um bloco de texto que um computador já consegue interpretar. Antes de um modelo conseguir raciocinar sobre o que uma mensagem diz, ele precisa transformar pixels em caracteres corretamente, seja qual for a fonte, o tamanho, o contraste e o layout que o app de mensagens usou. Essa etapa é o reconhecimento ótico de caracteres, OCR, que roda sobre o mesmo sistema de visão que lê qualquer outra imagem. A maioria das afirmações sobre precisão de IA e mensagens fala do raciocínio que acontece depois dessa etapa. Poucas falam da etapa em si.
Os números que existem
O teste mais direto é uma avaliação de 2023 da capacidade de OCR do GPT-4V em vários benchmarks1. Em texto de cena em inglês, ele marcou 88,0% de precisão de palavras no benchmark CUTE80 e entre 62,0% e 66,0% em três conjuntos ingleses mais difíceis, contra 68,2% a 98,6% de um sistema de OCR especializado nos mesmos quatro benchmarks. Em texto de cena em chinês, o benchmark ReCTS, o GPT-4V marcou zero. Num teste multilíngue à parte, no mesmo artigo, sua pontuação F1 de detecção de texto chegou a 82,49% para inglês e 83,42% para francês, contra 16,55% para árabe e 1,36% para chinês. O artigo afirma sem rodeios que “apesar da sua versatilidade lidando com diferentes tarefas de OCR, o GPT-4V não supera os sistemas de OCR de última geração já existentes,” e que “mostrou limitações lidando com idiomas que não usam o alfabeto latino”1.
Isso é uma única geração de modelo, testada em datasets de texto de cena selecionados, não em prints de mensagens, então trate isso como um piso mínimo para o problema geral, não como um veredito sobre nenhum app disponível hoje. Ainda é o número mais direto e verificável contra a afirmação simples de que a IA lê escrita não latina dentro de uma imagem tão bem quanto lê escrita latina. Por essa evidência, não lê.
Resolução também importa. O mesmo artigo encontrou “uma correlação positiva entre a resolução da imagem de entrada e o desempenho de reconhecimento”1, o que joga contra um print comprimido ou muito reduzido, exatamente o que muitos celulares produzem quando uma imagem é salva de novo ou reenviada, antes mesmo de o modelo ler uma única palavra. Um preprint de 2025, mais restrito, testou isso com mais precisão, ainda que só em caracteres kanji japoneses isolados, mostrados em tamanhos controlados, não em prints de conversas. Os modelos multimodais empataram com um método de OCR dedicado a cerca de 300 pixels por polegada, e “o desempenho deles piora de forma acentuada abaixo de 150 ppi”2. Se esse limiar vale para texto pequeno dentro de um print de celular comprimido não foi testado. A direção, texto menor e de resolução mais baixa degradando mais rápido nesses modelos do que num OCR feito sob medida para isso, é o ponto em que dois artigos separados concordam.
Sobre o modo escuro especificamente, e sobre texto de baixo contraste de modo geral, eu não encontrei nenhuma avaliação publicada medindo a precisão de modelos multimodais contra o equivalente em modo claro dos mesmos prints. Os pipelines clássicos de OCR costumam inverter imagens escuras antes de processá-las, porque a inversão de contraste é um gatilho conhecido para erros de leitura nessa tecnologia mais antiga, o que sugere que a preocupação de base é razoável. Ninguém rodou o teste equivalente nos modelos multimodais que as pessoas usam hoje para ler um print de conversa, pelo menos em nada que eu tenha encontrado, então eu não vou afirmar um número que não consigo sustentar.
Emojis ficam dentro da mesma imagem, e a pesquisa sobre eles responde a uma pergunta diferente da que as pessoas costumam fazer. É menos sobre se um modelo consegue perceber que uma forma é um emoji, e mais sobre qual emoji ele está vendo, porque o mesmo caractere não desenha a mesma imagem em todo lugar. O Unicode Consortium padroniza o ponto de código e o seu significado, não o desenho. A Apple, o Google, a Samsung e todo outro fornecedor desenham o próprio glifo para ele3. Numa pesquisa com 710 usuários do Twitter que tinham acabado de postar um tweet com emoji, pelo menos 25% não sabiam que o emoji deles podia aparecer diferente no celular de outra pessoa, e depois de verem como um dos próprios tweets realmente aparecia em outra plataforma, 20% disseram que teriam editado ou nem mandado3. Essa diferença existe entre duas pessoas olhando para o mesmo caractere em dois celulares diferentes. Um print estreita isso ainda mais. O que quer que a plataforma de quem mandou tenha desenhado fica achatado numa imagem parada, e um modelo que lê essa imagem não consegue recuperar qual era o emoji original sem que a fonte da própria plataforma já esteja embutida nos pixels. Se essa combinação, ambiguidade entre plataformas mais compressão do print, muda com que frequência um modelo erra o nome da emoção por trás de um emoji é um teste que, ao que parece, ainda ninguém rodou.
Falhas que as outras páginas deste site não cobrem
Um punhado de recursos específicos de chat torna a leitura correta mais difícil, cada um do seu jeito, além do problema no nível do pixel acima. Parte do que vem a seguir se apoia num estudo. Parte é uma descrição simples de como a interface funciona, sem nenhuma pesquisa dedicada por trás, e eu tentei manter as duas coisas separadas para que uma não empreste peso à outra.
Grupos e conversas com várias pessoas. Um print de uma conversa a dois dá ao modelo dois grupos visuais para separar a fala, um lado e o outro. Um grupo quebra esse padrão. Três ou mais pessoas podem compartilhar a mesma cor de balão, o nome de quem manda pode aparecer só acima da primeira mensagem de uma sequência e não em cada linha depois dela, e um avatar cortado pode ser a única pista visual de quem está falando. Eu não encontrei nenhum estudo testando a precisão de um modelo em atribuir linhas corretamente dentro de um print de grupo especificamente. A pesquisa mais próxima mede um problema relacionado mas diferente, atribuição de quem fala em transcrições escritas de reuniões, não em balões de print, e esse terreno já está coberto na página sobre ler a conversa inteira. O que está aqui é uma descrição mecânica da versão em print do mesmo problema, não uma conclusão testada. Mais pessoas falando e compartilhando menos pistas visuais por linha é, à primeira vista, uma tarefa de atribuição mais difícil, quer alguém tenha medido o quanto mais difícil quer não.
Reações rápidas e reações com emoji. Um emoji pequeno preso no canto do balão de outra pessoa, um coração, uma risada, um joia, carrega dois riscos separados. O primeiro é se um modelo consegue sequer identificar corretamente o glifo pequeno, às vezes sobreposto, e eu não encontrei nenhum teste direto disso. O segundo é o que a reação significa depois de ser lida corretamente, e essa parte já foi estudada. Uma análise de mais de 650.000 mensagens do Telegram com reação encontrou que reações positivas dominavam as respostas independentemente de a mensagem por trás soar neutra ou negativa, concluindo que reações com emoji “não funcionam de forma confiável como indicadores de espelhamento emocional ou de ressonância com o conteúdo”4. Essa é uma amostra grande de uma única plataforma e uma única área de assunto, canais relacionados a criptomoedas, e ainda é um preprint, então trate os números exatos como provisórios. O ponto que importa para quem lê um print se mantém apesar dessas ressalvas. Acertar o nome do emoji da reação não diz a ninguém, modelo ou pessoa, o que a reação realmente sinaliza.
Respostas citadas e a interface de encadeamento. A maioria dos apps de mensagem deixa você responder a uma mensagem anterior específica, mostrando o trecho citado como um bloco menor e mais apagado acima do novo. Num print, esse tratamento visual, tamanho reduzido, cor mais clara, às vezes uma linha vertical, é o único sinal de que uma linha é contexto citado e não uma mensagem nova de quem quer que pareça visualmente ser a vez de falar. Corte a imagem alguns pixels diferente e a distinção pode sumir. Eu não encontrei nenhum estudo medindo com que frequência um modelo confunde um trecho citado com uma mensagem nova, ou o contrário. Isso é uma falha mecânica plausível, embutida em como a interface representa o encadeamento, não uma testada.
Mensagens que somem e são efêmeras. Uma mensagem efêmera é feita para não deixar registro depois de vista, e é exatamente isso que um print anula. Antes de qualquer pergunta sobre IA entrar na história, pesquisadores forenses já tinham mostrado que a premissa por trás disso é mais frágil do que os usuários assumem. Testando diretamente os recursos de mensagens que somem do WhatsApp, do Snapchat e do Telegram, um estudo recuperou conteúdo supostamente apagado a partir de dados do aparelho e de backups na nuvem, em vários dos cenários que tentou5. Isso é uma conclusão sobre as plataformas, não sobre a IA lendo um print de uma delas, e não mede nada sobre a precisão de um modelo. O que isso estabelece, independente de qualquer IA, é que um print não é a única forma de o conteúdo efêmero sobreviver à exclusão para a qual foi feito. Se o desfoque na própria tela de um app, ou um aviso de “print tirado,” introduz artefatos visuais que um modelo poderia confundir com conteúdo é, de novo, uma preocupação plausível sem nenhum estudo dedicado por trás.
Figurinhas. Uma figurinha carrega significado através da pose e da expressão mais do que através de palavras, o que torna ela mais difícil de ler para uma máquina e, no fim das contas, para pessoas também. Um estudo com cinco grupos de discussão de estudantes usando figurinhas em chats de projetos reais, apoiado em entrevistas com sete dos participantes sobre o próprio uso de figurinhas, encontrou um desencontro entre o que quem mandou quis dizer e o que quem recebeu entendeu em 34,7% das figurinhas examinadas, principalmente por causa de expressões faciais e corporais ambíguas na própria arte6. Isso é um estudo pequeno e qualitativo de uma única população, estudantes universitários de uma instituição asiática, e mede erro de leitura entre humanos, não de um modelo. Ainda assim, é evidência real de que uma figurinha é um sinal ambíguo mesmo entre pessoas que já se conhecem, o que estabelece um teto baixo para o quão bem qualquer leitor, humano ou máquina, deveria conseguir ler só a partir da imagem.
Trocar de idioma no meio da conversa. Trocar de idioma dentro de uma mensagem, ou entre mensagens na mesma conversa, é comum em quem manda mensagem em dois ou mais idiomas, e é um caso difícil documentado para modelos de linguagem em geral. Uma revisão de 2025 da área afirma sem rodeios que “a maioria dos LLMs ainda tem dificuldade com entradas em idiomas misturados”7, sem um número que se transfira de forma limpa para um print com dois idiomas dentro do mesmo balão de fala. Eu não consegui encontrar um estudo isolando a troca de idioma como um problema de leitura de print especificamente, além do problema mais amplo de texto multilíngue que a revisão descreve. Trate isso como uma dificuldade real e documentada na tecnologia por trás, aplicada aqui a um caso que ainda ninguém testou diretamente.
O que três apps de leitura de print dizem sobre o que você envia
O Subtext não é o único app feito para ler um print de conversa, e a comparação útil é o que a documentação atual de cada um diz que acontece com um envio, não o que o marketing sugere. O panorama mais amplo das ferramentas de escrita com IA está mapeado à parte; aqui eu conferi três produtos citados lá, contra as próprias páginas de privacidade deles, sobre uma pergunta estreita, a de retenção, exclusão e uso no treinamento de um modelo.
O Keys AI Texting Coach, feito pela Charmed Inc. em torno da leitura de prints para conselhos de namoro e de mensagens, parece não estar mais no ar. O próprio serviço de consulta do iTunes da Apple retorna zero resultados para a sua ficha na App Store, app id 1510154956, a partir de 27 de setembro de 20268, e o domínio conhecido dele redireciona todo caminho, incluindo o que costumava ter a sua política de privacidade, para uma página de domínio estacionado. Eu não consegui localizar uma política de privacidade atual desse app por nenhum canal. O que quer que ele tenha dito um dia sobre o tratamento de prints, eu não consigo verificar hoje, e não vou reconstruir uma afirmação a partir de uma página que não carrega mais.
O Mei, um app de mensagem padrão do Android com um assistente de IA opcional, afirma nos seus termos atuais, com a última modificação em 3 de outubro de 2023 e verificados em 27 de setembro de 20269, que o conteúdo de mensagem, incluindo “imagens, fotos, áudio ou vídeos,” fica armazenado nos servidores dele “com o único propósito de comunicação” e “não é usado por nós de nenhuma outra forma.” Separadamente, descrevendo o que o assistente de IA opcional dele realmente recebe, o mesmo documento diz que as últimas 20 mensagens mandadas para a IA como contexto incluem “emojis, reações e URLs,” mas que “mensagens com anexos, mensagens de voz e imagens não são coletadas” para esse fim. Lendo os dois juntos, a própria documentação do Mei diz que o recurso de sugestão por IA dele não processa nenhum conteúdo de imagem, prints incluídos. A cláusula de armazenamento sobre fotos trata da entrega normal de mensagem dentro do app, não de nada mandado para a IA. Um recurso separado e opcional de assistente de IA funciona diferente. Quando um usuário liga ele, o Mei envia todo o banco de dados de mensagens SMS e MMS do aparelho, incluindo o texto de cada mensagem, mais números de telefone com hash e nomes de contatos, e a política afirma que esses dados são “usados para treinar modelos de IA.” Essa cláusula não cita prints ou imagens especificamente, mas é sobre treinar com o texto das mensagens de forma ampla, não só com metadados de contato.
A política de privacidade do ConfiText, em vigor desde 10 de fevereiro de 2026 e verificada em 27 de setembro de 202610, trata só de “texto que você digita no App” e não menciona fotos, imagens ou prints em nenhuma das nove seções dela. O próprio site de marketing dele descreve exatamente um método de entrada, colar uma mensagem que você já escreveu, e nenhum recurso de envio de print ou foto aparece em lugar nenhum da página. Do jeito que as coisas estão, a questão da retenção não parece se aplicar ao ConfiText. O produto, segundo o próprio site atual dele, nem aceita um print como entrada, para começar.
Entre os três, a contagem é um app que não parece mais existir, um cuja própria documentação exclui imagens do que a IA dele realmente lê mas treina com o texto das mensagens quando o assistente está ligado, e um que não aceita print nenhum. Isso não resolve como um app de leitura de print deveria tratar retenção. Mas significa que comparar as políticas de print de três concorrentes citados nomeadamente produziu menos concordância, e menos aplicabilidade, do que a premissa assumia de início.
Tirar os metadados ajuda de verdade, ou é só senso comum?
Toda foto que a câmera de um celular tira pode carregar dados EXIF, modelo do aparelho, data e hora, às vezes localização, embutidos no arquivo. O conselho de tirar esses dados antes de compartilhar uma foto está em todo lugar na internet. Eu procurei um estudo controlado medindo se remover esses dados, ou apagar manualmente o conteúdo visível de um print, produz uma queda mensurável em dano real à privacidade, em contraste com uma exposição teórica que uma edição só fecha no papel. Eu não encontrei nenhum. O que existe é texto descritivo, de segurança, que explica quais campos existem e como removê-los, não um experimento comparando resultados entre pessoas que tiraram metadados e pessoas que não tiraram. Trate o conselho como razoável e não testado, não como uma proteção medida.
Sobre o que o próprio Subtext faz com os metadados de um print, eu li diretamente os prompts de sistema e as definições de ferramenta do backend, o mesmo arquivo que as próprias regras deste site exigem conferir antes de qualquer afirmação sobre o produto (functions/src/subtext_prompts.ts). Nada nesse código lê, remove, inspeciona ou de qualquer outra forma toca nos metadados do arquivo de um print. As imagens são entregues ao modelo com capacidade de visão como entrada visual, do mesmo jeito que qualquer outra imagem seria, e nenhuma etapa separada de processamento de metadados aparece em nenhum lugar dos prompts ou definições de ferramenta que eu li. Estou afirmando isso como uma ausência, não como um recurso. Eu não encontrei nenhuma evidência de que o Subtext faça qualquer coisa com os metadados de um print, em nenhuma das duas direções, e não estou reivindicando uma capacidade que o código não mostra. Também não existe nenhuma avaliação independente de quão bem o próprio Subtext lê um print, a mesma lacuna que atravessa todos os apps citados acima. O que a política de privacidade confirma, e o que as duas páginas de fluxo deste site já afirmam, é a regra geral que se aplica a todo anexo, incluindo um print. Uma conversa, e tudo que está anexado a ela, se apaga sozinha cinco dias depois do último uso, ou noventa dias se estiver fixada, e nada do que é enviado é usado para treinar um modelo de IA.
Somando tudo isso
Juntando as quatro partes, o quadro é desigual por design, não por acidente. A única parte com um número de precisão real e verificável, o desempenho geral de OCR dentro de um modelo de visão, é misto, forte em inglês, mensuravelmente mais fraco em escrita não latina e em texto de baixa resolução, testado em benchmarks selecionados, não em prints reais de conversas. Quatro das seis falhas extras acima citam pesquisa real sobre uma pergunta adjacente, o que uma reação realmente sinaliza depois de ser lida corretamente, quão bem os apps de mensagem efêmera apagam conteúdo antes de mais nada, com que frequência as pessoas entendem errado as figurinhas umas das outras, e quão mal os modelos de linguagem lidam com texto multilíngue em geral. Nenhum desses quatro estudos testou o caso exato de um modelo lendo isso a partir de um print. As outras duas, atribuição em grupo e confusão de resposta citada, não têm nenhuma pesquisa por trás, adjacente ou não, só uma descrição mecânica de como a interface funciona. A conferência da concorrência achou menos para comparar do que a premissa assumia, um app que sumiu, um que exclui imagens do próprio recurso de IA segundo a própria documentação, e um que nunca aceitou print nenhum. E a questão dos metadados acabou sendo um conselho que todo mundo repete e que, ao que parece, ninguém mediu.
Nada disso quer dizer que um modelo lendo o seu print seja pouco confiável no uso geral. O maior e mais direto estudo aqui ainda assim mediu um modelo lendo corretamente a maior parte do texto de cena em inglês. Quer dizer que a afirmação específica, a de que um modelo de visão lê um print de conversa tão bem quanto lê texto simples digitado, tem exceções reais e quantificadas, algumas delas grandes, e vários casos difíceis que ainda ninguém mediu.
É aí que as coisas estão hoje. O Subtext é mais um app fazendo isso, nem mais nem menos verificado do que o resto acima.
Experimente o Subtext no navegadorEscaneie com a câmera do celular para instalar.Experimente o Subtext no navegador
Verificado em 27 de setembro de 2026.
Fontes
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang e Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Benchmarks de OCR de texto de cena e de documento contra uma única geração de modelo de 2023, não prints de mensagem.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. Preprint no arXiv, autor único. Testa 100 caracteres kanji japoneses isolados em tamanho de fonte e resolução controlados, não prints de conversa.
- Miller Hillberg, Levonian, Kluver, Terveen e Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Pesquisa com 710 usuários do Twitter sobre os próprios tweets com emoji, não um teste de um modelo lendo eles.
- Tardelli, Alvisi, Cima, Cresci e Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. Preprint no arXiv. Mais de 650.000 reações em mensagens do Telegram relacionadas a criptomoedas, uma única plataforma e uma única área de assunto.
- Heath, MacDermott e Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Testa o comportamento de exclusão do próprio WhatsApp, Snapchat e Telegram, não a leitura de um print por IA.
- Tang, Hew, Herring e Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Cinco grupos de discussão e sete entrevistados numa única universidade; mede erro de leitura entre humanos, não de um modelo.
- Sheth, Sinha, Patil, Beniwal e Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. Revisão em preprint no arXiv, sem teste específico sobre print.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, verificado em 27 de setembro de 2026. Retornou zero resultados; o app não parece mais estar listado.
- Mei. Terms of Service and Privacy Policy, última modificação em 3 de outubro de 2023, verificado em 27 de setembro de 2026.
- ConfiText. Privacy Policy, em vigor desde 10 de fevereiro de 2026, verificado em 27 de setembro de 2026.