ArtigosFerramentas de escrita
A IA consegue ler uma captura de ecrã das tuas mensagens. Nem sempre lê bem.
As taxas de erro publicadas para ler texto pequeno, em modo escuro e não latino numa captura de ecrã, o que três apps de leitura de capturas de ecrã dizem sobre o teu envio, e se remover os metadados faz alguma diferença mensurável.
Por Samet Durgun · Cofundador da Subtext · 16 min de leitura
Cola a captura de ecrã de uma conversa numa ferramenta de IA e, normalmente, funciona sem mais. Ela diz-te quem disse o quê, apanha a piada e redige uma resposta que faz sentido. “Normalmente” é a parte que ninguém mede, e vale a pena separá-la de uma pergunta diferente que este site já trata noutro sítio. Depois de o modelo já ter as palavras à frente, perceber quem fala em cada troca, seguir uma pergunta que nunca teve resposta, ler sarcasmo, é o tema da página sobre ler a mensagem que recebeste antes de responderes e da investigação sobre ler o fio inteiro antes de responder. Este texto é sobre o passo anterior, se o modelo lê bem a imagem, antes de mais nada.
Sou cofundador do Subtext, uma app de verificação de tom e de redação de respostas que recebe uma captura de ecrã da conversa como uma das suas entradas, por isso tenho um motivo para querer aqui uma resposta favorável. Não a tenho. O que se segue é o que consegui verificar sobre uma pergunta mais estreita e menos lisonjeira, a de quão bons são os modelos de hoje com capacidade de visão a ler uma captura de ecrã de telemóvel como imagem, e não como transcrição, e o que acontece a uma captura de ecrã depois de a entregares a uma destas apps. Todas as fontes abaixo são fontes que abri eu próprio.
Ler uma captura de ecrã é um problema de imagem antes de ser um problema de língua
Uma captura de ecrã de uma conversa é uma imagem feita de luz, não um bloco de texto que um computador já consiga interpretar. Antes de um modelo poder raciocinar sobre o que uma mensagem diz, tem de transformar pixels em carateres corretamente, seja qual for a fonte, o tamanho, o contraste e a disposição que a app de mensagens calhou usar. Esse passo é o reconhecimento ótico de carateres, OCR, que corre sobre o mesmo sistema de visão que lê qualquer outra imagem. A maioria das afirmações sobre precisão de IA e mensagens diz respeito ao raciocínio que acontece depois deste passo. Poucas dizem respeito ao passo em si.
Os números que existem
O teste mais direto é uma avaliação de 2023 da capacidade de OCR do GPT-4V em vários benchmarks1. Em texto de cena em inglês, obteve 88,0% de precisão de palavras no benchmark CUTE80 e entre 62,0% e 66,0% em três conjuntos ingleses mais difíceis, contra 68,2% a 98,6% de um sistema de OCR especializado nos mesmos quatro benchmarks. Em texto de cena em chinês, o benchmark ReCTS, o GPT-4V obteve zero. Num teste multilingue à parte, no mesmo artigo, a sua pontuação F1 de deteção de texto chegou a 82,49% para inglês e 83,42% para francês, contra 16,55% para árabe e 1,36% para chinês. O artigo afirma sem rodeios que “apesar da sua versatilidade a lidar com diferentes tarefas de OCR, o GPT-4V não supera os sistemas de OCR de última geração já existentes,” e que “mostrou limitações a lidar com línguas que não usam o alfabeto latino”1.
Isto é uma só geração de modelo, testada em datasets de texto de cena curados, não em capturas de ecrã de mensagens, por isso lê-o como um limite mínimo para o problema geral, não como um veredito sobre nenhuma app disponível hoje. Continua a ser o número mais direto e verificável contra a afirmação simples de que a IA lê escrita não latina dentro de uma imagem tão bem como lê escrita latina. Por esta evidência, não lê.
A resolução também importa. O mesmo artigo encontrou “uma correlação positiva entre a resolução da imagem de entrada e o desempenho de reconhecimento”1, o que joga contra uma captura de ecrã comprimida ou muito reduzida, exatamente o que muitos telemóveis produzem quando uma imagem é guardada de novo ou reenviada, antes mesmo de o modelo ler uma única palavra. Um preprint de 2025, mais restrito, testou isto com mais precisão, ainda que só em carateres kanji japoneses isolados, apresentados em tamanhos controlados, não em capturas de ecrã de conversas. Os modelos multimodais igualaram um método de OCR dedicado a cerca de 300 pixels por polegada, e “o seu desempenho piora de forma acentuada abaixo de 150 ppi”2. Se esse limiar se mantém para texto pequeno dentro de uma captura de ecrã de telemóvel comprimida não foi testado. A direção, texto mais pequeno e de resolução mais baixa a degradar-se mais depressa nestes modelos do que num OCR feito de propósito para isso, é o ponto em que dois artigos separados concordam.
Sobre o modo escuro em particular, e sobre texto de baixo contraste em geral, não encontrei nenhuma avaliação publicada que meça a precisão de modelos multimodais contra o equivalente em modo claro das mesmas capturas de ecrã. Os pipelines clássicos de OCR costumam inverter imagens escuras antes de as processar, porque a inversão de contraste é um gatilho conhecido para erros de leitura nessa tecnologia mais antiga, o que sugere que a preocupação de base é razoável. Ninguém correu o teste equivalente nos modelos multimodais que as pessoas usam hoje para ler uma captura de ecrã de conversa, pelo menos em nada que eu tenha encontrado, por isso não vou afirmar um número que não consigo sustentar.
Os emojis estão dentro da mesma imagem, e a investigação sobre eles responde a uma pergunta diferente da que as pessoas costumam fazer. Não é tanto se um modelo consegue perceber que uma forma é um emoji, e mais qual emoji está a ver, porque o mesmo caráter não desenha a mesma imagem em todo o lado. O Unicode Consortium normaliza o ponto de código e o seu significado, não o desenho. A Apple, a Google, a Samsung e todos os outros fornecedores desenham o seu próprio glifo para ele3. Num inquérito a 710 utilizadores do Twitter que tinham acabado de publicar um tweet com emoji, pelo menos 25% não sabiam que o seu emoji podia parecer diferente no telemóvel de outra pessoa, e depois de lhes mostrarem como um dos seus próprios tweets aparecia mesmo noutra plataforma, 20% disseram que o teriam editado ou nem sequer enviado3. Essa diferença existe entre duas pessoas a olhar para o mesmo caráter em dois telemóveis diferentes. Uma captura de ecrã estreita-a ainda mais. Seja o que for que a plataforma de quem enviou tenha desenhado, fica achatado numa imagem estática, e um modelo que lê essa imagem não consegue recuperar qual era o emoji original sem que a fonte da própria plataforma já esteja cozida nos pixels. Se essa combinação, ambiguidade entre plataformas mais compressão da captura de ecrã, muda com que frequência um modelo dá o nome errado à emoção por trás de um emoji é um teste que, ao que parece, ainda ninguém correu.
Modos de falha que as outras páginas deste site não cobrem
Um punhado de funcionalidades específicas de chat torna a leitura correta mais difícil, cada uma à sua maneira, para além do problema ao nível do pixel referido acima. Parte do que se segue assenta num estudo. Parte é uma descrição simples de como a interface funciona, sem nenhuma investigação dedicada por trás, e tentei manter as duas coisas separadas para que uma não empreste peso à outra.
Chats de grupo e conversas com várias pessoas. Uma captura de ecrã de uma conversa a dois dá ao modelo dois grupos visuais para separar a fala, um lado e o outro. Uma conversa de grupo quebra esse padrão. Três ou mais pessoas podem partilhar a mesma cor de balão, o nome de quem envia pode aparecer só acima da primeira mensagem de uma sequência e não em cada linha a seguir, e um avatar cortado pode ser a única pista visual de quem está a falar. Não encontrei nenhum estudo que teste a precisão de um modelo a atribuir linhas corretamente dentro de uma captura de ecrã de chat de grupo especificamente. A investigação mais próxima mede um problema relacionado mas diferente, a atribuição de quem fala em transcrições escritas de reuniões, não em balões capturados em ecrã, e esse terreno já está coberto na página sobre ler uma conversa inteira. O que está aqui é uma descrição mecânica da versão em captura de ecrã do mesmo problema, não uma conclusão testada. Mais pessoas a falar a partilhar menos pistas visuais por linha é, à partida, uma tarefa de atribuição mais difícil, quer alguém tenha medido quanto mais difícil quer não.
Reações rápidas e reações com emoji. Um pequeno emoji afixado ao canto do balão de outra pessoa, um coração, uma risada, um polegar para cima, carrega dois riscos separados. O primeiro é se um modelo consegue sequer identificar corretamente o glifo pequeno, por vezes sobreposto, e não encontrei nenhum teste direto disso. O segundo é o que a reação significa depois de ser lida corretamente, e essa parte já foi estudada. Uma análise de mais de 650.000 mensagens do Telegram com reação encontrou que as reações positivas dominavam as respostas independentemente de a mensagem subjacente se ler como neutra ou negativa, concluindo que as reações com emoji “não funcionam de forma fiável como indicadores de espelhamento emocional ou de ressonância com o conteúdo”4. Essa é uma amostra grande de uma só plataforma e uma só área de tema, canais relacionados com criptomoedas, e continua a ser um preprint, por isso trata os números exatos como provisórios. O ponto que importa para quem lê uma captura de ecrã mantém-se apesar dessas ressalvas. Dar o nome certo ao emoji da reação não diz a ninguém, modelo ou pessoa, o que a reação sinaliza de facto.
Respostas citadas e a interface de encadeamento. A maioria das apps de mensagens deixa-te responder a uma mensagem anterior específica, mostrando o excerto citado como um bloco mais pequeno e mais esbatido por cima da nova mensagem. Numa captura de ecrã, esse tratamento visual, tamanho reduzido, cor mais clara, por vezes uma linha vertical, é o único sinal de que uma linha é contexto citado e não uma mensagem nova de quem quer que pareça visualmente ser a vez de falar. Corta a imagem de forma ligeiramente diferente e a distinção pode desaparecer. Não encontrei nenhum estudo que meça com que frequência um modelo confunde um excerto citado com uma mensagem nova, ou o contrário. Isto é um modo de falha mecânico plausível, próprio de como a interface representa o encadeamento, não um modo testado.
Mensagens efémeras e que desaparecem. Uma mensagem efémera é feita para não deixar registo depois de ser vista, e é exatamente isso que uma captura de ecrã anula. Antes de qualquer pergunta sobre IA entrar em jogo, investigadores forenses já tinham mostrado que a premissa de base é mais frágil do que os utilizadores assumem. Ao testar diretamente as funcionalidades de mensagens que desaparecem do WhatsApp, do Snapchat e do Telegram, um estudo recuperou conteúdo supostamente apagado a partir de dados do aparelho e de cópias de segurança na nuvem, em vários dos cenários que experimentou5. Isso é uma conclusão sobre as plataformas, não sobre a IA a ler uma captura de ecrã de uma delas, e não mede nada sobre a precisão de um modelo. O que isso estabelece, independentemente de qualquer IA, é que uma captura de ecrã não é a única forma de o conteúdo efémero sobreviver à eliminação a que estava destinado. Se o desfoque no próprio ecrã de uma app, ou um aviso de “captura de ecrã feita,” introduz artefactos visuais que um modelo possa confundir com conteúdo é, mais uma vez, uma preocupação plausível sem nenhum estudo dedicado por trás.
Stickers. Um sticker carrega significado através da pose e da expressão mais do que através de palavras, o que o torna mais difícil de ler para uma máquina e, ao que parece, também para pessoas. Um estudo com cinco grupos de discussão de estudantes a usar stickers em chats de projetos reais, apoiado em entrevistas a sete dos participantes sobre o seu próprio uso de stickers, encontrou um desencontro entre o que quem enviou quis dizer e o que quem recebeu entendeu em 34,7% dos stickers examinados, sobretudo por causa de expressões faciais e corporais ambíguas no próprio desenho6. Isto é um estudo pequeno e qualitativo de uma só população, estudantes universitários de uma instituição asiática, e mede leitura errada entre humanos, não de um modelo. Ainda assim, é evidência real de que um sticker é um sinal ambíguo mesmo entre pessoas que já se conhecem, o que fixa um teto baixo para o quão bem qualquer leitor, humano ou máquina, deveria conseguir ler só a partir da imagem.
Mudar de língua a meio da conversa. Mudar de língua dentro de uma mensagem, ou entre mensagens no mesmo fio, é comum em quem escreve mensagens em duas ou mais línguas, e é um caso difícil documentado para modelos de linguagem em geral. Uma revisão de 2025 da área afirma sem rodeios que “a maioria dos LLMs ainda tem dificuldade com entradas em várias línguas”7, sem um número que se transfira de forma limpa para uma captura de ecrã com duas línguas dentro do mesmo balão de fala. Não consegui encontrar um estudo que isole a mudança de língua como um problema de leitura de capturas de ecrã especificamente, para além do problema mais amplo de texto multilingue que a revisão descreve. Trata isto como uma dificuldade real e documentada na tecnologia de base, aplicada aqui a um caso que ainda ninguém testou diretamente.
O que três apps de leitura de capturas de ecrã dizem sobre o teu envio
O Subtext não é a única app feita para ler uma captura de ecrã de conversa, e a comparação útil é o que a documentação atual de cada uma diz que acontece a um envio, não o que o marketing sugere. O panorama mais amplo das ferramentas de escrita com IA está mapeado à parte; aqui verifiquei três produtos referidos lá, contra as suas próprias páginas de privacidade, para uma pergunta estreita, a de retenção, eliminação e uso no treino de um modelo.
Keys AI Texting Coach, construída pela Charmed Inc. à volta da leitura de capturas de ecrã para conselhos de encontros e de mensagens, parece já não estar ativa. O próprio serviço de consulta do iTunes da Apple devolve zero resultados para a sua ficha na App Store, app id 1510154956, a partir de 27 de setembro de 20268, e o seu domínio web conhecido redireciona todos os caminhos, incluindo o que costumava ter a sua política de privacidade, para uma página de domínio estacionado. Não consegui localizar uma política de privacidade atual desta app por nenhum canal. O que quer que tenha dito em tempos sobre o tratamento de capturas de ecrã, não o consigo verificar hoje, e não vou reconstruir uma afirmação a partir de uma página que já não carrega.
Mei, uma app de mensagens predefinida no Android com um assistente de IA opcional, afirma nos seus termos atuais, com a última modificação a 3 de outubro de 2023 e verificados a 27 de setembro de 20269, que o conteúdo das mensagens, incluindo “imagens, fotos, áudio ou vídeos,” é guardado nos seus servidores “com o único propósito de comunicação” e “não é usado por nós de nenhuma outra forma.” Separadamente, ao descrever o que o seu assistente de IA opcional recebe de facto, o mesmo documento diz que as últimas 20 mensagens enviadas à IA como contexto incluem “emojis, reações e URLs,” mas que “mensagens com anexos, mensagens de voz e imagens não são recolhidas” para esse fim. Lidas em conjunto, a própria documentação da Mei diz que a sua funcionalidade de sugestões de IA não processa nenhum conteúdo de imagem, capturas de ecrã incluídas. A cláusula de armazenamento sobre fotos diz respeito à entrega normal de mensagens dentro da app, não a nada enviado à IA. Uma funcionalidade separada, e opcional, de assistente de IA funciona de outra forma. Quando um utilizador a liga, a Mei envia toda a base de dados de mensagens SMS e MMS do aparelho, incluindo o texto de cada mensagem, mais números de telefone com hash e nomes de contactos, e a política afirma que esses dados são “usados para treinar modelos de IA.” Essa cláusula não nomeia capturas de ecrã ou imagens especificamente, mas trata do treino com o texto das mensagens de forma ampla, não só com metadados de contactos.
A política de privacidade da ConfiText, em vigor desde 10 de fevereiro de 2026 e verificada a 27 de setembro de 202610, trata só de “texto que introduzes na App” e não menciona fotos, imagens ou capturas de ecrã em nenhuma das suas nove secções. O próprio site de marketing descreve exatamente um método de entrada, colar uma mensagem que já escreveste, e não aparece nenhuma funcionalidade de carregamento de captura de ecrã ou foto em lado nenhum da página. Tal como as coisas estão, a questão da retenção não parece aplicar-se à ConfiText. O produto, segundo o seu próprio site atual, nem sequer aceita uma captura de ecrã como entrada.
Nas três, a contagem é uma app que já não parece existir, uma cuja própria documentação exclui imagens do que a sua IA lê de facto mas treina com o texto das mensagens quando o assistente está ligado, e uma que não aceita capturas de ecrã de todo. Isso não resolve como uma app de leitura de capturas de ecrã devia tratar a retenção. Mas quer dizer que comparar as políticas de captura de ecrã de três concorrentes nomeados produziu menos concordância, e menos aplicabilidade, do que a premissa assumia à partida.
Remover os metadados ajuda mesmo, ou é só senso comum?
Toda a fotografia tirada pela câmara de um telemóvel pode carregar dados EXIF, modelo do aparelho, hora, por vezes localização, embutidos no ficheiro. O conselho para remover esses dados antes de partilhar uma foto está em todo o lado online. Procurei um estudo controlado que medisse se remover esses dados, ou tapar manualmente o conteúdo visível de uma captura de ecrã, produz uma queda mensurável no dano real à privacidade, em contraste com uma exposição teórica que uma redação só fecha no papel. Não encontrei nenhum. O que existe é escrita descritiva, de segurança, que explica que campos existem e como os remover, não uma experiência que compare resultados entre pessoas que removeram metadados e pessoas que não o fizeram. Trata o conselho como razoável e não testado, não como uma proteção medida.
Sobre o que o próprio Subtext faz com os metadados de uma captura de ecrã, li diretamente os prompts de sistema e as definições de ferramentas do backend, o mesmo ficheiro que as próprias regras deste site exigem verificar antes de qualquer afirmação sobre o produto (functions/src/subtext_prompts.ts). Nada nesse código lê, remove, inspeciona ou de outra forma toca nos metadados do ficheiro de uma captura de ecrã. As imagens são entregues ao modelo com capacidade de visão como entrada visual, da mesma forma que qualquer outra imagem seria, e não aparece nenhum passo separado de processamento de metadados em lado nenhum dos prompts ou definições de ferramentas que li. Estou a afirmar isto como uma ausência, não como uma funcionalidade. Não encontrei nenhuma evidência de que o Subtext faça o que quer que seja com os metadados de uma captura de ecrã, nem numa direção nem na outra, e não estou a reivindicar uma capacidade que o código não mostra. Também não existe nenhuma avaliação independente de quão bem o próprio Subtext lê uma captura de ecrã, a mesma lacuna que atravessa todas as apps nomeadas acima. O que a política de privacidade confirma, e o que as duas páginas de fluxo deste site já afirmam, é a regra geral que se aplica a todos os anexos, incluindo uma captura de ecrã. Uma conversa, e tudo o que lhe está anexado, apaga-se sozinha cinco dias depois da última utilização, ou noventa dias se estiver fixada, e nada do que é enviado é usado para treinar um modelo de IA.
O balanço de tudo isto
Juntando as quatro peças, o retrato é desigual por conceção, não por acidente. A única parte com um número de precisão real e verificável, o desempenho geral de OCR dentro de um modelo de visão, é misto, forte em inglês, mensuravelmente mais fraco em escrita não latina e em texto de baixa resolução, testado em benchmarks curados, não em capturas de ecrã reais de conversas. Quatro dos seis modos de falha extra acima citam investigação real sobre uma pergunta adjacente, o que uma reação sinaliza de facto depois de ser lida corretamente, quão fiavelmente as apps de mensagens efémeras apagam conteúdo em primeiro lugar, com que frequência as pessoas leem mal os stickers umas das outras, e quão mal os modelos de linguagem lidam com texto multilingue em geral. Nenhum desses quatro estudos testou o caso exato de um modelo a lê-lo a partir de uma captura de ecrã. Os outros dois, a atribuição em chat de grupo e a confusão de respostas citadas, não têm nenhuma investigação por trás, adjacente ou outra, só uma descrição mecânica de como a interface funciona. A verificação da concorrência encontrou menos para comparar do que a premissa assumia, uma app desaparecida, uma que exclui imagens da sua própria funcionalidade de IA segundo a sua própria documentação, e uma que nunca aceitou capturas de ecrã de todo. E a questão dos metadados acabou por ser um conselho que toda a gente repete e que, ao que parece, ninguém mediu.
Nada disto quer dizer que um modelo a ler a tua captura de ecrã seja pouco fiável no uso geral. O estudo maior e mais direto aqui mediu, mesmo assim, um modelo a ler corretamente a maior parte do texto de cena em inglês. Quer dizer que a afirmação específica, a de que um modelo de visão lê uma captura de ecrã de conversa tão bem como lê texto simples digitado, tem exceções reais e quantificadas, algumas delas grandes, e vários casos difíceis que ainda ninguém mediu.
É aqui que as coisas estão hoje. O Subtext é mais uma app a fazer isto, nem mais nem menos verificada do que as outras acima.
Experimentar o Subtext no browserDigitaliza com a câmara do telemóvel para instalar.Experimentar o Subtext no browser
Verificado a 27 de setembro de 2026.
Fontes
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang e Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Benchmarks de OCR de texto de cena e de documentos contra uma só geração de modelo de 2023, não capturas de ecrã de mensagens.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. Preprint arXiv, autor único. Testa 100 carateres kanji japoneses isolados, em tamanho de fonte e resolução controlados, não capturas de ecrã de conversas.
- Miller Hillberg, Levonian, Kluver, Terveen e Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Inquérito a 710 utilizadores do Twitter sobre os seus próprios tweets com emoji, não um teste de um modelo a lê-los.
- Tardelli, Alvisi, Cima, Cresci e Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. arXiv preprint. Mais de 650.000 reações em mensagens do Telegram relacionadas com criptomoedas, uma só plataforma e uma só área de tema.
- Heath, MacDermott e Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Testa o comportamento de eliminação do próprio WhatsApp, Snapchat e Telegram, não a leitura de uma captura de ecrã por IA.
- Tang, Hew, Herring e Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Cinco grupos de discussão e sete entrevistados numa só universidade; mede leitura errada entre humanos, não de um modelo.
- Sheth, Sinha, Patil, Beniwal e Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. arXiv preprint survey, sem teste específico sobre capturas de ecrã.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, verificado a 27 de setembro de 2026. Devolveu zero resultados; a app já não parece estar listada.
- Mei. Terms of Service and Privacy Policy, última modificação a 3 de outubro de 2023, verificado a 27 de setembro de 2026.
- ConfiText. Privacy Policy, em vigor desde 10 de fevereiro de 2026, verificado a 27 de setembro de 2026.