ArtículosHerramientas de escritura
La IA puede leer una captura de tus mensajes. No siempre la lee bien.
Las tasas de error publicadas al leer texto pequeño, en modo oscuro y en alfabetos no latinos dentro de una captura, lo que dicen tres apps de capturas sobre lo que subes, y si borrar los metadatos cambia algo medible.
Por Samet Durgun · Cofundador de Subtext · 16 min de lectura
Pega la captura de un chat en una herramienta de IA y normalmente funciona sin más. Te dice quién dijo qué, capta la broma y redacta una respuesta con sentido. “Normalmente” es la parte a la que nadie le pone un número, y vale la pena separarla de una pregunta distinta que este sitio ya trata en otra parte. Una vez que el modelo tiene las palabras delante, averiguar quién habla en cada turno, seguirle la pista a una pregunta que nunca se contestó, leer el sarcasmo, es el tema de la página sobre leer el mensaje que has recibido y de la investigación detrás de leer el hilo entero antes de responder. Este artículo trata del paso anterior, si el modelo lee bien la imagen en primer lugar.
Soy una de las dos personas que construye Subtext, una app que revisa el tono de tus mensajes y te ayuda a redactar la respuesta, y que admite una captura de un chat como una de sus entradas, así que tengo motivos para querer una respuesta favorable aquí. No la tengo. Lo que sigue es lo que pude verificar sobre una pregunta más concreta y menos favorable: qué tan bien leen hoy los modelos con capacidades de visión una captura de un teléfono como imagen, no como transcripción, y qué pasa con una captura en cuanto se la entregas a una de estas apps. Cada fuente de abajo es una que abrí yo mismo.
Leer una captura es un problema de imagen antes que un problema de idioma
La captura de un chat es una imagen hecha de luz, no un bloque de texto que un ordenador ya pueda analizar. Antes de que un modelo pueda razonar sobre lo que dice un mensaje, tiene que convertir píxeles en caracteres correctamente, con la tipografía, el tamaño, el contraste y el diseño que la app de mensajería haya usado. Ese paso es el reconocimiento óptico de caracteres, u OCR, que corre sobre el mismo sistema de visión que lee cualquier otra imagen. La mayoría de las afirmaciones sobre precisión que se hacen sobre la IA y la mensajería hablan del razonamiento que ocurre después de este paso. Pocas hablan del paso en sí.
Los números que existen
La prueba más directa es una evaluación de 2023 de la capacidad de OCR de GPT-4V en varios benchmarks1. En texto de escena en inglés obtuvo un 88,0% de precisión por palabra en el benchmark CUTE80 y entre el 62,0% y el 66,0% en tres conjuntos de inglés más difíciles, frente a un sistema de OCR especializado que fue del 68,2% al 98,6% en los mismos cuatro benchmarks. En texto de escena en chino, el benchmark ReCTS, GPT-4V obtuvo cero. En una prueba multilingüe distinta dentro del mismo paper, su puntuación F1 de detección de texto llegó al 82,49% para el inglés y al 83,42% para el francés, frente a un 16,55% para el árabe y un 1,36% para el chino. El paper afirma sin rodeos que “a pesar de su versatilidad para manejar tareas de OCR diversas, GPT-4V no supera a los modelos de OCR más avanzados que ya existen,” y que “mostró limitaciones al tratar con idiomas no latinos”1.
Eso es una sola generación de modelo, probada con conjuntos de datos de texto de escena ya seleccionados, no con capturas de mensajería, así que hay que leerlo como un piso para el problema general, no como un veredicto sobre ninguna app disponible hoy. Aun así, es el número más directo y comprobable frente a la afirmación llana de que la IA lee alfabetos no latinos dentro de una imagen tan bien como lee los latinos. Con esta evidencia, no es así.
La resolución también importa. El mismo paper encontró “una correlación positiva entre la resolución de la imagen de entrada y el rendimiento del reconocimiento”1, lo cual juega en contra de una captura comprimida o muy reducida de tamaño, justo lo que producen muchos teléfonos cuando una imagen se vuelve a guardar o se reenvía, antes incluso de que el modelo lea una sola palabra. Un preprint de 2025 más acotado probó esto con más precisión, aunque solo con caracteres kanji japoneses aislados, renderizados a tamaños controlados, no con capturas de chats. Los modelos multimodales igualaron a un método de OCR dedicado en torno a los 300 ppi, y “su rendimiento se deteriora de forma notable por debajo de los 150 ppi”2. Si ese umbral se mantiene con texto pequeño dentro de una captura de teléfono comprimida no está probado. La dirección, un texto más pequeño y de menor resolución que se degrada más rápido para estos modelos que para un OCR construido específicamente para eso, es lo que dos papers distintos coinciden en afirmar.
En concreto sobre el modo oscuro, y en general sobre el texto de bajo contraste, no encontré ninguna evaluación publicada que mida la precisión de los modelos multimodales frente a las mismas capturas en modo claro. Los pipelines de OCR clásicos invierten de forma rutinaria las imágenes oscuras antes de procesarlas, porque la inversión de contraste es un motivo conocido de lecturas erróneas en esa tecnología más antigua, lo que sugiere que la preocupación de fondo es razonable. Nadie ha hecho la prueba equivalente con los modelos multimodales que ahora se usan para leer una captura de chat, al menos no en nada que yo haya encontrado, así que no voy a dar un número que no puedo respaldar.
Los emojis están dentro de la misma imagen, y la investigación sobre ellos responde a una pregunta distinta de la que la gente suele hacerse. Se trata menos de si un modelo puede saber que una forma es un emoji, y más de qué emoji está viendo, porque el mismo carácter no dibuja el mismo icono en todas partes. El Consorcio Unicode estandariza el punto de código y su significado, no el dibujo. Apple, Google, Samsung y cualquier otro proveedor dibujan su propio glifo para él3. En una encuesta a 710 usuarios de Twitter que acababan de publicar un tuit con un emoji, al menos el 25% no sabía que su emoji podía verse distinto en el teléfono de otra persona, y después de que les mostraran cómo se veía en realidad uno de sus propios tuits en otra plataforma, el 20% dijo que lo habría editado o que directamente no lo habría enviado3. Esa brecha existe entre dos personas que miran el mismo carácter en dos teléfonos distintos. Una captura la estrecha todavía más. Lo que haya dibujado la plataforma de quien envía queda aplanado en una imagen fija, y un modelo que lea esa imagen no puede recuperar qué emoji era en origen sin que la tipografía propia de esa plataforma ya esté cocinada dentro de los píxeles. Si esa combinación, la ambigüedad entre plataformas más la compresión de la captura, cambia con qué frecuencia un modelo nombra mal la emoción detrás de un emoji es una prueba que, según parece, nadie ha hecho todavía.
Modos de fallo que las páginas de flujo de trabajo de aquí no cubren
Un puñado de funciones concretas del chat dificultan la lectura correcta cada una a su manera, más allá del problema a nivel de píxel de arriba. Parte de lo que sigue se apoya en un estudio. Parte es una simple descripción de cómo funciona la interfaz, sin ninguna investigación dedicada detrás, y he intentado mantener las dos cosas separadas para que una no le preste su peso a la otra.
Chats de grupo e hilos con varios participantes. Una captura de uno a uno le da al modelo dos grupos visuales en los que repartir el habla, un lado y el otro. Un hilo de grupo rompe ese patrón. Tres o más personas pueden compartir el mismo color de burbuja, el nombre de quien envía puede aparecer solo encima del primer mensaje de una racha y no en cada línea siguiente, y un avatar recortado puede ser la única pista visual de quién habla. No encontré ningún estudio que probara la precisión de un modelo a la hora de atribuir líneas correctamente dentro de una captura de un chat de grupo en concreto. La investigación más cercana mide un problema relacionado pero distinto, la atribución de quien habla en transcripciones escritas de reuniones, no en burbujas capturadas en pantalla, y ese terreno ya está cubierto en la página sobre leer un hilo de conversación entero. Lo que hay aquí es una descripción mecánica de la versión en captura del mismo problema, no un hallazgo probado. Que más personas compartan menos pistas visuales por línea es, a primera vista, una tarea de atribución más difícil, se haya medido o no cuánto más difícil.
Reacciones rápidas y reacciones con emoji. Un emoji pequeño anclado en la esquina de la burbuja de otra persona, un corazón, una risa, un pulgar hacia arriba, trae dos riesgos distintos. El primero es si un modelo puede identificar correctamente, para empezar, ese glifo pequeño y a veces superpuesto, algo de lo que no encontré ninguna prueba directa. El segundo es qué significa la reacción una vez que se lee correctamente, y esa parte sí se ha estudiado. Un análisis de más de 650.000 mensajes de Telegram con reacciones encontró que las reacciones positivas dominaban las respuestas sin importar si el mensaje de fondo se leía como neutro o negativo, y concluyó que las reacciones con emoji “no funcionan de forma fiable como indicadores de un reflejo o una resonancia emocional del contenido”4. Es una muestra grande de una sola plataforma y un solo tema, canales relacionados con las criptomonedas, y sigue siendo un preprint, así que hay que tratar las cifras exactas como provisionales. Lo que importa para quien lee una captura se mantiene al margen de esos matices. Nombrar bien el emoji de la reacción no le dice a nadie, ni a un modelo ni a una persona, qué señala en realidad esa reacción.
Respuestas citadas e interfaz de hilos. La mayoría de las apps de mensajería te dejan responder a un mensaje anterior concreto, y muestran el fragmento citado como un bloque más pequeño y más tenue encima del nuevo. En una captura, ese tratamiento visual, tamaño reducido, color más claro, a veces una línea vertical, es la única señal de que una línea es contexto citado y no un mensaje nuevo de quien parece, visualmente, que le toca el turno. Recorta la imagen unos píxeles distintos y la distinción puede desaparecer. No encontré ningún estudio que midiera con qué frecuencia un modelo confunde un fragmento citado con un mensaje nuevo, o al revés. Es un fallo mecánico plausible, integrado en cómo la interfaz representa los hilos, no uno probado.
Mensajes que desaparecen y efímeros. Un mensaje efímero está pensado para no dejar rastro una vez visto, que es justo lo que una captura anula. Antes de que entrara en juego ninguna pregunta sobre IA, los investigadores forenses ya habían mostrado que la premisa de fondo es más frágil de lo que asume la gente. Probando directamente las funciones de mensajes que desaparecen de WhatsApp, Snapchat y Telegram, un estudio recuperó contenido supuestamente borrado a partir de datos del dispositivo y copias de seguridad en la nube, en varios de los escenarios que probó5. Eso es un hallazgo sobre las plataformas, no sobre una IA leyendo una captura de una de ellas, y no mide nada sobre la precisión de un modelo. Lo que sí deja claro, al margen de cualquier IA, es que una captura no es la única forma en que un contenido efímero sobrevive a su borrado previsto. Si el propio desenfoque en pantalla de una app, o un aviso de “captura tomada,” introduce artefactos visuales que un modelo podría confundir con contenido es, de nuevo, una preocupación plausible sin ningún estudio dedicado detrás.
Stickers. Un sticker lleva el significado más en la pose y la expresión que en las palabras, lo que lo hace más difícil de leer para una máquina y, resulta, también para las personas. Un estudio con cinco grupos de discusión de estudiantes que usaban stickers en chats de proyectos reales, apoyado en entrevistas a siete de los participantes sobre su propio uso de stickers, encontró un desajuste entre lo que quería decir quien lo enviaba y lo que entendía quien lo recibía en el 34,7% de los stickers examinados, sobre todo por expresiones faciales y corporales ambiguas en el propio dibujo6. Es un estudio pequeño y cualitativo de una sola población, estudiantes universitarios de una institución asiática, y mide la mala lectura humana, no la de un modelo. Aun así, es evidencia real de que un sticker es una señal ambigua incluso entre personas que ya se conocen, lo que pone un techo bajo a lo bien que cabría esperar que lo leyera cualquiera, humano o máquina, solo a partir de la imagen.
Cambiar de idioma a mitad de conversación. Cambiar de idioma dentro de un mismo mensaje, o entre mensajes del mismo hilo, es habitual al escribir mensajes en bilingüe o en varios idiomas, y es un caso difícil documentado para los modelos de lenguaje en general. Una revisión de 2025 del campo afirma sin rodeos que “la mayoría de los LLM todavía tienen dificultades con las entradas en varios idiomas”7, sin dar un número que se traslade limpiamente a una captura con dos idiomas dentro de una misma burbuja. No pude encontrar un estudio que aislara el cambio de idioma como un problema específico de lectura de capturas, aparte del problema más amplio de texto multilingüe que describe la revisión. Trata esto como una dificultad real y documentada en la tecnología de base, aplicada aquí a un caso que todavía nadie ha probado directamente.
Lo que dicen tres apps de capturas sobre lo que subes
Subtext no es la única app hecha para leer una captura de un chat, y la comparación útil es lo que dice la documentación actual de cada una sobre qué pasa con lo que subes, no lo que insinúe su publicidad. El panorama más amplio de herramientas de IA para escribir está mapeado aparte; aquí comprobé tres productos nombrados allí, contra sus propias páginas de privacidad, para una pregunta concreta: retención, borrado y uso para entrenar un modelo.
Keys AI Texting Coach, construida por Charmed Inc. alrededor de leer capturas para dar consejos de citas y de mensajería, parece que ya no está activa. El propio servicio de búsqueda de iTunes de Apple devuelve cero resultados para su ficha en la App Store, id de app 1510154956, a fecha de 27 de septiembre de 20268, y su dominio web conocido redirige cualquier ruta, incluida la que solía tener su política de privacidad, a una página de aparcamiento de dominio. No pude localizar por ningún canal una política de privacidad vigente para esta app. Lo que dijera en su día sobre el manejo de capturas no lo puedo verificar hoy, y no voy a reconstruir una afirmación a partir de una página que ya no carga.
Mei, una app de mensajería predeterminada de Android con un asistente de IA opcional, declara en sus términos actuales, modificados por última vez el 3 de octubre de 2023 y comprobados el 27 de septiembre de 20269, que el contenido de los mensajes, incluidas “imágenes, fotos, audio o videos,” se guarda en sus servidores “con el único propósito de la comunicación” y “no se usa por nosotros de ninguna otra forma.” Por separado, al describir qué recibe en realidad su asistente de IA opcional, el mismo documento dice que los últimos 20 mensajes que se le mandan a la IA como contexto incluyen “emojis, reacciones y URLs,” pero que “los mensajes con adjuntos, los mensajes de voz y las imágenes no se recogen” para ese fin. Leído todo junto, la propia documentación de Mei dice que su función de sugerencias de IA no procesa en absoluto contenido de imagen, capturas incluidas. La cláusula sobre almacenamiento de fotos se refiere a la entrega normal de mensajes dentro de la app, no a nada que se le mande a la IA. Una función aparte de asistente de IA, opcional, funciona de otra forma: cuando alguien la activa, Mei sube toda la base de datos de mensajes SMS y MMS del dispositivo, incluido el texto de cada mensaje, más los números de teléfono con hash y los nombres de los contactos, y la política dice que esos datos “se usan para entrenar modelos de IA.” Esa cláusula no nombra capturas ni imágenes en concreto, pero sí habla de entrenar con el texto de los mensajes en general, no solo con los metadatos de contacto.
La política de privacidad de ConfiText, vigente desde el 10 de febrero de 2026 y comprobada el 27 de septiembre de 202610, solo se refiere al “texto que introduces en la app” y no menciona fotos, imágenes ni capturas en ninguna de sus nueve secciones. Su propia web de marketing describe exactamente un método de entrada, pegar un mensaje que el usuario ya ha escrito, y no aparece por ninguna parte de la página ninguna función para subir una captura o una foto. Tal como están las cosas, la pregunta sobre retención no parece aplicarle a ConfiText. El producto, según su propia web actual, de entrada no admite una captura como entrada.
Entre las tres, el recuento es una app que parece que ya no existe, una cuya propia documentación excluye las imágenes de lo que su IA lee en realidad pero sí entrena con el texto de los mensajes cuando su asistente está activado, y una que directamente no admite una captura. Eso no resuelve cómo debería tratar la retención una app que lee capturas. Sí quiere decir que comparar las políticas sobre capturas de tres competidores nombrados dio menos coincidencias, y menos aplicabilidad, de lo que suponía la premisa de partida.
Borrar los metadatos es sentido común, no algo medido
Cualquier foto que haga la cámara de un teléfono puede llevar datos EXIF, el modelo del dispositivo, la marca de tiempo, a veces la ubicación, incrustados en el archivo. El consejo de borrar estos datos antes de compartir una foto está por todas partes en internet. Busqué un estudio controlado que midiera si quitar esos datos, o tapar a mano el contenido visible de una captura, produce una reducción medible del daño real a la privacidad, frente a una exposición teórica que una redacción solo cierra sobre el papel. No encontré ninguno. Lo que existe es texto descriptivo sobre seguridad que explica qué campos existen y cómo eliminarlos, no un experimento que compare los resultados de quienes borraron los metadatos con los de quienes no lo hicieron. Trata el consejo como razonable y sin comprobar, no como una protección medida.
Sobre lo que Subtext mismo hace con los metadatos de una captura, leí directamente los system prompts y las definiciones de herramientas del backend, el mismo archivo que las propias reglas de este sitio exigen revisar antes de cualquier afirmación de producto (functions/src/subtext_prompts.ts). Nada en ese código lee, elimina, inspecciona ni toca de ninguna otra forma los metadatos del archivo de una captura. Las imágenes se le entregan al modelo con capacidades de visión subyacente como entrada visual, igual que cualquier otra imagen, y no aparece ningún paso separado de procesamiento de metadatos en ningún lugar de los prompts o las definiciones de herramientas que leí. Lo digo como una ausencia, no como una función. No encontré ninguna prueba de que Subtext haga algo con los metadatos de una captura, en ningún sentido, y no estoy afirmando una capacidad que el código no muestra. Tampoco existe ninguna evaluación independiente de qué tan bien lee Subtext mismo una captura, la misma brecha que atraviesa cada app nombrada arriba. Lo que sí confirma la política de privacidad, y lo que ya dicen las dos páginas de flujo de trabajo de este sitio, es la regla general que se aplica a cualquier adjunto, capturas incluidas. Una conversación, y todo lo que lleve adjunto, se borra automáticamente cinco días después de la última vez que la usas, o 90 días si la fijas, y nada de lo que subes se usa para entrenar un modelo de IA.
Lo que todo esto suma
Juntando las cuatro piezas, el panorama es desigual a propósito, no por accidente. La única parte con un número de precisión real y comprobable, el rendimiento general del OCR dentro de un modelo de visión, es mixta: fuerte en inglés, medible más débil en alfabetos no latinos y en texto de baja resolución, probada en benchmarks ya seleccionados, no en capturas de chats reales. Cuatro de los seis modos de fallo extra de arriba citan investigación real sobre una pregunta adyacente: qué señala en realidad una reacción una vez que se lee bien, qué tan fiables son en realidad las apps efímeras para borrar contenido, con qué frecuencia la gente malinterpreta los stickers de otros, y qué tan mal manejan los modelos de lenguaje el texto en varios idiomas en general. Ninguno de esos cuatro estudios probó el caso exacto de un modelo leyéndolo desde una captura. Los otros dos, la atribución en chats de grupo y la confusión con las respuestas citadas, no tienen ninguna investigación detrás, ni adyacente ni de ningún tipo, solo una descripción mecánica de cómo funciona la interfaz. La comprobación de la competencia encontró menos que comparar de lo que suponía la premisa: una app desaparecida, una que excluye las imágenes de su propia función de IA según su propia versión, y una que nunca aceptó capturas. Y la pregunta sobre los metadatos resultó ser un consejo que todo el mundo repite y que, según parece, nadie ha medido.
Nada de esto quiere decir que un modelo que lee tu captura sea poco fiable en el uso normal. El estudio más grande y más directo de aquí sigue midiendo que un modelo lee correctamente la mayor parte del texto de escena en inglés. Quiere decir que la afirmación concreta, que un modelo con capacidades de visión lee una captura de chat con la misma fiabilidad con la que lee texto escrito normal, tiene excepciones reales y cuantificadas, algunas grandes, y varios casos difíciles que nadie ha medido en absoluto.
Así están las cosas hoy. Subtext es una app más que hace esto, ni más ni menos verificada que el resto de arriba.
Prueba Subtext en tu navegadorEscanéalo con la cámara del móvil para instalar.Prueba Subtext en tu navegador
Comprobado el 27 de septiembre de 2026.
Fuentes
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang y Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Benchmarks de OCR de texto de escena y de documentos frente a una sola generación de modelo de 2023, no capturas de mensajería.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. Preprint de arXiv, autor único. Prueba 100 caracteres kanji japoneses aislados, a tamaño de fuente y resolución controlados, no capturas de chats.
- Miller Hillberg, Levonian, Kluver, Terveen y Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Encuesta a 710 usuarios de Twitter sobre sus propios tuits con emoji, no una prueba de un modelo leyéndolos.
- Tardelli, Alvisi, Cima, Cresci y Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. Preprint de arXiv. Más de 650.000 reacciones en mensajes de Telegram relacionados con criptomonedas, una sola plataforma y un solo tema.
- Heath, MacDermott y Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Prueba el comportamiento de borrado propio de WhatsApp, Snapchat y Telegram, no la lectura de una captura por parte de una IA.
- Tang, Hew, Herring y Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Cinco grupos de discusión y siete personas entrevistadas en una universidad; mide la mala lectura humana, no la de un modelo.
- Sheth, Sinha, Patil, Beniwal y Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. Encuesta en preprint de arXiv, sin prueba específica sobre capturas.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, comprobado el 27 de septiembre de 2026. Devuelve cero resultados; la app ya no parece estar en el listado.
- Mei. Terms of Service and Privacy Policy, modificados por última vez el 3 de octubre de 2023, comprobados el 27 de septiembre de 2026.
- ConfiText. Privacy Policy, vigente desde el 10 de febrero de 2026, comprobada el 27 de septiembre de 2026.