ArtículosHerramientas de escritura
La IA puede leer una captura de tus mensajes. No siempre le atina.
Las tasas de error publicadas al leer texto chico, en modo oscuro y en alfabetos no latinos dentro de una captura, lo que dicen tres apps de capturas sobre lo que subes, y si quitar los metadatos cambia algo medible.
Por Samet Durgun · Cofundador de Subtext · 16 min de lectura
Pegas la captura de un chat en una herramienta de IA y por lo general nomás funciona. Te dice quién dijo qué, entiende la broma y redacta una respuesta que tiene sentido. “Por lo general” es la parte a la que nadie le pone un número, y vale la pena separarla de una pregunta distinta que este sitio ya trata en otro lado. Una vez que el modelo ya tiene las palabras enfrente, entender quién habla en cada turno, seguirle la pista a una pregunta que nunca se contestó, leer el sarcasmo, es el tema de la página sobre leer el mensaje que recibiste y de la investigación detrás de leer el hilo completo antes de responder. Este texto habla del paso anterior, si el modelo lee bien la imagen desde un inicio.
Soy uno de los que construye Subtext, una app que revisa el tono de tus mensajes y te ayuda a redactar la respuesta, y que acepta una captura de un chat como una de sus entradas, así que tengo motivos para querer una respuesta favorable aquí. No la tengo. Lo que sigue es lo que pude verificar sobre una pregunta más puntual y menos favorable: qué tan bien leen hoy los modelos con capacidades de visión una captura de un teléfono como imagen, no como transcripción, y qué pasa con una captura en cuanto se la das a una de estas apps. Cada fuente de abajo es una que abrí yo mismo.
Leer una captura es un problema de imagen antes de ser un problema de idioma
La captura de un chat es una imagen hecha de luz, no un bloque de texto que una computadora ya pueda procesar. Antes de que un modelo pueda razonar sobre lo que dice un mensaje, tiene que convertir píxeles en caracteres de forma correcta, con la tipografía, el tamaño, el contraste y el diseño que haya usado la app de mensajería. Ese paso es el reconocimiento óptico de caracteres, u OCR, que corre sobre el mismo sistema de visión que lee cualquier otra imagen. La mayoría de lo que se afirma sobre la precisión de la IA y la mensajería habla del razonamiento que pasa después de este paso. Poco habla del paso en sí.
Los números que sí existen
La prueba más directa es una evaluación de 2023 sobre la capacidad de OCR de GPT-4V en varios benchmarks1. En texto de escena en inglés obtuvo 88.0% de precisión por palabra en el benchmark CUTE80 y entre 62.0% y 66.0% en tres conjuntos de inglés más difíciles, contra el 68.2% al 98.6% de un sistema de OCR especializado en esos mismos cuatro benchmarks. En texto de escena en chino, el benchmark ReCTS, GPT-4V sacó cero. En una prueba multilingüe aparte dentro del mismo paper, su puntuación F1 de detección de texto llegó a 82.49% para inglés y 83.42% para francés, contra 16.55% para árabe y 1.36% para chino. El paper dice sin rodeos que “a pesar de su versatilidad para manejar distintas tareas de OCR, GPT-4V no supera a los modelos de OCR más avanzados que ya existen,” y que “mostró limitaciones al lidiar con idiomas que no son latinos”1.
Eso es una sola generación de modelo, probada con conjuntos de datos de texto de escena ya elegidos de antemano, no con capturas de mensajería, así que hay que leerlo como un piso para el problema general, no como un veredicto sobre ninguna app que exista hoy. Aun así, es el número más directo y comprobable contra la afirmación de que la IA lee alfabetos no latinos dentro de una imagen tan bien como lee los latinos. Con esta evidencia, no es cierto.
La resolución también importa. El mismo paper encontró “una correlación positiva entre la resolución de la imagen de entrada y qué tan bien reconoce el texto”1, lo cual juega en contra de una captura comprimida o muy reducida, justo lo que hacen muchos teléfonos cuando una imagen se vuelve a guardar o se reenvía, antes de que el modelo siquiera lea una palabra. Un preprint de 2025 más acotado probó esto con más detalle, aunque solo con caracteres kanji japoneses sueltos, renderizados a tamaños controlados, no con capturas de chats. Los modelos multimodales igualaron a un método de OCR dedicado alrededor de los 300 ppi, y “su desempeño se deteriora bastante por debajo de los 150 ppi”2. Si ese umbral aplica también a texto chico dentro de una captura de teléfono comprimida no está probado. La dirección, texto más chico y de menor resolución que se degrada más rápido para estos modelos que para un OCR hecho específicamente para eso, es en lo que coinciden dos papers distintos.
Sobre el modo oscuro en particular, y sobre el texto de bajo contraste en general, no encontré ninguna evaluación publicada que mida la precisión de los modelos multimodales contra las mismas capturas en modo claro. Los pipelines de OCR clásicos invierten de forma rutinaria las imágenes oscuras antes de procesarlas, porque la inversión de contraste es una causa conocida de errores de lectura en esa tecnología más vieja, lo que sugiere que la preocupación de fondo tiene sentido. Nadie ha corrido la prueba equivalente con los modelos multimodales que ahora se usan para leer una captura de chat, al menos no en nada que yo haya encontrado, así que no voy a dar un número que no puedo respaldar.
Los emojis están dentro de la misma imagen, y la investigación sobre ellos contesta una pregunta distinta a la que la gente suele hacerse. Se trata menos de si un modelo puede saber que una forma es un emoji, y más de cuál emoji está viendo, porque el mismo carácter no dibuja el mismo ícono en todas partes. El Consorcio Unicode estandariza el punto de código y su significado, no el dibujo. Apple, Google, Samsung y cualquier otro proveedor dibujan su propio glifo para él3. En una encuesta a 710 usuarios de Twitter que acababan de publicar un tuit con un emoji, al menos 25% no sabía que su emoji podía verse distinto en el teléfono de alguien más, y después de que les mostraron cómo se veía en realidad uno de sus propios tuits en otra plataforma, 20% dijo que lo habría editado o de plano no lo habría mandado3. Esa brecha existe entre dos personas viendo el mismo carácter en dos teléfonos distintos. Una captura la achica todavía más. Lo que haya dibujado la plataforma de quien manda el mensaje queda aplanado en una imagen fija, y un modelo que lea esa imagen no puede recuperar cuál era el emoji original sin que la tipografía propia de esa plataforma ya esté horneada dentro de los píxeles. Si esa combinación, la ambigüedad entre plataformas más la compresión de la captura, cambia qué tan seguido un modelo le pone el nombre equivocado a la emoción detrás de un emoji es una prueba que, según parece, todavía nadie ha hecho.
Modos de falla que las páginas de flujo de trabajo de aquí no cubren
Un puñado de funciones concretas del chat hacen la lectura correcta más difícil, cada una a su manera, más allá del problema a nivel de píxel de arriba. Parte de lo que sigue se apoya en un estudio. Parte es nada más una descripción de cómo funciona la interfaz, sin ninguna investigación dedicada detrás, y traté de mantener las dos cosas separadas para que una no le preste su peso a la otra.
Chats grupales e hilos con varios participantes. Una captura de uno a uno le da al modelo dos grupos visuales para repartir quién dice qué, un lado y el otro. Un hilo grupal rompe ese patrón. Tres o más personas pueden compartir el mismo color de burbuja, el nombre de quien manda puede aparecer solo arriba del primer mensaje de una racha y no en cada línea siguiente, y un avatar recortado puede ser la única pista visual de quién habla. No encontré ningún estudio que probara la precisión de un modelo para atribuir líneas de forma correcta dentro de una captura de un chat grupal en específico. La investigación más cercana mide un problema relacionado pero distinto, la atribución de quién habla en transcripciones escritas de juntas, no en burbujas capturadas en pantalla, y ese terreno ya está cubierto en la página sobre leer un hilo de conversación completo. Lo que hay aquí es una descripción mecánica de la versión en captura del mismo problema, no un hallazgo probado. Que más personas compartan menos pistas visuales por línea es, a primera vista, una tarea de atribución más difícil, se haya medido o no qué tanto más difícil.
Reacciones rápidas y reacciones con emoji. Un emoji chico prendido en la esquina de la burbuja de alguien más, un corazón, una risa, un pulgar arriba, trae dos riesgos distintos. El primero es si un modelo puede identificar bien, para empezar, ese glifo chico y a veces encimado, algo de lo que no encontré ninguna prueba directa. El segundo es qué significa la reacción una vez que se lee bien, y esa parte sí se ha estudiado. Un análisis de más de 650,000 mensajes de Telegram con reacciones encontró que las reacciones positivas dominaban las respuestas sin importar si el mensaje de fondo se leía neutral o negativo, y concluyó que las reacciones con emoji “no funcionan de forma confiable como indicador de que hay un reflejo o una resonancia emocional con el contenido”4. Es una muestra grande de una sola plataforma y un solo tema, canales relacionados con criptomonedas, y sigue siendo un preprint, así que hay que tomar las cifras exactas como provisionales. Lo que importa para quien lee una captura se sostiene sin importar esos matices. Nombrar bien el emoji de la reacción no le dice a nadie, ni a un modelo ni a una persona, qué señala en realidad esa reacción.
Respuestas citadas e interfaz de hilos. La mayoría de las apps de mensajería te dejan responder a un mensaje anterior específico, y muestran el fragmento citado como un bloque más chico y más tenue arriba del nuevo. En una captura, ese tratamiento visual, tamaño reducido, color más claro, a veces una línea vertical, es la única señal de que una línea es contexto citado y no un mensaje nuevo de quien parece, a simple vista, que le toca el turno. Recorta la imagen unos píxeles distintos y esa distinción puede desaparecer. No encontré ningún estudio que midiera qué tan seguido un modelo confunde un fragmento citado con un mensaje nuevo, o al revés. Es una falla mecánica probable, metida en cómo la interfaz representa los hilos, no una probada.
Mensajes que desaparecen y efímeros. Un mensaje efímero está pensado para no dejar rastro una vez que se ve, que es justo lo que una captura anula. Antes de que entrara en juego cualquier pregunta sobre IA, los investigadores forenses ya habían mostrado que la premisa de fondo es más frágil de lo que la gente asume. Probando de forma directa las funciones de mensajes que desaparecen de WhatsApp, Snapchat y Telegram, un estudio recuperó contenido supuestamente borrado a partir de datos del dispositivo y respaldos en la nube, en varios de los escenarios que probó5. Eso es un hallazgo sobre las plataformas, no sobre una IA leyendo una captura de una de ellas, y no mide nada sobre la precisión de un modelo. Lo que sí deja claro, aparte de cualquier IA, es que una captura no es la única forma en que un contenido efímero sobrevive a su borrado planeado. Si el desenfoque propio en pantalla de una app, o un aviso de “se tomó una captura,” mete artefactos visuales que un modelo podría confundir con contenido es, otra vez, una preocupación posible sin ningún estudio dedicado detrás.
Stickers. Un sticker lleva el significado más en la pose y la expresión que en las palabras, lo cual lo hace más difícil de leer para una máquina y, resulta, también para las personas. Un estudio con cinco grupos de discusión de estudiantes que usaban stickers en chats reales de proyectos, apoyado en entrevistas a siete de los participantes sobre su propio uso de stickers, encontró un desajuste entre lo que quería decir quien lo mandaba y lo que entendía quien lo recibía en 34.7% de los stickers examinados, sobre todo por expresiones faciales y corporales ambiguas en el propio dibujo6. Es un estudio chico y cualitativo de una sola población, estudiantes universitarios de una institución asiática, y mide la mala lectura humana, no la de un modelo. Aun así, es evidencia real de que un sticker es una señal ambigua incluso entre personas que ya se conocen, lo que pone un techo bajo a qué tan bien debería esperarse que lo leyera cualquiera, humano o máquina, solo a partir de la imagen.
Cambiar de idioma a media conversación. Cambiar de idioma dentro de un mismo mensaje, o entre mensajes del mismo hilo, es común al escribir mensajes en bilingüe o en varios idiomas, y es un caso difícil documentado para los modelos de lenguaje en general. Una revisión de 2025 del campo dice sin rodeos que “la mayoría de los LLM todavía batallan con las entradas en varios idiomas”7, sin dar un número que se traslade bien a una captura con dos idiomas dentro de una misma burbuja. No pude encontrar un estudio que aislara el cambio de idioma como un problema específico de lectura de capturas, aparte del problema más amplio de texto en varios idiomas que describe la revisión. Toma esto como una dificultad real y documentada en la tecnología de base, aplicada aquí a un caso que todavía nadie ha probado directamente.
Lo que dicen tres apps de capturas sobre lo que subes
Subtext no es la única app hecha para leer una captura de un chat, y la comparación que sirve es lo que dice la documentación actual de cada una sobre qué pasa con lo que subes, no lo que insinúe su publicidad. El panorama más amplio de herramientas de IA para escribir está mapeado aparte; aquí revisé tres productos nombrados ahí, contra sus propias páginas de privacidad, para una pregunta puntual: retención, borrado y uso para entrenar un modelo.
Keys AI Texting Coach, hecha por Charmed Inc. alrededor de leer capturas para dar consejos de citas y de mensajería, parece que ya no está activa. El propio servicio de búsqueda de iTunes de Apple regresa cero resultados para su ficha en la App Store, id de app 1510154956, al 27 de septiembre de 20268, y su dominio web conocido redirige cualquier ruta, incluida la que antes tenía su política de privacidad, a una página de dominio estacionado. No pude ubicar por ningún canal una política de privacidad vigente para esta app. Lo que haya dicho en su momento sobre el manejo de capturas no lo puedo verificar hoy, y no voy a reconstruir una afirmación a partir de una página que ya no carga.
Mei, una app de mensajería predeterminada de Android con un asistente de IA opcional, declara en sus términos actuales, modificados por última vez el 3 de octubre de 2023 y revisados el 27 de septiembre de 20269, que el contenido de los mensajes, incluyendo “imágenes, fotos, audio o videos,” se guarda en sus servidores “únicamente con el propósito de la comunicación” y “no se usa por nosotros de ninguna otra forma.” Por separado, al describir qué recibe en realidad su asistente de IA opcional, el mismo documento dice que los últimos 20 mensajes que se le mandan a la IA como contexto incluyen “emojis, reacciones y URLs,” pero que “los mensajes con adjuntos, los mensajes de voz y las imágenes no se recolectan” para ese fin. Leído todo junto, la propia documentación de Mei dice que su función de sugerencias de IA no procesa para nada contenido de imagen, capturas incluidas. La cláusula sobre almacenar fotos tiene que ver con la entrega normal de mensajes dentro de la app, no con nada que se le mande a la IA. Una función aparte de asistente de IA, opcional, funciona distinto: cuando alguien la activa, Mei sube toda la base de datos de mensajes SMS y MMS del dispositivo, incluyendo el texto de cada mensaje, más los números de teléfono con hash y los nombres de los contactos, y la política dice que esos datos “se usan para entrenar modelos de IA.” Esa cláusula no menciona capturas ni imágenes en específico, pero sí habla de entrenar con el texto de los mensajes en general, no solo con los metadatos de contacto.
La política de privacidad de ConfiText, vigente desde el 10 de febrero de 2026 y revisada el 27 de septiembre de 202610, solo se refiere al “texto que escribes en la app” y no menciona fotos, imágenes ni capturas en ninguna de sus nueve secciones. Su propio sitio de marketing describe exactamente un método de entrada, pegar un mensaje que el usuario ya escribió, y no aparece en ninguna parte de la página ninguna función para subir una captura o una foto. Tal como están las cosas, la pregunta sobre retención no parece aplicarle a ConfiText. El producto, según su propio sitio actual, de entrada no acepta una captura como entrada.
Entre las tres, el conteo es una app que parece que ya no existe, una cuya propia documentación excluye las imágenes de lo que su IA lee en realidad pero sí entrena con el texto de los mensajes cuando su asistente está prendido, y una que de plano no acepta una captura. Eso no resuelve cómo debería manejar la retención una app que lee capturas. Sí quiere decir que comparar las políticas sobre capturas de tres competidores nombrados dio menos coincidencias, y menos aplicabilidad, de lo que suponía la premisa de entrada.
Borrar los metadatos es sentido común, no algo medido
Cualquier foto que tome la cámara de un teléfono puede llevar datos EXIF, el modelo del dispositivo, la marca de tiempo, a veces la ubicación, incrustados en el archivo. El consejo de borrar estos datos antes de compartir una foto está por todos lados en internet. Busqué un estudio controlado que midiera si quitar esos datos, o tapar a mano el contenido visible de una captura, produce una baja medible en el daño real a la privacidad, contra una exposición teórica que una edición nada más cierra en el papel. No encontré ninguno. Lo que existe es texto descriptivo sobre seguridad que explica qué campos existen y cómo quitarlos, no un experimento que compare los resultados de quienes borraron los metadatos contra los de quienes no lo hicieron. Toma el consejo como razonable y sin comprobar, no como una protección medida.
Sobre lo que Subtext mismo hace con los metadatos de una captura, revisé directamente los system prompts y las definiciones de herramientas del backend, el mismo archivo que las reglas de este sitio piden revisar antes de cualquier afirmación de producto (functions/src/subtext_prompts.ts). Nada en ese código lee, quita, inspecciona ni toca de ninguna otra forma los metadatos del archivo de una captura. Las imágenes se le entregan al modelo con capacidades de visión de fondo como entrada visual, igual que cualquier otra imagen, y no aparece ningún paso separado para procesar metadatos en ninguna parte de los prompts o las definiciones de herramientas que revisé. Lo digo como una ausencia, no como una función. No encontré ninguna evidencia de que Subtext haga algo con los metadatos de una captura, en ningún sentido, y no estoy afirmando una capacidad que el código no muestra. Tampoco existe ninguna evaluación independiente de qué tan bien lee Subtext mismo una captura, el mismo hueco que atraviesa cada app nombrada arriba. Lo que sí confirma la política de privacidad, y lo que ya dicen las dos páginas de flujo de trabajo de este sitio, es la regla general que aplica para cualquier adjunto, capturas incluidas. Una conversación, y todo lo que traiga adjunto, se borra automáticamente cinco días después de la última vez que la usas, o 90 días si la fijas, y nada de lo que subes se usa para entrenar un modelo de IA.
Lo que todo esto suma
Juntando las cuatro piezas, el panorama es desigual a propósito, no por accidente. La única parte con un número de precisión real y comprobable, el desempeño general del OCR dentro de un modelo de visión, es mixta: fuerte en inglés, medible más débil en alfabetos no latinos y en texto de baja resolución, probada en benchmarks ya elegidos de antemano, no en capturas de chats reales. Cuatro de los seis modos de falla extra de arriba citan investigación real sobre una pregunta cercana: qué señala en realidad una reacción una vez que se lee bien, qué tan confiables son en realidad las apps efímeras para borrar contenido, qué tan seguido la gente malinterpreta los stickers de otros, y qué tan mal manejan los modelos de lenguaje el texto en varios idiomas en general. Ninguno de esos cuatro estudios probó el caso exacto de un modelo leyéndolo desde una captura. Los otros dos, la atribución en chats grupales y la confusión con las respuestas citadas, no tienen ninguna investigación detrás, ni cercana ni de ningún tipo, solo una descripción mecánica de cómo funciona la interfaz. La revisión de la competencia encontró menos que comparar de lo que suponía la premisa: una app desaparecida, una que excluye las imágenes de su propia función de IA según su propia versión, y una que nunca aceptó capturas. Y la pregunta sobre los metadatos resultó ser un consejo que todo mundo repite y que, según parece, nadie ha medido.
Nada de esto quiere decir que un modelo que lee tu captura sea poco confiable en el uso normal. El estudio más grande y más directo de aquí sigue midiendo que un modelo lee bien la mayor parte del texto de escena en inglés. Quiere decir que la afirmación puntual, que un modelo con capacidades de visión lee una captura de chat tan confiablemente como lee texto escrito normal, tiene excepciones reales y medidas con números, algunas grandes, y varios casos difíciles que nadie ha medido para nada.
Así están las cosas hoy. Subtext es una app más que hace esto, ni más ni menos comprobada que el resto de arriba.
Prueba Subtext en tu navegadorEscanéalo con la cámara de tu celular para instalar.Prueba Subtext en tu navegador
Revisado el 27 de septiembre de 2026.
Fuentes
- Shi, Peng, Liao, Lin, Chen, Liu, Zhang y Jin (2023). Exploring OCR Capabilities of GPT-4V(ision): A Quantitative and In-depth Evaluation. arXiv. Benchmarks de OCR de texto de escena y de documentos contra una sola generación de modelo de 2023, no capturas de mensajería.
- Inoue (2025). Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity. Preprint de arXiv, un solo autor. Prueba 100 caracteres kanji japoneses sueltos, a tamaño de fuente y resolución controlados, no capturas de chats.
- Miller Hillberg, Levonian, Kluver, Terveen y Hecht (2018). What I See is What You Don’t Get: The Effects of (Not) Seeing Emoji Rendering Differences across Platforms. Proceedings of the ACM on Human-Computer Interaction, CSCW. Encuesta a 710 usuarios de Twitter sobre sus propios tuits con emoji, no una prueba de un modelo leyéndolos.
- Tardelli, Alvisi, Cima, Cresci y Tesconi (2025). Emoji Reactions on Telegram: Unreliable Indicators of Emotional Resonance. Preprint de arXiv. Más de 650,000 reacciones en mensajes de Telegram relacionados con criptomonedas, una sola plataforma y un solo tema.
- Heath, MacDermott y Akinbi (2023). Forensic analysis of ephemeral messaging applications: Disappearing messages or evidential data? Forensic Science International: Digital Investigation. Prueba el comportamiento propio de borrado de WhatsApp, Snapchat y Telegram, no la lectura de una captura por parte de una IA.
- Tang, Hew, Herring y Chen (2021). (Mis)communication through stickers in online group discussions: A multiple-case study. Discourse & Communication. Cinco grupos de discusión y siete personas entrevistadas en una universidad; mide la mala lectura humana, no la de un modelo.
- Sheth, Sinha, Patil, Beniwal y Singh (2025). Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities. Encuesta en preprint de arXiv, sin prueba específica sobre capturas.
- Apple. iTunes Lookup API result for Keys AI Texting Coach, app id 1510154956, revisado el 27 de septiembre de 2026. Regresa cero resultados; la app ya no parece estar en el listado.
- Mei. Terms of Service and Privacy Policy, modificados por última vez el 3 de octubre de 2023, revisados el 27 de septiembre de 2026.
- ConfiText. Privacy Policy, vigente desde el 10 de febrero de 2026, revisada el 27 de septiembre de 2026.