ArtículosHerramientas de escritura

La IA puede adivinar cómo suena tu mensaje. No sabe qué sientes en realidad.

Los números de precisión, por qué hasta los humanos entrenados discrepan entre sí, y la nueva ley de la UE que trata el texto distinto a tu cara o tu voz.

Por Samet Durgun · Cofundador de Subtext · 14 min de lectura

Soy uno de los que construye Subtext, una app que ayuda a la gente a leer mensajes y a decidir cómo responder. Así que tenía una razón egoísta para meterme de lleno en la investigación sobre detección de tono con IA: los benchmarks, los papers de ACL, las críticas desde la psicología y la ley de la UE que ahora prohíbe parte de este campo. Pondera mi interés en consecuencia. Cada afirmación de abajo está enlazada a su fuente, así que puedes verificar mi lectura en lugar de confiar en lo que digo.

La IA de hoy es buena para predecir cómo le puede caer un mensaje a quien lo lee. No tiene ninguna forma confiable de saber qué siente quien lo escribió. Todo lo que sigue es el detalle de la brecha entre esas dos frases.

La detección de tono es en realidad cinco tareas distintas

La frase suena a una sola función. Por dentro cubre problemas distintos que se ponen más difíciles a medida que bajas por la lista.

El sentimiento es lo fácil. Pregunta si un texto es positivo, negativo o neutral. Todos los proveedores grandes de nube lo venden. La API de Google1 devuelve un puntaje de menos uno a más uno, junto con una magnitud para la intensidad emocional; Amazon Comprehend2 clasifica el texto en positivo, negativo, neutral o mixto; y el servicio Azure de Microsoft3 le suma minería de opinión a nivel de aspecto, así que una frase como “la app está increíble pero el soporte fue pésimo” se divide correctamente en vez de promediarse hasta volverse papilla.

La detección de emociones, el siguiente escalón, cubre el enojo, la alegría, el miedo, la tristeza y sus muchos primos. Más difícil, como van a mostrar los números.

El tono interpersonal es lo que te importa cuando le escribes a tu casero. Esto suena cálido, directo, a la defensiva, acusador. Ya había investigadores modelando la frustración, la formalidad y la cortesía en correos de trabajo desde 20184, y funcionó razonablemente bien porque trataron esto como dimensiones separadas en vez de una sola etiqueta de emoción.

Luego vienen el sarcasmo y el subtexto, que dependen más del contexto que de las palabras. Hasta abajo está el estado emocional privado de quien escribe, que es justo lo que más insinúa el marketing y lo que menos respalda la investigación.

Así que cuando una página de producto dice que detecta el tono, y la mayoría de los verificadores de tono nunca verifican tu tono, mi primera pregunta es a cuál de estas cinco se refiere. Subtext vive en ese tercer grupo, el tono interpersonal, que pregunta si un mensaje se lee cálido, directo, a la defensiva o acusador para la persona que lo recibe. No es un puntaje de sentimiento ni una afirmación sobre los sentimientos privados de nadie.

Los números de precisión que nunca llegan a la página de ventas

El dataset de referencia para emoción fina en texto es GoEmotions5, de Google: 58,000 comentarios de Reddit que el equipo de Demszky etiquetó a mano con 27 emociones más neutral y presentó en ACL en 2020. Su modelo base BERT sacó un F1 macro de 0.46 en el conjunto completo de etiquetas. Trabajo posterior6, con modelos más fuertes y trucos de datos, lo subió a algo así como 0.49 a 0.51. Años de avances, y los mejores modelos especializados todavía se equivocan en buena parte de las etiquetas finas.

Pídele a un chatbot general que haga la misma clasificación entre 28 opciones, y su puntaje en el benchmark cae bien por debajo de los modelos chicos afinados para la tarea, en parte porque los modelos de forma libre inventan etiquetas fuera de la taxonomía y no calibran con los umbrales de la prueba. Suena condenatorio hasta que te enteras de que en un estudio de 20257, los jueces humanos muchas veces se pusieron del lado de las etiquetas de GPT-4 en vez de las oficiales del dataset. A veces el modelo no está de acuerdo con el benchmark porque el benchmark es la parte más débil.

La clasificación gruesa de positivo contra negativo saca puntajes mucho más altos en general. El desplome pasa justo donde viven las distinciones interesantes, como fastidio contra enojo o decepción contra desaprobación.

Los humanos también discrepan sobre el tono

La parte que me cambió por completo la forma de ver el tema es lo que pasa cuando revisas a los humanos. El apéndice del paper de GoEmotions reporta el acuerdo entre sus propios etiquetadores humanos, y para la mayoría de las emociones la kappa de Cohen anda entre 0.1 y 0.5, más o menos. La gratitud es fácil, con 0.75. El duelo cae en 0.09, casi como etiquetar al azar. Cuando humanos entrenados que leen la misma frase no logran ponerse de acuerdo en si expresa decepción o desaprobación, un modelo que saca un F1 macro de 0.46 contra sus etiquetas está siendo calificado con unas respuestas correctas que fallan justo en esos puntos. La kappa y el F1 miden cosas distintas, así que la cifra humana no es un techo estricto, pero te dice que parte del error del modelo viene de la tarea misma.

La kappa de Cohen, entre los propios etiquetadores humanos de GoEmotions Gratitud: 0.75. Duelo: 0.09, casi como etiquetar al azar.

Una kappa de 1.0 es acuerdo perfecto, 0 es azar. Cuando humanos entrenados no logran ponerse de acuerdo en si una frase es decepción o desaprobación, el F1 macro de 0.46 de un modelo se está calificando con unas respuestas correctas que fallan justo en esos puntos.

Y va más hondo todavía. ¿De quién es en realidad el sentimiento que estamos midiendo? Un dataset llamado EmoBank8 anotó las mismas frases dos veces, una desde la perspectiva de quien escribe y otra desde la de quien lee, porque resultan ser variables distintas. Los mismos investigadores encontraron en 2017 que anotar desde la perspectiva de quien escribe daba mejor calidad en general. Y la gran tarea de emoción de SemEval 20259, que cubrió más de 30 idiomas de siete familias lingüísticas, apunta a propósito a la emoción percibida, es decir, lo que un lector cualquiera le atribuiría al texto y explícitamente no lo que sintió por dentro quien lo escribió.

La prueba más contundente llegó en 2025. Un estudio de ACL10 les pidió a los autores que etiquetaran sus propias emociones, y luego dejó que humanos ajenos y LLMs adivinaran. Los dos se quedaron cortos frente a lo que reportaban los propios autores, y los LLMs le ganaron a los humanos desconocidos casi en todo. Las dos mitades de ese hallazgo importan. Hoy la IA lee mejor que una persona cualquiera a partir solo del texto, y aun así no logra reconstruir de forma confiable lo que sentiste. Subtext está construido para la mitad de ese hallazgo que sí se sostiene. Lee cómo es probable que suene tu mensaje, no lo que sentías cuando lo escribiste.

Una consecuencia práctica aparece en una comparación de 2023 en Heliyon11, que corrió ocho APIs comerciales de emoción sobre los mismos datasets y encontró que no coincidían entre sí, con rankings que cambiaban de un dataset a otro. Cualquier proveedor que presuma “95 por ciento de precisión en detección de emociones” sin decir qué etiquetas, qué datos y qué idioma usó, está presumiendo un número que no aguanta el peso de la afirmación.

Los modelos pasan las pruebas de emoción y aun así no captan a la persona

Dos resultados de investigación parecen contradecirse hasta que separas qué está midiendo cada uno.

En un estudio de 2025 en Communications Psychology12, seis modelos (entre ellos ChatGPT-4, Gemini 1.5 Flash, Claude 3.5 Haiku y DeepSeek V3) presentaron cinco pruebas estándar de inteligencia emocional, del tipo que se usa para evaluar humanos. Los modelos promediaron 81 por ciento de aciertos, contra el 56 por ciento que promedian los humanos en los estudios de validación de esas mismas pruebas. En Nature Human Behaviour13, GPT-4 igualó o superó a los humanos en tareas clásicas de teoría de la mente, como detectar creencias falsas y peticiones indirectas, aunque tropezó al reconocer meteduras de pata sociales. Y en JAMA Internal Medicine14, evaluadores con licencia médica leyeron respuestas a preguntas reales de pacientes y prefirieron las del chatbot sobre las de los médicos el 78.6 por ciento de las veces, calificándolas como 9.8 veces más propensas a sonar empáticas. Yo tendría en cuenta una salvedad. Las respuestas del chatbot promediaron 211 palabras contra 52 de los médicos, y la preferencia se achicaba cuando los doctores escribían más largo. Para las personas, si la inteligencia emocional realmente importa en el trabajo es una pregunta aparte.

Mientras tanto, EmoBench15, un benchmark construido para exigir razonamiento emocional y no solo reconocimiento de patrones, todavía encuentra una brecha clara entre los modelos y el humano promedio.

Los dos hallazgos pueden ser ciertos a la vez, porque saber sobre las emociones y saber la emoción de alguien son habilidades distintas. Un modelo ha leído más sobre celos, duelo y disculpas incómodas de oficina que cualquier humano vivo. Lo que le falta es contexto sobre esa persona en particular que escribió justo este mensaje.

Cuatro personas pueden escribir exactamente las mismas palabras: “Felicidades. Me da mucho gusto por ti.” Una lo dice en serio. Otra te guarda rencor. Una tercera está destrozada y haciendo de tripas corazón. La cuarta está siendo sarcástica. Las cuatro versiones son idénticas en la pantalla, así que ningún modelo de texto las puede distinguir, y tampoco podría un humano desconocido. Esa información vive fuera de las palabras.

El contexto hace casi todo el trabajo

Toma la respuesta “Bien.”

Sola, puede ser acuerdo, decepción, irritación, indiferencia o una puerta que se cierra despacito. Ponla después de “Ya moviste la fecha límite por tercera vez” y la lectura se cierra rápido. La palabra no cambió en nada. El contexto sí.

La investigación sobre sarcasmo llega una y otra vez a la misma conclusión, la de que hasta los humanos muchas veces necesitan la conversación de alrededor para saber si un mensaje de texto es sarcástico1617, y por eso las evaluaciones más nuevas prueban a los modelos con diálogos completos en vez de frases sueltas. De ahí saco directo la regla práctica para cualquier herramienta de tono. Dale el hilo completo, la relación y lo que está en juego. Juzgar un solo mensaje aislado es pedirle al modelo que falle, pero con educación. Por eso Subtext toma el hilo completo en lugar de una sola línea, porque la mayor parte de la lectura vive en el contexto, no en las palabras que se están leyendo.

El tono es cultural, y la mayoría de los modelos creció con inglés estadounidense

Un benchmark de 2025 llamado BESSTIE18 probó a varios modelos en sentimiento y sarcasmo con inglés australiano, británico e indio. El desempeño fue consistentemente peor con el inglés indio, con el sarcasmo como el caso más difícil, y a los modelos les costó generalizar de una variante a otra.

Ese resultado coincide con la experiencia de todos los días. “Kindly do the needful” se lee de una forma en el inglés profesional indio y de otra muy distinta para un modelo calibrado con las normas de oficina estadounidenses. Después de 13 años en Berlín puedo agregar la versión alemana. La franqueza que aquí cuenta como respeto por tu tiempo puede salir marcada como fría por un software criado con la cortesía estadounidense. Etiquetas como grosero, cálido o demasiado directo son juicios culturales disfrazados de objetivos. Una herramienta de tono que ignora quién le escribe a quién, y en qué cultura, va a malinterpretar a los dos lados con toda confianza.

Un sesgo relacionado aparece en la moderación de contenido, una tarea distinta a la puntuación de sentimiento. Sap y colegas revisaron conjuntos de datos de discurso de odio muy usados19 y encontraron que los tuits escritos en inglés afroamericano, a veces llamado African American Vernacular English o AAVE, eran etiquetados como ofensivos por clasificadores entrenados hasta el doble de veces que tuits comparables en otras variantes, sin que quienes etiquetaban vieran nunca quién los había escrito. La brecha vive en el clasificador de toxicidad, no en el de sentimiento, así que un benchmark como BESSTIE no la sacaría a relucir. Un sistema de moderación entrenado con esos datos marca frases comunes en AAVE como ofensivas con más frecuencia que el mismo mensaje dicho de otra manera.

La lectura facial es donde la IA de emociones perdió el rumbo

Todo lo de arriba es sobre texto. La rama de esta industria que escanea caras tiene un historial mucho más accidentado, y eso moldea cómo los reguladores tratan hoy a toda la categoría.

En 2019, la psicóloga Lisa Feldman Barrett y sus colegas revisaron más de mil estudios20 y concluyeron que no se puede inferir de forma confiable cómo se siente alguien a partir de sus movimientos faciales. La gente frunce el ceño cuando se concentra, sonríe cuando está ansiosa y llora en las bodas. Ese mismo año, un estudio pasó fotos de 400 jugadores de la NBA por dos sistemas comerciales y encontró que los dos leían más emoción negativa en las caras de los jugadores negros21 que en las de los jugadores blancos con expresiones parecidas.

La industria se dio cuenta. Microsoft retiró la inferencia de emociones de su Face API22 en 2022. HireVue eliminó el análisis facial de sus evaluaciones de contratación en 2021, después de que el grupo de derechos digitales EPIC presentara una queja ante la FTC23. Las herramientas de texto son otra tecnología, pero heredan este escepticismo, y se lo ganan cada vez que dicen leer estados internos en vez de solo palabras.

La UE trazó una línea, y el texto quedó fuera

Desde el 2 de febrero de 2025, el Artículo 5(1)(f)24 de la Ley de IA de la UE prohíbe la IA que infiere las emociones de las personas en el trabajo y en las escuelas, con excepciones puntuales para usos médicos y de seguridad, como detectar la fatiga de un conductor. Violar estas prácticas prohibidas trae multas de hasta 7 por ciento de la facturación anual global.

El alcance importa para cualquiera que construya o use estas herramientas. Los lineamientos de la Comisión Europea atan la prohibición a los datos biométricos25: caras, voces, dinámica de tecleo, postura corporal. Un sistema que infiere emociones a partir de texto escrito queda explícitamente fuera de la prohibición26. Analizar cómo puede caer un correo es legal. Apuntarle una webcam a los empleados para calificar su estado de ánimo está prohibido. Esa línea sigue bastante bien a la ciencia, y para Subtext se traduce en una restricción de diseño que de todos modos hubiéramos elegido: solo texto, nada de biometría, nada de vigilancia laboral.

Para qué sirven las herramientas de hoy

El detector de tono27 de Grammarly es el ejemplo de consumo más claro que hay, y su forma de plantearlo es la más directa del mercado. Analiza la elección de palabras, la redacción, la puntuación y el uso de mayúsculas27 para decirte cómo es probable que suene tu mensaje para quien lo lea, entre más de 40 tonos distintos. Es probable que suene. Esa forma de decirlo está haciendo un trabajo científico de verdad.

Las APIs en la nube de Google, Amazon, Microsoft e IBM28 están hechas para procesar tickets de soporte, reseñas y respuestas de encuestas en grandes volúmenes. IBM retiró su Tone Analyzer independiente en 2023 y metió la emoción dentro de su producto de lenguaje más amplio. Son la herramienta correcta para “¿cómo se sienten los clientes con nuestro proceso de pago?” y la herramienta equivocada para “¿mi mensaje suena pasivo-agresivo?”

Los LLMs generales son la opción más capaz para mensajes personales, porque pueden usar el contexto, manejar varios tonos a la vez y explicar su lectura. También son los peor calibrados, así que trata cualquier porcentaje de confianza como una sensación y no como un dato duro. Del lado de la voz, Hume AI29 levantó una Serie B de 50 millones de dólares en 2024 para medir la modulación vocal, sobre todo para que las interfaces de voz respondan con el ritmo y el tono adecuados. Un uso más acotado, y más defendible que decir que detectas sentimientos escondidos.

Cómo esto moldea a Subtext

Subtext analiza los mensajes que más le importan a la gente, como el texto de tu jefe, de tu cita o de tu mamá. Dejo que la investigación resuelva cómo debería funcionar eso.

El resultado tiene que ser sobre percepción. “Esto puede sonar desdeñoso” es una afirmación que la evidencia respalda. “Ella está enojada contigo” es una que no, y el estudio de ACL con reportes de primera mano es la prueba. También dejamos que un mensaje traiga varios tonos a la vez, porque los mensajes reales así son. Cálido y a la defensiva es una combinación normal, y los benchmarks más nuevos tratan la emoción como multietiqueta justo por esto.

La evidencia le gana al veredicto. Una herramienta útil señala las palabras que están creando una impresión, de la misma forma en que “como ya te expliqué” hace en silencio todo el trabajo pesado en un correo tenso, para que tú decidas si esa impresión es la que quieres dar. La incertidumbre también se queda visible. Cuando un mensaje es ambiguo, esa ambigüedad suele ser el hallazgo más preciso, y redondearla en una etiqueta segura de sí misma sería precisión falsa. El contexto va primero. Preferimos leer el hilo y preguntar quién es el destinatario, antes que calificar una frase flotando en el vacío, porque las mismas nueve palabras significan algo distinto viniendo de tu jefe que de alguien con quien andas sin ponerle nombre a la cosa.

En la práctica, pegas tu borrador o tomas captura del hilo, y Subtext te dice lo que tu mensaje probablemente está señalando, apunta a las palabras que crean esa impresión, y ofrece versiones que sigan sonando como tú. Prueba Subtext en tu navegadorPrueba Subtext en tu navegador

Mi lectura es que esta categoría es más chica que lo que prometen los pitch decks, y más útil de lo que admiten los escépticos. Leer la mente sigue fuera de alcance. Leer las palabras sí está disponible hoy, y de todos modos ahí es donde empieza casi todo el daño en la comunicación escrita. Me pareció razón suficiente para construirlo.


¿Trabajas en una de estas herramientas y crees que malinterpreté tu benchmark? Dímelo en LinkedIn.

Samet Durgun es cofundador de Subtext, una app que capta el tono emocional de tus mensajes y los reescribe con tu propia voz. Vive en Berlín.


Fuentes

Todos los enlaces de arriba llevan a la fuente primaria cuando existe, numerados en el orden en que aparecen. Dos entradas están citadas sin enlace porque no pude confirmar una URL estable para ellas, y las últimas dos son lectura adicional y no afirmaciones hechas arriba.

  1. Google Cloud. Natural Language API basics: sentiment score and magnitude.
  2. AWS. Amazon Comprehend: sentiment analysis.
  3. Microsoft. Azure Language: sentiment analysis and opinion mining.
  4. Chhaya et al. (2018). Frustrated, Polite, or Formal: Quantifying Feelings and Tone in Email. PEOPLES Workshop, NAACL 2018.
  5. Demszky et al. (2020). GoEmotions: A Dataset of Fine-Grained Emotions. ACL 2020.
  6. Wang et al. (2024). Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning. arXiv.
  7. Rethinking Emotion Annotations in the Era of Large Language Models (2025).
  8. Buechel and Hahn (2017). EmoBank, un corpus anotado tanto desde la perspectiva de quien escribe como desde la de quien lee, y “Readers vs. Writers vs. Texts,” Linguistic Annotation Workshop 2017.
  9. Muhammad et al. (2025). SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection. SemEval 2025.
  10. Li et al. (2025). Can Third Parties Read Our Emotions? ACL 2025.
  11. Abu-Salih et al. (2023). Emotion detection of social data: APIs comparative study. Heliyon.
  12. Schlegel, Sommer, and Mortillaro (2025). Large language models are proficient in solving and creating emotional intelligence tests. Communications Psychology.
  13. Strachan et al. (2024). Testing theory of mind in large language models and humans. Nature Human Behaviour.
  14. Ayers et al. (2023). Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum. JAMA Internal Medicine.
  15. Sabour et al. (2024). EmoBench: Evaluating the Emotional Intelligence of Large Language Models. ACL 2024.
  16. Feng et al. (2024). Affect Recognition in Conversations Using Large Language Models. SIGDIAL 2024.
  17. Hazarika et al. (2018). CASCADE: Contextual Sarcasm Detection in Online Discussion Forums. COLING 2018.
  18. Srirag et al. (2025). BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English. Findings of ACL 2025.
  19. Sap et al. (2019). The Risk of Racial Bias in Hate Speech Detection. ACL 2019.
  20. Barrett et al. (2019). Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements. Psychological Science in the Public Interest.
  21. Rhue (2019). Racial Influence on Automated Perceptions of Emotions. Documento de trabajo de SSRN.
  22. Microsoft (2022). Framework for building AI systems responsibly, en el que anuncia el retiro de la inferencia de emociones de la Face API.
  23. EPIC. In re HireVue, FTC complaint (2019).
  24. Ley de IA de la UE, Article 5: Prohibited AI Practices, vigente desde el 2 de febrero de 2025.
  25. Lewis Silkin (2025). Understanding the EU AI Act’s prohibited practices, on the Commission’s February 2025 guidelines.
  26. Future of Privacy Forum (2026). Red Lines under the EU AI Act: the prohibition of emotion recognition in the workplace and education.
  27. Grammarly. Página de producto del detector de tono y cómo funciona el detector de tono.
  28. IBM. Watson Natural Language Understanding.
  29. Hume AI.
  30. Northeastern University (2021). You can’t determine emotion from someone’s facial movements, and neither can AI.
  31. The Guardian (2024). Are you 80% angry and 2% sad? Why “emotional AI” is fraught with problems.