ArtigosFerramentas de escrita

A IA consegue adivinhar como a tua mensagem soa. Não consegue saber o que sentes de facto.

Os números de precisão, o motivo por que até humanos treinados discordam entre si, e a nova lei da UE que trata o texto de forma diferente da tua cara ou da tua voz.

Por Samet Durgun · Cofundador da Subtext · 13 min de leitura

Ajudo a construir o Subtext, uma app que ajuda as pessoas a ler mensagens e a decidir como responder. Por isso tinha uma razão nada desinteressada para escarafunchar a investigação sobre deteção de tom por IA: os benchmarks, os artigos da ACL, as críticas da psicologia e a lei da UE que agora proíbe parte deste campo. Pondera bem isto. Cada afirmação que se segue tem uma ligação para a fonte, para que possas verificar o meu trabalho e não confies só em mim.

A IA de hoje é boa a prever como uma mensagem pode soar a quem a lê. Não tem forma fiável de saber o que quem escreveu sente de facto. Tudo o que se segue é o detalhe do que separa estas duas frases.

“Deteção de tom” são cinco tarefas diferentes

A expressão soa a uma única funcionalidade. Por baixo, cobre problemas distintos que ficam mais difíceis à medida que desces a lista.

O sentimento é o fácil. Pergunta se um texto é positivo, negativo ou neutro. Todos os grandes fornecedores de cloud o vendem. A API da Google1 devolve uma pontuação entre menos um e mais um, com uma magnitude para a intensidade emocional, o Amazon Comprehend2 classifica o texto em positivo, negativo, neutro ou misto, e o serviço Azure da Microsoft3 junta mineração de opinião ao nível do aspeto, para que uma frase como “a app é ótima mas o suporte foi péssimo” seja dividida corretamente em vez de reduzida a uma média sem sentido.

A deteção de emoção, o passo seguinte, cobre raiva, alegria, medo, tristeza e as muitas primas destas. Mais difícil, como os números vão mostrar.

O tom interpessoal é o que interessa quando escreves ao teu senhorio. Isto soa caloroso, direto, defensivo, acusatório. Já havia investigadores a modelar frustração, formalidade e cortesia em emails de trabalho em 20184, e funcionava razoavelmente bem porque tratavam estas dimensões em separado em vez de as espremerem numa única etiqueta de emoção.

Depois vêm o sarcasmo e o subtexto, que dependem mais do contexto do que das palavras. No fundo está o estado emocional privado de quem escreveu, que é exatamente aquilo que a maior parte do marketing insinua e que a investigação menos sustenta.

Por isso, quando uma página de produto diz que “deteta o tom”, e a maioria dos verificadores de tom nunca verifica o teu tom, a minha primeira pergunta é a qual destas cinco coisas se refere. O Subtext vive nessa terceira categoria, o tom interpessoal, que pergunta se uma mensagem soa calorosa, direta, defensiva ou acusatória para quem a recebe. Isso não é uma pontuação de sentimento nem uma afirmação sobre os sentimentos privados de ninguém.

Os números de precisão que nunca chegam à página de vendas

O dataset de referência para emoção detalhada em texto é o GoEmotions5 da Google: 58.000 comentários do Reddit que a equipa de Demszky etiquetou à mão com 27 emoções mais neutro e apresentou na ACL em 2020. O seu modelo base BERT obteve um F1 macro de 0,46 no conjunto completo de etiquetas. Trabalho posterior6 com modelos mais fortes e truques de dados empurrou isso para algo entre 0,49 e 0,51. Anos de progresso, e os melhores modelos especializados continuam a falhar uma boa fatia das etiquetas finas.

Pede a um chatbot generalista para fazer a mesma classificação em 28 categorias e a sua pontuação no benchmark cai bem abaixo dos modelos pequenos afinados para o efeito, em parte porque os modelos de resposta livre inventam etiquetas fora da taxonomia e não se calibram aos limiares do teste. O que parece condenatório até se descobrir que, num estudo de 20257, juízes humanos frequentemente preferiram as etiquetas do GPT-4 às oficiais do dataset. Às vezes o modelo discorda do benchmark porque é o benchmark que está mais fraco.

A classificação grosseira entre positivo e negativo pontua muito mais alto em todos os testes. O colapso acontece exatamente onde vivem as distinções interessantes, como aborrecimento versus raiva ou desilusão versus desaprovação.

Os humanos também discordam sobre tom

A parte que me fez repensar o tema todo é o que acontece quando se verificam os humanos. O apêndice do artigo do GoEmotions reporta a concordância entre os seus próprios etiquetadores humanos, e para a maioria das emoções o kappa de Cohen fica entre cerca de 0,1 e 0,5. A gratidão é fácil, com 0,75. O luto fica em 0,09, quase equivalente a etiquetar ao acaso. Quando humanos treinados a ler a mesma frase não conseguem concordar se ela expressa desilusão ou desaprovação, um modelo com 0,46 de F1 macro contra essas etiquetas está a ser avaliado com uma grelha de correção que é frouxa precisamente nesses pontos. O kappa e o F1 medem coisas diferentes, por isso o valor humano não é um teto rígido, mas mostra que parte da falha do modelo pertence à própria tarefa.

Kappa de Cohen, os próprios etiquetadores humanos do GoEmotions Gratidão: 0,75. Luto: 0,09, quase equivalente a etiquetar ao acaso.

Um kappa de 1,0 é concordância perfeita, 0 é ao acaso. Quando humanos treinados não conseguem concordar se uma frase é desilusão ou desaprovação, os 0,46 de F1 macro de um modelo estão a ser avaliados com uma grelha de correção que é frouxa precisamente nesses pontos.

E vai mais fundo. De quem é o sentimento que estamos sequer a medir? Um dataset chamado EmoBank8 anotou as mesmas frases duas vezes, uma a partir da perspetiva de quem escreveu, outra a partir da perspetiva de quem lê, porque estas acabam por ser variáveis diferentes. Os mesmos investigadores descobriram em 2017 que anotar a partir da perspetiva de quem escreveu produzia melhor qualidade no geral. E a grande tarefa de emoção do SemEval 20259, que cobriu mais de 30 idiomas de sete famílias linguísticas, visa deliberadamente a emoção percebida, ou seja, o que um leitor comum atribuiria ao texto e explicitamente não o que a pessoa que escreveu sentiu por dentro.

O teste mais afiado veio em 2025. Um estudo da ACL10 pediu a autores que etiquetassem as suas próprias emoções, e depois pôs humanos externos e LLMs a adivinhar. Ambos ficaram aquém dos relatos dos próprios autores, e os LLMs superaram os desconhecidos humanos em quase tudo. Cada metade desta conclusão importa. A IA já é melhor do que uma pessoa qualquer a ler-te só a partir do texto, e continua incapaz de reconstruir de forma fiável o que sentiste. O Subtext foi construído para a metade desta descoberta que se mantém. Lê como a tua mensagem é provável ser recebida, não o que sentiste enquanto a escrevias.

Uma consequência prática vê-se numa comparação de 2023 na Heliyon11, que correu oito APIs comerciais de emoção sobre os mesmos datasets e encontrou-as em desacordo umas com as outras, com classificações que mudavam de dataset para dataset. Qualquer fornecedor que anuncie “95 por cento de precisão na deteção de emoção” sem nomear as etiquetas, os dados e o idioma está a citar um número que não aguenta o peso da afirmação.

Os modelos arrasam em testes de emoção e ainda assim falham a pessoa

Dois resultados de investigação parecem contraditórios até se separar o que cada um mede.

Num estudo de 2025 na Communications Psychology12, seis modelos, incluindo o ChatGPT-4, o Gemini 1.5 Flash, o Claude 3.5 Haiku e o DeepSeek V3, fizeram cinco testes padrão de inteligência emocional, do tipo usado para avaliar humanos. Os modelos tiveram em média 81 por cento de acertos, contra os 56 por cento da média humana nos estudos de validação desses testes. Na Nature Human Behaviour13, o GPT-4 igualou ou superou humanos em tarefas clássicas de teoria da mente, como identificar crenças falsas e pedidos indiretos, embora tenha tropeçado a reconhecer gafes sociais. E na JAMA Internal Medicine14, avaliadores licenciados leram respostas a perguntas reais de pacientes e preferiram as do chatbot às dos médicos em 78,6 por cento dos casos, considerando-as 9,8 vezes mais propensas a ser empáticas. Guardo uma ressalva. As respostas do chatbot tinham em média 211 palavras contra as 52 dos médicos, e a preferência encolhia quando os médicos escreviam mais. Para pessoas, se a inteligência emocional realmente importa no trabalho é uma questão à parte.

Entretanto, o EmoBench15, um benchmark construído para exigir raciocínio emocional em vez de mera memorização de padrões, continua a encontrar um fosso claro entre modelos e a média humana.

As duas conclusões podem ser ambas verdadeiras porque saber sobre emoções e saber a emoção de alguém são competências diferentes. Um modelo leu mais sobre ciúme, luto e pedidos de desculpa constrangedores no trabalho do que qualquer humano vivo. O que lhe falta é contexto sobre a pessoa concreta que escreveu esta mensagem específica.

Quatro pessoas podem escrever as mesmas palavras: “Parabéns. Estou feliz por ti.” Uma quer mesmo dizer isso. Outra tem inveja. Uma terceira está destroçada e a fazer-se de forte. A quarta está a ser sarcástica. Todas as versões são idênticas no ecrã, por isso nenhum modelo de texto as consegue separar, e nenhum desconhecido humano conseguiria também. Essa informação vive fora das palavras.

O contexto faz a maior parte do trabalho

Pega na resposta “Tudo bem.”

Sozinha, pode ser concordância, desilusão, irritação, indiferença ou uma porta a fechar-se em silêncio. Coloca-a depois de “já adiaste o prazo pela terceira vez” e a leitura estreita-se rapidamente. Nada na palavra mudou. O contexto mudou.

A investigação sobre sarcasmo chega sempre à mesma conclusão, a de que até os humanos precisam muitas vezes da conversa à volta para saber se um texto é sarcástico1617, razão pela qual as avaliações mais recentes testam os modelos em diálogos inteiros e não em frases isoladas. A regra prática que retiro disto para qualquer ferramenta de tom decorre diretamente. Dá-lhe a conversa, a relação e o que está em jogo. Julgar uma única mensagem isolada é pedir ao modelo que falhe com educação. É também por isto que o Subtext lê a conversa toda em vez de só uma linha, porque a maior parte da leitura vive no contexto, não nas palavras que estão lá escritas.

O tom é cultural, e a maioria dos modelos cresceu a ler inglês americano

Um benchmark de 2025 chamado BESSTIE18 testou modelos em sentimento e sarcasmo em inglês australiano, britânico e indiano. O desempenho foi consistentemente pior em inglês indiano, com o sarcasmo a ser o caso mais difícil, e os modelos tiveram dificuldade em generalizar de uma variante para outra.

Esse resultado bate certo com a experiência do dia a dia. “Kindly do the needful” lê-se de uma forma em inglês profissional indiano e de outra a um modelo calibrado nas normas de escritório americanas. Depois de 13 anos em Berlim, posso acrescentar a versão alemã. A franqueza que aqui conta como respeito pelo teu tempo pode ser assinalada como fria por software criado à imagem da cortesia americana. Etiquetas como rude, caloroso ou demasiado direto são juízos culturais disfarçados de objetivos. Uma ferramenta de tom que ignora quem escreve a quem, e em que cultura, vai ler mal ambos os lados com toda a confiança.

Surge um viés relacionado na moderação de conteúdo, uma tarefa diferente da pontuação de sentimento. Sap e colegas analisaram datasets de discurso de ódio muito usados19 e descobriram que tweets escritos em inglês afro-americano, por vezes chamado African American Vernacular English ou AAVE, eram classificados como ofensivos por classificadores treinados com uma frequência até duas vezes maior do que tweets equivalentes noutras variantes, sem que os anotadores alguma vez vissem quem os tinha escrito. A falha está no classificador de toxicidade, não no de sentimento, por isso um benchmark como o BESSTIE não a revelaria. Um sistema de moderação treinado com esses dados assinala formulações comuns em AAVE como ofensivas com mais frequência do que a mesma mensagem dita de outra forma.

A leitura facial é onde a IA de emoções descarrilou

Tudo o que li acima diz respeito a texto. O ramo desta indústria dedicado à leitura de rostos tem um histórico bem mais acidentado, e é isso que molda a forma como os reguladores tratam agora a categoria inteira.

Em 2019, a psicóloga Lisa Feldman Barrett e colegas reviram mais de mil estudos20 e concluíram que não se pode inferir de forma fiável como alguém se sente a partir dos seus movimentos faciais. As pessoas franzem a testa quando se concentram, sorriem quando estão ansiosas, choram em casamentos. No mesmo ano, um estudo passou fotografias de 400 jogadores da NBA por dois sistemas comerciais e descobriu que ambos liam mais emoção negativa nos rostos dos jogadores negros21 do que nos dos jogadores brancos com expressões semelhantes.

A indústria reparou. A Microsoft retirou a inferência de emoção da sua Face API22 em 2022. A HireVue abandonou a análise facial nas suas avaliações de contratação em 2021, depois de o grupo de direitos digitais EPIC ter apresentado queixa junto da FTC23. As ferramentas de texto são uma tecnologia diferente, mas herdam este ceticismo, e merecem-no sempre que afirmam ler estados internos em vez de escolhas de palavras.

A UE traçou uma linha, e o texto ficou de fora

Desde 2 de fevereiro de 2025, o artigo 5(1)(f)24 da Lei da IA da UE proíbe IA que infira as emoções das pessoas em locais de trabalho e escolas, com exceções restritas para usos médicos e de segurança, como a deteção de fadiga ao volante. Violar as práticas proibidas acarreta coimas até 7 por cento do volume de negócios anual global.

O alcance da lei importa para quem constrói ou usa este tipo de ferramentas. As orientações da Comissão Europeia ligam a proibição a dados biométricos25: rostos, vozes, dinâmica de digitação, postura corporal. Um sistema que infere emoções a partir de texto escrito fica explicitamente fora da proibição26. Analisar como um email pode soar é legal. Apontar uma webcam a funcionários para avaliar o seu humor é proibido. Essa linha acompanha bastante bem a ciência, e para o Subtext traduz-se numa restrição de desenho que teríamos escolhido de qualquer forma: só texto, sem biometria, sem vigilância no local de trabalho.

Para que servem as ferramentas de hoje

O detetor de tom27 da Grammarly é o exemplo mais claro ao nível do consumidor, e o seu enquadramento é o mais direto do mercado. Analisa escolha de palavras, formulação, pontuação e uso de maiúsculas27 para dizer como a tua mensagem é provável soar a um leitor, entre mais de 40 tons. Provável soar. Essa formulação está a fazer trabalho científico a sério.

As APIs de cloud da Google, Amazon, Microsoft e IBM28 estão feitas para processar tickets de suporte, avaliações e respostas a inquéritos em volume. A IBM reformou o seu Tone Analyzer autónomo em 2023 e absorveu a emoção num produto de linguagem mais amplo. São as ferramentas certas para “como é que os clientes se sentem em relação ao nosso checkout” e as ferramentas erradas para “esta mensagem soa passivo-agressiva”.

Os LLMs generalistas são a opção mais capaz para mensagens pessoais porque conseguem usar contexto, lidar com vários tons ao mesmo tempo e explicar a sua leitura. São também os pior calibrados, por isso trata qualquer percentagem de confiança como uma sensação e nada mais. Do lado da voz, a Hume AI29 angariou uma Série B de 50 milhões de dólares em 2024 para medir a modulação vocal, sobretudo para que interfaces de voz respondam com o ritmo e o tom certos. Um uso mais estreito, e mais defensável do que afirmar detetar sentimentos escondidos.

Como isto molda o Subtext

O Subtext analisa as mensagens com que as pessoas mais se importam, como o texto do teu chefe, do teu date ou da tua mãe. Deixo que a investigação defina como isso devia funcionar.

O resultado tem de ser sobre perceção. “Isto pode soar a desdém” é uma afirmação que a evidência sustenta. “Ela está zangada contigo” é uma afirmação que não sustenta, e o estudo da ACL com relatos em primeira pessoa é a prova disso. Também deixamos que uma mensagem carregue vários tons ao mesmo tempo, porque as mensagens reais fazem isso. Caloroso e defensivo ao mesmo tempo é uma combinação normal, e os benchmarks mais recentes tratam a emoção como multirrótulo exatamente por essa razão.

Evidência vale mais do que veredito. Uma ferramenta útil aponta para as palavras que criam uma impressão, da forma como “como já expliquei” faz discretamente o trabalho pesado num email tenso, para que decidas se essa é a impressão que queres deixar. A incerteza também fica visível. Quando uma mensagem é ambígua, essa ambiguidade costuma ser a descoberta mais precisa, e arredondá-la numa etiqueta confiante seria uma falsa precisão. O contexto vem primeiro. Preferimos ler a conversa toda e perguntar quem é o destinatário do que avaliar uma frase a flutuar no vazio, porque as mesmas nove palavras significam coisas diferentes para um chefe e para alguém com quem estás numa situação por definir.

A minha leitura é que esta categoria é mais pequena do que os pitch decks e mais útil do que os céticos admitem. Ler mentes continua fora de alcance. Ler palavras já está disponível hoje, e a maior parte dos danos na comunicação escrita começa precisamente aí. Isso pareceu-me razão suficiente para construir.

Na prática, colas o teu rascunho ou tiras uma foto da conversa, e o Subtext diz o que a tua mensagem é provável sinalizar, aponta as palavras que criam essa impressão e oferece versões que ainda soam como tu. Experimentar o Subtext no browserExperimentar o Subtext no browser


Trabalhas numa destas ferramentas e achas que li mal o teu benchmark? Diz-me no LinkedIn.

Samet Durgun é cofundador do Subtext, uma app que apanha o tom emocional das tuas mensagens e as reescreve na tua voz. Vive em Berlim.


Fontes

Todos os links acima levam à fonte primária onde ela existe, numerados pela ordem em que aparecem. Duas entradas são citadas sem link porque não consegui confirmar um URL estável para elas, e as duas últimas são leitura adicional, não afirmações feitas acima.

  1. Google Cloud. Natural Language API basics: sentiment score and magnitude.
  2. AWS. Amazon Comprehend: sentiment analysis.
  3. Microsoft. Azure Language: sentiment analysis and opinion mining.
  4. Chhaya et al. (2018). Frustrated, Polite, or Formal: Quantifying Feelings and Tone in Email. PEOPLES Workshop, NAACL 2018.
  5. Demszky et al. (2020). GoEmotions: A Dataset of Fine-Grained Emotions. ACL 2020.
  6. Wang et al. (2024). Large Language Models on Fine-grained Emotion Detection Dataset with Data Augmentation and Transfer Learning. arXiv.
  7. Rethinking Emotion Annotations in the Era of Large Language Models (2025).
  8. Buechel and Hahn (2017). EmoBank, corpus anotado a partir da perspetiva de quem escreve e de quem lê, e “Readers vs. Writers vs. Texts,” Linguistic Annotation Workshop 2017.
  9. Muhammad et al. (2025). SemEval-2025 Task 11: Bridging the Gap in Text-Based Emotion Detection. SemEval 2025.
  10. Li et al. (2025). Can Third Parties Read Our Emotions? ACL 2025.
  11. Abu-Salih et al. (2023). Emotion detection of social data: APIs comparative study. Heliyon.
  12. Schlegel, Sommer, and Mortillaro (2025). Large language models are proficient in solving and creating emotional intelligence tests. Communications Psychology.
  13. Strachan et al. (2024). Testing theory of mind in large language models and humans. Nature Human Behaviour.
  14. Ayers et al. (2023). Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum. JAMA Internal Medicine.
  15. Sabour et al. (2024). EmoBench: Evaluating the Emotional Intelligence of Large Language Models. ACL 2024.
  16. Feng et al. (2024). Affect Recognition in Conversations Using Large Language Models. SIGDIAL 2024.
  17. Hazarika et al. (2018). CASCADE: Contextual Sarcasm Detection in Online Discussion Forums. COLING 2018.
  18. Srirag et al. (2025). BESSTIE: A Benchmark for Sentiment and Sarcasm Classification for Varieties of English. Findings of ACL 2025.
  19. Sap et al. (2019). The Risk of Racial Bias in Hate Speech Detection. ACL 2019.
  20. Barrett et al. (2019). Emotional Expressions Reconsidered: Challenges to Inferring Emotion From Human Facial Movements. Psychological Science in the Public Interest.
  21. Rhue (2019). Racial Influence on Automated Perceptions of Emotions. SSRN working paper.
  22. Microsoft (2022). Framework for building AI systems responsibly, a anunciar a retirada da inferência de emoção na Face API.
  23. EPIC. In re HireVue, FTC complaint (2019).
  24. EU AI Act, Article 5: Prohibited AI Practices, em vigor desde 2 de fevereiro de 2025.
  25. Lewis Silkin (2025). Understanding the EU AI Act’s prohibited practices, on the Commission’s February 2025 guidelines.
  26. Future of Privacy Forum (2026). Red Lines under the EU AI Act: the prohibition of emotion recognition in the workplace and education.
  27. Grammarly. Tone detector product page and how the tone detector works.
  28. IBM. Watson Natural Language Understanding.
  29. Hume AI.
  30. Northeastern University (2021). You can’t determine emotion from someone’s facial movements, and neither can AI.
  31. The Guardian (2024). Are you 80% angry and 2% sad? Why “emotional AI” is fraught with problems.