ArtigosFerramentas de escrita

Reescritores de IA para mensagens realmente funcionam?

Quatro grupos de ferramentas e quatorze estudos sobre o que acontece de verdade quando a IA escreve a sua mensagem, e o que ajuda nos quinze segundos antes de enviar.

Por Samet Durgun · Cofundador da Subtext · 16 min de leitura

Passei algumas semanas lendo tudo que encontrei sobre ferramentas de IA que reescrevem mensagens pessoais, em parte porque estou construindo uma, e em parte porque queria saber se aquilo em que acredito sobre elas é verdade.

O que eu acredito é isto: quando você entrega uma mensagem difícil para uma IA, o momento útil não é a versão polida que ela devolve. O momento útil é trinta segundos antes, quando algo te avisa que a mensagem que você já escreveu vai cair mal, e por quê.

Então fui procurar uma ferramenta que fizesse isso. Não encontrei nenhuma pronta, e essa é, mais ou menos, a razão de termos acabado construindo o Subtext. Me trate como parcial por causa disso, e confira os artigos. Depois fui atrás da pesquisa sobre o que acontece quando as pessoas deixam a IA escrever as próprias mensagens pessoais, e isso acabou sendo bem mais interessante do que os produtos.

O que segue é o que encontrei, com tudo linkado para você conferir.


A maioria dos produtos dessa categoria faz exatamente a mesma coisa

Se você ignorar quantos downloads elas têm e organizar essas ferramentas pelo que elas fazem, elas caem em quatro grupos, e a maioria deles termina no mesmo lugar.

Grupo um são as ferramentas embutidas no seu celular. As Ferramentas de Escrita da Apple Intelligence1 rodam no sistema inteiro a partir do iOS 18.1. Você seleciona um texto e recebe Revisar, Reescrever em três tons (Amigável, Profissional, Conciso) e Compor, que passa o pedido para o ChatGPT. Grátis se o seu aparelho suportar, ou seja, iPhone 15 Pro em diante. O Samsung Writing Assist2 faz o mesmo trabalho na One UI, com troca de tom, respostas sugeridas e Live Translate. O Gboard3 soma Resposta Inteligente, Revisão e ferramentas de reformulação rodando no Gemini Nano em aparelhos mais novos. Tudo grátis.

Grupo dois são os assistentes dentro do próprio app de mensagens. O Magic Compose4 coloca respostas sugeridas acima do teclado no Google Mensagens e reescreve rascunhos em estilos como Animado, Tranquilo e, por motivos que não entendo, Shakespeare. Para fazer isso, ele envia até vinte das suas mensagens recentes para os servidores do Google, o que significa que essas mensagens deixam de ser criptografadas de ponta a ponta. O Google diz que não as armazena. O Gemini no Mensagens é uma coisa separada, uma conversa em que você rascunha e depois copia o resultado para uma conversa de verdade. Ele não enxerga suas outras conversas. Qual deles você precisa depende da tarefa: o melhor app de resposta com IA depende de o seu problema ser volume ou risco.

Grupo três são os apps de resposta para namoro. Você tira print da conversa, o app roda OCR nela, e você recebe cantadas e respostas prontas. O W Rizz cobra US$ 3,99 por semana. O PlugAI, antigo RizzGPT, fica em torno de US$ 4,99. Existem dezenas de outros, e todos otimizam para uma única coisa: se a próxima mensagem recebe resposta.

Grupo quatro são os pequenos, para conversas difíceis. Esse é o grupo mais interessante e o menos financiado. O Resolve5 no iOS mede o que chama de temperatura do conflito. O Clarity Coach6 no Android faz você digitar um rascunho dentro de um cenário de treino e diz se ele soa vago, brusco demais ou explicando além da conta, antes de ajudar a reescrever. O Subtext, que eu cofundei, está nesse grupo e funciona ao contrário do resto da categoria. Ele lê a conversa e o seu rascunho, diz como a mensagem provavelmente vai soar e qual palavra está causando isso, e só então oferece reescritas que você pode usar ou ignorar.

Repare no que acontece na maioria deles. Você entrega um texto, recebe outro texto. O passo em que algo lê o que você escreveu e diz como a outra pessoa provavelmente vai receber aquilo é raro, e onde existe fica quase sempre em software de trabalho. O Copilot no Outlook7 oferece orientação para email sobre tom, clareza e como o leitor pode se sentir, e o Reader Reactions8 do Grammarly prevê o que um leitor escolhido vai tirar de um documento e o que pode confundi-lo. Nenhum dos dois foi feito para a mensagem que você está prestes a mandar para a sua irmã. No lado pessoal, o Clarity Coach chega mais perto, mas é uma sandbox de treino, então não pode tocar numa mensagem que você está prestes a enviar de verdade.

O Grammarly9 é a ferramenta com a qual quero ser preciso, porque é o quase-acerto mais próximo de fechar essa lacuna. O detector de tom dele lê a escolha de palavras, a fraseado, a pontuação e o uso de maiúsculas, e nomeia o tom. No lançamento, em 2019, cobria cerca de quarenta tons10, incluindo grato, confiante, formal, afetuoso e triste. A própria documentação de suporte do Grammarly é cuidadosa quanto ao limite. O detector identifica o tom geral do texto11 e não oferece reescritas frase por frase. Ele diz qual tom está presente. Se a sua irmã vai se sentir desprezada por causa dele é outra pergunta. O recurso mais recente do Grammarly, o Reader Reactions, tenta responder a uma versão dela para um leitor que você escolhe, como um chefe ou um cliente8, e eu não vi nenhum teste independente de quão bem ele prevê leitores reais. A detecção de tom está no plano gratuito, com o Pro a US$ 12 por mês na cobrança anual, segundo os rastreadores de preço atuais.


As pessoas não conseguiam dizer se a IA tinha escrito o texto, e não chegou nem perto

Esse é o achado que mais me surpreendeu, e é o estudo mais robusto de toda a área.

Maurice Jakesch, Jeff Hancock e Mor Naaman rodaram seis experimentos com 4.600 participantes nos Estados Unidos, publicados na PNAS em 202312. As pessoas lam autoapresentações de perfis de namoro, hospedagem e perfis profissionais e tentavam adivinhar quais tinham sido escritas por uma máquina. A precisão ficou entre 50 e 52 por cento. Na condição de namoro, com dinheiro em jogo para acertar, cerca de 51,6 por cento.

Território de cara ou coroa.

O motivo é que todos usamos os mesmos atalhos mentais, e eles são falhos. Os participantes tomaram pronomes em primeira pessoa, contrações, menções à família e detalhes emocionais calorosos como prova de que um humano escreveu. Tomaram gramática limpa e frases secas como prova de que uma máquina escreveu. Cada um desses sinais é trivialmente fácil de um modelo produzir sob pedido. Os atalhos apontam exatamente para o lado errado. Um classificador treinado, no mesmo estudo, chegou a apenas 58,1 por cento, então isso não é uma questão de habilidade que se resolve prestando mais atenção.

O número Precisão para distinguir texto escrito por IA de texto escrito por humanos: 50 a 52 por cento. Território de cara ou coroa.

Seis experimentos · 4.600 participantes · publicado na PNAS, 2023 · um classificador treinado especificamente para essa tarefa chegou a apenas 58,1 por cento

Existe uma ressalva. Esse estudo usou textos da era do GPT-3. Não vi ninguém testar, numa escala parecida, se os números se mantêm com os modelos atuais.

É também por isso que o Subtext nunca tenta adivinhar se foi a IA que escreveu uma mensagem. Ele lê o seu próprio rascunho para ver como ele vai soar para quem está recebendo, algo que um palpite de cara ou coroa sobre quem escreveu nunca ia conseguir te dizer. Quando a redação soa como modelo pronto, frases prontas sem voz nenhuma por trás, ele marca isso como tom de robô, que é sobre como as palavras soam, não sobre quem escreveu.


O dano vem da suspeita, não de ser flagrado

Se as pessoas não conseguem detectar IA, seria de esperar que a preocupação toda evaporasse. Não evapora, e é essa a parte que importa para quem está escrevendo uma mensagem de verdade para uma pessoa de verdade.

Uma equipe liderada pela Cornell rodou dois experimentos randomizados com 1.020 participantes, publicados na Scientific Reports13. Respostas inteligentes tornaram as conversas mais rápidas e mais positivas, e as pessoas avaliaram umas às outras como mais próximas e mais cooperativas. Os participantes que suspeitavam que o parceiro estava usando respostas inteligentes, porém, avaliaram esse parceiro de forma significativamente pior. A suspeita é que causou o dano. Esse estudo mediu suspeita, não acerto, e dado os números de detecção acima, não acho que essas suspeitas estivessem caindo sobre as pessoas certas.

Uma equipe da Carnegie Mellon colocou um mecanismo por trás disso em um artigo de 202514 com 399 participantes em dois estudos, e o resultado deles é mais sutil do que uma simples penalidade. Um rótulo de IA é mais do que uma marca contra você. Ele torna a sua mensagem uma evidência mais fraca sobre quem você é, em qualquer direção. Um pedido de desculpas assistido por IA soa menos caloroso, e uma provocação ou acusação assistida por IA soa menos fria. O rótulo esvazia a mensagem da informação que ela carregava sobre você.

Esse enquadramento ficou na minha cabeça. Seja lá o que a sua mensagem estivesse sinalizando, o rótulo baixa o volume desse sinal.


Exceto em um cenário, onde revelar não fez diferença mensurável

Quero incluir o estudo que vai contra a tese do meu próprio produto, porque deixá-lo de fora seria desonesto.

Zoe Purcell e colegas do Max Planck Institute for Human Development, com Jakesch de novo entre os autores, rodaram dois experimentos pré-registrados com 1.637 participantes em jogos de confiança de dois jogadores com incentivo real, publicados na iScience em novembro de 202515. Metade podia usar assistência de texto preditivo para escrever uma mensagem convencendo um desconhecido a confiar nela. O resto escreveu sem ajuda.

A assistência de IA teve efeito mínimo sobre a confiança, e isso se manteve mesmo quando o uso de IA era revelado. Quem usou assistência produziu mensagens igualmente capazes de gerar confiança em menos tempo, então ganharam mais confiança por minuto gasto. A análise linguística encontrou mensagens ligeiramente menos autênticas, porém mais calorosas, mais complexas e mais altas no que os pesquisadores chamam de clout, ou peso social.

Os autores são cuidadosos quanto ao alcance do achado, e eu também sou. Isso é uma transação única entre desconhecidos com dinheiro envolvido. Confiança comportamental numa decisão de pagamento é um bicho diferente do seu parceiro lendo o seu texto às 23h e decidindo se você quis dizer aquilo mesmo. Mas a minha leitura é que a história de “a IA destrói a confiança” tem um contraexemplo real na literatura, e este é ele.


A IA escreve mensagens de conforto melhores do que a maioria das pessoas, até você mencionar que foi a IA

Dois estudos, o mesmo formato de resultado.

Yin, Jia e Wakslak, na PNAS16, descobriram que respostas geradas por IA fizeram as pessoas se sentirem mais ouvidas do que respostas de humanos sem treinamento, e que a IA era melhor em identificar qual emoção estava em jogo. Depois eles contaram aos receptores que a mensagem vinha de IA, e o efeito caiu. Um dos autores observou que os dois efeitos tinham tamanho parecido e praticamente se cancelaram.

Ovsyannikova, Oldemburgo de Mello e Inzlicht17 rodaram quatro experimentos pré-registrados com 556 participantes na Communications Psychology. Respostas do GPT-4 foram avaliadas como mais compassivas do que as de humanos, incluindo respostas escritas por voluntários treinados de linhas de apoio em crise dos Distress Centres of Greater Toronto. Revelar a origem estreitou a diferença, mas não a fechou.

Então, a máquina costuma ser melhor com as palavras. As palavras não são a única coisa transmitida.


O motivo de o esforço importar é que o esforço costumava ser caro

A teoria da sinalização é o enquadramento que fez tudo isso fazer sentido para mim.

Uma mensagem faz dois trabalhos. Ela carrega conteúdo, e prova que você gastou algo para enviá-la. Seu tempo, sua atenção e, numa conversa difícil, sua compostura. Isso é finito, então gastar essas coisas diz algo verdadeiro sobre o quanto você valoriza a pessoa. Pesquisa sobre sinais de compromisso18 em amostras japonesas e americanas encontrou que sinais caros superam sinais baratos, e que deixar de enviar um sinal esperado, como esquecer uma data importante, prejudicou relações românticas muito mais do que amizades.

Derrube o custo de produzir uma mensagem calorosa, bem articulada e bem estruturada para perto de zero, e o sinal para de carregar informação.

Agora existe evidência direta do mecanismo, ainda que não num contexto de mensagens. Um estudo de 2026 na Frontiers in Psychology19 com 618 participantes encontrou que rotular um conteúdo como gerado por IA reduziu significativamente o esforço percebido, enquanto um rótulo de feito por humano não diferiu de nenhum rótulo. As pessoas presumem esforço humano por padrão, e é a etiqueta de IA que remove essa presunção. Esse estudo usou vídeos curtos, então vale ler o cruzamento com mensagens com alguma cautela.


Terceirizar as palavras parece enfraquecer o seu próprio compromisso com elas

Esse é o achado em que mais fico pensando, e não é nem sobre quem recebe a mensagem.

Economistas do CREED, em Amsterdã20 rodaram jogos de confiança em que quem enviava a mensagem podia usar o ChatGPT para escrever uma promessa de reciprocidade. Duas coisas aconteceram ao mesmo tempo. Pessoas com acesso ao ChatGPT fizeram promessas mais explícitas. E pessoas que sequer abriram o ChatGPT cumpriram suas promessas 25,7 por cento menos vezes na hora do pagamento, independentemente de terem copiado ou não o que ele sugeriu.

O detalhe revelador é que, quanto mais próxima a mensagem enviada estava da sugestão bruta do ChatGPT, menos confiável era o comportamento posterior de quem a enviou. Quem reescreveu a sugestão se comportou melhor. Os autores leem isso como uma questão de propriedade. Dizer algo com as suas próprias palavras te faz sentir preso a isso. Encaminhar algo que uma máquina escreveu, e alguma parte de você nunca assinou embaixo. É também por isso que o Subtext mostra primeiro o problema, antes de qualquer solução, e marca quanto da sua redação cada versão mudou. Uma correção que você escolhe ou escreve é uma que você assinou embaixo.


Pedidos de desculpa são o terreno mais bem estudado, e o achado é mais útil do que “não faça isso”

Se você só ler uma seção, leia esta, porque a resposta prática mora aqui.

Ella Glikson e Omri Asscher rodaram três estudos de cenário sobre pedidos de desculpa no trabalho, publicados na Computers in Human Behavior21. Saber que alguém usou ferramentas de IA para escrever um pedido de desculpas reduziu o quanto ele soava autêntico e o quanto as pessoas estavam dispostas a perdoar. Revelar o uso por conta própria não amenizou isso. Até aqui, previsível.

Depois veio a parte que mudou minha cabeça. Participantes que usaram apenas uma entre três ferramentas de IA disponíveis não sofreram penalidade nenhuma de autenticidade. Os pesquisadores leem isso como uma questão de distância. Um uso limitado de IA mantém a mensagem final perto do que a pessoa quis dizer de verdade, e isso dá para sentir.

Um experimento separado 3x2 de Lim, Hong e Schneider, com 464 participantes, também na Computers in Human Behavior22, encontrou que pedidos de desculpa escritos por humanos foram vistos como mais sinceros em todos os cenários, e que um tom caloroso melhorava pedidos de desculpa feitos por IA sem nunca fechar a diferença até um humano.

Um artigo de 2026 na CHI23, de Fan, Liu e Pan, testou isso em mensagens românticas, com 152 pessoas num primeiro estudo e 704 num segundo. Quanto mais da mensagem a IA redigiu, menos ela parecia ser do próprio remetente e menos autêntica parecia. Uma reescrita leve de tom, aprovada pelo remetente, ajudou na avaliação de um pedido de desculpa, mas rascunhos completos e pedidos de limites tiveram resultados diferentes.

Junte os três estudos e sai algo prático. A penalidade acompanha o quanto a mensagem final se afastou do que você quis dizer. Não se uma máquina esteve envolvida. É pelo mesmo motivo que o Subtext te mostra o que está criando essa impressão antes de oferecer uma versão pronta, e te diz quanto da sua redação cada uma mudou, porque manter essa distância curta é o que mantém um pedido de desculpa acreditável. A pesquisa mais ampla sobre como pedir desculpa por mensagem está num artigo separado.


Essas ferramentas vão polir os seus piores instintos e não vão dizer uma palavra

Escreva algo passivo-agressivo, entregue para qualquer ferramenta de reescrita no seu celular, e veja o que acontece. Você recebe uma agressividade passiva melhor escrita. Sem aviso, sem “tem certeza?”. O trabalho da ferramenta é fazer o que você pediu.

Existe um motivo para os modelos pender para esse lado. A OpenAI retirou uma atualização do GPT-4o em abril de 2025 e escreveu publicamente24 que o modelo tinha ficado “excessivamente lisonjeiro ou concordante, muitas vezes descrito como bajulador”, e que ele “pendia para respostas excessivamente apoiadoras, mas pouco sinceras”. A causa apontada foi ajustar o modelo demais com base em feedback de curto prazo dos usuários, ou seja, curtidas e descurtidas. Num post seguinte25, eles admitiram que não tinham nenhuma avaliação em produção rastreando esse tipo de bajulação.

Pesquisadores da Anthropic descobriram que o mesmo padrão é geral. Num artigo apresentado na ICLR 202426, cinco assistentes de ponta mostraram bajulação, e uma análise de cerca de 15.000 comparações de preferência humana encontrou que concordar com a crença declarada do usuário estava entre os previsores mais fortes de qual resposta as pessoas preferiam. Treine por aprovação e você seleciona por concordância. Um benchmark de 202527 mediu comportamento bajulador em 58,19 por cento dos casos de teste em ChatGPT-4o, Claude Sonnet e Gemini 1.5 Pro, com 78,5 por cento de persistência depois de começar, embora isso tenha sido em perguntas e respostas factuais, não em mensagens pessoais. Para mensagens pessoais, comparei as alternativas ao ChatGPT para escrever e o que os três grandes fazem com as suas palavras.

Agora pense no que isso significa no momento em que você mais precisa de ajuda. Você está com raiva, escreveu algo de que vai se arrepender, e a ferramenta segurando o seu rascunho foi otimizada para te fazer sentir bem em relação a isso.

Esse é exatamente o momento para o qual o Subtext foi construído, e a parte desconfortável é o ponto. Ele te diz que o rascunho soa zangado em vez de fazer a raiva soar melhor.


A pergunta que eu não consigo responder

É melhor enviar uma mensagem desajeitada que você escreveu ou uma polida que você não escreveu?

Procurei bastante e não existe estudo que teste isso diretamente. Ninguém randomizou “o seu próprio rascunho imperfeito” contra “um bom rascunho que você não escreveu” e acompanhou o que aconteceu com a relação depois. Não há nada longitudinal. Nenhum dado de campo sobre casais, famílias ou amigos próximos ao longo de meses de mensagens assistidas por IA. Não sabemos se as pessoas se adaptam ao polimento sintético, ou se o hábito corrói alguma coisa em silêncio.

O que temos aponta numa direção para relações próximas. Esforço soa como cuidado, rótulos achatam o sinal, palavras terceirizadas parecem afrouxar o seu compromisso com as próprias promessas, e pedidos de desculpa continuam acreditáveis quando ficam perto do que você quis dizer. Mas o resultado do jogo de confiança diz que, em alguns contextos, o custo foi pequeno demais para ser medido, e eu não vou fingir que a evidência é mais limpa do que ela é.


Então o que ajudaria

Relendo tudo isso, acho que o formato do produto que falta fica bastante claro, e que é quase o oposto do que a categoria está construindo.

Ninguém precisa que as próprias palavras sejam substituídas. O que as pessoas precisam, nos quinze segundos antes de apertar enviar, é saber que a mensagem soa mais fria do que elas se sentem, ou que aquilo que parece uma explicação soa como uma lista de queixas. Depois elas mesmas corrigem, com as próprias palavras, e o sinal do esforço sobrevive, a propriedade sobrevive, e a distância de Glikson e Asscher fica curta.

Essa é a versão que eu quero que exista, e foi em torno dela que construímos o Subtext. O Subtext pega a conversa inteira, não só a frase, nomeia o que o seu rascunho provavelmente vai sinalizar para quem vai ler, e mostra as palavras criando essa impressão. Cada versão que ele oferece depois diz quanto da sua redação mudou, e você pode alterar qualquer uma delas com Editar manualmente antes de copiar, de modo que o ajuste continue sendo seu. Pela evidência acima, isso importa mais do que a reescrita, porque a penalidade acompanha a distância do que você quis dizer, e a distância mais curta é a sua própria frase com uma palavra trocada. Experimente o Subtext no navegadorExperimente o Subtext no navegador

Minha própria regra, para o que valer: deixo uma máquina me dizer como a minha mensagem soa. Não deixo ela dizer à minha irmã que eu sinto muito.


Acha que li algum estudo errado, ou conhece uma ferramenta que diagnostica antes de reescrever? Me conta no LinkedIn.

Samet Durgun é cofundador do Subtext, um aplicativo que capta o tom emocional das suas mensagens e reescreve elas do seu jeito. Ele mora em Berlim.

Fontes

Todo link acima leva à fonte primária, quando ela existe, numerado na ordem de aparição. Funcionalidades e preços de produtos verificados em agosto de 2026. Onde um número veio de blog de empresa ou press release em vez de um estudo, eu deixei de fora.

  1. Apple Support. Use Writing Tools with Apple Intelligence on iPhone.
  2. Samsung. Use Writing assist on Galaxy phones and tablets.
  3. Google Support. Use writing tools with Gboard.
  4. Google Support. Draft messages with Magic Compose.
  5. Apple App Store. Resolve: AI Conflict Coach.
  6. Google Play. Clarity Coach.
  7. Microsoft Support. Get email coaching with Copilot in Outlook.
  8. Grammarly Support. Reader Reactions user guide.
  9. Grammarly. Writing Tone Detector and Tone Suggestions.
  10. TechCrunch (2019). Grammarly gets a tone detector to keep you out of email trouble.
  11. Grammarly Support. How do Grammarly’s tone suggestions work?
  12. Jakesch, M., Hancock, J. T., & Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
  13. Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J., & Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
  14. Khadpe, P., Wenzel, K., Loewenstein, G., & Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
  15. Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M., & Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
  16. Yin, Y., Jia, N., & Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
  17. Ovsyannikova, D., Oldemburgo de Mello, V., & Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
  18. Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
  19. Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
  20. AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, University of Amsterdam.
  21. Glikson, E., & Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
  22. Lim, J. S., Hong, N., & Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
  23. Fan, G., Liu, D., & Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
  24. OpenAI (2025). Sycophancy in GPT-4o.
  25. OpenAI (2025). Expanding on what we missed with sycophancy.
  26. Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
  27. Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.