ArtigosFerramentas de escrita

Alternativas ao ChatGPT para escrever: o que os três grandes fazem às tuas palavras

O ChatGPT, o Claude e o Gemini deixam qualquer texto correto. Aqui fica onde cada um deixa de o manter teu, e o que se constrói por cima.

Por Samet Durgun · Cofundador da Subtext · 15 min de leitura

Já vi alguém escrever a mesma mensagem onze vezes, o que explica porque é que uma resposta de duas linhas pode levar uma hora. Apagar. Escrever outra vez. Ler em voz alta. Mandá-la a um amigo para ter uma segunda opinião. E depois enviar uma versão encurtada que não diz quase nada.

A certa altura, a maioria das pessoas cola aquilo no ChatGPT.

O que volta é normalmente melhor. A gramática está impecável, as frases estão mais apertadas, a divagação desapareceu. E normalmente também já não é delas. A mensagem deixa de ser uma coisa escrita por uma pessoa nervosa à uma da manhã e passa a ser uma coisa escrita por um estranho competente às dez da manhã de uma terça-feira, e quem a recebe sente essa diferença mesmo quando não lhe consegue dar nome. Essa diferença é exatamente o que o Subtext, a app que cofundei, foi feito para apanhar. Lê o que uma mensagem como essa está a fazer antes de a enviares.

Por isso tenho um enviesamento óbvio, e é bom que leias o resto com isso em mente. Prefiro ser útil a ser convincente, por isso a maior parte deste texto é sobre aquilo em que os três grandes assistentes são bons, seguido das formas concretas, e bastante documentadas, como falham quando a escrita fica pessoal. As fontes estão ligadas para conseguires pesar o meu interesse contra as provas.

Comecemos pelo que eles fazem bem

Se precisas que uma mensagem fique correta, mais curta, mais clara ou traduzida, os três são excelentes e o melhor é mesmo usá-los. Corrigem vírgulas mal postas, cortam aquelas aberturas em que ainda estás a limpar a garganta, transformam um parágrafo às voltas em três frases limpas e mudam de registo quando lhes mandas. O Canvas1 do ChatGPT dá-te uma superfície de edição lado a lado em vez de um muro de texto gerado outra vez do zero. O Ajuda-me a escrever do Gemini vive dentro do Gmail e do Docs, o que elimina quase toda a fricção de sequer chegar a uma ferramenta. Os Projects do Claude guardam um guia de estilo e um conjunto de documentos de referência de sessão para sessão.

Para um email de trabalho que só precisa de ser inofensivo e correto, isso chega. Podes parar de ler aqui.

O resto disto é sobre o outro tipo de mensagem. O pedido de desculpa. O limite que andas a adiar. A resposta à tua mãe. A mensagem para alguém com quem já andaste. Essa categoria comporta-se de outra maneira, e é aí que as diferenças entre estes modelos começam a contar.

Quatro coisas que uma reescrita pode estragar

Acho útil separar a qualidade de superfície da fidelidade da revisão. Uma mensagem pode ficar mais lisa e ao mesmo tempo pior, porque alisar tira as partes que estavam a fazer o trabalho. Trocar “digamos que foi uma forma de o dizer” por “ela discordou frontalmente” é mais explícito e muito menos verdade.

A minha lista tem quatro coisas em que uma revisão não pode mexer. É a forma como eu avalio uma reescrita, e ninguém a validou como escala.

O que fica intacto O que abrange Como os modelos o estragam
Factos Nomes, datas, números, o que prometeste mesmo Acrescentam um pormenor, endurecem um talvez num sim
Implícito Ironia, delicadeza, distância, vagueza propositada Dizem em voz alta aquilo que estava implícito
Voz O teu vocabulário, o ritmo, o comprimento das frases, as manias de pontuação Substituem tudo por um estilo de casa fluente
Estrutura Aquilo com que abriste e aquilo que enterraste Reordenam tudo para uma clareza convencional

Todas as queixas que se seguem neste texto são uma destas quatro a falhar. Reparo que os corretores gramaticais só verificam a primeira, e que a maioria das pessoas, ao avaliar uma reescrita de IA, também só repara na primeira.

O ChatGPT lê o ambiente e depois edita para lá do que lhe pediste

O ChatGPT é o mais intuitivo dos três em matéria de emoção quando se trata de diálogo. Dá-lhe uma cena em que duas pessoas falam de uma banalidade enquanto fogem de uma coisa dolorosa e, regra geral, ele deixa a coisa dolorosa por dizer. O que escreve tem uma cadência natural, e é bom a apanhar a dinâmica emocional que está por baixo do que foi escrito.

O problema recorrente é que ele não se aguenta na cadeira de editor. Quem descreve a forma como ele edita acaba sempre na mesma queixa, a de que reescreve coisas que ninguém lhe pediu para tocar.

Há dois efeitos secundários que contam para as mensagens. O primeiro é que ele arranca a especificidade. A frase que fazia do teu pedido de desculpa uma coisa tua, qualquer coisa como “sei que ficaste quarenta minutos à espera na rua”, colapsa num “sei que te deixei à espera”. Quem escreve ficção relata em fóruns online uma versão mais violenta do mesmo instinto. Pede uma revisão de linha que mantenha o comprimento e recebe de volta um capítulo muito mais curto.

O segundo é que instruções vagas sobre tom produzem oscilações brutais quando o que querias era um ajuste. Um relato comum é que ele volta com um tom muito formal, e basta pedir menos formal para saltar logo para o muito descontraído.

E dar-lhe mais textos teus não resolve o problema da voz de forma fiável. Quem cola milhares de palavras da sua própria prosa como referência continua a relatar resultados que soam a ChatGPT.

O Claude cumpre o que lhe pedes e depois explica-te a ti próprio

O Claude é o mais forte dos três a fazer aquilo que lhe pediste e mais nada. Respeita restrições, não inventa pormenores e lida bem com o que se passa por dentro das pessoas, o que explica que apareça sempre que alguém quer um modelo que não tome conta do rascunho.

É também aqui que existe a coisa mais parecida com prova comparativa a sério. O MultiPragEval, um benchmark que testa compreensão pragmática em inglês, alemão, coreano e chinês, pôs o Claude 3 Opus claramente à frente do GPT-4 em implicatura e interpretação griceana, que é a forma técnica de dizer que ele era melhor a perceber o que a pessoa queria dizer, e não o que disse à letra.2 Queria sinalizar duas ressalvas. O benchmark testa interpretação, não edição. E os modelos testados já têm várias gerações, por isso isto aponta para uma tendência de família e não para um placar atual.

O modo de falhar do Claude é o oposto do ChatGPT. Ele percebe o subtexto e depois escreve-o. Quem escreve ficção chama a isto deriva explicativa: o modelo converte o implícito em declarado, em prosa do género “o silêncio entre os dois carregava o peso não dito de anos”. Numa mensagem, isso aparece como linguagem de consultório.

Exemplo ilustrativo, não é output real

não estou chateado, só reparei que não respondeste

O que escreveste. Contido de propósito, que é o ponto todo.

Queria partilhar contigo que me tenho sentido um bocadinho magoado com a demora na tua resposta, e acho que isso vem de um lugar de valorizar mesmo muito a nossa amizade.

O subtexto passou a texto. É calmo, é bem articulado, e diz exatamente a coisa que tu estavas a escolher não dizer.

Há mais dois padrões do Claude que aparecem com frequência suficiente para contares com eles. Enfeita quando o deixas à solta, e os utilizadores descrevem a prosa como mais estilosa e às vezes carregada demais. E é generoso com os elogios, muitas vezes embrulhando a crítica numa sandes de elogios. Este segundo é um problema a sério quando o que precisavas era de uma leitura seca sobre se a tua mensagem cai mal.

O Gemini já está onde tu estás e é mau a deixar coisas por dizer

A vantagem do Gemini é a localização. Está no Gmail, está no Docs, é o assistente por omissão em muitos telemóveis Android e o plano gratuito é generoso. Não tem a mania do ChatGPT de encolher o teu texto e moraliza menos perante conteúdo difícil.

Os relatos sobre a qualidade da escrita dele estão divididos, e acho que isso merece ser dito com clareza. Há escritores experientes que o consideram o melhor dos três a criticar escrita criativa e a apanhar nuances. Outros acham que tem um estilo de casa de que não abdica, com um registo de conversa que alguns comparam a um comentário do Reddit.

O padrão mais relevante para mensagens pessoais é que o Gemini tem muito pouca contenção narrativa. Se há uma coisa a ser guardada, ele põe-na à vista. Os romancistas descrevem isto como pendurar um letreiro de néon a piscar por cima do pormenor que devia ficar escondido. Numa mensagem, quer dizer que aquilo que andavas a contornar com todo o cuidado acaba na segunda frase.

Os problemas que os três partilham

Um: eles concordam contigo

Este é o que mais importa, e é o mais bem documentado.

Em abril de 2025, a OpenAI lançou uma atualização que tornou o ChatGPT visivelmente mais bajulador e voltou atrás quatro dias depois. O texto deles3 dizia que o modelo “pendia para respostas excessivamente apoiantes mas pouco sinceras” e apontava a causa para dar peso a mais à aprovação imediata do utilizador. Um segundo texto4, poucos dias depois, entrou em mais pormenor sobre o que o processo de revisão deles tinha deixado passar.

O mecanismo por baixo disto não é exclusivo da OpenAI. Um estudo com cinco assistentes de topo concluiu que modelos treinados com dados de preferência humana “sacrificam com frequência a veracidade a favor de corresponder às crenças do utilizador”, porque é a concordância que é premiada.5

Agora pensa no que as pessoas perguntam mesmo a estas ferramentas. Muito poucas colam uma mensagem e pedem ajuda com a gramática. O que perguntam é alguma variação de “isto é duro de mais?” ou “estou a exagerar?”, a pergunta que desmonto em “Este texto soa mal-educado?”. Essa pergunta vai parar a um sistema com um enviesamento estrutural para te dizer que está tudo bem.

Um assistente genérico ajuda-te a escrever uma chantagem emocional melhor. Muitas vezes não te vai dizer que estás a fazer chantagem emocional.

Querias uma segunda opinião e o que recebeste foi um cúmplice com melhor pontuação.

De tudo nesta página, isto é a falha contra a qual o Subtext foi construído mais diretamente, e a solução que escolhi é estrutural. Volto a isto.

Dois: normalizam coisas que fizeste de propósito

Os três corrigem frases truncadas, repetições, pontuação estranha, reservas e regionalismos, mesmo quando isso foram escolhas. Pedir “preservação de voz” não resolve, porque o modelo não tem maneira de saber que esquisitices são tuas e quais são erros.

Ligada a isto, e mais subtil, está a inflação semântica. Um modelo transforma “se calhar não consigo ir” em “não vou conseguir ir”, ou “achei-te um bocado estranho” em “tu estavas chateado”. Cada edição lê-se como mais segura e é menos exata, e numa mensagem sobre uma relação a exatidão no grau é quase todo o conteúdo.

Três: escrevem num dialeto que as pessoas reconhecem

Todos os modelos têm tiques verbais. Há já algum tempo que quem escreve os anda a catalogar, e a partir do momento em que os vês deixa de dar para não os ver.

Padrão Exemplos O que custa
Substantivos abstratos testemunho, tapeçaria, farol, cacofonia Troca um pormenor concreto por um grandioso
Enquadramento binário “Não era X, era Y” / “Não por A, mas por B” Impõe uma conclusão arrumada a uma coisa confusa
Interioridade declarada “não pude deixar de sentir”, “vem de um lugar de” Dá nome à emoção em vez de a mostrar
Listas de três Três elementos onde dois chegavam Lê-se como composto, não como escrito
Antítese equilibrada Duas orações do mesmo peso, sem fim Um ritmo que não pertence a nenhum ser humano

Por trás da lista de vocabulário há uma preocupação maior. Estudos sobre escrita assistida por IA concluem que a intervenção do modelo empurra escritores diferentes para os mesmos padrões dominantes, o que significa que quanto mais usas estas ferramentas mais a escrita de toda a gente converge.6 Num estudo apresentado na CHI 2025, 118 pessoas da Índia e dos Estados Unidos escreveram sobre a sua própria vida e, com as sugestões de IA ligadas, a escrita dos participantes indianos derivou para estilos ocidentais.7 Para uma mensagem cujo propósito inteiro é ser inconfundivelmente tua, essa é a direção errada.

Quatro: quem recebe pode dar por isso, e isso sai-te caro

Esta é a parte que as pessoas subestimam. Existe uma linha de investigação sobre aquilo a que se chama comunicação mediada por IA, e a conclusão central é incómoda. As pessoas não são fiáveis a identificar texto escrito por IA8, e apoiam-se em pistas erradas quando tentam. Mas quando acreditam que um texto foi gerado por IA, confiam menos em quem o escreveu.9

Ou seja, o risco de uma reescrita genérica vai além de uma mensagem medíocre, até uma mensagem que se lê como falsa exatamente no momento em que a sinceridade é a carga toda. Um pedido de desculpa que dispara o detetor de IA da outra pessoa faz mais estragos do que o pedido de desculpa desajeitado que terias escrito sozinho.

Cinco: não sabem a quem estás a escrever

A menos que a memória ou um projeto tragam alguma coisa de sessões anteriores, cada sessão começa quase vazia. Para teres um bom rascunho, terias de explicar uma década de amizade, o que aconteceu em março, porque é que a frase “está tudo bem” quer dizer uma coisa muito específica entre vocês os dois. Quase ninguém faz isso, por isso o modelo escreve para um destinatário genérico. A formalidade é o que recebes quando um sistema não sabe nada sobre a relação, e é por isso que o resultado soa tantas vezes a apoio ao cliente. Esse começo em branco é a razão pela qual o Subtext lê a conversa que colas ou capturas, e pergunta para quem é uma mensagem quando um rascunho confronta alguém.

Há ainda a parte que as pessoas dizem baixinho. Colar uma captura de ecrã de uma discussão, ou o rascunho de um fim de relação, ou uma mensagem sobre a tua família num chatbot genérico não é a mesma coisa que lhe pedir para corrigir código. Esse instinto não é paranoia.

O que os romancistas fizeram quanto a isto

O que se segue é o que me convenceu de que esta falha é real, e não uma coisa que inventei para ter algo para vender.

Quem escreve ficção bateu nestas falhas primeiro, com mais em jogo e em muito maior volume. Continuaram a usar os modelos, só que não em cru. Cresceu por cima uma camada inteira de ferramentas, incluindo ambientes como o Novelcrafter10, que te deixa montar um dicionário de clichés proibidos que ficam marcados a vermelho à medida que o texto é gerado, e correr operações dirigidas como “mostra, não contes” sobre um trecho selecionado. O Sudowrite11 faz algo parecido, com passagens dedicadas que convertem resumo em pormenor sensorial concreto.

Os utilizadores mais sérios vão mais longe e montam pipelines com vários modelos. Um modelo para notas de desenvolvimento e análise de subtexto, um segundo para revisão de linha sob restrições apertadas, uma passagem de filtragem para limpar vocabulário de IA e depois uma passagem humana para repor a voz.

São quatro ferramentas e uma checklist para rever um capítulo. Funciona. E também te diz que os modelos genéricos não fazem este trabalho sozinhos, e que as pessoas que mais se importam com o resultado já aceitaram isso.

Agora aplica isso a uma mensagem de telemóvel. Ninguém corre um pipeline de quatro fases antes de responder à irmã. A necessidade de uma camada mais fina é exatamente a mesma e a tolerância ao esforço é praticamente zero, e é esse o verdadeiro problema de produto. Fui ver à parte se as ferramentas de IA para reescrever mensagens funcionam mesmo em mensagens como essa.

O que uma ferramenta mais fina tem de fazer de outra maneira

Três coisas, e nenhuma delas é “escrever melhor”.

Analisar antes de reescrever. Dar nome àquilo que o rascunho está a sinalizar antes de tocar numa única palavra, tal como deveria fazer um verificador de mensagens com IA, incluindo a parte que quem escreveu não queria sinalizar. Também ajuda com a bajulação, porque uma ferramenta que começa por uma leitura compromete-se com ela antes de ter hipótese de concordar contigo. Isso não torna a leitura correta. O Subtext funciona com o mesmo tipo de modelo, por isso pressiona-o como pressionarias um amigo. Que palavras sustentam essa leitura, e de que outras formas poderiam ser recebidas?

Mostrar a distância, não a esconder. Uma versão perto do que escreveste, ao lado de uma versão feita de raiz, é mais útil do que uma única substituição polida. Vês o que mudou e decides se estás disposto a soar assim.

Ler a relação, além da mensagem. Quem é esta pessoa para ti, o que a conversa mostra que já tentaste, o que quer dizer “está tudo bem” nesta amizade em concreto.

É isso que ando a construir, por isso trata este parágrafo com isso em mente. O Subtext etiqueta a emoção do que escreveste antes de sugerir seja o que for, uma escolha de design propositadamente chata, porque o momento em que é mais útil é precisamente aquele em que menos o queres ouvir.

Exemplo ilustrativo, não é output real

está tudo bem, eu percebo, andas ocupado. deixo de insistir.

O que ias enviar. Lê-se como afastamento, e “deixo de insistir” é uma ameaça vestida de pedido de desculpa.

Olá, compreendo perfeitamente que as coisas têm andado corridas. Não te preocupes nada com hoje à noite, diz-me só quando te der mais jeito e combinamos alguma coisa.

Uma reescrita genérica. Correta, simpática, e apagou o facto de estares magoado, que era a única informação que havia no original.

está tudo bem. mas fico um bocado desiludido. prefiro dizer isso do que fingir que não é nada.

A mesma voz, mantém a mágoa, deita fora a ameaça, e não acrescenta nada que não tenhas dito.

Na prática, colas o rascunho, ou fazes um screenshot da conversa para que leia os dois lados, e ele diz o que a tua mensagem está prestes a sinalizar antes de oferecer versões que ainda soam como tu. Experimentar o Subtext no browserExperimentar o Subtext no browser

Onde eu continuaria a abrir o ChatGPT

Documentos longos. Email profissional. Tudo aquilo em que estar correto importa mais do que ser reconhecivelmente tu. Pesquisa, primeiros rascunhos, tradução, e aquela misericórdia muito específica de pôr palavras numa página vazia quando não consegues começar.

E um facto que joga contra o meu próprio argumento, que prefiro incluir a deixar de fora. Um estudo com perguntas médicas colocadas num fórum público12 encontrou isto.

A descoberta Os avaliadores preferiram as respostas do chatbot às respostas dos médicos em 78,6% das comparações, e classificaram as respostas do chatbot como empáticas ou muito empáticas quase dez vezes mais vezes.

Estes modelos conseguem produzir texto que se lê como caloroso, e essa capacidade é real.

O que raramente fazem sem lho pedires é dizer-te que a tua mensagem se lê como um ultimato. Fazem o ultimato fluir melhor e elogiam-te pela tua honestidade emocional. Essa distância é pequena e é quase todo o trabalho, e construí o Subtext para a fechar. Nomeia como a tua mensagem se lê antes de reescrever uma única palavra dela.

Uma nota sobre versões dos modelos. Tudo o que está acima descreve comportamentos que se mantiveram ao longo de várias gerações de cada família de modelos, e é por isso que evitei quase sempre nomear versões concretas. Estes sistemas mudam de poucos em poucos meses e qualquer texto que prenda o argumento a um número de versão está errado quando chegar o inverno.


Achas que fui injusto com o teu modelo preferido? Diz-me no LinkedIn.

Samet Durgun é cofundador do Subtext, uma app que apanha o tom emocional das tuas mensagens e as reescreve na tua voz. Vive em Berlim.


Fontes

Todos os links acima levam à fonte primária, sempre que ela existe.

  1. OpenAI, “Introducing Canvas,” 3 de outubro de 2024.
  2. Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testou inglês, alemão, coreano e chinês nas categorias griceanas; o Gemini foi excluído por razões de acesso à API na altura.
  3. OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025.
  4. OpenAI, “Expanding on what we missed with sycophancy,” 2 de maio de 2025.
  5. Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, outubro de 2023.
  6. Investigação sobre homogeneização estilística na escrita assistida por IA, incluindo Padmakumar e He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, e Doshi e Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
  7. Agarwal, Naaman e Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
  8. Jakesch, Hancock e Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
  9. Jakesch, French, Ma, Hancock e Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Ver também Hancock, Naaman e Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
  10. Novelcrafter, funcionalidades Codex e de prompts de substituição de texto.
  11. Sudowrite, funcionalidades “Show, Don’t Tell” e Describe.
  12. Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 avaliações; as respostas do chatbot foram preferidas em 78,6% e classificadas como empáticas ou muito empáticas 9,8 vezes mais do que as dos médicos.