
ArtigosFerramentas de escrita
Alternativas ao ChatGPT para escrever: o que os três grandes fazem às tuas palavras
O ChatGPT, o Claude e o Gemini deixam qualquer texto correto. Aqui fica onde cada um deixa de o manter teu, e o que se constrói por cima.
Por Samet Durgun · Cofundador da Subtext · 15 min de leitura
· Atualizado a 26 de setembro de 2026
Já vi alguém escrever a mesma mensagem onze vezes, o que explica porque é que uma resposta de duas linhas pode levar uma hora. Apagar. Escrever outra vez. Ler em voz alta. Mandá-la a um amigo para ter uma segunda opinião. E depois enviar uma versão encurtada que não diz quase nada.
A certa altura, a maioria das pessoas cola aquilo no ChatGPT.
O que volta é normalmente melhor. A gramática está impecável, as frases estão mais apertadas, a divagação desapareceu. E normalmente também já não é delas. A mensagem deixa de ser uma coisa escrita por uma pessoa nervosa à uma da manhã e passa a ser uma coisa escrita por um estranho competente às dez da manhã de uma terça-feira, e quem a recebe sente essa diferença mesmo quando não lhe consegue dar nome. Essa diferença é exatamente o que o Subtext, a app que cofundei, foi feito para apanhar. Lê o que uma mensagem como essa está a fazer antes de a enviares.
Por isso tenho um enviesamento óbvio, e é bom que leias o resto com isso em mente. Prefiro ser útil a ser convincente, por isso a maior parte deste texto é sobre aquilo em que os três grandes assistentes são bons, seguido das formas concretas, e bastante documentadas, como falham quando a escrita fica pessoal. As fontes estão ligadas para conseguires pesar o meu interesse contra as provas.
Comecemos pelo que eles fazem bem
Se precisas que uma mensagem fique correta, mais curta, mais clara ou traduzida, os três são excelentes e o melhor é mesmo usá-los. Corrigem vírgulas mal postas, cortam aquelas aberturas em que ainda estás a limpar a garganta, transformam um parágrafo às voltas em três frases limpas e mudam de registo quando lhes mandas. O Canvas1 do ChatGPT dá-te uma superfície de edição lado a lado em vez de um muro de texto gerado outra vez do zero. O Ajuda-me a escrever do Gemini vive dentro do Gmail e do Docs, o que elimina quase toda a fricção de sequer chegar a uma ferramenta. Os Projects do Claude guardam um guia de estilo e um conjunto de documentos de referência de sessão para sessão.
Para um email de trabalho que só precisa de ser inofensivo e correto, isso chega. Podes parar de ler aqui.
O resto disto é sobre o outro tipo de mensagem. O pedido de desculpa. O limite que andas a adiar. A resposta à tua mãe. A mensagem para alguém com quem já andaste. Essa categoria comporta-se de outra maneira, e é aí que as diferenças entre estes modelos começam a contar.
Quatro coisas que uma reescrita pode estragar
Acho útil separar a qualidade de superfície da fidelidade da revisão. Uma mensagem pode ficar mais lisa e ao mesmo tempo pior, porque alisar tira as partes que estavam a fazer o trabalho. Trocar “digamos que foi uma forma de o dizer” por “ela discordou frontalmente” é mais explícito e muito menos verdade.
A minha lista tem quatro coisas em que uma revisão não pode mexer. É a forma como eu avalio uma reescrita, e ninguém a validou como escala.
| O que fica intacto | O que abrange | Como os modelos o estragam |
|---|---|---|
| Factos | Nomes, datas, números, o que prometeste mesmo | Acrescentam um pormenor, endurecem um talvez num sim |
| Implícito | Ironia, delicadeza, distância, vagueza propositada | Dizem em voz alta aquilo que estava implícito |
| Voz | O teu vocabulário, o ritmo, o comprimento das frases, as manias de pontuação | Substituem tudo por um estilo de casa fluente |
| Estrutura | Aquilo com que abriste e aquilo que enterraste | Reordenam tudo para uma clareza convencional |
Todas as queixas que se seguem neste texto são uma destas quatro a falhar. Reparo que os corretores gramaticais só verificam a primeira, e que a maioria das pessoas, ao avaliar uma reescrita de IA, também só repara na primeira.
O ChatGPT lê o ambiente e depois edita para lá do que lhe pediste
O ChatGPT é o mais intuitivo dos três em matéria de emoção quando se trata de diálogo. Dá-lhe uma cena em que duas pessoas falam de uma banalidade enquanto fogem de uma coisa dolorosa e, regra geral, ele deixa a coisa dolorosa por dizer. O que escreve tem uma cadência natural, e é bom a apanhar a dinâmica emocional que está por baixo do que foi escrito.
O problema recorrente é que ele não se aguenta na cadeira de editor. Quem descreve a forma como ele edita acaba sempre na mesma queixa, a de que reescreve coisas que ninguém lhe pediu para tocar.
Há dois efeitos secundários que contam para as mensagens. O primeiro é que ele arranca a especificidade. A frase que fazia do teu pedido de desculpa uma coisa tua, qualquer coisa como “sei que ficaste quarenta minutos à espera na rua”, colapsa num “sei que te deixei à espera”. Quem escreve ficção relata em fóruns online uma versão mais violenta do mesmo instinto. Pede uma revisão de linha que mantenha o comprimento e recebe de volta um capítulo muito mais curto.
O segundo é que instruções vagas sobre tom produzem oscilações brutais quando o que querias era um ajuste. Um relato comum é que ele volta com um tom muito formal, e basta pedir menos formal para saltar logo para o muito descontraído.
E dar-lhe mais textos teus não resolve o problema da voz de forma fiável. Quem cola milhares de palavras da sua própria prosa como referência continua a relatar resultados que soam a ChatGPT.
O Claude cumpre o que lhe pedes e depois explica-te a ti próprio
O Claude é o mais forte dos três a fazer aquilo que lhe pediste e mais nada. Respeita restrições, não inventa pormenores e lida bem com o que se passa por dentro das pessoas, o que explica que apareça sempre que alguém quer um modelo que não tome conta do rascunho.
É também aqui que existe a coisa mais parecida com prova comparativa a sério. O MultiPragEval, um benchmark que testa compreensão pragmática em inglês, alemão, coreano e chinês, pôs o Claude 3 Opus claramente à frente do GPT-4 em implicatura e interpretação griceana, que é a forma técnica de dizer que ele era melhor a perceber o que a pessoa queria dizer, e não o que disse à letra.2 Queria sinalizar duas ressalvas. O benchmark testa interpretação, não edição. E os modelos testados já têm várias gerações, por isso isto aponta para uma tendência de família e não para um placar atual.
O modo de falhar do Claude é o oposto do ChatGPT. Ele percebe o subtexto e depois escreve-o. Quem escreve ficção chama a isto deriva explicativa: o modelo converte o implícito em declarado, em prosa do género “o silêncio entre os dois carregava o peso não dito de anos”. Numa mensagem, isso aparece como linguagem de consultório.
Exemplo ilustrativo, não é output real
não estou chateado, só reparei que não respondeste
O que escreveste. Contido de propósito, que é o ponto todo.
Queria partilhar contigo que me tenho sentido um bocadinho magoado com a demora na tua resposta, e acho que isso vem de um lugar de valorizar mesmo muito a nossa amizade.
O subtexto passou a texto. É calmo, é bem articulado, e diz exatamente a coisa que tu estavas a escolher não dizer.
Há mais dois padrões do Claude que aparecem com frequência suficiente para contares com eles. Enfeita quando o deixas à solta, e os utilizadores descrevem a prosa como mais estilosa e às vezes carregada demais. E é generoso com os elogios, muitas vezes embrulhando a crítica numa sandes de elogios. Este segundo é um problema a sério quando o que precisavas era de uma leitura seca sobre se a tua mensagem cai mal.
O Gemini já está onde tu estás e é mau a deixar coisas por dizer
A vantagem do Gemini é a localização. Está no Gmail, está no Docs, é o assistente por omissão em muitos telemóveis Android e o plano gratuito é generoso. Não tem a mania do ChatGPT de encolher o teu texto e moraliza menos perante conteúdo difícil.
Os relatos sobre a qualidade da escrita dele estão divididos, e acho que isso merece ser dito com clareza. Há escritores experientes que o consideram o melhor dos três a criticar escrita criativa e a apanhar nuances. Outros acham que tem um estilo de casa de que não abdica, com um registo de conversa que alguns comparam a um comentário do Reddit.
O padrão mais relevante para mensagens pessoais é que o Gemini tem muito pouca contenção narrativa. Se há uma coisa a ser guardada, ele põe-na à vista. Os romancistas descrevem isto como pendurar um letreiro de néon a piscar por cima do pormenor que devia ficar escondido. Numa mensagem, quer dizer que aquilo que andavas a contornar com todo o cuidado acaba na segunda frase.
Os problemas que os três partilham
Um: eles concordam contigo
Este é o que mais importa, e é o mais bem documentado.
Em abril de 2025, a OpenAI lançou uma atualização que tornou o ChatGPT visivelmente mais bajulador e voltou atrás quatro dias depois. O texto deles3 dizia que o modelo “pendia para respostas excessivamente apoiantes mas pouco sinceras” e apontava a causa para dar peso a mais à aprovação imediata do utilizador. Um segundo texto4, poucos dias depois, entrou em mais pormenor sobre o que o processo de revisão deles tinha deixado passar.
O mecanismo por baixo disto não é exclusivo da OpenAI. Um estudo com cinco assistentes de topo concluiu que modelos treinados com dados de preferência humana “sacrificam com frequência a veracidade a favor de corresponder às crenças do utilizador”, porque é a concordância que é premiada.5
Agora pensa no que as pessoas perguntam mesmo a estas ferramentas. Muito poucas colam uma mensagem e pedem ajuda com a gramática. O que perguntam é alguma variação de “isto é duro de mais?” ou “estou a exagerar?”, a pergunta que desmonto em “Este texto soa mal-educado?”. Essa pergunta vai parar a um sistema com um enviesamento estrutural para te dizer que está tudo bem.
Um assistente genérico ajuda-te a escrever uma chantagem emocional melhor. Muitas vezes não te vai dizer que estás a fazer chantagem emocional.
Querias uma segunda opinião e o que recebeste foi um cúmplice com melhor pontuação.
De tudo nesta página, isto é a falha contra a qual o Subtext foi construído mais diretamente, e a solução que escolhi é estrutural. Volto a isto.
Dois: normalizam coisas que fizeste de propósito
Os três corrigem frases truncadas, repetições, pontuação estranha, reservas e regionalismos, mesmo quando isso foram escolhas. Pedir “preservação de voz” não resolve, porque o modelo não tem maneira de saber que esquisitices são tuas e quais são erros.
Ligada a isto, e mais subtil, está a inflação semântica. Um modelo transforma “se calhar não consigo ir” em “não vou conseguir ir”, ou “achei-te um bocado estranho” em “tu estavas chateado”. Cada edição lê-se como mais segura e é menos exata, e numa mensagem sobre uma relação a exatidão no grau é quase todo o conteúdo.
Três: escrevem num dialeto que as pessoas reconhecem
Todos os modelos têm tiques verbais. Há já algum tempo que quem escreve os anda a catalogar, e a partir do momento em que os vês deixa de dar para não os ver.
| Padrão | Exemplos | O que custa |
|---|---|---|
| Substantivos abstratos | testemunho, tapeçaria, farol, cacofonia | Troca um pormenor concreto por um grandioso |
| Enquadramento binário | “Não era X, era Y” / “Não por A, mas por B” | Impõe uma conclusão arrumada a uma coisa confusa |
| Interioridade declarada | “não pude deixar de sentir”, “vem de um lugar de” | Dá nome à emoção em vez de a mostrar |
| Listas de três | Três elementos onde dois chegavam | Lê-se como composto, não como escrito |
| Antítese equilibrada | Duas orações do mesmo peso, sem fim | Um ritmo que não pertence a nenhum ser humano |
Por trás da lista de vocabulário há uma preocupação maior. Estudos sobre escrita assistida por IA concluem que a intervenção do modelo empurra escritores diferentes para os mesmos padrões dominantes, o que significa que quanto mais usas estas ferramentas mais a escrita de toda a gente converge.6 Num estudo apresentado na CHI 2025, 118 pessoas da Índia e dos Estados Unidos escreveram sobre a sua própria vida e, com as sugestões de IA ligadas, a escrita dos participantes indianos derivou para estilos ocidentais.7 Para uma mensagem cujo propósito inteiro é ser inconfundivelmente tua, essa é a direção errada.
Quatro: quem recebe pode dar por isso, e isso sai-te caro
Esta é a parte que as pessoas subestimam. Existe uma linha de investigação sobre aquilo a que se chama comunicação mediada por IA, e a conclusão central é incómoda. As pessoas não são fiáveis a identificar texto escrito por IA8, e apoiam-se em pistas erradas quando tentam. Mas quando acreditam que um texto foi gerado por IA, confiam menos em quem o escreveu.9
Ou seja, o risco de uma reescrita genérica vai além de uma mensagem medíocre, até uma mensagem que se lê como falsa exatamente no momento em que a sinceridade é a carga toda. Um pedido de desculpa que dispara o detetor de IA da outra pessoa faz mais estragos do que o pedido de desculpa desajeitado que terias escrito sozinho.
Cinco: não sabem a quem estás a escrever
A menos que a memória ou um projeto tragam alguma coisa de sessões anteriores, cada sessão começa quase vazia. Para teres um bom rascunho, terias de explicar uma década de amizade, o que aconteceu em março, porque é que a frase “está tudo bem” quer dizer uma coisa muito específica entre vocês os dois. Quase ninguém faz isso, por isso o modelo escreve para um destinatário genérico. A formalidade é o que recebes quando um sistema não sabe nada sobre a relação, e é por isso que o resultado soa tantas vezes a apoio ao cliente. Esse começo em branco é a razão pela qual o Subtext lê a conversa que colas ou capturas, e pergunta para quem é uma mensagem quando um rascunho confronta alguém.
Há ainda a parte que as pessoas dizem baixinho. Colar uma captura de ecrã de uma discussão, ou o rascunho de um fim de relação, ou uma mensagem sobre a tua família num chatbot genérico não é a mesma coisa que lhe pedir para corrigir código. Esse instinto não é paranoia.
O que os romancistas fizeram quanto a isto
O que se segue é o que me convenceu de que esta falha é real, e não uma coisa que inventei para ter algo para vender.
Quem escreve ficção bateu nestas falhas primeiro, com mais em jogo e em muito maior volume. Continuaram a usar os modelos, só que não em cru. Cresceu por cima uma camada inteira de ferramentas, incluindo ambientes como o Novelcrafter10, que te deixa montar um dicionário de clichés proibidos que ficam marcados a vermelho à medida que o texto é gerado, e correr operações dirigidas como “mostra, não contes” sobre um trecho selecionado. O Sudowrite11 faz algo parecido, com passagens dedicadas que convertem resumo em pormenor sensorial concreto.
Os utilizadores mais sérios vão mais longe e montam pipelines com vários modelos. Um modelo para notas de desenvolvimento e análise de subtexto, um segundo para revisão de linha sob restrições apertadas, uma passagem de filtragem para limpar vocabulário de IA e depois uma passagem humana para repor a voz.
São quatro ferramentas e uma checklist para rever um capítulo. Funciona. E também te diz que os modelos genéricos não fazem este trabalho sozinhos, e que as pessoas que mais se importam com o resultado já aceitaram isso.
Agora aplica isso a uma mensagem de telemóvel. Ninguém corre um pipeline de quatro fases antes de responder à irmã. A necessidade de uma camada mais fina é exatamente a mesma e a tolerância ao esforço é praticamente zero, e é esse o verdadeiro problema de produto. Fui ver à parte se as ferramentas de IA para reescrever mensagens funcionam mesmo em mensagens como essa.
O que uma ferramenta mais fina tem de fazer de outra maneira
Três coisas, e nenhuma delas é “escrever melhor”.
Analisar antes de reescrever. Dar nome àquilo que o rascunho está a sinalizar antes de tocar numa única palavra, tal como deveria fazer um verificador de mensagens com IA, incluindo a parte que quem escreveu não queria sinalizar. Também ajuda com a bajulação, porque uma ferramenta que começa por uma leitura compromete-se com ela antes de ter hipótese de concordar contigo. Isso não torna a leitura correta. O Subtext funciona com o mesmo tipo de modelo, por isso pressiona-o como pressionarias um amigo. Que palavras sustentam essa leitura, e de que outras formas poderiam ser recebidas?
Mostrar a distância, não a esconder. Uma versão perto do que escreveste, ao lado de uma versão feita de raiz, é mais útil do que uma única substituição polida. Vês o que mudou e decides se estás disposto a soar assim.
Ler a relação, além da mensagem. Quem é esta pessoa para ti, o que a conversa mostra que já tentaste, o que quer dizer “está tudo bem” nesta amizade em concreto.
É isso que ando a construir, por isso trata este parágrafo com isso em mente. O Subtext etiqueta a emoção do que escreveste antes de sugerir seja o que for, uma escolha de design propositadamente chata, porque o momento em que é mais útil é precisamente aquele em que menos o queres ouvir.
Exemplo ilustrativo, não é output real
está tudo bem, eu percebo, andas ocupado. deixo de insistir.
O que ias enviar. Lê-se como afastamento, e “deixo de insistir” é uma ameaça vestida de pedido de desculpa.
Olá, compreendo perfeitamente que as coisas têm andado corridas. Não te preocupes nada com hoje à noite, diz-me só quando te der mais jeito e combinamos alguma coisa.
Uma reescrita genérica. Correta, simpática, e apagou o facto de estares magoado, que era a única informação que havia no original.
está tudo bem. mas fico um bocado desiludido. prefiro dizer isso do que fingir que não é nada.
A mesma voz, mantém a mágoa, deita fora a ameaça, e não acrescenta nada que não tenhas dito.
Na prática, colas o rascunho, ou fazes um screenshot da conversa para que leia os dois lados, e ele diz o que a tua mensagem está prestes a sinalizar antes de oferecer versões que ainda soam como tu. Experimentar o Subtext no browserDigitaliza com a câmara do telemóvel para instalar.Experimentar o Subtext no browser
Onde eu continuaria a abrir o ChatGPT
Documentos longos. Email profissional. Tudo aquilo em que estar correto importa mais do que ser reconhecivelmente tu. Pesquisa, primeiros rascunhos, tradução, e aquela misericórdia muito específica de pôr palavras numa página vazia quando não consegues começar.
E um facto que joga contra o meu próprio argumento, que prefiro incluir a deixar de fora. Um estudo com perguntas médicas colocadas num fórum público12 encontrou isto.
A descoberta Os avaliadores preferiram as respostas do chatbot às respostas dos médicos em 78,6% das comparações, e classificaram as respostas do chatbot como empáticas ou muito empáticas quase dez vezes mais vezes.
Estes modelos conseguem produzir texto que se lê como caloroso, e essa capacidade é real.
O que raramente fazem sem lho pedires é dizer-te que a tua mensagem se lê como um ultimato. Fazem o ultimato fluir melhor e elogiam-te pela tua honestidade emocional. Essa distância é pequena e é quase todo o trabalho, e construí o Subtext para a fechar. Nomeia como a tua mensagem se lê antes de reescrever uma única palavra dela.
Uma nota sobre versões dos modelos. Tudo o que está acima descreve comportamentos que se mantiveram ao longo de várias gerações de cada família de modelos, e é por isso que evitei quase sempre nomear versões concretas. Estes sistemas mudam de poucos em poucos meses e qualquer texto que prenda o argumento a um número de versão está errado quando chegar o inverno.
Achas que fui injusto com o teu modelo preferido? Diz-me no LinkedIn.
Samet Durgun é cofundador do Subtext, uma app que apanha o tom emocional das tuas mensagens e as reescreve na tua voz. Vive em Berlim.
Fontes
Todos os links acima levam à fonte primária, sempre que ela existe.
- OpenAI, “Introducing Canvas,” 3 de outubro de 2024.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testou inglês, alemão, coreano e chinês nas categorias griceanas; o Gemini foi excluído por razões de acesso à API na altura.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025.
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de maio de 2025.
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, outubro de 2023.
- Investigação sobre homogeneização estilística na escrita assistida por IA, incluindo Padmakumar e He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, e Doshi e Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Agarwal, Naaman e Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
- Jakesch, Hancock e Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
- Jakesch, French, Ma, Hancock e Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Ver também Hancock, Naaman e Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funcionalidades Codex e de prompts de substituição de texto.
- Sudowrite, funcionalidades “Show, Don’t Tell” e Describe.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 avaliações; as respostas do chatbot foram preferidas em 78,6% e classificadas como empáticas ou muito empáticas 9,8 vezes mais do que as dos médicos.