ArtigosFerramentas de escrita
Alternativas ao ChatGPT para escrever: o que os três grandes fazem às tuas palavras
O ChatGPT, o Claude e o Gemini deixam qualquer texto correto. Aqui fica onde cada um deixa de o manter teu, e o que se constrói por cima.
Por Samet Durgun · Cofundador da Subtext · 12 min de leitura
Já vi alguém escrever a mesma mensagem onze vezes. Apagar. Escrever outra vez. Ler em voz alta. Mandá-la a um amigo para ter uma segunda opinião. E depois enviar uma versão encurtada que não diz quase nada.
A certa altura, a maioria das pessoas cola aquilo no ChatGPT.
O que volta é normalmente melhor. A gramática está impecável, as frases estão mais apertadas, a divagação desapareceu. E normalmente também já não é delas. A mensagem deixa de ser uma coisa escrita por uma pessoa nervosa à uma da manhã e passa a ser uma coisa escrita por um estranho competente às dez da manhã de uma terça-feira, e quem a recebe sente essa diferença mesmo quando não lhe consegue dar nome.
Faço uma app nesta área, por isso tenho um enviesamento óbvio e é bom que leias o resto com isso em mente. Prefiro ser útil a ser convincente, por isso a maior parte deste texto é sobre aquilo em que os três grandes assistentes são mesmo bons, seguido das formas concretas, e bastante documentadas, como falham quando a escrita fica pessoal.
Comecemos pelo que eles fazem bem
Se precisas que uma mensagem fique correta, mais curta, mais clara ou traduzida, os três são excelentes e o melhor é mesmo usá-los. Corrigem vírgulas mal postas, cortam aquelas aberturas em que ainda estás a limpar a garganta, transformam um parágrafo às voltas em três frases limpas e mudam de registo quando lhes mandas. O Canvas1 do ChatGPT dá-te uma superfície de edição lado a lado em vez de um muro de texto gerado outra vez do zero. O Ajuda-me a escrever do Gemini vive dentro do Gmail e do Docs, o que elimina quase toda a fricção de sequer chegar a uma ferramenta. Os Projects do Claude guardam um guia de estilo e um conjunto de documentos de referência de sessão para sessão.
Para um email de trabalho que só precisa de ser inofensivo e correto, o trabalho está feito. Podes parar de ler aqui.
O resto disto é sobre o outro tipo de mensagem. O pedido de desculpa. O limite que andas a adiar. A resposta à tua mãe. A mensagem para alguém com quem já andaste. Essa categoria comporta-se de outra maneira, e é aí que as diferenças entre estes modelos começam a contar.
Quatro coisas que uma reescrita pode estragar
A investigação sobre edição traça uma linha útil entre qualidade de superfície e fidelidade da revisão. Uma mensagem pode ficar mais lisa e ao mesmo tempo pior, porque alisar tira as partes que estavam a fazer o trabalho. Trocar “digamos que foi uma forma de o dizer” por “ela discordou frontalmente” é mais explícito e muito menos verdade.
Há mais ou menos quatro coisas em que uma revisão não pode mexer:
| O que fica intacto | O que abrange | Como os modelos o estragam |
|---|---|---|
| Factos | Nomes, datas, números, o que prometeste mesmo | Acrescentam um pormenor, endurecem um talvez num sim |
| Implícito | Ironia, delicadeza, distância, vagueza propositada | Dizem em voz alta aquilo que estava implícito |
| Voz | O teu vocabulário, o ritmo, o comprimento das frases, as manias de pontuação | Substituem tudo por um estilo de casa fluente |
| Estrutura | Aquilo com que abriste e aquilo que enterraste | Reordenam tudo para uma clareza convencional |
Todas as queixas que se seguem neste texto são uma destas quatro a falhar. Vale a pena reparar que os corretores gramaticais só verificam a primeira, e que a maioria das pessoas, ao avaliar uma reescrita de IA, também só repara na primeira.
ChatGPT: lê o ambiente e depois edita para lá do que lhe pediste
O ChatGPT é o mais intuitivo dos três em matéria de emoção quando se trata de diálogo. Dá-lhe uma cena em que duas pessoas falam de uma banalidade enquanto fogem de uma coisa dolorosa e, regra geral, ele deixa a coisa dolorosa por dizer. O que escreve tem uma cadência natural, e é bom a apanhar a dinâmica emocional que está por baixo do que foi escrito.
O problema recorrente é que ele não se aguenta na cadeira de editor. Quem descreve a forma como ele edita acaba sempre na mesma queixa: reescreve coisas que ninguém lhe pediu para tocar.
“Mesmo em frases que não tinham nada a ver com as alterações pedidas, o ChatGPT parece continuar a querer reescrever.”
Relato de utilizador sobre a forma como o ChatGPT edita2
Há dois efeitos secundários que contam para as mensagens. O primeiro é que ele arranca a especificidade. A frase que fazia do teu pedido de desculpa uma coisa tua, qualquer coisa como “sei que ficaste quarenta minutos à espera na rua”, colapsa num “sei que te deixei à espera”. Quem escreve ficção relata uma versão mais violenta do mesmo instinto: entrega três mil palavras para uma revisão de linha e recebe de volta menos de metade, mesmo tendo pedido para manter o comprimento.3
O segundo é que instruções vagas sobre tom produzem oscilações brutais em vez de ajustes.
“Muitas vezes volta com um tom formalíssimo. Dizes ‘menos formal’ e ele salta logo para o descontraído total.”
Relato de utilizador sobre controlo de tom4
E dar-lhe mais textos teus não resolve o problema da voz de forma fiável. Um autor forneceu cerca de seis mil palavras da sua própria prosa como referência e contou que o resultado continuava a “cheirar a ChatGPT”.5
Claude: cumpre o que lhe pedes e depois explica-te a ti próprio
O Claude é o mais forte dos três a fazer aquilo que lhe pediste e mais nada. Respeita restrições, não inventa pormenores e lida bem com o que se passa por dentro das pessoas, o que explica que apareça sempre que alguém quer um modelo que não tome conta do rascunho.
É também aqui que existe a coisa mais parecida com prova comparativa a sério. O MultiPragEval, um benchmark que testa compreensão pragmática em inglês, alemão, coreano e chinês, pôs o Claude 3 Opus claramente à frente do GPT-4 em implicatura e interpretação griceana, que é a forma técnica de dizer que ele era melhor a perceber o que a pessoa queria dizer, e não o que disse à letra.6 Duas ressalvas. O benchmark testa interpretação, não edição. E os modelos testados já têm várias gerações, por isso isto aponta para uma tendência de família e não para um placar atual.
O modo de falhar do Claude é o oposto do ChatGPT. Ele percebe o subtexto e depois escreve-o. Quem escreve ficção chama a isto deriva explicativa: o modelo converte o implícito em declarado, em prosa do género “o silêncio entre os dois carregava o peso não dito de anos”. Numa mensagem, isso aparece como linguagem de consultório.
Exemplo ilustrativo, não é output real
não estou chateado, só reparei que não respondeste
O que escreveste. Contido de propósito, que é o ponto todo.
Queria partilhar contigo que me tenho sentido um bocadinho magoado com a demora na tua resposta, e acho que isso vem de um lugar de valorizar mesmo muito a nossa amizade.
O subtexto passou a texto. É calmo, é bem articulado, e diz exatamente a coisa que tu estavas a escolher não dizer.
Há mais dois padrões do Claude que aparecem com frequência suficiente para contares com eles. Enfeita quando o deixas à solta, descrito por um utilizador como uma “clara melhoria na escrita com estilo” que ainda assim conseguia “carregar demasiado” no resultado.7 E é generoso com os elogios, embrulhando a crítica numa sandes de elogios.8 Este segundo é um problema a sério quando o que precisavas era de uma leitura seca sobre se a tua mensagem cai mal.
Gemini: já está onde tu estás, mau a deixar coisas por dizer
A vantagem do Gemini é a localização. Está no Gmail, está no Docs, é o assistente por omissão em muitos telemóveis Android e o plano gratuito é generoso. Não tem a mania do ChatGPT de encolher o teu texto e moraliza menos perante conteúdo difícil.
Os relatos sobre a qualidade da escrita dele estão genuinamente divididos, e acho que isso merece ser dito em vez de alisado. Há escritores experientes que o consideram o melhor dos três a criticar escrita criativa e a apanhar nuances. Outros acham que tem um estilo de casa de que não abdica.
“O problema, para mim, é o estilo de escrita, escreve como um tipo do Reddit.”
Relato de utilizador sobre o registo por omissão do Gemini9
O padrão mais relevante para mensagens pessoais é que o Gemini tem muito pouca contenção narrativa. Se há uma coisa a ser guardada, ele põe-na à vista. Os romancistas descrevem isto como pendurar um letreiro de néon a piscar por cima do pormenor que devia ficar escondido. Numa mensagem, quer dizer que aquilo que andavas a contornar com todo o cuidado acaba na segunda frase.
Os problemas que os três partilham
Um: eles concordam contigo
Este é o que mais importa, e é o mais bem documentado.
Em abril de 2025, a OpenAI lançou uma atualização que tornou o ChatGPT visivelmente mais bajulador e voltou atrás quatro dias depois. O texto deles10 dizia que o modelo “pendia para respostas excessivamente apoiantes mas pouco sinceras” e apontava a causa para dar peso a mais à aprovação imediata do utilizador. Um segundo texto11, poucos dias depois, entrou em mais pormenor sobre o que o processo de revisão deles tinha deixado passar.
O mecanismo por baixo disto não é exclusivo da OpenAI. Um estudo com cinco assistentes de topo concluiu que modelos treinados com dados de preferência humana “sacrificam com frequência a veracidade a favor de corresponder às crenças do utilizador”, porque é a concordância que é premiada.12
Agora pensa no que as pessoas perguntam mesmo a estas ferramentas. Muito poucas colam uma mensagem e pedem ajuda com a gramática. O que perguntam é alguma variação de “isto é duro de mais?” ou “estou a exagerar?”. Essa pergunta vai parar a um sistema com um enviesamento estrutural para te dizer que está tudo bem.
Um assistente genérico ajuda-te a escrever uma chantagem emocional melhor. Não te vai dizer que estás a fazer chantagem emocional.
Querias uma segunda opinião e o que recebeste foi um cúmplice com melhor pontuação.
Dois: normalizam coisas que fizeste de propósito
Os três corrigem frases truncadas, repetições, pontuação estranha, reservas e regionalismos, mesmo quando isso foram escolhas. Pedir “preservação de voz” não resolve, porque o modelo não tem maneira de saber que esquisitices são tuas e quais são erros.
Ligada a isto, e mais subtil, está a inflação semântica. Um modelo transforma “se calhar não consigo ir” em “não vou conseguir ir”, ou “achei-te um bocado estranho” em “tu estavas chateado”. Cada edição lê-se como mais segura e é menos exata, e numa mensagem sobre uma relação a exatidão no grau é quase todo o conteúdo.
Três: escrevem num dialeto que as pessoas reconhecem
Todos os modelos têm tiques verbais. Há já algum tempo que quem escreve os anda a catalogar, e a partir do momento em que os vês deixa de dar para não os ver.
| Padrão | Exemplos | O que custa |
|---|---|---|
| Substantivos abstratos | testemunho, tapeçaria, farol, cacofonia | Troca um pormenor concreto por um grandioso |
| Enquadramento binário | “Não era X, era Y” / “Não por A, mas por B” | Impõe uma conclusão arrumada a uma coisa confusa |
| Interioridade declarada | “não pude deixar de sentir”, “vem de um lugar de” | Dá nome à emoção em vez de a mostrar |
| Listas de três | Três elementos onde dois chegavam | Lê-se como composto, não como escrito |
| Antítese equilibrada | Duas orações do mesmo peso, sem fim | Um ritmo que não pertence a nenhum ser humano |
Por trás da lista de vocabulário há uma preocupação maior. Estudos sobre escrita assistida por IA concluem que a intervenção do modelo empurra escritores diferentes para os mesmos padrões dominantes, o que significa que quanto mais usas estas ferramentas mais a escrita de toda a gente converge.13 Para uma mensagem cujo propósito inteiro é ser inconfundivelmente tua, essa é a direção errada.
Quatro: quem recebe pode dar por isso, e isso sai-te caro
Esta é a parte que as pessoas subestimam. Existe uma linha de investigação sobre aquilo a que se chama comunicação mediada por IA, e a conclusão central é incómoda: as pessoas não são fiáveis a identificar texto escrito por IA14, e apoiam-se em pistas erradas quando tentam. Mas quando acreditam que um texto foi gerado por IA, confiam menos em quem o escreveu.15
Ou seja, o risco de uma reescrita genérica não é só uma mensagem medíocre. É uma mensagem que se lê como falsa exatamente no momento em que a sinceridade é a carga toda. Um pedido de desculpa que dispara o detetor de IA da outra pessoa faz mais estragos do que o pedido de desculpa desajeitado que terias escrito sozinho.
Cinco: não sabem a quem estás a escrever
Cada sessão começa vazia. Para teres um bom rascunho, terias de explicar uma década de amizade, o que aconteceu em março, porque é que a frase “está tudo bem” quer dizer uma coisa muito específica entre vocês os dois. Quase ninguém faz isso, por isso o modelo escreve para um destinatário genérico. A formalidade é o que recebes quando um sistema não sabe nada sobre a relação, e é por isso que o resultado soa tantas vezes a apoio ao cliente.
Há ainda a parte que as pessoas dizem baixinho. Colar uma captura de ecrã de uma discussão, ou o rascunho de um fim de relação, ou uma mensagem sobre a tua família num chatbot genérico não é a mesma coisa que lhe pedir para corrigir código. Esse instinto não é paranoia.
O que os romancistas fizeram quanto a isto
Aqui fica o que me convenceu de que esta falha é real e não uma coisa que inventei para ter algo para vender.
Quem escreve ficção bateu nestas falhas primeiro, com mais em jogo e em muito maior volume. A resposta não foi deixar de usar os modelos. Foi deixar de os usar em cru. Cresceu por cima uma camada inteira de ferramentas: ambientes como o Novelcrafter16, que te deixa montar um dicionário de clichés proibidos que ficam marcados a vermelho à medida que o texto é gerado, e correr operações dirigidas como “mostra, não contes” sobre um trecho selecionado. O Sudowrite17 faz algo parecido, com passagens dedicadas que convertem resumo em pormenor sensorial concreto.
Os utilizadores mais sérios vão mais longe e montam pipelines com vários modelos. Um modelo para notas de desenvolvimento e análise de subtexto, um segundo para revisão de linha sob restrições apertadas, uma passagem de filtragem para limpar vocabulário de IA e depois uma passagem humana para repor a voz. A literatura de investigação chega à mesma arquitetura pelo lado oposto, recomendando uma fase de interpretação separada antes de qualquer revisão, edições ao nível do trecho em vez de reescritas completas, e um validador a confirmar que nada fora do âmbito pedido se mexeu.18
São quatro ferramentas e uma checklist para rever um capítulo. Funciona. E também te diz alguma coisa: os modelos genéricos não fazem este trabalho sozinhos, e as pessoas que mais se importam com o resultado já aceitaram isso.
Agora aplica isso a uma mensagem de telemóvel. Ninguém corre um pipeline de quatro fases antes de responder à irmã. A necessidade de uma camada mais fina é exatamente a mesma e a tolerância ao esforço é praticamente zero, e é esse o verdadeiro problema de produto.
O que uma ferramenta mais fina tem de fazer de outra maneira
Três coisas, e nenhuma delas é “escrever melhor”.
Analisar antes de reescrever. Dar nome àquilo que o rascunho está a sinalizar antes de tocar numa única palavra, incluindo a parte que quem escreveu não queria sinalizar. A investigação aponta no mesmo sentido: identificar o que uma passagem implica e rever a partir dessa interpretação dá melhores resultados do que um “melhora isto” indiferenciado.19 Esta é também a única resposta real à bajulação, porque uma ferramenta que começa por um diagnóstico tem de dizer alguma coisa antes de ter hipótese de concordar contigo.
Mostrar a distância, não a esconder. Uma versão perto do que escreveste, ao lado de uma versão feita de raiz, é mais útil do que uma única substituição polida. Vês o que mudou e decides se estás disposto a soar assim.
Guardar a relação, não só a mensagem. Quem é esta pessoa para ti, o que já tentaste, o que quer dizer “está tudo bem” nesta amizade em concreto.
É isso que ando a construir, por isso trata este parágrafo em conformidade. O Subtext etiqueta a emoção do que escreveste antes de sugerir seja o que for, uma escolha de design propositadamente chata, porque o momento em que é mais útil é precisamente aquele em que menos o queres ouvir.
Exemplo ilustrativo, não é output real
está tudo bem, eu percebo, andas ocupado. deixo de insistir.
O que ias enviar. Lê-se como afastamento, e “deixo de insistir” é uma ameaça vestida de pedido de desculpa.
Olá, compreendo perfeitamente que as coisas têm andado corridas. Não te preocupes nada com hoje à noite, diz-me só quando te der mais jeito e combinamos alguma coisa.
Uma reescrita genérica. Correta, simpática, e apagou o facto de estares magoado, que era a única informação que havia no original.
está tudo bem. mas fico um bocado desiludido, já é a terceira vez. prefiro dizer isso do que fingir que não é nada.
A mesma voz, o mesmo comprimento, mantém a mágoa, deita fora a ameaça.
Onde eu continuaria a abrir o ChatGPT
Documentos longos. Email profissional. Tudo aquilo em que estar correto importa mais do que ser reconhecivelmente tu. Pesquisa, primeiros rascunhos, tradução, e aquela misericórdia muito específica de pôr palavras numa página vazia quando não consegues começar.
E um facto que joga contra o meu próprio argumento, que prefiro incluir a deixar de fora. Num estudo com perguntas médicas colocadas num fórum público20, os avaliadores preferiram as respostas do chatbot às respostas dos médicos em 78,6% das comparações, e classificaram as respostas do chatbot como empáticas ou muito empáticas quase dez vezes mais vezes. Estes modelos conseguem produzir texto que se lê como caloroso. Essa capacidade é real.
O que eles não fazem é dizer-te que a tua mensagem se lê como um ultimato. Fazem o ultimato fluir melhor e elogiam-te pela tua honestidade emocional. Essa distância é pequena e é quase todo o trabalho.
Uma nota sobre versões dos modelos. Tudo o que está acima descreve comportamentos que se mantiveram ao longo de várias gerações de cada família de modelos, e é por isso que evitei quase sempre nomear versões concretas. Estes sistemas mudam de poucos em poucos meses e qualquer texto que prenda o argumento a um número de versão está errado quando chegar o inverno.
Achas que fui injusto com o teu modelo preferido? Diz-me no LinkedIn.
Samet Durgun é cofundador do Subtext, uma app que apanha o tom emocional das tuas mensagens e as reescreve na tua voz. Vive em Berlim.
Fontes
Todos os links acima levam à fonte primária, sempre que ela existe.
- OpenAI, “Introducing Canvas,” 3 de outubro de 2024. openai.com
- Comentários agregados de utilizadores sobre o âmbito de edição do ChatGPT, recolhidos em fóruns públicos e reviews.
- Relatos agregados de comunidades de escrita de ficção sobre truncagem em passagens de revisão de linha.
- Comentários agregados de utilizadores sobre a sensibilidade a instruções de tom, recolhidos nas mesmas fontes.
- Relato de utilizador sobre imitação de estilo com amostras de escrita extensas, recolhido nas mesmas fontes.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testou inglês, alemão, coreano e chinês nas categorias griceanas; o Gemini foi excluído por razões de acesso à API na altura.
- Comentários agregados de utilizadores sobre o embelezamento da prosa do Claude, recolhidos nas mesmas fontes.
- Comentários de utilizadores sobre o estilo de feedback editorial do Claude, recolhidos nas mesmas fontes.
- Comentário de utilizador sobre o registo de escrita por omissão do Gemini, recolhido nas mesmas fontes.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de maio de 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, outubro de 2023. arxiv.org
- Investigação sobre homogeneização estilística na escrita assistida por IA, incluindo Padmakumar e He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, e Doshi e Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock e Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock e Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Ver também Hancock, Naaman e Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funcionalidades Codex e de prompts de substituição de texto. novelcrafter.com
- Sudowrite, funcionalidades “Show, Don’t Tell” e Describe. sudowrite.com
- Síntese de abordagens de arquitetura de produção discutidas publicamente para sistemas de revisão com restrições, incluindo edição ao nível do trecho e validação de invariância.
- Investigação sobre prompting sensível a implicaturas, que conclui que tornar explícita a intenção latente antes da geração melhora a relevância e a qualidade do resultado.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 avaliações; as respostas do chatbot foram preferidas em 78,6% e classificadas como empáticas ou muito empáticas 9,8 vezes mais do que as dos médicos. jamanetwork.com