
ArtigosFerramentas de escrita
Alternativas ao ChatGPT para escrever: o que os três grandes fazem com as suas palavras
ChatGPT, Claude e Gemini são ótimos em deixar o texto correto. Onde cada um para de deixar ele com a sua cara, e o que as pessoas constroem em cima.
Por Samet Durgun · Cofundador da Subtext · 15 min de leitura
· Atualizado em 26 de setembro de 2026
Já vi alguém digitar a mesma mensagem onze vezes, o que explica por que uma resposta de duas linhas pode tomar uma hora. Apagar. Digitar de novo. Ler em voz alta. Mandar para uma amiga pedindo uma segunda opinião. E no fim enviar uma versão encurtada que não diz quase nada.
Em algum momento, quase todo mundo acaba colando isso no ChatGPT.
O que volta costuma ser melhor. A gramática fica limpa, as frases ficam mais apertadas, a enrolação some. E também costuma deixar de ser da pessoa. A mensagem sai de algo que alguém nervoso escreveu à uma da manhã e vira algo que um estranho competente escreveu numa terça às dez, e quem recebe sente essa diferença mesmo sem conseguir dar nome a ela. Essa é a lacuna que o Subtext, o aplicativo que eu cofundei, foi feito para captar. Ele lê o que uma mensagem desse tipo está fazendo antes de você enviar.
Então tenho um viés óbvio, e vale ler o resto sabendo disso. Prefiro ser útil a ser convincente, então a maior parte deste texto é sobre o que os três grandes assistentes fazem bem, e depois sobre as formas específicas, e bem documentadas, em que eles falham quando a escrita fica pessoal. As fontes estão linkadas para você pesar minha posição contra a evidência em si.
Comece pelo que eles fazem bem
Se você precisa que uma mensagem esteja bem escrita, mais curta, mais clara ou traduzida, os três são excelentes e você deveria simplesmente usar. Eles arrumam vírgula no lugar errado, cortam aquelas aberturas de pigarro, transformam um parágrafo que dá voltas em três frases limpas e trocam de registro na hora em que você pedir. O Canvas1 do ChatGPT te dá uma superfície de edição lado a lado, em vez de um paredão de texto regenerado. O Help me write do Gemini fica dentro do Gmail e do Docs, o que elimina quase todo o atrito de chegar até uma ferramenta. Os Projects do Claude guardam um guia de estilo e um conjunto de documentos de referência de uma sessão para outra.
Para um e-mail de trabalho que só precisa ser correto e não incomodar ninguém, isso já resolve. Você pode parar de ler aqui.
O resto é sobre o outro tipo de mensagem. O pedido de desculpa. O limite que você vem adiando colocar. A resposta para a sua mãe. A mensagem para alguém com quem você já namorou. Essa categoria se comporta de outro jeito, e é aí que as diferenças entre esses modelos começam a importar.
Quatro coisas que uma reescrita pode quebrar
Acho útil separar qualidade de superfície de fidelidade da revisão. Uma mensagem pode ficar mais lisa e pior ao mesmo tempo, porque alisar tira justamente as partes que estavam fazendo o trabalho. Trocar “bom, essa é uma forma de dizer” por “ela discordou fortemente” é mais explícito e muito menos verdadeiro.
A minha lista tem quatro coisas que uma revisão tem que deixar em paz. É assim que eu avalio uma reescrita, e ninguém validou isso como escala.
| O que não se toca | O que isso inclui | Como os modelos quebram |
|---|---|---|
| Fatos | Nomes, datas, números, o que você prometeu de verdade | Acrescenta um detalhe, transforma um talvez em um sim |
| Implicação | Ironia, educação, distância, vagueza proposital | Diz na cara aquilo que estava só implícito |
| Voz | Suas palavras, seu ritmo, o tamanho das suas frases, suas manias de pontuação | Troca tudo por um estilo de casa impecável |
| Estrutura | Com o que você abriu e o que você enterrou | Reorganiza em algo convencionalmente mais claro |
Toda reclamação daqui para baixo é uma dessas quatro falhando. Eu reparo que os corretores gramaticais só checam a primeira, e que quase todo mundo que avalia uma reescrita feita por IA também só repara na primeira.
ChatGPT lê o clima e depois edita além do combinado
O ChatGPT é o mais intuitivo dos três na parte emocional quando o assunto é diálogo. Dê a ele uma cena em que duas pessoas conversam sobre algo banal enquanto desviam de algo que dói, e ele em geral deixa a parte que dói sem ser dita. O que ele escreve tem uma cadência natural, e ele é bom em perceber a dinâmica emocional que está embaixo do que foi escrito.
O problema recorrente dele é que não fica na cadeira do editor. Quem descreve o jeito dele de editar sempre chega na mesma reclamação, a de que ele reescreve coisas que ninguém pediu para ele tocar.
Dois efeitos colaterais importam quando o assunto é mensagem. O primeiro é que ele tira a especificidade. A frase que fazia o seu pedido de desculpa ser seu, algo como “eu sei que você ficou quarenta minutos esperando na calçada”, desaba em “eu sei que te deixei esperando”. Quem escreve ficção relata em fóruns online uma versão mais bruta do mesmo instinto. Pede uma revisão de estilo que mantenha o tamanho e recebe de volta um capítulo bem mais curto.
O segundo é que instruções de tom vagas produzem guinadas quando você queria um ajuste. Um relato comum é que ele volta com um tom bem formal, e um pedido de menos formal faz ele ir direto para o super de boa.
E dar mais textos seus para ele não resolve o problema da voz de forma confiável. Quem cola milhares de palavras da própria prosa como referência ainda relata resultados que soam como ChatGPT.
Claude cumpre o combinado e depois explica você para você mesmo
O Claude é o mais forte dos três em fazer o que você pediu e nada além disso. Ele respeita as restrições, não inventa detalhes e lida bem com o mundo interno dos personagens, e é por isso que ele aparece toda hora quando alguém quer um modelo que não sequestre o rascunho.
Aqui também está a coisa mais próxima de evidência comparativa dura. O MultiPragEval, um benchmark que testa compreensão pragmática em inglês, alemão, coreano e chinês, colocou o Claude 3 Opus claramente à frente do GPT-4 em implicatura e interpretação griceana, que é o jeito técnico de dizer que ele era melhor em descobrir o que a pessoa quis dizer, e não o que ela disse literalmente.2 Eu apontaria duas ressalvas. O benchmark testa interpretação, não edição. E os modelos testados já têm várias gerações de idade, então isso aponta para uma tendência de família, não para um placar atual.
O modo de falha do Claude é o oposto do ChatGPT. Ele entende o subtexto e aí escreve ele por extenso. Quem escreve ficção chama isso de deriva explicativa: o modelo converte o que estava insinuado em algo dito, em frases do tipo “o silêncio entre os dois carregava o peso não dito de anos”. Numa mensagem de celular, isso aparece como fala de terapia.
Exemplo ilustrativo, não uma resposta real
não tô chateado, só reparei que você não respondeu
O que você escreveu. Deliberadamente contido, e é justamente esse o ponto.
Queria te dizer que eu tenho me sentido um pouco magoado com a demora da sua resposta, e acho que isso vem de um lugar de valorizar muito a nossa amizade.
O subtexto agora virou texto. Está calmo, bem articulado, e diz exatamente aquilo que você estava escolhendo não dizer.
Mais dois padrões do Claude aparecem com frequência suficiente para você já contar com eles. Ele enfeita quando fica solto, e usuários descrevem a prosa como mais estilosa e às vezes exagerada. E ele é generoso no elogio, muitas vezes embrulhando a crítica num sanduíche de gentilezas. Esse segundo é um problema de verdade quando o que você precisava era uma leitura sem anestesia sobre se a sua mensagem vai cair mal.
Gemini já está onde você está, e péssimo em deixar coisas não ditas
A vantagem do Gemini é o lugar. Ele está no Gmail, está no Docs, é o assistente padrão em um monte de celular Android, e o plano gratuito é generoso. Ele não tem a mania do ChatGPT de encolher o seu texto, e moraliza menos com assunto difícil.
Os relatos sobre a qualidade da escrita dele são divididos, e acho que vale dizer isso claramente. Alguns escritores experientes consideram ele o melhor dos três em crítica de escrita criativa e em nuance. Outros acham que ele tem um estilo de casa do qual não abre mão, com um tom de conversa que alguns comparam a um comentário do Reddit.
O padrão mais relevante para mensagens pessoais é que o Gemini tem pouquíssima contenção narrativa. Se tem alguma coisa sendo segurada, ele põe tudo à mostra. Os romancistas descrevem isso como pendurar um letreiro de neon piscando em cima do detalhe que deveria continuar escondido. Numa mensagem, isso quer dizer que aquilo que você estava contornando com todo o cuidado acaba aparecendo na segunda frase.
Os problemas que os três têm em comum
Um: eles concordam com você
Esse é o que mais importa, e é o mais bem documentado.
Em abril de 2025 a OpenAI lançou uma atualização que deixou o ChatGPT visivelmente mais bajulador, e voltou atrás quatro dias depois. O texto deles mesmos3 diz que o modelo “pendeu para respostas excessivamente acolhedoras, mas insinceras”, e apontou a causa: peso demais na aprovação imediata do usuário. Um post seguinte4, poucos dias depois, detalhou melhor o que o processo de revisão deles tinha deixado passar.
O mecanismo por trás disso não é exclusividade da OpenAI. Uma pesquisa com cinco assistentes de ponta mostrou que modelos treinados com dados de preferência humana “sacrificam a verdade com frequência para bater com as crenças do usuário”, porque a concordância é o que recebe recompensa.5
Agora pense no que as pessoas de fato pedem para essas ferramentas. Quase ninguém cola uma mensagem pedindo ajuda com gramática. Elas perguntam alguma versão de “isso está duro demais?” ou “eu estou exagerando?”, a pergunta que eu desmonto em “Essa mensagem soa mal-educada?”. Essa pergunta vai para um sistema com um viés estrutural na direção de te dizer que está tudo certo.
Um assistente genérico vai te ajudar a escrever uma chantagem emocional melhor. Muitas vezes ele não vai comentar que você está fazendo chantagem emocional.
Você queria uma segunda opinião e o que recebeu foi alguém assinando embaixo, com uma pontuação melhor.
De tudo nesta página, essa é a falha que o Subtext foi construído para combater mais diretamente, e a solução que eu escolhi é estrutural. Vou voltar nisso.
Dois: eles normalizam coisas que você fez de propósito
Os três corrigem frases pela metade, repetição, pontuação fora do padrão, rodeios e dialeto, inclusive quando tudo isso era escolha sua. Pedir para “preservar a voz” não resolve, porque o modelo não tem como saber quais esquisitices são suas e quais são erro.
Ligada a isso, e mais sutil, está a inflação semântica. O modelo transforma “talvez eu não consiga ir” em “não vou conseguir ir”, ou “você me pareceu meio estranho” em “você estava chateado”. Cada edição soa mais segura e é menos exata, e numa mensagem sobre um relacionamento, a exatidão do grau é quase todo o conteúdo.
Três: eles escrevem num dialeto que as pessoas reconhecem
Todo modelo tem cacoetes. Quem escreve vem catalogando eles faz um tempo, e depois que você enxerga não consegue mais parar.
| Padrão | Exemplos | O que isso custa |
|---|---|---|
| Substantivos abstratos | testemunho, tapeçaria, farol, sinfonia | Troca um detalhe concreto por um detalhe grandioso |
| Enquadramento binário | “Não era X, era Y” / “Não por A, mas por B” | Impõe uma conclusão redondinha a algo bagunçado |
| Interioridade declarada | “não pude deixar de sentir”, “vem de um lugar de” | Dá nome à emoção em vez de mostrar ela |
| Listas de três | Três itens onde dois bastariam | Soa composto, e não escrito |
| Antítese equilibrada | Duas orações de peso igual, sem parar nunca | Um ritmo que não pertence a nenhum ser humano |
Tem uma preocupação maior por trás dessa lista de vocabulário. Estudos sobre escrita assistida por IA mostram que a intervenção do modelo empurra escritores diferentes para os mesmos padrões dominantes, o que significa que quanto mais você usa essas ferramentas, mais a escrita de todo mundo converge.6 Num estudo apresentado na CHI 2025, 118 pessoas da Índia e dos Estados Unidos escreveram sobre a própria vida e, com as sugestões de IA ligadas, a escrita dos participantes indianos foi puxada para estilos ocidentais.7 Para uma mensagem cujo propósito inteiro é ser inconfundivelmente sua, essa é a direção errada.
Quatro: quem recebe pode perceber, e isso te custa caro
Essa é a parte que as pessoas subestimam. Existe uma linha de pesquisa sobre o que se chama de comunicação mediada por IA, e a descoberta central dela é incômoda. As pessoas não são confiáveis para identificar texto escrito por IA8, e se apoiam em pistas furadas quando tentam. Mas quando elas acreditam que um texto foi gerado por IA, confiam menos em quem escreveu.9
Então o risco de uma reescrita genérica vai além de uma mensagem mediana, para uma que soa insincera exatamente no momento em que a sinceridade é a carga inteira. Um pedido de desculpa que dispara o detector de IA da outra pessoa faz mais estrago do que o pedido de desculpa desajeitado que você teria escrito sozinho.
Cinco: eles não sabem para quem você está escrevendo
A menos que a memória ou um projeto tragam algo de antes, toda sessão começa quase vazia. Para conseguir um bom rascunho você teria que explicar uma década de amizade, o que aconteceu em março, por que a frase “tá tudo bem” significa uma coisa específica entre vocês dois. Quase ninguém faz isso, então o modelo escreve para um destinatário genérico. Formalidade é o que sobra quando um sistema não sabe nada sobre a relação, e é por isso que o resultado tantas vezes soa como atendimento ao cliente. Esse começo em branco é a razão pela qual o Subtext lê a conversa que você cola ou captura, e pergunta para quem é uma mensagem quando um rascunho confronta alguém.
Tem também a parte que as pessoas comentam baixinho. Colar o print de uma briga, ou o rascunho de um término, ou uma mensagem sobre a sua família num chatbot de uso geral é diferente de pedir para ele achar um bug no código. Esse instinto não é paranoia.
O que os romancistas fizeram com tudo isso
O que vem a seguir é o que me convenceu de que essa lacuna é real, e não algo que eu inventei para ter o que vender.
Quem escreve ficção bateu nessas mesmas falhas antes de todo mundo, com mais em jogo e muito mais volume. Eles continuaram usando os modelos, só que não crus. Cresceu uma camada inteira de ferramentas em cima, incluindo ambientes como o Novelcrafter10, que deixa você montar um dicionário de clichês proibidos que aparecem marcados em vermelho enquanto o texto é gerado, e rodar operações específicas como “mostre, não conte” num trecho selecionado. O Sudowrite11 faz algo parecido, com passadas dedicadas que convertem resumo em detalhe sensorial concreto.
Os usuários mais sérios vão além e montam esteiras com vários modelos. Um modelo para as notas de estrutura e a análise de subtexto, um segundo para a revisão de estilo sob restrições rígidas, uma passada de filtro para limpar o vocabulário de IA, e no fim uma passada humana para devolver a voz.
São quatro ferramentas e uma lista de checagem para revisar um capítulo. Funciona. E também diz que os modelos generalistas não dão conta desse trabalho sozinhos, e que quem mais se importa com o resultado já aceitou isso.
Agora aplique isso a uma mensagem de celular. Ninguém roda uma esteira de quatro etapas antes de responder à irmã. A necessidade de uma camada mais refinada é idêntica e a tolerância a esforço é basicamente zero, e esse é o problema de produto de verdade. Eu fui ver separadamente se os reescritores de IA para mensagens realmente funcionam em mensagens desse tipo.
O que uma ferramenta mais refinada precisa fazer de diferente
Três coisas, e nenhuma delas é “escrever melhor”.
Analisar antes de reescrever. Dar nome ao que o rascunho está sinalizando antes de tocar numa palavra, do jeito que um verificador de mensagens com IA deveria fazer, inclusive a parte que quem escreveu não pretendia. Isso também ajuda com a bajulação, porque uma ferramenta que começa por uma leitura se compromete com ela antes de ter chance de concordar com você. Isso não faz a leitura estar certa. O Subtext roda no mesmo tipo de modelo, então pressione como você pressionaria um amigo. Quais palavras sustentam essa leitura, e de que outro jeito elas poderiam ser recebidas?
Mostrar a distância, e não escondê-la. Uma versão perto do que você escreveu, ao lado de uma versão escrita do zero, é mais útil do que um único substituto polido. Você vê o que mudou e decide se topa soar assim.
Ler a relação, assim como a mensagem. Quem essa pessoa é para você, o que a conversa mostra que você já tentou, o que “tá tudo bem” significa nessa amizade específica.
É isso que eu estou construindo, então trate este parágrafo de acordo. O Subtext marca a emoção do que você escreveu antes de sugerir qualquer coisa, o que é uma escolha de design propositalmente incômoda, porque o momento em que ele é mais útil é justamente o momento em que você menos quer ouvir.
Exemplo ilustrativo, não uma resposta real
tá tudo bem, eu entendo, você tá ocupado. não pergunto mais.
O que você mandaria. Soa como afastamento, e “não pergunto mais” é uma ameaça vestida de pedido de desculpa.
Oi, entendo perfeitamente que as coisas andaram corridas por aí. Sobre hoje à noite, não tem problema nenhum, é só me avisar quando for melhor pra você que a gente se organiza.
Uma reescrita genérica. Correta, simpática, e apagou o fato de que você ficou magoado, que era a única informação do original.
tá tudo bem. mas fiquei um pouco chateado. prefiro te falar isso do que fingir que não é nada.
Mesma voz, mantém a mágoa, larga a ameaça e não acrescenta nada que você não tenha dito.
Na prática, você cola o rascunho ou tira um print da conversa para que ele leia os dois lados, e ele nomeia o que sua mensagem está para sinalizar antes de oferecer versões que ainda soam como você. Experimente o Subtext no navegadorEscaneie com a câmera do celular para instalar.Experimente o Subtext no navegador
Onde eu ainda abriria o ChatGPT
Documentos longos. E-mail profissional. Qualquer coisa em que estar correto importa mais do que ser reconhecidamente você. Pesquisa, primeiros rascunhos, tradução, e aquela misericórdia bem específica de colocar palavras numa página em branco quando você não consegue começar.
E um dado que joga contra o meu próprio argumento, que eu prefiro incluir a deixar de fora. Um estudo com perguntas médicas de um fórum público12 encontrou isto.
O achado Os avaliadores preferiram as respostas do chatbot às dos médicos em 78,6% das comparações, e classificaram as respostas do chatbot como empáticas ou muito empáticas quase dez vezes mais.
Esses modelos conseguem produzir texto que soa acolhedor, e essa capacidade é real.
O que eles raramente fazem sem você pedir é te dizer que a sua mensagem soa como um ultimato. Eles vão deixar o ultimato mais fluido e ainda te elogiar pela sua honestidade emocional. Essa lacuna é pequena e é quase todo o trabalho, e eu construí o Subtext para fechar ela. Ele nomeia como sua mensagem soa antes de reescrever uma única palavra dela.
Uma nota sobre as versões dos modelos. Tudo o que está acima descreve comportamentos que se mantiveram ao longo de várias gerações de cada família de modelos, e é por isso que eu evitei quase sempre citar versões específicas. Esses sistemas mudam a cada poucos meses, e qualquer texto que pendure o argumento num número de versão já vai estar errado no inverno.
Acha que fui injusto com o seu modelo favorito? Me conta no LinkedIn.
Samet Durgun é cofundador do Subtext, um aplicativo que capta o tom emocional das suas mensagens e reescreve elas com a sua própria voz. Ele mora em Berlim.
Fontes
Todos os links acima levam à fonte primária, quando ela existe.
- OpenAI, “Introducing Canvas,” 3 de outubro de 2024.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Foram testados inglês, alemão, coreano e chinês nas categorias griceanas; o Gemini ficou de fora na época por questões de acesso à API.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025.
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de maio de 2025.
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, outubro de 2023.
- Pesquisa sobre homogeneização estilística na escrita assistida por IA, incluindo Padmakumar e He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, e Doshi e Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Agarwal, Naaman e Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
- Jakesch, Hancock e Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
- Jakesch, French, Ma, Hancock e Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Veja também Hancock, Naaman e Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, recursos de Codex e de prompts de substituição de texto.
- Sudowrite, recursos “Show, Don’t Tell” e Describe.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 avaliações; as respostas do chatbot foram preferidas em 78,6% e classificadas como empáticas ou muito empáticas 9,8 vezes mais do que as respostas dos médicos.