ArticlesOutils d'écriture

Alternatives à ChatGPT pour écrire: ce que les trois grands font à vos mots

ChatGPT, Claude et Gemini savent tous rendre un texte correct. Voici où chacun cesse de le rendre vôtre, et ce que les gens bâtissent par-dessus.

Par Samet Durgun · Cofondateur de Subtext · 12 min de lecture

J’ai vu quelqu’un taper le même message onze fois. L’effacer. Le retaper. Le lire à voix haute. L’envoyer à un ami pour un deuxième avis. Puis envoyer une version raccourcie qui ne dit presque rien.

À un moment donné, la plupart des gens finissent par le coller dans ChatGPT.

Ce qui en ressort est généralement meilleur. La grammaire est propre, les phrases sont plus serrées, le radotage a disparu. C’est aussi, la plupart du temps, plus vraiment le leur. Le message passe de quelque chose qu’une personne nerveuse a écrit à 1 h du matin à quelque chose qu’un étranger compétent a écrit un mardi à 10 h, et la personne qui le reçoit sent cette différence même quand elle n’arrive pas à la nommer.

Je bâtis une application dans ce domaine, alors j’ai un biais évident et vous devriez lire la suite en le gardant en tête. Je préfère être utile plutôt que convaincant, donc l’essentiel de ce billet porte sur ce que les trois grands assistants font vraiment bien, suivi des façons précises, et plutôt bien documentées, dont ils échouent quand l’écriture devient personnelle.

Commençons par ce qu’ils font bien

Si vous avez besoin qu’un message soit grammatical, plus court, plus clair ou traduit, les trois sont excellents et vous devriez simplement les utiliser. Ils réparent les virgules qui recousent deux phrases ensemble, coupent les entrées en matière qui se raclent la gorge, transforment un paragraphe qui s’éparpille en trois phrases nettes et changent de registre sur demande. Le Canvas1 de ChatGPT vous donne une surface d’édition côte à côte au lieu d’un mur de texte régénéré. Le Help me write de Gemini vit directement dans Gmail et Docs, ce qui enlève presque toute la friction d’avoir à ouvrir un outil. Les Projects de Claude gardent un guide de style et des documents de référence d’une session à l’autre.

Pour un courriel de travail qui doit être inoffensif et correct, c’est tout le travail. Vous pouvez arrêter de lire ici.

Le reste de ce billet porte sur l’autre genre de message. Les excuses. La limite que vous évitez de poser. La réponse à votre mère. Le texto à une personne que vous avez déjà fréquentée. Cette catégorie se comporte autrement, et c’est là que les différences entre ces modèles commencent à compter.

Quatre choses qu’une réécriture peut briser

La recherche sur la révision trace une ligne utile entre la qualité de surface et la fidélité de la révision. Un message peut devenir plus lisse tout en devenant pire, parce que le lissage enlève les parties qui faisaient le travail. Remplacer « c’était une façon de le dire » par « elle était fortement en désaccord » est plus explicite et beaucoup moins vrai.

Il y a en gros quatre choses auxquelles une révision ne doit pas toucher:

Ce qui reste fixe Ce que ça couvre Comment les modèles le brisent
Les faits Noms, dates, chiffres, ce que vous avez réellement promis Ajoute un détail, durcit un peut-être en oui
L’implicite Ironie, politesse, distance, flou volontaire Énonce tout haut la chose sous-entendue
La voix Votre vocabulaire, votre rythme, la longueur de vos phrases, vos habitudes de ponctuation La remplace par un style maison fluide
La structure Ce que vous avez mis en premier et ce que vous avez enterré Réordonne le tout en quelque chose de conventionnellement plus clair

Chaque plainte plus bas dans ce billet est l’une de ces quatre choses en train de casser. À noter que les outils de grammaire ne vérifient que la première, et que la plupart des gens qui évaluent une réécriture par IA ne remarquent que la première eux aussi.

ChatGPT: il capte l’ambiance, puis déborde du mandat

ChatGPT est le plus intuitif des trois sur le plan émotionnel quand il s’agit de dialogue. Donnez-lui une scène où deux personnes discutent d’une banalité en évitant quelque chose de douloureux, et il laisse généralement la chose douloureuse non dite. Sa prose a une cadence naturelle, et il est bon pour repérer la dynamique émotionnelle sous ce qui a été écrit.

Son problème récurrent, c’est qu’il ne reste pas dans la chaise du réviseur. Les utilisateurs qui décrivent son comportement en édition retombent toujours sur la même plainte: il réécrit des choses que personne ne lui a demandé de toucher.

« Même dans des phrases qui n’avaient rien à voir avec les changements demandés, ChatGPT semble encore vouloir réécrire. »

Témoignage d’utilisateur sur le comportement d’édition de ChatGPT2

Deux effets en chaîne comptent pour les messages. Le premier: il efface la spécificité. La phrase qui faisait que vos excuses étaient les vôtres, quelque chose comme « je sais que tu as attendu dehors pendant quarante minutes », s’aplatit en « je sais que je t’ai fait attendre ». Les auteurs de fiction rapportent une version plus dure du même réflexe: ils confient trois mille mots pour une révision ligne à ligne et en reçoivent moins de la moitié, même en demandant que la longueur soit préservée.3

Le deuxième: des consignes de ton vagues produisent de grands écarts plutôt que des ajustements.

« Il revient souvent avec un ton vraiment formel. Dites “moins formel” et il s’en va complètement à l’autre bout, super relax. »

Témoignage d’utilisateur sur le contrôle du ton4

Et lui donner plus de votre écriture ne règle pas le problème de voix de façon fiable. Un auteur a fourni environ six mille mots de sa propre prose comme référence et a rapporté que le résultat « sentait encore le ChatGPT à plein nez ».5

Claude: il suit le mandat, puis vous explique à vous-même

Claude est le plus fort des trois pour faire ce que vous avez réellement demandé et rien d’autre. Il respecte les contraintes, n’invente pas de détails et manie bien l’intériorité, ce qui explique pourquoi il revient constamment quand les gens veulent un modèle qui ne prendra pas le contrôle de leur brouillon.

C’est aussi ici qu’on trouve ce qui ressemble le plus à une preuve comparative solide. MultiPragEval, un banc d’essai qui teste la compréhension pragmatique en anglais, en allemand, en coréen et en chinois, a placé Claude 3 Opus nettement devant GPT-4 sur l’implicature et l’interprétation au sens de Grice, ce qui est la façon technique de dire qu’il était meilleur pour comprendre ce que quelqu’un voulait dire plutôt que ce qu’il a littéralement dit.6 Deux réserves. Le banc d’essai teste l’interprétation, pas l’édition. Et les modèles testés datent de plusieurs générations, alors ça pointe vers une tendance de famille plutôt que vers un classement actuel.

Le mode d’échec de Claude est l’inverse de celui de ChatGPT. Il comprend le sous-texte, puis il l’écrit noir sur blanc. Les auteurs de fiction appellent ça la dérive explicative: le modèle convertit une chose sous-entendue en chose énoncée, dans une prose du genre « le silence entre eux portait le poids non dit des années ». Dans un texto, ça prend la forme du jargon de thérapie.

Exemple illustratif, pas une sortie captée

je suis pas fâché, j’ai juste remarqué que t’as pas répondu

Ce que vous avez écrit. Volontairement en retenue, et c’est justement le but.

Je veux te partager que je me suis senti un peu blessé par le délai avant d’avoir de tes nouvelles, et je pense que ça part d’un endroit où j’accorde beaucoup de valeur à notre amitié.

Le sous-texte est devenu le texte. C’est calme, articulé, et ça dit exactement la chose que vous choisissiez de ne pas dire.

Deux autres tendances de Claude reviennent assez souvent pour qu’on planifie en conséquence. Il enjolive quand on le laisse sans contraintes, ce qu’un utilisateur décrivait comme une « nette amélioration du style » qui pouvait quand même « en beurrer épais ».7 Et il est généreux en éloges, emballant la critique dans un sandwich de compliments.8 La deuxième est un vrai problème quand ce dont vous aviez besoin, c’était un avis franc sur les chances que votre message passe mal.

Gemini: déjà là où vous êtes, mauvais pour laisser les choses non dites

L’avantage de Gemini, c’est l’emplacement. Il est dans Gmail, il est dans Docs, il est l’assistant par défaut sur beaucoup de téléphones Android, et son forfait gratuit est généreux. Il n’a pas l’habitude de ChatGPT de rétrécir votre texte, et il moralise moins sur les contenus difficiles.

Les témoignages sur sa qualité d’écriture sont sincèrement partagés, et je pense que ça vaut la peine de le dire plutôt que de le lisser. Des auteurs d’expérience le classent meilleur des trois pour la critique et la nuance en écriture créative. D’autres trouvent qu’il a un style maison dont il ne se départit pas.

« Le problème pour moi, c’est le style d’écriture, il écrit comme quelqu’un sur Reddit. »

Témoignage d’utilisateur sur le registre par défaut de Gemini9

La tendance la plus pertinente pour les messages personnels: Gemini a très peu de retenue narrative. S’il y a quelque chose de retenu, il va le mettre au grand jour. Les romanciers décrivent ça comme accrocher une enseigne au néon clignotante au-dessus du détail qui devait rester caché. Dans un message, ça veut dire que la chose que vous contourniez soigneusement se retrouve dans la deuxième phrase.

Les problèmes que les trois partagent

Un: ils vous donnent raison

C’est celui qui compte le plus, et c’est le mieux documenté.

En avril 2025, OpenAI a livré une mise à jour qui rendait ChatGPT nettement plus flatteur, puis l’a retirée quatre jours plus tard. Leur propre compte rendu10 disait que le modèle « penchait vers des réponses trop encourageantes mais malhonnêtes », et attribuait la cause à un poids excessif accordé à l’approbation à court terme des utilisateurs. Un billet de suivi11 quelques jours plus tard détaillait ce que leur processus de révision avait manqué.

Le mécanisme sous-jacent n’est pas propre à OpenAI. Une recherche menée sur cinq assistants de pointe a montré que les modèles entraînés sur des données de préférences humaines « sacrifient fréquemment la vérité pour se conformer aux croyances de l’utilisateur », parce que l’accord est ce qui est récompensé.12

Maintenant, pensez à ce que les gens demandent vraiment à ces outils. Très peu de gens collent un message pour demander de l’aide en grammaire. Ils demandent une version de « est-ce que c’est trop dur? » ou « est-ce que j’exagère? ». Cette question s’en va vers un système avec un biais structurel qui le pousse à vous dire que tout est correct de votre bord.

Un assistant généraliste va vous aider à écrire un meilleur chantage émotif. Il ne vous dira pas que vous êtes en train d’en faire un.

Vous vouliez un deuxième avis, et ce que vous avez eu, c’est un endosseur avec une meilleure ponctuation.

Deux: ils normalisent ce que vous avez fait exprès

Les trois corrigent les phrases sans verbe, la répétition, la ponctuation inhabituelle, les formules prudentes et les régionalismes, y compris quand c’étaient des choix. Demander de « préserver la voix » ne règle rien, parce que le modèle n’a aucun moyen de savoir lesquelles de vos bizarreries sont à vous et lesquelles sont des erreurs.

Dans la même famille, et plus subtile, il y a l’inflation sémantique. Un modèle transforme « je pourrai peut-être pas venir » en « je ne pourrai pas venir », ou « t’avais l’air un peu off » en « tu étais fâché ». Chaque retouche paraît plus assurée et est moins exacte, et dans un message qui parle d’une relation, l’exactitude sur le degré, c’est presque tout le contenu.

Trois: ils écrivent dans un dialecte que les gens reconnaissent

Chaque modèle a ses tics verbaux. Les auteurs les cataloguent depuis un bon moment, et une fois qu’on les voit, on ne peut plus s’arrêter de les voir.

Motif Exemples Ce que ça coûte
Noms abstraits témoignage, tapisserie, phare, cacophonie Échange un détail concret contre un détail grandiose
Cadrage binaire « Ce n’était pas X, c’était Y » / « Non pas par A, mais par B » Impose une conclusion nette à quelque chose de brouillon
Intériorité énoncée « ne pouvait s’empêcher de ressentir », « ça part d’un endroit où » Nomme l’émotion au lieu de la montrer
Listes en trois temps Trois éléments là où deux suffiraient Ça se lit comme du composé plutôt que de l’écrit
Antithèse équilibrée Deux propositions de poids égal, sans fin Un rythme qui n’appartient à aucun humain

Derrière la liste de vocabulaire, il y a une inquiétude plus large. Les études sur l’écriture assistée par IA montrent que l’intervention du modèle pousse des auteurs différents vers les mêmes motifs dominants, ce qui veut dire que plus vous utilisez ces outils, plus l’écriture de tout le monde converge.13 Pour un message dont tout le but est d’être immanquablement de vous, c’est la mauvaise direction.

Quatre: l’autre peut s’en rendre compte, et ça vous coûte

C’est la partie que les gens sous-estiment. Il existe un programme de recherche sur ce qu’on appelle la communication médiée par l’IA, et sa conclusion centrale est inconfortable: les gens sont peu fiables pour identifier un texte écrit par une IA14, et ils s’appuient sur des indices boiteux quand ils essaient. Mais quand ils croient qu’un texte a été généré par une IA, ils font moins confiance à la personne qui l’a écrit.15

Le risque d’une réécriture générique n’est donc pas seulement un message médiocre. C’est un message qui sonne insincère au moment exact où la sincérité est toute la cargaison. Des excuses qui déclenchent le détecteur d’IA de quelqu’un font plus de dommage que les excuses maladroites que vous auriez écrites vous-même.

Cinq: ils ne savent pas à qui vous textez

Chaque session part à vide. Pour obtenir un bon brouillon, il faudrait expliquer une décennie d’amitié, ce qui s’est passé en mars, pourquoi la phrase « c’est correct » veut dire quelque chose de précis entre vous deux. Presque personne ne le fait, alors le modèle écrit pour un destinataire générique. La formalité, c’est ce qu’on obtient quand un système ne sait rien de la relation, et c’est pour ça que le résultat sonne si souvent comme du service à la clientèle.

Il y a aussi la partie que les gens mentionnent à voix basse. Coller la capture d’écran d’une chicane, un brouillon de rupture ou un message au sujet de votre famille dans un robot conversationnel général, ça ne fait pas le même effet que lui demander de déboguer du code. Cet instinct n’a rien de paranoïaque.

Ce que les romanciers ont fait de tout ça

Voici ce qui m’a convaincu que ce fossé est réel, et pas quelque chose que j’ai inventé pour avoir quelque chose à vendre.

Les auteurs de fiction ont frappé exactement ces échecs en premier, avec des enjeux plus élevés et un volume plus grand. Leur réponse n’a pas été d’arrêter d’utiliser les modèles. Ça a été d’arrêter de les utiliser à l’état brut. Toute une couche d’outils a poussé par-dessus: des environnements comme Novelcrafter16, qui vous laisse bâtir un dictionnaire de clichés interdits signalés en rouge à mesure que le texte se génère, et lancer des opérations ciblées comme « montre, ne raconte pas » sur une sélection surlignée. Sudowrite17 fait quelque chose de semblable avec des passes dédiées qui convertissent le résumé en détail sensoriel concret.

Les utilisateurs sérieux vont plus loin et montent des chaînes multi-modèles. Un modèle pour les notes de développement et l’analyse du sous-texte, un deuxième pour la révision ligne à ligne sous contraintes strictes, une passe de filtrage pour nettoyer le vocabulaire d’IA, puis une passe humaine pour remettre la voix. La littérature de recherche arrive à la même architecture par l’autre bout: elle recommande une étape d’interprétation distincte avant toute révision, des retouches par segments plutôt que des réécritures complètes, et un validateur qui vérifie que rien n’a bougé en dehors de la portée demandée.18

Ça fait quatre outils et une liste de vérification pour réviser un seul chapitre. Ça fonctionne. Et ça vous dit quelque chose: les modèles généraux ne font pas ce travail sans aide, et les gens qui tiennent le plus au résultat l’ont déjà accepté.

Maintenant, appliquez ça à un texto. Personne ne fait rouler une chaîne en quatre étapes avant de répondre à sa sœur. Le besoin d’une couche raffinée est identique et la tolérance à l’effort est à peu près zéro, et c’est ça, le vrai problème de produit.

Ce qu’un outil plus raffiné doit faire autrement

Trois choses, et aucune des trois n’est « mieux écrire ».

Analyser avant de réécrire. Nommer ce que le brouillon signale avant d’en toucher un mot, y compris la partie que la personne n’avait pas l’intention d’y mettre. La recherche pointe dans la même direction: identifier ce qu’un passage implique et réviser sous cette interprétation produit de meilleurs résultats qu’un simple « améliore ça » indifférencié.19 C’est aussi la seule vraie réponse à la complaisance, parce qu’un outil qui commence par un diagnostic doit dire quelque chose avant d’avoir la chance de vous donner raison.

Montrer la distance, pas la cacher. Une version proche de ce que vous avez écrit, placée à côté d’une version écrite à partir de rien, est plus utile qu’un seul remplacement poli. Vous voyez ce qui a changé et vous décidez si vous êtes prêt à sonner comme ça.

Retenir la relation, pas juste le message. Qui est cette personne pour vous, ce que vous avez déjà essayé, ce que « c’est correct » veut dire dans cette amitié précise.

C’est la chose que je bâtis, alors traitez ce paragraphe en conséquence. Subtext étiquette l’émotion dans ce que vous avez écrit avant de suggérer quoi que ce soit, un choix de conception volontairement agaçant, parce que le moment où c’est le plus utile est le moment où vous avez le moins envie de l’entendre.

Exemple illustratif, pas une sortie captée

c’est correct, je comprends, t’es occupé. je vais arrêter de demander.

Ce que vous enverriez. Ça se lit comme un retrait, et « je vais arrêter de demander » est une menace déguisée en excuse.

Salut, je comprends tout à fait que les derniers temps ont été occupés. Aucun souci pour ce soir, fais-moi simplement signe quand ça te conviendra mieux et on trouvera quelque chose.

Une réécriture générique. Grammaticale, agréable, et elle a effacé le fait que vous êtes blessé, qui était la seule information dans l’original.

c’est correct. je suis un peu déçu par contre, c’est la troisième fois. j’aime mieux le dire que de faire semblant que c’est rien.

Même voix, même longueur, la peine reste, la menace tombe.

Là où j’ouvrirais encore ChatGPT

Les longs documents. Le courriel professionnel. Tout ce qui a plus besoin d’être correct que d’être reconnaissable comme venant de vous. La recherche, les premiers jets, la traduction, et le soulagement bien particulier de voir des mots apparaître sur une page vide quand vous n’arrivez pas à commencer.

Et un fait qui joue contre mon propre argument, que je préfère inclure plutôt que taire. Dans une étude sur des questions médicales tirées d’un forum public20, les évaluateurs ont préféré les réponses du robot conversationnel à celles des médecins dans 78,6 % des comparaisons, et les ont jugées empathiques ou très empathiques à un taux presque dix fois plus élevé. Ces modèles peuvent produire du texte qui se lit comme chaleureux. Cette capacité est réelle.

Ce qu’ils ne font pas, c’est vous dire que votre message se lit comme un ultimatum. Ils vont rendre l’ultimatum plus fluide et vous féliciter pour votre honnêteté émotionnelle. Cet écart est petit, et c’est presque tout le travail.

Une note sur les versions de modèles. Tout ce qui précède décrit des comportements qui ont tenu sur plusieurs générations de chaque famille de modèles, et c’est pourquoi j’ai surtout évité de nommer des versions précises. Ces systèmes changent aux quelques mois, et tout billet qui accroche son argument à un numéro de version aura tort rendu à l’hiver.


Vous trouvez que j’ai été injuste envers votre modèle préféré? Dites-le-moi sur LinkedIn.

Samet Durgun est le cofondateur de Subtext, une application qui capte le ton émotionnel de vos messages et les réécrit dans votre propre voix. Il vit à Berlin.


Sources

Chaque lien ci-dessus mène à la source primaire quand elle existe.

  1. OpenAI, “Introducing Canvas,” 3 octobre 2024. openai.com
  2. Commentaires agrégés d’utilisateurs sur la portée des modifications de ChatGPT, rassemblés depuis des forums publics et des avis.
  3. Témoignages agrégés de communautés d’écriture de fiction sur la troncation pendant les passes de révision ligne à ligne.
  4. Commentaires agrégés d’utilisateurs sur la sensibilité aux consignes de ton, rassemblés depuis les mêmes sources.
  5. Témoignage d’utilisateur sur l’imitation de style avec des échantillons d’écriture étendus, rassemblé depuis les mêmes sources.
  6. Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. A testé l’anglais, l’allemand, le coréen et le chinois sur des catégories gricéennes; Gemini avait été exclu à l’époque pour des raisons d’accès à l’API.
  7. Commentaires agrégés d’utilisateurs sur l’embellissement de la prose par Claude, rassemblés depuis les mêmes sources.
  8. Commentaires d’utilisateurs sur le style de rétroaction éditoriale de Claude, rassemblés depuis les mêmes sources.
  9. Commentaire d’utilisateur sur le registre d’écriture par défaut de Gemini, rassemblé depuis les mêmes sources.
  10. OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 avril 2025. openai.com
  11. OpenAI, “Expanding on what we missed with sycophancy,” 2 mai 2025. openai.com
  12. Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octobre 2023. arxiv.org
  13. Recherche sur l’homogénéisation stylistique dans l’écriture assistée par IA, dont Padmakumar et He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, et Doshi et Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
  14. Jakesch, Hancock et Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
  15. Jakesch, French, Ma, Hancock et Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Voir aussi Hancock, Naaman et Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
  16. Novelcrafter, fonctions Codex et invites de remplacement de texte. novelcrafter.com
  17. Sudowrite, fonctions “Show, Don’t Tell” et Describe. sudowrite.com
  18. Synthèse d’approches d’architecture de production discutées publiquement pour des systèmes de révision sous contraintes, incluant la retouche par segments et la validation d’invariance.
  19. Recherche sur les invites sensibles à l’implicature, montrant que rendre l’intention latente explicite avant la génération améliore la pertinence et la qualité du résultat.
  20. Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 avril 2023. 585 évaluations; réponses du robot conversationnel préférées dans 78,6 % des cas et jugées empathiques ou très empathiques à un taux 9,8 fois plus élevé que celles des médecins. jamanetwork.com