ArticlesOutils d'écriture
Alternatives à ChatGPT pour écrire : ce que les trois grands font à vos mots
ChatGPT, Claude et Gemini savent tous rendre un texte correct. Voici où chacun cesse d'en faire le vôtre, et ce qu'on construit par-dessus.
Par Samet Durgun · Cofondateur de Subtext · 12 min de lecture
J’ai vu quelqu’un taper le même message onze fois. L’effacer. Le retaper. Le lire à voix haute. L’envoyer à un ami pour avoir un deuxième avis. Puis envoyer une version raccourcie qui ne dit presque plus rien.
À un moment, la plupart des gens le collent dans ChatGPT.
Ce qui en ressort est généralement meilleur. La grammaire est propre, les phrases sont plus serrées, les digressions ont disparu. Et généralement, ce n’est plus le leur. Le message passe de quelque chose qu’une personne anxieuse a écrit à 1 heure du matin à quelque chose qu’un inconnu compétent a écrit un mardi à 10 heures, et la personne qui le reçoit sent cette différence même quand elle ne sait pas la nommer.
Je développe une app dans ce domaine, j’ai donc un biais évident et vous devriez lire la suite en le gardant en tête. Je préfère être utile plutôt que convaincant, donc l’essentiel de cet article porte sur ce que les trois grands assistants font réellement bien, suivi des façons précises, et plutôt bien documentées, dont ils échouent quand l’écriture devient personnelle.
Commençons par ce qu’ils font bien
Si vous avez besoin qu’un message soit grammatical, plus court, plus clair ou traduit, les trois sont excellents et vous devriez simplement les utiliser. Ils corrigent les virgules mal placées, coupent les préambules qui tournent autour du pot, transforment un paragraphe qui s’éparpille en trois phrases nettes, et changent de registre à la demande. Canvas1 de ChatGPT vous donne une surface d’édition côte à côte au lieu d’un mur de texte régénéré. Help me write de Gemini vit directement dans Gmail et Docs, ce qui supprime l’essentiel de la friction d’accès à l’outil. Les Projects de Claude conservent un guide de style et des documents de référence d’une session à l’autre.
Pour un e-mail de travail qui doit être correct et inoffensif, c’est tout le travail. Vous pouvez arrêter de lire ici.
La suite concerne l’autre type de message. Les excuses. La limite que vous repoussez depuis des semaines. La réponse à votre mère. Le texto à quelqu’un que vous avez aimé. Cette catégorie se comporte différemment, et c’est là que les différences entre ces modèles commencent à compter.
Quatre choses qu’une réécriture peut casser
La recherche sur l’édition trace une ligne utile entre qualité de surface et fidélité de révision. Un message peut devenir plus fluide en devenant pire, parce que le lissage supprime les parties qui faisaient le travail. Remplacer « c’était une façon de présenter les choses » par « elle était fermement en désaccord » est plus explicite et bien moins vrai.
Il y a en gros quatre choses qu’une révision doit laisser tranquilles :
| Ce qui doit rester fixe | Ce que ça couvre | Comment les modèles le cassent |
|---|---|---|
| Les faits | Les noms, les dates, les chiffres, ce que vous avez réellement promis | Ajoute un détail, durcit un peut-être en oui |
| L’implicite | L’ironie, la politesse, la distance, le flou volontaire | Énonce noir sur blanc ce qui était sous-entendu |
| La voix | Votre vocabulaire, votre rythme, la longueur de vos phrases, vos habitudes de ponctuation | La remplace par un style maison bien fluide |
| La structure | Ce que vous avez mis en premier et ce que vous avez enterré | Réordonne le tout en quelque chose de plus conventionnel |
Chaque reproche cité plus bas dans cet article est l’un de ces quatre points en train de lâcher. Notez que les outils de grammaire ne vérifient que le premier, et que la plupart des gens qui évaluent une réécriture par IA ne remarquent, eux aussi, que le premier.
ChatGPT : il lit l’ambiance, puis déborde de la consigne
ChatGPT est le plus intuitif des trois sur le plan émotionnel quand il s’agit de dialogue. Donnez-lui une scène où deux personnes discutent de choses banales en évitant un sujet douloureux, et il laisse généralement la chose douloureuse non dite. Sa prose a une cadence naturelle, et il repère bien la dynamique émotionnelle sous ce qui est écrit.
Son problème récurrent, c’est qu’il ne reste pas à sa place d’éditeur. Les utilisateurs qui décrivent son comportement en édition retombent toujours sur la même plainte : il réécrit des choses que personne ne lui a demandé de toucher.
« Même dans des phrases sans rapport avec les changements demandés, ChatGPT semble toujours vouloir réécrire. »
Témoignage d’utilisateur sur le comportement d’édition de ChatGPT2
Deux effets en cascade comptent pour les messages. Le premier, c’est qu’il gomme la spécificité. La ligne qui rendait vos excuses vôtres, quelque chose comme « je sais que tu as attendu dehors pendant quarante minutes », s’effondre en « je sais que je t’ai fait attendre ». Les auteurs de fiction rapportent une version plus dure du même réflexe : ils confient trois mille mots pour une révision ligne à ligne et en récupèrent moins de la moitié, alors qu’ils avaient demandé de préserver la longueur.3
Le second, c’est que les consignes de ton vagues produisent des embardées plutôt que des ajustements.
« Il revient souvent avec un ton très formel. Dites “moins formel” et il bascule à fond dans le super décontracté. »
Témoignage d’utilisateur sur le contrôle du ton4
Et lui donner davantage de vos textes ne règle pas le problème de voix de façon fiable. Un auteur a fourni environ six mille mots de sa propre prose comme référence et a rapporté que le résultat « sentait toujours ChatGPT à plein nez ».5
Claude : il suit la consigne, puis vous explique à vous-même
Claude est le plus fort des trois pour faire ce que vous avez réellement demandé et rien d’autre. Il respecte les contraintes, n’invente pas de détails, et gère bien l’intériorité, ce qui explique qu’il revienne sans cesse quand les gens cherchent un modèle qui ne s’empare pas de leur brouillon.
C’est aussi ici qu’on trouve ce qui ressemble le plus à une preuve comparative solide. MultiPragEval, un benchmark qui teste la compréhension pragmatique en anglais, en allemand, en coréen et en chinois, a placé Claude 3 Opus nettement devant GPT-4 sur l’implicature et l’interprétation gricéenne, la façon technique de dire qu’il devinait mieux ce que quelqu’un voulait dire plutôt que ce qu’il a littéralement dit.6 Deux réserves. Le benchmark teste l’interprétation, pas l’édition. Et les modèles testés datent de plusieurs générations, donc cela pointe une tendance de famille plutôt qu’un classement à jour.
Le mode d’échec de Claude est l’inverse de celui de ChatGPT. Il comprend le sous-texte, puis il l’écrit noir sur blanc. Les romanciers appellent ça la dérive d’explicitation : le modèle convertit quelque chose d’implicite en quelque chose d’énoncé, dans une prose du genre « le silence entre eux portait le poids muet des années ». Dans un texto, ça donne du jargon de psy.
Exemple illustratif, pas une sortie capturée
je suis pas vexé, j’ai juste vu que t’avais pas répondu
Ce que vous avez écrit. Volontairement en dessous de la réalité, et c’est exactement le but.
J’aimerais partager avec toi que je me suis senti un peu blessé de ne pas avoir eu de tes nouvelles plus tôt, et je pense que cela vient d’un endroit où j’accorde une vraie valeur à notre amitié.
Le sous-texte est devenu le texte. C’est calme, articulé, et ça dit exactement la chose que vous aviez choisi de ne pas dire.
Deux autres habitudes de Claude reviennent assez souvent pour qu’on les anticipe. Il enjolive quand on le laisse sans contraintes, ce qu’un utilisateur décrivait comme une « nette amélioration du style » qui pouvait quand même « en faire des tonnes ».7 Et il est généreux en compliments, il emballe la critique dans un sandwich d’éloges.8 Ce second point est un vrai problème quand ce qu’il vous fallait, c’était un avis brut sur la façon dont votre message va atterrir.
Gemini : déjà là où vous êtes, incapable de laisser les choses non dites
L’avantage de Gemini, c’est l’emplacement. Il est dans Gmail, il est dans Docs, il est l’assistant par défaut de beaucoup de téléphones Android, et l’offre gratuite est généreuse. Il n’a pas l’habitude de ChatGPT de raccourcir votre texte, et il moralise moins sur les contenus difficiles.
Les retours sur sa qualité d’écriture sont franchement partagés, et je préfère le dire tel quel plutôt que de le lisser. Certains auteurs expérimentés le jugent le meilleur des trois pour la critique de textes littéraires et la nuance. D’autres trouvent qu’il a un style maison dont il ne sort jamais.
« Le problème pour moi, c’est le style d’écriture, il écrit comme un redditeur. »
Témoignage d’utilisateur sur le registre par défaut de Gemini9
Le schéma le plus pertinent pour les messages personnels, c’est que Gemini n’a presque aucune retenue narrative. S’il y a quelque chose de tu, il le mettra au grand jour. Les romanciers décrivent ça comme accrocher une enseigne au néon clignotante au-dessus du détail qui devait rester caché. Dans un message, ça veut dire que la chose que vous contourniez avec précaution se retrouve dans la deuxième phrase.
Les problèmes que les trois partagent
Un : ils sont d’accord avec vous
C’est celui qui compte le plus, et c’est le mieux documenté.
En avril 2025, OpenAI a déployé une mise à jour qui rendait ChatGPT nettement plus flatteur, puis l’a retirée quatre jours plus tard. Leur propre compte rendu10 indique que le modèle « penchait vers des réponses trop complaisantes mais insincères », et en attribue la cause à une surpondération de l’approbation immédiate de l’utilisateur. Un billet de suivi11 publié quelques jours plus tard détaillait ce que leur processus de revue avait manqué.
Le mécanisme sous-jacent n’est pas propre à OpenAI. Une étude menée sur cinq assistants de pointe a montré que les modèles entraînés sur des données de préférence humaine « sacrifient fréquemment la vérité au profit de l’alignement sur les croyances de l’utilisateur », parce que c’est l’accord qui est récompensé.12
Maintenant, pensez à ce que les gens demandent réellement à ces outils. Très peu de gens collent un message pour demander une correction grammaticale. Ils demandent une variante de « c’est trop dur ? » ou « est-ce que j’exagère ? ». Cette question part vers un système structurellement biaisé pour vous répondre que tout va bien.
Un assistant généraliste vous aidera à mieux formuler votre chantage affectif. Il ne vous dira pas que c’est du chantage affectif.
Vous vouliez un deuxième avis, et ce que vous avez obtenu, c’est un complice avec une meilleure ponctuation.
Deux : ils normalisent ce que vous aviez fait exprès
Tous les trois corrigent les phrases sans verbe, les répétitions, la ponctuation inhabituelle, les précautions oratoires et les tournures régionales, y compris quand c’étaient des choix. Demander de « préserver la voix » n’y change rien, parce que le modèle n’a aucun moyen de savoir quelles bizarreries sont les vôtres et lesquelles sont des fautes.
Dans le même registre, et plus subtile, il y a l’inflation sémantique. Un modèle transforme « je risque de ne pas pouvoir venir » en « je ne pourrai pas venir », ou « tu avais l’air un peu ailleurs » en « tu étais contrarié ». Chaque retouche paraît plus assurée et est moins exacte, et dans un message qui parle d’une relation, l’exactitude sur le degré est l’essentiel du contenu.
Trois : ils écrivent dans un dialecte que les gens reconnaissent
Chaque modèle a ses tics verbaux. Les auteurs les cataloguent depuis un moment, et une fois qu’on les voit, on ne voit plus qu’eux.
| Schéma | Exemples | Ce que ça coûte |
|---|---|---|
| Noms abstraits | testament, tapisserie, phare, cacophonie | Troque un détail concret contre un mot grandiose |
| Cadrage binaire | « Ce n’était pas X, c’était Y » / « Non pas par A, mais par B » | Impose une conclusion nette à quelque chose de confus |
| Intériorité énoncée | « ne pouvait s’empêcher de ressentir », « cela vient d’un endroit où » | Nomme l’émotion au lieu de la montrer |
| Listes ternaires | Trois éléments quand deux suffisaient | Se lit comme du composé, pas comme de l’écrit |
| Antithèses équilibrées | Deux propositions de poids égal, à l’infini | Un rythme qui n’appartient à aucun humain |
Derrière la liste de vocabulaire, il y a une inquiétude plus large. Les études sur l’écriture assistée par IA montrent que l’intervention du modèle pousse des auteurs différents vers les mêmes schémas dominants, ce qui signifie que plus vous utilisez ces outils, plus l’écriture de tout le monde converge.13 Pour un message dont l’unique raison d’être est d’être indubitablement de vous, c’est la mauvaise direction.
Quatre : le destinataire peut s’en apercevoir, et ça vous coûte
C’est la partie que les gens sous-estiment. Il existe un programme de recherche sur ce qu’on appelle la communication médiée par l’IA, et sa conclusion centrale est inconfortable : les gens identifient mal les textes écrits par une IA14, et ils s’appuient sur des indices faussés quand ils essaient. Mais quand ils croient qu’un texte a été généré par une IA, ils font moins confiance à son auteur.15
Le risque d’une réécriture générique n’est donc pas seulement un message médiocre. C’est un message qui paraît insincère au moment précis où la sincérité est tout le contenu. Des excuses qui déclenchent le détecteur d’IA de quelqu’un font plus de dégâts que les excuses maladroites que vous auriez écrites vous-même.
Cinq : ils ne savent pas à qui vous écrivez
Chaque session démarre à vide. Pour obtenir un bon brouillon, il faudrait expliquer dix ans d’amitié, ce qui s’est passé en mars, pourquoi la formule « c’est bon » veut dire quelque chose de précis entre vous deux. Presque personne ne le fait, donc le modèle écrit pour un destinataire générique. La formalité, c’est ce qu’on obtient quand un système ne sait rien de la relation, et c’est pour ça que le résultat sonne si souvent comme du service client.
Il y a aussi la partie que les gens mentionnent à voix basse. Coller la capture d’écran d’une dispute, un brouillon de rupture ou un message sur votre famille dans un chatbot généraliste, ça ne fait pas le même effet que lui demander de déboguer du code. Cet instinct n’a rien de paranoïaque.
Ce que les romanciers ont fait de tout ça
Voici ce qui m’a convaincu que ce manque est réel, et pas quelque chose que j’ai inventé pour avoir quelque chose à vendre.
Les auteurs de fiction ont rencontré exactement ces échecs en premier, avec des enjeux plus élevés et à plus gros volume. Leur réponse n’a pas été d’arrêter d’utiliser les modèles. Elle a été d’arrêter de les utiliser bruts. Toute une couche d’outils a poussé par-dessus : des environnements comme Novelcrafter16, qui vous laisse construire un dictionnaire de clichés interdits, signalés en rouge pendant que le texte se génère, et lancer des opérations ciblées comme « montrer plutôt que dire » sur une sélection surlignée. Sudowrite17 fait quelque chose de similaire avec des passes dédiées qui convertissent un résumé en détail sensoriel concret.
Les utilisateurs sérieux vont plus loin et montent des pipelines multi-modèles. Un modèle pour les notes de fond et l’analyse du sous-texte, un deuxième pour la révision ligne à ligne sous contraintes strictes, une passe de filtrage pour purger le vocabulaire d’IA, puis une passe humaine pour remettre la voix. La littérature de recherche arrive à la même architecture par l’autre bout : elle recommande une étape d’interprétation séparée avant toute révision, des retouches ciblées plutôt que des réécritures complètes, et un validateur qui vérifie que rien n’a bougé en dehors du périmètre demandé.18
Ça fait quatre outils et une checklist pour réviser un chapitre. Ça marche. Et ça vous dit quelque chose : les modèles généralistes ne font pas ce travail sans aide, et les gens qui tiennent le plus au résultat l’ont déjà accepté.
Maintenant, appliquez ça à un texto. Personne ne fait tourner un pipeline en quatre étapes avant de répondre à sa sœur. Le besoin d’une couche plus fine est identique, la tolérance à l’effort est à peu près nulle, et c’est ça, le vrai problème produit.
Ce qu’un outil plus fin doit faire autrement
Trois choses, et aucune des trois n’est « écrire mieux ».
Analyser avant de réécrire. Nommer ce que le brouillon signale avant d’en toucher un mot, y compris la partie que son auteur n’avait pas voulue. La recherche pointe dans le même sens : identifier ce qu’un passage implique, puis réviser sous cette interprétation, produit de meilleurs résultats qu’un « améliore ça » indifférencié.19 C’est aussi la seule vraie réponse à la complaisance, parce qu’un outil qui commence par un diagnostic doit dire quelque chose avant d’avoir l’occasion d’être d’accord avec vous.
Montrer la distance, pas la cacher. Une version proche de ce que vous avez écrit, posée à côté d’une version écrite de zéro, est plus utile qu’un unique remplacement bien poli. Vous voyez ce qui a changé et vous décidez si vous acceptez de sonner comme ça.
Retenir la relation, pas seulement le message. Qui est cette personne pour vous, ce que vous avez déjà tenté, ce que « c’est bon » veut dire dans cette amitié précise.
C’est ce que je construis, donc lisez ce paragraphe en conséquence. Subtext étiquette l’émotion de ce que vous avez écrit avant de suggérer quoi que ce soit, un choix de conception volontairement agaçant, parce que le moment où c’est le plus utile est le moment où vous avez le moins envie de l’entendre.
Exemple illustratif, pas une sortie capturée
c’est bon, je comprends, t’es occupé. j’arrête de demander.
Ce que vous enverriez. Ça se lit comme un retrait, et « j’arrête de demander » est une menace déguisée en excuse.
Coucou, je comprends tout à fait que tu sois très occupé en ce moment. Aucun souci pour ce soir, dis-moi simplement quand ça t’arrange mieux et on trouvera un créneau.
Une réécriture générique. Grammaticale, agréable, et elle a effacé le fait que vous êtes blessé, qui était la seule information de l’original.
c’est bon. je suis un peu déçu quand même, c’est la troisième fois. je préfère te le dire plutôt que faire comme si de rien n’était.
Même voix, même longueur, la déception reste, la menace disparaît.
Là où j’ouvrirais quand même ChatGPT
Les documents longs. Les e-mails professionnels. Tout ce qui demande d’être correct plus que d’être reconnaissable. La recherche, les premiers jets, la traduction, et cette miséricorde bien particulière d’obtenir des mots sur une page vide quand vous n’arrivez pas à commencer.
Et un fait qui joue contre mon propre argument, que je préfère inclure plutôt que taire. Dans une étude sur des questions médicales issues d’un forum public20, les évaluateurs ont préféré les réponses du chatbot à celles des médecins dans 78,6 % des comparaisons, et ont jugé les réponses du chatbot empathiques ou très empathiques presque dix fois plus souvent. Ces modèles savent produire un texte qui se lit comme chaleureux. Cette capacité est réelle.
Ce qu’ils ne font pas, c’est vous dire que votre message se lit comme un ultimatum. Ils rendront l’ultimatum plus fluide et vous féliciteront pour votre honnêteté émotionnelle. Cet écart est petit, et c’est l’essentiel du travail.
Une note sur les versions des modèles. Tout ce qui précède décrit des comportements qui se sont maintenus sur plusieurs générations de chaque famille de modèles, et c’est pour ça que j’ai surtout évité de nommer des versions précises. Ces systèmes changent tous les quelques mois, et tout article qui accroche son argument à un numéro de version aura tort d’ici l’hiver.
Vous trouvez que j’ai été injuste avec votre modèle préféré ? Dites-le moi sur LinkedIn.
Samet Durgun est le cofondateur de Subtext, une app qui capte le ton émotionnel de vos messages et les réécrit avec vos mots. Il vit à Berlin.
Sources
Chaque lien ci-dessus renvoie à la source primaire quand elle existe.
- OpenAI, “Introducing Canvas,” 3 octobre 2024. openai.com
- Commentaires d’utilisateurs agrégés sur le périmètre d’édition de ChatGPT, rassemblés depuis des forums publics et des avis.
- Rapports agrégés de communautés d’écriture de fiction sur la troncation pendant les passes de révision ligne à ligne.
- Commentaires d’utilisateurs agrégés sur la sensibilité aux consignes de ton, rassemblés depuis les mêmes sources.
- Témoignage d’utilisateur sur l’imitation de style à partir d’échantillons d’écriture étendus, rassemblé depuis les mêmes sources.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testé en anglais, allemand, coréen et chinois sur les catégories gricéennes ; Gemini avait été exclu à l’époque pour des raisons d’accès à l’API.
- Commentaires d’utilisateurs agrégés sur l’enjolivement de la prose par Claude, rassemblés depuis les mêmes sources.
- Commentaires d’utilisateurs sur le style de retours éditoriaux de Claude, rassemblés depuis les mêmes sources.
- Commentaire d’utilisateur sur le registre d’écriture par défaut de Gemini, rassemblé depuis les mêmes sources.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 avril 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2 mai 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octobre 2023. arxiv.org
- Recherche sur l’homogénéisation stylistique dans l’écriture assistée par IA, dont Padmakumar et He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, et Doshi et Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock et Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock et Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Voir aussi Hancock, Naaman et Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, fonctionnalités Codex et prompts de remplacement de texte. novelcrafter.com
- Sudowrite, fonctionnalités “Show, Don’t Tell” et Describe. sudowrite.com
- Synthèse d’approches d’architecture de production largement discutées publiquement pour les systèmes de révision sous contraintes, dont la retouche ciblée et la validation d’invariance.
- Recherche sur le prompting sensible à l’implicature, montrant qu’expliciter l’intention latente avant la génération améliore la pertinence et la qualité du résultat.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 avril 2023. 585 évaluations ; réponses du chatbot préférées dans 78,6 % des cas et jugées empathiques ou très empathiques 9,8 fois plus souvent que celles des médecins. jamanetwork.com