
ArticlesOutils d'écriture
Alternatives à ChatGPT pour écrire: ce que les trois grands font à vos mots
ChatGPT, Claude et Gemini savent tous rendre un texte correct. Voici où chacun cesse de le rendre vôtre, et ce que les gens bâtissent par-dessus.
Par Samet Durgun · Cofondateur de Subtext · 16 min de lecture
· Mis à jour le 26 septembre 2026
J’ai vu quelqu’un taper le même message onze fois, ce qui explique pourquoi une réponse de deux lignes peut prendre une heure. L’effacer. Le retaper. Le lire à voix haute. L’envoyer à un ami pour un deuxième avis. Puis envoyer une version raccourcie qui ne dit presque rien.
À un moment donné, la plupart des gens finissent par le coller dans ChatGPT.
Ce qui en ressort est généralement meilleur. La grammaire est propre, les phrases sont plus serrées, le radotage a disparu. C’est aussi, la plupart du temps, plus vraiment le leur. Le message passe de quelque chose qu’une personne nerveuse a écrit à 1 h du matin à quelque chose qu’un étranger compétent a écrit un mardi à 10 h, et la personne qui le reçoit sent cette différence même quand elle n’arrive pas à la nommer. Cet écart, c’est exactement ce que Subtext, l’application que j’ai cofondée, est bâti pour repérer. Il lit ce qu’un message comme celui-là est en train de faire avant que vous l’envoyiez.
Alors j’ai un biais évident, et vous devriez lire la suite en le gardant en tête. Je préfère être utile plutôt que convaincant, donc l’essentiel de ce billet porte sur ce que les trois grands assistants font bien, suivi des façons précises, et plutôt bien documentées, dont ils échouent quand l’écriture devient personnelle. Les sources sont liées pour que vous puissiez peser ma position par rapport à la preuve vous-même.
Commençons par ce qu’ils font bien
Si vous avez besoin qu’un message soit grammatical, plus court, plus clair ou traduit, les trois sont excellents et vous devriez simplement les utiliser. Ils réparent les virgules qui recousent deux phrases ensemble, coupent les entrées en matière qui se raclent la gorge, transforment un paragraphe qui s’éparpille en trois phrases nettes et changent de registre sur demande. Le Canvas1 de ChatGPT vous donne une surface d’édition côte à côte au lieu d’un mur de texte régénéré. Le Help me write de Gemini vit directement dans Gmail et Docs, ce qui enlève presque toute la friction d’avoir à ouvrir un outil. Les Projects de Claude gardent un guide de style et des documents de référence d’une session à l’autre.
Pour un courriel de travail qui doit être inoffensif et correct, ça fait l’affaire. Vous pouvez arrêter de lire ici.
Le reste de ce billet porte sur l’autre genre de message. Les excuses. La limite que vous évitez de poser. La réponse à votre mère. Le texto à une personne que vous avez déjà fréquentée. Cette catégorie se comporte autrement, et c’est là que les différences entre ces modèles commencent à compter.
Quatre choses qu’une réécriture peut briser
Je trouve utile de distinguer la qualité de surface de la fidélité de la révision. Un message peut devenir plus lisse tout en devenant pire, parce que le lissage enlève les parties qui faisaient le travail. Remplacer « c’était une façon de le dire » par « elle était fortement en désaccord » est plus explicite et beaucoup moins vrai.
Ma liste de vérification compte quatre choses auxquelles une révision ne doit pas toucher. C’est ma façon de relire une réécriture, et personne ne l’a validée comme échelle de mesure.
| Ce qui reste fixe | Ce que ça couvre | Comment les modèles le brisent |
|---|---|---|
| Les faits | Noms, dates, chiffres, ce que vous avez réellement promis | Ajoute un détail, durcit un peut-être en oui |
| L’implicite | Ironie, politesse, distance, flou volontaire | Énonce tout haut la chose sous-entendue |
| La voix | Votre vocabulaire, votre rythme, la longueur de vos phrases, vos habitudes de ponctuation | La remplace par un style maison fluide |
| La structure | Ce que vous avez mis en premier et ce que vous avez enterré | Réordonne le tout en quelque chose de conventionnellement plus clair |
Chaque plainte plus bas dans ce billet est l’une de ces quatre choses en train de casser. Je remarque que les outils de grammaire ne vérifient que la première, et que la plupart des gens qui évaluent une réécriture par IA ne remarquent que la première eux aussi.
ChatGPT capte l’ambiance, puis déborde du mandat
ChatGPT est le plus intuitif des trois sur le plan émotionnel quand il s’agit de dialogue. Donnez-lui une scène où deux personnes discutent d’une banalité en évitant quelque chose de douloureux, et il laisse généralement la chose douloureuse non dite. Sa prose a une cadence naturelle, et il est bon pour repérer la dynamique émotionnelle sous ce qui a été écrit.
Son problème récurrent, c’est qu’il ne reste pas dans la chaise du réviseur. Les utilisateurs qui décrivent son comportement en édition retombent toujours sur la même plainte, à savoir qu’il réécrit des choses que personne ne lui a demandé de toucher.
Deux effets en chaîne comptent pour les messages. Le premier: il efface la spécificité. La phrase qui faisait que vos excuses étaient les vôtres, quelque chose comme « je sais que tu as attendu dehors pendant quarante minutes », s’aplatit en « je sais que je t’ai fait attendre ». Sur des forums en ligne, des auteurs de fiction rapportent une version plus dure du même réflexe. Ils demandent une révision ligne à ligne qui garde la longueur et reçoivent un chapitre beaucoup plus court.
Le deuxième: des consignes de ton vagues produisent de grands écarts là où vous vouliez un ajustement. Un témoignage courant, c’est qu’il revient avec un ton très formel, et qu’une seule demande pour un ton moins formel l’envoie complètement à l’autre bout, très relax.
Et lui donner plus de votre écriture ne règle pas le problème de voix de façon fiable. Des auteurs qui collent des milliers de mots de leur propre prose comme référence rapportent quand même un résultat qui sonne comme du ChatGPT.
Claude suit le mandat, puis vous explique à vous-même
Claude est le plus fort des trois pour faire ce que vous avez demandé et rien d’autre. Il respecte les contraintes, n’invente pas de détails et manie bien l’intériorité, ce qui explique pourquoi il revient constamment quand les gens veulent un modèle qui ne prendra pas le contrôle de leur brouillon.
C’est aussi ici qu’on trouve ce qui ressemble le plus à une preuve comparative solide. MultiPragEval, un banc d’essai qui teste la compréhension pragmatique en anglais, en allemand, en coréen et en chinois, a placé Claude 3 Opus nettement devant GPT-4 sur l’implicature et l’interprétation au sens de Grice, ce qui est la façon technique de dire qu’il était meilleur pour comprendre ce que quelqu’un voulait dire plutôt que ce qu’il a littéralement dit.2 Je voudrais signaler deux réserves. Le banc d’essai teste l’interprétation, pas l’édition. Et les modèles testés datent de plusieurs générations, alors ça pointe vers une tendance de famille, pas vers un classement actuel.
Le mode d’échec de Claude est l’inverse de celui de ChatGPT. Il comprend le sous-texte, puis il l’écrit noir sur blanc. Les auteurs de fiction appellent ça la dérive explicative: le modèle convertit une chose sous-entendue en chose énoncée, dans une prose du genre « le silence entre eux portait le poids non dit des années ». Dans un texto, ça prend la forme du jargon de thérapie.
Exemple illustratif, pas une sortie captée
je suis pas fâché, j’ai juste remarqué que t’as pas répondu
Ce que vous avez écrit. Volontairement en retenue, et c’est justement le but.
Je veux te partager que je me suis senti un peu blessé par le délai avant d’avoir de tes nouvelles, et je pense que ça part d’un endroit où j’accorde beaucoup de valeur à notre amitié.
Le sous-texte est devenu le texte. C’est calme, articulé, et ça dit exactement la chose que vous choisissiez de ne pas dire.
Deux autres tendances de Claude reviennent assez souvent pour qu’on planifie en conséquence. Il enjolive quand on le laisse sans contraintes, et des utilisateurs décrivent une prose plus stylée qui en beurre parfois épais. Et il est généreux en éloges, emballant souvent la critique dans un sandwich de compliments. La deuxième est un vrai problème quand ce dont vous aviez besoin, c’était un avis franc sur les chances que votre message passe mal.
Gemini est déjà là où vous êtes, et mauvais pour laisser les choses non dites
L’avantage de Gemini, c’est l’emplacement. Il est dans Gmail, il est dans Docs, il est l’assistant par défaut sur beaucoup de téléphones Android, et son forfait gratuit est généreux. Il n’a pas l’habitude de ChatGPT de rétrécir votre texte, et il moralise moins sur les contenus difficiles.
Les témoignages sur sa qualité d’écriture sont partagés, et je pense que ça vaut la peine de le dire sans détour. Des auteurs d’expérience le classent meilleur des trois pour la critique et la nuance en écriture créative. D’autres trouvent qu’il a un style maison dont il ne se départit pas, avec un registre jasant que certains comparent à un commentaire sur Reddit.
La tendance la plus pertinente pour les messages personnels: Gemini a très peu de retenue narrative. S’il y a quelque chose de retenu, il va le mettre au grand jour. Les romanciers décrivent ça comme accrocher une enseigne au néon clignotante au-dessus du détail qui devait rester caché. Dans un message, ça veut dire que la chose que vous contourniez soigneusement se retrouve dans la deuxième phrase.
Les problèmes que les trois partagent
Un: ils vous donnent raison
C’est celui qui compte le plus, et c’est le mieux documenté.
En avril 2025, OpenAI a livré une mise à jour qui rendait ChatGPT nettement plus flatteur, puis l’a retirée quatre jours plus tard. Leur propre compte rendu3 disait que le modèle « penchait vers des réponses trop encourageantes mais malhonnêtes », et attribuait la cause à un poids excessif accordé à l’approbation à court terme des utilisateurs. Un billet de suivi4 quelques jours plus tard détaillait ce que leur processus de révision avait manqué.
Le mécanisme sous-jacent n’est pas propre à OpenAI. Une recherche menée sur cinq assistants de pointe a montré que les modèles entraînés sur des données de préférences humaines « sacrifient fréquemment la vérité pour se conformer aux croyances de l’utilisateur », parce que l’accord est ce qui est récompensé.5
Maintenant, pensez à ce que les gens demandent vraiment à ces outils. Très peu de gens collent un message pour demander de l’aide en grammaire. Ils demandent une version de « est-ce que c’est trop dur? » ou « est-ce que j’exagère? », la question que je décortique dans « Est-ce que ce texto a l’air bête? ». Cette question s’en va vers un système avec un biais structurel qui le pousse à vous dire que tout est correct de votre bord.
Un assistant généraliste va vous aider à écrire un meilleur chantage émotif. Souvent, il ne vous dira pas que vous êtes en train d’en faire un.
Vous vouliez un deuxième avis, et ce que vous avez eu, c’est un endosseur avec une meilleure ponctuation.
De tout ce qui se trouve sur cette page, c’est l’échec contre lequel Subtext est bâti le plus directement, et la solution que j’ai choisie est structurelle. Je vais y revenir.
Deux: ils normalisent ce que vous avez fait exprès
Les trois corrigent les phrases sans verbe, la répétition, la ponctuation inhabituelle, les formules prudentes et les régionalismes, y compris quand c’étaient des choix. Demander de « préserver la voix » ne règle rien, parce que le modèle n’a aucun moyen de savoir lesquelles de vos bizarreries sont à vous et lesquelles sont des erreurs.
Dans la même famille, et plus subtile, il y a l’inflation sémantique. Un modèle transforme « je pourrai peut-être pas venir » en « je ne pourrai pas venir », ou « t’avais l’air un peu off » en « tu étais fâché ». Chaque retouche paraît plus assurée et est moins exacte, et dans un message qui parle d’une relation, l’exactitude sur le degré, c’est presque tout le contenu.
Trois: ils écrivent dans un dialecte que les gens reconnaissent
Chaque modèle a ses tics verbaux. Les auteurs les cataloguent depuis un bon moment, et une fois qu’on les voit, on ne peut plus s’arrêter de les voir.
| Motif | Exemples | Ce que ça coûte |
|---|---|---|
| Noms abstraits | témoignage, tapisserie, phare, cacophonie | Échange un détail concret contre un détail grandiose |
| Cadrage binaire | « Ce n’était pas X, c’était Y » / « Non pas par A, mais par B » | Impose une conclusion nette à quelque chose de brouillon |
| Intériorité énoncée | « ne pouvait s’empêcher de ressentir », « ça part d’un endroit où » | Nomme l’émotion au lieu de la montrer |
| Listes en trois temps | Trois éléments là où deux suffiraient | Ça se lit comme du composé plutôt que de l’écrit |
| Antithèse équilibrée | Deux propositions de poids égal, sans fin | Un rythme qui n’appartient à aucun humain |
Derrière la liste de vocabulaire, il y a une inquiétude plus large. Les études sur l’écriture assistée par IA montrent que l’intervention du modèle pousse des auteurs différents vers les mêmes motifs dominants, ce qui veut dire que plus vous utilisez ces outils, plus l’écriture de tout le monde converge.6 Dans une étude CHI 2025, 118 personnes en Inde et aux États-Unis ont écrit sur leur propre vie, et avec les suggestions d’IA activées, l’écriture des participants indiens glissait vers des styles occidentaux.7 Pour un message dont tout le but est d’être immanquablement de vous, c’est la mauvaise direction.
Quatre: l’autre peut s’en rendre compte, et ça vous coûte
C’est la partie que les gens sous-estiment. Il existe un programme de recherche sur ce qu’on appelle la communication médiée par l’IA, et sa conclusion centrale est inconfortable. Les gens sont peu fiables pour identifier un texte écrit par une IA8, et ils s’appuient sur des indices boiteux quand ils essaient. Mais quand ils croient qu’un texte a été généré par une IA, ils font moins confiance à la personne qui l’a écrit.9
Le risque d’une réécriture générique dépasse donc le message médiocre et va jusqu’au message qui sonne insincère au moment exact où la sincérité est toute la cargaison. Des excuses qui déclenchent le détecteur d’IA de quelqu’un font plus de dommage que les excuses maladroites que vous auriez écrites vous-même.
Cinq: ils ne savent pas à qui vous textez
À moins qu’une mémoire ou un projet ne fasse le pont, chaque session part presque à vide. Pour obtenir un bon brouillon, il faudrait expliquer une décennie d’amitié, ce qui s’est passé en mars, pourquoi la phrase « c’est correct » veut dire quelque chose de précis entre vous deux. Presque personne ne le fait, alors le modèle écrit pour un destinataire générique. La formalité, c’est ce qu’on obtient quand un système ne sait rien de la relation, et c’est pour ça que le résultat sonne si souvent comme du service à la clientèle. Ce début vierge, c’est la raison pour laquelle Subtext lit le fil que vous collez ou dont vous prenez une capture d’écran, et demande pour qui un message est destiné quand un brouillon s’oppose à quelqu’un.
Il y a aussi la partie que les gens mentionnent à voix basse. Coller la capture d’écran d’une chicane, un brouillon de rupture ou un message au sujet de votre famille dans un robot conversationnel général, ça ne fait pas le même effet que lui demander de déboguer du code. Cet instinct n’a rien de paranoïaque.
Ce que les romanciers ont fait de tout ça
Ce qui suit m’a convaincu que ce fossé est réel, et pas quelque chose que j’ai inventé pour avoir quelque chose à vendre.
Les auteurs de fiction ont frappé exactement ces échecs en premier, avec des enjeux plus élevés et un volume plus grand. Ils ont continué d’utiliser les modèles, mais pas à l’état brut. Toute une couche d’outils a poussé par-dessus, dont des environnements comme Novelcrafter10, qui vous laisse bâtir un dictionnaire de clichés interdits signalés en rouge à mesure que le texte se génère, et lancer des opérations ciblées comme « montre, ne raconte pas » sur une sélection surlignée. Sudowrite11 fait quelque chose de semblable avec des passes dédiées qui convertissent le résumé en détail sensoriel concret.
Les utilisateurs sérieux vont plus loin et montent des chaînes multi-modèles. Un modèle pour les notes de développement et l’analyse du sous-texte, un deuxième pour la révision ligne à ligne sous contraintes strictes, une passe de filtrage pour nettoyer le vocabulaire d’IA, puis une passe humaine pour remettre la voix.
Ça fait quatre outils et une liste de vérification pour réviser un seul chapitre. Ça fonctionne. Ça vous dit aussi que les modèles généraux ne font pas ce travail sans aide, et que les gens qui tiennent le plus au résultat l’ont déjà accepté.
Maintenant, appliquez ça à un texto. Personne ne fait rouler une chaîne en quatre étapes avant de répondre à sa sœur. Le besoin d’une couche raffinée est identique et la tolérance à l’effort est à peu près zéro, et c’est ça, le vrai problème de produit. Je me suis penché séparément sur la question de savoir si les réécrits de messages par IA fonctionnent vraiment sur ce genre de messages.
Ce qu’un outil plus raffiné doit faire autrement
Trois choses, et aucune des trois n’est « mieux écrire ».
Analyser avant de réécrire. Nommer ce que le brouillon signale avant d’en toucher un mot, comme devrait le faire un vérificateur de messages par IA, y compris la partie que la personne n’avait pas l’intention d’y mettre. Ça aide aussi contre la complaisance, parce qu’un outil qui commence par une lecture s’engage sur celle-ci avant d’avoir la chance de vous donner raison. Ça ne rend pas cette lecture juste pour autant. Subtext roule sur le même genre de modèle, alors poussez-le comme vous pousseriez un ami. Quels mots appuient cette lecture, et de quelle autre façon pourraient-ils être reçus?
Montrer la distance, pas la cacher. Une version proche de ce que vous avez écrit, placée à côté d’une version écrite à partir de rien, est plus utile qu’un seul remplacement poli. Vous voyez ce qui a changé et vous décidez si vous êtes prêt à sonner comme ça.
Lire la relation en plus du message. Qui est cette personne pour vous, ce que le fil montre que vous avez déjà essayé, ce que « c’est correct » veut dire dans cette amitié précise.
C’est la chose que je bâtis, alors traitez ce paragraphe en conséquence. Subtext étiquette l’émotion dans ce que vous avez écrit avant de suggérer quoi que ce soit, un choix de conception volontairement agaçant, parce que le moment où c’est le plus utile est le moment où vous avez le moins envie de l’entendre.
Exemple illustratif, pas une sortie captée
c’est correct, je comprends, t’es occupé. je vais arrêter de demander.
Ce que vous enverriez. Ça se lit comme un retrait, et « je vais arrêter de demander » est une menace déguisée en excuse.
Salut, je comprends tout à fait que les derniers temps ont été occupés. Aucun souci pour ce soir, fais-moi simplement signe quand ça te conviendra mieux et on trouvera quelque chose.
Une réécriture générique. Grammaticale, agréable, et elle a effacé le fait que vous êtes blessé, qui était la seule information dans l’original.
c’est correct. je suis un peu déçu par contre. j’aime mieux le dire que de faire semblant que c’est rien.
Même voix, la peine reste, la menace tombe, et rien n’est ajouté que vous n’ayez pas dit.
En pratique, vous collez le brouillon, ou vous prenez une capture d’écran du fil pour qu’il se lise dans les deux sens, et il nomme ce que votre message s’apprête à signaler avant de proposer des versions qui sonnent encore comme vous. Essayer Subtext dans votre navigateurScannez-le avec l'appareil photo de votre téléphone pour installer.Essayer Subtext dans votre navigateur
Là où j’ouvrirais encore ChatGPT
Les longs documents. Le courriel professionnel. Tout ce qui a plus besoin d’être correct que d’être reconnaissable comme venant de vous. La recherche, les premiers jets, la traduction, et le soulagement bien particulier de voir des mots apparaître sur une page vide quand vous n’arrivez pas à commencer.
Et un fait qui joue contre mon propre argument, que je préfère inclure plutôt que taire. Une étude sur des questions médicales tirées d’un forum public12 a fait ce constat.
Le résultat Les évaluateurs ont préféré les réponses du robot conversationnel à celles des médecins dans 78,6 % des comparaisons, et les ont jugées empathiques ou très empathiques à un taux presque dix fois plus élevé.
Ces modèles peuvent produire du texte qui se lit comme chaleureux, et cette capacité est réelle.
Ce qu’ils font rarement sans qu’on le leur demande, c’est vous dire que votre message se lit comme un ultimatum. Ils vont rendre l’ultimatum plus fluide et vous féliciter pour votre honnêteté émotionnelle. Cet écart est petit, c’est presque tout le travail, et j’ai bâti Subtext pour le combler. Il nomme comment votre message se lit avant d’en réécrire le moindre mot.
Une note sur les versions de modèles. Tout ce qui précède décrit des comportements qui ont tenu sur plusieurs générations de chaque famille de modèles, et c’est pourquoi j’ai surtout évité de nommer des versions précises. Ces systèmes changent aux quelques mois, et tout billet qui accroche son argument à un numéro de version aura tort rendu à l’hiver.
Vous trouvez que j’ai été injuste envers votre modèle préféré? Dites-le-moi sur LinkedIn.
Samet Durgun est le cofondateur de Subtext, une application qui capte le ton émotionnel de vos messages et les réécrit dans votre propre voix. Il vit à Berlin.
Sources
Chaque lien ci-dessus mène à la source primaire quand elle existe.
- OpenAI, “Introducing Canvas,” 3 octobre 2024.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. A testé l’anglais, l’allemand, le coréen et le chinois sur des catégories gricéennes; Gemini avait été exclu à l’époque pour des raisons d’accès à l’API.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 avril 2025.
- OpenAI, “Expanding on what we missed with sycophancy,” 2 mai 2025.
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octobre 2023.
- Recherche sur l’homogénéisation stylistique dans l’écriture assistée par IA, dont Padmakumar et He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, et Doshi et Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Agarwal, Naaman et Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
- Jakesch, Hancock et Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
- Jakesch, French, Ma, Hancock et Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Voir aussi Hancock, Naaman et Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, fonctions Codex et invites de remplacement de texte.
- Sudowrite, fonctions “Show, Don’t Tell” et Describe.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 avril 2023. 585 évaluations; réponses du robot conversationnel préférées dans 78,6 % des cas et jugées empathiques ou très empathiques à un taux 9,8 fois plus élevé que celles des médecins.