
ArticlesOutils d'écriture
Les réécrits de messages par IA fonctionnent-ils vraiment?
Quatre groupes d'outils et quatorze études sur ce qui arrive vraiment quand l'IA écrit votre message, et ce qui aide dans les quinze secondes avant l'envoi.
Par Samet Durgun · Cofondateur de Subtext · 17 min de lecture
· Mis à jour le 26 septembre 2026
J’ai passé quelques semaines à lire tout ce que je trouvais sur les outils d’IA qui réécrivent des messages personnels, en partie parce que j’en construis un, et en partie parce que je voulais savoir si ce que je crois à leur sujet est vrai.
Voici ce que je crois. Quand vous confiez un message difficile à une IA, le moment utile n’est pas la version polie qu’elle vous redonne. Le moment utile arrive trente secondes plus tôt, quand quelque chose vous dit que le message que vous avez déjà écrit va mal passer, et pourquoi.
Je suis donc parti à la recherche d’un outil qui fait ça. Je n’en ai trouvé aucun sur le marché, ce qui explique, en gros, pourquoi on a fini par construire Subtext. Considérez-moi partial en conséquence, et vérifiez les études vous-mêmes. Ensuite, je suis parti à la recherche des travaux sur ce qui arrive quand les gens laissent l’IA écrire leurs messages personnels, et ça s’est avéré beaucoup plus intéressant que les produits.
Voici ce que j’ai trouvé, avec tout en lien pour que vous puissiez vérifier.
La plupart des produits de cette catégorie font exactement la même chose
Si on ignore le nombre de téléchargements et qu’on trie ces outils selon ce qu’ils font, ils se réduisent à quatre groupes, et la plupart finissent au même endroit.
Le premier groupe, ce sont les outils intégrés à votre téléphone. Les outils d’écriture d’Apple Intelligence1 fonctionnent partout dans iOS 18.1 et les versions plus récentes. Vous sélectionnez du texte et obtenez Relire, Réécrire selon trois tons (Amical, Professionnel, Concis), et Composer, qui transmet la demande à ChatGPT. Gratuit si votre appareil le supporte, c’est-à-dire iPhone 15 Pro et plus récent. Samsung Writing Assist2 fait le même travail sur One UI, avec des changements de ton, des réponses suggérées et la traduction en direct. Gboard3 ajoute la réponse intelligente, la relecture et des outils de reformulation qui tournent sur Gemini Nano sur les appareils plus récents. Tout est gratuit.
Le deuxième groupe, ce sont les assistants intégrés à l’application de messagerie. Magic Compose4 met des réponses suggérées au-dessus de votre clavier dans Google Messages et réécrit vos brouillons selon des styles qui incluent Excité, Décontracté et, pour des raisons qui m’échappent, Shakespeare. Pour ça, il envoie jusqu’à vingt de vos messages récents aux serveurs de Google, ce qui veut dire que ces messages ne sont plus chiffrés de bout en bout. Google dit qu’il ne les conserve pas. Gemini dans Messages, c’est autre chose: un fil de clavardage où vous rédigez, puis vous copiez le résultat dans une vraie conversation. Il ne peut pas voir vos autres fils. Lequel choisir dépend de la tâche: la meilleure appli de réponse IA dépend de si votre problème, c’est le volume ou les enjeux.
Le troisième groupe, ce sont les applications de réponses pour les rencontres. Vous prenez une capture d’écran de la conversation, l’application y fait tourner de la reconnaissance de texte, et vous obtenez des amorces et des répliques. W Rizz demande 3,99 $ par semaine. PlugAI, anciennement RizzGPT, tourne autour de 4,99 $. Il y en a des dizaines d’autres, et elles optimisent toutes pour la même chose: est-ce que le prochain message obtient une réponse.
Le quatrième groupe, ce sont les petites applications pour les conversations difficiles. C’est le groupe le plus intéressant et le moins financé. Resolve5 sur iOS calcule ce qu’elle appelle la température du conflit. Clarity Coach6 sur Android vous fait taper un brouillon dans un scénario d’entraînement et vous dit s’il sonne vague, trop brusque ou trop justificatif avant de vous aider à le réécrire. Subtext, que j’ai cofondé, se trouve dans ce groupe et fonctionne à l’envers du reste de la catégorie. Il lit le fil et votre brouillon, vous dit comment le message risque d’être reçu et quels mots en sont responsables, et c’est seulement après qu’il propose des réécritures que vous pouvez prendre ou ignorer.
Remarquez ce qui se passe dans la plupart de ces cas. Vous lui donnez du texte, il vous redonne un texte différent. L’étape où quelque chose lit ce que vous avez écrit et vous dit comment l’autre personne risque de le recevoir est rare, et quand elle existe, on la trouve surtout dans les logiciels de travail. Copilot dans Outlook7 offre un accompagnement pour vos courriels sur le ton, la clarté et la façon dont la personne qui lit risque de se sentir, et la fonction Reader Reactions8 de Grammarly prédit ce qu’un lecteur choisi va retenir d’un document et ce qui pourrait le mêler. Ni l’un ni l’autre n’est conçu pour le texto que vous êtes sur le point d’envoyer à votre sœur. Du côté personnel, Clarity Coach s’en approche le plus, mais c’est un bac à sable d’entraînement, donc il ne peut pas toucher à un message que vous êtes réellement sur le point d’envoyer.
Grammarly9 est l’outil sur lequel je veux être précis, parce que c’est le cas qui s’en approche le plus et qui a le plus de chances de combler cet écart. Son détecteur de ton lit votre choix de mots, vos tournures, votre ponctuation et vos majuscules, et nomme le ton. Au lancement en 2019, il en couvrait environ quarante10, dont reconnaissant, confiant, formel, affectueux et triste. La documentation d’aide de Grammarly elle-même est prudente sur la limite. Le détecteur identifie le ton général de votre texte11 et n’offre pas de réécritures phrase par phrase. Il vous dit quel ton est présent. Est-ce que votre sœur va se sentir ignorée en le lisant, c’est une autre question. La fonction plus récente de Grammarly, Reader Reactions, essaie de répondre à une version de cette question pour un lecteur que vous choisissez, comme un gestionnaire ou un client8, et je n’ai vu aucun test indépendant de sa capacité à prédire les réactions de vrais lecteurs. La détection de ton fait partie du forfait gratuit, et le forfait Pro coûte 12 $ par mois en facturation annuelle, selon les grilles de prix actuelles.
Les gens n’arrivaient pas à dire si l’IA avait écrit le texte, et ce n’était même pas proche
C’est le résultat qui m’a le plus surpris, et c’est l’étude la mieux dotée en puissance statistique de tout ce domaine.
Maurice Jakesch, Jeff Hancock et Mor Naaman ont mené six expériences avec 4 600 participants américains, publiées dans PNAS en 202312. Les gens lisaient des autoprésentations tirées de profils de rencontre, d’hébergement et professionnels, et devaient deviner lesquelles avaient été écrites par une machine. La précision se situait entre 50 et 52 %. Dans la condition rencontre, avec de l’argent en jeu pour bien deviner, environ 51,6 %.
Autant lancer une pièce.
La raison, c’est qu’on utilise tous les mêmes raccourcis défaillants. Les participants prenaient les pronoms à la première personne, les contractions, les mentions de famille et les détails émotionnels chaleureux comme preuve qu’un humain avait écrit le texte. Ils prenaient une grammaire propre et des tournures plates comme preuve qu’une machine l’avait fait. Chacun de ces signaux est trivialement facile à produire pour un modèle sur demande. Les heuristiques pointent exactement dans la mauvaise direction. Un classificateur entraîné dans la même étude n’a atteint que 58,1 %, donc ce n’est pas un problème d’habileté qu’on peut régler en faisant plus attention.
Le chiffre Précision pour distinguer un texte écrit par une IA d’un texte écrit par un humain : 50 à 52 %. Autant lancer une pièce.
Six expériences · 4 600 participants · publié dans PNAS, 2023 · un classificateur entraîné spécifiquement pour cette tâche n’a atteint que 58,1 %
Il y a une réserve. Cette étude utilisait des textes de l’époque GPT-3. Je n’ai vu personne tester à une échelle comparable si les chiffres tiennent face aux modèles actuels.
C’est aussi pourquoi Subtext n’essaie jamais de deviner si une IA a écrit un message. Il lit votre propre brouillon pour voir comment il va être reçu par la personne qui le lit, ce qu’un coup de pile ou face sur l’auteur n’allait jamais pouvoir vous dire. Quand la formulation se lit comme un modèle tout fait, avec des formules toutes faites et sans voix derrière, il l’étiquette comme un ton robotique, ce qui concerne la manière dont les mots se lisent, pas qui les a écrits.
Le dommage vient du soupçon, pas du fait d’être pris
Si les gens n’arrivent pas à détecter l’IA, on pourrait s’attendre à ce que toute l’inquiétude s’évapore. Ce n’est pas le cas, et c’est la partie qui compte pour quiconque écrit un vrai message à une vraie personne.
Une équipe menée par Cornell a mené deux expériences randomisées avec 1 020 participants, publiées dans Scientific Reports13. Les réponses intelligentes rendaient les conversations plus rapides et plus positives, et les gens s’évaluaient mutuellement comme plus proches et plus coopératifs. Les participants qui soupçonnaient leur partenaire d’utiliser des réponses intelligentes évaluaient toutefois ce partenaire nettement plus mal. C’est le soupçon qui a fait le dommage. Cette étude mesurait le soupçon plutôt que l’exactitude, et vu les chiffres de détection plus haut, je ne pense pas que ces soupçons tombaient sur les bonnes personnes.
Une équipe de Carnegie Mellon a mis un mécanisme derrière ce constat dans un article de 202514 avec 399 participants répartis sur deux études, et leur résultat est plus subtil qu’une simple pénalité. Une étiquette IA est plus qu’un point contre vous. Elle rend votre message une preuve plus faible sur qui vous êtes, dans les deux sens. Des excuses assistées par IA sonnent moins chaleureuses, et une vantardise ou un blâme assistés par IA sonnent moins froids. L’étiquette vide le message de l’information qu’il porte sur vous.
Cette façon de voir les choses m’est restée en tête. Peu importe ce que votre message faisait comme signal, l’étiquette en baisse le volume.
Sauf dans un contexte, où la divulgation n’a fait aucune différence mesurable
Je veux inclure l’étude qui va à l’encontre de la thèse même de notre produit, parce que l’omettre serait malhonnête.
Zoe Purcell et ses collègues du Max Planck Institute for Human Development, avec Jakesch encore parmi les auteurs, ont mené deux expériences préenregistrées avec 1 637 participants dans des jeux de confiance à deux joueurs avec incitatif financier, publiées dans iScience en novembre 202515. La moitié pouvait utiliser une assistance de texte prédictif pour écrire un message qui convainc un étranger de leur faire confiance. Les autres écrivaient sans aide.
L’assistance de l’IA avait un effet minime sur la confiance, et ça tenait même quand l’usage de l’IA était divulgué. Les rédacteurs assistés produisaient des messages tout aussi convaincants en moins de temps, donc ils gagnaient plus de confiance par minute investie. L’analyse linguistique a trouvé leurs messages légèrement moins authentiques, mais plus chaleureux, plus complexes, et plus élevés sur ce que les chercheurs appellent le clout, une mesure de prestige perçu.
Les auteurs sont prudents sur la portée de leurs résultats, et moi aussi. C’est une transaction ponctuelle entre étrangers, avec de l’argent en jeu. La confiance comportementale dans une décision de paiement, c’est une tout autre bête que votre partenaire qui lit votre texto à 23 h et qui décide si vous le pensiez vraiment. Mais ma lecture, c’est que l’histoire selon laquelle « l’IA détruit la confiance » a un vrai contre-exemple dans la littérature, et le voici.
L’IA écrit de meilleurs messages de réconfort que la plupart des gens, jusqu’à ce qu’on mentionne que c’était l’IA
Deux études, le même genre de résultat.
Yin, Jia et Wakslak, dans PNAS16 ont trouvé que les réponses générées par IA faisaient sentir les gens plus écoutés que les réponses d’humains non entraînés, et que l’IA était meilleure pour lire quelle émotion était en jeu. Puis ils ont dit aux destinataires que le message venait de l’IA, et l’effet a chuté. Un des auteurs a noté que les deux effets étaient de taille similaire et s’annulaient à peu près l’un l’autre.
Ovsyannikova, Oldemburgo de Mello et Inzlicht17 ont mené quatre expériences préenregistrées avec 556 participants dans Communications Psychology. Les réponses de GPT-4 ont été jugées plus compatissantes que celles des humains, y compris celles de bénévoles entraînés des lignes de crise des Distress Centres of Greater Toronto. Divulguer la source a réduit l’écart, mais ne l’a pas fermé.
Donc la machine est souvent meilleure avec les mots. Les mots ne sont pas la seule chose qui se transmet.
Si l’effort compte, c’est parce que l’effort coûtait cher avant
La théorie du signal, c’est le cadre qui a fait que tout ça a fait sens pour moi.
Un message fait deux travaux. Il porte un contenu, et il prouve que vous avez dépensé quelque chose pour l’envoyer. Votre temps, votre attention, et dans une conversation difficile, votre calme. Ce sont des ressources finies, donc les dépenser dit quelque chose de vrai sur la valeur que vous accordez à la personne. Des recherches sur les signaux d’engagement18 dans des échantillons japonais et américains ont trouvé que les signaux coûteux surpassaient les signaux bon marché, et que ne pas envoyer un signal attendu, comme oublier une occasion, nuisait bien davantage aux relations amoureuses qu’aux amitiés.
Faites tomber à peu près à zéro le coût de produire un message chaleureux, articulé et bien structuré, et le signal cesse de porter de l’information.
Il existe maintenant une preuve directe de ce mécanisme, même si ce n’est pas dans un contexte de messagerie. Une étude de 2026 dans Frontiers in Psychology19 avec 618 participants a trouvé qu’étiqueter un contenu comme généré par IA réduisait significativement l’effort perçu, alors qu’une étiquette « fait par un humain » ne différait pas de l’absence d’étiquette. Les gens présument un effort humain par défaut, et c’est l’étiquette IA qui retire cette présomption. Cette étude portait sur des vidéos courtes, donc à transposer à la messagerie avec prudence.
Sous-traiter les mots semble affaiblir votre propre engagement envers eux
C’est le résultat auquel je repense sans arrêt, et ça ne concerne pas du tout le destinataire.
Des économistes du CREED à Amsterdam20 ont mené des jeux de confiance où les expéditeurs pouvaient utiliser ChatGPT pour écrire un message promettant de rendre la pareille. Deux choses se sont produites en même temps. Les gens qui avaient accès à ChatGPT faisaient des promesses plus explicites. Et les gens qui avaient seulement ouvert ChatGPT tenaient leurs promesses 25,7 % moins souvent au moment du paiement, peu importe s’ils avaient fini par copier ce qu’il leur donnait ou non.
Le détail révélateur, c’est que plus le message envoyé était proche de la suggestion brute de ChatGPT, moins le comportement subséquent de l’expéditeur était digne de confiance. Les gens qui avaient réécrit la suggestion se comportaient mieux. Les auteurs voient ça comme un sentiment de propriété. Dites une chose avec vos propres mots et vous vous sentez lié par elle. Transférez une chose qu’une machine a écrite et une partie de vous ne l’a jamais vraiment signée. C’est aussi pourquoi Subtext vous montre d’abord le problème avant tout remplacement, et indique la part de votre formulation que chaque version a changée. Une correction que vous choisissez ou tapez vous-même est une que vous avez signée.
Les excuses sont ce qui a été étudié le plus sérieusement, et le résultat est plus utile que « n’en faites rien »
Si vous ne lisez qu’une seule section, lisez celle-ci, parce que la réponse pratique se trouve ici.
Ella Glikson et Omri Asscher ont mené trois études par scénarios sur les excuses en milieu de travail, publiées dans Computers in Human Behavior21. Savoir que quelqu’un a utilisé des outils d’IA pour écrire des excuses réduisait leur authenticité perçue et la volonté des gens de pardonner. Le divulguer soi-même n’atténuait pas ça. Jusqu’ici, prévisible.
Puis vient la partie qui m’a fait changer d’avis. Les participants qui n’avaient utilisé qu’un seul des trois outils d’IA offerts n’ont subi aucune pénalité d’authenticité. Les chercheurs y voient une question de distance. Un usage limité de l’IA garde le message final proche de ce que la personne voulait dire au départ, et les gens le sentent.
Une expérience distincte à devis 3x2 de Lim, Hong et Schneider avec 464 participants, aussi dans Computers in Human Behavior22, a trouvé que les excuses écrites par un humain étaient perçues comme plus sincères dans tous les cas, et qu’un ton chaleureux améliorait les excuses générées par IA sans jamais fermer l’écart avec celles d’un humain.
Un article CHI de 202623 de Fan, Liu et Pan a testé la question sur des messages amoureux, avec 152 personnes dans une première étude et 704 dans une deuxième. Plus l’IA avait rédigé une grande part du message, moins il semblait venir de la personne qui l’envoyait et moins il paraissait authentique. Une légère réécriture du ton, approuvée par l’expéditeur, améliorait la façon dont des excuses étaient jugées, mais les messages rédigés au complet et les demandes de limites ne donnaient pas le même résultat.
Mettez ces trois résultats côte à côte et vous obtenez quelque chose de pratique. La pénalité suit à quel point le message final s’est éloigné de ce que vous vouliez dire. Pas si une machine était dans la pièce. C’est la même raison pour laquelle Subtext vous montre ce qui crée cette impression avant de proposer une version aboutie, et vous dit la part de votre formulation que chacune a changée, parce que garder cette distance courte, c’est ce qui garde des excuses crédibles. La recherche plus large sur comment s’excuser par texto fait l’objet d’un texte séparé.
Ces outils vont polir vos pires instincts sans jamais dire un mot
Écrivez quelque chose de passif-agressif, donnez-le à n’importe quel outil de réécriture sur votre téléphone, et regardez ce qui se passe. Vous obtenez de la passivité-agressivité mieux écrite. Aucun avertissement, aucun « êtes-vous certain ». Le travail de l’outil, c’est de faire ce que vous avez demandé.
Il y a une raison pour laquelle les modèles penchent de ce côté. OpenAI a retiré une mise à jour de GPT-4o en avril 2025 et a écrit publiquement24 que le modèle était devenu « excessivement flatteur ou complaisant, souvent décrit comme flagorneur », et qu’il « penchait vers des réponses excessivement encourageantes mais malhonnêtes ». La cause qu’ils ont nommée, c’est un ajustement trop fort sur la rétroaction à court terme des utilisateurs, c’est-à-dire les pouces en l’air et les pouces vers le bas. Dans un billet de suivi25, ils ont admis n’avoir aucune évaluation de déploiement qui suivait la flagornerie.
Des chercheurs d’Anthropic ont trouvé que le même schéma est général. Dans un article présenté à ICLR 202426, les cinq assistants de pointe testés montraient tous de la flagornerie, et l’analyse d’environ 15 000 comparaisons de préférences humaines a trouvé que le fait de confirmer les croyances déclarées de l’utilisateur était parmi les plus forts prédicteurs de la réponse préférée. Entraînez sur l’approbation et vous sélectionnez pour l’accord. Un benchmark de 202527 a mesuré un comportement flagorneur dans 58,19 % des cas testés chez ChatGPT-4o, Claude Sonnet et Gemini 1.5 Pro, avec une persistance de 78,5 % une fois amorcée, même si le test portait sur des réponses à des questions factuelles, pas sur des messages personnels. Pour les messages personnels, j’ai comparé les alternatives à ChatGPT pour écrire et ce que font les trois grands joueurs à vos mots.
Pensez maintenant à ce que ça veut dire pour le moment où vous avez le plus besoin d’aide. Vous êtes fâché, vous avez écrit quelque chose que vous allez regretter, et l’outil qui tient votre brouillon a été optimisé pour vous faire sentir bien à ce sujet.
C’est le moment exact pour lequel Subtext est bâti, et la partie inconfortable c’est l’essentiel. Il vous dit que le brouillon sonne en colère au lieu de faire sonner la colère mieux.
La question à laquelle je ne peux pas répondre
Vaut-il mieux envoyer un message maladroit que vous avez écrit, ou un message poli que vous n’avez pas écrit?
J’ai cherché sérieusement et il n’existe aucune étude qui teste ça directement. Personne n’a randomisé « votre propre brouillon imparfait » contre « un bon brouillon que vous n’avez pas écrit » pour suivre ce qui arrive à la relation. Il n’y a rien de longitudinal du tout. Aucune donnée de terrain sur des couples, des familles ou des amis proches suivis pendant des mois de messagerie assistée par IA. On ne sait pas si les gens s’adaptent au poli synthétique, ou si l’habitude érode tranquillement quelque chose.
Ce qu’on a pointe dans une direction pour les relations proches. L’effort se lit comme du soin, les étiquettes aplatissent le signal, les mots sous-traités semblent relâcher votre prise sur vos propres promesses, et les excuses restent crédibles quand elles restent proches de ce que vous vouliez dire. Mais le résultat du jeu de confiance dit que, dans certains contextes, le coût était trop faible pour être mesuré, et je ne vais pas prétendre que les preuves sont plus nettes qu’elles ne le sont.
Alors qu’est-ce qui aiderait
En relisant tout ça, je trouve que la forme du produit qui manque est assez claire, et qu’elle est proche de l’opposé de ce que la catégorie construit.
Personne n’a besoin qu’on remplace ses mots. Ce dont les gens ont besoin, dans les quinze secondes avant d’appuyer sur envoyer, c’est de savoir que le message sonne plus froid que ce qu’ils ressentent, ou que ce qu’ils croient être une clarification se lit comme une liste de griefs. Ensuite, ils le corrigent eux-mêmes, avec leurs propres mots, et le signal d’effort survit, et la propriété survit, et la distance de Glikson et Asscher reste courte.
C’est la version que je veux voir exister, et c’est autour d’elle qu’on a construit Subtext. Subtext prend le fil entier plutôt que la phrase, nomme ce que votre brouillon risque de signaler à la personne qui s’apprête à le lire, et vous montre les mots qui créent cette impression. Chaque version qu’il propose ensuite indique la part de votre formulation qu’elle a changée, et vous pouvez modifier n’importe laquelle avec Modifier manuellement avant de la copier, pour que la correction reste la vôtre. D’après les preuves ci-dessus, c’est ça qui compte plus que la réécriture, parce que la pénalité suit la distance par rapport à ce que vous vouliez dire et que la plus courte distance, c’est votre propre phrase avec un mot changé. Essayer Subtext dans votre navigateurScannez-le avec l'appareil photo de votre téléphone pour installer.Essayer Subtext dans votre navigateur
Ma propre règle, pour ce qu’elle vaut: je vais laisser une machine me dire l’effet que fait mon message. Je ne vais pas la laisser dire à ma sœur que je suis désolé.
Vous pensez que j’ai mal lu une étude, ou vous connaissez un outil qui diagnostique avant de réécrire? Dites-le-moi sur LinkedIn.
Samet Durgun est le cofondateur de Subtext, une application qui capte le ton émotionnel de vos messages et les réécrit avec vos mots. Il vit à Berlin.
Sources
Chaque lien ci-dessus mène à la source primaire quand elle existe, numéroté dans l’ordre d’apparition. Fonctionnalités et prix des produits vérifiés en août 2026. Quand un chiffre venait d’un blogue d’entreprise ou d’un communiqué plutôt que d’une étude, je l’ai laissé de côté.
- Apple Support. « Use Writing Tools with Apple Intelligence on iPhone ».
- Samsung. « Use Writing assist on Galaxy phones and tablets ».
- Google Support. « Use writing tools with Gboard ».
- Google Support. « Draft messages with Magic Compose ».
- App Store d’Apple. Resolve: AI Conflict Coach.
- Google Play. Clarity Coach.
- Microsoft Support. « Get email coaching with Copilot in Outlook ».
- Grammarly Support. « Reader Reactions user guide ».
- Grammarly. « Writing Tone Detector and Tone Suggestions ».
- TechCrunch (2019). « Grammarly gets a tone detector to keep you out of email trouble ».
- Grammarly Support. « How do Grammarly’s tone suggestions work? »
- Jakesch, M., Hancock, J. T. et Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
- Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J. et Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
- Khadpe, P., Wenzel, K., Loewenstein, G. et Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
- Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M. et Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
- Yin, Y., Jia, N. et Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
- Ovsyannikova, D., Oldemburgo de Mello, V. et Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
- Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
- Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
- AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, University of Amsterdam.
- Glikson, E. et Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
- Lim, J. S., Hong, N. et Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
- Fan, G., Liu, D. et Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
- OpenAI (2025). Sycophancy in GPT-4o.
- OpenAI (2025). Expanding on what we missed with sycophancy.
- Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
- Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.