
ArticlesOutils d'écriture
Les réécritures IA de messages, ça fonctionne vraiment ?
Quatre familles d'outils et quatorze études sur ce qui se passe vraiment quand l'IA écrit votre message, et sur ce qui aide dans les quinze secondes avant l'envoi.
Par Samet Durgun · Cofondateur de Subtext · 17 min de lecture
· Mis à jour le 26 septembre 2026
J’ai passé quelques semaines à lire tout ce que j’ai pu trouver sur les outils d’IA qui réécrivent des messages personnels, en partie parce que j’en construis un, et en partie parce que je voulais savoir si ce que je crois à leur sujet est vrai.
Voici ce que je crois. Quand vous confiez un message difficile à une IA, le moment utile n’est pas la version polie qu’elle vous renvoie. Le moment utile arrive trente secondes plus tôt, quand quelque chose vous dit que le message que vous avez déjà écrit va mal passer, et pourquoi.
Je suis donc parti chercher un outil qui fait ça. Je n’en ai trouvé aucun dans les rayons, ce qui explique, en gros, pourquoi nous avons fini par construire Subtext. Considérez-moi partial en conséquence, et vérifiez les études. Ensuite je suis parti chercher la recherche sur ce qui se passe quand les gens laissent l’IA écrire leurs messages personnels, et ça s’est révélé bien plus intéressant que les produits.
Voici ce que j’ai trouvé, avec chaque source en lien pour que vous puissiez vérifier.
La plupart des produits de cette catégorie font exactement la même chose
Si on laisse de côté le nombre de téléchargements et qu’on trie ces outils selon ce qu’ils font, ils se regroupent en quatre familles, et la plupart aboutissent au même endroit.
Le premier groupe réunit les outils intégrés à votre téléphone. Apple Intelligence Writing Tools1 tourne sur tout le système à partir d’iOS 18.1. Vous sélectionnez du texte et obtenez Relecture, Réécriture en trois tons (Amical, Professionnel, Concis), et Composer, qui transmet la demande à ChatGPT. Gratuit si votre matériel le supporte, c’est-à-dire iPhone 15 Pro et plus récent. Samsung Writing Assist2 fait le même travail sur One UI, avec des changements de ton, des réponses suggérées et Live Translate. Gboard3 ajoute Réponse intelligente, Relecture, et des outils de reformulation qui tournent sur Gemini Nano sur les appareils récents. Tout est gratuit.
Le deuxième groupe réunit les assistants intégrés à l’app de messagerie. Magic Compose4 place des réponses suggérées au-dessus de votre clavier dans Google Messages et réécrit les brouillons dans des styles comme Enthousiaste, Décontracté et, pour des raisons qui m’échappent, Shakespeare. Pour ça, il envoie jusqu’à vingt de vos messages récents aux serveurs de Google, ce qui veut dire que ces messages ne sont plus chiffrés de bout en bout. Google dit ne pas les stocker. Gemini dans Messages est une chose distincte, un fil de discussion où vous rédigez puis copiez le résultat dans une vraie conversation. Il ne peut pas voir vos autres fils. Lequel choisir dépend de la tâche : la meilleure app de réponse IA dépend de si votre problème est le volume ou les enjeux.
Le troisième groupe réunit les apps de réponse pour les rencontres. Vous prenez le fil en capture d’écran, l’app fait de l’OCR dessus, et vous recevez des accroches et des répliques. W Rizz facture $3.99 par semaine. PlugAI, anciennement RizzGPT, tourne autour de $4.99. Il y en a des dizaines d’autres, et elles optimisent toutes la même chose : est-ce que le message suivant obtient une réponse.
Le quatrième groupe réunit les petits outils pour les conversations difficiles. C’est la famille la plus intéressante et la moins financée. Resolve5 sur iOS note ce qu’il appelle la température du conflit. Clarity Coach6 sur Android vous fait taper un brouillon dans un scénario d’entraînement et vous dit s’il sonne vague, trop brutal, ou trop justifié avant de vous aider à le réécrire. Subtext, que j’ai cofondé, appartient à cette famille et fonctionne à l’envers du reste de la catégorie. Il lit le fil et votre brouillon, vous dit comment le message risque d’être reçu et quels mots en sont la cause, et ce n’est qu’ensuite qu’il propose des réécritures que vous pouvez garder ou ignorer.
Remarquez ce qui se passe dans la plupart de ces cas. Vous donnez du texte, on vous rend un autre texte. L’étape où quelque chose lit ce que vous avez écrit et vous dit comment l’autre personne risque de le recevoir est rare, et quand elle existe, elle se trouve surtout dans les logiciels de travail. Copilot dans Outlook7 propose un coaching des e-mails sur le ton, la clarté et la façon dont le lecteur risque de se sentir, et Reader Reactions8, chez Grammarly, prédit ce qu’un lecteur choisi retiendra d’un document et ce qui pourrait l’embrouiller. Aucun des deux n’est conçu pour le texto que vous êtes sur le point d’envoyer à votre sœur. Côté vie personnelle, Clarity Coach s’en approche le plus, et c’est un bac à sable d’entraînement, donc il ne peut pas toucher à un message que vous êtes réellement sur le point d’envoyer.
Grammarly9 est l’outil sur lequel je veux être précis, parce que c’est le presque bon élève le plus susceptible de combler cet écart. Son détecteur de ton lit votre choix de mots, votre formulation, votre ponctuation et vos majuscules, et nomme le ton. Au lancement en 2019, il en couvrait une quarantaine10, dont reconnaissant, confiant, formel, affectueux et triste. La documentation de Grammarly elle-même est prudente sur la limite. Le détecteur identifie le ton général de votre texte11 et ne propose pas de réécritures phrase par phrase. Il vous dit quel ton est présent. Que votre sœur se sente ou non rejetée par ce ton, c’est une autre question. La fonction plus récente de Grammarly, Reader Reactions, tente de répondre à une version de cette question pour un lecteur que vous choisissez, comme un manager ou un client8, et je n’ai vu aucun test indépendant de sa capacité à prédire les réactions de vrais lecteurs. La détection de ton est dans l’offre gratuite, avec Pro à $12 par mois en facturation annuelle selon les comparateurs de prix actuels.
Les gens n’arrivaient pas à dire si l’IA avait écrit le texte, et ce n’était même pas serré
C’est le résultat qui m’a le plus surpris, et c’est l’étude la mieux dimensionnée de tout le domaine.
Maurice Jakesch, Jeff Hancock et Mor Naaman ont mené six expériences auprès de 4 600 participants américains, publiées dans PNAS en 202312. Les participants lisaient des autoprésentations issues de profils de rencontre, d’hospitalité et de contextes professionnels, et devinaient lesquelles avaient été écrites par une machine. Le taux de réussite tournait entre 50 et 52 %. Dans la condition rencontre, où de l’argent était en jeu pour bien deviner, environ 51,6 %. Autant jouer à pile ou face.
La raison, c’est que nous utilisons tous les mêmes raccourcis erronés. Les participants prenaient les pronoms à la première personne, les contractions, les mentions de la famille et le détail émotionnel chaleureux comme preuve qu’un humain avait écrit. Ils prenaient une grammaire propre et une formulation plate comme preuve qu’une machine l’avait fait. Chacun de ces signaux est trivialement facile à produire pour un modèle sur simple demande. Les heuristiques pointent exactement dans la mauvaise direction. Un classifieur entraîné, dans la même étude, n’a atteint que 58,1 %, donc ce n’est pas un problème d’attention qu’on peut corriger en faisant plus attention.
Le chiffre Précision pour distinguer un texte écrit par une IA d’un texte écrit par un humain : 50 à 52 %. Autant jouer à pile ou face.
Six expériences · 4 600 participants · publié dans PNAS, 2023 · un classifieur entraîné spécifiquement pour cette tâche n’a atteint que 58,1 %
Il y a une réserve. Cette étude utilisait des textes de l’époque GPT-3. Je n’ai vu personne tester à une échelle comparable si ces chiffres tiennent face aux modèles actuels.
C’est aussi pourquoi Subtext n’essaie jamais de deviner si une IA a écrit un message. Il lit votre propre brouillon pour voir comment il va être reçu par la personne qui le lit, ce qu’un tirage à pile ou face sur l’auteur n’allait jamais pouvoir vous dire. Quand la formulation se lit comme un modèle tout fait, avec des formules toutes faites et aucune voix propre derrière, il l’étiquette comme un ton robotique, ce qui concerne la façon dont les mots se lisent, pas qui les a écrits.
Le mal vient d’être soupçonné, pas d’être pris
Si les gens ne peuvent pas détecter l’IA, on pourrait s’attendre à ce que toute l’inquiétude s’évapore. Ce n’est pas le cas, et c’est la partie qui compte pour quiconque écrit un vrai message à une vraie personne.
Une équipe menée par Cornell a mené deux expériences randomisées auprès de 1 020 participants, publiées dans Scientific Reports13. Les réponses intelligentes rendaient les conversations plus rapides et plus positives, et les participants se jugeaient mutuellement plus proches et plus coopératifs. Les participants qui soupçonnaient leur partenaire d’utiliser des réponses intelligentes le notaient pourtant nettement plus mal. C’est le soupçon qui faisait le mal. Cette étude mesurait le soupçon plutôt que l’exactitude, et vu les chiffres de détection ci-dessus, je ne pense pas que ces soupçons tombaient sur les bonnes personnes.
Une équipe de Carnegie Mellon a mis un mécanisme derrière ce constat dans un article de 202514, avec 399 participants répartis sur deux études, et leur résultat est plus subtil qu’une simple pénalité. Une étiquette IA est plus qu’un mauvais point. Elle rend votre message moins probant à votre sujet, dans les deux sens. Des excuses assistées par IA paraissent moins chaleureuses, et une vantardise ou un reproche assistés par IA paraissent moins froids. L’étiquette vide le message de ce qu’il disait de vous.
Ce cadrage m’est resté en tête. Quoi que votre message faisait comme signal, l’étiquette en baisse le volume.
Sauf dans un cas précis, où le divulguer n’a fait aucune différence mesurable
Je tiens à inclure l’étude qui va à l’encontre de la thèse même de mon produit, parce que l’omettre serait malhonnête.
Zoe Purcell et ses collègues du Max Planck Institute for Human Development, avec Jakesch de nouveau parmi les auteurs, ont mené deux expériences préenregistrées auprès de 1 637 participants dans des jeux de confiance à deux joueurs avec incitation financière, publiées dans iScience en novembre 202515. La moitié pouvait utiliser une assistance de texte prédictif pour écrire un message destiné à convaincre un inconnu de leur faire confiance. Les autres écrivaient sans aide.
L’assistance IA avait un effet minime sur la confiance, et ça restait vrai même quand l’usage de l’IA était divulgué. Les rédacteurs assistés produisaient des messages tout aussi propices à la confiance, en moins de temps : ils gagnaient donc plus de confiance par minute passée. L’analyse linguistique a trouvé leurs messages légèrement moins authentiques, mais plus chaleureux, plus complexes, et plus élevés sur ce que les chercheurs appellent le clout.
Les auteurs restent prudents sur la portée de leur étude, et moi aussi. C’est une transaction ponctuelle entre inconnus, avec de l’argent en jeu. La confiance comportementale dans une décision de versement n’a rien à voir avec votre partenaire qui lit votre texto à 23h et décide si vous le pensiez vraiment. Mais ma lecture, c’est que le récit « l’IA détruit la confiance » a un vrai contre-exemple dans la littérature, et le voici.
L’IA écrit de meilleurs messages de réconfort que la plupart des gens, jusqu’à ce qu’on précise que c’était l’IA
Deux études, le même type de résultat.
Yin, Jia et Wakslak, dans PNAS16, ont montré que les réponses générées par IA donnaient aux gens le sentiment d’être davantage entendus que les réponses d’humains non formés, et que l’IA était meilleure pour repérer l’émotion en jeu. Puis les chercheurs ont dit aux destinataires que le message venait de l’IA, et l’effet a chuté. L’un des auteurs a noté que les deux effets étaient de taille comparable et s’annulaient à peu près.
Ovsyannikova, Oldemburgo de Mello et Inzlicht17 ont mené quatre expériences préenregistrées auprès de 556 participants dans Communications Psychology. Les réponses de GPT-4 ont été jugées plus compatissantes que les réponses humaines, y compris celles écrites par des bénévoles formés des lignes d’écoute des Distress Centres of Greater Toronto. Divulguer la source réduisait l’écart sans le refermer.
La machine est donc souvent meilleure sur les mots. Mais les mots ne sont pas la seule chose transmise.
Si l’effort compte, c’est parce qu’il coûtait cher
La théorie du signal est le cadre qui a fait que tout ça a fait sens pour moi.
Un message fait deux choses. Il porte un contenu, et il prouve que vous avez dépensé quelque chose pour l’envoyer. Votre temps, votre attention, et dans une conversation difficile, votre sang-froid. Ce sont des ressources limitées, donc les dépenser dit quelque chose de vrai sur la valeur que vous accordez à la personne. Des recherches sur les signaux d’engagement18, sur des échantillons japonais et américains, ont montré que les signaux coûteux surpassaient les signaux bon marché, et que ne pas envoyer un signal attendu, comme oublier une date importante, nuisait bien davantage aux relations amoureuses qu’aux amitiés.
Faites tomber le coût de production d’un message chaleureux, articulé et bien construit à presque zéro, et le signal cesse de transporter de l’information.
Il existe désormais une preuve directe de ce mécanisme, même si elle ne vient pas d’un contexte de messagerie. Une étude de 2026 dans Frontiers in Psychology19, menée auprès de 618 participants, a montré qu’étiqueter un contenu comme généré par IA réduisait significativement l’effort perçu, alors qu’une étiquette « fait par un humain » ne se distinguait pas de l’absence d’étiquette. Les gens supposent un effort humain par défaut, et c’est l’étiquette IA qui retire cette présomption. Cette étude portait sur des vidéos courtes, donc à transposer à la messagerie avec prudence.
Sous-traiter les mots semble affaiblir votre propre engagement envers eux
C’est le résultat auquel je repense sans arrêt, et il ne concerne pas du tout le destinataire.
Des économistes du CREED à Amsterdam20 ont fait jouer des jeux de confiance où les émetteurs pouvaient utiliser ChatGPT pour écrire un message promettant de rendre la pareille. Deux choses se sont produites en même temps. Les personnes ayant accès à ChatGPT faisaient des promesses plus explicites. Et les personnes qui avaient seulement ouvert ChatGPT tenaient leurs promesses 25,7 % moins souvent au moment du versement, qu’elles aient fini par recopier ce qu’il leur avait donné ou non.
Le détail révélateur, c’est que plus le message envoyé était proche de la suggestion brute de ChatGPT, moins le comportement ultérieur de l’émetteur était digne de confiance. Les personnes qui avaient réécrit la suggestion se comportaient mieux. Les auteurs y lisent un sentiment d’appropriation. Dites une chose avec vos propres mots et vous vous sentez engagé par elle. Transmettez une chose qu’une machine a écrite et une partie de vous ne l’a jamais signée. C’est aussi pourquoi Subtext vous montre d’abord le problème avant tout remplacement, et indique la part de votre formulation que chaque version a changée. Une correction que vous choisissez ou tapez vous-même en est une que vous avez signée.
Les excuses sont le seul cas bien étudié, et la conclusion vaut mieux que « ne le faites pas »
Si vous ne devez lire qu’une seule section, lisez celle-ci, parce que c’est là que se trouve la réponse pratique.
Ella Glikson et Omri Asscher ont mené trois études par scénario sur les excuses en contexte professionnel, publiées dans Computers in Human Behavior21. Savoir que quelqu’un avait utilisé des outils d’IA pour écrire des excuses réduisait leur authenticité perçue et la volonté de pardonner. Le fait de le divulguer soi-même n’atténuait pas cet effet. Jusque-là, prévisible.
Puis vient la partie qui m’a fait changer d’avis. Les participants qui n’avaient utilisé qu’un seul des trois outils d’IA disponibles n’ont subi aucune pénalité d’authenticité. Les chercheurs y lisent une question de distance. Un usage limité de l’IA garde le message final proche de ce que la personne voulait dire au départ, et ça se sent.
Une autre expérience, en plan 3x2, menée par Lim, Hong et Schneider auprès de 464 participants, également dans Computers in Human Behavior22, a montré que les excuses écrites par des humains étaient jugées plus sincères sur tous les plans, et qu’un ton chaleureux améliorait les excuses IA sans jamais refermer l’écart avec celles d’un humain.
Un article CHI de 202623 de Fan, Liu et Pan a testé cela sur des messages amoureux, avec 152 personnes dans une première étude et 704 dans une seconde. Plus l’IA avait rédigé une grande part du message, moins il semblait venir de l’expéditeur et moins il paraissait authentique. Une légère réécriture du ton, validée par l’expéditeur, améliorait la façon dont des excuses étaient jugées, mais les messages entièrement rédigés et les demandes de limites ne donnaient pas le même résultat.
Mettez ces trois études côte à côte et vous obtenez quelque chose de pratique. La pénalité suit l’écart entre le message final et ce que vous vouliez dire. Pas le fait qu’une machine était dans la pièce. C’est la même raison pour laquelle Subtext vous montre ce qui crée cette impression avant de proposer une version aboutie, et vous dit la part de votre formulation que chacune a changée, parce que c’est en gardant cette distance courte que des excuses restent crédibles. La recherche plus large sur comment s’excuser par texto fait l’objet d’un article séparé.
Ces outils polissent vos pires instincts sans jamais rien dire
Écrivez quelque chose de passif-agressif, donnez-le à n’importe quel outil de réécriture sur votre téléphone, et regardez ce qui se passe. Vous obtenez de la passivité-agressivité mieux écrite. Aucun avertissement, aucun « vous êtes sûr ». Le travail de l’outil, c’est de faire ce que vous avez demandé.
Il y a une raison pour laquelle les modèles penchent de ce côté. OpenAI a retiré une mise à jour de GPT-4o en avril 2025 et a écrit publiquement24 que le modèle était devenu « excessivement flatteur ou conciliant, souvent décrit comme flagorneur », et qu’il « penchait vers des réponses trop encourageantes mais peu sincères ». La cause qu’ils ont pointée était un réglage trop poussé sur les retours utilisateurs à court terme, autrement dit les pouces levés et baissés. Dans un billet de suivi25, ils ont admis n’avoir aucune évaluation en production qui suivait la flagornerie.
Des chercheurs d’Anthropic ont trouvé que le schéma est général. Dans un article présenté à ICLR 202426, cinq assistants de pointe ont tous montré de la flagornerie, et l’analyse d’environ 15 000 comparaisons de préférences humaines a montré que coller aux croyances affichées par l’utilisateur était l’un des plus forts prédicteurs de la réponse préférée. Entraînez sur l’approbation et vous sélectionnez pour l’accord. Un benchmark de 202527 a mesuré un comportement flagorneur dans 58,19 % des cas testés, sur ChatGPT-4o, Claude Sonnet et Gemini 1.5 Pro, avec une persistance de 78,5 % une fois amorcée, même si le test portait sur des questions factuelles, pas sur des messages personnels. Pour les messages personnels, j’ai comparé les alternatives à ChatGPT pour écrire et ce que font les trois grands acteurs à vos mots.
Maintenant, pensez à ce que ça veut dire pour le moment où vous avez le plus besoin d’aide. Vous êtes en colère, vous avez écrit quelque chose que vous regretterez, et l’outil qui tient votre brouillon a été optimisé pour vous faire vous sentir bien à ce sujet.
Ce moment est exactement celui pour lequel Subtext est construit, et la partie inconfortable est justement le point. Il vous dit que le brouillon sonne en colère au lieu de rendre la colère plus acceptable.
La question à laquelle je ne peux pas répondre
Vaut-il mieux envoyer un message maladroit que vous avez écrit, ou un message poli que vous n’avez pas écrit ?
J’ai cherché sérieusement et aucune étude ne teste ça directement. Personne n’a comparé, de façon randomisée, « votre propre brouillon imparfait » et « un bon brouillon que vous n’avez pas écrit » en suivant ce qui arrive à la relation. Il n’existe rien de longitudinal. Aucune donnée de terrain sur des couples, des familles ou des amis proches suivis sur des mois de messagerie assistée par IA. On ne sait pas si les gens s’adaptent au poli synthétique, ni si l’habitude érode discrètement quelque chose.
Ce qu’on a pointe dans une direction pour les relations proches. L’effort se lit comme de l’attention, les étiquettes aplatissent le signal, les mots sous-traités semblent desserrer votre prise sur vos propres promesses, et les excuses restent crédibles quand elles restent proches de ce que vous vouliez dire. Mais le résultat du jeu de confiance dit que, dans certains contextes, le coût était trop faible pour être mesuré, et je ne vais pas prétendre que les preuves sont plus nettes qu’elles ne le sont.
Ce qui aiderait
En relisant tout ça, je trouve que la forme du produit manquant devient assez claire, et qu’elle est proche de l’opposé de ce que la catégorie construit.
Personne n’a besoin qu’on remplace ses mots. Ce dont on a besoin, dans les quinze secondes avant d’appuyer sur envoyer, c’est de savoir que le message sonne plus froid qu’on ne le ressent, ou que ce qu’on croit être une clarification se lit comme une liste de griefs. Ensuite, on le corrige soi-même, avec ses propres mots, et le signal d’effort survit, et l’appropriation survit, et la distance de Glikson et Asscher reste courte.
C’est la version que je veux voir exister, et c’est autour d’elle que nous avons construit Subtext. Subtext prend tout le fil plutôt que la phrase isolée, nomme ce que votre brouillon risque de signaler à la personne qui va le lire, et vous montre les mots qui créent cette impression. Chaque version qu’il propose ensuite indique la part de votre formulation qu’elle a changée, et vous pouvez modifier n’importe laquelle avec Modifier manuellement avant de la copier, pour que la correction reste la vôtre. D’après les preuves ci-dessus, ça compte plus que la réécriture, parce que la pénalité suit la distance par rapport à ce que vous vouliez dire et que la plus courte distance, c’est votre propre phrase avec un mot changé. Essayer Subtext dans votre navigateurScannez-le avec l'appareil photo de votre téléphone pour installer.Essayer Subtext dans votre navigateur
Ma propre règle, pour ce qu’elle vaut : je laisserai une machine me dire de quoi mon message a l’air. Je ne la laisserai pas dire à ma sœur que je suis désolé à ma place.
Vous pensez que j’ai mal lu une étude, ou vous connaissez un outil qui diagnostique avant de réécrire ? Dites-le-moi sur LinkedIn.
Samet Durgun est le cofondateur de Subtext, une app qui capte le ton émotionnel de vos messages et les réécrit avec vos mots. Il vit à Berlin.
Sources
Chaque lien ci-dessus renvoie à la source primaire quand elle existe, numéroté dans l’ordre d’apparition. Fonctionnalités et prix des produits vérifiés en août 2026. Quand un chiffre venait du blog ou du communiqué d’une entreprise plutôt que d’une étude, je l’ai laissé de côté.
- Apple Support. Utiliser les outils de rédaction avec Apple Intelligence sur iPhone.
- Samsung. Utiliser Writing assist sur les téléphones et tablettes Galaxy.
- Google Support. Utiliser les outils de rédaction avec Gboard.
- Google Support. Rédiger des messages avec Magic Compose.
- Apple App Store. Resolve: AI Conflict Coach.
- Google Play. Clarity Coach.
- Microsoft Support. Get email coaching with Copilot in Outlook.
- Grammarly Support. Reader Reactions user guide.
- Grammarly. Writing Tone Detector and Tone Suggestions.
- TechCrunch (2019). Grammarly gets a tone detector to keep you out of email trouble.
- Grammarly Support. Comment fonctionnent les suggestions de ton de Grammarly ?
- Jakesch, M., Hancock, J. T., & Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
- Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J., & Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
- Khadpe, P., Wenzel, K., Loewenstein, G., & Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
- Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M., & Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
- Yin, Y., Jia, N., & Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
- Ovsyannikova, D., Oldemburgo de Mello, V., & Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
- Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
- Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
- AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, Université d’Amsterdam.
- Glikson, E., & Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
- Lim, J. S., Hong, N., & Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
- Fan, G., Liu, D., & Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
- OpenAI (2025). Sycophancy in GPT-4o.
- OpenAI (2025). Expanding on what we missed with sycophancy.
- Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
- Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.