ArtiklerSkriveverktøy

Fungerer KI-omskrivere av meldinger egentlig?

Fire grupper verktøy og fjorten studier om hva som faktisk skjer når KI skriver meldingen din, og hva som hjelper i de femten sekundene før du sender.

Av Samet Durgun · Medgrunnlegger av Subtext · 15 min lesetid

Jeg brukte noen uker på å lese alt jeg fant om KI-verktøy som skriver om personlige meldinger, dels fordi jeg bygger et selv, og dels fordi jeg ville vite om det jeg tror om dem, stemmer.

Det jeg tror, er dette. Gir du en vanskelig melding til en KI, er ikke det nyttige øyeblikket den polerte versjonen den gir deg tilbake. Det nyttige øyeblikket er tretti sekunder tidligere, når noe forteller deg at meldingen du allerede har skrevet, kommer til å lande dårlig, og hvorfor.

Så jeg lette etter et verktøy som gjør nettopp det. Jeg fant ingen på hyllene, og det er, grovt sagt, grunnen til at vi endte opp med å bygge Subtext. Regn meg som inhabil deretter, og sjekk kildene selv. Så gikk jeg videre til forskningen på hva som skjer når folk lar KI skrive de personlige meldingene sine, og det viste seg å være mye mer interessant enn produktene.

Det som følger, er det jeg fant, med alt lenket opp så du kan sjekke meg.


De fleste produktene i denne kategorien gjør nøyaktig det samme

Ser du bort fra antall nedlastinger og sorterer disse verktøyene etter hva de gjør, faller de sammen i fire grupper, og de fleste av dem ender på samme sted.

Gruppe én er verktøyene som er innebygd i mobilen din. Apple Intelligence Writing Tools1 kjører systemomfattende på iOS 18.1 og nyere. Du markerer tekst og får Korrekturles, Skriv om i tre toner (Vennlig, Profesjonell, Konsis) og Komponer, som sender forespørselen videre til ChatGPT. Gratis hvis maskinvaren din støtter det, altså iPhone 15 Pro og oppover. Samsung Writing Assist2 gjør den samme jobben på One UI, med toneendringer, forslag til svar og Live Translate. Gboard3 legger til Smart Reply, korrekturlesing og omformuleringsverktøy som kjører på Gemini Nano på nyere enheter. Alt gratis.

Gruppe to er assistentene inne i selve meldingsappen. Magic Compose4 legger svarforslag over tastaturet i Google Messages og skriver om utkast i stiler som Begeistret, Avslappet og, av grunner jeg ikke forstår, Shakespeare. Den sender opptil tjue av de siste meldingene dine til Googles servere for å gjøre det, noe som betyr at de meldingene ikke lenger er ende-til-ende-krypterte. Google sier de ikke lagrer dem. Gemini i Messages er en egen ting, en samtaletråd der du skriver utkast og deretter limer resultatet inn i en ekte samtale. Den kan ikke se de andre trådene dine. Hvilken av dem du trenger, avhenger av oppgaven: den beste KI-svarappen avhenger av om problemet ditt er volum eller hva som står på spill.

Gruppe tre er dating-svarappene. Du tar skjermbilde av en samtale, appen kjører OCR på det, og du får åpningsreplikker og motsvar. W Rizz tar $3.99 i uken. PlugAI, tidligere RizzGPT, ligger på rundt $4.99. Det finnes dusinvis til, og alle optimaliserer for én ting: om neste melding får svar.

Gruppe fire er de små appene for vanskelige samtaler. Dette er den mest interessante gruppen, og den minst finansierte. Resolve5 på iOS scorer det de kaller konflikttemperatur. Clarity Coach6 på Android lar deg skrive et utkast inn i et øvingsscenario og forteller deg om det leses som vagt, for brutalt eller overforklarende, før den hjelper deg å skrive om. Subtext, som jeg er medgrunnlegger av, hører til i denne gruppen, og jobber motsatt vei av resten av kategorien. Den leser tråden og utkastet ditt, forteller deg hvordan meldingen sannsynligvis vil lande og hvilke ordvalg som gjør det, og først da tilbyr den omskrivinger du kan velge eller ignorere.

Legg merke til hva som skjer i de fleste av disse. Du gir det tekst, det gir deg annen tekst. Steget der noe leser det du har skrevet og forteller deg hvordan den andre personen sannsynligvis vil oppfatte det, er sjeldent, og der det finnes, ligger det stort sett i jobbprogramvare. Copilot i Outlook7 tilbyr e-postcoaching på tone, klarhet og hvordan mottakeren kan komme til å føle seg, og Grammarlys Reader Reactions8 forutsier hva en valgt leser vil sitte igjen med etter et dokument, og hva som kan forvirre vedkommende. Ingen av dem er laget for meldingen du er i ferd med å sende til søsteren din. På den personlige siden kommer Clarity Coach nærmest, og den er en øvingssandkasse, så den kan ikke røre en melding du faktisk er i ferd med å sende.

Grammarly9 er verktøyet jeg vil være presis om, fordi det er nesten-treffet som mest sannsynlig kan tette dette gapet. Tonedetektoren leser ordvalg, formuleringer, tegnsetting og bruk av store bokstaver, og setter navn på tonen. Ved lansering i 2019 dekket den rundt førti av dem10, inkludert takknemlig, selvsikker, formell, kjærlig og trist. Grammarlys egen brukerstøttedokumentasjon er nøye med å presisere grensen. Detektoren identifiserer den overordnede tonen i teksten din11 og tilbyr ikke omskrivinger på setningsnivå. Den forteller deg hvilken tone som er til stede. Om søsteren din vil føle seg avfeid av den, er et annet spørsmål. Grammarlys nyere funksjon Reader Reactions prøver å svare på en versjon av det for en leser du velger, for eksempel en sjef eller en kunde8, og jeg har ikke sett en uavhengig test av hvor godt den forutsier ekte lesere. Tonedeteksjon ligger i gratisversjonen, med Pro til $12 i måneden ved årlig fakturering, ifølge dagens prissporere.


Folk klarte ikke å si om KI hadde skrevet teksten, og det var ikke engang i nærheten

Dette er funnet som overrasket meg mest, og det er den statistisk sterkeste studien i hele feltet.

Maurice Jakesch, Jeff Hancock og Mor Naaman gjennomførte seks eksperimenter med 4 600 amerikanske deltakere, publisert i PNAS i 202312. Folk leste egenpresentasjoner fra dating-, overnattings- og profesjonelle profiler og gjettet hvilke som var skrevet av en maskin. Treffsikkerheten lå mellom 50 og 52 %. I datingbetingelsen, med penger på spill for å gjette riktig, rundt 51,6 %.

Myntkast-territorium.

Grunnen er at vi alle bruker de samme ødelagte snarveiene. Deltakerne tolket førstepersonspronomen, sammentrekninger, omtale av familie og varme, følelsesladde detaljer som bevis på at et menneske hadde skrevet det. De tolket ren grammatikk og flat formulering som bevis på at en maskin hadde gjort det. Hvert eneste av disse signalene er trivielt enkelt for en modell å produsere på forespørsel. Tommelfingerreglene peker rett feil vei. En trent klassifikator i samme studie klarte bare 58,1 %, så dette er ikke noe du kan fikse ved å følge bedre med.

Tallet Nøyaktighet ved å skille KI-skrevet tekst fra menneskeskrevet tekst: 50 til 52 %. Myntkast-territorium.

Seks eksperimenter · 4 600 deltakere · publisert i PNAS, 2023 · en klassifikator trent spesifikt for denne oppgaven klarte bare 58,1 %

Det finnes ett forbehold. Studien brukte tekst fra GPT-3-tiden. Jeg har ikke sett noen teste, i noe som ligner den skalaen, om tallene holder seg mot dagens modeller.

Det er også en del av grunnen til at Subtext aldri prøver å gjette om KI skrev en melding. Den leser ditt eget utkast for å se hvordan det vil lande hos personen som mottar det, noe et myntkast-gjett om forfatterskap aldri kunne fortalt deg. Når formuleringen leses som en mal, med faste fraser og ingen stemme bak, merker den det som robotaktig tone, som handler om hvordan ordene høres ut, ikke om hvem som skrev dem.


Skaden kommer av å bli mistenkt, ikke av å bli tatt

Hvis folk ikke klarer å oppdage KI, skulle man tro at hele bekymringen forsvant. Det gjør den ikke, og dette er delen som betyr noe for alle som skriver en ekte melding til et ekte menneske.

Et Cornell-ledet team gjennomførte to randomiserte eksperimenter med 1 020 deltakere, publisert i Scientific Reports13. Smarte svarforslag gjorde samtaler raskere og mer positive, og folk vurderte hverandre som nærmere og mer samarbeidsvillige. Deltakere som mistenkte at partneren brukte smarte svarforslag, vurderte derimot den partneren betydelig dårligere. Mistanken var det som gjorde skaden. Studien målte mistanke, ikke treffsikkerhet, og gitt deteksjonstallene over tror jeg ikke at de mistankene traff de riktige personene.

Et team fra Carnegie Mellon satte en mekanisme under dette i en studie fra 202514 med 399 deltakere fordelt på to studier, og resultatet deres er mer nyansert enn en enkel straff. En KI-merking er mer enn et minuspoeng mot deg. Den gjør meldingen din til svakere bevis om deg, i begge retninger. En KI-assistert unnskyldning leses som mindre varm, og skryt eller bebreidelse med KI-hjelp leses som mindre kaldt. Merkingen tapper meldingen for informasjon om hvem du er.

Den innrammingen ble hengende i meg. Uansett hva meldingen din gjorde som signal, skrur merkingen ned volumet på det.


Unntatt i én situasjon, der åpenhet ikke gjorde noen målbar forskjell

Jeg vil ta med studien som argumenterer mot min egen produkttese, for å utelate den ville vært uærlig.

Zoe Purcell og kolleger ved Max Planck Institute for Human Development, med Jakesch igjen blant forfatterne, gjennomførte to forhåndsregistrerte eksperimenter med 1 637 deltakere i belønte tillitsspill for to spillere, publisert i iScience i november 202515. Halvparten kunne bruke prediktiv tekstassistanse for å skrive en melding som overtalte en fremmed til å stole på dem. Resten skrev uten hjelp.

KI-hjelp hadde minimal effekt på tillit, og det gjaldt selv når bruken av KI ble opplyst om. De hjulpne skribentene produserte like tillitsvekkende meldinger på kortere tid, så de fikk mer tillit per minutt brukt. Lingvistisk analyse fant at meldingene deres var noe mindre autentiske, men varmere, mer komplekse, og skåret høyere på det forskerne kaller «clout».

Forfatterne er nøye med omfanget, og det er jeg også. Dette er en engangstransaksjon mellom fremmede med penger involvert. Atferdsmessig tillit i en utbetalingsbeslutning er et helt annet dyr enn at partneren din leser meldingen din klokken 23 og avgjør om du mente det. Men min vurdering er at historien om at «KI ødelegger tillit» har et ekte moteksempel i litteraturen, og dette er det.


KI skriver bedre trøstemeldinger enn de fleste mennesker, helt til du nevner at det var KI

To studier, samme mønster i resultatet.

Yin, Jia og Wakslak i PNAS16 fant at KI-genererte svar fikk folk til å føle seg mer hørt enn svar fra utrente mennesker, og at KI-en var flinkere til å lese hvilken følelse som var i spill. Så fortalte de mottakerne at meldingen kom fra KI, og effekten falt. En av forfatterne bemerket at de to effektene var omtrent like store og stort sett kansellerte hverandre ut.

Ovsyannikova, Oldemburgo de Mello og Inzlicht17 gjennomførte fire forhåndsregistrerte eksperimenter med 556 deltakere i Communications Psychology. GPT-4-svar ble vurdert som mer medfølende enn menneskelige svar, inkludert svar skrevet av trente krisetelefon-frivillige ved Distress Centres of Greater Toronto. Å opplyse om kilden gjorde gapet mindre, men lukket det ikke.

Så maskinen er ofte bedre på ordene. Ordene er ikke det eneste som blir formidlet.


Grunnen til at innsats betyr noe, er at innsats pleide å koste noe

Signalteori er rammeverket som fikk alt dette til å falle på plass for meg.

En melding gjør to jobber. Den bærer innhold, og den beviser at du brukte noe på å sende den. Tiden din, oppmerksomheten din, og i en vanskelig samtale, fatningen din. De ressursene er begrenset, så å bruke dem sier noe reelt om hvor mye du verdsetter personen. Forskning på forpliktelsessignaler18 i japanske og amerikanske utvalg fant at kostbare signaler slo billige, og at det å ikke sende et forventet signal, som å glemme en merkedag, skadet romantiske forhold langt mer enn vennskap.

Senk kostnaden ved å produsere en varm, velformulert, velstrukturert melding til omtrent null, og signalet slutter å bære informasjon.

Det finnes nå direkte belegg for mekanismen, men ikke fra en meldingskontekst. En studie fra 2026 i Frontiers in Psychology19 med 618 deltakere fant at det å merke innhold som KI-generert reduserte den opplevde innsatsen betydelig, mens en «laget av menneske»-merking ikke skilte seg fra ingen merking i det hele tatt. Folk antar menneskelig innsats som standard, og det er KI-merkelappen som fjerner den antakelsen. Studien brukte kortformatvideo, så overfør til meldinger med litt forsiktighet.


Å sette bort ordene ser ut til å svekke ditt eget engasjement i dem

Dette er funnet jeg fortsetter å tenke på, og det handler ikke om mottakeren i det hele tatt.

Økonomer ved CREED i Amsterdam20 kjørte tillitsspill der avsendere kunne bruke ChatGPT til å skrive en melding som lovet gjengjeldelse. To ting skjedde samtidig. Folk med tilgang til ChatGPT ga flere eksplisitte løfter. Og folk som i det hele tatt åpnet ChatGPT, holdt løftene sine 25,7 % sjeldnere ved utbetaling, uansett om de endte med å kopiere det verktøyet ga dem eller ikke.

Den talende detaljen er at jo nærmere den sendte meldingen lå det rå ChatGPT-forslaget, desto mindre tillitsvekkende var avsenderens senere atferd. De som skrev om forslaget, oppførte seg bedre. Forfatterne leser dette som en eierskapsfølelse. Sier du noe med dine egne ord, føler du deg bundet av det. Videresender du noe en maskin skrev, er det en del av deg som aldri signerte på det. Det er også derfor Subtext viser deg problemet før noen erstatning, og markerer hvor mye av din egen formulering hver versjon har endret. En rettelse du selv velger eller skriver, er en du har signert.


Unnskyldninger er der dette har blitt studert skikkelig, og funnet er mer nyttig enn «ikke gjør det»

Leser du bare én seksjon, les denne, for det praktiske svaret bor her.

Ella Glikson og Omri Asscher gjennomførte tre scenariostudier om unnskyldninger på arbeidsplassen, publisert i Computers in Human Behavior21. Å vite at noen brukte KI-verktøy til å skrive en unnskyldning, reduserte hvor autentisk den virket og hvor villige folk var til å tilgi. Å opplyse om det selv dempet ikke dette. Så langt, forutsigbart.

Så kom delen som fikk meg til å tenke om. Deltakere som brukte bare ett av tre tilgjengelige KI-verktøy, fikk ingen autentisitetsstraff i det hele tatt. Forskerne leser det som avstand. Begrenset KI-bruk holder den ferdige meldingen nær det personen egentlig mente, og folk kan kjenne det.

Et separat 3x2-eksperiment av Lim, Hong og Schneider med 464 deltakere, også i Computers in Human Behavior22, fant at menneskeskrevne unnskyldninger ble oppfattet som mer oppriktige gjennomgående, og at en varm tone forbedret KI-unnskyldninger uten noensinne å lukke gapet til en menneskelig en.

En CHI-artikkel fra 202623 av Fan, Liu og Pan testet dette på romantiske meldinger, med 152 deltakere i en første studie og 704 i en andre. Jo mer av en melding KI-en hadde skrevet, desto mindre fremsto den som avsenderens egen, og desto mindre autentisk virket den. En lett omskriving av tonen som avsenderen selv godkjente, hjalp på hvordan en unnskyldning ble vurdert, men hele utkast og meldinger om grenser ga andre utslag.

Setter du de tre ved siden av hverandre, får du noe praktisk. Straffen følger hvor langt den ferdige meldingen har drevet bort fra det du mente. Ikke om en maskin var i rommet. Det er samme grunn til at Subtext viser deg hva som skaper inntrykket, før den i det hele tatt tilbyr en ferdig versjon, og forteller deg hvor mye av formuleringen din hver versjon har endret, fordi det å holde den avstanden kort er det som holder en unnskyldning troverdig. Den bredere forskningen på hvordan du sier unnskyld over tekst finnes i en egen artikkel.


Disse verktøyene polerer dine verste instinkter og sier aldri et ord

Skriv noe passiv-aggressivt, gi det til et hvilket som helst omskrivingsverktøy på mobilen din, og se hva som skjer. Du får bedre skrevet passiv aggresjon. Ingen advarsel, ingen «er du sikker». Verktøyets jobb er å gjøre det du ba om.

Det er en grunn til at modellene heller denne veien. OpenAI trakk tilbake en GPT-4o-oppdatering i april 2025 og skrev offentlig24 at modellen hadde blitt «overdrevent smigrende eller medgjørlig, ofte beskrevet som sycophantic», og at den «lente mot svar som var overdrevent støttende, men uoppriktige». Årsaken de pekte på, var for tung trening på kortsiktig brukertilbakemelding, altså tommel opp og tommel ned. I et oppfølgingsinnlegg25 innrømmet de at de ikke hadde noen driftsevalueringer som sporet smiger i det hele tatt.

Anthropic-forskere fant at det samme mønsteret er generelt. I en studie presentert på ICLR 202426 viste alle fem ledende assistenter smiger, og analyse av rundt 15 000 menneskelige preferansesammenligninger fant at det å matche brukerens uttalte oppfatninger var blant de sterkeste prediktorene for hvilket svar folk foretrakk. Tren på godkjenning, og du selekterer for enighet. En benchmark fra 202527 målte smigrende atferd i 58,19 % av testtilfellene på tvers av ChatGPT-4o, Claude Sonnet og Gemini 1.5 Pro, med 78,5 % vedvarenhet når det først startet, selv om den testet faktaspørsmål, ikke personlige meldinger. For personlige meldinger sammenlignet jeg ChatGPT-alternativer for skriving og hva de tre store gjør med ordene dine.

Tenk nå på hva det betyr for øyeblikket du trenger hjelp mest. Du er sint, du har skrevet noe du kommer til å angre på, og verktøyet som holder utkastet ditt, er optimalisert for å få deg til å føle deg bra med det.

Det øyeblikket er akkurat det Subtext er bygget for, og det ubehagelige er poenget. Den forteller deg at utkastet leses som sint, i stedet for å få sinnet til å høres bedre ut.


Spørsmålet jeg ikke kan svare på

Er det bedre å sende en klønete melding du skrev selv, eller en polert en du ikke skrev?

Jeg lette grundig, og det finnes ingen studie som tester dette direkte. Ingen har randomisert «ditt eget ufullkomne utkast» mot «et godt utkast du ikke skrev selv» og fulgt med på hva som skjedde med relasjonen. Det finnes ingenting longitudinelt i det hele tatt. Ingen feltdata på par, familier eller nære venner over måneder med KI-hjulpet meldingsskriving. Vi vet ikke om folk tilpasser seg syntetisk polering, eller om vanen stille eroderer noe.

Det vi har, peker i én retning for nære relasjoner. Innsats leses som omsorg, merkelapper flater ut signalet, bortsatte ord ser ut til å løsne grepet ditt om dine egne løfter, og unnskyldninger forblir troverdige når de holder seg nær det du mente. Men resultatet fra tillitsspillet sier at kostnaden i noen sammenhenger var for liten til å måles, og jeg kommer ikke til å late som om belegget er renere enn det er.


Så hva ville hjulpet

Leser jeg alt dette på nytt, synes jeg formen på det manglende produktet er ganske klar, og at den ligger nær det motsatte av det kategorien bygger.

Ingen trenger å få ordene sine erstattet. Det de trenger, i de femten sekundene før de trykker send, er å vite at meldingen leses kaldere enn de føler, eller at det de tror er en oppklaring, leses som en liste med klager. Så fikser de det selv, med sine egne ord, og innsatssignalet overlever, eierskapet overlever, og avstanden Glikson og Asscher fant, holder seg kort.

Det er versjonen jeg ønsker skal finnes, og det er rundt den vi bygde Subtext. Subtext tar hele tråden fremfor bare setningen, setter navn på hva utkastet ditt sannsynligvis signaliserer til personen som skal lese det, og viser deg ordene som skaper det inntrykket. Hver versjon den deretter tilbyr, viser hvor mye av formuleringen din den har endret, og du kan endre hvilken som helst av dem med Rediger manuelt før du kopierer den, slik at fikset forblir ditt eget. Ut fra belegget over betyr det mer enn omskrivingen, fordi straffen følger avstanden fra det du mente, og den korteste avstanden er din egen setning med ett ord endret. Prøv Subtext i nettleserenPrøv Subtext i nettleseren

Min egen regel, for hva den er verdt: jeg lar gjerne en maskin fortelle meg hvordan meldingen min høres ut. Jeg lar den ikke fortelle søsteren min at jeg er lei meg.


Tror du jeg har lest en studie feil, eller kjenner du til et verktøy som faktisk diagnostiserer før det skriver om? Si fra på LinkedIn.

Samet Durgun er medgrunnlegger av Subtext, en app som fanger opp den følelsesmessige tonen i meldingene dine og skriver dem om med din egen stemme. Han bor i Berlin.

Kilder

Hver lenke over går til primærkilden der en slik finnes, nummerert i den rekkefølgen de opptrer. Produktfunksjoner og priser sjekket august 2026. Der et tall kom fra en firmablogg eller pressemelding i stedet for en studie, utelot jeg det.

  1. Apple Support. Use Writing Tools with Apple Intelligence on iPhone.
  2. Samsung. Use Writing assist on Galaxy phones and tablets.
  3. Google Support. Use writing tools with Gboard.
  4. Google Support. Draft messages with Magic Compose.
  5. Apple App Store. Resolve: AI Conflict Coach.
  6. Google Play. Clarity Coach.
  7. Microsoft Support. Get email coaching with Copilot in Outlook.
  8. Grammarly Support. Reader Reactions user guide.
  9. Grammarly. Writing Tone Detector and Tone Suggestions.
  10. TechCrunch (2019). Grammarly gets a tone detector to keep you out of email trouble.
  11. Grammarly Support. How do Grammarly’s tone suggestions work?
  12. Jakesch, M., Hancock, J. T., & Naaman, M. (2023). Human heuristics for AI-generated language are flawed. PNAS, 120(11), e2208839120.
  13. Hohenstein, J., Kizilcec, R. F., DiFranzo, D., Aghajari, Z., Mieczkowski, H., Levy, K., Naaman, M., Hancock, J., & Jung, M. F. (2023). Artificial intelligence in communication impacts language and social relationships. Scientific Reports, 13, 5487.
  14. Khadpe, P., Wenzel, K., Loewenstein, G., & Kaufman, G. (2025). Explaining the Reputational Risks of AI-Mediated Communication. AAAI/ACM Conference on AI, Ethics and Society.
  15. Purcell, Z. A., Jakesch, M., Dong, M., Nussberger, A.-M., & Köbis, N. (2025). Writing with AI boosts trust-building efficiency. iScience, 28(12), 114092.
  16. Yin, Y., Jia, N., & Wakslak, C. J. (2024). AI can help people feel heard, but an AI label diminishes this impact. PNAS, 121(14), e2319112121.
  17. Ovsyannikova, D., Oldemburgo de Mello, V., & Inzlicht, M. (2025). Third-party evaluators perceive AI as more compassionate than expert humans. Communications Psychology, 3.
  18. Yamaguchi, M., et al. (2015). Commitment signals in friendship and romantic relationships. Evolution and Human Behavior.
  19. Human-made vs. AI-generated: how provenance labels drive strategic curation via perceived effort (2026). Frontiers in Psychology.
  20. AI-Powered Promises: The Influence of ChatGPT on Trust and Trustworthiness. CREED, University of Amsterdam.
  21. Glikson, E., & Asscher, O. (2023). AI-mediated apology in a multilingual work context. Computers in Human Behavior, 140, 107592.
  22. Lim, J. S., Hong, N., & Schneider, E. (2025). How warm- versus competent-toned AI apologies affect trust and forgiveness through emotions and perceived sincerity. Computers in Human Behavior, 172, 108761.
  23. Fan, G., Liu, D., & Pan, L. (2026). Is It Still You? Attributing Authorship and Authenticity in AI-Assisted Romantic Communication. Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems, 1-24.
  24. OpenAI (2025). Sycophancy in GPT-4o.
  25. OpenAI (2025). Expanding on what we missed with sycophancy.
  26. Sharma, M., et al. (2024). Towards Understanding Sycophancy in Language Models. ICLR 2024.
  27. Fanous, A., et al. (2025). SycEval: Evaluating LLM Sycophancy. AAAI/ACM Conference on AI, Ethics and Society.