ArtiklerSkriveverktøy
ChatGPT-alternativer for skriving: hva de tre store gjør med ordene dine
ChatGPT, Claude og Gemini gjør alle tekst korrekt. Her er punktet der hver av dem stille slutter å gjøre den til din, og hva folk bygger oppå.
Av Samet Durgun · Medgrunnlegger av Subtext · 12 min lesetid
Jeg har sett noen skrive den samme meldingen elleve ganger. Slette den. Skrive den på nytt. Lese den høyt. Sende den til en venn for å få en ekstra mening. Og så sende en forkortet versjon som nesten ikke sier noe.
På et eller annet tidspunkt limer de fleste den inn i ChatGPT.
Det som kommer tilbake, er som regel bedre. Grammatikken er ryddig, setningene er strammere, det ullne er borte. Det er som regel heller ikke deres egen tekst lenger. Meldingen går fra å være noe en nervøs person skrev klokka ett om natta, til noe en kompetent fremmed skrev klokka ti en tirsdag formiddag, og mottakeren kjenner den forskjellen selv uten å klare å sette ord på den.
Jeg lager en app i denne kategorien, så jeg er åpenbart farget, og du bør lese resten med det i bakhodet. Jeg vil heller være nyttig enn overbevisende, så det meste av denne teksten handler om hva de tre store assistentene faktisk er gode på, etterfulgt av de konkrete og ganske godt dokumenterte måtene de svikter på når skrivingen blir personlig.
Start med det de er gode på
Trenger du at en melding blir grammatisk riktig, kortere, klarere eller oversatt, er alle tre utmerkede, og da bør du bare bruke dem. De retter kommafeil, kutter innledninger som bare kremter, gjør et ullent avsnitt om til tre rene setninger, og bytter stilnivå på kommando. ChatGPTs Canvas1 gir deg en redigeringsflate side om side i stedet for en vegg av nygenerert tekst. Geminis Hjelp meg å skrive ligger rett inni Gmail og Docs, noe som fjerner det meste av friksjonen ved i det hele tatt å komme seg til et verktøy. Claudes Projects holder på en stilguide og et sett referansedokumenter på tvers av økter.
For en jobbmail som bare skal være uanstøtelig og korrekt, er det hele jobben. Du kan slutte å lese her.
Resten handler om den andre typen melding. Unnskyldningen. Grensen du har utsatt å sette. Svaret til moren din. Meldingen til en du var sammen med før. Den kategorien oppfører seg annerledes, og det er der forskjellene mellom disse modellene begynner å bety noe.
Fire ting en omskriving kan ødelegge
Forskning på redigering trekker et nyttig skille mellom overflatekvalitet og revisjonstroskap. En melding kan bli glattere samtidig som den blir dårligere, fordi glattingen fjerner akkurat de delene som gjorde jobben. Å endre «det var én måte å si det på» til «hun var sterkt uenig» er mer eksplisitt og mye mindre sant.
Det er grovt sett fire ting en revisjon må la være i fred:
| Det som skal ligge fast | Hva det dekker | Hvordan modellene bryter det |
|---|---|---|
| Fakta | Navn, datoer, tall, hva du faktisk lovet | Legger til en detalj, gjør et kanskje om til et ja |
| Implikasjon | Ironi, høflighet, avstand, bevisst vaghet | Sier det underforståtte rett ut |
| Stemme | Ordvalget ditt, rytmen, setningslengden, tegnsettingsvanene dine | Bytter det ut med flytende husstil |
| Struktur | Hva du begynte med og hva du gjemte bort | Stokker om til noe som er konvensjonelt tydeligere |
Hver eneste innvending lenger ned i teksten er én av disse fire som svikter. Verdt å merke seg at grammatikkverktøy bare sjekker den første, og at de fleste som vurderer en KI-omskriving, bare legger merke til den første de også.
ChatGPT: leser stemningen, og redigerer forbi oppdraget
ChatGPT er den mest følelsesmessig intuitive av de tre når det gjelder dialog. Gi den en scene der to personer snakker om noe hverdagslig mens de unngår noe vondt, og som regel lar den det vonde bli usagt. Teksten den lager har en naturlig rytme, og den er god til å oppdage den følelsesmessige dynamikken under det som ble skrevet.
Det gjentakende problemet er at den ikke blir sittende i redaktørstolen. Brukere som beskriver hvordan den redigerer, ender opp med den samme innvendingen: den skriver om ting ingen har bedt den røre.
«Selv i setninger som ikke hadde noe med endringene jeg ba om å gjøre, virker det som ChatGPT vil skrive om.»
Brukerrapport om hvordan ChatGPT redigerer2
To følgeeffekter betyr noe for meldinger. Den første er at den skreller vekk det spesifikke. Linja som gjorde unnskyldningen din til din, noe sånt som «jeg vet du sto ute i førti minutter», kollapser til «jeg vet jeg lot deg vente». Skjønnlitterære forfattere melder om en hardere variant av samme instinkt: de leverer fra seg tre tusen ord til språkvask og får tilbake under halvparten, selv om de ba om at lengden skulle beholdes.3
Den andre er at vage instruksjoner om tone gir voldsomme utslag i stedet for justeringer.
«Den kommer ofte tilbake med en veldig formell tone. Sier du ‘mindre formell’, svinger den helt over til superavslappet.»
Brukerrapport om tonestyring4
Og å mate den med mer av din egen tekst løser ikke stemmeproblemet på noen pålitelig måte. En skribent la inn rundt seks tusen ord av sin egen prosa som referanse, og meldte at resultatet fortsatt «stinket ChatGPT».5
Claude: følger oppdraget, og forklarer deg for deg selv
Claude er den sterkeste av de tre til å gjøre det du faktisk ba om, og ingenting mer. Den holder seg til rammene, finner ikke på detaljer, og håndterer indre liv godt, og det er grunnen til at den dukker opp igjen og igjen når folk vil ha en modell som ikke overtar utkastet deres.
Her finnes også det nærmeste vi kommer harde sammenligningstall. MultiPragEval, en test av pragmatisk forståelse på engelsk, tysk, koreansk og kinesisk, plasserte Claude 3 Opus klart foran GPT-4 på implikatur og tolkning i Grices forstand, som er den tekniske måten å si at den var bedre til å regne ut hva noen mente, i motsetning til hva de bokstavelig talt sa.6 To forbehold. Testen måler tolkning, ikke redigering. Og modellene som ble testet er flere generasjoner gamle nå, så dette peker på en tendens i familien, ikke på dagens stilling.
Claudes svakhet er det motsatte av ChatGPTs. Den forstår det som ligger under, og så skriver den det ned. Skjønnlitterære forfattere kaller det eksplikasjonsdrift: modellen gjør noe underforstått om til noe uttalt, i prosa som «stillheten mellom dem bar den usagte tyngden av mange år». I en tekstmelding kommer det ut som terapispråk.
Illustrerende eksempel, ikke faktisk modellsvar
jeg er ikke sur, jeg la bare merke til at du ikke svarte
Det du skrev. Bevisst underdrevet, og det er hele poenget.
Jeg har lyst til å dele at jeg har kjent meg litt såret av at det tok tid før jeg hørte fra deg, og jeg tror det kommer fra et sted der jeg verdsetter vennskapet vårt veldig høyt.
Det som lå under, er nå selve teksten. Den er rolig, velformulert, og den sier nøyaktig den ene tingen du valgte å ikke si.
To andre Claude-mønstre dukker opp ofte nok til at du bør planlegge rundt dem. Den pynter på når den ikke får rammer, beskrevet av én bruker som en «tydelig forbedring i stilig skriving» som likevel kunne «overspille» resultatet.7 Og den er raus med ros, og pakker kritikk inn i en komplimentsandwich.8 Det siste er et ekte problem når det du trengte var en rett fram vurdering av om meldingen din lander dårlig.
Gemini: allerede der du er, dårlig til å la noe være usagt
Geminis fordel er plassering. Den er i Gmail, den er i Docs, den er standardassistenten på mange Android-telefoner, og gratisnivået er raust. Den har ikke ChatGPTs vane med å krympe teksten din, og den moraliserer mindre over vanskelig innhold.
Rapportene om skrivekvaliteten er reelt delte, og jeg synes det er verdt å si i stedet for å glatte over. Noen erfarne skribenter mener den er best av de tre på kritikk av skjønnlitterær tekst og på nyanser. Andre opplever at den har en husstil den nekter å legge fra seg.
«Problemet for meg er skrivestilen, den skriver som en redditor.»
Brukerrapport om Geminis standardregister9
Mønsteret som betyr mest for personlige meldinger, er at Gemini har svært lite fortellermessig tilbakeholdenhet. Er det noe som holdes tilbake, legger den det åpent fram. Romanforfattere beskriver det som å henge et blinkende neonskilt over detaljen som skulle forbli skjult. I en melding betyr det at akkurat den tingen du gikk forsiktig rundt, havner i setning nummer to.
Problemene alle tre deler
Én: de er enige med deg
Dette er det som betyr mest, og det er best dokumentert.
I april 2025 rullet OpenAI ut en oppdatering som gjorde ChatGPT merkbart mer smigrende, og trakk den tilbake fire dager senere. Deres egen redegjørelse10 sa at modellen «helte mot svar som var overdrevent støttende, men uoppriktige», og sporet årsaken til at kortsiktig brukertilfredshet ble vektet for tungt. Et oppfølgingsinnlegg11 noen dager etter gikk grundigere inn på hva gjennomgangen deres hadde oversett.
Mekanismen bak er ikke spesiell for OpenAI. Forskning på tvers av fem ledende assistenter fant at modeller trent på menneskelige preferansedata «ofte ofrer sannferdighet til fordel for å matche brukerens oppfatninger», fordi det er enighet som blir belønnet.12
Tenk så på hva folk faktisk spør disse verktøyene om. Svært få limer inn en melding og ber om grammatikkhjelp. De spør en variant av «er dette for hardt?» eller «overreagerer jeg?». Det spørsmålet går til et system med en innebygd skjevhet mot å fortelle deg at du er helt fin.
En generell assistent hjelper deg å legge skyld på noen mer elegant. Den nevner ikke at det er det du gjør.
Du ville ha en ekstra vurdering, og det du fikk var en medunderskriver med bedre tegnsetting.
To: de normaliserer ting du gjorde med vilje
Alle tre retter opp setningsfragmenter, gjentakelser, uvanlig tegnsetting, forbehold og dialekt, også når det var valg du tok. Å be om at «stemmen bevares» hjelper ikke, for modellen har ingen måte å vite hvilke særheter som er dine og hvilke som er feil.
Beslektet, og mer subtilt, er semantisk inflasjon. En modell gjør «jeg klarer det kanskje ikke» om til «jeg kommer ikke til å klare det», eller «du virket litt rar» om til «du var lei deg». Hver endring leses som mer sikker og er mindre presis, og i en melding om et forhold er presisjon om grad det meste av innholdet.
Tre: de skriver på en dialekt folk kjenner igjen
Hver modell har språklige vaner. Skribenter har katalogisert dem en stund nå, og når du først ser dem, klarer du ikke å slutte.
| Mønster | Eksempler | Hva det koster |
|---|---|---|
| Abstrakte substantiver | vitnesbyrd, veven, fyrtårn, kakofoni | Bytter en konkret detalj mot en storslått en |
| Binær innramming | «Det var ikke X, det var Y» / «Ikke av A, men av B» | Påtvinger noe rotete en ryddig konklusjon |
| Uttalt innsideliv | «kunne ikke la være å føle», «fra et sted der» | Navngir følelsen i stedet for å vise den |
| Treleddede lister | Tre punkter der to holder | Leses som komponert, ikke skrevet |
| Balansert antitese | To ledd med lik vekt, i det uendelige | En rytme som ikke tilhører noe menneske |
Bak ordlista ligger en større bekymring. Studier av KI-assistert skriving finner at modellens inngrep dytter ulike skribenter mot de samme dominerende mønstrene, noe som betyr at jo mer du bruker disse verktøyene, jo mer nærmer alles skriving seg hverandre.13 For en melding hvis hele poeng er å være umiskjennelig fra deg, er det feil retning.
Fire: mottakeren kan merke det, og det koster deg
Dette er delen folk undervurderer. Det finnes et forskningsfelt som kalles KI-mediert kommunikasjon, og hovedfunnet er ubehagelig: folk er upålitelige til å kjenne igjen KI-skrevet tekst14, og de støtter seg på feilaktige signaler når de prøver. Men når de tror at en tekst er KI-generert, stoler de mindre på den som skrev den.15
Risikoen ved en generisk omskriving er altså ikke bare en middelmådig melding. Det er en melding som leses som uoppriktig i akkurat det øyeblikket oppriktighet er hele innholdet. En unnskyldning som utløser noens KI-detektor, gjør mer skade enn den klossete unnskyldningen du ville skrevet selv.
Fem: de vet ikke hvem du skriver til
Hver økt starter tom. For å få et godt utkast måtte du forklart ti år med vennskap, hva som skjedde i mars, hvorfor «det går fint» betyr noe helt spesielt mellom dere to. Nesten ingen gjør det, så modellen skriver for en generisk mottaker. Formalitet er det du får når et system ikke vet noe om relasjonen, og det er grunnen til at resultatet så ofte høres ut som kundeservice.
Så er det den delen folk nevner lavmælt. Å lime inn et skjermbilde av en krangel, eller et utkast til et brudd, eller en melding om familien din i en helt generell chatbot, kjennes annerledes enn å be den finne feil i kode. Den følelsen er ikke paranoid.
Hva romanforfatterne gjorde med alt dette
Her er det som overbeviste meg om at dette gapet er ekte, og ikke noe jeg fant på for å ha noe å selge.
Skjønnlitterære forfattere traff nøyaktig disse feilene først, med høyere innsats og i større volum. Svaret deres var ikke å slutte å bruke modellene. Det var å slutte å bruke dem rått. Et helt lag med verktøy vokste fram oppå: miljøer som Novelcrafter16, der du kan bygge en ordliste over forbudte klisjeer som blir merket i rødt mens teksten genereres, og kjøre målrettede operasjoner som «vis, ikke fortell» på en markert del. Sudowrite17 gjør noe lignende med egne gjennomkjøringer som gjør sammendrag om til konkrete sanselige detaljer.
Seriøse brukere går lenger og kjører kjeder med flere modeller. Én modell til strukturnotater og analyse av det som ligger under, en annen til språkvask under strenge rammer, en filtreringsrunde som skrubber vekk KI-vokabular, og så en menneskelig runde som setter stemmen tilbake. Forskningslitteraturen ender på den samme arkitekturen fra motsatt kant, og anbefaler et eget tolkningstrinn før enhver revisjon, redigering av avgrensede tekstbiter i stedet for full omskriving, og en validator som sjekker at ingenting utenfor det du ba om har flyttet seg.18
Det er fire verktøy og en sjekkliste for å revidere ett kapittel. Det funker. Det forteller deg også noe: de generelle modellene klarer ikke denne jobben alene, og de som bryr seg mest om resultatet, har allerede akseptert det.
Overfør det så til en tekstmelding. Ingen kjører en firetrinns prosess før de svarer søsteren sin. Behovet for et finere lag er nøyaktig det samme, og tålmodigheten for ekstra arbeid er omtrent null, og det er det egentlige produktproblemet.
Hva et mer finslipt verktøy må gjøre annerledes
Tre ting, og ingen av dem er «skriv bedre».
Analyser før du skriver om. Sett navn på hva utkastet signaliserer før du rører et eneste ord, også den delen skribenten ikke mente å sende. Forskningen peker samme vei: å identifisere hva et avsnitt impliserer, og så revidere ut fra den tolkningen, gir bedre resultater enn et enkelt, udifferensiert «gjør denne bedre».19 Dette er også det eneste ekte svaret på smisking, for et verktøy som starter med en diagnose, må si noe før det får sjansen til å være enig med deg.
Vis avstanden, ikke skjul den. En versjon som ligger nær det du skrev, ved siden av en versjon skrevet fra bunnen av, er mer nyttig enn én pusset erstatning. Du ser hva som ble endret, og bestemmer om du er villig til å høres sånn ut.
Hold på relasjonen, ikke bare meldingen. Hvem denne personen er for deg, hva du allerede har prøvd, hva «det går fint» betyr i akkurat dette vennskapet.
Det er det jeg holder på å bygge, så behandle dette avsnittet deretter. Subtext tagger følelsen i det du skrev før den foreslår noe som helst, et bevisst irriterende designvalg, for øyeblikket den er mest nyttig, er øyeblikket du minst vil høre det.
Illustrerende eksempel, ikke faktisk modellsvar
det går fint, jeg skjønner, du har mye. jeg skal slutte å spørre.
Det du ville sendt. Leses som at du trekker deg unna, og «jeg skal slutte å spørre» er en trussel forkledd som en unnskyldning.
Hei, jeg har full forståelse for at det har vært travelt i det siste. Helt i orden med i kveld, bare si fra når det passer bedre, så finner vi ut av noe.
En generisk omskriving. Grammatisk riktig, hyggelig, og den har slettet det faktum at du er såret, som var den eneste informasjonen i originalen.
det går fint. jeg blir litt skuffa, da, dette er tredje gang. jeg sier det heller enn å late som det er ingenting.
Samme stemme, samme lengde, beholder det som gjør vondt, kutter trusselen.
Der jeg fortsatt ville åpnet ChatGPT
Lange dokumenter. Profesjonell e-post. Alt der det å være korrekt betyr mer enn å være gjenkjennelig deg. Research, første utkast, oversettelse, og den helt spesielle nåden i å få ord ned på et tomt ark når du ikke klarer å begynne.
Og et faktum som taler mot mitt eget argument, som jeg heller vil ha med enn å utelate. I en studie av medisinske spørsmål fra et åpent forum20 foretrakk evaluatorene chatbotens svar framfor legens i 78,6 % av sammenligningene, og vurderte chatbotens svar som empatiske eller svært empatiske nesten ti ganger så ofte. Disse modellene kan lage tekst som leses som varm. Den evnen er reell.
Det de ikke gjør, er å fortelle deg at meldingen din leses som et ultimatum. De får ultimatumet til å flyte bedre og gir deg ros for følelsesmessig ærlighet. Det gapet er lite, og det er mesteparten av jobben.
En merknad om modellversjoner. Alt over beskriver oppførsel som har holdt seg gjennom flere generasjoner av hver modellfamilie, og det er derfor jeg stort sett har unngått å navngi bestemte versjoner. Disse systemene endrer seg med noen måneders mellomrom, og enhver tekst som fester argumentet sitt til ett versjonsnummer, er utdatert innen vinteren.
Synes du jeg har vært urettferdig mot favorittmodellen din? Si fra på LinkedIn.
Samet Durgun er medgründer av Subtext, en app som fanger opp den følelsesmessige tonen i meldingene dine og skriver dem om med dine egne ord. Han bor i Berlin.
Kilder
Hver lenke over går til primærkilden der det finnes en.
- OpenAI, “Introducing Canvas,” 3. oktober 2024. openai.com
- Samlede brukerkommentarer om ChatGPTs redigeringsomfang, hentet fra offentlige forum og anmeldelser.
- Samlede rapporter fra skjønnlitterære skrivemiljøer om at tekst blir forkortet under språkvask.
- Samlede brukerkommentarer om følsomhet for toneinstruksjoner, hentet fra de samme kildene.
- En brukerrapport om stilimitasjon med lange skriveprøver, hentet fra de samme kildene.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testet engelsk, tysk, koreansk og kinesisk på tvers av Grices kategorier. Gemini ble utelatt av hensyn til API-tilgang på det tidspunktet.
- Samlede brukerkommentarer om Claudes utsmykning av prosa, hentet fra de samme kildene.
- Brukerkommentarer om Claudes stil i redaksjonell tilbakemelding, hentet fra de samme kildene.
- En brukerkommentar om Geminis standardregister i skriving, hentet fra de samme kildene.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29. april 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2. mai 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, oktober 2023. arxiv.org
- Forskning på stilistisk homogenisering i KI-assistert skriving, blant annet Padmakumar og He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, og Doshi og Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock og Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock og Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Se også Hancock, Naaman og Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funksjonene Codex og prompter for tekstutskifting. novelcrafter.com
- Sudowrite, funksjonene “Show, Don’t Tell” og Describe. sudowrite.com
- Sammenstilling av offentlig diskuterte tilnærminger til produksjonsarkitektur for begrensede revisjonssystemer, blant annet redigering av avgrensede tekstbiter og validering av invarians.
- Forskning på implikaturbevisst prompting, som finner at det å gjøre underliggende intensjon eksplisitt før generering forbedrer relevansen og kvaliteten på resultatet.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28. april 2023. 585 vurderinger. Chatbotsvar ble foretrukket i 78,6 % og vurdert som empatiske eller svært empatiske 9,8 ganger så ofte som legesvarene. jamanetwork.com