ArtiklerSkriveværktøjer
ChatGPT-alternativer til at skrive: hvad de tre store gør ved dine ord
ChatGPT, Claude og Gemini er alle gode til at gøre tekst korrekt. Her er, hvor de holder op med at gøre den til din, og hvad folk bygger oven på.
Af Samet Durgun · Medstifter af Subtext · 12 min læsning
Jeg har set et menneske skrive den samme besked elleve gange. Slette den. Skrive den igen. Læse den højt. Sende den til en ven for at få en anden mening. Og så sende en forkortet version, der næsten ikke siger noget.
På et tidspunkt indsætter de fleste den i ChatGPT.
Det, der kommer tilbage, er som regel bedre. Grammatikken er ren, sætningerne er strammere, alt det ramlende er væk. Det er som regel heller ikke deres længere. Beskeden går fra at være noget, et nervøst menneske skrev klokken et om natten, til noget, en kompetent fremmed skrev klokken ti en tirsdag formiddag, og den, der modtager den, kan mærke forskellen, selv når de ikke kan sætte ord på den.
Jeg bygger selv en app i den her branche, så jeg er forudindtaget per definition, og du bør læse resten med det i baghovedet. Jeg vil hellere være nyttig end overbevisende, så det meste her handler om, hvad de tre store assistenter faktisk er gode til, og derefter om de helt konkrete og ret veldokumenterede måder, de fejler på, når det, du skriver, bliver personligt.
Lad os starte med det, de er gode til
Skal en besked bare være grammatisk korrekt, kortere, tydeligere eller oversat, er alle tre fremragende, og så skal du bare bruge dem. De retter kommafejl, skærer de indledninger væk, hvor man rømmer sig, laver et ramlende afsnit om til tre rene sætninger og skifter register på kommando. ChatGPTs Canvas1 giver dig en redigeringsflade med begge versioner ved siden af hinanden i stedet for en mur af nygenereret tekst. Geminis Help me write sidder direkte i Gmail og Docs, hvilket fjerner det meste af besværet ved overhovedet at komme hen til et værktøj. Claudes Projects holder fast i en stilguide og et sæt referencedokumenter på tværs af sessioner.
Til en arbejdsmail, der skal være uangribelig og korrekt, er det hele opgaven. Du kan roligt stoppe med at læse her.
Resten her handler om den anden slags besked. Undskyldningen. Den grænse, du har udskudt at sætte. Svaret til din mor. Beskeden til en, du engang var sammen med. Den kategori opfører sig anderledes, og det er der, forskellene mellem modellerne begynder at betyde noget.
Fire ting en omskrivning kan ødelægge
Forskningen i redigering trækker en nyttig grænse mellem overfladekvalitet og troskab mod originalen. En besked kan blive glattere og samtidig dårligere, fordi udglatningen fjerner præcis de steder, der gjorde arbejdet. At lave “det var én måde at sige det på” om til “hun var stærkt uenig” er mere eksplicit og meget mindre sandt.
Der er groft sagt fire ting, en omskrivning skal lade være i fred:
| Hvad der ligger fast | Hvad det dækker | Sådan ødelægger modellerne det |
|---|---|---|
| Fakta | Navne, datoer, tal, hvad du faktisk lovede | Digter en detalje med, gør et måske til et ja |
| Underforståelse | Ironi, høflighed, afstand, bevidst vaghed | Siger det underforståede lige ud |
| Stemme | Dine ordvalg, din rytme, sætningslængde, tegnsætningsvaner | Erstatter det med flydende husstil |
| Struktur | Hvad du åbnede med, og hvad du begravede | Bytter rundt, så det bliver konventionelt tydeligere |
Hver eneste indvending længere nede i teksten er en af de fire, der svigter. Værd at bemærke: grammatikværktøjer tjekker kun den første, og de fleste, der vurderer en AI-omskrivning, lægger også kun mærke til den første.
ChatGPT: læser stemningen og redigerer så mere, end du bad om
ChatGPT er den mest følelsesmæssigt intuitive af de tre, når det gælder dialog. Giv den en scene, hvor to mennesker taler om noget banalt, mens de undgår noget smertefuldt, og den lader som regel det smertefulde stå usagt. Teksten har en naturlig rytme, og den er god til at få øje på den følelsesmæssige dynamik under det, der er skrevet.
Dens gennemgående problem er, at den ikke bliver siddende i redaktørstolen. Brugere, der beskriver dens redigeringsadfærd, ender igen og igen samme sted: den skriver ting om, som ingen har bedt den røre ved.
“Selv i sætninger, der intet havde med de ønskede ændringer at gøre, virker det som om ChatGPT stadig gerne vil skrive om.”
Brugerudsagn om ChatGPTs redigeringsadfærd2
To afledte effekter betyder noget for beskeder. Den første er, at den fjerner det specifikke. Den linje, der gjorde din undskyldning til din, noget i retning af “jeg ved godt, du stod udenfor i fyrre minutter”, klapper sammen til “jeg ved godt, jeg lod dig vente”. Skønlitterære forfattere oplever en hårdere udgave af det samme instinkt: de afleverer tre tusind ord til en sproglig gennemgang og får under halvdelen tilbage, selv om de bad om at få længden bevaret.3
Den anden er, at vage instruktioner om tone giver vilde udsving i stedet for justeringer.
“Den kommer tit tilbage i en rigtig formel tone. Siger man ‘mindre formel’, svinger den hele vejen over i mega afslappet.”
Brugerudsagn om tonestyring4
Og det hjælper ikke pålideligt på stemmeproblemet at fodre den med mere af din egen tekst. En skribent gav den omkring seks tusind ord af sin egen prosa som reference og fortalte, at resultatet stadig “lugtede langt væk af ChatGPT”.5
Claude: holder sig til opgaven og forklarer dig så for dig selv
Claude er den stærkeste af de tre til at gøre præcis det, du bad om, og ikke andet. Den holder sig til rammerne, opfinder ikke detaljer og håndterer det indre liv godt, og derfor er det den, der bliver nævnt igen og igen, når folk vil have en model, der ikke overtager deres udkast.
Her findes også det nærmeste, vi kommer på hårde sammenligningstal. MultiPragEval, en benchmark der tester pragmatisk forståelse på engelsk, tysk, koreansk og kinesisk, placerede Claude 3 Opus tydeligt foran GPT-4 på implikatur og griceansk fortolkning, hvilket er den tekniske måde at sige, at den var bedre til at regne ud, hvad nogen mente, frem for hvad de bogstaveligt sagde.6 To forbehold. Benchmarken tester fortolkning, ikke redigering. Og de testede modeller er flere generationer gamle nu, så det peger på en tendens i familien, ikke på en aktuel stilling.
Claudes svaghed er den modsatte af ChatGPTs. Den forstår underteksten og skriver den så ned. Skønlitterære forfattere kalder det eksplikationsdrift: modellen laver noget underforstået om til noget udtalt, i prosa som “stilheden mellem dem bar årenes usagte vægt”. I en sms viser det sig som terapisprog.
Illustrativt eksempel, ikke et faktisk output
jeg er ikke sur, jeg lagde bare mærke til at du ikke skrev tilbage
Det, du skrev. Bevidst underspillet, og det er hele pointen.
Jeg vil gerne dele, at jeg har følt mig en smule såret over, at der gik så lang tid, før jeg hørte fra dig, og jeg tror, det kommer fra et sted, hvor jeg virkelig værdsætter vores venskab.
Underteksten er nu blevet teksten. Den er rolig, velformuleret og siger præcis det, du havde valgt ikke at sige.
To andre Claude-mønstre dukker op tit nok til, at man skal planlægge efter dem. Den pynter, når den ikke får snor på, beskrevet af en bruger som en “tydelig forbedring i stilfuld skrivning”, der stadig kunne “overspille” resultatet.7 Og den er rundhåndet med ros og pakker kritikken ind i en komplimentsandwich.8 Den sidste er et rigtigt problem, når det, du havde brug for, var en kontant vurdering af, om din besked lander skidt.
Gemini: allerede der, hvor du er, dårlig til at lade noget stå usagt
Geminis fordel er placering. Den er i Gmail, den er i Docs, den er standardassistenten på mange Android-telefoner, og gratisniveauet er generøst. Den har ikke ChatGPTs vane med at skrumpe din tekst, og den moraliserer mindre over svært indhold.
Vurderingerne af dens skrivekvalitet er reelt delte, og det synes jeg er værd at sige frem for at glatte ud. Nogle erfarne skribenter kalder den den bedste af de tre til kritik af skønlitteratur og til nuancer. Andre oplever, at den har en husstil, den ikke vil slippe.
“Problemet for mig er skrivestilen, den skriver som en redditor.”
Brugerudsagn om Geminis standardregister9
Det mønster, der betyder mest for personlige beskeder, er, at Gemini har meget lidt fortællemæssig tilbageholdenhed. Er der noget, der bliver holdt tilbage, lægger den det åbent frem. Romanforfattere beskriver det som at hænge et blinkende neonskilt op over lige præcis den detalje, der skulle være blevet skjult. I en besked betyder det, at det, du omhyggeligt skrev udenom, ender i sætning nummer to.
De problemer, alle tre deler
Et: de er enige med dig
Det her er det, der betyder mest, og det er også det bedst dokumenterede.
I april 2025 udsendte OpenAI en opdatering, der gjorde ChatGPT mærkbart mere smigrende, og rullede den tilbage fire dage senere. Deres egen redegørelse10 skrev, at modellen “hældede mod svar, der var overdrevent støttende, men uoprigtige”, og sporede årsagen tilbage til, at kortsigtet brugertilfredshed vejede for tungt. Et opfølgende indlæg11 et par dage efter gik mere i detaljer med, hvad deres kontrolproces havde overset.
Den underliggende mekanisme er ikke noget særligt for OpenAI. Forskning på tværs af fem førende assistenter fandt, at modeller trænet på menneskelige præferencedata “ofte ofrer sandfærdighed til fordel for at ramme brugerens egne overbevisninger”, fordi det er enigheden, der bliver belønnet.12
Tænk så på, hvad folk faktisk spørger de her værktøjer om. Meget få indsætter en besked og beder om hjælp til grammatikken. De spørger en variant af “er den her for hård?” eller “overreagerer jeg?”. Det spørgsmål lander hos et system, der er strukturelt tilbøjeligt til at fortælle dig, at du er helt fin.
En generel assistent hjælper dig med at give den anden dårlig samvittighed på en pænere måde. Den nævner ikke, at det er dét, du gør.
Du ville have en anden mening, og det, du fik, var en medunderskriver med bedre tegnsætning.
To: de normaliserer det, du gjorde med vilje
Alle tre retter ufuldstændige sætninger, gentagelser, usædvanlig tegnsætning, forbehold og dialekt, også når det var bevidste valg. At bede om at få “stemmen bevaret” løser det ikke, for modellen har ingen måde at vide på, hvilke skævheder der er dine, og hvilke der er fejl.
Beslægtet, og mere subtilt, er semantisk inflation. En model laver “jeg når det måske ikke” om til “jeg kan ikke nå det”, eller “du virkede lidt underlig” om til “du var ked af det”. Hver rettelse læses som mere sikker og er mindre præcis, og i en besked om en relation er præcision i graden det meste af indholdet.
Tre: de skriver i en dialekt, folk kan genkende
Hver model har sine sproglige vaner. Skribenter har katalogiseret dem et stykke tid nu, og når først du kan se dem, kan du ikke lade være.
| Mønster | Eksempler | Hvad det koster |
|---|---|---|
| Abstrakte substantiver | vidnesbyrd, vævning, fyrtårn, kakofoni | Bytter en konkret detalje ud med en storslået |
| Binær indramning | “Det var ikke X, det var Y” / “Ikke af A, men af B” | Presser en pæn konklusion ned over noget rodet |
| Udtalt indre liv | “kunne ikke lade være med at føle”, “fra et sted, hvor” | Sætter navn på følelsen i stedet for at vise den |
| Treleddede opremsninger | Tre led, hvor to ville være nok | Læses som komponeret frem for skrevet |
| Balanceret modstilling | To sætningsled af samme vægt, i det uendelige | En rytme, der ikke tilhører noget menneske |
Der ligger en større bekymring bag ordlisten. Undersøgelser af AI-assisteret skrivning viser, at modellens indblanding skubber vidt forskellige skribenter mod de samme dominerende mønstre, hvilket betyder, at jo mere du bruger værktøjerne, jo mere nærmer alles skrivning sig hinanden.13 For en besked, hvis hele formål er at være umiskendeligt fra dig, er det den forkerte retning.
Fire: modtageren opdager det måske, og det koster dig
Det her undervurderer folk. Der findes et helt forskningsfelt om det, der kaldes AI-medieret kommunikation, og dets centrale fund er ubehageligt: mennesker er upålidelige til at genkende AI-skrevet tekst14, og de læner sig op ad fejlagtige signaler, når de prøver. Men når de tror, at en tekst er AI-genereret, stoler de mindre på afsenderen.15
Risikoen ved en generisk omskrivning er altså ikke bare en middelmådig besked. Det er en besked, der læses som uoprigtig i præcis det øjeblik, hvor oprigtigheden er hele indholdet. En undskyldning, der udløser modtagerens indre AI-detektor, gør mere skade end den klodsede undskyldning, du selv ville have skrevet.
Fem: de ved ikke, hvem du skriver til
Hver session starter tom. For at få et godt udkast skulle du forklare ti års venskab, hvad der skete i marts, hvorfor sætningen “det er fint” betyder noget helt bestemt mellem jer to. Det gør stort set ingen, så modellen skriver til en generisk modtager. Formalitet er det, du får, når et system intet ved om relationen, og det er derfor, resultatet så tit lyder som kundeservice.
Og så er der det, folk siger lidt lavmælt. At indsætte et screenshot af et skænderi, et udkast til et brud eller en besked om din familie i en generel chatbot føles anderledes end at bede den finde en fejl i noget kode. Den fornemmelse er ikke paranoid.
Hvad romanforfatterne gjorde ved det hele
Her er det, der overbeviste mig om, at hullet er ægte og ikke bare noget, jeg har fundet på for at have noget at sælge.
Skønlitterære forfattere ramte præcis de her fejl først, med mere på spil og i større mængder. Deres svar var ikke at holde op med at bruge modellerne. Det var at holde op med at bruge dem rå. Der voksede et helt lag af værktøjer op oven på: miljøer som Novelcrafter16, hvor du kan bygge en ordbog over forbudte klicheer, der bliver markeret med rødt, mens teksten bliver genereret, og køre målrettede operationer som “vis det, sig det ikke” på en markeret passage. Sudowrite17 gør noget lignende med dedikerede gennemløb, der laver referat om til konkrete sanselige detaljer.
De seriøse brugere går videre og kører pipelines med flere modeller. Én model til de overordnede noter og analysen af underteksten, en anden til sproglige rettelser under stramme rammer, et filtreringsgennemløb der skrubber AI-ordforrådet væk, og til sidst et menneskeligt gennemløb, der lægger stemmen tilbage. Forskningslitteraturen ender på den samme arkitektur fra den anden ende og anbefaler et selvstændigt fortolkningstrin før enhver omskrivning, rettelser på passageniveau frem for hele omskrivninger, og en validator, der tjekker, at intet uden for det bestilte har flyttet sig.18
Det er fire værktøjer og en tjekliste for at gennemskrive ét kapitel. Det virker. Det fortæller også noget: de generelle modeller klarer ikke den her opgave uden hjælp, og de mennesker, der går mest op i resultatet, har for længst accepteret det.
Læg så det ned over en sms. Ingen kører en pipeline i fire trin, før de svarer deres søster. Behovet for et forfinet lag er præcis det samme, og tålmodigheden over for besvær er nogenlunde nul, og det er det egentlige produktproblem.
Hvad et mere forfinet værktøj skal gøre anderledes
Tre ting, og ingen af dem er “skriv bedre”.
Analysér før du skriver om. Sæt navn på, hvad udkastet signalerer, før du rører et eneste ord, også den del skribenten ikke havde tænkt sig. Forskningen peger samme vej: at identificere, hvad en passage antyder, og skrive om ud fra den fortolkning giver bedre resultater end et enkelt udifferentieret “gør den her bedre”.19 Det er også det eneste rigtige svar på smigeren, for et værktøj, der åbner med en diagnose, er nødt til at sige noget, før det når at være enig med dig.
Vis afstanden, skjul den ikke. En version tæt på det, du selv skrev, ved siden af en version skrevet helt forfra, er mere brugbar end én poleret erstatning. Du kan se, hvad der er ændret, og selv beslutte, om du har lyst til at lyde sådan.
Hold på relationen, ikke bare beskeden. Hvem det her menneske er for dig, hvad du allerede har prøvet, hvad “det er fint” betyder i lige præcis det venskab.
Det er det, jeg bygger, så tag det her afsnit for, hvad det er. Subtext sætter mærkat på følelsen i det, du skrev, før den foreslår noget som helst, og det er et bevidst irriterende designvalg, for det øjeblik, hvor den er mest nyttig, er præcis det øjeblik, hvor du mindst har lyst til at høre det.
Illustrativt eksempel, ikke et faktisk output
det er fint, jeg forstår det godt, du har travlt. jeg skal nok holde op med at spørge.
Det, du ville sende. Læses som at trække sig, og “jeg skal nok holde op med at spørge” er en trussel forklædt som en undskyldning.
Hej, jeg har fuld forståelse for, at der har været travlt på det seneste. Slet ingen problemer med i aften, sig bare til, når det passer bedre, så finder vi ud af noget.
En generisk omskrivning. Grammatisk korrekt, behagelig, og den har slettet det faktum, at du er såret, hvilket var den eneste information i originalen.
det er fint. jeg er godt nok lidt skuffet, det er tredje gang nu. jeg siger det hellere end at lade som om det ikke er noget.
Samme stemme, samme længde, beholder det, der sårer, og dropper truslen.
Hvornår jeg stadig selv åbner ChatGPT
Lange dokumenter. Professionelle mails. Alt, hvor det betyder mere at være korrekt end at være genkendeligt dig. Research, første udkast, oversættelse, og den helt særlige nåde det er at få ord ned på en tom side, når du ikke kan komme i gang.
Og så et faktum, der taler imod mit eget argument, som jeg hellere vil have med end udelade. I et studie af lægefaglige spørgsmål fra et offentligt forum20 foretrak bedømmerne chatbottens svar frem for lægens i 78,6 % af sammenligningerne og vurderede chatbottens svar som empatiske eller meget empatiske næsten ti gange så ofte. De her modeller kan producere tekst, der læses som varm. Den evne er ægte.
Det, de ikke gør, er at fortælle dig, at din besked læses som et ultimatum. De får ultimatummet til at flyde bedre og roser dig for din følelsesmæssige ærlighed. Det hul er lille, og det er det meste af opgaven.
En note om modelversioner. Alt herover beskriver adfærd, der har holdt sig gennem flere generationer af hver modelfamilie, og derfor har jeg stort set undgået at nævne bestemte versioner. De her systemer ændrer sig hver anden måned, og enhver tekst, der binder sit argument op på ét versionsnummer, er forkert inden vinter.
Synes du, jeg har været uretfærdig over for din yndlingsmodel? Sig det til mig på LinkedIn.
Samet Durgun er medstifter af Subtext, en app der fanger den følelsesmæssige tone i dine beskeder og skriver dem om med dine egne ord. Han bor i Berlin.
Kilder
Hvert link ovenfor peger på den primære kilde, hvor der findes en.
- OpenAI, “Introducing Canvas,” 3. oktober 2024. openai.com
- Samlede brugerkommentarer om ChatGPTs redigeringsomfang, indsamlet fra offentlige fora og anmeldelser.
- Samlede beretninger fra skønlitterære skrivefællesskaber om afkortning under sproglige gennemløb.
- Samlede brugerkommentarer om følsomhed over for toneinstruktioner, indsamlet fra de samme kilder.
- En brugerberetning om stilefterligning med længere skriveprøver, indsamlet fra de samme kilder.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testede engelsk, tysk, koreansk og kinesisk på tværs af griceanske kategorier; Gemini var på det tidspunkt udeladt af hensyn til API-adgang.
- Samlede brugerkommentarer om Claudes udsmykning af prosa, indsamlet fra de samme kilder.
- Brugerkommentarer om Claudes stil i redaktionel feedback, indsamlet fra de samme kilder.
- En brugerkommentar om Geminis standardregister i skrift, indsamlet fra de samme kilder.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29. april 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2. maj 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, oktober 2023. arxiv.org
- Forskning i stilistisk ensretning i AI-assisteret skrivning, blandt andet Padmakumar og He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, og Doshi og Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock og Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock og Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Se også Hancock, Naaman og Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, Codex og funktioner til tekstudskiftende prompts. novelcrafter.com
- Sudowrite, funktionerne “Show, Don’t Tell” og Describe. sudowrite.com
- Sammenfatning af offentligt diskuterede tilgange til produktionsarkitektur for begrænsede omskrivningssystemer, herunder redigering på passageniveau og validering af invarians.
- Forskning i implikaturbevidst prompting, der finder, at det forbedrer relevansen og kvaliteten af outputtet at gøre latent hensigt eksplicit før generering.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28. april 2023. 585 vurderinger; chatbottens svar blev foretrukket i 78,6 % af sammenligningerne og vurderet som empatiske eller meget empatiske 9,8 gange så ofte som lægens svar. jamanetwork.com