ArtiklarSkrivverktyg

ChatGPT-alternativ för skrivande: vad de tre stora gör med dina ord

ChatGPT, Claude och Gemini är alla bra på att göra text korrekt. Här är var de i tysthet slutar göra den till din, och vad folk bygger ovanpå.

Av Samet Durgun · Medgrundare av Subtext · 12 min läsning

Jag har sett någon skriva samma meddelande elva gånger. Radera det. Skriva det igen. Läsa det högt. Skicka det till en kompis för en andra åsikt. Och sedan skicka en nedkortad version som knappt säger något alls.

Förr eller senare klistrar de flesta in det i ChatGPT.

Det som kommer tillbaka är oftast bättre. Grammatiken är ren, meningarna sitter tajtare, allt svammel är borta. Det är oftast inte deras längre heller. Meddelandet går från något en nervös människa skrev klockan ett på natten till något en kompetent främling skrev klockan tio en tisdag förmiddag, och den som tar emot det känner skillnaden även om hen inte kan sätta ord på den.

Jag bygger en app i den här branschen, så jag är partisk per definition och du bör läsa resten med det i bakhuvudet. Jag vill hellre vara användbar än övertygande, så det mesta av den här texten handlar om vad de tre stora assistenterna faktiskt är bra på, följt av de specifika och rätt väldokumenterade sätt de fallerar på när skrivandet blir personligt.

Börja med det de är bra på

Behöver du ett meddelande som är grammatiskt, kortare, tydligare eller översatt är alla tre utmärkta, och då ska du bara använda dem. De fixar satsradningar, klipper bort inledningar som bara harklar sig, gör ett svamligt stycke till tre rena meningar och byter stilnivå på kommando. ChatGPT:s Canvas1 ger dig en redigeringsyta sida vid sida i stället för en vägg av nygenererad text. Geminis Help me write sitter direkt i Gmail och Docs, vilket tar bort det mesta av tröskeln att över huvud taget ta sig till ett verktyg. Claudes Projects håller kvar en stilguide och en uppsättning referensdokument mellan sessioner.

För ett jobbmejl som ska vara oförargligt och korrekt är det hela jobbet. Du kan sluta läsa här.

Resten handlar om den andra sortens meddelande. Ursäkten. Gränsen du har skjutit upp att sätta. Svaret till din mamma. Sms:et till någon du en gång var ihop med. Den kategorin beter sig annorlunda, och det är där skillnaderna mellan modellerna börjar spela roll.

Fyra saker en omskrivning kan förstöra

Redigeringsforskningen drar en användbar gräns mellan ytkvalitet och revideringstrohet. Ett meddelande kan bli mjukare och samtidigt sämre, eftersom mjukandet tar bort just de delar som gjorde jobbet. Att ändra ”det var ju ett sätt att uttrycka saken på” till ”hon höll absolut inte med” är mer explicit och betydligt mindre sant.

Det finns ungefär fyra saker en revidering måste låta vara:

Vad som ska stå fast Vad det omfattar Så förstör modellerna det
Fakta Namn, datum, siffror, vad du faktiskt lovade Lägger till en detalj, gör om ett kanske till ett ja
Det underförstådda Ironi, artighet, distans, medveten vaghet Säger det underförstådda rakt ut
Röst Ditt ordval, din rytm, dina meningslängder, hur du sätter skiljetecken Byter ut den mot flytande husstil
Struktur Vad du inledde med och vad du grävde ner Kastar om det till något konventionellt tydligare

Varje invändning längre ner i den här texten är någon av de fyra som fallerar. Värt att notera att grammatikverktyg bara kollar den första, och att de flesta som bedömer en AI-omskrivning också bara lägger märke till den första.

ChatGPT: läser av rummet, redigerar sedan förbi uppdraget

ChatGPT är den mest känslomässigt intuitiva av de tre när det gäller dialog. Ge den en scen där två personer pratar om något vardagligt medan de undviker något smärtsamt, så låter den i regel det smärtsamma förbli osagt. Texten den ger tillbaka har ett naturligt flyt, och den är bra på att se den känslomässiga dynamiken under det som faktiskt står.

Dess återkommande problem är att den inte stannar kvar i redaktörsstolen. Användare som beskriver hur den redigerar landar gång på gång i samma klagomål: den skriver om saker ingen bett den röra.

”Även i meningar som inte hade något med de begärda ändringarna att göra verkar ChatGPT ändå vilja skriva om.”

Användarrapport om ChatGPT:s sätt att redigera2

Två följdeffekter spelar roll för meddelanden. Den första är att den skalar bort det specifika. Raden som gjorde din ursäkt till din, något i stil med ”jag vet att du stod ute och väntade i fyrtio minuter”, kollapsar till ”jag vet att jag lät dig vänta”. Skönlitterära författare rapporterar en hårdare variant av samma instinkt: de lämnar in tre tusen ord för en språklig genomgång och får tillbaka under hälften, trots att de bett om att längden ska bevaras.3

Den andra är att vaga toninstruktioner ger vilda kast i stället för justeringar.

”Den kommer ofta tillbaka i en riktigt formell ton. Säger man ‘mindre formellt’ slår den hela vägen över till superavslappnat.”

Användarrapport om tonstyrning4

Och att mata den med mer av ditt eget skrivande löser inte tillförlitligt röstproblemet. En skribent lämnade in runt sex tusen ord egen prosa som referens och rapporterade att resultatet fortfarande ”stank ChatGPT”.5

Claude: följer uppdraget, förklarar sedan dig för dig själv

Claude är den starkaste av de tre på att göra det du faktiskt bad om och inget mer. Den håller sig till ramarna, hittar inte på detaljer och hanterar inre liv bra, vilket är varför den dyker upp gång på gång när folk vill ha en modell som inte tar över deras utkast.

Här finns också det närmaste vi kommer hårda jämförande belägg. MultiPragEval, ett benchmark som testar pragmatisk förståelse på engelska, tyska, koreanska och kinesiska, placerade Claude 3 Opus tydligt före GPT-4 på implikatur och griceansk tolkning, vilket är det tekniska sättet att säga att den var bättre på att lista ut vad någon menade snarare än vad hen bokstavligen sa.6 Två förbehåll. Testet mäter tolkning, inte redigering. Och modellerna som testades är flera generationer gamla nu, så det här pekar på en tendens i familjen snarare än på dagens resultatlista.

Claudes felläge är motsatsen till ChatGPT:s. Den förstår undertexten och skriver sedan ner den. Skönlitterära författare kallar det explikationsdrift: modellen gör om något underförstått till något utsagt, i prosa av typen ”tystnaden mellan dem bar på årens outtalade tyngd”. I ett sms visar det sig som terapisvenska.

Illustrativt exempel, inte fångad output

jag är inte sur, jag märkte bara att du inte svarade

Det du skrev. Medvetet nedtonat, vilket är hela poängen.

Jag vill dela med mig av att jag känt mig lite sårad av att det dröjt innan jag hört från dig, och jag tror att det kommer ur att jag verkligen värdesätter vår vänskap.

Undertexten är nu texten. Den är lugn, välformulerad, och den säger exakt det du valde att inte säga.

Två mönster till hos Claude dyker upp tillräckligt ofta för att planera för. Den utsmyckar när den lämnas utan ramar, av en användare beskrivet som en ”tydlig förbättring i stilfullt skrivande” som ändå kunde ”överspela” resultatet.7 Och den är generös med beröm och lindar in kritik i en komplimangsmacka.8 Den andra är ett verkligt problem när det du behövde var ett rakt besked om huruvida ditt meddelande landar illa.

Gemini: redan där du är, dålig på att låta saker förbli osagda

Geminis fördel är läge. Den finns i Gmail, den finns i Docs, den är standardassistent i massor av Android-telefoner, och gratisnivån är generös. Den har inte ChatGPT:s vana att krympa din text, och den moraliserar mindre kring svårt innehåll.

Omdömena om dess skrivkvalitet går verkligen isär, och jag tycker det är värt att säga i stället för att jämna ut. Vissa erfarna skribenter rankar den som bäst av de tre på nyans och på kritik av skönlitterärt skrivande. Andra tycker att den har en husstil den vägrar släppa.

”Problemet för mig är skrivstilen, den skriver som en redditor.”

Användarrapport om Geminis grundton9

Mönstret som är mest relevant för personliga meddelanden är att Gemini har väldigt lite berättarmässig återhållsamhet. Finns det något som hålls tillbaka lägger den fram det i öppen dager. Romanförfattare beskriver det som att hänga upp en blinkande neonskylt över just den detalj som skulle ha förblivit dold. I ett meddelande betyder det att det du försiktigt gick runt hamnar i mening två.

Problemen som alla tre delar

Ett: de håller med dig

Det här är det som spelar störst roll, och det är bäst dokumenterat.

I april 2025 släppte OpenAI en uppdatering som gjorde ChatGPT märkbart mer smickrande, och rullade tillbaka den fyra dagar senare. Deras egen genomgång10 sa att modellen ”lutade mot svar som var överdrivet stöttande men oärliga”, och spårade orsaken till att kortsiktigt användargillande vägde för tungt. Ett uppföljande inlägg11 några dagar senare gick närmare in på vad deras granskningsprocess hade missat.

Den underliggande mekanismen är inte specifik för OpenAI. Forskning på fem ledande assistenter fann att modeller tränade på mänskliga preferensdata ”ofta offrar sanningsenlighet till förmån för att matcha användarens övertygelser”, eftersom det är medhållet som belönas.12

Tänk nu på vad folk faktiskt frågar de här verktygen om. Väldigt få klistrar in ett meddelande och ber om grammatikhjälp. De frågar någon variant av ”är det här för hårt?” eller ”överreagerar jag?” Den frågan går till ett system med strukturell slagsida mot att tala om för dig att du är helt okej.

En allmän assistent hjälper dig skriva en bättre skuldbeläggning. Den kommer inte att nämna att du skuldbelägger.

Du ville ha en andra åsikt och det du fick var en medundertecknare med bättre skiljetecken.

Två: de normaliserar sådant du gjorde med flit

Alla tre rättar meningsfragment, upprepningar, ovanlig interpunktion, garderingar och dialekt, även när det var val. Att be om att ”rösten bevaras” löser det inte, eftersom modellen omöjligt kan veta vilka egenheter som är dina och vilka som är misstag.

Besläktat, och subtilare, är semantisk inflation. En modell gör ”jag kanske inte hinner” till ”jag kommer inte att kunna komma”, eller ”du verkade lite off” till ”du var upprörd”. Varje ändring läses som mer självsäker och är mindre exakt, och i ett meddelande om en relation är exaktheten i gradskillnader det mesta av innehållet.

Tre: de skriver på en dialekt folk känner igen

Varje modell har språkliga vanor. Skribenter har katalogiserat dem ett tag nu, och när du väl ser dem kan du inte sluta.

Mönster Exempel Vad det kostar
Abstrakta substantiv vittnesbörd, väv, ledstjärna, kakofoni Byter en konkret detalj mot en storslagen
Binär inramning ”Det var inte X, det var Y” / ”Inte av A, utan av B” Tvingar en prydlig slutsats på något rörigt
Utsagt inre liv ”kunde inte låta bli att känna”, ”kommer ur en plats av” Namnger känslan i stället för att visa den
Treuppräkningar Tre led där två hade räckt Läses som komponerat snarare än skrivet
Balanserad antites Två satser av samma vikt, i all oändlighet En rytm som inte tillhör någon människa

Bakom ordlistan finns en större oro. Studier av AI-assisterat skrivande visar att modellens ingrepp för olika skribenter mot samma dominerande mönster, vilket betyder att ju mer du använder de här verktygen desto mer konvergerar allas skrivande.13 För ett meddelande vars hela syfte är att omisskännligt komma från dig är det fel riktning.

Fyra: mottagaren kan märka det, och det kostar dig

Det här är delen folk underskattar. Det finns ett forskningsfält som kallas AI-medierad kommunikation, och dess centrala fynd är obekvämt: folk är opålitliga på att identifiera AI-skriven text14, och de lutar sig mot bristfälliga ledtrådar när de försöker. Men när de tror att en text är AI-genererad litar de mindre på den som skrev den.15

Risken med en generisk omskrivning är alltså inte bara ett medelmåttigt meddelande. Det är ett meddelande som läses som oärligt i exakt det ögonblick då uppriktigheten är hela innehållet. En ursäkt som utlöser någons AI-detektor gör mer skada än den klumpiga ursäkt du själv hade skrivit.

Fem: de vet inte vem du skriver till

Varje session börjar tom. För att få ett bra utkast skulle du behöva förklara tio år av en vänskap, vad som hände i mars, varför frasen ”det är lugnt” betyder något specifikt just mellan er två. Nästan ingen gör det, så modellen skriver för en generisk mottagare. Formalitet är vad du får när ett system inte vet något om relationen, och det är därför resultatet så ofta låter som kundtjänst.

Sedan finns det som folk nämner lite tystare. Att klistra in en skärmdump av ett bråk, eller ett utkast till ett uppbrott, eller ett meddelande om din familj i en allmän chattbot känns annorlunda än att be den felsöka kod. Den instinkten är inte paranoid.

Vad romanförfattarna gjorde åt det här

Här är det som övertygade mig om att glappet är verkligt och inte något jag hittat på för att ha något att sälja.

Skönlitterära författare gick in i exakt de här problemen först, med högre insatser och högre volym. Deras svar var inte att sluta använda modellerna. Det var att sluta använda dem råa. Ett helt lager av verktyg växte fram ovanpå: miljöer som Novelcrafter16, där du kan bygga en ordlista med förbjudna klichéer som markeras i rött medan texten genereras, och köra riktade operationer som ”show, don’t tell” på en markerad del. Sudowrite17 gör något liknande med särskilda genomkörningar som omvandlar sammanfattning till konkret sinnesdetalj.

Seriösa användare går längre och kör pipelines med flera modeller. En modell för strukturkommentarer och undertextanalys, en andra för språkredigering under strikta ramar, ett filtreringssteg som skrubbar bort AI-ordförrådet, och sedan en mänsklig genomgång som lägger tillbaka rösten. Forskningslitteraturen landar i samma arkitektur från andra hållet och rekommenderar ett separat tolkningssteg före all revidering, ändringar på avsnittsnivå i stället för fullständiga omskrivningar, och en validator som kontrollerar att inget utanför det efterfrågade har flyttat sig.18

Det är fyra verktyg och en checklista för att revidera ett enda kapitel. Det fungerar. Det säger också något: de allmänna modellerna klarar inte det här jobbet på egen hand, och de som bryr sig mest om resultatet har redan accepterat det.

Applicera nu det på ett sms. Ingen kör en pipeline i fyra steg innan hen svarar sin syster. Behovet av ett förfinat lager är identiskt och toleransen för ansträngning är ungefär noll, vilket är det verkliga produktproblemet.

Vad ett mer förfinat verktyg måste göra annorlunda

Tre saker, och ingen av dem är ”skriv bättre”.

Analysera innan du skriver om. Sätt ord på vad utkastet signalerar innan du rör ett enda ord i det, inklusive den del skribenten inte menade. Forskningen pekar åt samma håll: att identifiera vad ett stycke antyder och revidera utifrån den tolkningen ger bättre resultat än ett enda odifferentierat ”förbättra det här”.19 Det är också det enda riktiga svaret på inställsamhet, eftersom ett verktyg som börjar med en diagnos måste säga något innan det hinner hålla med dig.

Visa avståndet, dölj det inte. En version nära det du skrev, bredvid en version skriven från noll, är mer användbar än en enda polerad ersättare. Du ser vad som ändrades och avgör själv om du är beredd att låta så.

Håll kvar relationen, inte bara meddelandet. Vem den här personen är för dig, vad du redan har provat, vad ”det är lugnt” betyder i just den här vänskapen.

Det är det jag bygger, så behandla det här stycket därefter. Subtext taggar känslan i det du skrev innan den föreslår något, vilket är ett medvetet irriterande designval, eftersom det ögonblick då den är som mest användbar är det ögonblick då du minst vill höra det.

Illustrativt exempel, inte fångad output

det är lugnt, jag fattar, du har mycket. jag slutar fråga.

Det du skulle skicka. Läses som att du drar dig undan, och ”jag slutar fråga” är ett hot förklätt till ursäkt.

Hej, jag har full förståelse för att det varit mycket på sistone. Ingen fara alls med ikväll, säg bara till när det passar bättre så löser vi något.

En generisk omskrivning. Grammatiskt korrekt, trevlig, och den har raderat att du är sårad, vilket var den enda informationen i originalet.

det är lugnt. men jag är lite besviken, det här är tredje gången. jag säger hellre det än låtsas att det är ingenting.

Samma röst, samma längd, behåller det sårade, släpper hotet.

När jag ändå öppnar ChatGPT

Långa dokument. Professionella mejl. Allt där det är viktigare att vara korrekt än att vara igenkännbart du. Research, första utkast, översättning, och den där specifika nåden att få ord på en tom sida när du inte kommer igång.

Och ett faktum som talar emot mitt eget argument, som jag hellre tar med än utelämnar. I en studie av medicinska frågor från ett offentligt forum20 föredrog bedömarna chattbotens svar framför läkarnas i 78,6 % av jämförelserna, och bedömde chattbotens svar som empatiska eller mycket empatiska nästan tio gånger så ofta. De här modellerna kan producera text som läses som varm. Den förmågan är verklig.

Det de inte gör är att säga att ditt meddelande läses som ett ultimatum. De får ultimatumet att flyta bättre och ger dig en komplimang för din känslomässiga ärlighet. Det glappet är litet, och det är större delen av jobbet.

En notering om modellversioner. Allt ovan beskriver beteenden som hållit i sig över flera generationer av varje modellfamilj, och det är därför jag mestadels undvikit att namnge specifika versioner. De här systemen ändras med några månaders mellanrum, och varje text som hänger upp sitt argument på ett enskilt versionsnummer har fel till vintern.


Tycker du att jag varit orättvis mot din favoritmodell? Säg det till mig på LinkedIn.

Samet Durgun är medgrundare till Subtext, en app som fångar den känslomässiga tonen i dina meddelanden och skriver om dem med din egen röst. Han bor i Berlin.


Källor

Varje länk ovan går till primärkällan, där en sådan finns.

  1. OpenAI, “Introducing Canvas,” 3 oktober 2024. openai.com
  2. Samlade användarkommentarer om ChatGPT:s redigeringsomfång, hämtade från offentliga forum och recensioner.
  3. Samlade rapporter från skönlitterära skrivgemenskaper om förkortning under språkredigering.
  4. Samlade användarkommentarer om känslighet för toninstruktioner, hämtade från samma källor.
  5. En användarrapport om stilimitation med omfattande skrivprover, hämtad från samma källor.
  6. Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testade engelska, tyska, koreanska och kinesiska över griceanska kategorier; Gemini uteslöts vid tillfället av skäl som rörde API-åtkomst.
  7. Samlade användarkommentarer om Claudes utsmyckning av prosa, hämtade från samma källor.
  8. Användarkommentarer om Claudes stil i redaktionell återkoppling, hämtade från samma källor.
  9. En användarkommentar om Geminis grundton i skrift, hämtad från samma källor.
  10. OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 april 2025. openai.com
  11. OpenAI, “Expanding on what we missed with sycophancy,” 2 maj 2025. openai.com
  12. Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, oktober 2023. arxiv.org
  13. Forskning om stilistisk homogenisering i AI-assisterat skrivande, bland annat Padmakumar och He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, och Doshi och Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
  14. Jakesch, Hancock och Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
  15. Jakesch, French, Ma, Hancock och Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Se även Hancock, Naaman och Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
  16. Novelcrafter, Codex och promptfunktionerna för textersättning. novelcrafter.com
  17. Sudowrite, funktionerna “Show, Don’t Tell” och Describe. sudowrite.com
  18. Syntes av offentligt diskuterade arkitekturansatser för produktionssystem med begränsad revidering, inklusive redigering på avsnittsnivå och invariansvalidering.
  19. Forskning om implikaturmedveten prompting, med fyndet att den som gör latent avsikt explicit före generering får högre relevans och kvalitet i resultatet.
  20. Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 april 2023. 585 bedömningar; chattbotens svar föredrogs i 78,6 % av jämförelserna och bedömdes som empatiska eller mycket empatiska 9,8 gånger så ofta som läkarnas. jamanetwork.com