ArtiklarSkrivverktyg

ChatGPT-alternativ för skrivande: vad de tre stora gör med dina ord

ChatGPT, Claude och Gemini är alla bra på att göra text korrekt. Här är var de i tysthet slutar göra den till din, och vad folk bygger ovanpå.

Av Samet Durgun · Medgrundare av Subtext · 14 min läsning

Jag har sett någon skriva samma meddelande elva gånger, vilket förklarar varför ett tvåradigt svar kan ta en timme. Radera det. Skriva det igen. Läsa det högt. Skicka det till en kompis för en andra åsikt. Och sedan skicka en nedkortad version som knappt säger något alls.

Förr eller senare klistrar de flesta in det i ChatGPT.

Det som kommer tillbaka är oftast bättre. Grammatiken är ren, meningarna sitter tajtare, allt svammel är borta. Det är oftast inte deras längre heller. Meddelandet går från något en nervös människa skrev klockan ett på natten till något en kompetent främling skrev klockan tio en tisdag förmiddag, och den som tar emot det känner skillnaden även om hen inte kan sätta ord på den. Det gapet är vad Subtext, appen jag var med och grundade, är byggd för att fånga. Den läser vad ett sådant meddelande faktiskt gör innan du skickar det.

Så jag är partisk per definition, och du bör läsa resten med det i bakhuvudet. Jag vill hellre vara användbar än övertygande, så det mesta av den här texten handlar om vad de tre stora assistenterna är bra på, följt av de specifika och rätt väldokumenterade sätt de fallerar på när skrivandet blir personligt. Källorna är länkade så att du kan väga mina egna intressen mot evidensen själv.

Börja med det de är bra på

Behöver du ett meddelande som är grammatiskt, kortare, tydligare eller översatt är alla tre utmärkta, och då ska du bara använda dem. De fixar satsradningar, klipper bort inledningar som bara harklar sig, gör ett svamligt stycke till tre rena meningar och byter stilnivå på kommando. ChatGPT:s Canvas1 ger dig en redigeringsyta sida vid sida i stället för en vägg av nygenererad text. Geminis Help me write sitter direkt i Gmail och Docs, vilket tar bort det mesta av tröskeln att över huvud taget ta sig till ett verktyg. Claudes Projects håller kvar en stilguide och en uppsättning referensdokument mellan sessioner.

För ett jobbmejl som ska vara oförargligt och korrekt räcker det. Du kan sluta läsa här.

Resten handlar om den andra sortens meddelande. Ursäkten. Gränsen du har skjutit upp att sätta. Svaret till din mamma. Sms:et till någon du en gång var ihop med. Den kategorin beter sig annorlunda, och det är där skillnaderna mellan modellerna börjar spela roll.

Fyra saker en omskrivning kan förstöra

Jag tycker det är användbart att skilja ytkvalitet från revideringstrohet. Ett meddelande kan bli mjukare och samtidigt sämre, eftersom mjukandet tar bort just de delar som gjorde jobbet. Att ändra ”det var ju ett sätt att uttrycka saken på” till ”hon höll absolut inte med” är mer explicit och betydligt mindre sant.

Min checklista har fyra saker en revidering måste låta vara. Det är så jag granskar en omskrivning, och ingen har validerat den som en skala.

Vad som ska stå fast Vad det omfattar Så förstör modellerna det
Fakta Namn, datum, siffror, vad du faktiskt lovade Lägger till en detalj, gör om ett kanske till ett ja
Det underförstådda Ironi, artighet, distans, medveten vaghet Säger det underförstådda rakt ut
Röst Ditt ordval, din rytm, dina meningslängder, hur du sätter skiljetecken Byter ut den mot flytande husstil
Struktur Vad du inledde med och vad du grävde ner Kastar om det till något konventionellt tydligare

Varje invändning längre ner i den här texten är någon av de fyra som fallerar. Jag noterar att grammatikverktyg bara kollar den första, och att de flesta som bedömer en AI-omskrivning också bara lägger märke till den första.

ChatGPT läser av rummet, redigerar sedan förbi uppdraget

ChatGPT är den mest känslomässigt intuitiva av de tre när det gäller dialog. Ge den en scen där två personer pratar om något vardagligt medan de undviker något smärtsamt, så låter den i regel det smärtsamma förbli osagt. Texten den ger tillbaka har ett naturligt flyt, och den är bra på att se den känslomässiga dynamiken under det som faktiskt står.

Dess återkommande problem är att den inte stannar kvar i redaktörsstolen. Användare som beskriver hur den redigerar landar gång på gång i samma klagomål, nämligen att den skriver om saker ingen bett den röra.

Två följdeffekter spelar roll för meddelanden. Den första är att den skalar bort det specifika. Raden som gjorde din ursäkt till din, något i stil med ”jag vet att du stod ute och väntade i fyrtio minuter”, kollapsar till ”jag vet att jag lät dig vänta”. Skönlitterära författare på nätforum rapporterar en hårdare variant av samma instinkt. De ber om en språklig genomgång som behåller längden och får tillbaka ett mycket kortare kapitel.

Den andra är att vaga toninstruktioner ger vilda kast där du ville ha en justering. En vanlig rapport är att den kommer tillbaka väldigt formell, och en enda begäran om mindre formellt slår över hela vägen till väldigt avslappnat.

Och att mata den med mer av ditt eget skrivande löser inte tillförlitligt röstproblemet. Skribenter som klistrar in tusentals ord av sin egen prosa som referens rapporterar ändå resultat som låter som ChatGPT.

Claude följer uppdraget, förklarar sedan dig för dig själv

Claude är den starkaste av de tre på att göra det du bad om och inget mer. Den håller sig till ramarna, hittar inte på detaljer och hanterar inre liv bra, vilket är varför den dyker upp gång på gång när folk vill ha en modell som inte tar över deras utkast.

Här finns också det närmaste vi kommer hårda jämförande belägg. MultiPragEval, ett benchmark som testar pragmatisk förståelse på engelska, tyska, koreanska och kinesiska, placerade Claude 3 Opus tydligt före GPT-4 på implikatur och griceansk tolkning, vilket är det tekniska sättet att säga att den var bättre på att lista ut vad någon menade snarare än vad hen bokstavligen sa.2 Jag vill lyfta fram två förbehåll. Testet mäter tolkning, inte redigering. Och modellerna som testades är flera generationer gamla nu, så det här pekar på en tendens i familjen, inte på dagens resultatlista.

Claudes felläge är motsatsen till ChatGPT:s. Den förstår undertexten och skriver sedan ner den. Skönlitterära författare kallar det explikationsdrift: modellen gör om något underförstått till något utsagt, i prosa av typen ”tystnaden mellan dem bar på årens outtalade tyngd”. I ett sms visar det sig som terapisvenska.

Illustrativt exempel, inte fångad output

jag är inte sur, jag märkte bara att du inte svarade

Det du skrev. Medvetet nedtonat, vilket är hela poängen.

Jag vill dela med mig av att jag känt mig lite sårad av att det dröjt innan jag hört från dig, och jag tror att det kommer ur att jag verkligen värdesätter vår vänskap.

Undertexten är nu texten. Den är lugn, välformulerad, och den säger exakt det du valde att inte säga.

Två mönster till hos Claude dyker upp tillräckligt ofta för att planera för. Den utsmyckar när den lämnas utan ramar, och användare beskriver prosan som mer stilfull och ibland överspelad. Och den är generös med beröm och lindar ofta in kritik i en komplimangsmacka. Den andra är ett verkligt problem när det du behövde var ett rakt besked om huruvida ditt meddelande landar illa.

Gemini är redan där du är, och dålig på att låta saker förbli osagda

Geminis fördel är läge. Den finns i Gmail, den finns i Docs, den är standardassistent i massor av Android-telefoner, och gratisnivån är generös. Den har inte ChatGPT:s vana att krympa din text, och den moraliserar mindre kring svårt innehåll.

Omdömena om dess skrivkvalitet går isär, och jag tycker det är värt att säga rakt ut. Vissa erfarna skribenter rankar den som bäst av de tre på nyans och på kritik av skönlitterärt skrivande. Andra tycker att den har en husstil den vägrar släppa, med ett pratigt tonläge som vissa jämför med en Reddit-kommentar.

Mönstret som är mest relevant för personliga meddelanden är att Gemini har väldigt lite berättarmässig återhållsamhet. Finns det något som hålls tillbaka lägger den fram det i öppen dager. Romanförfattare beskriver det som att hänga upp en blinkande neonskylt över just den detalj som skulle ha förblivit dold. I ett meddelande betyder det att det du försiktigt gick runt hamnar i mening två.

Problemen som alla tre delar

Ett: de håller med dig

Det här är det som spelar störst roll, och det är bäst dokumenterat.

I april 2025 släppte OpenAI en uppdatering som gjorde ChatGPT märkbart mer smickrande, och rullade tillbaka den fyra dagar senare. Deras egen genomgång3 sa att modellen ”lutade mot svar som var överdrivet stöttande men oärliga”, och spårade orsaken till att kortsiktigt användargillande vägde för tungt. Ett uppföljande inlägg4 några dagar senare gick närmare in på vad deras granskningsprocess hade missat.

Den underliggande mekanismen är inte specifik för OpenAI. Forskning på fem ledande assistenter fann att modeller tränade på mänskliga preferensdata ”ofta offrar sanningsenlighet till förmån för att matcha användarens övertygelser”, eftersom det är medhållet som belönas.5

Tänk nu på vad folk faktiskt frågar de här verktygen om. Väldigt få klistrar in ett meddelande och ber om grammatikhjälp. De frågar någon variant av ”är det här för hårt?” eller ”överreagerar jag?”, frågan jag går igenom i ”Låter det här sms:et oförskämt?”. Den frågan går till ett system med strukturell slagsida mot att tala om för dig att du är helt okej.

En allmän assistent hjälper dig skriva en bättre skuldbeläggning. Den kommer ofta inte att nämna att du skuldbelägger.

Du ville ha en andra åsikt och det du fick var en medundertecknare med bättre skiljetecken.

Av allt på den här sidan är detta det misslyckande som Subtext är byggd för att motverka mest direkt, och lösningen jag valde är strukturell. Jag återkommer till det.

Två: de normaliserar sådant du gjorde med flit

Alla tre rättar meningsfragment, upprepningar, ovanlig interpunktion, garderingar och dialekt, även när det var val. Att be om att ”rösten bevaras” löser det inte, eftersom modellen omöjligt kan veta vilka egenheter som är dina och vilka som är misstag.

Besläktat, och subtilare, är semantisk inflation. En modell gör ”jag kanske inte hinner” till ”jag kommer inte att kunna komma”, eller ”du verkade lite off” till ”du var upprörd”. Varje ändring läses som mer självsäker och är mindre exakt, och i ett meddelande om en relation är exaktheten i gradskillnader det mesta av innehållet.

Tre: de skriver på en dialekt folk känner igen

Varje modell har språkliga vanor. Skribenter har katalogiserat dem ett tag nu, och när du väl ser dem kan du inte sluta.

Mönster Exempel Vad det kostar
Abstrakta substantiv vittnesbörd, väv, ledstjärna, kakofoni Byter en konkret detalj mot en storslagen
Binär inramning ”Det var inte X, det var Y” / ”Inte av A, utan av B” Tvingar en prydlig slutsats på något rörigt
Utsagt inre liv ”kunde inte låta bli att känna”, ”kommer ur en plats av” Namnger känslan i stället för att visa den
Treuppräkningar Tre led där två hade räckt Läses som komponerat snarare än skrivet
Balanserad antites Två satser av samma vikt, i all oändlighet En rytm som inte tillhör någon människa

Bakom ordlistan finns en större oro. Studier av AI-assisterat skrivande visar att modellens ingrepp för olika skribenter mot samma dominerande mönster, vilket betyder att ju mer du använder de här verktygen desto mer konvergerar allas skrivande.6 I en CHI-studie från 2025 skrev 118 personer i Indien och USA om sina egna liv, och med AI-förslag påslagna drev de indiska deltagarnas skrivande mot västerländska stilar.7 För ett meddelande vars hela syfte är att omisskännligt komma från dig är det fel riktning.

Fyra: mottagaren kan märka det, och det kostar dig

Det här är delen folk underskattar. Det finns ett forskningsfält som kallas AI-medierad kommunikation, och dess centrala fynd är obekvämt. Folk är opålitliga på att identifiera AI-skriven text8, och de lutar sig mot bristfälliga ledtrådar när de försöker. Men när de tror att en text är AI-genererad litar de mindre på den som skrev den.9

Risken med en generisk omskrivning går alltså längre än ett medelmåttigt meddelande, till ett som läses som oärligt i exakt det ögonblick då uppriktigheten är hela innehållet. En ursäkt som utlöser någons AI-detektor gör mer skada än den klumpiga ursäkt du själv hade skrivit.

Fem: de vet inte vem du skriver till

Om inte ett minne eller ett projekt för med sig något sedan tidigare börjar varje session nästan tom. För att få ett bra utkast skulle du behöva förklara tio år av en vänskap, vad som hände i mars, varför frasen “det är lugnt” betyder något specifikt just mellan er två. Nästan ingen gör det, så modellen skriver för en generisk mottagare. Formalitet är vad du får när ett system inte vet något om relationen, och det är därför resultatet så ofta låter som kundtjänst. Det där tomma startet är anledningen till att Subtext läser tråden du klistrar in eller skärmdumpar, och frågar vem ett meddelande är till när ett utkast går emot någon.

Sedan finns det som folk nämner lite tystare. Att klistra in en skärmdump av ett bråk, eller ett utkast till ett uppbrott, eller ett meddelande om din familj i en allmän chattbot känns annorlunda än att be den felsöka kod. Den instinkten är inte paranoid.

Vad romanförfattarna gjorde åt det här

Det som följer är det som övertygade mig om att glappet är verkligt, och inte något jag hittat på för att ha något att sälja.

Skönlitterära författare gick in i exakt de här problemen först, med högre insatser och högre volym. De fortsatte använda modellerna, bara inte råa. Ett helt lager av verktyg växte fram ovanpå, bland annat miljöer som Novelcrafter10, där du kan bygga en ordlista med förbjudna klichéer som markeras i rött medan texten genereras, och köra riktade operationer som ”show, don’t tell” på en markerad del. Sudowrite11 gör något liknande med särskilda genomkörningar som omvandlar sammanfattning till konkret sinnesdetalj.

Seriösa användare går längre och kör pipelines med flera modeller. En modell för strukturkommentarer och undertextanalys, en andra för språkredigering under strikta ramar, ett filtreringssteg som skrubbar bort AI-ordförrådet, och sedan en mänsklig genomgång som lägger tillbaka rösten.

Det är fyra verktyg och en checklista för att revidera ett enda kapitel. Det fungerar. Det säger också att de allmänna modellerna inte klarar det här jobbet på egen hand, och att de som bryr sig mest om resultatet redan har accepterat det.

Applicera nu det på ett sms. Ingen kör en pipeline i fyra steg innan hen svarar sin syster. Behovet av ett förfinat lager är identiskt och toleransen för ansträngning är ungefär noll, vilket är det verkliga produktproblemet. Jag har separat tittat på om AI-verktyg som skriver om meddelanden faktiskt fungerar på den typen av meddelanden.

Vad ett mer förfinat verktyg måste göra annorlunda

Tre saker, och ingen av dem är ”skriv bättre”.

Analysera innan du skriver om. Sätt ord på vad utkastet signalerar innan du rör ett enda ord i det, så som en AI-meddelandekollare borde, inklusive den del skribenten inte menade. Det hjälper också mot inställsamhet, eftersom ett verktyg som börjar med en läsning binder sig vid den innan det hinner hålla med dig. Det gör inte läsningen korrekt. Subtext körs på samma sorts modell, så pressa den som du skulle pressa en vän. Vilka ord stöder den läsningen, och hur skulle de annars kunna landa?

Visa avståndet, dölj det inte. En version nära det du skrev, bredvid en version skriven från noll, är mer användbar än en enda polerad ersättare. Du ser vad som ändrades och avgör själv om du är beredd att låta så.

Läs relationen såväl som meddelandet. Vem den här personen är för dig, vad tråden visar att du redan har provat, vad “det är lugnt” betyder i just den här vänskapen.

Det är det jag bygger, så behandla det här stycket därefter. Subtext taggar känslan i det du skrev innan den föreslår något, vilket är ett medvetet irriterande designval, eftersom det ögonblick då den är som mest användbar är det ögonblick då du minst vill höra det.

Illustrativt exempel, inte fångad output

det är lugnt, jag fattar, du har mycket. jag slutar fråga.

Det du skulle skicka. Läses som att du drar dig undan, och ”jag slutar fråga” är ett hot förklätt till ursäkt.

Hej, jag har full förståelse för att det varit mycket på sistone. Ingen fara alls med ikväll, säg bara till när det passar bättre så löser vi något.

En generisk omskrivning. Grammatiskt korrekt, trevlig, och den har raderat att du är sårad, vilket var den enda informationen i originalet.

det är lugnt. men jag är lite besviken. jag säger hellre det än låtsas att det är ingenting.

Samma röst, behåller det sårade, släpper hotet och lägger inte till något du inte sa.

I praktiken klistrar du in utkastet, eller skärmdumpar hela tråden så att den läser båda sidor, och den namnger vad ditt meddelande är på väg att signalera innan den erbjuder versioner som fortfarande låter som du. Prova Subtext i webbläsarenProva Subtext i webbläsaren

När jag ändå öppnar ChatGPT

Långa dokument. Professionella mejl. Allt där det är viktigare att vara korrekt än att vara igenkännbart du. Research, första utkast, översättning, och den där specifika nåden att få ord på en tom sida när du inte kommer igång.

Och ett faktum som talar emot mitt eget argument, som jag hellre tar med än utelämnar. En studie av medicinska frågor från ett offentligt forum12 visade det här.

Fyndet Bedömarna föredrog chattbotens svar framför läkarnas i 78,6 % av jämförelserna, och bedömde chattbotens svar som empatiska eller mycket empatiska nästan tio gånger så ofta.

De här modellerna kan producera text som läses som varm, och den förmågan är verklig.

Det de sällan gör utan att bli ombedda är att säga att ditt meddelande läses som ett ultimatum. De får ultimatumet att flyta bättre och ger dig en komplimang för din känslomässiga ärlighet. Det glappet är litet, och det är större delen av jobbet, och jag byggde Subtext för att stänga det. Det namnger vad ditt meddelande läses som innan det skriver om ett enda ord av det.

En notering om modellversioner. Allt ovan beskriver beteenden som hållit i sig över flera generationer av varje modellfamilj, och det är därför jag mestadels undvikit att namnge specifika versioner. De här systemen ändras med några månaders mellanrum, och varje text som hänger upp sitt argument på ett enskilt versionsnummer har fel till vintern.


Tycker du att jag varit orättvis mot din favoritmodell? Säg det till mig på LinkedIn.

Samet Durgun är medgrundare till Subtext, en app som fångar den känslomässiga tonen i dina meddelanden och skriver om dem med din egen röst. Han bor i Berlin.


Källor

Varje länk ovan går till primärkällan, där en sådan finns.

  1. OpenAI, “Introducing Canvas,” 3 oktober 2024.
  2. Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Testade engelska, tyska, koreanska och kinesiska över griceanska kategorier; Gemini uteslöts vid tillfället av skäl som rörde API-åtkomst.
  3. OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 april 2025.
  4. OpenAI, “Expanding on what we missed with sycophancy,” 2 maj 2025.
  5. Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, oktober 2023.
  6. Forskning om stilistisk homogenisering i AI-assisterat skrivande, bland annat Padmakumar och He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, och Doshi och Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
  7. Agarwal, Naaman och Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
  8. Jakesch, Hancock och Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
  9. Jakesch, French, Ma, Hancock och Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Se även Hancock, Naaman och Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
  10. Novelcrafter, Codex och promptfunktionerna för textersättning.
  11. Sudowrite, funktionerna “Show, Don’t Tell” och Describe.
  12. Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 april 2023. 585 bedömningar; chattbotens svar föredrogs i 78,6 % av jämförelserna och bedömdes som empatiska eller mycket empatiska 9,8 gånger så ofta som läkarnas.