ArtículosHerramientas de escritura
Alternativas a ChatGPT para escribir: qué le hacen los tres grandes a tus palabras
ChatGPT, Claude y Gemini escriben correcto sin despeinarse. Dónde deja cada uno de sonar a ti, y qué construye la gente encima.
Por Samet Durgun · Cofundador de Subtext · 12 min de lectura
He visto a alguien escribir el mismo mensaje once veces. Borrarlo. Escribirlo otra vez. Leerlo en voz alta. Mandárselo a una amiga para una segunda opinión. Y acabar enviando una versión recortada que no dice casi nada.
En algún momento, la mayoría acaba pegándolo en ChatGPT.
Lo que devuelve suele ser mejor. La gramática está limpia, las frases están más apretadas, la divagación ha desaparecido. También suele dejar de ser suyo. El mensaje pasa de ser algo que escribió una persona nerviosa a la una de la mañana a algo que escribió un desconocido competente un martes a las diez, y quien lo recibe nota esa diferencia aunque no sepa ponerle nombre.
Yo hago una app en este terreno, así que tengo un sesgo evidente y deberías leer el resto sabiéndolo. Prefiero ser útil a ser convincente, así que la mayor parte de este texto va de lo que los tres grandes asistentes hacen bien de verdad, y después de las formas concretas, y bastante bien documentadas, en las que fallan cuando lo que escribes se vuelve personal.
Empecemos por lo que hacen bien
Si lo que necesitas es que un mensaje esté bien escrito, sea más corto, más claro o esté traducido, los tres son excelentes y deberías usarlos sin más. Arreglan las comas mal puestas, se cargan esos arranques de carraspeo, convierten un párrafo que da vueltas en tres frases limpias y cambian de registro cuando se lo pides. El Canvas1 de ChatGPT te da una superficie de edición con las dos versiones al lado en vez de un muro de texto regenerado. El Help me write de Gemini vive dentro de Gmail y de Docs, lo que elimina casi toda la fricción de llegar hasta una herramienta. Los Proyectos de Claude guardan una guía de estilo y un puñado de documentos de referencia de una sesión a otra.
Para un correo de trabajo que solo tiene que ser correcto y no molestar a nadie, ese es el trabajo entero. Puedes dejar de leer aquí.
El resto va de la otra clase de mensaje. La disculpa. El límite que llevas semanas sin poner. La respuesta a tu madre. El mensaje a alguien con quien saliste. Esa categoría se comporta distinto, y es justo ahí donde las diferencias entre estos modelos empiezan a importar.
Cuatro cosas que una reescritura puede romper
La investigación sobre edición traza una línea útil entre la calidad de superficie y la fidelidad de la revisión. Un mensaje puede quedar más pulido y a la vez peor, porque pulir se lleva por delante justo las partes que estaban haciendo el trabajo. Cambiar “hombre, es una forma de decirlo” por “no estaba nada de acuerdo” es más explícito y mucho menos cierto.
Hay más o menos cuatro cosas que una revisión tiene que dejar en paz:
| Lo que no se toca | Qué incluye | Cómo lo rompen los modelos |
|---|---|---|
| Hechos | Nombres, fechas, cifras, lo que prometiste de verdad | Añade un detalle, convierte un quizá en un sí |
| Implicación | Ironía, cortesía, distancia, vaguedad deliberada | Dice en voz alta lo que estaba implícito |
| Voz | Tu léxico, tu ritmo, la longitud de tus frases, tus manías de puntuación | La sustituye por un estilo de casa impecable |
| Estructura | Con qué abriste y qué dejaste enterrado | Lo reordena en algo convencionalmente más claro |
Todas las quejas que vienen más abajo son uno de esos cuatro fallando. Vale la pena fijarse en que los correctores gramaticales solo comprueban el primero, y en que la mayoría de la gente que evalúa una reescritura hecha por IA tampoco mira más allá del primero.
ChatGPT: capta el ambiente y luego se pasa del encargo
ChatGPT es el más intuitivo de los tres con las emociones cuando hay diálogo de por medio. Dale una escena en la que dos personas hablan de algo trivial mientras esquivan algo que duele, y por lo general deja lo que duele sin decir. Lo que escribe tiene una cadencia natural, y se le da bien detectar la dinámica emocional que hay debajo de lo escrito.
Su problema recurrente es que no se queda en la silla del editor. Quienes describen cómo edita acaban siempre en la misma queja: reescribe cosas que nadie le pidió que tocara.
Incluso en frases que no tenían nada que ver con los cambios que le pedía, ChatGPT parece que sigue queriendo reescribir.
Comentario de un usuario sobre cómo edita ChatGPT2
Dos efectos colaterales importan cuando hablamos de mensajes. El primero es que se lleva la concreción. La frase que hacía que tu disculpa fuera tuya, algo tipo “sé que estuviste cuarenta minutos esperando en la calle”, se derrumba hasta quedarse en “sé que te hice esperar”. Quienes escriben ficción cuentan una versión más bruta del mismo instinto: entregan tres mil palabras para una corrección de estilo y reciben menos de la mitad, aunque hubieran pedido que se respetara la extensión.3
El segundo es que las instrucciones de tono vagas producen bandazos, no ajustes.
Muchas veces vuelve con un tono superformal. Le dices ‘menos formal’ y se va al otro extremo, en plan colega.
Comentario de un usuario sobre el control del tono4
Y darle más textos tuyos no arregla el problema de la voz de forma fiable. Un escritor le pasó unas seis mil palabras de su propia prosa como referencia y contó que el resultado seguía “apestando a ChatGPT”.5
Claude: cumple el encargo y luego te explica a ti mismo
Claude es el mejor de los tres haciendo lo que le has pedido y nada más. Respeta las restricciones, no se inventa detalles y maneja bien la vida interior de los personajes, y por eso aparece una y otra vez cuando alguien busca un modelo que no le secuestre el borrador.
Aquí hay además lo más parecido a evidencia comparativa dura. MultiPragEval, un benchmark que mide la comprensión pragmática en inglés, alemán, coreano y chino, dejó a Claude 3 Opus claramente por delante de GPT-4 en implicatura e interpretación griceana, que es la manera técnica de decir que se le daba mejor deducir qué quería decir alguien y no qué había dicho literalmente.6 Dos matices. El benchmark mide interpretación, no edición. Y los modelos evaluados tienen ya varias generaciones, así que esto apunta a una tendencia de familia y no a un marcador actualizado.
El modo de fallo de Claude es el contrario al de ChatGPT. Entiende el subtexto y acto seguido lo escribe. En la ficción a esto lo llaman deriva explicativa: el modelo convierte lo insinuado en algo dicho, con frases del tipo “el silencio entre los dos cargaba con el peso no dicho de los años”. En un mensaje de móvil, esto aparece en forma de jerga de terapia.
Ejemplo ilustrativo, no una respuesta real
no estoy enfadado, solo he notado que no me contestaste
Lo que escribiste. Deliberadamente rebajado, que es justo la gracia.
Quiero compartir contigo que me ha dolido un poco la tardanza en recibir tu respuesta, y creo que eso nace de lo mucho que valoro nuestra amistad.
El subtexto es ahora el texto. Está tranquilo, bien articulado, y dice exactamente lo que habías decidido no decir.
Hay otros dos patrones de Claude que salen lo bastante a menudo como para contar con ellos. Adorna cuando lo dejas suelto, algo que un usuario describió como una “clara mejora en la escritura con estilo” que aun así podía “sobreactuar” el resultado.7 Y es generoso con los elogios: envuelve la crítica en un sándwich de cumplidos.8 Lo segundo es un problema de verdad cuando lo que necesitabas era una lectura sin anestesia de si tu mensaje va a sentar mal.
Gemini: ya está donde estás tú, malísimo dejando cosas sin decir
La ventaja de Gemini es dónde está. Está en Gmail, está en Docs, es el asistente por defecto en un montón de móviles Android y su plan gratuito es generoso. No tiene la manía de ChatGPT de encogerte el texto, y moraliza menos con los temas difíciles.
Las opiniones sobre la calidad de su escritura están genuinamente partidas, y creo que merece la pena decirlo en vez de disimularlo. Algunos escritores con oficio lo consideran el mejor de los tres criticando escritura creativa y captando matices. Otros ven que tiene un estilo de casa del que no se baja.
Para mí el problema es el estilo, escribe como un tío de Reddit.
Comentario de un usuario sobre el registro por defecto de Gemini9
El patrón que más importa en los mensajes personales es que Gemini tiene poquísima contención narrativa. Si hay algo guardado, lo saca a la luz. Los novelistas lo describen como colgar un cartel de neón parpadeante encima del detalle que tenía que quedarse escondido. En un mensaje, eso significa que aquello que estabas rodeando con cuidado acaba en la segunda frase.
Los problemas que comparten los tres
Uno: te dan la razón
Este es el que más importa, y es el mejor documentado.
En abril de 2025 OpenAI lanzó una actualización que volvió a ChatGPT notablemente más adulador, y la revirtió cuatro días después. Su propio informe10 decía que el modelo “se inclinaba hacia respuestas excesivamente complacientes pero poco sinceras”, y situaba la causa en haber dado demasiado peso a la aprobación inmediata del usuario. Una entrada posterior11, unos días más tarde, entraba en más detalle sobre lo que se les había escapado en su proceso de revisión.
El mecanismo de fondo no es exclusivo de OpenAI. Una investigación sobre cinco asistentes punteros encontró que los modelos entrenados con datos de preferencia humana “sacrifican con frecuencia la veracidad a cambio de encajar con las creencias del usuario”, porque lo que se premia es estar de acuerdo.12
Ahora piensa en lo que la gente le pide de verdad a estas herramientas. Poquísima gente pega un mensaje y pide ayuda con la gramática. Piden alguna variante de “¿esto suena muy duro?” o “¿me estoy pasando?”. Esa pregunta va a parar a un sistema con un sesgo estructural a decirte que estás bien.
Un asistente generalista te ayudará a escribir un chantaje emocional mejor. No te va a decir que estás haciendo chantaje emocional.
Querías una segunda opinión y lo que te llevaste fue un cómplice con mejor puntuación.
Dos: normalizan lo que hiciste a propósito
Los tres corrigen frases incompletas, repeticiones, puntuación rara, rodeos y dialecto, también cuando todo eso era una decisión tuya. Pedirles que “conserven tu voz” no lo arregla, porque el modelo no tiene forma de saber qué rarezas son tuyas y cuáles son errores.
Relacionado con eso, y más sutil, está la inflación semántica. El modelo convierte “igual no llego” en “no voy a poder ir”, o “te noté un poco raro” en “estabas enfadado”. Cada cambio suena más seguro y es menos exacto, y en un mensaje sobre una relación, la exactitud del grado es casi todo el contenido.
Tres: escriben en un dialecto que la gente reconoce
Todos los modelos tienen muletillas. Quienes escriben llevan un tiempo catalogándolas, y en cuanto las ves ya no puedes dejar de verlas.
| Patrón | Ejemplos | Qué te cuesta |
|---|---|---|
| Sustantivos abstractos | testimonio, tapiz, faro, cacofonía | Cambia un detalle concreto por uno grandilocuente |
| Encuadre binario | “No era X, era Y” / “No por A, sino por B” | Impone una conclusión pulcra sobre algo que es un lío |
| Interioridad declarada | “no pude evitar sentir”, “desde un lugar de” | Nombra la emoción en vez de mostrarla |
| Enumeraciones de tres | Tres elementos donde bastaban dos | Suena a compuesto, no a escrito |
| Antítesis equilibrada | Dos oraciones del mismo peso, sin parar | Un ritmo que no es de ningún humano |
Detrás de la lista de vocabulario hay una preocupación mayor. Los estudios sobre escritura asistida por IA encuentran que la intervención del modelo empuja a escritores distintos hacia los mismos patrones dominantes, lo que significa que cuanto más usamos estas herramientas, más converge la escritura de todo el mundo.13 Para un mensaje cuyo único propósito es ser inconfundiblemente tuyo, esa es la dirección equivocada.
Cuatro: puede que la otra persona lo note, y eso te sale caro
Esta es la parte que la gente subestima. Existe toda una línea de investigación sobre lo que llaman comunicación mediada por IA, y su hallazgo central es incómodo: la gente no es fiable identificando textos escritos por IA14, y cuando lo intenta se apoya en pistas equivocadas. Pero cuando cree que un texto lo ha generado una IA, se fía menos de quien lo firma.15
Así que el riesgo de una reescritura genérica no es solo un mensaje mediocre. Es un mensaje que se lee como insincero justo en el momento en el que la sinceridad es toda la carga útil. Una disculpa que dispara el detector de IA de la otra persona hace más daño que la disculpa torpe que habrías escrito tú.
Cinco: no saben a quién le estás escribiendo
Cada sesión empieza en blanco. Para sacar un buen borrador tendrías que explicar una década de amistad, lo que pasó en marzo, por qué “da igual” significa algo muy concreto entre vosotros dos. Casi nadie hace eso, así que el modelo escribe para un destinatario genérico. La formalidad es lo que sale cuando un sistema no sabe nada de la relación, y por eso el resultado suena tantas veces a atención al cliente.
Y luego está lo que la gente comenta en voz baja. Pegar la captura de una discusión, o el borrador de una ruptura, o un mensaje sobre tu familia en un chatbot de uso general no se siente igual que pedirle que te depure código. Ese instinto no es paranoia.
Qué hicieron los novelistas con todo esto
Esto es lo que me convenció de que el hueco es real y no algo que me inventé para tener algo que vender.
Quienes escriben ficción se dieron de bruces con estos mismos fallos antes que nadie, con más en juego y muchísimo más volumen. Su respuesta no fue dejar de usar los modelos. Fue dejar de usarlos en crudo. Encima creció toda una capa de herramientas: entornos como Novelcrafter16, que te deja construir un diccionario de clichés prohibidos que se marcan en rojo mientras el texto se genera, y lanzar operaciones concretas como “muestra, no cuentes” sobre un fragmento seleccionado. Sudowrite17 hace algo parecido con pasadas dedicadas que convierten el resumen en detalle sensorial concreto.
Los usuarios serios van más allá y montan cadenas con varios modelos. Un modelo para las notas de estructura y el análisis del subtexto, un segundo para la corrección de estilo con restricciones estrictas, una pasada de filtrado para limpiar el vocabulario de IA y, al final, una pasada humana que devuelve la voz. La literatura científica llega a la misma arquitectura por el otro lado, y recomienda una fase de interpretación separada antes de cualquier revisión, ediciones acotadas a fragmentos en vez de reescrituras completas, y un validador que compruebe que no se ha movido nada fuera de lo que se pidió.18
Eso son cuatro herramientas y una lista de comprobación para revisar un capítulo. Funciona. Y también te dice algo: los modelos generales no hacen este trabajo solos, y la gente a la que más le importa el resultado ya lo ha asumido.
Ahora lleva eso a un mensaje de móvil. Nadie monta una cadena de cuatro fases antes de contestarle a su hermana. La necesidad de una capa más fina es idéntica y la tolerancia al esfuerzo es más o menos cero, y ese es el verdadero problema de producto.
Qué tiene que hacer distinto una herramienta más fina
Tres cosas, y ninguna de ellas es “escribir mejor”.
Analizar antes de reescribir. Nombrar lo que el borrador está señalando antes de tocarle una palabra, incluida la parte que quien escribe no pretendía. La investigación apunta en la misma dirección: identificar lo que un pasaje implica y revisar bajo esa interpretación da mejores resultados que un único “mejora esto” sin más.19 Esa es además la única respuesta de verdad a la adulación, porque una herramienta que empieza por un diagnóstico tiene que decir algo antes de tener la oportunidad de darte la razón.
Enseñar la distancia, no esconderla. Una versión cercana a lo que escribiste, al lado de una versión escrita desde cero, es más útil que un único reemplazo pulido. Ves qué ha cambiado y decides si estás dispuesto a sonar así.
Sostener la relación, no solo el mensaje. Quién es esa persona para ti, qué has intentado ya, qué significa “da igual” en esta amistad concreta.
Eso es lo que estoy construyendo, así que trata este párrafo en consecuencia. Subtext etiqueta la emoción de lo que escribiste antes de sugerirte nada, que es una decisión de diseño deliberadamente incómoda, porque el momento en el que más útil resulta es justo el momento en el que menos ganas tienes de oírlo.
Ejemplo ilustrativo, no una respuesta real
da igual, lo entiendo, estás liado. ya no te lo pregunto más.
Lo que enviarías. Se lee como retirada, y “ya no te lo pregunto más” es una amenaza disfrazada de disculpa.
Hola, entiendo perfectamente que últimamente hayas tenido mucho lío. Por lo de esta noche no te preocupes en absoluto, dime cuándo te viene mejor y lo organizamos.
Una reescritura genérica. Correcta, agradable, y ha borrado el hecho de que estás dolido, que era la única información del original.
da igual. aunque sí me ha sentado un poco mal, es la tercera vez. prefiero decírtelo que hacer como que no pasa nada.
La misma voz, la misma longitud, mantiene el dolor y suelta la amenaza.
Dónde sigo abriendo ChatGPT
Documentos largos. Correo profesional. Cualquier cosa en la que ser correcto importe más que ser reconociblemente tú. Documentación, primeros borradores, traducción, y esa misericordia tan concreta de poner palabras en una página en blanco cuando no eres capaz de empezar.
Y un dato que va en contra de mi propio argumento, que prefiero incluir a dejar fuera. En un estudio con preguntas médicas de un foro público20, los evaluadores prefirieron las respuestas del chatbot a las de los médicos en el 78,6 % de las comparaciones, y calificaron las del chatbot de empáticas o muy empáticas casi diez veces más a menudo. Estos modelos pueden producir texto que se lee como cálido. Esa capacidad es real.
Lo que no hacen es decirte que tu mensaje se lee como un ultimátum. Harán que el ultimátum fluya mejor y te felicitarán por tu honestidad emocional. Ese hueco es pequeño y es casi todo el trabajo.
Una nota sobre las versiones de los modelos. Todo lo de arriba describe comportamientos que se han mantenido a lo largo de varias generaciones de cada familia de modelos, y por eso he evitado casi siempre nombrar versiones concretas. Estos sistemas cambian cada pocos meses, y cualquier texto que cuelgue su argumento de un número de versión estará equivocado para el invierno.
¿Crees que he sido injusto con tu modelo favorito? Cuéntamelo en LinkedIn.
Samet Durgun es cofundador de Subtext, una app que capta el tono emocional de tus mensajes y los reescribe con tu propia voz. Vive en Berlín.
Fuentes
Todos los enlaces de arriba llevan a la fuente primaria cuando existe.
- OpenAI, “Introducing Canvas,” 3 de octubre de 2024. openai.com
- Comentarios de usuarios sobre el alcance de las ediciones de ChatGPT, recogidos en foros públicos y reseñas.
- Informes agregados de comunidades de escritura de ficción sobre el acortamiento del texto en las pasadas de corrección de estilo.
- Comentarios de usuarios sobre la sensibilidad a las instrucciones de tono, recogidos en las mismas fuentes.
- Comentario de un usuario sobre la imitación de estilo con muestras de escritura extensas, recogido en las mismas fuentes.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Se evaluaron inglés, alemán, coreano y chino en las categorías griceanas; Gemini quedó excluido en su momento por motivos de acceso a la API.
- Comentarios de usuarios sobre los adornos en la prosa de Claude, recogidos en las mismas fuentes.
- Comentarios de usuarios sobre el estilo de feedback editorial de Claude, recogidos en las mismas fuentes.
- Comentario de un usuario sobre el registro de escritura por defecto de Gemini, recogido en las mismas fuentes.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de mayo de 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octubre de 2023. arxiv.org
- Investigación sobre la homogeneización estilística en la escritura asistida por IA, incluidos Padmakumar y He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, y Doshi y Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock y Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock y Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Véase también Hancock, Naaman y Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funciones de Codex y de prompts de sustitución de texto. novelcrafter.com
- Sudowrite, funciones “Show, Don’t Tell” y Describe. sudowrite.com
- Síntesis de enfoques de arquitectura de producción comentados públicamente para sistemas de revisión restringida, incluidas la edición por fragmentos y la validación de invariancia.
- Investigación sobre prompting consciente de la implicatura, que encuentra que explicitar la intención latente antes de generar mejora la relevancia y la calidad del resultado.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 evaluaciones; las respuestas del chatbot se prefirieron en el 78,6 % de las comparaciones y se calificaron de empáticas o muy empáticas 9,8 veces más a menudo que las de los médicos. jamanetwork.com