
ArtículosHerramientas de escritura
Alternativas a ChatGPT para escribir: qué le hacen los tres grandes a tus palabras
ChatGPT, Claude y Gemini escriben correcto sin despeinarse. Dónde deja cada uno de sonar a ti, y qué construye la gente encima.
Por Samet Durgun · Cofundador de Subtext · 15 min de lectura
· Actualizado el 26 de septiembre de 2026
He visto a alguien escribir el mismo mensaje once veces, lo que explica por qué una respuesta de dos líneas puede llevarte una hora. Borrarlo. Escribirlo otra vez. Leerlo en voz alta. Mandárselo a una amiga para una segunda opinión. Y acabar enviando una versión recortada que no dice casi nada.
En algún momento, la mayoría acaba pegándolo en ChatGPT.
Lo que devuelve suele ser mejor. La gramática está limpia, las frases están más apretadas, la divagación ha desaparecido. También suele dejar de ser suyo. El mensaje pasa de ser algo que escribió una persona nerviosa a la una de la mañana a algo que escribió un desconocido competente un martes a las diez, y quien lo recibe nota esa diferencia aunque no sepa ponerle nombre. Esa distancia es justo lo que Subtext, la app que cofundé, está hecha para detectar. Lee lo que tu mensaje está a punto de hacer antes de que lo envíes.
Así que tengo un sesgo evidente y deberías leer el resto sabiéndolo. Prefiero ser útil a ser convincente, así que la mayor parte de este texto va de lo que los tres grandes asistentes hacen bien, y después de las formas concretas, y bastante bien documentadas, en las que fallan cuando lo que escribes se vuelve personal. Las fuentes están enlazadas para que puedas sopesar mi interés contra la evidencia tú mismo.
Empecemos por lo que hacen bien
Si lo que necesitas es que un mensaje esté bien escrito, sea más corto, más claro o esté traducido, los tres son excelentes y deberías usarlos sin más. Arreglan las comas mal puestas, se cargan esos arranques de carraspeo, convierten un párrafo que da vueltas en tres frases limpias y cambian de registro cuando se lo pides. El Canvas1 de ChatGPT te da una superficie de edición con las dos versiones al lado en vez de un muro de texto regenerado. El Help me write de Gemini vive dentro de Gmail y de Docs, lo que elimina casi toda la fricción de llegar hasta una herramienta. Los Proyectos de Claude guardan una guía de estilo y un puñado de documentos de referencia de una sesión a otra.
Para un correo de trabajo que solo tiene que ser correcto y no molestar a nadie, con eso basta. Puedes dejar de leer aquí.
El resto va de la otra clase de mensaje. La disculpa. El límite que llevas semanas sin poner. La respuesta a tu madre. El mensaje a alguien con quien saliste. Esa categoría se comporta distinto, y es justo ahí donde las diferencias entre estos modelos empiezan a importar.
Cuatro cosas que una reescritura puede romper
Me resulta útil separar la calidad de superficie de la fidelidad de la revisión. Un mensaje puede quedar más pulido y a la vez peor, porque pulir se lleva por delante justo las partes que estaban haciendo el trabajo. Cambiar “hombre, es una forma de decirlo” por “no estaba nada de acuerdo” es más explícito y mucho menos cierto.
Mi lista tiene cuatro cosas que una revisión tiene que dejar en paz. Es como yo reviso una reescritura, y nadie la ha validado como escala.
| Lo que no se toca | Qué incluye | Cómo lo rompen los modelos |
|---|---|---|
| Hechos | Nombres, fechas, cifras, lo que prometiste de verdad | Añade un detalle, convierte un quizá en un sí |
| Implicación | Ironía, cortesía, distancia, vaguedad deliberada | Dice en voz alta lo que estaba implícito |
| Voz | Tu léxico, tu ritmo, la longitud de tus frases, tus manías de puntuación | La sustituye por un estilo de casa impecable |
| Estructura | Con qué abriste y qué dejaste enterrado | Lo reordena en algo convencionalmente más claro |
Todas las quejas que vienen más abajo son uno de esos cuatro fallando. Yo diría que los correctores gramaticales solo comprueban el primero, y que la mayoría de la gente que evalúa una reescritura hecha por IA tampoco mira más allá del primero.
ChatGPT capta el ambiente y luego se pasa del encargo
ChatGPT es el más intuitivo de los tres con las emociones cuando hay diálogo de por medio. Dale una escena en la que dos personas hablan de algo trivial mientras esquivan algo que duele, y por lo general deja lo que duele sin decir. Lo que escribe tiene una cadencia natural, y se le da bien detectar la dinámica emocional que hay debajo de lo escrito.
Su problema recurrente es que no se queda en la silla del editor. Quienes describen cómo edita acaban siempre en la misma queja, la de que reescribe cosas que nadie le pidió que tocara.
Dos efectos colaterales importan cuando hablamos de mensajes. El primero es que se lleva la concreción. La frase que hacía que tu disculpa fuera tuya, algo tipo “sé que estuviste cuarenta minutos esperando en la calle”, se derrumba hasta quedarse en “sé que te hice esperar”. Quienes escriben ficción cuentan en foros una versión más bruta del mismo instinto. Piden una corrección de estilo que respete la extensión y reciben un capítulo mucho más corto.
El segundo es que las instrucciones de tono vagas producen bandazos cuando tú querías un ajuste. Un comentario habitual es que vuelve con un tono superformal, y basta pedirle una vez que sea menos formal para que se vaya al otro extremo, en plan colega.
Y darle más textos tuyos no arregla el problema de la voz de forma fiable. Hay escritores que le pegan miles de palabras de su propia prosa como referencia y siguen contando que el resultado suena a ChatGPT.
Claude cumple el encargo y luego te explica a ti mismo
Claude es el mejor de los tres haciendo lo que le has pedido y nada más. Respeta las restricciones, no se inventa detalles y maneja bien la vida interior de los personajes, y por eso aparece una y otra vez cuando alguien busca un modelo que no le secuestre el borrador.
Aquí hay además lo más parecido a evidencia comparativa dura. MultiPragEval, un benchmark que mide la comprensión pragmática en inglés, alemán, coreano y chino, dejó a Claude 3 Opus claramente por delante de GPT-4 en implicatura e interpretación griceana, que es la manera técnica de decir que se le daba mejor deducir qué quería decir alguien y no qué había dicho literalmente.2 Yo señalaría dos matices. El benchmark mide interpretación, no edición. Y los modelos evaluados tienen ya varias generaciones, así que esto apunta a una tendencia de familia, no a un marcador actualizado.
El modo de fallo de Claude es el contrario al de ChatGPT. Entiende el subtexto y acto seguido lo escribe. En la ficción a esto lo llaman deriva explicativa: el modelo convierte lo insinuado en algo dicho, con frases del tipo “el silencio entre los dos cargaba con el peso no dicho de los años”. En un mensaje de móvil, esto aparece en forma de jerga de terapia.
Ejemplo ilustrativo, no una respuesta real
no estoy enfadado, solo he notado que no me contestaste
Lo que escribiste. Deliberadamente rebajado, que es justo la gracia.
Quiero compartir contigo que me ha dolido un poco la tardanza en recibir tu respuesta, y creo que eso nace de lo mucho que valoro nuestra amistad.
El subtexto es ahora el texto. Está tranquilo, bien articulado, y dice exactamente lo que habías decidido no decir.
Hay otros dos patrones de Claude que salen lo bastante a menudo como para contar con ellos. Adorna cuando lo dejas suelto, y hay usuarios que describen su prosa como más estilosa y a veces sobreactuada. Y es generoso con los elogios, con la crítica a menudo envuelta en un sándwich de cumplidos. Lo segundo es un problema de verdad cuando lo que necesitabas era una lectura sin anestesia de si tu mensaje va a sentar mal.
Gemini ya está donde estás tú, y es malísimo dejando cosas sin decir
La ventaja de Gemini es dónde está. Está en Gmail, está en Docs, es el asistente por defecto en un montón de móviles Android y su plan gratuito es generoso. No tiene la manía de ChatGPT de encogerte el texto, y moraliza menos con los temas difíciles.
Las opiniones sobre la calidad de su escritura están partidas, y creo que merece la pena decirlo sin rodeos. Algunos escritores con oficio lo consideran el mejor de los tres criticando escritura creativa y captando matices. Otros ven que tiene un estilo de casa del que no se baja, con un registro de charla que algunos comparan con un comentario de Reddit.
El patrón que más importa en los mensajes personales es que Gemini tiene poquísima contención narrativa. Si hay algo guardado, lo saca a la luz. Los novelistas lo describen como colgar un cartel de neón parpadeante encima del detalle que tenía que quedarse escondido. En un mensaje, eso significa que aquello que estabas rodeando con cuidado acaba en la segunda frase.
Los problemas que comparten los tres
Uno: te dan la razón
Este es el que más importa, y es el mejor documentado.
En abril de 2025 OpenAI lanzó una actualización que volvió a ChatGPT notablemente más adulador, y la revirtió cuatro días después. Su propio informe3 decía que el modelo “se inclinaba hacia respuestas excesivamente complacientes pero poco sinceras”, y situaba la causa en haber dado demasiado peso a la aprobación inmediata del usuario. Una entrada posterior4, unos días más tarde, entraba en más detalle sobre lo que se les había escapado en su proceso de revisión.
El mecanismo de fondo no es exclusivo de OpenAI. Una investigación sobre cinco asistentes punteros encontró que los modelos entrenados con datos de preferencia humana “sacrifican con frecuencia la veracidad a cambio de encajar con las creencias del usuario”, porque lo que se premia es estar de acuerdo.5
Ahora piensa en lo que la gente le pide de verdad a estas herramientas. Poquísima gente pega un mensaje y pide ayuda con la gramática. Piden alguna variante de “¿esto suena muy duro?” o “¿me estoy pasando?”, la pregunta que analizo en “¿Suena borde este mensaje?”. Esa pregunta va a parar a un sistema con un sesgo estructural a decirte que estás bien.
Un asistente generalista te ayudará a escribir un chantaje emocional mejor. Muchas veces no te va a decir que estás haciendo chantaje emocional.
Querías una segunda opinión y lo que te llevaste fue un cómplice con mejor puntuación.
De todo lo de esta página, este es el fallo contra el que está construida Subtext más directamente, y la solución que elegí es estructural. Volveré a ello.
Dos: normalizan lo que hiciste a propósito
Los tres corrigen frases incompletas, repeticiones, puntuación rara, rodeos y dialecto, también cuando todo eso era una decisión tuya. Pedirles que “conserven tu voz” no lo arregla, porque el modelo no tiene forma de saber qué rarezas son tuyas y cuáles son errores.
Relacionado con eso, y más sutil, está la inflación semántica. El modelo convierte “igual no llego” en “no voy a poder ir”, o “te noté un poco raro” en “estabas enfadado”. Cada cambio suena más seguro y es menos exacto, y en un mensaje sobre una relación, la exactitud del grado es casi todo el contenido.
Tres: escriben en un dialecto que la gente reconoce
Todos los modelos tienen muletillas. Quienes escriben llevan un tiempo catalogándolas, y en cuanto las ves ya no puedes dejar de verlas.
| Patrón | Ejemplos | Qué te cuesta |
|---|---|---|
| Sustantivos abstractos | testimonio, tapiz, faro, cacofonía | Cambia un detalle concreto por uno grandilocuente |
| Encuadre binario | “No era X, era Y” / “No por A, sino por B” | Impone una conclusión pulcra sobre algo que es un lío |
| Interioridad declarada | “no pude evitar sentir”, “desde un lugar de” | Nombra la emoción en vez de mostrarla |
| Enumeraciones de tres | Tres elementos donde bastaban dos | Suena a compuesto, no a escrito |
| Antítesis equilibrada | Dos oraciones del mismo peso, sin parar | Un ritmo que no es de ningún humano |
Detrás de la lista de vocabulario hay una preocupación mayor. Los estudios sobre escritura asistida por IA encuentran que la intervención del modelo empuja a escritores distintos hacia los mismos patrones dominantes, lo que significa que cuanto más usamos estas herramientas, más converge la escritura de todo el mundo.6 En un estudio presentado en CHI 2025, 118 personas de la India y de Estados Unidos escribieron sobre su propia vida, y con las sugerencias de IA activadas, la escritura de los participantes indios se desplazó hacia estilos occidentales.7 Para un mensaje cuyo único propósito es ser inconfundiblemente tuyo, esa es la dirección equivocada.
Cuatro: puede que la otra persona lo note, y eso te sale caro
Esta es la parte que la gente subestima. Existe toda una línea de investigación sobre lo que llaman comunicación mediada por IA, y su hallazgo central es incómodo. La gente no es fiable identificando textos escritos por IA8, y cuando lo intenta se apoya en pistas equivocadas. Pero cuando cree que un texto lo ha generado una IA, se fía menos de quien lo firma.9
Así que el riesgo de una reescritura genérica va más allá de un mensaje mediocre y llega a uno que se lee como insincero justo en el momento en el que la sinceridad es toda la carga útil. Una disculpa que dispara el detector de IA de la otra persona hace más daño que la disculpa torpe que habrías escrito tú.
Cinco: no saben a quién le estás escribiendo
A menos que la memoria o un proyecto arrastren algo de antes, cada sesión empieza casi en blanco. Para sacar un buen borrador tendrías que explicar una década de amistad, lo que pasó en marzo, por qué “da igual” significa algo muy concreto entre vosotros dos. Casi nadie hace eso, así que el modelo escribe para un destinatario genérico. La formalidad es lo que sale cuando un sistema no sabe nada de la relación, y por eso el resultado suena tantas veces a atención al cliente. Ese comienzo en blanco es la razón por la que Subtext lee el hilo que pegas o capturas, y pregunta para quién es un mensaje cuando un borrador se enfrenta a alguien.
Y luego está lo que la gente comenta en voz baja. Pegar la captura de una discusión, o el borrador de una ruptura, o un mensaje sobre tu familia en un chatbot de uso general no se siente igual que pedirle que te depure código. Ese instinto no es paranoia.
Qué hicieron los novelistas con todo esto
Lo que sigue me convenció de que el hueco es real, y no algo que me inventé para tener algo que vender.
Quienes escriben ficción se dieron de bruces con estos mismos fallos antes que nadie, con más en juego y muchísimo más volumen. Siguieron usando los modelos, solo que no en crudo. Encima creció toda una capa de herramientas, entre ellas entornos como Novelcrafter10, que te deja construir un diccionario de clichés prohibidos que se marcan en rojo mientras el texto se genera, y lanzar operaciones concretas como “muestra, no cuentes” sobre un fragmento seleccionado. Sudowrite11 hace algo parecido con pasadas dedicadas que convierten el resumen en detalle sensorial concreto.
Los usuarios serios van más allá y montan cadenas con varios modelos. Un modelo para las notas de estructura y el análisis del subtexto, un segundo para la corrección de estilo con restricciones estrictas, una pasada de filtrado para limpiar el vocabulario de IA y, al final, una pasada humana que devuelve la voz.
Eso son cuatro herramientas y una lista de comprobación para revisar un capítulo. Funciona. Y también te dice que los modelos generales no hacen este trabajo solos, y que la gente a la que más le importa el resultado ya lo ha asumido.
Ahora lleva eso a un mensaje de móvil. Nadie monta una cadena de cuatro fases antes de contestarle a su hermana. La necesidad de una capa más fina es idéntica y la tolerancia al esfuerzo es más o menos cero, y ese es el verdadero problema de producto. Por separado, miré si los reescritores de mensajes con IA funcionan de verdad en mensajes como ese.
Qué tiene que hacer distinto una herramienta más fina
Tres cosas, y ninguna de ellas es “escribir mejor”.
Analizar antes de reescribir. Nombrar lo que el borrador está señalando antes de tocarle una palabra, tal como debería hacerlo un verificador de mensajes con IA, incluida la parte que quien escribe no pretendía. También ayuda contra la adulación, porque una herramienta que empieza por una lectura se compromete con ella antes de tener la oportunidad de darte la razón. Eso no hace que la lectura sea correcta. Subtext funciona con el mismo tipo de modelo, así que ponlo a prueba como pondrías a prueba a un amigo. ¿Qué palabras sostienen esa lectura, y de qué otra forma podrían sentar?
Enseñar la distancia, no esconderla. Una versión cercana a lo que escribiste, al lado de una versión escrita desde cero, es más útil que un único reemplazo pulido. Ves qué ha cambiado y decides si estás dispuesto a sonar así.
Leer la relación además del mensaje. Quién es esa persona para ti, qué muestra el hilo que ya has intentado, qué significa “da igual” en esta amistad concreta.
Eso es lo que estoy construyendo, así que trata este párrafo en consecuencia. Subtext etiqueta la emoción de lo que escribiste antes de sugerirte nada, que es una decisión de diseño deliberadamente incómoda, porque el momento en el que más útil resulta es justo el momento en el que menos ganas tienes de oírlo.
Ejemplo ilustrativo, no una respuesta real
da igual, lo entiendo, estás liado. ya no te lo pregunto más.
Lo que enviarías. Se lee como retirada, y “ya no te lo pregunto más” es una amenaza disfrazada de disculpa.
Hola, entiendo perfectamente que últimamente hayas tenido mucho lío. Por lo de esta noche no te preocupes en absoluto, dime cuándo te viene mejor y lo organizamos.
Una reescritura genérica. Correcta, agradable, y ha borrado el hecho de que estás dolido, que era la única información del original.
da igual. aunque sí me ha sentado un poco mal. prefiero decírtelo que hacer como que no pasa nada.
La misma voz, mantiene el dolor, suelta la amenaza y no añade nada que no hayas dicho.
En la práctica, pegas el borrador o haces una captura de pantalla del hilo para que lea ambos lados, y nombra lo que tu mensaje está a punto de señalar antes de ofrecer versiones que sigan sonando como tú. Prueba Subtext en tu navegadorEscanéalo con la cámara del móvil para instalar.Prueba Subtext en tu navegador
Dónde sigo abriendo ChatGPT
Documentos largos. Correo profesional. Cualquier cosa en la que ser correcto importe más que ser reconociblemente tú. Documentación, primeros borradores, traducción, y esa misericordia tan concreta de poner palabras en una página en blanco cuando no eres capaz de empezar.
Y un dato que va en contra de mi propio argumento, que prefiero incluir a dejar fuera. Un estudio con preguntas médicas de un foro público12 encontró esto.
El hallazgo Los evaluadores prefirieron las respuestas del chatbot a las de los médicos en el 78,6 % de las comparaciones, y calificaron las del chatbot de empáticas o muy empáticas casi diez veces más a menudo.
Estos modelos pueden producir texto que se lee como cálido, y esa capacidad es real.
Lo que rara vez hacen sin que se lo pidas es decirte que tu mensaje se lee como un ultimátum. Harán que el ultimátum fluya mejor y te felicitarán por tu honestidad emocional. Ese hueco es pequeño y es casi todo el trabajo, y construí Subtext para cerrarlo. Nombra cómo se lee tu mensaje antes de reescribir una sola palabra de él.
Una nota sobre las versiones de los modelos. Todo lo de arriba describe comportamientos que se han mantenido a lo largo de varias generaciones de cada familia de modelos, y por eso he evitado casi siempre nombrar versiones concretas. Estos sistemas cambian cada pocos meses, y cualquier texto que cuelgue su argumento de un número de versión estará equivocado para el invierno.
¿Crees que he sido injusto con tu modelo favorito? Cuéntamelo en LinkedIn.
Samet Durgun es cofundador de Subtext, una app que capta el tono emocional de tus mensajes y los reescribe con tu propia voz. Vive en Berlín.
Fuentes
Todos los enlaces de arriba llevan a la fuente primaria cuando existe.
- OpenAI, “Introducing Canvas,” 3 de octubre de 2024.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Se evaluaron inglés, alemán, coreano y chino en las categorías griceanas; Gemini quedó excluido en su momento por motivos de acceso a la API.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025.
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de mayo de 2025.
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octubre de 2023.
- Investigación sobre la homogeneización estilística en la escritura asistida por IA, incluidos Padmakumar y He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, y Doshi y Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Agarwal, Naaman y Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
- Jakesch, Hancock y Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
- Jakesch, French, Ma, Hancock y Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Véase también Hancock, Naaman y Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funciones de Codex y de prompts de sustitución de texto.
- Sudowrite, funciones “Show, Don’t Tell” y Describe.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 evaluaciones; las respuestas del chatbot se prefirieron en el 78,6 % de las comparaciones y se calificaron de empáticas o muy empáticas 9,8 veces más a menudo que las de los médicos.