ArtículosHerramientas de escritura

Alternativas a ChatGPT para escribir: qué le hacen los tres grandes a tus palabras

ChatGPT, Claude y Gemini son buenos para dejar un texto correcto. Dónde deja cada uno de sonar a ti, y qué arma la gente encima de ellos.

Por Samet Durgun · Cofundador de Subtext · 15 min de lectura

He visto a alguien escribir el mismo mensaje once veces, lo que explica por qué una respuesta de dos líneas te puede tomar una hora. Borrarlo. Escribirlo otra vez. Leerlo en voz alta. Mandárselo a una amiga a ver qué opina. Y al final mandar una versión recortada que no dice casi nada.

En algún momento, casi todos terminan pegándolo en ChatGPT.

Lo que sale suele ser mejor. La gramática queda limpia, las frases más apretadas, se fue toda la vuelta que le estabas dando. También suele dejar de ser suyo. El mensaje pasa de ser algo que escribió una persona nerviosa a la una de la mañana a algo que escribió un desconocido competente un martes a las diez, y quien lo recibe siente esa diferencia aunque no sepa ponerle nombre. Ese vacío es justo lo que Subtext, la aplicación que cofundé, está hecha para detectar. Lee qué está haciendo un mensaje así antes de que lo mandes.

Así que mi sesgo es obvio y vale la pena que leas el resto sabiéndolo. Prefiero ser útil que convincente, así que la mayor parte de este texto va de lo que los tres grandes asistentes hacen bien, y después de las formas concretas, y bastante bien documentadas, en las que fallan cuando lo que escribes se pone personal. Las fuentes están enlazadas para que peses mi interés contra la evidencia tú mismo.

Empecemos por lo que sí hacen bien

Si lo que necesitas es que un mensaje esté bien escrito, sea más corto, más claro o esté traducido, los tres son excelentes y úsalos sin pensarlo. Arreglan las comas mal puestas, se echan esos arranques de carraspeo, convierten un párrafo que da vueltas en tres frases limpias y cambian de registro cuando se los pides. El Canvas1 de ChatGPT te da una superficie de edición con las dos versiones lado a lado en vez de un muro de texto regenerado. El Help me write de Gemini vive dentro de Gmail y de Docs, lo que quita casi toda la fricción de siquiera llegar a la herramienta. Los Proyectos de Claude guardan una guía de estilo y unos cuantos documentos de referencia de una sesión a otra.

Para un correo de trabajo que nada más tiene que ser correcto y no incomodar a nadie, con eso basta. Puedes dejar de leer aquí.

El resto va de la otra clase de mensaje. La disculpa. El límite que llevas semanas evitando poner. La respuesta a tu mamá. El mensaje a alguien con quien saliste. Esa categoría se comporta distinto, y ahí es donde las diferencias entre estos modelos empiezan a importar.

Cuatro cosas que una reescritura puede romper

Me sirve separar la calidad de superficie de la fidelidad de la revisión. Un mensaje puede quedar más pulido y al mismo tiempo peor, porque pulir se lleva justo las partes que estaban haciendo el trabajo. Cambiar “pues es una forma de decirlo” por “no estuvo nada de acuerdo” es más explícito y mucho menos cierto.

Mi lista tiene cuatro cosas que una revisión tiene que dejar en paz. Así es como yo reviso una reescritura, y nadie la ha validado como escala.

Lo que no se toca Qué abarca Cómo lo rompen los modelos
Hechos Nombres, fechas, cifras, lo que sí prometiste Agrega un detalle, convierte un tal vez en un sí
Implicación Ironía, cortesía, distancia, vaguedad deliberada Dice de frente lo que estaba implícito
Voz Tu léxico, tu ritmo, el largo de tus frases, tus manías de puntuación La cambia por un estilo de casa impecable
Estructura Con qué abriste y qué dejaste enterrado Lo reordena en algo convencionalmente más claro

Todas las quejas que vienen más abajo son alguno de esos cuatro fallando. Yo diría que los correctores de gramática solo revisan el primero, y que la mayoría de la gente que evalúa una reescritura hecha por IA tampoco ve más allá del primero.

ChatGPT capta el ambiente y luego se pasa del encargo

ChatGPT es el más intuitivo de los tres con lo emocional cuando hay diálogo de por medio. Dale una escena donde dos personas hablan de algo trivial mientras le sacan la vuelta a algo que duele, y por lo general deja lo que duele sin decir. Lo que escribe tiene una cadencia natural, y se le da bien detectar la dinámica emocional que hay debajo de lo escrito.

Su problema recurrente es que no se queda en la silla del editor. Quienes describen cómo edita terminan siempre en la misma queja, la de que reescribe cosas que nadie le pidió que tocara.

Dos efectos colaterales importan cuando hablamos de mensajes. El primero es que se lleva lo específico. La frase que hacía que tu disculpa fuera tuya, algo como “sé que te quedaste cuarenta minutos parada afuera”, se derrumba hasta quedar en “sé que te hice esperar”. Quienes escriben ficción cuentan en foros en línea una versión más brutal del mismo instinto. Piden una corrección de estilo que respete la extensión y les regresan un capítulo mucho más corto.

El segundo es que las instrucciones de tono vagas producen bandazos cuando tú querías un ajuste. Un reporte común es que regresa con un tono súper formal, y basta con pedirle una vez que sea menos formal para que se vaya hasta el otro extremo, bien relajado.

Y darle más textos tuyos no arregla de forma confiable el problema de la voz. Hay escritores que le pegan miles de palabras de su propia prosa como referencia y siguen reportando que el resultado suena a ChatGPT.

Claude cumple el encargo y luego te explica a ti mismo

Claude es el mejor de los tres haciendo lo que le pediste y nada más. Respeta las restricciones, no se inventa detalles y maneja bien la vida interior de los personajes, y por eso aparece una y otra vez cuando alguien busca un modelo que no le secuestre el borrador.

Aquí hay además lo más parecido a evidencia comparativa dura. MultiPragEval, un benchmark que mide la comprensión pragmática en inglés, alemán, coreano y chino, dejó a Claude 3 Opus claramente por delante de GPT-4 en implicatura e interpretación griceana, que es la forma técnica de decir que se le daba mejor deducir qué quería decir alguien y no qué dijo literalmente.2 Yo señalaría dos advertencias. El benchmark mide interpretación, no edición. Y los modelos evaluados ya tienen varias generaciones encima, así que esto apunta a una tendencia de familia, no a un marcador actualizado.

El modo de falla de Claude es el contrario al de ChatGPT. Entiende el subtexto y acto seguido lo escribe. En la ficción a esto le llaman deriva explicativa: el modelo convierte lo insinuado en algo dicho, con frases del tipo “el silencio entre los dos cargaba con el peso no dicho de los años”. En un mensaje de celular, esto aparece como jerga de terapia.

Ejemplo ilustrativo, no una respuesta real

no estoy enojado, nada más noté que no me contestaste

Lo que escribiste. Deliberadamente rebajado, que es justo el punto.

Quiero compartirte que me ha dolido un poco la demora en recibir tu respuesta, y creo que eso viene de lo mucho que valoro nuestra amistad.

El subtexto ahora es el texto. Está tranquilo, bien articulado, y dice exactamente lo que estabas eligiendo no decir.

Hay otros dos patrones de Claude que salen lo bastante seguido como para tenerlos previstos. Adorna cuando lo dejas suelto, y hay usuarios que describen su prosa como con más estilo y a veces sobreactuada. Y es generoso con los halagos, con la crítica muchas veces envuelta en un sándwich de cumplidos. Lo segundo es un problema de verdad cuando lo que necesitabas era una lectura sin anestesia de si tu mensaje va a caer mal.

Gemini ya está donde estás tú, y es malísimo para dejar cosas sin decir

La ventaja de Gemini es dónde está. Está en Gmail, está en Docs, es el asistente por defecto en un montón de celulares Android y su plan gratuito es generoso. No tiene la manía de ChatGPT de encogerte el texto, y moraliza menos con los temas difíciles.

Las opiniones sobre la calidad de su escritura están partidas, y creo que vale la pena decirlo sin rodeos. Algunos escritores con oficio lo consideran el mejor de los tres criticando escritura creativa y captando matices. Otros ven que tiene un estilo de casa del que no se baja, con un registro de plática que algunos comparan con un comentario de Reddit.

El patrón que más importa en los mensajes personales es que Gemini tiene poquísima contención narrativa. Si hay algo guardado, lo saca a la luz. Los novelistas lo describen como colgar un letrero de neón parpadeante encima del detalle que se suponía que iba a quedarse escondido. En un mensaje, eso significa que aquello que estabas rodeando con cuidado termina en la segunda frase.

Los problemas que los tres comparten

Uno: te dan la razón

Este es el que más importa, y es el mejor documentado.

En abril de 2025 OpenAI lanzó una actualización que dejó a ChatGPT notablemente más adulador, y la revirtió cuatro días después. Su propio informe3 decía que el modelo “se inclinaba hacia respuestas excesivamente complacientes pero poco sinceras”, y ubicaba la causa en haberle dado demasiado peso a la aprobación inmediata del usuario. Una entrada posterior4, unos días más tarde, entraba en más detalle sobre lo que se les había escapado en su proceso de revisión.

El mecanismo de fondo no es exclusivo de OpenAI. Una investigación sobre cinco asistentes de punta encontró que los modelos entrenados con datos de preferencia humana “con frecuencia sacrifican la veracidad con tal de coincidir con las creencias del usuario”, porque lo que se premia es estar de acuerdo.5

Ahora piensa en lo que la gente de verdad le pide a estas herramientas. Poquísima gente pega un mensaje y pide ayuda con la gramática. Piden alguna versión de “¿esto suena muy duro?” o “¿estoy exagerando?”, la pregunta que analizo en “¿Este mensaje suena grosero?”. Esa pregunta va a dar a un sistema con un sesgo estructural a decirte que estás bien.

Un asistente generalista te va a ayudar a escribir un mejor chantaje emocional. Muchas veces no te va a decir que estás chantajeando.

Querías una segunda opinión y lo que te llevaste fue un cómplice con mejor puntuación.

De todo lo que hay en esta página, este es el fallo contra el que Subtext está construido más directamente, y la solución que elegí es estructural. Volveré a esto.

Dos: normalizan lo que hiciste a propósito

Los tres corrigen frases incompletas, repeticiones, puntuación rara, rodeos y dialecto, incluso cuando todo eso fue una decisión tuya. Pedirles que “conserven tu voz” no lo arregla, porque el modelo no tiene forma de saber cuáles rarezas son tuyas y cuáles son errores.

Relacionado con eso, y más sutil, está la inflación semántica. El modelo convierte “igual y no llego” en “no voy a poder ir”, o “te noté medio raro” en “estabas enojado”. Cada cambio suena más seguro y es menos exacto, y en un mensaje sobre una relación, la exactitud del grado es casi todo el contenido.

Tres: escriben en un dialecto que la gente reconoce

Todos los modelos tienen muletillas. Quienes escriben llevan un buen rato catalogándolas, y en cuanto las ves ya no las puedes dejar de ver.

Patrón Ejemplos Qué te cuesta
Sustantivos abstractos testimonio, tapiz, faro, cacofonía Cambia un detalle concreto por uno grandilocuente
Encuadre binario “No era X, era Y” / “No por A, sino por B” Impone una conclusión pulcra sobre algo que es un enredo
Interioridad declarada “no pude evitar sentir”, “desde un lugar de” Nombra la emoción en vez de mostrarla
Listas de tres Tres elementos donde bastaban dos Suena a compuesto, no a escrito
Antítesis equilibrada Dos cláusulas del mismo peso, sin parar Un ritmo que no es de ningún humano

Detrás de la lista de vocabulario hay una preocupación más grande. Los estudios sobre escritura asistida por IA encuentran que la intervención del modelo empuja a escritores distintos hacia los mismos patrones dominantes, lo que significa que entre más usamos estas herramientas, más converge la escritura de todos.6 En un estudio presentado en CHI 2025, 118 personas de India y Estados Unidos escribieron sobre su propia vida, y con las sugerencias de IA activadas, la escritura de los participantes de India se fue moviendo hacia estilos occidentales.7 Para un mensaje cuyo único propósito es ser inconfundiblemente tuyo, esa es la dirección equivocada.

Cuatro: puede que la otra persona lo note, y eso te sale caro

Esta es la parte que la gente subestima. Existe toda una línea de investigación sobre lo que llaman comunicación mediada por IA, y su hallazgo central es incómodo. La gente no es confiable identificando textos escritos por IA8, y cuando lo intenta se apoya en pistas equivocadas. Pero cuando cree que un texto lo generó una IA, confía menos en quien lo firma.9

Así que el riesgo de una reescritura genérica va más allá de un mensaje mediocre y llega a uno que se lee como insincero justo en el momento en el que la sinceridad es toda la carga. Una disculpa que le dispara el detector de IA a la otra persona hace más daño que la disculpa torpe que habrías escrito tú.

Cinco: no saben a quién le estás escribiendo

A menos que la memoria o un proyecto arrastren algo de antes, cada sesión empieza casi en blanco. Para sacar un buen borrador tendrías que explicar una década de amistad, lo que pasó en marzo, por qué “todo bien” significa algo muy específico entre ustedes dos. Casi nadie hace eso, así que el modelo escribe para un destinatario genérico. La formalidad es lo que sale cuando un sistema no sabe nada de la relación, y por eso el resultado suena tantas veces a atención a clientes. Ese comienzo en blanco es la razón por la que Subtext lee el hilo que pegas o capturas, y pregunta para quién es un mensaje cuando un borrador se enfrenta a alguien.

Y luego está la parte que la gente menciona en voz baja. Pegar la captura de un pleito, o el borrador de una ruptura, o un mensaje sobre tu familia en un chatbot de uso general no se siente igual que pedirle que te arregle un código. Ese instinto no es paranoia.

Qué hicieron los novelistas con todo esto

Lo que sigue es lo que me convenció de que el hueco es real, y no algo que me inventé para tener qué vender.

Quienes escriben ficción se toparon con estas fallas exactas antes que nadie, con más en juego y muchísimo más volumen. Siguieron usando los modelos, solo que no en crudo. Encima creció toda una capa de herramientas, incluidos entornos como Novelcrafter10, que te deja armar un diccionario de clichés prohibidos que se marcan en rojo mientras el texto se genera, y correr operaciones concretas como “muestra, no cuentes” sobre un fragmento seleccionado. Sudowrite11 hace algo parecido con pasadas dedicadas que convierten el resumen en detalle sensorial concreto.

Los usuarios serios van más lejos y arman cadenas con varios modelos. Un modelo para las notas de estructura y el análisis del subtexto, un segundo para la corrección de estilo con restricciones estrictas, una pasada de filtrado para limpiar el vocabulario de IA y, al final, una pasada humana que le devuelve la voz.

Eso son cuatro herramientas y una lista de verificación para revisar un capítulo. Funciona. Y también te dice que los modelos generales no hacen este trabajo solos, y que la gente a la que más le importa el resultado ya lo asumió.

Ahora llévalo a un mensaje de celular. Nadie arma una cadena de cuatro etapas antes de contestarle a su hermana. La necesidad de una capa más fina es idéntica y la tolerancia al esfuerzo es más o menos cero, y ese es el verdadero problema de producto. Por separado, revisé si los reescritores de mensajes con IA de verdad funcionan en mensajes como ese.

Qué tiene que hacer distinto una herramienta más fina

Tres cosas, y ninguna es “escribir mejor”.

Analizar antes de reescribir. Nombrar lo que el borrador está señalando antes de tocarle una palabra, tal como debería hacerlo un verificador de mensajes con IA, incluida la parte que quien escribe no traía en mente. También ayuda contra la adulación, porque una herramienta que arranca con una lectura se compromete con ella antes de tener chance de darte la razón. Eso no hace que la lectura sea correcta. Subtext funciona con el mismo tipo de modelo, así que cuestiónalo como cuestionarías a un amigo. ¿Qué palabras sostienen esa lectura, y de qué otra forma podrían caer?

Mostrar la distancia, no esconderla. Una versión cercana a lo que escribiste, junto a una versión escrita desde cero, es más útil que un solo reemplazo pulido. Ves qué cambió y decides si estás dispuesto a sonar así.

Leer la relación además del mensaje. Quién es esa persona para ti, qué muestra el hilo que ya intentaste, qué significa “todo bien” en esta amistad en particular.

Eso es lo que estoy construyendo, así que trata este párrafo en consecuencia. Subtext etiqueta la emoción de lo que escribiste antes de sugerirte nada, que es una decisión de diseño deliberadamente incómoda, porque el momento en el que más útil resulta es justo el momento en el que menos ganas tienes de oírlo.

Ejemplo ilustrativo, no una respuesta real

todo bien, ya entendí, andas ocupada. ya no te insisto.

Lo que mandarías. Se lee como retirada, y “ya no te insisto” es una amenaza disfrazada de disculpa.

Hola, entiendo perfectamente que has andado con mucho trabajo. Por lo de hoy en la noche no te preocupes para nada, dime cuándo te queda mejor y lo acomodamos.

Una reescritura genérica. Correcta, agradable, y borró el hecho de que estás dolido, que era la única información del original.

todo bien. aunque sí me quedé algo desanimado. prefiero decírtelo a hacer como que no pasa nada.

La misma voz, conserva el dolor, suelta la amenaza y no agrega nada que no hayas dicho.

En la práctica, pegas el borrador, o capturas la conversación para que lea ambos lados, y te dice qué va a señalar tu mensaje antes de ofrecerte versiones que aún suenen como tú. Prueba Subtext en tu navegadorPrueba Subtext en tu navegador

Dónde sigo abriendo ChatGPT

Documentos largos. Correo profesional. Cualquier cosa donde ser correcto importe más que ser reconociblemente tú. Investigación, primeros borradores, traducción, y esa piedad tan específica de poner palabras en una página en blanco cuando no puedes empezar.

Y un dato que va en contra de mi propio argumento, que prefiero incluir a dejar fuera. Un estudio con preguntas médicas de un foro público12 encontró esto.

El hallazgo Los evaluadores prefirieron las respuestas del chatbot a las de los médicos en 78.6% de las comparaciones, y calificaron las del chatbot como empáticas o muy empáticas casi diez veces más seguido.

Estos modelos sí pueden producir texto que se lee como cálido, y esa capacidad es real.

Lo que rara vez hacen sin que se los pidas es decirte que tu mensaje se lee como un ultimátum. Van a hacer que el ultimátum fluya mejor y te van a felicitar por tu honestidad emocional. Ese hueco es pequeño y es casi todo el trabajo, y construí Subtext para cerrarlo. Nombra cómo se lee tu mensaje antes de reescribir una sola palabra de él.

Una nota sobre las versiones de los modelos. Todo lo de arriba describe comportamientos que se han mantenido a lo largo de varias generaciones de cada familia de modelos, y por eso casi siempre evité nombrar versiones específicas. Estos sistemas cambian cada pocos meses, y cualquier texto que cuelgue su argumento de un número de versión va a estar equivocado para el invierno.


¿Crees que fui injusto con tu modelo favorito? Cuéntamelo en LinkedIn.

Samet Durgun es cofundador de Subtext, una aplicación que capta el tono emocional de tus mensajes y los reescribe con tu propia voz. Vive en Berlín.


Fuentes

Todos los enlaces de arriba llevan a la fuente primaria cuando existe.

  1. OpenAI, “Introducing Canvas,” 3 de octubre de 2024.
  2. Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Se evaluaron inglés, alemán, coreano y chino en las categorías griceanas; Gemini quedó fuera en ese momento por motivos de acceso a la API.
  3. OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025.
  4. OpenAI, “Expanding on what we missed with sycophancy,” 2 de mayo de 2025.
  5. Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octubre de 2023.
  6. Investigación sobre la homogeneización estilística en la escritura asistida por IA, incluidos Padmakumar y He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, y Doshi y Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
  7. Agarwal, Naaman y Vashistha, “AI Suggestions Homogenize Writing Toward Western Styles and Diminish Cultural Nuances,” CHI 2025.
  8. Jakesch, Hancock y Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023.
  9. Jakesch, French, Ma, Hancock y Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Véase también Hancock, Naaman y Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
  10. Novelcrafter, funciones de Codex y de prompts de sustitución de texto.
  11. Sudowrite, funciones “Show, Don’t Tell” y Describe.
  12. Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 evaluaciones; las respuestas del chatbot se prefirieron en 78.6% de las comparaciones y se calificaron como empáticas o muy empáticas 9.8 veces más seguido que las de los médicos.