ArtículosHerramientas de escritura
Alternativas a ChatGPT para escribir: qué le hacen los tres grandes a tus palabras
ChatGPT, Claude y Gemini son buenos para dejar un texto correcto. Dónde deja cada uno de sonar a ti, y qué arma la gente encima de ellos.
Por Samet Durgun · Cofundador de Subtext · 12 min de lectura
He visto a alguien escribir el mismo mensaje once veces. Borrarlo. Escribirlo otra vez. Leerlo en voz alta. Mandárselo a una amiga a ver qué opina. Y al final mandar una versión recortada que no dice casi nada.
En algún momento, casi todos terminan pegándolo en ChatGPT.
Lo que sale suele ser mejor. La gramática queda limpia, las frases más apretadas, se fue toda la vuelta que le estabas dando. También suele dejar de ser suyo. El mensaje pasa de ser algo que escribió una persona nerviosa a la una de la mañana a algo que escribió un desconocido competente un martes a las diez, y quien lo recibe siente esa diferencia aunque no sepa ponerle nombre.
Yo hago una aplicación en este terreno, así que mi sesgo es obvio y vale la pena que leas el resto sabiéndolo. Prefiero ser útil que convincente, así que la mayor parte de este texto va de lo que los tres grandes asistentes sí hacen bien, y después de las formas concretas, y bastante bien documentadas, en las que fallan cuando lo que escribes se pone personal.
Empecemos por lo que sí hacen bien
Si lo que necesitas es que un mensaje esté bien escrito, sea más corto, más claro o esté traducido, los tres son excelentes y úsalos sin pensarlo. Arreglan las comas mal puestas, se echan esos arranques de carraspeo, convierten un párrafo que da vueltas en tres frases limpias y cambian de registro cuando se los pides. El Canvas1 de ChatGPT te da una superficie de edición con las dos versiones lado a lado en vez de un muro de texto regenerado. El Help me write de Gemini vive dentro de Gmail y de Docs, lo que quita casi toda la fricción de siquiera llegar a la herramienta. Los Proyectos de Claude guardan una guía de estilo y unos cuantos documentos de referencia de una sesión a otra.
Para un correo de trabajo que nada más tiene que ser correcto y no incomodar a nadie, ese es el trabajo completo. Puedes dejar de leer aquí.
El resto va de la otra clase de mensaje. La disculpa. El límite que llevas semanas evitando poner. La respuesta a tu mamá. El mensaje a alguien con quien saliste. Esa categoría se comporta distinto, y ahí es donde las diferencias entre estos modelos empiezan a importar.
Cuatro cosas que una reescritura puede romper
La investigación sobre edición traza una línea útil entre la calidad de superficie y la fidelidad de la revisión. Un mensaje puede quedar más pulido y al mismo tiempo peor, porque pulir se lleva justo las partes que estaban haciendo el trabajo. Cambiar “pues es una forma de decirlo” por “no estuvo nada de acuerdo” es más explícito y mucho menos cierto.
Hay más o menos cuatro cosas que una revisión tiene que dejar en paz:
| Lo que no se toca | Qué abarca | Cómo lo rompen los modelos |
|---|---|---|
| Hechos | Nombres, fechas, cifras, lo que sí prometiste | Agrega un detalle, convierte un tal vez en un sí |
| Implicación | Ironía, cortesía, distancia, vaguedad deliberada | Dice de frente lo que estaba implícito |
| Voz | Tu léxico, tu ritmo, el largo de tus frases, tus manías de puntuación | La cambia por un estilo de casa impecable |
| Estructura | Con qué abriste y qué dejaste enterrado | Lo reordena en algo convencionalmente más claro |
Todas las quejas que vienen más abajo son alguno de esos cuatro fallando. Vale la pena notar que los correctores de gramática solo revisan el primero, y que la mayoría de la gente que evalúa una reescritura hecha por IA tampoco ve más allá del primero.
ChatGPT: capta el ambiente y luego se pasa del encargo
ChatGPT es el más intuitivo de los tres con lo emocional cuando hay diálogo de por medio. Dale una escena donde dos personas hablan de algo trivial mientras le sacan la vuelta a algo que duele, y por lo general deja lo que duele sin decir. Lo que escribe tiene una cadencia natural, y se le da bien detectar la dinámica emocional que hay debajo de lo escrito.
Su problema recurrente es que no se queda en la silla del editor. Quienes describen cómo edita terminan siempre en la misma queja: reescribe cosas que nadie le pidió que tocara.
“Incluso en frases que no tenían nada que ver con los cambios que pedí, ChatGPT parece que igual quiere reescribir.”
Reporte de un usuario sobre cómo edita ChatGPT2
Dos efectos colaterales importan cuando hablamos de mensajes. El primero es que se lleva lo específico. La frase que hacía que tu disculpa fuera tuya, algo como “sé que te quedaste cuarenta minutos parada afuera”, se derrumba hasta quedar en “sé que te hice esperar”. Quienes escriben ficción cuentan una versión más brutal del mismo instinto: entregan tres mil palabras para una corrección de estilo y les regresan menos de la mitad, aunque hayan pedido que se respetara la extensión.3
El segundo es que las instrucciones de tono vagas producen bandazos, no ajustes.
“Muchas veces regresa con un tono súper formal. Le dices ‘menos formal’ y se va hasta el otro extremo, bien relajado.”
Reporte de un usuario sobre el control del tono4
Y darle más textos tuyos no arregla de forma confiable el problema de la voz. Un escritor le pasó unas seis mil palabras de su propia prosa como referencia y contó que el resultado seguía “apestando a ChatGPT”.5
Claude: cumple el encargo y luego te explica a ti mismo
Claude es el mejor de los tres haciendo lo que le pediste y nada más. Respeta las restricciones, no se inventa detalles y maneja bien la vida interior de los personajes, y por eso aparece una y otra vez cuando alguien busca un modelo que no le secuestre el borrador.
Aquí hay además lo más parecido a evidencia comparativa dura. MultiPragEval, un benchmark que mide la comprensión pragmática en inglés, alemán, coreano y chino, dejó a Claude 3 Opus claramente por delante de GPT-4 en implicatura e interpretación griceana, que es la forma técnica de decir que se le daba mejor deducir qué quería decir alguien y no qué dijo literalmente.6 Dos advertencias. El benchmark mide interpretación, no edición. Y los modelos evaluados ya tienen varias generaciones encima, así que esto apunta a una tendencia de familia y no a un marcador actualizado.
El modo de falla de Claude es el contrario al de ChatGPT. Entiende el subtexto y acto seguido lo escribe. En la ficción a esto le llaman deriva explicativa: el modelo convierte lo insinuado en algo dicho, con frases del tipo “el silencio entre los dos cargaba con el peso no dicho de los años”. En un mensaje de celular, esto aparece como jerga de terapia.
Ejemplo ilustrativo, no una respuesta real
no estoy enojado, nada más noté que no me contestaste
Lo que escribiste. Deliberadamente rebajado, que es justo el punto.
Quiero compartirte que me ha dolido un poco la demora en recibir tu respuesta, y creo que eso viene de lo mucho que valoro nuestra amistad.
El subtexto ahora es el texto. Está tranquilo, bien articulado, y dice exactamente lo que estabas eligiendo no decir.
Hay otros dos patrones de Claude que salen lo bastante seguido como para tenerlos previstos. Adorna cuando lo dejas suelto, algo que un usuario describió como una “clara mejora en la escritura con estilo” que aun así podía “sobreactuar” el resultado.7 Y es generoso con los halagos: envuelve la crítica en un sándwich de cumplidos.8 Lo segundo es un problema de verdad cuando lo que necesitabas era una lectura sin anestesia de si tu mensaje va a caer mal.
Gemini: ya está donde estás tú, malísimo para dejar cosas sin decir
La ventaja de Gemini es dónde está. Está en Gmail, está en Docs, es el asistente por defecto en un montón de celulares Android y su plan gratuito es generoso. No tiene la manía de ChatGPT de encogerte el texto, y moraliza menos con los temas difíciles.
Las opiniones sobre la calidad de su escritura están genuinamente partidas, y creo que vale la pena decirlo en vez de disimularlo. Algunos escritores con oficio lo consideran el mejor de los tres criticando escritura creativa y captando matices. Otros ven que tiene un estilo de casa del que no se baja.
“Para mí el problema es el estilo, escribe como tipo de Reddit.”
Reporte de un usuario sobre el registro por defecto de Gemini9
El patrón que más importa en los mensajes personales es que Gemini tiene poquísima contención narrativa. Si hay algo guardado, lo saca a la luz. Los novelistas lo describen como colgar un letrero de neón parpadeante encima del detalle que se suponía que iba a quedarse escondido. En un mensaje, eso significa que aquello que estabas rodeando con cuidado termina en la segunda frase.
Los problemas que los tres comparten
Uno: te dan la razón
Este es el que más importa, y es el mejor documentado.
En abril de 2025 OpenAI lanzó una actualización que dejó a ChatGPT notablemente más adulador, y la revirtió cuatro días después. Su propio informe10 decía que el modelo “se inclinaba hacia respuestas excesivamente complacientes pero poco sinceras”, y ubicaba la causa en haberle dado demasiado peso a la aprobación inmediata del usuario. Una entrada posterior11, unos días más tarde, entraba en más detalle sobre lo que se les había escapado en su proceso de revisión.
El mecanismo de fondo no es exclusivo de OpenAI. Una investigación sobre cinco asistentes de punta encontró que los modelos entrenados con datos de preferencia humana “con frecuencia sacrifican la veracidad con tal de coincidir con las creencias del usuario”, porque lo que se premia es estar de acuerdo.12
Ahora piensa en lo que la gente de verdad le pide a estas herramientas. Poquísima gente pega un mensaje y pide ayuda con la gramática. Piden alguna versión de “¿esto suena muy duro?” o “¿estoy exagerando?”. Esa pregunta va a dar a un sistema con un sesgo estructural a decirte que estás bien.
Un asistente generalista te va a ayudar a escribir un mejor chantaje emocional. No te va a decir que estás chantajeando.
Querías una segunda opinión y lo que te llevaste fue un cómplice con mejor puntuación.
Dos: normalizan lo que hiciste a propósito
Los tres corrigen frases incompletas, repeticiones, puntuación rara, rodeos y dialecto, incluso cuando todo eso fue una decisión tuya. Pedirles que “conserven tu voz” no lo arregla, porque el modelo no tiene forma de saber cuáles rarezas son tuyas y cuáles son errores.
Relacionado con eso, y más sutil, está la inflación semántica. El modelo convierte “igual y no llego” en “no voy a poder ir”, o “te noté medio raro” en “estabas enojado”. Cada cambio suena más seguro y es menos exacto, y en un mensaje sobre una relación, la exactitud del grado es casi todo el contenido.
Tres: escriben en un dialecto que la gente reconoce
Todos los modelos tienen muletillas. Quienes escriben llevan un buen rato catalogándolas, y en cuanto las ves ya no las puedes dejar de ver.
| Patrón | Ejemplos | Qué te cuesta |
|---|---|---|
| Sustantivos abstractos | testimonio, tapiz, faro, cacofonía | Cambia un detalle concreto por uno grandilocuente |
| Encuadre binario | “No era X, era Y” / “No por A, sino por B” | Impone una conclusión pulcra sobre algo que es un enredo |
| Interioridad declarada | “no pude evitar sentir”, “desde un lugar de” | Nombra la emoción en vez de mostrarla |
| Listas de tres | Tres elementos donde bastaban dos | Suena a compuesto, no a escrito |
| Antítesis equilibrada | Dos cláusulas del mismo peso, sin parar | Un ritmo que no es de ningún humano |
Detrás de la lista de vocabulario hay una preocupación más grande. Los estudios sobre escritura asistida por IA encuentran que la intervención del modelo empuja a escritores distintos hacia los mismos patrones dominantes, lo que significa que entre más usamos estas herramientas, más converge la escritura de todos.13 Para un mensaje cuyo único propósito es ser inconfundiblemente tuyo, esa es la dirección equivocada.
Cuatro: puede que la otra persona lo note, y eso te sale caro
Esta es la parte que la gente subestima. Existe toda una línea de investigación sobre lo que llaman comunicación mediada por IA, y su hallazgo central es incómodo: la gente no es confiable identificando textos escritos por IA14, y cuando lo intenta se apoya en pistas equivocadas. Pero cuando cree que un texto lo generó una IA, confía menos en quien lo firma.15
Así que el riesgo de una reescritura genérica no es solo un mensaje mediocre. Es un mensaje que se lee como insincero justo en el momento en el que la sinceridad es toda la carga. Una disculpa que le dispara el detector de IA a la otra persona hace más daño que la disculpa torpe que habrías escrito tú.
Cinco: no saben a quién le estás escribiendo
Cada sesión empieza en blanco. Para sacar un buen borrador tendrías que explicar una década de amistad, lo que pasó en marzo, por qué “todo bien” significa algo muy específico entre ustedes dos. Casi nadie hace eso, así que el modelo escribe para un destinatario genérico. La formalidad es lo que sale cuando un sistema no sabe nada de la relación, y por eso el resultado suena tantas veces a atención a clientes.
Y luego está la parte que la gente menciona en voz baja. Pegar la captura de un pleito, o el borrador de una ruptura, o un mensaje sobre tu familia en un chatbot de uso general no se siente igual que pedirle que te arregle un código. Ese instinto no es paranoia.
Qué hicieron los novelistas con todo esto
Esto es lo que me convenció de que el hueco es real y no algo que me inventé para tener qué vender.
Quienes escriben ficción se toparon con estas fallas exactas antes que nadie, con más en juego y muchísimo más volumen. Su respuesta no fue dejar de usar los modelos. Fue dejar de usarlos en crudo. Encima creció toda una capa de herramientas: entornos como Novelcrafter16, que te deja armar un diccionario de clichés prohibidos que se marcan en rojo mientras el texto se genera, y correr operaciones concretas como “muestra, no cuentes” sobre un fragmento seleccionado. Sudowrite17 hace algo parecido con pasadas dedicadas que convierten el resumen en detalle sensorial concreto.
Los usuarios serios van más lejos y arman cadenas con varios modelos. Un modelo para las notas de estructura y el análisis del subtexto, un segundo para la corrección de estilo con restricciones estrictas, una pasada de filtrado para limpiar el vocabulario de IA y, al final, una pasada humana que le devuelve la voz. La literatura científica llega a la misma arquitectura por el otro lado, y recomienda una etapa de interpretación separada antes de cualquier revisión, ediciones acotadas a fragmentos en vez de reescrituras completas, y un validador que compruebe que no se movió nada fuera de lo que se pidió.18
Eso son cuatro herramientas y una lista de verificación para revisar un capítulo. Funciona. Y también te dice algo: los modelos generales no hacen este trabajo solos, y la gente a la que más le importa el resultado ya lo asumió.
Ahora llévalo a un mensaje de celular. Nadie arma una cadena de cuatro etapas antes de contestarle a su hermana. La necesidad de una capa más fina es idéntica y la tolerancia al esfuerzo es más o menos cero, y ese es el verdadero problema de producto.
Qué tiene que hacer distinto una herramienta más fina
Tres cosas, y ninguna es “escribir mejor”.
Analizar antes de reescribir. Nombrar lo que el borrador está señalando antes de tocarle una palabra, incluida la parte que quien escribe no traía en mente. La investigación apunta a lo mismo: identificar lo que un pasaje implica y revisar bajo esa interpretación da mejores resultados que un solo “mejora esto” sin más.19 Esa es además la única respuesta real a la adulación, porque una herramienta que arranca con un diagnóstico tiene que decir algo antes de tener chance de darte la razón.
Mostrar la distancia, no esconderla. Una versión cercana a lo que escribiste, junto a una versión escrita desde cero, es más útil que un solo reemplazo pulido. Ves qué cambió y decides si estás dispuesto a sonar así.
Sostener la relación, no solo el mensaje. Quién es esa persona para ti, qué ya intentaste, qué significa “todo bien” en esta amistad en particular.
Eso es lo que estoy construyendo, así que trata este párrafo en consecuencia. Subtext etiqueta la emoción de lo que escribiste antes de sugerirte nada, que es una decisión de diseño deliberadamente incómoda, porque el momento en el que más útil resulta es justo el momento en el que menos ganas tienes de oírlo.
Ejemplo ilustrativo, no una respuesta real
todo bien, ya entendí, andas ocupada. ya no te insisto.
Lo que mandarías. Se lee como retirada, y “ya no te insisto” es una amenaza disfrazada de disculpa.
Hola, entiendo perfectamente que has andado con mucho trabajo. Por lo de hoy en la noche no te preocupes para nada, dime cuándo te queda mejor y lo acomodamos.
Una reescritura genérica. Correcta, agradable, y borró el hecho de que estás dolido, que era la única información del original.
todo bien. aunque sí me quedé algo desanimado, ya van tres veces. prefiero decírtelo a hacer como que no pasa nada.
La misma voz, el mismo largo, conserva el dolor y suelta la amenaza.
Dónde sigo abriendo ChatGPT
Documentos largos. Correo profesional. Cualquier cosa donde ser correcto importe más que ser reconociblemente tú. Investigación, primeros borradores, traducción, y esa piedad tan específica de poner palabras en una página en blanco cuando no puedes empezar.
Y un dato que va en contra de mi propio argumento, que prefiero incluir a dejar fuera. En un estudio con preguntas médicas de un foro público20, los evaluadores prefirieron las respuestas del chatbot a las de los médicos en 78.6% de las comparaciones, y calificaron las del chatbot como empáticas o muy empáticas casi diez veces más seguido. Estos modelos sí pueden producir texto que se lee como cálido. Esa capacidad es real.
Lo que no hacen es decirte que tu mensaje se lee como un ultimátum. Van a hacer que el ultimátum fluya mejor y te van a felicitar por tu honestidad emocional. Ese hueco es pequeño y es casi todo el trabajo.
Una nota sobre las versiones de los modelos. Todo lo de arriba describe comportamientos que se han mantenido a lo largo de varias generaciones de cada familia de modelos, y por eso casi siempre evité nombrar versiones específicas. Estos sistemas cambian cada pocos meses, y cualquier texto que cuelgue su argumento de un número de versión va a estar equivocado para el invierno.
¿Crees que fui injusto con tu modelo favorito? Cuéntamelo en LinkedIn.
Samet Durgun es cofundador de Subtext, una aplicación que capta el tono emocional de tus mensajes y los reescribe con tu propia voz. Vive en Berlín.
Fuentes
Todos los enlaces de arriba llevan a la fuente primaria cuando existe.
- OpenAI, “Introducing Canvas,” 3 de octubre de 2024. openai.com
- Comentarios agregados de usuarios sobre el alcance de las ediciones de ChatGPT, recogidos en foros públicos y reseñas.
- Reportes agregados de comunidades de escritura de ficción sobre el acortamiento del texto en las pasadas de corrección de estilo.
- Comentarios agregados de usuarios sobre la sensibilidad a las instrucciones de tono, recogidos en las mismas fuentes.
- Comentario de un usuario sobre la imitación de estilo con muestras de escritura extensas, recogido en las mismas fuentes.
- Park et al., “MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models,” 2024. Se evaluaron inglés, alemán, coreano y chino en las categorías griceanas; Gemini quedó fuera en ese momento por motivos de acceso a la API.
- Comentarios agregados de usuarios sobre los adornos en la prosa de Claude, recogidos en las mismas fuentes.
- Comentarios de usuarios sobre el estilo de retroalimentación editorial de Claude, recogidos en las mismas fuentes.
- Comentario de un usuario sobre el registro de escritura por defecto de Gemini, recogido en las mismas fuentes.
- OpenAI, “Sycophancy in GPT-4o: what happened and what we’re doing about it,” 29 de abril de 2025. openai.com
- OpenAI, “Expanding on what we missed with sycophancy,” 2 de mayo de 2025. openai.com
- Sharma et al., “Towards Understanding Sycophancy in Language Models,” Anthropic, arXiv:2310.13548, octubre de 2023. arxiv.org
- Investigación sobre la homogeneización estilística en la escritura asistida por IA, incluidos Padmakumar y He, “Does Writing with Language Models Reduce Content Diversity?”, ICLR 2024, y Doshi y Hauser, “Generative AI enhances individual creativity but reduces the collective diversity of novel content,” Science Advances, 2024.
- Jakesch, Hancock y Naaman, “Human heuristics for AI-generated language are flawed,” PNAS, 2023. pnas.org
- Jakesch, French, Ma, Hancock y Naaman, “AI-Mediated Communication: How the Perception that Profile Text was Written by AI Affects Trustworthiness,” CHI 2019. Véase también Hancock, Naaman y Levy, “AI-Mediated Communication: Definition, Research Agenda, and Ethical Considerations,” Journal of Computer-Mediated Communication, 2020.
- Novelcrafter, funciones de Codex y de prompts de sustitución de texto. novelcrafter.com
- Sudowrite, funciones “Show, Don’t Tell” y Describe. sudowrite.com
- Síntesis de enfoques de arquitectura de producción discutidos públicamente para sistemas de revisión restringida, incluidas la edición por fragmentos y la validación de invariancia.
- Investigación sobre prompting consciente de la implicatura, que encuentra que explicitar la intención latente antes de generar mejora la relevancia y la calidad del resultado.
- Ayers et al., “Comparing Physician and Artificial Intelligence Chatbot Responses to Patient Questions Posted to a Public Social Media Forum,” JAMA Internal Medicine, 28 de abril de 2023. 585 evaluaciones; las respuestas del chatbot se prefirieron en 78.6% de las comparaciones y se calificaron como empáticas o muy empáticas 9.8 veces más seguido que las de los médicos. jamanetwork.com