Fundamentos y herramientas de IA

Si solo pudieras elegir una IA para programar: la elección de un usuario tras un año de uso real

Una de las preguntas más frecuentes en las comunidades de desarrolladores actuales es: «¿Cuál debería usar, Claude Code o Codex?». He pagado Claude durante aproximadamente un año y Codex durante más de seis meses, y los uso a diario, incluidos el reciente Claude Fable 5 y GPT-5.6 Sol…

8 min de lectura
Imagen de portada de Si solo pudieras elegir una IA para programar: la elección de un usuario tras un año de uso real

La conclusión de un desarrollador tras usar Claude durante un año y Codex durante seis meses

Una de las preguntas más frecuentes en las comunidades de desarrolladores actuales es: «¿Cuál debería usar, Claude Code o Codex?». He pagado Claude durante aproximadamente un año y Codex durante más de seis meses, y los uso a diario, incluidos el reciente Claude Fable 5 y GPT-5.6 Sol. Antes de quedarme con estos dos, también probé Cursor y Kiro. Cursor me pareció realmente bueno al principio, pero acabé pasándome de forma natural porque Claude era excepcional. Kiro es una herramienta bastante buena, pero al ser más minoritaria, su ecosistema de skills y plugins no está tan desarrollado. Además, como dentro de Kiro acabaría usando modelos de Claude de todos modos, no encontré mucho sentido en pasar por él. En este artículo resumiré las diferencias que he percibido directamente, junto con datos objetivos como encuestas de la comunidad, benchmarks e incidencias de GitHub.

La diferencia de carácter entre los dos agentes según mi experiencia

En una frase: Claude se siente como un desarrollador sénior competente en casi todo, mientras que Codex se siente como un compañero de pocas palabras pero muy preciso.

Claude Code es relativamente rápido y preciso. Tiene buen criterio para comprender el código y leer el contexto, por lo que capta bien la intención incluso cuando las instrucciones son ambiguas. Sin embargo, a veces comete errores. Es el típico estilo sénior: avanza con confianza y puede pasar por alto los detalles. Además, su gran base de usuarios hace que su ecosistema de skills y plugins sea una ventaja importante. Si buscas el workflow que necesitas, probablemente alguien ya lo haya creado.

Codex no escribe código tan rápido ni con tanta soltura como Claude. Pero es preciso. Se toma más tiempo para pensar y el resultado deja menos cabos sueltos.

Lo interesante es que no se trata solo de una impresión mía. En una encuesta de Reddit con más de 500 participantes, el 65% prefirió Codex para el uso diario, mientras que en una revisión de código a ciegas el 67% consideró más limpio el código de Claude. En las comunidades internacionales también es habitual leer que «Claude destaca en la edición precisa y Codex en la refactorización amplia», y que «Codex es más lento, pero más exhaustivo en tareas complejas». Coincide casi por completo con mi experiencia.

Claude Fable 5: se han resuelto casi todas sus carencias

Claude Fable 5, lanzado en junio de 2026, me ha dejado muy satisfecho. La principal carencia del Claude anterior, es decir, que era «rápido, pero a veces cometía errores», prácticamente ha desaparecido.

Los números también lo confirman. Fable 5 obtuvo un 95% en SWE-bench Verified y un 80,3% en SWE-bench Pro. Opus 4.8, el modelo líder anterior, obtuvo un 69,2% en SWE-bench Pro, así que la mejora supera los 11 puntos porcentuales. En el difícil FrontierCode Diamond alcanzó el 29,3%, más del doble que el 13,4% de Opus. Stripe afirmó haber completado en un día con Fable 5 la migración de una base de código Ruby de 50 millones de líneas, un trabajo que habría requerido más de dos meses manualmente. Por supuesto, estos benchmarks se basan en el scaffolding propio de Anthropic y han recibido críticas por no usar un harness neutral, así que conviene interpretarlos como una tendencia y no como cifras absolutas.

GPT-5.6 Sol: un defecto fatal, el problema de los tokens, pero aun así sobresaliente

GPT-5.6 Sol, lanzado por OpenAI el 9 de julio, también es un modelo sobresaliente. Estableció un nuevo récord con 80 puntos en el Coding Agent Index de Artificial Analysis. Sin embargo, justo después del lanzamiento comenzaron a multiplicarse los informes de que «el límite de uso se consume a una velocidad absurda». A mí también me ocurrió y, al investigarlo, aparecen indicios bastante concretos.

  • El issue #32250 del repositorio de Codex muestra que, cuando un suscriptor Pro asignó una tarea breve a GPT-5.6 Sol Medium, el saldo del límite de cinco horas cayó del 87% al 76%: 11 puntos porcentuales de una sola vez. Después, incluso cada pregunta de seguimiento trivial sin llamadas a herramientas descontaba aproximadamente un punto porcentual. Se agotaba más rápido que el GPT-5.5 xhigh que usaba el mismo usuario.
  • El issue #31860 confirmó que la aplicación Codex utilizaba para Sol un contexto de 372K, aproximadamente el 35% de su especificación de 1.05M tokens. Cuando el contexto alcanzaba el 90%, se producía una compaction temprana, y es posible que este reprocesamiento acelerara aún más el consumo de tokens.
El límite de uso pierde 11 puntos porcentuales con una sola tarea breve
El límite de uso pierde 11 puntos porcentuales con una sola tarea breve

Finalmente, OpenAI reconoció que «había hecho demasiado fácil usar la configuración de máximo cómputo sin comunicar suficientemente sus consecuencias» y restableció el rate limit dos veces en 24 horas. Según explicó una persona de OpenAI, Sol Medium 5.6 no está al mismo nivel que 5.5 Medium; el valor predeterminado es Sol Low y xhigh debe reservarse para problemas realmente difíciles. En otras palabras, parece más un problema de UX, en el que la configuración de alto cómputo se usaba como si fuera la predeterminada, combinado con un bug de la aplicación, que una ineficiencia intrínseca del modelo por token. De hecho, OpenAI afirma que el max reasoning de Sol redujo un 54% los tokens de salida frente a modelos competidores.

Fue un defecto grave, pero el modelo en sí sigue siendo extraordinario. Si entiendes la configuración, la precisión de sus resultados continúa estando entre las mejores.

Ya no hace falta insistir en Claude

Hasta hace unos meses existía la sensación de que «para programar había que usar Claude sí o sí». Ya no lo creo. Ambos son excelentes. En Terminal-Bench 2.1, la combinación con Codex CLI ocupa el primer puesto con un 83,4%, mientras que Fable 5 lidera SWE-bench Pro con un 80,3%. Estamos en una época en la que el primer puesto cambia según el benchmark.

Por eso mi conclusión es que lo mejor es usar ambos. Pero si tuviera que elegir solo uno, elegiría Codex. Ya uso ChatGPT con frecuencia y una sola suscripción también cubre la generación de imágenes. Es la mejor opción al valorar la utilidad de la suscripción completa, no solo la de un agente de programación.

¿No acabaremos todos usando ambos?

Quiero añadir otra perspectiva. El consumo de tokens de los modelos recientes está aumentando de forma espectacular. Un análisis sostiene que la IA agéntica puede consumir hasta 1.000 veces más tokens que el uso habitual de un chatbot. Forbes y TechCrunch han llamado a este fenómeno «Tokenpocalypse» y han informado de que cada vez más usuarios agotan sus límites de suscripción antes de lo previsto. De hecho, la principal razón por la que la comunidad contrata también Codex es que «el límite de Claude se agota demasiado rápido».

Si el límite de una sola suscripción deja de ser suficiente, creo que al final todos convergeremos de forma natural hacia el uso simultáneo de dos suscripciones.

Usar ambos agentes juntos también mejora el rendimiento

Usar ambos no se debe únicamente al problema de los límites. Al probar la orquestación de IA, obtuve mejores resultados haciendo que interactuaran agentes distintos que conectando dos agentes iguales.

Esto también está respaldado por la investigación. El estudio X-MAS (arXiv 2505.16997) informa de que asignar distintos LLM a diferentes roles en un sistema multiagente mejora la precisión entre un 8% y un 47% frente a combinaciones homogéneas. Otro estudio (arXiv 2602.03794) concluyó que dos agentes diversos pueden igualar o superar a 16 agentes homogéneos.

La combinación que mejor me ha funcionado es esta: dejar que Claude haga el trabajo y que Codex revise el resultado. Es una estructura en la que un sénior rápido y atrevido produce el resultado y un revisor prudente y preciso lo filtra. Como sus características son distintas, detectan bien los puntos ciegos del otro.

Una estructura de colaboración en la que Claude escribe el código y Codex lo revisa
Una estructura de colaboración en la que Claude escribe el código y Codex lo revisa

Resumen

  • Claude tiene un estilo sénior, rápido y preciso; Codex es más lento, pero preciso. La valoración de la comunidad coincide.
  • Fable 5 ha resuelto la carencia de Claude (sus errores ocasionales), y GPT-5.6 Sol sigue siendo extraordinario pese a su problema de tokens.
  • Ya no hace falta insistir en Claude. Ambos son de primer nivel y lo mejor es usar los dos.
  • Si solo pudiera elegir uno, elegiría Codex por la utilidad de una suscripción que incluye ChatGPT y generación de imágenes.
  • Al observar la tendencia de consumo explosivo de tokens, ¿no acabaremos todos usando ambos?
  • Para la orquestación, la respuesta está en las combinaciones heterogéneas. La combinación que mejor funcionó fue que Claude creara y Codex revisara.

Material de referencia