Noticias techJul 2026 · 2 min de lectura

Codex vs Claude Code: una comparación honesta para programar con agentes

SWE-bench dice que están prácticamente empatados. Las diferencias reales son el costo, el modelo de autonomía y para qué brilla cada uno. Un reporte de campo tras usar ambos en producción.

Raudin Moreno
Raudin MorenoIngeniero de Software

A mediados de 2026 la pregunta de "cuál agente de código" se redujo a dos respuestas serias para la mayoría: OpenAI Codex y Anthropic Claude Code. Ambos son maduros, ambos manejan una terminal y un IDE, ambos hablan MCP. La comparación honesta no es quién es más inteligente, sino costo, autonomía y encaje.

Los benchmarks están más cerca que los titulares

En SWE-bench Verified quedan dentro del margen de ruido, alrededor de 88.7 contra 88.6 por ciento. La señal interesante está donde divergen en pruebas más duras: Claude suele liderar SWE-bench Pro, la variante multi-archivo de largo alcance, por unos diez puntos, mientras que Codex suele liderar Terminal-Bench por unos pocos. Otro benchmark, otro ganador. Cualquier número único que afirme superioridad categórica merece sospecha.

La brecha real es el costo, no la capacidad

En la misma tarea, una conversión de Figma a código medida en una comparación, Codex usó unos 1.5 millones de tokens frente a unos 6.2 millones de Claude Code, casi cuatro veces menos. Ese solo dato explica gran parte del sentimiento del gremio: Codex es más barato y predecible, mientras que la queja más común sobre Claude Code es que consume tokens rápido y choca con los límites de uso.

Dos modelos distintos de autonomía

Codex se apoya en sandboxes en la nube aislados: le pasas un issue de GitHub, trabaja solo en una VM precargada y devuelve un PR que revisas. Claude Code corre subagentes en paralelo dentro de una sesión, planifica antes de editar y carga un contexto efectivo mayor, cerca de un millón de tokens frente a unos 400K en el producto Codex. Hasta difieren en la configuración, AGENTS.md para Codex y CLAUDE.md para Claude Code, aunque ambos leen los mismos servidores MCP.

El marco práctico es calidad contra fiabilidad. Claude Code suele ganar las pruebas ciegas de calidad y escribe código más completo y mejor documentado, acorde al estilo existente. Codex suele aparecer, terminar y no cortarte a mitad de una tarea. Ninguna de esas es una frase de marketing, son las dos formas de fallar que sientes a diario.

El patrón al que muchos equipos llegan no es uno u otro: Claude Code para diagnosticar, planificar y criticar el enfoque, Codex para redactar la implementación y cubrir los casos repetitivos. Toma las encuestas de sentimiento con pinzas, una consulta muy compartida de 500 desarrolladores se inclinó hacia Codex, pero eso es orientativo, no dogma. Elige según tu propia carga de trabajo y tu propia factura.

Volver al blog© 2026 Raudin Moreno