No consigo decidirme entre Claude y Codex
Codex me da más margen de uso, mejores interfaces y una aplicación más cómoda. Claude aún termina mis grandes cambios multiagente en horas, no en todo el día.
En esta página
- ¿Por qué pago los dos? Cada uno es mejor en trabajos distintos
- ¿Qué hace mejor Codex? El frontend y el uso diario
- ¿Por qué termina Claude antes? Su gestor mantiene el foco
- ¿Por qué Sol termina más tarde si es más rápido? Codex crea más trabajo
- ¿Qué complica el uso de Claude? Los límites y la seguridad
- ¿Debo usar Claude o Codex? Depende del alcance
No consigo decidirme entre Claude y Codex porque cada plataforma gana en una parte distinta de mi trabajo. Codex me da más tiempo útil, controles más cómodos, explicaciones más claras y mejores resultados de frontend. Claude convierte mis planes multiagente en cambios terminados mucho antes, algo decisivo cuando una funcionalidad abarca varios sistemas.
| Parte del trabajo | Claude | Codex |
|---|---|---|
| Visión general de la arquitectura | Mi primera opción | Sólido, pero pierde el foco antes |
| Orquestación de funcionalidades grandes | Suele terminar primero | A menudo se convierte en una tarea mucho más larga |
| Implementación del frontend | Fiable, pero a menudo familiar | Mejor encaje, espaciado y criterio visual |
| Comunicación escrita | Fable entiende bien el sistema | Sol suele explicarlo con más claridad |
| Uso incluido | Fable se detiene al consumir la mitad de la cuota semanal | Los resets hacen que la cuota parezca mucho mayor |
| Interrupciones de seguridad | Más falsos positivos en mi trabajo | No es perfecto, pero está mejor calibrado para mis tareas |
| Flujo entre teléfono y ordenador | Cubre lo mismo, pero lo reparte entre varios modos | Más coherente en el uso diario |
La tabla explica por qué sigo sin decidirme. Codex gana en más aspectos concretos de la experiencia, pero Claude se impone en el trabajo con funcionalidades grandes que ocupa los bloques más largos de mi jornada. En mi uso, ninguno de los dos modelos es claramente más inteligente. Son los sistemas que los rodean los que deciden cuál abro.
¿Por qué pago los dos? Cada uno es mejor en trabajos distintos
Pago los dos porque Claude encaja con mi forma de trabajar en funcionalidades grandes, mientras que Codex es el producto que prefiero para muchas tareas más pequeñas. Renunciar a cualquiera de ellos significaría perder algo que uso todas las semanas. Es una respuesta molesta cuando representan dos de mis mayores gastos recurrentes de software.
Uso asistentes de programación desde los primeros tiempos de GitHub Copilot, incluida la época en que programar con ChatGPT consistía en copiar fragmentos desde un chat del navegador. Durante años mantuve una configuración estable: Claude Max 20x para programar y un plan más barato de ChatGPT para investigar. Suelo investigar antes de tomar una decisión, tanto técnica como personal, y la experiencia de investigación de OpenAI siempre me ha resultado más adecuada.
GPT-5.6 alteró ese equilibrio. Sol tiene más o menos la misma capacidad que Fable 5 en mi trabajo, así que pasé al plan Pro 20x de OpenAI y mantuve Claude Max 20x. [4] [9] Mi uso es tan intenso que alguna vez he necesitado una segunda suscripción Claude Max. Si un plan consume su cuota más rápido o se detiene antes, cambia la cantidad de trabajo que puedo terminar ese día.
En la práctica, la cuota de OpenAI suele parecer más generosa. Vi tres resets globales más entre el 26 de agosto y el 1 de septiembre de 2026, además de la campaña de resets que cubrí en agosto. Mi impresión es que estas celebraciones también sirven de marketing para un modelo que puede consumir el límite de uso con rapidez. El efecto para mí es más sencillo: los resets aumentaron la capacidad de mi cuenta, y eso hace que abandonar Codex sea difícil.
¿Qué hace mejor Codex? El frontend y el uso diario
Codex funciona mejor en las partes del trabajo diario que noto de inmediato: el diseño de frontend al primer intento, las explicaciones escritas, el control remoto y la forma en que los límites interrumpen una tarea. Resulta más cómodo para resolver una tarea acotada tras otra, aunque Sol no siempre escriba mejor código backend.
La diferencia de calidad más clara aparece en el frontend. GPT-5.6 suele acertar antes con el espaciado, la alineación y la jerarquía visual. OpenAI afirma que el modelo mejora la estética del frontend y el criterio de diseño. [1] Eso respalda la capacidad, pero no compara Sol con Fable 5. La comparación procede de mi experiencia: Codex tiene más probabilidades de crear un diseño que encaje con el producto existente, mientras que Claude suele devolver una plantilla conocida si no describo la dirección visual con detalle.
También me resulta más fácil leer a Sol. Normalmente explica una decisión con palabras corrientes, aunque el trabajo de fondo sea técnico. Fable me da una mejor visión de la arquitectura, pero su prosa todavía puede volverse más difícil de seguir. Esta diferencia importa porque el agente principal dedica la mayor parte del tiempo a hablar de decisiones y comunicar avances, no solo a escribir código.
Esa facilidad también se nota cuando me aparto del escritorio. OpenAI documenta un acceso remoto que permite seguir desde un teléfono una conversación activa de Codex en un Mac o un equipo Windows conectado. Desde el teléfono puedo dirigir el trabajo y revisar aprobaciones, diffs y la salida del terminal. [7] Codex también ofrece tareas aisladas en la nube, aunque yo utilizo sobre todo la conexión con el equipo. [21]
Claude cubre las mismas necesidades mediante varios modos. Permite continuar sesiones locales desde un teléfono, iniciar trabajo de escritorio mediante Dispatch y ejecutar sesiones en la nube después de apagar el ordenador. [17] [18] [22] Ambas plataformas cubren los usos principales, pero Codex los presenta de una forma que me resulta más fácil de seguir. Claude reparte tareas parecidas entre Remote Control, Dispatch, las sesiones locales y las sesiones en la nube.
Los límites de uso acentúan la diferencia. La documentación actual de OpenAI indica que los mensajes locales y las tareas en la nube del plan Pro 20x comparten una ventana de cinco horas, y que también pueden aplicarse límites semanales. Por tanto, el plan no se limita a una cuota semanal. También explica que un turno activo puede continuar después de que la cuenta llegue al límite, sujeto a controles de uso razonable. [4] Claude ya puede esperar y reanudar una tarea interrumpida cuando se restablece el límite de la sesión. [20] En mi experiencia, alcanzar el límite todavía supone una interrupción brusca en el peor momento. Las reglas exactas de los resets me importan menos que la posibilidad de llevar el cambio de hoy hasta un punto seguro.
¿Por qué termina Claude antes? Su gestor mantiene el foco
Claude termina antes mis funcionalidades grandes porque su orquestación encaja con mi forma de dividir el desarrollo de software. Un modelo capaz conserva el plan, toma decisiones y habla conmigo, mientras agentes separados investigan, implementan, prueban y auditan. En mis proyectos, Claude consigue que ese agente principal mantenga el foco en la coordinación con mayor constancia.
Anthropic llama a este patrón general «orchestrator-workers»: un modelo central divide una tarea, la delega y reúne los resultados. OpenAI documenta la misma idea básica como una orquestación dirigida por un gestor. [14] [15] El nombre importa menos que la separación: el gestor conserva el objetivo y toma las decisiones, mientras que los demás agentes reciben trabajos acotados y devuelven pruebas.
Los flujos de trabajo dinámicos de Claude Code hacen que esa división sea especialmente explícita. Claude escribe un script de orquestación, inicia agentes en paralelo y deja que el entorno gestione las ramificaciones y los resultados intermedios. Anthropic afirma que una ejecución puede iniciar decenas o cientos de agentes a lo largo del tiempo, con hasta 16 trabajando a la vez si la máquina tiene suficientes recursos de CPU. [11] [12] Yo no necesito cientos, pero valoro que la conversación principal no tenga que absorber cada archivo leído, cada resultado de un comando y cada desvío de depuración.
En mi configuración, Fable 5 actúa como agente principal. Acordamos la arquitectura y redacta el plan; después, los agentes Opus implementan partes acotadas mientras otros las prueban y revisan. Fable decide qué hallazgos merecen trabajo y me consulta cuando un cambio modificaría el plan. Explico los detalles de implementación en mi flujo de trabajo de Opus 5 basado en planificar primero. Lo importante aquí es que Fable sigue siendo responsable del resultado completo.
gestor
- Fable 5 conserva el objetivo, el plan, las decisiones y la conversación con el usuario
agentes
- agentes de investigación analizan el repositorio y las preguntas pendientes
- agentes Opus implementan partes acotadas
- agentes de prueba y auditoría devuelven pruebas y hallazgos
decisión
- revisión del gestor acepta, rechaza, redirige o consulta al usuario
- funcionalidad terminada plan cumplido y comprobaciones superadas
En Claude Code, Fable y Opus admiten una ventana de contexto de un millón de tokens, pero la mayor ventaja consiste en mantener los detalles de los agentes fuera de la conversación del gestor. [13] Incluso una ventana grande acaba llenándose si cada lectura de archivos, registro de agentes y resultado de pruebas entra en ella. Los flujos de trabajo dinámicos mantienen esos datos separados, así que el contexto restante del gestor sigue siendo útil.
OpenAI describe la misma separación para Codex: el hilo principal debería conservar los requisitos y las decisiones, mientras que los agentes se ocupan de la exploración, las pruebas y los registros. [5] Por eso esperaba poder trasladar mi flujo de trabajo. Sin embargo, en mis ejecuciones, el agente principal de Codex no mantiene su papel exclusivo de gestor con tanta constancia como el de Claude.
¿Por qué Sol termina más tarde si es más rápido? Codex crea más trabajo
Sol puede generar texto más rápido y aun así terminar más tarde una funcionalidad grande porque la velocidad de salida es solo una parte del trabajo. La mayor parte del tiempo se va en decidir, utilizar herramientas y coordinar agentes. Esa velocidad no ayuda si Codex crea tareas adicionales o reabre decisiones ya cerradas.
Artificial Analysis midió 77,1 tokens de salida por segundo para GPT-5.6 Sol y 66,9 para Fable 5 en las configuraciones de máximo esfuerzo comparadas el 1 de septiembre de 2026. [3] Esa ventaja de velocidad cercana al 15 % coincide con la sensación de ver responder a Sol. No coincide con mis resultados de principio a fin porque Codex suele crearse más trabajo cuando la implementación original ya está casi terminada.
El alcance adicional consume la ventaja de velocidad de Sol
Gran parte del tiempo adicional procede de la sobreingeniería. Tengo que indicar con mucha claridad que Codex debe conservar la arquitectura existente, informar sobre hallazgos ajenos a la tarea sin corregirlos y detenerse cuando se cumplen los criterios de aceptación. De lo contrario, Sol puede añadir capas defensivas, nuevos helpers o todo un subsistema para un problema que solo necesitaba un cambio concreto. Medí la misma tendencia durante las auditorías: Sol encontró muchos más problemas posibles que Fable, pero, tras revisarlos, la mayoría no eran errores reales.
La coordinación añade otro retraso. En las ejecuciones de Codex Ultra que he utilizado, al agente principal le costaba mantener su papel exclusivo de gestor. Delegaba trabajo, pero después seguía inspeccionando archivos, haciendo cambios o reabriendo decisiones mientras sus agentes realizaban sus propias tareas. OpenAI describe Ultra como el máximo nivel de razonamiento con delegación automática y señala que el hilo principal recopila los resultados de los demás agentes. [5] [19] No promete que el hilo principal se mantenga al margen de la implementación. Mis intentos de imponer ese límite han reducido el problema, pero no lo han eliminado.
Más contexto y menos esfuerzo no resuelven el problema
Las ejecuciones largas exigen más de la ventana de contexto, pero ampliarla no ha resuelto la lentitud. Al principio, el estado de Codex mostraba 272K tokens, así que cambié model_context_window a un millón en la configuración. OpenAI documenta este ajuste y el propio Sol admite hasta 1,05 millones de tokens. [6] [2] La cifra de 272K describe lo que mostraba mi configuración, no un valor predeterminado universal establecido por OpenAI. La ventana más grande ayuda, pero Codex sigue llenándola con rapidez durante una ejecución multiagente larga. Cuando comienza la compactación, tengo menos confianza en que una restricción inicial conserve el mismo peso seis horas después.
El contexto largo tampoco es gratis. En la API de OpenAI, los prompts que superan los 272K se cobran al doble de la tarifa de entrada y a 1,5 veces la tarifa de salida para toda la solicitud. [2] OpenAI no afirma que una cuota de ChatGPT Pro utilice exactamente esos multiplicadores, así que no aplico esa fórmula al medidor de mi suscripción. Sí muestra por qué ampliar una ventana no equivale a hacer eficiente una tarea larga.
Reducir el ajuste de esfuerzo de Sol tampoco me ha resuelto el problema. Codex acelera un poco, pero pierde mucha más calidad de planificación y revisión de la que gana en velocidad. Definir un objetivo tampoco lo arregla. OpenAI presenta los objetivos como una forma de seguir trabajando entre varios turnos hasta alcanzar una condición de parada verificable, justo lo que busco. [8] En mis ejecuciones largas, el objetivo mantiene activo a Codex, pero no lo ayuda a terminar antes.
¿Qué complica el uso de Claude? Los límites y la seguridad
La ventaja de Claude en la orquestación viene acompañada de límites más estrictos y más interrupciones de seguridad por falsos positivos. Su flujo de trabajo para funcionalidades grandes encaja mejor conmigo, pero dedico más tiempo a administrar qué modelo aún puede ejecutarse y a recuperarme cuando una comprobación de seguridad interrumpe el trabajo habitual.
El límite de Fable es la frustración más directa. Pago Max 20x, pero Fable solo puede utilizar la mitad de la cuota semanal incluida. [10] Entiendo que un proveedor limite con mayor rigor su modelo más caro. Eso no hace que la interrupción encaje con mi trabajo. Una funcionalidad grande no pierde importancia cuando se agota esa cuota más reducida.
Las interrupciones de seguridad son peores porque rompen la concentración sin hacer avanzar el trabajo. Anthropic reconoció que Fable 5 estaba marcando solicitudes inofensivas durante tareas rutinarias de programación y depuración después de su lanzamiento y retirada temporal en junio de 2026. [16] Ahora veo menos interrupciones que al principio, pero los filtros todavía se activan con más frecuencia de la que espero en tareas inofensivas.
OpenAI también advierte que las protecciones de GPT-5.6 pueden intervenir ante solicitudes legítimas. [1] Codex no está libre de falsos positivos. En mis proyectos, sus clasificadores están mejor calibrados: normalmente puedo entender por qué una solicitud de doble uso provocó una pausa, y es menos probable que el trabajo habitual de desarrollo provoque una interrupción. Esta comparación procede de mis proyectos, no de tasas de error publicadas sobre los filtros.
Estas quejas no pesan más que la ventaja de la orquestación. Explican por qué sigo mirando hacia Codex incluso después de que Claude gane otra implementación grande.
¿Debo usar Claude o Codex? Depende del alcance
Elijo Claude cuando necesito investigar el repositorio, decidir la arquitectura, coordinar varios agentes y realizar una auditoría independiente. Elijo Codex para cambios acotados y frontend, o cuando valoro una interfaz más limpia y más margen de uso en la práctica. Para una investigación amplia, sigo empezando con ChatGPT antes que con cualquiera de los dos harness de programación.
Esta división se basa en el flujo de trabajo, no en la idea de que Fable 5 sea más inteligente que Sol. Si diera a ambos modelos una tarea pequeña y clara, confiaría en cualquiera de los dos para producir código sólido. La diferencia aparece cuando una funcionalidad debe dividirse en varias tareas dependientes y una sola conversación tiene que conservar el motivo de todas ellas.
Codex se convertiría en mi opción predeterminada si su gestor pudiera mantenerse al margen de la implementación, controlar el alcance con mayor fiabilidad, utilizar el contexto largo de forma más eficiente y llevar una ejecución extensa hasta una parada verificada. Claude sería la suscripción única más fácil de elegir si la cuota incluida de Fable fuera menos restrictiva y el trabajo habitual de programación activara menos bloqueos de seguridad.
Por ahora, sigo pagando los dos. Claude es la plataforma en la que inicio una funcionalidad grande porque su orquestación alcanza el estado final que pedí. Codex es el producto que sigo queriendo usar porque todo lo demás resulta más sencillo. Ninguna de las dos plataformas reúne todavía la orquestación de Claude y la experiencia de producto de Codex en un solo flujo de trabajo.
Fuentes
- Model guidance
- GPT-5.6 Sol Model
- GPT-5.6 Sol (max) vs Claude Fable 5
- Pricing
- Subagents
- Configuration Reference
- Remote connections
- Follow a goal
- What is the Max plan?
- Claude Fable 5 on your plan
- Introducing dynamic workflows in Claude Code
- Orchestrate subagents at scale with dynamic workflows
- How large is the context window on paid Claude plans?
- Building effective agents
- Orchestration and handoffs
- Redeploying Fable 5
- Continue local sessions from any device with Remote Control
- Desktop application
- Models
- Error reference
- Codex cloud
- Assign tasks from anywhere in Claude Cowork