Claude Code vs Codex CLI vs Muse Code en 2026
Índice de contenidos
- Puntos clave
- En qué se diferencian los tres, más allá de la puntuación
- Qué dice de verdad la tabla de Terminal-Bench
- Qué trae cada uno: MCP, hooks, subagentes y permisos
- Cuánto cuesta cada uno de verdad
- Quién los usa: los datos de adopción
- Cuál elegir según tu perfil
- Preguntas frecuentes
- ¿Es cierto que Codex CLI supera a Claude Code en Terminal-Bench?
- ¿Merece la pena el nivel contributor de Muse Code?
- ¿Puedo usar los tres a la vez en el mismo repositorio?
- Conclusión
- Fuentes
Los tres son agentes de terminal, pero apuestan por cosas distintas. En el Terminal-Bench 4.0 oficial, publicado el 28 de agosto de 2026, Claude Code con Opus 5 resuelve el 51,8 % de los intentos a 18,09 dólares cada uno, y Codex con GPT-5.6 Sol el 37,3 % a 7,70. Muse Code no figura en ninguna tabla.
Elegir agente de terminal en 2026 se ha convertido en una decisión de tres. Claude Code y el Codex CLI de OpenAI llevan meses repartiéndose el terreno, y desde el 5 de agosto Meta compite con Muse Code en fase beta. Este artículo compara los tres con los datos que publican sus fabricantes y con la tabla oficial de Terminal-Bench, no con los resúmenes que circulan por ahí.
Puntos clave
- Las tres herramientas ya traen MCP, hooks, subagentes, cortafuegos del sistema operativo y modos de aprobación. La lista de funciones dejó de ser el criterio de elección.
- La comparación que todo el mundo repite (89,5 % frente a 89,1 % en Terminal-Bench 2.1) no aparece en la tabla oficial. Ahí arriba hay un 83,82 % y un 83,15 %, con modelos distintos.
- Terminal-Bench 2.1 salió el 6 de mayo de 2026. La versión vigente es la 4.0, del 28 de agosto, y ahí la diferencia es de 14,5 puntos, no de medio punto.
- Esa ventaja se paga: 18,09 dólares por intento frente a 7,70, y unos 80 minutos de reloj frente a 40.
- Muse Code no ha presentado resultados en ninguna versión del banco de pruebas. Lo que ofrece es precio: 1,25 y 4,25 dólares por millón de tokens.
- En el plan Pro de 20 dólares, Claude Code no arranca con Opus 5 sino con Sonnet 5, que es la fila con peor relación entre acierto y gasto de toda la tabla.
En qué se diferencian los tres, más allá de la puntuación
Las tres herramientas hacen lo mismo sobre el papel: leen tu repositorio, editan ficheros, ejecutan órdenes y te devuelven un cambio revisable. La diferencia está en qué esperan de ti mientras trabajan.
El Codex CLI está pensado para delegar y revisar. Su documentación describe la orden /permissions como la forma de "choose when Codex can edit files or run commands without asking", y la pantalla de bienvenida que aparece en esos mismos documentos arranca con gpt-5.6-sol en esfuerzo medium. Es rápido, es barato por tarea y el flujo natural es lanzarlo, irte y leer el diff.
Claude Code está construido como andamiaje para trabajos largos. La documentación lo define como "an agentic coding tool that reads your codebase, edits files, runs commands, and integrates with your development tools", y alrededor de esa frase hay un ecosistema de ficheros CLAUDE.md, skills, hooks, subagentes que se coordinan y un SDK para montar agentes propios. Gasta más tiempo y más dinero por tarea, y a cambio termina tareas que las otras dos abandonan.
Muse Code llega apuntando a repositorios grandes. Meta lo presenta como un agente donde "Multiple agents coordinate on every task. Workers in parallel, reviewers in the background", con subagentes que trabajan cada uno en su propio árbol de trabajo de Git para no tocar tu copia. Es la propuesta más joven y la más barata.
Qué dice de verdad la tabla de Terminal-Bench
Aquí conviene detenerse, porque hay una cifra que se ha propagado sin fuente. La comparación que aparece en decenas de artículos es Codex CLI al 89,5 % y Claude Code al 89,1 % en Terminal-Bench 2.1. Consultamos los datos que sirve la propia web del banco de pruebas y esos dos números no existen en la tabla oficial de la 2.1. Tampoco existe el 86,7 % que circula asociado a Opus 5.
Lo que hay realmente en Terminal-Bench 2.1, sobre 445 intentos (89 tareas por cinco pasadas cada una):
| Puesto | Agente | Modelo | Acierto |
|---|---|---|---|
| 1 | Claude Code | Fable 5 | 83,82 % |
| 2 | Codex | GPT-5.5 | 83,15 % |
| 3 | Terminus 2 | Fable 5 | 80,45 % |
| 5 | Claude Code | Opus 4.8 | 78,88 % |
| 8 | mini-SWE-agent | Muse Spark 1.1 | 76,18 % |
No hay ninguna fila de Opus 5 en la 2.1. La diferencia entre los dos primeros es de 0,67 puntos, dentro de sus propios márgenes de error declarados.
Hay un problema añadido con citar la 2.1 a estas alturas: se publicó el 6 de mayo de 2026 y desde entonces han salido la 3.0 y la 4.0. El equipo del banco de pruebas explica por qué van retirando tareas: "We considered a task ‘saturated’ when all classes within all families of the latest generation of models solve it 5/5 times. Such a task no longer meaningfully differentiates between models". Traducido: los porcentajes altos de la 2.1 miden en parte tareas que ya no distinguen nada.
En la versión vigente, la 4.0 del 28 de agosto de 2026, sobre 330 intentos, el retrato cambia por completo.
| Puesto | Agente | Modelo | Acierto | Coste medio por intento | Duración media |
|---|---|---|---|---|---|
| 1 | Claude Code | Opus 5 | 51,82 % | 18,09 $ | 80 min |
| 2 | Claude Code | Fable 5 | 44,55 % | 22,02 $ | 70 min |
| 3 | Claude Code | GLM-5.3 | 41,82 % | 8,27 $ | 97 min |
| 4 | Codex | GPT-5.6 Sol | 37,27 % | 7,70 $ | 40 min |
| 6 | Codex | GPT-5.6 Terra | 21,52 % | 5,25 $ | 42 min |
| 9 | Claude Code | Sonnet 5 | 12,42 % | 29,10 $ | 108 min |
El coste por intento no viene dado en la tabla: lo calculamos dividiendo el coste total de cada ejecución entre el número de intentos, dos campos que la propia tabla publica. Con tareas más duras, la distancia entre el primero y el cuarto pasa de medio punto a 14,5, y el precio de esa distancia queda a la vista.
La última fila merece atención aparte. Sonnet 5 acierta el 12,42 % y es a la vez lo más caro por intento de toda la lista. El anuncio de la versión 4.0 lo atribuye al consumo: 21.600 millones de tokens en su ejecución frente a 6.500 millones de Opus 5.
Muse Code no aparece en ninguna de las cuatro tablas. Ni en la 2.0, ni en la 2.1, ni en la 3.0, ni en la 4.0. La única presencia de Meta es el modelo Muse Spark 1.1 ejecutado bajo otro agente, mini-SWE-agent, en la 2.1. Quien te diga que Muse Code puntúa X en Terminal-Bench se lo está inventando o lo ha leído de alguien que se lo inventó.
Qué trae cada uno: MCP, hooks, subagentes y permisos
Esta es la parte que más ha cambiado en 2026 y la que menos se cuenta. Hace un año la comparación de extensibilidad tenía sentido porque había huecos evidentes. Ahora los tres marcan casi todas las casillas.
| Capacidad | Claude Code | Codex CLI | Muse Code |
|---|---|---|---|
| Servidores MCP | Sí | Sí (codex mcp) |
Sí |
| Hooks de proyecto | Sí | Sí | Sí |
| Subagentes en paralelo | Sí | Sí | Sí, en árboles de Git aislados |
| Cortafuegos del sistema operativo | Sí | Sí | Sí, activo desde el primer arranque |
| Modos de aprobación | Sí | Sí (/permissions) |
Sí |
| Fichero de instrucciones del repositorio | CLAUDE.md |
AGENTS.md |
Reglas del espacio de trabajo |
| Registro auditable de acciones | Sí | Sí | Registro de eventos reproducible |
| Modo no interactivo para integración continua | Sí | Sí | Sí |
| Superficies fuera de la terminal | Terminal, VS Code, JetBrains, escritorio, web | Terminal, IDE, aplicaciones de escritorio | Solo terminal |
| Sistemas operativos | macOS, Linux, Windows | macOS, Linux, Windows | macOS y Linux |
Donde sí quedan diferencias reales es en los extremos de la tabla. Claude Code es el único que vive fuera de la terminal con la misma configuración: el mismo CLAUDE.md y los mismos servidores MCP valen en el editor, en la aplicación de escritorio y en el navegador. Muse Code, en cambio, todavía no existe en Windows.
Si vas a montar tu propia integración, la pieza común a los tres es el protocolo MCP, y ahí tenemos una guía para construir un servidor MCP propio que funciona igual con cualquiera de ellos.
Cuánto cuesta cada uno de verdad
Los precios de abajo son los que publican los fabricantes en sus propias páginas, consultadas el 30 de agosto de 2026. Son cifras del vendedor, no medidas nuestras, y lo que pagues depende mucho de cuánto acierte la caché.
| Modelo | Entrada | Entrada en caché | Salida |
|---|---|---|---|
| Opus 5 (Anthropic) | 5,00 $ | 0,50 $ | 25,00 $ |
| Sonnet 5 (Anthropic) | 2,00 $ | 0,20 $ | 10,00 $ |
| GPT-5.6 Sol (OpenAI, contexto corto) | 4,00 $ | 0,40 $ | 20,00 $ |
| GPT-5.6 Terra (OpenAI, contexto corto) | 2,00 $ | 0,20 $ | 12,00 $ |
| muse-spark-1.2 (Meta) | 1,25 $ | 0,15 $ | 4,25 $ |
| muse-spark-1.2-contributor (Meta) | 0,10 $ | 0,002 $ | 0,20 $ |
Todos los importes son por millón de tokens. Meta ofrece dos versiones del mismo modelo con una diferencia de precio de doce veces en la entrada y de veintiuna en la salida. La etiqueta que las separa en la página de Meta es literal: muse-spark-1.2-contributor está marcado como "Used to improve our products" y muse-spark-1.2 como "Not used to improve our products". El descuento se paga con tu código.
Hay un detalle de la suscripción de Anthropic que conviene tener presente antes de comparar tarifas de lista. Claude Code entra en el plan Pro de 20 dólares al mes, pero la documentación explica que el modelo por defecto depende del plan: Max, Team Premium y la API arrancan con Opus 5, mientras que Pro y Team Standard arrancan con Sonnet 5. Es decir, el plan barato no te da el modelo que encabeza la tabla, sino el que peor relación entre acierto y gasto obtuvo en ella.
Quién los usa: los datos de adopción
La encuesta Developer Ecosystem Survey de JetBrains, en su décima edición, es la referencia menos interesada del sector. Se describe como "a large-scale, globally representative survey of more than 15,000 professional developers worldwide", con trabajo de campo entre mayo y julio de 2026, cuotas por región, ocho idiomas y reponderación estadística posterior.
Sus cifras para ese periodo:
- Claude Code: 39 % de los desarrolladores profesionales del mundo, y 47 % en Estados Unidos.
- GitHub Copilot: 21 %, frente al 29 % de un año antes.
- Codex: 16 %, con un crecimiento que JetBrains describe como "adoption growth of roughly 5x, from just 3% in January 2026".
- Cursor: 12 %, desde el 18 % de enero.
- OpenCode: 7 %. Google Antigravity: 6 %.
El titular del estudio es que "90% of professional developers were using AI coding agents at work at least weekly", con un 68 % de uso diario. Muse Code no aparece en el estudio por una razón sencilla: el trabajo de campo se cerró antes de su lanzamiento el 5 de agosto.
Cuál elegir según tu perfil
Después de todo lo anterior, la recomendación se puede dar sin ambigüedad.
Si delegas tareas acotadas y revisas diffs, el Codex CLI. Termina en la mitad de tiempo, cuesta menos de la mitad por intento y su flujo está diseñado para eso. Tenemos una guía dedicada a el Codex CLI de OpenAI si vienes de cero.
Si el trabajo es largo, multipaso y con reglas propias, Claude Code. Los 14,5 puntos de ventaja en la versión 4.0 del banco de pruebas se notan justo en las tareas que las demás abandonan a medias, y el andamiaje de hooks, subagentes y CLAUDE.md es el más maduro de los tres. Ahora bien, presupuesta en consecuencia y no lo contrates en el plan de 20 dólares esperando Opus 5.
Si te duele la factura y tu repositorio es enorme, prueba Muse Code. Cuesta una fracción de los otros dos y su diseño de subagentes en árboles de Git aislados va justo en esa dirección. Tenlo en cuenta como lo que es: una beta sin ningún resultado independiente publicado. La analizamos en detalle en Muse Code, el agente de terminal de Meta.
Si lo que buscas es un agente dentro del editor y no en la terminal, esta comparativa no es la tuya. La que necesitas es Claude Code frente a Cursor y GitHub Copilot, que mide el mismo trabajo desde el otro lado.
Preguntas frecuentes
¿Es cierto que Codex CLI supera a Claude Code en Terminal-Bench?
En la tabla oficial vigente, no. En Terminal-Bench 4.0, Claude Code con Opus 5 marca 51,82 % y Codex con GPT-5.6 Sol marca 37,27 %. La idea contraria viene de citas a la versión 2.1, donde los dos primeros puestos están separados por 0,67 puntos y corresponden a modelos anteriores.
¿Merece la pena el nivel contributor de Muse Code?
Depende de qué código le des. Meta lo etiqueta explícitamente como datos que usa para mejorar sus productos, y a cambio cobra 0,10 dólares por millón de tokens de entrada en lugar de 1,25. Para experimentos personales o proyectos abiertos, la cuenta sale. Para código de un cliente bajo acuerdo de confidencialidad, no.
¿Puedo usar los tres a la vez en el mismo repositorio?
Sí, y no es raro hacerlo. Los tres leen su propio fichero de instrucciones (CLAUDE.md, AGENTS.md y las reglas del espacio de trabajo de Muse Code), así que no se pisan. El conflicto llega con Git: si lanzas varios agentes a la vez sobre la misma rama acabarás resolviendo conflictos a mano, que es exactamente el problema que Muse Code intenta evitar con árboles de trabajo separados.
Conclusión
La conclusión honesta de 2026 es que la lista de funciones ya no decide nada: MCP, hooks, subagentes, aislamiento y permisos están en los tres. Lo que decide es qué modelo trae de fábrica tu plan, cuánto estás dispuesto a pagar por tarea terminada y cuánta prisa tienes. Claude Code compra acierto con dinero y con reloj, el Codex CLI compra velocidad y previsibilidad, y Muse Code compra precio a costa de no tener todavía una sola medición independiente que enseñar. Y antes de repetir cualquier porcentaje sobre estas herramientas, ábrelo en la tabla original: el que más se cita ahora mismo no está ahí. La versión en inglés de este artículo está en Claude Code vs Codex CLI vs Muse Code in 2026.
Fuentes
- Terminal-Bench, tabla oficial de resultados
- Terminal-Bench 2.1, anuncio de la versión
- Terminal-Bench 4.0, anuncio de la versión
- Anthropic, precios de Claude y Claude Code
- OpenAI, precios de la API
- Meta, producto y precios de Muse Code
- Documentación de Claude Code, visión general
- Documentación de Claude Code, modelo por defecto
- OpenAI, documentación del Codex CLI
- JetBrains Research, adopción de agentes de programación en 2026