Meta publicó Muse Code en beta el 5 de agosto de 2026 y la pregunta que importa a quien ya vive dentro de Claude Code o de Codex CLI es muy concreta: qué hay aquí que no tenga ya. Este artículo repasa lo que Meta afirma, lo que sus propias gráficas dicen, lo que cuesta de verdad una sesión y lo que todavía falta en la beta.

Puntos clave

  • Lo firma Meta Superintelligence Labs y funciona con Muse Spark 1.2, un modelo propietario que solo vive en la nube de Meta.
  • Meta entrenó el modelo junto al agente, no por separado: dice haber usado trayectorias del propio arnés como datos de entrenamiento.
  • Los subagentes no nacen y mueren con cada tarea: permanecen activos durante toda la sesión.
  • Cada llamada al modelo, cada ejecución de herramienta, cada aprobación y cada edición se añaden a un registro local de eventos, y de ahí sale tanto la auditoría como el reinicio tras una caída.
  • El precio publicado el 30 de agosto de 2026 es de 1,25 $ por millón de tokens de entrada y 4,25 $ de salida, con un segundo nivel muchísimo más barato que se paga con tus datos.

Qué es Muse Code y quién lo firma

Muse Code es un agente de programación que vive en el terminal. La metaetiqueta de autoría del anuncio y su JSON-LD atribuyen la publicación a Meta Superintelligence Labs, la unidad que Meta montó en 2026 para concentrar su trabajo de modelos. La frase con la que abre el anuncio no deja lugar a interpretación: "We’re excited to release Muse Code (beta), a terminal coding agent powered by Muse Spark 1.2, our newest model."

El encaje mental es sencillo si ya usas Codex CLI o Claude Code: mismo formato, mismo sitio, misma clase de tarea. Meta lo posiciona para repositorios grandes, planificando cambios, escribiendo el código y validando el resultado. Muse Spark 1.2 está disponible tanto dentro de Muse Code como en la Meta Model API, y su ventana de contexto es de un millón de tokens.

Qué significa que el modelo se entrenara junto al agente

Esta es la afirmación diferencial y merece leerse despacio. Meta no dice que cogiera un modelo bueno y le construyera un arnés encima; dice que entrenó las dos cosas a la vez. El texto habla de trayectorias del arnés filtradas por muestreo con rechazo y de optimizaciones de receta para objetivos, compactación de contexto y subagentes, además de integrar el conjunto de herramientas de Muse Code en el entrenamiento para maximizar la compatibilidad con el arnés.

¿Importa? Sí, pero no como argumento de venta. Importa como sesgo de medición. Un modelo entrenado contra un arnés concreto rendirá mejor en ese arnés que un modelo que lo ve por primera vez, y Meta mide a sus rivales precisamente dentro de su propio marco de evaluación. Hay que reconocérselo, porque lo admite por escrito en el PDF de metodología: "We note that our evaluation setup (e.g., agent tools and system prompts) may not be specifically tuned for proprietary third-party models. Therefore, the results may not reflect these models’ best performance when used in environments tailored to their specific strengths."

Esa advertencia hace más interesante el resultado, no menos. Meta juega en casa, con el modelo entrenado para la casa, y aun así sus propias gráficas colocan a Opus 5 por delante en los tres bancos de pruebas que publica.

Los números que publica Meta

Conviene decir algo antes de la tabla: las cifras no aparecen como texto en el anuncio. Están únicamente como etiquetas dentro de tres gráficas de barras en formato PNG, lo que explica que la cobertura de prensa las haya reproducido con errores. Estos son los valores leídos directamente de esas imágenes, transcritos enteros y sin recortar la lista de modelos.

Modelo (agente con el que se midió) Terminal-Bench 2.1 (ejecución de Meta) DeepSWE 1.1 Meta Internal Coding Bench
Opus 5 (Claude Code) 86,7 % 65,0 % 79,4 %
Muse Spark 1.2 (Muse Code) 82,9 % 59,3 % 70,6 %
GPT 5.6 Terra (Codex) 81,8 % 64,8 % 65,4 %
Grok 4.5 (Grok Build) 81,6 % 56,6 % sin publicar
Gemini 3.6 Flash (Antigravity CLI) 78,9 % 40,0 % 63,9 %
Muse Spark 1.1 (mini-swe-agent) 76,2 % 53,0 % 68,3 %

El PDF de metodología añade el contexto que las barras esconden. Terminal-Bench 2.1 usa 89 tareas y reporta la media de pass@1 sobre cinco intentos, cada uno en un contenedor aislado. DeepSWE v1.1 son 113 tareas repartidas en 91 repositorios y cinco lenguajes, también a cinco intentos. El banco interno de Meta reúne 440 tareas derivadas de pull requests reales de su propio código, sin acceso a internet y con dos intentos por tarea. Y el esfuerzo de razonamiento no es homogéneo: xhigh para los modelos de Meta, max para Opus y GPT, high para Grok y Gemini.

Ahora bien, esa columna es la ejecución interna de Meta, no la tabla oficial de Terminal-Bench. No coinciden. En el marcador que publica el propio banco de pruebas no hay ninguna fila de Opus 5 en la versión 2.1, y sus dos primeros puestos son Claude Code con Fable 5 al 83,82 % y Codex con GPT-5.5 al 83,15 %. Además la 2.1 salió el 6 de mayo de 2026 y está superada por la 4.0, del 28 de agosto, donde el reparto cambia por completo. Es decir: el 86,7 % de arriba es una medición de Meta con su propio andamiaje, no un dato del marcador público, y así hay que leerlo.

Frente a su antecesor la mejora es clara y verificable: Muse Spark 1.1 con mini-swe-agent marcaba 76,2 % en Terminal-Bench 2.1, así que 1.2 dentro de Muse Code sube 6,7 puntos. Frente a la competencia, la lectura honesta es que se queda cerca sin llegar. Esta tabla es la de Meta, no la nuestra: la comparativa a tres bandas contra el marcador oficial la tienes en Claude Code, Codex CLI y Muse Code en 2026.

Subagentes que no se reinician

La arquitectura que Meta describe es un bucle de agente sencillo más un conjunto de agentes de fondo asíncronos. La diferencia con lo que ya conoces está en la palabra "persistentes": estos agentes de fondo siguen vivos durante toda la sesión en lugar de generarse para cada tarea concreta, lo que según Meta evita repetir la recopilación de información y reduce la latencia y la necesidad de dirigirlos a mano en tareas largas.

Sobre el reparto en paralelo, TechCrunch informó de que el agente reparte el trabajo entre subagentes en árboles de trabajo aislados de Git cuando el proyecto es lo bastante grande, de modo que tu copia de trabajo no se toca. Mark Zuckerberg contó en la presentación que en pruebas construyeron seis funciones de un juego a la vez sin colisiones. Es una demostración, no una medida, y conviene tratarla como tal.

El agente trae además tres habilidades de serie: /plan convierte una tarea en un plan que requiere aprobación, /grill somete ese plan a presión hasta que aguanta, y /goal trabaja hacia el objetivo indicado.

El registro de eventos como auditoría y como vuelta atrás

Esta es la pieza que más me interesa del diseño. Meta lo describe así: el agente usa un registro local de eventos al que se añaden todas las llamadas al modelo, todas las ejecuciones de herramienta, todas las aprobaciones y todas las ediciones. Al ser la única fuente de verdad, el tiempo de ejecución se vuelve reproducible exactamente y resistente a reinicios; tras una caída el agente reanuda justo donde se quedó.

Lo que eso te da en la práctica son dos cosas distintas que conviene no confundir. La primera es una traza auditable: puedes reconstruir por qué el agente tocó un fichero y con qué aprobación previa, que es exactamente lo que echa en falta cualquiera que haya intentado justificar ante un compañero un cambio generado por una máquina. La segunda es la capacidad de retomar una tarea de muchas horas sin empezar de cero, que es lo que hace viable el caso de estudio de Meta: optimizar kernels de GPU durante más de mil llamadas a herramientas y hasta 24 horas seguidas sobre tarjetas NVIDIA Hopper.

Conviene decir lo que el registro no es. No es un sistema de control de versiones ni sustituye a Git; es el diario del agente, no el de tu repositorio.

Instalación en macOS y en Linux

La orden que publica Meta es una sola línea:

curl -fsSL https://dev.meta.ai/install.sh | bash

Descargué ese script antes de escribir esto, porque una tubería hacia bash merece leerse. Lo que hace es más contenido de lo que temía y menos transparente de lo que me gustaría:

  1. Instala un lanzador llamado muse en ~/.local/bin, ruta que puedes cambiar con MUSE_INSTALL_DIR.
  2. Añade la línea de PATH a .zshrc, .bashrc, .profile o conf.d/muse.fish según el intérprete que uses, salvo que definas MUSE_NO_MODIFY_PATH.
  3. Verifica el SHA-256 del lanzador solo si el servidor envía la cabecera x-content-sha256. El propio comentario del script lo dice: "Verified when advertised; older serving code sends none."
  4. Descarga el binario real desde lookaside.facebook.com y te pide identificarte mediante un flujo OIDC de código de dispositivo contra auth.meta.com; las credenciales quedan en ~/.config/muse/auth.json.
  5. Deja activada una comprobación de actualizaciones cada 3.600 segundos contra el canal muse-stable, que se desactiva con MUSE_NO_AUTO_UPDATE=1.

El 30 de agosto de 2026 ese canal servía la versión 1.0.1-R1848.1. El manifiesto de esa versión declara binarios de 213,0 MiB para Linux en arm64, 238,6 MiB para Linux en x86_64, 217,6 MiB para macOS en Apple Silicon y 237,3 MiB para macOS en Intel. Es un binario autocontenido y pesado, sin dependencias de Node ni de Python.

Un detalle que no aparece en ninguna nota de prensa: ese mismo manifiesto lista además artefactos x86_windows (277,0 MiB) y aarch64_windows (251,4 MiB). Existen. Lo que no existe es la vía para instalarlos, porque la función de detección de plataforma del lanzador solo reconoce macOS y Linux en x86_64 y arm64, y aborta con "unsupported platform" en cualquier otro caso. Quien trabaje en Windows tendrá que pasar por WSL, que a efectos del instalador es Linux.

Qué cuesta una tarea real

Meta publica dos variantes del mismo modelo. Estos precios están consultados en la página de producto el 30 de agosto de 2026 y pueden cambiar:

Variante Entrada Entrada en caché Salida Tus datos
muse-spark-1.2 1,25 $/M 0,15 $/M 4,25 $/M No se usan
muse-spark-1.2-contributor 0,10 $/M 0,002 $/M 0,20 $/M Sí se usan

La diferencia es de 12,5 veces en la entrada y de 21,25 veces en la salida. Puesto en una sesión concreta, y suponiendo un millón de tokens de entrada con un 80 % de aciertos de caché más 100.000 tokens de salida, la aritmética da unos 0,80 $ en el nivel estándar y unos 0,04 $ en el nivel contributor. Esa sesión de un millón de tokens de entrada no es un ejemplo de laboratorio: con una ventana de contexto de un millón, un repositorio mediano releído varias veces llega ahí sin esfuerzo.

Es un precio bajo, y esa es la tesis de Meta. Alexandr Wang, responsable de IA de la compañía, lo dijo a TechCrunch en estos términos: "We think that for a lot of workflows and a lot of use cases, this can be an incredibly good option, especially from a cost perspective."

El asterisco está en el nivel barato. Pagar cuatro céntimos en lugar de ochenta significa autorizar a Meta a entrenar con tus indicaciones y con las respuestas, es decir, con fragmentos de tu código. Para un proyecto personal o para código que ya es público, es una ganga. Para el repositorio de un cliente, es una decisión que no te corresponde a ti tomar solo.

Qué falta en la beta

Lista honesta, sin adornos:

  • No hay pesos abiertos. Muse Spark 1.2 es propietario y solo se sirve desde la infraestructura de Meta. Preguntado por ello, Zuckerberg respondió que tendría más que contar pronto, lo que no es un compromiso.
  • No hay instalación en Windows pese a que los binarios existen en el manifiesto.
  • No hay repositorio ni changelog público del agente. La documentación vive en el portal de desarrolladores de Meta, detrás de la puerta de la cuenta.
  • Hace falta cuenta de Meta y método de pago antes de la primera ejecución.
  • Es la versión 1.0.1. Tres semanas de vida pública y ninguna nota de versión publicada por el camino.
  • No hay integración de editor anunciada. Terminal y nada más, lo cual para mucha gente es una virtud.

Preguntas frecuentes

¿Muse Code sustituye a Claude Code o a Codex CLI?

Hoy no, si tu criterio es la capacidad del modelo. En las tres gráficas que publica el propio Meta, Opus 5 va por delante de Muse Spark 1.2. Si tu criterio es el coste por token en tareas de mucho contexto, la conversación cambia de signo y merece la pena probarlo.

¿Qué pasa con mi código si uso el nivel barato?

Meta lo declara sin ambigüedad en su propia página de producto: en la variante contributor, tus indicaciones y las respuestas se usan para mejorar el producto. En la variante estándar, no. La diferencia de precio es literalmente el precio de tus datos.

¿El registro de eventos me deja deshacer cambios?

Te deja reconstruir y reanudar, que no es lo mismo que revertir. Guarda todas las acciones en orden y permite reproducir la sesión y retomarla tras una caída, pero la vuelta atrás de los ficheros la sigue haciendo Git. Trabaja en una rama, como con cualquier otro agente.

Conclusión

Muse Code no trae un avance de capacidad: en los propios números de Meta, medidos con un arnés que Meta entrenó a la vez que el modelo, Opus 5 gana en los tres bancos. Lo que trae son dos cosas defendibles. Una es el diseño de tiempo de ejecución, con un registro de eventos que convierte una sesión de agente en algo auditable y reanudable, que es exactamente lo que hace falta para tareas de horas. La otra es el precio, con un nivel estándar competitivo y un nivel barato que solo tiene sentido cuando tu código puede ser datos de entrenamiento de otro.

Mi recomendación práctica: instálalo, dale una tarea de refactorización real en un repositorio grande y compara la factura con la de tu herramienta actual. No lo conviertas todavía en tu agente por defecto. Si vienes de otro sitio, empieza por el repaso a Claude Code, Cursor y Copilot en 2026 para situar el terreno. La versión en inglés de este artículo está en Muse Code: Meta’s terminal coding agent.

Fuentes

  1. Meta Superintelligence Labs, presentación de Muse Code y Muse Spark 1.2
  2. Meta, metodología de evaluación de Muse Spark 1.2 y Muse Code
  3. Meta for Developers, página de producto de Muse Code
  4. Meta, script de instalación de Muse Code
  5. TechCrunch, Meta lanza Muse Code
  6. VentureBeat, Meta entra en la guerra de los agentes de programación