La herramienta en beta mantiene agentes auxiliares durante cada sesión y registra llamadas, ediciones y aprobaciones para reanudar trabajos después de una interrupción.
Meta presentó Muse Code, un agente de programación que funciona desde la terminal y está disponible en versión beta. Según el anuncio publicado por Meta el 5 de agosto de 2026, la herramienta puede planificar modificaciones, escribir código y validar resultados en repositorios de gran tamaño.
Muse Code está basado en Muse Spark 1.2, una actualización del modelo de Meta orientada a generación de código, depuración, comprensión de repositorios y flujos de desarrollo. La empresa ofrece instalación para macOS y Linux, mientras que el modelo también está disponible mediante Meta Model API.
Subagentes y recuperación de tareas
La herramienta emplea un agente principal acompañado por agentes auxiliares que permanecen activos durante la sesión. Estos pueden investigar partes del problema, ejecutar pasos adicionales y comunicar sus resultados al agente principal.
Cuando una tarea lo requiere, Muse Code puede distribuir trabajo entre varios subagentes en directorios aislados. El diseño busca evitar que los procesos modifiquen simultáneamente la copia de trabajo del usuario, aunque Meta no ha publicado pruebas independientes que permitan determinar cómo se comporta esta coordinación en repositorios empresariales reales.
Otra función es un registro local de eventos que conserva las llamadas al modelo, el uso de herramientas, las aprobaciones y las ediciones. Meta sostiene que este mecanismo permite reanudar una tarea desde el punto en que fue interrumpida después de un fallo. Esta función puede resultar relevante para trabajos prolongados, pero su eficacia y sus requisitos operativos todavía deben evaluarse fuera de las demostraciones del proveedor.
Las comparaciones no utilizan un agente uniforme
Meta publicó un documento con la metodología de evaluación de Muse Spark 1.2 y Muse Code. Las pruebas incluyen Terminal-Bench 2.1, DeepSWE 1.1 y un conjunto interno compuesto por 440 tareas procedentes del código de la compañía.
La metodología presenta una limitación importante para interpretar las comparaciones. Cada modelo fue probado con un producto de agente diferente. Muse Spark 1.2 utilizó Muse Code, mientras que los modelos de otras compañías fueron ejecutados con herramientas como Claude Code, Codex y otros agentes seleccionados por Meta.
La compañía señala que intentó aproximar las configuraciones, pero reconoce que su entorno y sus instrucciones pueden no estar optimizados para los modelos de terceros. Por ello, los resultados describen el desempeño de sistemas completos bajo la configuración escogida por Meta y no aíslan únicamente la capacidad de cada modelo.
En Terminal-Bench y DeepSWE se ejecutaron cinco intentos por tarea dentro de entornos aislados. El conjunto interno de Meta, por su parte, no es públicamente reproducible y empleó dos intentos por tarea. Estas pruebas aportan una referencia técnica, pero no establecen por sí solas el rendimiento, el costo ni la fiabilidad del agente en proyectos operativos.
Una beta que requiere evaluación adicional
Meta también describe una prueba de optimización de kernels para GPU NVIDIA Hopper que se prolongó durante más de mil llamadas a herramientas y hasta 24 horas. Se trata de una tarea específica con implementaciones de referencia y condiciones definidas por la empresa, no de evidencia general sobre la capacidad de Muse Code para mantener software en producción.
El anuncio de investigación consultado no detalla los términos comerciales, la retención de datos ni los controles administrativos aplicables a repositorios privados. Antes de utilizar la beta con código sensible, las organizaciones deberán comprobar esas condiciones y evaluar los cambios generados mediante sus propios controles de revisión, pruebas y seguridad.
Fuentes: Meta AI Research: Introducing Muse Code and Muse Spark 1.2; Meta AI Research: Muse Spark 1.2 and Muse Code Evaluation Methodology
Ilustración: Captura del sitio de Meta
📬 Newsletter gratuito