Meta lanza Muse Code, el primer agente de programación de terminal con agentes de ejecución prolongada y opción de descuento del 95%

iconMetaEra
Compartir
AI summary iconResumen
Meta presentó Muse Code, su primer agente de programación terminal, construido a partir de MetaEra y emparejado con el modelo actualizado Muse Spark 1.2. El agente puede manejar bases de código grandes, redactar planes, escribir y probar código, y ejecutar agentes en segundo plano. Una versión de contribuyente ofrece un recorte del 95% en costos a cambio del acceso a datos. El sistema admite tareas de larga duración y recuperación ante caídas. Meta afirma que Muse Spark 1.2 está cerca de los modelos líderes, pero aún no ha superado a sus rivales en todas las pruebas. Las noticias sobre el colapso del mercado y los datos de inflación podrían influir en su adopción.
El 5 de agosto de 2026, Meta lanzó su primer agente de programación terminal, Muse Code, junto con el modelo Muse Spark 1.2 optimizado específicamente para programación. Muse Code puede leer grandes bases de código, elaborar planes de modificación, escribir código, ejecutar pruebas y validar resultados, además de permitir que múltiples agentes en segundo plano se mantengan activos durante toda la sesión, sin necesidad de comprender nuevamente el proyecto para cada tarea. Meta también diseñó un registro de eventos local de solo adición, sin posibilidad de sobrescritura, que permite recuperar con precisión el punto de interrupción incluso en caso de fallo del programa. Lo que realmente ha generado discusión entre los desarrolladores es el precio: la versión estándar cuesta $1.25 por millón de tokens de entrada y $4.25 por millón de tokens de salida; si los usuarios permiten a Meta utilizar sus entradas y salidas para mejorar el producto, la versión "contribuidor" se reduce a $0.10 y $0.20 respectivamente. La condición detrás de este bajo precio no es una promoción común, sino el código y los datos de uso. Las evaluaciones oficiales muestran que Muse Spark 1.2 ya está cerca de los modelos de programación líderes, pero aún no lidera completamente, y algunos resultados aún no han sido replicados independientemente. La señal que Meta está enviando con este lanzamiento es que la unidad de competencia en la programación con IA está pasando de modelos individuales a sistemas completos compuestos por modelos, marcos de ejecución de agentes, estado prolongado y ciclos cerrados de datos.

Autor del artículo, fuente: Meta AI Research

Meta finalmente tiene su propio "Claude Code"

Muse Code es el primer agente de programación terminal lanzado por Meta, actualmente disponible en versión de prueba para macOS y Linux. Su objetivo no es la completación de código, sino tareas completas de ingeniería de software: ingresar a un repositorio de código grande, comprender la estructura existente, elaborar un plan, modificar múltiples archivos, ejecutar comandos y pruebas, y luego ajustar según los resultados.

Esto lleva a Muse Code directamente al mercado que están compitiendo productos como Claude Code, Codex y Gemini CLI. El modelo ya no solo responde “¿cómo debería escribirse este código?”, sino que obtiene acceso a la terminal, el sistema de archivos y las herramientas de desarrollo, permitiendo ejecutar tareas de forma continua con menos intervención humana.

Meta presenta Muse Code y Muse Spark 1.2 como un sistema integrado, no como dos productos intercambiables. Muse Spark 1.2 se encarga de comprender, razonar y generar, mientras que Muse Code gestiona el contexto, programa sub-Agentes, llama a herramientas, guarda el estado y valida los resultados. Ambos fueron optimizados conjuntamente durante el entrenamiento, lo que significa que el mismo modelo no necesariamente replicará los resultados mostrados por Meta si se traslada a otro marco de Agentes.

Los múltiples agentes no son un grupo temporal, sino una presencia permanente.

El diseño más diferenciador de Muse Code es un conjunto de Agentes en segundo plano que funcionan de forma asíncrona.

Los sistemas comunes de múltiples agentes crean temporalmente un asistente cuando necesitan ejecutar una subtarea, por ejemplo, para buscar archivos relacionados, analizar fallas en pruebas o investigar una dependencia específica. Al finalizar la tarea, el contexto de este asistente suele desaparecer; la próxima vez que surja un problema similar, el sistema podría volver a escanear el mismo conjunto de código y recopilar repetidamente la misma información.

El agente de fondo de Muse Code permanecerá activo durante toda la sesión. Pueden acumular continuamente comprensión sobre la base de código, avanzar por su cuenta al siguiente paso y elegir cuándo informar los resultados al agente principal. El agente principal se encarga de coordinar los objetivos, mientras que los agentes de fondo pueden investigar por separado diferentes módulos, revisar pruebas, buscar relaciones de llamadas o validar soluciones de implementación.

Este diseño intenta resolver un desperdicio común en tareas largas: el agente olvida repetidamente qué ha visto ya. Si el estado del agente en segundo plano se puede conservar de manera confiable, no necesita volver a leer la estructura del proyecto en cada paso, ni el humano necesita recordarle constantemente que ya revisó este archivo.

Sin embargo, múltiples Agentes que modifican el código simultáneamente también generan problemas de conflicto, permisos y costos. El artículo público de Meta no revela completamente cómo se dividen las tareas, cómo se fusionan las modificaciones de código, ni cómo los demás Agentes evitan heredar conclusiones erróneas cuando uno de los Agentes de fondo comete un error. Por lo tanto, los Agentes continuos son una dirección arquitectónica digna de atención, pero actualmente no se puede juzgar su estabilidad en proyectos de equipo reales solo con base en las demostraciones oficiales.

Después del colapso, no vuelvas a empezar desde cero

Los Agentes de programación de ejecución prolongada enfrentan un problema muy real: cuanto más larga sea la tarea, más probable es que se encuentren con interrupciones de red, errores de herramientas, colapsos de procesos o límites de contexto. Si el sistema solo guarda el estado actual dentro de la conversación del modelo, un solo fallo podría hacer que se pierdan varias horas de trabajo de exploración.

Muse Code ha creado un registro de eventos local. Cada llamada al modelo, ejecución de herramienta, aprobación del usuario y modificación de archivo se escriben en el registro de forma agregada, y el historial ya ocurrido no se sobrescribe directamente por estados posteriores.

Meta llama a este mecanismo "reproducibilidad precisa" y "seguridad de reinicio". Cuando un Agente se bloquea en mitad del proceso, el sistema puede recuperar el trabajo a partir del registro de eventos, en lugar de tener que adivinar nuevamente qué ocurrió anteriormente. Esto convierte realmente a los Agentes de programación de una conversación temporal en un proceso de ingeniería con estado.

Muse Code también incluye varias habilidades llamables:/plangenera primero un plan de ejecución que requiere aprobación del usuario;/grillataca y cuestiona específicamente este plan para identificar omisiones, riesgos y suposiciones erróneas;/goalpermite que el agente ejecute continuamente la tarea especificada hasta cumplir las condiciones de finalización.

La idea detrás de estas funciones es clara: si la IA debe realizar horas de trabajo de ingeniería de software, lo crucial no es solo que genere código elegante en cada paso, sino también que pueda guardar el progreso, aceptar revisiones, detectar fallos en el plan y continuar ejecutándose tras un fallo.

Muse Spark 1.2 es el modelo y también el "motor dedicado" del marco de Agentes

Muse Spark 1.2 es una versión mejorada en programación lanzada menos de un mes después de la versión 1.1. Meta afirma que aumentó la capacidad de entrenamiento para tareas de programación y la diversidad del entorno de entrenamiento, centrándose en mejorar la generación de código, la resolución de errores complejos, la comprensión de bibliotecas de código y los flujos de desarrollo end-to-end.

El rango de entrenamiento no solo incluye la reparación de archivos individuales, sino también la generación de repositorios de código completos, proyectos grandes de extremo a extremo y tareas de investigación automatizadas. El modelo utilizará planes para organizar los pasos de trabajo, mantener la dirección mediante condiciones de objetivo y comprimir la información a medida que el contexto crece, conservando solo la información realmente necesaria para el trabajo posterior.

Meta también involucra a Muse Spark 1.1 en el entrenamiento del próximo modelo. El modelo anterior se encarga de generar entornos de programación más complejos y plantillas de seguimiento de instrucciones, y luego evalúa si las soluciones candidatas cumplen con los requisitos, generando así por lotes datos para que el modelo 1.2 aprenda.

La "automejora" aquí mencionada aún no implica que el modelo modifique sus propios pesos sin control humano. Una descripción más precisa es que el modelo de la generación anterior se utiliza como generador y evaluador de datos para ayudar al equipo a ampliar los datos de entrenamiento de la próxima generación. El flujo de datos, las ejecuciones de entrenamiento y la publicación final del modelo siguen bajo control de Meta.

Más importante aún, Meta no entrenó un modelo separado "que escriba código", sino que integró en el entrenamiento las herramientas, la gestión de objetivos, la compresión de contexto y las trayectorias de subagentes de Muse Code. La capacidad futura de los modelos de programación podría depender cada vez más de qué marco de agente haya conocido desde la fase de entrenamiento.

Lo importante de esta demostración es ejecutar durante 24 horas y llamar a las herramientas más de 1000 veces.

Un caso proporcionado por Meta consiste en optimizar los kernels KDA y MLA en GPU NVIDIA Hopper mediante Muse Spark 1.2 en el entorno Muse Code. El sistema debe escribir el código, compilarlo, analizar el rendimiento y modificarlo repetidamente según los resultados.

La prueba completa puede durar hasta 24 horas, con más de 1000 llamadas a herramientas. Se prohíbe a los investigadores que el modelo importe directamente bibliotecas de núcleos de terceros listas para usar; se les exige implementar el algoritmo en Triton y buscar mejoras reales de rendimiento, en lugar de envolver implementaciones existentes como si fueran sus propios resultados.

En la tarea KDA, el modelo combina núcleos de preparación dentro del bloque en paralelo con un escaneo entre bloques secuencial, e incorpora optimizaciones específicas para la decaída acumulativa con puerta. En la tarea MLA, diseña una tubería Triton compuesta por dos núcleos y busca reutilizar representaciones latentes KV compartidas.

La importancia de estos casos no radica en un solo número de aceleración, sino en si el agente puede mantener el objetivo, comprender los datos de análisis de rendimiento y generar el siguiente ciclo de experimentos tras cientos de fracasos y resultados intermedios. Si el sistema solo funciona de manera estable durante unos quince minutos, es más bien una herramienta de completado avanzada; solo cuando puede avanzar durante 24 horas comienza a acercarse a un agente adecuado para delegar investigación de ingeniería.

La evaluación está cerca de la cima, pero aún no "supera a Claude y Codex"

La evaluación de Meta cubre Terminal-Bench 2.1, DeepSWE 1.1, GDPVal-AA v2, MCP Atlas y pruebas de programación internas. Terminal-Bench 2.1 incluye 89 tareas que deben completarse en un entorno de terminal; DeepSWE 1.1 incluye 113 tareas provenientes de 91 repositorios de código, abarcando cinco lenguajes de programación.

Según los gráficos publicados por Meta, Muse Spark 1.2 junto con Muse Code obtuvo un 82,9% en Terminal-Bench 2.1, por debajo del 86,7% de Claude Opus 5, pero por encima de Codex y Grok Build en sus evaluaciones. En DeepSWE 1.1, Muse Spark 1.2 obtuvo un 59,3%, sin alcanzar el primer puesto. En 440 tareas de ingeniería reales internas de Meta, logró un 70,6%, también por detrás de Opus 5.

Estos resultados indican que Muse Code ya se encuentra dentro del rango de competencia de los agentes de programación líderes, pero no respaldan la conclusión de que “Meta superó por completo a Claude Code y Codex”.

OficialArchivo de método de evaluaciónTambién indica que cada modelo está emparejado con su respectivo producto Agent: Muse Spark utiliza Muse Code, Claude utiliza Claude Code, GPT utiliza Codex, Gemini utiliza Antigravity y Kimi utiliza Kimi Code. Esta comparación es más cercana a un enfrentamiento completo de productos, pero no permite distinguir si los resultados provienen del modelo o del marco Agent.

Meta también reconoce que su entorno de evaluación interna y sus prompts probablemente no estén optimizados de forma óptima para modelos cerrados de terceros. Los resultados de Muse Spark 1.2 en Terminal-Bench aún no han ingresado a la lista de verificación independiente. Por lo tanto, la afirmación más prudente en esta etapa es: las pruebas internas de Meta indican que está cerca del nivel de vanguardia, pero aún faltan reproducciones independientes.

La versión más económica, requiere intercambio con código y conversación

Muse Spark 1.2 Standard cuesta $1.25 por millón de tokens de entrada, $0.15 para entrada en caché y $4.25 para salida. La entrada y salida de esta versión no se utilizarán para mejorar los productos de Meta.

Otro modelo está identificado comomuse-spark-1.2-contributor. Su precio por millón de tokens de entrada es de solo $0.10, $0.002 para entrada en caché y $0.20 para salida. En comparación con la versión estándar, la entrada es un 92% más barata y la salida aproximadamente un 95% más barata.

El costo es que las sugerencias y las salidas del modelo de los contribuyentes pueden ser utilizadas por Meta para mejorar sus productos. Para proyectos de código abierto, experimentos personales o trabajos que no contengan información sensible, esto puede ser un intercambio muy atractivo; pero para código privado empresarial, productos no lanzados, datos de clientes, configuraciones de claves y proyectos sujetos a acuerdos de confidencialidad, primero es un problema de gobernanza de datos, no de precio.

Las empresas no deben asumir que es adecuado entregar todo el código fuente a la versión de contribuyentes solo por el precio unitario del Token. Si se permite el uso de los datos para entrenamiento debe evaluarse en función de los términos específicos de servicio de Meta, la propiedad del código, los contratos con los clientes y las políticas internas de seguridad. Las versiones estándar y de contribuyentes utilizan capacidades similares, pero corresponden a dos relaciones de datos completamente distintas.

Esto también revela la verdadera estrategia competitiva de Meta: no solo busca atraer desarrolladores con precios bajos, sino también establecer un nuevo ciclo cerrado de datos de entrenamiento de programación a través de las tareas, modificaciones, comentarios y resultados generados cuando los desarrolladores usan Muse Code. Los desarrolladores obtienen llamadas a Agentes casi gratuitas, mientras que Meta podría obtener datos más valiosos que los códigos públicos de GitHub: cómo se desglosan, modifican y verifican realmente las tareas.

La programación de IA ha entrado en la fase de "entrenamiento conjunto de modelos y andamiajes"

Anteriormente, la evaluación de IA de programación se centraba principalmente en cuántos problemas podía resolver el modelo. Muse Code presenta una lógica de competencia diferente: el modelo es solo una parte del sistema; si los Agentes en segundo plano mantienen el estado, si las llamadas a herramientas son confiables, si las tareas pueden recuperarse, si el contexto se comprime correctamente y si se puede seguir iterando tras un fallo, todo esto puede ser más importante que la capacidad de generar código en una sola ocasión.

Meta también indicó claramente que en el futuro lanzará modelos más grandes y más funciones de marcos de Agentes. Esto significa que Muse Spark 1.2 no es el producto insignia final, sino más bien la primera infraestructura completa de Meta para el mercado de Agentes de programación.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.