Está demasiado competitivo.
Solo han pasado tres días de septiembre y ya se han lanzado cinco modelos avanzados.
Fable 5.1 y Mythos 5.1 de Anthropic, Gemini 3.8 Flash y Cyber de Google, y Muse Spark1.3 de Meta... RSI, sin duda ya ha llegado.
Just last night, just as Google's Gemini 3.8 Flash became the lightweight champion, Meta came to challenge it.
Mark Zuckerberg anuncia con autoridad en X: Muse Spark 1.3 se lanza oficialmente hoy, ofreciendo una experiencia casi tan económica que no requiere medición, gracias a su rendimiento de vanguardia. ¡Este es el avance más grande que hemos logrado hasta ahora en programación y agentes inteligentes!

Alexandr Wang, a cargo de Meta Superintelligence Lab, también publicó tres entradas en X, revelando la clave principal de este "as de picas".
Él indicó que, en comparación con Muse Spark 1.2, Muse Spark 1.3 reduce las rondas inválidas, disminuye en aproximadamente un 20% el número de llamadas a herramientas y reduce el consumo de tokens en aproximadamente un 25%, además de mantener mejor los requisitos en tareas de larga duración: «los usuarios notarán claramente este salto».

Con el lanzamiento de Muse Spark 1.3, Gemini 3.8 Flash, lanzado anoche, parece un poco desfasado.
Los resultados muestran que el aumento en Muse Spark 1.3 es mayor esta vez.
No solo superó a GPT-5.6 Sol y Fable 5 en puntuación, sino que el índice de inteligencia Artificial Analysis bajo la máxima intensidad de inferencia ya alcanzó 62 puntos, entrando sin duda en el primer grupo actual.

En cinco meses, Meta ha iterado inadvertidamente cuatro versiones de Muse Spark.
Alejandro el Grande burla a Google: "respirar el humo de los modelos de otros"
Recientemente, el primer grupo de IA ha estado muy congestionado. GPT-5.6 ocupa el trono, Fable 5.1 ha surgido rápidamente y Gemini 3.8 Flash está adelantando en la curva.
La aparición de Muse Spark 1.3 desordenó por completo a todos.
En la prueba de referencia DeepSWE v1.1, que mejor refleja la verdadera capacidad de programación a largo plazo del modelo, Muse Spark 1.3 supera directamente a Opus 5 y GPT-5.6 Sol, y deja atrás al recién lanzado Gemini 3.8 Flash, obteniendo la puntuación más alta actual.
Muse Spark 1.3: 75.4 puntos
Claude Opus 5: 74.0 puntos
GPT-5.6 Sol: 73.0 puntos

Además, en otras varias métricas clave de desarrolladores, Muse Spark 1.3 también demostró un rendimiento notable.
En SWEAtlas CodeBase QnA, obtuvo 59.4 puntos, superando a GPT-5.6 Sol y Opus 5.
En Terminal-Bench 2.1 obtuvo una puntuación de 88.8.
En MRCR 512K-1M, ¡obtuvo una asombrosa puntuación de 98.1! (para comparación, GPT-5.6 Sol obtuvo solo 73.8, lo que es una ventaja abrumadora).

En cuanto a sus capacidades, también ha alcanzado casi el nivel más avanzado, con una diferencia de solo unos pocos por ciento frente a Opus 5 en pruebas como JobBench y OSWorld.

En Artificial Analysis, Muse Spark 1.3 deja claramente atrás a Gemini 3.8 Flash.
En el índice inteligente, obtuvo una puntuación de 62, empatando con Claude Fable 5 y ubicándose entre los mejores.

En cuanto al costo más relevante para los desarrolladores, el costo de entrada de Muse es 8 veces menor que el de Fable 5, y el costo de salida es casi 12 veces menor, ofreciendo una relación calidad-precio óptima.
Ante un récord tan destacado, el jefe de IA de Meta, Alexandr Wang, comentó sarcásticamente: "En el índice inteligente Artificial Analysis, Gemini no es nada y solo puede respirar los gases de escape de los modelos de otros".
Google realmente ha caído en desgracia.

Algunos bromeaban: “Google trabajó duro durante cuatro meses y lanzó cuatro versiones de Gemini Flash, mientras que Meta lanzó cuatro iteraciones de Muse Spark⁺ en cinco meses. Pero apenas Google tomó la delantera unas pocas horas, Meta lo superó; esta trama es demasiado emocionante.”

Menos es más: una bestia de rendimiento por 1 dólar durante 2 horas
Aunque un alto rendimiento es impresionante, en el mundo actual de la IA, lo que realmente entusiasma a los desarrolladores es siempre algo útil y económico.
Muse Spark 1.3 se llama el rey de la relación calidad-precio porque no solo es rápido, sino que también ahorra mucho.
Como dijo Alexandr Wang, Muse Spark 1.3 es «tan barato que no importa», «rendimiento de vanguardia, con costos que son solo una fracción».


Siguió un camino completamente diferente al de los modelos grandes anteriores, que se basaban en "muchos recursos generan milagros y acumular parámetros locamente": hizo una resta.
Muse Spark 1.3 fue entrenado específicamente para programación de larga duración y una mejor capacidad de seguimiento de instrucciones, reduciendo así las rondas de interacción innecesarias y haciendo las salidas más concisas.

Se vuelve más inteligente y pulido, con un estilo de código más limpio y menos texto innecesario.
Y la consecuencia directa de esta resta es una caída en picada de los costos.
A continuación, se presenta un caso real de prueba muy impactante.
El desarrollador @SPAC89 comparó el modo Muse Spark 1.3 Ultra Contributor con Fable 5.1 xHigh.

La instrucción que proporcionó incluye una regla estricta de "mejora propia": si la calificación del jurado independiente es inferior a 9.5/10, el agente debe seguir mejorando el código y volver a intentarlo.
Ambos modelos funcionaron durante aproximadamente 2 horas, con resultados asombrosos.
Muse Spark 1.3 es como un supertrabajador incansable que no puede detenerse: realizó un total de 20 ciclos de auto-mejora, iniciando 3 agentes en cada ciclo, lo que equivale a más de 60 ejecuciones de agentes en solo 2 horas.
¡Y el costo total para completar esta tarea de razonamiento prolongado, extremadamente grande y compleja, fue inferior a 1 dólar!

El desarrollador exclamó: "¡Esto supera con creces mis expectativas, esto es realmente una obra de arte!"
En la fijación de precios macro, Meta demostró una gran seriedad. El nuevo modelo ofrece más capacidad sin aumentar los precios, manteniendo la tarifa de 1,25 dólares por millón de tokens de entrada y 4,25 dólares por millón de tokens de salida.

En términos de precios, la versión de contribuyentes de Muse Spark 1.3, «muse-spark-1.3-contributor», establece el piso de precios para modelos extranjeros. (La contrapartida es utilizar los datos para mejorar los productos de Meta.)

El fundador y desarrollador de Codedamn, Mehul Mohan, dijo directamente:
La capa de precios de los contribuyentes de Muse Spark 1.3 es simplemente increíblemente irreal, esta es la « DeepSeek El momento de la fijación de precios.

En las estadísticas de Artificial Analysis, entre modelos con el mismo nivel de inteligencia (puntuación superior a 59), el costo por tarea única de Muse Spark 1.3 es de solo $0.55, siendo la solución óptima absoluta.
Para comparación, Grok 4.6 con la misma inteligencia (61 puntos) cuesta 0.94 dólares, GPT-5.6 Sol requiere 0.95 dólares, y Claude Opus 5 llega a 1.23 dólares.
Incluso, el desarrollador Kartik señaló que Muse Spark 1.3 parece tener una capacidad de razonamiento de "profundidad cíclica" similar a Sol y Fable.
No genera respuestas de inmediato, sino que realiza inferencias lógicas internamente, lo que hace que su eficiencia de tokens sea asombrosamente alta.

La subida de Alexandr Wang, la ambición final de Zuckerberg
El estreno de Muse Spark 1.3 no sería posible sin los operadores detrás de él.
En julio de este año, Meta lanzó Muse Spark 1.1, destacando un contexto superlargo de 1M y operaciones informáticas.
En menos de dos meses, la versión 1.3 ya ha elevado la capacidad de codificación a largo plazo al nivel de GPT-5.6.
Esta rápida iteración es precisamente el resultado de Alexandr Wang asumiendo el Laboratorio de Superinteligencia de Meta.
¿Cuál es su objetivo final? Como Mark Zuckerberg y Alexandr Wang han enfatizado repetidamente: «agentes» y «barato hasta ignorarlo».
Es decir, Meta mira el próximo impulso de ASI: "Agente Engineering".
Alexandr Wang, director de Meta AI, declaró claramente en una entrevista con Axios que todas las mejoras de disponibilidad están destinadas a servir el ambicioso plan mencionado repetidamente por Zuckerberg: crear agentes personales disponibles las 24 horas del día, los 7 días de la semana.

Para que un agente te ayude 24 horas al día con correos electrónicos, escribir código y analizar datos, debe cumplir dos condiciones.
1. Extremadamente inteligente y estable: debe manejar largas secuencias de conversación (largos hilos) y poder procesar múltiples flujos de trabajo en paralelo.
Cuando la instrucción sea ambigua, debe saber hacer preguntas proactivamente; cuando encuentre obstáculos, debe saber pedir ayuda a los humanos; antes de realizar operaciones clave, debe saber confirmar. Lo más importante es no generar ilusiones.
2. Extremadamente económico: si el costo de ejecutar un agente personal durante un día llega a decenas de dólares, nunca será más que un juguete para unos pocos.
La aparición de Muse Spark 1.3 es, en esencia, abrir el camino para agentes personales 7×24.
Es como un ingeniero experimentado y maduro: le das un objetivo y él mismo lo planifica, se corrige y lo entrega.
Para ello, Sun Zhiqing, exalumno de la Universidad de Pekín e investigador de Meta, reveló que el equipo de Meta realizó un nuevo entrenamiento posterior del modelo Avocado anterior, logrando un mejor escalado en las pruebas.

Detrás de la fiesta: ¿nos engañaron con el «manipulación de listas»?
However, Muse Spark 1.3 has also been questioned.
La reconocida institución de IA BridgeMind publicó una reflexión profundamente inspiradora:
Gemini 3.8 Flash y Muse Spark 1.3 se lanzan hoy simultáneamente. Ambos parecen excelentes en las pruebas de referencia.
Muse Spark 1.3 actualmente está empatado con Fable 5 en el índice inteligente... Quiero sentirme emocionado. Pero no lo estoy.
Porque, este mes, los lanzamientos de IA han sido idénticos, las puntuaciones han aumentado drásticamente, pero la experiencia en el mundo real no ha mejorado en absoluto.
Esto es frustrante. Mi confianza en las pruebas de referencia disminuye cada semana, y mi confianza en los laboratorios que manipulan las pruebas de referencia es casi nula.

Este mensaje aborda con precisión el punto débil de la industria de los modelos grandes actualmente.
Algunos usuarios de internet realizaron pruebas de estrés en Muse Spark 1.3 y Gemini Flash 3.8z bajo restricciones 3D a nivel de backend, y los resultados revelaron las debilidades de ambos modelos:
Muse Spark 1.4 no es tan bueno, y Gemini Flash 3.5 simplemente está manipulando las clasificaciones.

Actualmente, los principales laboratorios han caído en un círculo vicioso de «entrenar para obtener puntuaciones». Cada vez que se lanza un modelo, siempre acompañado de varias gráficas de radar y capturas de pantalla de listas de clasificación que superan a la competencia.
DeepSWE, Tau3-Bench, GPQA se han convertido en objetivos frenéticos de "práctica" de todos.
Muse Spark 1.3 también ha dejado entrever sus debilidades.
En el informe profundo de Artificial Analysis, también podemos ver un ligero retroceso.
Por ejemplo, en la prueba AA-Omniscience, las versiones xhigh y max experimentaron una caída. La razón es que su «tasa de abstención» aumentó: cuando no estaba seguro, prefería no responder en lugar de inventar respuestas.
Esto reduce la tasa de ilusiones, pero también indica indirectamente que su conocimiento absoluto no ha aumentado tanto como sugieren las mejoras en los puntajes.

¿En qué consiste la segunda mitad de los grandes modelos?
Hoy, con el lanzamiento de Muse Spark 1.3 y Gemini 3.8 Flash, podemos sacar las siguientes conclusiones.
En primer lugar, el "beneficio de parámetros" de los modelos base está alcanzando su punto máximo.
La vía de mejorar la inteligencia simplemente aumentando el tamaño de los parámetros tiene beneficios marginales cada vez más bajos.
En el futuro, quien pueda introducir, como Muse Spark 1.3, un mecanismo de razonamiento similar al «profundidad cíclica» en la arquitectura del sistema y realizar una «reducción extrema» en la llamada a herramientas, logrará un verdadero salto en la experiencia.
Además, la ingeniería de agentes es la clave del resultado.
La competencia entre modelos grandes ya ha pasado de "quién habla mejor" a "quién trabaja mejor".
La barrera central del futuro no es un solo puntaje, sino la capacidad de implementar tareas de larga duración a un costo extremadamente bajo.
Modelos como Muse Spark 1.3, que pueden completar 60 ciclos de prueba con menos de 1 dólar, redefinirán por completo los modelos de negocio.
Referencias:
https://x.com/SPAC89/status/2095284969614475744
https://research.meta.ai/blog/introducing-muse-spark-1-3
https://x.com/AIatMeta/status/2095234385129963666?s=20
https://artificialanalysis.ai/zh/models/muse-spark-1-3
https://x.com/EdwardSun0909/status/2095236891574780275?s=20
Este artículo proviene del canal de WeChat "Nueva Inteligencia", autor: Apocalipsis de la ASI
