Mind Lab lanza el modelo Macaron-V1, que emplea una arquitectura Mixture-of-LoRA con 748 mil millones de parámetros y 4 LoRA independientes, alcanzando un puntaje de 85.6 en la evaluación SWE-bench Verified, liderando así la clasificación de capacidad de codificación. Este laboratorio chino, fundado hace menos de un año, logró un nivel técnico comparable al de equipos de Silicon Valley con financiamientos de 500 millones de dólares, atrayendo el respaldo de líderes de la industria como Richard Sutton, ganador del Premio Turing, y Liang Wenheng de DeepSeek. Mind Lab también propone los conceptos de "aprendizaje continuo" e "inteligencia colectiva", afirmando que el modelo puede seguir aprendiendo y colaborando en entornos reales tras salir del laboratorio. Solo dos semanas después de su comercialización, alcanzó un ARR de 10 millones de dólares, validando que esta ruta tecnológica resuelve problemas reales.Autor y fuente del artículo: Nuevos智元
La semana pasada, el mundo de la IA discutió un tema, pero la mayoría solo vio la mitad.
El 15 de julio, Mira Murati, exCTO de OpenAI, lanzó en San Francisco el primer modelo de Thinking Machines Lab, Inkling.
Financiación de 2 mil millones de dólares, 975 mil millones de parámetros, equipo de élite de 100 personas: la startup de IA más destacada de Silicon Valley finalmente ha revelado sus cartas.


Casi al mismo tiempo, Richard Sutton, padre del aprendizaje por refuerzo y ganador del Premio Turing 2024, de casi setenta años, anunció la creación de Oak Lab.
Las palabras originales del anciano fueron: "Los métodos actuales de aprendizaje profundo son frágiles e ineficientes; lo que se necesita no son arreglos superficiales, sino comenzar de nuevo desde los cimientos."

No solo Sutton piensa así. Liang Wenheng, fundador de DeepSeek, hizo un juicio casi idéntico.
Él comparó el desarrollo de la IA con una serie de peldaños: modelos de lenguaje, CoT, agentes... y después de los agentes, el siguiente peldaño que se debe superar es el aprendizaje continuo.
Su punto de vista es que la capacidad central del próximo modelo debe ser el aprendizaje continuo; de lo contrario, no puede llamarse próximo modelo. Si se logra primero el aprendizaje continuo, la inteligencia general podría volverse fácil.
Cuando una línea técnica es respaldada simultáneamente por un ganador del Premio Turing, la startup de IA más observada de Silicon Valley y el fundador del modelo más innovador de China, ya no es una opción tecnológica, sino un consenso de la industria.
El viento ha cambiado.
Mientras todos estaban mirando Silicon Valley, al otro lado del Pacífico, un laboratorio chino fundado hace menos de un año presentó, en la misma pista, una respuesta inesperada.
Mind Lab, lanzamiento oficial de Macaron-V1.
Mind Lab fue fundada en octubre de 2025 como un laboratorio de investigación de vanguardia bajo Mindverse (Xinzhou Technology). El equipo, compuesto por más de treinta miembros, proviene de xAI, DeepMind, DeepSeek, ByteDance Seed, MIT y la Universidad Tsinghua. A principios de año completó una ronda de financiación Serie A de 50 millones de dólares, liderada por Meituan, con participaciones de Ant Group, Sequoia Capital China, ZhenFund y otros.
Tenga en cuenta este número: 50 millones de dólares, que se utilizará más adelante.
748B parámetros, refuerzo directo con aprendizaje por refuerzo
Cada uno de los 4 LoRA se encarga de su propio ámbito
Primero, revisa el modelo.
Macaron-V1 tiene dos versiones:
- Venti Pro, 748B parámetros, compuesto por una base GLM-5.2 de 744B más cuatro LoRA de 1B, con contexto superlargo nativo de 2M;
- Versión estándar Tall, 35B, entrenada posteriormente sobre Qwen-3.7, se puede ejecutar en Mac.
Pero lo clave no está en los parámetros, sino en esos 4 LoRA.
Antes, LoRA era la versión económica de la fine-tuning completa. Ahorraba dinero, pero con descuento.
Mind Lab lo ha redefinido: el modelo base es la «generalidad», y LoRA es la «individualidad».
¿Qué significa? Al igual que todos los iPhone usan el mismo sistema iOS, pero las aplicaciones que instalas, tus hábitos de entrada y tus operaciones más frecuentes hacen que tu iPhone se convierta en «tu iPhone».
La conversación debe ser natural y empática, la programación debe ser estrictamente precisa, los agentes deben planificar en múltiples pasos, la interfaz generativa debe diseñarse con interacción: entrenarlos todos en un solo conjunto de parámetros hace que se conflictúen.
La aproximación de Macaron-V1 es sencilla y directa: desmontar.
Cuatro LoRA independientes, encargados de chat, Agent, programación y GenUI, cada uno entrenado, evaluado y revertido por separado.
Cambio dinámico del router en tiempo de ejecución: dices «ayúdame a organizar mi agenda», se usa Agent LoRA; dices «este código tiene un error», se cambia a Coding LoRA. Totalmente transparente para el usuario.
Esta arquitectura tiene un nombre oficial: Mixture-of-LoRA (MoL): distintas capacidades se entrenan de forma independiente sobre una base compartida, se combinan de manera flexible y se activan según sea necesario. No se trata de forzar a un modelo a convertirse en un experto general, sino de hacer que un grupo de especialistas trabaje en conjunto.

En términos de rendimiento, Macaron-V1 aún no ha alcanzado el nivel del modelo propietario más potente en todas las capacidades. Sin embargo, en toda la serie de evaluaciones, ya puede empatar e incluso superar a Opus 4.8, GPT-5.5 y Gemini 3.1 Pro en la mayoría de las tareas, especialmente destacándose en escenarios de la vida cotidiana, capacidad de programación y generación de UI.

SWE-bench verificado: una de las evaluaciones de capacidad de código más rigurosas reconocidas en la industria. Macaron-V1-Venti alcanza el primer lugar con 85.6 puntos, superando en 3 puntos al segundo lugar y superando a DeepSeek-V4-Pro (80.6), MiniMax-M3 (80.5) y Kimi-K2.6 (80.2).

Aún más impresionante es Deep-SWE, diseñado específicamente para evaluar tareas complejas de ingeniería de software a largo plazo. Macaron-V1-Venti obtuvo una puntuación de 58.4, mientras que el segundo lugar fue su modelo base, GLM-5.2, con 46.2. El mismo modelo base, tras ser entrenado con refuerzo LoRA, superó directamente en 12 puntos. Ese es el valor incremental que puede aportar el post-entrenamiento.

Lo más importante: pesos abiertos y despliegue privado. Incluso si los modelos propietarios son más potentes, tus datos deben pasar por los servidores de otros. Macaron-V1 te permite llevar el modelo de vuelta a tu casa, sin tener que entregar ni un solo byte de tus datos.
Andrew mostró un caso durante su discurso en WAIC: un usuario toma una foto de un cubo de Rubik desordenado y la envía; el modelo identifica el estado, resuelve el algoritmo y genera una guía interactiva en 3D para resolverlo — esto requiere la integración de cuatro capacidades: comprensión visual, algoritmos, llamada a herramientas de Agent y GenUI.

Otro diseño fácil de pasar por alto pero extremadamente técnico: diseño conjunto de Model y Harness.
¿Qué significa esto? La mayoría de los modelos de entrenamiento y despliegue real son dos entornos distintos: las herramientas y los flujos de ejecución utilizados durante el entrenamiento no coinciden con el entorno real después del lanzamiento, lo que reduce el rendimiento.
Macaron-V1 ha entrenado y optimizado el modelo junto con el Harness del entorno de producción desde el principio: cómo invocar herramientas, cómo operar la terminal y cómo ejecutar tareas de larga duración son idénticos en el entrenamiento y en la producción.
El REPL Harness asociado permite que el modelo combine herramientas mediante código, guarde estados intermedios y reutilice flujos eficaces, sin necesidad de comenzar desde cero cada vez, reduciendo llamadas repetitivas y el desperdicio de contexto.
Esto no es un modelo que solo charla, es un agente capaz de realizar tareas.
¿Por qué es «el único en el mundo»?
Podrías decir: ¿Qué hay de especial en el ajuste fino de LoRA? Están por todas partes.
Lo impresionante está en dos palabras: escala.
Hacer LoRA con aprendizaje por refuerzo en un modelo de 30B es algo que muchos equipos pueden hacer. Pero cuando el número de parámetros llega al nivel de billones, la dificultad aumenta exponencialmente.
El principal desafío es la inconsistencia entre entrenamiento e inferencia. El aprendizaje por refuerzo requiere entrenar e inferir simultáneamente para recopilar retroalimentación; cuando un modelo MoE con billones de parámetros se divide y distribuye en decenas de GPU, incluso una pequeña desviación entre la precisión de entrenamiento y la precisión de inferencia provoca deriva de gradientes, haciendo que la curva de entrenamiento no converja.
Por ejemplo: en una orquesta de cámara de 30 personas en un espacio cerrado, un pequeño desafinamiento aún se puede compensar. Pero si se trata de una orquesta sinfónica de cien músicos, cualquier instrumento que se desafine arruina toda la actuación.
Solo dos equipos en todo el mundo pueden ejecutar LoRA con aprendizaje por refuerzo en escalas de万亿 parámetros.
Una es Thinking Machines Lab de Mira Murati. Otra es Mind Lab.
No hay un tercero.
En diciembre de 2025, Mind Lab implementó LoRA reinforcement learning en Kimi K2, un modelo MoE extremadamente grande con un total de 1.04 billones de parámetros. El poder de cómputo fue solo una décima parte del necesario para el ajuste fino completo, y la curva de entrenamiento convergió de manera estable.
En este mes, LongStraw ha llevado el entrenamiento tras el aprendizaje por refuerzo hasta 2M de contexto, bajo una capacidad de cómputo GPU fija. Macaron-V1 es el resultado concentrado de todos estos avances.
Este camino no es recorrido solo por Mind Lab. John Schulman, científico jefe de TML, cofundador de OpenAI e inventor del algoritmo PPO, publicó en 2025 el artículo «LoRA without Regret», donde los experimentos demostraron que LoRA tiene un rendimiento idéntico al ajuste completo en la mayoría de los escenarios de post-entrenamiento. Él lo llamó «intervalo de baja pérdida».

La industria también está votando con dinero real. Fireworks AI, que completó su ronda D de 1.500 millones de dólares la semana pasada, tiene una valoración de 17.500 millones de dólares y puede alojar cientos de LoRA; Together AI completó su ronda C de 800 millones de dólares y ya ha establecido LoRA como el método predeterminado de ajuste fino.
Silicon Valley gastó 2 mil millones para construir la base; él gastó una décima parte y se paró sobre los hombros de gigantes
Aquí hay una comparación muy interesante.
Mind Lab y TML siguen la misma línea tecnológica, pero sus estrategias de base son completamente opuestas.
TML, por diversas razones, optó por entrenar desde cero su modelo base. Inkling, con 975 mil millones de parámetros y 45 billones de tokens; pero Murati también reconoció públicamente: «Este no es el modelo más potente actualmente».
Las evaluaciones muestran que Inkling es claramente inferior a modelos chinos de código abierto como GLM y Kimi. Empezar desde cero les consumió una gran cantidad de esfuerzo y poder de cómputo.
Mind Lab al revés. No entrena su base por sí mismo; directamente se apoya en el ecosistema de modelos de código abierto chino.
Kimi K2 valida LoRA RL con billones de parámetros, V1-Preview se basa en GLM-5.1, la versión oficial Venti usa GLM-5.2, Tall usa Qwen-3.7: cada actualización de la base eleva el punto de partida del entrenamiento posterior.
Los modelos de código abierto de China ya han alcanzado un nivel cercano al SOTA a nivel global. Tomando estas bases casi en el límite y utilizando LoRA con aprendizaje por refuerzo para impulsar las capacidades clave hasta el verdadero SOTA.
No necesitas cultivar tu propio trigo para hornear el mejor pan.
¿Qué tan cruel es la comparación?
TML: Financiación de 2 mil millones de dólares, equipo de 100 personas, colaboración con NVIDIA en potencia de cómputo de varios megavatios: las capacidades de Inkling aún están por detrás de GLM-5.2.
Mind Lab: Más de treinta personas, financiación de menos de 50 millones de dólares; desarrollaron modelos más potentes en múltiples dimensiones como Chat, Agent y Coding.
En cuanto al aprendizaje por refuerzo con LoRA, Mind Lab es probablemente el equipo con la mejor relación costo-beneficio del mundo. Sin duda alguna.
Aprende continuamente: ¿Por qué los modelos se vuelven más inteligentes con el uso?
Después de explicar la tecnología y las comparaciones, llegamos a la pregunta más fundamental: ¿qué está moviendo Mind Lab?
La respuesta está en el título de un artículo publicado conjuntamente por Richard Sutton y David Silver, ex investigador principal de AlphaGo: Welcome to the Era of Experience.

La preentrenación es la «era de los datos»: el modelo aprende a partir del texto existente generado por humanos.
La próxima era es la «era de la experiencia»: la capacidad de la IA ya no proviene de datos existentes, sino de las acciones a largo plazo, la retroalimentación y el aprendizaje continuo de los agentes en entornos reales.
La contradicción fundamental de los grandes modelos hoy radica aquí: una vez entrenados, se congelan.
Un usuario corrigió el mismo error diez veces, y la próxima vez el modelo aún debe volver a leer el historial del chat. Un agente de programación falla repetidamente en el mismo repositorio de código, y los fallos no se convierten en nuevas capacidades. El modelo procesa una gran cantidad de tareas diariamente, pero toda la experiencia se pierde.
Es solo un motor de razonamiento que repite infinitamente, no un agente en crecimiento.
Lo que Mind Lab busca hacer es romper este círculo vicioso. Su objetivo es crear una "máquina de inteligencia experiencial": un modelo que continúe aprendiendo en el mundo real, incluso después de salir del laboratorio.
La experiencia se convierte en nuevas habilidades, y estas habilidades permiten resolver problemas más difíciles, que a su vez generan experiencias más ricas.
La inteligencia ya no es el resultado de un solo entrenamiento, sino un proceso de crecimiento continuo.
LoRA ya no es una "herramienta para ahorrar dinero", sino un estado persistente que se puede escribir, revertir y evolucionar de forma independiente.
La base lleva conocimiento general, LoRA lleva tus preferencias, tu estilo de código, tu lógica de negocio. No es un parche estático, es una memoria que crece con la interacción.
Los experimentos demuestran que el módulo de adaptación ligero, comprimido a menos del 0,5% de los parámetros del modelo base, sigue siendo estable y confiable: cuanto más potente sea el modelo base, más efectivas resultan las actualizaciones a pequeña escala.
Mind Lab llevó tres años por este camino. En 2023, el fundador Andrew colaboró con Karthik Narasimhan, autor de GPT-1, y Yao Shunyu para publicar FireAct, el primer trabajo que utiliza el aprendizaje de parámetros para mejorar la capacidad de los agentes. Después de escribir las trayectorias del agente en los parámetros, el tiempo de ejecución por instancia se redujo de 9,0 segundos a 2,7 segundos.

Paga un costo una vez para aprender, y cada uso posterior es una recompensa. Desde FireAct hasta Macaron-V1, esta lógica se ha ampliado a una escala de billones de parámetros.
Inteligencia colectiva: La tercera curva de escalado
Aprender continuamente es solo la mitad de la historia. El segundo principio fundamental reflejado por Macaron-V1, quizás más revolucionario, es la inteligencia colectiva.
Cada modelo aprende continuamente según sus propias experiencias, y diferentes instancias se dirigen en direcciones distintas. Las retroalimentaciones de los usuarios, las tareas y los datos diversos moldean capacidades diferentes. Partiendo de la misma base, con el tiempo se convierten en «personas distintas».
¿Esta diversidad es un bug o una característica? Los resultados del experimento son increíbles.
Partiendo del mismo基座 Qwen3-30B, los objetivos de entrenamiento y los algoritmos son completamente idénticos, solo se cambia el orden de los datos y el masking.
Precisión de un solo adaptador en AIME24: 36,44%. Votación mayoritaria con 198 adaptadores diferentes: 48,67%. Muestreo repetido 198 veces con el mismo adaptador, máximo alcanzado: 43,78%.
Diferentes «experiencias» generan complementariedad que un solo modelo no puede ofrecer. No se trata de «probar varias veces»: es una verdadera efectividad colaborativa entre rutas de aprendizaje diversificadas.

Andrew llama a esto la tercera curva de escalado en WAIC.
Primera regla: Parámetros de escala tipo GPT-3: mayores parámetros generan mayor inteligencia.
Segunda: Tokens de Scale Thinking del estilo DeepSeek R1: más tokens de razonamiento llevan a una inteligencia superior.
Tercera: Escalar el número de modelos — la colaboración entre más modelos lleva a un límite superior de inteligencia más alto.
En el experimento, el número de modelos aumentó de unos pocos a 200, y el rendimiento mejoró linealmente en una escala logarítmica. Si la curva se mantiene, el siguiente paso es escalar de 200 a 20,000 y luego a 2 millones.
La plataforma MinT desarrollada internamente por Mind Lab ha establecido un directorio de LoRA de un millón de direcciones accesibles. Un millón de LoRA comparten una base de un billón de parámetros.
Atención: esto no son un millón de modelos pequeños, son un millón de modelos grandes con un billón de parámetros cada uno.
Las personas comparten más del 99% de su genoma, pero una base biológica casi idéntica no ha generado mentes idénticas. Es precisamente la diversidad inteligente y su colaboración lo que ha llevado a los mayores logros de la civilización humana.
2 semanas, 10 millones de dólares en ARR: la validación de comercialización más rápida
Incluso la mejor hoja de ruta técnica no sirve si el mercado no la acepta; solo es un PPT. Mind Lab lanzará su API comercial en julio.
Resultado: 2 semanas, 10 millones de dólares en ARR.

This is likely the fastest record for any model company to achieve $10 million in ARR since the first model's release.
Los números son importantes, pero lo que importa más es la velocidad. Que los clientes voten tan rápidamente con dinero real por una ruta técnica demuestra que resuelve un problema real y apremiante.
Mind Lab no vende solo tokens. Su lógica comercial central es: los clientes compran la capacidad del modelo para aprender y iterar continuamente en sus propios escenarios.
Los fabricantes de teléfonos móviles entrenan el conocimiento del producto en un LoRA exclusivo; las empresas de audífonos incorporan las preferencias de interacción en el estado del modelo: los datos clave no necesitan enviarse a la empresa del modelo base para reentrenamiento, y el cliente mantiene el control.
ShaoYin Technology, AI hardware startup Odyss, and a leading smartphone manufacturer are already on the partnership list.
La estructura de las llamadas a la API también lo demuestra: 20% chat, 30% flujos de trabajo de Agent, 30% generación de código, y el resto proviene de GenUI: la distribución de escenarios es equilibrada, no es una prosperidad falsa sostenida por un solo éxito viral.
Versión Pro: 6 dólares por millón de tokens, versión Estándar: 4 dólares, versión Ultra rápida: 2 dólares.
La visión de Mind Lab es solo una frase: Si sabes usar Tokens, puedes entrenar Tokens.
Entrenar un modelo debe ser tan sencillo como invocar un modelo. No se requieren grandes esfuerzos de ventas previas ni personal personalizado. El aprendizaje continuo, en sí mismo, es una capacidad escalable del modelo.
La puerta se abrió
Richard Sutton grita "la era de la experiencia" en Toronto. Liang Wenheng cree que se necesita una capacidad de aprendizaje continuo para llamar a los siguientes modelos. Mira Murati construye infraestructura de aprendizaje por refuerzo LoRA con billones de parámetros en San Francisco. Fireworks AI tiene una valoración de 17.500 millones de dólares.
Todos apuestan por la misma dirección: el modelo debe seguir aprendiendo después del despliegue. LoRA es la tecnología clave que hace posible esto a escala de billones de parámetros.
Mind Lab es el participante más joven en esta categoría. Pero su postura de partida podría ser la más eficiente: sin base propia, se apoya en el ecosistema de código abierto de China, y con un equipo de más de treinta personas y menos de 50 millones de dólares en financiación, logró una capacidad técnica al mismo nivel que los equipos de Silicon Valley con presupuestos de cientos de millones.
Detrás de esto hay un juicio simple pero profundo:
El resultado final de la competencia de los grandes modelos no está en quién entrena la base más grande, sino en quién puede hacer que el modelo siga volviéndose más inteligente.
La preentrenamiento es una infraestructura única. El aprendizaje continuo es la verdadera ventaja competitiva.
Mind Lab busca crear una máquina de inteligencia experiencial: un modelo que continúe aprendiendo en el mundo real después de salir del laboratorio, volviéndose más inteligente con el uso. Cuando suficientes de estas inteligencias comiencen a colaborar, se abrirá una nueva vía hacia una inteligencia superior.
Murati empuja esta puerta en San Francisco con 2 mil millones de dólares y un equipo de 100 personas.
Pero quien abrió primero la puerta un poco fue este lado del Pacífico, un joven laboratorio que se apoya en el ecosistema de código abierto chino.
