¡Los grandes resultados de la inteligencia encarnada están por llegar!!!
Desde que Generalist lanzó el cerebro encarnado Gen 1.5 capaz de aprender movimientos de 3 a 12 segundos la semana pasada~
Just now, North American embodied AI startup Skild AI released the new robotic foundation model S1, extending the context learning task length for robots to over 10 minutes.

Esta S1 se centra en el aprendizaje en contexto (in-context learning, ICL):
No es necesario aprender específicamente nuevos datos de operación durante la fase de post-entrenamiento; solo con ver un video de demostración humana, puede “imitar el modelo” y completar directamente una secuencia completa de operaciones complejas que nunca ha visto antes.
En la demostración oficial, el robot completó tareas de larga duración como preparar panqueques, preparar café, trasplantar plantas y ensamblar equipos. Además, logró una tasa de éxito del 66% en tareas no vistas previamente, superando ampliamente a las VLA basadas en indicaciones de lenguaje (solo 9%).
Además, incluso siguiendo la ruta tradicional de ajuste fino posterior al entrenamiento, para igualar el rendimiento de S1 con solo una demostración, probablemente se necesiten alrededor de 380 demostraciones de tareas.
¡Muy amazing!
Se puede decir que esta última ola de trabajos centrados en el aprendizaje contextual ha reavivado la esperanza de muchas personas en cuanto a la embodiement.
Un usuario de Twitter dijo que los robots universales podrían aparecer en dos años, no en siete.

Otros usuarios también indicaron que, desde Rhoda, hasta el Generalist de la semana pasada, y ahora las tareas de 10 minutos de Skild S1, el verdadero momento GPT del robot parece estar surgiendo.

Porque una vez que esta capacidad se generalice realmente, desarrollar habilidades para robots podría volverse realmente como escribir prompts para ChatGPT.

¿Es realmente así de increíble? Veámoslo juntos.
De la era BERT a la era GPT
Para entender cómo S1 aprende en este contexto, primero debemos ver cómo aprenden los robots tradicionales una nueva habilidad.
En el pipeline tradicional, el aprendizaje de robots es realmente similar al de los modelos grandes:
Primero, se entrena previamente con grandes volúmenes de datos para adquirir habilidades básicas; luego, en escenarios específicos, se recopilan datos para una tarea concreta y se realiza un entrenamiento posterior para que el robot aprenda habilidades especializadas.

Sin embargo, el problema radica en que, aunque los robots y los modelos grandes tienen procesos similares, los costos de datos son completamente distintos.
Los datos de preentrenamiento de los grandes modelos provienen en gran medida de internet; incluso en escenarios especializados como programación y agentes, muchos datos de postentrenamiento pueden obtenerse rápidamente en línea o incluso generarse automáticamente.
Pero los robots tienen más suerte. Los datos de preentrenamiento deben recopilarse en el mundo real, y los datos de entrenamiento posterior también deben recopilarse en el mundo real.
Entonces, en el blog técnico, Skild AI lo dijo directamente:
Si un modelo base de robot requiere decenas o cientos de horas de datos reales para aprender cada nueva tarea y luego necesita volver a entrenarse, ¿dónde está la “base” de este modelo?
Incluso citan investigaciones previas que indican que, si se dispone de suficientes datos para una nueva tarea, un modelo entrenado desde cero podría igualar incluso al modelo base preentrenado y luego afinado.
Entonces, ¿cuál es realmente el significado de la preentrenación corporal?
Skild responde: aprendizaje en contexto.
Para tener un punto de referencia, Skild tomó como comparación la línea de desarrollo de los modelos grandes.
BERT temprano ya era muy potente, pero con frecuencia aún era necesario preparar los datos nuevamente y realizar un nuevo ajuste fino para cada tarea nueva.
Lo que realmente cambió el juego fue la capacidad de aprendizaje contextual que se volvió evidente tras GPT-3:
No es necesario modificar los pesos del modelo; solo con proporcionar algunos ejemplos en el Prompt, el modelo puede “aprender” temporalmente una nueva tarea.

Basado en esto, Skild cree que los robots actualmente aún están atrapados en una era similar a BERT, y lo que realmente desean es lograr que los robots también realicen esta misma transformación paradigmática.
Es decir, el verdadero valor del preentrenamiento no debería ser simplemente reducir la cantidad de datos necesarios para el entrenamiento posterior, sino permitir que el robot adquiera finalmente la capacidad de "aprender directamente del contexto".
Aprendizaje por contexto
Entonces, ¿qué aprendió realmente S1 del contexto?
Skild cree que, en realidad, solo hay dos dimensiones que pueden evaluar verdaderamente la capacidad de aprendizaje contextual de los robots:
Uno es si puede aprender habilidades que nunca vio durante el entrenamiento; el otro es si puede combinar habilidades existentes para completar una nueva tarea larga y compleja.
Por ejemplo, el robot solo necesita ver un video de dar vuelta una crepe para aprender a hacerla—
Incluso si esta habilidad nunca antes apareció en sus datos de entrenamiento.
Al mismo tiempo, en comparación con los videos de un segundo mostrados la semana pasada por Gen-1.5, S1 esta vez lleva el aprendizaje contextual hasta un máximo de 10 minutos.
En tareas como el trasplante de plantas, cada tarea requiere completar decenas de pasos de forma continua. En las demostraciones de estas tareas de largo alcance, el robot no solo necesita imitar, sino también saber:
¿En qué paso estoy ahora, qué debo hacer a continuación, cómo combinar las habilidades y qué hacer si algo sale mal en el camino?
Es decir, el robot necesita comprender realmente la intención de las tareas y acciones en la demostración en video, reaccionar adecuadamente y adaptarse de forma dinámica, y no solo realizar clonación de comportamiento.
Además, en la tarea de trasplantar plantas, desde el inicio de la demostración hasta que el robot realizó la tarea por sí solo, solo se tardaron 11 minutos, superando directamente en eficiencia a los métodos tradicionales de entrenamiento posterior.
Finalmente, durante todo el proceso, S1 no utilizó fine-tuning ni post-training; los pesos del modelo permanecieron completamente inalterados, y con el mismo conjunto de pesos se completaron todas las tareas mostradas en el blog.
Se ha logrado una alineación básica con el avance de los modelos grandes, desde BERT, que requiere ajustes específicos para escenarios particulares, hasta GPT-3, que puede completar tareas OOD solo con ejemplos.
La única diferencia es que el prompt ya no es un idioma, sino videos de acciones que se alinean mejor con la tarea de destino.

Experimento: ¿Es ICL realmente más escalable?
En la sección experimental, Skild comparó el ICL video Prompt con el prompt de lenguaje tradicional VLA en tareas vistas y no vistas (en los datos de entrenamiento).

Los resultados de la prueba indican que, cuando los datos de entrenamiento son solo 1000 horas, el prompt lingüístico funciona mejor, pero a medida que aumenta el volumen de datos, el ICL comienza a superarlo.
Al llegar a 100,000 horas, en las tareas vistas durante el entrenamiento: ICL 96%, lenguaje Prompt 89%.
En la tarea crítica de OOD: ICL alcanza el 66%, mientras que el prompt de lenguaje solo alcanza el 9%, estableciendo una diferencia de más de 7 veces.
Para verificar la generalización de S1, Skild realizó pruebas bajo diferentes condiciones experimentales.

Los resultados muestran que la disminución del rendimiento del VLA con prompt lingüístico puede ser hasta tres veces mayor que la de ICL.
Es decir, lo que ICL aprende no es repetir acciones en escenarios fijos, sino replantear cómo actuar según el entorno actual.
Finalmente, en cuanto al aprendizaje de un solo disparo.
S1 no realiza ningún post-entrenamiento en la nueva tarea y logra un éxito del 66% solo con ver una demostración en video.

En comparación, el VLA tradicional requiere aproximadamente 380 iteraciones de entrenamiento posterior para alcanzar el mismo nivel.
Por supuesto, después de acumular 2000 demostraciones, el post-entrenamiento tradicional finalmente logra un 86%.
Entonces, la conclusión podría no ser "los robots ya no necesitarán entrenamiento en el futuro", sino:
Antes, una nueva habilidad podía requerir cientos de enseñanzas, pero ahora, con solo verla una vez, ya puedes lograr un 60 o 70 por ciento.
Este es también lo que Skild denomina la ley de escalado de ICL:
Cuanto más datos haya, el modelo no solo adquiere más habilidades, sino que cada vez aprende mejor "a partir de demostraciones".
¿Quién es Skild AI?
Skild se fundó en 2023, respaldada por dos conocidos del círculo de robótica de CMU: Deepak Pathak y Abhinav Gupta.

Ambos son profesores del Instituto de Robótica de la Universidad Carnegie Mellon; Deepak se enfoca principalmente en el aprendizaje de robots, el aprendizaje por refuerzo y la visión por computadora, mientras que Abhinav es un experto en visión por computadora y aprendizaje autosupervisado.
Ya en 2022, ambos colaboraron en WHIRL, permitiendo que los robots aprendieran imitación one-shot observando videos humanos; por lo tanto, esta línea de S1 no surgió de la nada.

Como empresa estrella del círculo de inteligencia corporal en Norteamérica, en 2024 Skild, apenas salió de su modo de invisibilidad, recaudó 300 millones de dólares en la ronda A con una valoración de 1.500 millones de dólares;
En enero de este año, se completó una ronda de financiación Serie C de 1.400 millones de dólares, elevando la valoración a más de 14.000 millones de dólares, con SoftBank como líder y NVIDIA, Bezos y otros continuando participando. En poco más de dos años, la valoración se aproximó a multiplicarse por diez.
En comparación horizontal, Skild tiene una posición bastante única en el ecosistema de embodiment de Norteamérica.
En comparación con PI, que parece más un "robot GPT", Generalist ha enfatizado recientemente el aprendizaje de un solo ejemplo, así como el impulso integral de Genesis AI y Sunday; Skild ha mantenido siempre un mismo mensaje: Any robot, any task, one brain.
Se enfatiza más la interoperabilidad entre embodiment, con el objetivo de que el mismo Skild Brain pueda ejecutarse en diferentes cuerpos, como brazos mecánicos, cuadrúpedos y humanoides.
Dicho de forma sencilla, quiere ser el Android de la era de los robots: una capa inteligente que se puede integrar en diversos cuerpos.
Esto también determina la estrategia de datos de Skild: quererlo todo.
Skild considera los datos del robot en tres dimensiones: proximidad de hardware, diversidad y escalabilidad:
El control remoto de dispositivos reales es el más cercano al hardware, pero es caro; los videos humanos en primera persona son los más fáciles de escalar, pero están muy lejos del cuerpo del robot; la simulación es barata y se puede producir en masa, pero presenta la brecha de sim-to-real.

Entonces, para Robot Teleop, UMI, Video Egocéntrico y Simulación, básicamente adoptan una estrategia de usar todos.
Y el ICL de S1 es, de hecho, una extensión natural de esta línea:

Septiembre de 2025: LocoFormer → Febrero de 2026: Primera ICL en el mismo dominio → Mayo: Primera vuelta de la crepe → Agosto: Lanzamiento de S1, llevando directamente el aprendizaje contextual a tareas OOD de largo alcance de hasta 10 minutos.
Entonces, la pregunta realmente relevante ahora podría no ser si los robots aún pueden aprender más habilidades, sino:
¿Puede el costo de enseñar una nueva habilidad a un robot realmente pasar de “enseñarla cientos de veces” a “tú lo haces una vez, y él lo observa una vez”?
Si esta ley de escalado sigue siendo válida, el llamado momento GPT de los robots podría realmente no ser solo otro eslogan de marketing.
Enlace de referencia: [1] https://www.skild.ai/blogs/s1
Este artículo proviene del canal de WeChat "Quantum Bit", autor: henry
