Skild AI lança o modelo de robô S1 com aprendizado de contexto de 10 minutos

icon MarsBit
Compartilhar
AI summary iconResumo
Notícias de IA + cripto explodiram com o lançamento do modelo de robô S1 da Skild AI, que usa aprendizado por contexto para realizar tarefas complexas a partir de uma única demonstração. O modelo alcançou uma taxa de sucesso de 66% em tarefas não vistas, muito acima dos métodos tradicionais de VLA, que atingem 9%. O S1 elimina a necessidade de centenas de exemplos de treinamento, reduzindo drasticamente o tempo de aprendizado. Novos lançamentos de tokens em exchanges frequentemente refletem avanços tecnológicos, e esse desenvolvimento pode influenciar projetos futuros relacionados a IA no espaço cripto.

O grande resultado da inteligência embodiada está chegando!!!

Desde que o Generalist lançou, na semana passada, o cérebro embutido Gen 1.5 capaz de aprender ações de 3 a 12 segundos~

Há pouco, a startup norte-americana de embodiement Skild AI lançou o novo modelo base de robô S1, aumentando diretamente o comprimento da tarefa de aprendizado de contexto do robô para mais de 10 minutos.

Skild AI

Este S1 destaca o aprendizado em contexto (in-context learning, ICL):

Não é necessário aprender especificamente novos dados de operação durante a fase de pós-treinamento; apenas assistindo a um vídeo de demonstração humana, é possível “imitar” e realizar diretamente uma sequência completa de operações complexas nunca vistas antes.

Na demonstração oficial, o robô concluiu tarefas de longo prazo, como preparar panquecas, preparar café, transplantar plantas e montar equipamentos. Além disso, alcançou uma taxa de sucesso de 66% em tarefas nunca vistas antes, superando em muito as VLA baseadas em instruções de linguagem (apenas 9%).

Além disso, mesmo seguindo a abordagem tradicional de fine-tuning pós-treinamento, para igualar o desempenho do S1 com apenas uma demonstração, provavelmente será necessário fornecer cerca de 380 demonstrações de tarefas.

Muito amazing!

Pode-se dizer que esta última onda de trabalhos focados em aprendizado contextual reacendeu a esperança de muitos em relação ao embasamento.

Um usuário do Twitter afirmou que robôs universais podem surgir em dois anos, e não em sete.

Skild AI

Outros usuários também mencionaram que, da Rhoda, ao Generalist da semana passada, e agora às tarefas de 10 minutos do Skild S1, o verdadeiro momento GPT do robô parece estar surgindo.

Skild AI

Porque, uma vez que essa capacidade realmente se generalizar, desenvolver habilidades para robôs poderá se tornar realmente como escrever prompts para o ChatGPT.

Skild AI

É realmente tão incrível assim? Vamos dar uma olhada.

Do era BERT para a era GPT

Para entender como o S1 está aprendendo neste contexto, primeiro precisamos ver como os robôs tradicionais aprendem uma nova habilidade.

No pipeline tradicional, o aprendizado de robôs é na verdade semelhante ao dos grandes modelos:

Primeiro, faça o pré-treinamento em grandes volumes de dados para adquirir habilidades básicas; depois, em cenários específicos, colete dados para uma tarefa em particular e realize o pós-treinamento para que o robô aprenda habilidades especializadas.

Skild AI

Apenas o problema é que, embora os robôs e os grandes modelos tenham processos semelhantes, os custos de dados são completamente diferentes.

Os dados de pré-treinamento de grandes modelos são amplamente obtidos da internet; mesmo em cenários especializados, como programação e Agent, muitos dados de pós-treinamento podem ser obtidos rapidamente online ou até gerados automaticamente.

Mas os robôs têm mais dificuldade. Os dados de pré-treinamento precisam ser coletados no mundo real, e os dados de pós-treinamento também precisam ser coletados no mundo real.

Então, no blog técnico, a Skild AI simplesmente falou diretamente:

Se um modelo base de robô ainda precisar de dezenas ou centenas de horas de dados reais para aprender cada nova tarefa e depois ser treinado novamente, eu gostaria de perguntar: onde está a “base” desse “modelo base”?

Eles até citaram estudos existentes que indicam que, se houver dados suficientes para uma nova tarefa, um modelo treinado do zero pode até igualar o desempenho de modelos base pré-treinados e finetunados.

Então, qual é realmente o significado do pré-treinamento embodied?

A resposta dada por Skild é: aprendizado de contexto.

Para ter um ponto de referência, Skild trouxe a linha de desenvolvimento dos grandes modelos como comparação.

O BERT inicial já era muito poderoso, mas, ao enfrentar uma nova tarefa, geralmente era necessário preparar os dados novamente e fazer um novo fine-tuning.

O que realmente mudou o jogo foi a capacidade de aprendizado contextual que se tornou progressivamente evidente após o GPT-3:

Não é necessário alterar os pesos do modelo; apenas fornecendo alguns exemplos no prompt, o modelo pode “aprender” temporariamente uma nova tarefa.

Skild AI

Com base nisso, Skild acredita que os robôs ainda estão presos em uma era semelhante à do BERT, e o que realmente desejam é permitir que os robôs também realizem essa mesma transformação de paradigma.

Ou seja, o verdadeiro valor do pré-treinamento não deve ser apenas reduzir a quantidade de dados necessários para o treinamento posterior, mas sim permitir que o agente adquira finalmente a capacidade de “aprender diretamente do contexto”.

Aprendizado por contexto

Então, o que o S1 aprendeu realmente do contexto desta vez?

Skild acredita que, na verdade, existem apenas duas dimensões que podem testar verdadeiramente a capacidade de aprendizado de contexto dos robôs:

Um é se é possível aprender novas habilidades que nunca foram vistas durante o treinamento; o outro é se é possível recombinar habilidades já existentes para concluir uma nova tarefa longa e complexa.

Por exemplo, o robô só precisa assistir a um vídeo de virar panquecas para aprender a fazê-las—

Mesmo que essa habilidade nunca tenha aparecido em seus dados de treinamento anteriormente.

Ao mesmo tempo, em comparação com os vídeos em segundos apresentados pelo Gen-1.5 na semana passada, o S1 agora eleva o aprendizado de contexto para até 10 minutos.

Em tarefas como a transplantação de plantas, cada tarefa exige a conclusão contínua de dezenas de etapas. Nas demonstrações dessas tarefas de longo prazo, o robô não precisa apenas imitar, mas também precisa saber:

Em que etapa eu estou agora, o que devo fazer a seguir, como combinar as habilidades e como continuar se algo der errado no meio do caminho.

Ou seja, o robô precisa realmente compreender a intenção das tarefas e ações no vídeo demonstrativo, reagindo de forma adaptativa e não apenas realizando clonagem de comportamento.

Além disso, na tarefa de transplante de plantas, desde o início da demonstração até o robô executar sozinho, foram gastos apenas 11 minutos, superando diretamente a eficiência do treinamento tradicional.

Por fim, em todo o processo, o S1 não utilizou fine-tuning nem post-training; os pesos do modelo permaneceram inalterados, e com o mesmo conjunto de pesos, foram concluídas todas as tarefas apresentadas no blog.

Atingiu-se basicamente a transição dos grandes modelos, que antes exigiam ajuste específico para cenários particulares como o BERT, até o GPT-3, que consegue realizar tarefas OOD apenas com demonstrações.

A única diferença é que o prompt usado não é mais linguístico, mas sim vídeos de ações que se alinham melhor às tarefas de baixo nível.

Skild AI

Experiment: ICL is really better at scaling?

Na seção experimental, o Skild comparou o ICL video Prompt com o tradicional language Prompt VLA em tarefas vistas e não vistas nos dados de treinamento.

Skild AI

Os resultados do teste indicam que, quando os dados de treinamento são apenas 1.000 horas, o prompt de linguagem apresenta melhor desempenho, mas à medida que o volume de dados aumenta, o ICL começa a superá-lo.

Ao atingir 100.000 horas, o desempenho nas tarefas vistas durante o treinamento: ICL 96%, Language Prompt 89%.

Na tarefa crítica real de OOD: ICL 66%, prompt de linguagem apenas 9%, criando uma diferença de mais de 7 vezes.

Para verificar a generalização do S1, o Skild realizou testes em diferentes condições experimentais.

Skild AI

Os resultados mostram que a queda de desempenho do Prompt VLA de linguagem pode ser até três vezes maior que a do ICL.

Ou seja, o ICL não aprende a repetir ações em cenários fixos, mas sim a replanejar suas ações de acordo com o ambiente atual.

Por fim, no que diz respeito ao aprendizado one-shot.

S1 não realiza nenhum pós-treinamento na nova tarefa e, ao observar apenas uma demonstração em vídeo, alcança uma taxa de sucesso de 66%.

Skild AI

Em comparação, o VLA tradicional precisa de aproximadamente 380 iterações de pós-treinamento para alcançar o mesmo nível.

Claro, continuar empilhando até 2000 demonstrações, o pós-treinamento tradicional finalmente alcança 86%.

Então a conclusão pode não ser “os robôs não precisarão mais ser treinados”, mas sim:

Antes, uma nova habilidade precisava ser ensinada centenas de vezes; agora, após ver apenas uma vez, já é possível executá-la com 60 ou 70 pontos.

Essa é também a lei de escala ICL mencionada por Skild:

Quanto mais dados, mais o modelo não apenas adquire mais habilidades, mas também se torna cada vez melhor em "aprender habilidades a partir de demonstrações".

Quem é o Skild AI?

Skild foi fundada em 2023 por dois conhecidos do círculo de robótica da CMU: Deepak Pathak e Abhinav Gupta.

Skild AI

Ambos são professores do Instituto de Robótica da Universidade Carnegie Mellon; Deepak se concentra principalmente em aprendizado de robôs, aprendizado por reforço e visão computacional, enquanto Abhinav é um especialista em visão computacional e aprendizado autossupervisionado.

Já em 2022, os dois haviam colaborado no WHIRL, permitindo que robôs aprendessem imitação one-shot assistindo a vídeos humanos; pode-se dizer que essa linha S1 não surgiu do nada.

Skild AI

Como uma empresa estrela do ecossistema de entidades na América do Norte, a Skild acabou de sair do modo invisível em 2024, arrecadando US$ 300 milhões na rodada A com uma avaliação de US$ 1,5 bilhão;

Até janeiro deste ano, foi concluída uma rodada de financiamento série C de US$ 1,4 bilhão, elevando a avaliação diretamente para mais de US$ 14 bilhões, com a SoftBank liderando e NVIDIA, Bezos e outros continuando a participar. Em mais de dois anos, a avaliação quase dobrou dez vezes.

Em uma comparação horizontal, o Skild também possui uma posição bastante única no ecossistema de entidades na América do Norte.

Em comparação com o PI, que parece mais focado em “robôs GPT”, o Generalist recentemente enfatizou o aprendizado de um único exemplo, bem como o impulso full-stack da Genesis AI e da Sunday. O Skild sempre enfatizou uma única frase: Any robot, any task, one brain.

Ele enfatiza mais a跨embodiment, desejando que o mesmo Skild Brain possa operar em diferentes corpos, como braços mecânicos, quadrúpedes e humanoides.

Dito de forma mais simples, é querer se tornar o Android da era dos robôs: uma camada inteligente que pode ser inserida em diversos corpos diferentes.

Isso também determina a estratégia de dados da Skild: querer tudo.

Skild considera os dados do robô em três dimensões: proximidade de hardware, diversidade e escalabilidade:

Controle remoto de dispositivos reais é o mais próximo do hardware, mas caro; vídeos humanos em primeira pessoa são os mais fáceis de escalar, mas estão muito distantes do corpo robótico; simulação é barata e pode ser produzida em grande escala, mas apresenta a lacuna sim-to-real.

Skild AI

Então, eles adotam basicamente a estratégia de usar todos para Robot Teleop, UMI, Egocentric Video e Simulação.

E o ICL do S1 é, na verdade, uma extensão natural dessa linha:

Skild AI

Setembro de 2025: LocoFormer → Fevereiro de 2026: Primeiro ICL no Domínio → Maio: Primeira virada da panqueca → Agosto: Lançamento do S1, levando diretamente o aprendizado de contexto a tarefas de longo prazo OOD de até 10 minutos.

Então, a questão realmente relevante agora pode não ser se os robôs ainda podem aprender mais habilidades, mas:

O custo de ensinar uma nova habilidade a um robô pode realmente passar de “ensinar centenas de vezes” para “você faz uma vez, ele observa uma vez”?

Se essa lei de escala continuar válida, o chamado momento GPT dos robôs pode realmente não ser apenas mais um clichê de marketing.

Link de referência: [1] https://www.skild.ai/blogs/s1

Este artigo é do canal do WeChat "Quantum Bit", autor: henry

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.