Braços robóticos têm uma história bem documentada de serem frustrantemente ruins em pegar coisas. O Claude Fable 5.1 da Anthropic, lançado em 1º de setembro de 2026, acabou de causar uma significativa redução nesse problema.
O modelo alcança uma taxa de sucesso de 40% em tarefas de pegar e colocar robóticas, em comparação com 5% de seu antecessor, Claude Fable 5.
O que mudou por baixo dos panos
O Fable 5.1 é projetado para trabalho agente de longo prazo, a categoria de tarefas em que um modelo precisa planejar, executar e recuperar-se ao longo de muitos passos sem a intervenção humana. Pipelines de codificação, fluxos de trabalho de pesquisa científica e automação empresarial complexa são os cenários-alvo.
Os números de referência refletem esse foco. No Terminal-Bench-Science, o Fable 5.1 obtém 52,6%, em comparação com 24,7% para o Fable 5. A conclusão estrita no OSWorld 2.0 aumenta de 36,1% para 41,7%. O AutomationBench, que testa automação de software em múltiplos passos, sobe de 17,1% para 31,4%.
Os comentários dos clientes após o lançamento refletiram a história de referência. Os usuários corporativos mencionaram especificamente a melhoria na confiabilidade em projetos que duram horas, e não minutos, com o modelo concluindo essas tarefas usando menos tokens do que as versões anteriores.
A matemática dos preços é mais interessante do que parece
O preço base para o Fable 5.1 permanece estável em $10 por milhão de tokens de entrada e $50 por milhão de tokens de saída, o mesmo que o modelo anterior.
O custo de leitura de cache caiu 75% para US$ 0,25 por milhão de tokens. A Anthropic estima que a redução de cache se traduz em aproximadamente 25% de poupança em cargas de trabalho típicas. Para pipelines agênticos mais complexos, as economias podem atingir 45%.
O modelo está disponível para usuários Pro, Max, Team e Enterprise e é acessível por meio da API e principais mercados de nuvem.
Por que o número de robótica merece sua própria conversa
A melhoria na seleção e colocação é o indicador principal, mas vale a pena refletir sobre por que esse benchmark específico é importante. A seleção e colocação é um proxy para a ancoragem no mundo físico: um modelo de IA consegue traduzir raciocínio abstrato em comandos motores precisos e reais? A tarefa envolve reconhecimento de objetos, raciocínio espacial, planejamento de agarre e recuperação de erros quando algo dá errado.
Uma taxa de sucesso de 5% é essencialmente ruído. Uma taxa de 40% ainda não é suficientemente boa para implantação industrial não supervisionada, mas ultrapassa o limiar em que a tecnologia se torna útil como camada de assistência humana, e não apenas uma curiosidade.
Contexto competitivo
Avaliadores independentes classificaram o Claude Fable 5.1 igual ou acima dos líderes anteriores em índices de inteligência logo após seu lançamento. O padrão de melhorias no Terminal-Bench-Science, OSWorld 2.0 e AutomationBench sugere que a Anthropic está direcionando seus esforços a clientes empresariais que executam fluxos de trabalho complexos, com múltiplos passos e duração de várias horas, em vez de consumidores fazendo perguntas rápidas.
