O misterioso modelo de IA 'Ox Alpha' gera especulações no OpenRouter

icon MarsBit
Compartilhar
AI summary iconResumo
Um modelo de IA misterioso chamado Ox Alpha apareceu no OpenRouter, atraindo atenção por suas fortes habilidades de codificação e anonimato. Conhecido como “牛来” entre usuários chineses, ele suporta entradas de texto, imagem e vídeo e está atualmente gratuito. Desenvolvedores o testaram em repositórios de código reais, com resultados próximos aos dos modelos de ponta. Alguns o associam ao GLM-5.3 da Zhipu AI. Outro modelo, korrine, está sendo testado no Code Arena, com teorias que o ligam ao Kimi K3.1 ou MiMo V3. Análises on-chain mostram crescente interesse em testes anônimos, permitindo avaliação imparcial e feedback público antes dos lançamentos oficiais.

No mundo dos grandes modelos, é comum realizar testes "com disfarce".

Recentemente, um modelo anônimo chamado Ox Alpha apareceu repentinamente no OpenRouter. "Ox" significa literalmente "boi", e internautas chineses logo lhe deram um nome mais popular:

Modelo "Bull Comes".

De acordo com as informações divulgadas pelo OpenRouter, o Ox Alpha possui 1 milhão de tokens de contexto, suporta entradas de texto, imagens e vídeos, pode chamar ferramentas e está atualmente totalmente gratuito.

GLM

Logo após o lançamento, os desenvolvedores integraram-no ao Agent de codificação e o colocaram em repositórios de código reais para teste.

Os resultados iniciais dos testes indicam que este grande modelo desconhecido, chamado "Niu Lai", já está próximo das capacidades dos principais modelos de código atuais.

Ao mesmo tempo, usuários da internet relataram que um modelo anônimo chamado korrine está sendo testado no Code Arena. Alguns acreditam que seja Kimi K3.1, algumas pessoas também o associam ao Qwen e ao MiMo, dizem de tudo.

O mercado de grandes modelos em agosto de repente se tornou um grande jogo de adivinhação.

O grande modelo "Bull Comes" se destacou

Ox Alpha realmente chamou atenção por sua capacidade de codificação.

O desenvolvedor Ben Davis testou 10 tarefas extraídas do DeepSWE, e o Ox Alpha completou 8 delas, alcançando uma taxa de aprovação de 80%. Nos resultados comparativos divulgados, o Fable 5 Max obteve 65%, GLM-5.3 Max e Grok 4.6 xhigh ambos obtiveram 62%, e o GPT-5.6 Sol Max obteve 52%.

GLM

DeepSWE avalia habilidades reais de engenharia de software. O modelo precisa ler repositórios de código, identificar problemas, modificar o código, executar testes e, com base nos erros retornados, continuar corrigindo. Em comparação com problemas de programação em uma única etapa, ele se aproxima mais do trabalho real de um agente de codificação.

No entanto, a amostra de 10 tarefas é pequena. Posteriormente, outros desenvolvedores testaram em outro subconjunto do DeepSWE, obtendo resultados de aproximadamente 63%. As tarefas e as configurações de execução dos dois testes não são idênticas, portanto, não é possível determinar atualmente a classificação exata do Ox Alpha.

GLM

No entanto, esses resultados iniciais indicam que este modelo anônimo já demonstrou forte potencial de codificação de longo prazo, aproximando-se dos modelos líderes atuais.

De quem é o grande modelo "Niu Lai"?

A identidade do modelo "Niu Lai" é mais amplamente difundida como o GLM-5.3 Flash, ainda não lançado pela Zhipu, ou a versão multimodal do GLM-5.3.

Alguém até escreveu um blogue específico para analisar:

1. A evidência mais forte vem do codificador de vídeo. Em quatro vídeos com diferentes taxas de quadros, durações e resoluções, o Ox Alpha consumiu os mesmos tokens visuais que o GLM-5V-Turbo. MiMo, Qwen e GLM-4.6V apresentaram resultados claramente diferentes.

2. O tokenizer de texto também apresenta alta correspondência. Os pesquisadores testaram 25 conjuntos de prompts, e o Ox Alpha mantém sempre uma diferença fixa de 75 tokens em relação ao GLM-5.3.

3. Outras características também apontam para Zhipu. O Ox Alpha recusa processar áudio, da mesma forma que o GLM-5V; o estilo de resposta, o número de passos de execução do Agente e a interface de raciocínio são muito próximos do GLM. A Zhipu já utilizou anteriormente o Pony Alpha para testes anônimos do GLM-5, possuindo um precedente operacional idêntico.

GLM

https://ox-alpha-evidence-production.up.railway.app/

Outros usuários também encontraram pistas na conversa.

GLM

Ben Davis acredita que há 99% de certeza de que este é o GLM-5.x.

GLM

Essas pistas aumentam a credibilidade do que o GLM disse, mas ainda não são suficientes para concluir a confirmação de identidade.

Até o momento, nem o OpenRouter nem o Zhipu responderam publicamente.

A identidade de korrine é ainda mais enigmática

A identidade do modelo «Niu Lai» ainda é incerta, e agora surgiu na Code Arena um modelo anônimo chamado korrine.

Inicialmente, muitos adivinharam que era Kimi K3.1, por causa de Kimi Antes do lançamento do K3, foi considerado que estava sendo testado sob o código kivine. O kivine tem estrutura semelhante ao korrine, o que gerou associações.

GLM

No entanto, o vazador que divulgou originalmente a notícia posteriormente acrescentou que o novo modelo Moonshot anteriormente conhecido pode corresponder a outro código, adamant-ananke. Korrine também pode vir de outras equipes chinesas, como Qwen.

GLM

Nos comentários, outras pessoas também o apontaram para o MiMo V3.

GLM

Por que as empresas de grandes modelos gostam de "usar disfarces"?

Os testes anônimos estão se tornando um componente importante antes do lançamento oficial de grandes modelos.

Ocultar fabricantes e modelos na Arena pode reduzir ao máximo o viés prévio trazido pela marca. Os usuários não veem a identidade do modelo e só podem escolher com base na saída real; os resultados acumulados das disputas também se aproximam mais da experiência real do usuário.

OpenRouter oferece um ambiente de teste diferente.

Os desenvolvedores integrarão o modelo a diversos agents de codificação, permitindo que ele acesse repositórios reais, chame ferramentas continuamente e execute tarefas de engenharia de software que duram várias horas. A estabilidade do contexto, a confiabilidade das chamadas de ferramentas e a tendência do modelo a entrar em ciclos ou se desviar durante tarefas de longa duração serão rapidamente expostas em uso intensivo.

Para os fabricantes de modelos, isso equivale a um teste de pressão público. A equipe pode observar casos de falha com antecedência, validar a capacidade de suporte dos serviços de inferência e acumular reputação real antes do lançamento oficial.

Além disso, "adivinhar o modelo" também está se tornando cada vez mais uma estratégia de marketing, pois a incerteza sobre a identidade realmente prolonga o ciclo de discussão.

Por fim, voltemos ao próprio modelo. Se o Ox Alpha for realmente um modelo Flash cuja capacidade de codificação já se aproxima do nível líder, onde a versão completa, com mais recursos e capacidades mais completas, levaria o limite?

Link de referência:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Este artigo é do canal do WeChat "Machine Heart" (ID: almosthuman2014), autor: interessado em IA

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.