En el círculo de grandes modelos, es popular realizar pruebas "con máscaras".
Recientemente, un modelo anónimo llamado Ox Alpha apareció repentinamente en OpenRouter. «Ox» significa «toro», y los internautas chinos pronto le pusieron un nombre más coloquial:
Modelo «Bull Comes».
Según la divulgación de OpenRouter, Ox Alpha cuenta con 1 millón de tokens de contexto, admite entradas de texto, imágenes y videos, puede invocar herramientas y actualmente es completamente gratuito.

Poco después de su lanzamiento, el desarrollador lo integró con el agente de codificación y lo probó en un repositorio de código real.
Los resultados iniciales de las pruebas indican que este modelo de gran tamaño, de origen desconocido llamado "Niu Lai", ya se acerca a las capacidades de los mejores modelos de código actuales.
Mientras tanto, un usuario de internet reveló que un modelo anónimo llamado korrine está siendo probado en Code Arena. Algunos sospechan que es Kimi K3.1, algunos también lo asocian con Qwen y MiMo, y hay todo tipo de comentarios.
En agosto, el mundo de los grandes modelos se convirtió repentinamente en un gran juego de adivinanzas.
El modelo «Niu Lai» ha tenido un rendimiento destacado
Ox Alpha realmente llama la atención por su capacidad de programación.
El desarrollador Ben Davis probó 10 tareas extraídas de DeepSWE, y Ox Alpha completó 8 de ellas, logrando una tasa de aprobación del 80%. En los resultados comparativos publicados, Fable 5 Max obtuvo un 65%, GLM-5.3 Max y Grok 4.6 xhigh ambos obtuvieron un 62%, y GPT-5.6 Sol Max obtuvo un 52%.

DeepSWE evalúa las habilidades reales de ingeniería de software. El modelo debe leer repositorios de código, identificar problemas, modificar el código, ejecutar pruebas y corregir errores según los mensajes de error. En comparación con problemas de programación de una sola ronda, es más cercano al trabajo real de un agente de codificación.
Sin embargo, la muestra de 10 tareas es pequeña. Posteriormente, otros desarrolladores probaron en otro subconjunto de DeepSWE y obtuvieron resultados de aproximadamente el 63%. El alcance de las tareas y la configuración de ejecución en ambas pruebas no son idénticas, por lo que actualmente no se puede determinar con precisión el ranking de Ox Alpha.

Sin embargo, estos resultados iniciales muestran que este modelo anónimo ya ha demostrado un fuerte potencial de codificación a largo plazo, acercándose a las capacidades de los modelos líderes actuales.
¿De quién es el modelo de gran tamaño «Niu Lai»?
La identidad del modelo «Niu Lai» se ha difundido ampliamente como GLM-5.3 Flash, aún no lanzado por Zhipu, o la versión multimodal de GLM-5.3.
Alguien incluso escribió un blog para analizarlo:
1. La evidencia más contundente proviene del codificador de video. En cuatro videos con diferentes tasas de fotogramas, duraciones y resoluciones, Ox Alpha consumió los tokens visuales exactamente iguales a los de GLM-5V-Turbo. MiMo, Qwen y GLM-4.6V mostraron resultados claramente distintos.
2. El tokenizer de texto también muestra una alta coincidencia. Los investigadores probaron 25 conjuntos de prompts, y Ox Alpha mantuvo siempre una diferencia fija de 75 tokens con respecto a GLM-5.3.
3. Otras características también apuntan a Zhipu. Ox Alpha rechaza procesar audio, igual que el enrutamiento de GLM-5V; el estilo de respuesta, el número de pasos de ejecución del agente y la interfaz de razonamiento también son muy similares a GLM. Zhipu ya había utilizado anteriormente Pony Alpha para pruebas anónimas de GLM-5, lo que demuestra un precedente similar.

https://ox-alpha-evidence-production.up.railway.app/
También hay usuarios que encontraron pistas en la conversación.

Ben Davis está 99% seguro de que este es GLM-5.x.

Estas pistas aumentan la credibilidad de lo que dice GLM, pero aún no son suficientes para completar la confirmación de identidad.
Hasta el momento, OpenRouter y Zhipu no han respondido públicamente.
La identidad de Korrine es aún más enigmática
La identidad del modelo «Niu Lai» aún es incierta, y en Code Arena ha aparecido un modelo anónimo llamado korrine.
Inicialmente, muchos supusieron que era Kimi K3.1, debido a Kimi Antes del lanzamiento de K3, se creía que se probaba bajo el código kivine. Dado que kivine tiene una estructura similar a korrine, se generaron asociaciones.

Sin embargo, el informante original que difundió primero la noticia añadió posteriormente que el nuevo modelo Moonshot previamente conocido podría corresponder a otro código: adamant-ananke. Korrine también podría provenir de otros equipos chinos, como Qwen.

En los comentarios, todavía lo están vinculando con MiMo V3.

¿Por qué los fabricantes de modelos grandes les gustan "usar disfraces"?
Las pruebas anónimas se están convirtiendo en un componente importante antes del lanzamiento oficial de los modelos grandes.
Ocultar fabricantes y modelos en Arena puede reducir al mínimo el sesgo previo generado por la marca. Al no ver la identidad del modelo, los usuarios solo pueden elegir según el rendimiento real, y los resultados de las batallas acumuladas reflejan con mayor precisión la experiencia real del usuario.
OpenRouter ofrece un entorno de prueba diferente.
Los desarrolladores integrarán el modelo en diversos agentes de codificación para que acceda a repositorios reales, llame continuamente a herramientas y maneje tareas de ingeniería de software que duran varias horas. La estabilidad del contexto, la confiabilidad de las llamadas a herramientas y si el modelo se cicla o se desvía durante tareas de larga duración se exponen rápidamente bajo uso intensivo.
Para los fabricantes de modelos, esto equivale a una prueba de estrés pública. El equipo puede observar con anticipación los casos de fallo, validar la capacidad de carga del servicio de inferencia y acumular reputación real antes del lanzamiento oficial.
Además, "adivinar el modelo" también se está volviendo cada vez más una estrategia de marketing, ya que el misterio sobre la identidad realmente puede prolongar el ciclo de discusión.
Finalmente, volvamos al modelo en sí. Si Ox Alpha es realmente un modelo Flash cuya capacidad de codificación ya se acerca al nivel líder, ¿dónde elevaría el límite la versión completa, con mayores inversiones de recursos y capacidades más completas?
Enlace de referencia:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
Este artículo proviene del número de WeChat "Machine Heart" (ID: almosthuman2014), autor: interesado en IA
