El misterioso modelo de IA 'Ox Alpha' genera especulaciones en OpenRouter

icon MarsBit
Compartir
AI summary iconResumen
Un modelo de IA misterioso llamado Ox Alpha ha aparecido en OpenRouter, llamando la atención por sus fuertes habilidades de programación y su anonimato. Conocido como “牛来” entre los usuarios chinos, admite entradas de texto, imagen y video y actualmente es gratuito. Los desarrolladores lo probaron en repositorios de código reales, obteniendo resultados cercanos a los de modelos de primer nivel. Algunos lo vinculan con GLM-5.3 de Zhipu AI. Otro modelo, korrine, se está probando en Code Arena, con teorías que lo conectan con Kimi K3.1 o MiMo V3. El análisis en cadena muestra un creciente interés en pruebas anónimas, lo que permite una evaluación imparcial y retroalimentación pública antes de los lanzamientos oficiales.

En el círculo de grandes modelos, es popular realizar pruebas "con máscaras".

Recientemente, un modelo anónimo llamado Ox Alpha apareció repentinamente en OpenRouter. «Ox» significa «toro», y los internautas chinos pronto le pusieron un nombre más coloquial:

Modelo «Bull Comes».

Según la divulgación de OpenRouter, Ox Alpha cuenta con 1 millón de tokens de contexto, admite entradas de texto, imágenes y videos, puede invocar herramientas y actualmente es completamente gratuito.

GLM

Poco después de su lanzamiento, el desarrollador lo integró con el agente de codificación y lo probó en un repositorio de código real.

Los resultados iniciales de las pruebas indican que este modelo de gran tamaño, de origen desconocido llamado "Niu Lai", ya se acerca a las capacidades de los mejores modelos de código actuales.

Mientras tanto, un usuario de internet reveló que un modelo anónimo llamado korrine está siendo probado en Code Arena. Algunos sospechan que es Kimi K3.1, algunos también lo asocian con Qwen y MiMo, y hay todo tipo de comentarios.

En agosto, el mundo de los grandes modelos se convirtió repentinamente en un gran juego de adivinanzas.

El modelo «Niu Lai» ha tenido un rendimiento destacado

Ox Alpha realmente llama la atención por su capacidad de programación.

El desarrollador Ben Davis probó 10 tareas extraídas de DeepSWE, y Ox Alpha completó 8 de ellas, logrando una tasa de aprobación del 80%. En los resultados comparativos publicados, Fable 5 Max obtuvo un 65%, GLM-5.3 Max y Grok 4.6 xhigh ambos obtuvieron un 62%, y GPT-5.6 Sol Max obtuvo un 52%.

GLM

DeepSWE evalúa las habilidades reales de ingeniería de software. El modelo debe leer repositorios de código, identificar problemas, modificar el código, ejecutar pruebas y corregir errores según los mensajes de error. En comparación con problemas de programación de una sola ronda, es más cercano al trabajo real de un agente de codificación.

Sin embargo, la muestra de 10 tareas es pequeña. Posteriormente, otros desarrolladores probaron en otro subconjunto de DeepSWE y obtuvieron resultados de aproximadamente el 63%. El alcance de las tareas y la configuración de ejecución en ambas pruebas no son idénticas, por lo que actualmente no se puede determinar con precisión el ranking de Ox Alpha.

GLM

Sin embargo, estos resultados iniciales muestran que este modelo anónimo ya ha demostrado un fuerte potencial de codificación a largo plazo, acercándose a las capacidades de los modelos líderes actuales.

¿De quién es el modelo de gran tamaño «Niu Lai»?

La identidad del modelo «Niu Lai» se ha difundido ampliamente como GLM-5.3 Flash, aún no lanzado por Zhipu, o la versión multimodal de GLM-5.3.

Alguien incluso escribió un blog para analizarlo:

1. La evidencia más contundente proviene del codificador de video. En cuatro videos con diferentes tasas de fotogramas, duraciones y resoluciones, Ox Alpha consumió los tokens visuales exactamente iguales a los de GLM-5V-Turbo. MiMo, Qwen y GLM-4.6V mostraron resultados claramente distintos.

2. El tokenizer de texto también muestra una alta coincidencia. Los investigadores probaron 25 conjuntos de prompts, y Ox Alpha mantuvo siempre una diferencia fija de 75 tokens con respecto a GLM-5.3.

3. Otras características también apuntan a Zhipu. Ox Alpha rechaza procesar audio, igual que el enrutamiento de GLM-5V; el estilo de respuesta, el número de pasos de ejecución del agente y la interfaz de razonamiento también son muy similares a GLM. Zhipu ya había utilizado anteriormente Pony Alpha para pruebas anónimas de GLM-5, lo que demuestra un precedente similar.

GLM

https://ox-alpha-evidence-production.up.railway.app/

También hay usuarios que encontraron pistas en la conversación.

GLM

Ben Davis está 99% seguro de que este es GLM-5.x.

GLM

Estas pistas aumentan la credibilidad de lo que dice GLM, pero aún no son suficientes para completar la confirmación de identidad.

Hasta el momento, OpenRouter y Zhipu no han respondido públicamente.

La identidad de Korrine es aún más enigmática

La identidad del modelo «Niu Lai» aún es incierta, y en Code Arena ha aparecido un modelo anónimo llamado korrine.

Inicialmente, muchos supusieron que era Kimi K3.1, debido a Kimi Antes del lanzamiento de K3, se creía que se probaba bajo el código kivine. Dado que kivine tiene una estructura similar a korrine, se generaron asociaciones.

GLM

Sin embargo, el informante original que difundió primero la noticia añadió posteriormente que el nuevo modelo Moonshot previamente conocido podría corresponder a otro código: adamant-ananke. Korrine también podría provenir de otros equipos chinos, como Qwen.

GLM

En los comentarios, todavía lo están vinculando con MiMo V3.

GLM

¿Por qué los fabricantes de modelos grandes les gustan "usar disfraces"?

Las pruebas anónimas se están convirtiendo en un componente importante antes del lanzamiento oficial de los modelos grandes.

Ocultar fabricantes y modelos en Arena puede reducir al mínimo el sesgo previo generado por la marca. Al no ver la identidad del modelo, los usuarios solo pueden elegir según el rendimiento real, y los resultados de las batallas acumuladas reflejan con mayor precisión la experiencia real del usuario.

OpenRouter ofrece un entorno de prueba diferente.

Los desarrolladores integrarán el modelo en diversos agentes de codificación para que acceda a repositorios reales, llame continuamente a herramientas y maneje tareas de ingeniería de software que duran varias horas. La estabilidad del contexto, la confiabilidad de las llamadas a herramientas y si el modelo se cicla o se desvía durante tareas de larga duración se exponen rápidamente bajo uso intensivo.

Para los fabricantes de modelos, esto equivale a una prueba de estrés pública. El equipo puede observar con anticipación los casos de fallo, validar la capacidad de carga del servicio de inferencia y acumular reputación real antes del lanzamiento oficial.

Además, "adivinar el modelo" también se está volviendo cada vez más una estrategia de marketing, ya que el misterio sobre la identidad realmente puede prolongar el ciclo de discusión.

Finalmente, volvamos al modelo en sí. Si Ox Alpha es realmente un modelo Flash cuya capacidad de codificación ya se acerca al nivel líder, ¿dónde elevaría el límite la versión completa, con mayores inversiones de recursos y capacidades más completas?

Enlace de referencia:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Este artículo proviene del número de WeChat "Machine Heart" (ID: almosthuman2014), autor: interesado en IA

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.