Таинственная модель ИИ 'Ox Alpha' вызывает спекуляции на OpenRouter

icon MarsBit
Поделиться
AI summary iconСводка
Таинственная модель ИИ под названием Ox Alpha появилась на OpenRouter, привлекая внимание своими сильными навыками программирования и анонимностью. Среди китайских пользователей она известна как «牛来», поддерживает текстовые, изображения и видео-входы и в настоящее время бесплатна. Разработчики протестировали её на реальных репозиториях кода, получив результаты, близкие к топовым моделям. Некоторые связывают её с GLM-5.3 от Zhipu AI. Другая модель, korrine, тестируется на Code Arena, и существуют теории, связывающие её с Kimi K3.1 или MiMo V3. Анализ в цепочке показывает растущий интерес к анонимному тестированию, что позволяет проводить объективную оценку и собирать общественные отзывы до официального выпуска.

В кругах больших моделей популярно «тестирование с использованием маскировки».

Недавно анонимная модель под названием Ox Alpha внезапно появилась на OpenRouter. «Ox» само по себе означает «бык», и китайские пользователи быстро дали ей более простое название:

Модель «Нью Лай».

Согласно информации, раскрытой OpenRouter, Ox Alpha имеет контекст из 1 миллиона токенов, поддерживает ввод текста, изображений и видео, может вызывать инструменты и сейчас полностью бесплатен.

GLM

Вскоре после запуска разработчики подключили его к кодирующему агенту и протестировали в реальном репозитории кода.

Предварительные результаты тестирования показывают, что эта неизвестная крупномасштабная модель «Нюлай» достигла уровня, близкого к текущим ведущим моделям для кода.

В то же время пользователи в сети сообщили, что анонимная модель под названием korrine тестируется на Code Arena. Некоторые предполагают, что это Кими K3.1, некоторые также связывают его с Qwen и MiMo, говорят всякое.

В августе рынок крупных моделей внезапно превратился в масштабную игру в угадывание.

Модель «Нью Лай» показала отличные результаты

Ox Alpha действительно привлек внимание благодаря своим навыкам программирования.

Разработчик Бен Дэвис протестировал 10 задач, извлеченных из DeepSWE; Ox Alpha успешно выполнила 8 из них, что составляет показатель прохождения 80%. В опубликованных результатах сравнения Fable 5 Max показал 65%, GLM-5.3 Max и Grok 4.6 xhigh — по 62%, а GPT-5.6 Sol Max — 52%.

GLM

DeepSWE оценивает реальные навыки программной инженерии. Модель должна анализировать репозиторий кода, находить проблемы, вносить изменения, запускать тесты и устранять ошибки на основе сообщений об ошибках. В отличие от однократных задач по программированию, он лучше отражает реальную работу агента-программиста.

Однако выборка из 10 задач мала. Впоследствии другие разработчики протестировали другую подвыборку DeepSWE, получив результат около 63%. Диапазон задач и конфигурации запуска в обоих тестах не идентичны, поэтому на данный момент невозможно точно определить рейтинг Ox Alpha.

GLM

Однако эти предварительные результаты показывают, что эта анонимная модель уже демонстрирует значительный потенциал в длиннотерминовом кодировании, приближаясь по возможностям к ведущим моделям текущего времени.

Кто является владельцем большой модели «Ню Лай»?

Личность большой модели «Ню Лай» наиболее широко распространяется как еще не выпущенная智谱 GLM-5.3 Flash или мультимодальная версия GLM-5.3.

Кто-то даже написал отдельный блог для анализа:

1. Самые убедительные доказательства поступают из видеокодека. В четырех видео с разной частотой кадров, длительностью и разрешением Ox Alpha потреблял визуальные токены абсолютно идентично GLM-5V-Turbo. MiMo, Qwen и GLM-4.6V показали явно отличающиеся результаты.

2. Токенизатор текста также демонстрирует высокую согласованность. Исследователи протестировали 25 наборов подсказок, и разница в количестве токенов между Ox Alpha и GLM-5.3 постоянно составляла ровно 75 токенов.

3. Другие признаки также указывают на Zhipu. Ox Alpha отклоняет обработку аудио, как и GLM-5V; стиль ответов, количество шагов выполнения агента и интерфейс рассуждений также очень близки к GLM. Ранее Zhipu уже использовала Pony Alpha для анонимного тестирования GLM-5, что свидетельствует о наличии аналогичного опыта.

GLM

https://ox-alpha-evidence-production.up.railway.app/

Также пользователи сети нашли намеки в диалоге.

GLM

Бен Дэвис считает на 99% уверенным, что это GLM-5.x.

GLM

Эти подсказки повысили достоверность утверждений GLM, но недостаточны для полной идентификации.

На данный момент OpenRouter и Zhipu не сделали публичных комментариев.

Личность Korrine остается еще более загадочной

Личность большой модели «Ню Лай» остается неясной, и в Code Arena появилась еще одна анонимная модель под названием korrine.

Изначально многие предполагали, что это Кими K3.1, причина Кими Перед выпуском K3 она считалась проходившей тестирование под кодовым именем kivine. Поскольку kivine имеет схожую структуру с korrine, это вызвало ассоциации.

GLM

Однако первоначальный источник информации позже уточнил, что ранее упомянутая новая модель Moonshot может соответствовать другому кодовому имени — adamant-ananke. Korrine также может происходить от других китайских команд, таких как Qwen.

GLM

В комментариях кто-то также указывает на MiMo V3.

GLM

Почему производители крупных моделей любят «носить маски»?

Анонимное тестирование становится важным этапом перед официальным запуском крупных моделей.

Скрытие производителя и модели в Arena помогает минимизировать предвзятость, связанную с брендом. Пользователи не видят идентичность модели и могут выбирать только на основе реальных результатов, а накопленные результаты битв более точно отражают реальный пользовательский опыт.

OpenRouter предоставляет другой тип тестовой среды.

Разработчики подключат модель к различным кодировочным агентам, чтобы она входила в реальные репозитории, последовательно вызывала инструменты и выполняла задачи по программной инженерии, длящиеся несколько часов. Стабильность контекста, надежность вызовов инструментов и возможность модели зацикливаться или сбиваться с курса в ходе длительных задач быстро проявляются при интенсивном использовании.

Для производителей моделей это эквивалентно публичному стресс-тесту. Команда может заранее наблюдать за случаями сбоев, проверить нагрузочную способность сервиса вывода и накопить реальные отзывы до официального запуска.

Кроме того, «угадай модель» все чаще становится маркетинговым инструментом, поскольку интрига вокруг личности действительно продлевает цикл обсуждений.

Вернемся к самой модели. Если Ox Alpha действительно является флеш-моделью, чьи кодовые способности уже приближаются к уровню ведущих, то как далеко сможет продвинуться верхний предел полной версии с более значительными ресурсами и более полными возможностями?

Ссылка для справки:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Эта статья с веб-сайта WeChat «Machine Heart» (ID: almosthuman2014), автор: следящий за ИИ

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.