В кругах больших моделей популярно «тестирование с использованием маскировки».
Недавно анонимная модель под названием Ox Alpha внезапно появилась на OpenRouter. «Ox» само по себе означает «бык», и китайские пользователи быстро дали ей более простое название:
Модель «Нью Лай».
Согласно информации, раскрытой OpenRouter, Ox Alpha имеет контекст из 1 миллиона токенов, поддерживает ввод текста, изображений и видео, может вызывать инструменты и сейчас полностью бесплатен.

Вскоре после запуска разработчики подключили его к кодирующему агенту и протестировали в реальном репозитории кода.
Предварительные результаты тестирования показывают, что эта неизвестная крупномасштабная модель «Нюлай» достигла уровня, близкого к текущим ведущим моделям для кода.
В то же время пользователи в сети сообщили, что анонимная модель под названием korrine тестируется на Code Arena. Некоторые предполагают, что это Кими K3.1, некоторые также связывают его с Qwen и MiMo, говорят всякое.
В августе рынок крупных моделей внезапно превратился в масштабную игру в угадывание.
Модель «Нью Лай» показала отличные результаты
Ox Alpha действительно привлек внимание благодаря своим навыкам программирования.
Разработчик Бен Дэвис протестировал 10 задач, извлеченных из DeepSWE; Ox Alpha успешно выполнила 8 из них, что составляет показатель прохождения 80%. В опубликованных результатах сравнения Fable 5 Max показал 65%, GLM-5.3 Max и Grok 4.6 xhigh — по 62%, а GPT-5.6 Sol Max — 52%.

DeepSWE оценивает реальные навыки программной инженерии. Модель должна анализировать репозиторий кода, находить проблемы, вносить изменения, запускать тесты и устранять ошибки на основе сообщений об ошибках. В отличие от однократных задач по программированию, он лучше отражает реальную работу агента-программиста.
Однако выборка из 10 задач мала. Впоследствии другие разработчики протестировали другую подвыборку DeepSWE, получив результат около 63%. Диапазон задач и конфигурации запуска в обоих тестах не идентичны, поэтому на данный момент невозможно точно определить рейтинг Ox Alpha.

Однако эти предварительные результаты показывают, что эта анонимная модель уже демонстрирует значительный потенциал в длиннотерминовом кодировании, приближаясь по возможностям к ведущим моделям текущего времени.
Кто является владельцем большой модели «Ню Лай»?
Личность большой модели «Ню Лай» наиболее широко распространяется как еще не выпущенная智谱 GLM-5.3 Flash или мультимодальная версия GLM-5.3.
Кто-то даже написал отдельный блог для анализа:
1. Самые убедительные доказательства поступают из видеокодека. В четырех видео с разной частотой кадров, длительностью и разрешением Ox Alpha потреблял визуальные токены абсолютно идентично GLM-5V-Turbo. MiMo, Qwen и GLM-4.6V показали явно отличающиеся результаты.
2. Токенизатор текста также демонстрирует высокую согласованность. Исследователи протестировали 25 наборов подсказок, и разница в количестве токенов между Ox Alpha и GLM-5.3 постоянно составляла ровно 75 токенов.
3. Другие признаки также указывают на Zhipu. Ox Alpha отклоняет обработку аудио, как и GLM-5V; стиль ответов, количество шагов выполнения агента и интерфейс рассуждений также очень близки к GLM. Ранее Zhipu уже использовала Pony Alpha для анонимного тестирования GLM-5, что свидетельствует о наличии аналогичного опыта.

https://ox-alpha-evidence-production.up.railway.app/
Также пользователи сети нашли намеки в диалоге.

Бен Дэвис считает на 99% уверенным, что это GLM-5.x.

Эти подсказки повысили достоверность утверждений GLM, но недостаточны для полной идентификации.
На данный момент OpenRouter и Zhipu не сделали публичных комментариев.
Личность Korrine остается еще более загадочной
Личность большой модели «Ню Лай» остается неясной, и в Code Arena появилась еще одна анонимная модель под названием korrine.
Изначально многие предполагали, что это Кими K3.1, причина Кими Перед выпуском K3 она считалась проходившей тестирование под кодовым именем kivine. Поскольку kivine имеет схожую структуру с korrine, это вызвало ассоциации.

Однако первоначальный источник информации позже уточнил, что ранее упомянутая новая модель Moonshot может соответствовать другому кодовому имени — adamant-ananke. Korrine также может происходить от других китайских команд, таких как Qwen.

В комментариях кто-то также указывает на MiMo V3.

Почему производители крупных моделей любят «носить маски»?
Анонимное тестирование становится важным этапом перед официальным запуском крупных моделей.
Скрытие производителя и модели в Arena помогает минимизировать предвзятость, связанную с брендом. Пользователи не видят идентичность модели и могут выбирать только на основе реальных результатов, а накопленные результаты битв более точно отражают реальный пользовательский опыт.
OpenRouter предоставляет другой тип тестовой среды.
Разработчики подключат модель к различным кодировочным агентам, чтобы она входила в реальные репозитории, последовательно вызывала инструменты и выполняла задачи по программной инженерии, длящиеся несколько часов. Стабильность контекста, надежность вызовов инструментов и возможность модели зацикливаться или сбиваться с курса в ходе длительных задач быстро проявляются при интенсивном использовании.
Для производителей моделей это эквивалентно публичному стресс-тесту. Команда может заранее наблюдать за случаями сбоев, проверить нагрузочную способность сервиса вывода и накопить реальные отзывы до официального запуска.
Кроме того, «угадай модель» все чаще становится маркетинговым инструментом, поскольку интрига вокруг личности действительно продлевает цикл обсуждений.
Вернемся к самой модели. Если Ox Alpha действительно является флеш-моделью, чьи кодовые способности уже приближаются к уровню ведущих, то как далеко сможет продвинуться верхний предел полной версии с более значительными ресурсами и более полными возможностями?
Ссылка для справки:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
Эта статья с веб-сайта WeChat «Machine Heart» (ID: almosthuman2014), автор: следящий за ИИ
