Загадкова модель штучного інтелекту 'Ox Alpha' викликає припущення на OpenRouter

icon MarsBit
Поділитися
AI summary iconКороткий зміст
З’явився таємничий AI-модель під назвою Ox Alpha на OpenRouter, яка привернула увагу своїми сильними навичками програмування та анонімністю. Серед китайських користувачів її відома як «牛来». Вона підтримує вхідні дані у вигляді тексту, зображень та відео і зараз безкоштовна. Розробники протестували її на реальних репозиторіях коду, отримавши результати, близькі до найкращих моделей. Деякі пов’язують її з GLM-5.3 від Zhipu AI. Інша модель, korrine, тестується на Code Arena, і існують теорії, що вона пов’язана з Kimi K3.1 або MiMo V3. Аналіз у блокчейні показує зростаючий інтерес до анонімного тестування, що дозволяє проводити неупереджену оцінку та отримувати публічні відгуки до офіційного випуску.

У великих моделях поширена практика «тестування з масками».

Недавно анонімна модель під назвою Ox Alpha з’явилася на OpenRouter. Ox означає «бик», і китайські користувачі швидко дали їй більш зрозумілу назву:

Модель «Нюйлай».

Згідно з інформацією, оприлюдненою OpenRouter, Ox Alpha має 1 мільйон токенів контексту, підтримує введення тексту, зображень і відео, може викликати інструменти і зараз повністю безкоштовний.

GLM

Неодмінно після запуску розробники підключили його до кодового агента та запустили у реальний сховище коду для тестування.

Попередні результати тестування показують, що потужність цієї невідомої великої моделі «Нюлай» наближається до рівня найкращих сучасних моделей для коду.

Тим часом користувачі в мережі повідомили, що анонімна модель під назвою korrine тестується на Code Arena. Хтось припустив, що це Kimi K3.1, хтось також пов’язує його з Qwen і MiMo, і каже що завгодно.

У серпні світ великих моделей раптово перетворився на велику гру в відгадування загадок.

Велика модель «Нюйлай» виявилася відмінною

Ox Alpha справді привернув увагу завдяки своїм кодовим здібностям.

Розробник Бен Девіс вибрав 10 завдань із DeepSWE для тестування; Ox Alpha виконала 8 з них, що становить показник успішності 80%. У опублікованих порівняльних результатах Fable 5 Max показав 65%, GLM-5.3 Max і Grok 4.6 xhigh — по 62%, а GPT-5.6 Sol Max — 52%.

GLM

DeepSWE оцінює справжні навички програмної інженерії. Модель повинна читати сховища коду, виявляти проблеми, змінювати код, запускати тести та виправляти помилки на основі повідомлень про помилки. У порівнянні з однокроковими програмними завданнями, він ближчий до реальної роботи агента з кодування.

Проте вибірка з 10 завдань є невеликою. Пізніше інші розробники протестували іншу підмножину DeepSWE, отримавши результат близько 63%. Діапазон завдань і конфігурації запуску в обох тестах не були ідентичними, тому наразі неможливо визначити точне місце Ox Alpha.

GLM

Проте ці попередні результати свідчать, що ця анонімна модель вже демонструє великий потенціал у довгостроковому кодуванні, наближаючись за можливостями до лідерів ринку.

Хто є власником великої моделі «Нюйлай»?

Найпоширенішою версією ідентичності великої моделі «Ню Лай» є ще неопублікована GLM-5.3 Flash або мультимодальна версія GLM-5.3 від Zhipu.

Хтось навіть написав блог з аналізом:

1. Найбільш переконливі докази походять із відеокодека. У чотирьох відео з різною частотою кадрів, тривалістю та роздільною здатністю Ox Alpha споживає таку саму кількість візуальних токенів, як GLM-5V-Turbo. MiMo, Qwen та GLM-4.6V показують суттєво відмінні результати.

2. Токенізатор тексту також дуже добре збігається. Дослідники протестували 25 наборів підказок, і різниця в кількості токенів між Ox Alpha та GLM-5.3 завжди становила фіксовані 75 токенів.

3. Інші ознаки також вказують на Zhipu. Ox Alpha відмовляється обробляти аудіо, як і GLM-5V; стиль відповідей, кількість кроків виконання агента та інтерфейс міркувань також дуже схожі на GLM. Раніше Zhipu вже використовувала Pony Alpha для анонімного тестування GLM-5, що є аналогічним прецедентом.

GLM

https://ox-alpha-evidence-production.up.railway.app/

Також користувачі знайшли сліди у діалозі.

GLM

Бен Девіс вважає, що на 99% впевнений, що це GLM-5.x.

GLM

Ці підказки підвищують вірогідність тверджень GLM, але недостатні для повної ідентифікації.

На даний момент OpenRouter та Zhipu не надали публічних відповідей.

Особа Korrine залишається ще більш загадковою

Особистість великої моделі «Нюйлай» залишається невідомою, а в Code Arena з’явилася ще одна анонімна модель під назвою korrine.

Спочатку багато хто припускав, що це Kimi K3.1, причина Kimi Перед випуском K3 вважалося, що вона проходила тестування під кодовим ім’ям kivine. Оскільки kivine має схожу структуру з korrine, це викликало асоціації.

GLM

Однак найперший розкривач інформації пізніше додав, що раніше відома нова модель Moonshot може відповідати іншому кодовому імені — adamant-ananke. Korrine також може походити від інших китайських команд, таких як Qwen.

GLM

У коментарях хтось також посилався на MiMo V3.

GLM

Чому виробники великих моделей люблять «носити маски»?

Анонімне тестування стає важливим етапом перед офіційним запуском великих моделей.

Приховування виробника та моделі в Arena допомагає зменшити вплив брендів та передумов. Користувачі не бачать ідентичність моделі й вибирають на основі реальних результатів, а накопичені результати битв краще відображають справжній користувацький досвід.

OpenRouter надає інший тип тестового середовища.

Розробники під’єднують модель до різних кодових агентів, щоб вона мала доступ до реальних репозиторіїв, безперервно викликала інструменти та виконувала завдання з програмування тривалістю кілька годин. Стабільність контексту, надійність викликів інструментів та здатність моделі уникати зациклювання або відхилення від курсу під час довготривалих завдань швидко виявляються під інтенсивним навантаженням.

Для виробників моделей це еквівалент публічного тесту на стрес. Команда може заздалегідь спостерігати за випадками невдачі, перевірити завантаження сервісів інференсу та зібрати справжні відгуки до офіційного запуску.

Крім того, «відгадування моделі» все частіше стає маркетинговим інструментом, оскільки ідентичнісна загадковість дійсно може продовжити тривалість обговорень.

Нарешті, повернемося до самої моделі. Якщо Ox Alpha справді є Flash-моделлю, чиї здібності до кодування вже наблизилися до лідерського рівня, то повна версія з більшими ресурсами та повнішими можливостями виведе межі на який рівень?

Посилання для довідки:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Цей матеріал зі сторінки WeChat «Machine Heart» (ID: almosthuman2014), автор: той, хто стежить за ШІ

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.