大規模モデルの世界では「マスクを掛けてテスト」することが流行している。
最近、OpenRouterに「Ox Alpha」という名前の匿名モデルが突如登場しました。Ox自体は「牛」を意味し、中国のネットユーザーはすぐにこれにより親しみやすい名前を付けました:
「牛来」大モデル。
OpenRouterの情報によると、Ox Alphaは100万トークンのコンテキストをサポートし、テキスト、画像、動画の入力に対応し、ツールを呼び出せます。現在は完全に無料です。

上場後まもなく、開発者はそれをコーディングエージェントに接続し、本番コードリポジトリでテストしました。
初期テスト結果によると、正体不明の「牛来」大モデルの能力は、現在のトップレベルのコードモデルに迫っています。
一方で、ネットユーザーが、Korrineという名前の匿名モデルがCode Arenaでテストされているとリークしました。誰かはそれが Kimi K3.1は、一部の人々がQwenやMiMoを指しているとも言われています。
8月の大規模モデル業界は、突如として大きななぞなぞゲーム变成了。
「牛来」大モデルが目覚ましいパフォーマンスを発揮
Ox Alphaが本格的に注目を集めたのは、コーディング能力によるものだ。
開発者Ben DavisはDeepSWEから10のタスクを抽出してテストを行い、Ox Alphaはそのうち8タスクを完了し、成功率は80%であった。公開された比較結果によると、Fable 5 Maxは65%、GLM-5.3 MaxとGrok 4.6 xhighはいずれも62%、GPT-5.6 Sol Maxは52%であった。

DeepSWEは、実際のソフトウェアエンジニアリング能力を評価します。モデルはコードリポジトリを読み取り、問題を特定し、コードを修正し、テストを実行して、エラーに応じてさらに修正を加えます。単一のプログラミング問題と比較して、これはエンコーディングエージェントの実際の作業により近いものです。
ただし、10件のタスクはサンプルが小さい。その後、他の開発者が別のDeepSWEサブセットでテストを行い、結果は約63%となった。両方のテストのタスク範囲と実行設定は完全には一致していないため、現在のところOx Alphaの正確な順位を決定することはできない。

しかし、これらの結果は、この匿名モデルがすでに長距離エンコードの高い可能性を示しており、現在のトップモデルに近い能力を有していることを示唆しています。
「牛来」大モデルはどの企業のものですか?
「牛来」大モデルの正体について、最も広く流布されている説は、智譜が未発表のGLM-5.3 Flash、またはGLM-5.3のマルチモーダル版である。
誰かが专门にブログを書いて分析しました:
1. 最強の証拠はビデオエンコーダーから得られた。異なるフレームレート、長さ、解像度の4つの動画において、Ox Alpha が消費したビジュアルトークンは GLM-5V-Turbo と完全に一致した。MiMo、Qwen、GLM-4.6V はいずれも明確に異なる結果を示した。
2. テキストのトークナイザーも非常に一致しています。研究者は25組のプロンプトをテストし、Ox AlphaとGLM-5.3のトークン数は常に75トークンの固定差を保っていました。
3. その他の特徴も智谱を示唆している。Ox Alphaはオーディオ処理を拒否し、GLM-5Vのルーティング方式と同一である。回答スタイル、エージェントの実行ステップ数、推論インターフェースもGLMに非常に類似している。智谱は以前、Pony Alphaを用いてGLM-5を匿名でテストしており、同様の操作事例を持っている。

https://ox-alpha-evidence-production.up.railway.app/
また、ネットユーザーが会話から手がかりを見つけ出した。

ベン・デイビスは、これがGLM-5.xであることを99%確信している。

これらの手がかりはGLMの主張の信頼性を高めましたが、身份の確認にはまだ十分ではありません。
これまでに、OpenRouterおよび智谱はいずれも公に反応していません。
コリーンの身元はさらに謎めいている
「牛来」大モデルの正体はいまだ不明であり、Code Arenaにはkorrineという名前の匿名モデルが登場した。
最初、多くの人がそれはと推測していた Kimi K3.1、理由は Kimi K3のリリース前、kivineというコードネームでテストが行われていたとされていた。kivineはkorrineと構造が類似しているため、関連が想起された。

しかし、最初にこの情報を広めたリーク元はその後、以前得られたMoonshotの新モデルは別のコードネームであるadamant-anankeに対応している可能性があると補足した。korrineはQwenなどの他の中国チーム由来である可能性もある。

コメント欄では、まだ誰かがそれをMiMo V3に指向しています。

大規模モデル厂商はなぜ「マスクを掛ける」のが好きですか?
匿名テストは、大規模モデルの正式リリース前の重要なステップとなっています。
Arenaでメーカーとモデルを非表示にすることで、ブランドによる先入観をできるだけ減らすことができます。ユーザーはモデルの正体を知ることができず、実際の出力に基づいて選択するしかなく、最終的に蓄積される対戦結果は、よりリアルなユーザー体験に近くなります。
OpenRouterは別の種類のテスト環境を提供しています。
開発者はモデルをさまざまなコーディングエージェントに接続し、実際のリポジトリに導入して、数時間にわたるソフトウェアエンジニアリングタスクを連続的にツールを呼び出して処理します。コンテキストの安定性、ツール呼び出しの信頼性、モデルが長距離タスク中にループしたり逸脱したりしないかは、高負荷使用時に迅速に明らかになります。
これはモデルベンダーにとって、公開のストレステストに相当します。チームは事前に失敗事例を観察し、推論サービスのキャパシティを検証でき、正式リリース前に実際の評判を蓄積することも可能です。
また、「モデル予想」は今やますますマーケティング手段としても用いられるようになっており、アイデンティティの謎は議論の継続期間を延ばす効果があります。
最後にモデル自体に戻ります。Ox Alphaが本当にフラッシュモデルであり、そのコード能力がトップレベルに迫っているなら、より多くのリソースが投入され、機能がより完全なフルバージョンは、上限をどこまで引き上げるのでしょうか?
参照リンク:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
本文は微信公众号「機械の心」(ID:almosthuman2014)より、著者:AIに注目する
