在大模型圈,流行「掛馬甲」測試。
近日,一款名為 Ox Alpha 的匿名模型突然出現在 OpenRouter。Ox 本身意為「牛」,國內網友很快為它取了一個更貼地氣的名字:
「Niu Lai」 large model.
根據 OpenRouter 披露的資訊,Ox Alpha 擁有 100 萬 token 上下文,支援文字、圖片和影片輸入,可調用工具,目前完全免費。

上線後不久,開發者就將其接入編碼 Agent,並放入真實代碼倉庫進行測試。
Initial test results show that this unverified "Niu Lai" large model has capabilities approaching those of today's top code models.
同時,有網友爆料,一款名為 korrine 的匿名模型正在 Code Arena 上進行測試。有人猜它是 Kimi K3.1,也有人將其指向 Qwen 和 MiMo,說法不一。
8 月的大模型圈,突然變成了一場大型猜謎遊戲。
「牛來」大模型表現搶眼
Ox Alpha 真正引人關注的,是其程式碼能力。
開發者 Ben Davis 從 DeepSWE 中抽取 10 項任務進行測試,Ox Alpha 完成了其中 8 項,通過率達 80%。其公佈的對比結果中,Fable 5 Max 為 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均為 62%,GPT-5.6 Sol Max 為 52%。

DeepSWE 考察真實的軟體工程能力。模型需要閱讀程式碼倉庫、定位問題、修改程式碼、運行測試,並根據錯誤訊息繼續修復。與單輪程式題相比,它更接近編碼 Agent 的實際工作。
不過,10 項任務的樣本量較小。隨後,其他開發者在另一組 DeepSWE 子集上進行測試,得出的結果約為 63%。兩次測試的任務範圍和運行配置並不完全相同,目前無法據此確定 Ox Alpha 的準確排名。

不過這些結果初步顯示,這款匿名模型已展現出強大的長程編碼潛力,能力逼近當前頭部模型。
「牛來」大模型到底是誰家的?
「牛來」大模型的身份,目前流傳最廣的說法是智譜尚未發布的 GLM-5.3 Flash,或 GLM-5.3 的多模態版本。
有人還專門寫了篇部落格進行分析:
1. 最有力的證據來自視頻編碼器。在四段不同幀率、時長和解析度的視頻中,Ox Alpha 消耗的視覺 token 與 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 均呈現出明顯不同的結果。
2. 文本 tokenizer 也高度吻合。研究者測試了 25 組提示詞,Ox Alpha 與 GLM-5.3 的 token 數量始終保持固定的 75 token 差值。
3. 其他特徵也指向智譜。Ox Alpha 拒絕處理音頻,與 GLM-5V 的路由方式相同;回答風格、Agent 執行步數和推理介面也與 GLM 非常接近。智譜此前曾以 Pony Alpha 匿名測試 GLM-5,具備相同操作先例。

https://ox-alpha-evidence-production.up.railway.app/
還有網友從對話中尋到蛛絲馬跡。

Ben Davis 認為 99% 確定這就是 GLM-5.x。

這些線索提高了 GLM 說的可信度,但還不足以完成身份確認。
截至目前,OpenRouter、智譜都沒有公開回應。
korrine 的身份更加撲朔迷離
「牛來」大模型的身份仍撲朔迷離,Code Arena 又出現了一個名為 korrine 的匿名模型。
最初,不少人猜測它是 Kimi K3.1,原因是 Kimi 在 K3 發布前,曾被認為以 kivine 的代號接受測試。kivine 與 korrine 結構相近,因此引發了聯想。

不過,最早傳播消息的爆料者隨後補充稱,此前獲知的 Moonshot 新模型可能對應另一個代號 adamant-ananke。korrine 也可能來自 Qwen 等其他中國團隊。

在評論區中,還有其他人將其指向 MiMo V3。

為何大型模型廠商喜歡「掛馬甲」?
匿名測試正成為大模型正式發布前的重要環節。
在 Arena 中隱藏廠商和型號,可盡量削弱品牌帶來的先入為主。用戶看不到模型身份,只能根據實際輸出進行選擇,最終累積的對戰結果,也更接近真實用戶體驗。
OpenRouter 提供的是另一類測試環境。
開發者會將模型接入各種編碼 Agent,讓它進入真實倉庫,連續調用工具,處理長達數小時的軟體工程任務。上下文能否保持穩定、工具調用是否可靠、模型是否會在長程任務中循環或跑偏,都能在高強度使用中迅速暴露。
對模型廠商來說,這相當於一次公開壓力測試。團隊可以提前觀察失敗案例,驗證推理服務的承載能力,也能在正式發布前累積真實口碑。
此外,「猜模型」現在也越來越成為一種營銷手段,身份懸念確實可以拉長討論週期。
最後回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代碼能力已經逼近頭部水平,那麼資源投入更高、能力更完整的完整版,又會把上限推到哪裡呢?
參考連結:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:關注AI的
