王雲和的初創公司推出 NeoHorse,首個代理原生模型

icon MarsBit
分享
AI summary icon精華摘要
王雲和的初創公司 Genyue Dynamics 推出了 NeoHorse,這是首款 Agent 原生模型,正值恐懼與貪婪指數趨勢變化之際。該模型提供 4B 和 9B 兩個版本,並基於 Agent 執行日誌和公開數據集進行訓練,在工具調用、錯誤檢測和路徑調整方面表現出色。此項目獲得 Wuwen Xinqiong 基礎設施支持,並結合了清華大學與北京大學的研究成果。在通脹數據仍是市場關注焦點的背景下,此發布突顯了 AI 驅動的效率如何應對宏觀經濟變化。

王雲鶴創業後,首次交出大模型成果。

量子位獲悉,華為諾亞方舟實驗室前主任、 Pangu 大模型 由負責人王雲鶴創辦的基元律動,發布首個 Agent-Native 模型 NeoHorse。

該模型由無問芯穹提供底層基礎設施支援與 Infra 優化技術能力,清華大學、北京大學團隊參與算法和訓練方法研究,共同探索提升 Agent 後訓練的數據利用效率和訓練效果。

NeoHorse-1 包含 4B 和 9B 兩個版本,重點面向 Agent 工作過程中需要的一組能力,包括調用工具、讀取環境反饋、發現錯誤、調整路徑,並最終完成任務。

NeoHorse

在涵蓋 Harness Agent、工具使用、代碼和指令遵循等 10 項評測中,經過 Agentic Post-Training 後,4B 模型的綜合表現已達到/略超 9B 基礎模型。

NeoHorse

一家一直強調多模型協作的公司,為何又開始自行訓練模型?基元律動準備加入基礎模型牌桌了嗎?

從 NeoHorse 給出的答案看,方向並沒有發生這樣的變化。

這個模型更像是基元律動過去累積的多模型執行經驗,首次進入了模型參數。

為 Agent 挑選模型的公司,也開始訓練模型

Throughout history, scores have often been the main basis for comparing models.

但當模型開始被放入 Agent 系統並承擔完整任務後,單一分數的解釋力就會下降。

在一個任務中,模型不僅需要提供一個看似合理的答案,還需在執行過程中持續讀取環境回饋、處理錯誤,並根據實際進展調整後續路徑;不同環節對模型能力的要求也各不相同。

由此,Primal Rhythm 團隊形成了一個判斷。

模型不歸一將是 AI 產業長期存在的一種結構。

模型越多、分工越細,價格和能力差異越明顯,就越需要一套系統回答幾個問題——

這一步應該使用哪個模型?哪些環節可以交給成本更低的模型?什麼時候需要升級到推理和執行能力更強的模型?一條執行路徑受阻後,應該換誰接手?多個模型能否並行提供方案,再將結果聚合起來?

王雲鶴團隊將這一層系統稱為 Routing Harness(旗下相關開源項目 OpenSquilla 已接入多款模型,透過統一介面,在 Agent 運行過程中進行細粒度路由、模型切換和多模型協作)。

NeoHorse

同樣,基於這一思路,基元律動似乎沒有太強的理由自行訓練模型。市場上已擁有足夠豐富的模型供應,按需調用顯得更加靈活。

隨著調度系統持續運行,另一類資產開始沉淀,如「什麼任務需要什麼能力」「模型在哪一步容易失敗」「什麼樣的修復路徑有效」「怎樣的結果能夠通過環境驗證」。

這些資訊一方面可以提升路由判斷,另一方面也開始具備訓練價值。

這有點像一個連接眾多品牌與消費者的平台。交易過程中累積的需求、評價和使用反饋,可以幫助商品找到更合適的用戶,並進一步反饋給產品研發。

平台服務市場的過程因此成為下一轮產品改進的數據來源。

NeoHorse 的任務就是將基元律動在 Harness 中累積的部分執行經驗,轉化為模型能力。

將多模型走過的路,練進 Agent-Native 模型

NeoHorse 的數據來源值得一提。

其核心語料是將 Routing Harness 產生的 Agent 執行信號與公開資料結合,建構面向 Agent 後訓練的資料體系。

An agent leaves a complete execution record after completing a task in Harness.

  1. 輸入任務→ 路由器判斷需要什麼能力
  2. → 選擇某個模型
  3. → 模型進行推理和工具調用
  4. → 環境返回結果
  5. → 模型繼續執行或發生錯誤
  6. → 系統切換模型或調整路徑
  7. → 任務最終完成或失敗

常見問答數據往往集中在「問題」和「答案」兩端。

Routing Harness 的數據中還包含另外幾層資訊:任務需要什麼能力、系統做出了什麼執行決策,以及環境最終給出了什麼反饋。

例如,路由器最初判斷某項任務只需普通模型,但在執行過程中連續失敗後,升級至能力更強的模型,任務才得以完成。

這條軌跡包含的資訊遠多於一次失敗。

系統可以得知,最初的能力建判可能偏低,模型在哪一步出現問題,更強模型採用了什麼策略,哪條執行路徑最終通過環境驗證,以及完成任務額外消耗了多少 Token 和時間。

NeoHorse

更重要的一點在於,基元律動觀察到的並非某個模型對自身能力的判斷,而是多個模型面對相似任務時留下的橫向表現。

其中包括成功的路徑,以及中途失敗後由其他模型接手的執行記錄。

From a training perspective, failure trajectories may even provide more information.

最終答案能告訴模型一條可行路徑,失敗與修復過程則補充了另外兩類知識:哪些地方容易出錯,以及出錯後如何調整。

“除了多個模型給出的結果,還包括多個模型在任務環境中實際走過的路徑”,這也是 NeoHorse 比較有辨識度的一點。

如何將 Agent 工作日誌轉化為模型能力?

將所有日誌全部投入訓練,並不會自然得到一個更強的 Agent 模型。

代理軌跡通常很長,其中混雜了系統提示、用戶請求、工具參數、執行結果、重複嘗試、錯誤信息以及大量中間輸出。

有些步驟具有訓練價值,有些則更接近噪聲。還有一些軌跡流程完整,但結果本身並不正確。

Primitive Rhythm first needs to address the question of “which data are worth learning for the model”.

根據技術報告,每條軌跡都會經過結構檢查,以確認請求、模型回覆、工具調用和環境結果之間能夠對應。

隨後,系統會從六個維度評估執行質量,包括是否完成用戶目標、是否遵守指令、工具使用是否合理、結論是否有證據支撐、發生錯誤後能否恢復,以及模型是否在合適的時機終止任務。

這裡還涉及 Agent 訓練中容易被混淆的問題。

任務結束並不等於用戶目標已經滿足——模型輸出「任務已經完成」只能說明執行流程停止了,無法證明交付物符合用戶要求。

因此,完成狀態、目標滿足度、環境證據和用戶反饋,需作為不同信號分別記錄。

數據完成篩選後,路由信號開始發揮另一項作用。

路由器會估計任務所需能力,並形成不同能力檔位的信號。NeoHorse 在訓練過程中據此安排樣本順序,先學習能力需求較低的任務,再逐漸增加更複雜的執行軌跡,同時保留基礎任務覆蓋。

This method is called Routing-Guided Curriculum, which is routing-guided curriculum learning.

簡單來說,路由信號在線上決定將任務交給誰,並在訓練階段告訴模型哪些任務適合先學、哪些適合後學。

NeoHorse

除了常規監督微調,NeoHorse 還使用了 On-Policy Distillation。

It can be understood as first allowing students to solve problems in their own way, then having the teacher provide guidance based on the actual steps the students have taken.

這樣一來,教師模型處理的是學生模型在當前分佈下會遇到的問題,而非預先準備的一套標準錯誤。

NeoHorse

經過這些環節,多模型長期執行任務累積下來的經驗,開始被用於 NeoHorse 的後訓練。

After post-training, what is improved?

根據當前技術報告的結果,Agentic Post-Training 在 4B 和 9B 兩個規模上均帶來了穩定提升。

其中,NeoHorse-1-4B 的綜合表現(宏平均分數從 58.94 提升至 64.87)已達到同規模的 SOTA,在所有可對比的基準上均超越其基礎模型 Qwen3.5-4B,並在 4B 同規模對比模型中綜合領先。

NeoHorse

但 SOTA 並不意味著能力是均勻鋪開的。

進一步拆分結果可以看到,4B 模型的提升主要集中在一類任務上。

這類任務通常擁有相對明確的工作流程,環境反饋能夠被觀察,成功與失敗可以驗證,最終交付標準也比較清楚。

例如,在一個項目排期任務中,基礎模型雖然找到了工作目錄中的檔案,卻沒有繼續讀取一封包含最新依賴約束的郵件。

結果,它根據已過期的資訊生成計劃,並將檔案寫入錯誤位置。

The post-trained model continues to read new evidence, detects that constraints have changed, recalculates the schedule and validates the results, then saves the deliverables to the correct location.

兩者的差異體現在 Agent 執行鏈條上。

一個模型大致知道任務應該怎麼做,另一個模型已經能把獲取證據、更新約束、執行、驗證和交付串成較完整的工作流程。

達到同規模 SOTA,並不代表要讓 NeoHorse-1-4B 接管所有任務。基元律動更關注如何精細劃分不同模型的能力邊界。

可由 4B 穩定完成的任務,可減少對更大規模模型的調用;可由更強模型完成的任務,也不需持續升級至價格最高的旗艦模型;當難度繼續上升時,再交由模型池中能力更強的模型處理。

這裡正好銜接上 Routing Harness 與自研模型之間的關係。

模型不斷向外擴展可承擔任務的成本區間,路由系統則根據任務難度和執行情況,把不同能力放到合適的位置。

NeoHorse

除了 API 調用費,這套模式還有什麼價值?

At this point, the relationship between the various product lines of Elementum Pulse has also become clearer.

第一層是 OpenSquilla 開源版。

通過免費、開源、本地部署和桌面產品,基元律動降低開發者使用多模型 Agent 的門檻,同時連接開發者和任務入口。

第二層是 TokenRhythm API。

其定位接近「中國版 OpenRouter」,透過統一介面提供不同模型的呼叫能力,滿足開發者與企業的模型使用需求,同時協助模型廠商連接更多應用場景。

Enterprises can more easily evaluate, select, and switch models without having to individually adapt to numerous model interfaces.

第 3 級是面向企業的服務與部署能力。

金融、製造等行業對權限、穩定性、私有部署與服務保障有不同的需求,也因此形成進一步的商業空間。

第 4 級才是 NeoHorse。

NeoHorse 首先驗證了一項關鍵連接:在 Harness 執行過程中產生的有效經驗,經過篩選和訓練後,確實有機會被轉化為模型自身的能力。

Thus, the business flywheel previously proposed by Primitive Rhythm has for the first time produced results at the model level.

這一點也帶來了優化推理經濟賬的可能。

如果 NeoHorse 後續能夠穩定承接一批高頻、標準相對明確的 Agent 任務,平台便多了一種可以自主調度的能力供給。

這些任務可進一步優化推理成本、響應速度和穩定性,並讓模型供給配置更具彈性。隨著模型持續迭代,其可覆蓋的任務範圍仍有進一步擴大的空間。

From this perspective, Primordial Rhythm's goal is somewhat like the process accumulation in manufacturing systems.

外部模型生態提供不同能力,Harness 負責組織執行;在執行過程中形成的經驗,再進入下一轮模型改進。

從連接模型、提供服務,到將服務中產生的經驗轉化為模型能力,並進一步提升效率與品質,這也是基元律動在 API 聚合平台之外,邁出的一步。

Beyond the model, what is the primitive rhythm constructing?

基元律動設想中的循環大致可以用幾條業務線串起來:

  1. Routing Harness 連接開發者與 Agent 任務
  2. → TokenRhythm API 連接供應與調用需求
  3. → 由 Harness 組織執行,累積路由與任務軌跡
  4. → 可用軌跡經篩選,用於模型訓練
  5. → 更新後的模型返回 Harness,參與適配任務
  6. → 改善任務體驗,探索更佳的響應速度與成本效率
  7. → 持續使用、付費與經營效率的提升
  8. → 支持下一轮服務完善和研發投入

其中一個關鍵變化在於,模型產生的軌跡不再只停留在消費和調用環節,它還可能成為下一轮模型訓練的來源。

Agent 完成一次任務,Harness 就多獲得一次關於能力邊界的觀察。

某個模型失敗,系統知道能力缺口可能出現在哪裡;另一個模型成功接手,系統獲得一條新的修復路徑;用戶最終接受或拒絕結果,又提供一層外部反饋。

任務累積越多,路由判斷可能越準確;路由判斷更加準確以後,篩選出的訓練軌跡也會更貼近實際任務;模型更適合任務以後,API 服務又有機會獲得更好的成本和體驗。

如果這一循環能夠長期成立,基元律動與常規 API 聚合平台之間的差異,也會逐漸從路由規則和模型列表,進入訓練任務設計、訓練方法以及模型參數。

最後再透過產品表現呈現出來。

距離 RSI 還有多遠?

以上是基元律動開始談論 RSI(Recursive Self-Improvement,遞歸自我改進)的背景。

目前,Primal Rhythm 驗證 RSI 的範圍更接近一套工程閉環,可拆分為兩個部分。

第一個是 Data-RSI。

模型在 Harness 中持續執行任務,每一次路由、工具調用、失敗恢復和最終結果,都會生成新的結構化記錄。

These records, after being filtered and processed, can be added to the subsequent training data pool. As a result, the training data does not need to rely entirely on manual preparation beforehand and can grow continuously with ongoing system usage.

第二個是 Model-RSI。

系統根據評測結果識別當前模型的能力短板,調整下一轮訓練數據分佈,更新模型,再把新模型放回 Harness 參與執行。

In other words, the model learns from execution experience, and the updated model performs new tasks to generate fresh feedback for the next round of training.

NeoHorse

不過,以 NeoHorse 目前公開的資訊,還不能把這套體系視為完整 RSI。

技術報告目前驗證的是一次「執行—評估—選擇—更新」閉環。信號設計、獎勵設計和訓練流程仍由人類設定,多代模型迭代後能否持續穩定獲得增益,仍需更多實驗確認。

因此,更準確的表述是,NeoHorse 這次發佈完成了兩層驗證。

第一層是商業上的,系統累積的數據能夠進入模型訓練,並轉化為可衡量的能力提升。

另一層是技術上的,王雲鶴帶領創業團隊完成了一次面向 RSI 方向的單輪工程驗證。

模型越多,這家公司越值錢?

Of course, for the story of Primal Rhythm to hold true, several hurdles still need to be overcome.

第一,開源生態能否持續轉化為 API 使用和收入。

Second, as the number of task types increases, can the system continuously obtain sufficient high-quality Agent trajectories for training?

Third, after the model's capabilities are improved, can they be consistently translated into better task experiences and execution efficiency, and further reflected in business metrics?

Fourth, how long will the performance gains last after multiple model iterations?

這些問題都需要更長時間觀察。

以及還有一個無法避開的變數—— DeepSeek 、Qwen、 MiniMax 模型廠商也正向 Harness 和 Agent 產品延伸,模型與 Agent 基礎設施垂直整合的趨勢日益明顯。

以基元律動為例,這家公司目前的差異之一是模型中立,以及在跨模型執行過程中形成的橫向比較數據。

但如果模型之間的能力差異足夠大,跨模型調度就有機會成為一門獨立的生意;如果頭部模型逐漸覆蓋更多任務,或廠商自行將路由、工具調用和 Agent 框架一併打包,中間層的空間就會被壓縮。

當上游能力越來越強、越來越便宜時,為何這一中間層仍需存在?

對於基元律動來說,NeoHorse 至少為這個問題增添了一個新的觀察角度。

過去它證明自己會「用模型」,現在開始嘗試證明,長期使用模型累積下來的數據,也能沉淀成自己的模型能力。

If this path succeeds, the moat of Elemental Rhythms will extend beyond routing strategies; if it fails, it will still face the issues common to all model intermediate layers.

GitHub:https://github.com/TokenRhythm/NeoHorse

抱抱臉:https://huggingface.co/collections/TokenRhythm/neohorse-1

本文來自微信公眾號「量子位」,作者:衡宇

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露