Periodic Labs 使用 1300 顆 H200 GPU 訓練萬億參數模型,用於科學實驗

iconMetaEra
分享
AI summary icon精華摘要
Periodic Labs 使用 1,300 個 H200 GPU 和內部實驗的鏈上數據,訓練了其 Periodic Neon 模型。該模型基於 Kimi K2.6,分析 X 射線衍射結果,並在 FrontierXRD 基準上將成功率從 2.7% 提升至 55.3%。Periodic 声稱,Neon 在更低的成本下優於 GPT-6 Astra 和 Claude Fable 5.1。該模型運行於閉環系統中,實驗的鏈上數據為未來的訓練提供動力。結果為內部資料,尚未經過審核。Neon 的權重未對外公開。
Periodic Labs 發布了科學模型 Periodic Neon:它以開放權重的萬億參數模型 Kimi K2.6 為起點,使用公司實驗室產生的材料數據進行中期訓練和強化學習,再部署回實驗室分析 X 射線衍射結果。在最困難的內部評測 FrontierXRD 上,成功率從基礎模型的 2.7% 提高到 55.3%;Periodic 表示,它在這項特定任務上超越 GPT‑6 Astra 和 Claude Fable 5.1,同時成本更低。真正值得關注的並非「1300 張 H200 打敗 10 萬張 GPU」的簡單比較,而是公司正在建立實驗—訓練—再實驗的閉環:實體實驗室持續產生互聯網上沒有的新數據,模型從中學習,再決定下一轮應合成和檢測什麼。不過,所有主要成績目前均來自公司內部評測,依賴 LLM 裁判,尚無同行評審或獨立複現;Neon 繼承了 Kimi K2.6 昂貴的預訓練成果,而且截至檢索時也未找到 Neon 權重的公開下載地址。

文章作者、來源:Periodic Labs

它解決的不是聊天問題,而是「實驗到底做出了什麼」

Periodic Labs 正在尋找更好的超導體和磁性材料。實驗人員可以設定目標材料、選擇原料與溫度,但最終得到的粉末未必是預期產物:裡面可能同時存在目標晶相、未反應完的原料,以及意外產生的副產物。

研究人員通常使用粉末X射線衍射(XRD)來判斷樣品的成分。X射線照射晶體後會形成一組峰值;不同晶體結構會產生不同圖案,類似於材料的「指紋」。

但真實樣品往往包含多種物質,其峰值會互相重疊。一個數學上擬合良好的答案,也可能在化學上不合理。分析人員還需要綜合原料、溫度、氣氛、樣品是否接觸水分、此前實驗、晶體數據庫、熱力學計算和相關論文,才能判斷哪些物相真正存在、各自比例是多少。

Periodic 表示,複雜樣品可能需要材料科學家花費數小時進行分析。在其評測中,獲得認可的答案平均包含五種物相。這正是 Neon 要自動化的工作:讀取衍射圖和完整實驗背景,調用資料庫及科學軟體,提出候選物相,再反覆檢驗自己的解釋。研究文章稱,模型已投入公司的高通量實驗室使用。

從 2.7% 提高到 55.3%

Neon 並非從零開始預訓練的新基礎模型。Periodic 從開放權重的 Kimi K2.6 開始,加入由學術論文、代碼和專有實驗數據構成的科學語料進行中期訓練,隨後利用實驗室數據進行強化學習。

在公司最困難的內部評測 FrontierXRD 上,原始 Kimi K2.6 的成功率為 2.7%,Neon 達到 55.3%,約提高 20 倍。評測包含 134 個來自 Periodic 實驗室的複雜樣品。

公司還測試了198次來自保留化學體系的XRD測量:這些體系及其包含的更大體系未進入訓練數據,但較小的子體系可能曾出現過。Neon在這組測試中同樣領先於受測的前沿模型,不過Periodic明確指出,這組題目比FrontierXRD簡單。

(原文包含性能—成本散點圖、強化學習算力擴展曲線,以及在化學體系上保留的泛化結果圖。)

這裡的「超過 GPT‑6 Astra 和 Claude Fable 5.1」必須限定在 Periodic 自建的 XRD 評測中。它不代表 Neon 具備更強的通用推理、編程或語言能力,也不能據此建立綜合模型排名。

而且 55.3% 的成績意味著,在最困難的樣品上仍有接近一半沒有成功解決。Neon 更適合作為擴大科學家分析能力的工具,而不是無需審核的全自動材料專家。

實驗室開始成為模型的訓練環境

Periodic 提出的核心邏輯是:公開互聯網提供的高質量科學數據終究有限,實體實驗室卻可以不斷製造新數據。

傳統論文尤其偏向發表成功結果。哪些材料沒有合成出來、哪些溫度和配比失敗、儀器出現過什麼異常,這些資訊往往不會進入論文,卻對判斷下一轮實驗非常有價值。自主實驗室可以把成功、失敗和不確定結果全部保留下來。

公司將材料發現拆分成三個循環步驟:

首先預測應該製造什麼材料;隨後預測怎樣合成;最後分析實驗究竟製造出了什麼。分析結果再反饋給模型,用來修正下一轮假設。

Neon 目前主要改進的是第三步。Periodic 下一階段希望讓模型直接規劃研究項目、編寫合成流程,並選擇下一項最有資訊價值的實驗。

這與數學、代碼強化學習有一個重要區別。程式可以在幾秒鐘內運行測試,數學答案也可能由形式化系統檢查;物理實驗需要設備、材料和時間,有時持續數天,結果還可能含糊不清。公司無法像生成代碼一樣瞬間啟動數萬個真實實驗,因此必須在實驗等待期間,充分利用已經累積的數據訓練和改進模型。

1300張 H200 並不等於從零訓練萬億參數模型

Periodic 表示,Neon 最後一次訓練運行的峰值規模為 1300 張 Nvidia H200,涵蓋中期訓練和強化學習階段。公司將其與據稱用於 GPT‑6 Astra 的 10 萬張以上 Blackwell GPU 進行對比,以說明專業數據可減少訓練通用科學能力所需的算力。

但这不是同口径比較。

Neon 繼承了 Kimi K2.6 的萬億參數權重,以及其此前預訓練所投入的全部數據和算力。1300 張 H200 僅代表 Periodic 在繼續訓練模型時的峰值規模,而非獲得這套萬億參數能力的全部成本。公司也未披露完整的訓練時長、累計 GPU 小時、能源消耗或總費用。

更有價值的是其工程細節。基礎設施文章稱,公司在 Megatron、SGLang、Miles 和 Ray 之上進行修改,使長序列訓練吞吐量達到其 Megatron 基線的 4.1 倍,並將萬億參數模型的解碼速度從每個請求每秒 10 個 Token 提高到 25 個。

XRD Agent 的一次推理可能持續一個多小時,期間需要反覆運行科學程序。早期系統曾讓模型生成的代碼申請 80GB 記憶體,導致整個訓練任務崩潰。團隊隨後開發了名為 pbox 的隔離環境,把模型代碼放在沙箱內運行,並利用 GPU 伺服器空閒的 CPU 資源處理科學工具。

(基礎設施原文包含超過一小時的Agent運行軌跡、非同步訓練與推理架構,以及pbox沙箱效能對比圖。)

提升並不全來自模型,工具和上下文同樣重要

Periodic 還使用相同的 Claude Opus 5 比較了兩種 Agent 環境。

一種是 Claude Code 加上開源晶體資料庫及標準 XRD 軟體;另一種是 Periodic 自己的科學工作環境,其中包含實驗背景、內部材料資料庫、模擬結果和定製分析工具。

在模型完全相同、單次分析成本相近的情況下,Periodic 環境的成功率達到前者的 3.8 倍。這說明 XRD 任務的瓶頸不只是模型權重,還包括模型能否看到正確的實驗記錄、調用合適的工具,並保存此前研究積累。

因此,Neon 的競爭優勢可能難以僅通過複製一個模型完全複現。更重要的資產是模型背後的實驗室數據、資料庫、儀器介面和分析流程。

這也意味著科學AI可能形成與通用聊天模型不同的競爭格局:實驗室越大,產生的專有數據越多;模型越好,能指導的實驗越多;新實驗又進一步擴大數據優勢。

當沒有標準答案時,Periodic 使用 AI 為 AI 打分

複雜的 XRD 分析通常不存在便宜、唯一且可自動驗證的標準答案。峰形擬合得好,不代表結果符合化學規律。因此,Periodic 讓三名材料相關專業的博士分別標註數千個圖案,再訓練由 Claude Opus 5 和 GPT‑5.6 Sol 組成的裁判系統,為模型輸出評分。

三名人類專家之間的兩兩一致率為 77.2%;LLM 裁判與單一人類專家的一致率為 74.6%;與專家共識相比,一致率為 84%。

這些結果表明 AI 裁判可以近似專家判斷,但並不等同於客觀真值。人類之間本就存在分歧,而裁判模型也可能偏愛某種回答風格,或漏掉所有標註者共同沒有識別出的錯誤。

更需要注意的是,FrontierXRD 的模型、工作環境、樣品和評分方法都由 Periodic 設計。雖然公司公開了較多方法與統計數據,但尚未發布完整評測集、訓練數據或可供外界重新運行的 Neon 權重,結果也沒有經過同行評審。

「從開放權重開始」不等於 Neon 已經開源

Periodic 明確說明 Neon 從開放權重模型 Kimi K2.6 繼續訓練。部分社群媒體因此將 Neon 稱為「開放權重科學模型」。

但截至檢索時,官方發布未提供 Neon 的模型卡、許可證或權重下載地址,也未提供可完整複現中期訓練和強化學習的代碼與數據。準確的說法應是:Neon 建立在開放權重模型之上,而不是已經確認對外開放了訓練後的 Neon 權重。

這一區別很重要。外部研究人員目前無法獨立驗證 55.3% 的成績,也無法判斷提升中有多少來自實驗數據、強化學習、專用工具、推理預算或評測環境。

真正的變化,是 AI 開始吃到「現實世界的新數據」

過去的科學大模型主要學習已寫成論文、專利和資料庫記錄的知識。Periodic 試圖跨出下一步:讓模型觀察今天剛完成、從未出現在互聯網中的實驗,然後用這些結果指導明天的實驗。

它還不是完整的「AI 科學家」。人類仍需確定研究目標、建設實驗室、維護儀器、設計獎勵、審核 XRD 結論,並決定哪些材料值得繼續投入。Neon 目前證明的是其中一個關鍵環節可以被顯著自動化:隨著實驗數量增加,結果分析不必完全依賴同比例增加的人類專家。

如果這套閉環有效,未來科學模型的競爭優勢可能不再只取決於誰擁有更多公開文本和 GPU,也取決於誰能穩定運行真實實驗、記錄失敗結果,並將自然世界轉化為持續更新的訓練環境。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露