新論文提出透過探索性建模實現生成模型的端到端訓練

icon MarsBit
分享
AI summary icon精華摘要
來自 UIUC 和哈佛大學的一篇新論文介紹了探索性建模(XM),這是一種用於生成模型的端到端訓練方法。該方法使用 for-loop 生成並選取最佳候選者,以減少模式模糊。在圖像、視頻和語言任務中均顯示出優勢,並提升了 FLOP、樣本和參數效率。隨著受關注的山寨幣吸引目光,此類創新可能影響交易者的情緒指數。

在 2012 年,AlexNet 以壓倒性的勝利結束了一個時代。在此之前,圖像識別需要依賴人工手動設計多層特徵提取流程;AlexNet 證明了一件後來被反覆驗證的事:將整個任務端到端地交由模型自行學習,幾乎總能勝過人類精心設計的分階段流水線。

從圖像分類到目標檢測,再到圖像分割,深度學習的每一次躍遷背後,都是同一句話:讓它自己一口氣學完。

只有一個領域始終是例外:生成模型。

今天最強、最能擴展的生成模型(無論是自迴歸還是擴散模型)都不是端到端的。

它們在訓練時只學習預測「一小步」,但在推理時卻需像循環網絡一樣將這一步反覆展開數百甚至數千次。

訓練和推理使用的採樣方式並不相同。這個缺口帶來了一個老問題:每一步的誤差會傳遞到下一步,輸入逐漸偏離訓練時見過的分佈,誤差層層累積。學術上稱之為「暴露偏差」(exposure bias)。

In other words, the most fundamental lesson in deep learning—that “end-to-end is better”—has never truly been applied to generative models over the past decade.

而就在最近,一篇來自 UIUC 與哈佛大學的論文,試圖把這塊最後的拼圖補上。

生成模型

作者為這個新範式命名為 Explorative Modeling(探索式建模),模型簡稱為 XM。其理念簡單得近乎樸素,卻指向一個大膽的結論:生成模型除了參數和數據外,其實還有第三條可擴展的維度。

生成模型

項目網站:https://explorative-modeling.github.io

論文地址:https://arxiv.org/abs/2607.27372

程式碼倉庫:https://github.com/alexiglad/XM

問題的根源:模型只會「取平均」

要理解這篇論文在解決什麼,得先理解生成到底難在哪。

一般的監督學習(例如分類)每個輸入基本上只有一個正確答案,模型只需學習一個確定的映射即可。

但生成結果並不相同。你讓模型「生成一隻狗」,正確答案甚至可能有無窮多個。這些合法的輸出,就是數據分佈中的各個 mode(即分佈中各個獨立的峰)。生成之所以困難,正是因為要同時掌握這麼多 mode。

麻煩在於,主流生成模型在訓練時使用的是重建損失(例如平方誤差)。當一個輸入被隨機配上了許多個不同的合法目標時,重建損失所能給出的最佳解,是這些目標的平均值。而對絕大多數數據而言,平均值根本不在數據流形上,而是落在幾個 mode 之間,誰也不像。

論文中那張圖非常直觀:讓模型在沒有任何技巧的情況下直接端到端回歸,三堆散點會被它預測成正中間的一個點,一張狗的照片會糊成一團,一句話會退化成不斷重複「the」。這就是「mode 模糊」(mode blurring),即最優解恰恰是最不像真實數據的那個答案。

生成模型

現有的模型是如何繞過這個問題的?答案是將「生成」這件事拆解開來。自迴歸每次只預測一個元素,擴散每次只去除一點噪聲,每一步的目標都被縮小到幾乎只剩單一模式,因此重構損失就不會再取平均值。

這套「拆分生成過程」正是擴散和自迴歸能夠生成高品質樣本的原因,但也正因如此,模型無法實現端到端。

作者由此提出了一個關鍵的追問:一個生成模型只有兩樣東西可以拆,一個是怎麼生成,一個是怎麼訓練。

既然拆生成這條路會毀掉端到端,那為什麼不去拆訓練呢?

生成模型

一個 for 循環:探索式建模的全部內核

Explorative Modeling 拆解的就是訓練迴圈本身。

其機制可一言以蔽之:在每個訓練步驟中,模型不再僅生成一個樣本去硬湊目標,而是生成 K 個候選,然後僅挑選其中最接近真實數據的一個來進行訓練與梯度反傳。論文中將其實現為一個 3 至 5 行的 for 迴圈,簡單到令人懷疑(Algorithm 1)。

生成模型

為什麼這樣做就能解決 mode 模糊?

換一個生活中的場景:猜飛鏢的落點。如果只讓你猜一次,你的最佳策略是猜所有飛鏢的平均位置,但那通常是靶盤上根本沒幾支飛鏢扎中的地方。但如果允許你猜 K 次,且只按最接近的那一次計分,最佳策略立刻改變了:你會將這幾次猜測分散開,讓每一次覆蓋一簇不同的落點。

生成模型

模型也是如此。當它被允許探索 K 個候選時,不同的輸入噪聲會各自「認領」一個不同的 mode,而不是全都擠到中間取平均。探索多少次,模型就能穩穩抓住多少個 mode。

生成模型

作者為這項長期被忽視的能力命名為:生成表達力(generative expressivity),並指出它由訓練目標本身決定,無論你將參數和數據堆得多大,它都不會自行提升。

生成模型

這也解釋了一個業界早已觀察到的怪現象:為什麼今天最優秀的模型都如此依賴「引導」(guidance)技術。

所謂無分類器引導,本質是將預測「推離」那個模糊的平均值。但如果模型本身不模糊,又何必去推它?引導之所以有用,恰恰是 mode 模糊留下的病根。

論文還提出了 Forward 和 Reverse 兩種探索方向:前者固定一個真實目標,在自身的生成結果中尋找最近的一個,偏向「查全」(覆蓋所有 mode);後者固定一個生成結果,在真實數據中尋找最近的一個,偏向「查准」,且幾乎不增加算力開銷,代價是可能收斂至少數 mode。兩者互為補充,可組合使用。

生成模型

生成模型

第三根軸:放大程度越高,收益越大

這篇論文最有分量的結論,是將「探索」驗證為一根真正的 scaling 軸。

作者將探索應用於擴散/流模型、Jumpy 模型,乃至掩碼擴散語言模型,在圖像、視頻、語言三種模態上均觀察到性能持續提升。更重要的是,收益隨規模擴大的趨勢:規模越大,提升越顯著。

論文提供的數字是:隨著數據規模增長,探索帶來的增益從 7% 一路攀升至 36%;隨著模型增大,從 13% 上升至 23%;當算力增加至三倍時,效率增益直接翻了一倍以上。

在效率方面,將 FLOP 效率提升了 4.1 倍、樣本效率提升了 6.2 倍、參數效率提升了 47%。在圖像生成方面,它將目前最強的 RAE 配方進一步推至 ImageNet 上無引導 FID 1.43,逼近業界最佳水平。

生成模型

一個探索 5 個 mode 的 Large 模型,甚至能跑贏一個多出 47% 參數卻不做探索的 XLarge 模型。

生成模型

這個趨勢的含義並不小。作者的解釋是:在規模較小時,模型主要受參數和數據的限制,生成表達力還不是瓶頸;但一旦參數和數據擴大到「不再成為限制」的程度,生成表達力就會越來越成為真正的瓶頸。而這正是探索可直接擴展之物的關鍵。

考慮到當下真實的基礎模型訓練所使用的算力,比這篇論文最大實驗的算力高出約四個數量級,作者認為論文中報告的這些數字,很可能只是更大規模下收益的下限。

真正端到端的生成

如果把探索推到極限,會發生什麼?答案回到了開頭那個懸念:生成模型終於可以端到端了。

作者將 XM 視為獨立的端到端模型,用於機器人控制任務。在行為克隆(Behavior Cloning)上,他們的 Explorative Policy 僅需一次網路前向,便追平甚至超越了需要 100 次前向的 Diffusion Policy;在目標導向的世界建模上,Explorative World Model 以比 Diffuser 少 16 到 256 倍的推理算力,實現了更佳的平均表現。

生成模型

生成模型

這個差距的來源很清晰:擴散模型在推理時以數百步生成換取表現力,而端到端的 XM 則將這筆成本轉移到訓練時的探索上,因此推理只需一次前向傳播。「處理多模式」這同一件事,要麼在推理時慢慢拆解,要麼在訓練時一次探索到位;這篇論文選擇了後者。

作者介紹

這篇論文的第一作者 Alexi Gladstone 並不是新面孔。就在 2025 年 7 月,他主導的 Energy-Based Transformers(EBT)曾在社交平台上引發不小的討論。

生成模型

該工作聲稱首次在多個維度上「跑贏」了標準前饋 Transformer 的擴展曲線,並試圖將「System 2 思考」推廣至任意 mode。參閱機器之心報導《新範式來了!新能量模型打破 Transformer++ 擴展上限,訓練擴展率快 35%》。

生成模型

Explorative Modeling 與他一貫的思路一脈相承:都在追問「模型能否透過某種搜尋、探索的方式,完成單次前向無法做到的事」。而這篇論文更是建立在他與合作者(Yilun Du 和 Heng Ji)的另一套理論 Mode Forcing 之上。論文中坦言,正因為有那套理論在先,XM 的大部分結果是先被理論預測、再被實驗驗證的,這在以「跑完實驗再解釋」為常態的深度學習圈裡,並不多見。

生成模型

作者也很坦誠地承認了局限:best-of-K 這個想法本身並不新,前人做過很多次;他們真正的貢獻,是想清楚了這個簡單迴圈到底在做什麼:它在不拆分生成過程的前提下,直接放大了生成表達力。

此外,自迴歸語言模型目前仍是難度最高的挑戰,純端到端的 Forward XM 在極度多模式的分佈(例如圖像生成)上成本仍過高,這些問題將留待後續研究解決。

十幾年來,我們習慣了用兩個旋鈕去調生成模型:把它做得更大,餵它更多數據。

這篇論文提出的第三個旋鈕相當樸素:讓模型多猜幾次,只保留最好的一次。但如果它揭示的趨勢成立,那麼隨著規模繼續膨脹,前兩個旋鈕遲早會達到極限,而第三個才剛剛開始轉動。

參考連結

https://x.com/AlexiGlad/status/2083230922196107288

本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:Panda

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露