螞蟻集團發表四篇關於動態環境中 AI 適應性的 IJCAI 2026 論文

iconMetaEra
分享
AI summary icon精華摘要
Ant Group 於 IJCAI 2026 發布了四篇 AI + 加密貨幣論文,專注於 AI 在動態環境中的適應性。研究內容涵蓋動態時間序列聚類、強化學習數據混合、高維貝葉斯優化與視頻品質評估。這些研究旨在解決分佈偏移、計算效率與不斷演化的 AIGC 生態系統問題。鏈上新聞平台 MetaEra 評價該研究具有技術深度與現實應用價值。
蚂蚁集團在 IJCAI 2026 發表四篇論文,系統性探索 AI 在動態環境中的自適應能力。

文章作者、來源:雷峰網

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

再聰明的演算法,終歸要回到動態環境中檢驗。

IJCAI-ECAI 2026 將於 2026 年 8 月 15 日至 21 日在德國不來梅舉行。大會召開之際,AI 科技評論也正在系統掃描本屆頂會收錄的論文,從中捕捉技術趨勢和行業風向。

华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」中,我們觀察到了大廠在參數競賽上的克制,以及對算力效率的追求。

而螞蟻集團入選的四篇論文,則指向了一條同樣重要但路徑截然不同的技術脈絡:對動態環境適應能力的系統性探索。

算法模型在實驗室中的準確度不斷刷新紀錄,但一旦部署到真實世界,性能衰減幾乎成為常態。原因很簡單:真實世界從來不是靜止的。

螞蟻集團的業務場景將這種「不靜止」推向了極致:超過10億用戶、8000多種服務,支付高峰與凌晨低谷之間的差異可達數個數量級,風險控制模型必須以小時級響應黑產策略的迭代,全球化部署還需適應各國截然不同的金融基礎設施。

在這樣的環境裡,「一次訓練、永久部署」的靜態模型,註定陷入「刻舟求劍」的困境。

也正因此,真正的智能,在於算法能否感知環境變化、主動調整自身策略、在動態中尋找最優解。螞蟻集團這四篇論文,不約而同地回答了這個核心命題:如何讓 AI 從「靜態的求解器」進化為「動態的自適應者」?

01 MSRGC-Net:讓時間序列聚類“自適應”數據密度分佈

時間序列聚類,就是把海量行為序列自動歸類,這是一種理解行為模式、監控異常信號的基礎工具。

但現有方法各有各的尷尬:

  • 相似度方法(如 k-Shape):能抓局部模式,但要算所有樣本兩兩之間的距離,數據一多就跑不動了;
  • 深度學習方法(如自編碼器):表徵能力強,但訓練成本高、調參繁瑣、算力消耗大;
  • 傳統特徵提取:依賴人工設計特徵,關鍵的時間動態資訊可能被丟棄。

更大的問題是:現實中的時序數據密度分佈極不均勻——雙十一交易數據密集如暴雨,凌晨數據則稀疏如滴水,但傳統方法需要你提前告訴它分成幾類,這本身就與現實錯位。

Ant Group 與重慶郵電大學共同提出的 MSRGC-Net,透過一套「無訓練」的組合拳,避開了精準度與計算效率之間的兩難選擇。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

論文地址:https://arxiv.org/pdf/2606.12077v1

▎它的核心邏輯可以拆成三步:

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

第一步,多尺度儲備池編碼(特徵提取)。使用多個無需訓練的回聲狀態網絡(ESN)作為儲備池計算的基本單元,僅靠調整譜半徑就能從原始時序中同時提取局部波動和長期趨勢,將所有樣本聚合後形成視圖特徵矩陣,作為後續環節的輸入。

第二步,“顆粒球”錨定圖構建(結構建模),這是最巧妙的部分。算法不再盯著單個數據點,而是根據數據的局部密度自動劃分“顆粒球”(Granular Ball):密度高的區域形成小而多的顆粒,密度低的區域形成大而少的顆粒。數據規模從 N 壓縮到 M(顆粒數,M < N),同時噪聲干擾也被抑制。

Step 3: Consensus-based Multi-scale Graph Optimization. Anchor graphs across scales are fused through a consensus strategy, enabling the model to capture both micro local patterns and macro global trends, ultimately generating robust clustering results without requiring manual specification of the number of clusters.

這套打法效果如何?

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

在5個多變量基準數據集、15項評估指標(NMI、ARI、RI 各5項)上,MSRGC-Net 獲得12項最佳、2項第二——80%的最佳率。

更重要的是,它避開了 O(n²) 的成對計算,實現了近線性的複雜度。簡單來說就是:又快又準,而且無需你猜測要分幾類。

在螞蟻的實際業務場景中,這意味著系統能根據流量密度自動調整聚類粒度——高峰時精細分群抓異常,低谷時粗粒度概括省算力,始終跟著數據走。

02 讓離線到在線強化學習「自適應」資料混合策略

強化學習有一個著名的「水土不服」問題——「分佈偏移」:在離線數據上訓練好的模型,一上線就容易「失憶」。這是因為離線數據和在線交互數據之間存在分佈差異,導致在線初期策略迅速「遺忘」離線學到的知識。

目前的解決方案無非兩種:要么固定 50% 離線 + 50% 在線這樣的混合比例,要么用啟發式規則優先採樣「近策略」的樣本。

但問題是,策略在不同階段的需求完全不一樣——早期需要更多離線數據穩住基本盤,後期需要更多在線數據探索新可能。固定策略,就是刻舟求劍。

Ant Group 聯合上海交通大學提出 ROAD,將數據混合比例從一個「預設參數」變為「動態決策變數」。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

論文地址:https://arxiv.org/pdf/2605.14497

它的核心思想很有意思:數據選擇本質上是個雙層優化問題。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

  • 內層(Inner-Level):標準的 Q 學習更新,即最小化貝爾曼誤差;
  • 外層(Outer-Level):將數據混合策略視為元決策變量,以最大化在線策略的預期回報為目標。

兩層透過多臂賭博機 MAB(Multi-Armed Bandit)算法近似求解,使混合策略能在訓練過程中即時調整:一旦發現模型開始「遺忘」離線階段學到的知識,就自動提高離線數據的採樣比例以穩住基本盤;當模型趨於保守、探索不足時,則及時增加在線數據的占比,鼓勵其嘗試錯誤。

實驗做得挺紮實。團隊在離線到在線強化學習的三大經典基準上進行了驗證:AntMaze(機器人在迷宮中尋找目標)、MuJoCo(仿生機器人的運動控制)和FrankaKitchen(機械臂在廚房中完成複雜操作)。這些任務難度不同、狀態空間各異,能比較全面地檢驗算法的泛化能力。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

為驗證 ROAD 的算法普適性,研究團隊將 ROAD 與 IQL、PEX、CQL、Cal-QL 等多種主流離線算法「嫁接」在一起。結果顯示:無論底層使用哪種算法,ROAD 都能穩定帶來性能提升。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

以 PEX+ROAD 為例,該方法在 D4RL 基準的 24 個連續控制任務上取得了 71.12 的總體平均分,24 個任務中有 18 個排名 第 1 名,顯著優於固定比例、遞減比例、啟發式平衡回放等所有基線。

也就是說,ROAD 能讓模型在「保守繼承」和「激進探索」之間找到最佳平衡點——既不會一上線就翻車,也不會錯失實時數據帶來的提升機會。該方法對螞蟻集團風控模型上線、推薦系統實時優化這類場景而言,價值很鮮明。

03 DSEBO: 使高維貝葉斯優化“自適應”搜尋子空間

貝葉斯優化是黑盒函數優化的經典方法,但一碰到高維問題就頭疼。一種常見解法是隨機嵌入——把優化投射到低維子空間,但新問題來了:有效維度到底是多少?

傳統方法要么依賴專家經驗給定固定子空間維度,要么通過試錯法反覆估計,不僅消耗大量資源,且固定的子空間維度難以適配不同任務。更麻煩的是,有效維度本身可能隨優化進程變化:初期探索時低維度就夠用,後期精調時可能需要更高維度的細節。

Ant Group 聯合華東師範大學、南京大學提出的 DSEBO,讓子空間維度成為優化進程中的「動態變數」,隨搜索進度自主切換。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

論文地址:https://arxiv.org/pdf/2605.23473

DSEBO 的核心機制是「從低到高,逐級躍升」:

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

  • 從低維子空間出發,優化器在低維空間生成候選解,經隨機嵌入映射至原始空間,並快速摸清目標函數的大致輪廓,然後結果反饋驅動高斯過程迭代更新;
  • 觀察到收斂後自動觸發維度擴展,透過共享嵌入矩陣把低維解「繼承」到高維;
  • 新子空間初始化與持續優化,由共享嵌入矩陣確保各子空間相互嵌套,形成「低維探索→收斂觸發→維度擴展→繼續優化」的循環,直到達到評估預算上限。

在維度擴展環節中,擴展幅度也不是固定的——算法會根據當前最優值變化曲線自適應調整:曲線平緩就慢點擴,省不必要的開銷;曲線陡峭就快點擴,快速捕捉高維增益。

實驗結果顯示:在合成函數(Levy、Griewank、Sphere,D=1000)和三個真實任務(MSLR、Lasso-Hard、LIMO)上,DSEBO 與 REMBO、SIRBO、BAxUS、TuRBO 等十幾種主流方法逐一對比,在幾乎所有任務上均取得最優解——精確度與收斂速度雙雙領先。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

這種「低維探路、高維精調」的策略,在螞蟻的日常研發中也非常實用——信貸模型的超參數調優、風控策略的閾值尋優、營銷活動的多變量實驗設計,不再需要專家憑直覺估計維度,演算法會自行「邊走邊看」,實現了自動化、高效率的運行。

04 VGA-BenchV2:讓視頻評估基準適應 AIGC 生態的進化

如果前三篇論文探討的是演算法層面的自適應,那麼 VGA-BenchV2 則展示了評估基礎設施如何「自適應」AIGC 技術生態的迭代。這也是四篇論文中唯一聚焦多模態內容理解的工作,反映了螞蟻集團在數位生活、內容生態等非金融領域的戰略儲備。

AIGC 帶來了視頻生產的爆發,但一個核心問題卡住了:我們該如何系統性評估這些生成視頻的質量?

傳統評估指標如 FVD(評估整體質量與時序連貫性)CLIP Score(評估生成圖像與文字描述的語義一致性),主要看畫面清不清晰、動作連不連貫、文本對不對得上。至於構圖精不精妙、光影講不講究、色彩和不和諧——這些關乎“美感”的感知品質,它們幾乎無能為力。

此前於 CVPR 2026 上,螞蟻聯合北京電影學院、通用人工智慧研究院(BIGAI)提出了 VGA-Bench,首次為視頻審美評估建立了三維度框架(美學質量、美學標籤、生成質量),並基於 1016 個提示詞、12 個生成模型、超 6 萬個視頻構建了評估基準,讓 AI 第一次學會了從專業視角「鑑賞」視頻。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

論文連結:https://arxiv.org/pdf/2604.10127

但視頻生成模型進化太快,以月為單位的迭代節奏讓固定基準很快就「不夠用了」。在這篇 IJCAI 2026 論文中,團隊又進一步推出 VGA-BenchV2。

Ant Group IJCAI 2026 論文盘点:讓 AI 學會「隨機應變」

開源地址:

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

▎核心進化有三點:

第一,人工標註量級增加。VGA-BenchV2 新增了 36,000 條任務級人工標註,其中美學質量標註 16,200 條、美學標籤標註 13,200 條、生成質量標註 6,600 條,相比 VGA-Bench 分別實現了 13.46 倍、11.15 倍和 1.55 倍的擴展。更充足的“人類偏好”數據,讓評估器與人的審美判斷對齊得更準。

第二,評估器架構升級。團隊設計了混合架構:VAQA-Net 負責連續美學評分,VTag-Net 和 VGQA-Net 基於 Qwen 大視覺語言模型進行標籤識別和質量評估。大模型的引入,讓評估器對複雜視覺語義的理解上了一個台階。實驗結果表明,其在多個生成模型上的評估結果與人類判斷高度一致。

第三,打通從「評估」到「優化」的閉環。這是 VGA-BenchV2 最具突破性的設計:它將學到的美學評估器作為獎勵信號,直接用於強化學習的生成模型微調。這意味著評估基準不再只是「裁判員」,它提供的分數可直接轉化為優化信號,指導生成模型在美學質量上持續迭代。

從 VGA-Bench 到 VGA-BenchV2,評估體系已不再是靜態的標尺,而是與生成生態「共進化」的活系統。對於螞蟻集團的內容理解、安全審核、推薦優化等場景而言,視頻質量評估能力不僅能跟上 AIGC 生態的演進,還能反過來驅動上游模型的優化:從「打分」到「優化」,閉環就此形成。

結語:再聰明的演算法,終歸要回到動態環境中檢驗

四篇論文分別從無監督學習、強化學習、黑盒優化和多模態評估四個方向切入,共同指向了同一個技術路徑——從靜態到動態的範式轉換。

實驗數據也印證了這條路徑的有效性:MSRGC-Net 在 15 項指標中拿下 12 個第一、2 個第二;ROAD 在多類離線到在線強化學習任務中超越現有策略;DSEBO 在千維優化問題上實現了可量化的改進;VGA-BenchV2 在多個生成模型上的評估結果與人類判斷高度一致。

從這條技術路徑再觀察螞蟻的整體佈局,會發現一個清晰的「雙輪驅動」結構:一面在金融核心場景中深耕時序建模、強化學習和優化算法;一面在數字生活與內容生態中前瞻佈局多模態理解與評估基礎設施。

Ultimately, no matter how clever the algorithm is, it must ultimately be tested in a dynamic environment. The true value of these four papers may lie in the fact that they all grow from real business contexts: Ant's business scenarios are not merely a "backdrop" for the papers, but the source of problems, the origin of data, and the testing ground for effectiveness.

而這或許,正是工業界做 AI 研究最獨特的地方——他們不只是在“做論文”,更是在為真實世界的问题,找“能抗住動態變化”的解法。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露