第67屆國際數學奧林匹克競賽IMO2026成績揭曉,小紅書大模型 dots-note-3.0 以六道題全部答對的滿分成績斬獲金牌。這是中國大模型首次獲得IMO官方金牌認證,也是繼谷歌Gemini之後全球第二個達到該成績的大模型——且為滿分,谷歌此前僅答對5/6題。IMO被視為大模型智力與推理能力的試金石,參賽者需寫出邏輯完整的證明過程,難度極高。本屆金牌線為29分,dots-note-3.0與金牌線相差13分。雙CMO金牌得主評價其解法「正確且漂亮,結構緊湊、邏輯自然」。此次滿分證明小紅書已具備可遷移的通用推理能力,基礎模型領域出現值得關注的新玩家。文章作者、來源:小紅書
近日揭曉第67屆國際數學奧林匹克競賽(IMO2026)成績,小紅書大模型 dots-note-3.0 以六題全對的滿分成績榮獲金牌。這是中國大模型首次獲得 IMO 官方金牌水平認證,亦為繼谷歌 Gemini 之後全球第二個達成此成績的大模型——且為滿分,谷歌此前僅答對 5/6 題。
IMO 是國際數學奧林匹克競賽的簡稱,每年匯聚全球頂尖中學生,陶哲軒等半數當代菲爾茲獎得主均出自該賽事。比賽分兩天進行,每天 4.5 小時完成 3 道題,覆蓋代數、組合、幾何和數論四個方向,每題 7 分,滿分 42 分。參賽者必須寫出邏輯完整、可接受逐步審查的證明過程,這對大模型而言難度極高。

谷歌 Gemini 的 IMO 之路可作為參考:2024 年首次挑戰時僅獲 28 分銀牌,且需先將題目翻譯成 Lean 等形式化語言,部分題目耗時數天;2025 年 Gemini Deep Think 以自然語言端到端完成證明,4.5 小時內解決 5 道題獲得金牌。數學競賽被視為大模型智力與推理能力的試金石,而 IMO 相比常規 Benchmark 有一個獨特優勢——未知性。每屆賽題由專家命製並嚴格保密,模型無法提前針對性訓練,只能依賴實時理解、探索和嚴密推理。
本屆 IMO 金牌線為 29 分,較去年的 35 分下降 6 分,整套賽題的得分難度明顯高於去年。29 分意味著完整解答 4 道題,再從剩餘兩題中拿到 1 分即可進入金牌區間,而小紅書大模型 dots-note-3.0 全部答對,與金牌線之間整整相差 13 分。
滿分成績首先證明的是 Agentic 推理系統的穩定性。模型需要理解自然語言條件,判斷關鍵資訊,提出中間結論,並組織成完整證明,任何條件誤讀或推導跳步都會被評審直接指出。dots-note-3.0 在六類不同問題中連續拿滿,意味著表現並非依賴某道題的偶然靈感。其次,模型直接以自然語言端到端處理,具備從問題理解到答案表達的完整閉環,代表其擁有可遷移的通用推理能力。

在具體答題過程中,dots-note-3.0 採用智能體方式,結合自然語言與 Python 代碼執行推理,並借助遞歸自我批判能力審視自身論證。真正令人驚喜的是第三題——一道組合博弈問題。常見解法是將原問題轉化為圖論連通性問題再建立證明,而 dots-note-3.0 則改用歸納法,抓住了問題最本質的結構,設計出恰到好處的歸納對象與命題。
雙 CMO 金牌得主劉涵祚評價其「正確且漂亮,結構緊湊、邏輯自然,即使放在 IMO 解答中也屬於較為簡潔優雅的一類」。CMO 金牌得主汪千桐認為其「簡潔明瞭而且直擊本質,每一步都順理成章,但人類選手很難想到能從這個角度切入」。
對小紅書而言,IMO 滿分是一次重要的技術亮相。過去外界對其技術認知集中在內容社區、推薦算法和內容理解,基礎模型領域的位置一直缺少公開權威的證明。IMO 滿分不一樣——42 分就擺在那裡,無需複雜解釋,足以證明小紅書已具備值得行業認真審視的基礎模型能力,基礎模型領域出現了一個值得關注的新玩家。據悉,dots-note-3.0 即將開源。
