第67回国際数学オリンピック(IMO2026)の結果が発表され、小紅書の大規模モデルdots-note-3.0が全6問を正解し満点で金メダルを獲得した。これは中国の大規模モデルとして初のIMO公式金メダル認定であり、グーグルのGeminiに続き、世界で2番目にこの成績を達成した大規模モデルである。さらにdots-note-3.0は満点を記録し、グーグルはこれまで6問中5問しか正解できていなかった。IMOは大規模モデルの知能と推論能力を測る試金石とされ、参加者は論理的に完全な証明プロセスを記述する必要があり、難易度は極めて高い。今回の金メダルラインは29点であり、dots-note-3.0はその差を13点も上回った。両方のCMO金メダル獲得者からは、その解答が「正しく、美しく、構造が凝縮され、論理が自然である」と評価された。今回の満点は、小紅書が汎用的で移転可能な推論能力を備えていることを証明し、基礎モデル分野に注目すべき新規参入者が登場したことを示している。記事作成者、出典:小紅書
第67回国際数学オリンピック(IMO2026)の結果が近日発表され、小紅書の大規模モデルdots-note-3.0が6問すべて正解の満点で金メダルを獲得しました。これは中国の大規模モデルとして初めてIMO公式の金メダルレベルの認証を受けたものであり、グーグルのGeminiに続き、世界で2番目にこの成績を達成した大規模モデルです。また、dots-note-3.0は満点であり、グーグルはこれまで6問中5問しか正解していません。
IMOは国際数学オリンピックの略称で、毎年世界のトップ中学生が集まり、陶哲軒を含む当代のフィールズ賞受賞者の半数以上がこの大会出身である。大会は2日間にわたり、毎日4.5時間で3問を解き、代数、組合せ、幾何、数論の4分野をカバーする。各問題は7点満点で、総合計42点。参加者は論理的に完全で、段階的に検証可能な証明を記述しなければならず、これは大規模モデルにとって非常に高い難易度である。

Google GeminiのIMOへの道は参考になる:2024年の初挑戦では28点の銀メダルにとどまり、問題をLeanなどの形式言語に翻訳する必要があり、一部の問題には数日を要した。2025年にはGemini Deep Thinkが自然言語でエンドツーエンドの証明を完了し、4.5時間で5問を解いて金メダルを獲得した。数学コンテストは大規模モデルの知性と推論能力の試金石と見なされており、IMOは従来のベンチマークと比べて独特な利点——未知性——を持つ。毎回の出題は専門家によって作成され厳重に秘匿されるため、モデルは事前に対策訓練ができず、リアルタイムでの理解、探求、厳密な推論に頼らざるを得ない。
今回のIMOの金メダルラインは29点で、昨年の35点から6点低下した。全体の問題の得点難易度は昨年より明らかに高かった。29点とは、4問を完全に解き、残り2問から1点獲得すれば金メダル圏内に入るということだが、小紅書の大規模モデルdots-note-3.0はすべての問題を正解しており、金メダルラインと13点の差がある。
満点の成績はまず、Agentic推論システムの安定性を証明している。モデルは自然言語の条件を読み取り、重要な情報を判断し、中間的な結論を導き出し、それらを完全な証明として構成しなければならず、条件の誤解や推論の飛躍は審査員によって即座に指摘される。dots-note-3.0が6つの異なる問題カテゴリで連続して満点を取得したことは、その性能が特定の問題に対する偶然のインスピレーションに依存していないことを意味する。さらに、モデルは自然言語を用いてエンドツーエンドで処理し、問題理解から回答の表現までの完全な閉ループを備えており、これは汎用的な移転可能な推論能力を有していることを示している。

具体的解答プロセスにおいて、dots-note-3.0はエージェント方式を採用し、自然言語とPythonコードの実行を組み合わせて推論を行い、再帰的な自己批判機能を活用して自身の論証を検証する。本当に驚かされるのは第3問——組合せゲーム理論の問題である。一般的な解法は、元の問題をグラフ理論の連結性問題に変換して証明を構築するが、dots-note-3.0は帰納法を用い、問題の本質的な構造を捉え、適切な帰納対象と命題を設計した。
CMO金メダリストの劉涵祚は、「正しいかつ美しく、構造が凝縮され、論理が自然で、IMOの解答にも匹敵するほど簡潔で洗練されている」と評価した。CMO金メダリストの汪千桐は、「簡潔で明瞭かつ本質を突き、すべてのステップが自然に流れているが、人間の選手がこの視点からアプローチするとは思いつきにくい」と述べた。
小红书にとって、IMO満点は重要な技術的なプレゼンテーションである。これまで外部の小紅書の技術に対する認識は、コンテンツコミュニティ、推奨アルゴリズム、コンテンツ理解に限定されており、基礎モデル分野における位置づけは公にされた信頼できる証拠が不足していた。しかし、IMO満点は異なる。42点という得点が明確に示されており、複雑な説明は不要であり、小紅書が業界が真剣に注目すべき基礎モデル能力を備えていることを十分に証明している。基礎モデル分野に、注目すべき新規参入者が登場した。なお、dots-note-3.0は間もなくオープンソース化される予定である。
