Claudeは今回、AIプログラミングランキングを断トツの1位に引き上げた!
最新のMirrorCodeランキングで、Claude Fable 5が64%の絶対成功率で再び1位となりました。
その後を追うGPT-5.6 Solのスコアは、その3分の1に過ぎません!
4位のGPT-5.5はさらに惨憺たる状況で、成績はわずか10%にとどまり、自社の先輩であるGPT-5.4に圧倒的に劣っている。

さらに驚くべきことに、Goなどのリソースを多く消費する言語を使用した場合、Fable 5の解出率は64%であり、マイナーな言語Adaに切り替えても、成績は依然として61%と高い。
オープンソースの世界では、PythonのコーパスはAdaの約230倍です。
しかし、Fable 5では、成績がたった3パーセントポイント低下したにすぎない。

これは面白いですね。
モデルが人気言語の文法や一般的な書き方を主に記憶に頼っている場合、Adaに変更した後は成績が低下すべきである。
しかし、現在の結果は別の可能性を示唆している——
最強のモデルは、特定のコーパスに依存することなく、ゼロから完全なソフトウェアプロジェクトを構築する方法を学び始めた。
100%通過線で固まる、100億トークンの極限テスト
具体的には、MirrorCodeはUnixツール、インタプリタ、データクエリ、バイオインフォマティクス、暗号学、圧縮ツールなどの分野をカバーする25のターゲットプログラムで構成されています。
ここで、モデルは隔離環境に配置され、インターネットに接続できず、元のプロジェクトのソースコードを見ることはできず、サードパーティの依存関係をダウンロードすることもできません。モデルが入手できるのは、高レベルのドキュメント、一部の可視テスト、および繰り返し呼び出せる元のプログラムのみです。
次に、それは元のプログラムに継続的にデータを入力し、出力を観察して内部ロジックを推測する 点点 一貫した行動をする新しいプログラムを書く。
最新のランキングから15のMediumおよびLargeターゲットを選出します。各ターゲットについて、2つの実装言語を使用し、各言語で3回実行します。
また、公開テストと非公開テストの完了率が100%でなければ合格とはならず、99.9%でも不可です。
1つのエッジケースでも見逃した場合、全体の実行は失敗とみなされます。

モデルに最後のいくつかのギャップも埋めさせるために、MirrorCodeは1回の予算を100億トークンに引き上げ、最長7日間の連続実行を許可しました。
論文で最もコストが高かったタスクはさらに激しく、モデルが連続して19日間動作し、1回のコストが2600ドルに達した。
この19日間、モデルは元のプログラムを繰り返し実行し、結果を比較して機能を補完した後、テストを再実行します。エラーが発生すれば原因を調査し、出力が一致しなければ仮説を変更します。部分的に成功したら、次の欠落部分を追跡します。
このプロセスは、一度の生成というより、数日間続くデバッグに似ている。

gotreeの例が最も直観的です。
この生物情報学ツールは、元々約1万6000行のGoコードと40以上のコマンドを含んでいました。
Claude Opus 4.7は14時間と251ドルを費やし、2001のテストのうち2000項を通過し、達成率は99.95%でした。
週単位で計算されていた工数を、わずか十数時間に圧縮したが、MirrorCodeの100%クリアラインに阻まれ、日付コメントの処理というマイナーなバグを見落としてしまった。
Epochは、AIを使用しなければ、人間のエンジニアが同じタスクを完了するには少なくとも2〜17週間かかると推定しています。
語料の砂漠で、Fable 5はわずか3分しかドロップしなかった
MirrorCodeの論文は、StarCoderの公開トレーニングデータを参照として使用していた。
Pythonは約8%を占め、Adaは0.034%にすぎず、前者は後者の約230倍です。

もちろん、閉源モデルがどれほど多くのAdaコードを見たかを知ることはできませんが、公開エコシステムを基準にすると、Adaがどれほど希少であるかは十分に明確です。
この言語は主に航空宇宙、防衛、その他のセキュリティ重要システムで使用されます。コミュニティの規模、チュートリアルの数、オープンソースプロジェクトの数いずれも、Python、JavaScript、またはGoと比べてはるかに劣ります。
そして、Fable 5は明らかにGoコードをAdaに逐語的に翻訳しているわけではない。
まず元のプログラムがどのように動作するかを理解し、その後、別の言語で同じ動作を再構築するようなものだ。

一方、他のモデルはこれほど安定していません。
GPT-5.6 Solは24%から19%に低下し、GPT-5.4は21%から12%に低下し、GPT-5.5は17%から5%にまで落ち込んだ。言語を変えると、差が即座に拡大する。
プロジェクト全体をAIに委託する
現在、Cursorは数百のエージェントを協力させ、約1週間でゼロから100万行以上のブラウザコードを1000のファイルにわたって書き上げました。
Anthropicは16のClaude Agentを並列で約2000回のセッションを実行し、最終的にLinux 6.9カーネルをコンパイルできる10万行のCコンパイラを構築した。
OpenAIが5月までに公開したCodexの個人ユーザー样本では、70.2%が少なくとも1回、人間の作業量で1時間以上かかるタスクを提出しており、25.6%が8時間以上かかるタスクを提出していた。
人々がAIに委ねる単位は、一段のコードや一つのバグから、午後、一週間、さらには全体のプロジェクトへと変わっている。
MirrorCodeの64%は、この「プロジェクトレベルの委託」を定量化したものです。
それは、目標が明確で結果が自動的に検証できる場合、最先端のモデルが中〜大規模なソフトウェアの一部を自立して完了できることを示している。
AIに仕事を委託しているすべての人にとって、変化はもう目の前に迫っている——
以前はすべてのコードを手で書き上げる必要があったが、今後は重要な節目でだけ、それが正しい方向に進んでいるかを確認するようになるだろう。
コードはますます安くなります。
問題を明確に説明し、結果を正確に検証できる人々は、ますます価値が高まっていく。
参照:https://epoch.ai/MirrorCode
本文は微信公众号「新智元」より、著者:ASI启示録;編集:モーセ
