AIは、あなたが半完成状態のIKEA棚の写真を見て、どのステップで間違えたかを特定できるようになった。 Epochが「家具組立ベンチマーク」をリリースした。 このモデルは、説明書のPDFと半完成品の1枚の写真を受け取り、間違ったステップを特定して誤りを説明するか、間違いがない場合は何も言わない。 2025年11月:最高スコア28%(Claude Opus 4.5) 今日:80%(GPT-6 Astra) 10か月で+52ポイント Fable 5.1は70%、Opus 5は61% 玩具のように聞こえるかもしれないが、そうではない。 これは、ロボットが欠いているまさにそのスキルだ。マニュアルを読み、現実の世界を見て、現実が計画と一致していないことに気づく。 コーディングベンチマークは画面内で何が起こるかを示す。このベンチマークは、AIがあなたのリビングルームにどれだけ近づいたかを示す。 公平に言えば、これは小さなテストだ。60枚の写真、3つのIKEA製品、評価者は別のモデルだ。この数値に家を賭けるつもりはない。 しかし、傾向の方が規模より重要だ。 最も恐ろしいのはそのスピードだ。28%から80%まで、1年未満で上昇し、ほとんど誰もこの推移に注目していなかった。 個人的には、この進化が私のタイムラインを大きく変えた。家の中のロボットは2030年代の話だと思っていたが、指示と実際の作業を10回中8回チェックできるモデルとは、すでに「脳」の部分はほぼ完成しているということだ。 次は「手」の段階だ。


