source avatarDep

分享

AI 現在可以查看一張你未完成的宜家架子照片,並告訴你哪一步出錯了。 Epoch 剛剛發布了家具組裝基準測試。 該模型會收到一份說明 PDF 和一張半組裝物品的照片,它必須找出錯誤的步驟並解釋錯誤,或說明沒有錯誤。 2025 年 11 月:最高分 28%(Claude Opus 4.5) 今天:80%(GPT-6 Astra) 10 個月。+52 分。 Fable 5.1 為 70%。Opus 5 為 61%。 聽起來像個玩具,但其實不是。 這正是機器人所欠缺的技能:閱讀說明書、觀察現實世界,並發現現實與計劃不符。 編程基準測試告訴你螢幕上發生了什麼,而這個測試則告訴你 AI 距離你的客廳有多近。 公平地說,這是一個小規模測試:60 張照片、3 款宜家產品,評分者也是另一個模型。我不會拿房子來賭這個數字的精確性。 但趨勢比規模更重要。 最令人擔憂的是速度:不到一年內從 28% 提升到 80%,而幾乎沒有人關注這張圖表。 就個人而言,這是我推進時間線的關鍵。我一直以為家中的機器人是 2030 年代的事。一個能以 80% 的準確率檢查實物與說明是否一致的模型,意味著「大腦」部分已基本到位。 接下來就是「手」了。

No.0 picture
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露