過去1年間、「ワールドモデル」はAI業界で最も乱用されている用語の一つとなった。 連続した動画を生成できるものをワールドモデルと呼ぶ;プレイヤーが画面内で数歩歩けるものをワールドモデルと呼ぶ;ロボット、動画生成、3D、具現化された知能というまったく異なる分野が、すべて自分たちにこのラベルを貼り付けている。この言葉はますます大きくなり、その意味はますますあいまいになっている。 World Labs は以前、同行にやや失礼な行為をした。彼らはまず「ワールドモデル」に基準を設けた。次に何が見えるかを生成するだけでは不十分だ。システムは、物がどこにあり、互いにどのような関係を持ち、状態がどのように変化するかを理解している必要がある。その段階になって、ようやく世界を模倣し始めたと言える。 これが私がこの記事を書いた理由だ。 ワールドモデルの次段階の分かれ目は、生成される画像がどれほどリアルかではなく、モデルが機械が読み取り、測定し、操作できる内部世界を持っているかどうかにある。Atlas はまだこの問題を解決していないが、少なくとも問題の設定は正しい。 今日「ワールドモデル」と呼ばれている多くのものは、振り返れば、結局のところより高度な動画生成ツールに過ぎなかった可能性が高い。

