Epoch AIは、AIの「思考」コストを初めて測定し、その低下速度はこれまでのいかなる変革技術よりも速いことが明らかになった。 Epochは、モデル性能、トレーニングコスト、チップ、データセンターのデータを独自に収集し、AIの進化を追跡する独立した研究機関である。9月22日の報告書で、Luke EmbersonとDavid Roodmanは、約3年間にわたり、5つのベンチマーク(数学、ハードサイエンス、スキルゲーム)で同じ性能レベルを達成するコストの変化を分析した。 中心的な数値:2023年以降、特定の性能レベルを達成するコストは四半期ごとに約47%低下しており、年間で13倍安くなっている。歴史的比較では、DNAシーケンシングの4倍、コンピューティングの6倍、リチウム電池の18倍、1973年までの電力の54倍も速いペースだ。証拠は、2021年11月にOpenAIがGPT-3のAPIを完全に開放して以来、この速度で継続していたことを示唆している。 2025年1月31日、OpenAIのo3は、物理学・化学・生物学の博士課程レベルの多肢選択試験であるGPQA Diamondで75%の正解率を達成するのに、1問あたり約30セントかかっていた。それから18か月も経たないうちに、GPT-5.6 Lunaは同じ結果を0.0004ドル(0.04セント)で達成した。725分の1の価格低下だ。Epochは、新車の価格が5万ドルから69ドルに下がるような比喩でこれを例えている。 低下速度は分野によって異なる:ゲームパズルでは四半期ごとに39〜43%(やや遅め)、数学では50〜52%(より速い)。また、ある性能レベルがその時点での最高峰になると、直後に価格が急激に下落する。主要5ベンチマークの平均では、最先端モデルが登場した直後は四半期ごとに66%(年間75倍)下落し、2年後にはその半分の32%(年間4.7倍)に減速した。彼らの仮説は、初期段階では研究ラボがプレミアムを課し、その後オープンおよびクローズドな競争が価格を押し下げているという点だ。 彼ら自身も課題を列挙している。ラボはベンチマーク向けに過剰にトレーニングしている可能性がある。試験に正解することが実用的な仕事とは限らない。実際のユーザーは常に最安値の最先端モデルを使うわけではない。データ期間はわずか3年であり、平均値は複数の方法で算出可能だ。 AIスタックにとっての教訓は明確だ:昨日までプレミアムだった能力が急速にコモディティ化し、大規模利用を可能にするのは新しいモデルそのものではなく、タスクあたりのコストである。APIを販売する企業にとって、特定モデルでの異常な利益は一時的なものに過ぎない。Epoch自身も、これは競争の原因であり結果であると述べている。彼らのグラフでは、最上位付近での激しい競争は主にクローズドモデル間で発生している。投資家にとって、推論マージンは圧縮されている。ボリュームを獲得し、コスト面で一四半期でも先行する企業が重要であり、「永遠のモデル」という物語よりも重要だ。最上位で最も安価であるというプレミアムは急速に消える。 チップとエネルギーのコストは上昇したが、「思考」コストは安くなった。

