生成モデルは、訓練方法のせいで遅くなることがあります。 多くの出力が有効な場合、再構成モデルを1ステップでそのうち1つを予測するように訓練すると、出力がそれらの可能性の平均に引き寄せられてしまいます。 ディフュージョンモデルや自己回帰モデルは、推論時に繰り返す必要のある小さなステップに生成を分割することで、この問題を回避しています。 探索的モデリングの最も単純なバージョンは、各訓練例に対して複数の可能な出力を生成し、ターゲットに最もよく一致する出力を学習します。これにより、モデルは出力を平均化するのではなく、異なる有効な出力を捉えることができます。 強力な画像生成ベースラインに探索を追加したところ、訓練サンプルを6.2倍少なく、FLOPsを4.1倍少なく使用して、ベースラインと同等の最終性能に達しました。 また、動画およびマスクドディフュージョン言語モデルの性能も向上しました。別途実施したスケーリング実験では、モデルサイズと訓練データが増加するにつれて、性能向上がさらに大きくなりました。 完全なエンドツーエンドの探索的モデルは、推論時に最大256倍少ないネットワーク評価で、ディフュージョンベースラインと同等の制御タスク性能を達成しました。 探索は、訓練中にモデルがより多くの不確実性を解決するのを助け、出力を生成するためのステップ数を減らすのに役立つ可能性があります。


