DeepSeekは、100万トークンのコンテキストを処理し、2年前にリリースされた一部のオープンソースモデルよりも少ないパラメータを活性化するモデルを発表しました。9月10日に発表されたV4.1-Flashは、中国のAIスタートアップが大規模言語モデルの経済モデルを再定義しようとする最新の取り組みです。
このモデルは、5520億のパラメータをMixture-of-Experts(MoE)アーキテクチャに統合していますが、入力タスクには約80億、出力には約160億のパラメータしか活性化しません。その結果、実際の計算リソースの規模よりもはるかに高い性能を発揮します。
それを可能にするアーキテクチャ
V4.1-Flashは、DeepSeekが非対称な因果的エンコーダー・デコーダーアーキテクチャーと呼ぶものを導入し、入力を処理し出力を生成する際に、単一のパイプラインを通すのではなく、各タスクに最適化された異なるパスを用います。
コンテキストウィンドウは100万トークンまで拡張されています。この巨大なコンテキストをサポートするためのKVキャッシュは、トークンあたり約890バイトを消費し、前のV4-Flashモデルに必要だった量の約4分の1です。
このキャッシュ削減は、表面上よりもはるかに重要です。KVキャッシュは、モデルが同時にサービスできるユーザー数や会話の継続時間に影響を与えるメモリのボトルネックです。これを75%削減すると、オペレーターは同じハードウェアで約4倍のユーザーをサービスできるようになり、GPUクラスターをアップグレードせずに4倍長いコンテキストを処理できます。
ベンチマークにおいて、DeepSeekはV4.1-Flashが同社のV4-Proモデルを上回り、GPT-5.6およびKimi K3と直接競合すると主張しています。同社は既にV4-Proからのリクエストを新しいモデルに転送しており、更新された料金は9月14日から適用されます。
オープンウェイト、オープン戦略
DeepSeekは、Hugging Face上でモデルの重みをMITライセンスで公開しました。新しいモデルは、エンドポイント「deepseek-flash」を通じてDeepSeekのAPIから利用可能です。オープンな重みとAPIアクセスの組み合わせにより、2つの採用パスが実現されます。独自のインフラで推論を実行したい開発者はローカルにダウンロードしてデプロイでき、マネージドサービスを好むユーザーはDeepSeekの新しい価格プランでAPIを呼び出せます。
IPOの影響と競争的ポジショニング
V4.1-Flashのリリースタイミングは偶然ではありません。DeepSeekは上海のSTAR市場での上場が予想されており、技術的な勢いを継続的に示すことは、ロードショーのプレゼンテーションをより説得力のあるものにするのです。
V4.1-Flashに組み込まれた視覚およびテキストデータをカバーするマルチモーダル理解は、OpenAIやKimi K3を開発するMoonshot AIなどの競合他社の差別化の機会を狭めています。
