アリババがQwen 3.8 Flashモデルをリリースし、オープンソース化。125B MoEアーキテクチャを採用し、1トークンあたり約6Bのパラメータのみが活性化され、ネイティブで262144トークンのコンテキストをサポートし、YaRNにより1Mトークンまで拡張可能。このモデルの革新的な点は、コンシューマー向けの4090 GPU上で実行可能であり、データセンター級の長文モデルをコンシューマー向けハードウェアに移行した点にある。さらに競争力のある価格設定として、入力100万トークンあたり0.8元、出力100万トークンあたり2.7元で、DeepSeek-V4-Flashの3分の1の価格。実証テストでは、4つのプラットフォーム用の文案を2分以内に作成し、会議録の抽出、テーブル整理、メール生成を4分以内に完了。Qwen 3.8 Flashはすでに千問オフィスプラットフォームにリリースされ、APIインターフェースも同時に公開された。同日、智譜はGLM-5.3-Flashをオープンソース化し、Claude Opus 4.8と同等のパフォーマンスを実現しながら、その価格は1/40である。記事執筆者、出典:量子位
アリババのQwen新モデルが、また新たなレベルを切り開きました。
彼らが公開し、オープンソース化したQwen 3.8 Flash-Nextは、価格でDeepSeek-V4-Flashを圧倒するだけでなく、リリース直後にHuggingfaceのトップに輝きました!

Twitterのユーザーたちも盛り上がり、エンジニアが実際のテスト動画を投稿して「すげえ!」と叫んだりしました:
Qwen 3.8 FlashはVRAMの障壁を突破し、データセンター級の長文大規模モデルが、一般消費者向けの4090 GPUでも動作可能に!
すでに誰かがそれを仕事に活用しています。
8分未満で、Pythonプログラミング、複数テーブル分析、およびレポート生成を含む一連のワークフローを完了しました:

宝塔エフェクトも余裕です:

Wow、本当にこんなに凄いの?私たちもぜひ試してみましょう。

100万トークンの入力あたり0.8元のみ
Qwen3.8-Flashは125B MoEアーキテクチャを採用し、1トークンあたり約6Bのパラメータのみを活性化します。ネイティブで262144トークンのコンテキストをサポートし、YaRNにより1Mトークンまで拡張可能です。
同時に、これはQwen4の新しいアーキテクチャの事前プレビューでもあります。
Qwen 3.7 Plusと比較して、Qwen 3.8 Flashは活性化パラメータを1/3に削減しただけでなく、トレーニングコストも1/9に抑え、汎用性、数学的推論、プログラミングなどの能力もさらに強化されています。
さらに厳しいのは価格で、Qwen 3.8 Flashでは100万トークンあたりの入力は0.8元、出力は2.7元、キャッシュヒットは0.1元であり、価格はDeepSeek-V4-Flashの1/3まで低下しています。
拼多多の「一刀砍」よりもはるかに強いですね(冗談です

わかりました、価格がここまで競争しているなら、遠慮なく本気でいきましょう。実際に2つのテストを実施して、Qwen 3.8 Flashがオフィスシーンでどれほど実用的な性能を発揮するか探ってみましょう。
実証テスト1:カメラ製品向けに、異なるスタイルのプラットフォームに適応した4つのコピーを設計する
私たちは「サイバーテキストチャレンジ」を開催し、Qwen 3.8 Flashに1元の予算内で、約1万字のカメラ製品資料を小紅書、微博、抖音、および朋友圈の文案に書き直させ、どれだけのタスクを完了できるかを試しました。
以下のプロンプト:

プロンプトを送信した後、私は会社のティーラウンジで水を汲みに行き、全体で2分もかかりませんでした。
戻って確認すると、4つの異なるプラットフォームの文案がすべて完成しており、@ブランド、スタイル、ハッシュタグも完璧に抑えられています(私はそんなに長い朋友圈は投稿しないだけですhhh):




2分未満で4つのコピーを仕上げ、「サイバーワーカー」の手際は合格点だ。
しかし職場で本当に頭を悩ませるのは、コピーライティングを書くことではなく、会議が終わった後に散らかった状態を誰が片付けるかである。
そこで、私たちはそれに第二の仕事を与え、その実務能力を試しました。
実証テスト2:製品週次会議を実行可能なプランに変える
「スマートカスタマーサポートAgent V2.0 要件と技術レビュー会」をテーマに、週次ミーティング終了後に手に入るような、音が似ている誤字が多く、雑談が交じった万字の原始ミーティング記録をそのまま再現し、Qwen3.8-Flashが一度の処理で要約の抽出、テーブル整理、ミーティング後の通知メール作成の3つの作業を完了しました。
△画像はAIが生成しました。「token」を「偷啃」と聞き間違えるとは、本当に生活感がありますね
以下のプロンプト:

デフォルトモードで、4分未満でQwen3.8-Flashはすべてのタスクを完了し、5つの核心的な結論の要約やテーブルの役割分担の内容も正確で、メールのフォーマットは規範的であり、受信者も会議の内容と正確に対応しています。



△部分テスト結果図
特に要求しなくても、会議でまだ結論が出ていない項目を自ら整理して提示してくれて、次回の会議で継続して議論できるようにしてくれます。be like:

そして、ここまで来ても、私のクォータはまだ使い切っていませんよ!
あはは、このような制限のない感じは本当に気持ちいい。
現在、Qwen 3.8 Flashは「千問オフィス」プラットフォームで初公開され、APIインターフェースも同時に開放されました。ぜひお試しください!

もう一つ
国内大規模モデルの価格戦争がさらに激しくなっている。
Qwen 3.8 Flashがオープンソース化されたほぼ同時に、智谱はGLM-5シリーズの最初のネイティブマルチモーダルモデルであるGLM-5.3-Flash、つまり以前ネットで話題となった「牛来」大モデルOx Alphaをオープンソース化しました。
評価において、このモデルの性能はClaude Opus 4.8に匹敵し、価格はGLM-5.3の1/10に引き下げられました。

また、GLM-5.3-Flashは2週間の半額キャンペーンを実施しており、キャンペーン期間中のGLM-5.3-Flashの価格はGLM-5.3の1/20、Opus4.8の1/40となります。

また、Qwen 3.8 FlashとGLM-5.3-Flashには、今回ともに超低価格でDeepSeek-V4-Flashを驚かせたという共通点があります(DeepSeekは文句を言いながら去っていきました):
△DeepSeek-V4-Flash、Qwen 3.8 Flash、GLM-5.3-Flashの価格比較図
言うまでもなく、激しい競争ですね。
