智谱在10万台国产芯片上推出GLM-5.3-Flash模型,与NVIDIA竞争

iconMetaEra
共有
AI summary icon概要
Zhipu AIは、GLM-5.3-Flashモデルをリリースし、現在、10万台以上の国内チップからなるクラスターにデプロイされています。このモデルは以前Ox Alphaと呼ばれており、NVIDIA GPUと同等の効率とトークンコストを実現し、AAインテリジェンスインデックスで57点を獲得しています。先行する競合他社よりも低価格で、GLM-5シリーズ初のネイティブマルチモーダルモデルです。オンチェーンデータは、AIインフラへの関心の高まりを示しており、オンチェーン分析では、コスト効率の高い国内ソリューションへのシフトが強調されています。
智谱は最新モデルGLM-5.3-Flashを発表しました。このモデルは以前、匿名でOx Alphaとしてテストプラットフォームで無償公開され、5日間で50兆トークンを超えるトラフィックを記録しました。モデルの推論サービスには10万枚以上の国内製チップクラスタが使用され、ハードウェア効率および1トークンあたりのコストはNVIDIA GPUと同等レベルに達しています。性能面では、AA総合インテリジェンス指数で57点を獲得し、Claude Opus 4.8と同等です。価格は入力100万トークンあたり0.8元、出力100万トークンあたり2.8元と、競合製品に比べて大幅に低価格です。アーキテクチャはスパース注意力とリニア注意力のハイブリッド設計を採用しており、GLM-5シリーズで初のネイティブマルチモーダルモデルです。国内のAIモデルが次々と価格を引き上げる中、智谱は低価格戦略で市場を獲得しています。

記事執筆者、出典:晚点LatePost

8月26日、智谱は正式に、開発者コミュニティで話題を呼んでいた匿名モデルOx Alpha(中国語コミュニティでは「牛来」と呼ばれる)が、最新リリースのGLM-5.3-Flashであることを確認しました。モデルのコードネームは、中国で現在公開中の映画『牛来』に由来しています。

このモデルは正式リリース前に、OpenRouterおよびOpenCode上で匿名で無償テストが提供され、5日間で累計50兆トークン以上のトラフィックを記録し、両プラットフォームのトラフィック成長記録を更新しました。現在の利用量はDeepSeekの2倍以上に達しています。しかし、市場の注目を真正に引き寄せたのは、智譜がその後明らかにした詳細でした。つまり、これらのトラフィックはすべて中国製チップで処理されていたということです。

智谱は公式技術ドキュメントで、このモデルの推論サービスに10万枚以上の国内製チップクラスタを活用しており、「ハードウェア効率および1トークンあたりのコストは、主要なNVIDIA GPUと同等のレベルに達した」と述べています。

半導体研究機関SemiAnalysisは直ちにXプラットフォームで投稿し、「すべてのトラフィックは国内製チップで処理されており、ハードウェアの効率と1トークンあたりのコストはNVIDIA GPUと同等レベルに達している。昨日発表されたJalapeño(OpenAI自社開発の推論チップ)に続き、CUDAの護城河が再び試されている。」

10万枚国产芯片:智谱在技术文档中描述了这套国产芯片集群从测试到生产的部署细节。

単一チップの主なボトルネックはメモリ容量と帯域幅であり、100万トークンに及ぶコンテキスト長をサポートすることは特に困難である。これに対応するため、智谱はSGLangを基盤に専用推論エンジンを構築し、W8A8量子化、INT8/FP8/BF16ハイブリッドキャッシュ量子化、ノード内テンソル並列化などの技術を採用するとともに、プロダクションレベルのEncode–Prefill–Decode(EPD)分離アーキテクチャを導入し、マルチモーダルエンコード、promptのプリフィル、トークン単位でのデコードを独立してスケジューリング可能なワークプールに分割した。

智谱は、同じハードウェア上の初期ベースラインと比較して、エンドツーエンドのサービスパフォーマンスが3倍向上したと述べています。

『晚点LatePost』の情報によると、这批チップのサプライヤーは華為、モールラインテン、またはハイグァングのいずれかである可能性がある。智譜公式はこれについてコメントを控えており、技術ドキュメントにも具体的なチップモデルは明記されていない。

SemiAnalysisはコメントで、かつてはトップレベルの先端ラボのみが1日100兆トークンの計算能力を有していると考えられてきたが、ここでは1日100兆トークンの無料トラフィックがすべて国内製チップ上で動作していると指摘した。

モデル自体:DeepSeekを目標とし、価格はClaude Opusの1/40。GLM-5.3-Flashの総パラメータ数は320B、アクティブパラメータは18Bで、パラメータ規模は前世代のフラッグシップGLM-5.3の約40%であり、DeepSeek V4 Flashとほぼ同等である。

性能面では、智谱公式の評価によると、GLM-5.3-FlashはArtificial Analysis Intelligence Index(AA総合知能指数)で57点を獲得し、前世代のフラッグシップモデルGLM-5.2を上回り、AnthropicのClaude Opus 4.8と同等であり、DeepSeekのフラッグシップモデルV4 Pro正式版の53点を上回っています。

価格設定では、GLM-5.3-Flashの入力は100万トークンあたり0.8元、出力は2.8元、キャッシュヒット価格は0.23元で、GLM-5.3の1/10です。リリース前2週間は半額で提供します。

智谱は、GLM-5.3-Flashの価格がGLM-5.3の1/10、限定割引期間中はGLM-5.3の1/20、Claude Opus 4.8の1/40であると述べました。

値下げ後のDeepSeek V4 Flash(深夜入力1.5元、出力4.5元)と比較すると、GLM-5.3-Flashはほとんどの通常利用シーンでより安価です。

アーキテクチャの革新:パラメータ数と層数がほぼ半分に削減されました。GLM-5.3-Flashは、GLM-5.3とは完全に異なるアーキテクチャを採用しており、これがより低コストでより高いパフォーマンスを実現する核心的な理由です。

GLM-4.5と比較して、GLM-5.3-Flashの総パラメータ数はほぼ同等(355B対320B)ですが、活性化パラメータ数は32Bから18Bに減少し、レイヤー数は92層から45層へとほぼ半減しました。

智谱は、GLM-5.3-Flashが、スパースアテンションとリニアアテンションのハイブリッドアーキテクチャを採用した初のオープンソースの最先端モデルであると述べた。GLM-5.3と比較して、アテンション計算量は3.01倍、KVキャッシュサイズは4.44倍削減された。

また、このモデルはGLM-5シリーズで最初のネイティブマルチモーダルモデルであり、画像と動画の入力をサポートしています。また、智谱がcodingに戦略的焦点を当てる以来、初めてマルチモーダル機能を備えた新モデルです。

価格引き上げの波の中での低価格突破。GLM-5.3-Flashのリリースは、中国AIモデル市場での一連の集団的価格引き上げの後に発表された。

Kimi K3の出力価格は100万トークンあたり100元と、前世代のK2.6の3倍以上に達している。智谱は今年上半期の価格改定後、出力価格を28元に設定した。DeepSeek V4 Proは6元から13.5元へ上昇し、ピーク時間帯には27元となる。DeepSeek V4 Flashの出力価格は2元から4.5元へ上昇し、ピーク時間帯には9元となる。

価格引き上げの直接的な結果は需要の流出である。『晚点LatePost』は、DeepSeek V4 Flashの価格引き上げ後、OpenCodeプラットフォームでの呼び出し量が半分に減少したと指摘し、この需要が国内モデルベンダーにとって新たな成長空間となった。

GLM-5.3-Flashの価格戦略は、まさにこのギャップをターゲットにしています。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。