過去1週間で、Qwen3.8-Max-Preview と Kimi K3 が次々と登場し、国内大規模モデルのパラメータ規模を2兆以上に引き上げました。
しかし、大規模モデルの競争は、ベンチマークやパラメータ数だけを重視する段階をすでに超えています。日常のワークフローに実際に組み込むことができることが、ベースモデルの能力を測る最良の基準です。
これについて、Biteyeは今日、驴か馬か、実際に試してみることにしました。
同じ「一文でBiteyeスタイルの雷霆戦機ウェブ小游戏を作る」プロンプトに対して、Qwen3.8、Kimi K3、gpt5.6 solの3つのモデルは全く異なる回答を提示した:
- Qwen3.8:能動であり、かつ能動に限る
- GPT-5.6 Sol:ビジュアルが良く、ブランドの公式サイトのようだ
- Kimi K3:花活が最多で、ゲーム感が最も強い
⚠️お知らせ:Kimi K3は計算能力の制限によりサブスクリプションの受付を終了したため、本次のテストはWorkBuddyが呼び出します。
Qwen3.8:戦闘機が離陸したが、その後何も起こらなかった | 評価:1つ星⭐
https://x.com/i/status/2079865420576927996
Qwen3.8バージョンを開くと、最初の印象は:冗談ですか?
濃い青の背景に、Biteyeのネイティブではないロゴと「ゲームを開始」ボタンが中央に配置されています。タイトルの黒い文字が濃い背景と溶け合い、まるで事前に隠身モードを起動したかのようです。
ゲームを起動すると、基本機能はなんとかまともに動作する:
- マウスで戦闘機をドラッグ
- 自動で弾を発射
- 赤い三角形の敵機
- 分数統計
- コラプションと終了メカニズム
実証テスト中、戦闘機は連続射撃が可能で、スコアは858まで上昇しました。Qwen3.8は少なくとも動作しました。
しかし問題は、このゲーム全体が剛構築されたCanvasデモのようだということです:敵機は三角形、弾は光点で、プレイ方法はほとんど変化していません。武器の成長も、アイテムシステムも、明確なステージのリズムも一切ありません。
Qwenチーム自身が発表したように、Qwen3.8の後学習はまだ完了しておらず、「日次でイテレーション中」です。
明らかに、アートとプランニングの担当者がまだチャットに参加していません。
GPT-5.6 Sol:デザインは良いが、プレイ性は改善の余地あり|評価:3.5⭐
https://x.com/i/status/2079865420576927996
GPT-5.6 Solバージョンを開くと、一気に気合が入ります。
左側は明確なタスク、中央は戦闘領域、右側はビジュアル化されたレーダーとテレメトリーモジュールです。ダークな背景にフローレッセントシアンを組み合わせ、中国語と英語の混在とBiteyeのブランド要素を加えることで、007スパイの仪表盤のようなビジュアル感を実現しています。
そのシステムはQwenよりもはるかに豊かです。たとえば:
- Wave波次
- Armor装甲
- オーバードライブ状態
- コンボ連打
- 最高記録
- 一時停止機能
- マウスとキーボードの両方で操作
実際のプレイでゲームは正常に動作し、922点を獲得しました。失敗しても単に“Game Over”と表示されるのではなく、“戦機オフライン”と表示され、再開は“再接続”と呼ばれます。開始から結果表示まで、文案とビジュアルが一貫した世界観を保っている点が非常に洗練されています。
しかし、GPT-5.6 Solの問題は、包装が行き過ぎていることです。左右の情報パネルが大量のスペースを占め、本当のゲーム領域は真ん中に圧縮されています。これは、ちょっとしたミニゲームが埋め込まれた、完成度の高いブランドキャンペーンページに似ています。
Qwen3.8と比較して、gpt-5.6 solのアート、ブランド、運用チームは全員揃ったが、ゲームプランニングは明らかに手を抜いている。
Kimi K3:他の人がデモを制作している中、彼は課金ポイントを追加し始めた | 評価:4つ星
https://x.com/i/status/2079865420576927996
Kimi K3の最初の画面はGPT-5.6 Solほど驚異的ではないが、ゲーム説明が出てきた瞬間、雰囲気が変わった:
- W:火力アップ
- S:スターシールド
- B:爆弾
- H:修正
- スペース:爆弾を投下
- P:一時停止
- M:ミュート
ゲーム開始後、3つのライフ、火力レベル、爆弾の数、一時停止ボタン、音声スイッチがあります。
他の二つのバージョンはまだ「飛行機をどう動かすか」をゆっくり解決しているところだが、Kimi K3はすでにプレイヤーがアイテムを拾った後の遊び方を考え始めている。
これは3つのバージョンにおける最も明確な差異です。Qwenは射撃機能を実装し、Solはビジュアルパッケージを提供し、Kimiはアイテム、リソース、成長、およびアクティブスキルを積極的に補完しました。
もちろん、その画質はまだ精細とは言えません。敵機やエフェクトはほとんど単純な幾何学図形で、一部のロゴ素材もそのまま貼り付けられています。しかし、この小さなゲームは、常にプレイヤーに新しい要素を提供することをよく理解しています。
3つのモデルをそれぞれどの部署に採用しますか?
三つのモデルを新入社員に例えると、今回のテストはこのような感じです:
一発生成ゲームでは、もうコードの早さだけでは勝てない
Biteyeの雷電戦闘機テストを例に挙げると、大規模モデルにコードを書かせて、「飛行機が移動し、弾丸が発射される」ウェブページを作成することは難しくない。
しかし、真に差を生むのは、モデルが事前ロジックのトレーニング後に、フィードバック、レベル、アイテム、成長要素、ビジュアルテーマを自発的に設計できるかどうかである。大規模モデルはコードを理解するだけでなく、プレイヤーがなぜもう一回プレイしたいと思うのかを真正に理解しなければならない。
