過去一週,Qwen3.8-Max-Preview 與 Kimi K3 線上亮相,將國產大模型的參數規模推至2萬億級以上。
不過,大模型之爭早已超越了單看 Benchmark、只看參數的階段。能否真正介入日常的工作流程,才是衡量基模能力的最佳標準。
針對此,Biteye 今天決定拉出來溜溜,看看是驢子還是馬。
同樣是「一句話做個 Biteye 風格的雷霆戰機網頁小遊戲」的提示詞,Qwen3.8、Kimi K3、gpt5.6 sol 三個模型交出了完全不同的答卷:
- Qwen3.8:能動,也僅限於能動
- GPT-5.6 Sol:視效好看,像品牌官網
- Kimi K3:最多花樣,遊戲感最強
⚠️溫馨提示:由於 Kimi K3 因算力限制不再開放訂閱,本次測試最終由 WorkBuddy 調用。
Qwen3.8:戰機起飛了,結果沒有然後 | 評價:1顆⭐
https://x.com/i/status/2079865420576927996
打開 Qwen3.8 版本,第一感覺是:逗我呢?
深藍色背景,中間是一個非 Biteye 原生的 Logo,以及一個「開始遊戲」按鈕。標題中的黑色文字與深色背景融為一體,彷彿提前開啟了隱身模式。
進入遊戲後,基本功能還算勉強夠用:
- 拖曳飛機
- 自動發射子彈
- 紅色三角形敵機
- 得分統計
- 撞機與結束機制
在實際測試中,戰機可持續射擊,分數也一路攀升至 858,Qwen3.8 至少已成功運行。
但問題是,整個遊戲就像一個剛搭建好的 Canvas 演示:敵機是三角形,子彈是光點,玩法幾乎沒有變化。沒有任何武器成長、沒有任何道具系統,也沒有明顯的關卡節奏。
正如 Qwen 團隊自己宣布的那樣,Qwen3.8 的後訓練尚未完成,正在「按天迭代中」。
顯然,美術和策劃還未進群。
GPT-5.6 Sol:美工不錯,玩法有待加強 | 評價:3.5顆⭐
https://x.com/i/status/2079865420576927996
打開 GPT-5.6 Sol 版本,氣勢一下就上來了。
左側是鮮明的任務,中間是戰鬥區域,右側是可視化雷達和遙測模組。深色背景搭配螢光青,再結合中英文混排和 Biteye 品牌元素,極具 007 特工儀表盤的視覺感。
它的系統也比 Qwen 豐富不少,譬如:
- Wave 波次
- Armor 裝甲
- Overdrive 狀態
- Combo 連擊
- 最高紀錄
- 暫停功能
- 滑鼠和鍵盤雙操作
在實際測試中,遊戲順利運行並取得 922 分。失敗時不會簡單彈出「Game Over」,而是顯示「戰機離線」,重新開始則稱為「重新連接」。從開始到結算,文案與視覺都保持同一套世界觀,這一點相當有特色。
不過,GPT-5.6 Sol 的問題在於太擅長包裝了。左右兩側的資訊面板佔據了大量空間,真正的遊戲區域反而被壓在中間。它更像一張完成度很高的品牌活動頁,裡面順便嵌了一款小遊戲。
與 Qwen3.8 相比,gpt-5.6 sol 的美術、品牌和運營均已到崗,但遊戲策劃明顯摸了點魚。
Kimi K3:別人在做 Demo,它已開始加入付費點 | 評價:4 顆⭐
https://x.com/i/status/2079865420576927996
Kimi K3 的首頁雖然沒有 GPT-5.6 Sol 那麼驚豔,但遊戲說明一出來,味道就不一樣了:
- W:火力升級
- S:StarShield
- B:炸彈
- H:修復
- 空格:釋放炸彈
- P:暫停
- M:靜音
進入遊戲後,還有三條生命、火力等級、炸彈數量、暫停按鈕和聲音開關。
另外兩個版本還在慢吞吞地解決「飛機怎麼移動」,Kimi K3 已經開始考慮玩家撿到道具之後怎麼玩了。
這也是三個版本最明顯的差距:Qwen 實現了射擊功能,Sol 完成了視覺包裝,Kimi 則主動補上了道具、資源、成長和主動技能。
當然,它的畫面仍然不算精細。敵機和特效大多是簡單的幾何圖形,部分 Logo 素材貼得也比較直接。但作為一款小遊戲,它最懂得不斷給玩家新東西。
三個模型,分別招進哪個部門?
如果把三個模型當成新員工,這次測試大概是這樣的:
一句話生成遊戲,拼的早就不只是代碼
以 Biteye 的 雷霆戰機 測試為例,現在讓大模型寫代碼,製作一個「飛機會移動、子彈會發射」的網頁並不難。
但真正拉開差距的是,模型在前置邏輯訓練後,會不會主動設計反饋、關卡、道具、成長和視覺主題。大模型不仅要理解代碼,還要真正理解,玩家為什麼願意再玩一局。
