“最強模型”的保質期正在縮短。文章作者、來源:定焦
在一個月內,9 款旗艦模型集中發布,這在大模型行業並不常見。
從月初騰訊混元 Hy3 發布正式版並開源,到月末 Anthropic 發布 Claude Opus 5,期間 Kimi K3、Qwen3.8-Max 預覽版、Grok 4.5 等模型陸續登場。7 月成為近一年少見的發布高峰。

各家選擇的時間點並不相同。有的廠商借競品更新後的間隙跟進發布,有的廠商選在世界人工智慧大會前後亮相,也有廠商通過價格調整回應市場競爭。
但7月不僅模型發布數量多,更值得注意的是這輪發布反映出的兩個變化。
第一,模型之間的能力差距正在縮小。Artificial Analysis 最新綜合智能指數顯示,頭部模型之間的分差已經明顯收窄。隨著版本快速迭代,「最強模型」的位置越來越難長期保持,各家開始圍繞不同任務尋找優勢,而不是追求單一維度的絕對領先。
第二,開源模型已進入第一梯隊。在7月發布的新模型中,騰訊混元Hy3、Kimi K3等選擇開放權重(開放模型參數,允許開發者自行下載和部署)。其中,Kimi K3在Code Arena前端程式設計榜單中排名第一,超越GPT-5.6 Sol和Claude Fable 5。過去兩年,開源模型更多被視為閉源模型的追趕者,而這輪競爭顯示,開源模型已開始在部分開發場景中與閉源模型直接競爭。
那麼,這一個月的密集發佈究竟帶來了哪些變化,又意味著什麼?
01. 不再只比誰更聰明
過去幾年,大模型行業主要比拼通用能力,誰的知識面更廣、誰的回答更準確。但現在,競爭維度已經變了。
在這一輪中,代碼能力成為最明顯的爭奪方向。
OpenAI 繼續強化編程和複雜推理,並持續擴展 Codex 生態,希望透過開發工具綁定程式員用戶。Anthropic 押注代碼理解和安全審計,協助開發者處理大型項目中的複雜工程問題。Grok 4.5 則強調速度和低成本,並與 AI 編程工具 Cursor 綁定,覆蓋日常開發場景。
大模型研究者姚宇航告訴「定焦One」,各家公司都在重點投入編程能力,差距也在快速縮小,例如 Kimi K3 的代碼能力提升明顯,正在接近頭部閉源模型的水平。

圖源 / pexels
Agent 是各家爭奪的另一個方向。GPT-5.6 Sol 配合 Codex 探索自動化程式設計,Opus 5 強調長程任務執行,Kimi K3 展示連續運行完成複雜任務的能力,騰訊混元 Hy3 則試圖結合微信生態探索智能體應用。
但 Agent 在實際工作中仍不成熟。獨立開發者北城表示,目前部分智能體產品的短板不在能不能調用工具,而在任務調度能力。例如,Codex 的 Ultra 模式會開啟很多子代理,不同的子代理重複讀取同一個文件,進行類似分析,最後 Token 消耗增加,但真正有效的工作並沒有增加。在他看來,智能體能力提升不能只靠增加子代理數量,關鍵在於能否判斷哪些任務值得分析、哪些步驟可以省略。
姚宇航的看法類似。他認為智能體是目前最值得關注的方向,但離真正成熟還有距離。在他看來,醫療、金融等垂直領域的智能體仍有較大機會;下一階段拉開差距的關鍵不只是模型能力本身,還在於智能體在具體場景中好不好用、客戶願不願意買單。
國產模型則透過不同能力的提升尋找突破點。Kimi K3 選擇強化長上下文、前端編程和產品設計能力,在多個編程測試中進入頭部位置,能力接近國外閉源旗艦模型。
參數規模與推理效率之間的競爭,也成為另一條主線。
7 月發布的多款模型已進入萬億甚至數萬億參數區間,但參數規模已不能簡單等同於能力高低。隨著 MoE 架構的發展,模型可以擁有更大的參數容量,同時僅激活其中一小部分來完成推理,降低實際計算成本。
行業由此形成兩條路線:一是繼續擴大規模,用更大參數換取更強能力;二是強調效率,用更小的激活參數實現接近旗艦模型的效果。
價格也成為7月模型競爭中最直接的變量。
海外廠商更多採取差異化定價策略。OpenAI 選擇進一步細分市場,將 GPT-5.6 拆分為不同版本,讓用戶根據任務複雜程度選擇對應模型;Anthropic 則繼續維持高性能旗艦模型路線,透過 Opus 系列覆蓋高價值開發和企業場景;Grok 4.5 則採取低價策略,輸出價格僅為 Opus 系列的四分之一,並透過與 Cursor 的綁定吸引開發者。
國內廠商則更強調成本優勢。過去半年,多家國內模型廠商持續下调 API 價格,希望透過低成本降低使用門檻,擴大開發者和企業用戶規模。
一句總結,7 月的大模型競爭已從單一能力比拼,擴展至代碼、智能體、參數效率和價格多個維度。
02. 誰超出預期,誰評價兩極?
綜合相比前代的變化、榜單表現和開發者反饋,7 月發布的模型的水平大致可以分為三類。
先看超出預期的一類:Kimi K3、Grok 4.5、混元 Hy3。
其中最受關注的是 Kimi K3。該模型採用 MoE 架構,總參數規模達到萬億級別,重點強化了長上下文、前端編程和產品設計能力。發布當天,Kimi K3 便以 1679 分登上 Code Arena 前端編程榜第 1 名,相比前代 Kimi K2.6 的第 18 名,提升 17 個位次。在一周後的 Arena 綜合榜上,Kimi K3 則首次進入全球 Top 10。
但 Kimi K3 也有明顯的能力邊界。在 Artificial Analysis 的知識可靠性測試中,其幻覺率從 Kimi K2.6 的 39% 升至 51%,輸出速度約為 33 Token/s,遠低於同類模型。
開發者的實際使用感受也印證了這種「偏科」。北城認為 Kimi K3 相比上一代確實有明顯提升,優勢主要集中在前端開發、UI 設計和產品表達。例如在優化網站 UI、設計 APP 界面這類任務中,Kimi K3 能產出更好的產品,但涉及複雜工程任務時,表現不夠穩定。

圖源 / pexels
同樣受關注的還有 Grok 4.5。於 7 月 9 日發布後,它進入 Artificial Analysis 智能指數前列,並在部分工具調用測試中表現突出,被不少開發者視為性價比較高的選擇。
北城的體驗與此一致,他認為 Grok 4.5 最大的優勢是速度,同樣的需求用它可能三五分鐘就完成了,而用 GPT-5.6 有時需要二十分鐘甚至半小時,加上價格較低,適合有快速開發需求時使用。姚宇航認為,Grok 4.5 的編程能力經過專門優化,搭配 Cursor 使用整體體驗很好。一個背景是,SpaceX 此前宣布收購 Cursor 母公司 Anysphere,交易預計於第三季度交割;xAI 與 Cursor 展開的數據合作,也被認為有助於 Grok 4.5 優化編程體驗。
混元 Hy3 則代表了效率路線的突破。該模型總參數為 295B,激活參數僅為 21B,在參數規模不到旗艦模型五分之一的情況下,多個公開基準的成績接近體量更大的競爭模型。然而,在 SWE-Bench Pro 中,混元 Hy3 的 57.9 分與 Claude Opus 的 69.2 分仍有明顯差距,顯示其複雜代碼修復能力仍需追趕。
Yao Yuhang believes that Hunyuan Hy3 represents an improvement over Tencent’s previous models, and with its open-source nature and compact design, it is a decent choice among mid-sized models.
再看穩定在第一梯隊、但驚喜有限的一類:GPT-5.6 Sol 和 Claude Opus 5。
GPT-5.6 Sol 和 Claude Opus 5 仍保持在第一梯队,但並未帶來重大變革。GPT-5.6 Sol 強化了複雜推理與智能體編程能力,在 Terminal-Bench(測試模型在命令行環境中完成實際任務能力的基準)2.1 測試中達到 88.8%,Ultra 模式進一步提升至 91.9%。Claude Opus 5 則繼續保持在複雜任務上的優勢,更強調模型在複雜工程、代碼理解與安全分析等場景中的可靠性。Opus 5 的優勢在於性能接近 Fable 5,但價格僅為後者的一半。
Both models remain in the top tier, but have not delivered major breakthroughs.
北城提到,GPT-5.6 已經能夠滿足他大部分的日常開發需求,但在遇到特別複雜的問題時,會調用 Opus 5 來解決。不過,更強大的能力也意味著更高的成本。對他而言,Opus 5 的定位更接近於解決關鍵問題時調用的「專家」。
最後是反饋分化、仍待驗證的一類:Gemini 3.6 Flash 和 Qwen3.8-Max 預覽版。
最典型的是 Gemini 3.6 Flash。它在 Artificial Analysis 智能指數榜單上得分为 50,與前代 3.5 Flash 持平。開發者社區較一致的反饋是,這一代相比前代沒有明顯提升,表現也不如同期競品。不過也有人認為,作為一款輕量化的模型,Gemini 3.6 Flash 的輸出質量基本過關。
在獨立開發者卡普迪姆看來,Gemini 3.6 Flash 的日常使用體驗不錯,雖然程式設計能力不突出,但多模態理解仍然比較出色。它支援輸入任何格式的檔案,日常聊天的文風和體驗也優於許多競爭對手。
Qwen3.8-Max 預覽版於 7 月上線後,模型表現不穩定,市場反饋不一。北城最大的感受是 Qwen3.8-Max 預覽版的思考深度較高,但有時會陷入長時間推理,“好像自己把自己繞進去”,但最終未提供有效解決方案。卡普迪姆則認為 Qwen3.8-Max 預覽版低於預期,他在使用自己的前端美學評測集進行測評時發現,實際能力與宣傳存在明顯差距。作為一款仍在調整中的預覽版產品,最終表現仍需等待正式版發布後再驗證。
7 月沒有出現一個在所有維度都領先的模型,不同模型開始圍繞具體場景形成分工。
以北城為例,他會根據任務選擇工具:GPT-5.6 負責日常開發,Grok 4.5 用於快速完成需求,Kimi K3 用來做產品和前端場景,Claude Opus 5 負責解決複雜問題。卡普迪姆的搭配則不同,他會使用 Claude 的 Fable 5 或 Opus 5 模型進行規劃,再通過 GPT-5.6 Sol 執行。
03. 發布速度越來越快,開源與閉源之爭升溫
在這輪密集發佈背後,有幾個問題值得分析:模型迭代為何越來越快,為何集中發生在7月,以及開源為何會衝擊現有的商業模式。
首先,模型的迭代方式正在發生變化。過去,大模型能力的提升主要依賴重新訓練更大規模的模型,週期長、成本高。但隨著強化學習、後訓練(在基礎模型訓練完成後,通過微調、強化學習等方式繼續優化模型表現)等技術成熟,模型升級開始更多依賴訓練後的優化。
姚宇航告訴「定焦One」,近兩年模型發布速度明顯加快,一個重要原因是行業已掌握更成熟的後訓練方法。現在很多模型的提升並不需要重新訓練一個模型,而是在已有基礎模型上繼續優化,通過強化學習、自我迭代等方式提升能力。
這意味著模型競爭的週期正在縮短。過去,一個領先模型可能保持數月優勢;現在,版本更新帶來的領先窗口可能只有幾週。發布節奏跟不上,就可能很快被新版本覆蓋。對廠商而言,發布模型不只是技術展示,發布時間本身也成為競爭的一部分。

圖源 / pexels
其次,7月是多個節點疊加的時間。對於國內廠商而言,世界人工智慧大會(WAIC)於7月舉行,廠商集中在此前後發布模型、展示技術進展。對於海外廠商而言,多家頭部公司也選擇在這一階段更新模型,希望在開發者生態和商業競爭中佔據主動。
此外,行業的競爭規則正在變化。模型能力足夠強大已不再是唯一目標,競爭已延伸至模型如何被使用以及如何轉化為收入。
這也是為什麼開源與閉源之爭在7月再次升溫。長期以來,開源模型與閉源模型之間存在能力差距。但隨著部分開源模型進入第一梯隊,一個更現實的問題出現:當高性能模型可以免費獲得,模型公司的API調用和訂閱收入會不會被分流?
支持開源的一方認為,開放權重能降低技術門檻,讓更多企業和開發者參與 AI 創新。開源意味著技術提供方主動讓渡部分利益,推動生態發展;而閉源陣營則擔心自己的用戶會被開源模型分流。Anthropic 等公司認為,隨著模型能力提升,開放權重可能帶來安全風險,需要更嚴格的治理。
這場爭論背後,其實對應著不同公司的利益訴求。對於英偉達等基礎設施企業而言,模型開放意味著更多部署需求,也意味著更大的算力市場。對於OpenAI、Anthropic等模型公司而言,閉源模式能夠維持API調用和訂閱收入。不過也要看到另一面:開源確實會擴大部署需求,但隨著參數效率提升,單位任務的算力消耗也可能被攤薄,算力市場的增量未必與模型開放程度同步。對國內廠商而言,開放權重不只是技術路線的選擇,也是在爭取開發者生態、雲服務和後續商業化的入口。
7月之後,大模型競爭仍會繼續。開發者社區普遍預期,DeepSeek V4 正式版、Fable 5.1、GPT-6 等新模型將於 8 月陸續發布。
模型能力的差距正在縮小,單靠發布一個更強的模型,越來越難建立長期優勢。接下來值得觀察的是幾個具體指標:DeepSeek V4 正式版能把開源模型的能力上限推到哪裡,API 價格是否繼續下探,智能體能否出現穩定的付費場景,以及開源模型能否進入更多企業的私有化部署。這些問題的答案,會比榜單名次更能說明這一輪混戰真正改變了什麼。
*封面圖片來源於 Pexels。
