中國的AI產業在過去兩年建立了作為矽谷昂貴模型工廠的廉價、高效替代方案的聲譽,但這聲譽如今正從多個方向受到衝擊。
國內監管打壓、獨立審計揭示驚人的準確性失誤,以及美國科技高管日益增加的警告,正在重新定義關於中國人工智慧的討論。
準確性問題
數字呈現出一幅粗略的圖景。2025年7月,假資訊追蹤組織NewsGuard對五款領先的中國AI模型進行了測試,測試內容為具有親中立場的主張,結果顯示這些模型在提供準確資訊方面的失敗率高達60%。
DeepSeek 被認為是全球舞台上最突出的中國 AI 模型,但在另一項評估中表現更差。2025 年 1 月的 NewsGuard 審計發現,當要求該模型提供準確資訊時,失敗率高達 83%。
所提及的模型並非冷門的研究項目,包括 DeepSeek、阿里巴巴的通義千問(又稱 Qwen 系列)、百度的 ERNIE,以及月之暗面的 Kimi。
北京自身的清理工作
即使中國的監管機構也承認這個問題,只是他們的表述方式不同。2026年2月,中國網信辦推出了其稱為「清朗2026專項行動」的計劃。該計劃針對大量生產低品質AI生成內容的現象,中國官員將此現象稱為「數位垃圾」。
競爭激烈但複雜
品質方面的擔憂與另一項同樣重要的趨勢並存:中國的 AI 模型在性能基準測試上正變得真正具有競爭力。
史丹佛大學2026年AI指數報告指出,自2025年初以來,美國與中國模型之間的表現差距已基本縮小。雙方在多項基準測試中多次交替領先,均未保持持續優勢。截至2026年3月,任何給定評估結果都近乎拋硬幣決定。
美國的 AI 領導者已注意到。OpenAI 和 Anthropic 的高層承認,DeepSeek 和 Moonshot 的 Kimi K3 等模型的表現經常與頂尖美國系統相當,有時甚至超越。2026 年 7 月,這些高層進一步警告,低成本的中國模型帶來重大安全風險。
許多中國模型的開放權重特性加劇了這些擔憂。開放權重模型可由任何人下載、修改和部署,這對開發者而言具有吸引力,但對安全分析師而言則存在風險。
