動察 Beating AI 快訊,自 OpenAI 於 9 月 3 日發布 GPT-6 Astra 後,多項模型評測基準數據持續被調整,部分修改使 Astra 表現更佳,同時部分競爭對手模型的成績出現下滑,引發外界對 AI「刷榜」及評測透明度的質疑。其中,Astra 的幻覺率曾從 4.2% 下調至 2%,GPT-5.6 Sol 則從 12.2% 降至 9.4%,隨後兩者又恢復至 4.2% 和 12.2%。在數學評測中,Anthropic 的 Fable 5.1 得分也曾從 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 則從 83% 降至 80.5%,後恢復至 83%。此外,Astra 在 ARC-AGI-3 評測中的成績從發布前草稿的 98.6% 提升至最終頁面的 99.99%,其編程評測成績也從 57.7% 小幅上調至 57.9%。OpenAI 表示,評測結果會受到模型版本、工具配置、推理級別及測試運行等因素影響,此次調整是為了確保數據更準確地反映模型的最佳性能。不過,史丹福大學研究人員認為,頻繁重新運行評測可能涉及所謂「Benchmaxxing」,即通過調整測試條件最大化基準成績。業內人士指出,隨著 AI 模型競爭加劇,評測數據已成為衡量模型能力及爭奪市場的重要工具,如何提高基準測試的透明度和可重現性正受到越來越多關注。
OpenAI 調整 GPT-6 Astra 評估資料,引發透明度關切
MarsBit分享
據報導,OpenAI 已修改 GPT-6 Astra 的評估數據,引發對透明度的擔憂。Astra 的幻覺率從 4.2% 下降至 2%,而 Anthropic 和 GPT-5.6 Sol 等競爭對手的數學分數則出現下滑。OpenAI 表示,這些變更反映了準確的表現,但史丹佛大學的研究人員警告存在「benchmaxxing」問題。在市場轉變之際,值得关注的山寨幣正獲得關注,可靠的數據仍至關重要。通脹數據趨勢也突顯了在人工智慧和加密貨幣領域中,清晰且可重複的基準的重要性。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。