GROK 4.7:更擅長長任務,但並非處處更強 xAI 已推出 Grok 4.7,這是一款專為編碼、AI 代理以及可運行數小時的任務而設計的模型。 新版本搭載了新的基礎模型、針對困難任務的更長 RL 訓練、改進的自我檢查功能,以及高達 500K 個 token 的長上下文窗口。 目前已在 Cursor、Grok Build 和 API 中提供。 根據 xAI 的基準測試,Grok 4.7 展現了明顯的提升: - CursorBench 4.0:46.3% 對比 Grok 4.6 的 40.4% - DeepSWE:71% 對比 65.2% - Terminal-Bench:38% 對比 20.3% 在 CursorBench 上,Grok 4.7 優於 GPT-5.6 Sol,但仍落後於 Fable 5.1。 獨立測試則呈現出較為混合的結果。 Artificial Analysis 給予 Grok 4.7 輕微提升——其智慧指數為 46 對比 44。 然而,作為 Grok Build 中的編碼代理,該模型表現出更強大的能力。 但也存在缺點:Grok 4.7 的輸出更冗長。 token 價格保持不變,但更長的輸出意味著某些任務的成本可能更高。 API 定價:每 1M 輸入 token $2 / 每 1M 輸出 token $6。 一旦提示超過 200K 個 token,定價率將翻倍。 Fast 版本速度快 2 倍且價格更高,目前僅在 Cursor 和 Grok Build 中提供。 總體而言,Grok 4.7 最適合用於長時間編碼、大型程式庫和複雜的多步驟任務。 對於短提示,提升幅度可能小得多。 因此,Grok 4.7 究竟是重大升級,還只是一款在較窄任務範圍內表現出色的更昂貴模型?


