source avatarDami-Defi

分享

代理評估存在一個隱藏問題: 評判本身可能不可靠。 一項新實驗測試了 Jev 對比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6。 結果如下: → 500/500 次二元判斷與人類權威一致 → 分數變異性降低 92–913 倍 → 平均延遲為 0.44 秒 → 每次評估成本為 $0.00035 Jev 不會先生成一段文字,再轉換為分數。 它直接做出結構化判斷。 這可能改變代理評估的經濟模式。 更便宜、更快的評判意味著團隊可以評估更多追蹤記錄、執行更多回歸檢查,並在每次代理更新時縮短反饋迴路。 重要提醒:這僅是一次狹窄的早期實驗。 但方向極具吸引力: 可靠的代理可能需要更優秀的評判,而不僅僅是更強大的模型。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露