根據動察 Beating 監測,OpenRouter 推出 Ori Eval,協助開發者判斷自己的 AI 應用該使用哪個模型。它會掃描程式碼庫,找出呼叫模型的位置,並使用專案中的真實任務測試多個候選模型。開發者可指定更看重效果、速度還是成本。評測期間,Ori Eval 會鎖定測試框架、模型配置和推理強度,最後直接提供排名,避免因測試條件不同而無法比較不同模型。它不僅評估回答品質,還會檢查 Agent 是否調用了正確的工具、避開不應執行的操作。開發者以自然語言描述一個 Bug,它就能生成一條重現問題的測試。修復後接入 GitHub Actions,後續更換模型、修改 prompt 或代碼時,都能自動檢查問題是否再次出現。公開榜單僅能比較模型的通用能力,無法直接回答客服、搜尋或程式設計產品該選哪一款。Ori Eval 將逐一手動測試模型,轉變為一套基於真實業務的自動選型流程。
OpenRouter 推出 Ori Eval,協助開發者選擇 AI 模型
MarsBit分享
OpenRouter 已宣布推出 Ori Eval,這是一項新工具,可協助開發者為其專案選擇最適合的 AI 模型。Ori Eval 會分析程式碼倉庫,使用真實任務測試模型,並根據效能、速度或成本進行排名。它確保測試公平,並檢查工具是否正確使用。開發者可以以自然語言報告錯誤,Ori Eval 會建立測試案例以重現問題。這些測試可新增至 GitHub Actions 以進行持續驗證。此專案公告正值 AI + 加密貨幣新聞持續增長之際。
來源:顯示原文
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。
虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款和風險披露 。