動察 Beating の監測によると、OpenRouter は Ori Eval をリリースし、開発者が自社の AI アプリケーションにどのモデルを使用すべきかを判断できるようにしました。Ori Eval はコードベースをスキャンしてモデルを呼び出している箇所を特定し、プロジェクト内の実際のタスクを使って複数の候補モデルをテストします。開発者は、効果、速度、コストのいずれを重視するかを指定できます。評価中、Ori Eval はテストフレームワーク、モデル設定、推論強度を固定し、最終的にランキングを直接提示することで、テスト条件の違いによるモデル間の比較不能を回避します。単に回答の良し悪しを判断するだけでなく、Agent が正しいツールを呼び出しているか、実行すべきでない操作を避けていないかもチェックします。開発者が自然言語でバグを記述すると、Ori Eval はその問題を再現するテストを自動生成します。修正後、GitHub Actions に接続することで、今後モデルを変更したり、prompt を変更したり、コードを修正したりしても、問題が再発していないかを自動でチェックできます。公開ランキングではモデルの汎用能力しか比較できませんが、カスタマーサポート、検索、プログラミング製品などにどのモデルを選択すべきかという具体的な問いには答えられません。Ori Eval は、個々のモデルを手動で試す作業を、実際のビジネスタスクに基づく自動選定プロセスに置き換えます。
OpenRouter、開発者がAIモデルを選択するためのOri Evalをリリース
MarsBit共有
OpenRouterは、開発者がプロジェクトに最適なAIモデルを選択するための新ツール「Ori Eval」のリリースを発表しました。Ori Evalはコードリポジトリを分析し、実際のタスクでモデルをテストして、パフォーマンス、速度、またはコストに基づいてランキングを付けます。公正なテストを保証し、ツールの適切な使用を確認します。開発者は自然言語でバグを報告でき、Ori Evalは問題を再現するためのテストケースを作成します。これらのテストはGitHub Actionsに追加して継続的な検証に利用できます。このプロジェクトの発表は、AI+暗号通貨に関するニュースが拡大し続けている中で行われました。
出典:原文を表示
免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。
デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。