OpenRouter lance Ori Eval pour aider les développeurs à choisir des modèles d'IA

icon MarsBit
Partager
AI summary iconRésumé
OpenRouter a annoncé le lancement d'Ori Eval, un nouvel outil conçu pour aider les développeurs à choisir les meilleurs modèles d'IA pour leurs projets. Ori Eval analyse les dépôts de code, teste les modèles avec des tâches réelles et les classe selon leurs performances, leur vitesse ou leur coût. Il garantit des tests équitables et vérifie l'utilisation appropriée des outils. Les développeurs peuvent signaler des bogues en langage naturel, et Ori Eval génère des cas de test pour reproduire les problèmes. Ces tests peuvent être intégrés à GitHub Actions pour une validation continue. Cette annonce intervient alors que les actualités liées à l'IA et à la cryptomonnaie continuent de croître.

Selon Beating Monitoring, OpenRouter lance Ori Eval, un outil qui aide les développeurs à déterminer quel modèle utiliser pour leurs applications IA. Il analyse les dépôts de code pour identifier les appels aux modèles, puis exécute plusieurs modèles candidats sur des tâches réelles issues du projet. Les développeurs peuvent prioriser la qualité, la vitesse ou le coût. Pendant l'évaluation, Ori Eval verrouille le cadre de test, la configuration du modèle et l'intensité d'inférence, puis fournit directement un classement, évitant ainsi toute comparaison biaisée due à des conditions de test différentes. En plus d'évaluer la qualité des réponses, il vérifie si l'Agent utilise les bons outils et évite les opérations non autorisées. En décrivant un bogue en langage naturel, le développeur peut générer automatiquement un test de reproduction. Une fois le correctif appliqué, l'intégration avec GitHub Actions permet d'automatiser la vérification de la réapparition du bogue à chaque changement de modèle, de prompt ou de code. Les classements publics ne permettent de comparer que les capacités générales des modèles et ne répondent pas directement à la question : quel modèle choisir pour le service client, la recherche ou les produits de programmation ? Ori Eval transforme le processus manuel d'essais individuels en un flux automatisé basé sur des cas d'utilisation réels.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.