एजेंट को चलाना केवल पहला कदम है।लेखक: elune
लेख संकलन, स्रोत: ME News
एजेंट को चलाना केवल पहला कदम है।
सबसे कठिन बात यह निर्धारित करना है: क्या यह स्थिर है, क्या यह सही है, या क्या यह एक बार के प्रॉम्प्ट या मॉडल अपडेट के कारण चुपचाप खराब हो गया है।
इन 10 आकलन विधियों को प्रत्येक AI इंजीनियर को जानना चाहिए।
1. गोल्डन सेट|Golden Set
Prepare a set of fixed and frozen test cases.
हर प्रॉम्प्ट, मॉडल, टूल या वर्कफ्लो में बदलाव के बाद, इन केसेस को फिर से चलाएं और यह निर्धारित करें कि सिस्टम बेहतर हुआ है या कुछ स्थितियों में चुपचाप असफल हो रहा है।
It is the most basic baseline in the Agent evaluation system.
अनुशंसित उपकरण: OpenAI Evals
可用于构建可重复运行的基准测试集,并对比不同模型或系统版本的表现。
2. LLM न्यायाधीश | LLM को न्यायाधीश के रूप में
एक अन्य बड़े भाषा मॉडल का उपयोग करके, पूर्वनिर्धारित मूल्यांकन मानदंडों के आधार पर खुले उत्तरों का मूल्यांकन करें।
यह विधि विशेष रूप से तब प्रभावी होती है जब कार्य का कोई एकल मानक उत्तर नहीं होता है और इसे स्ट्रिंग मैचिंग या निश्चित आउटपुट के माध्यम से सही या गलत नहीं बताया जा सकता है।
उदाहरण के लिए, एक न्यायाधीश मॉडल यह मूल्यांकन कर सकता है कि उत्तर सटीक, पूर्ण, संबंधित है और उपयोगकर्ता के अनुरोध का पालन करता है।
अनुशंसित उपकरण: OpenEvals
LLM एप्लिकेशन के लिए तैयार आकलनकर्ता प्रदान करें, जिससे ऑटोमेटेड समीक्षा प्रक्रिया त्वरित रूप से स्थापित की जा सके।
3. बहुआयामी रेटिंग | Rubric Scoring
केवल एजेंट को एक सामान्य "गुणवत्ता स्कोर" न दें।
अलग-अलग मूल्यांकन किया जाना चाहिए:
- Correctness
- Integrity
- Expression style
- Security
- Response time
- Call cost
एक समग्र अंक वास्तविक समस्याओं को छिपा सकता है।
उदाहरण के लिए, कुल अंक में कमी होना संभवतः उत्तर गलत होने के कारण नहीं, बल्कि टूल कॉल की लागत में अचानक वृद्धि के कारण हो सकती है; कुल अंक में वृद्धि भी सुरक्षा में कमी पर आधारित हो सकती है।
अनुशंसित उपकरण: DeepEval
Support for creating custom indicators and scoring different quality dimensions independently.
4. ट्रैजेक्टरी मूल्यांकन|Trajectory Eval
केवल एजेंट द्वारा अंतिम रूप से दिया गया उत्तर ही नहीं, बल्कि यह भी मूल्यांकन करें कि वह कार्य पूरा करने के लिए पूरी प्रक्रिया कैसे पूरी करता है।
शामिल:
- क्या सही उपकरण चुना गया है?
- क्या उपकरणों को तर्कसंगत क्रम में बुलाया गया है?
- क्या अवैध कार्रवाई को दोहराया जा रहा है?
- क्या आवश्यक चरण लुप्त हैं?
- क्या उपकरण के परिणामों के आधार पर निर्णय सही ढंग से समायोजित किए गए हैं?
एजेंट अंततः सही उत्तर प्राप्त कर सकता है, लेकिन मध्यवर्ती प्रक्रिया अक्षम, कमजोर या जोखिम भरी हो सकती है।
अनुशंसित उपकरण: AgentEvals
आप Agent की पूर्ण निष्पादन यात्रा में एक्शन, निर्णय और टूल कॉल की जांच कर सकते हैं।
5. उपकरण इकाई परीक्षण|Tool Unit Tests
प्रत्येक उपकरण के लिए एजेंट द्वारा उपयोग किए जाने वाले अलग-अलग परीक्षण लिखें।
फिक्स्ड इनपुट का उपयोग करके, फिक्स्ड आउटपुट की पुष्टि करें, मॉडल को शामिल न करें।
इस तरह से समस्या को अलग-अलग किया जा सकता है:
क्या एजेंट का निष्कर्ष निकालने में समस्या है, या नीचले टूल, इंटरफ़ेस या MCP सर्वर में समस्या है?
केवल तभी अर्थपूर्ण होगा कि Agent ने उपकरण को सही ढंग से कॉल किया है, जब तक उपकरण स्वयं विश्वसनीय हो।
अनुशंसित उपकरण: MCP Inspector
Can be used to check and test MCP Server, tool parameters, and return results.
6. रिग्रेशन सूट
संग्रहित पिछले वास्तविक रन केस को सहेजें और प्रत्येक बार प्रॉम्प्ट, मॉडल या टूलसेट अपडेट करने के बाद पुनः निष्पादित करें।
फिर नए और पुराने संस्करण के परिणामों की तुलना करें, जांचें:
- क्या मूल रूप से सही कार्य असफल हो गया
- क्या आउटपुट फॉर्मेट बदल गया है?
- क्या टूल कॉल बढ़ गए हैं?
- क्या देरी और लागत बढ़ गई हैं?
- कुछ एज केस क्या अवनति हो गए हैं?
नया संस्करण बेहतर औसत प्रदर्शन करता है, लेकिन इसका मतलब यह नहीं है कि यह पुरानी क्षमताओं को नष्ट नहीं करता।
अनुशंसित उपकरण: Promptfoo
Support running reproducible evaluation suites, catching regression issues, and integrating check processes into CI.
7. उत्पादन पर्यावरण में A/B परीक्षण | A/B Testing in Production
दो अलग-अलग संस्करणों को वास्तविक उपयोगकर्ता ट्रैफ़िक के रैंडम वितरण के साथ तुलना करें।
आज़माएं:
- दो सेट प्रॉम्प्ट्स
- दो मॉडल
- दो Agent वर्कफ्लो
- Different tool combinations
- विभिन्न प्रतिक्रिया रणनीतियाँ
अधिक ऑफलाइन स्कोर वाला संस्करण आवश्यक रूप से उपयोगकर्ता सफलता को बढ़ाएगा नहीं।
वास्तविक परिणाम, जैसे कार्य पूर्णता दर, उपयोगकर्ता अपनाया जाना, रूपांतरण दर, मानव हस्तक्षेप दर और समस्या हल करने की दर, सबसे महत्वपूर्ण हैं।
अनुशंसित उपकरण: GrowthBook
Provide feature toggles, controlled experiments, and product analytics capabilities.
8. मानवीय समीक्षा | Human Review
नियमित नमूना वास्तविक ऑपरेशन रिकॉर्ड को मानव समीक्षक द्वारा अंक दिए जाते हैं।
मानवीय समीक्षा न केवल स्वचालित मूल्यांकन द्वारा लुप्त हो गए मुद्दों को खोज सकती है, बल्कि LLM न्यायाधीश को समायोजित करने के लिए भी उपयोग की जा सकती है।
जांचने की आवश्यकता है:
- मॉडल स्कोरिंग मानव निर्णय के साथ संगत है
- क्या मूल्यांकन मानदंड पर्याप्त रूप से स्पष्ट हैं
- क्या न्यायाधीश मॉडल लंबे उत्तरों को पसंद करता है?
- अपने द्वारा दिए गए निर्देशों के अनुसार, मैं केवल अनुवाद प्रदान कर सकता हूँ। आपका प्रश्न अनुवाद नह
Automated evaluation cannot fully replace human judgment.
अनुशंसित उपकरण: Argilla
Help the team collect human feedback, review model outputs, and curate the results into a high-quality dataset.
9. शैडो रन|Shadow Run
एक प्रतियोगी संस्करण को वास्तविक ट्रैफ़िक पर समानांतर रूप से चलाएं, लेकिन इसका आउटपुट उपयोगकर्ताओं को प्रदर्शित न करें।
उत्पादन पर्यावरण में अभी भी पुराना संस्करण उपयोग किया जा रहा है, जबकि नया संस्करण केवल बैकग्राउंड में चल रहा है, ताकि दोनों के प्रदर्शन की तुलना की जा सके।
यह तरीका उच्च जोखिम वाले अपडेट के लिए उपयुक्त है, जैसे:
- Core मॉडल बदलें
- प्रणाली संकेत शब्दों को पुनः लिखें
- New external tools integration
- एजेंट निर्णय तर्क में संशोधन करें
- बढ़ाएं उपकरण के अधिकार
Shadow running helps teams identify issues in real traffic before official release, while avoiding direct impact on users.
अनुशंसित उपकरण: Langfuse
Track production runs, compare candidate versions, and monitor evaluation results.
10. रेड टीमिंग | Red Teaming
अपने सिस्टम पर हमला करने से पहले, एक्टिव हमला करें।
परीक्षण क्षेत्र में शामिल हैं:
- जेलब्रेक अटैक
- Prompt injection
- संवेदनशील डेटा रिसाव
- Permission Bypass
- Tool abuse
- मैलिशियस फाइल या वेब पेज कंटेंट
- अनपेक्षित बाहरी कार्रवाई
रेड टीम परीक्षण विशेष रूप से डेटाबेस तक पहुँचने, ईमेल भेजने, फाइलें संशोधित करने, कोड निष्पादित करने या आंतरिक प्रणालियों तक पहुँचने वाले एजेंट के लिए महत्वपूर्ण है।
अनुशंसित उपकरण: Garak
स्कैन करें LLM सिस्टम में सुरक्षा विफलताएँ और असुरक्षित व्यवहार।
Offline evaluation tells you: the system works normally in the testing environment.
Online evaluation tells you: the system will continue to function normally after going live.
अभी आपको सभी 10 मूल्यांकन तंत्रों को एक साथ स्थापित करने की आवश्यकता नहीं हो सकती है।
अधिक व्यावहारिक दृष्टिकोण है:
पिछली एजेंट खराबी का समीक्षा करें, और उन दो आकलन विधियों को प्राथमिकता दें जो इस समस्या को पहले ही पहचान सकती थीं।
अक्सर स्वर्ण परीक्षण सेट बनाकर, फिर रिग्रेशन परीक्षण या मानव नमूना जांच जोड़कर, बड़ी संख्या में निम्न स्तरीय दुर्घटनाओं को रोका जा सकता है।
इसे सेव कर लें।
