এজেন্ট চালু করা শুধু প্রথম ধাপ।লেখক: elune
লেখার সংকলন, উৎস: ME News
এজেন্ট চালু করা শুধু প্রথম ধাপ।
সবচেয়ে কঠিন বিষয় হলো এটি স্থিতিশীল কিনা, সঠিক কিনা, এবং একটি প্রম্পট বা মডেল আপডেটের কারণে চুপচাপ অবনতি হচ্ছে কিনা তা বিচার করা।
এই 10টি মূল্যায়ন পদ্ধতি প্রতিটি এআই ইঞ্জিনিয়ারের জন্য জানা উচিত।
1. গোল্ডেন সেট | Golden Set
একটি নির্দিষ্ট এবং ফ্রিজ করা টেস্ট কেস সেট প্রস্তুত করুন।
প্রতিবার প্রম্পট, মডেল, টুল বা ওয়ার্কফ্লো পরিবর্তনের পরে, এই কেসগুলি পুনরায় চালান যাতে বুঝতে পারেন সিস্টেমটি কি ভালো হয়েছে নাকি কিছু স্কেনারিওতে চুপচাপ ব্যর্থ হয়েছে।
এটি এজেন্ট মূল্যায়ন সিস্টেমের সবচেয়ে মৌলিক বেঞ্চমার্ক।
সুপারিশকৃত টুল: OpenAI Evals
একটি পুনরাবৃত্তিযোগ্য বেঞ্চমার্ক সেট তৈরি করতে এবং বিভিন্ন মডেল বা সিস্টেম ভার্সনের পারফরম্যান্স তুলনা করতে ব্যবহার করা যায়।
2. এলএলএম বিচারক|এলএলএম হিসাবে বিচারক
একটি অন্যান্য বড় ভাষা মডেল ব্যবহার করে, পূর্বনির্ধারিত স্কোরিং মানদণ্ডের ভিত্তিতে খোলা উত্তরগুলি মূল্যায়ন করুন।
যখন কোনো কাজের একটি একক মানদণ্ড নেই এবং স্ট্রিং ম্যাচিং বা স্থির আউটপুটের মাধ্যমে এটি সঠিক বা ভুল কিনা বিচার করা যায় না, তখন এই পদ্ধতিটি বিশেষভাবে কার্যকর।
উদাহরণস্বরূপ, একটি রেফারি মডেল মূল্যায়ন করতে পারে যে উত্তরটি সঠিক, সম্পূর্ণ, সম্পর্কিত এবং ব্যবহারকারীর প্রয়োজনীয়তা মেনে চলে কিনা।
সুপারিশকৃত টুল: OpenEvals
LLM অ্যাপ্লিকেশনের জন্য প্রস্তুত মূল্যায়নকারী প্রদান করে স্বয়ংক্রিয় পর্যালোচনা প্রক্রিয়া দ্রুত স্থাপন করুন।
3. বহুমাত্রিক স্কোরিং | রুব্রিক স্কোরিং
কেবল এজেন্টকে একটি সাধারণ "গুণমান স্কোর" দিও না।
পৃথকভাবে মূল্যায়ন করা উচিত:
- সঠিকতা
- পূর্ণতা
- Expression style
- নিরাপত্তা
- রেসপন্স স্পিড
- কল খরচ
একটি সমন্বিত স্কোর প্রকৃত সমস্যাকে লুকিয়ে রাখতে পারে।
উদাহরণস্বরূপ, মোট স্কোর কমে যাওয়ার কারণ উত্তর ভুল নাও হতে পারে, বরং টুল কলের খরচ হঠাৎ বেড়ে যাওয়া; মোট স্কোর বাড়ার ক্ষেত্রেও সম্ভবত নিরাপত্তা হ্রাসের উপর ভিত্তি করে।
সুপারিশকৃত টুল: DeepEval
কাস্টম মেট্রিক তৈরি করা এবং বিভিন্ন গুণগত মাপদণ্ডের জন্য স্বতন্ত্রভাবে স্কোর দেওয়া সমর্থিত।
4. ট্রাজেক্টরি মূল্যায়ন|Trajectory Eval
শুধু এজেন্ট দ্বারা প্রদানকৃত চূড়ান্ত উত্তর মূল্যায়ন করবেন না, বরং এটি কাজটি সম্পন্ন করার পুরো প্রক্রিয়াটিও মূল্যায়ন করুন।
সহিত:
- সঠিক টুলটি নির্বাচন করা হয়েছে কি?
- টুলগুলি যুক্তিসঙ্গত ক্রমে কল করা হচ্ছে কি?
- কি অকার্যকর কাজ পুনরাবৃত্তি করা হচ্ছে
- কি প্রয়োজনীয় ধাপগুলি বাদ পড়েছে?
- টুলের ফলাফলের ভিত্তিতে কি সঠিকভাবে সিদ্ধান্ত সমন্বয় করা হয়েছে?
এজেন্ট শেষপর্যন্ত সঠিক উত্তর পেতে পারে, কিন্তু মধ্যবর্তী প্রক্রিয়াটি অকার্যকর, দুর্বল বা এমনকি ঝুঁকিপূর্ণ হতে পারে।
সুপারিশকৃত টুল: AgentEvals
এজেন্টের পূর্ণাঙ্গ কার্যক্রমে এর কার্য, সিদ্ধান্ত এবং টুল কলগুলি পরীক্ষা করুন।
5. টুল ইউনিট টেস্ট
প্রতিটি টুলের জন্য এজেন্ট ব্যবহার করে স্বতন্ত্র পরীক্ষা লিখুন।
ফিক্সড ইনপুট ব্যবহার করে ফিক্সড আউটপুট যাচাই করুন, মডেলকে অংশগ্রহণ করতে দিবেন না।
এটিকে বিভক্ত করা যেতে পারে:
কি এজেন্টের যুক্তিবিদ্যায় সমস্যা হয়েছে, নাকি নিম্নস্তরের টুল, ইন্টারফেস বা MCP সার্ভারে সমস্যা হয়েছে?
যদি টুলটি নিজেই বিশ্বস্ত না হয়, তবে এজেন্টটি কি সঠিকভাবে টুলটি ব্যবহার করেছে তা মূল্যায়ন করা অর্থহীন।
সুপারিশকৃত টুল: MCP Inspector
এটি এমসিপি সার্ভার, টুল প্যারামিটার এবং রিটার্ন রেজাল্ট পরীক্ষা ও চেক করার জন্য ব্যবহার করা যেতে পারে।
6. রিগ্রেশন স্যুট
পূর্বের বাস্তব রান কেসগুলি সংরক্ষণ করুন এবং প্রতিবার প্রম্পট, মডেল বা টুলসেট আপডেট করার পরে পুনরায় রান করুন।
তারপর নতুন এবং পুরানো সংস্করণের ফলাফলের তুলনা করুন, পরীক্ষা করুন:
- মূলত সঠিক কাজটি ব্যর্থ হয়েছে কি
- আউটপুট ফরম্যাট পরিবর্তিত হয়েছে কি
- টুল কল কি বাড়ছে?
- দেরি এবং খরচ বেড়েছে কি?
- কিছু প্রান্তিক কেস কি অবনতি ঘটিয়েছে
নতুন সংস্করণের গড় পারফরম্যান্স ভালো হওয়ার অর্থ এটি পুরনো ক্ষমতাগুলি ভাঙ্গেনি এমন নয়।
প্রস্তাবিত টুল: Promptfoo
সমর্থন করে পুনরাবৃত্ত মূল্যায়ন স্যুট চালানো, রিগ্রেশন সমস্যা ধরে রাখা এবং চেক প্রক্রিয়াটি CI-এর সাথে যুক্ত করা।
7. প্রোডাকশন এ/বি টেস্টিং | A/B Testing in Production
দুটি ভিন্ন সংস্করণে বাস্তব ব্যবহারকারীর ট্রাফিক র্যান্ডমভাবে বণ্টন করুন এবং বাস্তব পরিবেশে তাদের পারফরম্যান্স তুলনা করুন।
পরীক্ষা করুন:
- দুটি প্রম্পট
- দুটি মডেল
- দুটি এজেন্ট ওয়ার্কফ্লো
- বিভিন্ন টুল কম্বিনেশন
- বিভিন্ন প্রতিক্রিয়া কৌশল
অফলাইন স্কোর বেশি হওয়ার মানে এই নয় যে ব্যবহারকারীদের সাফল্যের হারও বেশি হবে।
সত্যিকারের গুরুত্বপূর্ণ বিষয়গুলি হল কাজ সম্পন্নের হার, ব্যবহারকারী গ্রহণের হার, রূপান্তরের হার, মানব হস্তক্ষেপের হার এবং সমস্যা সমাধানের হার।
সুপারিশকৃত টুল: GrowthBook
ফাংশন সুইচ, নিয়ন্ত্রিত পরীক্ষা এবং পণ্য বিশ্লেষণের ক্ষমতা প্রদান করুন।
8. মানব পর্যালোচনা | Human Review
নিয়মিত নমুনা বাস্তব রান রেকর্ড মানুষের রিভিউয়ারদ্বারা স্কোর করা হয়।
ম্যানুয়াল রিভিউ শুধুমাত্র অটোমেশন মূল্যায়ন দ্বারা উপেক্ষিত সমস্যাগুলি শনাক্ত করতে পারে, এটি LLM বিচারকদের ক্যালিব্রেশনের জন্যও ব্যবহার করা যেতে পারে।
প্রধান পরীক্ষা প্রয়োজন:
- মডেল স্কোরিং কি মানুষের বিচারের সাথে সঙ্গতিপূর্ণ
- স্কোরিং ক্রাইটেরিয়া পর্যাপ্ত স্পষ্ট কি না
- কি সিদ্ধান্ত মডেলগুলি দীর্ঘ উত্তরগুলিকে পছন্দ করে?
- অটোমেটিকভাবে গুরুতর ভুল মিস হয়েছে কিনা তা মূল্যায়ন করুন
অটোমেশন মূল্যায়ন মানব বিচারকে সম্পূর্ণরূপে প্রতিস্থাপন করতে পারে না।
সুপারিশকৃত টুল: Argilla
ম্যানুয়াল ফিডব্যাক সংগ্রহ, মডেল আউটপুট পরীক্ষা এবং ফলাফলকে উচ্চ মানের ডেটাসেট হিসেবে সংরক্ষণ করতে টিমকে সহায়তা করুন।
9. শ্যাডো রান | Shadow Run
প্রতিদানটিকে বাস্তব ট্রাফিকে সিঙ্ক্রোনাইজড ভাবে চালান, কিন্তু এর আউটপুটকে ব্যবহারকারীদের কাছে প্রদর্শন করবেন না।
প্রোডাকশন পরিবেশে এখনও পুরানো সংস্করণ ব্যবহার করা হচ্ছে, যখন নতুন সংস্করণটি শুধুমাত্র ব্যাকগ্রাউন্ডে চলছে, যা উভয়ের পারফরম্যান্স তুলনা করার জন্য।
এই পদ্ধতিটি উচ্চ ঝুঁকিপূর্ণ আপডেটের জন্য উপযুক্ত, যেমন:
- কোর মডেল পরিবর্তন করুন
- পুনর্লিখিত সিস্টেম প্রম্পট
- নতুন বাহ্যিক টুল যোগ করুন
- এজেন্ট সিদ্ধান্ত নেওয়ার যুক্তি সংশোধন করুন
- টুল অ্যাক্সেস বাড়ান
Shadow running টিমকে আনুষ্ঠানিক প্রকাশের আগে বাস্তব ট্রাফিকে সমস্যা শনাক্ত করতে সাহায্য করে, একইসাথে ব্যবহারকারীদের প্রত্যক্ষভাবে প্রভাবিত করা এড়ায়।
সুপারিশকৃত টুল: Langfuse
উত্পাদন রান ট্র্যাক করুন, প্রতিযোগী সংস্করণগুলি তুলনা করুন এবং মূল্যায়নের ফলাফল মনিটর করুন।
10. রেড টিমিং | Red Teaming
আক্রমণকারীর আগে নিজের সিস্টেমে সক্রিয় আক্রমণ করুন।
পরীক্ষার পরিসর অন্তর্ভুক্ত:
- জেল ভাঙ্গার আক্রমণ
- প্রম্পট ইনজেকশন
- সংবেদনশীল ডেটা প্রকাশ
- পারমিশন বাইপাস
- টুল দুর্ব্যবহার
- দুষ্টু ফাইল বা ওয়েবপেজ কন্টেন্ট
- অপ্রত্যাশিত বাহ্যিক অপারেশন
ডাটাবেস অ্যাক্সেস করতে, ইমেইল পাঠাতে, ফাইল পরিবর্তন করতে, কোড এক্সিকিউট করতে বা অভ্যন্তরীণ সিস্টেমে অ্যাক্সেস করতে পারে এমন এজেন্টের জন্য রেড টিম টেস্টিং বিশেষভাবে গুরুত্বপূর্ণ।
সুপারিশকৃত টুল: Garak
LLM সিস্টেমের নিরাপত্তা ভাঙ্গন এবং অনিরাপদ আচরণ স্ক্যান করুন।
অফলাইন মূল্যায়ন আপনাকে বলে: পরীক্ষামূলক পরিবেশে সিস্টেমটি সঠিকভাবে কাজ করছে।
অনলাইন মূল্যায়ন বলছে: সিস্টেম চালু হওয়ার পরেও সঠিকভাবে কাজ করবে।
আপনি এখন সম্ভবত একসাথে সব ধরনের ১০টি মূল্যায়ন মেকানিজম স্থাপন করার প্রয়োজন বোধ করছেন না।
আরও বাস্তবসম্মত পদ্ধতি হল:
সর্বশেষ এজেন্ট ব্যর্থতার পুনর্বিবেচনা করুন, তারপর সেই দুটি মূল্যায়ন পদ্ধতি প্রাথমিকভাবে চালু করুন যা আগে থেকেই সমস্যাগুলি শনাক্ত করতে পারত।
সোনার টেস্ট সেট তৈরি করে, তারপর রিগ্রেশন টেস্ট বা ম্যানুয়াল স্যাম্পলিং যোগ করলে অনেক সাধারণ দুর্ঘটনা এড়ানো যায়।
এটি সংরক্ষণ করুন।
