এজেন্ট ফ্রেমওয়ার্ক পরীক্ষায় ক্লড কোড টোকেন ব্যবহার অন্যান্যদের তুলনায় ৩০ গুণ বেশি

icon MarsBit
শেয়ার
AI summary iconসারাংশ
সম্প্রতি কম্পোসিও টিম একটি বেঞ্চমার্ক পরীক্ষা পরিচালনা করেছে, যেখানে কিমি K3 মডেল ব্যবহার করে 28টি সমান কাজের মাধ্যমে তিনটি এজেন্ট ফ্রেমওয়ার্ক—Claude Code, Hermes, এবং Kimi Code—এর টোকেন ব্যবহার তুলনা করা হয়েছে। টোকেন লঞ্চের খবরে উল্লেখ করা হয়েছে যে Claude Code অন্যদের তুলনায় প্রায় 30 গুণ বেশি টোকেন ব্যবহার করেছে, যার মধ্যকালীন মান 340,000 টোকেন, যখন Kimi Code-এর মধ্যকালীন মান 61,000। Claude Code-এর জন্য প্রতিটি কাজের খরচ $2 পৌঁছেছে, যখন Kimi Code-এর জন্য এটি $0.22। পরীক্ষাটি দেখিয়েছে যে এজেন্ট ডিজাইনটি টোকেন দক্ষতা এবং খরচকে উল্লেখযোগ্যভাবে প্রভাবিত করে।

সবাই বলছে ক্লড কোড টোকেন নষ্ট করে, এটা কতটা নষ্ট করে? এবার শেষ পর্যন্ত কেউ সংখ্যা বের করেছে।

সম্প্রতি কম্পোসিও দল থেকে একটি আকর্ষণীয় তুলনামূলক পরীক্ষা হয়েছে। তারা একই মডেল ব্যবহার করেছে কিমি K3, তিনটি ভিন্ন এজেন্ট ফ্রেমওয়ার্কে (হারনেস) চালান —— Claude Code, Hermes এবং কিমি কোড—— মোট 28টি সম্পূর্ণ একই কাজ পরীক্ষা করা হয়েছে।

মডেল অর্জন

ফলাফল হিসেবে, তিনটি হারনেসের কাজ সফলভাবে সম্পন্নের হার প্রায় একই: কিমি কোড এর মধ্যে 28 টির মধ্যে 22 টি সফল হয়েছে, হারমেস 21 টি, ক্লড কোড 20 টি। পার্থক্য বেশি নয়।

বাস্তবিক পার্থক্য তৈরি হয় টোকেন খরচের মাধ্যমে। একই টাস্ক ভিন্ন হারনেস ব্যবহার করে চালানোর সময়, টোকেন ব্যবহার 30 গুণ পর্যন্ত পার্থক্য হতে পারে!

মধ্যক অনুযায়ী, কিমি কোড প্রায় 61,000 টোকেন, হারমেস প্রায় 67,000, আর Claude Code সরাসরি 34 লক্ষে পৌঁছে যায়, যা প্রায় কিমি কোডের 6 গুণ।

মডেল অর্জন

অনুসরণ করুন কিমি K3-এর জন্য প্রতি মিলিয়ন ইনপুট টোকেনের দাম 3 ডলার (এজেন্ট ওয়ার্কফ্লোতে ইনপুট টোকেন সাধারণত 95% এর প্রায় সমান হয়), প্রতিটি কাজের গড় খরচ প্রায়: কিমি কোড 0.22 ডলার, হারমেস 0.28 ডলার, ক্লড কোড তখন 2 ডলার। পার্থক্যটি স্পষ্ট।

গতি একই নয়। মধ্যকালীন সময়, হারমেস সবচেয়ে দ্রুত, 179 সেকেন্ড; কিমি ২৯৭ সেকেন্ড; ক্লড কোড ৩৪৮ সেকেন্ড।

সুতরাং সবচেয়ে দ্রুততম হল হারমেস, এবং সবচেয়ে কম টোকেন খরচ করে হল কিমি কোড, দুটি একত্রিত হয় না।

কম্পোসিও দল এই উপসংহারে পৌঁছেছে যে, আপনি যদি এজেন্টের খরচ কমাতে চান, তাহলে প্রথমে দেখুন কোন হারনেস ব্যবহার করছেন, এবং মডেল পরিবর্তনের দিকে দ্রুত যাবেন না। তাদের ডেটা অনুযায়ী, হারনেস নিজেই খরচকে 9 গুণ পর্যন্ত পার্থক্য করতে পারে, যখন মডেলের ক্ষমতা প্রায় একই।

মডেল অর্জন

এই ফলাফল দেখে সেবাস্টিয়ান রাশকা একটি পোস্ট করেন, যেখানে তিনি বলেন যে এটি তাঁর আগের Qwen3.6 ব্যবহার করে করা পর্যবেক্ষণের সাথে মিলে যায়: Claude Code একই সফলতার হারের ক্ষেত্রে, token ব্যবহার অন্যান্য অনেক harness-এর তুলনায় 2 থেকে 3 গুণ বেশি।

মডেল অর্জন

তিনি কয়েকটি সম্ভাব্য কারণ উল্লেখ করেন: কি এটি খুব কম অপ্টিমাইজ করা হয়েছে? কি এতে বাগ আছে? নাকি এটি ইচ্ছাকৃতভাবে এভাবে ডিজাইন করা হয়েছে (কারণ এটি আরও কঠিন টাস্কে সহায়ক হতে পারে)? তিনি বলেন যে তাকে আরও সময় দিয়ে এটি ভালোভাবে পরীক্ষা করতে হবে।

তিনি গত মাসে তিনি স্থানীয় কোডিং এজেন্ট সম্পর্কে লেখা প্রবন্ধের সময় যা পর্যবেক্ষণ করেছিলেন, তা অতিরিক্তভাবে যোগ করলেন। তখন তিনি বিশ্লেষণ করেছিলেন যে Claude Code কেন বেশি token ব্যবহার করে, এবং দেখেছিলেন যে পার্থক্যটি মূলত ইনপুট token-এ, নয় আউটপুট token-এ। অর্থাৎ, Claude কোনও একগুচ্ছ বিষয়বস্তুর দ্বিগুণ লেখেনি। লগগুলি দেখায় যে, Claude-এর harness-এর একাধিক ইন্টারঅ্যাকশনের সময়, পূর্ববর্তী বার্তা, টুল-কল, কমান্ড-আউটপুট এবং ফাইলের বিষয়বস্তুসহ আরও বেশি কনটেক্সটকে পুনরায় মডেলের দিকে পাঠানো হয়। উদাহরণস্বরূপ, Claude-এর একটি রানের সময়, 578,000টি ইনপুট token-এর ব্যবহার হয়েছিল, কিন্তু আউটপুট মাত্র 4,500টি token, 25টি রাউন্ডে। সুতরাং, Claude-এর harness-এর একাধিক-পদক্ষেপ agent-এর সময়, prompt-এর ইতিহাসটি সঞ্চিত বা অন্তর্ভুক্ত হয়, এটিই সম্ভবতই ব্যাখ্যা।

মডেল অর্জন

এই পরীক্ষার ফলাফলগুলি একটি অবহেল্যযোগ্য প্রবণতা প্রকাশ করে: হারনেসের গুরুত্ব এখন মডেলের চেয়ে কম নয়।

সাম্প্রতিক একটি পেপার (Writer কোম্পানি থেকে, যারা এন্টারপ্রাইজ-লেভেল AI এজেন্ট প্ল্যাটফর্ম তৈরি করে) এটিকে সিস্টেমেটিকভাবে প্রমাণ করে: এটি কন্ট্রোলড ভেরিয়েবল এক্সপেরিমেন্ট ব্যবহার করে প্রমাণ করেছে যে, মডেল পরিবর্তনের পরিবর্তে হারনেস লেয়ার পরিবর্তন করলে ব্যয় কমানো যায়, এবং সমস্ত মডেলই এটির সুবিধা পায়।

মডেল অর্জন

বিশেষভাবে, তারা একটি কঠোর “নিয়ন্ত্রিত চলক” পরীক্ষা পরিচালনা করেছে: ২২টি ব্যবসায়িক কাজ এবং ৬টি বেস মডেল (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) অপরিবর্তিত রেখে, শুধুমাত্র অর্গানাইজেশন লেয়ারটি প্রতিস্থাপন করা হয়েছে—প্রোডাকশন-গ্রেড এজেন্ট সাইকেলকে Writer-এর নিজস্ব Harness দিয়ে প্রতিস্থাপন করা হয়েছে।

পরীক্ষার ফলাফল দেখায়: প্রতিটি কাজের গড় খরচ 41% কমেছে (0.21 ডলার → 0.12 ডলার), মধ্যকাল সময় 44% কমেছে (48 সেকেন্ড → 27 সেকেন্ড), টোকেন ব্যবহার 38% কমেছে (14.2k → 8.8k), এবং কাজের গুণগত মান প্রায় অপরিবর্তিত রয়েছে (0.78 → 0.81, নমুনা আকার ছোট হওয়ায় এটি উল্লেখযোগ্য পার্থক্য হিসাবে বিবেচিত হয়নি)। মূল্য-প্রতি-গুণমানের দিক থেকে, প্রতি ডলারের জন্য গুণমানের বৃদ্ধি 82% পর্যন্ত পৌঁছেছে, এবং প্রতি মিলিয়ন টোকেনে সম্পন্ন কাজের সংখ্যা 54.9 থেকে 92.0-এ বৃদ্ধি পেয়েছে।

তাই, মডেলটি "জল, বিদ্যুৎ ও গ্যাস" এ পরিণত হওয়ার পর, হারনেসই কি আপনার বিদ্যুৎ বিল নির্ধারণ করে এমন এয়ার কন্ডিশনার? অন্যভাবে বললে: আগে কেউ বলত "মডেলই পণ্য", এখন কি "হারনেসই পণ্য"?

মডেল অর্জন

যেহেতু হারনেস এতটাই গুরুত্বপূর্ণ, তাহলে পরবর্তী বই আরও বিস্তারিতভাবে হিসাব করা উচিত নয় কি?

কেউ উল্লেখ করেছেন যে, আমাদের বর্তমান বেঞ্চমার্কে "harness ট্যাক্স" যোগ করা প্রয়োজন। বিশেষ করে যখন টুল কল এবং পুনরায় চেষ্টা লুপে পড়ে যায়, তখন এই ট্যাক্স রৈখিকভাবে বৃদ্ধি পায় না।

মডেল অর্জন

অন্যভাবে বললে, ভবিষ্যতের এজেন্ট প্রতিযোগিতার প্রথম অংশে প্রশ্ন হবে “এটা করা সম্ভব কি না?”, দ্বিতীয় অংশে প্রশ্ন হবে “একই কাজটি করতে কে কম খরচে করে” — আর খরচ কমানোর গোপন কৌশলটি মডেলের বাইরে, harness-এ।

মডেল অর্জন

এজেন্ট চালানোর সময় আপনার কি এই ধরনের অভিজ্ঞতা হয়েছে? মন্তব্যের ক্ষেত্রে আলোচনা করুন।

এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন সিন্টিস" (ID: almosthuman2014) থেকে এসেছে, লেখক: মেশিন সিন্টিস

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।