সবাই বলছে ক্লড কোড টোকেন নষ্ট করে, এটা কতটা নষ্ট করে? এবার শেষ পর্যন্ত কেউ সংখ্যা বের করেছে।
সম্প্রতি কম্পোসিও দল থেকে একটি আকর্ষণীয় তুলনামূলক পরীক্ষা হয়েছে। তারা একই মডেল ব্যবহার করেছে কিমি K3, তিনটি ভিন্ন এজেন্ট ফ্রেমওয়ার্কে (হারনেস) চালান —— Claude Code, Hermes এবং কিমি কোড—— মোট 28টি সম্পূর্ণ একই কাজ পরীক্ষা করা হয়েছে।

ফলাফল হিসেবে, তিনটি হারনেসের কাজ সফলভাবে সম্পন্নের হার প্রায় একই: কিমি কোড এর মধ্যে 28 টির মধ্যে 22 টি সফল হয়েছে, হারমেস 21 টি, ক্লড কোড 20 টি। পার্থক্য বেশি নয়।
বাস্তবিক পার্থক্য তৈরি হয় টোকেন খরচের মাধ্যমে। একই টাস্ক ভিন্ন হারনেস ব্যবহার করে চালানোর সময়, টোকেন ব্যবহার 30 গুণ পর্যন্ত পার্থক্য হতে পারে!
মধ্যক অনুযায়ী, কিমি কোড প্রায় 61,000 টোকেন, হারমেস প্রায় 67,000, আর Claude Code সরাসরি 34 লক্ষে পৌঁছে যায়, যা প্রায় কিমি কোডের 6 গুণ।

অনুসরণ করুন কিমি K3-এর জন্য প্রতি মিলিয়ন ইনপুট টোকেনের দাম 3 ডলার (এজেন্ট ওয়ার্কফ্লোতে ইনপুট টোকেন সাধারণত 95% এর প্রায় সমান হয়), প্রতিটি কাজের গড় খরচ প্রায়: কিমি কোড 0.22 ডলার, হারমেস 0.28 ডলার, ক্লড কোড তখন 2 ডলার। পার্থক্যটি স্পষ্ট।
গতি একই নয়। মধ্যকালীন সময়, হারমেস সবচেয়ে দ্রুত, 179 সেকেন্ড; কিমি ২৯৭ সেকেন্ড; ক্লড কোড ৩৪৮ সেকেন্ড।
সুতরাং সবচেয়ে দ্রুততম হল হারমেস, এবং সবচেয়ে কম টোকেন খরচ করে হল কিমি কোড, দুটি একত্রিত হয় না।
কম্পোসিও দল এই উপসংহারে পৌঁছেছে যে, আপনি যদি এজেন্টের খরচ কমাতে চান, তাহলে প্রথমে দেখুন কোন হারনেস ব্যবহার করছেন, এবং মডেল পরিবর্তনের দিকে দ্রুত যাবেন না। তাদের ডেটা অনুযায়ী, হারনেস নিজেই খরচকে 9 গুণ পর্যন্ত পার্থক্য করতে পারে, যখন মডেলের ক্ষমতা প্রায় একই।

এই ফলাফল দেখে সেবাস্টিয়ান রাশকা একটি পোস্ট করেন, যেখানে তিনি বলেন যে এটি তাঁর আগের Qwen3.6 ব্যবহার করে করা পর্যবেক্ষণের সাথে মিলে যায়: Claude Code একই সফলতার হারের ক্ষেত্রে, token ব্যবহার অন্যান্য অনেক harness-এর তুলনায় 2 থেকে 3 গুণ বেশি।

তিনি কয়েকটি সম্ভাব্য কারণ উল্লেখ করেন: কি এটি খুব কম অপ্টিমাইজ করা হয়েছে? কি এতে বাগ আছে? নাকি এটি ইচ্ছাকৃতভাবে এভাবে ডিজাইন করা হয়েছে (কারণ এটি আরও কঠিন টাস্কে সহায়ক হতে পারে)? তিনি বলেন যে তাকে আরও সময় দিয়ে এটি ভালোভাবে পরীক্ষা করতে হবে।
তিনি গত মাসে তিনি স্থানীয় কোডিং এজেন্ট সম্পর্কে লেখা প্রবন্ধের সময় যা পর্যবেক্ষণ করেছিলেন, তা অতিরিক্তভাবে যোগ করলেন। তখন তিনি বিশ্লেষণ করেছিলেন যে Claude Code কেন বেশি token ব্যবহার করে, এবং দেখেছিলেন যে পার্থক্যটি মূলত ইনপুট token-এ, নয় আউটপুট token-এ। অর্থাৎ, Claude কোনও একগুচ্ছ বিষয়বস্তুর দ্বিগুণ লেখেনি। লগগুলি দেখায় যে, Claude-এর harness-এর একাধিক ইন্টারঅ্যাকশনের সময়, পূর্ববর্তী বার্তা, টুল-কল, কমান্ড-আউটপুট এবং ফাইলের বিষয়বস্তুসহ আরও বেশি কনটেক্সটকে পুনরায় মডেলের দিকে পাঠানো হয়। উদাহরণস্বরূপ, Claude-এর একটি রানের সময়, 578,000টি ইনপুট token-এর ব্যবহার হয়েছিল, কিন্তু আউটপুট মাত্র 4,500টি token, 25টি রাউন্ডে। সুতরাং, Claude-এর harness-এর একাধিক-পদক্ষেপ agent-এর সময়, prompt-এর ইতিহাসটি সঞ্চিত বা অন্তর্ভুক্ত হয়, এটিই সম্ভবতই ব্যাখ্যা।

এই পরীক্ষার ফলাফলগুলি একটি অবহেল্যযোগ্য প্রবণতা প্রকাশ করে: হারনেসের গুরুত্ব এখন মডেলের চেয়ে কম নয়।
সাম্প্রতিক একটি পেপার (Writer কোম্পানি থেকে, যারা এন্টারপ্রাইজ-লেভেল AI এজেন্ট প্ল্যাটফর্ম তৈরি করে) এটিকে সিস্টেমেটিকভাবে প্রমাণ করে: এটি কন্ট্রোলড ভেরিয়েবল এক্সপেরিমেন্ট ব্যবহার করে প্রমাণ করেছে যে, মডেল পরিবর্তনের পরিবর্তে হারনেস লেয়ার পরিবর্তন করলে ব্যয় কমানো যায়, এবং সমস্ত মডেলই এটির সুবিধা পায়।

বিশেষভাবে, তারা একটি কঠোর “নিয়ন্ত্রিত চলক” পরীক্ষা পরিচালনা করেছে: ২২টি ব্যবসায়িক কাজ এবং ৬টি বেস মডেল (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) অপরিবর্তিত রেখে, শুধুমাত্র অর্গানাইজেশন লেয়ারটি প্রতিস্থাপন করা হয়েছে—প্রোডাকশন-গ্রেড এজেন্ট সাইকেলকে Writer-এর নিজস্ব Harness দিয়ে প্রতিস্থাপন করা হয়েছে।
পরীক্ষার ফলাফল দেখায়: প্রতিটি কাজের গড় খরচ 41% কমেছে (0.21 ডলার → 0.12 ডলার), মধ্যকাল সময় 44% কমেছে (48 সেকেন্ড → 27 সেকেন্ড), টোকেন ব্যবহার 38% কমেছে (14.2k → 8.8k), এবং কাজের গুণগত মান প্রায় অপরিবর্তিত রয়েছে (0.78 → 0.81, নমুনা আকার ছোট হওয়ায় এটি উল্লেখযোগ্য পার্থক্য হিসাবে বিবেচিত হয়নি)। মূল্য-প্রতি-গুণমানের দিক থেকে, প্রতি ডলারের জন্য গুণমানের বৃদ্ধি 82% পর্যন্ত পৌঁছেছে, এবং প্রতি মিলিয়ন টোকেনে সম্পন্ন কাজের সংখ্যা 54.9 থেকে 92.0-এ বৃদ্ধি পেয়েছে।
তাই, মডেলটি "জল, বিদ্যুৎ ও গ্যাস" এ পরিণত হওয়ার পর, হারনেসই কি আপনার বিদ্যুৎ বিল নির্ধারণ করে এমন এয়ার কন্ডিশনার? অন্যভাবে বললে: আগে কেউ বলত "মডেলই পণ্য", এখন কি "হারনেসই পণ্য"?

যেহেতু হারনেস এতটাই গুরুত্বপূর্ণ, তাহলে পরবর্তী বই আরও বিস্তারিতভাবে হিসাব করা উচিত নয় কি?
কেউ উল্লেখ করেছেন যে, আমাদের বর্তমান বেঞ্চমার্কে "harness ট্যাক্স" যোগ করা প্রয়োজন। বিশেষ করে যখন টুল কল এবং পুনরায় চেষ্টা লুপে পড়ে যায়, তখন এই ট্যাক্স রৈখিকভাবে বৃদ্ধি পায় না।

অন্যভাবে বললে, ভবিষ্যতের এজেন্ট প্রতিযোগিতার প্রথম অংশে প্রশ্ন হবে “এটা করা সম্ভব কি না?”, দ্বিতীয় অংশে প্রশ্ন হবে “একই কাজটি করতে কে কম খরচে করে” — আর খরচ কমানোর গোপন কৌশলটি মডেলের বাইরে, harness-এ।

এজেন্ট চালানোর সময় আপনার কি এই ধরনের অভিজ্ঞতা হয়েছে? মন্তব্যের ক্ষেত্রে আলোচনা করুন।
এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন সিন্টিস" (ID: almosthuman2014) থেকে এসেছে, লেখক: মেশিন সিন্টিস
