ওয়াং ইউনহের স্টার্টআপ নিওহর্স চালু করেছে, প্রথম এজেন্ট-নেটিভ মডেল

icon MarsBit
শেয়ার
AI summary iconসারাংশ
ওয়াং ইউনহের স্টার্টআপ জেনিউয়ে ডায়নামিক্স পরিবর্তিত ভয় ও লালসা সূচকের প্রেক্ষাপটে নিওহর্স চালু করেছে, যা প্রথম Agent-Native মডেল। এই মডেলটি 4B এবং 9B সংস্করণে উপলব্ধ এবং Agent এক্সিকিউশন লগ এবং পাবলিক ডেটাসেটের উপর প্রশিক্ষিত। এটি টুল কলিং, ত্রুটি শনাক্তকরণ এবং পথ সমন্বয়ে দক্ষ। এই প্রকল্পটি উউওয়েন শিনকিয়ংয়ের ইনফ্রাস্ট্রাকচার এবং চিংহুয়া ও পেকিং বিশ্ববিদ্যালয়ের গবেষণা দ্বারা সমর্থিত। যখন মুদ্রাস্ফীতির ডেটা এখনও মার্কেটের জন্য একটি প্রধান চিন্তা, তখন এই প্রকাশটি ম্যাক্রোঅর্থনোমিক পরিবর্তনের প্রতিক্রিয়ায় AI-চালিত দক্ষতা প্রদর্শন করে।

ওয়াং ইউনহে তার উদ্যোগ শুরু করার পর প্রথমবারের মতো বড় মডেলের ফলাফল জমা দিয়েছেন।

কোয়ান্টাম পজিশন জানায়, হুয়াওয়ে নোয়া আর্ক ল্যাবের পূর্ব প্রধান, Pangu বড় মডেল প্রতিষ্ঠাতা ওয়াং ইউনহে দ্বারা প্রতিষ্ঠিত জিয়ুয়ান লুড়ং, NeoHorse নামক প্রথম Agent-Native মডেল প্রকাশ করেছে।

এই মডেলটির নিচের ইনফ্রাস্ট্রাকচার এবং ইনফ্রা অপ্টিমাইজেশন টেকনোলজি প্রদান করেছে উয়ানওয়েন শিনকিউং, যখন তসিংহুয়া বিশ্ববিদ্যালয় এবং পেকিং বিশ্ববিদ্যালয়ের দলগুলি অ্যালগরিদম এবং ট্রেনিং পদ্ধতি গবেষণায় অংশগ্রহণ করেছে, যাতে Agent-এর পোস্ট-ট্রেনিং ডেটা ব্যবহারের দক্ষতা এবং ট্রেনিং ফলাফল উন্নত হয়।

NeoHorse-1 এর দুটি সংস্করণ রয়েছে: 4B এবং 9B, যা টুল কল, পরিবেশের ফিডব্যাক পড়া, ত্রুটি শনাক্তকরণ, পথ সমন্বয় এবং চূড়ান্তভাবে কাজ সম্পন্ন করার মতো এজেন্টের কাজের সময় প্রয়োজনীয় একটি সেটকে কেন্দ্র করে।

NeoHorse

হারনেস এজেন্ট, টুল ব্যবহার, কোড এবং নির্দেশ অনুসরণসহ 10টি মূল্যায়নে, এজেন্টিক পোস্ট-ট্রেনিংয়ের পরে, 4B মডেলের সমগ্র পারফরম্যান্স 9B বেস মডেলের সমান বা সামান্য বেশি।

NeoHorse

একটি কোম্পানি যা সর্বদা মাল্টি-মডেল সহযোগিতার উপর জোর দিয়েছে, তারা আবার কেন নিজেদের মডেল ট্রেইন করতে শুরু করল? Primal Rhythm বেসিক মডেলের টেবিলে যোগ দিতে প্রস্তুত?

নিওহর্সের উত্তর থেকে দেখা যাচ্ছে যে দিকটি এমনভাবে পরিবর্তিত হয়নি।

এই মডেলটি প্রায় প্রাইম রিদমের অতীতে জমা হওয়া মাল্টি-মডেল এক্সিকিউশনের অভিজ্ঞতা, যা প্রথমবারের মতো মডেল প্যারামিটারে প্রবেশ করেছে।

এজেন্টের জন্য মডেল বাছাই করা কোম্পানিটিও এখন মডেল ট্রেনিং শুরু করেছে।

সর্বদা স্কোরকে মডেলগুলির তুলনা করার প্রধান ভিত্তি হিসাবে ব্যবহার করা হয়েছে।

কিন্তু মডেলটিকে এজেন্ট সিস্টেমে ব্যবহার করে পূর্ণাঙ্গ কাজ দেওয়া হলে, একক স্কোরের ব্যাখ্যামূলক ক্ষমতা কমে যায়।

একটি কাজে, মডেলকে শুধু একটি যুক্তিসঙ্গত উত্তর দিতে হবে না, বরং প্রক্রিয়ার সময় পরিবেশের ফিডব্যাক নিয়মিত পড়তে, ত্রুটি প্রক্রিয়াকরণ করতে এবং বাস্তব অগ্রগতির ভিত্তিতে পরবর্তী পথ সামঞ্জস্য করতে হবে; বিভিন্ন ধাপগুলির জন্য মডেলের ক্ষমতার প্রয়োজনীয়তা ভিন্ন।

এইভাবে, প্রিমিটিভ লিব্রেশন টিম একটি সিদ্ধান্তে পৌঁছায়।

মডেলের অ্যানোর্মালাইজেশন হবে এআই শিল্পের একটি দীর্ঘস্থায়ী কাঠামো।

যত বেশি মডেল, তত বেশি বিভাজন, তত বেশি পার্থক্য দেখা যায় মূল্য এবং ক্ষমতার, তখন কয়েকটি প্রশ্নের জন্য একটি সিস্টেমের প্রয়োজন হয়—

এই ধাপে কোন মডেল ব্যবহার করা উচিত? কোন ধাপগুলি কম খরচের মডেলের দায়িত্বে দেওয়া যেতে পারে? কখন প্রস্তুতি এবং বাস্তবায়ন ক্ষমতা বেশি মডেলে আপগ্রেড করা দরকার? একটি বাস্তবায়ন পথ বাধাগ্রস্ত হলে, কার কাছে হস্তান্তর করা উচিত? একাধিক মডেল কি একসাথে সমাধান দিতে পারে, এবং তারপর ফলাফলগুলি একত্রিত করা যেতে পারে?

ওয়াং ইউনহে দল এই সিস্টেমটিকে রাউটিং হারনেস নামে ডাকে (তাদের অধীনস্থ ওপেনস্কিলা ওপেন-সোর্স প্রকল্পটি এখন বিভিন্ন মডেলের সাথে যুক্ত, যা একটি একক ইন্টারফেসের মাধ্যমে এজেন্টের কার্যকলাপে সূক্ষ্ম রাউটিং, মডেল সুইচিং এবং একাধিক মডেলের সহযোগিতা সম্ভব করেছে)।

NeoHorse

একইভাবে, এই ধারণার ভিত্তিতে, প্রিমিটিভ লিনিয়ারিটির নিজের মডেল ট্রেন করার জন্য বিশেষ কোনো শক্তিশালী কারণ নেই। বাজারে যথেষ্ট সমৃদ্ধ মডেল সরবরাহ রয়েছে, যা প্রয়োজন অনুযায়ী ব্যবহার করা আরও নমনীয়।

যখন শিডিউলিং সিস্টেম চলমান থাকে, তখন অন্য ধরনের সম্পদ জমা হতে শুরু করে, যেমন: “কোন কাজের জন্য কোন দক্ষতা প্রয়োজন”, “মডেলটি কোন ধাপে ব্যর্থ হয়”, “কোন ধরনের মেরামতের পথ কার্যকর”, “কোন ফলাফল পরিবেশের যাচাইয়ের মাধ্যমে পাস করে”。

এই তথ্যগুলি একদিকে রুটিং সিদ্ধান্ত গ্রহণে সহায়তা করে, অন্যদিকে প্রশিক্ষণের মূল্যও শুরু করে।

এটি একটি প্ল্যাটফর্মের মতো যা অসংখ্য ব্র্যান্ড এবং গ্রাহকদের সংযোগ করে। ট্রেডিং প্রক্রিয়ায় সঞ্চিত চাহিদা, মূল্যায়ন এবং ব্যবহারের ফিডব্যাক পণ্যগুলিকে আরও উপযুক্ত ব্যবহারকারীদের সন্ধানে সাহায্য করতে পারে এবং পণ্য উন্নয়নের জন্য আরও ফিডব্যাক প্রদান করতে পারে।

এই প্রক্রিয়াটি প্ল্যাটফর্ম সার্ভিস মার্কেটের জন্য পরবর্তী প্রোডাক্ট উন্নতির ডেটা সোর্স হয়ে উঠেছে।

নিওহর্স হল হারনেসে জমা হওয়া কিছু কার্যক্রমের অভিজ্ঞতাকে মডেল ক্ষমতায় রূপান্তরিত করা।

মাল্টি-মডেল দ্বারা অতিক্রান্ত পথগুলিকে এজেন্ট-নেটিভ মডেলে অনুশীলন করুন

NeoHorse-এর ডেটা উৎসটি উল্লেখযোগ্য।

এর মূল কর্পাস হল রাউটিং হারনেস দ্বারা উত্পাদিত এজেন্ট এক্সিকিউশন সিগন্যাল এবং পাবলিক ডেটা একত্রিত করে এজেন্ট পোস্ট-ট্রেনিং-এর জন্য ডেটা সিস্টেম তৈরি করা।

একজন এজেন্ট হারনেসে একটি কাজ সম্পন্ন করলে একটি সম্পূর্ণ বাস্তবায়ন রেকর্ড রেখে যায়।

  1. টাস্ক ইনপুট → রাউটার কী ক্ষমতা প্রয়োজন তা চিহ্নিত করে
  2. কোনো মডেল নির্বাচন করুন
  3. মডেল ইনফারেন্স এবং টুল কল করে
  4. → পরিবেশ ফলাফল ফেরত দেয়
  5. → মডেলটি পুনরায় কার্যকর করুন বা ত্রুটি ঘটেছে
  6. → সিস্টেম মডেল পরিবর্তন করে বা পথ সামঞ্জস্য করে
  7. → কাজ চূড়ান্তভাবে সম্পন্ন বা ব্যর্থ হয়

সাধারণ প্রশ্নোত্তরের ডেটা প্রায়শই "প্রশ্ন" এবং "উত্তর" দুটি প্রান্তে কেন্দ্রীভূত হয়।

রাউটিং হারনেসের ডেটাতে আরও কিছু স্তরের তথ্য রয়েছে: টাস্কটির কী ক্ষমতার প্রয়োজন, সিস্টেম কী এক্সিকিউশন সিদ্ধান্ত নিয়েছে, এবং পরিবেশ চূড়ান্তভাবে কী ফিডব্যাক দিয়েছে।

উদাহরণস্বরূপ, রাউটার প্রাথমিকভাবে একটি কাজকে সাধারণ মডেল দিয়ে সম্পন্ন করার সিদ্ধান্ত নেয়, কিন্তু বারবার ব্যর্থতার পর এটি একটি শক্তিশালী মডেলে আপগ্রেড করা হয়, যার ফলে কাজটি সম্পন্ন হয়।

এই ট্র্যাকটিতে একটি ব্যর্থতার চেয়ে অনেক বেশি তথ্য রয়েছে।

সিস্টেম জানতে পারে যে প্রাথমিক ক্ষমতা নির্ণয় সম্ভবত কম ছিল, মডেলটি কোন ধাপে সমস্যায় পড়েছিল, শক্তিশালী মডেলটি কী কৌশল ব্যবহার করেছিল, কোন একিউটিং পথ চূড়ান্তভাবে পরিবেশ যাচাইকে পার হয়েছিল, এবং কাজটি সম্পন্ন করতে অতিরিক্ত কতগুলি টোকেন এবং সময় ব্যয় হয়েছিল।

NeoHorse

এর চেয়ে বেশি গুরুত্বপূর্ণ হলো, প্রাইমাল রিদম দ্বারা পর্যবেক্ষিত হয় কোনো মডেলের নিজের ক্ষমতা সম্পর্কে মূল্যায়ন নয়, বরং সদৃশ কাজের জন্য একাধিক মডেলের পার্শ্বীয় পারফরম্যান্স।

এর মধ্যে সফল পথ এবং মধ্যে ব্যর্থ হয়ে অন্য মডেল দ্বারা গ্রহণ করা এক্সিকিউশন রেকর্ড উভয়ই রয়েছে।

প্রশিক্ষণের দৃষ্টিকোণ থেকে, ব্যর্থ ট্রাজেক্টরি এমনকি আরও বেশি তথ্য প্রদান করতে পারে।

শেষ উত্তরটি মডেলকে একটি কার্যকরী পথ দেখায়, যখন ব্যর্থতা এবং সংশোধনের প্রক্রিয়াটি অতিরিক্ত দুটি ধরনের জ্ঞান যোগ করে—কোথায় ভুল হওয়ার সম্ভাবনা বেশি, এবং ভুল হলে কীভাবে সংশোধন করবেন।

এছাড়াও, একাধিক মডেল দ্বারা প্রদানকৃত ফলাফলের পাশাপাশি একাধিক মডেল দ্বারা কার্যপরিবেশে প্রকৃতপক্ষে অতিক্রমকৃত পথগুলি শেখা হয়, যা NeoHorse-এর একটি চিহ্নিত বৈশিষ্ট্য।

এজেন্ট কাজের লগকে কিভাবে মডেলের ক্ষমতায় পরিণত করা যায়?

সমস্ত লগগুলিকে প্রশিক্ষণে ফেলে দেওয়া স্বাভাবিকভাবেই একটি শক্তিশালী এজেন্ট মডেল প্রদান করবে না।

এজেন্টের ট্রাজেক্টরি সাধারণত দীর্ঘ হয়, যাতে সিস্টেম প্রম্পট, ব্যবহারকারীর অনুরোধ, টুল প্যারামিটার, বাস্তবায়নের ফলাফল, পুনরাবৃত্তি চেষ্টা, ত্রুটি তথ্য এবং অসংখ্য মধ্যবর্তী আউটপুট মিশে আছে।

কিছু ধাপে প্রশিক্ষণের মূল্য রয়েছে, কিছু বেশি শব্দের মতো। কিছু ট্রাজেক্টরি প্রক্রিয়া সম্পূর্ণ হয়, কিন্তু ফলাফলটি নিজেই ভুল।

প্রাইম লিপ প্রথমে এই প্রশ্নটি সমাধান করতে হবে যে কোন ডেটা মডেলের জন্য শেখার মতো।

টেকনিক্যাল রিপোর্ট অনুসারে, প্রতিটি ট্র্যাক স্ট্রাকচারাল চেক মাধ্যমে যায়, যেখানে রিকোয়েস্ট, মডেলের রিপ্লাই, টুল কল এবং এনভায়রনমেন্ট রেজাল্টের মধ্যে সামঞ্জস্যতা নিশ্চিত করা হয়।

পরে, সিস্টেমটি ব্যবহারকারীর লক্ষ্য পূরণ হয়েছে কিনা, নির্দেশাবলী মেনে চলা হয়েছে কিনা, টুল ব্যবহার যুক্তিসঙ্গত কিনা, উপসংহারগুলির প্রমাণ রয়েছে কিনা, ত্রুটি ঘটলে পুনরুদ্ধার করা যায় কিনা এবং মডেলটি সঠিক সময়ে কাজটি বন্ধ করেছে কিনা—এই ছয়টি মাপদণ্ডের ভিত্তিতে কার্যক্ষমতা মূল্যায়ন করবে।

এখানে এজেন্ট প্রশিক্ষণের সময় প্রায়শই মিশিয়ে ফেলা সমস্যাগুলি রয়েছে।

কাজ শেষ হওয়া মানে ব্যবহারকারীর লক্ষ্য পূরণ হয়েছে এমন নয়—মডেলের আউটপুট “কাজ সম্পন্ন হয়েছে” শুধু এটাই বোঝায় যে বাস্তবায়ন প্রক্রিয়াটি বন্ধ হয়ে গেছে, এটি প্রদানকৃত ফলাফলটি ব্যবহারকারীর প্রয়োজনীয়তা পূরণ করেছে কিনা তা প্রমাণ করতে পারে না।

সুতরাং, সম্পন্ন অবস্থা, লক্ষ্য পূরণের মাত্রা, পরিবেশগত প্রমাণ এবং ব্যবহারকারীর প্রতিক্রিয়াকে ভিন্ন ভিন্ন সংকেত হিসাবে রেকর্ড করা প্রয়োজন।

ডেটা ফিল্টারিং শেষ হওয়ার পর, রুটিং সিগন্যাল আরেকটি ভূমিকা পালন শুরু করে।

রাউটার কাজের জন্য প্রয়োজনীয় ক্ষমতা অনুমান করে এবং বিভিন্ন ক্ষমতা স্তরের সংকেত তৈরি করে। প্রশিক্ষণের সময় NeoHorse এই সংকেতগুলির ভিত্তিতে নমুনার ক্রম নির্ধারণ করে, প্রথমে কম ক্ষমতা প্রয়োজনীয় কাজগুলি শেখে, তারপর ধীরে ধীরে বেশি জটিল এক্সিকিউশন ট্রাজেক্টরির দিকে এগিয়ে যায়, একইসাথে বেসিক কাজগুলির কভারেজ বজায় রাখে।

এই পদ্ধতিটিকে রাউটিং-গাইডেড কারিকুলাম বলা হয়।

সহজ ভাষায়, রাউটিং সিগন্যাল অনলাইনে কোন টাস্কটি কার কাছে পাঠানো হবে তা নির্ধারণ করে, এবং ট্রেনিং পর্যায়ে মডেলকে বলে দেয় যে কোন টাস্কগুলি আগে শেখা উচিত এবং কোনগুলি পরে।

NeoHorse

সাধারণ সুপারভাইজড ফাইন-টিউনিংয়ের পাশাপাশি, নিওহর্স অন-পলিসি ডিস্টিলেশনও ব্যবহার করে।

এটি বুঝা যায় যে, প্রথমে ছাত্রদের নিজেদের পদ্ধতিতে সমস্যা সমাধান করতে দেওয়া হয়, তারপর শিক্ষক ছাত্রদের বাস্তবে যে ধাপে পৌঁছেছে, তার উপর ভিত্তি করে গাইডলাইন দেন।

এভাবে, শিক্ষক মডেলটি পূর্বনির্ধারিত একটি মানক ত্রুটির পরিবর্তে শিক্ষার্থী মডেলের বর্তমান বন্টনের অধীনে সামনে আসা সমস্যাগুলি প্রক্রিয়া করে।

NeoHorse

এই ধাপগুলির মাধ্যমে, বহুমডেল দীর্ঘমেয়াদী কার্য সম্পাদনের অভিজ্ঞতা এখন NeoHorse-এর পোস্ট-ট্রেনিং-এ ব্যবহার করা হচ্ছে।

পোস্ট-ট্রেনিংয়ের পরে কী উন্নতি হয়?

বর্তমান প্রযুক্তিগত রিপোর্টের ফলাফল অনুযায়ী, Agentic Post-Training 4B এবং 9B উভয় স্কেলে স্থিতিশীল উন্নতি আনে।

নিওহর্স-1-4B-এর সমগ্র পারফরম্যান্স (ম্যাক্রো-অ্যাভারেজ স্কোর 58.94 থেকে বেড়ে 64.87 হয়েছে) একই আকারের SOTA-এর সমান হয়েছে—এটি তার বেস মডেল Qwen3.5-4B-এর চেয়ে সমস্ত তুলনামূলক বেঞ্চমার্কে উন্নতি করেছে এবং 4B আকারের অন্যান্য মডেলগুলির মধ্যে সমগ্রভাবে অগ্রণী।

NeoHorse

কিন্তু SOTA মানে এটি সমানভাবে বিস্তৃত ক্ষমতা নয়।

আরও বিস্তারিত ফলাফল দেখলে দেখা যায় যে 4B মডেলের উন্নতি মূলত একটি ধরনের কাজে কেন্দ্রীভূত হয়েছে।

এই ধরনের কাজগুলির সাধারণত পরিষ্কার কাজের প্রবাহ থাকে, পরিবেশের প্রতিক্রিয়া পর্যবেক্ষণ করা যায়, সাফল্য ও ব্যর্থতা যাচাই করা যায়, এবং চূড়ান্ত প্রদানের মানদণ্ডও পরিষ্কার।

উদাহরণস্বরূপ, একটি প্রকল্প সময়সূচি কাজে, বেস মডেল যদিও কাজের ডিরেক্টরিতে ফাইলগুলি খুঁজে পেয়েছে, তবুও সর্বশেষ নির্ভরশীলতা সীমাবদ্ধতা সহ একটি ইমেইল পড়তে চালিয়ে যায়নি।

ফলে, এটি এখন মেয়াদ শেষ হয়ে যাওয়া তথ্য অনুযায়ী পরিকল্পনা তৈরি করেছে এবং ফাইলটি ভুল স্থানে লিখেছে।

পোস্ট-ট্রেনড মডেলটি নতুন প্রমাণ পড়তে থাকবে, বন্ধনগুলি পরিবর্তিত হয়েছে কিনা তা শনাক্ত করবে, সময়সূচী পুনর্গণনা করবে, ফলাফল যাচাই করবে এবং আউটপুটগুলি সঠিক অবস্থানে সংরক্ষণ করবে।

এর পার্থক্যটি এজেন্ট এক্সিকিউশন চেইনে প্রকাশ পায়।

একটি মডেল প্রায় বুঝতে পারে যে কাজটি কীভাবে করা উচিত, অন্যটি প্রমাণ সংগ্রহ, সীমাবদ্ধতা আপডেট, বাস্তবায়ন, যাচাইকরণ এবং ডেলিভারি কে একটি পূর্ণাঙ্গ কাজের প্রবাহে সংযুক্ত করতে পারে।

একই স্কেলের সর্বোত্তম প্রচলিত পদ্ধতি অর্জন করা মানে এটি নয় যে NeoHorse-1-4B সমস্ত কাজ নিয়ে নেবে। প্রাইম রিদম বেশি গুরুত্ব দেয় বিভিন্ন মডেলের ক্ষমতার সীমানা কিভাবে সূক্ষ্মভাবে বিভক্ত করা যায়।

4B মডেল দ্বারা স্থিতিশীলভাবে সম্পন্ন করা যায় এমন কাজগুলির জন্য বড় মডেলগুলির কল কমানো যায়; যে কাজগুলি আরও শক্তিশালী মডেল দ্বারা সম্পন্ন করা যায়, তাদের জন্য সর্বোচ্চ মূল্যের ফ্ল্যাগশিপ মডেলে নিয়মিত আপগ্রেড করার দরকার নেই; যখন কঠিনতা আরও বাড়বে, তখন এটি মডেল পুলের আরও শক্তিশালী মডেলগুলির কাছে হস্তান্তর করা হবে।

এখানে রাউটিং হারনেস এবং স্ব-উন্নয়িত মডেলের মধ্যে সঠিক সংযোগ রয়েছে।

মডেলটি ধারাবাহিকভাবে এমন কাজের খরচের পরিসরকে বাইরের দিকে বিস্তার করছে, যেখানে রাউটিং সিস্টেমটি কাজের কঠিনতা এবং সম্পাদনের ভিত্তিতে বিভিন্ন ক্ষমতাগুলিকে উপযুক্ত স্থানে স্থাপন করে।

NeoHorse

API কল ফি ছাড়াও, এই মডেলের অন্য কোন মূল্য আছে?

এই বিষয়ে, প্রাইম লিক পণ্য লাইনগুলির মধ্যে সম্পর্ক ধীরে ধীরে পরিষ্কার হয়ে উঠছে।

প্রথম স্তর হল OpenSquilla ওপেন সোর্স ভার্সন।

প্রিমিট মোশন ফ্রি, ওপেন-সোর্স, লোকালি ডিপ্লয় এবং ডেস্কটপ পণ্যের মাধ্যমে ডেভেলপারদের মাল্টি-মডেল এজেন্ট ব্যবহারের বাধা কমিয়ে ডেভেলপারদের এবং টাস্ক এন্ট্রির মধ্যে সংযোগ স্থাপন করে।

দ্বিতীয় স্তর হল TokenRhythm API।

এটি "চীনা ভার্সন অফ ওপেনরাউটার" এর কাছাকাছি অবস্থান নেয়, একক ইন্টারফেসের মাধ্যমে বিভিন্ন মডেলের কল ক্ষমতা প্রদান করে, ডেভেলপার এবং প্রতিষ্ঠানগুলির মডেল ব্যবহারের প্রয়োজনীয়তা পূরণ করে এবং মডেল প্রস্তুতকারকদের আরও বেশি অ্যাপ্লিকেশন স্কিমের সাথে সংযুক্ত করতে সহায়তা করে।

ব্যবসাগুলি বিভিন্ন মডেলের ইন্টারফেসগুলি আলাদাভাবে সামঞ্জস্য করার প্রয়োজন ছাড়াই মডেলগুলি মূল্যায়ন, বাছাই এবং পরিবর্তন করতে সহজ হয়ে যায়।

তৃতীয় স্তর হল ব্যবসায়িক সেবা এবং বাস্তবায়ন ক্ষমতা।

ফাইন্যান্স, ম্যানুফ্যাকচারিং ইত্যাদি শিল্পগুলিতে অ্যাক্সেস নিয়ন্ত্রণ, স্থিতিশীলতা, প্রাইভেট ডিপ্লয়মেন্ট এবং সার্ভিস গ্যারান্টির বিভিন্ন প্রয়োজনীয়তা রয়েছে, যা আরও ব্যবসায়িক সুযোগ তৈরি করে।

চতুর্থ স্তরটি হল নিওহর্স।

নিওহর্স প্রথমে একটি গুরুত্বপূর্ণ সংযোগ যাচাই করেছে: হারনেস এক্সিকিউশন প্রক্রিয়ায় উৎপন্ন কার্যকরী অভিজ্ঞতা, ছাটাই এবং প্রশিক্ষণের পরে, সত্যিই মডেলের নিজস্ব ক্ষমতায় রূপান্তরিত হওয়ার সম্ভাবনা রাখে।

এর ফলে, প্রাইম লিপস আগে যে ব্যবসায়িক ফ্লাইওয়াহ প্রস্তাব করেছিল, তার প্রথমবারের মতো মডেল স্তরে ফলাফল দেখা গেল।

এটি উপসংহার অর্থনীতির অপ্টিমাইজেশনের সম্ভাবনাও আনে।

যদি নিওহর্স পরবর্তীতে একটি উচ্চ ফ্রিক�োয়েন্সি এবং স্পষ্ট মানদণ্ড সম্পন্ন এজেন্ট কাজের একটি সেট স্থিতিশীলভাবে গ্রহণ করতে পারে, তাহলে প্ল্যাটফর্মটির একটি স্ব-নিয়ন্ত্রিত সম্পদ সরবরাহের ক্ষমতা যোগ হবে।

এই কাজগুলি যুক্তিসঙ্গত খরচ, প্রতিক্রিয়া গতি এবং স্থিতিশীলতা আরও উন্নত করতে পারে এবং মডেল সরবরাহ কনফিগারেশনকে আরও নমনীয় করে তোলে। মডেলটি যতক্ষণ পুনরায় পুনরায় উন্নত হচ্ছে, এটি কভার করার ক্ষমতা আরও বাড়ানোর সম্ভাবনা রয়েছে।

এই দৃষ্টিকোণ থেকে, প্রিমিটিভ লিপ যা করতে চায় তা প্রক্রিয়া সঞ্চয়ের মতো।

বাহ্যিক মডেল ইকোসিস্টেম বিভিন্ন ক্ষমতা প্রদান করে, হারনেস এগুলির সংগঠন ও বাস্তবায়ন দায়িত্ব পালন করে; বাস্তবায়ন প্রক্রিয়ায় অর্জিত অভিজ্ঞতা পরবর্তী মডেল উন্নতির জন্য ব্যবহার করা হয়।

মডেল সংযোগ করা, সেবা প্রদান করা থেকে শুরু করে সেবার মাধ্যমে অর্জিত অভিজ্ঞতাকে মডেলের ক্ষমতায় রূপান্তরিত করে দক্ষতা এবং গুণগত মান উন্নত করা—এটি প্রাইম রিদমের জন্য API এগ্রিগেশন প্ল্যাটফর্মের বাইরে একটি অতিরিক্ত পদক্ষেপ।

মডেলের বাইরে, প্রিমিটিভ লিব্রেশন কী তৈরি করছে?

প্রাইম রিদমের ধারণায় চক্রটি কয়েকটি ব্যবসায়িক লাইন দ্বারা সংযুক্ত করা যেতে পারে:

  1. রাউটিং হারনেস ডেভেলপারদের এজেন্ট টাস্কের সাথে সংযুক্ত করে
  2. → টোকেনরিদম এপিআই কানেকশন মডেল: সরবরাহ এবং কল চাহিদা
  3. → হারনেস সংগঠন দ্বারা বাস্তবায়িত, রুটিং এবং টাস্ক ট্র্যাজেক্টরি সঞ্চয় করুন
  4. মডেল প্রশিক্ষণের জন্য ছাঁটাইকৃত ট্র্যাক উপলব্ধ
  5. → আপডেটকৃত মডেল হারনেস ফেরত দেয়, অ্যাডাপ্টেশন টাস্কে অংশগ্রহণ করুন
  6. কাজের অভিজ্ঞতা উন্নত করুন, আরও ভালো প্রতিক্রিয়া গতি এবং খরচ দক্ষতা অন্বেষণ করুন
  7. → ব্যবহার চালিয়ে যাওয়া, পেমেন্ট এবং পরিচালনা দক্ষতার উন্নতি
  8. পরবর্তী সার্ভিস উন্নতি এবং গবেষণা ও উন্নয়নের জন্য সমর্থন করুন

একটি গুরুত্বপূর্ণ পরিবর্তন হল যে, মডেল দ্বারা উত্পাদিত ট্র্যাজেক্টরি শুধুমাত্র ব্যবহার এবং কল পর্যায়েই সীমাবদ্ধ থাকবে না, এটি পরবর্তী মডেল ট্রেনিংয়ের জন্যও উৎস হতে পারে।

একটি টাস্ক সম্পন্ন করলে, হারনেস ক্ষমতার সীমানা সম্পর্কে আরও একটি পর্যবেক্ষণ পায়।

একটি মডেল ব্যর্থ হয়েছে, সিস্টেম জানে কোথায় ক্ষমতার ফাঁক হতে পারে; অন্য একটি মডেল সফলভাবে নিয়ে নেয়, সিস্টেম একটি নতুন ঠিক করার পথ পায়; ব্যবহারকারী চূড়ান্তভাবে ফলাফল গ্রহণ করে বা প্রত্যাখ্যান করে, যা একটি বাহ্যিক ফিডব্যাক প্রদান করে।

যত বেশি কাজ সঞ্চিত হবে, রাউটিং সিদ্ধান্ত তত বেশি সঠিক হবে; রাউটিং সিদ্ধান্ত আরও সঠিক হওয়ার পর, বাছাই করা প্রশিক্ষণ ট্র্যাজেক্টরি বাস্তব কাজের সাথে আরও বেশি মিলবে; মডেলটি কাজের জন্য আরও উপযুক্ত হওয়ার পর, API সেবার খরচ এবং অভিজ্ঞতা উন্নতির সুযোগ পাবে।

যদি এই চক্রটি দীর্ঘমেয়াদীভাবে প্রযোজ্য হয়, তবে প্রাইম লিক এবং সাধারণ API এগ্রিগেটর প্ল্যাটফর্মের মধ্যে পার্থক্যও ধীরে ধীরে রাউটিং নিয়ম এবং মডেল তালিকা থেকে প্রশিক্ষণ টাস্ক ডিজাইন, প্রশিক্ষণ পদ্ধতি এবং মডেল প্যারামিটারের দিকে সরে যাবে।

শেষ পর্যন্ত পণ্যের প্রদর্শনের মাধ্যমে প্রকাশ পাবে।

RSI এর থেকে কতটা দূরে?

উপরে হল প্রাইম রিদম আলোচনা শুরু করার পটভূমি RSI (Recursive Self-Improvement, রিকার্সিভ সেলফ-ইমপ্রুভমেন্ট) নিয়ে।

Primal Rhythm এখন RSI পরিসরটি একটি ইঞ্জিনিয়ারিং সম্পূর্ণ চক্রের কাছাকাছি যাচাই করছে, যা দুটি অংশে বিভক্ত করা যায়।

প্রথমটি ডেটা-আরএসআই।

হারনেসে মডেলটি কাজ চালিয়ে যায়, প্রতিটি রাউটিং, টুল কল, ব্যর্থতা পুনরুদ্ধার এবং চূড়ান্ত ফলাফলের জন্য নতুন স্ট্রাকচার্ড রেকর্ড তৈরি হয়।

এই রেকর্ডগুলি ফিল্টার এবং প্রক্রিয়াজাত করার পরে, পরবর্তী প্রশিক্ষণের জন্য ডেটা পুলে যোগ করা যায়। তাই প্রশিক্ষণ ডেটা শুধুমাত্র ম্যানুয়ালি প্রস্তুত করা ডেটার উপর নির্ভরশীল হওয়ার দরকার নেই, বরং সিস্টেমের নিরন্তর ব্যবহারের সাথে সাথে এটি বৃদ্ধি পেতে পারে।

দ্বিতীয়টি মডেল-আরএসআই।

সিস্টেম মূল্যায়নের ফলাফলের ভিত্তিতে বর্তমান মডেলের দুর্বলতা শনাক্ত করে, পরবর্তী প্রশিক্ষণ ডেটা বন্টন সামঞ্জস্য করে, মডেল আপডেট করে এবং নতুন মডেলটি হারনেসে ফিরিয়ে দেয়।

অর্থাৎ, মডেলটি কার্যক্রমের অভিজ্ঞতা থেকে শেখে, আপডেটকৃত মডেলটি নতুন কার্য সম্পাদন করে পরবর্তী প্রশিক্ষণ চক্রের জন্য নতুন ফিডব্যাক তৈরি করে।

NeoHorse

তবে, নিওহর্সের বর্তমান প্রকাশিত তথ্যের ভিত্তিতে, এই সিস্টেমটিকে একটি পূর্ণাঙ্গ RSI হিসাবে বিবেচনা করা যায় না।

বর্তমান প্রযুক্তিগত রিপোর্টটি একটি "নির্বাহ-মূল্যায়ন-পছন্দ-আপডেট" বন্দনা যাচাই করে। সিগন্যাল ডিজাইন, পুরস্কার ডিজাইন এবং প্রশিক্ষণ প্রক্রিয়া এখনও মানুষ দ্বারা নির্ধারিত; একাধিক প্রজন্মের মডেল পুনরাবৃত্তির পরেও স্থিতিশীলভাবে লাভ অর্জন করা যাবে কিনা, তা আরও পরীক্ষার প্রয়োজন।

অতএব, নিওহর্স এই প্রকাশের মাধ্যমে দুটি স্তরের যাচাইকরণ সম্পন্ন করেছে।

একটি ব্যবসায়িক স্তর হল যেখানে সিস্টেম দ্বারা সংগৃহীত ডেটা মডেল ট্রেনিংয়ে প্রবেশ করে এবং পরিমাপযোগ্য ক্ষমতা বৃদ্ধিতে রূপান্তরিত হয়।

একটি প্রযুক্তিগত স্তরে, ওয়াং ইউনহে একটি স্টার্টআপ দলকে নেতৃত্ব দিয়ে RSI দিকে একক প্রকল্প যাচাই সম্পন্ন করেছেন।

যত বেশি মডেল, তত বেশি মূল্যবান হবে এই কোম্পানি?

অবশ্যই, প্রিমিটিভ লিপ গল্পটি সফল হতে কয়েকটি বাধা অতিক্রম করতে হবে।

প্রথমত, ওপেন সোর্স ইকোসিস্টেম কি প্রতিনিয়ত API ব্যবহার এবং আয়ে রূপান্তরিত হতে পারে।

দ্বিতীয়ত, কাজের ধরন বাড়ার সাথে সাথে সিস্টেম কি প্রশিক্ষণের জন্য যথেষ্ট উচ্চ মানের এজেন্ট ট্রাজেক্টরি পেতে পারবে।

তৃতীয়ত, মডেলের ক্ষমতা উন্নত হওয়ার পরে, কি এটি স্থিতিশীলভাবে ভালো কাজের অভিজ্ঞতা এবং কার্যক্ষমতায় রূপান্তরিত হবে এবং তা ব্যবসায়িক ডেটায় আরও প্রকাশ পাবে।

চতুর্থ, একাধিক মডেল পুনরাবৃত্তির পরে, ক্ষমতার বৃদ্ধি কতক্ষণ চলবে।

এই প্রশ্নগুলির জন্য আরও বেশি সময় পর্যবেক্ষণ প্রয়োজন।

এবং একটি অপরিহার্য পরিবর্তনশীল রয়েছে— ডিপসিক , কুয়েন, মিনিম্যাক্স মডেল প্রস্তুতকারকরাও হারনেস এবং এজেন্ট পণ্যের দিকে বিস্তার ঘটাচ্ছে, মডেল এবং এজেন্ট ইনফ্রাস্ট্রাকচারের উল্লম্ব একীকরণের প্রবণতা আরও পরিষ্কারভাবে দেখা যাচ্ছে।

উদাহরণস্বরূপ, প্রাইম রিদমের ক্ষেত্রে, এই কোম্পানির বর্তমানে একটি পার্থক্য হল মডেল-নিষ্ঠা এবং বিভিন্ন মডেলের মধ্যে ক্রস-মডেল একেকটি তুলনামূলক ডেটা।

কিন্তু যদি মডেলগুলির মধ্যে ক্ষমতার পার্থক্য যথেষ্ট বড় হয়, তবে মডেল-ব্যাপী স্কিডিউলিং একটি স্বতন্ত্র ব্যবসা হয়ে উঠার সুযোগ রাখে; যদি শীর্ষস্থানীয় মডেলগুলি ধীরে ধীরে আরও বেশি কাজ কভার করে যায়, অথবা প্রস্তুতকারকরা নিজেরাই Routing, টুল কল এবং Agent ফ্রেমওয়ার্ককে একসাথে প্যাকেজ করে দেয়, তবে মধ্যবর্তী স্তরের জন্য স্থান চাপা পড়বে।

যখন আপস্ট্রিম ক্ষমতা ক্রমাগত শক্তিশালী এবং সস্তা হচ্ছে, তখন মধ্যবর্তী স্তরটি কেন বিদ্যমান থাকবে?

প্রাইম রিদমের জন্য, নিওহর্স কমপক্ষে এই প্রশ্নটিকে একটি নতুন পর্যালোচনার দিক যোগ করেছে।

এটি আগে প্রমাণ করেছিল যে এটি "মডেল ব্যবহার" করতে পারে, এখন এটি চেষ্টা করছে প্রমাণ করতে যে দীর্ঘমেয়াদীভাবে মডেল ব্যবহারের মাধ্যমে জমা হওয়া ডেটা নিজস্ব মডেল ক্ষমতায় পরিণত হতে পারে।

যদি এই পথটি সফল হয়, তাহলে প্রিমিটিভ লিকের প্রতিরক্ষা শুধুমাত্র রাউটিং কৌশলেই সীমাবদ্ধ থাকবে না; যদি এটি সফল না হয়, তাহলে এটিকে সমস্ত মডেল মধ্যবর্তী স্তরের সাথে সাধারণভাবে সামনে দিয়ে যেতে হবে।

GitHub: https://github.com/TokenRhythm/NeoHorse

হাগ ফেস: https://huggingface.co/collections/TokenRhythm/neohorse-1

এই লেখাটি ওয়েইচ্যান গ্রুপ "Quantum Bit" থেকে এসেছে, লেখক: হেং ইউ

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।