"সবচেয়ে শক্তিশালী মডেল"-এর সংরক্ষণ সময় কমে আসছে।লেখক, উৎস: ডিংজিয়াও
এক মাসের মধ্যে 9টি ফ্ল্যাগশিপ মডেল একসাথে প্রকাশিত হওয়া বড় মডেল শিল্পে সাধারণ নয়।
প্রথম সপ্তাহে টেনসেন্ট হুইয়েন Hy3-এর চূড়ান্ত সংস্করণ প্রকাশ করে ওপেন-সোর্স করে, এবং শেষ সপ্তাহে Anthropic Claude Opus 5 প্রকাশ করে, এর মধ্যে Kimi K3, Qwen3.8-Max প্রিভিউ সংস্করণ, Grok 4.5 ইত্যাদি মডেলগুলি ধারাবাহিকভাবে চলে আসে। জুলাই গত বছরের মধ্যে অল্প কয়েকটি প্রকাশের শীর্ষ সময় হয়ে উঠেছে।

বিভিন্ন প্রস্তুতকারক বিভিন্ন সময়ে পদক্ষেপ নেয়। কিছু প্রস্তুতকারক প্রতিদ্বন্দ্বীর আপডেটের পরের বিরতির সময়ে পণ্য প্রকাশ করে, কিছু প্রস্তুতকারক বিশ্ব কৃত্রিম বুদ্ধিমত্তা সম্মেলনের আগে-পরে প্রকাশ করে, আবার কিছু প্রস্তুতকারক বাজার প্রতিযোগিতার প্রতিক্রিয়ায় মূল্য সমায়োজন করে।
কিন্তু জুলাই শুধু মডেল প্রকাশের সংখ্যা বেশি হওয়া নয়, এই প্রকাশের মধ্যে দুটি পরিবর্তনও উল্লেখযোগ্য।
প্রথমত, মডেলগুলির মধ্যে ক্ষমতার ব্যবধান কমে আসছে। Artificial Analysis-এর সর্বশেষ সমন্বিত বুদ্ধিমত্তা সূচক অনুযায়ী, শীর্ষস্থানীয় মডেলগুলির মধ্যে পার্থক্য স্পষ্টভাবে কমে এসেছে। দ্রুত সংস্করণ আপডেটের সাথে, “সবচেয়ে শক্তিশালী মডেল”-এর অবস্থান দীর্ঘদিন ধরে বজায় রাখা কঠিন হয়ে পড়ছে, এবং সবকিছু একক মাপদণ্ডের পরম অগ্রগতির পরিবর্তে বিভিন্ন কাজের জন্য সুবিধা খোঁজা শুরু করেছে।
দ্বিতীয়ত, ওপেন-সোর্স মডেলগুলি এখন প্রথম স্তরে প্রবেশ করছে। জুলাইয়ে প্রকাশিত নতুন মডেলগুলির মধ্যে, টেনসেন্ট হুনইন Hy3, Kimi K3 ইত্যাদি ওপেন-ওয়েটস (ওপেন-সোর্স মডেল প্যারামিটার, যা ডেভেলপারদের ডাউনলোড এবং ডিপ্লয় করার অনুমতি দেয়) বেছে নিয়েছে। এর মধ্যে, Kimi K3 Code Arena ফ্রন্ট-এন্ড প্রোগ্রামিং র্যাঙ্কিংয়ে প্রথম স্থানে, GPT-5.6 Sol এবং Claude Fable 5-এর চেয়েও উপরে। গত দুই বছরে, ওপেন-সোর্স মডেলগুলিকে বেশিরভাগই বন্ধ-সোর্স মডেলগুলির অনুসরণকারী হিসাবে দেখা হয়েছিল, কিন্তু এই প্রতিযোগিতা দেখাচ্ছে যে, ওপেন-সোর্স মডেলগুলি এখন কিছু ডেভেলপমেন্ট সিনারিওতে বন্ধ-সোর্স মডেলগুলির সাথে সরাসরি প্রতিদ্বন্দ্বিতা করছে।
তাহলে, এই মাসের ঘন ঘন প্রকাশ কী পরিবর্তন এনেছে এবং এর অর্থ কী?
01. এখন শুধু কে বুদ্ধিমান তা নিয়ে প্রতিযোগিতা করা বন্ধ
গত কয়েক বছর ধরে, বড় মডেল শিল্পের মুখ্য প্রতিযোগিতা ছিল সাধারণ ক্ষমতার উপর, কে কতটা ব্যাপক জ্ঞান রাখেন এবং কে কতটা সঠিক উত্তর দেন। কিন্তু এখন, প্রতিযোগিতার মাপকাঠি পরিবর্তিত হয়েছে।
এই রাউন্ডে, কোডিং দক্ষতা সবচেয়ে স্পষ্ট প্রতিদ্বন্দ্বিতার দিক হয়ে উঠেছে।
ওপেনএআই প্রোগ্রামিং এবং জটিল যুক্তিকে আরও শক্তিশালী করছে এবং কোডেক্স ইকোসিস্টেমকে সম্প্রসারিত করছে, যাতে ডেভেলপারদের টুলসের মাধ্যমে আবদ্ধ করা যায়। অ্যানথ্রোপিক কোডের বুঝতে এবং সুরক্ষা অডিটে জোর দিচ্ছে, যাতে ডেভেলপাররা বড় প্রকল্পগুলিতে জটিল ইঞ্জিনিয়ারিং সমস্যাগুলি সমাধান করতে পারে। গ্রক 4.5 তখন গতি এবং কম খরচের উপর জোর দিচ্ছে এবং AI প্রোগ্রামিং টুল Cursor-এর সাথে বাঁধা, যা দৈনন্দিন ডেভেলপমেন্টের পরিস্থিতি কভার করে।
বড় মডেল গবেষক ইয়াও ইউহাং বলেছেন যে প্রতিটি কোম্পানি প্রোগ্রামিং দক্ষতায় গুরুত্বপূর্ণ বিনিয়োগ করছে এবং পার্থক্য দ্রুত কমে যাচ্ছে, যেমন Kimi K3-এর কোডিং দক্ষতা উল্লেখযোগ্যভাবে উন্নতি পেয়েছে এবং এটি শীর্ষস্থানীয় বন্ধ মডেলগুলির স্তরের কাছাকাছি পৌঁছাচ্ছে।

ছবির উৎস / pexels
এজেন্ট হল প্রতিটি প্রতিষ্ঠানের জন্য অন্য একটি প্রতিযোগিতামূলক দিক। GPT-5.6 Sol এবং Codex একসাথে স্বয়ংক্রিয় প্রোগ্রামিং অনুসন্ধান করছে, Opus 5 দীর্ঘ-পরিসরের কাজ সম্পাদনের উপর জোর দিচ্ছে, Kimi K3 ক্রমাগত চলমান ক্ষমতা দিয়ে জটিল কাজ সম্পন্নের ক্ষমতা প্রদর্শন করছে, এবং টেনসেন্ট হাইব্রিড Hy3 ওয়েচ্যাট ইকোসিস্টেমের সাথে সংযুক্ত হয়ে স্মার্ট এজেন্ট অ্যাপ্লিকেশন অনুসন্ধানের চেষ্টা করছে।
কিন্তু এজেন্টগুলি বাস্তব কাজে এখনও অপরিপক্ক। স্বাধীন ডেভেলপার বেইচেং বলেন, বর্তমানে কিছু স্মার্ট এজেন্ট পণ্যের দুর্বলতা টুল ব্যবহার করার ক্ষমতা নয়, বরং টাস্ক স্কেডিউলিং ক্ষমতায়। উদাহরণস্বরূপ, Codex-এর আলট্রা মোড অনেকগুলি সাব-এজেন্ট চালু করে, যেখানে বিভিন্ন সাব-এজেন্ট একই ফাইলটি পুনরাবৃত্তি করে, সদৃশ বিশ্লেষণ করে, যার ফলে Token-এর খরচ বাড়ে, কিন্তু প্রকৃতপক্ষে কার্যকরী কাজের কোনো বৃদ্ধি হয়না। তার মতে, এজেন্টের ক্ষমতা বৃদ্ধির জন্য শুধুমাত্র সাব-এজেন্টের সংখ্যা বাড়ানোই যথেষ্ট নয়; মূল বিষয়টি হলো, কোনটি বিশ্লেষণযোগ্য, কোনটির ধাপগুলি বাদ দেওয়া যায়—এটি চিহ্নিতকরণের ক্ষমতা।
যাও যুহাংয়ের মতামতও একই। তিনি মনে করেন যে এজেন্টগুলি বর্তমানে সবচেয়ে বেশি মনোযোগ দেওয়ার মতো দিক, কিন্তু প্রকৃতপক্ষে পরিপক্ক হওয়ার আগে আরও দূরে আছে। তাঁর মতে, চিকিৎসা, অর্থনীতি ইত্যাদি বিশেষায়িত ক্ষেত্রের এজেন্টগুলিতে এখনও বড় সুযোগ রয়েছে; পরবর্তী পর্যায়ে পার্থক্য তৈরির মূল কারণ শুধুমাত্র মডেলের ক্ষমতা নয়, বরং এজেন্টগুলির বিশেষ পরিস্থিতিতে কতটা ব্যবহারযোগ্য এবং গ্রাহকরা কি প্রতিদান দিতে রাজি।
দেশীয় মডেলগুলি বিভিন্ন ক্ষমতার উন্নতির মাধ্যমে বিচ্ছিন্নতা খুঁজে পায়। কিমি K3 দীর্ঘ কনটেক্সট, ফ্রন্টএন্ড প্রোগ্রামিং এবং পণ্য ডিজাইনের ক্ষমতা শক্তিশালী করেছে, যা বিভিন্ন প্রোগ্রামিং পরীক্ষায় শীর্ষস্থানে পৌঁছেছে এবং বিদেশী বন্ধ সোর্স ফ্ল্যাগশিপ মডেলগুলির কাছাকাছি ক্ষমতা অর্জন করেছে।
প্যারামিটার সাইজ এবং ইনফারেন্স দক্ষতার মধ্যে প্রতিদ্বন্দ্বিতা অন্যতম অন্যতম মূল রেখা হয়ে উঠেছে।
জুলাইয়ে প্রকাশিত অনেকগুলি মডেল ট্রিলিয়ন এবং এমনকি কয়েক ট্রিলিয়ন প্যারামিটারের পরিসরে প্রবেশ করেছে, কিন্তু প্যারামিটার সাইজ এখন সহজেই ক্ষমতার মাপদণ্ড হিসেবে বিবেচিত হচ্ছে না। MoE আর্কিটেকচারের উন্নতির সাথে সাথে, মডেলগুলি বড় প্যারামিটার ক্ষমতা অর্জন করতে পারে, একইসাথে উপসংহারের জন্য শুধুমাত্র একটি ছোট অংশকেই সক্রিয় করে, যা বাস্তব গণনা খরচ কমায়।
এই শিল্পটি দুটি পথে বিভক্ত হয়েছে: একটি হল স্কেল বাড়ানো, বড় প্যারামিটার ব্যবহার করে বেশি ক্ষমতা অর্জন; অন্যটি হল দক্ষতা বৃদ্ধি, ছোট এক্টিভেশন প্যারামিটার ব্যবহার করে ফ্ল্যাগশিপ মডেলের কাছাকাছি ফলাফল অর্জন।
দাম এখন জুলাই মডেল প্রতিযোগিতার সবচেয়ে সরাসরি পরিবর্তনশীল হয়ে উঠেছে।
বিদেশি প্রতিষ্ঠানগুলি বেশি বিভিন্নতা ভিত্তিক মূল্য নির্ধারণ কৌশল গ্রহণ করে। OpenAI বাজারকে আরও বিভক্ত করে GPT-5.6 কে বিভিন্ন সংস্করণে বিভক্ত করেছে, যাতে ব্যবহারকারীরা কাজের জটিলতা অনুযায়ী সংশ্লিষ্ট মডেলটি বেছে নিতে পারে; Anthropic তার উচ্চ পারফরম্যান্সের ফ্ল্যাগশিপ মডেলের পথ অব্যাহত রাখছে, Opus সিরিজের মাধ্যমে উচ্চ-মূল্যের ডেভেলপমেন্ট এবং কর্পোরেট স্কেনারিওগুলি কভার করছে; Grok 4.5 তার নিম্নমূল্যের কৌশল গ্রহণ করেছে, যার আউটপুট মূল্য Opus সিরিজের চারভাগের একভাগ, এবং Cursor-এর সাথে বাইন্ডিংয়ের মাধ্যমে ডেভেলপারদের আকর্ষণ করছে।
দেশীয় প্রস্তুতকারকরা ব্যয়ের সুবিধাকে বেশি জোর দেয়। গত ছয় মাসে, অনেক দেশীয় মডেল প্রস্তুতকারক এপিআই মূল্য নিয়মিত কমিয়েছে, যাতে কম খরচে ব্যবহারের বাধা কমে ডেভেলপার এবং ব্যবসায়িক ব্যবহারকারীদের সংখ্যা বাড়ে।
জুলাইয়ের বড় মডেল প্রতিযোগিতা এখন শুধুমাত্র একক ক্ষমতার তুলনা থেকে কোড, এজেন্ট, প্যারামিটার দক্ষতা এবং মূল্যের মতো বিভিন্ন মাত্রায় বিস্তৃত হয়েছে।
02. কে প্রত্যাশার বাইরে গেল, কে দ্বিমুখী মূল্যায়ন পেল?
পূর্ববর্তী প্রজন্মের তুলনায় পরিবর্তন, র্যাঙ্কিং পারফরম্যান্স এবং ডেভেলপার ফিডব্যাকের সমন্বয়ে, জুলাইয়ে প্রকাশিত মডেলগুলির স্তর প্রায় তিনটি শ্রেণিতে বিভক্ত।
অপেক্ষার বাইরের এক ধরনের দেখুন: Kimi K3, Grok 4.5, Hunyuan Hy3।
সবচেয়ে বেশি মনোযোগ দেওয়া হচ্ছে Kimi K3-এর দিকে। এই মডেলটি MoE আর্কিটেকচার ব্যবহার করে, যার মোট প্যারামিটার সাইজ ট্রিলিয়ন লেভেলে পৌঁছেছে, এবং দীর্ঘ কনটেক্সট, ফ্রন্টএন্ড প্রোগ্রামিং এবং প্রোডাক্ট ডিজাইনের ক্ষমতা শক্তিশালী করা হয়েছে। প্রকাশের দিনই, Kimi K3 1679 পয়েন্ট নিয়ে Code Arena ফ্রন্টএন্ড প্রোগ্রামিং র্যাঙ্কিংয়ে প্রথম স্থান অধিকার করে, যা আগের সংস্করণ Kimi K2.6-এর 18তম স্থানের তুলনায় 17টি স্থান উপরে। এক সপ্তাহ পর Arena-এর সমগ্র র্যাঙ্কিংয়ে, Kimi K3 প্রথমবারের মতো বিশ্বের Top 10-এ প্রবেশ করে।
কিন্তু কিমি K3-এরও স্পষ্ট ক্ষমতার সীমাবদ্ধতা রয়েছে। Artificial Analysis-এর জ্ঞানের বিশ্বস্ততা পরীক্ষায়, এর হলুসিনেশন হার কিমি K2.6-এর 39% থেকে বেড়ে 51% হয়েছে, এবং আউটপুট গতি প্রায় 33 টোকেন/সেকেন্ড, যা অনুরূপ মডেলগুলির তুলনায় অনেক কম।
ডেভেলপারদের বাস্তব ব্যবহারের অভিজ্ঞতা এই “পক্ষপাত” কে প্রমাণ করে। বেইচেং মনে করেন যে Kimi K3 আগের প্রজন্মের তুলনায় প্রকৃতপক্ষে উল্লেখযোগ্য উন্নতি দেখিয়েছে, যার সুবিধা মূলত ফ্রন্ট-এন্ড ডেভেলপমেন্ট, UI ডিজাইন এবং পণ্য প্রকাশে কেন্দ্রীভূত। উদাহরণস্বরূপ, ওয়েবসাইট UI অপ্টিমাইজ করা বা অ্যাপ ইন্টারফেস ডিজাইন করা এই ধরনের কাজগুলিতে Kimi K3 ভালো পণ্য তৈরি করতে পারে, কিন্তু জটিল ইঞ্জিনিয়ারিং টাস্কগুলির ক্ষেত্রে এর পারফরম্যান্স অস্থির।

ছবির উৎস / pexels
Grok 4.5 এও একই পরিমাণ মনোযোগ দেওয়া হচ্ছে। 9 জুলাই প্রকাশের পর, এটি Artificial Analysis স্মার্ট ইনডেক্সের শীর্ষে পৌঁছেছে এবং কিছু টুল কল টেস্টে উল্লেখযোগ্য পারফরম্যান্স দেখিয়েছে, যা অনেক ডেভেলপারকে এটিকে ভালো মূল্য-প্রতি-মূল্যের বিকল্প হিসাবে বিবেচনা করতে উৎসাহিত করেছে।
বেইচেং এই অনুভূতির সাথে একমত এবং মনে করেন যে Grok 4.5-এর সবচেয়ে বড় সুবিধা হল গতি; একই প্রয়োজনীয়তা এটি দিয়ে মাত্র তিন থেকে পাঁচ মিনিটে শেষ করা যায়, অন্যদিকে GPT-5.6 দিয়ে কখনও কখনও বিশ মিনিট বা এমনকি পৌঁছাতে পারে, এবং এর দামও কম, তাই দ্রুত ডেভেলপমেন্টের প্রয়োজনীয়তা থাকলে এটি ব্যবহার করা উপযুক্ত। যাও ইউহাংয়ের মতে, Grok 4.5-এর প্রোগ্রামিং ক্ষমতা বিশেষভাবে অপ্টিমাইজড, এবং Cursor-এর সাথে ব্যবহারের সময় সমগ্র অভিজ্ঞতা খুবই ভালো। একটি পটভূমি হল, SpaceX-এর আগে Cursor-এর মা-কোম্পানি Anysphere-কে ক্রয়ের ঘোষণা করেছিল, যা তৃতীয় ত্রৈমাসিকের মধ্যে সম্পন্নের প্রত্যাশা; xAI এবং Cursor-এর মধ্যকার ডেটা সহযোগিতা, Grok 4.5-এর প্রোগ্রামিং অভিজ্ঞতা উন্নতিতেও সহায়তা করেছে।
হাইয়ুয়ান Hy3 দক্ষতা পথের একটি বিপ্লব নিয়ে এসেছে। এই মডেলের মোট প্যারামিটার 295B এবং সক্রিয় প্যারামিটার মাত্র 21B, যা ফ্ল্যাগশিপ মডেলের পাঁচভাগের একভাগেরও কম আকারে বিভিন্ন প্রকাশিত বেঞ্চমার্কে বড় প্রতিদ্বন্দ্বী মডেলগুলির কাছাকাছি ফলাফল অর্জন করেছে। তবে SWE-Bench Pro-এ, হাইয়ুয়ান Hy3-এর 57.9 স্কোর Claude Opus-এর 4.8-এর 69.2 স্কোরের তুলনায় স্পষ্টভাবে কম, যা জটিল কোড ঠিক করার ক্ষমতা এখনও অনুসরণ করতে হবে বলে নির্দেশ করে।
যাও যুহাং মনে করেন যে, হুইয়ুয়ান Hy3 টিএসএন-এর আগের মডেলের তুলনায় উন্নতি করেছে, এবং ওপেন-সোর্স এবং ছোট আকারের ডিজাইনের সাথে মধ্যম আকারের মডেলগুলির মধ্যে এটি একটি ভালো বিকল্প।
GPT-5.6 Sol এবং Claude Opus 5 এর মতো প্রথম সারির স্থিতিশীল কিন্তু আশ্চর্যজনক কিছু নেই এমন ক্যাটাগরি আবার দেখুন।
GPT-5.6 Sol এবং Claude Opus 5 এখনও প্রথম স্তরে অবস্থান করছে, তবে কোনও বড় পরিবর্তন আনেনি। GPT-5.6 Sol জটিল যুক্তিবিদ্যা এবং এজেন্ট প্রোগ্রামিংয়ের ক্ষমতা শক্তিশালী করেছে, Terminal-Bench (কমান্ড লাইন পরিবেশে মডেলের বাস্তব কাজ সম্পাদনের ক্ষমতা পরীক্ষার জন্য বেঞ্চমার্ক) 2.1-এ 88.8% স্কোর অর্জন করেছে, যা Ultra মোডে 91.9% পর্যন্ত উন্নতি পেয়েছে। Claude Opus 5 জটিল কাজের ক্ষেত্রে তার সুবিধা বজায় রেখেছে, এবং জটিল ইঞ্জিনিয়ারিং, কোড বুঝতে পারা এবং সিকিউরিটি বিশ্লেষণের মতো সিনেরিওতে মডেলের নির্ভরযোগ্যতাকে আরও বেশি গুরুত্ব দিয়েছে। Opus 5-এর সুবিধা হলো এটি Fable 5-এর কাছাকাছি পারফরম্যান্স দেয়, যখন এর দাম শুধুমাত্র Fable 5-এর অর্ধেক।
দুটি মডেল এখনও প্রথম স্তরে রয়েছে, তবে কোনও বড় উন্নতি আনেনি।
বুচেং উল্লেখ করেন যে GPT-5.6 তার বেশিরভাগ দৈনিক ডেভেলপমেন্ট প্রয়োজনীয়তা পূরণ করতে পারে, কিন্তু বিশেষভাবে জটিল সমস্যার সম্মুখীন হলে তিনি Opus 5 ব্যবহার করেন। তবে, শক্তিশালী ক্ষমতার অর্থ হল বেশি খরচ। তার জন্য, Opus 5-এর অবস্থান হল কীলক সমস্যা সমাধানের জন্য কল করা “বিশেষজ্ঞ”।
শেষে আছে প্রতিক্রিয়ার বিভাজন এবং এখনও যাচাইয়ের অপেক্ষায় রয়েছে: Gemini 3.6 Flash এবং Qwen3.8-Max প্রিভিউ ভার্সন।
সবচেয়ে প্রতিনিধিত্বকারী হল Gemini 3.6 Flash। এটি Artificial Analysis স্মার্ট ইনডেক্স তালিকায় 50 পয়েন্ট পেয়েছে, যা পূর্বপুরুষ 3.5 Flash-এর সাথে সমান। ডেভেলপার সম্প্রদায়ের বেশিরভাগ প্রতিক্রিয়া হল যে, এই প্রজন্মটি পূর্বপুরুষের তুলনায় স্পষ্টভাবে উন্নতি করেনি এবং একই সময়ের প্রতিদ্বন্দ্বীদের চেয়েও কম দক্ষ। তবে কিছু মানুষ মনে করেন, একটি হালকা মডেল হিসাবে, Gemini 3.6 Flash-এর আউটপুট গুণমান মোটামুটি গ্রহণযোগ্য।
ক্যাপডিমের মতে, জেমিনি 3.6 ফ্ল্যাশের দৈনিক ব্যবহারের অভিজ্ঞতা ভালো, যদিও এর প্রোগ্রামিং ক্ষমতা বেশি উল্লেখযোগ্য নয়, তবে মাল্টিমোডাল বোঝার ক্ষমতা এখনও খুব ভালো। এটি যেকোনো ফরম্যাটের ফাইল ইনপুট সমর্থন করে এবং দৈনিক চ্যাটের শৈলী ও অভিজ্ঞতা অনেক প্রতিদ্বন্দ্বীর চেয়ে ভালো।
জুলাইয়ে চালু হওয়া Qwen3.8-Max প্রিভিউ ভার্সনটির মডেল পারফরম্যান্স অস্থির ছিল এবং বাজারের প্রতিক্রিয়া বিভিন্ন ছিল। বেইচেংয়ের প্রধান অনুভূতি ছিল যে Qwen3.8-Max প্রিভিউ ভার্সনটির চিন্তার গভীরতা বেশি, কিন্তু কখনও কখনও এটি দীর্ঘসময়ের যুক্তিবিদ্যায় আটকে যায়, “যেন নিজেকেই ঘুরিয়ে ফেলছে”, কিন্তু শেষপর্যন্ত কোনো কার্যকরী সমাধান দেয়নি। কাপদিমের মতে, Qwen3.8-Max প্রিভিউ ভার্সনটি প্রত্যাশার চেয়ে কম, যখন তিনি নিজের ফ্রন্টএন্ড সৌন্দর্য্যের মূল্যায়ন সেট ব্যবহার করেছিলেন, তখন বাস্তব ক্ষমতা এবং প্রচারের মধ্যে স্পষ্ট পার্থক্য দেখা গিয়েছিল। একটি এখনও সমন্বয়ধীন প্রিভিউ পণ্য হিসেবে, চূড়ান্ত পারফরম্যান্সটি অফিশিয়াল ভার্সনটির প্রকাশের পরেই যাচাইয়ের অপেক্ষায়।
জুলাই মাসে কোনো মডেলই সমস্ত মাপদণ্ডে শীর্ষে ছিল না, বিভিন্ন মডেলগুলি ধীরে ধীরে বিশেষ পরিস্থিতির জন্য বিভাজন শুরু করেছে।
উদাহরণস্বরূপ উত্তর শহরের ক্ষেত্রে, সে কাজের ভিত্তিতে টুল নির্বাচন করে: দৈনিক ডেভেলপমেন্টের জন্য GPT-5.6, দ্রুত প্রয়োজনীয়তা পূরণের জন্য Grok 4.5, পণ্য এবং ফ্রন্টএন্ড সিনারিওর জন্য Kimi K3, এবং জটিল সমস্যা সমাধানের জন্য Claude Opus 5। ক্যাপডিমের ক্ষেত্রে এটি ভিন্ন: সে পরিকল্পনার জন্য Claude-এর Fable 5 বা Opus 5 মডেল ব্যবহার করে, তারপর GPT-5.6 Sol-এর মাধ্যমে বাস্তবায়ন করে।
০৩. প্রকাশের গতি বাড়ছে, ওপেন সোর্স বনাম প্রোপ্রাইটারির বিতর্ক তীব্রতর হচ্ছে
এই ঘনঘন প্রকাশের পেছনে কয়েকটি প্রশ্ন বিশ্লেষণ করা যোগ্য: মডেল আপডেট কেন এত দ্রুত হচ্ছে, কেন এগুলো সবই জুলাইয়ে ঘটছে, এবং ওপেন-সোর্সিং কেন বর্তমান ব্যবসায়িক মডেলকে প্রভাবিত করছে।
প্রথমত, মডেল আপডেটের পদ্ধতি পরিবর্তন হচ্ছে। অতীতে, বড় মডেলের ক্ষমতা বৃদ্ধি মূলত বড় স্কেলের মডেল পুনরায় ট্রেন করার উপর নির্ভর করত, যা দীর্ঘ সময় ও উচ্চ খরচ সহকারে হত। কিন্তু শক্তিশালী শিক্ষা, পোস্ট-ট্রেনিং (মৌলিক মডেল ট্রেনিংয়ের পর, ফাইন-টিউনিং, শক্তিশালী শিক্ষা ইত্যাদির মাধ্যমে মডেলের পারফরম্যান্স আরও উন্নত করা) ইত্যাদি প্রযুক্তির পারদর্শিতা বৃদ্ধির সাথে, মডেল আপগ্রেডের জন্য এখন বেশি ভিত্তি হয়ে উঠছে ট্রেনিংয়ের পরের অপ্টিমাইজেশনে।
যাও যুহাং বলেন যে গত দুই বছরে মডেল প্রকাশের গতি স্পষ্টভাবে বেড়েছে, এর একটি প্রধান কারণ হল শিল্পটি আরও পরিপক্ক পোস্ট-ট্রেনিং পদ্ধতি অর্জন করেছে। এখন অনেক মডেলের উন্নতির জন্য একটি নতুন মডেল পুনরায় ট্রেন করার দরকার হয় না, বরং বিদ্যমান বেস মডেলের উপর আরও উন্নতি করা হয়, যা রিইনফোর্সমেন্ট লার্নিং, সেলফ-ইটারেশন ইত্যাদির মাধ্যমে ক্ষমতা বাড়ানোর জন্য।
এর অর্থ হলো, মডেলের প্রতিযোগিতার চক্র সংক্ষিপ্ত হয়ে আসছে। অতীতে, একটি অগ্রণী মডেল কয়েক মাস ধরে অগ্রাধিকার বজায় রাখতে পারত; এখন, ভার্সন আপডেটের কারণে অগ্রাধিকারের সময়কাল কেবল কয়েক সপ্তাহ হতে পারে। যদি প্রকাশের গতি অনুসরণ না করা যায়, তবে খুব দ্রুত এটি নতুন ভার্সন দ্বারা আচ্ছাদিত হয়ে যাবে। প্রস্তুতকারকদের জন্য, মডেল প্রকাশ শুধুমাত্র প্রযুক্তিগত প্রদর্শন নয়, প্রকাশের সময়ও প্রতিযোগিতার একটি অংশ হয়ে উঠেছে।

ছবির উৎস / pexels
দ্বিতীয়ত, জুলাই একাধিক নোডের সমন্বয়ের সময়। দেশীয় প্রস্তুতকারকদের জন্য, বিশ্ব কৃত্রিম বুদ্ধিমত্তা সম্মেলন (WAIC) জুলাইয়ে অনুষ্ঠিত হয়, এবং প্রস্তুতকারকরা এই সময়ের আগে-পরে মডেল প্রকাশ করে এবং প্রযুক্তিগত অগ্রগতি প্রদর্শন করে। বিদেশী প্রস্তুতকারকদের জন্য, অনেকগুলি শীর্ষস্থানীয় কোম্পানি এই পর্যায়ে মডেল আপডেট করতে বেছে নিয়েছে, যাতে ডেভেলপার ইকোসিস্টেম এবং বাণিজ্যিক প্রতিযোগিতায় আগের অবস্থান অর্জন করা যায়।
আরও একটি বিষয়, শিল্পের প্রতিযোগিতামূলক নিয়ম পরিবর্তন হচ্ছে। মডেলের ক্ষমতা যথেষ্ট শক্তিশালী হওয়া এখন একমাত্র লক্ষ্য নয়; প্রতিযোগিতা এখন মডেল কীভাবে ব্যবহার করা হচ্ছে এবং কীভাবে আয়ে রূপান্তরিত হচ্ছে তার দিকেও বিস্তৃত হয়েছে।
এটাই কারণ যে, জুলাইয়ে ওপেন সোর্স এবং প্রোপ্রাইটারি মডেলের মধ্যে বিতর্ক আবার তীব্র হয়ে উঠেছে। দীর্ঘদিন ধরে, ওপেন সোর্স মডেল এবং প্রোপ্রাইটারি মডেলের মধ্যে ক্ষমতার ব্যবধান ছিল। কিন্তু কিছু ওপেন সোর্স মডেল প্রথম সারির মধ্যে প্রবেশ করার পর, একটি আরও বাস্তবসম্মত প্রশ্ন উঠেছে: যখন উচ্চ-পারফরম্যান্স মডেলগুলি বিনামূল্যে পাওয়া যাবে, তখন মডেল কোম্পানিগুলির API কল এবং সাবস্ক্রিপশন আয় কি বিভক্ত হয়ে যাবে?
ওপেন সোর্স পক্ষেরা মনে করেন যে, ওপেন ওয়েটস প্রযুক্তিগত বাধা কমিয়ে আরও বেশি কোম্পানি এবং ডেভেলপারদের এআই উদ্ভাবনে অংশগ্রহণের সুযোগ করে দেয়। ওপেন সোর্স মানে হলো প্রযুক্তি প্রদানকারীদের সক্রিয়ভাবে কিছু সুবিধা ত্যাগ করা, যা প্রজেক্টের ইকোসিস্টেমকে উন্নতি করে; অন্যদিকে, ক্লোজড সোর্স পক্ষগুলি তাদের ব্যবহারকারীদের ওপেন সোর্স মডেলগুলির দ্বারা বিভক্ত হওয়ার বিষয়ে উদ্বিগ্ন। Anthropic-এর মতো কোম্পানিগুলি মনে করেন যে, মডেলের ক্ষমতা বৃদ্ধির সাথে সাথে, ওপেন ওয়েটস নিরাপত্তা ঝুঁকিরও সৃষ্টি করতে পারে, যা আরও কঠোর গভর্ন্যান্সের প্রয়োজন।
এই বিতর্কের পিছনে আসলে বিভিন্ন কোম্পানির স্বার্থের দাবি লুকিয়ে আছে। ইনফ্রাস্ট্রাকচার কোম্পানি যেমন নভিডিয়ার জন্য, মডেলের ওপেন সোর্স হওয়া অর্থ বেশি ডিপ্লয়মেন্টের চাহিদা এবং বড় ক্যালকুলেশন মার্কেট। অপেনএআই, অ্যানথ্রোপিকের মতো মডেল কোম্পানির জন্য, ক্লোজড-সোর্স মডেল API কল এবং সাবস্ক্রিপশন আয় বজায় রাখতে পারে। তবে অন্যদিকেও দেখা যায়: ওপেন-সোর্সিং ডিপ্লয়মেন্টের চাহিদা বাড়ায়, কিন্তু প্যারামিটার দক্ষতা বৃদ্ধির সাথে সাথে, একক টাস্কের ক্যালকুলেশন খরচও কমতে পারে, তাই ক্যালকুলেশন মার্কেটের বৃদ্ধি মডেলের ওপেননেসের সাথে সমানুপাতিকভাবে হতেই হবে এমনটা নয়। দেশীয় ফ্যাব্রিক্যান্টদের জন্য,ওজনগুলির ওপেনসোর্সিং শুধুমাত্র একটি প্রযুক্তিগত পথচলার বিষয়ই নয়,এটি ডেভেলপারদের ইকোসিস্টেম,ক্লাউডসারভিস,এবংপরবর্তীবণিজ্যকরণেরপ্রবেশদ্বারঅর্জনকরারওএকটিবিষয়।
জুলাইয়ের পরেও বড় মডেলের প্রতিযোগিতা চলতে থাকবে। ডেভেলপার সম্প্রদায় সাধারণত প্রত্যাশা করছে যে ডিপসিক V4 রিলিজ, ফেবল 5.1, GPT-6 ইত্যাদি নতুন মডেলগুলি আগস্টে ধাপে ধাপে প্রকাশিত হবে।
মডেলের ক্ষমতার ব্যবধান কমে আসছে, এখন শুধু একটি শক্তিশালী মডেল প্রকাশ করে দীর্ঘমেয়াদী সুবিধা তৈরি করা ক্রমশ কঠিন হয়ে পড়ছে। পরবর্তীতে নিম্নলিখিত কয়েকটি নির্দিষ্ট সূচক পর্যবেক্ষণযোগ্য: DeepSeek V4-এর অফিসিয়াল ভার্সন ওপেন-সোর্স মডেলের ক্ষমতার সীমানা কতটা বাড়াবে, API-এর দাম আরও কমবে কিনা, এজেন্টগুলির জন্য স্থিতিশীল পেমেন্ট-ভিত্তিক স্কেনারিও কি দেখা যাবে, এবং ওপেন-সোর্স মডেলগুলি কি আরও বেশি কর্পোরেটদের প্রাইভেট ডিপ্লয়মেন্টে প্রবেশ করবে। এই প্রশ্নগুলির উত্তরগুলি, সূচির র্যাঙ্কিংয়ের চেয়ে এই লড়াইয়ের মধ্যে আসলেই কী পরিবর্তন হয়েছে, তা আরওভালভাবে বোঝাবে।
*চিত্রটি Pexels থেকে প্রাপ্ত।
