ক্লড 5.1 এখনই চালু হয়েছে, অন্যদিকে ওপেনএআই আস্ট্রা ঠিক তখনই এসে পৌঁছাচ্ছে।
এখন, গুগলও নতুন পদক্ষেপ নিয়েছে। সর্বশেষ অপ্রকাশিত তথ্য অনুযায়ী, জেমিনি 3.8 ফ্ল্যাশ আগামীকাল চালু হবে।


প্রতীয়মান, এআই সম্প্রদায়ে আবার বছরের শেষ হয়ে যাচ্ছে।
জেমিনি 3.5 প্রো বাতিল, পরবর্তী বড় সংস্করণ 4.0
জেমিনি ৩.৮ ফ্ল্যাশ প্রকাশের তুলনায় অনেকে আরও বেশি কৌতূহলী: জেমিনি ৩.৫ প্রো কবে আসবে?!
দুঃখিত, অপেক্ষা করবেন না, গুগল ত্যাগ করে দিয়েছে...

আই/ও কনফারেন্সের ঘোষণা থেকে এখন প্রায় 4 মাস পার হয়ে গেছে, এবং জেমিনি 3.5 প্রো-এর উন্নতি ফ্ল্যাশের চেয়েও কম।
গুগলও অন্য পথ ছাড়া চলেনি, সরাসরি "ছেড়ে দিয়েছে"।
ভালো বিষয় হলো, Gemini 4.0 প্রি-ট্রেনিংয়ে উত্তম মূল্যায়ন পেয়েছে এবং পোস্ট-ট্রেনিংও সুচারুভাবে চলছে।


WSJ-এর এই এক্সক্লুসিভ রিপোর্টটি জেমিনি 3.8 Flash (কোডনাম 'Skimaki')-এর শক্তিশালী প্রোগ্রামিং ক্ষমতার প্রচারও করে।
গুগলের অভ্যন্তরীণ কোডিং টুল জেটস্কির তুলনামূলক পরীক্ষায়, 3.8 Flash সরাসরি ওপাস মডেলকে পিছনে ফেলেছে।
এছাড়াও, এই মডেলটি কয়েক মাস ধরে বিকাশ করা হয়েছে, গুগলের নেতৃত্বের "ভূমিকম্প" এর আগেই শুরু হয়েছিল।
হাসাবিস পদত্যাগ করলেন, চিফ সায়েন্টিস্ট জেফ ডিন চলে গেলেন, যার ফলে অনেকেই জেমিনির ভবিষ্যতের ব্যাপারে উদ্বিগ্ন।

তবে, বর্তমানে দেখা যাচ্ছে যে সবকিছু অভ্যন্তরীণভাবে সুসংগঠিতভাবে চলছে।
বর্তমানে, গুগল প্রথমে জেমিনি 3.8 ফ্ল্যাশ চালু করার পরিকল্পনা করছে, কারণ এই মডেলটির প্যারামিটার কম, কম গণনার প্রয়োজন হয় এবং ফলাফল পাওয়া সহজ।
অভ্যন্তরীণ সূত্রের কথা অনুযায়ী, এই বছরের শুরু থেকে গুগল জেমিনির কোডিং দক্ষতা উন্নত করার জন্য আরও বেশি মানব সম্পদ এবং কম্পিউটিং পাওয়ার বিনিয়োগ করেছে।
বিশেষ করে, "রিইনফোর্সমেন্ট লার্নিং"-এর প্রতি বেশি মনোযোগ দেওয়া হয়েছে, যাতে AI নিয়মিত পরীক্ষা-ভুলের মাধ্যমে নতুন দক্ষতা শিখতে পারে।
এবং গুগল ডিপমাইন্ড এবং অন্যান্য ল্যাবগুলি একসাথে একাধিক প্রকল্প চালিয়ে যায়, যার ফলে একটি ব্যর্থ হলেও অন্যটি প্রতিস্থাপন করতে পারে।
জেমিনি ৩.৫ প্রো প্রত্যাশিত হয়নি, কিন্তু জেমিনি ৪.০ এখনও প্রকাশিত হয়নি।
এখন, সিলিকন ভ্যালির দুটি প্রধান প্রতিষ্ঠান OpenAI এবং Anthropic এগিয়ে যাচ্ছে এগিয়ে যাচ্ছে অগ্রণী মডেল এবং প্রোগ্রামিং এজেন্টে।
তথ্য অনুসারে, ওপেনএআইয়ের পরবর্তী প্রজন্মের আস্ট্রা একটি «রিকারেন্ট ডেপ্থ» (recurrent depth) নতুন যুক্তি পদ্ধতি ব্যবহার করে, যা চিন্তার টোকেন কমিয়ে একসাথে পারফরম্যান্স উল্লেখযোগ্যভাবে বাড়ায়।
এই মাস্টার কার্ডটি এই সপ্তাহে প্রকাশিত হবে।

এখনই, গুগলকে কিছু প্রদান করতে হবে।
বিশেষ করে প্রতিশ্রুতি দেওয়ার কয়েক মাস পরে, তিনি শুধুমাত্র 3.7 Flash প্রকাশ করেছেন, এবং AI সম্প্রদায়কে উত্তেজিত করার মতো কোনো মডেল আর প্রকাশ করেননি।
হয়তো আজ রাতেই Gemini 3.8 Flash চালু হবে।

জেমিনি প্রথমবারের মতো ভিডিও দেখতে শিখেছে
গুগল আজ জেমিনির জন্য একটি নতুন ক্ষমতা যোগ করে এর আগে প্রচার শুরু করেছে—
এজেন্টিক ভিডিও বুঝতে পারা
এই ফিচারটি সত্যিই বড় পয়েন্ট দেয়।
I/O কনফারেন্সের একটি ভিডিও আপলোড করুন, একই মডেল Gemini 3.7 Flash-এর জন্য টোকেন খরচ সরাসরি 88% কমে গেল।

গুগলের অফিসিয়াল ব্লগে বলা হয়েছে, Gemini 3.7 Flash, 3.6 Flash এবং 3.5 Flash-Lite তিনটি মডেলই agentic ভিডিও বুঝার ক্ষমতা ব্যবহার করতে পারবে, যা Google AI Studio এবং Gemini Enterprise Agent Platform-এ উপলব্ধ।
স্ট্যান্ডার্ড ভিডিও বেঞ্চমার্কে এই সুইচটি চালু করুন, টোকেন ব্যবহার সর্বোচ্চ ৮৮% কমে যায়, বিশ্লেষণ খরচ সর্বোচ্চ ৬৬% কমে যায়, এবং সঠিকতা সর্বোচ্চ ৭% বাড়ে।

এবং কোনও অতিরিক্ত ফি নেওয়া হয়নি, এখনও স্ট্যান্ডার্ড API-এর টোকেন মূল্যনির্ধারণ অনুসরণ করা হচ্ছে। টাকা বাঁচানো এবং সঠিক হওয়া সাধারণত লড়াই করে। এবার লড়াই হয়নি।

কারণ, জেমিনি শিখেছে "প্রোগ্রেস বার ড্র্যাগ করা"।
পূর্বের প্রক্রিয়াকরণ পদ্ধতিকে "স্থির" প্রক্রিয়াকরণ বলা হত, যেখানে মডেলটি নির্দিষ্ট ফ্রেম রেটের চিত্র প্রবাহ পায়, যা API প্যারামিটার দ্বারা নির্ধারিত হয়, এবং মডেলের কোনো কথা বলার অধিকার থাকে না।
এখন মডেলটি নিজেই সিদ্ধান্ত নেয় যে কোন অংশটি দেখবে, কত দ্রুত দেখবে, চিত্র দেখবে, অডিও শুনবে নাকি প্রতিলিপির লেখাটি সরাসরি পড়বে।

এটি গুগলের প্রথম বার এমন করা নয়।
আগের এজেন্টিক ভিশন কোড এক্সিকিউশন এবং জেমিনির ন্যাটিভ ইমেজ বুঝতে পারা কে একসাথে জুড়ে দিয়েছিল, যাতে মডেলটি একটি ছবির উপর দিয়ে নিজেই কোড লিখে বড় করতে, কাটতে এবং তুলনা করতে পারে।
এবার ভিডিওর পালা, ধারণা একই রাখা হয়েছে, শুধু টুলটি নেটিভ ভিডিও টুলে পরিবর্তন করা হয়েছে।
চারটি আগে খুব কঠিন কাজ
অফিসিয়াল ব্লগে কয়েকটি উচ্চ কঠিন অ্যাপ্লিকেশন স্কেনারিওও তালিকাভুক্ত করা হয়েছে।
অল্প সেকেন্ডের ভিডিও ফ্রেম খুঁজে বার করা। আগের মডেলগুলি ভিডিও দেখতেন, প্রতি সেকেন্ডে শুধু একটি ছবি ক্যাপচার করত। সমস্যা হলো, অনেক জিনিস এক সেকেন্ডেরও কম সময়েই দৃশ্যমান হয়ে যায়।
এখন এই মুহূর্তগুলি এক সেকেন্ডের কম সময়ে সঠিকভাবে চিহ্নিত করা যাচ্ছে।
এর অর্থ হল যে এখন প্রথমবারের মতো "অটো-কাট" বাস্তবসম্মত হয়ে উঠেছে: আগে সম্পাদকদের নিজেদের টাইমলাইনের উপর ঝুঁকে পড়ে প্রতিটি ফ্রেম পরীক্ষা করে কোথায় কাটতে হবে তা খুঁজে বার করতে হত, এখন প্রথমে মডেলটি সমস্ত সম্ভাব্য কাটিং পয়েন্টগুলি চিহ্নিত করতে পারে, তারপর মানুষ বাছাই করতে পারে।

দীর্ঘ ভিডিওতে সূঁচ খুঁজছেন। কয়েক ঘন্টার ম্যাটেরিয়ালে একটি জটিল প্রশ্ন জিজ্ঞাসা করুন, কিন্তু লক্ষ লক্ষ টোকেন ব্যয় করার দরকার নেই।
অসাধারণ শনাক্তকরণ। একটি নির্দিষ্ট সময় উইন্ডোকে মডেল টার্গেট করার পরে, এই সময়কালের জন্য ফ্রেম রেট বাড়িয়ে পুনরায় নমুনা নেওয়া যেতে পারে, যাতে দ্রুত গতি এবং সূক্ষ্ম চিত্র ত্রুটি পরিষ্কারভাবে দেখা যায়। উৎপাদন লাইন কোয়ালিটি চেক এবং নিরাপত্তা নিরীক্ষণের জন্য এটি সবচেয়ে গুরুত্বপূর্ণ, কারণ অসাধারণতা শুধুমাত্র কয়েক সেকেন্ডের মধ্যেই ঘটে।
গণনা করুন। কতবার একটি ক্রিয়া পুনরাবৃত্ত হয়েছে, চিত্রে কয়টি ভিন্ন বস্তু আছে—এই ধরনের প্রশ্নগুলির জন্য মডেলগুলি আগে স্থিতিশীলভাবে ভুল করত, কারণ এটি খুবই সহজ: অবহেলিত কয়েকটি ফ্রেমে ঠিক কিছু ছিল।

এজেন্ট চূড়ান্তভাবে ভিডিওটি দেখল
ভিডিও সবচেয়ে ব্যয়বহুল মোডালিটি হয়ে আসছে।
টেক্সট সস্তা, ছবি ঠিক আছে, কিন্তু ভিডিও বড় এবং দীর্ঘ, এক মিনিটেই একটি বইয়ের টোকেন শেষ হয়ে যায়।
সুতরাং গত দুই বছর ধরে সবাই এজেন্ট নিয়ে আলোচনা করেছে, বেশিরভাগই এটি পড়তে, লিখতে এবং টুল ব্যবহার করতে পারে তা নিয়ে।
সমস্যা হলো, একটি মূলত পাঠ্যের মাধ্যমে বিশ্বকে বুঝে থাকা এজেন্ট যা দেখছে তা হলো কারও দ্বারা 'পুনরায় বর্ণনা' করা বিশ্ব।
যে সব জিনিস ক্যামেরায় ধরা পড়েছে, মিটিংয়ে রেকর্ড করা হয়েছে, বা প্রোডাকশন লাইনে দৌড়ে গেছে—যেগুলোর জন্য কেউ সময় ব্যয় করতে চায় না যেগুলোকে টেক্সটে রূপান্তর করা হোক—এটি সেগুলো জানে না।
এখন, এই খরচ বক্ররেখার একটি বড় অংশ কেটে ফেলা হয়েছে।
একটি এজেন্ট যদি কয়েক ঘন্টার সুপারভিশন, দশকগুলির কোর্স এবং শতাধিক মেটারিয়াল নিজেই অনুবাদ করতে পারে এবং বাজেট ব্যয় করে ফেলে না, তাহলে এটি বিশ্বের সাথে যোগাযোগের পদ্ধতি পরিবর্তিত হয়ে যায়।
এটাকে আর কারও দ্বারা চিত্রকে শব্দে রূপান্তরিত করে খাওয়ানোর প্রয়োজন নেই, এবং "দেখতে পাওয়া" এবং "সঠিকভাবে দেখা" এর মধ্যে একটি বাছাইয়েরও প্রয়োজন নেই।
গুগল এই বিপ্লবকারী হিসেবে প্রথমে এগিয়ে এসেছিল।
এআই যুদ্ধ, পরবর্তী রাউন্ড
এই কয়দিনে, চারটির প্রকাশের রিদম প্রায় একসাথে মিলে গেছে।
ক্লড 5.1 এখনই এসেছে, ওপেনএআই অ্যাস্ট্রা ইতিমধ্যে দরজায়, গুগল কয়েক মাস ধরে চাপ ধরে রেখে চূড়ান্তভাবে জেমিনি 3.8 ফ্ল্যাশ নিয়ে আসল।
এই আপডেটের পরে, বর্তমানে ক্লাউড দুটি ক্ষেত্রে ফোকাস করছে: প্রোগ্রামিং এবং গবেষণা।
পরবর্তী প্রজন্মের অ্যাস্ট্রা একটি "নিয়মিত এজেন্ট" হয়ে উঠবে, অল্টিম্যানের কথায়, এর কম্পিউটার ব্যবহারের দক্ষতা মানুষের সমতলে পৌঁছেছে।

জেমিনি 3.8 ফ্ল্যাশ প্রোগ্রামিংয়েও বড় একটি প্রগতি দেখাবে।
এখন, OpenAI, Anthropic, গুগল এবং SpaceXAI সবাই একসাথে পুরো শক্তিতে কাজ করছে।

মাস্ক ঘোষণা করেছেন যে গ্রক 4.7 দশ দিনের মধ্যে প্রকাশিত হবে
এই যুদ্ধটি এখনও সবচেয়ে নিষ্ঠুর পর্যায়ে প্রবেশ করেছে।
প্রসঙ্গ:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
এই লেখাটি ওয়েইচ্যাট গ্রুপ "নিউ জিয়ুয়ান" থেকে এসেছে, লেখক: ASI প্রতিজ্ঞা
