গুগল জেমিনি 3.8 ফ্ল্যাশ চালু করেছে, ফ্ল্যাগশিপ মডেলগুলির সাথে পারফরম্যান্সের ফারাক বন্ধ করেছে

iconMetaEra
শেয়ার
AI summary iconসারাংশ
২০২৬ সালের ২ সেপ্টেম্বর, সর্বশেষ অন-চেইন খবরের অংশ হিসেবে গুগল জেমিনি ৩.৮ ফ্ল্যাশ এবং এর সাইবার সিকিউরিটি ভার্সন, জেমিনি ৩.৮ ফ্ল্যাশ সাইবার প্রকাশ করে। স্ট্যান্ডার্ড মডেলটি ১ মিলিয়ন টোকেন সমর্থন করে এবং DeepSWE v1.1-এ ৭৩.৭% স্কোর করে, যা Claude Opus 5-এর প্রায় সমান। সাইবার ভার্সনটি স্বয়ংক্রিয়ভাবে ভালনারেবিলিটি শনাক্ত করে এবং প্যাচ করে, ২০টি ভাষায় ৭০%এরও বেশি সফলতা অর্জন করে। উভয় মডেলই এখন Gemini API এবং Google AI Studio-এর মাধ্যমে উপলব্ধ, যার ফলে নতুন টোকেন লিস্টিংয়ের সম্ভাবনা রয়েছে।
গুগল ২০২৬ সালের ২ সেপ্টেম্বর জেমিনি ৩.৮ ফ্ল্যাশ এবং বিশ্বস্ত নেটওয়ার্ক ডিফেন্স সংস্থাগুলির জন্য জেমিনি ৩.৮ ফ্ল্যাশ সাইবার প্রকাশ করেছে। সাধারণ সংস্করণটি ১ মিলিয়ন টোকেনের কনটেক্সট সহ আসে, যা প্রোগ্রামিং, এজেন্ট এবং বিশেষজ্ঞ কাজগুলিতে কেন্দ্রীয় মনোযোগ দেয়; গুগলের প্রকাশিত পরীক্ষায়, এর দীর্ঘমেয়াদি সফটওয়্যার ইঞ্জিনিয়ারিংয়ের স্কোর ৭৩.৭% ছিল, যা Claude Opus 5-এর ৭৪.০% এর কাছাকাছি, যখন ফাইন্যানশিয়াল এজেন্ট, লিগ্যাল এজেন্ট এবং কিছু সমন্বিত যুক্তির পারফরম্যান্স পরীক্ষিত মডেলগুলির চেয়ে উন্নত। সাইবার সংস্করণটি স্বয়ংক্রিয়ভাবে ভাঙন খুঁজে বের করতে এবং প্যাচ তৈরি করতে পারে: ২০টিরও বেশি প্রোগ্রামিং ভাষায় গুগলের内部 পরীক্ষায় সফলতারহার ৭০%এরওবেশি,এবংChromeটিমপ্রাপ্তসঠিকপ্যাচেরসংখ্যাবড়বড়বাণিজ্যিকমডেলগুলির2.6গুণ।বর্তমানAPIঅফারমূল্যহলপ্রতিমিলিয়নইনপুটটোকেন0.75ডলারএবংআউটপুটটোকেন3.75ডলার,কিন্তুমডেলটিপারফরম্যান্সেরজন্যআরওবেশিরিজনিংধাপএবংটুলকলকরে,স্বতন্ত্রমূল্যায়নগুলিদেখিয়েছেযেএকটিকাজেরখরচ3.7ফ্ল্যাশএরচেয়েপ্রায়40%বেশি।এইপ্রকাশেরমূলসংকেতহল,অতীতেযা-কেবলমহঙ্গা旗舰মডেলগুলিরঅধিকারছিলতা-এজেন্টক্ষমতা,এখনকমদাম,স্কেলযোগ্য“কাজমডেল”গুলিতেপ্রবেশকরছে,কিন্তুক্ষমতারডেটা-এখনওপ্রধানতগুগলএবংঅংশীদারদেরপরীক্ষা-ভিত্তিক,এবংসাইবারসংস্করণসাধারণব্যবহারকারীদেরজন্যউনলককরাহয়নি।

লেখক, উৎস: DeepMind

ছয় সপ্তাহে তিনবার আপডেট করে, গুগল Flash-কে মূল মডেল হিসেবে পরিণত করেছে

জেমিনি 3.8 ফ্ল্যাশ, 3.7 ফ্ল্যাশ প্রকাশের মাত্র তিন সপ্তাহ পরে এবং গুগল দ্বারা ছয় সপ্তাহের মধ্যে প্রকাশিত তৃতীয় ফ্ল্যাশ ভার্সন।

অতীতে, "Flash" বলতে সাধারণত দ্রুত গতি এবং কম খরচ বোঝায়, কিন্তু এর ক্ষমতা স্পষ্টভাবে ফ্ল্যাগশিপ মডেলের চেয়ে কম ছিল। Gemini 3.8-এর অবস্থান পরিবর্তন হচ্ছে: Google এখনও এটিকে বড় স্কেলে ডিপ্লয়ের জন্য একটি "ওয়ার্কহorse" মডেল হিসাবে উল্লেখ করছে, কিন্তু দীর্ঘমেয়াদি প্রোগ্রামিং, ধারাবাহিক টুল কল এবং পেশাদার বিশ্লেষণকে প্রধান ক্ষমতা হিসাবে গণনা করছে, শুধুমাত্র চ্যাট, সারাংশ ইত্যাদি হালকা কাজগুলির জন্য সীমাবদ্ধ নয়।

নতুন মডেলটি টেক্সট, ইমেজ, অডিও, ভিডিও এবং PDF ইনপুট সমর্থন করে, যার 100 লক্ষ Token কনটেক্সট এবং 64,000 Token সর্বোচ্চ আউটপুট রয়েছে, এবং সার্চ, ফাংশন এবং কম্পিউটার অপারেশন টুলগুলি কল করা যায়। এটি এখন পরীক্ষামূলক প্রিভিউর বদলে প্রাতিষ্ঠানিকভাবে উন্মুক্ত, যা Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, Gemini অ্যাপ, সার্চ AI Mode এবং Google Sheets-এর মাধ্যমে ব্যবহার করা যায়।

গুগলের হোস্টেড এজেন্ট অ্যান্টিগ্র্যাভিটি এখন ডিফল্টভাবে 3.8 Flash ব্যবহার করছে। এটি নির্দেশ করে যে এই মডেলটি একবারের প্রশ্ন-উত্তরের পরিবর্তে পুনঃপুনঃ পরিকল্পনা, টুল কল, ফলাফল চেক এবং ধারাবাহিকভাবে সংশোধনের প্রয়োজনীয়তা সম্পন্ন এজেন্টকেই লক্ষ্য করছে।

Programming performance is now approaching that of expensive flagship models.

গুগল দ্বারা প্রকাশিত DeepSWE v1.1 দীর্ঘ সময়কালের সফটওয়্যার ইঞ্জিনিয়ারিং পরীক্ষায়, Gemini 3.8 Flash 73.7% স্কোর অর্জন করে, যা 3.7 Flash-এর 65.3% এবং GPT‑5.6 Sol-এর 72.7% এর চেয়ে বেশি, এবং Claude Opus 5-এর 74.0% এর সাথে 0.3 পার্সেন্টপয়েন্ট পার্থক্য রয়েছে।

এই ধরনের পরীক্ষায় মডেলকে বাস্তব কোডবেসে প্রবেশ করতে হয়, বিভিন্ন ফাইলের মধ্যে সম্পর্ক বুঝতে হয়, সমস্যা শনাক্ত করতে হয় এবং পরীক্ষা পাস করার জন্য পরিবর্তন করতে হয়। এটি একটি স্বতন্ত্র ফাংশন তৈরি করার চেয়ে বাস্তব প্রোগ্রামিং এজেন্টের কাজের সাথে বেশি মিলে যায়।

Vals Finance Agent v2-এ, 3.8 Flash পেয়েছে 61.4%, পরীক্ষিত 3.7 Flash, Claude Opus 5 এবং GPT‑5.6 Sol যথাক্রমে 59.0%, 58.6% এবং 53.8% পেয়েছে।

হারভে আইনি এজেন্ট পরীক্ষায়, 3.8 Flash-এর 10.0% স্কোর 3.7 Flash-এর 8.8%, Claude Opus 5-এর 6.7% এবং GPT‑5.6 Sol-এর 2.5% এর চেয়ে বেশি। তবে, এই পরীক্ষায় সমস্ত মডেলের পরম স্কোর খুব কম, “প্রথম স্থান” মানে এটি জটিল আইনি কাজগুলি নির্ভরযোগ্যভাবে পরিচালনা করতে পারে এমন নয়।

HLE-Verified বহুবিষয়ক যুক্তিসঙ্গত পরীক্ষায়, 3.8 Flash 54.9% স্কোর করেছে, যখন GPT‑5.6 Sol এবং Claude Opus 5 যথাক্রমে 54.5% এবং 54.4% স্কোর করেছে; তিনটির মধ্যে পার্থক্য খুবই কম, যা কোনো একটি মডেলের স্থিতিশীল সামগ্রিক অগ্রাধিকারের প্রমাণ হিসেবে ব্যবহার করা যায় না।

এই ফলাফলগুলি মূলত গুগল তাদের নিজস্ব কনফিগারেশন অনুযায়ী প্রকাশ করেছে। মডেল, এজেন্ট ফ্রেমওয়ার্ক, যুক্তিসঙ্গত শক্তি, টুল অ্যাক্সেস এবং পরীক্ষার বাজেট সবই চূড়ান্ত স্কোরকে প্রভাবিত করে, তাই আরও যৌক্তিক উপসংহারটি হল: Flash-স্তরের মডেলগুলি কিছু মহান মডেলের কাছাকাছি চলে এসেছে, Gemini সমস্ত টাস্কে সম্পূর্ণরূপে এগিয়ে নয়।

“আরও কঠিনভাবে কাজ করা” মানে আরও বুদ্ধিমানের মতো, এবং সম্ভবত আরও ব্যয়বহুল

গুগল 3.8 ফ্ল্যাশ ক্ষমতা বৃদ্ধিকে একটি সরাসরি ডিজাইন বিকল্প হিসাবে ব্যাখ্যা করেছে: মডেলকে "আরও বেশি পরিশ্রম করতে" বাধ্য করা।

জটিল কাজের সময়, এটি বেশি মধ্যবর্তী যুক্তি পদক্ষেপ গ্রহণ করে, টুলগুলি পুনরাবৃত্তি করে এবং সম্পন্ন কাজগুলি সক্রিয়ভাবে পরীক্ষা করে। ডেভেলপাররা নিম্ন, মধ্যম এবং উচ্চ তিনটি চিন্তার স্তর বেছে নিতে পারেন, যার মধ্যমটি ডিফল্ট; উচ্চ স্তরটি কঠিন প্রোগ্রামিং এবং একাধিক পদক্ষেপের যুক্তির জন্য উপযুক্ত, যখন নিম্ন স্তরটি বাস্তব-সময়ের চ্যাট, খসড়া তৈরি এবং দেরি-সংবেদনশীল কাজের জন্য উপযুক্ত।

এটি এজেন্টের আগে থেকেই বন্ধ হয়ে যাওয়া, ধাপগুলি উপেক্ষা করা বা একটি টুল কল ব্যর্থ হওয়ার পরে লক্ষ্য থেকে সম্পূর্ণরূপে বিচ্যুত হওয়ার সম্ভাবনা কমিয়ে দেয়, তবে এটি আরও বেশি টোকেন খরচ করে।

Artificial Analysis-এর স্বতন্ত্র পরীক্ষায়, 3.8 Flash উচ্চ চিন্তার স্তরে 59 পয়েন্টের বুদ্ধিমত্তা স্কোর অর্জন করেছে, যা 3.7 Flash-এর তুলনায় 3 পয়েন্ট বেশি এবং GPT‑5.6 Sol-এর সর্বোচ্চ যুক্তিসঙ্গত কনফিগারেশনের সমান পর্যায়ে। এর গড় আউটপুট গতি প্রায় 300 টোকেন/সেকেন্ড, এবং একটি একক পরীক্ষা সম্পন্ন করতে গড়ে 2.5 মিনিট সময় লাগে।

কিন্তু 3.8 Flash-এ গড় আউটপুট টোকেন প্রায় 30% বেড়েছে, এবং এজেন্ট মূল্যায়নে কার্যক্রমের সংখ্যাও বেশি। যদিও প্রতি টোকেনের দাম বৃদ্ধি পায়নি, তবে গড় একক কাজের খরচ প্রায় 0.58 ডলার, যা 3.7 Flash-এর 0.40 ডলারের চেয়ে প্রায় 40% বেশি।

অতএব, “কম মূল্য” মানে এটি নয় যে প্রতিটি কাজ অবশ্যই কম খরচে হবে। যদি কাজটির জন্য জটিল যুক্তির প্রয়োজন না হয়, তবে 3.8 Flash-কে উচ্চ ঘনত্বে চালানো মাত্র সময় এবং খরচ বাড়াবে। Google-ও কার্যপ্রবাহের দক্ষতা বাড়ানোর জন্য চিন্তার স্তর কমিয়ে দেওয়ার পরামর্শ দেয়, অথবা এখনও সমর্থিত 3.7 Flash-এর ব্যবহার চালিয়ে যাওয়ার পরামর্শ দেয়।

বর্তমান সস্তা মূল্য শুধুমাত্র সীমিত সময়ের জন্য অফার

২০২৬ সালের ৩১ ডিসেম্বর পর্যন্ত, Gemini 3.8 Flash-এর প্রচারমূল্য প্রতি মিলিয়ন ইনপুট টোকেনের জন্য ০.৭৫ ডলার এবং প্রতি মিলিয়ন আউটপুট টোকেনের জন্য ৩.৭৫ ডলার, যা 3.7 Flash-এর বর্তমান মূল্যের সমান।

২০২৭ সালের ১ জানুয়ারি থেকে, মানক মূল্য প্রতি মিলিয়ন ইনপুট টোকেনের জন্য ১.৫০ ডলার এবং আউটপুট টোকেনের জন্য ৭.৫০ ডলারে পরিবর্তিত হবে, যা ঠিক দ্বিগুণ। ডেভেলপারদের দীর্ঘমেয়াদি খরচ মূল্যায়নের সময় প্রকাশের সময়কালের মূল্যকে স্থায়ী মূল্য হিসাবে বিবেচনা করা উচিত নয়।

ভবিষ্যতের মানদণ্ড অনুযায়ী দাম হিসাব করলেও, এটি কিছু ফ্ল্যাগশিপ মডেলের চেয়ে কম; তবে লক্ষ লক্ষ টোকেন জেনারেট করতে এবং দশটিরও বেশি টুল কল চালানোর প্রয়োজন হওয়া এজেন্টের জন্য, প্রতি মিলিয়ন টোকেনের দামের তালিকা নয়, বরং সম্পূর্ণ কাজের খরচ তুলনা করা উচিত।

সাইবার সংস্করণের লক্ষ্য হল ভাঙ্গন ব্যাখ্যা করা নয়, বরং সরাসরি প্যাচ প্রদান করা

গুগল একসাথে জেমিনি 3.8 ফ্ল্যাশ সাইবার প্রকাশ করেছে। এটি সাধারণ সংস্করণের সাথে মৌলিক ক্ষমতা শেয়ার করে, তবে এটি আরও কেন্দ্রীয় সাইবার নিরাপত্তা প্রশিক্ষণ লাভ করেছে এবং সাধারণ মডেল যা অস্বীকার করতে পারে, তা সম্পন্ন করার জন্য এটি অপেক্ষাকৃত ঢিলেঢালা সাইবার নিরাপত্তা সীমাবদ্ধতা ব্যবহার করে।

সাইবারজিম ভাল্ট আবিষ্কার বেঞ্চমার্কে, গুগল দাবি করেছে যে এটি অগ্রণী স্তরে পৌঁছেছে। যেহেতু সাইবারজিম মূলত C এবং C++ প্রকল্পগুলিতে কেন্দ্রীভূত, কোম্পানিটি 20টি প্রোগ্রামিং ভাষা কভার করে এমন একটি অভ্যন্তরীণ পরীক্ষা ডিজাইন করেছে, যা জটিল বাস্তব কোডবেস অন্তর্ভুক্ত করে, 3.8 Flash Cyber-এর ভাল্ট আবিষ্কারের সফলতার হার 70% এর বেশি।

ভাজা খোঁজা শুধু প্রথম ধাপ। গুগল বিশেষভাবে জোর দিয়েছে যে সাইবার ভার্সনের প্রশিক্ষণের লক্ষ্য হল সমস্যা ঠিক করা, আক্রমণের জন্য এক্সপ্লয়িট তৈরি করা নয়।

Collinear দ্বারা পরিচালিত CWE-Bench প্যাচ টেস্টে, 3.8 Flash Cyber-এর প্রথম সাবমিশনের পাস রেট 47.2% এবং তুলনামূলক নেতৃস্থানীয় ফ্ল্যাগশিপ মডেলের পাস রেট 47.8%। উভয়ের পারফরম্যান্স কাছাকাছি, কিন্তু Google জানিয়েছে যে Flash Cyber-এর রানিং খরচ কম।

এটি নিরাপত্তা এজেন্টের লক্ষ্যকে “এখানে সম্ভাব্য সমস্যা আছে” বলা থেকে ভাঙ্গন বুঝতে, প্যাচ লিখতে, পরীক্ষা চালাতে এবং পরিবর্তনগুলি যাচাই করতে রূপান্তরিত হওয়াকে নির্দেশ করে। যদি ফলাফলগুলি যথেষ্ট বিশ্বস্ত হয়, তবে এটি নিরাপত্তা দলকে ভাঙ্গন শনাক্ত করে থেকে প্যাচ স্থাপন করা পর্যন্ত সময় কমিয়ে দিতে পারে।

Chrome পায় 2.6 গুণ সঠিক প্যাচ, তবে এখনও প্রস্তুতকারক এবং সহযোগীদের পরীক্ষার মধ্যে রয়েছে

গুগল ইতিমধ্যে ফ্ল্যাশ সাইবারকে অভ্যন্তরীণ কোড নিরাপত্তা কাজে ব্যবহার করছে।

ক্রোম সিকিউরিটি টিম বলেছে যে এটি তৈরি করা সঠিক ভালনের প্যাচের সংখ্যা বড় বাণিজ্যিক মডেলগুলির তুলনায় 2.6 গুণ। সাইবার সিকিউরিটি কোম্পানি Wiz বলেছে যে তাদের পেনিট্রেশন টেস্টিং বেঞ্চমার্কে, Flash Cyber-এর ভালন রিকল রেট অন্যান্য অগ্রণী মডেলগুলির তুলনায় 7.5 থেকে 9.7 পয়েন্ট বেশি, এবং খরচ 2.3 থেকে 5.2 গুণ কম।

গুগল ক্লাউড ভালনারেবিলিটি রিসার্চ টিম আরও বলেছে যে, এই মডেলটি দুই ঘন্টারও কম সময়ে একটি কী ইনফ্রাস্ট্রাকচার ভালনারেবিলিটি শনাক্ত করেছে, যেখানে অনুরূপ গবেষণা সাধারণত মাসের পর মাস স্থায়ী হয়।

এই ফলাফলগুলি বাস্তবসম্মত প্রসঙ্গ প্রদান করে, তবে এগুলিকে স্বতন্ত্র এবং পুনরাবৃত্তযোগ্য পাবলিক মূল্যায়ন হিসাবে বিবেচনা করা যায় না। Google সেই গুরুত্বপূর্ণ দুর্বলতার সম্পূর্ণ বিবরণ, তুলনামূলক মডেলের তালিকা এবং সম্পূর্ণ রান ট্রেজেক্টরি প্রকাশ করেনি; Chrome ডেটা Google-এর অভ্যন্তরীণ, Wizও Fairwind-এর পার্টনার। তাই, এগুলি প্রমাণ করে যে মডেলটি বাস্তব সুরক্ষা কাজে অংশগ্রহণ করতে পারে, তবে এটি প্রমাণ করে না যে এটি সমস্ত কোডবেস এবং দুর্বলতা ধরনের উপর স্থিতিশীলভাবে একই পরিমাণের ফলাফল অর্জন করে।

সর্বশ্রেষ্ঠ সাইবার নিরাপত্তা ক্ষমতা শুধুমাত্র বিশ্বস্ত প্রতিষ্ঠানগুলিকে প্রদান করা হয়

Flash Cyber গুগলের নতুন ফেয়ারউইন্ড প্রোগ্রামের মাধ্যমে প্রদান করা হয়, যার বর্তমানে 650-এরও বেশি প্রতিভাগকারী রয়েছে, যাদের মধ্যে প্রধানত সরকারি সাইবার নিরাপত্তা সংস্থা, কীভাবে অবকাঠামো পরিচালনকারী, সফটওয়্যার রক্ষণাবেক্ষণকারী এবং বড় সাইবার নিরাপত্তা কোম্পানিগুলি অন্তর্ভুক্ত।

প্রতিষ্ঠানগুলিকে অভ্যন্তরীণ অ্যাক্সেসের পরিসর সীমিত রাখতে হবে এবং মাল্টি-ফ্যাক্টর অথেন্টিকেশনের মতো নিরাপত্তা ব্যবস্থা গ্রহণ করতে হবে। মডেল এবং CodeMender Agent-এর সংমিশ্রণে, প্রতিষ্ঠানগুলি তাদের নিজস্ব ক্লাউড পরিবেশে ভাঙন খুঁজে, যাচাই করে এবং ঠিক করতে পারে।

সাধারণ Google Cloud গ্রাহকদের এখনও CodeMender ব্যবহার করার অনুমতি রয়েছে যা পাবলিক ভার্সনের Gemini মডেলের সাথে কাজ করে, তবে Flash Cyber-এর পূর্ণ ক্ষমতা পাওয়া যায় না।

এই “একটি বেস মডেল, দুটি অনুমতি স্তর” পদ্ধতি অ্যানথ্রোপিকের আগের Claude-কে Fable এবং Mythos-এ বিভক্ত করার পথের সাথে খুব মিলে যায়: সাধারণ প্রোগ্রামিং এবং বিশ্লেষণাত্মক ক্ষমতা বাজারে উন্মুক্ত করা হয়, যখন সহজেই আক্রমণাত্মক ক্ষমতায় রূপান্তরিত হতে পারে এমন সাইবার নিরাপত্তা ফাংশনগুলি পরিচয় যাচাই, অ্যাক্সেস নিয়ন্ত্রণ এবং নিরন্তর মনিটরিংয়ের মাধ্যমে সরবরাহ করা হয়।

নিরাপত্তা স্পষ্টভাবে উন্নত হয়নি, তবে কিছু অ-ইংরেজি প্রদর্শন অবনতি দেখা দিয়েছে

সাধারণ সংস্করণ 3.8 Flash-এ রাসায়নিক, জীববিজ্ঞান, বিকিরণ, পারমাণবিক সম্পর্কিত এবং সাইবার আক্রমণের জন্য নিরাপত্তা সীমাবদ্ধতা রয়েছে; সাইবার সংস্করণ পেশাদার প্রতিরক্ষা কার্যক্রম সম্পন্ন করার জন্য সাইবার নিরাপত্তা সীমাবদ্ধতা কম, তাই শুধুমাত্র অনুমোদিত প্রতিষ্ঠানগুলিকেই উন্মুক্ত।

গুগল মডেল কার্ড অনুসারে, 3.7 Flash-এর তুলনায় 3.8 Flash-এ কোম্পানির অগ্রণী সুরক্ষা কাঠামোর উল্লিখিত উচ্চ-ঝুঁকি ক্ষেত্রগুলিতে কোনও প্রায়োগিক নতুন ক্ষমতা দেখা যায়নি, তাই এটি উচ্চতর ঝুঁকি স্তরকে ট্রিগার করেনি। গ্রে সোয়ান পরোক্ষ প্রম্পট ইনজেকশন পরীক্ষায় এর সুরক্ষা উন্নতি লাভ করেছে।

তবে, মডেল কার্ডে এও উল্লেখ করা হয়েছে যে 3.8 Flash অটোমেশনযুক্ত বহুভাষিক নিরাপত্তা পরীক্ষায় 3.7 Flash এর তুলনায় 5.4 পার্সেন্টপয়েন্ট পিছিয়ে গেছে। Google-এর মানব পরীক্ষার পর দেখা গেছে যে, বেশিরভাগ পার্থক্য ভুল সতর্কবার্তা বা অত্যন্ত গুরুতর নয়, তবে সম্পূর্ণ নমুনা এবং ভাষা-ভিত্তিক ডেটা প্রকাশিত হয়নি।

মডেলটি বড় ভাষা মডেলের সাধারণ সমস্যাগুলিও বজায় রাখে, যার মধ্যে রয়েছে হ্যালুসিনেশন, কখনও কখনও প্রতিক্রিয়া ধীর বা টাইমআউট, এবং পারফরম্যান্স উন্নতির জন্য অতিরিক্ত টোকেন ব্যবহার। জ্ঞানের সীমা 2026 মার্চ হিসাবে চিহ্নিত করা হয়েছে, তবে Google বলেছে যে কিছু ক্ষেত্রের বিশ্বস্ত জ্ঞান এখনও 2025 জানুয়ারির কাছাকাছি পর্যন্তই আপডেট হয়েছে; সর্বশেষ তথ্যের ক্ষেত্রে অনলাইনে যাচাইয়ের প্রয়োজন।

প্রকৃত প্রতিযোগিতা এখন “কে সবচেয়ে বুদ্ধিমান” থেকে “কে বড় পরিসরে ব্যবহার করা যায়”-এর দিকে সরে যাচ্ছে

জেমিনি ৩.৮ ফ্ল্যাশের সবচেয়ে গুরুত্বপূর্ণ বিষয় হল কোনো একটি বেঞ্চমার্কে শূন্য কয়েক ভাগের অগ্রগতি নয়, বরং Google ঠিক ফ্ল্যাশ মূল্য ব্যবধানে দীর্ঘমেয়াদি প্রোগ্রামিং, পেশাদার বিশ্লেষণ এবং স্বায়ত্তশাসিত টুল কলের ক্ষমতা চাপিয়ে দিচ্ছে।

শীর্ষ মডেলগুলি উচ্চ-মূল্যবান, কম ফ্রিকোয়েন্সির জটিল কাজের জন্য উপযুক্ত; কিন্তু ব্যবসায়িক কাস্টমার সাপোর্ট, প্রোগ্রামিং পাইপলাইন, ফাইন্যান্সিয়াল অ্যানালিসিস এবং সিকিউরিটি স্ক্যানিংয়ে বাস্তবায়িত এজেন্টগুলি প্রতিদিন মিলিয়ন মিলিয়ন কল পরিচালনা করে। এই পরিস্থিতিগুলিতে, গতি, একক মূল্য এবং একক কাজের সফলতার হার প্রায়শই র‍্যাঙ্কিংয়ের প্রথম স্থানের চেয়ে বেশি গুরুত্বপূর্ণ।

3.8 ফ্ল্যাশ এই রুটের বিরোধিতাও দেখায়: মডেল যত বেশি পুনরাবৃত্তি এবং ধারাবাহিকভাবে কাজ করতে পারে, তত বেশি Token জেনারেট করার সম্ভাবনা থাকে, যা “সস্তা মডেল”-এর একক কাজের খরচ বাড়িয়ে দেয়। অতএব, ভবিষ্যতে Agent-এর প্রতিযোগিতার মূল বিষয় শুধুমাত্র কে সবচেয়ে ভালোভাবে উত্তর দেয়, তা নয়—এটি কখন চিন্তা চালিয়ে যাবে, কখন টুলস ব্যবহার করবে, এবং কখন থামবে, তা বিচার করতে পারা কতটা দক্ষ, তা নিয়েও।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।