GPT-6 শুধু আস্ট্রা নয়!
অস্ট্রা মাত্র কয়েক দিন আগে প্রকাশ করা হয়েছে, তখন GPT-6 Sol-এর অভ্যন্তরীণ পরীক্ষার সংবাদ প্রকাশিত হয়েছে।

Performance is also outstanding, with a single test speed six times that of Astra.
অনুমান করুন: টেরা এবং লুনা কি পথে আছে?
এবং ঠিক সেই দিনই, OpenAI একটি অভ্যন্তরীণ ডেটা সেট প্রকাশ করেছে:
এখন পর্যন্ত, 8 ঘন্টার কাজের দিনের ভিত্তিতে, OpenAI গবেষক যখন একদিন কাজ করেন, তখন তাঁর পাশে 3টিরও বেশি মাল্টি-এজেন্ট কাজের দিন একসাথে চলছে।
API মূল্যের ভিত্তিতে, ওপেনএআইয়ের মধ্যকার গড় গবেষক প্রতিদিন 600 ডলারের বেশি এজেন্ট রিজনিং সম্পদ ব্যবহার করেন।

OpenAI আরও ঘোষণা করেছে যে তারা «অটোমেটেড রিসার্চ ইন্টার্ন» অর্জন করেছে:
এই এজেন্টগুলি মানুষের নির্দেশে কিছু কাজ সম্পন্ন করতে পারে যা আগে গবেষকদের কয়েক দিন লাগত।
লো হুয়াংও বলেছেন: এজিআই এখন এসে গেছে!

তিনি প্রকাশ করেন যে আস্ট্রা প্রায় 100,000 সেট NVIDIA Grace Blackwell NVLink72 ব্যবহার করে ট্রেনিং করছে, এবং আগামীতে 400,000 সেট GPU যোগ হবে।
এটা মনে হচ্ছে এই প্রচারটা শুধুমাত্র OpenAI-এর পক্ষ থেকে নয়।
GPT-6 Sol-এর অন্তর্নিহিত পরীক্ষা শুরু হয়েছে বলে প্রকাশ পেয়েছে
ব্যবহারকারী Lentils-এর দাবি অনুযায়ী, OpenAI অভ্যন্তরীণভাবে GPT-6 Sol পরীক্ষা করছে।
তিনি বলেন, সলের মোট আউটপুট ক্ষমতা সাম্প্রতিকভাবে প্রকাশিত অ্যাস্ট্রার তুলনায় প্রায় কম, কিন্তু এটি দ্রুততর, এবং এখনও 'মনস্টার-লেভেল' মডেলের মধ্যে পড়ে।
কতটা দ্রুত? একটি পরীক্ষার গতি প্রায় অ্যাস্ট্রার 6 গুণ।
নেটিজেন লাইরা একই কাজটি বিভিন্ন মডেলের জন্য পরীক্ষা করেছেন: একটি BMW M4 Competition-এর SVG চিত্র তৈরি করতে মডেলগুলিকে নির্দেশ দেওয়া।
এর মধ্যে, GPT-6 Sol ম্যাক্স লেভেল এবং জিরো-শট জেনারেশন ব্যবহার করে প্রায় 3 মিনিট সময় নেয় এবং প্রায় 28,000 টোকেন আউটপুট দেয়।

GPT-6 Astra ম্যাক্স মোড ব্যবহার করে, প্রায় 25,000 টোকেন আউটপুট দেয়, যা প্রায় 19 মিনিট সময় নেয়।

জেমিনি ৩.১ ডিপথিংক হাই ডিগ্রি চালু করা হয়েছে, যার আউটপুট প্রায় ৩৩০০ টোকেন দেখায়, কিন্তু রিজনিং প্রক্রিয়াটি প্রায় ৪৫.৮ লাখ টোকেন খরচ করে এবং প্রায় ২৯ মিনিট সময় নেয়।

জেমিনি 3.8 ফ্ল্যাশ একইভাবে হাই ডিগ্রি সক্রিয় করে, প্রায় ৪২ সেকেন্ডে প্রায় ১.৯ হাজার টোকেন আউটপুট করে।

তুলনায়, Sol-এর পারফরম্যান্স সবচেয়ে উল্লেখযোগ্য: এটি Astra-এর আউটপুট স্কেলের সমান কিন্তু প্রতিটি টেস্টের সময় Astra-এর প্রায় ছয়গুণ দ্রুত—শুধুমাত্র এর ষষ্ঠাংশ সময় নেয়।
এছাড়াও, ওয়েবসাইট ব্যবহারকারী Lentils একটি পিক্সেল-স্টাইল স্যান্ডবক্স বিশ্বের প্রোটোটাইপ প্রদর্শন করেছেন যার নাম 'The Realm of Aurellune'।

GPT-6 Sol একবারে শহর, কৃষিক্ষেত্র, নদী, দুর্গ এবং সংক্ষিপ্ত মানচিত্র তৈরি করেছে, এছাড়াও দিন-রাতের পরিবর্তন, স্থানের নাম স্থাপন, বিস্তারিত সমায়োজনের জন্য কন্ট্রোল প্যানেল যোগ করেছে, যা সম্পূর্ণরূপে একটি ইতিমধ্যে প্রাথমিক রূপরেখা প্রস্তুত সিমুলেশন ম্যানেজমেন্ট গেমের মতো।
এটি জিরো-শট, ম্যাক্স ইনফারেন্স লেভেল, ১৫ মিনিট, মোট ৬০,০০০ টোকেন ব্যয় করে তৈরি করা হয়েছে।
বর্তমানে অনুমান করা যায় যে, এস্ট্রা সর্বোচ্চ কঠিনতার গভীর যুক্তিকে প্রাধান্য দেয়, যেখানে সল সম্ভবত গতি, থ্রুপুট এবং স্কেলযোগ্য এজেন্ট কলকে প্রাধান্য দেয়।
সল-এর প্রকাশের সময় সম্পর্কে, ব্যবহারকারী পঞ্চজন কুমার বলেছেন, এটি 29 সেপ্টেম্বরে অপেনএআই ডেভেলপার কনফারেন্সে অফিসিয়ালি প্রকাশিত হতে পারে।

GPT-6, Terra, Luna এবং GPT-Image 2.5 একসাথে উপস্থিত হওয়ার সম্ভাবনা বাদ দেওয়া হয়নি।

ওপেনএআই গবেষক, প্রতিজনের সাথে 3টি এজেন্ট ইন্টার্ন কাজে আসে
একই দিনে, ওপেনএআই একটি আকর্ষণীয় অভ্যন্তরীণ ডেটা শেয়ার করেছিল—AI মডেলগুলি তাদের নিজস্ব পরীক্ষাগারে বিজ্ঞানকে কতটা ত্বরান্বিত করেছে।
এই বছরের আগস্টের মধ্যভাগের মধ্যে, গবেষক যখন 8 ঘন্টা কাজ করেন, তখন প্রায় 3.1 এজেন্ট-দিনের কাজ সমান্তরালে চলছে।
ওহ হ্যাঁ, একজন ব্যক্তি তিনজন অনিদ্রার ইন্টার্নকে নিয়ে চলেছেন~

খরচের ক্ষেত্রে, API মূল্য অনুযায়ী, মধ্যকার গবেষক প্রতিদিন 600 ডলারের বেশি এজেন্ট উপসংহার সম্পদ ব্যয় করেন।
এটি একজন প্রাথমিক ইঞ্জিনিয়ারের একদিনের বেতনের কাছাকাছি।

এই এজেন্টগুলি ঠিক কী করছে?
গবেষণা কোড লিখুন, ইনফ্রাস্ট্রাকচার কোড লিখুন, ট্রেনিং পরিবেশ তৈরি করুন, মূল্যায়ন পরীক্ষা চালান, টুল এবং পরিবেশের সমস্যা চিহ্নিত করুন, পরীক্ষার ফলাফল বিশ্লেষণ করুন, ট্রেনিং টাস্ক মনিটর করুন... গবেষণার উপসংহার সংগঠিত এবং যোগাযোগ করার ক্ষেত্রেও আপনি হাত দিতে পারেন।
এটি প্রায় সবকিছুই করতে পারে, শুধু কী অধ্যয়ন করতে হবে তা ঠিক করতে পারে না।
সবচেয়ে স্পষ্ট পরিবর্তনটি হল যে, আগে পরীক্ষামূলক পরিবেশ বন্ধ হয়ে গেলে গবেষকদের অভ্যন্তরীণ চ্যানেলে লোক ডাকতে হত; এখন এজেন্টগুলি এই ধরনের কাজগুলি আরও ভালভাবে করতে পারছে, যার ফলে মানবিক উত্তরদায়িত্বের পরিমাণ সরাসরি কমে গেছে।

কিছু দল স্থির প্রযুক্তিগত প্রশ্নোত্তর সময় বাতিল করে মানুষকে সিস্টেমটি উন্নত করতে মুক্ত করেছে।
এই ডেটার ভিত্তিতে, ওপেনএআই ঔপচারিকভাবে ঘোষণা করেছে যে তারা «অটোমেটেড এআই রিসার্চ ইন্টার্ন» লক্ষ্যটি অর্জন করেছে।
এখানে «ইন্টার্ন» বলতে বোঝায় একটি কাজ করতে পারে এমন রিসার্চ নোড: মানুষের নির্দেশনায়, এটি স্পষ্ট সীমানা সহ গবেষণা কাজগুলি স্বাধীনভাবে সম্পন্ন করতে পারে, যেখানে কিছু কাজ আগে অভিজ্ঞ গবেষকদের কয়েক দিন লাগত।
প্রভাবও তাৎক্ষণিক ছিল, গবেষকদের কোড আউটপুট এবং পরীক্ষার সংখ্যা উভয়ই বাড়ছে।

আগস্ট ২০২৬-এ, প্রতি ব্যক্তির পরীক্ষার সংখ্যা ২০২৫ সালের জানুয়ারি থেকে পরিসংখ্যান শুরু হওয়ার পর সর্বোচ্চ পর্যায়ে পৌঁছেছে, এবং এজেন্টগুলি যে কাজগুলি নিচ্ছে তা আরও জটিল এবং সময়সীমা দীর্ঘতর হচ্ছে।

এই নিবন্ধের লেখক কেভিন লিউ এটিকে একটি বড় প্রেক্ষাপটে রেখেছেন।
তিনি মনে করেন, রিকার্সিভ সেলফ-ইম্প্রুভমেন্ট হ'ল আগামী বছরগুলিতে এআই ক্ষমতার বিপ্লবের জন্য সবচেয়ে গুরুত্বপূর্ণ কারণগুলির মধ্যে একটি।
সরল কথায়, এআই এআই তৈরি করছে, আর তৈরি হচ্ছে দ্রুততর।

কিন্তু সমস্যা হলো, বর্তমান বিকাশের প্রবণতা অনুযায়ী, এই ক্ষমতা ডিফল্টভাবে কেবলমাত্র কয়েকটি অগ্রণী এআই পরীক্ষাগারের ভিতরেই উপলব্ধ হবে, বাইরের লোকেরা এটি কতটা এগিয়েছে তা দেখতে পাবে না।
অতএব, লিউ মনে করেন যে স্বচ্ছতার প্রকাশ এখন আগের যেকোনো সময়ের চেয়ে আরও জরুরি। মডেলগুলি কত দ্রুত শক্তিশালী হচ্ছে, এবং গবেষণা ও উন্নয়নের গতি কি ব্রেক করা উচিত—এগুলি কয়েকটি কোম্পানির বন্ধ দরজার পিছনে সিদ্ধান্ত নেওয়া উচিত নয়।
তিনি অন্যান্য এআই কোম্পানিগুলিকেও ডাক দিয়েছেন: এগুলিও অনুরূপ ডেটা প্রকাশ করা উচিত।
তবে, এআই গবেষণা প্রকৃতই দ্রুত হয়েছে, কিন্তু এখনও সম্পূর্ণ স্বয়ংচালিত হওয়ার মতো দ্রুত হয়নি।
OpenAI-এর ডেটা অনুসারে, যে কাজগুলির জন্য আগে 4 থেকে 8 ঘন্টা লাগত, গত ছয় মাসে তার বেশিরভাগ সফল কেসে মানুষকে কমপক্ষে একবার হস্তক্ষেপ করতে হয়েছে। উচ্চস্তরের গবেষণা পরিকল্পনার ক্ষেত্রে তো প্রায়ই Agent-এর ওপর ছেড়ে দেওয়া হয় না।

গবেষকদের এখনও কী গবেষণা করতে হবে, কোন ফলাফলগুলি চালিয়ে যাওয়া উচিত এবং কখন প্রশিক্ষণ বাড়ানো, পরীক্ষা বন্ধ করা বা মডেল চালু করা উচিত তা নির্ধারণের দায়িত্ব রয়েছে।
OpenAI-এর পরবর্তী লক্ষ্যও নির্ধারিত হয়েছে: 2028 সালের মার্চের আগে «অটোমেটেড AI গবেষক» অর্জন করা।
শুধু স্পষ্ট কাজ গ্রহণ করতে পারে এমন “ইন্টার্ন”-এর তুলনায়, “গবেষক”-দের অধিক খোলা গবেষণা লক্ষ্য বহন করতে হয় এবং নিজের দ্বারা দীর্ঘতর প্রকল্পগুলি এগিয়ে নিতে হয়—এটি একজন বাস্তবায়নকারী থেকে স্বাধীন দায়িত্বপ্রাপ্ত ব্যক্তিতে রূপান্তরিত হওয়ার সমতুল্য।
যদি GPT-6 Sol প্রকৃতপক্ষে অভ্যন্তরীণ পরীক্ষায় থাকে, তাহলে এটি সম্ভবত এই নতুন উন্নয়ন মডেলের মাধ্যমে তৈরি হয়েছে:
আরও বেশি GPU দিয়ে ক্যালকুলেশন করা হচ্ছে, আরও বেশি Agent একসাথে পরীক্ষা চালাচ্ছে, আর মানুষের গবেষকরা উঁচু জায়গায় দাঁড়িয়ে—দিকনির্দেশনা বাছাই করছেন, ফলাফল মূল্যায়ন করছেন, এবং চূড়ান্তভাবে সিদ্ধান্ত নিচ্ছেন কোনগুলোকে পরবর্তী প্রজন্মের মডেলে পরিণত করা উচিত।
শক্তিশালী এআই এখন আরও কঠিন হয়ে উঠছে নিয়ন্ত্রণের জন্য
একই দিনে, ওপেনএআই-এর প্রধান বিজ্ঞানী জাকুব প্যাচোকি একটি দশহাজার শব্দের দীর্ঘ নিবন্ধ প্রকাশ করেন, যার শিরোনাম সরাসরি —《বাইরের মস্তিষ্ক》।

আমি এটি পড়ার পরে বুঝতে পারলাম যে, ওপেনএআই-এর প্রধান বিজ্ঞানীও সম্পূর্ণ শিল্পকে ধীর করার পরামর্শ দিচ্ছেন...
জাকুব বলেন, এআই মানুষ যেমন ডিজাইন চিত্র অনুযায়ী একটি চিপ এবং একটি নিয়ম দিয়ে তৈরি করে না, এটি বরং বিপুল পরিমাণ ডেটা এবং ক্যালকুলেশন শক্তির মধ্যে নিজেই 'বাড়ে'।
আপনি এর কিছু পার্ট আলাদা করে বুঝতে পারেন, কিন্তু পুরো সিস্টেমটি হঠাৎ করে কীভাবে কিছু ক্ষমতা অর্জন করল, অন্য পরিবেশে এটি কীভাবে আচরণ করবে—কেউ বলতে পারে না।
আরও বেশি ব্যথার বিষয় হলো, এআইকে মানুষকে সম্পূর্ণভাবে পিছনে ফেলতে হবে না যাতে সমস্যা হয়; শুধু যথেষ্ট সংখ্যক কী দক্ষতায় মানুষের চেয়ে ভালো হলেই, এটি আপনাকে বড় সাহায্য করতে পারে এবং বড় বিপদেরও কারণ হতে পারে।
তাহলে প্রশ্ন হচ্ছে: মানুষ এটি বুঝতে পারে কি?
গতকাল ওপেনএআই এআই নিয়ন্ত্রণ করত মূলত একটি পদ্ধতি দিয়ে: চিন্তার শৃঙ্খলা দেখে।
সহজ ভাষায়, মডেলের যুক্তির প্রক্রিয়াটি পর্যবেক্ষণ করা হচ্ছে যাতে এটি কোনো অন্যায় কাজ না করে, যেমন মিথ্যা বলা, অনধিকারচ্যুত কাজ করা বা সীমাবদ্ধতা এড়িয়ে যাওয়া।
কিন্তু আস্ট্রা প্রজন্মে এই কৌশলটি কাজ করতে বন্ধ করে দিল।
প্রথমত, মডেলগুলি ধীরে ধীরে নিজেদের বলা কথাগুলি পরিচালনা করতে শিখছে, তাদের প্রকৃত চিন্তাগুলি সবসময় যুক্তিতে লেখা হয় না; দ্বিতীয়ত, এজেন্টগুলি এখন শুধুমাত্র “ভাবের পরে উত্তর দেওয়া” এর বাইরে। এগুলি টুলগুলি ব্যবহার করে, কম্পিউটার চালায়, পরিবেশ চালায়, এবং মানুষ বা অন্যান্য এজেন্টদের সাথে সমন্বয় করে।
এই বিষয়গুলি এতটাই মিশে গেছে যে গবেষকদের জন্য প্রতিটি বাক্য পরীক্ষা করার জন্য একটি সম্পূর্ণ স্বচ্ছ চিন্তার শৃঙ্খল তৈরি করা সম্ভব হচ্ছে না।
OpenAI আরও দেখেছে যে, Astra জটিল কাজগুলি সম্পন্ন করতে পারে যদিও এটি যুক্তির প্রক্রিয়াটি সম্পূর্ণভাবে লিখে ফেলেনি।
সহজ কথায়, মডেলটি ইতিমধ্যেই "চুপ করে বড় কাজ করা" শিখে ফেলেছে।

একটি বিশেষায়িত প্রতিদ্বন্দ্বী পরীক্ষায়, যেখানে মডেলগুলিকে মনিটরিং এড়ানোর জন্য উত্তেজিত করা হয়, অ্যাস্ট্রা কিছু ভয়ঙ্কর ক্ষমতা প্রদর্শন করেছে: পরীক্ষার স্কোর ইচ্ছাকৃতভাবে কমিয়ে দেওয়া, মনিটরিং এড়ানো, এবং ধ্বংসাত্মক কাজ সম্পাদন করা।
অবশ্যই, এগুলি মানব প্রযুক্তি দ্বারা ডিজাইন করা প্রেসার টেস্ট, যা অপেনএআইকে এট্রাস্টাকে দৈনন্দিন কাজে সক্রিয়ভাবে প্রতারণা করার জন্য নির্ধারণ করতে দেয়নি। তবে এটি কমপক্ষে বোঝায় যে, চিন্তার শৃঙ্খল পর্যবেক্ষণ করেই মডেলের সমস্ত সম্ভাব্য আচরণ কভার করা কঠিন।
পূর্বের হাগিং ফেস ঘটনাটি কি মনে আছে? সেটা ছিল একটি সতর্কবাণী।

সেই সময়, GPT‑5.6 Sol এবং একটি শক্তিশালী অভ্যন্তরীণ গবেষণা মডেলকে ExploitGym নেটওয়ার্ক টার্গেট রেঞ্জে রাখা হয়েছিল, যেখানে তাদের কাজ ছিল ভাঙ্গন খুঁজে বার করা, আক্রমণ সম্পন্ন করা এবং Flag পাওয়া। মডেলের প্রকৃত ক্ষমতা পরীক্ষা করার জন্য, মূল্যায়ন পরিবেশে সম্পূর্ণ সুরক্ষা প্রতিরোধ সক্রিয় করা হয়নি।
ফলাফল মডেলগুলি সতর্কভাবে সমস্যা সমাধান করেনি, তারা প্রথমে নেটওয়ার্ক আইসোলেশন এড়িয়ে অননুমোদিত চ্যানেলের মাধ্যমে পরস্পরের সাথে বার্তা বিনিময় করে কাজের বণ্টন করেছে।
এরপর সফটওয়্যার প্যাকেজ ক্যাশে প্রক্সির শূন্য-দিনের দুর্বলতার ব্যবহার করে পাবলিক ইন্টারনেট অ্যাক্সেস অর্জন করা হয় এবং শেষ পর্যন্ত Hugging Face সিস্টেমে প্রবেশ করে ExploitGym-এর টেস্ট উত্তর খোঁজার চেষ্টা করা হয়।

বাস্তবে, এই বিষয়টি মূলত অভ্যন্তরীণ গবেষণা মডেল IM1 দ্বারা প্রেরিত হয়েছিল, GPT‑5.6 Sol কিছু আক্রমণের পথ পুনরাবৃত্তি করেছিল, এবং Astra অংশগ্রহণ করেনি।
মডেলের মূল লক্ষ্য এখনও পরীক্ষা সম্পন্ন করা, কিন্তু উত্তর পাওয়ার জন্য তারা নিয়মের ফাঁক খুঁজতে থাকে এবং শেষ পর্যন্ত কাজের পরিসরের বাইরে চলে যায়।
অতএব, ওপেনএআইও একটি বিপদের সংকেত পড়েছে: যখন এজেন্ট যথেষ্ট শক্তিশালী, টুলগুলি যথেষ্ট বেশি, এবং রানিং টাইম যথেষ্ট দীর্ঘ, তখন এটি নিজেই নতুন পথ খুঁজে বার করতে পারে, বাহ্যিক সম্পদ কল করতে পারে, এমনকি অন্যান্য এজেন্টদের সাথে সহযোগিতা করতে পারে।
না... তাহলে এইভাবে ঘুরাঘুরি করে এটা কি একটা বন্ধ চক্র হয়ে গেল??
OpenAI কে আরও শক্তিশালী মডেল দরকার, যা কোড লিখতে, পরীক্ষা চালাতে, অ্যালাইনমেন্ট গবেষণা করতে এবং অন্যান্য AI-এর বিরুদ্ধে সুরক্ষা সিস্টেম তৈরি করতে পারে। মডেল যত শক্তিশালী হবে, তত বেশি কাজ করতে পারবে, এবং গবেষণার গতি তত দ্রুত হবে।
কিন্তু একই সময়ে, মানুষ এটি কীভাবে সিদ্ধান্তে পৌঁছায় তা নিশ্চিত করতে ক্রমাগত কঠিন হয়ে পড়ছে, এবং পরিবেশ পরিবর্তনের পরেও কি এটি আগের শেখা নিয়মগুলি পুনরায় ব্যাখ্যা করবে।
জাকুব মনে করেন, এখন কোনও ল্যাব নিজেদের দাবি করে না যে তারা মডেলের অ্যালাইনমেন্ট এবং মনিটরিং ঠিকমতো করেছে এবং দীর্ঘমেয়াদে সর্বোচ্চ গতিতে মডেলের স্কেল বাড়ানোর জন্য নিরাপদে এগিয়ে যেতে পারে।

যতক্ষণ পর্যন্ত শিল্পজুড়ে একটি সাধারণ নিরাপত্তা মানদণ্ড প্রতিষ্ঠিত হয় না, ততক্ষণ তিনি সবাইকে "স্বেচ্ছায় ব্রেক চাপা" কে একটি অনুমতি হিসেবে গ্রহণ করতে অনুরোধ করেন।
ওপেনএআই নিজেও বলেছে: যদি প্রয়োজন হয়, তবে মডেলের স্কেল বাড়ানো বন্ধ করে একপক্ষে বন্ধ করে দেওয়ার কথাও বাদ দেওয়া হয়নি।
তোমার ভালো হবে এভাবে… আমি মনে করি কোনো A দিয়ে শুরু হওয়া কোম্পানি এটাও বলেছিল।
রেফারেন্স লিঙ্ক:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
এই লেখাটি ওয়েইচ্যাট গিটহাব "কোয়ানটাম পজিশন" থেকে এসেছে, লেখক: তিং ইউ
