2026 সালের YC স্টার্টআপ স্কুলে, জেফ ডিনের কণ্ঠস্বর কাঁপছিল।
সাক্ষাতকার শুরু হওয়ার সাথে সাথে তিনি ব্যাখ্যা করেন যে তিনি কণ্ঠহীন হয়ে গেছেন, আজ তাঁর কণ্ঠস্বর সাধারণের চেয়ে ভিন্ন। কিন্তু এটি দর্শকদের মনোযোগকে প্রভাবিত করেনি। তাঁর সামনে বসে থাকা YC পার্টনার ডায়ানা হু, কম্পিউটার ইতিহাসে লিখে রাখা যায় এমন একটি নামের তালিকা উল্লেখ করেন: MapReduce, BigTable, TensorFlow, TPU, Gemini।

প্রতিটি প্রকল্পই একজন ইঞ্জিনিয়ারের ক্যারিয়ারের প্রতিনিধিত্বকারী হতে পারে। কিন্তু এই প্রকল্পগুলি জেফ ডিন এবং তাঁর চারপাশের কয়েকজন গুগল ইঞ্জিনিয়ারদের রিজিউমেতে একসাথে দেখা যায়।
ডায়ানা সাক্ষাতকারটিকে একটি সাফল্যের পুনরাবৃত্তি হিসেবে তৈরি করেননি। তিনি আরেকটি প্রশ্নের দিকে বেশি মনোযোগ দিচ্ছেন: যখন জেনারেটিভ এআই ইতিমধ্যেই সফটওয়্যার শিল্পকে আচ্ছন্ন করে ফেলেছে, তখন জেফ ডিন, যিনি সিস্টেমগুলির নিচের স্তরে পুনর্গঠনের জন্য সবচেয়ে দক্ষ, আজকের দিনে কী দেখছেন?
উত্তরটি বড় মডেল নয়।
এক ঘন্টার বেশি সময় ধরে এই কথোপকথনে, জেফ ডিন বারবার যুক্তি হার্ডওয়্যার, শক্তি, ডেটা ট্রান্সফার, কনটেক্সট ইঞ্জিনিয়ারিং, দীর্ঘস্থায়ী এজেন্ট, অটোমেশন এক্সপেরিমেন্ট সিস্টেম এবং স্টার্টআপগুলি কীভাবে জেনারিক মডেলের সরাসরি আক্রমণ এড়াতে পারে তা নিয়ে আলোচনা করেন। তিনি যা বলেন তা প্রথম দৃষ্টিতে বিক্ষিপ্ত মনে হলেও, এর পিছনে একটি অত্যন্ত স্পষ্ট মূল রেখা রয়েছে: AI-এর পরবর্তী পর্যায়টি শুধুমাত্র মডেলগুলিকে আরও বুদ্ধিমান করে তোলা নয়, বরং মডেলগুলিকে এমন একটি সিস্টেমের মধ্যে রাখা, যা দীর্ঘস্থায়ীভাবে কাজ করতে, ধারাবাহিকভাবে পরীক্ষা-ভুল করতে, স্বয়ংক্রিয়ভাবে যাচাই করতে এবং ধারাবাহিকভাবে ক্ষমতা সঞ্চয় করতে পারে।
এর অর্থ এও, এআই প্রতিযোগিতা এখন “কার কাছে বড় মডেল আছে” থেকে “কে বুদ্ধিমত্তাকে ভালোভাবে সংগঠিত করতে পারে”-এর দিকে সরে আসছে।
এক, এআই এখন প্রাথমিক ইঞ্জিনিয়ারের মতো, কিন্তু এটাই সবচেয়ে গুরুত্বপূর্ণ পরিবর্তন নয়
2025 মে মাসে, জেফ ডিন একটি বিতর্কিত মন্তব্য করেছিলেন যে, এআইয়ের ক্ষমতা এখন একজন প্রারম্ভিক ইঞ্জিনিয়ারের ক্ষমতার কাছাকাছি পৌঁছেছে।

এক বছর পর, ডায়ানা তাকে জিজ্ঞাসা করল, এই পূর্বানুমানটি কতটা বাস্তবায়িত হয়েছে?
জেফ ডিনের উত্তর খুব সরাসরি। তিনি মনে করেন, এই বিচারটি “পর্যাপ্ত সঠিক”। এজেন্টকরণ, দীর্ঘ প্রক্রিয়া কোডিং এবং জটিল কাজে মডেলের উন্নতি তাঁর আগের পূর্বানুমানের চেয়েও দ্রুত হয়েছে।
"মডেলটি ক্রমবর্ধমান জটিল কাজগুলি সম্পন্ন করার ক্ষমতা আমার প্রত্যাশার চেয়ে দ্রুত বৃদ্ধি পাচ্ছে," তিনি বলেন।
আরও গুরুত্বপূর্ণ বিষয় হলো, এই ক্ষমতা এখন কোড লেখার সীমানা ছাড়িয়ে গিয়েছে। বড় সংখ্যক এজেন্ট সিস্টেম বিজ্ঞান, প্রকৌশল এবং অন্যান্য পেশাদার ক্ষেত্রে প্রবেশ করছে। তারা শুধু প্রশ্নের উত্তর দেয় না, বরং কাজগুলি বিভক্ত করে, টুলস ব্যবহার করে, পরীক্ষা চালায়, ফলাফল পড়ে, এবং ফিডব্যাকের ভিত্তিতে আরও কাজ করে।
এআইকে একজন প্রাথমিক ইঞ্জিনিয়ারের সাথে তুলনা করলে মনোযোগ মানব শ্রমের প্রতিস্থাপনের দিকে নিয়ে যায়। কিন্তু জেফ ডিন আরও গুরুত্বপূর্ণ একটি পরিবর্তনের দিকে মনোযোগ দেন: যখন একজন 'প্রাথমিক ইঞ্জিনিয়ার'কে ডজনে ডজনে, শতে শতে কপি করা যায়, এবং কয়েকদিন বা কয়েকসপ্তাহ পর্যন্ত সমান্তরালভাবে কাজ করে, তখন উৎপাদনের পদ্ধতি কীভাবে পরিবর্তিত হবে?
প্রাচীন দলে, জুনিয়র ইঞ্জিনিয়ারদের ব্যবসায়িক কাজে হাত দিতে হয়, টুলগুলি বুঝতে হয়, এবং নিয়মিত ফিডব্যাক পেতে হয়। এজেন্টও ঠিক তেমনি। শুধু এর প্রশিক্ষণের উপকরণগুলি শুধুমাত্র ডকুমেন্টেশন নয়, বরং প্রম্পট, টুল বর্ণনা, স্কিল ফাইল, টেস্টিং সিস্টেম, মূল্যায়নকারী, এবং সমগ্র কনটেক্সটual পরিবেশ।
এটি এআই ইঞ্জিনিয়ারিংয়ে একটি নতুন বিভাজন তৈরি করেছে।
অতীতে, ইঞ্জিনিয়ারদের মূলত কোড লেখার দায়িত্ব ছিল। ভবিষ্যতে, আরও বেশি ইঞ্জিনিয়ার সমস্যা সংজ্ঞায়িত করতে, পরিবেশ তৈরি করতে, নিয়মাবলী লিখতে, ফিডব্যাক লুপ ডিজাইন করতে এবং একটি সেট অ্যাজেন্টকে কাজ সম্পন্ন করতে সাজাতে ব্যস্ত হবেন।
জেফ ডিনের ২০২৭ সালের পূর্বাভাস ঠিক এইরকম। তিনি মনে করেন, মেশিন লার্নিং সিস্টেমগুলি ক্রমাগতভাবে মেশিন লার্নিং সিস্টেমগুলিকেই উন্নত করতে অংশগ্রহণ করবে। এগুলি লক্ষ্যকে উপ-সমস্যাগুলিতে বিভক্ত করবে, স্বয়ংক্রিয়ভাবে অসংখ্য পরীক্ষা চালাবে, ফলাফলগুলি তুলনা করবে এবং কার্যকরী সমাধানগুলি একত্রিত করে আরও শক্তিশালী নতুন সিস্টেম তৈরি করবে।
যে কোনো ক্ষেত্রে যদি পরিমাপযোগ্য লক্ষ্য থাকে, তাহলে বড় অগ্রগতির সুযোগ থাকে।
এটি সাক্ষাতকারের প্রথম চাবিকাঠি।
সবচেয়ে প্রথমে যে ক্ষেত্রে কৃত্রিম বুদ্ধিমত্তা স্বয়ংক্রিয়ভাবে প্রবেশ করবে, তা অবশ্যই সবচেয়ে বেশি জ্ঞানসমৃদ্ধ ক্ষেত্র নয়, বরং প্রতিক্রিয়া সবচেয়ে স্পষ্ট ক্ষেত্র। কোড কি টেস্ট পার করবে, চিপ লেআউট কি ক্ষেত্রফল কমাতে পারবে, মডেল স্ট্রাকচার কি সঠিকতা বাড়াতে পারবে, উপাদানের বৈশিষ্ট্যগুলি কি প্রয়োজনীয়তা পূরণ করছে—এই প্রশ্নগুলির জন্য সাপেক্ষভাবে স্পষ্ট মূল্যায়ন মানদণ্ড রয়েছে। শুধুমাত্র মূল্যায়নকারীটি যথেষ্ট নির্ভরযোগ্য হলে, মেশিনটি অত্যন্ত উচ্চ ফ্রিকোয়েন্সিতে পুনরাবৃত্তি পরীক্ষা চালাতে পারবে।
সুতরাং, এআই যুগে প্রকৃতপক্ষে গুরুত্বপূর্ণ একক হতে পারে একটি উত্তর নয়, বরং একটি সম্পূর্ণ বন্দর: প্রস্তাব প্রস্তুত করা, প্রস্তাব বাস্তবায়ন করা, ফলাফল পরিমাপ করা এবং দিকনির্দেশ সংশোধন করা।
দ্বিতীয়ত, গুগল সার্চকে পরিবর্তন করে একটি অংকের সমস্যা
জেফ ডিনের অনেক প্রতিনিধিত্বমূলক কাজ একটি খুব সাদামাটা শুরু থেকে শুরু হয়েছিল: প্রথমে ক্রমের পরিমাণ গণনা করুন।
২০০১ সালে, গুগল অনুসন্ধান এখনও হার্ড ডিস্কের উপর প্রচুর নির্ভর করছিল। হার্ড ডিস্কের ক্ষমতা বেশি ছিল, কিন্তু অ্যাক্সেস গতি ধীর ছিল। জেফ ডিন এবং সঞ্জয় ঘেমাওয়াত একটি অনুমান করেন, যেখানে তারা দেখেন যে গুগলের সম্পূর্ণ অনুসন্ধান ইনডেক্সটি একসময় সমস্ত সার্ভারের মেমোরিতে ফিট করে যেত।
আজকে এটি শুধু একটি স্টোরেজ মিডিয়া আপগ্রেড মনে হচ্ছে। কিন্তু সে সময়ে, এটি সম্পূর্ণ ভিন্ন সিস্টেম ডিজাইনকে বোঝাত।
যদি ইনডেক্স মূলত হার্ড ডিস্কে থাকে, তাহলে কোয়েরির জন্য মেকানিক্যাল সার্চের অপেক্ষা করতে হয়। শুধু ইনডেক্সটি মেমোরিতে রাখলেই অ্যাক্সেস ল্যাটেন্সি হঠাৎ করে কমে যায়। দুজন শীঘ্রই নতুন ভার্সন লিখে কয়েক দিনের মধ্যে এটিকে প্রোডাকশন এনভায়রনমেন্টে পাঠিয়ে দেয়। এতে Google সার্চ উল্লেখযোগ্যভাবে দ্রুত হয়ে যায়।
এই গল্পটিকে সহজেই একটি জিনিয়াসের হঠাৎ উদ্ভাবন হিসেবে প্রস্তুত করা যায়। কিন্তু জেফ ডিনের বক্তব্যটি একজন ইঞ্জিনিয়ারের মতো সাধারণ জ্ঞান প্রকাশ করে: সিস্টেমের শর্তগুলি পরিবর্তিত হয়েছে, যা আগে কাজ করত না, এখন কাজ করতে পারে, তাই আবার গণনা করা উচিত।
এই মুহূর্তে অনেক শিল্প উদ্ভাবন ঘটে।
একটি পুরনো সমস্যা দীর্ঘদিন ধরে বিদ্যমান ছিল, এবং মানুষ এটির চারপাশে প্যাচ করে চলেছিল। পরে, হার্ডওয়্যারের দাম, মেমোরির ক্ষমতা, নেটওয়ার্ক ব্যান্ডউইথ বা মডেলের ক্ষমতা কোনো সীমানা অতিক্রম করল, এবং পুরনো সীমাবদ্ধতা অদৃশ্য হয়ে গেল। কিন্তু বেশিরভাগ মানুষ এখনও পুরনো আর্কিটেকচার ব্যবহার করছে, কারণ সেই আর্কিটেকচারটি এখন সাধারণ জ্ঞান হয়ে গেছে।
জেফ ডিন যা করেন, তা হল সাধারণ জ্ঞানকে পুনরায় অনুমানে পরিণত করা।
সে জিজ্ঞাসা করবে: কেন এভাবেই হতে হবে? আজকের পরিমাণ গতকালের পরিমাণের মতোই কি? যদি সবচেয়ে ব্যয়বহুল পদক্ষেপটি পরিবর্তন করা হয়, তাহলে সম্পূর্ণ সিস্টেমটি কি সম্পূর্ণ ভিন্ন আকার ধারণ করবে?
এটিই তিনি উদ্যোক্তাদের জন্য পরামর্শ দিয়েছেন। শুধুমাত্র বর্তমান সমাধানগুলির অসুবিধাগুলি দেখবেন না, বরং প্রথম নীতি থেকে সমস্যাটি পুনরায় দেখুন। কি করে পারফরম্যান্সকে এক ক্রম বাড়ানো যায়? কি করে খরচকে দুই ক্রম কমানো যায়? কি করে শিল্পের ডিফল্ট বাস্তবায়নের পথটি আর অনুসরণ করা যায় না?
কখনও কখনও, আপনাকে শুধু একটি সমস্যার দিকে চোখ পিটপিট করে তাকাতে হবে, আজকের সমাধানে আটকে থাকবেন না, বরং প্রথম নীতি থেকে ভাবুন যে এটি কীভাবে সমাধান করা উচিত।
এটি কোনও রহস্য নয়। সত্যিকারের কঠিন বিষয় হলো, অধিকাংশ মানুষ একটি শিল্পে প্রবেশ করার পর দ্রুত সেই শিল্পের সমস্ত ডিফল্ট উত্তরগুলি শিখে ফেলে। অভিজ্ঞতা দক্ষতা বাড়ায়, কিন্তু পুনরায় প্রশ্ন করার ক্ষমতা হারিয়ে ফেলে।
তিন মিনিটের ভয়েস কেন একটি TPU-কে জন্ম দিয়েছিল
২০১৩ সালে, গুগলের ডিপ লার্নিং স্পিচ রিকগনিশন পুরানো সিস্টেমকে উল্লেখযোগ্যভাবে ছাড়িয়ে গেল। ভুলের হার অর্ধেক কমে গেল, যা গত বিশ বছরের স্পিচ রিকগনিশনের অগ্রগতিকে কয়েক মাসের মধ্যে একত্রিত করল।
পণ্য দল অবশ্যই উত্তেজিত। কিন্তু জেফ ডিন আগে একটি গণনা করলেন।
যদি ভয়েস রিকগনিশন প্রকৃতপক্ষে উন্নত হয়, তাহলে ব্যবহারকারীরা এটি ব্যবহার করতে বেশি ইচ্ছুক হবে। ধরে নিন, প্রতিটি গুগল ব্যবহারকারী প্রতিদিন শুধুমাত্র তিন মিনিট ভয়েস রিকগনিশন ব্যবহার করে, গুগলের কতগুলি সার্ভারের প্রয়োজন হবে?
ফলাফল অনুকূল নয়। সেই সময়ের CPU-এর দক্ষতার ভিত্তিতে, গুগলকে তার সার্ভার স্কেল দ্বিগুণ করতে হতে পারে।
এটিই TPU-এর শুরু।
এটি গবেষণা দলের হঠাৎ চিপ তৈরির ইচ্ছার কারণে নয়, এবং Google-এর হার্ডওয়্যার তৈরির ক্ষমতা প্রমাণের জন্যও নয়, বরং একটি সফল মডেল একটি অপ্রতিরোধ্য সার্ভিস খরচ তৈরি করতে চলেছে।
এই ইতিহাসটি একটি প্রায়শই উপেক্ষিত নিয়মকে প্রকাশ করে: মডেলের কার্যকারিতা উন্নত হওয়া সর্বদা খরচ কমায় না। বরং, যত ভালো কার্যকারিতা, তত বেশি ব্যবহার এবং সিস্টেমের চাপ বাড়ে।
যখন ভয়েস রিকগনিশন কাজ করে না, তখন ব্যবহারকারীরা কমই এটি ব্যবহার করে। সিস্টেমের খরচ সমস্যা নয়। যখন ভুলের হার অনেক কমে যায়, তখন চাহিদা হঠাৎ করে মুক্ত হয়ে পড়ে, যা আগে ব্যাকগ্রাউন্ডে লুকিয়ে ছিল সেই কম্পিউটিং ক্ষমতার সীমাবদ্ধতা প্রকাশ পায়।
TPU এর পথটি মেশিন লার্নিংয়ের সবচেয়ে কেন্দ্রীয় গণনা প্যাটার্নের জন্য স্পেশালাইজড হার্ডওয়্যার তৈরি করার উপর ফোকাস করে। এটি ব্রাউজার চালানোর প্রয়োজন নেই এবং সমস্ত জেনারিক প্রোগ্রাম প্রসেস করার দরকারও নেই। এটি মূলত লো-প্রিসিশন, ঘন লিনিয়ার বীজগণিতে দক্ষ। এই ধরনের গণনা আধুনিক মেশিন লার্নিংয়ের কেন্দ্রেই অবস্থিত।
প্রথম প্রজন্মের TPU শেষপর্যন্ত ক্রমিক লাভ আনে। জেফ ডিনের মতে, এটি সেই সময়ের CPU এবং GPU এর তুলনায় ৩০ থেকে ৮০ গুণ বেশি শক্তি সাশ্রয়ী ছিল এবং ২০ থেকে ৩০ গুণ কম ল্যাটেন্সি ছিল।
এটি একটি সহজেই উপেক্ষিত ডিজাইন পরিমাপ।
TPU খুব বিশেষায়িত, কিন্তু এতটাই বিশেষায়িত নয় যে এটি শুধুমাত্র একটি নির্দিষ্ট মডেল চালাতে পারে। টিমটি জানত যে মেশিন লার্নিং অ্যালগরিদমগুলি দ্রুত পরিবর্তিত হবে, তাই তারা চিপটিকে একটি সাধারণীকৃত রৈখিক বীজগণিত সিস্টেম হিসাবে ডিজাইন করেছে। এটি Chrome বা Word চালানোর ক্ষমতা ত্যাগ করেছে, কিন্তু ভবিষ্যতের অ্যালগরিদমের উন্নতির জন্য স্থান সংরক্ষণ করেছে।
এটি ধরে রাখা কঠিন একটি ভারসাম্য। যদি পর্যাপ্ত ব্যবহার না করা হয়, তবে আয় স্পষ্ট হয় না। যদি অত্যধিক ব্যবহার করা হয়, তবে অ্যালগরিদম পরিবর্তনের সাথে সাথে হার্ডওয়্যার পুরনো হয়ে যায়।
জেফ ডিন আজকের রিজনিং হার্ডওয়্যার সম্পর্কে যে মতামত দিয়েছেন, তা পুরনো TPU-এর সাথে স্পষ্টভাবে সামঞ্জস্যপূর্ণ। তিনি মনে করেন, পরবর্তী গুরুত্বপূর্ণ সুযোগ এখনও স্পেশালাইজেশনের মধ্যে রয়েছে, কিন্তু ফোকাস আরও কম ল্যাটেন্সি এবং কম শক্তি খরচের রিজনিং-এর দিকে সরে যাবে।
কল্পনা করুন, যদি বিলম্ব 50 গুণ উন্নত হয়, আপনি কী করতে পারবেন।
যখন মডেলের উত্তর দেওয়ার জন্য দশ কিছু সেকেন্ড লাগে, তখন মানুষ এটিকে কখনও কখনও পরামর্শ নেওয়ার একটি টুল হিসাবে ব্যবহার করে। যখন বিলম্ব প্রায় তাৎক্ষণিক হয়, তখনই এটি প্রকৃতপক্ষে ইন্টারঅ্যাকটিভ ইন্টারফেস, রোবট, রিয়েল-টাইম ভিডিও, অপারেটিং সিস্টেম এবং ধারাবাহিক সিদ্ধান্ত প্রক্রিয়ায় প্রবেশ করতে পারে।
অপেক্ষা করা একটি ছোট অভিজ্ঞতা সমস্যা নয়। অপেক্ষা করলে পণ্যের আকৃতি পরিবর্তিত হয়।
চতুর্থ, এআইয়ের খরচের কেন্দ্র হল গণনা নয়, বরং ডেটা স্থানান্তর।
যদি ২০২৬ সালের এআই ইঞ্জিনিয়ারদের জন্য “প্রতিটি ইঞ্জিনিয়ার যা জানা উচিত” এর একটি আপডেট সংস্করণ তৈরি করা হয়, তাহলে জেফ ডিন মনে করেন যে ফোকাস হার্ড ডিস্ক সার্চ, ক্যাশে মিস এবং মহাদেশীয় নেটওয়ার্ক ল্যাটেন্সির পরিবর্তে চিপের ভিতরের ডেটা ফ্লোয়ের দিকে সরানো উচিত।
ইঞ্জিনিয়ারদের জানা দরকার: মেইন মেমোরি থেকে চিপের মেমোরির ব্যান্ডউইথ কত, চিপের মেমোরি থেকে গুণন ইউনিটের ব্যান্ডউইথ কত, একটি গুণনের জন্য কতটা শক্তি প্রয়োজন, চিপগুলি কীভাবে পরস্পরের সাথে সংযুক্ত, এবং 500টি চিপকে 10,000টি চিপে স্কেল করলে নেটওয়ার্কের দক্ষতা কীভাবে কমবে।
এই সংখ্যাগুলি পণ্যের থেকে দূরে মনে হলেও, বাস্তবে এগুলি কোন পণ্য সফল হবে তা নির্ধারণ করে।
জেফ ডিন একটি অত্যন্ত প্রভাবশালী অনুপাত উল্লেখ করেছেন। একটি গাণিতিক গুণন সম্পন্ন করতে প্রায় এক পিকোজুল শক্তির প্রয়োজন। ডেটাকে হাই-ব্যান্ডউইথ মেমোরি থেকে কম্পিউটেশনাল ইউনিটে স্থানান্তরিত করার শক্তি খরচ প্রায় 1000 গুণ বেশি হতে পারে।
অন্যভাবে বললে, আজকের এআই সিস্টেমে খরচী কাজগুলি প্রায়শই গণনা করা নয়, বরং গণনার জন্য প্রয়োজনীয় জিনিসগুলি আনা।
এটিই ব্যাচ প্রসেসিংয়ের গুরুত্ব ব্যাখ্যা করে।
একবার মেমোরি থেকে কম্পিউটেশনাল ইউনিটে মডেল ওয়েটগুলি স্থানান্তরিত হওয়ার পর, যদি শুধুমাত্র একটি টোকেন প্রক্রিয়াকরণ করা হয়, তবে ডেটা স্থানান্তরের খরচ সম্পূর্ণরূপে সেই একটি টোকেনের উপর চাপিয়ে দেওয়া হয়। যদি একসাথে বড় ব্যাচ প্রক্রিয়াকরণ করা হয়, তবে একই ওয়েটগুলি বেশি কম্পিউটেশনকে সার্ভ করতে পারে, যার ফলে শক্তি এবং ব্যান্ডউইথ খরচ বিতরণ হয়।
কিন্তু ব্যাচ প্রসেসিং এবং লো ল্যাটেন্সি স্বাভাবিকভাবেই পরস্পর বিরোধী। একটি ব্যাচের জন্য প্রয়োজনীয় অনুরোধগুলি জমা হওয়ার জন্য সিস্টেম প্রায়শই অপেক্ষা করে। এতে থ্রুপুট বাড়ে, কিন্তু একক ব্যবহারকারীর প্রতিক্রিয়া সময় ধীর হতে পারে।
সুতরাং, অনেক যে সমস্যাগুলি মডেল স্তরের মতো দেখায়, বাস্তবে হার্ডওয়্যার এবং সিস্টেম সমস্যা। ট্রেনিংয়ের জন্য বড় ব্যাচ ব্যবহার করা হয় কেন, ইনফারেন্সের জন্য KV Cache প্রয়োজন কেন, মডেল কেন লো-প্রিসিশন অনুসরণ করে, সিস্টেম কেন কোয়ান্টাইজেশন প্রয়োজন—এসবের পিছনেই ডেটা ট্রান্সফার এবং শক্তির সীমাবদ্ধতা।
জেফ ডিন সাম্প্রতিক সময়ে উপসংহারের দিকে বেশি মনোযোগ দিচ্ছেন, কারণ উপসংহার অত্যন্ত ল্যাটেন্সি-সংবেদনশীল। প্রশিক্ষণ কাজগুলি ধীরে চললে শুধুমাত্র পরীক্ষাগুলি দেরিতে শেষ হয়। কিন্তু উপসংহার কাজে প্রতি এক সেকেন্ড বাড়লে এটি ব্যবহারকারীর অভিজ্ঞতা এবং এজেন্টের কার্যক্ষমতাকে সরাসরি প্রভাবিত করে।
যদি একটি এজেন্ট ১০০০ বার ক্রমাগত মডেল কল করে, তবে প্রতিটি কলের ল্যাটেন্সি ৫০% কমিয়ে সম্পূর্ণ টাস্কটির সময়ে বিপুল পার্থক্য আসতে পারে। এছাড়াও, ভবিষ্যতে এজেন্টগুলি কয়েক দিন বা কয়েক সপ্তাহ চলবে।
অতএব, এআই-এর "শক্তি সমস্যা" হল দূরবর্তী পরিবেশগত বিষয় নয়। এটি সরাসরি নির্ধারণ করে যে মডেলটি কতটা সস্তায় বেশি মানুষকে সেবা দিতে পারবে, এজেন্টটি কতক্ষণ চলবে, এবং স্টার্টআপের মোট লাভ সুস্থ কি না।
পাঁচ, মডেল শুধু একটি অংশ, প্রেক্ষাপটই এজেন্টের কাজের স্থান
গত কয়েক বছর ধরে, এআই শিল্প অগ্রগতি পরিমাপের জন্য প্যারামিটার সংখ্যা, প্রশিক্ষণ ডেটা এবং বেঞ্চমার্ক স্কোরের উপর নির্ভর করেছে। 2026 সালে, জেফ ডিন মডেলের চারপাশের সবকিছুকে বেশি গুরুত্ব দিচ্ছেন।
একটি প্রকৃতপক্ষে কার্যকরী এআই সিস্টেমের মডেলের পাশাপাশি রিট্রিভাল, টুলস, মেমোরি, ইতিহাসবিশিষ্ট তথ্য, এক্সিকিউশন পরিবেশ এবং ফিডব্যাক মেকানিজমও প্রয়োজন। মডেলটি জানে কোন টুলগুলি উপলব্ধ, কখন টুল কল করতে হবে, জটিল সমস্যাগুলিকে কীভাবে একটি অ্যাকশনের ধারাবাহিকতায় বিভক্ত করতে হবে, এবং বিভিন্ন পদ্ধতির তুলনা করে কোনটি বেশি সফল হওয়ার সম্ভাবনা রয়েছে তা নির্ণয় করতে পারে।
এটিই হল যে কারণে “কনটেক্সট ইঞ্জিনিয়ারিং” এখন মঞ্চের কেন্দ্রে আসছে।
জেফ ডিন বলেন, প্রশিক্ষণ পর্যায়ে মডেল যে তথ্যগুলি দেখেছে, সেগুলি শেষ পর্যন্ত হাজার বিলিয়ন থেকে ট্রিলিয়ন পরিমাণ প্যারামিটারের মধ্যে 'মিশ্রিত' হয়ে যায়। এগুলি একটি ঘন সুপের মতো, জ্ঞান উপস্থিত থাকে, কিন্তু সবসময় স্পষ্ট থাকে না। বর্তমান প্রসঙ্গে যে তথ্যগুলি প্রবেশ করানো হয়, সেগুলি মডেলের জন্য আরও সরাসরি এবং সঠিকভাবে ব্যবহারযোগ্য।
এটি ছোট দলগুলির জন্য একটি গুরুত্বপূর্ণ সুযোগ তৈরি করে।
বেস মডেল ট্রেনিংয়ের জন্য প্রচুর মূলধন, ডেটা এবং কম্পিউটেশনাল পাওয়ার প্রয়োজন। তবে কনটেক্সট ইঞ্জিনিয়ারিং শুধুমাত্র একটি API দিয়ে শুরু করা যায়। উদ্যোক্তারা নির্দিষ্ট ব্যবসার চাহিদা অনুযায়ী, ডোমেইন জ্ঞান, টুলস প্রক্রিয়া, ক্লায়েন্ট ডেটা এবং মূল্যায়ন মানদণ্ডগুলি সংগঠিত করে জেনারিক মডেলকে একটি সংকীর্ণ স্কেনারিওতে আরও বিশ্বস্তভাবে কাজ করতে পারেন।
জেফ ডিন নিজের একটি উদাহরণ উল্লেখ করেছেন।
তিনি সঞ্জয় ঘেমাওয়াতের সাথে প্রায়শই গুগলের অভ্যন্তরীণ লো-লেভেল লাইব্রেরি অপ্টিমাইজ করেন। এই ডেটা স্ট্রাকচারগুলি মিলিয়ন মিলিয়ন প্রসেসে চলতে পারে, এক পয়েন্ট পারফরম্যান্সের পার্থক্যগুলি স্কেল দ্বারা বড় হয়ে যায়। প্রচলিত পদ্ধতিতে, ইঞ্জিনিয়াররা প্রথমে মাইক্রো-বেঞ্চমার্ক লেখেন, বর্তমান পারফরম্যান্স মাপেন, তারপর কোড পরিবর্তন করেন, বেঞ্চমার্ক পুনরায় চালান, ক্যাশে ব্যবহার এবং পারফরম্যান্সের পরিবর্তন পর্যবেক্ষণ করেন, এবং তারপর পুনরাবৃত্তি করেন।
দুজন এই কাজের পদ্ধতিটিকে একটি এজেন্ট দক্ষতা হিসাবে লিখেছেন। মডেলটি বেঞ্চমার্ক চালানো, কোড পরিবর্তন করা, ফলাফল তুলনা করা এবং পরিমাপের ভিত্তিতে আরও উন্নতি করা শিখেছে।
আমরা শুধু মানুষের যে পদ্ধতি ব্যবহার করে, তা মডেলের ব্যবহারের জন্য ফর্ম্যাট করে দিয়েছি।
এই বাক্যটিকে প্রায় প্রসঙ্গ প্রকৌশলের সাদাসিধে সংজ্ঞা হিসাবে বিবেচনা করা যেতে পারে।
এটি কোনো রহস্যময় প্রম্পট ট্রিক নয়, আবার বেশি ব্যাকগ্রাউন্ড মেটেরিয়াল জমা করাও নয়। এটি তিনটি প্রশ্নের উত্তর দেওয়া: বিশেষজ্ঞরা কী ধাপগুলি অনুসরণ করেন, সিস্টেমে কোন নির্ভরযোগ্য টুলগুলি রয়েছে, এবং ফলাফলগুলি কীভাবে যাচাই করা উচিত।
যখন এই কন্টেন্টগুলি স্ট্রাকচারাইজড হয়, তখন মডেলটি আরও বেশি জ্ঞান পায় না, বরং একটি পুনরাবৃত্তি করা যায় এমন পদ্ধতির সেট পায়।
এই কারণেই «দক্ষতা (skill)» এজেন্ট ইকোসিস্টেমের একটি গুরুত্বপূর্ণ সম্পদ হয়ে উঠেছে। একটি উত্তম দক্ষতা ফাইল সম্ভবত একটি দলের বছরের পর বছর জমা হওয়া অস্পষ্ট অভিজ্ঞতা প্যাকেজ করে। এটি মডেলকে বলে যে কোনো ধরনের সমস্যা দেখা দিলে প্রথমে কী করবে, কোন ভুলগুলি সবচেয়ে সাধারণ, কোন টুলগুলির উপর বিশ্বাস করা যায়, এবং কীভাবে বোঝা যায় যে ফলাফলটি সম্পন্ন হয়েছে।
ভবিষ্যতের কোম্পানিগুলির পার্থক্য শুধু মডেল ওয়েটসেই সীমাবদ্ধ থাকবে না, বরং এই কাজের প্রবাহে কোডযুক্ত অভিজ্ঞতাগুলিতেও থাকবে।
ষষ্ঠ, এজেন্ট কেন ৩০ম পদক্ষেপে নিয়ন্ত্রণ হারায়
প্রায় সব প্রকৃত এজেন্ট বাস্তবায়নকারী দলই একই ধরনের পরিস্থিতি দেখেছে।
প্রথম কয়েকটি ধাপ খুব ভালো চলছিল। মডেলটি প্রয়োজনীয়তা পড়তে পারে, টুল কল করতে পারে, কোড লিখতে পারে। কিন্তু ৩০তম বা ৫০তম ধাপে, এটি লক্ষ্য ভুলে যায়, অবস্থা ভুলবুঝি করে, একই কাজ পুনরাবৃত্তি করে, অথবা একটি ভুল দিকে আরও দূরে চলে যায়।
জেফ ডিন একটি কারণ হিসেবে আউট-অফ-ডিস্ট্রিবিউশন সমস্যাকে উল্লেখ করেছেন।
মডেলটি প্রশিক্ষণের সময় অসংখ্য সাধারণ কাজ দেখেছে। যতক্ষণ কাজটি এর পরিচিত 'উজ্জ্বল পথ'-এর মধ্যে থাকে, পারফরম্যান্স সাধারণত ভালো থাকে। যখন ক্রমাগত অপারেশনগুলি এটিকে অপরিচিত অবস্থার দিকে নিয়ে যায়, তখন পারফরম্যান্স হঠাৎ করে কমে যায়। যত বেশি আরামদায়ক অঞ্চল থেকে বিচ্যুত হয়, ততই ভুলগুলি সহজেই জমা হয়।
একটি সমাধান হলো দক্ষতা এবং টিপস প্রদান করে মডেলটিকে এর পরিচিত পথের মধ্যে সীমাবদ্ধ রাখা। অন্য একটি পদ্ধতি হলো মাল্টি-এজেন্ট সিস্টেম ব্যবহার করা।
একাধিক এজেন্ট বিভিন্ন পদ্ধতি পরীক্ষা করতে পারে, এবং অন্য একটি মডেল মূল্যায়নকারী হিসেবে কাজ করে কোন দিকগুলি বেশি প্রতিশ্রুতিশীল তা নির্ধারণ করে। ব্যর্থ শাখাগুলি বাদ দেওয়া হয়, এবং সফল শাখাগুলি এগিয়ে যায়। এটি মূলত যুক্তির পর্যায়ে অনুসন্ধান করা।
এটি মানুষের দলের কাজের পদ্ধতির সাথে পরিচিত। জটিল সমস্যার সম্মুখীন হয়ে, একজন সমাধান প্রস্তাব করে, অন্যজন ঝুঁকি পরীক্ষা করেন, এবং তৃতীয়জন পরীক্ষা চালান। দলটি প্রথম ধারণার উপর সমস্ত আশা নির্ভর করে না, বরং কাজের বিভাজন এবং ফিডব্যাকের মাধ্যমে একক বিন্দুর ভুল কমায়।
এজেন্ট যত বেশি সময় চলবে, সিস্টেম ডিজাইন তত কম একবারে সঠিক হওয়ার উপর নির্ভর করবে।
একটি প্রকৃতপক্ষে নির্ভরযোগ্য দীর্ঘ-পরিসর এজেন্টের জন্য চেকপয়েন্ট, স্টেট ম্যানেজমেন্ট, রোলব্যাক, ব্রাঞ্চ এক্সপ্লোরেশন, বাহ্যিক মূল্যায়ন, অনুমতি নিয়ন্ত্রণ এবং ব্যতিক্রম পুনরুদ্ধার প্রয়োজন। এটি একটি অতি-দীর্ঘ চ্যাট উইন্ডোর চেয়ে একটি ডিস্ট্রিবিউটেড সিস্টেমের মতো।
এটিই হল যে জায়গায় জেফ ডিনের পটভূমি আবার গুরুত্বপূর্ণ হয়ে উঠছে।
ম্যাপরিডিউসের মূল সমস্যাগুলির মধ্যে একটি হল অসংখ্য অবিশ্বস্ত মেশিনকে বিশ্বস্ত গণনা সম্পন্ন করতে কীভাবে সক্ষম করা যায়। আজকের এজেন্ট সিস্টেম একই বিরোধের সম্মুখীন: একবারের মডেল কল আদর্শ নয়, টুলগুলি ব্যর্থ হতে পারে, কিন্তু সম্পূর্ণ কাজটি যতটা সম্ভব স্থিতিশীলভাবে সম্পন্ন করতে হবে।
ভবিষ্যতের উৎকৃষ্ট এজেন্ট প্ল্যাটফর্মটি অনেক বিকেন্দ্রীকৃত সিস্টেমের ধারণা গ্রহণ করতে পারে। কাজগুলি বিভক্ত করা যেতে পারে, ফলাফলগুলি যাচাই করা যেতে পারে, ব্যর্থতা পুনরায় চেষ্টা করা যেতে পারে, অবস্থা পুনরুদ্ধার করা যেতে পারে, এবং স্থানীয় ত্রুটি সম্পূর্ণ প্রক্রিয়াকে ধ্বংস করা উচিত নয়।
যখন জেফ ডিন বলেন যে এজেন্ট কয়েক দিন বা কয়েক সপ্তাহ চলবে, তখন তিনি একটি দীর্ঘতর চ্যাটের কথা বলছেন না। তিনি একটি নতুন কম্পিউটিং অবকাঠামোর কথা বলছেন।
সাত, দুই বা তিনজন কিভাবে গুগলকে পরাজিত করবেন: যে সমস্যার মডেলের সফলতার হার মাত্র 1% তা খুঁজুন
স্টার্টআপ স্কুলের প্রেক্ষাপটে, সবচেয়ে বেশি আলোচিত প্রশ্নটি অবশ্যই স্টার্টআপের সুযোগ।
গুগল চিপ, ডেটা সেন্টার, মডেল এবং পণ্য ডিজাইনে সহযোগিতা করতে পারে। জেমিনির মতো সাধারণ মডেলগুলি এখনও দ্রুত সক্ষমতার সীমানা বাড়াচ্ছে। দুই বা তিনজনের একটি দল কীভাবে জিতবে?
জেফ ডিনের উত্তরটি রোমান্টিক নয়।
ছোট দলগুলির সুযোগ সাধারণ মডেলগুলি যথেষ্ট মনোযোগ দেয়নি এমন নির্দিষ্ট ক্ষেত্রগুলিতে বিদ্যমান। উদ্যোক্তারা পণ্য ইন্টারফেস, স্বত্বাধিকারসম্পন্ন ডেটা, কাজের প্রবাহ এবং ক্ষেত্রের দক্ষতা একত্রিত করে একটি সংকীর্ণ পরিস্থিতিতে উচ্চতর সঠিকতা এবং উন্নত অভিজ্ঞতা প্রদান করতে পারেন।
কিন্তু তিনি তৎক্ষণাৎ সতর্কবার্তা দেন: জেনেরিক মডেলগুলি দ্রুত শক্তিশালী হয়ে উঠছে। আজ যেসব স্বতন্ত্র পণ্য ফিচার দেখা যাচ্ছে, ছয় বা বারো মাস পরে সেগুলি হয়তো মূল মডেল দ্বারা সরাসরি কভার করে ফেলা হবে।
অতএব, উদ্যোক্তাদের নিজেদের সুবিধাগুলির টেকসই প্রকৃতি বিচার করতে হবে।
জেফ ডিন একটি খুব নির্দিষ্ট ছাঁটাই মানদণ্ড দিয়েছেন: বর্তমানে সাধারণ মডেলের সফলতার হার 20% হওয়া কাজের পরিবর্তে, যেসব কাজের সফলতার হার প্রায় 0% বা 1% তা খোঁজুন।
যদি মডেলটি সম্পূর্ণভাবে ব্যর্থ হয়, তবে এটি একটি ভালো সংকেত হতে পারে। যদি এটি ইতিমধ্যে কিছুটা করতে পারে, কিন্তু খুব ভালোভাবে না করে, তবে এটি অবশ্যই ভালো সংকেত নয়।
কারণটি খুব সহজ। 20% মানে ক্ষমতা শুরু হয়েছে। আরও বেশি ডেটা, বড় মডেল এবং দীর্ঘতর যুক্তিসঙ্গত প্রক্রিয়া দ্রুত এটিকে ব্যবহারযোগ্য অবস্থায় নিয়ে আসবে। 0% বা 1% হলে বোঝা যায় যে কাজটির জন্য প্রয়োজনীয় ডেটা, বিশেষ টুল, ক্ষেত্রের ফিডব্যাক বা একটি সাধারণ মডেলের সংক্ষিপ্ত সময়ের মধ্যে অর্জনযোগ্য নয় এমন ক্ষমতা অনুপস্থিত।
এটিকে জেফ ডিনের "1% নিয়ম" বলা যেতে পারে।
এটি উদ্যোক্তাদের সবচেয়ে কঠিন সমস্যাগুলির দিকে মনোনিবেশ করার পরামর্শ দেয় না, বরং সাধারণ মডেলগুলির গঠনগত অন্ধবিন্দুগুলি খুঁজে বের করার পরামর্শ দেয়।
এই অন্ধবিন্দু তিন প্রকারের।
প্রথম ধরনের হল স্বত্বাধিকার প্রাপ্ত ডেটা। জেনেরিক মডেলগুলি বিশ্বের তথ্য সংগঠিত করতে পারে, কিন্তু কোনো ব্যবহারকারীর সম্পূর্ণ প্রোফাইল, কোনো কোম্পানির অভ্যন্তরীণ প্রক্রিয়া, বা কোনো ডিভাইস দ্বারা উৎপাদিত রিয়েল-টাইম ডেটা অ্যাক্সেস করতে পারে না। এই ডেটা পাওয়ার পর স্টার্টআপ পণ্যগুলি বেসিক মডেলগুলির থেকে ভিন্ন দৃষ্টিভঙ্গি অর্জন করতে পারে।
দ্বিতীয় ধরন হল পেশাদার মূল্যায়ন। অনেক শিল্পে উৎপাদন ক্ষমতার অভাব নয়, বরং বিশ্বস্ত বিচারের অভাব রয়েছে। চিকিৎসা, উপাদান, চিপ, উৎপাদন এবং বৈজ্ঞানিক গবেষণা, সবকিছুরই উচ্চ মানের যাচাইকরণ প্রয়োজন। যিনি "কী সঠিক" তা সংজ্ঞায়িত করতে পারেন, তিনিই Agent-কে ধারাবাহিকভাবে অপ্টিমাইজ করতে পারবেন।
তৃতীয় ধরন হল সংকীর্ণ এবং গভীর মডেল। অ্যালফাফোল্ড একটি সাধারণ চ্যাট মডেল নয়, এটি প্রোটিন গঠনের সমস্যার জন্য অত্যন্ত বিশেষায়িত ক্ষমতা তৈরি করেছে। উপাদান বিজ্ঞান, চিপ ডিজাইন এবং অন্যান্য বিশেষায়িত ক্ষেত্রগুলিতেও এই ধরনের সুযোগ দেখা দিতে পারে।
এই বিচার প্রতিষ্ঠাতাদের জন্য সহজ নয়। এটি দলকে মডেলের ক্ষমতার সীমাবদ্ধতা এবং শিল্পের গভীরের সমস্যা উভয়ই বুঝতে হয়। শুধু AI বুঝলে, প্ল্যাটফর্ম দ্বারা দ্রুত গ্রহণ করা ফাংশনগুলি তৈরি করা সহজ। শুধু শিল্প বুঝলে, মডেলের প্রগতির গতি হয়তো অবহেলা করা হয়।
সত্যিকারের সুযোগ দুটির সীমানায় অবস্থিত।
৮. যখন কোড দুর্লভ না থাকে, তখন স্পেসিফিকেশন, স্বাদ এবং সমস্যার বাছাই বেশি মূল্যবান হয়ে ওঠে
ডায়ানা একটি অনুমান প্রস্তাব করেন: যদি ভবিষ্যতে প্রতিটি প্রতিষ্ঠাতা একসাথে ৫০, ১০০ টি এজেন্ট পরিচালনা করতে পারেন এবং সমস্ত কোড এজেন্ট দ্বারা লেখা হয়, তবে কোন দক্ষতা বিরল হয়ে পড়বে?
জেফ ডিনের উত্তর ছিল "স্বাদ"।
এটি ঠিক করা যে এজেন্টটিকে কী করতে হবে।
তিনি মনে করেন, গবেষণার বেশিরভাগ মূল্য পরীক্ষা কতটা দক্ষতার সাথে সম্পন্ন করা হয়েছে তার উপর নির্ভর করে না, বরং একটি গবেষণার যোগ্য সমস্যা নির্বাচন করা হয়েছে কিনা তার উপর। একটি দল সবচেয়ে পরিপূর্ণ পদ্ধতিতেও একটি অপ্রাসঙ্গিক গবেষণা সম্পন্ন করতে পারে। অথবা, একটি মৌলিক সমস্যাকে ধরে রাখতে পারে, যা সমাধান করলেই পুরো ক্ষেত্রটিকে পরিবর্তন করে দেবে।
এজেন্ট বাস্তবায়ন খরচ কমিয়ে দেওয়ার পরে, সমস্যা বাছাইয়ের গুরুত্ব আরও বেড়ে যাবে।
অতীতে, একটি অস্পষ্ট ধারণা বিকাশ খরচ অত্যধিক হওয়ায় স্বাভাবিকভাবেই মুছে যেত। ভবিষ্যতে, যথেষ্ট এজেন্টকে সক্রিয় করলে অনেক ধারণাই দ্রুত প্রোটোটাইপে পরিণত হবে। এর ফলে বিশ্বে স্বয়ংক্রিয়ভাবে বেশি ভালো পণ্য তৈরি হবে না, শুধুমাত্র বেশি পণ্যই তৈরি হবে।
স্পেসিফিকেশনও আরও গুরুত্বপূর্ণ হয়ে উঠবে।
জেফ ডিন বলেছেন, ভার্চুয়াল এজেন্টের সাথে কাজ করার সময় লক্ষ্য যত স্পষ্ট হবে, সাফল্যের সম্ভাবনা তত বেশি হবে। অতীতে, অস্পষ্ট প্রয়োজনীয়তা একজন অভিজ্ঞ ইঞ্জিনিয়ারকে দেওয়া হত, যিনি প্রশ্ন করতে পারতেন এবং সাধারণ পটভূমির ভিত্তিতে ইচ্ছাকে পূরণ করতে পারতেন। এজেন্টও প্রশ্ন করতে পারে, কিন্তু প্রসঙ্গের অভাবে এটি নিজেই অনুমান করার ঝোঁক বেশি।
একটি সাধারণ উচ্চ সফলতার কাজ হল একটি সফটওয়্যারকে একটি প্রোগ্রামিং ভাষা থেকে অন্য একটি ভাষায় স্থানান্তর করা। কারণটি হল স্থানান্তরটি সহজ নয়, বরং স্পেসিফিকেশনটি অত্যন্ত সম্পূর্ণ। পুরনো কোডটি আচরণকে সংজ্ঞায়িত করে, টেস্টগুলি সীমানা সংজ্ঞায়িত করে, এবং Agent নতুন ভার্সনটি একইভাবে আচরণ করা পর্যন্ত ধাপে ধাপে তুলনা করতে পারে।
এখন এজেন্ট আপনার জন্য সফটওয়্যার লিখতে পারে, কিন্তু আপনি ঠিক কী চান তা ব্যাখ্যা করা আরও গুরুত্বপূর্ণ হয়ে উঠেছে।
এই বাক্যটি সোঁচার এআই-নেটিভ সংগঠনগুলির জন্য সরাসরি প্রেরণা দেয়।
ভবিষ্যতের ম্যানেজাররা শুধু কাজ বণ্টন করবেন না, বরং আরও স্পষ্ট লক্ষ্য এবং গ্রহণযোগ্যতা মানদণ্ড তৈরি করবেন। ডিজাইন ডকুমেন্টগুলি শুধুমাত্র টিমের মধ্যে যোগাযোগের জন্য নয়, বরং মেশিনের জন্য ইনপুটও হয়ে উঠবে। টেস্টিং, মেট্রিক্স, সীমাবদ্ধতা এবং উদাহরণগুলি ডেভেলপমেন্ট প্রক্রিয়ার শেষের দিক থেকে কাজের সংজ্ঞা পর্যায়ে সরিয়ে আনা হবে।
প্রিয় কিভাবে প্রশিক্ষণ দেওয়া হয়, তার বিষয়ে জেফ ডিন খুব ব্যবহারিক পদ্ধতি প্রস্তাব করেছেন।
পরবর্তী ১২ মাসে গুরুত্বপূর্ণ হওয়ার সম্ভাবনা রাখে এমন কিছু বিষয় লিখুন। আপনাকে সবগুলো করতে হবে না। ১২ মাস পর পুনরায় পরীক্ষা করুন যে কোনগুলো সত্যি হয়েছে, কোনগুলো অন্যরা করেছে, আর কোনগুলোর কোনো প্রগতি হয়নি। প্রতিশ্রুতির নমুনা সংগ্রহ করে ধারাবাহিকভাবে, মানুষ ধীরে ধীরে তাদের বিচারকে সমন্বয় করে।
স্বাদ কেবলমাত্র জন্মগত দক্ষতা নয়। এটি পুনর্বিশ্লেষণ এবং প্রশিক্ষণের মাধ্যমেও বিকাশ করা যেতে পারে।
নয়। ভালো চিন্তার পরীক্ষা, প্রথমে শিল্পের সবচেয়ে দৃঢ় ধারণাগুলি সরিয়ে ফেলুন
সাক্ষাতকারের দ্বিতীয় অংশে, জেফ ডিন একটি পাগলামির মতো চিন্তার পরীক্ষা শেয়ার করেন।
গত ৬০ বছর ধরে চিপ শিল্প ছোট, স্থিতিশীল এবং ত্রুটির হার কম ট্রানজিস্টরের দিকে এগিয়ে গেছে। ধারণা করা হয়েছে যে, একই ডিজাইনে তৈরি চিপগুলি যতটা সম্ভব সম্পূর্ণরূপে একই হওয়া উচিত, বিট ফ্লিপ যত কম হবে তত ভালো।
বড় বিতরিত সিস্টেমগুলিতে, ইঞ্জিনিয়াররা একটি উপাদানের ব্যর্থ হওয়াকে স্বীকার করেছে। হার্ড ড্রাইভ ক্ষতিগ্রস্ত হতে পারে, মেশিনগুলি ক্রাশ হতে পারে, সুইচগুলি সমস্যায় পড়তে পারে। সিস্টেমের বিশ্বস্ততা প্রতিটি অংশের কখনও ভুল না করার উপর নির্ভর করে না, বরং পুনরুৎপাদন, যাচাইকরণ, অতিরিক্ত এবং পুনরুদ্ধারের উপর নির্ভর করে।
তাই জেফ ডিন জিজ্ঞাসা করলেন: যদি ট্রানজিস্টর প্রতিদিন 20 বার ভুল করে, যদি কয়েক মিলিয়ন বছরে একবার ভুল করে না, তাহলে কী হবে?
এটি একটি বাস্তব পণ্য পরিকল্পনা নয়। তিনি শুধুমাত্র একটি পরিচিত ধারণাকে সরিয়ে ফেলার চেষ্টা করছেন। সম্ভবত অত্যন্ত অবিশ্বস্ত ট্রানজিস্টরগুলি সম্পূর্ণ ভিন্নভাবে তৈরি করা যেতে পারে, এবং সিস্টেমটি বহুপথ এবং উচ্চস্তরের অতিরিক্ততা দ্বারা ফলাফল নিশ্চিত করবে।
অধিকাংশ চিন্তার পরীক্ষা চূড়ান্তভাবে পণ্যে পরিণত হয় না। অনেক শিল্প পদ্ধতি দশকের পর দশক ধরে চলে আসছে, যার প্রকৃতপক্ষে যথেষ্ট কারণ রয়েছে। কিন্তু জেফ ডিন মনে করেন, এই কারণগুলি নিয়মিতভাবে পুনরায় পরীক্ষা করা উচিত।
ম্যাপরিডিউস এই ধরনের প্রক্রিয়া থেকে এসেছে।
গুগলের প্রাথমিক ক্রলার এবং ইনডেক্সিং সিস্টেমে অসংখ্য হাতে লেখা সমান্তরাল কোড, চেকপয়েন্ট এবং ব্যর্থতা পুনরুদ্ধার যুক্তি ছিল। প্রকৃত ব্যবসায়িক গণনা প্রায়শই খুব সহজ হত, যেমন সমস্ত ওয়েবপেজ পড়া এবং পৃষ্ঠার ভাষা চিহ্নিত করা। কিন্তু বহু সিস্টেম কোড সহজ ইচ্ছাকে ডুবিয়ে দিয়েছিল।
জেফ ডিন এবং সঞ্জয় ঘেমাওয়াত ফাংশনাল প্রোগ্রামিং থেকে অনুপ্রেরণা পেয়েছিলেন। তারা বড় পরিমাণের কাজকে ম্যাপ এবং রিডিউসে হিসাবে বিমূর্ত করেছিলেন, এবং সম songকালিতা, স্কিডিউলিং, ত্রুটি সহনশীলতা এবং পুনরায় চেষ্টা করার মতো বিষয়গুলিকে একটি একক ফ্রেমওয়ার্কের মধ্যে স্থানান্তরিত করেছিলেন। ব্যবসায়িক ডেভেলপারদের শুধুমাত্র গণনা প্রকাশ করতে হয়।
এই ডিজাইনটি মেশিনকে ভুলমুক্ত করেনি। এটি ভুলগুলিকে সিস্টেম শোষণ করতে সক্ষম করেছে।
আজকের এজেন্ট ইঞ্জিনিয়ারিংও সম্ভবত একই পর্যায়ে রয়েছে। বড় পরিমাণে টিম এখনও প্রতিটি কাজের জন্য হাতে হাতে প্রম্পট, পুনরায় চেষ্টার যুক্তি এবং টুল কল ব্যবস্থা করছে। ভবিষ্যতে, কি একটি ম্যাপরিডিউসের মতো সরল অ্যাবস্ট্রাকশন আসবে, যা দীর্ঘ-পরিসরের এজেন্টের বিভাজন, যাচাইকরণ, পুনরুদ্ধার এবং সম songোগিকভাবে অনুসন্ধানকে নিম্ন-স্তরের ক্ষমতা হিসেবে করে তুলবে?
এটি হয়তো পরবর্তী প্রজন্মের ইনফ্রাস্ট্রাকচার কোম্পানির জন্য সুযোগ।
দশমত, এআই আরও ভালো এআই তৈরি শুরু করেছে, বৈজ্ঞানিক পদ্ধতিকে হাই-স্পিড সাইকেলে সংকুচিত করা হয়েছে
জেফ ডিন ভবিষ্যতের জন্য সবচেয়ে উত্তেজিত দিকটি হল বিজ্ঞানের পদ্ধতিটিকে স্বয়ংক্রিয় করা।
প্রাচীন গবেষণা প্রক্রিয়াটি হলো পরিকল্পনা করা, পরীক্ষা ডিজাইন করা, পরীক্ষা চালানো, ফলাফল বিশ্লেষণ করা, এবং পরবর্তী পরিকল্পনা তৈরি করা। এই চক্রের গতি দীর্ঘদিন ধরে পরীক্ষার খরচ এবং যাচাইয়ের বিলম্বের দ্বারা সীমাবদ্ধ ছিল।
এআই দুটি অংশকে পরিবর্তন করতে পারে।
একটি অংশ হল আরও বেশি পরীক্ষা স্বয়ংক্রিয়ভাবে প্রস্তাব এবং বাস্তবায়ন করা। অন্যটি হল ব্যয়বহুল ভেরিফায়ারকে সস্তা আনুমানিক মডেলে পরিণত করা।
জেফ ডিন কোয়ান্টাম রসায়নের উদাহরণ উল্লেখ করেন। গবেষকদের একটি অণুর কনফিগারেশনের বৈশিষ্ট্য নির্ধারণ করতে হলে ডেনসিটি ফাংশনাল থিওরি সিমুলেশন চালাতে হয়। একটি সিমুলেশনে পুরো রাত লাগতে পারে। গুগলের গবেষকরা বহু সিমুলেশন ইনপুট এবং আউটপুট ব্যবহার করে একটি নিউরাল নেটওয়ার্ক অ্যাপ্রক্সিমেটর প্রশিক্ষিত করেছেন। এটি মূল সিমুলেটরের সঠিকতার কাছাকাছি, কিন্তু প্রায় ৩০ লক্ষ গুণ দ্রুত।
প্রমাণীকরণ গতি পরিবর্তনের পরে, বৈজ্ঞানিক প্রশ্নের রূপও পরিবর্তিত হয়।
গতকাল 10 মিলিয়ন প্রার্থী পরীক্ষা করা ছিল একটি কয়েক মাসের কম্পিউটেশনাল প্রকল্প। এখন, গবেষকদের একটি দুপুরের খাবার খাওয়ার সময়েই সিস্টেম প্রাথমিক ফিল্টারিং শেষ করে দেয়। পরীক্ষাগুলি আর মূল্যবান একক বেট নয়, বরং হাই-ফ্রিকোয়েন্সি অনুসন্ধানে পরিণত হয়েছে।
এটি হল AlphaEvolve, AlphaChip ইত্যাদি সিস্টেমের পিছনে সাধারণ যুক্তি। মডেল প্রস্তাব দেয়, টুলগুলি প্রস্তাবটি বাস্তবায়ন করে, এবং মূল্যায়ক ফলাফলগুলি ছাঁটাই করে, উত্তম ফলাফলগুলি পরবর্তী চক্রে যায়। যতক্ষণ ক্লোজড-লুপটি যথেষ্ট দ্রুত, সিস্টেমটি বিশাল সমাধান স্পেসে অবিরত অনুসন্ধান করতে পারে।
মেশিন লার্নিং নিজেই এই স্বয়ংক্রিয় বিজ্ঞানের বিষয় হয়ে উঠবে।
আজকাল, বড় গবেষণা দলগুলি সাধারণত মানুষ দ্বারা নতুন আর্কিটেকচার বা ট্রেনিং পদ্ধতি প্রস্তাব করা হয়, যা প্রথমে ছোট স্কেলের পরীক্ষায় চালানো হয় এবং তারপর প্রায়শই প্রতিশ্রুতিশীল পদ্ধতিগুলি বড় করে তোলা হয়। জেফ ডিন মনে করেন, মডেলগুলির এই প্রক্রিয়ার অধিকাংশ পদক্ষেপগুলি নিয়ে নেওয়ার কোনও মৌলিক বাধা নেই। মানুষ উচ্চস্তরের দিকনির্দেশনা দেয়, এবং সিস্টেমটি স্বয়ংক্রিয়ভাবে স্ট্রাকচার, ডেটা রেসিপি এবং ট্রেনিং কৌশলগুলির অনুসন্ধান করে, এবং সফল পরীক্ষাগুলিকে একত্রিত করে নতুন মডেলগুলি তৈরি করে।
ভবিষ্যতে গবেষণার দক্ষতা পরিমাপের মাপকাঠি শুধুমাত্র সেকেন্ডে ফ্লোটিং পয়েন্ট অপারেশন নয়, বরং "প্রতি ইউনিট ক্যালকুলেশন থেকে কতটা কার্যকর আবিষ্কার উৎপাদন হয়" হতে পারে।
ক্যালকুলেশন ক্ষমতা অবশ্যই গুরুত্বপূর্ণ। কিন্তু ক্যালকুলেশন ক্ষমতাকে আবিষ্কারে রূপান্তরিত করা আরও গুরুত্বপূর্ণ।
১১। নিউরিপস দ্বারা প্রত্যাখ্যাত ডিস্টিলেশন পেপার এবং ব্যর্থতাকে কীভাবে দেখবেন
২০১৪ সালে, জেফ ডিন, জেফ্ফ হিনটন এবং ওরিওল ভিনিয়ালস একটি জ্ঞান ডিস্টিলেশন সম্পর্কিত পেপার জমা দেন। আজ, জ্ঞান ডিস্টিলেশন মডেল কম্প্রেশন এবং ক্ষমতা স্থানান্তরের একটি মৌলিক পদ্ধতি হয়ে উঠেছে। বড় মডেলগুলি শিক্ষক হিসাবে কাজ করে এবং ছোট, দ্রুততর এবং কম খরচের শিক্ষার্থী মডেলগুলিকে ক্ষমতা স্থানান্তরিত করে।
এই প্রবন্ধটি পরবর্তীতে গভীর প্রভাব ফেলেছিল, কিন্তু তখন NeurIPS দ্বারা প্রত্যাখ্যাত হয়েছিল।
একজন সমালোচক মনে করেন যে এটি "বড় প্রভাব ফেলার সম্ভাবনা কম"। আগ্রহী পাঠকরা পড়তে পারেন: "অস্বীকৃত = ব্যর্থতা নয়! এই উচ্চ-প্রভাবশালী গবেষণাপত্রগুলি সমস্ত শীর্ষ কনফারেন্সে অস্বীকৃত হয়েছিল।"
জেফ ডিন এই অভিজ্ঞতা নিয়ে ক্রোধ প্রকাশ করেননি। তিনি বলেন, সমালোচকদের সম্ভবত বড় পরিসরের এআই সেবা নিয়ে বাস্তবসম্মত সমস্যাগুলির প্রতি সচেতনতা নেই। গুগলের জন্য, মহাকাশীয় মডেলগুলিকে কয়েকশত মিলিয়ন ব্যবহারকারীকে সেবা প্রদানের জন্য ছোট মডেলে রূপান্তরিত করা অত্যন্ত গুরুত্বপূর্ণ। যারা শুধুমাত্র তাত্ত্বিক নবীনতার দিকেই মনোযোগ দেন, তাদের জন্য এটি যথেষ্ট 'মৌলিক' মনে হতে পারে না।
পেপারটি প্রত্যাখ্যাত হওয়ার পর টিমটি এটিকে arXiv-এ আপলোড করে। শিল্পটি এটি পড়েছে এবং এটি ব্যবহার শুরু করেছে।
আজ, জেমিনির ফ্ল্যাশ মডেলটি ছোট আকার এবং কম ল্যাটেন্সির সাথে শক্তিশালী ক্ষমতা বজায় রাখতে পারে, এবং ডিসিলেশন হল এর গুরুত্বপূর্ণ পদ্ধতিগুলির একটি।
এই গল্প শুধুমাত্র “ধৈর্য ধরে থাকলে সফলতা মিলবে” এই অনুপ্রেরণামূলক বার্তা নয়। এটি দেখায় যে মূল্যায়ন ব্যবস্থার সবসময় অন্ধবিন্দু থাকে। একটি সমাধানের মূল্য, কখনও কখনও শুধুমাত্র সেই সিস্টেমের বাধা বাস্তবিকভাবে অনুভব করেছে এমন ব্যক্তিই তাৎক্ষণিকভাবে দেখতে পায়।
এটি উদ্যোক্তাদের জন্যও একই প্রাধান্য রাখে।
বাজার, বিনিয়োগকারী এবং পেশাদারদের প্রত্যাখ্যান হতে পারে একটি ভুল দিক নির্দেশ করে, অথবা শুধুমাত্র তারা একই সমস্যার সাথে একই পরিস্থিতিতে না থাকা। পার্থক্যটি হল, দলটির কাছে যথেষ্ট বিশদ প্রমাণ আছে কিনা যে এই সমস্যাটি কেন গুরুত্বপূর্ণ এবং এখনই কেন এটি সমাধান করা যাচ্ছে।
জেফ ডিন লোকদের অন্ধভাবে ধরে থাকার পরামর্শ দেন না। তিনি পরামর্শ দেন: সমস্যাটি বুঝুন, নিয়মিতভাবে যাচাই করুন, এবং একটি মূল্যায়নকে বিশ্বের চূড়ান্ত বিচার হিসাবে গ্রহণ করবেন না।
দ্বাদশ, যুবক জেফ ডিন আজ কী করবেন
সাক্ষাতকারের শেষের দিকে, ডায়ানা একটি কল্পনাশীল প্রশ্ন তুলে ধরেন।
যদি ১৯৯৯ সালে গুগলে যোগ দেওয়ার সময়ের যুবক জেফ ডিনকে ২০২৬ সালে পাঠানো হয়, তাহলে সে একটি অগ্রণী পরীক্ষাগারে যোগ দেবে, নাকি দুই বা তিনজন বন্ধুর সাথে একটি কোম্পানি শুরু করবে?
জেফ ডিন কোনো মানক উত্তর দেননি।
বড় সংগঠনগুলিতে কাঠামো, প্ল্যাটফর্ম এবং অসংখ্য দক্ষ সহকর্মী থাকে। একজন ব্যক্তি এর মধ্যে নিজের অজানা জ্ঞানের সাথে পরিচিত হতে পারে এবং প্রাপ্তিবয়স্ক পণ্যের মাধ্যমে বিশ্বব্যাপী ব্যবহারকারীদের প্রভাবিত করতে পারে। ছোট দলগুলি আরও স্বাধীন, কিন্তু বড় ঝুঁকি বহন করে। প্রতিষ্ঠাতাদেরকে সত্যিকারের একটি সমস্যায় বিশ্বাস করতে হবে এবং অনিশ্চয়তা সহ্য করতে কয়েক বছরের জন্য প্রস্তুত থাকতে হবে।
তিনি যে মাপকাঠি দিয়েছেন, তা «বড় কোম্পানিতে যোগ দেওয়া নাকি স্টার্টআপ শুরু করা»-এর চেয়ে আরও মৌলিক।
যদি আমি এই সমস্যাটি সমাধান করি এবং সেরা ফলাফলটি প্রকৃতপক্ষে ঘটে, তাহলে কি বিশ্বটি স্পষ্টভাবে ভালো হয়ে যাবে? নাকি মানুষ শুধু বলবে, হুম, খুব কুল, আর এটাই?
যদি উত্তর শুধু "খুব কুল" হয়, তাহলে সম্ভবত আপনার সবচেয়ে মূল্যবান সময় ব্যয় করা উচিত নয়।
তিনি সহকর্মীদের গুরুত্বও জোর দেন। পরস্পরকে পূরক করার ক্ষমতা সম্পন্ন ব্যক্তিদের খুঁজুন, এবং নিজেকে কম গুরুত্ব দেওয়া, সহযোগিতার প্রতি প্রস্তুত এবং সহজে সম্পর্ক গড়ে তোলার ক্ষমতা সম্পন্ন ব্যক্তিদেরও খুঁজুন। প্রকৃতপক্ষে কঠিন সমস্যাগুলির সমাধানের জন্য দীর্ঘদিন একসাথে কাজ করা প্রয়োজন। টিমের সদস্যদের সবাইকে অন্যদের না থাকা টুলস থাকা উচিত, এবং সহযোগিতার মাধ্যমে নিজেদের 'টুলবেল্ট' বাড়িয়ে তোলা উচিত।
এই কথাগুলোর মধ্যে একটি পুরনো ধরনের ইঞ্জিনিয়ারের সরলতা রয়েছে।
এআই শিল্প সূচকীয় বৃদ্ধি, সুপার বুদ্ধিমত্তা এবং বিশাল বিনিয়োগের কথা বলতে পছন্দ করে। তবে জেফ ডিন শেষপর্যন্ত তিনটি ছোট বিষয়ের দিকেই ফিরে আসেন: একটি সত্যিকারের গুরুত্বপূর্ণ সমস্যা নিয়ে কাজ করা, যাদের সাথে আপনি পছন্দ করেন তাদের সাথে কাজ করা, এবং বিশ্বকে ভালোভাবে তৈরি করার জন্য সর্বোত্তম চেষ্টা করা।
শেষ কথাঃ এআই যুগের সবচেয়ে দুর্লভ বিষয় হলো সমস্যাটিকে স্পষ্টভাবে দেখা
জেফ ডিনের ক্যারিয়ারে অনেকগুলি পুনরাবৃত্ত হওয়া কিংবদন্তি রয়েছে।
সে এবং সঞ্জয় ঘেমাওয়াত কয়েক দিনের মধ্যে সার্চ সিস্টেমটি পুনরায় লিখেছিলেন, যাতে ইনডেক্সিং মেমোরিতে চলে যায়। তিন মিনিটের একটি ভয়েস কলের অনুমানটি গুগলকে TPU তৈরির দিকে নিয়ে গিয়েছিল। MapReduce বড় পরিসরের সম songালীকরণ এবং ত্রুটি-সহিষ্ণুতাকে একটি একক অ্যাবস্ট্রাকশনের ভিতরে লুকিয়ে রেখেছিল। জ্ঞান ডিস্টিলেশন একটি প্রত্যাখ্যাত পেপার থেকে শুরু হয়ে শিল্পের মৌলিক প্রযুক্তিতে পরিণত হয়েছিল।
এই গল্পগুলি তাকে একজন নিয়মিত অনুপ্রেরণা পাওয়া জেনিয়াস হিসাবে কল্পনা করতে সহজ করে তোলে।
তবে এই সাক্ষাত্কার থেকে বোঝা যায় যে তার পদ্ধতি আসলে অত্যন্ত সামঞ্জস্যপূর্ণ।
প্রথমে পরিমাণের স্কেল বুঝুন। তারপর প্রকৃত বন্ধনী খুঁজুন। তারপর ডিফল্ট ধারণাগুলির প্রশ্ন তুলুন এবং একটি সহজতর বিমূর্তি তৈরি করুন। শেষে, পরিমাপ এবং ফিডব্যাক ব্যবহার করে সিস্টেমকে ধারাবাহিকভাবে পুনরায় পুনরায় উন্নত করুন।
আজকের এআই শিল্প একটি সদৃশ মোড়ের মধ্যে দিয়ে যাচ্ছে।
মডেলটি এতটাই শক্তিশালী যে এটি প্রাথমিক ইঞ্জিনিয়ার লেভেলের কাজ পালন করতে পারে। এরপর, বাস্তব উৎপাদনশীলতা নির্ধারণ করে শুধুমাত্র মডেলের বুদ্ধিবৃত্তি নয়, বরং যুক্তিসঙ্গত খরচ, প্রসঙ্গ সংগঠন, টুলের মান, যাচাইয়ের গতি এবং দীর্ঘমেয়াদি চলাচলের বিশ্বস্ততা।
এজেন্টগুলি ক্রমাগত টিম মেম্বারের মতো হয়ে উঠবে। কিন্তু তাদের পরিষ্কার স্পেসিফিকেশন, দক্ষতা, চেকপয়েন্ট, মূল্যায়নকারী এবং ব্যর্থতাকে ধারণ করতে পারে এমন একটি সিস্টেমের প্রয়োজন।
শুরুর কোম্পানিগুলির সুযোগও অদৃশ্য হয়ে যাবে না, শুধু তা আরও কঠিন হয়ে যাবে। যেসব সমস্যার জন্য জেনারিক মডেলগুলি ইতিমধ্যে 20% কাজ করে তা করার চেয়ে, সেসব সমস্যা খুঁজুন যেগুলির সফলতার হার এখনও 0% বা 1% এর কাছাকাছি। সেখানে সম্ভবত প্রপ্রাইটারি ডেটা, প্রফেশনাল ইভালুয়েটর, নির্দিষ্ট ক্ষেত্রের মডেল, বা সম্পূর্ণ নতুন সিস্টেম অ্যাবস্ট্রাকশন লুকিয়ে আছে।
যখন কোড জেনারেশন আরও সস্তা হয়ে যায়, তখন আসলে মহং হয়ে উঠবে সমস্যাটি।
কী করা উচিত? কী সীমাবদ্ধতা পুরনো হয়ে গেছে? কী পরিবর্তন ঠিক এখনই সীমানা পার হয়েছে? কোন সিস্টেম যদি 50 গুণ দ্রুত হয়, তবে এটি সম্পূর্ণ ভিন্ন পণ্যে পরিণত হবে?
জেফ ডিন ৬০০০ উদ্যোক্তার জন্য কোনো সুযোগের তালিকা দেননি। তিনি একটি আরও টেকসই চিন্তার পদ্ধতি দিয়েছেন।
সবচেয়ে জনপ্রিয় উত্তরের পিছনে দৌড়াবেন না।
প্রথমে সমস্যাটি গণনা করুন।
রেফারেন্স লিঙ্ক
https://x.com/ycombinator/status/2082938685071491219
https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building
এই লেখাটি ওয়েইচ্যাট গ্রুপ "মেশিন মাইন্ড" (ID: almosthuman2014) থেকে এসেছে, লেখক: Panda
