থমসন রয়টার্স কাস্টম আইনগত এআই মডেল প্রশিক্ষণে 40 মিলিয়ন ডলার ব্যয় করেছে

iconTechFlow
শেয়ার
AI summary iconসারাংশ
থমসন রয়টার্স তাদের কাস্টম আইনি এআই মডেল, থমসন প্রশিক্ষণের জন্য 40 মিলিয়ন ডলার বিনিয়োগের ঘোষণা করেছে। কোম্পানির আইনি, কর এবং সংবাদ ডেটা ব্যবহার করে তৈরি এই মডেলটি বিশেষ আইনি কাজগুলিতে শক্তিশালী পারফরম্যান্স দেখিয়েছে। প্রথম প্রয়োগটি CoCounsel Legal-এর Tabular Analysis-এ, যার একটি হালকা সংস্করণ Hugging Face-এ উপলব্ধ। এই পদক্ষেপটি CFT প্রয়োজনীয়তা বৃদ্ধি এবং তরলতা এবং ক্রিপ্টো বাজারের উপর বৃদ্ধি পাওয়া পর্যবেক্ষণের মধ্যে আসছে।

লেখক: শিয়াওবিং

২৪ আগস্ট, থমসন রয়টার্স তাদের নিজস্ব বড় ভাষা মডেল "থমসন" চালু করার ঘোষণা করে। এই ৭০ বিলিয়ন ডলারের বেশি আয়কারী তথ্য প্রতিষ্ঠানটি জানায় যে, মডেলটি ওপেন-সোর্স বেসিসের উপর প্রশিক্ষিত, যার জন্য প্রায় ৪,০০০ মিলিয়ন ডলার (মানবসম্পদ এবং কম্পিউটেশনাল ক্ষমতা সহ) ব্যয় করা হয়েছে, এবং প্রশিক্ষণের জন্য ডেটা পাওয়া গেছে Westlaw আইনি ডাটাবেস, Practical Law ব্যবহারিক গাইড, Checkpoint ট্যাক্স গবেষণা প্ল্যাটফর্ম এবং Reuters সংবাদ সম্পদ থেকে। প্রাথমিক মূল্যায়নে দেখা গেছে যে, Thomson-এর অনেকগুলি কাজের পারফরম্যান্স "সর্বশেষ অগ্রণী মডেলগুলির সঙ্গে তুলনীয়"।

400 মিলিয়ন ডলার—তুলনা করুন: OpenAI-এর সর্বশেষ ফান্ডিং রাউন্ড 40 বিলিয়ন ডলার, Anthropic-এর মোট ফান্ডিং 13 বিলিয়ন ডলারের বেশি, xAI একটি রাউন্ডেই 6 বিলিয়ন ডলার পেয়েছে। অগ্রণী ল্যাবগুলি জেনারেল মডেল ট্রেনিংয়ের জন্য দশs বিলিয়ন ডলার ব্যয় করে, অথচ Thomson Reuters একটি ভার্টিক্যাল ক্ষেত্রে একটি শূন্যেরও কম ব্যয়ে এমন ক্ষমতা তৈরি করেছে যা অগ্রণী মডেলগুলির সাথে তুলনীয় বলে দাবি করে।

সিটিও জোয়েল হ্রনের মূল কথাঃ বছর ধরে এআই শিল্প পরিসরকে উত্তর হিসেবে ব্যবহার করেছে, বড় মডেল, বেশি ক্যালকুলেশন ক্ষমতা, বেশি টাকা। থমসন প্রমাণ করেছেন যে একটি শক্তিশালী ভিত্তি থেকে শুরু করে সত্যিকারের গুরুত্বপূর্ণ কাজের জন্য গভীরভাবে স্পেশালাইজড হওয়ার মাধ্যমে কার্যকরী এবং সম্পূর্ণভাবে নিয়ন্ত্রিত বুদ্ধিমত্তা গড়ে তোলা সম্ভব।

উল্লম্ব শিল্পের জন্য এআই নিজস্ব তৈরির যুগ শুরু হচ্ছে।

থমসন কী করেছেন?

থমসন ওপেন সোর্স বেস থেকে শুরু করে (ঘোষণায় কোন মডেল নির্দিষ্ট করা হয়নি), মধ্যম প্রশিক্ষণ (mid-training) এবং পরবর্তী প্রশিক্ষণ (post-training) এর মাধ্যমে থমসন রয়টার্সের স্বত্বাধিকারপ্রাপ্ত ডেটা ইনজেক্ট করে।

ঘোষণায় বলা হয়েছে যে বর্তমানে শুধুমাত্র 10% এর কম স্ব-উৎপাদিত কন্টেন্ট ট্রেনিংয়ের জন্য ব্যবহার করা হয়েছে, এবং ভবিষ্যতে নতুন বিশেষায়িত দিকগুলি অন্বেষণ করা হবে। প্রশিক্ষণ লক্ষ্য ডিজাইন থেকে চূড়ান্ত মূল্যায়ন পর্যন্ত শতাধিক বিষয়বিশেষজ্ঞ অংশগ্রহণ করেছেন।

মডেলের প্রথম বাস্তবায়ন পরিস্থিতি হল CoCounsel Legal-এর টেবুলার অ্যানালিসিস ফাংশন, যা আইনি প্রতিষ্ঠান এবং কর্পোরেট লিগ্যাল ডিপার্টমেন্টের জন্য। CoCounsel একাধিক মডেল আর্কিটেকচার বজায় রাখে, যেখানে Thomson-এর পক্ষে স্পষ্ট সুবিধা রয়েছে সেখানে Thomson ব্যবহার করা হয়, অন্যান্য পরিস্থিতিতে বাইরের অগ্রণী মডেলগুলি ব্যবহার করা হয়।

থমসন রয়টার্স শিক্ষাগত এবং অ-বাণিজ্যিক ব্যবহারের জন্য হাগিং ফেসে একটি "ছোট" ওপেন-সোর্স সংস্করণও প্রকাশ করেছে এবং আইন এবং এআই পণ্ডিতদের স্বাধীন মূল্যায়নের জন্য আমন্ত্রণ জানিয়েছে।

ওয়াশিংটন বিশ্ববিদ্যালয়ের আইন বিভাগের অধ্যাপক জনাথন চয় তাঁর কর্পোরেট ট্যাক্স কোর্সের কঠিন প্রশ্নগুলির মাধ্যমে Thomson, ChatGPT এবং Claude-কে পরীক্ষা করেন এবং মন্তব্য করেন যে তিনটি মডেলই সঠিকভাবে উত্তর দিয়েছে, তবে তিনি Thomson-এর উত্তরকে বেশি পছন্দ করেন, বিশেষ করে আইনগত গ্রন্থের লিঙ্কগুলির জন্য যা উত্তরগুলিকে আরও স্বচ্ছ এবং ব্যবহারিক করে তোলে।

4000 মিলিয়ন ডলারের অর্থনীতি

এই সংখ্যাটি সম্পূর্ণ বিষয়টি বুঝতে চাবি।

একটি সাধারণ অগ্রগামী মডেল প্রশিক্ষণের খরচ ঘাতাত্মকভাবে বৃদ্ধি পাচ্ছে। মেটা Llama 3 প্রশিক্ষণের জন্য 16,000 টিরও বেশি H100 GPU ব্যবহার করেছে, যার ক্যালকুলেশন খরচ কয়েকশত মিলিয়ন ডলার হবে বলে অনুমান করা হচ্ছে। ওপেনএআই এবং গুগল ডিপমাইন্ডের প্রশিক্ষণ বাজেট আরও বেশি। এই মডেলগুলির লক্ষ্য "সবকিছুই করা"—কবিতা লেখা থেকে অন্তরক সমীকরণ সমাধান, প্রোগ্রামিং থেকে চরিত্র অভিনয় পর্যন্ত।

থমসন রয়টার্স যা করে, তা যৌক্তিকভাবে সম্পূর্ণ ভিন্ন। এটির একটি সর্বজনীন মডেলের প্রয়োজন নেই, এটির প্রয়োজন এমন একটি মডেলের, যা আইনগত গবেষণা, কর সঙ্গতি, নিয়ন্ত্রণ ব্যাখ্যা এবং পেশাদার ডকুমেন্ট বিশ্লেষণ—এই চারটি অত্যন্ত বিশেষায়িত ক্ষেত্রে সাধারণ অগ্রণী মডেলের সমান বা তারও ভালো কাজ করতে পারে। এই লক্ষ্যের পরিসর অনেক সংকীর্ণ, তাই প্রশিক্ষণের খরচও অনেক কম।

কিন্তু 40 মিলিয়ন ডলারকে সম্ভব করে তোলে পরিসর সংকুচিত করা নয়, বরং ডেটা সম্পদ।

থমসন রয়টার্স এর মালিকানাধীন ওয়েস্টল আইনি ডাটাবেসটি ৪০,০০০ এর বেশি কেস ডাটাবেস এবং ১০০ বছরের বেশি প্রেসিডেন্ট সঞ্চয়কে কভার করে। প্র্যাকটিক্যাল ল এ ৬৫০ এর বেশি আইনজীবী সম্পাদক দ্বারা নিয়মিত আপডেটকৃত অপারেশনাল গাইডলাইন এবং টেমপ্লেট রয়েছে। চেকপয়েন্ট হল মার্কিন ট্যাক্স পেশাদারদের জন্য মানক টুল। রয়টার্স সংবাদ কর্পাসটি বিশ্বব্যাপী ১৭৫ বছরেরও বেশি সময়কালকে কভার করে।

এই ডেটা ইন্টারনেট থেকে স্ক্র্যাপ করা হয়নি।

এগুলি পেশাদারভাবে সম্পাদিত, লেবেলযুক্ত, স্ট্রাকচারযুক্ত এবং নিয়মিত আপডেট করা স্বত্বাধিকারসম্পন্ন সম্পদ। এই ডেটার উপর প্রশিক্ষিত ভার্টিক্যাল মডেলগুলি তাদের পেশাদার ক্ষেত্রে সঠিকতা এবং উদ্ধৃতির মানের ক্ষেত্রে জেনারিক মডেলগুলির জন্য সহজ RAG (রিট্রিভাল-অ্যাঙ্গড জেনারেশন) বা ফাইন-টিউনিং দিয়ে অনুসরণ করা কঠিন। জেনারিক মডেলগুলি এই ডেটা "অ্যাক্সেস" করতে পারে, কিন্তু অ্যাক্সেস করা এবং "এর মধ্যে বাড়া" দুটি ভিন্ন বিষয়।

থমসন রয়টার্স নিজেরাই এই পার্থক্যটি উল্লেখ করেছে: ক্ষেত্র-বিশেষায়িত প্রশিক্ষণ দ্বারা অর্জিত লাভ, শুধুমাত্র কনটেন্ট অ্যাক্সেস দ্বারা প্রতিস্থাপন করা যায় না।

এই পথটি কে অনুসরণ করবে?

থমসন রয়টার্স একচেটিয়া হবে না। "স্বত্বাধিকার ডেটা → ভার্টিক্যাল মডেল → কম ইনফারেন্স খরচ → শক্তিশালী ডেটা নিয়ন্ত্রণ → উচ্চ কর্পোরেট মার্জিন" এই শৃঙ্খলের দিকে তাকালে, কমপক্ষে কয়েকটি ধরনের কোম্পানি এই মডেলকে অনুকরণের জন্য উপযুক্ত।

একটি আর্থিক ডেটা কোম্পানি। ব্লুমবার্গ ২০২৩ সালে নিজস্ব আর্থিক টার্মিনাল ডেটা এবং সংবাদ কর্পাসের উপর ভিত্তি করে BloombergGPT প্রশিক্ষণ দিয়েছে। যদিও পরবর্তী পদক্ষেপগুলি সীমিত, তবুও Bloomberg Terminal-এর ডেটা ব্যারিয়ার এবং Thomson Reuters-এর Westlaw একই মাত্রার—এগুলি যেকোনো সাধারণ মডেলের জন্য আইনগতভাবে অ্যাক্সেসযোগ্য নয় এমন স্বত্বাধিকারসম্পন্ন ডেটা সেট।

পেশাদার সেবা প্রদানকারী প্রতিষ্ঠান। চারটি বড় অডিটিং ফার্ম (PwC, Deloitte, EY, KPMG), বড় আইনি অ্যালায়েন্স (যেমন Baker McKenzie, Kirkland & Ellis), এবং স্বাস্থ্য তথ্য কোম্পানি (যেমন Epic Systems-এর ইলেকট্রনিক মেডিকেল রেকর্ড ডেটা) উচ্চ গঠনযুক্ত, উচ্চ গোপনীয় পেশাদার ডেটা নিয়ে বসেছে। এই প্রতিষ্ঠানগুলি তাদের ক্লায়েন্ট ডেটা জেনারিক মডেলগুলিতে দিতে চায় না, কিন্তু AI-এর মাধ্যমে দক্ষতা বৃদ্ধির প্রয়োজনীয়তা রাখে। কমপ্লায়েন্সের দৃষ্টিকোণ থেকে, এই প্রতিষ্ঠানগুলির জন্য স্বয়ংসম্পূর্ণ ভার্টিক্যাল মডেল তৈরি করা একটি বিকল্প নয়, বরং একটি প্রয়োজনীয়তা।

শিল্পের ডেটা মনোপলিস্ট। MSCI-এর কাছে বিশ্বব্যাপী ESG রেটিং এবং ইনডেক্স ডেটা, Verisk-এর কাছে বীমা মূল্যনির্ধারণ এবং ঝুঁকি মডেল ডেটা, Wolters Kluwer-এর কাছে ইউরোপীয় আইন এবং সঙ্গতি ডেটা, RELX-এর কাছে Elsevier একাডেমিক জার্নাল এবং LexisNexis আইনি ডেটা। এই কোম্পানিগুলির সাধারণ বৈশিষ্ট্য হল: ডেটা হল মূল সম্পদ, ডেটার একচেটিয়া অধিকারই হল প্রতিরক্ষা প্রাচীর, অন্যদের মডেলকে ডেটা খাওয়ানো আপনার মূল্যকে কমিয়ে দেয়।

OpenAI এবং Anthropic-এর জন্য এর অর্থ কী?

থমসন রয়টার্সের ঘোষণায় একটি বিস্তারিত বিষয় উপেক্ষিত হয়: CoCounsel একাধিক মডেল আর্কিটেকচার বজায় রাখে। যেখানে থমসনের সুবিধা রয়েছে, সেখানে থমসন ব্যবহার করা হবে, অন্যান্য পরিস্থিতিতে বাইরের মডেলগুলি ব্যবহার করা হবে।

এটি বোঝায় যে এমনকি নিজস্ব মডেল তৈরি করা প্রতিষ্ঠানগুলিও সাধারণ মডেলগুলিকে সম্পূর্ণভাবে ত্যাগ করবে না।

জেনারিক মডেলগুলি এখনও জেনারিক রিজনিং, কোড জেনারেশন, মাল্টিলিঙ্গুয়াল প্রসেসিং ইত্যাদির ক্ষেত্রে সুবিধা রাখে। ভার্টিক্যাল মডেলগুলি জেনারিক মডেলগুলির সেই স্তরকে প্রতিস্থাপন করে যা নির্দিষ্ট ক্ষেত্রে "পর্যাপ্ত কিন্তু পর্যাপ্ত ভালো নয়"।

কিন্তু দীর্ঘমেয়াদে, যদি বড় মূল্যবান ব্যবসায়িক গ্রাহকদের মধ্যে বেশিরভাগই নিজেদের উল্লম্ব মডেল তৈরি করতে শুরু করে, তাহলে জেনারিক মডেল কোম্পানিগুলি বিপদে পড়বে—এগুলি শুধুমাত্র ইনফ্রাস্ট্রাকচার লেয়ারে সীমাবদ্ধ হয়ে পড়বে: ব্যবসায়িকদের জন্য বেস মডেল প্রদান করবে, জেনারিক টাস্কগুলির জন্য ইনফারেন্স API প্রদান করবে, কিন্তু সবচেয়ে লাভজনক উল্লম্ব অ্যাপ্লিকেশনগুলিতে মূল্যনির্ধারণের ক্ষমতা হারিয়ে ফেলবে।

এটি ক্লাউড কম্পিউটিং শিল্পের বিকাশের মতো।

AWS, Azure এবং GCP ইনফ্রাস্ট্রাকচার প্রদান করে, কিন্তু সবচেয়ে লাভজনক SaaS অ্যাপ্লিকেশন লেয়ারটি Salesforce, ServiceNow, Workday এর মতো ভার্টিক্যাল কোম্পানিগুলি দখল করে। যদি AI শিল্প একই পথে এগিয়ে যায়, তবে OpenAI এবং Anthropic-এর ভূমিকা "AI-এর AWS"-এর চেয়ে "AI-এর Salesforce"-এর সাথে বেশি মিলবে।

থমসন রয়টার্স যা 40 মিলিয়ন ডলার খরচ করে প্রমাণ করেছে, তা হল: যখন আপনার পর্যাপ্ত অনন্য ডেটা থাকে, তখন আপনি আপনার ক্ষেত্রে দশ বিলিয়ন ডলারের ট্রেনিংয়ের মাধ্যমে তৈরি সাধারণ মডেলগুলির সাথে শুধুমাত্র একটি ছোট অংশের খরচে প্রতিযোগিতা করতে পারেন।

এই যুক্তি যদি প্রমাণিত হয়, তবে প্রতিটি স্বতন্ত্র ডেটা খনির উপর বসে থাকা কোম্পানি পুনরায় গণনা করবে: বছরের পর বছর OpenAI বা Anthropic-কে API ফি দেওয়া চালিয়ে যাওয়া, নাকি একটি সম্পূর্ণরূপে নিয়ন্ত্রিত ভার্টিক্যাল মডেল প্রশিক্ষণের জন্য তুলনামূলকভাবে অনেক কম টাকা খরচ করা?

"AI অস্ত্র প্রতিযোগিতা" এর বর্ণনায় অভ্যস্ত বাজারের জন্য, থমসন রয়টার্সের 40 মিলিয়ন ডলার একটি বিপরীত সংকেত। AI প্রতিযোগিতার পরবর্তী পর্যায়ে, যে কোম্পানির প্রশিক্ষণ খরচ সবচেয়ে বেশি তারা জিতবে না, বরং যাদের ডেটা সবচেয়ে অনন্য এবং অপরিহার্য তারাই জিতবে। মডেলগুলি হল সরঞ্জাম, ডেটা হল বাধা।

দাবিত্যাগ: এই পৃষ্ঠার তথ্য তৃতীয় পক্ষের কাছ থেকে প্রাপ্ত হতে পারে এবং অগত্যা KuCoin এর মতামত বা মতামত প্রতিফলিত করে না। এই বিষয়বস্তু শুধুমাত্র সাধারণ তথ্যগত উদ্দেশ্যে প্রদান করা হয়, কোন ধরনের প্রতিনিধিত্ব বা ওয়ারেন্টি ছাড়াই, বা এটিকে আর্থিক বা বিনিয়োগ পরামর্শ হিসাবে বোঝানো হবে না। KuCoin কোনো ত্রুটি বা বাদ পড়ার জন্য বা এই তথ্য ব্যবহারের ফলে যে কোনো ফলাফলের জন্য দায়ী থাকবে না। ডিজিটাল সম্পদে বিনিয়োগ ঝুঁকিপূর্ণ হতে পারে। আপনার নিজের আর্থিক পরিস্থিতির উপর ভিত্তি করে একটি পণ্যের ঝুঁকি এবং আপনার ঝুঁকি সহনশীলতা সাবধানে মূল্যায়ন করুন। আরও তথ্যের জন্য, অনুগ্রহ করে আমাদের ব্যবহারের শর্তাবলী এবং ঝুঁকি প্রকাশ পড়ুন।