تھامسن ریٹر نے مخصوص قانونی AI ماڈل کو تربیت دینے کے لیے 40 ملین ڈالر خرچ کیے

iconTechFlow
بانٹیں
AI summary iconخلاصہ
تھامسن ریٹر نے اپنے مخصوص قانونی AI ماڈل، تھامسن، کو تربیت دینے کے لیے 40 ملین امریکی ڈالر کا سرمایہ کاری کا اعلان کیا۔ اس ماڈل کو فرم کے قانونی، ٹیکس اور خبروں کے ڈیٹا کا استعمال کرتے ہوئے تعمیر کیا گیا ہے، جو تخصص یافتہ قانونی کاموں میں مضبوط کارکردگی دکھاتا ہے۔ پہلا заعہ کوکونسل لیگل کے ٹیبلر اینالسز میں ہے، جبکہ ہگنگ فیس پر ایک ہلکا ورژن دستیاب ہے۔ یہ اقدام CFT کی ضروریات میں اضافے اور سيولة اور کرپٹو مارکیٹس پر بڑھتی ہوئی نگرانی کے دوران آیا ہے۔

لکھنے والہ: چھوٹا بیکی

24 اگست کو، تھامسن ریٹر نے اپنے خود ساختہ بڑے زبان ماڈل "تھامسن" کا اطلاق کیا۔ اس 70 ارب ڈالر سے زائد سالانہ آمدنی والی معلومات کی عظیم کمپنی نے کہا کہ ماڈل کو اوپن سورس بنیاد پر تربیت دی گئی ہے، جس میں تقریباً 40 ملین امریکی ڈالر (ماہرین اور کمپوٹنگ طاقت سمیت) کا خرچ ہوا ہے، اور تربیت کے لیے ڈیٹا ویسٹلو نو قانونی ڈیٹا بیس، پراکٹیکل لاء عملی رہنمائی، چیک پوائنٹ ٹیکس ریسرچ پلیٹ فارم اور ریٹر نیوز اثاثوں سے حاصل کیا گیا ہے۔ ابتدائی جائزہ سے پتہ چلتا ہے کہ تھامسن کئی کاموں میں "حالیہ سرٹھ کے ماڈلز کے برابر" کارکردگی دکھاتا ہے۔

400 ملین امریکی ڈالر، اس کا موازنہ کریں: OpenAI کی تازہ ترین سرمایہ کاری 40 ارب امریکی ڈالر، Anthropic کی کل سرمایہ کاری 13 ارب سے زائد، اور xAI نے ایک ہی دور میں 6 ارب حاصل کیے۔ سرحدی لیبز ڈیجیٹل طاقت کو ڈیڑھ ارب ڈالر کے ساتھ جمع کرتے ہوئے جامع ماڈلز کو ٹرین کرتے ہیں، جبکہ Thomson Reuters نے اس کا صرف ایک ننھا حصہ استعمال کرتے ہوئے ایک خاص شعبے میں ایسا کام کیا ہے جسے وہ سرحدی صلاحیتوں کے برابر قرار دیتے ہیں۔

CTO Joel Hron کا کہنا تھا: AI صنعت نے سالوں تک سائز کو جواب کے طور پر دیکھا ہے، بڑے مدلز، زیادہ کمپوٹنگ پاور، زیادہ پیسہ۔ تھامسن نے ثابت کیا کہ ایک مضبوط بنیاد سے شروع کرکے، اصلی اہم کاموں کے لیے گہرائی سے تخصص کے ذریعے، ایک موثر اور مکمل طور پر خود مختار ذہنیت تعمیر کی جا سکتی ہے۔

عمودی صنعتوں کا AI خود کار بنانے کا دور شروع ہو رہا ہے۔

تھامسن نے کیا کیا؟

تھامسن نے ایک اوپن سورس بنیاد (جو کہ اعلان میں کوئی خاص ماڈل نہیں بتایا گیا) سے شروع کیا، اور مڈ ٹریننگ اور پوسٹ ٹریننگ کے ذریعے تھامسن ریوٹرز کے ملکی ڈیٹا کو شامل کیا۔

اعلان میں بتایا گیا ہے کہ اب تک صرف 10% سے کم اپنی محتوا کا استعمال کیا گیا ہے، اور مزید نئے ماہرانہ رخوں کی تلاش جاری رہے گی۔ سینکڑوں مضامین کے ماہرین نے تربیت کے مقاصد کے ڈیزائن سے لے کر آخری جائزہ تک مکمل طور پر شرکت کی۔

ماڈل کا پہلا ڈیپلویمنٹ سیناریو CoCounsel Legal کے ٹیبلر اینالیسس فنکشن کے لیے ہے، جو قانونی فرمز اور کارپوریٹ لیگل ڈیپارٹمنٹس کے لیے ہے۔ CoCounsel متعدد ماڈل آرکیٹیکچر برقرار رکھتا ہے، جہاں Thomson کو ترجیح دی جاتی ہے وہاں Thomson کا استعمال کیا جاتا ہے، اور دیگر سیناریوز میں باہری ایڈوانسڈ ماڈلز کا استعمال جاری رکھا جاتا ہے۔

تھامسن ریٹر نے اکیڈمک اور غیر تجارتی استعمال کے لیے ہگنگ فیس پر ایک "چھوٹا" اوپن سورس ورژن جاری کیا ہے اور قانون اور AI کے ماہرین کو مستقل جائزہ لینے کے لیے دعوت دی ہے۔

واشنگٹن یونیورسٹی لاء اسکول کے پروفیسر جوناتھن چوئی نے تھامسن، چیٹ جی پی ٹی اور کلاؤڈ کو کمپنی ٹیکس کورس کے مشکل سوالات کے ساتھ ٹیسٹ کیا، جس میں تینوں ماڈلز نے صحیح جواب دیے، لیکن وہ تھامسن کے جواب کو ترجیح دیتے ہیں، خاص طور پر قانونی حوالہ جات کے لنکس کی وجہ سے جواب زیادہ شفاف اور عملی ہے۔

40 ملین امریکی ڈالر کی مالیاتی معیشت

یہ عدد پورے معاملے کو سمجھنے کی کلید ہے۔

ایک جامع اور پیشہ ورانہ ماڈل کو تربیت دینے کی لاگت لگاتار بڑھ رہی ہے۔ میٹا نے Llama 3 کو تربیت دینے کے لیے 16,000 سے زائد H100 GPU استعمال کیے، جس کی کمپوٹیشنل لاگت کئی ارب ڈالر کی ہے۔ OpenAI اور Google DeepMind کی تربیتی بجٹ اس سے بھی زیادہ ہے۔ ان ماڈلز کا مقصد "ہر کام کرنا" ہے، شاعری لکھنا سے لے کر متفاوت مساوات حل کرنا، پروگرامنگ سے لے کر کردار ادا کرنا تک۔

تھامسن ریٹر کا کام منطقی طور پر بالکل الگ ہے۔ اسے ایک ایسا ماڈل درکار نہیں جو سب کچھ کر سکے، بلکہ اسے قانونی تحقیق، ٹیکس کمپلائنس، ریگولیٹری تشریحات اور پیشہ ورانہ دستاویزات کے تجزیہ جیسے بہت زیادہ خاص شعبوں میں عام جدید ماڈلز کے برابر یا ان سے بہتر کام کرنے والا ماڈل درکار ہے۔ اس مقصد کا دائرہ کار بہت تنگ ہے، اس لیے تربیت کا خرچ بہت کم ہے۔

لیکن 40 ملین امریکی ڈالر کو ممکن بنانے والا اصل بات رینج کی تقلیل نہیں، بلکہ ڈیٹا ایسٹس ہیں۔

تھامسن ریٹر کے ملکیت والی ویسٹ لاء قانونی ڈیٹا بیس میں 40,000 سے زائد کیس ڈیٹا بیس اور 100 سال سے زائد کا جج کا فیصلہ کا تجربہ شamil ہے۔ پریکٹیکل لاء میں 650 سے زائد وکلاء ایڈیٹرز کی طرف سے مستقل طور پر اپڈیٹ کیے جانے والے عملی گائیڈز اور ٹیمپلیٹس شامل ہیں۔ چیک پوائنٹ امریکہ کے ٹیکس ماہرین کا معیاری ٹول ہے۔ ریٹر نیوز کارپس دنیا بھر میں پھیلا ہوا ہے اور اس کا تاریخی دائرہ 175 سال سے زائد ہے۔

یہ ڈیٹا انٹرنیٹ سے کھینچا نہیں گیا ہے۔

یہ مخصوص اثاثے ہیں جنہیں پیشہ ورانہ طور پر سمبھالا، نشان لگایا، ساخت دیا گیا اور مستقل طور پر اپ ڈیٹ کیا جاتا ہے۔ اس ڈیٹا پر تربیت پانے والے عمودی ماڈلز اپنے مخصوص شعبے میں درستگی اور حوالہ جات کی معیار کے لحاظ سے عام ماڈلز کو عام RAG (ریٹریول اینہانسڈ جنریشن) یا فائن ٹیوننگ سے مطابقت نہیں دے سکتے۔ عام ماڈلز ان ڈیٹا تک "رسائی" حاصل کر سکتے ہیں، لیکن رسائی حاصل کرنا اور "اس میں پروان چڑھنا" دو الگ باتیں ہیں۔

تھامسن ریٹر نے خود اس فرق کو نوٹ کیا ہے: فیلڈ سپیسیفک ٹریننگ سے حاصل ہونے والا فائدہ، صرف مواد کے ایکسیس سے قابلِ تقلید نہیں۔

یہ راستہ کون چلے گا؟

تھامسن ریٹر صرف ایک نہیں ہوگی۔ "مخصوص ڈیٹا → عمودی ماڈل → کم استدلال لاگت → مضبوط ڈیٹا کنٹرول → زیادہ کاروباری برآمدی" کے سلسلے کو دیکھتے ہوئے، کم از کم کچھ قسم کی کمپنیاں اس ماڈل کو نقل کرنے کے لیے مناسب شرائط رکھتی ہیں۔

مالیاتی ڈیٹا کمپنی۔ بلومبرگ نے 2023 میں اپنے مخصوص فنانشل ٹرمینل ڈیٹا اور خبروں کے کارپس کے بنیاد پر بلومبرگ جی پی ٹی تربیت دے دیا۔ حالانکہ بعد کے اقدامات کم ہیں، لیکن بلومبرگ ٹرمینل کا ڈیٹا باریئر تھامسن ریوٹرز کے ویسٹلو کے ساتھ ایک ہی سطح پر ہے—یہ ان ڈیٹا سیٹس ہیں جن تک کوئی بھی جنرل ماڈل قانونی طور پر رسائی نہیں رکھ سکتا۔

ماہرین کی خدمات فراہم کرنے والے ادارے۔ چار بڑے اکاؤنٹنگ فرمز (PwC، Deloitte، EY، KPMG)، بڑے قانونی اتحاد (جیسے Baker McKenzie، Kirkland & Ellis)، اور طبی معلومات کی کمپنیاں (جیسے Epic Systems کا الیکٹرانک میڈیکل ریکارڈ ڈیٹا)، کے پاس بہت زیادہ ساخت شدہ، بہت زیادہ سیکور ڈیٹا ہے۔ ان اداروں کو اپنے صارفین کا ڈیٹا جنرل ماڈلز کو دینا پسند نہیں، لیکن وہ AI کے ذریعے کارکردگی میں اضافہ چاہتے ہیں۔ ان کے لیے، کمپلائنس کے نقطہ نظر سے، اپنا عمودی ماڈل بنانا انتخاب نہیں، بلکہ ضرورت ہے۔

صنعتی ڈیٹا مونوپولیس۔ MSCI کے پاس عالمی ESG ریٹنگ اور انڈیکس ڈیٹا ہے، Verisk کے پاس بیمہ قیمت گذاری اور خطرہ ماڈل ڈیٹا ہے، Wolters Kluwer کے پاس یورپی قانون اور مطابقت ڈیٹا ہے، RELX کے پاس Elsevier اکیڈمک جرائد اور LexisNexis قانونی ڈیٹا ہے۔ ان کمپنیوں کا مشترکہ خاصہ یہ ہے کہ ڈیٹا مرکزی اثاثہ ہے، ڈیٹا کا انحصار ہی دفاعی دیوار ہے، اور دوسرے کے ماڈلز کو ڈیٹا فراہم کرنا اپنی قیمت کو کم کر دیتا ہے۔

اوپن اے آئی اور اینتھروپک کے لیے کیا ہے؟

تھامسن ریٹر کے اعلان میں ایک تفصیل ہے جس کو نظرانداز کیا جا سکتا ہے: CoCounsel متعدد ماڈل آرکیٹیکچر برقرار رکھتا ہے۔ تھامسن کے فوائد والے مقامات پر تھامسن کا استعمال کریں اور دیگر صورتوں میں باہری ماڈلز جاری رکھیں۔

یہ بات یہ ظاہر کرتی ہے کہ یہاں تک کہ اپنا ماڈل بنانے والے کمپنیاں بھی عام ماڈلز کو مکمل طور پر نہیں چھوڑتیں۔

عام ماڈلز اب بھی عام استدلال، کوڈ جنریشن، اور متعدد زبانوں کے معالجہ وغیرہ میں برتری رکھتے ہیں۔ عمودی ماڈلز عام ماڈلز کو ان خاص شعبوں میں "کافی لیکن بہتر نہ ہونے" والے لیول سے بدل رہے ہیں۔

لیکن لمبے مدت کے لحاظ سے، اگر مزید زیادہ اعلیٰ قیمت والے کاروباری صارفین اپنے خود کے عمودی ماڈلز بنانے لگیں، تو جنرل ماڈل کمپنیاں خطرے میں ہو سکتی ہیں جن میں وہ بنیادی طبقے تک محدود ہو جائیں: کاروباری صارفین کے لیے بنیادی ماڈل فراہم کرنا، عام کاموں کے لیے انفرینس API فراہم کرنا، لیکن سب سے زیادہ منافع بخش عمودی اطلاقات میں قیمت تعین کرنے کا اختیار کھو دینا۔

یہ کلاؤڈ کمپیوٹنگ صنعت کے ترقی کے مشابہ ہے۔

AWS، Azure اور GCP انفراسٹرکچر فراہم کرتے ہیں، لیکن سب سے زیادہ منافع بخش SaaS ایپلیکیشن لیئر Salesforce، ServiceNow، Workday جیسے عمودی کمپنیوں کے قبضے میں ہے۔ اگر AI صنعت اسی راستے پر چلی تو OpenAI اور Anthropic کا کردار "AI کا AWS" کے قریب تر ہوگا، نہ کہ "AI کا Salesforce"۔

تھامسن ریٹر نے 40 ملین امریکی ڈالر خرچ کر کے یہ ثابت کیا کہ جب آپ کے پاس کافی منفرد ڈیٹا ہو، تو آپ اپنے شعبے میں اربوں ڈالر کے ٹرینڈ کیے گئے جنرل ماڈلز کے برابر آ سکتے ہیں، صرف ایک چھوٹے سے حصے کی لاگت پر۔

جب یہ منطق تصدیق ہو جائے گا، تو ہر ایک کمپنی جو اپنے مخصوص ڈیٹا کے کان کے اوپر بیٹھی ہے، اپنا حساب دوبارہ لگائے گی: کیا وہ OpenAI یا Anthropic کو سالانہ API فیس دینا جاری رکھے، یا ایک نسبتاً کم تر رقم خرچ کرکے اپنا مکمل طور پر کنٹرول کردہ عمودی ماڈل تربیت دے؟

"AI فوجی ترقی" کے نریش کے ساتھ آشنا مارکیٹ کے لیے تھامسن ریٹر کا 40 ملین ڈالر ایک اُلٹا سگنل ہے۔ AI مقابلے کا اگلا مرحلہ، وہی جیتے گا جس کے پاس سب سے منفرد اور سب سے غیر قابل تبدیل ڈیٹا ہوگا۔ ماڈلز ٹولز ہیں، ڈیٹا ہی دیوار ہے۔

اعلان دستبرداری: اس صفحہ پر معلومات تیسرے فریق سے حاصل کی گئی ہوں گی اور یہ ضروری نہیں کہ KuCoin کے خیالات یا خیالات کی عکاسی کرے۔ یہ مواد کسی بھی قسم کی نمائندگی یا وارنٹی کے بغیر صرف عام معلوماتی مقاصد کے لیے فراہم کیا گیا ہے، اور نہ ہی اسے مالی یا سرمایہ کاری کے مشورے کے طور پر سمجھا جائے گا۔ KuCoin کسی غلطی یا کوتاہی کے لیے، یا اس معلومات کے استعمال کے نتیجے میں کسی بھی نتائج کے لیے ذمہ دار نہیں ہوگا۔ ڈیجیٹل اثاثوں میں سرمایہ کاری خطرناک ہو سکتی ہے۔ براہ کرم اپنے مالی حالات کی بنیاد پر کسی پروڈکٹ کے خطرات اور اپنے خطرے کی برداشت کا بغور جائزہ لیں۔ مزید معلومات کے لیے، براہ کرم ہماری استعمال کی شرائط اور خطرے کا انکشاف دیکھیں۔