थॉमसन रूटर्स ने कस्टम लीगल एआई मॉडल को प्रशिक्षित करने के लिए 40 मिलियन डॉलर खर्च किए

iconTechFlow
साझा करें
AI summary iconसारांश
थॉमसन रूटर्स ने अपने कस्टम लीगल AI मॉडल, थॉमसन को प्रशिक्षित करने के लिए 40 मिलियन डॉलर का निवेश किया है। इस मॉडल का निर्माण कंपनी के कानूनी, कर और समाचार डेटा का उपयोग करके किया गया है, जो विशिष्ट कानूनी कार्यों में मजबूत प्रदर्शन दर्शाता है। पहला अनुप्रयोग CoCounsel Legal के Tabular Analysis में है, और हगिंग फेस पर एक हल्का संस्करण उपलब्ध है। यह कदम CFT आवश्यकताओं में वृद्धि और तरलता और क्रिप्टो बाजारों पर बढ़ती निगरानी के बीच आया है।

लेखक: शियाओबिंग

24 अगस्त को, थॉमसन रॉयटर्स ने अपने स्वयं के बड़े भाषा मॉडल "थॉमसन" की घोषणा की। इस 70 अरब डॉलर से अधिक की वार्षिक आय वाली सूचना विशालकाय कंपनी ने कहा कि मॉडल ओपन सोर्स बेस पर प्रशिक्षित है, जिसमें लगभग 4,000 डॉलर (कर्मचारियों और कंप्यूटिंग पावर सहित) का निवेश किया गया है, और प्रशिक्षण डेटा Westlaw कानूनी डेटाबेस, Practical Law व्यावहारिक मार्गदर्शिका, Checkpoint कर अनुसंधान प्लेटफॉर्म और Reuters समाचार संपत्ति से लिया गया है। प्रारंभिक मूल्यांकन से पता चलता है कि Thomson कई कार्यों में "नवीनतम अग्रणी मॉडलों के समान" प्रदर्शन करता है।

400 मिलियन डॉलर, इसकी तुलना करें: OpenAI की हालिया फंडिंग राउंड 40 बिलियन डॉलर, Anthropic की कुल फंडिंग 13 बिलियन डॉलर से अधिक, xAI ने एक ही राउंड में 6 बिलियन डॉलर प्राप्त किए। अग्रणी प्रयोगशालाएँ सामान्य मॉडल के प्रशिक्षण के लिए दहलीज पर अरबों डॉलर का गणना क्षमता खर्च करती हैं, जबकि Thomson Reuters ने एक ऊर्ध्वाधर क्षेत्र में इसके एक शून्य से कम का उपयोग करके, स्वयं को अग्रणी क्षमताओं के समान बताया है।

CTO Joel Hron के शब्दों में: AI उद्योग ने वर्षों तक पैमाने को उत्तर माना है—बड़े मॉडल, अधिक कैलकुलेशन पावर, अधिक पैसा। Thomson ने साबित किया है कि एक मजबूत आधार से शुरू करके, वास्तविक रूप से महत्वपूर्ण कार्यों के लिए गहन विशेषीकरण करके, एक कुशल और पूरी तरह से स्वयं नियंत्रित बुद्धिमत्ता बनाई जा सकती है।

वर्टिकल इंडस्ट्री के लिए AI स्व-निर्माण का युग शुरू हो रहा है।

थॉमसन ने क्या किया?

थॉमसन ओपन सोर्स बेस से शुरू करता है (घोषणा में कोई विशिष्ट मॉडल नहीं बताया गया है), और मध्यम ट्रेनिंग (mid-training) और पोस्ट-ट्रेनिंग (post-training) के माध्यम से थॉमसन रॉयटर्स के निजी डेटा को शामिल करता है।

घोषणा में बताया गया है कि वर्तमान में केवल 10% से कम स्वयं की सामग्री का उपयोग प्रशिक्षण के लिए किया गया है, और भविष्य में नए विशेषज्ञता क्षेत्रों की खोज जारी रखी जाएगी। सैकड़ों विषय विशेषज्ञों ने प्रशिक्षण लक्ष्य डिजाइन से लेकर अंतिम मूल्यांकन तक पूरी प्रक्रिया में भाग लिया।

मॉडल का पहला डिप्लॉयमेंट सीन CoCounsel Legal के टेबुलर एनालिसिस फीचर में है, जो कानूनी फर्मों और कॉर्पोरेट लीगल डिपार्टमेंट्स के लिए है। CoCounsel बहु-मॉडल आर्किटेक्चर को बनाए रखता है, जहां Thomson के लिए स्पष्ट लाभ है, वहां Thomson का उपयोग किया जाता है, और अन्य सीनों में बाहरी अग्रणी मॉडल्स का उपयोग जारी रखा जाता है।

थॉमसन रॉयटर्स ने शैक्षणिक और गैर-व्यावसायिक उपयोग के लिए हगिंग फेस पर एक "छोटा" ओपन सोर्स संस्करण भी प्रकाशित किया है और कानून और AI के शोधकर्ताओं को स्वतंत्र मूल्यांकन के लिए आमंत्रित किया है।

वाशिंगटन विश्वविद्यालय के विधि स्कूल के प्रोफेसर जोनाथन चॉइ ने थॉमसन, ChatGPT और Claude को कंपनी कर के पाठ्यक्रम में कठिन प्रश्नों के साथ परीक्षण किया, जिसमें तीनों मॉडलों ने सही उत्तर दिए, लेकिन उन्होंने थॉमसन के उत्तर को विशेष रूप से पसंद किया, खासकर कानूनी स्रोतों के लिंक्स के संदर्भित होने के कारण जिससे उत्तर अधिक पारदर्शी और व्यावहारिक हो गया।

4000 डॉलर की अर्थव्यवस्था

This number is the key to understanding the whole thing.

एक सामान्य अग्रणी मॉडल को प्रशिक्षित करने की लागत घातीय रूप से बढ़ रही है। मेटा ने Llama 3 को प्रशिक्षित करने के लिए 16,000 से अधिक H100 GPU का उपयोग किया, जिसकी कंप्यूटिंग लागत कई अरब डॉलर की है। OpenAI और Google DeepMind के प्रशिक्षण बजट अधिक हैं। इन मॉडलों का लक्ष्य "सब कुछ करना" है, जिसमें कविता लिखना, अवकल समीकरणों को हल करना, प्रोग्रामिंग और भूमिका निभाना शामिल है।

थॉमसन रूटर जो करता है, वह तार्किक रूप से बिल्कुल अलग है। इसे एक सब कुछ करने वाला मॉडल नहीं चाहिए, इसे ऐसा मॉडल चाहिए जो कानूनी अनुसंधान, कर अनुपालन, नियामक व्याख्या और पेशेवर दस्तावेज़ विश्लेषण जैसे अत्यधिक विशिष्ट क्षेत्रों में सामान्य अग्रणी मॉडल के बराबर या उससे बेहतर प्रदर्शन कर सके। इस लक्ष्य की सीमा काफी संकीर्ण है, इसलिए प्रशिक्षण लागत काफी कम है।

लेकिन 4000 डॉलर को संभव बनाने वाला वास्तविक कारक सीमा संकुचन नहीं, बल्कि डेटा संपत्ति है।

थॉमसन रूटर्स के स्वामित्व में वेस्टलॉ लीगल डेटाबेस में 40,000 से अधिक केस डेटाबेस और 100 वर्षों से अधिक का न्यायिक इतिहास शामिल है। प्रैक्टिकल लॉ में 650 से अधिक वकील संपादकों द्वारा निरंतर अपडेट किए जा रहे ऑपरेशनल गाइड्स और टेम्पलेट्स हैं। चेकपॉइंट संयुक्त राज्य अमेरिका में कर पेशेवरों का मानक उपकरण है। रूटर्स समाचार कॉर्पस वैश्विक है और 175 वर्षों से अधिक के समय कवरेज को शामिल करता है।

ये डेटा इंटरनेट से स्क्रैप नहीं किए गए हैं।

ये विशेषज्ञ संपादित, टैग किए गए, संरचित और निरंतर अपडेट किए गए स्वामित्व एसेट हैं। इन डेटा पर प्रशिक्षित वर्टिकल मॉडल अपने विशेषज्ञ क्षेत्र में सटीकता और संदर्भ गुणवत्ता के मामले में सामान्य मॉडल को सिर्फ RAG (रिट्रीवल-एन्हांस्ड जनरेशन) या फाइन-ट्यूनिंग से मिलना मुश्किल है। सामान्य मॉडल इन डेटा को "एक्सेस" कर सकते हैं, लेकिन एक्सेस करना और "उनमें उगना" दो अलग बातें हैं।

थॉमसन रूटर्स ने खुद इस अंतर को उजागर किया है: क्षेत्र-विशिष्ट प्रशिक्षण से प्राप्त लाभ, केवल सामग्री के समावेश से अप्रतिस्थाप्य है।

कौन इस रास्ते पर जाएगा?

थॉमसन रूटर्स एकमात्र नहीं होगी। "स्वामित्व वाला डेटा → वर्टिकल मॉडल → कम निष्कर्ष लागत → बेहतर डेटा नियंत्रण → उच्च व्यावसायिक शुद्ध लाभ" के श्रृंखला को देखते हुए, कम से कम कुछ प्रकार की कंपनियाँ इस मॉडल को नकल करने की स्थिति में हैं।

एक वित्तीय डेटा कंपनी। Bloomberg ने 2023 में अपने स्वयं के वित्तीय टर्मिनल डेटा और समाचार कॉर्पस के आधार पर BloombergGPT को प्रशिक्षित किया। हालांकि बाद के कदम कम रहे, लेकिन Bloomberg Terminal का डेटा बैरियर Thomson Reuters के Westlaw के समान स्तर का है—ये ऐसे निजी डेटासेट हैं जिनका कोई भी सामान्य मॉडल कानूनी रूप से प्राप्त नहीं कर सकता।

व्यावसायिक सेवा संस्थाएं। चार बड़े लेखा फर्म (PwC, Deloitte, EY, KPMG), बड़े कानूनी संघ (जैसे Baker McKenzie, Kirkland & Ellis), और स्वास्थ्य सूचना कंपनियां (जैसे Epic Systems के इलेक्ट्रॉनिक मेडिकल रिकॉर्ड डेटा) के पास अत्यधिक संरचित और अत्यधिक गोपनीय व्यावसायिक डेटा होता है। ये संस्थाएं अपने ग्राहक डेटा को सामान्य मॉडल पर प्रसंस्कृत करने के लिए नहीं देना चाहतीं, लेकिन AI के माध्यम से दक्षता में वृद्धि की आवश्यकता भी होती है। सामान्य मॉडल के लिए संगठनों के लिए, संगतता के दृष्टिकोण से, ऊर्ध्वाधर मॉडल बनाना एक विकल्प नहीं, बल्कि एक आवश्यकता है।

उद्योग के डेटा मोनोपोलिस्ट। MSCI के पास वैश्विक ESG रेटिंग और इंडेक्स डेटा है, Verisk के पास बीमा मूल्य निर्धारण और जोखिम मॉडल डेटा है, Wolters Kluwer के पास यूरोपीय कानून और अनुपालन डेटा है, RELX के पास Elsevier शोध पत्र और LexisNexis कानूनी डेटा है। इन कंपनियों की सामान्य विशेषता यह है: डेटा मूल संपत्ति है, डेटा की अनन्यता ही व्यापारिक लाभ है, और अन्य के मॉडल को डेटा प्रदान करने से अपनी मूल्यता कम होती है।

OpenAI और Anthropic के लिए क्या अर्थ है?

थॉमसन रूटर्स के घोषणा पत्र में एक ऐसा विवरण है जिसे आसानी से नजरअंदाज किया जा सकता है: CoCounsel बहु-मॉडल आर्किटेक्चर को बनाए रखता है। जहाँ थॉमसन का लाभ है, वहाँ थॉमसन का उपयोग करें, और अन्य परिदृश्यों में बाहरी मॉडल का उपयोग जारी रखें।

यह बताता है कि यहां तक कि जिन कंपनियों ने अपने मॉडल बना लिए हैं, वे भी सामान्य मॉडल को पूरी तरह नहीं छोड़ते।

जनरल मॉडल अभी भी जनरल इन्फरेंस, कोड जनरेशन, मल्टीलैंग्वेज प्रोसेसिंग आदि में लाभ रखते हैं। वर्टिकल मॉडल जनरल मॉडल को विशिष्ट क्षेत्र में "पर्याप्त लेकिन पर्याप्त नहीं" वाले स्तर से बदल देते हैं।

लेकिन दीर्घकालिक रूप से, यदि अधिक और अधिक उच्च मूल्यवान उद्योग ग्राहक अपने स्वयं के ऊर्ध्वाधर मॉडल बनाना शुरू कर देते हैं, तो सामान्य मॉडल कंपनियों का जोखिम है कि वे बुनियादी ढांचे के स्तर तक सीमित हो जाएंगे: उद्योगों के लिए आधार मॉडल प्रदान करना, सामान्य कार्यों के लिए निष्कर्षण API प्रदान करना, लेकिन सबसे लाभदायक ऊर्ध्वाधर अनुप्रयोगों में मूल्य निर्धारण का अधिकार खो देना।

यह क्लाउड कंप्यूटिंग उद्योग के विकास के समान है।

AWS, Azure और GCP इंफ्रास्ट्रक्चर प्रदान करते हैं, लेकिन सबसे लाभदायक SaaS एप्लिकेशन लेयर Salesforce, ServiceNow, Workday जैसी वर्टिकल कंपनियों द्वारा कब्जा किया गया है। यदि AI उद्योग इसी पथ पर चलता है, तो OpenAI और Anthropic की भूमिका "AI का AWS" के बजाय "AI का Salesforce" के अधिक समान हो सकती है।

थॉमसन रूटर्स द्वारा 4000 डॉलर के खर्च से साबित किया गया बात यह है: जब आपके पास पर्याप्त अनोखा डेटा होता है, तो आप अपने क्षेत्र में दस अरब डॉलर के खर्च से प्रशिक्षित सामान्य मॉडल के साथ बराबरी कर सकते हैं।

जब यह तर्क सत्यापित हो जाएगा, तो प्रत्येक कंपनी जो अपने स्वामित्व वाले डेटा खनन पर बैठी है, वह फिर से गणना करेगी: क्या वह OpenAI या Anthropic को प्रतिवर्ष API शुल्क देना जारी रखे, या अपना पूरी तरह से नियंत्रित वर्टिकल मॉडल ट्रेन करने के लिए एक तुलनात्मक रूप से कम राशि खर्च करे?

AI आयुध प्रतिस्पर्धा के कथन को लेकर जिस बाजार को आदत है, उसके लिए थॉमसन रूटर्स के 4000 डॉलर एक विपरीत संकेत है। AI प्रतिस्पर्धा के अगले चरण में, जीतने वाली कंपनी वह नहीं होगी जिसकी प्रशिक्षण लागत सबसे अधिक होगी, बल्कि वह होगी जिसके पास सबसे अनूठा और सबसे अपरिहार्य डेटा होगा। मॉडल उपकरण हैं, डेटा ही बाधा है।

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।