हैरवे और एनग्रामलैब ने एक ओपन-सोर्स सिंथेटिक डेटासेट जारी किया है, जिसमें 100 मिलियन से अधिक टोकन हैं, जो मूल रूप से एक काल्पनिक कानूनी फर्म के पूरे कार्य को बनाता है, ताकि वास्तविक AI प्रणालियाँ वास्तविक फर्मों के कैसे संचालित होती हैं, इसका अध्ययन कर सकें। यह डेटासेट 46 ग्राहकों के लिए 250 से अधिक काल्पनिक मामलों को कवर करता है, जिसमें लगभग 10,000 व्यक्तिगत फाइलें हैं, जो उस संस्थागत ज्ञान को दर्शाती हैं जो सामान्यतः दशकों से अभ्यास कर रहे साझेदारों के मन में होता है।
डेटासेट में वास्तव में क्या शामिल है
एन्ग्रमलैब का योगदान इसकी मेमोरी-लेयर तकनीक पर केंद्रित है, जिसका कंपनी दावा है कि यह संगठनात्मक संदर्भ को इतना संपीड़ित कर सकती है कि टोकन उपयोग में अधिकतम 100x की कमी हो सके। व्यावहारिक रूप से, इसका मतलब है कि एक एआई प्रणाली बिना कंप्यूट बजट को खत्म किए एक साझेदार के करियर के बराबर संस्थागत ज्ञान को प्रोसेस कर सकती है।
हैरवे, अपने हिस्से के रूप में, इस तरह के रिलीज की ओर बढ़ रहा है। 2026 की शुरुआत में, कंपनी ने लीगल एजेंट बेंचमार्क, जिसे LAB के नाम से जाना जाता है, को ओपन-सोर्स किया, जिसने AI एजेंट्स के कानूनी कार्यों पर प्रदर्शन को मापने के मानकीकृत तरीके स्थापित किए। सिंथेटिक डेटासेट एक प्राकृतिक सहयोगी है, जो शोधकर्ताओं और डेवलपर्स को उन बेंचमार्क के साथ काम करने के लिए वास्तविक प्रशिक्षण सामग्री प्रदान करता है।
रिलीज के पीछे की कंपनियाँ
हैरवे अब विधि AI के सबसे प्रमुख खिलाड़ियों में से एक बन गया है, जिसका वर्तमान मूल्य $11 बिलियन है। कंपनी ने खुद को ऐसे कानूनी फर्मों के लिए एक प्लेटफॉर्म के रूप में स्थापित किया है जो अपने स्वामित्व वाले ज्ञान को छोड़े बिना अपनी प्रक्रियाओं में AI को एकीकृत करना चाहते हैं।
23 जून, 2026 को EngramLab ने लगभग $600 मिलियन के मूल्यांकन पर $98 मिलियन की फंडिंग एकत्र की। इसकी मुख्य तकनीक AI प्रणालियों के लिए सीखे गए स्मृति परतों पर केंद्रित है, जो लंबी बातचीत के दौरान संदर्भ बनाए रखने के लिए आवश्यक कंप्यूटेशनल ओवरहेड को कम करती है।
दोनों कंपनियों के बीच का साझेदारी इस डेटासेट रिलीज से पहले की थी। उनकी सहयोगिता AI के माध्यम से कानूनी फर्म प्रक्रियाओं को कोडिंग पर केंद्रित रही है, जिसमें लीगल एजेंट बेंचमार्क उस कार्य का एक प्रारंभिक सार्वजनिक आउटपुट है।
यहाँ ओपन सोर्स क्यों मायने रखता है
कानूनी फर्में अपने डेटा की रक्षा के लिए प्रसिद्ध हैं, और इसका अच्छा कारण है। वकील-ग्राहक विशेषाधिकार, कार्य-उत्पाद सिद्धांत और प्रतिस्पर्धी गोपनीयता सभी ऐसे डेटा के संग्रह के लिए विशाल बाधाएँ उत्पन्न करते हैं जिसकी एआई प्रणालियों को आवश्यकता होती है। सिंथेटिक डेटा एक समाधान प्रदान करता है: वास्तविक कानूनी कार्य की सभी संरचनात्मक जटिलता, बिना किसी गोपनीयता की चिंता के।
इसका कानूनी AI दृश्य पर क्या असर होगा
एनग्रामलैब का 100x संपीड़न का दावा, यदि व्यवहार में साबित होता है, तो विशेष रूप से महत्वपूर्ण साबित हो सकता है। एक एकल एमए लेनदेन से दस हजारों पृष्ठों के दस्तावेज़ बन सकते हैं। कोई भी तकनीक जो इस तरह के आयतन के दौरान अर्थपूर्ण संदर्भ को बनाए रख सके बिना लागत में समानुपातिक वृद्धि के, कानूनी कंपनियों में AI को पैमाने पर लागू करने की एक मूलभूत बाधा को हल करती है।
हैरवे के लिए, ओपन-सोर्स रणनीति इसे केवल एक अन्य पॉइंट सॉल्यूशन के बजाय कानूनी AI के लिए एक बुनियादी ढांचे के रूप में अपनी पोज़ीशन को मजबूत करती है। बेंचमार्क (LAB) के साथ-साथ अब प्रशिक्षण डेटा प्रदान करके, कंपनी ऐसे मानक तैयार कर रही है जिनके आधार पर पूरा क्षेत्र विकसित होगा।
