हर उद्यमिक AI टीम अंततः एक ही बाधा से टकराती है: PDF से उपयोगी डेटा प्राप्त करना। दस्तावेज अव्यवस्थित होते हैं, तालिकाएँ अजीब होती हैं, लेआउट अस्थिर होते हैं, और वे उपकरण जो वास्तव में काम करते हैं, वे ऐसा शुल्क लेते हैं जैसे वे जानते हैं कि आप निराश हैं। कोहेर को लगता है कि उसके पास एक बेहतर सौदा है।
कंपनी ने गुरुवार को पार्स 5 जारी किया, एक 2.3 अरब पैरामीटर विजन भाषा मॉडल जो PDF, स्लाइड्स और इमेजेज को संरचित मार्कडाउन में बदलने के लिए डिज़ाइन किया गया है। इसका दावा यह नहीं है कि यह बाजार में सबसे सटीक पार्सर है। इसका दावा यह है कि यह पर्याप्त सटीक है और इतना सस्ता है कि इसे स्केल पर चलाया जा सकता है।
पार्स 5 वास्तव में क्या करता है
पार्स 5 (मॉडल आईडी: parse-v5.0) का आकार लगभग 4.6 जीबी है और इसमें 8K संदर्भ विंडो है। इसे ऐसे दस्तावेज़ों को संभालने के लिए बनाया गया है जिनसे एआई पाइपलाइन अटक जाती हैं: जटिल तालिकाएँ, नेस्टेड सूचियाँ, फॉर्म, कैप्शन वाली छवियाँ, मल्टी-कॉलम लेआउट और पेज सीमाएँ।
तालिकाएँ HTML के रूप में निर्यात की जाती हैं। दृश्य तत्वों के साथ बाउंडिंग बॉक्स आते हैं। पठन क्रम संरक्षित होता है, जो इतना महत्वपूर्ण है क्योंकि पैराग्राफ को गलत क्रम में प्राप्त करने से नीचे की ओर जाने वाली प्राप्ति प्रणाली को चुपचाप नुकसान पहुँच सकता है।
मॉडल नौ प्रमुख वाणिज्यिक भाषाओं का समर्थन करता है, जिससे वित्त, बीमा, कानून और वैज्ञानिक क्षेत्रों में बहुराष्ट्रीय लागूकरण के लिए एक बॉक्स चेक होता है। कोहेर भी सुरक्षित लागूकरण विकल्प प्रदान कर रहा है, जो इस वास्तविकता को स्वीकार करता है कि इन क्षेत्रों के उद्यम अपने संवेदनशील दस्तावेजों को बिना सुरक्षा के तीसरे पक्ष के API के माध्यम से भेजने में प्रसन्न नहीं हैं।
जो संख्याएँ मायने रखती हैं
API मूल्य निर्धारण $1.50 प्रति 1,000 पृष्ठ से शुरू होता है। जिन संगठनों के पास दस्तावेजों को बड़े पैमाने पर प्रोसेस करने की आवश्यकता होती है, उनके लिए Cohere का मॉडल वॉल्ट 23% से 61% तक की टियर्ड छूट प्रदान करता है, जो उपयोग पर निर्भर करता है।
इसे वास्तविक शब्दों में कहें तो: कोहेरे का अनुमान है कि प्रति महीने 13 मिलियन पृष्ठों के वर्कफ्लो का उपयोग सीधे API कॉल्स के बजाय मॉडल वॉल्ट के माध्यम से किया जाए तो लगभग $144K की बचत हो सकती है।
प्रतिनिधि हार्डवेयर पर थ्रूपुट 4.5 पृष्ठ प्रति सेकंड पर पहुँचता है। यह गति कुछ ओपन-सोर्स विकल्पों से आगे है।
Cohere के ParseBench बेंचमार्क पर, Parse 5 का औसत स्कोर 79.2 है। इसका टेबल पार्सिंग 87.0 तक पहुँचता है, और विश्वसनीयता, यानी आउटपुट कितनी सटीकता से स्रोत दस्तावेज को दर्शाता है, 86.6 पर पहुँचती है।
संदर्भ के लिए, Mistral OCR 4 इसी बेंचमार्क पर 74.5 स्कोर करता है। LlamaParse Cost Effective 78.3 पर आता है। हालाँकि, Parse 5 दोनों को पीछे छोड़ देता है, और Cohere स्पष्ट रूप से बताता है कि बड़े और महंगे मॉडल अभी भी कच्ची सटीकता पर इसे पीछे छोड़ते हैं।
यह एंटरप्राइज AI स्टैक में कहाँ फिट होता है
5 प्लग्स को Cohere के मौजूदा परितंत्र में पार्स किया जाता है और Microsoft Foundry और AWS SageMaker के साथ एकीकृत किया जाता है। यह अंतरसंचालन महत्वपूर्ण है क्योंकि अधिकांश उद्यम अपने AI स्टैक को शून्य से नहीं बना रहे हैं। वे नए उपकरणों को मौजूदा क्लाउड इंफ्रास्ट्रक्चर पर जोड़ रहे हैं।
मॉडल को एजेंटिक रिट्रीवल पाइपलाइन्स के लिए भी स्थित किया गया है, जो बढ़ती लोकप्रियता प्राप्त आर्किटेक्चर है जहां AI एजेंट स्वतंत्र रूप से दस्तावेज़ भंडारों के माध्यम से खोज करते हैं ताकि कार्य पूरा किए जा सकें। इन वर्कफ्लोज़ में अक्सर विशाल मात्रा में दस्तावेज़ों को प्रोसेस किया जाता है, जिससे प्रति पृष्ठ लागत एक महत्वपूर्ण चर बन जाती है जो यह तय कर सकती है कि कोई प्रोजेक्ट आर्थिक रूप से संभव है या शुरू होने से पहले ही असफल हो जाएगा।
