गणित के सबसे कठिन बेंचमार्क में से एक में हर समस्या को हल करने का आमतौर पर दस हजार डॉलर की लागत होती है। NEAR AI ने इसे केवल $111 में कर दिया।
26 सितंबर, 2026 को, NEAR प्रोटोकॉल के सह-संस्थापक एलेक्स स्किडानोव ने घोषणा की कि प्रोजेक्ट का ओपन-सोर्स लीन एजेंट ने पुटनमबेंच बेंचमार्क में सभी 672 समस्याओं को हल कर लिया है, जो विलियम लोवेल पुटनम गणितीय प्रतियोगिता से ली गई एक सूट है। कुल बिल: $111। दूसरा सबसे सस्ता ज्ञात सबमिशन 250 गुना अधिक लागत वाला था।
PutnamBench वास्तव में क्या है, और यह क्यों महत्वपूर्ण है
पुटनम प्रतियोगिता उत्तरी अमेरिका में सबसे प्रतिष्ठित स्नातक गणित प्रतियोगिता है। बहुत ही बुद्धिमान छात्रों के बीच भी शून्य अंक प्राप्त करना असामान्य नहीं है। परीक्षा आपको तोड़ने के लिए डिज़ाइन की गई है।
2024 में पेश किया गया PutnamBench, कठिनाई की इस परंपरा को AI प्रमेय-सिद्धि उपकरणों के लिए एक औपचारिक मूल्यांकन सूट में बदल देता है। इस बेंचमार्क में 672 समस्याएँ Lean 4 में कोडित हैं, जो एक प्रमाण सहायक भाषा है जिसमें गणितीय तर्क को मशीन-सत्यापित सटीकता के साथ लिखा जाना आवश्यक है। तार्किक रूप से अस्पष्ट प्रमाण को तुरंत अस्वीकार कर दिया जाता है, कोई आंशिक अंक नहीं।
NEAR AI के परिणाम से पहले, PutnamBench का प्रयास करने वाले एजेंट्स को प्रति समस्या अक्सर हजारों निष्कर्षण कॉल की आवश्यकता होती थी। कंप्यूट लागत जल्दी से बढ़ गई, जिससे प्रमुख प्रणालियों के लिए पूर्ण-बेंचमार्क चलाने की कुल व्यय राशि $10,000 से $25,000 की सीमा में आ गई।
NEAR AI का लीन एजेंट 672 समस्याओं के पूरे सेट को $111 में पूरा कर लिया।
क्यों लागत अंतर ही वास्तविक कहानी है
प्रत्येक पूर्ण रन के $10,000 से $25,000 पर, केवल कुछ ही संगठन अपने प्रमेय-उपपत्ति पाइपलाइन को दोहराने, प्रयोग करने और सुधारने के लिए सशक्त थे। $111 पर, यह गणना पूरी तरह से उलट जाती है।
2025 और 2026 के बीच PutnamBench परिणामों में तेजी से वृद्धि पहले से ही बड़े भाषा मॉडलों और Lean के प्रूफ-चेकिंग इंजन को जोड़ने वाले एजेंटिक वर्कफ्लो द्वारा संचालित हो रही थी। NEAR AI का दृष्टिकोण इस पैटर्न को आगे बढ़ाता है, लेकिन इसमें एक ऐसी दक्षता का अतिरिक्त स्तर जोड़ता है जिसे बेंचमार्क समुदाय पहले कभी नहीं देखा था।
NEAR AI ने इस उपलब्धि को अपने आईरनक्लॉव कहलाने वाले ढांचे पर केंद्रित व्यापक बुनियादी ढांचे की दृष्टि के भीतर स्थित किया है, जो गोपनीय और सत्यापित कृत्रिम बुद्धिमत्ता पर आधारित है। औपचारिक सत्यापन क्षमता इस ढांचे के सीधे अनुरूप है: यदि आप मशीन स्तर पर गणितीय तर argument की सही होने का प्रमाण दे सकते हैं, तो आपके पास कृत्रिम बुद्धिमत्ता प्रणालियों के लिए एक आधार है, जिनके आउटपुट की विश्वास पर नहीं, बल्कि स्वतंत्र रूप से ऑडिट किया जा सकता है।
NEAR प्रोटोकॉल का लीन एजेंट को ओपन-सोर्स बनाने का निर्णय इसके महत्व को बढ़ाता है। ऐसे निजी उपकरण जो 250x लागत लाभ प्रदान करते हैं, आमतौर पर निजी ही रहते हैं। एजेंट को ओपन-सोर्स करने का मतलब है कि इस विधि का जांच, विस्तार और उपयोग किसी भी व्यक्ति द्वारा किया जा सकता है।

