Ang paglutas ng bawat problema sa isa sa mga pinakamahirap na benchmark sa matematika ay karaniwang nagkakahalaga ng maraming libo-libong dolyar. Ginawa ng NEAR AI ito para sa $111 lang.
Noong Setyembre 6, 2026, inanunsyo ni Alex Skidanov, co-founder ng NEAR Protocol, na ang open-source na Lean agent ng proyekto ay nalutasan ang lahat ng 672 na problema sa PutnamBench benchmark, isang set na kinuha mula sa William Lowell Putnam Mathematical Competition. Ang kabuuang gastos: $111. Ang pangalawang pinakamura na kilalang pagpapasa ay nagsakop ng 250 beses na higit pa.
Ano talaga ang PutnamBench, at bakit ito mahalaga
Ang Putnam Competition ay ang pinakamakapangyarihang paligsahan sa matematika para sa mga undergraduate sa North America. Ang pagkuha ng score na zero ay hindi kakaibang bagay, kahit sa mga genyo. Ang pagsusulit ay disenyo upang sirain ka.
Ang PutnamBench, na ipinakilala noong 2024, ay kinuha ang tradisyong ito ng kahirapan at ginawa itong pormal na suite ng pagtataya para sa mga AI theorem-prover. Ang benchmark ay naglalaman ng 672 mga problema na encoded sa Lean 4, isang wika ng proof assistant na nangangailangan ng mga matematikal na argumento na isulat nang may machine-verifiable na presisyon. Ang isang patotoo na lohikal na malabo ay agad na tatanggihan, walang bahagyang puntos.
Bago ang resulta ng NEAR AI, madalas na kailangan ng mga agent na gumamit ng libu-libong paghinga ng pagpapatakbo bawat problema. Ang mga gastos sa compute ay tumataas nang mabilis, nagdudulot ng kabuuang gastos sa pagitan ng $10,000 hanggang $25,000 para sa mga nangungunang sistema.
Natapos ng Lean agent ng NEAR AI ang buong hanay ng 672 na problema para sa $111.
Bakit ang cost gap ang totoong kuwento
Sa $10,000 hanggang $25,000 bawat buong pagpapatakbo, maraming organisasyon lamang ang kayang mag-iterate, mag-experiment, at mapabuti ang kanilang mga pipeline para sa pagpapatotoo ng teorema. Sa $111, ang kalkulasyon ay bumabalik nang buo.
Ang mabilis na pag-unlad sa mga resulta ng PutnamBench sa pagitan ng 2025 at 2026 ay nangyayari na dahil sa agentic workflows na nagkakaisa sa mga malalaking language model at proof-checking engine ni Lean. Ang pagkakasundo ni NEAR AI ay nagpapatuloy sa pattern na iyon, ngunit idinagdag ang isang antas ng efficiency na hindi pa nakikita ng komunidad ng benchmark.
Ang NEAR AI ay isinilid ang tagumpay na ito sa isang mas malawak na pananaw sa imprastruktura na nakatuon sa kanyang tinatawag na IronClaw, isang framework na nakatuon sa lihim at verifiable na AI. Direktang sumasalamin sa pagsasalaysay na ito ang kakayahang magkaroon ng pormal na pagpapatotoo: kung makakapagpatunay ka na tama ang isang matematikal na argumento sa antas ng machine, mayroon ka nang pundasyon para sa mga sistema ng AI kung saan ang mga output nito ay maaaring ma-audit nang independiyente kaysa sa pagtitiwala lamang.
Ang desisyon ng NEAR Protocol na gawing open-source ang Lean agent ay nagpapalakas sa kahalagahan nito. Ang mga proprietary na tool na nagdadala ng 250x na advantage sa gastos ay karaniwang nananatiling proprietary. Ang pag-open-source ng agent ay nangangahulugan na ang metodolohiya ay available para sa pagsusuri, pagpapalawak, at paggamit ng sinuman.

