Nilabas ni Harvey at EngramLab ang isang open-source na synthetic dataset na naglalaman ng higit sa 100 milyon na token, na nagtatayo ng buong corpus ng trabaho ng isang fiktibong law firm upang matutunan ng mga totoong AI system kung paano gumagana ang mga tunay na law firm. Ang dataset ay kumakalat sa higit sa 250 na sintetikong kaso ng kliyente sa loob ng 46 na kliyente, na may halos 10,000 na indibidwal na file na kumakatawan sa uri ng institusyonal na kaalaman na karaniwang nasa loob ng mga ulo ng mga partner na may dekada-dekada na karanasan.
Ano ang kasama talaga sa dataset
Ang kontribusyon ng EngramLab ay nakabatay sa teknolohiya nito sa memorya-layer, na sinasabing kayang i-compress ang organisasyonal na konteksto hanggang sa bawasan ang paggamit ng token ng hanggang 100x. Sa praktikal na mga termino, ibig sabihin nito na ang isang AI system ay kayang prosesuhin ang katumbas ng buong karera ng isang kasosyo ng institusyonal na kaalaman nang hindi mabubulok ang budget para sa compute.
Si Harvey, sa kanyang panig, ay nagtatayo patungo sa ganitong uri ng paglabas. Noong una sa 2026, in-open source ng kumpanya ang Legal Agent Benchmark, kilala bilang LAB, na nagtatag ng mga pamantayang paraan upang masukat kung gaano kahusay ang mga AI agent sa mga legal na gawain. Ang synthetic dataset ay isang natural na kasamang bahagi, na nagbibigay sa mga mananaliksik at developer ng tunay na materyales para sa pagtuturo kasama ang mga benchmark na iyon.
Ang mga kumpanya sa likod ng paglabas
Naging isa sa mga pinakamakapangyarihang player sa legal AI si Harvey, na kasalukuyang may halaga na $11 bilyon. Ang kumpanya ay nakaposisyon bilang platform para sa mga law firm na naghahanap na i-integrate ang AI sa kanilang mga workflow nang hindi nagpapabaya sa kontrol ng kanilang propiyetaryong kaalaman.
Kumita ng $98 milyon ang EngramLab sa pagsasapalaran noong Hunyo 23, 2026, sa isang halaga na humigit-kumulang $600 milyon. Ang pangunahing teknolohiya nito ay nakatuon sa mga natutunang layer ng memorya para sa mga sistema ng AI, na nagpapababa ng computational overhead na kailangan upang panatilihin ang konteksto sa mahabang interaksyon.
Ang pagkakasundo sa pagitan ng dalawang kumpanya ay nagsimula bago ang paglabas ng dataset na ito. Ang kanilang kolaborasyon ay nakatuon sa pag-encode ng mga proseso ng mga kumpanya ng abogado gamit ang AI, na may Legal Agent Benchmark bilang isang maagang publikong output ng gawaing iyon.
Bakit mahalaga ang open source dito
Kilala ang mga law firm bilang masigasig na nagpaprotekta sa kanilang data, at may mabuting dahilan. Ang attorney-client privilege, ang work-product doctrine, at ang kompetitibong lihim ay naglalikha ng malalaking hadlang sa pagbuo ng uri ng training data na kailangan ng mga AI system. Ang synthetic data ay nag-aalok ng solusyon: ang lahat ng estruktural na kumplikasyon ng totoong legal na gawain, walang mga alalahanin tungkol sa konsiderasyon.
Ano ang ibig sabihin nito para sa legal na landscape ng AI
Ang claim ni EngramLab tungkol sa 100x compression, kung patutunayan sa praktika, ay maaaring maging lalong mahalaga. Isang solong M&A transaction ay maaaring magproduksyon ng mga libo-libong pahina ng dokumento. Anumang teknolohiya na makakapagpanatili ng makabuluhang konteksto sa ganitong dami nang walang proporsyonal na pagtaas sa gastos ay lalampas sa isa sa mga pangunahing bottleneck sa pag-deploy ng AI sa malaking saklaw sa loob ng mga law firm.
Para kay Harvey, ang open-source strategy ay nagpapalakas sa posisyon nito bilang isang infrastructure layer para sa legal AI kaysa isa lamang sa mga point solution. Sa pagbibigay ng parehong benchmark (LAB) at ngayon ang training data, ang kumpanya ay nagpapabuo ng mga istandard na gagamitin ng buong sektor.
