EngramLab at Harvey ay naglunsad ng 100M-token na synthetic legal dataset

iconCryptoBriefing
I-share
AI summary iconSummary
Ipinakilala ni EngramLab at Harvey ang isang 100M-token na sintetikong dataset para sa batas na nakatuon sa mga skenaryo ng CFT (Countering the Financing of Terrorism), na naglalayong mapabuti ang efficiency ng AI sa mga legal na gawain. Ang open-source na data ay sumasimula sa mga workflow ng law firm sa loob ng 250 client matters at 10,000 files. Ang memory-layer tech ni EngramLab ay nag-claim na 100x mas kaunting tokens ang kailangan para sa pagproseso. Noon ay ipinakilala ni Harvey ang Legal Agent Benchmark upang standardize ang performance ng AI. Ang paglalabas ay sumusuporta sa AI sa mga legal na workflow habang pinapanatili ang data privacy, na sumasalungat sa mga trend sa likwididad at crypto markets.

Nilabas ni Harvey at EngramLab ang isang open-source na synthetic dataset na naglalaman ng higit sa 100 milyon na token, na nagtatayo ng buong corpus ng trabaho ng isang fiktibong law firm upang matutunan ng mga totoong AI system kung paano gumagana ang mga tunay na law firm. Ang dataset ay kumakalat sa higit sa 250 na sintetikong kaso ng kliyente sa loob ng 46 na kliyente, na may halos 10,000 na indibidwal na file na kumakatawan sa uri ng institusyonal na kaalaman na karaniwang nasa loob ng mga ulo ng mga partner na may dekada-dekada na karanasan.

Ano ang kasama talaga sa dataset

Ang kontribusyon ng EngramLab ay nakabatay sa teknolohiya nito sa memorya-layer, na sinasabing kayang i-compress ang organisasyonal na konteksto hanggang sa bawasan ang paggamit ng token ng hanggang 100x. Sa praktikal na mga termino, ibig sabihin nito na ang isang AI system ay kayang prosesuhin ang katumbas ng buong karera ng isang kasosyo ng institusyonal na kaalaman nang hindi mabubulok ang budget para sa compute.

Si Harvey, sa kanyang panig, ay nagtatayo patungo sa ganitong uri ng paglabas. Noong una sa 2026, in-open source ng kumpanya ang Legal Agent Benchmark, kilala bilang LAB, na nagtatag ng mga pamantayang paraan upang masukat kung gaano kahusay ang mga AI agent sa mga legal na gawain. Ang synthetic dataset ay isang natural na kasamang bahagi, na nagbibigay sa mga mananaliksik at developer ng tunay na materyales para sa pagtuturo kasama ang mga benchmark na iyon.

Pamamahayag

Ang mga kumpanya sa likod ng paglabas

Naging isa sa mga pinakamakapangyarihang player sa legal AI si Harvey, na kasalukuyang may halaga na $11 bilyon. Ang kumpanya ay nakaposisyon bilang platform para sa mga law firm na naghahanap na i-integrate ang AI sa kanilang mga workflow nang hindi nagpapabaya sa kontrol ng kanilang propiyetaryong kaalaman.

Kumita ng $98 milyon ang EngramLab sa pagsasapalaran noong Hunyo 23, 2026, sa isang halaga na humigit-kumulang $600 milyon. Ang pangunahing teknolohiya nito ay nakatuon sa mga natutunang layer ng memorya para sa mga sistema ng AI, na nagpapababa ng computational overhead na kailangan upang panatilihin ang konteksto sa mahabang interaksyon.

Ang pagkakasundo sa pagitan ng dalawang kumpanya ay nagsimula bago ang paglabas ng dataset na ito. Ang kanilang kolaborasyon ay nakatuon sa pag-encode ng mga proseso ng mga kumpanya ng abogado gamit ang AI, na may Legal Agent Benchmark bilang isang maagang publikong output ng gawaing iyon.

Bakit mahalaga ang open source dito

Kilala ang mga law firm bilang masigasig na nagpaprotekta sa kanilang data, at may mabuting dahilan. Ang attorney-client privilege, ang work-product doctrine, at ang kompetitibong lihim ay naglalikha ng malalaking hadlang sa pagbuo ng uri ng training data na kailangan ng mga AI system. Ang synthetic data ay nag-aalok ng solusyon: ang lahat ng estruktural na kumplikasyon ng totoong legal na gawain, walang mga alalahanin tungkol sa konsiderasyon.

Ano ang ibig sabihin nito para sa legal na landscape ng AI

Ang claim ni EngramLab tungkol sa 100x compression, kung patutunayan sa praktika, ay maaaring maging lalong mahalaga. Isang solong M&A transaction ay maaaring magproduksyon ng mga libo-libong pahina ng dokumento. Anumang teknolohiya na makakapagpanatili ng makabuluhang konteksto sa ganitong dami nang walang proporsyonal na pagtaas sa gastos ay lalampas sa isa sa mga pangunahing bottleneck sa pag-deploy ng AI sa malaking saklaw sa loob ng mga law firm.

Para kay Harvey, ang open-source strategy ay nagpapalakas sa posisyon nito bilang isang infrastructure layer para sa legal AI kaysa isa lamang sa mga point solution. Sa pagbibigay ng parehong benchmark (LAB) at ngayon ang training data, ang kumpanya ay nagpapabuo ng mga istandard na gagamitin ng buong sektor.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.