Harvey 和 EngramLab 已釋出一個開源的合成資料集,包含超過 1 億個標記,基本上模擬了一家虛構律所的全部工作內容,以便真實的 AI 系統學習實際律所的運作方式。該資料集涵蓋 46 位客戶的超過 250 個合成客戶案件,約有 10,000 個獨立檔案,代表通常存於從業數十年的合夥人腦中的機構知識。
該數據集實際包含的內容
EngramLab 的貢獻在於其記憶層技術,該公司聲稱此技術可將組織情境壓縮至將代幣使用量減少高達 100 倍。實際上,這意味著 AI 系統可以在不耗盡計算預算的情況下,處理相當於一位合作夥伴職業生涯的機構知識。
至於 Harvey,其一直為此類發布做準備。2026 年早些時候,該公司開源了法律代理基準(Legal Agent Benchmark,簡稱 LAB),建立了衡量 AI 代理在法律任務中表現的標準化方法。該合成數據集是自然的配套內容,為研究人員和開發者提供了與這些基準配套的實際訓練材料。
背後的公司
Harvey 已成為法律 AI 領域最突出的玩家之一,目前估值為 $11 億美元。該公司將自身定位為一個平台,協助律師事務所在不放棄其專有知識控制權的情況下,將 AI 整合到工作流程中。
EngramLab 於 2026 年 6 月 23 日完成 98 億美元融資,估值約為 6 億美元。其核心技術專注於 AI 系統的學習記憶層,降低在長時間互動中維持上下文所需的計算開銷。
這兩家公司之間的合作早於此數據集發布。他們的合作主要集中在透過人工智能編碼律所流程,而法律代理基準測試則是該項工作的早期公開成果。
為何開源在這裡至關重要
律所一向對其資料高度保護,這有其合理原因。律師與客戶之間的特權、工作產物原則以及競爭機密,都為構建人工智能系統所需的訓練資料設下了巨大障礙。合成資料提供了一種解決方案:保留真實法律工作的全部結構複雜性,卻無需擔憂機密性問題。
這對法律 AI 領域的意義
EngramLab 宣稱的 100 倍壓縮率,若在實際應用中得以實現,將具有特別重要的意義。一宗併購交易可能產生數萬頁的文件。任何能夠在如此大量資料中維持有意義的上下文,且無需成比例增加成本的技術,都將解決律所大規模部署 AI 時面臨的基本瓶頸之一。
對於 Harvey 而言,開源策略強化了其作為法律 AI 基礎設施層的地位,而非僅僅是另一種點解決方案。通過提供基準(LAB)以及現在的訓練數據,該公司正在塑造整個行業將依循的標準。
