EngramLab 與 Harvey 發布 1 億代幣合成法律數據集

iconCryptoBriefing
分享
AI summary icon精華摘要
EngramLab 與 Harvey 發布了專注於 CFT(打擊資助恐怖主義)情境的 1 億詞元合成法律數據集,旨在提升 AI 在法律任務中的效率。這份開源數據模擬了 250 個客戶案件和 10,000 個文件的律所工作流程。EngramLab 的記憶層技術聲稱可將處理所需的詞元數減少 100 倍。Harvey 此前已發布 Legal Agent Benchmark,以標準化 AI 的表現。此發布有助於在維護數據隱私的前提下支持 AI 在法律工作流程中的應用,與流動性及加密市場的趨勢一致。

Harvey 和 EngramLab 已釋出一個開源的合成資料集,包含超過 1 億個標記,基本上模擬了一家虛構律所的全部工作內容,以便真實的 AI 系統學習實際律所的運作方式。該資料集涵蓋 46 位客戶的超過 250 個合成客戶案件,約有 10,000 個獨立檔案,代表通常存於從業數十年的合夥人腦中的機構知識。

該數據集實際包含的內容

EngramLab 的貢獻在於其記憶層技術,該公司聲稱此技術可將組織情境壓縮至將代幣使用量減少高達 100 倍。實際上,這意味著 AI 系統可以在不耗盡計算預算的情況下,處理相當於一位合作夥伴職業生涯的機構知識。

至於 Harvey,其一直為此類發布做準備。2026 年早些時候,該公司開源了法律代理基準(Legal Agent Benchmark,簡稱 LAB),建立了衡量 AI 代理在法律任務中表現的標準化方法。該合成數據集是自然的配套內容,為研究人員和開發者提供了與這些基準配套的實際訓練材料。

廣告

背後的公司

Harvey 已成為法律 AI 領域最突出的玩家之一,目前估值為 $11 億美元。該公司將自身定位為一個平台,協助律師事務所在不放棄其專有知識控制權的情況下,將 AI 整合到工作流程中。

EngramLab 於 2026 年 6 月 23 日完成 98 億美元融資,估值約為 6 億美元。其核心技術專注於 AI 系統的學習記憶層,降低在長時間互動中維持上下文所需的計算開銷。

這兩家公司之間的合作早於此數據集發布。他們的合作主要集中在透過人工智能編碼律所流程,而法律代理基準測試則是該項工作的早期公開成果。

為何開源在這裡至關重要

律所一向對其資料高度保護,這有其合理原因。律師與客戶之間的特權、工作產物原則以及競爭機密,都為構建人工智能系統所需的訓練資料設下了巨大障礙。合成資料提供了一種解決方案:保留真實法律工作的全部結構複雜性,卻無需擔憂機密性問題。

這對法律 AI 領域的意義

EngramLab 宣稱的 100 倍壓縮率,若在實際應用中得以實現,將具有特別重要的意義。一宗併購交易可能產生數萬頁的文件。任何能夠在如此大量資料中維持有意義的上下文,且無需成比例增加成本的技術,都將解決律所大規模部署 AI 時面臨的基本瓶頸之一。

對於 Harvey 而言,開源策略強化了其作為法律 AI 基礎設施層的地位,而非僅僅是另一種點解決方案。通過提供基準(LAB)以及現在的訓練數據,該公司正在塑造整個行業將依循的標準。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露