HarveyとEngramLabは、1億以上のトークンを含むオープンソースの合成データセットをリリースしました。これは、実際の法律事務所がどのように運営されているかをAIシステムが学習できるよう、架空の法律事務所の全業務を再現したものです。このデータセットは、46人のクライアントにわたる250以上の合成クライアント案件をカバーし、約10,000の個別ファイルで、数十年にわたり実務を積んできたパートナーたちの頭の中にしかないような機関的知識を表しています。
そのデータセットに実際に含まれている内容
EngramLabの貢献は、同社が組織的な文脈を圧縮し、トークン使用量を最大100倍削減できると主張するメモリレイヤーテクノロジーに集中しています。実用的には、これはAIシステムがパートナーのキャリア分に相当する組織的知識を処理しても、コンピューティング予算を消費しないことを意味します。
ハーベイは、この種のリリースに向けて着実に準備を進めてきました。2026年早々、同社は「Legal Agent Benchmark」(通称LAB)をオープンソース化し、AIエージェントが法律タスクをどの程度うまく実行できるかを測定するための標準的な方法を確立しました。この合成データセットは、そのベンチマークと併せて研究者や開発者が実際に使用できるトレーニング資料として自然な補完となります。
リリースの背後にある企業
ハーヴェイは、現在の評価額が110億ドルに達し、法律分野のAIにおける最も注目されるプレイヤーの一人となりました。同社は、独自の知的財産の管理権を手放すことなく、法律事務所がAIを業務フローに統合できるプラットフォームとして位置づけています。
EngramLabは2026年6月23日、約6億ドルの評価額で9800万ドルの資金調達を実施しました。同社のコア技術は、長時間のやり取りにおけるコンテキスト維持に必要な計算オーバーヘッドを削減するための学習型メモリ層に焦点を当てています。
両社の提携は、このデータセットのリリースよりも前から存在しています。彼らの協力は、AIを通じて法律事務所のプロセスをエンコードすることに焦点を当てており、Legal Agent Benchmarkはその取り組みの初期の公開成果です。
なぜここではオープンソースが重要なのか
法律事務所は、その理由からデータの保護に非常に慎重です。弁護士と顧客との間の秘密保持義務、業務成果の保護原則、そして競争上の機密情報は、AIシステムが必要とする訓練データを構築する上で大きな障壁となります。合成データはその回避策を提供します。本物の法律業務と同様の構造的複雑さを保ちながら、機密性に関する懸念は一切ありません。
これが法的AIの景観に与える意味
EngramLabの100倍圧縮という主張が実際の運用で有効であれば、特に重要となる可能性があります。1件のM&A取引だけで数万ページに及ぶ文書が生成されることがあります。このような規模の文書量において、比例したコスト増加なしに意味のある文脈を維持できる技術は、法律事務所におけるAIのスケール導入における根本的なボトルネックの一つを解決します。
ハーベイにとって、オープンソースの戦略は、単なる別のポイントソリューションではなく、法律AIのインフラ層としての地位を強化します。同社はベンチマーク(LAB)を提供し、今回トレーニングデータも提供することで、業界全体が基準とする標準を形成しています。
