Harvey dan EngramLab telah mengeluarkan set data sintetik sumber terbuka yang mengandungi lebih daripada 100 juta token, pada dasarnya membina keseluruhan karya firma undang-undang palsu supaya sistem AI sebenar boleh belajar bagaimana firma sebenar beroperasi. Set data ini merangkumi lebih daripada 250 perkara pelanggan sintetik melalui 46 pelanggan, dengan kira-kira 10,000 fail individu yang mewakili jenis pengetahuan institusi yang biasanya tersimpan dalam fikiran rakan yang telah berlatih selama beberapa dekad.
Apa yang sebenarnya dimuatkan dalam set data
Pusat sumbangan EngramLab ialah teknologi lapisan memori miliknya, yang menurut syarikat itu boleh memampatkan konteks organisasi sehingga mengurangkan penggunaan token sehingga 100 kali ganda. Dalam istilah praktikal, itu bermakna sistem AI boleh memproses setara dengan sepanjang karier rakan yang penuh dengan pengetahuan institusi tanpa menghabiskan bajet pengiraan.
Harvey, dari pihaknya, telah membangun menuju pelepasan sebegini. Pada awal 2026, syarikat tersebut membuka sumber Benchmark Agen Undang-Undang, dikenali sebagai LAB, yang menubuhkan cara standard untuk mengukur sejauh mana agen AI berprestasi dalam tugas undang-undang. Set data sintetik ini merupakan pasangan semula jadi, memberikan bahan latihan sebenar kepada penyelidik dan pembangun untuk digunakan bersama benchmark tersebut.
Syarikat-syarikat di sebalik pelancaran
Harvey telah menjadi salah satu pemain paling ketara dalam AI undang-undang, dengan nilai semasa sebanyak $11 bilion. Syarikat ini telah menempatkan dirinya sebagai platform untuk firma undang-undang yang ingin mengintegrasikan AI ke dalam alur kerja mereka tanpa menyerahkan kawalan terhadap pengetahuan milik mereka.
EngramLab mengumpul dana sebanyak $98 juta pada 23 Jun 2026, dengan penilaian kira-kira $600 juta. Teknologi utamanya berfokus pada lapisan memori yang dipelajari untuk sistem AI, mengurangkan beban komputasi yang diperlukan untuk mengekalkan konteks sepanjang interaksi panjang.
Kerjasama antara dua syarikat ini berlaku sebelum pelepasan set data ini. Kerjasama mereka berpusat pada pengkodean proses firma undang-undang melalui AI, dengan Legal Agent Benchmark sebagai output awal awam daripada kerja tersebut.
Mengapa sumber terbuka penting di sini
Firma undang-undang terkenal kerap melindungi data mereka, dengan sebab yang baik. Privasi peguam-klien, doktrin hasil kerja, dan kerahsiaan persaingan semuanya mencipta halangan besar dalam mengumpulkan jenis data latihan yang diperlukan oleh sistem AI. Data sintetik menawarkan jalan keluar: semua kompleksiti struktur kerja undang-undang sebenar, tanpa sebarang kebimbangan kerahsiaan.
Apakah yang dimaksudkan ini terhadap landskap AI undang-undang
Tuntutan kompresi 100x EngramLab, jika berkesan dalam amalan, boleh menjadi sangat signifikan. Satu transaksi M&A sahaja boleh menghasilkan puluhan ribu muka surat dokumen. Sebarang teknologi yang mampu mengekalkan konteks yang bermakna merentas volum sebesar itu tanpa peningkatan kos yang sepadan akan menangani salah satu halangan asas dalam pelaksanaan AI dalam skala besar di kalangan firma undang-undang.
Bagi Harvey, strategi sumber terbuka memperkuat kedudukannya sebagai lapisan infrastruktur untuk AI undang-undang, bukan sekadar penyelesaian titik lain. Dengan menyediakan both benchmark (LAB) dan kini data latihan, syarikat ini membentuk piawaian yang seluruh sektor akan bangunkan.
