Harvey ve EngramLab, gerçek AI sistemlerinin gerçek hukuk firmalarının nasıl çalıştığını öğrenmesi için tamamen sahte bir hukuk firmasının tüm çalışmalarını içeren 100 milyondan fazla token içeren açık kaynaklı bir sentetik veri kümesi yayınladı. Veri kümesi, 46 müşteride 250'den fazla sentetik müşteri meselesini kapsıyor ve on binlerce bireysel dosya, yıllarca uygulama yapan ortakların zihinlerinde genellikle yer alan kurumsal bilgiyi temsil ediyor.
Veri kümesi aslında ne içeriyor
EngramLab’ın katkısı, şirketin organize bağlamı sıkıştırarak token kullanımını en fazla 100 kat azaltabileceğini iddia ettiği bellek katmanı teknolojisine odaklanmaktadır. Pratik olarak, bu, bir yapay zeka sisteminin bir ortağın kariyeri boyunca birikmiş kurumsal bilgiye eşdeğer bir miktarı işlemesini, hesaplama bütçelerini tüketerek yapmadan mümkün kılacaktır.
Harvey, kendi kısmında, bu tür bir sürüm için çalışmaya devam etti. 2026 yılının erken dönemlerinde, şirket, AI agenterinin hukuki görevlerde ne kadar iyi performans gösterdiğini ölçmek için standartlaştırılmış yolları tanımlayan Legal Agent Benchmark (LAB)’ı açık kaynak hale getirdi. Sentetik veri seti, bu benchmark’larla birlikte araştırmacılar ve geliştiricilere gerçek eğitim materyalleri sunan doğal bir tamamlayıcıdır.
Sürümün arkasındaki şirketler
Harvey, şu anda 11 milyar dolar değerinde olan bir şirket olarak, hukuki yapay zekanın en önde gelen oyuncularından biri haline geldi. Şirket, özgün bilgilerini kontrolünü kaybetmeden iş akışlarına yapay zekayı entegre etmek isteyen avukatlık firmaları için bir platform olarak kendini konumlandırdı.
EngramLab, 23 Haziran 2026 tarihinde yaklaşık 600 milyon dolarlık bir değerlemeye sahip olarak 98 milyon dolar fon topladı. Temel teknolojisi, uzun etkileşimler boyunca bağlamı korumak için gerekli hesaplama yükünü azaltan AI sistemleri için öğrenilmiş bellek katmanlarına odaklanır.
İki şirket arasındaki ortaklık, bu veri kümesinin yayımlanmasından önce başlamıştır. İş birlikleri, hukuk firması süreçlerinin AI ile kodlanmasına odaklanmıştır ve Legal Agent Benchmark, bu çalışmanın erken kamuoyuna sunulan bir çıktısıdır.
Neden burada açık kaynak önemlidir
Hukuk firmaları, iyi nedenlerle verilerini korumak için ünlüdür. Avukat-müşteri gizliliği, çalışma ürünü doktrini ve rekabetçi gizlilik, yapay zeka sistemlerinin ihtiyaç duyduğu türdeki eğitim verilerini bir araya getirmek için büyük engeller oluşturur. Yapay veriler bir çözüm sunar: gerçek hukuki işlerin tüm yapısal karmaşıklığı, hiçbir gizlilik endişesi olmadan.
Bu, hukuki AI ortamı için ne anlama geliyor
EngramLab’ın 100 kat sıkıştırma iddiası, pratikte geçerli kalırsa özellikle önemli olabilir. Tek bir BİB işlemi on binlerce sayfa belge üretebilir. Bu tür bir hacimde anlamlı bağlamı koruyup maliyet artışına orantılı olarak yük getirmeyen her teknoloji, hukuk firmalarında AI’yi ölçeklenebilir şekilde uygulamadaki temel darboğazlardan birini çözer.
Harvey için, açık kaynak stratejisi, şirketin sadece başka bir nokta çözümü değil, yasal yapay zeka için bir altyapı katmanı olarak konumunu pekiştiriyor. Hem referans (LAB) hem de şimdi eğitim verilerini sağlayarak, şirket sektörün tamamının temel alacağı standartları şekillendiriyor.
