Harvey та EngramLab випустили відкритий синтетичний набір даних, що містить понад 100 мільйонів токенів, створивши повний обсяг роботи вигаданої юридичної фірми, щоб реальні AI-системи могли вивчити, як працюють справжні фірми. Набір даних охоплює понад 250 синтетичних справ для 46 клієнтів, з приблизно 10 000 окремих файлів, що представляють інституційні знання, які зазвичай зберігаються в головах партнерів, що практикують уже десятиліття.
Що саме містить набір даних
Внесок EngramLab заснований на його технології memory-layer, яку компанія стверджує, що може стиснути організаційний контекст настільки, що зменшити використання токенів до 100 разів. У практичному плані це означає, що AI-система зможе обробити обсяг інституційних знань, що відповідає кар’єрі партнера, не витрачаючи значних ресурсів обчислень.
Harvey, для своєї частини, готувався до такого випуску. На початку 2026 року компанія відкрила код Legal Agent Benchmark, відомого як LAB, що встановило стандартизовані способи вимірювання ефективності AI-агентів при виконанні юридичних завдань. Синтетичний набір даних є природним доповненням, надаючи дослідникам і розробникам реальні навчальні матеріали для роботи разом із цими тестами.
Компанії, що стоять за випуском
Harvey став одним із найвідоміших гравців у сфері юридичного ІІ, зараз його оцінка становить 11 мільярдів доларів. Компанія позиціонує себе як платформу для юридичних фірм, які бажають інтегрувати ІІ у свої робочі процеси, не втрачаючи контролю над власними знаннями.
EngramLab зібрала 98 мільйонів доларів США у фінансуванні 23 червня 2026 року при оцінці приблизно 600 мільйонів доларів США. Її основна технологія зосереджена на навчаних шарах пам’яті для систем ШІ, що зменшує обчислювальні навантаження, необхідні для збереження контексту під час довгих взаємодій.
Партнерство між двома компаніями почалося до випуску цього набору даних. Їхня співпраця була спрямована на кодування процесів юридичних фірм за допомогою ШІ, а Оціночний інструмент для юридичного агента став раннім публічним результатом цієї роботи.
Чому відкритий код має значення саме тут
Юридичні фірми відомі своєю захисною позицією щодо даних, і це має добру причину. Адвокатсько-клієнтська привілея, доктрина робочих матеріалів та конкурентна секретність створюють величезні бар’єри для збирання типу навчальних даних, які потрібні системам ШІ. Синтетичні дані пропонують обхідний шлях: вся структурна складність реальних юридичних робіт, без будь-яких питань конфіденційності.
Що це означає для правового ландшафту штучного інтелекту
Заява EngramLab про 100-кратне стиснення, якщо вона підтвердиться на практиці, може виявитися особливо значущою. Одна транзакція злиття та поглинання може породити десятки тисяч сторінок документів. Будь-яка технологія, яка здатна зберігати значущий контекст на такому обсязі без пропорційного зростання витрат, вирішує одну з фундаментальних обмежень у масштабуванні впровадження ШІ в юридичних фірмах.
Для Harvey відкрита стратегія підсилює її позицію як інфраструктурного рівня для правового ІІ, а не просто ще однієї точкової рішення. Надаючи як бенчмарк (LAB), так і навчальні дані, компанія формує стандарти, проти яких буде будуватися весь сектор.
