EngramLab et Harvey lancent un jeu de données juridique synthétique de 100 millions de jetons

iconCryptoBriefing
Partager
AI summary iconRésumé
EngramLab et Harvey ont dévoilé un jeu de données synthétiques juridiques de 100 millions de jetons axé sur des scénarios CFT (Lutte contre le financement du terrorisme), visant à améliorer l'efficacité de l'IA dans les tâches juridiques. Ces données open source simulent les processus de cabinets d'avocats sur 250 affaires clients et 10 000 fichiers. La technologie de couche mémoire d'EngramLab affirme nécessiter 100 fois moins de jetons pour le traitement. Harvey avait précédemment publié le Legal Agent Benchmark pour standardiser les performances de l'IA. Cette publication soutient l'IA dans les processus juridiques tout en préservant la confidentialité des données, en phase avec les tendances des marchés de liquidité et de cryptomonnaies.

Harvey et EngramLab ont publié un jeu de données synthétique open source contenant plus de 100 millions de jetons, créant ainsi l'ensemble des travaux d'un faux cabinet d'avocats afin que les systèmes d'IA réels puissent apprendre comment fonctionnent réellement les cabinets. Le jeu de données couvre plus de 250 affaires synthétiques pour 46 clients, avec environ 10 000 fichiers individuels représentant ce type de connaissance institutionnelle qui réside habituellement dans la tête des associés ayant exercé pendant des décennies.

Ce que contient réellement l'ensemble de données

Le centre de contribution d'EngramLab repose sur sa technologie de couche mémoire, que l'entreprise affirme permettre de compresser le contexte organisationnel au point de réduire l'utilisation de jetons jusqu'à 100 fois. En termes pratiques, cela signifie qu'un système d'IA pourrait traiter l'équivalent d'une carrière entière de connaissances institutionnelles sans épuiser son budget de calcul.

Harvey, pour sa part, a construit progressivement vers ce type de publication. Plus tôt en 2026, l'entreprise a open-sourcé le Legal Agent Benchmark, connu sous le nom de LAB, qui a établi des méthodes normalisées pour mesurer la performance des agents IA sur des tâches juridiques. L'ensemble de données synthétiques en est le complément naturel, offrant aux chercheurs et développeurs des matériaux d'entraînement concrets à utiliser alongside ces benchmarks.

Publicité

Les entreprises derrière la sortie

Harvey est devenu l'un des acteurs les plus marquants de l'IA juridique, évalué actuellement à 11 milliards de dollars. L'entreprise s'est positionnée comme une plateforme pour les cabinets d'avocats souhaitant intégrer l'IA dans leurs processus sans céder le contrôle de leurs connaissances propriétaires.

EngramLab a levé 98 millions de dollars le 23 juin 2026, à une évaluation d'environ 600 millions de dollars. Sa technologie principale se concentre sur des couches de mémoire apprises pour les systèmes d'IA, réduisant la surcharge computationnelle nécessaire pour maintenir le contexte lors d'interactions prolongées.

Le partenariat entre les deux entreprises précède la publication de ce jeu de données. Leur collaboration s'est concentrée sur l'encodage des processus des cabinets d'avocats grâce à l'IA, avec le Legal Agent Benchmark comme premier résultat public de ce travail.

Pourquoi le code source ouvert est important ici

Les cabinets d'avocats sont célèbres pour protéger leurs données, et ce pour de bonnes raisons. Le privilège avocat-client, la doctrine du travail préparatoire et le secret concurrentiel créent d'immenses obstacles à la collecte des types de données d'entraînement nécessaires aux systèmes d'IA. Les données synthétiques offrent une solution de contournement : toute la complexité structurelle du travail juridique réel, sans aucune préoccupation de confidentialité.

Ce que cela signifie pour le paysage juridique de l'IA

L'affirmation d'EngramLab concernant une compression à 100x, si elle se vérifie en pratique, pourrait s'avérer particulièrement significative. Une seule opération de fusion-acquisition peut produire des dizaines de milliers de pages de documents. Toute technologie capable de préserver un contexte pertinent à cette échelle sans augmentation proportionnelle des coûts résout l'une des goulots d'étranglement fondamentaux dans le déploiement de l'IA à grande échelle au sein des cabinets d'avocats.

Pour Harvey, la stratégie open-source renforce sa position en tant que couche d'infrastructure pour l'IA juridique, et non pas simplement une autre solution ponctuelle. En fournissant à la fois le benchmark (LAB) et désormais les données d'entraînement, l'entreprise fixe les normes sur lesquelles l'ensemble du secteur s'appuiera.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.