Harvey y EngramLab han lanzado un conjunto de datos sintéticos de código abierto que contiene más de 100 millones de tokens, creando esencialmente todo el cuerpo de trabajo de una firma legal ficticia para que los sistemas de IA reales puedan aprender cómo operan las firmas reales. El conjunto de datos cubre más de 250 asuntos sintéticos de clientes en 46 clientes, con aproximadamente 10,000 archivos individuales que representan el tipo de conocimiento institucional que normalmente reside en la mente de socios con décadas de experiencia.
Qué contiene realmente el conjunto de datos
El centro de contribución de EngramLab es su tecnología de capa de memoria, que la empresa afirma puede comprimir el contexto organizacional hasta reducir el uso de tokens hasta 100 veces. En términos prácticos, esto significa que un sistema de IA podría procesar el equivalente a la carrera de un socio en conocimiento institucional sin agotar los presupuestos de cómputo.
Harvey, por su parte, ha estado preparándose para este tipo de lanzamiento. A principios de 2026, la empresa liberó como código abierto el Legal Agent Benchmark, conocido como LAB, que estableció formas estandarizadas para medir el rendimiento de los agentes de IA en tareas legales. El conjunto de datos sintéticos es un complemento natural, brindando a investigadores y desarrolladores material de entrenamiento real para trabajar junto a esas métricas.
Las empresas detrás del lanzamiento
Harvey se ha convertido en uno de los jugadores más destacados en inteligencia artificial legal, con un valor actual de $11 mil millones. La empresa se ha posicionado como una plataforma para bufetes de abogados que buscan integrar IA en sus flujos de trabajo sin ceder el control de su conocimiento propietario.
EngramLab recaudó $98 millones en financiamiento el 23 de junio de 2026, con una valoración de aproximadamente $600 millones. Su tecnología principal se centra en capas de memoria aprendida para sistemas de IA, reduciendo la sobrecarga computacional necesaria para mantener el contexto durante interacciones prolongadas.
La asociación entre ambas empresas precede a este lanzamiento de conjunto de datos. Su colaboración se ha centrado en codificar los procesos de bufetes de abogados mediante IA, con el Legal Agent Benchmark como una salida pública temprana de ese trabajo.
Por qué el código abierto es importante aquí
Las firmas legales son famosas por proteger sus datos, y por buenas razones. El privilegio abogado-cliente, la doctrina de materia de trabajo y el secreto competitivo crean enormes barreras para reunir el tipo de datos de entrenamiento que necesitan los sistemas de IA. Los datos sintéticos ofrecen una solución alternativa: toda la complejidad estructural del trabajo legal real, sin ninguna de las preocupaciones de confidencialidad.
Qué significa esto para el panorama legal de la inteligencia artificial
La afirmación de EngramLab sobre una compresión de 100x, si se sostiene en la práctica, podría resultar particularmente significativa. Una sola transacción de fusiones y adquisiciones podría generar decenas de miles de páginas de documentos. Cualquier tecnología que pueda mantener contexto significativo a través de ese volumen sin aumentos proporcionales en costos aborda uno de los cuellos de botella fundamentales en la implementación de IA a gran escala dentro de bufetes de abogados.
Para Harvey, la estrategia de código abierto refuerza su posición como una capa de infraestructura para la inteligencia artificial jurídica, más que como solo otra solución puntual. Al proporcionar tanto el benchmark (LAB) como ahora los datos de entrenamiento, la empresa está definiendo los estándares contra los cuales construirá todo el sector.
