Thomson Reuters gasta $40 millones en entrenar un modelo de IA legal personalizado

iconTechFlow
Compartir
AI summary iconResumen
Thomson Reuters anunció una inversión de 40 millones de dólares para entrenar su modelo de IA legal personalizado, Thomson. Desarrollado con datos legales, fiscales y de noticias de la empresa, el modelo muestra un rendimiento sólido en tareas legales especializadas. La primera aplicación está en Tabular Analysis de CoCounsel Legal, con una versión ligera en Hugging Face. Este movimiento se produce en medio del creciente cumplimiento de CFT y una mayor supervisión de los mercados de liquidez y cripto.

Artículo escrito por Xiao Bing

El 24 de agosto, Thomson Reuters anunció el lanzamiento de su propio modelo de lenguaje grande, "Thomson". Esta gigante de la información, con ingresos anuales superiores a 7 mil millones de dólares, afirmó que el modelo se entrenó sobre una base de código abierto, con una inversión acumulada de aproximadamente 40 millones de dólares (incluyendo talento y capacidad de cómputo), utilizando datos de entrenamiento provenientes de la base de datos legal Westlaw, las guías prácticas Practical Law, la plataforma de investigación fiscal Checkpoint y los activos noticiosos de Reuters. Las evaluaciones iniciales muestran que Thomson desempeña "de manera comparable a los modelos más avanzados actuales" en varias tareas.

400 millones de dólares, en comparación: la última ronda de financiación de OpenAI fue de 40 mil millones de dólares, Anthropic ha recaudado más de 13 mil millones en total, y xAI obtuvo 6 mil millones en una sola ronda. Los laboratorios de vanguardia utilizan miles de millones de dólares para entrenar modelos generales, mientras que Thomson Reuters, con menos de una décima parte de esa cantidad, logró desarrollar, en un ámbito vertical, capacidades que afirma pueden competir con las de vanguardia.

Las palabras originales de CTO Joel Hron son: Durante años, la industria de la IA ha considerado la escala como la respuesta: modelos más grandes, más capacidad de cómputo, más dinero. Thomson demuestra que existe otro camino: partir de una base sólida, especializarse profundamente en tareas realmente importantes, y así construir inteligencia eficiente y completamente autónoma y controlable.

La era de la construcción propia de IA para industrias verticales está comenzando.

¿Qué hizo Thomson?

Thomson parte de una base de código abierto (el modelo específico no se especifica en el anuncio) y utiliza entrenamiento intermedio (mid-training) y entrenamiento posterior (post-training) para incorporar datos propietarios de Thomson Reuters.

El anuncio revela que actualmente se ha utilizado menos del 10% del contenido propio para el entrenamiento, y se continuarán explorando nuevas direcciones especializadas en el futuro. Cientos de expertos en diversas disciplinas participaron en todo el proceso, desde el diseño de los objetivos de entrenamiento hasta la evaluación final.

El primer escenario de implementación del modelo es la función de análisis tabular (Tabular Analysis) en CoCounsel Legal, dirigida a bufetes de abogados y departamentos jurídicos corporativos. CoCounsel mantiene una arquitectura de múltiples modelos, utilizando a Thomson en los escenarios donde Thomson tiene una ventaja clara y continuando con modelos externos de vanguardia en otros escenarios.

Thomson Reuters también lanzó una versión de código abierto "pequeña" en Hugging Face para uso académico y no comercial, e invitó a académicos en derecho e IA a realizar evaluaciones independientes.

El profesor de la Facultad de Derecho de la Universidad de Washington, Jonathan Choi, probó a Thomson, ChatGPT y Claude con preguntas difíciles de su curso de impuestos corporativos, y evaluó que los tres modelos respondieron correctamente, pero prefería las respuestas de Thomson, especialmente porque los enlaces a tratados jurídicos hacían las respuestas más transparentes y prácticas.

40 millones de dólares en economía

This number is the key to understanding the whole thing.

El costo de entrenar un modelo general de vanguardia está aumentando exponencialmente. Meta utilizó más de 16,000 GPU H100 para entrenar a Llama 3, con un gasto estimado en computación de cientos de millones de dólares. Los presupuestos de entrenamiento de OpenAI y Google DeepMind son aún mayores. Estos modelos tienen como objetivo "hacer todo", desde escribir poesía hasta resolver ecuaciones diferenciales, desde programar hasta hacer rol.

Lo que hace Thomson Reuters es lógicamente completamente diferente. No necesita un modelo que lo haga todo; necesita un modelo que, en varios dominios extremadamente verticales como investigación jurídica, cumplimiento fiscal, interpretación regulatoria y análisis de documentos profesionales, alcance un rendimiento igual o superior al de los modelos generales de vanguardia. Este objetivo es mucho más limitado, por lo que los costos de entrenamiento son mucho más bajos.

Pero lo que realmente hizo posible los 40 millones de dólares no fue la reducción del rango, sino los activos de datos.

La base de datos legal Westlaw, propiedad de Thomson Reuters, cubre más de 40,000 bases de datos de casos y más de 100 años de acumulación de jurisprudencia. Practical Law incluye guías operativas y plantillas mantenidas continuamente por más de 650 abogados editores. Checkpoint es la herramienta estándar para profesionales fiscales en Estados Unidos. La base de noticias de Reuters abarca globalmente más de 175 años.

These data are not scraped from the internet.

Son activos propietarios editados, etiquetados, estructurados y actualizados continuamente por profesionales. Los modelos verticales entrenados con estos datos son difíciles de igualar en precisión y calidad de citación en su campo especializado por modelos generales mediante RAG (generación reforzada por recuperación) o ajuste fino simples. Los modelos generales pueden "conectarse" a estos datos, pero conectarse y "crecer dentro de ellos" son dos cosas distintas.

Thomson Reuters también destacó esta diferencia: los beneficios generados por el entrenamiento especializado en un dominio no pueden reemplazarse con solo el acceso al contenido.

¿Quién seguirá este camino?

Thomson Reuters no será el único. Siguiendo la cadena de "datos propietarios → modelos verticales → costos de inferencia más bajos → mayor control de datos → mayores márgenes brutos empresariales", al menos varias categorías de empresas tienen las condiciones para replicar este modelo.

Empresa de datos financieros. Bloomberg ya entrenó BloombergGPT en 2023 utilizando sus propios datos de terminales financieros y corpus de noticias. Aunque no ha habido muchas acciones posteriores, los datos del Bloomberg Terminal y Westlaw de Thomson Reuters pertenecen al mismo nivel: son conjuntos de datos propietarios que ningún modelo generalista puede obtener legalmente.

Servicios profesionales. Las cuatro grandes firmas de contabilidad (PwC, Deloitte, EY, KPMG), grandes alianzas de bufetes de abogados (como Baker McKenzie, Kirkland & Ellis) y empresas de información médica (como los datos de historias clínicas electrónicas de Epic Systems) poseen grandes cantidades de datos profesionales altamente estructurados y confidenciales. Estas instituciones no están dispuestas a entregar los datos de sus clientes a modelos generales, pero necesitan la IA para mejorar la eficiencia. Para ellas, construir modelos verticales propios no es una opción, sino una necesidad desde el punto de vista de la conformidad.

Monopolistas de datos del sector. MSCI posee datos de calificaciones y índices ESG globales, Verisk posee datos de fijación de precios de seguros y modelos de riesgo, Wolters Kluwer posee datos legales y de cumplimiento europeos, y RELX posee revistas académicas Elsevier y datos legales de LexisNexis. La característica común de estas empresas es que los datos son el activo central, la exclusividad de los datos constituye la ventaja competitiva, y alimentar los modelos de otros con sus datos diluye su propio valor.

¿Qué significa para OpenAI y Anthropic?

Un detalle fácil de pasar por alto en el anuncio de Thomson Reuters es que CoCounsel mantiene una arquitectura multimodelo: utiliza Thomson donde tiene ventaja y sigue usando modelos externos en otros escenarios.

Esto indica que incluso las empresas que han desarrollado sus propios modelos no descartarán por completo los modelos generales.

Los modelos generales aún mantienen ventajas en razonamiento general, generación de código y procesamiento multilingüe. Los modelos verticales reemplazan la capa de los modelos generales que es "suficiente pero no óptima" en dominios específicos.

Sin embargo, a largo plazo, si cada vez más clientes empresariales de alto valor comienzan a construir sus propios modelos verticales, las empresas de modelos generales corren el riesgo de verse comprimidas hacia la capa de infraestructura: proporcionar modelos base para que las empresas los entrenen nuevamente y ofrecer API de inferencia para tareas generales, pero perder el control de precios en las aplicaciones verticales más rentables.

Esto es similar a la evolución de la industria de la nube.

AWS, Azure y GCP proporcionan infraestructura, pero la capa de aplicaciones SaaS más rentable está ocupada por empresas verticales como Salesforce, ServiceNow y Workday. Si la industria de la IA sigue la misma trayectoria, el papel de OpenAI y Anthropic podría ser más parecido al de "AWS de la IA" que al de "Salesforce de la IA".

Lo que Thomson Reuters demostró con 40 millones de dólares es que, cuando posees datos lo suficientemente únicos, puedes igualar modelos generales entrenados con miles de millones de dólares a un costo insignificante en tu campo.

Una vez verificada esta lógica, cada empresa que posee una mina de datos propietarios volverá a calcular: ¿continuar pagando anualmente tarifas de API a OpenAI o Anthropic, o invertir una cantidad significativamente menor en entrenar un modelo vertical completamente bajo su control?

Para un mercado acostumbrado a la narrativa de la "carrera armamentista de IA", los 40 millones de dólares de Thomson Reuters son una señal en dirección opuesta. La próxima fase de la competencia en IA podría ser ganada no por la empresa con los mayores costos de entrenamiento, sino por la que posea los datos más únicos e irremplazables. Los modelos son herramientas; los datos son la barrera.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.