Thomson Reuters chi 40 triệu USD để đào tạo mô hình AI pháp lý tùy chỉnh

iconTechFlow
Chia sẻ
AI summary iconTóm tắt
Thomson Reuters thông báo đầu tư 40 triệu USD để đào tạo mô hình AI pháp lý tùy chỉnh của mình, Thomson. Được xây dựng dựa trên dữ liệu pháp lý, thuế và tin tức của công ty, mô hình này cho hiệu suất mạnh mẽ trong các nhiệm vụ pháp lý chuyên sâu. Ứng dụng đầu tiên được triển khai trong Tabular Analysis của CoCounsel Legal, với phiên bản nhẹ hơn trên Hugging Face. Động thái này diễn ra trong bối cảnh các yêu cầu về CFT ngày càng tăng và sự giám sát chặt chẽ hơn đối với thanh khoản và thị trường tiền điện tử.

Bài viết: Tiểu Bánh

Ngày 24 tháng 8, Thomson Reuters công bố ra mắt mô hình ngôn ngữ lớn tự phát triển có tên "Thomson". Tập đoàn thông tin có doanh thu hàng năm vượt quá 7 tỷ USD cho biết, mô hình này được huấn luyện trên nền tảng mã nguồn mở, với tổng chi phí đầu tư khoảng 40 triệu USD (bao gồm nhân lực và năng lực tính toán), dữ liệu huấn luyện lấy từ cơ sở dữ liệu pháp lý Westlaw, hướng dẫn thực tiễn Practical Law, nền tảng nghiên cứu thuế Checkpoint và tài sản tin tức Reuters. Đánh giá sơ bộ cho thấy Thomson có hiệu suất "tương đương với các mô hình tiên tiến nhất hiện nay" trên nhiều nhiệm vụ.

400 triệu USD, so sánh với: vòng huy động vốn mới nhất của OpenAI là 40 tỷ USD, Anthropic đã huy động tổng cộng hơn 13 tỷ, xAI chỉ một vòng đã nhận 6 tỷ. Các phòng thí nghiệm tiên tiến dùng hàng chục tỷ USD để đầu tư vào năng lực tính toán nhằm huấn luyện các mô hình tổng quát, trong khi Thomson Reuters chỉ dùng một phần rất nhỏ, nhưng đã tạo ra khả năng tự cho là có thể sánh ngang với các mô hình tiên tiến trong một lĩnh vực chuyên biệt.

CTO Joel Hron nói: “Trong nhiều năm qua, ngành AI đã lấy quy mô làm câu trả lời—mô hình lớn hơn, năng lực tính toán nhiều hơn, tiền bạc nhiều hơn. Thomson đã chứng minh rằng có một con đường khác: bắt đầu từ một nền tảng mạnh mẽ, chuyên sâu hóa cho những công việc thực sự quan trọng, bạn có thể xây dựng trí tuệ hiệu quả và hoàn toàn tự chủ.”

Thời đại tự xây dựng AI cho các ngành dọc đang bắt đầu.

Thomson đã làm gì?

Thomson xuất phát từ nền tảng mã nguồn mở (bản tin không nêu rõ mô hình cụ thể nào), thông qua quá trình huấn luyện trung kỳ (mid-training) và huấn luyện hậu kỳ (post-training) để lồng ghép dữ liệu độc quyền của Thomson Reuters.

Thông báo cho biết hiện tại chỉ sử dụng chưa đến 10% nội dung tự có để huấn luyện, và sẽ tiếp tục khám phá các hướng chuyên môn mới. Hàng trăm chuyên gia trong các lĩnh vực đã tham gia toàn bộ quy trình, từ thiết kế mục tiêu huấn luyện đến đánh giá cuối cùng.

Tình huống triển khai đầu tiên của mô hình là chức năng Phân tích bảng (Tabular Analysis) trong CoCounsel Legal, nhắm đến các văn phòng luật sư và bộ phận pháp chế doanh nghiệp. CoCounsel duy trì kiến trúc đa mô hình, sử dụng Thomson trong các tình huống mà Thomson có lợi thế rõ rệt, đồng thời tiếp tục sử dụng các mô hình tiên tiến bên ngoài trong các tình huống khác.

Thomson Reuters cũng đã phát hành một phiên bản mã nguồn mở "nhỏ" trên Hugging Face để sử dụng cho mục đích học thuật và phi thương mại, đồng thời mời các học giả luật và AI đánh giá độc lập.

Giáo sư Jonathan Choi của Trường Luật Đại học Washington đã thử thách Thomson, ChatGPT và Claude bằng các câu hỏi khó trong khóa học về thuế doanh nghiệp và đánh giá rằng cả ba mô hình đều trả lời đúng, nhưng ông ưa thích câu trả lời của Thomson hơn, đặc biệt vì các liên kết dẫn đến các tác phẩm pháp lý giúp câu trả lời minh bạch và thực tiễn hơn.

Kinh tế học 40 triệu USD

This number is the key to understanding the whole thing.

Chi phí để huấn luyện một mô hình tiên tiến tổng quát đang tăng theo cấp số nhân. Meta đã sử dụng hơn 16.000 GPU H100 để huấn luyện Llama 3, với chi phí tính toán ước tính lên đến hàng trăm triệu đô la Mỹ. Ngân sách huấn luyện của OpenAI và Google DeepMind còn cao hơn. Các mô hình này nhằm mục tiêu "làm được mọi thứ", từ viết thơ đến giải phương trình vi phân, từ lập trình đến đóng vai.

Những gì Thomson Reuters làm về mặt logic là hoàn toàn khác biệt. Họ không cần một mô hình có thể làm mọi việc, mà cần một mô hình hoạt động tốt ngang bằng hoặc thậm chí tốt hơn các mô hình tiên tiến phổ biến trong các lĩnh vực cực kỳ chuyên sâu như nghiên cứu pháp lý, tuân thủ thuế, giải thích quy định và phân tích tài liệu chuyên nghiệp. Phạm vi mục tiêu này hẹp hơn nhiều, do đó chi phí huấn luyện cũng thấp hơn nhiều.

Nhưng điều thực sự làm cho 40 triệu USD trở nên khả thi không phải là thu hẹp phạm vi, mà là tài sản dữ liệu.

Cơ sở dữ liệu pháp lý Westlaw, thuộc sở hữu của Thomson Reuters, bao gồm hơn 40.000 cơ sở dữ liệu vụ án và hơn 100 năm tích lũy tiền lệ. Practical Law chứa các hướng dẫn thực hành và mẫu được duy trì liên tục bởi hơn 650 luật sư biên tập. Checkpoint là công cụ tiêu chuẩn dành cho các chuyên gia thuế tại Hoa Kỳ. Cơ sở dữ liệu tin tức Reuters bao phủ toàn cầu, kéo dài hơn 175 năm.

Dữ liệu này không được thu thập từ internet.

Chúng là các tài sản sở hữu độc quyền đã được biên tập chuyên nghiệp, gán nhãn, cấu trúc hóa và cập nhật liên tục. Các mô hình chuyên ngành được huấn luyện trên dữ liệu này có độ chính xác và chất lượng trích dẫn trong lĩnh vực chuyên môn của chúng, mà các mô hình phổ thông khó có thể sánh kịp chỉ bằng RAG (tăng cường truy vấn) hoặc tinh chỉnh đơn giản. Các mô hình phổ thông có thể "truy cập" vào dữ liệu này, nhưng việc truy cập và "phát triển trong đó" là hai chuyện hoàn toàn khác nhau.

Thomson Reuters cũng đã chỉ ra sự khác biệt này: lợi ích từ việc đào tạo chuyên sâu theo lĩnh vực không thể thay thế bằng việc chỉ tiếp cận nội dung đơn thuần.

Ai sẽ đi con đường này?

Thomson Reuters sẽ không phải là công ty duy nhất. Xét theo chuỗi "dữ liệu độc quyền → mô hình chuyên ngành → chi phí suy luận thấp hơn → kiểm soát dữ liệu mạnh mẽ hơn → lợi nhuận gộp doanh nghiệp cao hơn", ít nhất có vài loại công ty sở hữu điều kiện để sao chép mô hình này.

Công ty dữ liệu tài chính. Bloomberg đã huấn luyện BloombergGPT vào năm 2023 dựa trên dữ liệu terminal và ngữ liệu tin tức riêng của họ. Mặc dù các hành động tiếp theo không nhiều, nhưng rào cản dữ liệu của Bloomberg Terminal và Westlaw của Thomson Reuters thuộc cùng một cấp độ—đây là các bộ dữ liệu độc quyền mà bất kỳ mô hình phổ quát nào cũng không thể hợp pháp truy cập.

Các tổ chức dịch vụ chuyên nghiệp. Bốn công ty kiểm toán lớn (PwC, Deloitte, EY, KPMG), các liên minh luật sư lớn (như Baker McKenzie, Kirkland & Ellis), và các công ty thông tin y tế (như dữ liệu hồ sơ bệnh án điện tử của Epic Systems) đều sở hữu lượng lớn dữ liệu chuyên môn có cấu trúc cao và cực kỳ bảo mật. Các tổ chức này không muốn giao dữ liệu khách hàng cho các mô hình tổng quát xử lý, đồng thời cần AI để nâng cao hiệu quả. Việc tự xây dựng mô hình chuyên ngành đối với họ, từ góc độ tuân thủ, không chỉ là một lựa chọn, mà là điều bắt buộc.

Người thống trị dữ liệu ngành. MSCI sở hữu dữ liệu xếp hạng ESG và chỉ số toàn cầu, Verisk sở hữu dữ liệu định giá bảo hiểm và mô hình rủi ro, Wolters Kluwer sở hữu dữ liệu pháp lý và tuân thủ châu Âu, RELX sở hữu tạp chí học thuật Elsevier và dữ liệu pháp lý LexisNexis. Đặc điểm chung của những công ty này là: dữ liệu là tài sản cốt lõi, tính độc quyền của dữ liệu chính là hàng rào bảo vệ, việc cung cấp dữ liệu cho mô hình của người khác sẽ làm suy giảm giá trị của chính họ.

Điều đó có nghĩa gì đối với OpenAI và Anthropic?

Một chi tiết dễ bị bỏ qua trong thông báo của Thomson Reuters: CoCounsel duy trì kiến trúc đa mô hình. Sử dụng mô hình của Thomson ở những nơi Thomson có lợi thế, và tiếp tục sử dụng các mô hình bên ngoài trong các tình huống khác.

Điều này cho thấy ngay cả những doanh nghiệp tự xây dựng mô hình cũng sẽ không hoàn toàn từ bỏ các mô hình phổ dụng.

Các mô hình tổng quát vẫn duy trì lợi thế trong các lĩnh vực như suy luận tổng quát, tạo mã và xử lý đa ngôn ngữ. Các mô hình chuyên ngành thay thế lớp mà mô hình tổng quát chỉ "đủ dùng nhưng chưa tốt" trong các lĩnh vực cụ thể.

Tuy nhiên, về dài hạn, nếu ngày càng nhiều khách hàng doanh nghiệp giá trị cao bắt đầu tự xây dựng mô hình chuyên ngành, các công ty mô hình phổ quát sẽ đối mặt với nguy cơ bị thu hẹp xuống tầng cơ sở: cung cấp mô hình nền tảng để doanh nghiệp huấn luyện lại, cung cấp API suy luận để xử lý các nhiệm vụ phổ quát, nhưng mất quyền định giá trong các ứng dụng chuyên ngành mang lại lợi nhuận cao nhất.

Điều này tương tự như sự phát triển của ngành điện toán đám mây.

AWS, Azure và GCP cung cấp cơ sở hạ tầng, nhưng lớp ứng dụng SaaS sinh lời nhất lại bị các công ty chuyên biệt như Salesforce, ServiceNow và Workday chiếm lĩnh. Nếu ngành AI đi theo con đường tương tự, vai trò của OpenAI và Anthropic có thể gần giống với "AWS của AI" hơn là "Salesforce của AI".

Điều Thomson Reuters chi 40 triệu USD để chứng minh là: khi bạn sở hữu dữ liệu đủ độc đáo, bạn có thể đạt được mức độ cạnh tranh ngang hàng với các mô hình tổng quát được huấn luyện với chi phí hàng tỷ đô la, chỉ với một phần nhỏ chi phí.

Khi logic này được xác minh, mọi công ty đang sở hữu các mỏ dữ liệu độc quyền sẽ phải tính lại: tiếp tục trả phí API hàng năm cho OpenAI hoặc Anthropic, hay chi một khoản tiền nhỏ hơn nhiều để huấn luyện một mô hình chuyên biệt mà họ hoàn toàn kiểm soát?

Đối với thị trường đã quen với câu chuyện "cuộc chạy đua vũ trang AI", khoản đầu tư 40 triệu USD của Thomson Reuters là một tín hiệu ngược chiều. Giai đoạn tiếp theo của cuộc cạnh tranh AI, người chiến thắng có thể không phải là công ty có chi phí huấn luyện cao nhất, mà là công ty có dữ liệu độc đáo và không thể thay thế nhất. Mô hình là công cụ, dữ liệu mới là rào cản.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.