湯森路透斥資 4000 萬美元訓練自訂法律 AI 模型

iconTechFlow
分享
AI summary icon精華摘要
湯森路透宣布投資 4000 萬美元,用於訓練其專屬法律 AI 模型 Thomson。該模型基於公司的法律、稅務和新聞數據構建,在專業法律任務中表現出色。首個應用於 CoCounsel Legal 的表格分析功能,並在 Hugging Face 上提供輕量版。此舉正值 CFT 要求日益增加,以及對流動性和加密貨幣市場的監管審查加嚴之際。

撰文:小餅

8 月 24 日,Thomson Reuters 宣布推出自研大語言模型 "Thomson"。這家年收入超過 70 億美元的信息巨頭稱,模型基於開源底座訓練,累計投入約 4,000 萬美元(涵蓋人才和算力),訓練數據來自 Westlaw 法律資料庫、Practical Law 實務指南、Checkpoint 稅務研究平台和 Reuters 新聞資產。早期評估顯示,Thomson 在多個任務上的表現「與最新的前沿模型相當」。

4,000 萬美元,對比一下:OpenAI 最新一輪融資 400 億美元,Anthropic 累計融資超過 130 億,xAI 單輪就拿了 60 億。前沿實驗室用數十億美元堆算力訓練通用模型,而 Thomson Reuters 用不到一個零頭,在一個垂直領域做出了自稱可以對標前沿的能力。

CTO Joel Hron 表示:多年來,AI 行業一直把規模當作答案——更大的模型、更多的算力、更多的資金。Thomson 證明了另一條路徑的存在:從一個強大的基礎出發,針對真正重要的任務進行深度專精,就能構建出高效且完全自主可控的智能。

垂直行業的 AI 自建時代正在開始。

Thomson 做了什麼?

Thomson 從開源底座出發(公告未指明具體是哪個模型),通過中期訓練(mid-training)和後期訓練(post-training)注入 Thomson Reuters 的專有數據。

公告透露,目前只使用了不到 10% 的自有內容進行訓練,後續將繼續探索新的專業化方向。數百名學科專家從訓練目標設計到最終評估全程參與。

模型的首個部署場景是 CoCounsel Legal 中的表格分析(Tabular Analysis)功能,面向律所和企業法務部門。CoCounsel 保持多模型架構,在 Thomson 具有明顯優勢的場景使用 Thomson,在其他場景繼續使用外部前沿模型。

Thomson Reuters 也在 Hugging Face 上發布了一個「小型」開源版本,供學術和非商業用途使用,並邀請法律與 AI 學者進行獨立評估。

華盛頓大學法學院教授 Jonathan Choi 使用公司稅課程中的高難度問題測試了 Thomson、ChatGPT 和 Claude,評價是三個模型都回答正確,但他更偏好 Thomson 的回答,特別是引用法律論著的連結讓回答更透明、更實用。

4000 萬美元的經濟學

This number is the key to understanding the whole thing.

訓練一個通用前沿模型的成本正在指數級攀升。Meta 訓練 Llama 3 使用了超過 16,000 塊 H100 GPU,算力開支估計達數億美元。OpenAI 和 Google DeepMind 的訓練預算更高。這些模型的目標是「什麼都能做」,從寫詩到解微分方程,從編程到角色扮演。

Thomson Reuters 所做的事情在邏輯上完全不同。它不需要一個萬能模型,而需要在法律研究、稅務合規、監管解讀和專業文檔分析這幾個極度垂直的領域中,達到與通用前沿模型一樣好甚至更好的模型。這個目標的範圍窄得多,因此訓練成本也低得多。

但真正讓 4000 萬美元成為可能的,不是範圍縮窄,而是數據資產。

Thomson Reuters 擁有的 Westlaw 法律資料庫涵蓋超過 40,000 個案例資料庫和超過 100 年的判例累積。Practical Law 包含由 650 多名律師編輯持續維護的操作指南和模板。Checkpoint 是美國稅務專業人士的標準工具。Reuters 新聞語料庫覆蓋全球,時間跨度超過 175 年。

這些數據並非從互聯網上爬取的。

它們是經過專業編輯、標註、結構化和持續更新的專有資產。在這些數據上訓練出來的垂直模型,其在專業領域內的準確性和引用質量,是通用模型很難僅通過簡單的 RAG(檢索增強生成)或微調來匹配的。通用模型可以「接入」這些數據,但接入和「在其中生長」是兩回事。

Thomson Reuters 也點出了這個區別:領域特化訓練所帶來的增益,是單純的內容接入無法取代的。

誰會走這條路?

Thomson Reuters 不會是唯一一家。沿著「專有數據→垂直模型→更低推理成本→更強數據控制→更高企業毛利」這條鏈條看,至少有幾類公司具備複製這個模式的條件。

金融數據公司。Bloomberg 已於 2023 年訓練了 BloombergGPT,基於其自有金融終端數據和新聞語料。儘管後續動作不多,但 Bloomberg Terminal 的數據壁壘與 Thomson Reuters 的 Westlaw 屬於同一量級——這些都是任何通用模型均無法合法獲取的專有數據集。

專業服務機構。四大会計師事務所(PwC、Deloitte、EY、KPMG)、大型律所聯盟(如 Baker McKenzie、Kirkland & Ellis),以及醫療資訊公司(如 Epic Systems 的電子病歷數據),都擁有大量高度結構化、高度機密的專業數據。這些機構不願將客戶數據交給通用模型處理,同時又需要 AI 提升效率。對它們而言,從合規角度來看,自建垂直模型不是選擇,而是必然。

行業數據壟斷者。MSCI 擁有全球 ESG 評級和指數數據,Verisk 擁有保險定價和風險模型數據,Wolters Kluwer 擁有歐洲法律和合規數據,RELX 擁有 Elsevier 學術期刊和 LexisNexis 法律數據。這些公司的共同特徵是:數據是核心資產,數據的獨佔性就是護城河,將數據提供給別人的模型會稀釋自身價值。

對 OpenAI 和 Anthropic 意味著什麼?

Thomson Reuters 的公告中有一個細節容易被忽略:CoCounsel 保持多模型架構。在 Thomson 具有優勢的地方使用 Thomson,在其他場景繼續使用外部模型。

This shows that even companies that have built their own models will not completely abandon general-purpose models.

通用模型在通用推理、代碼生成、多語言處理等方面仍具優勢。垂直模型取代的是通用模型在特定領域中「夠用但不夠好」的那層。

但長期來看,如果越來越多的高價值企業客戶開始自建垂直模型,通用模型公司面臨的風險是被壓縮到基礎設施層:提供底座模型供企業二次訓練,提供推理 API 處理通用任務,但在最賺錢的垂直應用場景中失去定價權。

這類似於雲計算行業的演變。

AWS、Azure 和 GCP 提供基礎設施,但最賺錢的 SaaS 應用層被 Salesforce、ServiceNow、Workday 等垂直公司佔據。如果 AI 行業走上同樣的路徑,OpenAI 和 Anthropic 的角色可能更接近「AI 的 AWS」,而非「AI 的 Salesforce」。

湯森路透花費4000萬美元證明的事實是:當你擁有足夠獨特的數據時,你可以以極低的成本,在你的領域中追上耗資數十億美元訓練的通用模型。

一旦這個邏輯被驗證,每一家坐擁專有數據礦山的公司都會重新計算一筆賬:是繼續每年向 OpenAI 或 Anthropic 支付 API 費用,還是花相對少得多的錢,訓練一個完全由自己掌控的垂直模型?

對於習慣了「AI 軍備競賽」敘事的市場來說,湯森路透的 4000 萬美元是一個反向信號。AI 競爭的下一階段,贏的可能不是訓練成本最高的公司,而是數據最獨特、最不可替代的公司。模型是工具,數據才是壁壘。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露