撰文:小餅
8 月 24 日,Thomson Reuters 宣布推出自研大語言模型 "Thomson"。這家年收入超過 70 億美元的信息巨頭稱,模型基於開源底座訓練,累計投入約 4,000 萬美元(涵蓋人才和算力),訓練數據來自 Westlaw 法律資料庫、Practical Law 實務指南、Checkpoint 稅務研究平台和 Reuters 新聞資產。早期評估顯示,Thomson 在多個任務上的表現「與最新的前沿模型相當」。
4,000 萬美元,對比一下:OpenAI 最新一輪融資 400 億美元,Anthropic 累計融資超過 130 億,xAI 單輪就拿了 60 億。前沿實驗室用數十億美元堆算力訓練通用模型,而 Thomson Reuters 用不到一個零頭,在一個垂直領域做出了自稱可以對標前沿的能力。
CTO Joel Hron 表示:多年來,AI 行業一直把規模當作答案——更大的模型、更多的算力、更多的資金。Thomson 證明了另一條路徑的存在:從一個強大的基礎出發,針對真正重要的任務進行深度專精,就能構建出高效且完全自主可控的智能。
垂直行業的 AI 自建時代正在開始。
Thomson 做了什麼?
Thomson 從開源底座出發(公告未指明具體是哪個模型),通過中期訓練(mid-training)和後期訓練(post-training)注入 Thomson Reuters 的專有數據。
公告透露,目前只使用了不到 10% 的自有內容進行訓練,後續將繼續探索新的專業化方向。數百名學科專家從訓練目標設計到最終評估全程參與。
模型的首個部署場景是 CoCounsel Legal 中的表格分析(Tabular Analysis)功能,面向律所和企業法務部門。CoCounsel 保持多模型架構,在 Thomson 具有明顯優勢的場景使用 Thomson,在其他場景繼續使用外部前沿模型。
Thomson Reuters 也在 Hugging Face 上發布了一個「小型」開源版本,供學術和非商業用途使用,並邀請法律與 AI 學者進行獨立評估。
華盛頓大學法學院教授 Jonathan Choi 使用公司稅課程中的高難度問題測試了 Thomson、ChatGPT 和 Claude,評價是三個模型都回答正確,但他更偏好 Thomson 的回答,特別是引用法律論著的連結讓回答更透明、更實用。
4000 萬美元的經濟學
This number is the key to understanding the whole thing.
訓練一個通用前沿模型的成本正在指數級攀升。Meta 訓練 Llama 3 使用了超過 16,000 塊 H100 GPU,算力開支估計達數億美元。OpenAI 和 Google DeepMind 的訓練預算更高。這些模型的目標是「什麼都能做」,從寫詩到解微分方程,從編程到角色扮演。
Thomson Reuters 所做的事情在邏輯上完全不同。它不需要一個萬能模型,而需要在法律研究、稅務合規、監管解讀和專業文檔分析這幾個極度垂直的領域中,達到與通用前沿模型一樣好甚至更好的模型。這個目標的範圍窄得多,因此訓練成本也低得多。
但真正讓 4000 萬美元成為可能的,不是範圍縮窄,而是數據資產。
Thomson Reuters 擁有的 Westlaw 法律資料庫涵蓋超過 40,000 個案例資料庫和超過 100 年的判例累積。Practical Law 包含由 650 多名律師編輯持續維護的操作指南和模板。Checkpoint 是美國稅務專業人士的標準工具。Reuters 新聞語料庫覆蓋全球,時間跨度超過 175 年。
這些數據並非從互聯網上爬取的。
它們是經過專業編輯、標註、結構化和持續更新的專有資產。在這些數據上訓練出來的垂直模型,其在專業領域內的準確性和引用質量,是通用模型很難僅通過簡單的 RAG(檢索增強生成)或微調來匹配的。通用模型可以「接入」這些數據,但接入和「在其中生長」是兩回事。
Thomson Reuters 也點出了這個區別:領域特化訓練所帶來的增益,是單純的內容接入無法取代的。
誰會走這條路?
Thomson Reuters 不會是唯一一家。沿著「專有數據→垂直模型→更低推理成本→更強數據控制→更高企業毛利」這條鏈條看,至少有幾類公司具備複製這個模式的條件。
金融數據公司。Bloomberg 已於 2023 年訓練了 BloombergGPT,基於其自有金融終端數據和新聞語料。儘管後續動作不多,但 Bloomberg Terminal 的數據壁壘與 Thomson Reuters 的 Westlaw 屬於同一量級——這些都是任何通用模型均無法合法獲取的專有數據集。
專業服務機構。四大会計師事務所(PwC、Deloitte、EY、KPMG)、大型律所聯盟(如 Baker McKenzie、Kirkland & Ellis),以及醫療資訊公司(如 Epic Systems 的電子病歷數據),都擁有大量高度結構化、高度機密的專業數據。這些機構不願將客戶數據交給通用模型處理,同時又需要 AI 提升效率。對它們而言,從合規角度來看,自建垂直模型不是選擇,而是必然。
行業數據壟斷者。MSCI 擁有全球 ESG 評級和指數數據,Verisk 擁有保險定價和風險模型數據,Wolters Kluwer 擁有歐洲法律和合規數據,RELX 擁有 Elsevier 學術期刊和 LexisNexis 法律數據。這些公司的共同特徵是:數據是核心資產,數據的獨佔性就是護城河,將數據提供給別人的模型會稀釋自身價值。
對 OpenAI 和 Anthropic 意味著什麼?
Thomson Reuters 的公告中有一個細節容易被忽略:CoCounsel 保持多模型架構。在 Thomson 具有優勢的地方使用 Thomson,在其他場景繼續使用外部模型。
This shows that even companies that have built their own models will not completely abandon general-purpose models.
通用模型在通用推理、代碼生成、多語言處理等方面仍具優勢。垂直模型取代的是通用模型在特定領域中「夠用但不夠好」的那層。
但長期來看,如果越來越多的高價值企業客戶開始自建垂直模型,通用模型公司面臨的風險是被壓縮到基礎設施層:提供底座模型供企業二次訓練,提供推理 API 處理通用任務,但在最賺錢的垂直應用場景中失去定價權。
這類似於雲計算行業的演變。
AWS、Azure 和 GCP 提供基礎設施,但最賺錢的 SaaS 應用層被 Salesforce、ServiceNow、Workday 等垂直公司佔據。如果 AI 行業走上同樣的路徑,OpenAI 和 Anthropic 的角色可能更接近「AI 的 AWS」,而非「AI 的 Salesforce」。
湯森路透花費4000萬美元證明的事實是:當你擁有足夠獨特的數據時,你可以以極低的成本,在你的領域中追上耗資數十億美元訓練的通用模型。
一旦這個邏輯被驗證,每一家坐擁專有數據礦山的公司都會重新計算一筆賬:是繼續每年向 OpenAI 或 Anthropic 支付 API 費用,還是花相對少得多的錢,訓練一個完全由自己掌控的垂直模型?
對於習慣了「AI 軍備競賽」敘事的市場來說,湯森路透的 4000 萬美元是一個反向信號。AI 競爭的下一階段,贏的可能不是訓練成本最高的公司,而是數據最獨特、最不可替代的公司。模型是工具,數據才是壁壘。
