Isinulat ni Xiao Bing
Noong Agosto 24, ipinahayag ng Thomson Reuters ang paglunsad ng kanilang sariling malaking modelo sa wika na "Thomson". Ang kompanyang impormasyon na may kita taun-taon na higit sa 7 bilyong dolyar ng Amerika ay sinabi na ang modelo ay tinuturuan batay sa isang bukas na pinagmulan, na may kabuuang pagsasagawa ng halos 40 milyong dolyar ng Amerika (kabilang ang mga talento at computing power), at ang mga datos sa pagtuturo ay galing sa Westlaw legal database, Practical Law practice guides, Checkpoint tax research platform, at mga asset ng balita ng Reuters. Ang mga maagang pagtataya ay nagpakita na ang Thomson ay may pagganap na "kasing antas ng mga pinakabagong modelo sa harap."
400 milyong dolyar, ihambing sa: huling pagsasapalaran ng OpenAI na 40 bilyong dolyar, kabuuang pagsasapalaran ng Anthropic na higit sa 13 bilyon, at 6 bilyong dolyar sa iisang pagsasapalaran ng xAI. Ginagamit ng mga advanced na laboratorio ang maraming bilyon na dolyar para sa pagtratrabaho ng computing power para sa pagtuturo ng mga pangkalahatang modelo, samantalang ang Thomson Reuters ay gumamit ng mas maliit kaysa sa isang zero, at nagawa ang kanilang sariling kakayahan na sinasabing makakapagkumpetensya sa mga advanced na modelo sa isang espesipikong larangan.
Sinabi ni CTO Joel Hron: "Sa loob ng maraming taon, ang industriya ng AI ay nag-iisip na ang sukat ang sagot—mas malalaking modelo, mas maraming computing power, mas maraming pera. Patotohanan ni Thomson na mayroong ibang daan: magsimula sa isang matibay na pundasyon, at mag-specialize nang malalim para sa mga mahalagang gawain, upang makabuo ng isang epektibo at buong-pawis na awtonomous na inteligensya."
Ang panahon ng pagbuo ng sariling AI para sa mga patakarang pampagawaan ay nagsisimula na.
Ano ang ginawa ni Thomson?
Ang Thomson ay nagmula sa isang open-source base (hindi nakalista ang partikular na modelo sa pahayag), at nagdagdag ng proprietary data ng Thomson Reuters sa pamamagitan ng mid-training at post-training.
Ipinahayag ng anunsyo na kasalukuyang ginagamit ang mas mababa sa 10% ng sariling nilalaman para sa pagtuturo, at magpapatuloy ang pag-aaral ng mga bagong espesyalisadong direksyon. Kabilang sa proseso mula sa pagdidisenyo ng layunin sa pagtuturo hanggang sa huling pagtataya ang mga eksperto mula sa mga daan-daang disiplina.
Ang unang deployment ng modelo ay ang Tabular Analysis function sa CoCounsel Legal, na nakatuon sa mga law firm at corporate legal departments. Patuloy na ginagamit ng CoCounsel ang multi-model architecture, kung saan ginagamit ang Thomson sa mga escenario kung saan may malaking kakayahan ang Thomson, habang patuloy na ginagamit ang mga external state-of-the-art model sa iba pang escenario.
Ipinakalabas din ni Thomson Reuters ang isang "maliit" na open-source na bersyon sa Hugging Face para sa akademiko at non-commercial na paggamit, at hiniling ang independiyenteng pagtataya mula sa mga propesor ng batas at AI.
Ang propesor ng Washington University School of Law, Jonathan Choi, ay sinubok ang Thomson, ChatGPT, at Claude gamit ang mahirap na tanong sa kurso ng korporatibong buwis, at ang pagtataya ay ang lahat ng tatlong modelo ay tama sa sagot, ngunit mas pinahahalagahan niya ang sagot ni Thomson, lalo na ang mga link sa mga aklat ng batas na nagpapakita ng transparensya at praktikalidad.
40 milyong dolyar ng ekonomiks
Ang numero na ito ay ang susi sa pag-unawa sa buong bagay.
Ang gastos sa pag-train ng isang pangkalahatang advanced model ay umuusbong nang eksponensyal. Gumamit ang Meta ng higit sa 16,000 na H100 GPU para sa pag-train ng Llama 3, na may estymadong gastos sa computing sa maraming milyon dolyar. Mas mataas ang budget para sa pag-train ng OpenAI at Google DeepMind. Ang layunin ng mga modelong ito ay "magagawa ang lahat"—mula sa pagsulat ng tula hanggang sa paglutas ng differential equations, mula sa pag-program hanggang sa pag-rolplay.
Ang ginagawa ng Thomson Reuters ay nasa magkakaibang lohika. Hindi nito kailangan ng isang modelong kayang gawin ang lahat; kailangan nito ang isang modelong makakamit o lalong mabuti ang antas ng mga pangkalahatang modelo sa mga sobrang espesyalisadong larangan tulad ng pagsusuri ng batas, pagtugon sa buwis, pagpapaliwanag ng regulasyon, at pagsusuri ng propesyonal na dokumento. Mas maliit ang sakop ng layuning ito, kaya mas mababa ang gastos sa pagtatrain.
Ngunit ang tunay na nagbigay-daan sa 40 milyong dolyar ay hindi ang pagpapaliit ng saklaw, kundi ang mga data asset.
Ang Westlaw, na may-ari ng Thomson Reuters, ay naglalaman ng higit sa 40,000 na database ng mga kaso at higit sa 100 taon ng pagkumpil ng mga prekyento. Ang Practical Law ay naglalaman ng mga gabay sa paggawa at mga template na patuloy na inaayos ng higit sa 650 na abogado na editor. Ang Checkpoint ay ang standard na kasangkapan para sa mga propesyonal sa buwis sa Estados Unidos. Ang Reuters news corpus ay nakakapalibot sa buong mundo at sumasaklaw sa higit sa 175 taon.
Hindi ito kinuha mula sa internet.
Ito ay mga eksklusibong asset na经过专业编辑、标注、结构化和持续更新。Sa mga data na ito, ang mga vertical model ay nakakamit ng kahusayan at kalidad ng pagbanggit na mahirap makamit ng mga pangkalahatang model sa pamamagitan ng simpleng RAG (retrieval-augmented generation) o fine-tuning. Maaaring "ma-access" ng mga pangkalahatang model ang mga data na ito, ngunit ang pag-access at ang paglago sa loob nito ay dalawang magkakaibang bagay.
Ipinakita rin ng Thomson Reuters ang pagkakaiba ito: ang benepisyo mula sa pagtatrain na espesipiko sa larangan ay hindi makakapalit ng simpleng pag-access sa kontenido.
Sino ang maglalakad sa daan na ito?
Hindi ang Thomson Reuters ang tanging kumpanya. Sa pamamagitan ng chuva na "proprietary data → vertical model → lower inference cost → stronger data control → higher enterprise gross profit," mayroong hindi isang uri ng kumpanya na may kakayahang kopyahin ang modelo na ito.
Kumpanya ng mga datos sa financial. Ang Bloomberg ay nagtratrabaho na sa BloombergGPT noong 2023, batay sa kanilang sariling data ng financial terminal at corpus ng balita. Bagaman hindi marami ang mga susunod na hakbang, ang barrier ng data ng Bloomberg Terminal ay nasa parehong antas tulad ng Westlaw ng Thomson Reuters—ang mga ito ay proprietary datasets na hindi maaaring ma-access nang legal ng anumang pangkalahatang modelo.
Mga propesyonal na serbisyo. Ang mga malalaking kumpanya sa accounting (PwC, Deloitte, EY, KPMG), malalaking konsultasyon sa batas (tulad ng Baker McKenzie at Kirkland & Ellis), at mga kumpanya sa medikal na impormasyon (tulad ng Epic Systems na may datos ng electronic health records) ay may malaking dami ng napakadetalye at napakalikas na propesyonal na data. Ayaw ng mga institusyong ito na ibigay ang data ng kanilang mga kliyente sa mga pangkalahatang modelo, samantala kailangan nila ang AI para sa pagpapabuti ng epekto. Ang pagbuo ng sariling vertical model ay maaaring hindi lamang isang opsyon kundi isang kinakailangan mula sa pananaw ng pagkakasunod.
Mga monopolista ng data sa industriya. May-ari ng MSCI ang global na ESG ratings at data ng index, may-ari ng Verisk ang data sa pagpapasiya ng insurance at mga modelo ng panganib, may-ari ng Wolters Kluwer ang European legal at compliance data, at may-ari ng RELX ang academic journals na Elsevier at legal data na LexisNexis. Ang karaniwang katangian ng mga kumpanyang ito: ang data ay ang pangunahing asset, ang eksklusibidad ng data ang kanilang malalim na kahon, at ang pagbibigay ng data sa ibang mga modelo ay magdudulot ng pagbaba sa kanilang halaga.
Ano ang ibig sabihin nito para sa OpenAI at Anthropic?
May isang detalye sa pahayag ni Thomson Reuters na madalas na nakakalimutan: ang CoCounsel ay nagpapanatili ng maraming modelo arkitektura. Gamitin ang Thomson kung saan may kahusayan ito, at patuloy na gamitin ang mga eksternal na modelo sa iba pang mga sitwasyon.
Ito ay nagpapakita na kahit ang mga kumpanya na nagtatayo ng kanilang sariling modelo, ay hindi ganap na iiwas sa pangkalahatang modelo.
Ang pangkalahatang modelo ay patuloy na may kakayahan sa pangkalahatang pag-iisip, pagbuo ng code, at pagtrato sa maraming wika. Ang mga pambansang modelo ay nagpapalit sa antas ng pangkalahatang modelo na "sapat ngunit hindi sapat" sa mga partikular na larangan.
Ngunit sa matagalang panahon, kung lalong dumadami ang mga mataas na halaga na korporatibong kliyente na nagtatayo ng kanilang sariling vertical model, ang panganib na haharapin ng mga kompanya ng generic model ay ang pagkabawas sa antas ng imprastruktura: pagbibigay ng base model para sa pangalawang pag-train ng mga korporasyon, pagbibigay ng inference API para sa pangkalahatang mga gawain, ngunit pagkawala ng kakayahang magtakda ng presyo sa pinakakitaan na mga vertical application.
Ito ay katulad ng pag-unlad ng industriya ng cloud computing.
Ang AWS, Azure, at GCP ay nagbibigay ng imprastruktura, ngunit ang pinakamalaking kita sa SaaS application layer ay kinokontrol ng mga espesyalisadong kumpanya tulad ng Salesforce, ServiceNow, at Workday. Kung susundin ng industriya ng AI ang parehong landas, ang papel ng OpenAI at Anthropic ay maaaring mas malapit sa "AWS ng AI" kaysa sa "Salesforce ng AI".
Ang pinatotohanan ng Thomson Reuters sa pamamagitan ng $40 milyon ay: kapag mayroon ka ng sapat na natatanging data, maaari mong abutin ang mga pangkalahatang modelo na tinuturuan ng milyon-milyong dolyar gamit ang isang maliit na bahagi ng gastos.
Kapag nasusuri ang lohikang ito, bawat kumpanya na nakaupo sa mga mina ng proprietary data ay magrereview muli ng kanilang desisyon: patuloy na magbabayad ng mga bayarin sa API sa OpenAI o Anthropic bawat taon, o maglalabas ng isang mas maliit na halaga upang turuan ang isang sariling kontroladong vertical model?
Para sa mga market na nakakakita ng kuwento ng "arms race sa AI", ang $40 milyon ni Thomson Reuters ay isang palatandaan ng kabaligtaran. Sa susunod na yugto ng kompetisyon sa AI, ang mananalo ay hindi kailangang ang may pinakamataas na gastos sa pagtatrain, kundi ang may pinakamakaibang at pinakamahalagang data. Ang mga modelo ay mga kasangkapan, ang data ang pader.
