Yazan: Xiao Bing
24 Ağustos'ta Thomson Reuters, kendi geliştirdiği büyük dil modeli "Thomson"u tanıttı. Yıllık geliri 7 milyar doların üzerinde olan bu bilgi devi, modelin açık kaynak taban üzerinde eğitildiğini ve toplamda yaklaşık 40 milyon dolarlık yatırım yapıldığını (insan kaynakları ve hesaplama gücü dahil) belirtti. Eğitim verileri, Westlaw hukuki veritabanı, Practical Law uygulamalı rehberler, Checkpoint vergi araştırmaları platformu ve Reuters haber varlıklarından oluşuyor. Erken değerlendirme sonuçları, Thomson'un birçok görevde "en son öncü modellerle eşit performans gösterdiğini" gösteriyor.
400 milyon ABD doları; bunu karşılaştırın: OpenAI'nin en son sermaye toplama turu 40 milyar ABD doları, Anthropic toplamda 13 milyardan fazla topladı, xAI tek bir turda 6 milyar aldı. Önde gelen laboratuvarlar, genel modelleri eğitmek için onlarca milyar dolar harcıyor, oysa Thomson Reuters, bu rakamın bir sıfırından azını harcayarak, kendi dikey alanında önde gelen seviyeye ulaşabileceğini iddia eden bir yetenek geliştirdi.
CTO Joel Hron'un sözleri: AI endüstrisi yıllardır ölçekleri cevap olarak gördü, daha büyük modeller, daha fazla hesaplama gücü, daha fazla para. Thomson, güçlü bir temelden başlayarak gerçekten önemli işler için derinlemesine özelleştirme yoluyla verimli ve tamamen kendi kontrolünde akıllı sistemler inşa edilebileceğini kanıtladı.
Dikey sektörler için AI kendi kendine kurma dönemi başlıyor.
Thomson ne yaptı?
Thomson, açık kaynaklı bir temel üzerinden (duyuruda hangi model olduğu belirtilmemiş), orta dönem eğitimi (mid-training) ve son dönem eğitimi (post-training) ile Thomson Reuters'in özel verilerini entegre eder.
Duyuruya göre, şu anda kendi içeriğinin %10'undan azı eğitim için kullanılmıştır; ileride yeni uzmanlık alanları keşfedilmeye devam edilecektir. Yüzlerce disiplin uzmanı, eğitim hedefi tasarımı ile son değerlendirme arasında tam süreçte yer almıştır.
Modelin ilk dağıtım senaryosu, avukatlık firmaları ve kurumsal hukuk departmanları için CoCounsel Legal'in Tabular Analysis (Tablo Analizi) işlevidir. CoCounsel, çok modelli mimariyi korumaya devam eder; Thomson'un açık avantajı olduğu senaryolarda Thomson kullanılır, diğer senaryolarda ise dışarıdan öncü modeller kullanılmaya devam edilir.
Thomson Reuters, akademik ve ticari olmayan kullanım için Hugging Face üzerinde bir "küçük" açık kaynak sürümü de yayınladı ve hukuk ile AI akademisyenlerine bağımsız değerlendirme çağrısında bulundu.
Washington Üniversitesi Hukuk Fakültesi profesörü Jonathan Choi, Thomson, ChatGPT ve Claude’u şirket vergisi dersindeki zor sorularla test etti ve üç modelin de doğru cevap verdiğini değerlendirdi; ancak özellikle yasal eserlere bağlantılar sunan Thomson’un cevaplarını tercih etti, çünkü bu bağlantılar cevapları daha şeffaf ve pratik hale getirdi.
40 milyon ABD doları ekonomisi
Bu sayı, olayın tamamını anlamak için anahtardır.
Genel ileri bir model eğitmek maliyeti üssel olarak artıyor. Meta, Llama 3'ü eğitmek için 16.000'den fazla H100 GPU kullandı ve hesaplamalı maliyetler milyonlarca dolar olarak tahmin ediliyor. OpenAI ve Google DeepMind'in eğitim bütçeleri daha yüksek. Bu modellerin hedefi, şiir yazmaktan diferansiyel denklemleri çözmeye, programlamadan karakter rol yapmaya kadar her şeyi yapmak.
Thomson Reuters'in yaptığı iş mantıksal olarak tamamen farklıdır. Her şeyi yapabilen bir modele ihtiyacı yoktur; hukuki araştırma, vergi uyumluluğu, düzenleyici yorumlama ve profesyonel belge analizi gibi son derece dar alanlarda, genel ileri modeller kadar iyi hatta daha iyi performans gösteren bir modele ihtiyaç duyar. Bu hedefin kapsamı çok daha dar olduğundan, eğitim maliyeti çok daha düşüktür.
Ancak 40 milyon doları mümkün kılan, aralığın daralması değil, veri varlıklarıdır.
Thomson Reuters'e ait Westlaw hukuki veritabanı, 40.000'den fazla dava veritabanını ve 100 yıldan fazla hukuki öncül birikimi kapsar. Practical Law, 650'den fazla avukat editörün sürekli olarak güncellediği işlem kılavuzlarını ve şablonları içerir. Checkpoint, ABD'li vergi uzmanları için standart bir araçtır. Reuters haber corpus'u, 175 yıldan fazla bir zaman diliminde küresel kapsama sahiptir.
Bu veriler internetten kazınmamıştır.
Bu, profesyonel olarak düzenlenmiş, etiketlenmiş, yapılandırılmış ve sürekli güncellenen özel varlıklardır. Bu veriler üzerinde eğitilen dikey modeller, uzmanlık alanlarında genel modellerin basit RAG (bilgi retrieval ile artırılmış üretme) veya ince ayarla ulaşamayacağı kadar yüksek doğruluk ve alıntı kalitesine sahiptir. Genel modeller bu verilere "erişebilir", ancak erişmek ve içinde "büyümek" iki farklı şeydir.
Thomson Reuters, alanlara özel eğitimin sağladığı kazanımların, yalnızca içerik entegrasyonuyla yerine konulamayacağını da vurguladı.
Bu yolu kim izleyecek?
Thomson Reuters tek olmayacak. "Özel veri → Dikey model → Daha düşük çıkarım maliyeti → Daha güçlü veri kontrolü → Daha yüksek kurumsal brüt kâr" zincirini takip ederseniz, bu modeli taklit etme koşullarına sahip en az birkaç tür şirket vardır.
Finansal veri şirketi. Bloomberg, 2023'te kendi finansal terminal verilerini ve haber corpus'larını kullanarak BloombergGPT'yi eğitmiştir. Sonraki adımlar sınırlı olsa da, Bloomberg Terminal veri engeli ve Thomson Reuters'in Westlaw'ı aynı düzeydedir—bu, herhangi bir genel modelin yasal olarak erişemeyeceği özel veri kümeleridir.
Profesyonel hizmet sağlayıcılar. PwC, Deloitte, EY, KPMG gibi dört büyük muhasebe firmaları, Baker McKenzie ve Kirkland & Ellis gibi büyük hukuk firmaları ve Epic Systems gibi tıbbi bilgi şirketleri, yüksek yapılandırılmış ve çok gizli profesyonele özgü verilere sahiptir. Bu kurumlar, müşteri verilerini genel modellere vermek istememektedir; ancak verimlilik artışı için AI'ya ihtiyaç duymaktadırlar. Dikey modelleri kendi içlerinde kurmak, onlar için uygunluk açısından bir tercih değil, bir zorunluluktur.
Sektör veri monopolcüleri. MSCI, küresel ESG puanlama ve endeks verilerine sahiptir; Verisk, sigorta fiyatlandırma ve risk modelleri verilerine sahiptir; Wolters Kluwer, Avrupa hukuki ve uyumluluk verilerine sahiptir; RELX, Elsevier akademik dergilerine ve LexisNexis hukuki verilerine sahiptir. Bu şirketlerin ortak özelliği: veriler temel varlıktır, verinin eksklüzyonluğu koruma duvarıdır; veriyi başkalarının modellerine beslemek, kendi değerini zayıflatarak azaltır.
OpenAI ve Anthropic için ne anlama geliyor?
Thomson Reuters'in duyurusunda dikkat edilmesi kolayca kaçırılan bir ayrıntı var: CoCounsel, çok modelli mimariyi korumaktadır. Thomson'un avantajlı olduğu yerlerde Thomson kullanılır, diğer senaryolarda dış modeller kullanılmaya devam edilir.
Bu, kendi modellerini oluşturan şirketlerin bile genel modelleri tamamen bırakmayacağını gösterir.
Genel modeller, genel çıkarım, kod üretimi ve çok dilli işleme gibi alanlarda hâlâ avantajlıdır. Dikey modeller, genel modellerin belirli alanlarda "yeterli ama yeterince iyi olmayan" katmanını yerine getirir.
Ancak uzun vadede, giderek daha fazla yüksek değerli kurumsal müşteri kendi dikey modellerini kurmaya başlarsa, genel modeller şirketleri, altyapı katmanına sıkıştırılma riskiyle karşı karşıya kalır: kurumsal müşterilere temel model sağlar, genel görevler için çıkarım API'si sunar, ancak en karlı dikey uygulama alanlarında fiyat belirleme hakkını kaybeder.
Bu, bulut hesaplama endüstrisinin gelişimine benzer.
AWS, Azure ve GCP altyapıyı sağlıyor, ancak en karlı SaaS uygulama katmanı Salesforce, ServiceNow ve Workday gibi dikey şirketler tarafından işgal ediliyor. Eğer AI endüstrisi aynı yolu izlerse, OpenAI ve Anthropic'in rolleri "AI'nın Salesforce'u"ndan ziyade "AI'nın AWS'si"ne daha yakın olabilir.
Thomson Reuters, 40 milyon dolar harcayarak şunu kanıtladı: Yeterince benzersiz bir veriye sahipseniz, alanınızda milyarlarca dolarlık genel modellerle aynı seviyeye ulaşmak için sadece küçük bir maliyetle yeterli olur.
Bu mantık doğrulandığında, özel veri madenlerinin üzerinde oturan her şirket, OpenAI veya Anthropic'e yıllık API ücretleri ödemeye devam etmeyi mi, yoksa nispeten çok daha küçük bir maliyetle tamamen kendi kontrolünde dikey bir model mi eğitmeyi mi tercih edeceğini yeniden hesaplayacaktır.
"AI silahlanma yarışı" narratifine alışmış piyasalar için Thomson Reuters'in 40 milyon dolarlık yatırımı, ters bir sinyaldir. AI yarışının bir sonraki aşamasında, en yüksek eğitim maliyetine sahip şirketler değil, en benzersiz ve en değiştirilemez verilere sahip şirketler kazanabilir. Model araçtır, veri ise engeldir.
