Thomson Reuters Mengeluarkan $40J untuk Melatih Model AI Undang-Undang Khusus

iconTechFlow
Kongsi
AI summary iconRingkasan
Thomson Reuters mengumumkan pelaburan sebanyak $40 juta untuk melatih model AI undang-undang khususnya, Thomson. Dibina menggunakan data undang-undang, cukai, dan berita syarikat, model ini menunjukkan prestasi yang kuat dalam tugas undang-undang khusus. Aplikasi pertama adalah dalam Tabular Analysis CoCounsel Legal, dengan versi yang lebih ringan di Hugging Face. Langkah ini diambil semasa peningkatan keperluan CFT dan pengawasan yang lebih ketat terhadap likuiditi dan pasaran kripto.

Ditulis oleh Xiao Bing

Pada 24 Ogos, Thomson Reuters mengumumkan pelancaran model bahasa besar buatan sendiri bernama "Thomson". Raksasa maklumat dengan pendapatan tahunan melebihi 7 bilion dolar AS ini menyatakan bahawa model tersebut dilatih berdasarkan asas sumber terbuka, dengan jumlah pelaburan kira-kira 40 juta dolar AS (termasuk tenaga kerja dan kuasa pengiraan), dan data latihan diperoleh daripada pangkalan data undang-undang Westlaw, panduan amal Practical Law, platform penyelidikan cukai Checkpoint, dan aset berita Reuters. Penilaian awal menunjukkan bahawa Thomson menunjukkan prestasi "sepadan dengan model terkini terkini" dalam pelbagai tugas.

400 juta dolar AS, bandingkan dengan: pembiayaan terbaru OpenAI sebanyak 40 bilion dolar AS, Anthropic telah mengumpulkan lebih dari 13 bilion dolar AS, xAI menerima 6 bilion dolar AS dalam satu sesi. Laboratorium terkini menggunakan puluhan bilion dolar AS untuk melatih model generik, sementara Thomson Reuters menggunakan kurang daripada sebahagian kecilnya sahaja dalam satu bidang khusus dan mengklaim mampu menandingi kemampuan terkini.

Pernyataan asal CTO Joel Hron: Selama bertahun-tahun, industri AI telah menjadikan skala sebagai jawapannya—model yang lebih besar, lebih banyak kekuatan pengiraan, dan lebih banyak dana. Thomson membuktikan bahawa terdapat jalan lain: bermula daripada asas yang kuat, melakukan spesialisasi mendalam untuk tugas-tugas yang benar-benar penting, kita boleh membina kecerdasan yang cekap dan sepenuhnya boleh dikendalikan sendiri.

Zaman pembinaan AI sendiri untuk industri vertikal sedang bermula.

Apakah yang Thomson lakukan?

Thomson berasal daripada asas sumber terbuka (pengumuman tidak menyatakan model spesifik), dan memasukkan data eksklusif Thomson Reuters melalui latihan pertengahan (mid-training) dan latihan akhir (post-training).

Pengumuman mengungkapkan bahawa saat ini hanya kurang daripada 10% kandungan sendiri yang digunakan untuk latihan, dan akan terus mengeksplorasi arah profesional baru. Ratusan pakar disiplin terlibat sepenuhnya dari perancangan objektif latihan hingga penilaian akhir.

Skenario pertama pelaksanaan model ialah fungsi Analisis Jadual (Tabular Analysis) dalam CoCounsel Legal, yang ditujukan kepada firma undang-undang dan jabatan undang-undang korporat. CoCounsel terus mempertahankan arsitektur pelbagai model, menggunakan Thomson dalam skenario di mana Thomson mempunyai kelebihan jelas, dan terus menggunakan model terkini pihak ketiga dalam skenario lain.

Thomson Reuters juga menerbitkan versi sumber terbuka "kecil" di Hugging Face untuk penggunaan akademik dan bukan komersial, serta mengundang ahli undang-undang dan AI untuk menilai secara bebas.

Profesor Jonathan Choi dari Sekolah Undang-Undang Universiti Washington menguji Thomson, ChatGPT, dan Claude dengan soalan sukar dalam kursus cukai syarikat, dan menilai bahawa ketiga-tiga model menjawab dengan betul, tetapi beliau lebih menyukai jawapan Thomson, terutamanya kerana pautan kepada karya undang-undang membuat jawapan lebih telus dan lebih praktikal.

Ekonomi US$40 juta

Angka ini adalah kunci untuk memahami keseluruhan perkara.

Kos untuk melatih model canggih universal sedang meningkat secara eksponen. Meta menggunakan lebih daripada 16,000 unit GPU H100 untuk melatih Llama 3, dengan anggaran perbelanjaan komputasi mencapai ratusan juta dolar AS. Anggaran pelatihan OpenAI dan Google DeepMind pula lebih tinggi lagi. Model-model ini bertujuan untuk "bisa melakukan apa sahaja", dari menulis puisi hingga menyelesaikan persamaan pembezaan, dari pemrograman hingga peranan peranan.

Perkara yang dilakukan Thomson Reuters secara logik berbeza sama sekali. Ia tidak memerlukan model yang boleh melakukan segala-galanya, tetapi memerlukan model yang cekap dalam bidang-bidang sangat khusus seperti penyelidikan undang-undang, kepatuhan cukai, tafsiran peraturan, dan analisis dokumen profesional, dengan prestasi setara atau lebih baik daripada model terkini umum. Lingkungan matlamat ini jauh lebih sempit, oleh itu kos latihan jauh lebih rendah.

Namun, yang benar-benar menjadikan 40 juta dolar AS mungkin bukan penyempitan lingkup, melainkan aset data.

Basis data undang-undang Westlaw, yang dimiliki oleh Thomson Reuters, merangkumi lebih daripada 40,000 pangkalan data kes dan pengumpulan preseden lebih daripada 100 tahun. Practical Law mengandungi panduan operasi dan templat yang dikekalkan secara berterusan oleh lebih 650 pengedit peguam. Checkpoint adalah alat piawai untuk profesional cukai Amerika Syarikat. Korpus berita Reuters meliputi seluruh dunia, dengan jangka masa lebih daripada 175 tahun.

Data ini bukan dikumpulkan dari internet.

Ia adalah aset eksklusif yang telah diedit, diberi label, disusun, dan dikemas kini secara berterusan. Model vertikal yang dilatih pada data ini mencapai ketepatan dan kualiti rujukan yang sukar dicapai oleh model umum hanya melalui RAG (Retrieval-Augmented Generation) atau penyesuaian halus. Model umum boleh "menghubungkan" data ini, tetapi menghubungkan dan "tumbuh di dalamnya" adalah dua perkara yang berbeza.

Thomson Reuters sendiri menekankan perbezaan ini: keuntungan daripada latihan yang dispesifikasikan kepada bidang tertentu tidak boleh digantikan hanya dengan akses kandungan semata-mata.

Siapa yang akan mengikuti jalan ini?

Thomson Reuters tidak akan menjadi satu-satunya. Melihat rantai "data eksklusif → model vertikal → kos inferens yang lebih rendah → kawalan data yang lebih kuat → keuntungan kasar perusahaan yang lebih tinggi", sekurang-kurangnya terdapat beberapa jenis syarikat yang mempunyai syarat untuk meniru model ini.

Syarikat data kewangan. Bloomberg telah melatih BloombergGPT pada 2023, berdasarkan data terminal kewangan dan korpus berita miliknya sendiri. Walaupun tindakan seterusnya tidak banyak, rintangan data Terminal Bloomberg setara dengan Westlaw milik Thomson Reuters—kedua-duanya merupakan set data eksklusif yang tidak boleh diperoleh secara sah oleh model umum apa pun.

Perkhidmatan profesional. Kumpulan empat pejabat audit besar (PwC, Deloitte, EY, KPMG), gabungan firma undang-undang besar (seperti Baker McKenzie, Kirkland & Ellis), serta syarikat maklumat kesihatan (seperti data rekod kes elektronik dari Epic Systems), memiliki sejumlah besar data profesional yang sangat terstruktur dan sangat sulit. Institusi-institusi ini tidak bersedia untuk menghantar data pelanggan kepada model umum, tetapi memerlukan AI untuk meningkatkan kecekapan. Membina model tegak sendiri bagi mereka bukanlah pilihan, tetapi keperluan dari segi pematuhan.

Pemonopoli data industri. MSCI memiliki data penilaian ESG dan indeks global, Verisk memiliki data penentuan harga insurans dan model risiko, Wolters Kluwer memiliki data undang-undang dan kesesuaian Eropah, RELX memiliki jurnal akademik Elsevier dan data undang-undang LexisNexis. Ciri sepunya syarikat-syarikat ini ialah: data adalah aset utama, eksklusiviti data adalah parit pertahanan, dan memberikan data kepada model orang lain akan melemahkan nilai sendiri.

Apakah maksudnya kepada OpenAI dan Anthropic?

Sebuah butiran dalam pengumuman Thomson Reuters mudah diabaikan: CoCounsel mengekalkan arsitektur model berganda. Gunakan Thomson di tempat yang menjadi kelebihan Thomson, dan terus gunakan model luar di skenario lain.

Ini menunjukkan bahawa walaupun syarikat telah membina model sendiri, mereka tidak akan meninggalkan model umum sepenuhnya.

Model umum masih memiliki kelebihan dalam inferensi umum, penghasilan kod, dan pemprosesan pelbagai bahasa. Model vertikal menggantikan lapisan model umum yang "cukup baik" tetapi "tidak cukup baik" dalam bidang tertentu.

Namun, dari perspektif jangka panjang, jika semakin banyak pelanggan korporat bernilai tinggi membangun model vertikal sendiri, risiko yang dihadapi perusahaan model umum ialah terkompresi ke lapisan infrastruktur: menyediakan model dasar untuk pelatihan ulang oleh perusahaan dan menyediakan API inferensi untuk menangani tugas-tugas umum, tetapi kehilangan kuasa penetapan harga dalam aplikasi vertikal yang paling menguntungkan.

Ini serupa dengan evolusi industri komputawan awan.

AWS, Azure, dan GCP menyediakan infrastruktur, tetapi lapisan aplikasi SaaS yang paling menguntungkan dikuasai oleh perusahaan-perusahaan vertikal seperti Salesforce, ServiceNow, dan Workday. Jika industri AI mengikuti jalan yang sama, peran OpenAI dan Anthropic mungkin lebih mirip dengan "AWS untuk AI", bukan "Salesforce untuk AI".

Perkara yang dibuktikan oleh Thomson Reuters dengan menghabiskan US$40 juta ialah: apabila anda memiliki data yang cukup unik, anda boleh mengejar kesetaraan dengan model umum yang dilatih dengan belanja miliaran dolar dengan kos yang hampir tidak bererti.

Apabila logik ini disahkan, setiap syarikat yang duduk di atas tambang data eksklusif akan mengira semula: terus membayar yuran API setiap tahun kepada OpenAI atau Anthropic, atau mengeluarkan jumlah wang yang jauh lebih kecil untuk melatih model tegak yang sepenuhnya dikendalikan sendiri?

Bagi pasaran yang telah terbiasa dengan naratif "perlumbaan senjata AI", dana $40 juta dari Thomson Reuters adalah isyarat yang bertentangan. Tahap seterusnya dalam persaingan AI mungkin tidak akan dimenangi oleh syarikat yang mempunyai kos latihan paling tinggi, tetapi oleh syarikat yang mempunyai data paling unik dan paling tidak boleh digantikan. Model adalah alat, data adalah halangan.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.