Thomson Reuters ใช้เงิน 40 ล้านดอลลาร์สหรัฐในการฝึกโมเดล AI ด้านกฎหมายเฉพาะทาง

iconTechFlow
แชร์
AI summary iconสรุป
ธอมสัน รีเตอร์ส ประกาศลงทุน 40 ล้านดอลลาร์สหรัฐเพื่อฝึกโมเดล AI ทางกฎหมายเฉพาะทางของตนเองชื่อ Thomson โมเดลนี้ถูกสร้างขึ้นจากข้อมูลทางกฎหมาย ภาษี และข่าวของบริษัท และแสดงประสิทธิภาพที่แข็งแกร่งในงานทางกฎหมายเฉพาะทาง แอปพลิเคชันแรกคือใน Tabular Analysis ของ CoCounsel Legal โดยมีเวอร์ชันเบาลงบน Hugging Face การเคลื่อนไหวนี้เกิดขึ้นในช่วงที่มีความต้องการด้าน CFT เพิ่มขึ้นและการตรวจสอบตลาดสภาพคล่องและตลาดคริปโตอย่างเข้มงวดยิ่งขึ้น

เขียนโดย เสี่ยวปิ้ง

วันที่ 24 สิงหาคม Thomson Reuters ประกาศเปิดตัวโมเดลภาษาขนาดใหญ่ที่พัฒนาขึ้นเองชื่อ "Thomson" บริษัทผู้ให้ข้อมูลที่มีรายได้ประจำปีเกิน 7 พันล้านดอลลาร์สหรัฐฯ ระบุว่า โมเดลนี้ถูกฝึกบนพื้นฐานโอเพ่นซอร์ส โดยมีการลงทุนสะสมประมาณ 40 ล้านดอลลาร์สหรัฐฯ (รวมถึงบุคลากรและพลังการคำนวณ) ข้อมูลการฝึกมาจากฐานข้อมูลกฎหมาย Westlaw คู่มือการปฏิบัติ Practical Law แพลตฟอร์มการวิจัยภาษี Checkpoint และทรัพย์สินข่าวของ Reuters การประเมินเบื้องต้นแสดงให้เห็นว่า Thomson มีประสิทธิภาพในหลายงาน "เทียบเท่ากับโมเดลชั้นนำล่าสุด"

400 ล้านดอลลาร์สหรัฐฯ เมื่อเทียบกับ: การระดมทุนรอบล่าสุดของ OpenAI ที่ 40 พันล้านดอลลาร์สหรัฐฯ, Anthropic ระดมทุนสะสมเกิน 13 พันล้านดอลลาร์สหรัฐฯ, xAI ได้รับการระดมทุนเพียงรอบเดียว 6 พันล้านดอลลาร์สหรัฐฯ ห้องปฏิบัติการชั้นนำใช้เงินหลายพันล้านดอลลาร์สหรัฐฯ เพื่อสร้างพลังการประมวลผลในการฝึกโมเดลทั่วไป ขณะที่ Thomson Reuters ใช้เงินน้อยกว่าหนึ่งศูนย์ในสาขาเฉพาะ แต่สามารถพัฒนาความสามารถที่อ้างว่าเทียบเท่ากับเทคโนโลยีชั้นนำ

คำพูดของซีทีโอ โจเอล ฮรอน: อุตสาหกรรม AI ได้ใช้ขนาดเป็นคำตอบมานานหลายปี ด้วยการใช้โมเดลที่ใหญ่ขึ้น ทรัพยากรการประมวลผลมากขึ้น และเงินทุนมากขึ้น Thomson ได้พิสูจน์ว่ามีทางเลือกอีกทางหนึ่ง นั่นคือเริ่มต้นจากพื้นฐานที่แข็งแกร่ง และทำการปรับแต่งอย่างลึกซึ้งสำหรับงานที่สำคัญจริงๆ เพื่อสร้างปัญญาที่มีประสิทธิภาพและควบคุมได้อย่างสมบูรณ์

ยุคของการสร้าง AI เองสำหรับอุตสาหกรรมเฉพาะทางกำลังเริ่มต้นขึ้น

Thomson ทำอะไรไปบ้าง?

Thomson ใช้ฐานโอเพนซอร์ส (ประกาศไม่ได้ระบุโมเดลเฉพาะ) และผ่านการฝึกกลาง (mid-training) และการฝึกหลัง (post-training) เพื่อฝังข้อมูลเฉพาะของ Thomson Reuters

ประกาศเปิดเผยว่าขณะนี้ใช้เนื้อหาของตัวเองน้อยกว่า 10% สำหรับการฝึกอบรม และจะดำเนินการค้นคว้าทิศทางเฉพาะทางเพิ่มเติมในอนาคต ผู้เชี่ยวชาญด้านวิชาการหลายร้อยคนมีส่วนร่วมตั้งแต่การออกแบบเป้าหมายการฝึกอบรมจนถึงการประเมินผลสุดท้าย

การใช้งานแรกของโมเดลคือฟีเจอร์การวิเคราะห์ตาราง (Tabular Analysis) ใน CoCounsel Legal สำหรับสำนักงานกฎหมายและฝ่ายกฎหมายขององค์กร CoCounsel ยังคงใช้สถาปัตยกรรมแบบหลายโมเดล โดยจะใช้ Thomson ในสถานการณ์ที่ Thomson มีข้อได้เปรียบชัดเจน และยังคงใช้โมเดลขั้นสูงจากภายนอกในสถานการณ์อื่นๆ

Thomson Reuters ยังได้เผยแพร่เวอร์ชันโอเพ่นซอร์สขนาด "เล็ก" บน Hugging Face สำหรับการใช้งานทางวิชาการและไม่เพื่อการค้า โดยเชิญนักนิติศาสตร์และนักวิจัยด้าน AI 来进行การประเมินอย่างอิสระ

ศาสตราจารย์ Jonathan Choi จากคณะนิติศาสตร์ มหาวิทยาลัยวอชิงตัน ได้ทดสอบ Thomson, ChatGPT และ Claude ด้วยคำถามที่ยากในบทเรียนภาษีบริษัท และพบว่าโมเดลทั้งสามตอบถูกต้อง แต่เขาชื่นชอบคำตอบของ Thomson เป็นพิเศษ โดยเฉพาะการอ้างอิงลิงก์ถึงงานวิชาการทางกฎหมาย ซึ่งทำให้คำตอบมีความโปร่งใสและใช้งานได้จริงมากขึ้น

เศรษฐศาสตร์มูลค่า 40 ล้านดอลลาร์สหรัฐ

ตัวเลขนี้คือกุญแจสำคัญในการเข้าใจทั้งเรื่อง

ต้นทุนในการฝึกโมเดลขั้นสูงทั่วไปกำลังเพิ่มขึ้นแบบก้าวกระโดด Meta ใช้ GPU H100 มากกว่า 16,000 ตัวในการฝึก Llama 3 โดยค่าใช้จ่ายด้านกำลังการประมวลผลคาดว่าอยู่ที่หลายร้อยล้านดอลลาร์สหรัฐ งบประมาณการฝึกของ OpenAI และ Google DeepMind สูงกว่านั้นอีก โมเดลเหล่านี้มีเป้าหมายเพื่อ “ทำได้ทุกอย่าง” ตั้งแต่การเขียนบทกวี การแก้สมการเชิงอนุพันธ์ การเขียนโปรแกรม ไปจนถึงการรับบทบาท

สิ่งที่ Thomson Reuters ทำนั้นต่างจากกันอย่างสิ้นเชิงในเชิงตรรกะ มันไม่จำเป็นต้องมีโมเดลที่ทำได้ทุกอย่าง แต่ต้องการโมเดลที่เชี่ยวชาญในสาขาเฉพาะทางอย่างการวิจัยด้านกฎหมาย การปฏิบัติตามภาษี การตีความกฎระเบียบ และการวิเคราะห์เอกสารทางวิชาชีพ ซึ่งต้องทำได้ดีเทียบเท่าหรือดีกว่าโมเดลขั้นสูงทั่วไป เป้าหมายนี้มีขอบเขตแคบกว่ามาก จึงมีต้นทุนการฝึกอบรมต่ำกว่ามาก

แต่สิ่งที่ทำให้ 40 ล้านดอลลาร์สหรัฐเป็นไปได้นั้น ไม่ใช่การลดช่วง แต่คือทรัพย์สินข้อมูล

Westlaw ฐานข้อมูลกฎหมายที่เป็นของ Thomson Reuters ครอบคลุมฐานข้อมูลคดีมากกว่า 40,000 ฐานและสะสมคำตัดสินมากกว่า 100 ปี Practical Law มีคู่มือการปฏิบัติและเทมเพลตที่ทนายความมากกว่า 650 คนแก้ไขและดูแลอย่างต่อเนื่อง Checkpoint เป็นเครื่องมือมาตรฐานสำหรับผู้เชี่ยวชาญด้านภาษีของสหรัฐอเมริกา คลังข่าวของ Reuters ครอบคลุมทั่วโลกและมีประวัติยาวนานกว่า 175 ปี

ข้อมูลเหล่านี้ไม่ได้ถูกดึงมาจากอินเทอร์เน็ต

พวกมันเป็นสินทรัพย์แบบเอกสิทธิ์ที่ผ่านการแก้ไข ทำเครื่องหมาย จัดโครงสร้าง และอัปเดตอย่างต่อเนื่องโดยผู้เชี่ยวชาญ โมเดลเฉพาะทางที่ฝึกบนข้อมูลเหล่านี้มีความแม่นยำและคุณภาพการอ้างอิงในสาขาเฉพาะของมัน ซึ่งโมเดลทั่วไปยากที่จะเทียบได้แม้จะใช้ RAG (การสร้างที่เสริมด้วยการค้นหา) หรือการปรับแต่งอย่างง่าย โมเดลทั่วไปสามารถ “เชื่อมต่อ” กับข้อมูลเหล่านี้ได้ แต่การเชื่อมต่อและ “เติบโตภายใน” นั้นต่างกัน

Thomson Reuters ยังชี้ให้เห็นถึงความแตกต่างนี้เอง: ผลประโยชน์ที่ได้จากการฝึกอบรมเฉพาะด้าน ไม่สามารถแทนที่ได้ด้วยการเชื่อมต่อเนื้อหาเพียงอย่างเดียว

ใครจะเดินเส้นทางนี้?

Thomson Reuters จะไม่ใช่รายเดียว ตามสายโซ่ที่ว่า “ข้อมูลเฉพาะทาง → โมเดลเฉพาะทาง → ต้นทุนการให้เหตุผลที่ต่ำลง → การควบคุมข้อมูลที่ดีขึ้น → กำไรขั้นต้นขององค์กรที่สูงขึ้น” มีบริษัทอย่างน้อยหลายประเภทที่มีเงื่อนไขในการเลียนแบบรูปแบบนี้

บริษัทข้อมูลทางการเงิน Bloomberg ได้ฝึกโมเดล BloombergGPT ตั้งแต่ปี 2023 โดยใช้ข้อมูลจากเทอร์มินัลของตนเองและข้อมูลข่าวสารเฉพาะของบริษัท แม้จะไม่มีการดำเนินการเพิ่มเติมมากนัก แต่ข้อมูลจาก Bloomberg Terminal มีอุปสรรคทางข้อมูลในระดับเดียวกับ Westlaw ของ Thomson Reuters—นี่คือชุดข้อมูลเฉพาะที่โมเดลทั่วไปไม่สามารถเข้าถึงได้อย่างถูกต้องตามกฎหมาย

องค์กรบริการมืออาชีพ เช่น บริษัทบัญชีสี่แห่งใหญ่ (PwC, Deloitte, EY, KPMG) กลุ่มบริษัทกฎหมายขนาดใหญ่ (เช่น Baker McKenzie, Kirkland & Ellis) และบริษัทข้อมูลทางการแพทย์ (เช่น ข้อมูลบันทึกการรักษาทางอิเล็กทรอนิกส์ของ Epic Systems) ต่างมีข้อมูลมืออาชีพที่มีโครงสร้างสูงและเป็นความลับอย่างมาก องค์กรเหล่านี้ไม่ต้องการส่งข้อมูลลูกค้าไปให้โมเดลทั่วไปประมวลผล แต่ก็ต้องการใช้ AI เพื่อเพิ่มประสิทธิภาพ การสร้างโมเดลเฉพาะทางด้วยตนเองสำหรับพวกเขา ไม่ใช่แค่ตัวเลือก แต่เป็นสิ่งจำเป็นจากมุมมองการปฏิบัติตามกฎระเบียบ

ผู้ผูกขาดข้อมูลอุตสาหกรรม MSCI ครอบครองข้อมูลการจัดอันดับ ESG และดัชนีระดับโลก Verisk ครอบครองข้อมูลการกำหนดราคาประกันและแบบจำลองความเสี่ยง Wolters Kluwer ครอบครองข้อมูลกฎหมายและการปฏิบัติตามกฎหมายในยุโรป RELX ครอบครองวารสารวิชาการ Elsevier และข้อมูลกฎหมาย LexisNexis คุณลักษณะร่วมของบริษัทเหล่านี้คือ: ข้อมูลเป็นสินทรัพย์หลัก ความเป็นเจ้าของข้อมูลคือกำแพงป้องกัน และการให้ข้อมูลแก่แบบจำลองของผู้อื่นจะลดมูลค่าของตนเอง

หมายถึงอะไรสำหรับ OpenAI และ Anthropic?

รายละเอียดหนึ่งในประกาศของ Thomson Reuters ที่อาจถูกมองข้าม: CoCounsel ยังคงใช้สถาปัตยกรรมแบบหลายโมเดล ใช้โมเดลของ Thomson ในจุดที่ Thomson มีข้อได้เปรียบ และยังคงใช้โมเดลภายนอกในสถานการณ์อื่นๆ

นี่แสดงให้เห็นว่าแม้แต่บริษัทที่สร้างโมเดลของตนเองก็จะไม่ละทิ้งโมเดลทั่วไปอย่างสมบูรณ์

โมเดลทั่วไปยังคงมีข้อได้เปรียบในด้านการให้เหตุผลทั่วไป การสร้างโค้ด และการจัดการหลายภาษา โมเดลเฉพาะทางแทนที่ชั้นของโมเดลทั่วไปที่ “เพียงพอแต่ไม่ดีพอ” ในสาขาเฉพาะ

แต่ในระยะยาว หากลูกค้าองค์กรที่มีมูลค่าสูง越来越多เริ่มสร้างโมเดลเฉพาะทางของตนเอง บริษัทโมเดลทั่วไปอาจเผชิญความเสี่ยงที่จะถูกบีบให้เหลือเพียงชั้นโครงสร้างพื้นฐาน: ให้โมเดลพื้นฐานแก่องค์กรเพื่อฝึกฝนใหม่ และให้ API การประมวลผลสำหรับงานทั่วไป แต่สูญเสียอำนาจในการกำหนดราคาในแอปพลิเคชันเฉพาะทางที่ทำกำไรสูงสุด

สิ่งนี้คล้ายกับการพัฒนาของอุตสาหกรรมคลาวด์คอมพิวติ้ง

AWS, Azure และ GCP ให้โครงสร้างพื้นฐาน แต่ชั้นแอปพลิเคชัน SaaS ที่ทำกำไรสูงสุดถูกครอบครองโดยบริษัทเฉพาะทางเช่น Salesforce, ServiceNow และ Workday หากอุตสาหกรรม AI เดินตามเส้นทางเดียวกัน บทบาทของ OpenAI และ Anthropic อาจใกล้เคียงกับ "AWS ของ AI" มากกว่า "Salesforce ของ AI"

สิ่งที่ Thomson Reuters ใช้เงิน 40 ล้านดอลลาร์สหรัฐเพื่อพิสูจน์คือ: เมื่อคุณมีข้อมูลที่ไม่ซ้ำใครเพียงพอ คุณสามารถใช้ต้นทุนเพียงเศษเสี้ยวของค่าใช้จ่ายในการแข่งขันกับแบบจำลองทั่วไปที่ได้รับการฝึกฝนด้วยเงินหลายพันล้านดอลลาร์ในสาขาของคุณ

เมื่อตรรกะนี้ได้รับการยืนยัน ทุกบริษัทที่มีข้อมูลเชิงลึกของตนเองจะต้องทบทวนใหม่ว่า ควรจ่ายค่า API รายปีให้กับ OpenAI หรือ Anthropic ต่อไป หรือใช้เงินจำนวนน้อยกว่ามากในการฝึกโมเดลเฉพาะทางที่ควบคุมได้เอง

สำหรับตลาดที่คุ้นเคยกับเรื่องราว “การแข่งขันอาวุธ AI” งบประมาณ 40 ล้านดอลลาร์สหรัฐของ Thomson Reuters ถือเป็นสัญญาณในทิศทางตรงกันข้าม ระยะต่อไปของการแข่งขัน AI ผู้ชนะอาจไม่ใช่บริษัทที่มีต้นทุนการฝึกอบรมสูงที่สุด แต่เป็นบริษัทที่มีข้อมูลที่เป็นเอกลักษณ์และไม่สามารถแทนที่ได้มากที่สุด โมเดลคือเครื่องมือ ข้อมูลคือกำแพงกั้น

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา