كتابة: شياو بينغ
في 24 أغسطس، أعلنت ثومسون رويترز عن إطلاق نموذج لغوي كبير مطور ذاتيًا يُسمى "Thomson". وصرحت هذه الشركة العملاقة في مجال المعلومات التي تحقق إيرادات تزيد عن 7 مليارات دولار سنويًا أن النموذج تم تدريبه على أساس مفتوح المصدر، وباستثمار إجمالي قدره حوالي 40 مليون دولار (يشمل التكاليف المتعلقة بالكوادر والحوسبة)، حيث استُخدمت بيانات التدريب من قاعدة بيانات Westlaw القانونية، ودليل Practical Law العملي، ومنصة Checkpoint لأبحاث الضرائب، وأصول أخبار رويترز. وأظهرت التقييمات المبكرة أن Thomson يحقق أداءً "متكافئًا مع أحدث النماذج الرائدة" في عدة مهام.
400 مليون دولار، مقارنةً بذلك: جمعت OpenAI آخر جولة تمويل بقيمة 40 مليار دولار، وجمعت Anthropic أكثر من 13 مليار دولار بشكل إجمالي، بينما حصلت xAI على 6 مليارات في جولة واحدة فقط. تستخدم المختبرات الرائدة عشرات المليارات من الدولارات لتدريب نماذج عامة، بينما استخدمت Thomson Reuters أقل من جزء ضئيل من هذا المبلغ، وحققت في مجال متخصص قدرات تدّعي أنها توازي الأداء الرائد.
الكلمات الأصلية لـ CTO جويل هرون: لقد اعتبرت صناعة الذكاء الاصطناعي على مدار سنوات أن الحجم هو الحل—نماذج أكبر، وقوة حوسبة أكثر، وأموال أكثر. أثبت تومسون وجود مسار آخر، يبدأ من أساس قوي، ويُخصّص بعمق للمهام الحقيقية المهمة، مما يمكّن من بناء ذكاء فعّال ومستقل بالكامل.
يبدأ عصر بناء الذكاء الاصطناعي الخاص بالصناعات الرأسية.
ماذا فعل تومسون؟
يبدأ Thomson من قاعدة مفتوحة المصدر (لم تُحدد النموذج المحدد في الإعلان)، من خلال إدخال بيانات Thomson Reuters الحصرية عبر التدريب المتوسط (mid-training) والتدريب المتأخر (post-training).
أُعلن أن أقل من 10% من المحتوى الذاتي تم استخدامه حاليًا للتدريب، وسيتم الاستمرار في استكشاف مجالات متخصصة جديدة في المستقبل. شارك مئات الخبراء في التخصصات من تصميم أهداف التدريب حتى التقييم النهائي.
أول سيناريو لنشر النموذج هو وظيفة تحليل الجداول (Tabular Analysis) في CoCounsel Legal، الموجهة إلى مكاتب المحاماة وإدارات القانون المؤسسي. يحافظ CoCounsel على بنية نماذج متعددة، حيث يستخدم Thomson في السيناريوهات التي تتميز بها Thomson، ويستمر في استخدام نماذج خارجية متقدمة في السيناريوهات الأخرى.
نشرت ثومسون رويترز أيضًا إصدارًا مفتوح المصدر "صغيرًا" على Hugging Face للاستخدام الأكاديمي وغير التجاري، ودعت الباحثين في القانون والذكاء الاصطناعي إلى إجراء تقييم مستقل.
أجرى البروفيسور جوناثان تشوي من كلية الحقوق بجامعة واشنطن اختبارًا على Thomson وChatGPT وClaude باستخدام أسئلة صعبة من دورة ضرائب الشركات، ووجد أن جميع النماذج أجابت بشكل صحيح، لكنه فضل إجابات Thomson، خاصةً بسبب روابطها إلى المراجع القانونية التي جعلت الإجابات أكثر شفافية وفائدة.
40 مليون دولار اقتصادي
This number is the key to understanding the whole thing.
تكلفة تدريب نموذج متقدم عام ترتفع بشكل أسّي. استخدمت Meta أكثر من 16,000 وحدة H100 GPU لتدريب Llama 3، مع تقدير تكاليف الحوسبة ببلايين الدولارات. إن ميزانيات التدريب الخاصة بـ OpenAI وGoogle DeepMind أعلى من ذلك. تهدف هذه النماذج إلى "القيام بكل شيء"، من كتابة الشعر إلى حل المعادلات التفاضلية، ومن البرمجة إلى تمثيل الأدوار.
ما تقوم به تومسون رويترز يختلف تمامًا من الناحية المنطقية. فهي لا تحتاج إلى نموذج قادر على فعل كل شيء، بل تحتاج إلى نموذج يحقق أداءً مساويًا أو حتى أفضل من النماذج الرائدة العامة في مجالات متخصصة جدًا مثل البحث القانوني، والامتثال الضريبي، وتأويل اللوائح، وتحليل الوثائق المهنية. نطاق هذا الهدف أضيق بكثير، وبالتالي فإن تكلفة التدريب أقل بكثير.
لكن ما جعل 40 مليون دولار ممكنًا ليس تضييق النطاق، بل الأصول البياناتية.
تغطي قاعدة بيانات Westlaw التابعة لـ Thomson Reuters أكثر من 40,000 قاعدة بيانات قضايا وأكثر من 100 عام من التراكم القضائي. وتشمل Practical Law إرشادات تشغيلية وقوالب يتم صيانتها باستمرار من قبل أكثر من 650 محامٍ محرر. ويعتبر Checkpoint الأداة القياسية للمحترفين الضريبيين في الولايات المتحدة. وتغطي قاعدة بيانات أخبار Reuters عالميًا، وتمتد على مدار أكثر من 175 عامًا.
هذه البيانات ليست مُستخرجة من الإنترنت.
إنها أصول حصرية تم تحريرها وتوسيمها وهيكلتها وتحديثها باستمرار من قبل متخصصين. إن النماذج المتخصصة المدربة على هذه البيانات تحقق دقة وجودة استشهادات لا يمكن للنماذج العامة محاكاتها بسهولة من خلال RAG (الاسترجاع المعزز بالولادة) أو الدقة الدقيقة فقط. يمكن للنماذج العامة "الوصول" إلى هذه البيانات، لكن الوصول والـ"النمو" داخلها هما أمران مختلفان.
أشارت ثومسون رويترز بنفسها إلى هذا الفرق: الكسب الناتج عن التدريب المتخصص في المجال لا يمكن تعويضه بالوصول إلى المحتوى فقط.
من سيسلك هذا الطريق؟
لن تكون ثومسون رويترز الوحيدة. بالنظر إلى السلسلة "البيانات الحصرية → نموذج عمودي → تكلفة استدلال أقل → تحكم أقوى في البيانات → هامش ربح أعلى للشركات"، هناك على الأقل عدة فئات من الشركات التي تمتلك الشروط اللازمة لنسخ هذا النموذج.
شركة بيانات مالية. لقد درّبت بلومبرغ BloombergGPT في عام 2023 باستخدام بيانات محطتها الخاصة ومواد أخبارها. على الرغم من أن الإجراءات اللاحقة كانت محدودة، إلا أن حواجز بيانات بلومبرغ تيرمنال تُعادل مستوى Westlaw التابع لثومسون رويترز — هذه مجموعات بيانات حصرية لا يمكن لأي نموذج عام الحصول عليها قانونيًا.
خدمات احترافية. تمتلك مكاتب المحاسبة الكبرى (PwC وDeloitte وEY وKPMG)، وتحالفات المحامين الكبيرة (مثل Baker McKenzie وKirkland & Ellis)، بالإضافة إلى شركات المعلومات الطبية (مثل بيانات السجلات الطبية الإلكترونية من Epic Systems)، كميات هائلة من البيانات الاحترافية عالية التنظيم وعالية السرية. هذه المؤسسات لا ترغب في تزويد النماذج العامة ببيانات عملائها، وفي نفس الوقت تحتاج إلى الذكاء الاصطناعي لتحسين الكفاءة. بناء نماذج متخصصة داخليًا قد لا يكون خيارًا بالنسبة لها من منظور الامتثال، بل ضرورة.
مُحتكِر بيانات الصناعة. تمتلك MSCI بيانات التصنيفات والمؤشرات العالمية للبيئة والمجتمع والحوكمة، وتمتلك Verisk بيانات تسعير التأمين ونماذج المخاطر، وتمتلك Wolters Kluwer بيانات القانون والامتثال الأوروبية، وتمتلك RELX دوريات Elsevier الأكاديمية وبيانات LexisNexis القانونية. السمة المشتركة لهذه الشركات هي: البيانات هي الأصل الأساسي، وحصريّة البيانات هي الحاجز التنافسي، وتغذية نماذج الآخرين بالبيانات تُضعف قيمتها الذاتية.
ماذا يعني ذلك لـ OpenAI و Anthropic؟
يحتوي إعلان Thomson Reuters على تفصيل يُمكن تجاهله: يحافظ CoCounsel على بنية نموذج متعددة. يستخدم Thomson في المجالات التي تتميز بها Thomson، ويستمر استخدام النماذج الخارجية في السيناريوهات الأخرى.
هذا يوضح أن الشركات حتى لو أنشأت نماذجها الخاصة، فلن تتخلى تمامًا عن النماذج العامة.
لا تزال النماذج العامة تتمتع بمزايا في الاستدلال العام، وتوليد الكود، ومعالجة اللغات المتعددة. أما النماذج المتخصصة، فهي تستبدل الطبقة في النماذج العامة التي تكون "كافية ولكن غير ممتازة" في مجالات محددة.
لكن على المدى الطويل، فإن الخطر الذي تواجهه شركات النماذج العامة هو أن تُضَيَّق إلى طبقة البنية التحتية: تقديم نماذج قاعدية للشركات لتدريبها مجددًا، وتقديم واجهات برمجة تطبيقات الاستنتاج لمعالجة المهام العامة، لكنها تفقد السيطرة على التسعير في أحدث التطبيقات العمودية الربحية.
هذا يشبه تطور صناعة الحوسبة السحابية.
توفر AWS وAzure وGCP البنية التحتية، لكن طبقة تطبيقات SaaS الأكثر ربحية تُسيطر عليها شركات متخصصة مثل Salesforce وServiceNow وWorkday. إذا سلكت صناعة الذكاء الاصطناعي نفس المسار، فقد تكون دور OpenAI وAnthropic أقرب إلى "AWS للذكاء الاصطناعي" بدلاً من "Salesforce للذكاء الاصطناعي".
ما أثبتته تومسون رويترز بإنفاق 40 مليون دولار هو أنه عندما تمتلك بيانات كافية وفريدة، يمكنك مجاراة النماذج العامة التي تدربت بمليارات الدولارات بتكلفة ضئيلة جدًا في مجالك.
بمجرد التحقق من هذا المنطق، ستُعيد كل شركة تمتلك مناجم بيانات حصرية حساباتها: هل تستمر في دفع رسوم واجهة برمجة التطبيقات سنويًا لـ OpenAI أو Anthropic، أم تنفق مبلغًا أصغر بكثير على تدريب نموذج رأسي تتحكم فيه بالكامل؟
للسوق المعتاد على سردية "سباق التسلح بالذكاء الاصطناعي"، فإن الـ40 مليون دولار من تومسون رويترز إشارة معاكسة. المرحلة التالية من سباق الذكاء الاصطناعي، قد لا يفوز فيها الأكبر إنفاقًا على التدريب، بل الأفضل في البيانات الأصلية والأقل قابلية للاستبدال. النماذج هي أدوات، والبيانات هي الحاجز.
