Автор: Сяобин
24 августа Thomson Reuters объявила о запуске собственной большой языковой модели «Thomson». Этот информационный гигант с годовым доходом более 7 миллиардов долларов США заявил, что модель была обучена на открытой базе, с общими затратами около 40 миллионов долларов США (включая кадры и вычислительные ресурсы). Обучающие данные были получены из юридической базы данных Westlaw, практических руководств Practical Law, платформы Checkpoint для налоговых исследований и новостных активов Reuters. Предварительная оценка показала, что Thomson демонстрирует результаты, «сопоставимые с новейшими передовыми моделями», по нескольким задачам.
400 миллионов долларов — сравните: последний раунд финансирования OpenAI — 40 миллиардов долларов, Anthropic собрала более 13 миллиардов в совокупности, xAI получила 6 миллиардов за один раунд. Передовые лаборатории тратят десятки миллиардов на вычислительные мощности для обучения универсальных моделей, а Thomson Reuters потратила менее сотой доли этой суммы и в узкой области добилась способностей, которые, по их утверждению, сопоставимы с передовыми.
Исходные слова технического директора Джоэла Хрона: «На протяжении многих лет индустрия ИИ принимала масштаб за ответ — большие модели, больше вычислительных мощностей, больше денег. Thomson доказал, что существует иной путь: начав с прочной основы и глубоко специализировавшись для решения действительно важных задач, можно создать эффективный и полностью автономный интеллект».
Эпоха самостоятельной разработки ИИ для вертикальных отраслей только начинается.
Что сделал Томсон?
Thomson, исходя из открытой базы (в объявлении не указано конкретно, какая модель), внедряет проприетарные данные Thomson Reuters посредством промежуточного обучения (mid-training) и последующего обучения (post-training).
Сообщается, что для обучения пока использовано менее 10% собственного контента, и в дальнейшем будут продолжаться поиски новых специализированных направлений. Сотни экспертов в различных областях участвовали на всех этапах — от проектирования целей обучения до финальной оценки.
Первым сценарием развертывания модели является функция анализа таблиц (Tabular Analysis) в CoCounsel Legal, предназначенная для юридических фирм и корпоративных юридических отделов. CoCounsel сохраняет многомодельную архитектуру: в сценариях, где Thomson демонстрирует явные преимущества, используется Thomson, а в остальных сценариях продолжают применяться внешние передовые модели.
Thomson Reuters также выпустила на Hugging Face «маленькую» открытую версию для академических и некоммерческих целей и пригласила юристов и исследователей ИИ провести независимую оценку.
Профессор юридического факультета Вашингтонского университета Джонатан Чой протестировал Thomson, ChatGPT и Claude с помощью сложных вопросов из курса корпоративного налогообложения и оценил, что все три модели дали правильные ответы, но он отдал предпочтение ответу Thomson, особенно благодаря ссылкам на юридические источники, которые сделали ответ более прозрачным и практичным.
40 миллионов долларов США в экономике
Это число — ключ к пониманию всей ситуации.
Стоимость обучения универсальных передовых моделей растет экспоненциально. Meta потратила более 16 000 GPU H100 на обучение Llama 3, а затраты на вычислительные ресурсы оцениваются в сотни миллионов долларов. Бюджеты на обучение OpenAI и Google DeepMind еще выше. Цель этих моделей — «уметь всё»: от написания стихов до решения дифференциальных уравнений, от программирования до ролевых игр.
Деятельность Thomson Reuters принципиально отличается по логике. Ей не нужна модель, способная делать всё, ей нужна модель, которая в нескольких крайне узких областях — правовых исследованиях, налоговой комплаенс-аналитике, интерпретации регуляторных требований и анализе профессиональных документов — будет работать не хуже, а даже лучше, чем универсальные передовые модели. Эта цель гораздо уже, поэтому затраты на обучение значительно ниже.
Но тем, что сделало возможными 40 миллионов долларов, стали не сужение диапазона, а данные как активы.
Правовая база данных Westlaw, принадлежащая Thomson Reuters, охватывает более 40 000 баз данных дел и более 100 лет прецедентов. Practical Law содержит руководства и шаблоны, постоянно обновляемые более чем 650 юристами-редакторами. Checkpoint является стандартным инструментом для американских налоговых специалистов. Новостной корпус Reuters охватывает весь мир и охватывает период более 175 лет.
Эти данные не собираются с интернета.
Это собственные активы, прошедшие профессиональную редактуру, аннотирование, структурирование и постоянное обновление. Модели, обученные на этих данных, в своей специализированной области достигают точности и качества цитирования, которые общие модели трудно воспроизвести с помощью простого RAG (поискового усиления генерации) или тонкой настройки. Общие модели могут «подключиться» к этим данным, но подключение и «рост внутри них» — это две разные вещи.
Thomson Reuters сами подчеркнули это различие: преимущества, полученные в результате специализированной подготовки, не могут быть заменены простым подключением контента.
Кто пойдет этим путем?
Thomson Reuters не будет единственной. Глядя на цепочку «проприетарные данные → вертикальные модели → более низкие затраты на вывод → лучший контроль над данными → более высокая валовая прибыль компании», по крайней мере, несколько типов компаний обладают условиями для воспроизведения этой модели.
Финансовая информационная компания. Bloomberg уже в 2023 году обучила BloombergGPT на основе собственных данных финансовых терминалов и новостных корпусов. Хотя последующих действий было немного, данные Bloomberg Terminal и Westlaw от Thomson Reuters относятся к одному и тому же уровню — это проприетарные наборы данных, которые любая универсальная модель не может законно получить.
Профессиональные сервисные организации. Четыре крупнейшие бухгалтерские фирмы (PwC, Deloitte, EY, KPMG), крупные юридические альянсы (такие как Baker McKenzie, Kirkland & Ellis), а также компании в сфере медицинской информации (например, электронные медицинские карты Epic Systems) обладают огромными объемами высокоструктурированных и строго конфиденциальных профессиональных данных. Эти организации не хотят передавать данные клиентов на обработку универсальным моделям, но при этом нуждаются в ИИ для повышения эффективности. Для них создание специализированных моделей — не вариант, а необходимость с точки зрения соблюдения нормативных требований.
Игроки, монополизирующие отраслевые данные. MSCI владеет глобальными данными по ESG-рейтингам и индексам, Verisk — данными по ценообразованию в страховании и моделям рисков, Wolters Kluwer — данными по европейскому праву и соответствию нормам, RELX — академическими журналами Elsevier и юридическими данными LexisNexis. Общая черта этих компаний: данные являются ключевым активом, эксклюзивность данных — это их конкурентное преимущество, а передача данных для использования в чужих моделях снижает их собственную ценность.
Что это значит для OpenAI и Anthropic?
В объявлении Thomson Reuters есть деталь, которую легко упустить: CoCounsel сохраняет многомодельную архитектуру. В областях, где Thomson имеет преимущество, используется Thomson, в остальных сценариях — внешние модели.
Это означает, что даже компании, создавшие собственные модели, не будут полностью отказываться от универсальных моделей.
Общие модели по-прежнему обладают преимуществами в общих рассуждениях, генерации кода и обработке многоязычных данных. Вертикальные модели заменяют ту часть общих моделей, которая в конкретных областях «достаточно хороша, но не идеальна».
Однако в долгосрочной перспективе, если все больше высокодоходных корпоративных клиентов начнут создавать собственные вертикальные модели, компании, занимающиеся универсальными моделями, рискуют быть сжатыми до уровня инфраструктуры: предоставляя базовые модели для вторичного обучения предприятиями и API для вывода результатов при решении универсальных задач, но теряя контроль над ценообразованием в самых прибыльных вертикальных сценариях применения.
Это похоже на эволюцию индустрии облачных вычислений.
AWS, Azure и GCP предоставляют инфраструктуру, но наиболее прибыльный слой SaaS-приложений занят вертикальными компаниями, такими как Salesforce, ServiceNow и Workday. Если индустрия ИИ пойдет по тому же пути, роль OpenAI и Anthropic может быть ближе к «AWS для ИИ», а не к «Salesforce для ИИ».
То, что Thomson Reuters доказала, потратив 40 миллионов долларов, заключается в следующем: когда у вас есть достаточно уникальные данные, вы можете с помощью небольшой части затрат достичь уровня общих моделей, обученных на десятки миллиардов долларов, в вашей области.
Как только эта логика будет подтверждена, каждая компания, владеющая собственными данными, пересчитает свои расходы: продолжать ежегодно платить OpenAI или Anthropic за API-доступ или потратить значительно меньшую сумму на обучение собственной полностью контролируемой специализированной модели?
Для рынка, привыкшего к нарративу «гонки вооружений в области ИИ», 40 миллионов долларов от Thomson Reuters — это сигнал в противоположном направлении. Следующий этап конкуренции в области ИИ может выиграть не компания с самыми высокими затратами на обучение, а та, у которой самые уникальные и незаменимые данные. Модели — это инструменты, данные — это барьеры.
