Thomson Reuters витрачає 40 млн доларів на навчання власної правової моделі ШІ

iconTechFlow
Поділитися
AI summary iconКороткий зміст
Thomson Reuters оголосила про інвестицію в 40 мільйонів доларів США на навчання своєї власної юридичної моделі штучного інтелекту Thomson. Модель, створена на основі юридичних, податкових та новинних даних фірми, демонструє високу ефективність у вузьких юридичних завданнях. Першим застосуванням є Tabular Analysis у CoCounsel Legal, а також легка версія на Hugging Face. Цей крок відбувається на тлі зростання вимог CFT та підвищеної уваги до ліквідності та криптовалютних ринків.

Автор: Xiao Bing

24 серпня Thomson Reuters оголосила про запуск власної великої мовної моделі «Thomson». Цей інформаційний гігант з річним доходом понад 7 мільярдів доларів США повідомив, що модель навчена на відкритій базі, загальні витрати склали близько 40 мільйонів доларів США (включаючи витрати на кадри та обчислювальні ресурси), а даними для навчання послужили база даних Westlaw, практичні керівництва Practical Law, платформа Checkpoint для податкових досліджень та новинні активи Reuters. Ранні оцінки показали, що Thomson демонструє результати, «рівні найсучаснішим передовим моделям», у кількох завданнях.

400 мільйонів доларів США — порівняйте: останній раунд фінансування OpenAI — 40 мільярдів доларів США, Anthropic зібрала більше 13 мільярдів, xAI отримала 6 мільярдів за один раунд. Передові лабораторії витрачають десятки мільярдів доларів на обчислювальну потужність для навчання універсальних моделей, тоді як Thomson Reuters використала менше ніж один нуль у цьому масштабі і створила в одній вертикальній галузі модель, яка, за їхніми словами, здатна зрівнятися з передовими.

Оригінальне твердження CTO Джоела Хрона: «Роками індустрія ШІ вважала масштаб відповіддю — більші моделі, більше обчислювальних потужностей, більше грошей. Thomson довів, що існує інший шлях: від міцної основи до глибокої спеціалізації для справжньо важливих завдань, щоб створити ефективний та повністю автономний інтелект».

Починається ера самостійної побудови ШІ для вертикальних галузей.

Що зробив Томсон?

Thomson, виходячи з відкритої основи (у повідомленні не вказано конкретну модель), впроваджує власні дані Thomson Reuters за допомогою проміжного навчання (mid-training) та пізнішого навчання (post-training).

У повідомленні зазначено, що наразі для навчання використано менше 10% власного контенту, і подальше дослідження нових спеціалізованих напрямків продовжиться. Сотні експертів у галузях брали участь у всьому процесі — від розробки цілей навчання до фінальної оцінки.

Першим сценарієм розгортання моделі є функція аналізу таблиць (Tabular Analysis) у CoCounsel Legal, призначена для юридичних фірм та корпоративних юридичних відділів. CoCounsel зберігає багатомодельну архітектуру: у сценаріях, де Thomson має очевидну перевагу, використовується Thomson, а в інших сценаріях продовжується використання зовнішніх передових моделей.

Thomson Reuters також опублікувала на Hugging Face «малу» відкриту версію для академічного та некомерційного використання та запрошує юристів та дослідників у галузі ШІ до незалежної оцінки.

Професор юридичного факультету Вашингтонського університету Джонатан Чой протестував Thomson, ChatGPT та Claude за допомогою складних питань з курсу корпоративного оподаткування і оцінив, що всі три моделі дали правильні відповіді, але він віддав перевагу відповідям Thomson, зокрема через посилання на правові джерела, що роблять відповіді більш прозорими та практичними.

40 мільйонів доларів США економіки

Це число — ключ до розуміння всієї справи.

Вартість навчання універсальних передових моделей зростає експоненційно. Meta витратила понад 16 тисяч GPU H100 на навчання Llama 3, а витрати на обчислювальні ресурси оцінюються в сотні мільйонів доларів США. Бюджети OpenAI та Google DeepMind ще вищі. Метою цих моделей є «вміння робити все» — від написання віршів до розв’язання диференціальних рівнянь, від програмування до ролевої гри.

Діяльність Thomson Reuters логічно відрізняється. Їй не потрібна модель, здатна робити все, їй потрібна модель, яка в чотирьох надто спеціалізованих галузях — правових дослідженнях, податковій відповідності, тлумаченні регуляторних вимог та аналізі професійних документів — досягає такого ж або навіть кращого рівня, як і універсальні передові моделі. Діапазон цієї мети значно вужчий, тому витрати на навчання набагато нижчі.

Але справжньою причиною, що зробила 40 мільйонів доларів можливими, є не звуження діапазону, а дані як активи.

База даних з правом Westlaw, що належить Thomson Reuters, охоплює понад 40 000 баз даних з судовими справами та понад 100 років прецедентів. Practical Law містить постійно оновлювані практичні посібники та шаблони, підготовлені більше ніж 650 юристами-редакторами. Checkpoint є стандартним інструментом для американських податкових фахівців. Новинний корпус Reuters охоплює всю планету та простягається на понад 175 років.

Ці дані не зібрані з інтернету.

Це власні активи, які були професійно відредаговані, анотовані, структуровані та постійно оновлюються. Моделі, навчені на таких даних, досягають у своїй спеціалізації точності та якості цитування, які загальні моделі важко змогли б відтворити за допомогою простого RAG (пошуково-посиланого генерування) або доналаштування. Загальні моделі можуть «підключитися» до цих даних, але підключення та «зростання» в них — це дві різні речі.

Thomson Reuters сама підкреслила цю різницю: вигода від спеціалізованого навчання не може бути замінена просто підключенням контенту.

Хто піде цим шляхом?

Thomson Reuters не буде єдиною. Дивлячись на ланцюжок «власні дані → вертикальна модель → нижчі витрати на висновування → кращий контроль над даними → вищий корпоративний валовий прибуток», принаймні кілька типів компаній мають умови для копіювання цієї моделі.

Фінансова інформаційна компанія. Bloomberg навчила BloombergGPT у 2023 році, використовуючи власні дані фінансових терміналів та новинні корпуси. Хоча подальших дій було не так багато, але дані Bloomberg Terminal мають такий самий рівень бар’єрів, як і Westlaw від Thomson Reuters — це власні набори даних, які будь-яка загальна модель не може легально отримати.

Професійні сервісні організації. Чотири величезні бухгалтерські фірми (PwC, Deloitte, EY, KPMG), великі юридичні альянси (наприклад, Baker McKenzie, Kirkland & Ellis) та медичні інформаційні компанії (наприклад, електронні медичні записи Epic Systems) мають величезний обсяг високоструктурованих, високозахищених професійних даних. Ці організації не бажають передавати дані клієнтів на обробку загальним моделям, але одночасно потребують використання ШІ для підвищення ефективності. Створення власних вертикальних моделей для них з точки зору відповідності нормам може бути не варіантом, а необхідністю.

Монополісти галузевих даних. MSCI володіє глобальними даними ESG-рейтингів та індексів, Verisk — даними щодо ціноутворення в страховій галузі та моделями ризиків, Wolters Kluwer — європейськими правовими та компліанси-даними, RELX — академічними журналами Elsevier та правовими даними LexisNexis. Спільна риса цих компаній: дані є ключовим активом, виключність даних — це їхній конкурентний перевага, а передача даних іншим для навчання їхніх моделей зменшує власну цінність.

Що це означає для OpenAI та Anthropic?

У оголошенні Thomson Reuters є деталь, яку легко не помітити: CoCounsel зберігає багатомодельну архітектуру. У сферах, де Thomson має перевагу, використовується Thomson, а в інших сценаріях продовжується використання зовнішніх моделей.

Це означає, що навіть компанії, які створили власні моделі, не повністю відмовляться від загальних моделей.

Загальні моделі все ще мають переваги в загальному висновку, генерації коду, багатомовній обробці тощо. Вертикальні моделі замінюють ту шар загальних моделей, який «достатній, але не досконалий» у конкретній галузі.

Але з довгострокової перспективи, якщо все більше високодоходних корпоративних клієнтів почнуть розробляти власні вертикальні моделі, компанії, що створюють універсальні моделі, ризикують бути зведені до інфраструктурного рівня: надавати базові моделі для подальшого навчання підприємствами та API для виведення результатів при вирішенні універсальних завдань, але втратити контроль над ціноутворенням у найприбутковіших вертикальних сценаріях застосування.

Це схоже на еволюцію індустрії хмарних обчислень.

AWS, Azure та GCP надають інфраструктуру, але найприбутковіший шар SaaS-застосунків займають вертикальні компанії, такі як Salesforce, ServiceNow та Workday. Якщо індустрія ШІ піде тим самим шляхом, роль OpenAI та Anthropic може бути ближчою до «AWS для ШІ», ніж до «Salesforce для ШІ».

Те, що Thomson Reuters витратила 40 мільйонів доларів США, довело: коли у вас є достатньо унікальні дані, ви можете досягти рівня загальних моделей, натренованих на десятки мільярдів доларів, за ціну, що становить лише частину від цієї суми.

Після підтвердження цієї логіки кожна компанія, що сидить на власних даних, перерахує витрати: продовжувати щорічно платити OpenAI чи Anthropic за API, чи витратити значно меншу суму на навчання власної вертикальної моделі, повністю під контролем?

Для ринку, який звик до історії «AI-змагання з озброєнням», 40 мільйонів доларів від Thomson Reuters є сигналом у протилежному напрямку. Наступний етап змагання в галузі штучного інтелекту може виграти не компанія з найвищими витратами на навчання, а та, хто має найунікальніші та найбільш незамінні дані. Моделі — це інструменти, а дані — це бар’єри.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.