Китайська життєва наука AI-модель GeneLLM виникає як «біологічний DeepSeek»

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про штучний інтелект і криптовалюту від MarsBit підкреслюють новий розвиток у сфері життєвих наук Китаю. Команда з чотирьох випускників Оксфорду розробила GeneLLM — багатоомічну велику модель від Jindu Life Sciences. Опублікована в Nature Communications та Advanced Science, модель використовує сирі омічні дані для попереднього навчання. З 1,5 мільярда параметрів і 3,5 трильйонами основних пар, вона спрямована на відкриття ліків, персоналізовану медицину та синтетичну біологію. Тренди даних про інфляцію залишаються ключовим фокусом для інвесторів, але цей прорив у галузі штучного інтелекту демонструє сильний імпульс у біотехнологічному просторі.

DeepSeek -V4-Flash офіційна версія щойно викликала хаос у світовому кругу універсальних великих моделей, і китайська версія Deepseek для життєвих наук відразу ж слідує за ним.

Недавно власний біологічний великий моделюючий інструмент GeneLLM для життєвих наук, розроблений Jin Du Sheng Ke (заснований чотирма вченими, що повернулися з Оксфордського університету), був опублікований у міжнародних провідних наукових журналах — «Nature Communications» та «Advanced Science».

GeneLLM — це перша у світі багатоомічна велика модель, навчена безпосередньо на сирових даних оміки, і вона є наступним важливим кроком після AlphaFold від Google та EVO 2 від Стенфордського університету. Вона заповнює прогалину у сфері базових великих моделей для життєвих наук у Китаї і є китайською версією Deepseek у життєвих науках, дозволяючи ШІ розуміти кілька «мов» життя та всю «систему» цілком.

Jindu Shengke

Jindu Shengke

Jindu Shengke

Передбачати наступне повідомлення життя, як передбачати наступний токен

Розпізнавання хвороб — це лише один із сценаріїв застосування GeneLLM; справжньою метою JinDu Bioscience є створення «Claude Code» для галузі біологічних наук.

ChatGPT, Claude, DeepSeek Серцем великих мовних моделей є прогнозування наступного токена.

Ідея GeneLLM схожа, але вона передбачає не текст, а інформацію про життя.

Чотири основи в РНК — аденін (A), урацил (U), гуанін (G), цитозин (C) — стають базовими токенами, які GeneLLM використовує для розуміння мови життя.

Традиційний біоінформатичний аналіз зазвичай залежить від анотації генів, зіставлення послідовностей та ручного визначення міток. Хоча цей метод точний, він заздалегідь обмежує діапазон розуміння моделі та може призвести до втрати великої кількості невідомих біологічних сигналів, прихованих у сирій даній.

GeneLLM вибрав інший підхід, навчаючись життєвим закономірностям безпосередньо з необроблених сирових данних секвенування.

Він використовує сирові дані багатоомісних даних, таких як транскриптом, протеом, метаболом тощо, як навчальні дані, щоб дозволити моделі самостійно виявляти патерни, пов’язані з хворобами.

На даний момент GeneLLM завершив попереднє навчання моделі з 1,5 мільярда параметрів та 3,5 трильйона послідовностей основ, а версія XLarge досягла попереднього навчання моделі з 30 мільярдами параметрів, постійно розширюючи технологічний бар’єр.

Як перша у світі багатоомічна велика модель, натренована на сиріх секвенувальних даних, GeneLLM включає два етапи:

(1) Безнаглядне попереднє навчання та розробка прототипів

(2) Налаштування за рівнем пацієнта (Disease Tuning)

Jindu Shengke

GeneLLM спочатку має вирішити проблему:

Як перетворити складні дані про життя на мову, зрозумілу для ШІ?

У обробці природної мови алгоритм BPE розбиває речення на токени; GeneLLM розбиває фрагменти РНК-секвенування довжиною приблизно 150 пар основ за допомогою ковзного вікна з 7 основ (7-mer) на біологічні токени.

Потім модель використовує архітектуру Transformer для прямого прогнозування наступного основного елемента без геномних анотацій та штучних міток.

Це означає, що ІШ не спочатку переглядає «словник», підготовлений людьми, а навчається безпосередньо з первісних сигналів життя.

Під час навчання GeneLLM обробив приблизно десятки трильйонів RNA reads на кластері зі стотисячними GPU NVIDIA A100.

На цьому етапі загальні здібності GeneLLM почали «виявлятися».

Як важливий інноваційний прорив у галузі біологічних наук, геномна модель GeneLLM, розроблена в країні, може застосовуватися в таких сферах, як розробка нових ліків, персоналізована медицина, синтетична біологія, моніторинг навколишнього середовища, мікробіологія та біологічне сільське господарство, проектування білків та молекул, і є однією з небагатьох глобальних моделей, які успішно реалізовані на практиці.

Jindu Shengke

Після того як ми розглянемо інновації GeneLLM у таких фундаментальних аспектах, як «дані, архітектура, навчання», ми зможемо справді зрозуміти: чому він є китайською «біологічною версією DeepSeek ».

Сіліконова долина склала трильйони параметрів з десятками тисяч H100, DeepSeek За допомогою інновацій у алгоритмах для підвищення ефективності обчислень, GeneLLM також ефективно використовує мільярди даних у сфері життєвих наук.

Якщо AlphaFold дозволив ШІ вперше зрозуміти «структуру» життя, а EVO2 — почати розуміти «код» життя, то GeneLLM намагається глибше зрозуміти «систему» життя.

Jindu Shengke

Ще більш вражаючою є ефективність. Традиційні методи залежать від глибокого секвенування об’ємом 6 Гб, що призводить до високих витрат і ускладнює практичне застосування. GeneLLM зберігає AUC > 0,8 навіть при надзвичайно малий глибині 1 Гб (зменшення витрат на 83%).

Це означає, що справжній потенціал зробити персоналізовану медичну допомогу доступною для всіх стає реальністю.

З’являється нова наукова парадигма: дозволити ШІ вчитися на біологічних даних, щоб ввести життєві науки у нову еру передбачуваності, обчислюваності та масштабованого дослідження.

Не лише модель, а й інтелектуальна інфраструктура «останнього кілометра»

Але стратегія Jindu Shengke не обмежується базовими моделями.

На основі багатоомічної моделі GeneLLM компанія JinDu Bioscience створює виконавчу систему, що з’єднує штучний інтелект і фізичний світ, забезпечуючи повний цикл AI for Science — від розуміння законів життя та генерації наукових гіпотез до автоматизованого експериментального підтвердження та постійної ітеративної оптимізації за допомогою інтелектуального рівня виконання експериментів Harness та циклу даних DBTL (Design-Build-Test-Learn).

Як сказав Ліам Федус, колишній віце-президент OpenAI та керівник навчання, сучасні LLM вичерпали обмежені текстові та кодові ресурси інтернету, і подальші значні наукові досягнення повинні залежати від експериментальних ітерацій.

Jindu Shengke

Тобто не можна лише залежати від читання вже написаного людьми, щоб відкривати нові знання — ІМ повинні проводити експерименти самостійно.

Але виникає питання —

Інтернет-сервіси мають вбудовані API, а інформація в мережі є цифровою за природою, але наукове обладнання виробляється різними виробниками, має різні протоколи, є складним і дорогим, і ніхто не може за кілька місяців зруйнувати його та побудувати з нуля.

Сьогодні більшість лабораторій створені для людей: панелі приладів, рухи піпетування, стан зразків, миттєві рішення — майже ніщо з цього не перетворюється на сигнали, зрозумілі для машин.

Штучний інтелект увійшов у лабораторію, і зараз проблема не лише в здатностях моделей, а й у необхідності нової інфраструктури.

Тому штучний інтелект входить у лабораторію, і зараз проблема не лише в здатностях моделей, а й у фізичному харнессі: перетворити лабораторію на систему, яку можна компілювати, планувати, спостерігати та відстежувати.

Це й є справжній останній кілометр AI4S.

BioFord Harness, щоб лабораторія почала «діяти сама»

Для цього Цзіньду розробив систему під назвою BioFord Harness.

Це інфраструктура, що з’єднує ШІ з фізичними лабораторіями.

Вони не намагалися за допомогою роботизованої руки імітувати людську руку, а перетворили лабораторію на систему, яку можна компілювати, планувати, спостерігати та відстежувати.

У цьому процесі фізичний Harness повинен виконати щонайменше три завдання:

1. Компілюйте науковий намір або DSL експерименту в інструкції, здатні виконуватися різними пристроями;

2. Виконуйте планування, управління ресурсами та безпековими обмеженнями між кількома пристроями та обробляйте виняткові ситуації;

3. Поверніть результати експериментів, журнали обладнання та параметри середовища як вхідні дані для наступного циклу моделювання та проектування експериментів.

Наукове питання → Розуміння ШІ → Експериментальний план → Планування обладнання → Виконання → Повернення даних → Оптимізація моделі → Наступний цикл.

Так запустився маховик наукових експериментальних даних.

Jindu Shengke

П’ять інтелектуальних агентів перетворили науковий процес на конвеєр

Біофорд Агент — це платформа для наукових досліджень з вбудованою штучною інтелектуальною системою, яка з’єднує фізичний рівень лабораторій з когнітивним рівнем вчених, а між ними — фізичний ІІ, що усуває розрив між міркуванням та виконанням.

На когнітивному рівні BioFord Agent складається з п’яти агентів, що утворюють спільну мережу, яка об’єднує всі етапи досліджень у галузі біології та може збільшити наукову ефективність у кілька разів.

Агент пошуку літератури

Агент для проектування експериментів

Наукові агенти

Експериментальний планувальник агентів

Агент для аналізу даних

Наприклад, інтелектуальний агент для пошуку літератури може швидко допомогти вам знайти та прочитати велику кількість наукових праць, підготувати огляд літератури та допомогти сформулювати гіпотези.

Jindu Shengke

Інтелектуальний агент для проектування експериментів скоротив цикл проектування експериментів для наукових команд з кількох місяців до тижня.

Експериментальний оркестратор, запущений JinDu Shengke, на основі універсального абстрактного рівня приладів (Universal Instrument Abstraction Layer) подолав протокольні бар’єри між різними типами гетерогенних пристроїв.

Як PCR-апарати, так і ензимні імунно-асоційовані детектори, потокові цитометри, а також автоматизовані роботизовані станції для піпетування можуть бути об’єднані та координовані єдиною системою. Система має вбудований динамічний алгоритм планування, який автоматично масово розподіляє завдання, уникнути конфліктів у реальному часі та повністю фіксує параметри експерименту, формуючи відстежуваний аудиторський ланцюжок.

Jindu Shengke

Це означає, що ІІ більше не обмежується етапом «надання порад», а справді входить у лабораторію, керує обладнанням та виконує завдання, стаючи надійним «науковим асистентом».

Помилкові дані, можливо, цінніші, ніж дані про успіх

Глибша цінність цієї системи полягає в тому, що кожен експеримент — незалежно від того, чи він успішний, чи ні — перетворюється на дані, які система може обробити.

У традиційній лабораторії один невдалий результат може бути лише одним рядком «результат не відповідає очікуванням», досвід зберігається в голові людини, і коли людина йде, досвід теж зникає.

У системі BioFord кожна невдача — це цінні навчальні дані — логіка вибору параметрів, запис умов середовища, докази неправильних шляхів… все це накопичується, стаючи частиною «досвіду» системи.

Наступного разу штучний інтелект знатиме: цей шлях не проходить.

Цікаво, що в цьому сегменті не перемагає найпотужніший хешрейт, ні найбільша модель.

Обчислювальну потужність можна купити, але наукові дані — ні.

Засновник і генеральний директор Jin Du Sheng Ke Джин Юнчэн сказав: «У процесі розробки ми поступово зрозуміли, що AI for BioScience — це не просто накопичення моделей і даних. Для тих, хто проводить експерименти, кінцевою метою залишається вирішення проблеми: після розрахунків не вдається зробити експеримент, а якщо його зробити — він виходить неправильним».

Це — найважливіша та найскладніша для копіювання перевага в секторі AI4S.

Чотири оксфордці, серед яких — однокурсник Ло Фулі

У 2022 році Кім Йон Сон стояв перед вибором у момент отримання докторського ступеня з біоінженерії в Оксфордському університеті.

Його наставник — член Королівського товариства Великобританії та засновник британської публічної компанії Oxford Nanopore, лідера у галузі третього покоління секвенування, — Хаган Бейлі; у лабораторії глибоко коріниться традиція «реалізації результатів». Залишитися у Великобританії — це чіткий шлях.

Але він обрав інший шлях — взяв «прототипну технологію» з лабораторії, поклав її у валізу і привіз до країни. Разом з ним були троє однокурсників з Оксфорду: доктор біології Ден Сівей, старший науковий співробітник комп’ютерного відділу Ша Лей (доктор комп’ютерних наук з Пекінського університету, старший брат по лабораторії Ло Фулі, керівника великої моделі Xiaomi), а також Чжоу Тяньяо, фахівець з реалізації продуктів. У четвірки були знання в галузях біоінженерії, штучного інтелекту, обчислювальної біології та бізнес-операцій — кожен був незамінний. Вони раніше об’єднувалися для спільних наукових проектів, поєднуючи ШІ та транскриптомну технологію для прогнозування та діагностики захворювань. Чотири людини, як шматочки пазлу, ідеально доповнювали один одного й могли виконувати високоступеневі міждисциплінарні дослідження.

Назва компанії «Цзіньду Шенке»: «Цзінь» походить від Оксфорду, символізуючи їхній початок з найкращих лабораторій Оксфорду та інших академічних центрів, а «ду» означає допомогти іншим — це, як вони вважають, його кінцева мета: AI for Science.

Наразі фізична AI-платформа BioFord Agent компанії Jin Du Sheng Ke вже запущена в кількох відомих університетах країни, що значно скоротило науковий цикл — з кількох місяців до одного тижня.

Вітер піднявся: 4 раунди фінансування за рік — капітал «справді смачний»

Проте, йти шляхом, якого ніхто раніше не брав, неодмінно супроводжується самотністю.

На початку підприємництва було багато труднощів. Тоді стартапи в галузі ШІ розквітали, але спроби застосування «ШІ+» у сфері біологічних наук були майже відсутні. «Ті, хто розуміє ШІ, не обов’язково розуміють біологічні науки, а більшість тих, хто розуміє біологічні науки, не розуміють ШІ».

Ким Йон Сон відкрито сказав: «Інвестори спочатку не могли зрозуміти, чим ми займаємося».

Команда вибрала «найважчий шлях»: почати з великої біологічної моделі, таких компаній у світі на цьому напрямку — лише кілька.

У 2025 році з’явилася зміна.

Тоді Рада міністрів випустила «Міркування щодо глибокого впровадження ініціативи «Штучний інтелект +»», де AI for Science було включено, і на ринку почався підйом.

Цзіньду Шенкє створив рекорд — «чотири раунди фінансування за рік». Основні дати фінансування компанії є еталоном для галузі.

Ангел+цикл: отримав лідерське фінансування від Seed Fund China Sequoia;

Пре-А+ раунд: керівне інвестування в розмірі десятків мільйонів від Chuangdong Investment;

Пре-А+ раунд: отримано інвестиції в розмірі десятків мільйонів від Nanshan Zhanxin Tou;

Раунд A: отримав лідерське інвестування в розмірі майже 100 мільйонів юанів від Gao Tejia Investments.

Виконавчий партнер Gaojia Investments Тен Юйхан сказав: «Jindu Bioscience перетворила фундаментальні дослідження в галузі життєвих наук на підписну, масштабовану інфраструктуру „обчислювальна потужність + експеримент“».

А мета Цзин Янчена ще далі: «Нам недостатньо просто продавати програмне забезпечення — ми хочемо створити інтелектуальну операційну систему для галузі життєвих наук. Як Intel визначила обчислювальну потужність ери ПК, ми хочемо визначити нову парадигму досліджень у життєвих науках у еру ШІ».

Від Оксфордської лабораторії до Шенчжена, від повної нерозуміння до підтримки ведучих інвестиційних капіталів — історія чотирьох випускників Оксфорду — це не просто історія підприємництва, а глибоке питання: «Що ми можемо зробити для людства?»

Коли ШІ навчиться самостійно «працювати нічами» в наукових дослідженнях, наукові відкриття можуть більше не залежати від випадкового геніального інсайту, а стати передбачуваними та необхідними. Цей шлях вони лише почали.

Індустріальна карта: Цзіньду вибрав шлях легковаго фізичного ІІ

На більшій карті AI для біонаук Тінджу не одинокий, але точка входу абсолютно інша.

Перший тип — це AI-вчені з цифрового сегменту.

Biomni, інкубована Стенфордом (вже комерціалізована як Phylo), має понад 150 професійних інструментів для автоматизації систематичних оглядів літератури, генерації гіпотез та біоінформатичного аналізу.

FutureHouse, підтримувана Еріком Шмідтом, присвячена створенню AI-вчених, які можуть самостійно генерувати гіпотези та писати наукові статті.

Проте, хоча вони потужні, вони все ще обмежені цифровим світом.

Другий тип — це повністю автономний підхід.

Ching Tai Technology має понад 300 робочих місць, розгорнутих по всьому світу за допомогою «ШІ + робототехніки».

Lila Sciences, інкубована Flagship Pioneering, зібрав 5,5 млрд доларів США, намагаючись повністю передати AI проектування, виконання та перепроектування експериментів, з метою створення «наукового суперінтелекту».

Але всі ці речі занадто витратні.

Третій тип — це енд-ту-енд маршрутизування.

Insilico Medicine безпосередньо інтегрує ШІ у власні інноваційні фармацевтичні лінійки, перший ШІ-лік вже перейшов до III фази клінічних випробувань, але вони — «будівники автомобілів», а не «ремонтники доріг».

Вибір Цзіньду Шенкэ: зосередитися на створенні фізичного Harness як інфраструктури для «останнього кілометра» між моделями та фізичними експериментальними системами.

Не брати участь у боротьбі за основу, не створювати енд-ту-енд лінійки, не бути виключно цифровим AI-вченим. Зробити лише ту одну кілометр — це, безумовно, більш легкий підхід.

Кім Ін Сон чітко сформулював це твердження: «Справжнім переломним моментом для AI for Science є не те, наскільки модель відповідає як вчений, а чи може лабораторія почати працювати як система неперервного навчання.»

Крім того, у сфері глобального AI for Science JinDu не обмежується просто «виконанням останнього кілометра».

Точніше, він входить у останній кілометр, борючись за контроль над усім науковим робочим процесом.

У порівнянні з чисто цифровими вченими-штучним інтелектом, він може взаємодіяти з фізичним світом; у порівнянні зі створенням власних наукових заводів з великою капіталоємністю, він має можливість прийняти на себе керівництво вже існуючими лабораторіями клієнтів; у порівнянні з компаніями з енд-ту-енд штучним інтелектом для фармацевтики, йому не потрібно покладати свою долю на якусь одну клінічну лінію.

Jindu Shengke

Його справжнім конкурентним перевагою буде не кількість параметрів, а постійно накопичувані експериментальні траєкторії, інтерфейси обладнання, досвід невдач та мережі виконання між лабораторіями.

Як сказав Кім Йонсун, десятки тисяч сигнальних шляхів у біологічних організмах і невідомі механізми реакцій надзвичайно захоплюють. «Наскільки багатою є біологія, настільки ж прекрасним є майбутнє AI for Science.»

З допомогою інтелекту ШІ досліджуючи таємниці життя, ця група оксфордських відмінників лише починає свій шлях до зіркових морів.

Цей матеріал з іншого каналу WeChat «Новий розум», автор: Новий розум; редагування: Aeneas KingHZ

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.