DeepSeek -V4-Flash официальная версия только что произвела сенсацию в мире универсальных крупных моделей, и вслед за ней сразу же появилась китайская версия Deepseek для жизненных наук.
Недавно собственная многомодальная языковая модель для生命科学 GeneLLM, разработанная Jin Du Sheng Ke (основанная четырьмя выпускниками Оксфордского университета), была опубликована в международных ведущих научных журналах — «Nature Communications» и «Advanced Science».
GeneLLM — это первая в мире многогеномная языковая модель, предварительно обученная на исходных данных омиксных исследований. После AlphaFold от Google и EVO 2 от Стэнфордского университета, GeneLLM заполняет пробел в области фундаментальных крупномасштабных моделей для жизни в Китае и может считаться китайской версией Deepseek для биологических наук, позволяя ИИ начать понимать несколько «языков» жизни и всю «систему» в целом.



Предсказывайте следующую жизнь, как будто предсказываете следующий токен
Распознавание заболеваний — это лишь одно из применений GeneLLM; настоящей целью JinDu Life Science является создание «Claude Code» для области биологических наук.
ChatGPT, Claude, DeepSeek Основой крупных языковых моделей является предсказание следующего токена.
Идея GeneLLM похожа, но она предсказывает не текст, а биологическую информацию.
Четыре основания в РНК-последовательности — аденин (A), урацил (U), гуанин (G), цитозин (C) — становятся базовыми токенами, с помощью которых GeneLLM понимает язык жизни.
Традиционный биоинформатический анализ обычно опирается на аннотацию генов, выравнивание последовательностей и ручное определение меток. Хотя этот метод точен, он заранее ограничивает познавательные возможности модели и может привести к потере большого количества скрытых биологических сигналов, содержащихся в исходных данных.
GeneLLM идет другим путем, непосредственно изучая законы жизни из необработанных исходных данных секвенирования.
Он использует исходные данные мультиомики, такие как транскриптом, протеом, метаболом и другие, в качестве обучающих данных, чтобы модель самостоятельно выявляла паттерны, связанные с заболеваниями.
На данный момент GeneLLM завершил предварительное обучение модели с 15 миллиардами параметров и 3,5 триллионами базовых последовательностей, а версия XLarge достигла предварительного обучения модели с 30 миллиардами параметров, продолжая расширять технологическое преимущество.
Являясь первой в мире многомодальной языковой моделью, предварительно обученной на исходных секвенционных данных, GeneLLM включает два этапа:
(1) Безнадзорное предварительное обучение и поиск прототипов
(2) Тонкая настройка по уровням пациентов (Disease Tuning)

GeneLLM сначала должен решить одну проблему:
Как превратить сложные данные о жизни в язык, понятный ИИ?
В обработке естественного языка алгоритм BPE разбивает предложения на токены; GeneLLM разделяет фрагменты РНК-секвенирования длиной около 150 пар оснований на биологические токены с помощью скользящего окна из 7 оснований (7-mer).
Затем модель использует архитектуру Transformer для прямого предсказания следующего основания без аннотаций генов и ручных меток.
Это означает, что ИИ не сначала изучает «словарь», подготовленный людьми, а учится непосредственно из первичных сигналов жизни.
В процессе обучения GeneLLM обработал около десятков триллионов RNA reads на кластере из сотен GPU NVIDIA A100.
На этом этапе способности обобщения GeneLLM начинают «возникать».
Как значительный инновационный прорыв в области биотехнологий, китайская биологическая модель GeneLLM может применяться в таких областях, как разработка новых лекарств, персонализированная медицина, синтетическая биология, мониторинг окружающей среды, микробиология и биологическое сельское хозяйство, проектирование белков и молекул, и является одной из немногих моделей в мире, успешно реализованных в реальных сценариях.

После того как мы рассмотрели инновации GeneLLM в таких фундаментальных аспектах, как «данные, архитектура, обучение», мы сможем по-настоящему понять: почему он представляет собой «биологическую версию» Китая DeepSeek ».
Силиконовая долина складывает триллионы параметров из десятков тысяч H100, DeepSeek За счет инноваций в алгоритмах для повышения эффективности вычислительной мощности GeneLLM также легко смещает многомиллиардные объемы данных в области биологических наук.
Если AlphaFold позволил ИИ впервые понять «структуру» жизни, а EVO2 заставил ИИ начать понимать «код» жизни, то GeneLLM пытается глубже понять «систему» жизни.

Еще более впечатляющей является эффективность. Традиционные методы зависят от глубокого секвенирования на 6 Гб, что сопряжено с высокими затратами и затрудняет внедрение. GeneLLM сохраняет AUC > 0,8 даже при крайне низкой глубине секвенирования 1 Гб (сокращение затрат на 83%).
Это означает, что универсальная точная медицина действительно может стать реальностью.
Формируется новая научная парадигма: позволить ИИ учиться на данных о жизни, чтобы перевести жизнь на новую стадию — предсказуемую, вычисляемую и масштабируемую.
Это не просто модель, а интеллектуальная инфраструктура «последнего километра»
Но стратегия Jin Du Sheng Ke не ограничивается базовыми моделями.
На основе многомодельной модели GeneLLM для понимания жизни, JinDu Bioscience создает исполнительную систему, соединяющую ИИ-интеллект с физическим миром, обеспечивая полный цикл AI for Science — от понимания законов жизни и генерации научных гипотез до автоматизированной экспериментальной проверки и непрерывной итеративной оптимизации через интеллектуальный экспериментальный уровень Harness и цикл данных DBTL (Design-Build-Test-Learn).
Как сказал Лиям Федус, бывший вице-президент OpenAI и руководитель по обучению, текущие МО уже исчерпали ограниченные текстовые и кодовые ресурсы интернета, и дальнейшие значительные научные достижения будут зависеть от экспериментальных итераций.

То есть нельзя обнаруживать новые знания только за счет чтения того, что уже написали люди; ИИ должен проводить эксперименты самостоятельно.
Но возникает вопрос —
Интернет-сервисы изначально имеют API, а сетевая информация изначально цифровая, но научное оборудование поступает от разных производителей, использует разные протоколы, оно сложное и дорогое, и никто не может за несколько месяцев полностью перестроить его.
Сегодня большинство лабораторий созданы для людей: панели приборов, действия с пипетками, состояние образцов, принятие решений на месте — большинство из этого не превращается в машиночитаемые сигналы.
ИИ входит в лабораторию, и сейчас речь идет не только о способностях моделей, но и о необходимости новой инфраструктуры.
Таким образом, ИИ входит в лабораторию, и сейчас речь идет не только о способностях моделей, но и о физическом харнессе: превращении лаборатории в систему, которую можно компилировать, планировать, отслеживать и отслеживать.
Это и есть настоящий последний километр AI4S.
BioFord Harness, заставляя лаборатории начать «действовать самостоятельно»
For this, Jindu developed a system called BioFord Harness.
Это инфраструктура, объединяющая ИИ и физические лаборатории.
Они не заставляли роботизированные руки имитировать человеческие руки, а превратили лабораторию в систему, которая может быть скомпилирована, запланирована, наблюдаема и прослеживаема.
В этом процессе физический Harness должен выполнить как минимум три задачи:
1. Скомпилировать научные цели или DSL эксперимента в инструкции, которые могут выполняться различными устройствами;
2. Управление расписанием, ресурсами и ограничениями безопасности между несколькими устройствами, а также обработка исключений;
3. Возвращайте результаты экспериментов, журналы оборудования и параметры среды в качестве входных данных для следующего цикла моделирования и проектирования экспериментов.
Научная проблема → Понимание ИИ → Экспериментальный план → Распределение оборудования → Выполнение → Обратная связь данных → Оптимизация модели → Следующий цикл.
Так был запущен вращающийся маховик научных экспериментальных данных.

Пять интеллектуальных агентов превратили научный процесс в конвейер
Биофорд Агент — платформа для научных исследований с использованием встраиваемого ИИ, которая соединяет физический уровень лабораторий с когнитивным уровнем ученых, используя физический ИИ для устранения разрыва между рассуждением и выполнением.
На когнитивном уровне агент BioFord состоит из пяти интеллектуальных агентов, образующих координационную сеть, которая охватывает весь цикл исследований в области биологических наук и позволяет повысить эффективность научной работы в несколько раз.
Агент для поиска литературы
Экспериментальный дизайн-агент
Scientific agents
Экспериментальный планировщик агентов
Агент для анализа данных
Например, агент для поиска литературы может быстро помочь вам найти и изучить огромное количество научных работ, составить обзор литературы и поддержать формулирование гипотез.

Экспериментальный дизайн-агент сократил для исследовательской команды цикл проектирования экспериментов с нескольких месяцев до одной недели.
Экспериментальный оркестратор, представленный Цзиньду Шэнкэ, основан на универсальном абстрактном уровне оборудования (Universal Instrument Abstraction Layer) и преодолел протокольные барьеры между различными типами гетерогенных устройств.
Как ПЦР-амплификаторы, микропланшетные детекторы, потоковые цитометры, так и автоматизированные станции для пипетирования могут быть унифицированно управляемы и распределены. Система содержит встроенный алгоритм динамического планирования, который автоматически выполняет массовое планирование, предотвращает конфликты в реальном времени и полностью регистрирует параметры эксперимента, формируя прослеживаемую аудиторскую цепочку.

Это означает, что ИИ больше не ограничивается этапом «предложения идей», а действительно проникает в лаборатории, управляет оборудованием и выполняет задачи, становясь надежным «научным ассистентом».
Неудачные данные, возможно, ценнее успешных данных
Более глубокая ценность этой системы заключается в том, что каждый эксперимент — будь он успешным или неудачным — превращается в данные, которые система может обработать.
В традиционной лаборатории неудачный результат может быть зафиксирован всего одной строкой «результат не соответствует ожиданиям», а опыт хранится в голове человека — и когда человек уходит, опыт исчезает.
В системе BioFord каждая неудача становится ценными обучающими данными — логика выбора параметров, запись условий среды, доказательства неверных путей… всё это накапливается и становится частью «опыта» системы.
Следующий раз ИИ будет знать: этот путь невозможен.
Интересно, что в этом сегменте побеждает не тот, у кого самая высокая вычислительная мощность, и не тот, у кого самая крупная модель.
Вы можете купить вычислительную мощность, но не можете купить научные данные.
Основатель и генеральный директор Jin Yongseong заявил: «В процессе разработки мы постепенно поняли, что применение ИИ в бионауке — это не просто накопление моделей и данных. Для тех, кто проводит эксперименты, окончательной целью остается преодоление трудностей, когда после расчетов невозможно провести эксперимент, а проведенный эксперимент оказывается неверным».
Это — самая важная и最难被复制的护城河 в секторе AI4S.
Четыре оксфордца, среди которых — старший брат по лаборатории Ро Фули
В 2022 году, получив докторскую степень в биоинженерии в Оксфордском университете, Ким Ён Сон столкнулся с выбором.
Его наставник — член Королевского общества Великобритании и основатель британской публичной компании Oxford Nanopore, лидера в области третьего поколения секвенирования, Хаган Бейли; в лаборатории глубоко укоренилась традиция реализации результатов. Остаться в Великобритании — это ясный и ровный путь.
Он выбрал другой путь — взял «прототипную технологию» из лаборатории, упаковал её в чемодан и привёз в страну. С ним путешествовали три однокурсника из Оксфорда: доктор биологии Дэн Сивэй, доцент компьютерного факультета Ша Лэй (доктор компьютерных наук из Пекинского университета, старший товарищ по лаборатории Ло Фули, руководителя крупной языковой модели Xiaomi), а также Чжоу Тяньяо, специалист по внедрению продуктов. У всех четверых был опыт в биоинженерии, искусственном интеллекте, вычислительной биологии и коммерческой эксплуатации — каждый из них был незаменим. Ранее они сотрудничали в рамках совместных научных проектов, используя сочетание ИИ и транскриптомных технологий для прогнозирования и диагностики заболеваний. Четверо людей идеально дополняли друг друга, как кусочки пазла, и могли успешно проводить междисциплинарные исследования.
Название компании «Цзиньду Шэнкэ»: «Цзинь» взято из «Оксфорд» и символизирует их отправную точку — передовые академические лаборатории Оксфорда; «Ду» означает «помогать другим», что, по их мнению, является конечной целью AI for Science.
В настоящее время физическая ИИ-платформа BioFord Agent компании Jin Du Sheng Ke уже внедрена в нескольких известных китайских университетах и показала значительные результаты, сократив научно-исследовательский цикл с нескольких месяцев до одной недели.
Ветер поднялся: четыре раунда финансирования за год — капитал на месте «правда вкусно»
Однако путь, который никто не прокладывал раньше, неизбежно сопровождается одиночеством.
На начальном этапе предпринимательства возникло множество трудностей. Тогда стартапы в области ИИ были в разгаре, но попытки применения «ИИ+» в области биологических наук были крайне редки. «Те, кто понимают ИИ, не обязательно разбираются в биологических науках, а большинство тех, кто разбирается в биологических науках, не понимают ИИ».
Ким Ён Сон честно признал: «Инвесторы некоторое время не могли понять, чем мы занимаемся.»
Команда выбрала «самый сложный путь»: начать с биологической базовой модели, таких компаний в мире всего несколько.
В 2025 году произошел перелом.
В то время Государственный совет выпустил «Мнения о глубоком внедрении инициативы «Искусственный интеллект +»», в которых AI for Science была включена в список, и рынок начал развиваться.
Цзиньду Шэнчуань установил рекорд «четыре раунда финансирования за один год». Основные этапы финансирования компании являются эталоном для отрасли.
Angel + Round: Led by Sequoia Capital China Seed Fund;
Pre-A+ раунд: лидирующее инвестирование в размере десятков миллионов от Chuangdong Investment;
Предварительный раунд A+: получено инвестиции в размере десятков миллионов от Nanshan Zhanxin Tou;
Раунд A: возглавляемое Gao Te Jia инвестиции на сумму почти 100 миллионов юаней.
Исполнительный партнер Gaojia Capital Тэн Юйхан сказал: «Jindu Bioscience превратила фундаментальные исследования в области биологии в подписную и масштабируемую инфраструктуру «вычислительная мощность + эксперименты».»
А цель Цзинь Юнчэн еще более амбициозна: «Нам недостаточно просто продавать программное обеспечение — мы хотим создать интеллектуальную операционную систему для области жизни и наук о здоровье. Как Intel определила вычислительную мощность в эпоху ПК, мы хотим определить новую парадигму исследований в области жизни и наук о здоровье в эпоху ИИ.»
От Оксфордской лаборатории до Шэньчжэня, от полного непонимания до поддержки ведущих капиталов — история четырех оксфордцев — это не просто легенда о предпринимательстве, а глубокий вопрос: «Что мы можем сделать для человечества?»
Когда ИИ научится самостоятельно «работать всю ночь» над научными исследованиями, научные открытия могут больше не зависеть от случайных вдохновений гениев, а стать предсказуемой необходимостью. Этот путь они только начали.
Отраслевая карта: Цзиньду вышел на путь легковесной физической ИИ
На более широкой карте ИИ для бионауки Цзиньду не одинок, но точка входа совершенно иная.
Первый тип — это AI-ученые в цифровой сфере.
Biomni, инкубированная Стэнфордом (коммерциализированная как Phylo), обладает более чем 150 профессиональными инструментами для автоматизации систематических обзоров литературы, генерации гипотез и биоинформатического анализа.
FutureHouse, поддерживаемая Эриком Шмидтом, стремится создать AI-ученых, способных самостоятельно генерировать гипотезы и писать научные статьи.
Однако, несмотря на свою мощь, они остаются ограниченными цифровым миром.
Второй тип — это полный самостоятельный подход.
Кристалл Технолоджис развернула более 300 рабочих станций по всему миру с использованием технологии «ИИ + робототехника».
Lila Sciences, инкубированная Flagship Pioneering, привлекла 550 миллионов долларов США, стремясь позволить ИИ полностью взять на себя проектирование, выполнение и повторное проектирование экспериментов, с целью создания «научного суперинтеллекта».
Но все это слишком дорого.
Третий тип — это конец-в-конец маршруты с управлением.
Insilico Medicine напрямую интегрирует ИИ в собственные инновационные фармацевтические программы: первый ИИ-препарат уже перешел на третью фазу клинических испытаний, но они — «строители автомобилей», а не «ремонтники дорог».
А выбор Цзиньду Шэнкэ — сосредоточиться на создании физической Harness как инфраструктуры для «последнего километра» между моделями и физическими экспериментальными системами.
Не участвовать в гонке за базовую платформу, не строить энд-ту-энд конвейеры, не быть AI-ученым исключительно в цифровом мире. Сфокусироваться только на этом последнем километре — это явно более легкий подход.
Джин Ён Сон четко сформулировал это суждение: «Настоящим переломным моментом для ИИ в науке является не то, насколько точно модель имитирует ученых, а способна ли лаборатория начать функционировать как система непрерывного обучения».
Кроме того, в области глобального ИИ для науки Цзиньду не просто «занимается только последним километром».
Более точно, оно использует последнюю милю в качестве входа, чтобы бороться за контроль над всей научной рабочей процедурой.
В отличие от чисто цифровых ученых-исследователей ИИ, он может взаимодействовать с физическим миром; в отличие от самостоятельного создания научных заводов с высокими капитальными затратами, он имеет возможность взять под контроль уже существующие лаборатории клиентов; в отличие от компаний ИИ для разработки лекарств с полным циклом, ему не нужно связывать свою судьбу с какой-либо одной клинической линией.

Его настоящим конкурентным преимуществом станет не количество параметров, а накопленные экспериментальные траектории, интерфейсы оборудования, опыт неудач и сети выполнения между лабораториями.
Как сказал Ким Ён Сон, десятки тысяч сигнальных путей в живых организмах и неизвестные механизмы реакций вызывают восхищение. «Насколько богата биология, настолько прекрасны перспективы AI for Science.»
С помощью интеллекта ИИ они исследуют тайны жизни — звезды и океаны этих оксфордских талантов только начинают раскрываться.
Эта статья взята из официального аккаунта WeChat «Новознание», автор: Новознание; редактор: Aeneas KingHZ
