中国のライフサイエンスAIモデル「GeneLLM」が「生物学的DeepSeek」として登場

icon MarsBit
共有
AI summary icon概要
MarsBitのAI+暗号通貨ニュースでは、中国のライフサイエンス分野における新たな展開が紹介されています。オックスフォード大学の卒業生4人からなるチームが、JinduライフサイエンスによってGeneLLMというマルチオミクス大規模モデルを開発しました。このモデルは、Nature CommunicationsおよびAdvanced Scienceに掲載され、原始オミクスデータを用いて事前学習を行います。15億のパラメータと3.5兆塩基対を有し、薬剤開発、精密医療、合成生物学を対象としています。インフレーションデータの動向は引き続き投資家の注目ポイントですが、このAIの画期的進展は、バイオテクノロジー分野における強い勢いを示しています。

DeepSeek -V4-Flashの正式版が世界的な汎用大モデル圈に衝撃を与えた直後、中国の生命科学版Deepseekが続いた。

最近、4人のオックスフォード大学帰国エリートが設立した津渡生科が独自開発した生命科学分野特化のGeneLLMマルチオミクス大モデルが、国際的トップ学術ジャーナル『Nature Communications』および『Advanced Science』に掲載されました。

グローバルで初めてオミクスの原始データを直接用いて事前学習したマルチオミクス大モデルであるGeneLLMは、GoogleのAlphaFoldやスタンフォード大学のEVO 2に続く重要なモデルであり、中国の生命科学分野における基礎的大モデルの空白を埋め、中国版Deepseekと称される。AIが生命の複数の「言語」および全体の「システム」を理解し始めた。

津渡生科

津渡生科

津渡生科

次のトークンを予測するように、次の生命情報を予測する

疾患の識別はGeneLLMの一つの応用シーンに過ぎず、津渡生科が真に目指しているのは、生命科学分野の「Claude Code」を構築することです。

ChatGPT、Claude、 DeepSeek 大規模言語モデルの核心は、次のトークンの予測である。

GeneLLMの考え方は似ていますが、予測するのは文字ではなく生命情報です。

RNA配列における4つの塩基——アデニン(A)、ウラシル(U)、グアニン(G)、シトシン(C)——は、GeneLLMが生命の言語を理解するための基本的なトークンとなる。

従来の生物情報学分析は、遺伝子アノテーション、配列アライメント、および手動で定義されたラベルに依存しています。この方法は正確ですが、モデルの認識範囲を事前に制限し、原始データに隠された多数の未知の生物学的シグナルを失う可能性があります。

GeneLLMは独自のアプローチを採用し、加工作業を経ていない原始的な配列データから生命の法則を学習します。

モデルは、RNA組、プロテオーム、メタボロームなどのマルチオミクス原始データを訓練データとして使用し、疾患に関連するパターンを自ら発見します。

現在、GeneLLMは15億パラメータと3.5兆塩基配列のモデル事前学習を完了し、XLargeバージョンでは300億パラメータのモデル事前学習を実現し、技術的優位性を継続的に拡大しています。

原始シーケンシングデータに基づいて事前学習された世界初のマルチオミクス大モデルであるGeneLLMは、2つの段階を含みます:

(1)非監督学習によるプリトレーニングとプロトタイプの抽出

(2)患者レベルの疾患微調整(Disease Tuning)

津渡生科

GeneLLMはまず、一つの問題を解決する必要があります:

複雑な生命データをAIが理解できる言語にどう変換するか?

自然言語処理では、BPEアルゴリズムが文をトークンに分割するのに対し、GeneLLMは約150bpのRNAシーケンス断片を、7つの塩基からなるスライディングウィンドウ(7-mer)を用いてライフトークンに分割します。

その後、モデルはTransformerアーキテクチャを用いて、遺伝子アノテーションや手動ラベルなしで次の塩基を直接予測します。

これは、AIが人間が整理した「辞書」をまず見るのではなく、生命の原始的な信号から直接学ぶことを意味します。

トレーニング中に、GeneLLMはNVIDIA A100 GPUを搭載した百台クラスタ上で約数十兆のRNAリードを処理しました。

これにより、GeneLLMの汎化能力などが「顕著に現れ始めました」。

生命科学分野における重要なイノベーションとして、国内開発の生命科学モデルGeneLLMは、新薬開発、精密医療、合成生物学、環境モニタリング、微生物および生物農業、タンパク質および分子設計など複数の分野に適用可能であり、実際のシナリオへの実装を達成したグローバルでも稀な大規模モデルです。

津渡生科

GeneLLMの「データ、アーキテクチャ、トレーニング」などの基盤的なイノベーションを検討した後で、ようやくそれが中国の「バイオ版」をどのように表しているのかを真正に理解できる。 DeepSeek 」。

シリコンバレーは数万枚のH100を積み重ねて兆パラメータを実現しました。 DeepSeek アルゴリズムの革新により算力効率を向上させ、GeneLLMもまた四两撥千斤の力で、数億のライフサイエンスデータを引き動かします。

AlphaFoldがAIに生命の「構造」を初めて理解させ、EVO2がAIに生命の「コード」を理解し始めたとすれば、GeneLLMは生命の「システム」をさらに理解しようとしています。

津渡生科

さらに厳しいのは効率です。従来の方法は6Gbの深度シーケンシングに依存しており、コストが高くなり、実用化が困難です。一方、GeneLLMは1Gbの極めて浅い深度(コストを83%削減)でもAUC > 0.8を維持します。

これは、包括的で精密な医療を現実のものにする本当の希望を意味します。

新しい研究パラダイムが現れつつある:AIに生命データから学習させ、生命科学を予測可能で計算可能、かつ規模拡大可能な探求の新段階へと導く。

モデルだけでなく、「最後の1キロ」のインテリジェントインフラでもあります

但津渡生科の展開は基礎モデルにとどまらない。

GeneLLMマルチオミクス大モデルを生命認知の基盤とし、Jindu Life Scienceは、AI知能と物理世界を接続する実行システムをさらに構築しました。Harnessスマート実験実行層とDBTL(Design-Build-Test-Learn)データサイクルを通じて、生命の法則の理解、科学的仮説の生成から、自動化実験の検証および継続的な反復最適化に至る、完全なAI for Scienceサイクルを実現します。

以前OpenAI副社長で現在のトレーニング責任者であるリーム・フェダスの言葉を借りれば、現在のLLMはインターネット上の限られたテキストとコードをすでに使い尽くしており、次の科学的発見の大きな進展は実験の反復に依存しなければならない。

津渡生科

つまり、人間が既に書き下した内容だけを読むことで新しい知識を発見することはできず、AIは自ら実験を行う必要がある。

しかし問題が発生しました——

インターネットサービスは元々APIを備えており、ネットワーク情報は元からデジタルであるが、科研機器は異なるメーカーから提供され、プロトコルもそれぞれ異なり、複雑で高価であり、誰も数ヶ月で一から再構築することはできない。

今日のほとんどの実験室は、人間のために設計されている:機器パネル、ピペット操作、サンプルの状態、現場での判断のほとんどが、機械が理解できる信号に変換されていない。

AIが実験室に導入され、現在ではモデルの能力だけでなく、新しいインフラストラクチャも必要となっている。

したがって、AIが実験室に導入された現在、モデルの能力だけでなく、実験室をコンパイル可能、スケジュール可能、可観測可能、トレーサブルなシステムに変えるための物理的なハーネスも必要です。

これが、AI4Sの真の最終距離である。

BioFord Harnessで、実験室が「自ら動く」ように

これにより、津渡はBioFord Harnessというシステムを開発しました。

これはAIと物理実験室を接続するインフラストラクチャーです。

彼らはロボットアームに人間の手を模倣させることではなく、実験室をプログラム可能でスケジューリング可能、観測可能、トレーサブルなシステムに変えた。

このプロセスでは、物理ハーネスが少なくとも三つのことを達成しなければなりません:

1. 科学的意図または実験DSLを、さまざまなデバイスが実行できる命令にコンパイルする。

2. 複数のデバイス間でスケジューリング、リソースおよびセキュリティ制約を管理し、異常を処理する。

3. 実験結果、デバイスログ、環境パラメータをフィードバックし、次のモデルと実験設計の入力とする。

科学的課題→AIの理解→実験計画→装置のスケジューリング→実行→データのフィードバック→モデルの最適化→次ラウンド。

科学実験データのフライホイールが、このように起動しました。

津渡生科

五大エージェントが研究プロセスを生産ライン化する

BioFord AgentのエムボディードAI科学研究プラットフォームは、下層で実験室の物理層に接続し、上層で科学者の認知層を支え、その中間に物理AIを介して推論と実行のギャップを解消します。

認知レベルでは、BioFord Agentは5つのエージェントからなる協調ネットワークを構成し、生命科学研究の全フローを連携させることで、研究効率を数倍向上させます。

文献検索エージェント

実験設計エージェント

科学エージェント

実験スケジューリングエージェント

データ分析エージェント

例えば、文献検索エージェントは、膨大な文献を迅速に検索・閲覧し、文献レビューを完了して仮説の立案を支援できます。

津渡生科

実験設計エージェントにより、研究チームは従来数か月かかっていた実験設計のサイクルを1週間に短縮しました。

津渡生科が開発した実験スケジューリングエージェントは、ユニバーサル・インストルメント・アブストラクション・レイヤー(Universal Instrument Abstraction Layer)を基盤として、複数の非互換機器間のプロトコルの壁を打破しました。

PCR装置、酵素標識計、フローサイトメーター、自動ピペットワークステーションなど、すべてを一元管理・一元スケジューリングが可能です。システムには動的スケジューリングアルゴリズムが内蔵されており、自動的な一括スケジューリング、リアルタイムの競合回避、実験パラメータの全程記録を実現し、追跡可能な監査チェーンを構築します。

津渡生科

これは、AIが「計画を立てる」段階にとどまらず、実際に実験室に入り、機器を操作しタスクを実行する、信頼できる「研究アシスタント」となることを意味します。

失敗データは、成功データよりも貴重かもしれない

このシステムが解決するより深い価値は、成功したとしても失敗したとしても、すべての実験をシステムが取り込めるデータに変えることです。

従来の実験室では、失敗の記録は「結果が予想に合わなかった」という一行に過ぎず、経験は人の頭の中にしか存在せず、人が去れば経験も失われてしまう。

BioFordシステムでは、失敗のたびに貴重な学習データが蓄積されます——パラメータ選択のロジック、環境条件の記録、誤った経路の証明……すべてがシステムの「経験」として蓄積されます。

次回、AIはこの道は通じないことを知るだろう。

興味深いことに、この分野では、計算能力が最も強い者が勝つわけでも、モデルが最も大きい者が勝つわけでもない。

計算能力は購入できるが、研究データは購入できない。

津渡生科の創設者兼CEO、金泳成は、「開発プロセスにおいて、AIをバイオサイエンスに応用することは単にモデルやデータを積み重ねるだけではないことに徐々に気づきました。実験を行う人々にとって、最終的に解決すべき課題は、計算はできるが実行できない、あるいは実行しても正しくないという困境です。」

これが、AI4Sセクターで最も重要で、最も真似されにくい強みである。

オックスフォードの4人で、その中にロ・フリの同門の先輩も含まれている

2022年、金泳成はオックスフォード大学の生物工学の博士号を取得した瞬間、選択に直面した。

彼の指導教員は英国王立協会会員で、三代目シーケンシングの巨匠である英国上場企業Oxford Nanoporeの創設者であるハーガン・ベイリーであり、実験室には「成果の実用化」の伝統が深く根付いている。英国に残ることは、明確な平坦な道である。

しかし、彼は別の道を選んだ——実験室にある「プロトタイプ技術」をスーツケースに詰め、国に持ち帰った。彼と同行したのは、オックスフォードの同窓生3人だった。生物学博士の邓司偉、コンピューターサイエンス副研究員の沙磊(北京大学コンピューターサイエンス博士、小米大モデル責任者羅福莉の同門先輩)、そして製品実装に長けた周天尧。この4人は、生物工学、人工知能、計算生物学、ビジネス運営などの関連分野の知識を備えており、誰もが欠かせない存在だ。彼らはかつて共同研究プロジェクトを組み、AIとトランスクリプトーム技術を組み合わせて疾患の予測・検出を実現した。この4人はピースのように完璧に補い合い、高度な学際的研究を遂行できる。

会社名「津渡生科」の「津」はオックスフォードに由来し、彼らがオックスフォードのトップレベルの研究室などの学術的拠点から出発することを意味しています。「渡」は人を導くことを意味し、彼らがAI for Scienceが到達すべき最終目標であると考えているところです。

現在、津渡生科のBioFord Agent物理AI科研プラットフォームは、国内のいくつかの有名大学に導入され、顕著な成果を上げており、研究サイクルを従来の数ヶ月から1週間に短縮しました。

風が吹き始めた:1年で4回の資金調達、資本の「本気」の現場

しかし、「前人未到」の道を歩むことは、必ず孤独を伴う。

創業初期、困難が多かった。当時、AIスタートアップは盛んだったが、生物科学分野での「AI+」の試みはほとんどなかった。「AIを理解する者は生物科学を必ずしも理解せず、生物科学を理解する者は大半がAIを理解していない。」

金泳成は率直に述べた:「投資家たちは私たちが何をしているのかを一度理解できなかった。」

チームは「最も難しい道」を選んだ:生物基礎大モデルから着手し、この分野で世界中に存在する企業はごくわずかである。

2025年、転機が訪れた。

当時、国務院は「『AI+』行動の深層的実施に関する意見」を発表し、AI for Scienceがその中に含まれ、このセクターに風が吹き始めた。

津渡生科は「1年で4回の資金調達を達成」という実績を挙げました。同社の主な資金調達のタイムラインは業界のベンチマークとなっています。

天使+輪: Sequoia Capital China Seed Fundがリード投資を実施;

Pre-A+ラウンド:創東方投資が千万級でリード投資を実施;

Pre-A+ラウンド:南山戦新投資から千万級の投資を獲得;

ラウンドA:高特佳投資が約1億元をリード投資。

高特佳投資執行合夥人滕宇航は、「津渡生科は生命科学の基礎研究を、サブスクリプション可能で拡張可能な『計算力+実験』インフラに変革した。」

金泳成の目標はさらに遠大です。「ソフトウェアを販売するだけでは満足せず、生命科学分野のインテリジェントオペレーティングシステムを構築します。インテルがPC時代の計算能力を定義したように、私たちはAI時代の生命科学研究の新たなパラダイムを定義したいと考えています。」

オックスフォードの研究室から深センへ、誰にも理解されない状態からトップキャピタルの注目を浴びるまで。4人のオックスフォード出身者の物語は、単なる起業の伝説ではなく、「私たちに人類のために何ができるか」という魂の問いかけである。

AIが自ら「徹夜」して科学研究を進めれば、科学的発見は天才の偶然のインスピレーションに頼るのではなく、予測可能な必然となるだろう。この道のりは、彼らにとってまだ始まったばかりである。

業界マップ:津渡が軽量な物理AI路線を展開

より広いAI for BioScienceのマップにおいて、ジンドゥは孤独ではないが、アプローチはまったく異なる。

第一類は、デジタル上のAI科学者です。

スタンフォードのインキュベーター出身のBiomni(商業化版はPhylo)は、文献レビュー、仮説生成、バイオインフォマティクス分析を自動化する150以上の専門ツールを備えています。

エリック・シュミットが支援するFutureHouseは、自ら仮説を生成し、論文を執筆できるAI科学者の構築に取り組んでいます。

しかし、それらは強力ではあるものの、依然としてデジタル世界に限定されています。

第二の道は、フルスタック自社開発です。

晶泰科技は「AI+ロボット」を活用し、世界中に300台以上のワークステーションを展開しています。

Flagship Pioneeringが育成したLila Sciencesは、5.5億ドルの資金調達を行い、AIが実験の設計、実行、再設計を完全に担うことを目指し、「科学的スーパーアイ」という目標を掲げています。

でも、これらはすべてお金がかかりすぎます。

第三類はエンドツーエンドの管路ルートです。

英矽智能はAIを自社の新薬開発パイプラインに直接導入し、初のAI薬が第III相臨床試験に進んだが、彼らは「道路を整備する人」ではなく「車を製造する人」である。

一方、津渡生科の選択は、物理的なハーネスの構築に専念し、モデルと実体実験システムの間の「最後の1キロ」のインフラを整えることです。

ベース競争をせず、エンドツーエンドのパイプラインを構築せず、純粋なデジタルワールドのAI科学者にもならない。その1キロだけに集中するのは、はるかに軽量なアプローチである。

金泳成はこの判断を明確に述べた:「ScienceのためのAIの真の分水嶺は、モデルが科学者のようにどれだけよく答えられるかではなく、実験室が持続的な学習システムのように動作し始められるかである。」

また、グローバルなAI for Science分野において、ジンドゥは単に「最後の1キロ」だけを担うわけではない。

より正確には、它はラストマイルを入口として、科学研究ワークフロー全体の編成権を競い合っている。

純粋なデジタルAI科学者とは異なり、物理世界にアクセスできる。自社で重資産の科学工場を構築するよりも、既存の顧客ラボを引き継ぐ機会がある。エンドツーエンドのAI製薬企業とは異なり、特定の臨床パイプラインにすべてを賭ける必要がない。

津渡生科

真の競争優位は、パラメータ数ではなく、蓄積されていく実験の軌跡、デバイスインターフェース、失敗の経験、そして複数の研究所間で実行されるネットワークである。

キム・ヨンソンの言葉通り、生物体内には数万ものシグナル経路と未知に満ちた反応機構が存在し、それは魅惑的である。「生物学がどれほど豊かであるか、AI for Scienceの可能性もまたそれだけ美しい。」

AIの知性で生命の謎を探求する。このオックスフォードの秀才たちの星々と大海は、いまだ幕を開けたばかりである。

本文は微信公众号「新智元」より、著者:新智元;編集:Aeneas KingHZ

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。