Çinli Hayat Bilimleri AI Modeli GeneLLM, 'Biyolojik DeepSeek' olarak ortaya çıkıyor

icon MarsBit
Paylaş
AI summary iconÖzet
MarsBit'ten AI ve kripto haberleri, Çin'in yaşam bilimleri sektöründe yeni bir gelişmeyi vurguluyor. Dört Oxford mezunu ekibi, Jindu Yaşam Bilimleri tarafından GeneLLM adlı çoklu omik büyük modeli geliştirdi. Nature Communications ve Advanced Science dergilerinde yayımlanan bu model, ön-eğitim için ham omik verileri kullanıyor. 1,5 milyar parametre ve 3,5 trilyon baz çifti ile ilaç keşfi, hassas tıp ve sentetik biyoloji hedefleniyor. Enflasyon verisi trendleri, yatırımcılar için hâlâ ana odak noktası olmaya devam ediyor; ancak bu AI devrimi, biyoteknoloji alanında güçlü bir momentum gösteriyor.

DeepSeek -V4-Flash resmi sürümü, küresel genel amaçlı büyük modeller dünyasını sarsarken, Çinli yaşam bilimleri versiyonu Deepseek hemen ardından geldi.

Son zamanlarda, dört Oxford Üniversitesi mezunu uzman tarafından kurulan Jin Du Shengke, kendi kendine geliştirdiği yaşam bilimleri odaklı GeneLLM çoklu omik büyük modeliyle uluslararası üst düzey akademik dergiler olan Nature Communications ve Advanced Science’da yer aldı.

GeneLLM, küresel olarak ilk kez omik verilerinin orijinal verilerini kullanarak önceden eğitilen çok omik büyük bir modeldir ve Google'ın AlphaFold ve Stanford Üniversitesi'nin EVO 2'sinden sonra gelen önemli bir modeldir; Çin'in yaşam bilimleri temel büyük modeli boşluğunu doldurarak Çin'in yaşam bilimleri versiyonu Deepseek olarak kabul edilebilir ve AI'ya yaşamın birçok "dilini" ve tüm "sistemini" anlamayı öğretir.

Jindu Shengke

Jindu Shengke

Jindu Shengke

Bir sonraki token'u tahmin ederken, bir sonraki yaşam mesajını tahmin edin

Hastalık tanımlama, GeneLLM'in yalnızca bir uygulama alanıdır; JinDu Biotech'in gerçek amacı, yaşam bilimleri alanında bir «Claude Code» oluşturmaktır.

ChatGPT, Claude, DeepSeek Büyük dil modellerinin çekirdeği, bir sonraki token tahminidir.

GeneLLM, benzer bir fikre sahiptir, ancak metin değil, yaşam bilgilerini tahmin eder.

RNA dizisindeki dört baz—adenin (A), urasil (U), guanin (G), sitozin (C)—, GeneLLM'in yaşam dilini anlamak için temel token'ları oluşturur.

Geleneksel biyoinformatik analizler genellikle gen notasyonu, dizi hizalaması ve elle tanımlanmış etiketlere dayanır. Bu yöntem, doğru olsa da modelin algı alanını önceden sınırlar ve orijinal verilerde gizli olan birçok bilinmeyen biyolojik sinyali kaçırmaya neden olabilir.

GeneLLM, yaşamın kurallarını doğrudan işlenmemiş orijinal dizileme verilerinden öğrenerek farklı bir yol izliyor.

Model, RNA, proteom, metabolom vb. çoklu omik verileriyle eğitilerek hastalıklara ilişkin desenleri kendi kendine keşfeder.

Şu anda GeneLLM, 15 milyar parametre ve 3,5 trilyon baz dizisi ile model ön eğitimi tamamladı; XLarge sürümü 30 milyar parametreli model ön eğitimi gerçekleştirdi ve teknolojik engeli sürekli genişletiyor.

Orijinal dizileme verileriyle önceden eğitilen ilk küresel çoklu omik büyük model olan GeneLLM, iki aşamadan oluşur:

(1) Gözetimsiz ön eğitim ve prototip keşfi

(2) Hastalık düzeyinde ince ayar (Disease Tuning)

Jindu Shengke

GeneLLM öncelikle bir sorunu çözmeli:

Karmaşık yaşam verilerini AI'nın anlayabileceği dile nasıl çevirebiliriz?

Doğal dil işlemede BPE algoritması cümleleri tokenlara böler; GeneLLM ise yaklaşık 150 bp uzunluğundaki RNA dizileme parçalarını, 7 bazdan oluşan kayan pencere (7-mer) ile yaşam tokenlarına böler.

Daha sonra, model, genik annotasyon ve insan etiketleri olmadan, bir sonraki bazı doğrudan tahmin etmek için Transformer mimarisini kullanır.

Bu, yapay zekânın insanlar tarafından düzenlenmiş bir «sözlük»e bakmak yerine, yaşamın ilk sinyallerinden doğrudan öğrenmesi anlamına gelir.

Eğitim sırasında GeneLLM, yüzlerce NVIDIA A100 GPU'dan oluşan bir kümede yaklaşık onlarca trilyon RNA okumasını işledi.

Bu noktada GeneLLM'in genelleme yetenekleri başlıyor.

GeneLLM, biyoteknoloji alanında önemli bir yenilik olan bu yerel biyoteknoloji modeli, yeni ilaç geliştirme, hassas tıp, sentetik biyoloji, çevre izleme, mikrobiyoloji ve biyolojik tarım, protein ve molekül tasarımı gibi birçok alanda kullanılabilir ve gerçek dünya senaryolarında uygulama bulmuş nadir büyük modellerden biridir.

Jindu Shengke

GeneLLM'in «veri, mimari, eğitim» gibi temel yeniliklerini inceledikten sonra, neden bunun Çin'in «biyolojik versiyonu» olduğunu gerçekten anlayabiliriz: DeepSeek 」.

硅谷, milyonlarca H100 ile trilyon parametreli modeller oluşturuyor, DeepSeek Algoritmik yenilikle hesaplama verimliliğini artırarak, GeneLLM aynı şekilde binlerce yaşam bilimi verisini harekete geçirmektedir.

AlphaFold, AI'nin yaşamın "yapısını" ilk kez anlamasını sağladıysa, EVO2 AI'nin yaşamın "kodunu" anlamaya başlamasını sağladı, GeneLLM ise yaşamın "sistemini" daha da derinlemesine anlamayı hedefliyor.

Jindu Shengke

Daha da önemlisi verimlilik. Geleneksel yöntemler 6 Gb derinlik dizileme gerektirir, maliyeti yüksektir ve uygulanması zordur. GeneLLM, 1 Gb çok düşük derinlikte (maliyet %83 azalır) bile AUC > 0,8 değerini korur.

Bu, evrensel doğru tedavinin gerçeğe dönüşmesi için gerçek bir umut anlamına gelir.

Yeni bir bilimsel araştırma paradigmasi ortaya çikmaya başlıyor: Yapay zekânın yaşam verilerinden öğrenmesi ve yaşam bilimlerinin öngörülebilir, hesaplanabilir ve ölçeklenebilir bir keşif aşamasına girmesi.

Sadece model değil, aynı zamanda "son kilometre" akıllı altyapısı

Jin Du Shengke'nin planlaması sadece temel modelde değil.

GeneLLM çoklu omik büyük modeliyle yaşam bilgisinin temelini oluşturarak, JinDu Biotech, AI akıllılığını fiziksel dünyaya bağlayan bir yürütme sistemi kuruyor; Harness akıllı deney yürütme katmanı ve DBTL (Tasarım-Oluştur-Dene-Öğren) veri döngüsü aracılığıyla, yaşam kurallarının anlaşılması, bilimsel hipotezlerin oluşturulması, otomatikleştirilmiş deney doğrulaması ve sürekli yinelemeli iyileştirme süreçlerini kapsayan tam bir AI for Science döngüsünü gerçekleştirmektedir.

Önceki OpenAI VP ve sonraki eğitim sorumlusu Liam Fedus’un söylediğine göre, mevcut LLM’ler internet üzerindeki sınırlı metin ve kodları tükettiler; bundan sonraki bilimsel keşiflerin büyük ilerlemeleri deney yinelemelerine dayanacaktır.

Jindu Shengke

Yani, yeni bilgileri sadece insanlar tarafından yazılmış içerikleri okuyarak keşfedemeyen AI, kendi deneylerini yapmalıdır.

Peki soru şu—

İnternet hizmetleri doğuştan API'ye sahiptir, ağ bilgisi doğuştan dijitaldir, ancak bilimsel cihazlar farklı üreticilerden gelir, protokoller farklıdır, hem karmaşık hem de pahalıdır ve kimse birkaç ay içinde bunları yıkıp yeniden inşa edemez.

Günümüzdeki çoğu laboratuvar, insanlar için tasarlanmıştır: cihaz panelleri, pipetleme hareketleri, örnek durumları, anlık kararlar; çoğu makine tarafından anlaşılabilir sinyale dönüşmemiştir.

Yapay zeka laboratuvara girdi, şu anda sadece model yetenekleri sorunu değil, yeni bir altyapı da gerekiyor.

Bu nedenle, AI laboratuvara giriyor ve şu anda sadece model yetenekleri değil, fiziksel bir Harness gerekiyor: laboratuvarı bir derlenebilir, planlanabilir, izlenebilir ve izlenebilir sistem haline getirmek.

Bu, AI4S'nin gerçek son kilometresidir.

BioFord Harness, laboratuvarın «kendisi harekete geçmesini» sağlıyor

Bunun için Jin Du, BioFord Harness adlı bir sistem geliştirdi.

Bu, yapay zekâ ile fizik laboratuvarlarını birbirine bağlayan bir altyapıdır.

Onlar, robot kolu ile insan elini taklit etmek yerine, laboratuvarı bir derlenebilir, planlanabilir, izlenebilir ve izlenebilir sistem haline getirdi.

Bu süreçte, fiziksel Harness en az üç şeyi tamamlamalıdır:

1. Bilimsel amaçları veya deney DSL'lerini farklı cihazların yürütebileceği komutlara derleyin;

2. Çok cihaz arasında zamanlama, kaynak ve güvenlik kısıtlamalarını yönetin ve istisnaları ele alın;

3. Deney sonuçlarını, cihaz günlüklerini ve çevre parametrelerini geri besleyerek bir sonraki model ve deney tasarımı için girdi haline getirin.

Bilimsel soru → AI anlayışı → Deneysel tasarım → Cihaz planlaması → Gerçekleştirme → Veri geri beslemesi → Model optimizasyonu → Sonraki döngü.

Bilimsel bir deney veri döngüsü böylece başlatıldı.

Jindu Shengke

Beş akıllı ajan, bilimsel süreci bir montaj hattına dönüştürüyor

BioFord Agent, fiziksel laboratuvar katmanına aşağıdan bağlanır, bilim insanlarının bilişsel katmanına yukarıdan destek olur ve ortada fiziksel AI ile çıkarım ve yürütme arasındaki boşluğu doldurur.

Bilişsel düzeyde, BioFord Agent, yaşam bilimleri araştırmasının tam sürecini birleştiren beş akıllı ajanlı bir işbirliği ağından oluşur ve araştırma verimliliğini birkaç kat artırır.

Literatür arama akıllı aracısı

Deneysel Tasarım Aracı

Bilimsel agens

Deneysel Zamanlama Ajanı

Veri Analizi Akıllı Aracı

Örneğin, literatür arama ajanı, size büyük miktarda literatürü hızlıca aratıp okumayı, literatür gözden geçirmesini tamamlamayı ve hipotez önermeyi destekleyebilir.

Jindu Shengke

Deneysel tasarım ageni, araştırma ekibinin deney tasarımı döngüsünü aylardan haftalara indirdi.

Jin Du Shengke'nin sunduğu deney zamanlama ajanı, Evrensel Cihaz Soyutlama Katmanı (Universal Instrument Abstraction Layer) üzerine kuruludur ve çeşitli heterojen cihazlar arasındaki protokol bariyerlerini ortadan kaldırır.

PCR cihazları, mikroplak okuyucular, akış sitometreleri veya otomatik pipetleme istasyonları, tek bir sistemde birleştirilerek ortak olarak yönetilebilir ve planlanabilir. Sistem, dinamik planlama algoritması ile otomatik toplu planlama, gerçek zamanlı çakışma önleme ve deney parametrelerinin tamamının kaydedilmesini sağlar; bu da izlenebilir bir denetim zinciri oluşturur.

Jindu Shengke

Bu, AI'nın yalnızca "fikir önerme" aşamasında kalmayıp, laboratuvara gerçekten girmesini, cihazları操纵 etmesini ve görevleri yerine getirmesini, güvenilir bir "araştırma asistanı" haline gelmesini anlamaktadır.

Başarısız veriler, başarılı verilerden daha değerli olabilir.

Bu sistem, başarıya ulaşsın ya da başarısız olsun, her deneyi sistemin tüketebileceği verilere dönüştürerek daha derin bir değer yaratır.

Geleneksel bir laboratuvarda, bir başarısızlık kaydı sadece “beklenen sonuç elde edilemedi” satırı olabilir; deneyim insanın zihninde saklıdır, insan gittiğinde deneyim de kaybolur.

BioFord sisteminde her başarısızlık, değerli bir eğitim verisidir—parametre seçimi mantığı, çevre koşullarının kaydı, yanlış yolların kanıtı… hepsi sistemin “deneyimi” kısmına katılır.

Bir sonraki sefer, AI bunun geçilmez bir yol olduğunu bilecek.

Bu alanda, en güçlü hesaplama gücüne sahip olan değil, en büyük modele sahip olan değil kazanır.

Hesaplama gücü satın alınabilir, ancak bilimsel veriler satın alınamaz.

Jin Yeong-seong, JinDu Life Science'in kurucusu ve CEO'su, "Araştırma ve geliştirme süreci boyunca, AI'nın Biyobilim için kullanılmasının sadece model ve veri yığını oluşturmak olmadığını anladık. Deney yapanlar için nihai hedef, hesaplamayı yaptıktan sonra yapamama ve yaptıklarının yanlış çıkma sorununu çözmektir."

Bu, AI4S yarışmasının en önemli ve en zor kopyalanabilir koruma duvarıdır.

Dört Oxfordlu, bunların arasında Ro Fuli'nin aynı danışmanın öğrencisi de var

2022 yılında, Kim Yeong-seong, Oxford Üniversitesi'nden biyomühendislik doktorasını aldığında bir seçimle karşı karşıya kaldı.

Onun danışmanı, Royal Society üyesi ve üçüncü nesil dizileme devi İngiliz halka açık şirketi Oxford Nanopore'un kurucusu Hagan Bayley'dir; laboratuvarda "sonuçların uygulanması" gelenekleri derindir. İngiltere'de kalmak, net bir yolculuktur.

Ancak başka bir yol seçti—laboratuvarda bir «prototip teknoloji»yi valizine koyup ülkesine getirdi. Onunla birlikte gidenler, Oxford mezunu üç kişi: biyoloji doktoru Deng Siwei, bilgisayar bilimleri araştırmacısı Sha Lei (Pekin Üniversitesi Bilgisayar Bilimleri doktoru, Xiaomi büyük model sorumlusu Luo Fuli’nin aynı danışmanın öğrencisi) ve ürün uygulamasında uzman Zhou Tianyao. Dört kişi, biyomühendislik, yapay zeka, hesaplamalı biyoloji ve ticari operasyonlar gibi ilgili bilgi alanlarına sahiptir ve her biri eksiksizdir. Daha önce birlikte ortak araştırma projeleri gerçekleştirmiş, AI ve transkriptom teknolojilerini birleştirerek hastalık tahmini ve tespiti sağlamışlardır. Dört kişi, bir bulmaca gibi tamamen birbirini tamamlıyor ve yüksek düzeyde disiplinler arası araştırma yapabilirler.

Şirket adı “Jindu Biotech”, “Jin” Oxford’dan alınmıştır ve Oxford’un önde gelen laboratuvarları gibi akademik zirvelerden başladıkları anlamına gelir; “Du” ise insanlara hizmet etmeyi ifade eder, bu da AI for Science’in ulaşması gereken hedef olarak görürler.

Şu anda, Jin Du Sheng Ke'nin BioFord Agent fiziksel AI bilimsel araştırma platformu, ülkede bazı ünlü üniversitelerde hayata geçirilmiş ve araştırma döngüsünü önceki birkaç aydan bir haftaya indirmiştir.

Rüzgar esmeye başladı: 1 yıl içinde 4 finansman turu, sermayenin "gerçekten lezzetli" sahnesi

Ancak, daha önce hiç görülmemiş bir yolu izlemek, mutlaka yalnızlıkla beraber gelir.

Başlangıçta birçok zorlukla karşılaşıldı. O dönemde AI girişimleri yoğun bir şekilde yürütülüyordu, ancak biyolojik bilimler alanında «AI+» denemeleri neredeyse yoktu. «AI’yi anlayanlar biyolojik bilimleri anlamayabilir, biyolojik bilimleri anlayanların çoğu AI’yi anlamaz.»

Kim Yeong-seong, "Yatırımcılar bir süre bizim ne yaptığımızı anlayamadı." dedi.

Takım, "en zor yolu" seçti: Biyolojik temel modelden başlayarak, dünyada bu yönde çalışan şirketler sınırlı sayıdadır.

2025 yılında, bir dönüşüm noktası ortaya çıktı.

O dönemde, Devlet Konseyi, "Yapay Zeka+" Harekâtı'nın Derinleştirilmesi Hakkında Bir Görüş"ü yayınladı ve AI for Science bunun içinde yer aldı, sektörde bir rüzgar esmeye başladı.

Jindu Shengke, "bir yıl içinde dört finansman turu tamamlama" rekorunu kırdı. Şirketin ana finansman zaman çizelgesi endüstri standardı haline geldi.

Melek+Çark: Sequoia Capital Çin Tohum Fonu tarafından öncü finansman sağlandı;

Ön A+ Turu: Huachuang Dongfang Yatırım, on milyon düzeyindeki lider yatırımını gerçekleştirdi;

Ön A+ Turu: Nan Shan Za Xin Tou'dan on milyon dolarlık yatırım alındı;

A Serisi: Yüksek Özellikli Yatırım'dan yaklaşık 100 milyon yuan liderlikli yatırım.

Gao Tejia Yatırım İşbirlikçi Ortağı Teng Yuhang, "Jindu Biyotech, yaşam bilimleri temel araştırmalarını abonelik ve ölçeklenebilir bir 'hesaplama gücü + deney' altyapısına dönüştürdü." dedi.

Kim Yeong-seong'un hedefi ise daha da büyüktür: "Yazılım satmakla yetinmiyoruz; yaşam bilimleri alanında akıllı bir işletim sistemi kurmak istiyoruz. Intel, PC çağındaki hesaplama gücünü tanımladı; biz de AI çağındaki yaşam bilimleri araştırmasının yeni bir paradigmayı tanımlamayı hedefliyoruz."

Oxford laboratuvarından Shenzhen'e, hiçbirinin anlamadığı bir durumdan birinci sınıf sermayenin desteklediği bir hale gelene kadar dört Oxfordlı'nın hikayesi, sadece bir girişim efsanesi değil, aynı zamanda "İnsanlık için ne yapabiliriz?" sorusuna yönelik bir ruhsal sorgulamadır.

Yapay zekâ kendi kendine "gece boyu" bilimsel araştırma yapmayı öğrendiğinde, bilimsel keşifler belirsiz şanslı ilhamlara değil, öngörülebilir bir zorunluluğa dönüşebilir. Bu yol, sadece başlangıç aşamasında.

Endüstri haritası: Jin Du, hafif fiziksel AI yolunu izliyor

Daha büyük bir AI for BioScience haritasında, Jindu yalnız değil, ancak girdi noktaları tamamen farklı.

İlk kategori, dijital AI bilim insanlarıdır.

Stanford tarafından desteklenen Biomni (Phylo olarak ticarileştirildi), literatür incelemesi, hipotez oluşturma ve biyoinformaatik analizleri otomatikleştiren 150'den fazla profesyonel araca sahiptir.

Eric Schmidt tarafından desteklenen FutureHouse, kendi kendine hipotez üretip makale yazan AI bilim insanları inşa etmeye odaklanıyor.

Ancak güçlü olmalarına rağmen hala dijital dünyada sınırlı kalıyorlar.

İkinci tür, tamamen kendi kendine yürütülen yaklaşımdır.

Jing Tai Bilim ve Teknolojisi, 'AI + Robot' ile küresel olarak 300'den fazla iş istasyonu kurmuştur.

Flagship Pioneering tarafından kültürlenen Lila Sciences, 5,5 milyar dolarlık finansmanla AI'nın deneylerin tasarımı, yürütülmesi ve yeniden tasarımı tamamen üstlenmesini hedefliyor ve hedefi "bilimsel süper zeka".

Ancak bunların hepsi çok para harcıyor.

Üçüncü tür, uçtan uca yönetim rotasıdır.

英矽智能, yapay zekayı doğrudan kendi yenilikçi ilaç hatlarına entegre ediyor; ilk AI ilacı Phase III klinik denemelerine girdi, ancak onlar "yol onarıcılar" değil "araba üreticiler".

Jin Du Shengke'nin seçimi: Fiziksel Harness yapısına odaklanmak ve model ile fiziksel deney sistemleri arasında "son kilometre" altyapısını oluşturmak.

Taban yarışması yapmıyoruz, uçtan uca hat yapmıyoruz, saf dijital dünyada AI bilimci olmuyoruz. Sadece o bir kilometreyi yapıyoruz, bu kesinlikle daha hafif bir yaklaşım.

Kim Yeong-seong, bu kararı şöyle açıkça ifade etti: "Bilim için AI'nın gerçek bölünme noktası, modelin bilim insanları gibi ne kadar iyi cevap vermesi değil, laboratuvarın sürekli öğrenen bir sistem gibi çalışmaya başlamasıdır."

Ayrıca, küresel AI for Science alanında, Jindu sadece "son kilometreyi yapmakla" sınırlı değildir.

Daha doğru bir ifadeyle, son kilometre giriş noktası olarak bilimsel çalışma akışının orchestrasyon hakkını kazanır.

Sadece dijital AI bilim insanlarına kıyasla fiziksel dünyaya dokunabilir; kendi ağırlıklı bilimsel fabrikaları kurmaya kıyasla müşterilerin mevcut laboratuvarlarını devralma fırsatına sahiptir; end-to-end AI ilacı geliştirme şirketlerine kıyasla bir klinik hattına kaderini bağlamak zorunda değildir.

Jindu Shengke

Gerçek koruma duvarı, parametre sayısı değil, sürekli biriken deney geçmişleri, cihaz arayüzleri, başarısızlık deneyimleri ve çapraz laboratuvar yürütme ağları olacaktır.

Kim Yeong-seong'un söylediğine göre, canlı organizmalardaki on binlerce sinyal yolu ve bilinmeyen reaksiyon mekanizmaları büyüleyicidir. "Biyojiliğin ne kadar zenginse, Bilim için AI'nın geleceği de o kadar güzeldir."

Yapay zeka ile yaşamın sırlarını keşfedin, bu Oxford lisesi öğrencilerinin yıldızlı denizleri henüz başlıyor.

Bu yazı WeChat hesabından "Yeni Zihin" tarafından paylaşılmıştır, yazar: Yeni Zihin; editör: Aeneas KingHZ

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.