DeepSeek - V4-Flash - Ang opisyal na bersyon ay nag-impluwensya sa buong pandaigdigang komunidad ng pangkalahatang modelo, at agad sumunod ang Chinese Life Sciences version ng Deepseek.
Kasalukuyan, ang GeneLLM, ang sariling binuo na malaking modelo para sa life sciences na gawa ng Jin Du Sheng Ke (na itinatag ng 4 na mga scholar na bumalik sa China mula sa University of Oxford), ay naging tema sa mga prestihiyosong international academic journal—ang Nature Communications at Advanced Science.
Bilang ang unang multi-omics large model sa mundo na direktang gumagamit ng orihinal na genomic data para sa pre-training, ang GeneLLM ay ang susunod na malaking model pagkatapos ng Google's AlphaFold at Stanford University's EVO 2, na nagpapuno sa puwang ng mga pangunahing large model sa life sciences sa China, at itinuturing na ang Chinese version ng Deepseek sa life sciences, na nagpapahintulot sa AI na maunawaan ang maraming 'wika' at buong 'sistema' ng buhay.



Magpalaya ng sumusunod na token tulad ng paghula sa sumusunod na mensahe sa buhay
Ang pagkilala sa sakit ay isang aplikasyon lamang ng GeneLLM; ang tunay na layunin ng Jin Du Life Science ay stablishin ang 'Claude Code' ng larangan ng life sciences.
ChatGPT, Claude, DeepSeek Ang pangunahang bahagi ng malalaking modelo sa wika ay ang paghuhula ng susunod na token.
Kapareho ang ideya ni GeneLLM, ngunit hindi ito nagpapahula ng teksto, kundi ng impormasyon sa buhay.
Ang apat na base sa RNA sequence—adenine (A), uracil (U), guanine (G), at cytosine (C)—ay naging mga token na pangunahin para sa pag-unawa ni GeneLLM sa wika ng buhay.
Ang tradisyonal na analisis ng bioinformatika ay karaniwang nakabatay sa pag-annota ng gene, paghahambing ng sekwensya, at manu-manong pagtukoy ng mga label. Bagaman ang paraang ito ay akurat, ito ay naglalagay ng limitasyon sa sakop ng kaalaman ng modelo at maaaring mawala ang maraming hindi kilalang biyolohikal na signal na nakatago sa orihinal na data.
Ang GeneLLM ay naglalakad ng ibang daan, natututo nang direkta mula sa mga orihinal, hindi pa na-prosesong sequencing data upang maunawaan ang mga batas ng buhay.
Ginagamit nito ang mga orihinal na data mula sa RNAome, proteome, metabolome, at iba pang multi-omics bilang training data upang pahintulutan ang modelo na makahanap ng mga pattern na may kaugnayan sa sakit.
Kasalukuyan, natapos na ng GeneLLM ang pre-training ng modelo na may 1.5 bilyong parameter at 3.5 trilyong sequence ng base, at natapos na ang pre-training ng modelo na may 30 bilyong parameter sa bersyon na XLarge, patuloy na papalawakin ang teknikal na kapakinabangan.
Bilang ang unang global na maraming omics na malaking modelo na pre-trained sa orihinal na sequencing data, ang GeneLLM ay naglalaman ng dalawang yugto:
(1) Walang pagmamarkang pagpapahintulot at paghahanap ng prototipo
(2) Disease Tuning sa antas ng pasyente

Kailangan muna ng GeneLLM na lutasin ang isang problema:
Paano isasalin ang mga kumplikadong data ng buhay sa wika na maunawaan ng AI?
Sa natural language processing, ang BPE algorithm ay naghihiwalay ng pangungusap sa mga token; samantala, ang GeneLLM ay naghihiwalay sa mga RNA sequencing fragment na may habang 150 bp gamit ang isang sliding window na binubuo ng 7 bases (7-mer) upang mabuo ang life tokens.
Pagkatapos, ginagamit ng modelo ang Transformer architecture upang direktang makapag-predict ng susunod na base pair nang walang gene annotation at manual labels.
Ibig sabihin nito na hindi unaang tumitingin ang AI sa "diksiyonaryo" na nailikha ng tao, kundi direktang natututo mula sa mga orihinal na signal ng buhay.
Sa proseso ng pagtatrain, inangkop ng GeneLLM ang higit sa sampu't milyong milyon na RNA reads, na tinuruan sa isang cluster ng 100 NVIDIA A100 GPU.
Sa point na ito, ang mga kakayahan ng GeneLLM tulad ng generalization ay nagsimulang “magmula”.
Bilang isang malaking pag-usbong sa larangan ng biyolohiya, ang GeneLLM, isang lokal na modelo sa biyolohiya, ay maaaring gamitin sa pagbuo ng bagong gamot, tumpak na pangangalaga sa kalusugan, sintetikong biyolohiya, pagmamasid sa kalikasan, mikrobyo at biyolohikal na agrikultura, at disenyo ng protina at molekula, at isa sa mga kaunting malalaking modelo sa buong mundo na nakakamit ng praktikal na pagpapatupad.

Pagkatapos nating suriin ang mga pangunahing inobasyon ni GeneLLM sa mga aspeto tulad ng «data, arkitektura, pagtuturo», tayo ay makakaintindi ng totoo: bakit ito ang kinakatawan ng «biological version» ng China DeepSeek 」.
Ang Silicon Valley ay nagtatayo ng trilyon na parameter gamit ang libo-libong H100, DeepSeek Sa pamamagitan ng pagpapabuti ng algorithm para sa mas mataas na efficiency ng computing power, ginagamit din ni GeneLLM ang prinsipyo ng “isang maliit na puwersa para baguhin ang malaking bagay” upang mapabilis ang milyun-milyon na data sa life sciences.
Kung ang AlphaFold ay nagbigay sa AI ng unang pagkakataon na maintindihan ang "istraktura" ng buhay, at ang EVO2 ay nagbigay sa AI ng pag-unawa sa "kode" ng buhay, ang GeneLLM ay sumisikap na mas malalim na maintindihan ang "sistema" ng buhay.

Mas malakas pa ang efficiency. Ang tradisyonal na paraan ay nakadepende sa 6Gb deep sequencing, na may mataas na gastos at mahirap i-implement. Ang GeneLLM ay nananatiling may AUC > 0.8 kahit sa 1Gb napakapalalim na pagse-sequence (bawas ng 83% sa gastos).
Ito ay nangangahulugan na may totoong pag-asa na gawing katotohanan ang masaklaw at tumpak na pangangalaga sa kalusugan.
Isang bagong paradigma sa pananaliksik ay nagsisimula na lumabas: pagpapahintulot sa AI na matutunan mula sa data ng buhay, upang ipasok ang agham ng buhay sa isang bagong yugto na makapagbabadya, makakalkula, at maaaring iskalin ang pag-aaral.
Hindi lang isang modelo, kundi ang智能化 panghuling kilometer na imprastruktura
Ngunit ang pagpaplano ni Jin Du Shengke ay hindi limitado sa base model.
Gamit ang GeneLLM multi-omics large model bilang pundasyon ng pag-unawa sa buhay, patuloy ng Jin Du Bioscience ang pagbuo ng isang eksekutibong sistema na nag-uugnay sa AI intelligence at pisikal na mundo, sa pamamagitan ng Harness intelligent experiment execution layer at DBTL (Design-Build-Test-Learn) data loop, upang makamit ang buong AI for Science loop mula sa pag-unawa sa mga batas ng buhay, pagbuo ng scientific hypothesis, hanggang sa automated experiment validation at patuloy na iterasyon at pagpapabuti.
Ayon kay Liam Fedus, dating VP ng OpenAI at tagapamahala ng post-training, ang kasalukuyang LLM ay nagsawa na sa limitadong teksto at code sa internet, at ang mga malalaking pag-unlad sa agham ay kailangang umasa sa pagpapalit ng eksperimento.

Ibig sabihin, hindi sapat na batay lang sa pagbabasa ng mga nilalaman na isinulat ng tao upang makahanap ng bagong kaalaman; kailangan ng AI na gumawa ng sariling eksperimento.
Ngunit may problema na—
Ang mga serbisyo sa internet ay may naturally existing API, at ang impormasyon sa web ay naturally digital, ngunit ang mga kagamitan sa pananaliksik ay galing sa iba’t ibang manufacturer, may iba’t ibang protokolo, at kumplikado at mahal, kaya walang makakapagpabagsak at muling itayo sa loob ng ilang buwan.
Karamihan sa mga laboratorio ngayon ay disenyo para sa mga tao: mga panel ng instrumento, mga galaw ng pipeta, estado ng sample, at paggawa ng desisyon sa lugar, at karamihan ay hindi naging mga signal na maunawaan ng machine.
Pumasok ang AI sa laboratorio, at ang problema ay hindi lamang ang kakayahan ng modelo, kundi kailangan din ng isang bagong imprastruktura.
Kaya pumasok ang AI sa laboratorio, at ngayon ay hindi lang problema ang kakayahan ng model, kundi kailangan din ng pisikal na Harness: gawing isang system na ma-compile, ma-schedule, ma-observe, at ma-trace ang laboratorio.
Ito, ang totoong huling kilometer ng AI4S.
BioFord Harness, nagpapahintulot sa laboratorio na magsimula na mag-act
Para sa layuning ito, binuo ng Jindu ang isang sistema na tinatawag na BioFord Harness.
Ito ay isang imprastruktura na nag-uugnay sa AI at mga pisikal na laboratorio.
Hindi sila nagpapakopya sa kamay ng tao gamit ang robotic arm, kundi ginawa nila ang laboratorio bilang isang system na maaayos, maaayos ang pagkakasunod-sunod, maaobserbahan, at matatakdang masuri.
Sa proseso na ito, ang pisikal na Harness ay kailangang matapos ang kahit anong tatlo:
1. I-compile ang scientific intent o experiment DSL bilang mga utos na makakapagpapagana sa iba’t ibang device;
2. Matupad ang pagjadwal, pagpapamahala sa mga yaman at mga limitasyon sa kaligtasan sa pagitan ng maraming device, at penanagutan sa mga anomaliya;
3. Ibalik ang mga resulta ng eksperimento, mga log ng kagamitan at mga parameter ng kapaligiran bilang input para sa susunod na pagdidisenyo ng modelo at eksperimento.
Pananaliksik na tanong → Pag-unawa ng AI → Pagsasagawa ng eksperimento → Pagjadwal ng kagamitan → Paggawa → Pagbabalik ng data → Pagsusulong ng modelo → Susunod na bilang.
Nagsimula na ang flywheel ng isang set ng scientific experimental data.

Limang mga intelligent agent, isinasalin ang proseso ng pananaliksik sa isang assembly line
Ang BioFord Agent, ang platform para sa pag-aaral ng embodied intelligence, ay nag-uugnay sa physical layer ng laboratorio sa ibabaw, at nagtataguyod ng cognitive layer ng mga siyentipiko, habang ginagamit ang physical AI upang tulungan ang pagitan ng pag-iisip at pagpapatupad.
Sa antas ng pag-unawa, binubuo ng limang autonomous agents ang BioFord Agent na isang kooperatibong network na nag-uugnay sa buong proseso ng pananaliksik sa buhay, na maaaring magpataas ng efficiency ng pananaliksik ng ilang beses.
Inteligenteng agent para sa paghahanap ng literatura
Experimental Design Agent
Scientific Agent
Experimental Scheduler Agent
Data Analysis Agent
Halimbawa, ang intelligent document retrieval agent ay maaaring mabilis na tumulong sa iyo na hanapin at basahin ang malaking bilang ng mga aklat, makumpleto ang pananaliksik sa literatura, at matulungan sa pagbuo ng mga hipotesis.

Ang pagdidisenyo ng intelligent agent ay nagpapabilis sa mga team ng siyentipiko na maabot ang kanilang cycle ng pagdidisenyo ng eksperimento mula sa ilang buwan hanggang isang linggo.
Ang experiment scheduling agent na inilunsad ng Jin Du Sheng Ke ay nagpapalagay sa Universal Instrument Abstraction Layer upang sirain ang mga hadlang sa protokolo sa pagitan ng iba’t ibang uri ng heterogenous na device.
Maaaring maunahan at maiayos nang isang paraan ang lahat ng mga aparato tulad ng PCR machine, microplate reader, flow cytometer, at automated liquid handling workstation. Ang sistema ay may nakabuilt na dynamic scheduling algorithm na kayang awtomatikong mag-iskedyul sa mga batch, maiiwasan ang mga konplikto sa real-time, at mag-record ng lahat ng mga parametrong eksperimento upang mabuo ang isang ma-track na audit trail.

Ibig sabihin nito, hindi na lang nagpapahinga ang AI sa yugto ng “pagbibigay ng mga ideya,” kundi talagang pumasok sa laboratorio, pinoproseso ang mga kagamitan, at nagpapatupad ng mga gawain, naging isang mapagkakatiwalaang “tulungan sa siyensya.”
Ang mga data ng pagkabigo, maaaring mas mahalaga kaysa sa mga data ng tagumpay
Ang mas malalim na halaga na lutas ng sistemang ito ay: gawing data na kayang masipsip ng sistema ang bawat eksperimento—ano man ang resulta nito.
Sa tradisyonal na laboratorio, ang isang pagkabigo ay maaaring isang linya lamang na “hindi tumutugma ang resulta sa inaasahan,” at ang karanasan ay nasa isip ng tao; kapag umalis ang tao, nawawala rin ang karanasan.
Sa loob ng sistemang BioFord, bawat pagkabigo ay isang mahalagang data para sa pagsasanay—ang lohika ng pagpili ng parameter, ang pag-record ng mga kondisyon ng kapaligiran, ang patotoo sa mga maling landas... lahat ay nagiging bahagi ng "karanasan" ng sistema.
Sa susunod, alam ng AI: hindi ito daan.
Kakaibang bagay ay sa larangan na ito, hindi yung may pinakamalakas na computing power ang nananalo, ni yung may pinakamalaking model.
Ang computing power ay mabibili, ngunit ang scientific data ay hindi mabibili.
Sinabi ni Kim Young-sung, tagapagtatag at CEO ng JinDu Life Science: "Sa proseso ng pagbuo, unti-unting naramdaman namin na ang AI for BioScience ay hindi lamang pagpapalaki ng mga modelo at datos. Para sa mga nagpapagawa ng eksperimento, ang huling solusyon ay ang paglutas sa problema kung bakit hindi sila makakagawa pagkatapos ng kalkulasyon, o kung bakit mali ang kanilang ginagawa."
Ito ang pinakamahalagang at pinakamahirap na mapalitan na kahon ng pagtatanggol sa AI4S赛道.
Apat na Oxford, kabilang ang senior classmate ni Luo Fuli
Noong 2022, nang makakuha si Kim Young-seong ng doktorado sa biyongkniya sa University of Oxford, nagkaroon siya ng isang pagpipilian.
Ang kanyang tagapayo ay miyembro ng Royal Society ng Britain at ang tagapagtatag ng Oxford Nanopore, ang pangunahing UK-based publicly listed company sa third-generation sequencing, si Hagan Bayley, at may malalim na tradisyon sa “pagpapatupad ng mga resulta” sa laboratorio. Ang pagtira sa Britain ay isang malinaw at madaling daan.
Ngunit pinili niya ang ibang daan—kinuha niya ang isang “prototype technology” mula sa laboratorio at isinama ito sa kanyang luggage para dalhin sa bansa. Kasama niya ang tatlong mga kaalumni ng Oxford: si Dr. Deng Siwei sa biyolohiya, si Sha Lei, assistant researcher sa School of Computer Science (PhD sa Computer Science ng Peking University at senior batch mate ni Luo Fuli, head ng Xiaomi’s large model), at si Zhou Tianyao, na may kakayahan sa pagpapatupad ng produkto. Ang apat nila ay may mga background sa biyoenhinyeriya, artificial intelligence, computational biology, at business operations—lahat ng ito ay kailangan. Noon ay nagtrabaho sila bilang isang team sa isang joint research project, kung saan pinagsama nila ang AI at transcriptomic technology para sa pagpapahula at pagdetect ng sakit. Ang apat nila ay parang mga piraso ng puzzle na perpektong nagpapuno sa isa’t isa, at kayang gawin ang mataas na interdisiplinary na pag-aaral.
Ang pangalan ng kumpanya ay "Jin Du Sheng Ke"; ang "Jin" ay hinango mula sa Oxford, na nagpapahiwatig na sila ay nagsimula sa mga pinakamataas na akademikong sentro tulad ng mga laboratoryo ng Oxford, habang ang "Du" ay nangangahulugan ng pagtuturo sa iba, na ang kanilang paniniwala ay ang katapusan ng AI for Science.
Sa kasalukuyan, ang BioFord Agent physical AI research platform ng Jin Du Sheng Ke ay naitatag na sa ilang kilalang unibersidad sa bansa, na nagdulot ng malaking epekto sa pagpapabilis ng panahon ng pananaliksik mula sa ilang buwan hanggang isang linggo.
Nagsimula na ang hangin: 4 rounds ng pagsasapulot ng kapital sa loob ng 1 taon, totoong 'true value' ang eksena ng kapital
Gayunpaman, ang paglalakad sa isang daan na “walang nakaraan” ay kasama ng pag-iisa.
Sa unang yugto ng pagbuo ng negosyo, maraming hamon. Noong panahong iyon, ang pagpapalaganap ng AI sa pagbuo ng negosyo ay malakas, ngunit ang mga pagsubok na “AI+” sa larangan ng biological science ay kaunti lamang. “Ang mga nagkakaunawa sa AI ay hindi laging nagkakaunawa sa biological science, at ang karamihan sa mga nagkakaunawa sa biological science ay hindi nagkakaunawa sa AI.”
Kinilala ni Kim Young-sung: "Isang panahon, hindi nakakaintindi ang mga investor kung ano ang ginagawa namin."
Pumili ang tim ng «pinakamahirap na daan»: magsimula sa malaking modelo ng biyolohikal na pundasyon, kung saan kaunting kompanya sa buong mundo ang gumagawa sa direksyong ito.
Sa taon na 2025, umabot ang pagbabago.
Noong panahong iyon, inilabas ng State Council ang "Mga Opinyon tungkol sa Malalim na Pagsasagawa ng Aksyon na 'AI+'", at kinabibilangan nito ang AI for Science, kaya nagsimula na ang trend sa sector na iyon.
Nakamit ng Jin Du Sheng Chuang ang tagumpay na “matapos ang 4 round ng pagsasapalaran sa loob ng isang taon.” Ang pangunahing timeline ng pagsasapalaran ng kumpanya ay isang pamantayan sa industriya.
Angel + Round: Pinamunuan ng Sequoia Capital China Seed Fund;
Pre-A+ round: Pinamumunuan ng RMB milyon sa pamamagitan ng Chuangdong Investment;
Pre-A+ round: Nakatanggap ng milyon-pesong investmiento mula sa Nanshan Zhanxin Tou;
Round A: Pinamunuan ng Gao Tejia Investment na halos isang milyon yuan.
Sinabi ni Teng Yuhang, Executive Partner ng Gaotai Investment: "Ang Jin Du Life Science ay nagpapalit ng mga pangunahang pag-aaral sa life science sa isang mag-subscribe at maaaring palawigin na 'compute power + eksperimento' na imprastruktura."
Ang mas malayong layunin ni Kim Young-sung: "Hindi namin sasaktan sa pagbebenta ng software; nais naming itayo ang intelligent operating system para sa larangan ng life sciences. Tulad ng ipinakilala ng Intel ang computing power sa panahon ng PC, nais naming ipakilala ang bagong paradigm sa pag-aaral ng life sciences sa panahon ng AI."
Mula sa Oxford Laboratory hanggang Shenzhen, mula sa walang pag-unawa hanggang sa pagtanggap ng malaking suporta mula sa mga pangunahing kapital, ang kuwento ng apat na Oxford alumni ay higit pa sa isang alamat ng pagbuo ng negosyo—ito ay isang malalim na tanong tungkol sa “Ano ang maaari nating gawin para sa tao?”
Kapag natututo ang AI na mag-isip nang buong gabi, ang mga pagkakatuklas sa agham ay maaaring hindi na nakasalalay sa pagkakataon ng mga genio, kundi maging isang makikita at inaasahang katotohanan. Sa landas na ito, sila ay bago lang nagsisimula.
Industry map: Jin Du ay lumabas sa lightweight physical AI pathway
Sa mas malawak na mapa ng AI for BioScience, ang Jin Du ay hindi nag-iisa, ngunit ang puntos ng pagsisimula ay magkakaiba.
Ang unang klase ay ang mga siyentipiko ng AI sa digital end.
Ang Biomni, na inihubog ng Stanford (na naging komersyal bilang Phylo), ay may higit sa 150 na espesyalisadong kasangkapan na nakakapagpapatakbo ng awtomatikong pagsusuri ng literatura, pagbuo ng hipotesis, at pag-analisa ng biyoinformatics.
Ang FutureHouse, na sinusuportahan ni Eric Schmidt, ay nakatuon sa pagbuo ng isang AI scientist na kayang gumawa ng sariling hipotesis at sumulat ng mga papel.
Gayunpaman, bagaman sila ay makapangyarihan, patuloy pa ring limitado sa digital na mundo.
Ikalawang klase, ang buong-stack na sariling landas.
Ang JingTai Technology ay nag-deploy ng higit sa 300 na workstations sa buong mundo gamit ang "AI + robotics".
Ang Lila Sciences, isang startup mula sa Flagship Pioneering, na nakakuha ng pondo na $5.5 bilyon, ay nagtatangkang hayaan ang AI na kumontrol ng buong proseso ng pagdidisenyo, pagpapatupad, at pag-redesign ng mga eksperimento, na may layunin na “scientific superintelligence”.
Pero lahat ng ito, sobrang mahal.
Ikatlo, ang end-to-end route.
Ang Insilico Medicine ay direktang pinapalaya ang AI sa kanilang sariling pipeline ng innoBated na gamot, at ang kanilang unang AI-based na gamot ay nasa Phase III clinical trial, ngunit sila ay mga “tagapagbuo ng kotse” at hindi mga “tagapagayos ng daan”.
Ang piliin ng Jin Du Sheng Ke ay: mag-focus sa pagbuo ng pisikal na Harness bilang imprastruktura para sa «huling kilometro» sa pagitan ng modelo at ng sistemang eksperimento sa katotohanan.
Hindi sumasali sa kompetisyon ng base, hindi nagtatayo ng end-to-end pipeline, hindi isang AI scientist na nakatuon lamang sa digital world. Ang paggawa lamang sa iisang kilometer ay mas magaan na paraan.
Sinabi nang malinaw ni Kim Young-sung: "Ang tunay na punto ng paghahati para sa AI for Science ay hindi kung gaano kagaya ng isang scientist ang sagot ng modelo, kundi kung kaya ba ng laboratorio na magsimula bilang isang patuloy na nag-aaral na sistema."
At sa global na AI for Science sector, Jin Du ay hindi lamang "nagpapatakbo ng huling kilometer".
Mas tiyak na ito ay nagpapasok sa huling kilometer upang makipag-ugnayan sa pagpaplano ng buong proseso ng pananaliksik.
Kumpara sa mga siyentipikong AI na mayroon lamang digital na kapasidad, ito ay nakakatugon sa pisikal na mundo; kumpara sa pagbuo ng sariling malaking gawaing siyentipiko, may pagkakataon itong kunin ang mga alam na laboratorio ng mga kliyente; kumpara sa mga kumpanyang AI sa paggawa ng gamot na end-to-end, hindi ito kailangang i-deposito ang kanyang kapalaran sa isang tiyak na clinical pipeline.

Ang totoong malalim na kalakalan nito ay hindi ang bilang ng parameter, kundi ang patuloy na akumulasyon ng mga track ng eksperimento, mga interface ng kagamitan, mga karanasan sa pagkabigo, at network na pagsasagawa sa pagitan ng mga laboratorio.
Tulad ng sinabi ni Kim Young-sung, ang libu-libong signal pathways at ang mga hindi pa nalalaman na mekanismo ng reaksyon sa loob ng mga organismo ay nakakatutuwa. "Gaano karami ang kagandahan ng biyolohiya, ganoon din ang kagandahan ng AI for Science."
Sa pamamagitan ng inteligensya ng AI upang masuri ang mga lihim ng buhay, ang mga mag-aaral mula sa Oxford ay kailangan lang mag-umpisa sa kanilang mga bituin at dagat.
Ang artikulong ito ay galing sa WeChat public account na “NeuralAISource”, may-akda: NeuralAISource; editor: Aeneas KingHZ
