El modelo de inteligencia artificial para ciencias de la vida chino GeneLLM surge como el "DeepSeek biológico"

icon MarsBit
Compartir
AI summary iconResumen
Las noticias de AI y cripto de MarsBit destacan un nuevo desarrollo en el sector de las ciencias de la vida en China. Un equipo de cuatro exalumnos de Oxford ha desarrollado GeneLLM, un modelo grande de multi-ómica de Jindu Life Sciences. Publicado en Nature Communications y Advanced Science, el modelo utiliza datos omicos crudos para el preentrenamiento. Con 1.5 mil millones de parámetros y 3.5 billones de pares de bases, se enfoca en el descubrimiento de fármacos, la medicina de precisión y la biología sintética. Las tendencias de los datos de inflación siguen siendo un foco clave para los inversores, pero este avance en IA muestra un fuerte impulso en el espacio bio-tecnológico.

DeepSeek -V4-Flash acaba de revolucionar el mundo de los modelos generales universales, y poco después lo siguió la versión china de Deepseek para ciencias de la vida.

Recientemente, Jindu Life Science (fundada por cuatro académicos graduados de la Universidad de Oxford) presentó su modelo de lenguaje grande especializado en ciencias de la vida, GeneLLM, desarrollado internamente, que ha sido publicado en prestigiosas revistas académicas internacionales: Nature Communications y Advanced Science.

Como el primer modelo de lenguaje multiomico del mundo entrenado directamente con datos crudos de omica, GeneLLM es un modelo revolucionario tras AlphaFold de Google y EVO 2 de la Universidad de Stanford, llenando el vacío de los modelos base de ciencias de la vida en China y siendo considerado el Deepseek de las ciencias de la vida china, permitiendo que la IA comience a comprender múltiples «lenguajes» y todo el «sistema» de la vida.

Jindu Life Science

Jindu Life Science

Jindu Life Science

Predice el siguiente mensaje de vida como si predijeras el próximo token.

La identificación de enfermedades es solo una aplicación de GeneLLM; lo que JinDu Life Science realmente quiere lograr es crear el «Claude Code» del campo de las ciencias de la vida.

ChatGPT, Claude, DeepSeek El núcleo de los grandes modelos de lenguaje es la predicción del siguiente token.

GeneLLM sigue una idea similar, pero en lugar de predecir texto, predice información biológica.

Las cuatro bases en la secuencia de RNA: adenina (A), uracilo (U), guanina (G) y citosina (C), se convierten en los tokens básicos que permiten a GeneLLM comprender el lenguaje de la vida.

El análisis tradicional de bioinformática generalmente depende de la anotación génica, el alineamiento de secuencias y etiquetas definidas manualmente. Aunque este método es preciso, limita previamente el rango de conocimiento del modelo y también puede perder numerosas señales biológicas desconocidas ocultas en los datos originales.

GeneLLM, en cambio, sigue un camino diferente, aprendiendo directamente las leyes de la vida a partir de datos de secuenciación crudos no procesados.

Utiliza datos brutos de múltiples omicas, como transcriptómica, proteómica y metabolómica, como datos de entrenamiento para permitir que el modelo descubra patrones relacionados con enfermedades de forma autónoma.

Actualmente, GeneLLM ha completado la preentrenación del modelo con 1.5 mil millones de parámetros y 3.5 billones de secuencias de bases; la versión XLarge ha logrado la preentrenación del modelo con 30 mil millones de parámetros, ampliando continuamente la barrera tecnológica.

Como el primer modelo de lenguaje multiomico preentrenado con datos de secuenciación original a nivel mundial, GeneLLM incluye dos etapas:

(1) Preentrenamiento no supervisado y minería de prototipos

(2) Afinación de enfermedades a nivel de paciente

Jindu Life Science

GeneLLM primero necesita resolver un problema:

¿Cómo convertir datos complejos de la vida en un lenguaje que la IA pueda entender?

En procesamiento de lenguaje natural, el algoritmo BPE divide las oraciones en tokens; mientras que GeneLLM divide los fragmentos de secuenciación de ARN de aproximadamente 150 pb en tokens biológicos mediante una ventana deslizante de 7 bases (7-mer).

Luego, el modelo utiliza la arquitectura Transformer para predecir directamente el siguiente nucleótido sin anotaciones genéticas ni etiquetas humanas.

Esto significa que la IA no mira primero un «diccionario» preparado por humanos, sino que aprende directamente de las señales originales de la vida.

Durante el entrenamiento, GeneLLM procesó aproximadamente decenas de trillones de reads de RNA, entrenado en un clúster de cien GPUs NVIDIA A100.

Hasta ahora, las capacidades de generalización de GeneLLM han comenzado a «emergir».

Como un importante avance innovador en el campo de las ciencias de la vida, el modelo nacional de ciencias de la vida GeneLLM puede aplicarse en múltiples áreas, como el desarrollo de nuevos fármacos, medicina de precisión, biología sintética, monitoreo ambiental, microbiología y agricultura biológica, así como diseño de proteínas y moléculas, y es uno de los pocos modelos a gran escala en el mundo que han logrado implementación práctica en escenarios reales.

Jindu Life Science

Después de examinar las innovaciones fundamentales de GeneLLM en «datos, arquitectura, entrenamiento», podemos comprender realmente: por qué representa la «versión biológica de China» DeepSeek ».

Silicon Valley ha acumulado decenas de miles de H100 para construir modelos de billones de parámetros, DeepSeek Mediante la innovación algorítmica para mejorar la eficiencia del poder de cómputo, GeneLLM también logra mover miles de millones de datos de ciencias de la vida con un esfuerzo mínimo.

Si AlphaFold permitió que la IA entendiera por primera vez la «estructura» de la vida, y EVO2 permitió que la IA comenzara a comprender el «código» de la vida, entonces GeneLLM intenta comprender aún más el «sistema» de la vida.

Jindu Life Science

Lo que es aún más impresionante es la eficiencia. Los métodos tradicionales dependen de secuenciación profunda de 6 Gb, con costos elevados y dificultad para su implementación. GeneLLM mantiene un AUC > 0.8 incluso con una profundidad extremadamente baja de 1 Gb (reducción de costos del 83%).

This means there is real potential to make precision medicine for all a reality.

Surge un nuevo paradigma de investigación: permitir que la IA aprenda de los datos biológicos, llevando a las ciencias de la vida a una nueva etapa predecible, calculable y escalable.

No solo es un modelo, sino también la infraestructura inteligente de la última milla

Pero el enfoque de Jin Du Shengke no se limita al modelo base.

Con el modelo multimodal GeneLLM como base para la comprensión de la vida, Jin Du Biotech ha construido un sistema de ejecución que conecta la inteligencia artificial con el mundo físico, logrando un ciclo completo de AI for Science mediante la capa de ejecución experimental Harness y el bucle de datos DBTL (Diseño-Construcción-Prueba-Aprendizaje), que abarca la comprensión de las leyes de la vida, la generación de hipótesis científicas, la validación experimental automatizada y la optimización continua.

Como dijo Liam Fedus, exvicepresidente de OpenAI y responsable de post-entrenamiento, los LLM actuales ya han agotado el texto y el código limitados disponibles en internet, y los siguientes avances científicos importantes dependerán de la iteración experimental.

Jindu Life Science

Es decir, no se puede descubrir nuevo conocimiento solo leyendo el contenido escrito por humanos; la IA debe realizar experimentos por sí misma.

Pero surge la pregunta:

Los servicios de internet tienen API por naturaleza, y la información en red es inherentemente digital, pero los equipos de investigación provienen de diferentes fabricantes, tienen protocolos distintos, son complejos y costosos, y nadie puede derribar y reconstruir todo en unos meses.

La mayoría de los laboratorios de hoy están diseñados para humanos: paneles de instrumentos, movimientos de pipeteo, estado de las muestras, juicios en el lugar, la gran mayoría no se convierten en señales comprensibles para máquinas.

La inteligencia artificial ha entrado en el laboratorio; ahora no se trata solo de la capacidad de los modelos, sino también de una nueva infraestructura.

Por lo tanto, la IA entra en el laboratorio, y actualmente no se trata solo de la capacidad del modelo, sino también de un harness físico: convertir el laboratorio en un sistema compilable, programable, observable y rastreable.

This is the true last mile of AI4S.

BioFord Harness, hace que el laboratorio comience a «moverse por sí mismo»

For this, Jindu developed a system called BioFord Harness.

Esta es una infraestructura que conecta la inteligencia artificial con laboratorios físicos.

No se trata de hacer que un brazo robótico imite la mano humana, sino de convertir el laboratorio en un sistema programable, programable, observable y rastreable.

Durante este proceso, el harness físico debe completar al menos tres tareas:

1. Compilar la intención científica o el DSL experimental en instrucciones ejecutables por diferentes dispositivos;

2. Realizar la gestión de programación, recursos y restricciones de seguridad entre múltiples dispositivos, y manejar excepciones;

3. Reenvíe los resultados del experimento, los registros del equipo y los parámetros del entorno como entrada para el próximo modelo y diseño experimental.

Pregunta científica → Comprensión por IA → Plan experimental → Programación de equipos → Ejecución → Retorno de datos → Optimización del modelo → Siguiente ciclo.

Así se puso en marcha el volante de datos de un experimento científico.

Jindu Life Science

Cinco agentes inteligentes convierten el proceso de investigación en una línea de producción

La plataforma de investigación de inteligencia encarnada BioFord Agent conecta hacia abajo la capa física del laboratorio y soporta hacia arriba la capa cognitiva de los científicos, utilizando IA física para superar la brecha entre el razonamiento y la ejecución.

En el nivel cognitivo, el BioFord Agent está compuesto por una red colaborativa de cinco agentes que integran todo el proceso de investigación en ciencias de la vida, aumentando la eficiencia científica por varios factores.

Agente de búsqueda de literatura

Agente de diseño experimental

Agentes de inteligencia científica

Agente de programación de experimentos

Agente de análisis de datos

Por ejemplo, un agente de búsqueda bibliográfica puede ayudarte rápidamente a buscar y leer una gran cantidad de documentos, completar una revisión de la literatura y asistir en la formulación de hipótesis.

Jindu Life Science

El agente de diseño experimental reduce el ciclo de diseño de experimentos de meses a una semana para los equipos de investigación.

El agente de programación de experimentos lanzado por Jin Du Sheng Ke supera las barreras de protocolo entre diversos equipos heterogéneos, basándose en la capa de abstracción universal de instrumentos (Universal Instrument Abstraction Layer).

Tanto los termocicladores, los lectores de microplacas, los citómetros de flujo como las estaciones de trabajo de pipeteo automatizado pueden ser gestionados y programados de forma unificada. El sistema incluye un algoritmo de programación dinámica que permite la programación por lotes automática, la evitación en tiempo real de conflictos y el registro completo de los parámetros experimentales, formando una cadena de auditoría rastreable.

Jindu Life Science

Esto significa que la IA ya no se queda en la fase de "dar consejos", sino que realmente entra en el laboratorio, opera equipos y ejecuta tareas, convirtiéndose en un "asistente de investigación" confiable.

Los datos fallidos pueden ser más valiosos que los datos exitosos

El valor más profundo que resuelve este sistema es convertir cada experimento —ya sea exitoso o fallido— en datos que el sistema pueda procesar.

En un laboratorio tradicional, un registro de fracaso podría ser simplemente una línea que dice «los resultados no coincidieron con lo esperado», y la experiencia reside en la mente de las personas; cuando se van, la experiencia también se pierde.

En el sistema BioFord, cada fallo es un valioso conjunto de datos de entrenamiento: la lógica de selección de parámetros, el registro de condiciones ambientales, la demostración de caminos erróneos... todo se acumula y se convierte en parte de la "experiencia" del sistema.

La próxima vez, la IA sabrá: este camino no lleva a ningún lado.

Curiosamente, en este sector, no gana el que tiene la mayor potencia de cálculo, ni el que tiene el modelo más grande.

La capacidad de cálculo se puede comprar, pero los datos de investigación no.

El fundador y CEO de Jindu Shengke, Kim Young-sung, dijo: «Durante el proceso de desarrollo, gradualmente nos dimos cuenta de que AI for BioScience no se trata simplemente de acumular modelos y datos. Para quienes realizan experimentos, la verdadera solución sigue siendo superar el dilema de que, aunque se calcula, no se sabe cómo hacerlo, y cuando se hace, no es correcto».

This is the most important and hardest-to-replicate moat in the AI4S sector.

Cuatro oxfordianos, uno de los cuales es el compañero de laboratorio de Luo Fuli

En 2022, Jin Yeong-seong enfrentó una decisión en el momento en que obtuvo su doctorado en bioingeniería de la Universidad de Oxford.

Su mentor es Hagan Bayley, miembro de la Royal Society de Reino Unido y fundador de Oxford Nanopore, la empresa británica cotizada en bolsa líder en secuenciación de tercera generación, con una profunda tradición de "aplicación de resultados" en el laboratorio. Quedarse en Reino Unido era un camino claro y despejado.

Pero él eligió otro camino: llevar consigo una «tecnología prototipo» del laboratorio en su maleta y regresar a su país. Lo acompañaban tres exalumnos de Oxford: el doctor en biología Deng Siwei, el investigador asociado de la Escuela de Informática Sha Lei (doctor en informática por la Universidad de Pekín y compañero de laboratorio de Luo Fuli, responsable del gran modelo de Xiaomi), y Zhou Tianyao, especialista en la implementación de productos. Los cuatro poseen conocimientos complementarios en ingeniería biológica, inteligencia artificial, biología computacional y operaciones comerciales, todos indispensables. Anteriormente habían formado un equipo para realizar proyectos de investigación conjunta, combinando IA y tecnología de transcriptoma para lograr la predicción y detección de enfermedades. Los cuatro encajaban como piezas de un rompecabezas, complementándose perfectamente para llevar a cabo investigaciones altamente interdisciplinarias.

El nombre de la empresa, "Jin Du Sheng Ke", toma "Jin" de Oxford, simbolizando que parten de los más altos niveles académicos, como los laboratorios de Oxford, y "Du" significa ayudar a los demás, que es el destino que ellos consideran que debe alcanzar la IA para la ciencia.

Actualmente, la plataforma física de inteligencia artificial para investigación científica BioFord Agent de Jin Du Sheng Ke ya se ha implementado en algunas universidades reconocidas del país, logrando resultados notables al reducir el ciclo de investigación de varios meses a una semana.

El viento ha comenzado a soplar: 4 rondas de financiación en un año, el capital en pleno "¡Qué rico!"

Sin embargo, recorrer un camino "sin precedentes" inevitablemente conlleva soledad.

Al inicio del emprendimiento, los desafíos eran numerosos. En ese entonces, el emprendimiento en IA estaba en auge, pero los intentos de «IA+» en el campo de las ciencias biológicas eran escasos. «Quienes entienden de IA no necesariamente entienden de ciencias biológicas, y la mayoría de quienes entienden de ciencias biológicas no entienden de IA.»

Kim Yeong-seong admitió: "Los inversores no podían entender en qué estábamos trabajando."

El equipo eligió el camino «más difícil»: comenzar con un modelo base de biología; solo unas pocas empresas en todo el mundo trabajan en esta dirección.

En 2025, surgió un giro.

En ese momento, el Consejo de Estado emitió la "Opinión sobre la implementación profunda de la acción 'IA +'", y AI for Science se incluyó entre ellas, lo que generó impulso en el sector.

Jindu Shengke logró el récord de "realizar 4 rondas de financiación en un año". La línea temporal principal de financiación de la empresa es un referente de la industria.

Ronda Ángel: liderada por el fondo de semilla de Sequoia Capital China;

Ronda Pre-A+: financiada en millones por Chuangdong Investment como líder;

Ronda Pre-A+: Recibe una inversión de millones de dólares de Nanshan Zhanxin Tou;

Ronda A: liderada por Gao Tejia Investment con cerca de 100 millones de yuanes.

Teng Yuhang, socio ejecutivo de Gao Tejia Investment, dijo: «Jindu Life Science ha convertido la investigación básica en ciencias de la vida en una infraestructura de 'potencia de cálculo + experimentación' suscribible y escalable.»

Y el objetivo de Kim Young-sung es aún más ambicioso: "No nos conformamos con vender software; queremos construir un sistema operativo inteligente para el campo de las ciencias de la vida. Así como Intel definió la capacidad de cómputo en la era de la PC, deseamos definir un nuevo paradigma de investigación en ciencias de la vida en la era de la IA."

Desde el laboratorio de Oxford hasta Shenzhen, desde ser incomprendidos hasta recibir inversión de capital de primer nivel, la historia de cuatro personas de Oxford no es solo una leyenda emprendedora, sino también una profunda pregunta sobre «¿Qué podemos hacer por la humanidad?».

Cuando la IA aprende a hacer investigación «durante toda la noche» por sí misma, los descubrimientos científicos podrían dejar de depender de la inspiración fortuita de los genios y convertirse en algo predecible y inevitable. Este camino, apenas lo están comenzando.

Mapa de la industria: Jin Du adopta una ruta de IA física ligera

En el mapa más amplio de AI for BioScience, Jin Du no está solo, pero el punto de entrada es completamente diferente.

La primera categoría son los científicos de IA digitales.

Biomni, incubada por Stanford (comercializada como Phylo), cuenta con más de 150 herramientas profesionales que automatizan revisiones bibliográficas, generación de hipótesis y análisis bioinformáticos.

FutureHouse, respaldada por Eric Schmidt, se dedica a construir científicos de IA capaces de generar hipótesis y redactar artículos por sí mismos.

Sin embargo, aunque son potentes, aún se limitan al mundo digital.

La segunda categoría es la ruta de desarrollo integral y autónoma.

Jingtai Technology ha desplegado más de 300 estaciones de trabajo en todo el mundo con la combinación de "IA + robótica".

Lila Sciences, incubada por Flagship Pioneering, ha recaudado 550 millones de dólares para intentar que la IA asuma completamente el diseño, la ejecución y el rediseño de experimentos, con el objetivo de lograr una «superinteligencia científica».

Pero todo esto es demasiado costoso.

La tercera categoría es la ruta de gestión punto a punto.

Insilico Medicine está impulsando directamente la IA en su propia cartera de medicamentos innovadores; su primer medicamento basado en IA ya ha ingresado a la fase III de ensayos clínicos, pero son «constructores de vehículos» y no «reparadores de caminos».

La elección de Jin Du Shengke es: centrarse en construir el harness físico, actuando como infraestructura para el "último kilómetro" entre los modelos y los sistemas experimentales físicos.

No participar en la competencia de bases, no construir tuberías de extremo a extremo, no ser un científico de IA puramente del mundo digital. Solo enfocarse en ese último kilómetro es sin duda un enfoque más ligero.

Kim Yeong-seong lo expresó claramente: "El verdadero punto de inflexión en AI for Science no es que los modelos respondan como científicos, sino si los laboratorios pueden comenzar a funcionar como un sistema de aprendizaje continuo."

Además, en el ámbito global de AI for Science, Jindu no se limita simplemente a «hacer solo la última milla».

Más precisamente, entra por la última milla para competir por el control de toda la cadena de trabajo científica.

En comparación con científicos de IA puramente digitales, puede interactuar con el mundo físico; en comparación con fábricas científicas de activos pesados propias, tiene la oportunidad de asumir los laboratorios existentes de los clientes; en comparación con empresas de IA farmacéutica de extremo a extremo, no necesita apostar su futuro a una sola línea clínica.

Jindu Life Science

Su verdadera ventaja competitiva no será el número de parámetros, sino el acúmulo continuo de trayectorias experimentales, interfaces de equipos, experiencias de fracaso y redes de ejecución entre laboratorios.

Como dijo Kim Young-sung, los miles de vías de señalización en los organismos vivos y los mecanismos de reacción aún desconocidos son fascinantes. "Cuán rica es la biología, tan hermoso es el futuro de la IA para la ciencia."

Con la inteligencia artificial para explorar los misterios de la vida, el vasto universo de estos estudiantes de Oxford acaba de comenzar.

Este artículo proviene del canal de WeChat "Neozh Yuan", autor: Neozh Yuan; editor: Aeneas KingHZ

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.