Periodic Labs entrena un modelo de billones de parámetros con 1300 GPUs H200 para experimentos científicos

iconMetaEra
Compartir
AI summary iconResumen
Periodic Labs ha entrenado su modelo Periodic Neon utilizando 1300 GPU H200 y datos en cadena de experimentos de laboratorio internos. Basado en Kimi K2.6, el modelo analiza resultados de difracción de rayos X y aumentó las tasas de éxito del 2,7% al 55,3% en el benchmark FrontierXRD. Periodic afirma que Neon supera a GPT-6 Astra y Claude Fable 5.1 a menor costo. El modelo opera en un sistema de bucle cerrado donde los datos en cadena de los experimentos alimentan el entrenamiento futuro. Los resultados son internos y no han sido revisados. Los pesos de Neon no están disponibles públicamente.
Periodic Labs lanzó el modelo científico Periodic Neon: parte del modelo de万亿 parámetros con pesos abiertos Kimi K2.6, se entrena en etapa intermedia y con aprendizaje por refuerzo utilizando datos de materiales generados en los laboratorios de la empresa, y luego se implementa de nuevo en el laboratorio para analizar resultados de difracción de rayos X. En la evaluación interna más difícil, FrontierXRD, la tasa de éxito aumentó del 2.7% del modelo base al 55.3%; Periodic afirma que supera a GPT‑6 Astra y Claude Fable 5.1 en esta tarea específica, al mismo tiempo que reduce costos. Lo realmente notable no es la comparación simplista de “1300 H200 frente a 100,000 GPU”, sino que la empresa está estableciendo un ciclo cerrado: experimento—entrenamiento—nuevo experimento: los laboratorios físicos generan continuamente nuevos datos no disponibles en internet, el modelo aprende de ellos y determina qué compuestos sintetizar y detectar en la próxima ronda. Sin embargo, todos los logros principales provienen actualmente de evaluaciones internas de la empresa, dependen de jueces basados en LLM y aún no han sido sometidos a revisión por pares ni reproducidos independientemente; Neon hereda los costosos resultados de preentrenamiento de Kimi K2.6, y hasta la fecha de consulta no se ha encontrado ninguna dirección pública para descargar los pesos de Neon.

Autor del artículo, fuente: Periodic Labs

No resuelve el problema del chat, sino "¿qué logró realmente el experimento?"

Periodic Labs busca mejores superconductores y materiales magnéticos. Los experimentadores pueden establecer el material objetivo, seleccionar los reactivos y la temperatura, pero el polvo resultante no siempre es el producto esperado: puede contener simultáneamente la fase cristalina objetivo, reactivos no reaccionados y subproductos inesperados.

Los investigadores suelen utilizar la difracción de rayos X en polvo, también conocida como XRD, para determinar la composición de las muestras. Cuando los rayos X inciden sobre un cristal, generan un conjunto de picos; diferentes estructuras cristalinas producen patrones distintos, similares a la “huella dactilar” del material.

Pero las muestras reales a menudo contienen múltiples sustancias cuyos picos se superponen. Una respuesta matemáticamente bien ajustada también puede ser químicamente irrazonable. Los analistas deben considerar además la composición de la materia prima, la temperatura, la atmósfera, si la muestra ha estado en contacto con humedad, experimentos anteriores, bases de datos de cristales, cálculos termodinámicos y artículos relacionados para determinar qué fases están realmente presentes y en qué proporciones.

Periodic afirma que las muestras complejas pueden requerir que los científicos de materiales las analicen durante varias horas. En sus evaluaciones, la respuesta aprobada promedio incluía cinco fases. Esto es exactamente lo que Neon busca automatizar: leer los patrones de difracción y el contexto experimental completo, invocar bases de datos y software científico, proponer fases candidatas y verificar repetidamente sus interpretaciones.Artículo de investigaciónafirma que el modelo ya se está utilizando en el laboratorio de alto rendimiento de la empresa.

Aumentar del 2.7% al 55.3%

Neon no es un nuevo modelo base entrenado desde cero. Periodic comienza con el modelo de pesos abiertos Kimi K2.6, realiza un entrenamiento intermedio con un corpus científico compuesto por artículos académicos, código y datos experimentales propietarios, y luego utiliza datos de laboratorio para el aprendizaje por refuerzo.

En la evaluación interna más difícil de la empresa, FrontierXRD, la tasa de éxito del Kimi K2.6 original fue del 2.7%, mientras que Neon alcanzó el 55.3%, aproximadamente 20 veces más. La evaluación incluye 134 muestras complejas del laboratorio Periodic.

La empresa también probó 198 mediciones XRD de sistemas químicos reservados: estos sistemas y los sistemas más grandes que los contienen no aparecieron en los datos de entrenamiento, aunque es posible que algunos sub-sistemas más pequeños sí lo hayan hecho. Neon también lideró en este conjunto de pruebas frente a los modelos de vanguardia evaluados, aunque Periodic señala explícitamente que este conjunto de preguntas es más fácil que FrontierXRD.

(El texto original incluye un gráfico de dispersión de rendimiento-coste, una curva de escalado de capacidad de cómputo de aprendizaje por refuerzo y un gráfico de resultados de generalización en sistemas químicos conservados.)

La afirmación de "superior a GPT-6 Astra y Claude Fable 5.1" debe limitarse exclusivamente a las evaluaciones XRD realizadas por Periodic. No implica que Neon posea mayores capacidades generales de razonamiento, programación o lenguaje, ni puede utilizarse para establecer un ranking integral de modelos.

Y un 55,3% de éxito significa que aún cerca de la mitad de las muestras más difíciles no se resolvieron con éxito. Neon es más adecuado como una herramienta para ampliar la capacidad de análisis de los científicos, que como un experto en materiales completamente automático sin necesidad de supervisión.

Los laboratorios comienzan a convertirse en entornos de entrenamiento para modelos.

La lógica central planteada por Periodic es que los datos científicos de alta calidad proporcionados por Internet abierto son finalmente limitados, mientras que los laboratorios físicos pueden generar continuamente nuevos datos.

Los artículos tradicionales tienden especialmente a publicar resultados exitosos. La información sobre qué materiales no se sintetizaron, qué temperaturas y proporciones fallaron, o qué anomalías presentaron los instrumentos a menudo no se incluye en los artículos, pero resulta muy valiosa para evaluar el próximo ciclo de experimentos. Un laboratorio autónomo puede conservar todos los resultados: exitosos, fallidos e inciertos.

La empresa divide el descubrimiento de materiales en tres pasos cíclicos:

Primero predice qué material debería fabricarse; luego predice cómo sintetizarlo; finalmente analiza qué se fabricó realmente en el experimento. Los resultados del análisis se devuelven al modelo para corregir la próxima hipótesis.

Neon actualmente se enfoca principalmente en el tercer paso. La próxima fase de Periodic espera que el modelo planifique directamente proyectos de investigación, escriba procesos de síntesis y elija el siguiente experimento con mayor valor informativo.

Esto tiene una diferencia importante con las matemáticas y el aprendizaje por refuerzo de código. Los programas pueden ejecutar pruebas en segundos, y las respuestas matemáticas también pueden verificarse mediante sistemas formalizados; sin embargo, los experimentos físicos requieren equipos, materiales y tiempo, a veces durando varios días, y los resultados pueden ser ambiguos. Las empresas no pueden iniciar decenas de miles de experimentos reales al instante, como lo hacen con la generación de código, por lo que deben aprovechar al máximo los datos ya acumulados para entrenar y mejorar los modelos mientras esperan los experimentos.

1300 unidades de H200 no equivalen a entrenar desde cero un modelo de billones de parámetros

Periodic afirmó que el pico de la última ejecución de entrenamiento de Neon fue de 1,300 Nvidia H200, cubriendo las fases de entrenamiento a mediano plazo y aprendizaje por refuerzo. La empresa lo compara con los más de 100,000 GPU Blackwell que se dice que utiliza GPT‑6 Astra, para ilustrar que los datos especializados pueden reducir la potencia de cómputo necesaria para entrenar capacidades científicas generales.

Pero esto no es una comparación homogénea.

Neon hereda los pesos de billones de parámetros de Kimi K2.6, así como todos los datos y la potencia de cómputo invertidos en su preentrenamiento previo. Las 1300 tarjetas H200 representan solo la escala máxima durante el entrenamiento adicional realizado por Periodic, no el costo total para adquirir esta capacidad de billones de parámetros. La empresa tampoco ha revelado la duración completa del entrenamiento, las horas acumuladas de GPU, el consumo energético o el costo total.

Lo más valioso son sus detalles de ingeniería.Artículo de infraestructura indica que la empresa modificó Megatron, SGLang, Miles y Ray para lograr un rendimiento de entrenamiento de secuencias largas 4.1 veces mayor que su línea base de Megatron, y aumentar la velocidad de decodificación de modelos de un billón de parámetros de 10 tokens por solicitud por segundo a 25.

Una inferencia de XRD Agent puede durar más de una hora, durante la cual se deben ejecutar repetidamente programas científicos. Los sistemas iniciales hicieron que el código generado por el modelo solicitara 80 GB de memoria, lo que provocó el colapso de toda la tarea de entrenamiento. El equipo luego desarrolló un entorno aislado llamado pbox, que ejecuta el código del modelo dentro de un entorno sandbox y utiliza los recursos de CPU ociosos del servidor GPU para procesar herramientas científicas.

(La infraestructura original contiene más de una hora de trayectoria de ejecución del agente, arquitectura de entrenamiento e inferencia asíncrona, y gráficos de comparación de rendimiento del sandbox pbox.)

La mejora no proviene solo del modelo; las herramientas y el contexto también son importantes

Periodic también comparó dos entornos de Agent usando el mismo Claude Opus 5.

Una opción es Claude Code junto con una base de datos de cristales de código abierto y software XRD estándar; la otra es el entorno científico propio de Periodic, que incluye contexto experimental, base de datos interna de materiales, resultados de simulación y herramientas de análisis personalizadas.

En condiciones de modelo idéntico y costo por análisis unitario similar, la tasa de éxito del entorno Periodic es 3.8 veces mayor que la del anterior. Esto indica que el cuello de botella en la tarea XRD no solo son los pesos del modelo, sino también si el modelo puede acceder a los registros experimentales correctos, utilizar las herramientas adecuadas y conservar los conocimientos acumulados en investigaciones anteriores.

Por lo tanto, la ventaja competitiva de Neon puede ser difícil de replicar completamente copiando un modelo. Los activos más importantes son los datos del laboratorio, las bases de datos, las interfaces de instrumentos y los procesos de análisis detrás del modelo.

Esto también implica que la IA científica podría formar un panorama competitivo diferente al de los modelos de chat generales: cuanto más grande sea el laboratorio, más datos propietarios generará; cuanto mejor sea el modelo, más experimentos podrá guiar; y los nuevos experimentos ampliarán aún más la ventaja en datos.

Cuando no hay una respuesta estándar, Periodic usa IA para calificar a la IA.

El análisis complejo de XRD generalmente no tiene respuestas baratas, únicas y verificables automáticamente. Un buen ajuste de la forma del pico no implica que los resultados sean coherentes con las leyes químicas. Por ello, Periodic hizo que tres doctores especializados en materiales etiquetaran miles de patrones, y luego entrenó un sistema de evaluación compuesto por Claude Opus 5 y GPT‑5.6 Sol para calificar las salidas del modelo.

La tasa de acuerdo entre pares entre tres expertos humanos es del 77,2%; la tasa de acuerdo entre el juez LLM y un solo experto humano es del 74,6%; en comparación con el consenso de los expertos, la tasa de acuerdo es del 84%.

Estos resultados indican que los árbitros de IA pueden aproximar el juicio de los expertos, pero no son equivalentes a la verdad objetiva. Ya existe divergencia entre humanos, y los modelos de árbitro también pueden preferir cierto estilo de respuesta o pasar por alto errores que todos los anotadores conjuntamente no identificaron.

Es más importante destacar que el modelo, el entorno de trabajo, las muestras y el método de evaluación de FrontierXRD fueron diseñados por Periodic. Aunque la empresa ha publicado muchos métodos y estadísticas, aún no ha liberado el conjunto completo de evaluaciones, los datos de entrenamiento ni los pesos de Neon disponibles para que terceros vuelvan a ejecutarlos, y los resultados tampoco han sido sometidos a revisión por pares.

Comenzar con pesos abiertos no significa que Neon ya sea de código abierto

Periodic aclara que Neon se entrenó continuamente a partir del modelo de pesos abiertos Kimi K2.6. Algunos medios sociales han denominado por ello a Neon como "modelo científico de pesos abiertos".

Pero hasta la fecha de la consulta, la publicación oficial no proporciona la ficha del modelo, la licencia ni la dirección de descarga de los pesos de Neon, ni tampoco código o datos completos para reproducir el entrenamiento intermedio y el aprendizaje por refuerzo. La afirmación precisa es que Neon se basa en modelos con pesos abiertos, no que los pesos entrenados de Neon ya se hayan puesto oficialmente a disposición del público.

Esta distinción es importante. Los investigadores externos actualmente no pueden verificar independientemente el 55,3% ni determinar cuánto de la mejora proviene de los datos experimentales, el aprendizaje por refuerzo, las herramientas dedicadas, el presupuesto de razonamiento o el entorno de evaluación.

El verdadero cambio es que la IA ha comenzado a consumir "nuevos datos del mundo real"

Los grandes modelos científicos anteriores aprendieron principalmente conocimientos ya documentados en artículos, patentes y registros de bases de datos. Periodic intenta dar el siguiente paso: permitir que el modelo observe experimentos recién completados hoy y que nunca antes han aparecido en internet, y luego utilizar estos resultados para guiar los experimentos de mañana.

Aún no es un "científico de IA" completo. Los humanos deben seguir determinando los objetivos de investigación, construyendo laboratorios, manteniendo instrumentos, diseñando recompensas, revisando las conclusiones de XRD y decidiendo qué materiales merecen más inversión. Neon actualmente demuestra que uno de los componentes clave puede ser significativamente automatizado: a medida que aumenta el número de experimentos, el análisis de resultados no necesita depender proporcionalmente de un aumento en la cantidad de expertos humanos.

Si este ciclo cerrado funciona, la ventaja competitiva de los modelos científicos futuros ya no dependerá únicamente de quién posea más textos públicos y GPU, sino también de quién pueda ejecutar experimentos reales de manera estable, registrar resultados fallidos y convertir el mundo natural en un entorno de entrenamiento actualizado continuamente.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.