Periodic Labs выпустила научную модель Periodic Neon: она основана на открытом万亿-параметрической модели Kimi K2.6, прошла промежуточное обучение и обучение с подкреплением на данных о материалах, полученных в лаборатории компании, и была возвращена в лабораторию для анализа результатов рентгеновской дифракции. На самом сложном внутреннем тесте FrontierXRD успех вырос с 2,7% у базовой модели до 55,3%; Periodic утверждает, что эта модель превосходит GPT‑6 Astra и Claude Fable 5.1 в этой конкретной задаче при более низкой стоимости. На самом деле важно не простое сравнение «1300 H200 против 100 000 GPU», а то, что компания создает замкнутый цикл: эксперимент — обучение — снова эксперимент. Физические лаборатории постоянно генерируют новые данные, которых нет в интернете, модель учится на них и определяет, что следует синтезировать и тестировать в следующем цикле. Однако все основные достижения пока основаны на внутренних тестах компании, используются оценки на основе LLM, и отсутствуют рецензируемые публикации или независимая воспроизводимость; Neon наследует дорогостоящую предварительную подготовку Kimi K2.6, а на момент проверки публичных ссылок для скачивания весов Neon не найдено.Автор статьи, источник: Periodic Labs
Он решает не проблему чата, а то, «что именно показал эксперимент»
Periodic Labs ищет лучшие сверхпроводники и магнитные материалы. Экспериментаторы могут задать целевой материал, выбрать исходные компоненты и температуру, но полученный порошок未必 будет ожидаемым продуктом: в нем могут одновременно присутствовать целевая кристаллическая фаза, непрореагировавшие исходные материалы и случайно образовавшиеся побочные продукты.
Исследователи обычно используют порошковую рентгеновскую дифракцию (XRD) для определения состава образца. После облучения кристалла рентгеновскими лучами формируется набор пиков; различные кристаллические структуры создают разные узоры, аналогичные «отпечаткам пальцев» материала.
Однако реальные образцы часто содержат несколько веществ, пики которых перекрываются. Математически хорошо подогнанный ответ может быть химически неразумным. Аналитикам также необходимо учитывать состав сырья, температуру, атмосферу, подвергался ли образец воздействию влаги, предыдущие эксперименты, базы данных кристаллов, термодинамические расчеты и соответствующие научные статьи, чтобы определить, какие фазы действительно присутствуют и в каких пропорциях.
Periodic утверждает, что анализ сложных образцов может занять у материаловедов несколько часов. В их оценке средний признанный ответ включал пять фаз. Именно это Neon автоматизирует: считывает дифракционные картины и полную экспериментальную информацию, обращается к базам данных и научному программному обеспечению, предлагает кандидатские фазы и многократно проверяет свои интерпретации.Исследовательская статьяуказывает, что модель уже внедрена в высокопроизводительную лабораторию компании.
Увеличение с 2,7% до 55,3%
Neon — это не новая базовая модель, обученная с нуля. Periodic начинается с открытой модели Kimi K2.6, проходит промежуточное обучение на научном корпусе, состоящем из академических статей, кода и проприетарных экспериментальных данных, а затем использует лабораторные данные для обучения с подкреплением.
На внутренней оценке FrontierXRD, самой сложной для компании, исходная успешность Kimi K2.6 составила 2,7%, а Neon достигла 55,3%, что примерно в 20 раз выше. Оценка включала 134 сложных образца от лаборатории Periodic.
Компания также протестировала 198 измерений XRD из сохранённых химических систем: сами эти системы и более крупные системы, содержащие их, не входили в обучающие данные, хотя меньшие подсистемы могли встречаться. Neon также показал лучший результат на этом наборе тестов по сравнению с другими передовыми моделями, однако Periodic подчеркнул, что этот набор задач легче, чем FrontierXRD.
(В оригинале есть диаграмма рассеяния производительность-стоимость, кривая масштабирования вычислительных ресурсов с использованием усиленного обучения и график обобщающих результатов на химических системах.)
Здесь «превосходит GPT‑6 Astra и Claude Fable 5.1» должно ограничиваться оценками XRD, проведенными Periodic самостоятельно. Это не означает, что Neon обладает более высокими общими способностями к рассуждению, программированию или языку, и по этому показателю нельзя составлять общий рейтинг моделей.
И результат в 55,3% означает, что почти половина самых сложных образцов остались нерешенными. Neon больше подходит в качестве инструмента для расширения возможностей ученых, чем в качестве полностью автономного эксперта по материалам без контроля.
Лаборатория начинает становиться средой для обучения моделей
Основная логика Periodic заключается в том, что качественные научные данные, предоставляемые открытым интернетом, в конечном счете ограничены, тогда как физические лаборатории могут непрерывно генерировать новые данные.
Традиционные научные статьи особенно склонны публиковать только успешные результаты. Информация о том, какие материалы не были синтезированы, какие температуры и пропорции не сработали, какие аномалии возникали в оборудовании, часто не попадает в статьи, но крайне ценна для планирования следующего раунда экспериментов. Автономная лаборатория может сохранять все результаты — успешные, неудачные и неопределённые.
Компания разбила открытие материалов на три циклических этапа:
Сначала предсказывают, какой материал следует синтезировать; затем — как его синтезировать; наконец, анализируют, что именно было получено в эксперименте. Результаты анализа возвращаются в модель для корректировки следующей гипотезы.
Neon в настоящее время в основном улучшает третий шаг. На следующем этапе Periodic планирует позволить модели напрямую планировать исследовательские проекты, составлять синтетические процедуры и выбирать следующий эксперимент с наибольшей информационной ценностью.
Это существенно отличается от математики и кодирования с использованием обучения с подкреплением: программы могут запускать тесты за несколько секунд, а математические ответы могут быть проверены формализованными системами; физические эксперименты требуют оборудования, материалов и времени, иногда длящегося несколько дней, а результаты могут быть неоднозначными. Компании не могут мгновенно запускать десятки тысяч реальных экспериментов, как это делается с генерацией кода, поэтому они должны в течение ожидания экспериментов максимально эффективно использовать накопленные данные для обучения и улучшения моделей.
1300 H200 не равны нулевому обучению модели с триллионами параметров
Periodic сообщает, что пиковый масштаб последнего цикла обучения Neon составил 1300 GPU Nvidia H200, охватывая этапы среднесрочного обучения и усиленного обучения. Компания сравнивает это с более чем 100 000 GPU Blackwell, которые, как утверждается, используются GPT‑6 Astra, чтобы продемонстрировать, что специализированные данные могут сократить вычислительные ресурсы, необходимые для обучения универсальным научным способностям.
Но это не сравнение по однородной базе.
Neon унаследовал веса с триллионом параметров от Kimi K2.6, а также все данные и вычислительные ресурсы, вложенные в его предварительное обучение. 1300 GPU H200 представляют собой только пиковую масштабируемость при дальнейшем обучении модели, а не полную стоимость получения этих триллионов параметров. Компания не раскрыла полную продолжительность обучения, совокупное количество часов GPU, потребление энергии или общие затраты.
Более ценными являются его инженерные детали.Статья об инфраструктуре утверждает, что компания внесла изменения в Megatron, SGLang, Miles и Ray, увеличив пропускную способность обучения длинных последовательностей в 4,1 раза по сравнению с базовой версией Megatron, а также повысив скорость декодирования моделей с триллионом параметров с 10 токенов в секунду на запрос до 25.
Один запрос XRD Agent может длиться более часа, в течение которого необходимо многократно запускать научные программы. Ранние системы заставляли модель генерировать код, запрашивающий 80 ГБ памяти, что приводило к сбою всей обучающей задачи. Затем команда разработала изолированную среду под названием pbox, в которой код модели выполняется в песочнице, а свободные ресурсы CPU на GPU-серверах используются для обработки научных инструментов.
(Исходный текст инфраструктуры содержит более чем час траектории работы агента, асинхронную архитектуру обучения и вывода, а также график сравнения производительности pbox-песочницы.)
Повышение не происходит только за счет модели — инструменты и контекст также важны
Periodic также сравнил две среды агентов с использованием того же Claude Opus 5.
Один из них — Claude Code в сочетании с открытым кристаллическим датабазом и стандартным ПО для XRD; другой — собственная научная среда Periodic, включающая экспериментальные данные, внутреннюю базу материалов, результаты моделирования и пользовательские аналитические инструменты.
При одинаковых моделях и сопоставимой стоимости одного анализа успех в среде Periodic в 3,8 раза выше. Это указывает, что узким местом задачи XRD являются не только веса модели, но и способность модели видеть правильные экспериментальные записи, использовать подходящие инструменты и сохранять накопленные результаты предыдущих исследований.
Таким образом, конкурентные преимущества Neon могут быть трудно воспроизвести просто копированием модели. Более важными активами являются лабораторные данные, базы данных, интерфейсы оборудования и аналитические процессы, лежащие в основе модели.
Это также означает, что научный ИИ может сформировать конкурентную среду, отличную от универсальных чат-моделей: чем больше лаборатория, тем больше проприетарных данных она генерирует; чем лучше модель, тем больше экспериментов она может направлять; новые эксперименты дополнительно расширяют преимущество в данных.
В отсутствие стандартных ответов Periodic использует ИИ для оценки ИИ
Сложный анализ XRD обычно не имеет дешевых, уникальных и автоматически проверяемых стандартных ответов. Хорошая подгонка формы пиков не означает, что результат соответствует химическим законам. Поэтому Periodic привлек трех докторантов, специализирующихся на материалах, чтобы они аннотировали тысячи паттернов, а затем обучили систему судей, состоящую из Claude Opus 5 и GPT‑5.6 Sol, для оценки выводов модели.
Межэкспертная согласованность между тремя человеческими экспертами составила 77,2%; согласованность между LLM-судьей и одним человеческим экспертом — 74,6%; согласованность с экспертным консенсусом — 84%.
Эти результаты показывают, что ИИ-судьи могут приближаться к экспертным суждениям, но не эквивалентны объективной истине. Между людьми изначально существуют разногласия, а модели судей могут также предпочитать определённый стиль ответов или пропускать ошибки, которые ни один из аннотаторов не выявил.
Более того, модель, рабочая среда, образцы и метод оценки FrontierXRD были разработаны Periodic. Хотя компания опубликовала множество методов и статистических данных, полный набор оценок, обучающие данные или веса Neon, позволяющие сторонним участникам воспроизвести результаты, пока не были выпущены, и результаты не прошли рецензирование коллегами.
Начало с открытыми весами не означает, что Neon уже открытый
Periodic четко указывает, что Neon был дообучен на основе модели с открытыми весами Kimi K2.6. Из-за этого некоторые социальные сети называют Neon «научной моделью с открытыми весами».
Однако на момент проверки официальный выпуск не предоставил карту модели Neon, лицензию или ссылку для скачивания весов, а также не предоставил код и данные для полного воспроизведения промежуточного обучения и обучения с подкреплением. Точнее будет сказать: Neon основан на модели с открытыми весами, а не то, что веса обученного Neon официально открыты для общественности.
Это различие важно. Внешние исследователи в настоящее время не могут независимо проверить результат в 55,3% и не могут определить, какая часть улучшений обусловлена экспериментальными данными, обучением с подкреплением, специализированными инструментами, бюджетом на рассуждение или средой оценки.
Настоящие изменения заключаются в том, что ИИ начал получать «новые данные из реального мира»
Ранние научные большие модели в основном обучались на знаниях, уже зафиксированных в научных статьях, патентах и базах данных. Periodic стремится сделать следующий шаг: заставить модель наблюдать за экспериментами, завершенными сегодня и никогда ранее не появлявшимися в интернете, а затем использовать эти результаты для направления завтрашних экспериментов.
Он ещё не является полным «AI-учёным». Люди всё ещё должны определять цели исследований, строить лаборатории, обслуживать оборудование, проектировать системы вознаграждений, проверять выводы XRD и решать, какие материалы стоит продолжать изучать. Neon пока доказал, что один из ключевых этапов можно значительно автоматизировать: с ростом количества экспериментов анализ результатов не должен полностью зависеть от пропорционального увеличения числа человеческих экспертов.
Если эта замкнутая система работает, то в будущем конкурентное преимущество научных моделей будет определяться не только тем, кто обладает большим количеством открытых текстов и GPU, но и тем, кто сможет стабильно проводить реальные эксперименты, фиксировать неудачные результаты и превращать натуральный мир в постоянно обновляемую обучающую среду.

