Periodic Labsは科学モデル「Periodic Neon」をリリースした。これは、オープンウェイトの兆パラメータモデル「Kimi K2.6」を出発点とし、同社の実験室で生成された材料データを用いて中期トレーニングと強化学習を実施した後、X線回折結果の分析に再び実験室に導入される。最も困難な内部評価「FrontierXRD」では、成功率が基礎モデルの2.7%から55.3%まで向上した。Periodicは、この特定のタスクにおいて、GPT‑6 AstraやClaude Fable 5.1を上回り、コストも低いと主張している。注目すべきは「1300枚のH200が10万枚のGPUに勝つ」という単純な比較ではなく、同社が実験—トレーニング—再実験のサイクルを構築している点である。物理的な実験室はインターネット上に存在しない新規データを継続的に生成し、モデルはそれから学習し、次に合成・検査すべき物質を決定する。ただし、現在得られているすべての主要な成果は同社の内部評価に基づいており、LLMによる評価に依存しており、査読済みまたは独立した再現はまだ行われていない。NeonはKimi K2.6の高コストなプリトレーニング成果を継承しており、調査時点ではNeonの重みの公開ダウンロード先は見つかっていない。文章作者、来源:Periodic Labs
それはチャットの問題を解決するのではなく、「実験が実際に何を達成したか」です
Periodic Labsは、より優れた超伝導体および磁性材料を探しています。実験者は目的の材料を設定し、原料と温度を選択できますが、最終的に得られる粉末は必ずしも期待される生成物とは限らず、目的の結晶相、反応しきらなかった原料、および予期しない副産物が同時に含まれる可能性があります。
研究者は通常、粉末X線回折(XRD)を使用して試料の成分を判断します。結晶にX線を照射すると一連のピークが形成され、異なる結晶構造は材料の「指紋」に類似した異なるパターンを生み出します。
しかし、実際の試料には多くの物質が含まれており、ピークが重複することがよくあります。数学的に良好にフィットした解でも、化学的に不合理な場合があります。分析者は、原料、温度、雰囲気、試料が水分に接触したかどうか、以前の実験、結晶データベース、熱力学計算、および関連論文を総合的に考慮して、どの物相が実際に存在し、それぞれの比率がどれほどであるかを判断する必要があります。
Periodicは、複雑なサンプルには材料科学者が数時間かけて分析する必要があると述べている。その評価では、認可された回答には平均して5つの物相が含まれていた。これがNeonが自動化しようとしている作業である:回折図と実験の全体的な背景を読み取り、データベースおよび科学ソフトウェアを呼び出し、候補となる物相を提案し、自らの解釈を繰り返し検証する。研究文章によると、このモデルは同社の高スループット実験室で使用されている。
2.7%から55.3%へ向上
Neonはゼロから事前学習された新しい基礎モデルではありません。Periodicは、オープンウェイトのKimi K2.6から開始し、学術論文、コード、および独自の実験データで構成される科学コーパスで中期学習を行い、その後、実験室データを用いて強化学習を行います。
社内最難易度の評価FrontierXRDにおいて、元のKimi K2.6の成功率は2.7%であり、Neonは55.3%に達し、約20倍の向上を実現しました。この評価には、Periodicラボから提供された134の複雑なサンプルが含まれています。
会社は、保存化学体系から得られた198回のXRD測定をテストしました:これらの体系およびそれらを含むより大きな体系は訓練データに含まれていませんが、小さなサブ体系は出現していた可能性があります。Neonはこのテストセットでも、評価された最先端モデルを上回りましたが、Periodicは、このセットがFrontierXRDよりも難しいと明確に指摘しています。
(元の文には、性能対コストの散布図、強化学習の計算能力拡張曲線、および化学系における一般化結果のグラフが含まれています。)
「GPT-6 AstraおよびClaude Fable 5.1を上回る」は、Periodicが自社で構築したXRD評価に限定されます。これはNeonがより優れた汎用推論、プログラミング、または言語能力を備えていることを意味せず、総合モデルランキングを構築する根拠にはなりません。
また、55.3%の成功率は、最も困難なサンプルのほぼ半分が解決できていないことを意味します。Neonは、審査不要の完全自動化された材料専門家というより、科学者の分析能力を拡張するツールとして適しています。
実験室がモデルのトレーニング環境となり始めています
Periodicが提唱する核心的なロジックは、公開インターネットが提供する高品質な科学データは結局のところ限られているのに対し、実体の実験室は新規データを継続的に生成できるということである。
従来の論文は、成功した結果の発表に偏りがちです。どの材料が合成されなかったか、どの温度や配合が失敗したか、装置にどのような異常が生じたかといった情報は、論文には記載されませんが、次の実験を判断する上で非常に価値があります。自律実験室は、成功・失敗・不確定な結果のすべてを保存できます。
会社は材料の発見を三つのサイクルステップに分割しています:
まずどのような材料を合成すべきかを予測し、次にその合成方法を予測し、最後に実験で実際に何が合成されたかを分析する。この分析結果をモデルにフィードバックして、次の仮説を修正する。
Neonは現在、ステップ3の改善に主眼を置いています。Periodicの次段階では、モデルが研究プロジェクトを直接計画し、合成プロセスを記述し、次に最も情報価値の高い実験を選択できるようにすることを目指しています。
これは数学やコードの強化学習と重要な違いです。プログラムは数秒でテストを実行でき、数学的な答えは形式化システムによって検証可能ですが、物理実験には装置、材料、時間が必要で、時には数日かかる上、結果が曖昧になることもあります。企業はコードを生成するように数万の実際の実験を即座に起動することはできず、したがって実験の待機中にすでに蓄積されたデータを活用してモデルを訓練し改善しなければなりません。
H200を1300枚所有しても、ゼロから兆パラメータモデルを訓練するのと同じではない
Periodicは、Neonの最終訓練ランのピーク規模が1300枚のNvidia H200であり、中期訓練および強化学習段階をカバーしていると述べた。同社は、GPT‑6 Astraが使用しているとされる10万枚以上のBlackwell GPUと比較し、専門データが汎用科学能力の訓練に必要な計算リソースを削減できることを示している。
これは同じ基準での比較ではありません。
NeonはKimi K2.6の兆パラメータ重みを継承し、その前段階での事前学習に費やされたすべてのデータと計算リソースも引き継いでいます。1300枚のH200は、Periodicがモデルを継続して学習する際のピーク規模を示すにすぎず、この兆パラメータの能力を得るためにかかった全コストを意味しません。同社は、総学習時間、累計GPU時間、エネルギー消費量、または総費用についても公表していません。
より価値あるのはそのエンジニアリングの詳細である。インフラストラクチャ記事は、同社がMegatron、SGLang、Miles、Rayを基に修正を加え、長シーケンストレーニングのスループットをMegatronベースラインの4.1倍に向上させ、兆パラメータモデルのデコード速度を1リクエストあたり毎秒10トークンから25トークンに引き上げたと述べている。
XRD Agentの1回の推論は1時間以上続くことがあり、その間、科学プログラムを繰り返し実行する必要があります。初期のシステムでは、モデルが生成したコードが80GBのメモリを要求し、トレーニングタスク全体がクラッシュしました。その後、チームはpboxという隔離環境を開発し、モデルのコードをサンドボックス内で実行するとともに、GPUサーバーの空きCPUリソースを科学ツールの処理に活用しました。
(インフラストラクチャの原文には、1時間以上にわたるAgentの実行トレース、非同期トレーニングと推論アーキテクチャ、およびpboxサンドボックスのパフォーマンス比較図が含まれています。)
不完全なのはモデルだけでなく、ツールとコンテキストも同様に重要です
Periodicは、同じClaude Opus 5を使用して、2つのAgent環境を比較しました。
一つはClaude Codeとオープンソースの結晶データベース、および標準的なXRDソフトウェアである。もう一つはPeriodic独自の科学作業環境で、実験背景、内部材料データベース、シミュレーション結果、およびカスタム分析ツールを含む。
モデルが完全に同一で、単回分析コストが類似する場合、Periodic環境の成功確率は前者の3.8倍に達する。これは、XRDタスクのボトルネックがモデルの重みだけでなく、正しい実験記録を確認し、適切なツールを呼び出し、これまでの研究蓄積を保存できる能力にもあることを示している。
したがって、Neonの競争優位性は、単にモデルをコピーするだけでは完全に再現するのが難しいでしょう。より重要な資産は、モデルの背後にある実験データ、データベース、機器インターフェース、および分析プロセスです。
これは、科学AIが汎用チャットモデルとは異なる競争格局を形成する可能性を示している:ラボが大きくなるほど、生成される独自データが増え、モデルが優れるほど、指導できる実験が増え、新たな実験はさらにデータ優位性を拡大する。
標準答案がない場合、PeriodicはAIがAIに採点する
複雑なXRD分析には、安価で唯一かつ自動検証可能な標準的な答えは通常存在しない。ピーク形状のフィッティングが良くても、結果が化学的規則に合っているとは限らない。そのため、Periodicは材料関連分野の博士3名に数千のパターンを手動でラベル付けさせ、Claude Opus 5とGPT‑5.6 Solからなるジャッジシステムを訓練して、モデルの出力にスコアを付与した。
三人間の人類専門家による二つずつの一致率は77.2%であり、LLM裁判官と単一の人類専門家との一致率は74.6%、専門家のコンセンサスとの一致率は84%である。
これらの結果は、AIジャッジが専門家の判断に近づくことはできるが、客観的な真実と等価ではないことを示している。人間同士には本来差異が存在し、ジャッジモデルは特定の回答スタイルを好む可能性があり、またはすべてのアノテーターが見落とした誤りを見逃す可能性がある。
さらに注目すべきは、FrontierXRDのモデル、作業環境、サンプル、および評価方法がすべてPeriodicによって設計されていることです。同社は多くの手法と統計データを公開していますが、完全な評価セット、トレーニングデータ、または外部で再実行可能なNeonの重みはまだ公開されておらず、結果も査読を受けていません。
「オープンウェイトから始める」は、Neonが既にオープンソースであることを意味しない
Periodicは、NeonがオープンウェイトモデルKimi K2.6の継続的なトレーニングによって生成されたことを明確に説明しています。このため、一部のソーシャルメディアではNeonを「オープンウェイト科学モデル」と呼んでいます。
ただし、検索時点において、公式発表にはNeonのモデルカード、ライセンス、重みのダウンロード先は含まれておらず、中期トレーニングおよび強化学習を完全に再現するためのコードとデータも提供されていません。正確な表現は、Neonがオープンウェイトモデルを基盤として構築されていることであり、トレーニング済みのNeonの重みがすでに一般公開されているわけではありません。
この違いは重要です。外部の研究者は現在、55.3%の成績を独立して検証できず、その向上のうちどれだけが実験データ、強化学習、専用ツール、推論予算、または評価環境に由来するかを判断できません。
真の変化は、AIが「現実世界の新しいデータ」を食べ始めたことである
過去の科学的大規模モデルは、すでに論文や特許、データベース記録として書き込まれた知識を主に学習してきました。Periodicは次のステップへと踏み出します:モデルが今日完了したばかりで、インターネット上に一度も登録されたことのない実験を観察し、その結果をもとに明日の実験を導くことです。
それはまだ完全な「AI科学者」ではありません。人間は依然として研究目標を設定し、実験室を構築し、機器を保守し、報酬を設計し、XRDの結論を審査し、どの材料に継続して投資するかを決定する必要があります。Neonは現在、重要な一つの环节が大幅に自動化できることを実証しています:実験の数が増加しても、結果の分析は必ずしも同比例で増加する人間の専門家に依存する必要はありません。
この閉ループが有効であれば、将来的な科学モデルの競争優位性は、より多くの公開テキストやGPUを所有しているかどうかだけでなく、真の実験を安定して実行し、失敗結果を記録し、自然世界を継続的に更新されるトレーニング環境に変換できるかどうかにもかかってくるだろう。

