Periodic Labs telah menerbitkan model saintifik Periodic Neon: ia bermula dengan model berparameter triliunan dengan bobot terbuka Kimi K2.6, dilatih menengah menggunakan data bahan yang dihasilkan oleh laboratorium perusahaan, serta pembelajaran penguatan, kemudian dideploy semula ke laboratorium untuk menganalisis keputusan difraksi sinar-X. Dalam ujian dalaman paling sukar FrontierXRD, kejayaan meningkat dari 2.7% pada model asas kepada 55.3%; Periodic menyatakan bahawa ia melebihi GPT‑6 Astra dan Claude Fable 5.1 dalam tugas khusus ini, sambil mengurangkan kos. Yang benar-benar patut diperhatikan bukan perbandingan mudah “1300 H200 mengalahkan 100,000 GPU”, tetapi bagaimana perusahaan sedang membina gelung tertutup eksperimen—latihan—eksperimen semula: laboratorium fizikal terus menghasilkan data baharu yang tidak ada di internet, model belajar daripadanya, lalu menentukan apa yang perlu disintesis dan diuji dalam putaran seterusnya. Namun, semua pencapaian utama kini berasal daripada ujian dalaman perusahaan, bergantung kepada penilai LLM, dan belum ada ulasan rakan sebaya atau pengulangan bebas; Neon mewarisi hasil latihan awal Kimi K2.6 yang mahal, dan sehingga masa pemeriksaan, tiada alamat muat turun awam untuk bobot Neon ditemui.Penulis artikel, sumber: Periodic Labs
Ia menyelesaikan bukan masalah perbualan, tetapi "eksperimen sebenarnya telah mencapai apa"
Periodic Labs sedang mencari superkonduktor dan bahan magnetik yang lebih baik. Para penyelidik boleh menetapkan bahan sasaran, memilih bahan mentah dan suhu, tetapi serbuk yang dihasilkan mungkin tidak menjadi produk yang dijangka: ia mungkin mengandungi fasa hablur sasaran, bahan mentah yang tidak bertindak balas sepenuhnya, serta produk sampingan yang tidak dijangka.
Penyelidik biasanya menggunakan difraksi sinar-X serbuk, atau XRD, untuk menentukan komposisi sampel. Selepas sinar-X memancar ke dalam kristal, ia menghasilkan satu set puncak; struktur kristal yang berbeza akan menghasilkan corak yang berbeza, serupa dengan "jejak jari" bahan tersebut.
Namun, sampel sebenarnya sering mengandungi pelbagai bahan, di mana puncanya saling tindih. Jawapan yang sesuai secara matematik mungkin tidak munasabah secara kimia. Ahli analisis juga perlu menggabungkan bahan mentah, suhu, suasana, sama ada sampel bersentuhan dengan air, eksperimen sebelumnya, pangkalan data kristal, pengiraan termodinamik, dan kertas kerja berkaitan untuk menentukan fasa mana yang benar-benar wujud dan berapakah nisbah masing-masing.
Periodic menyatakan bahawa sampel kompleks mungkin memerlukan ahli bahan menganalisis selama berjam-jam. Dalam penilaian mereka, jawapan yang diiktiraf secara purata mengandungi lima fasa bahan. Inilah yang ingin diotomatiskan oleh Neon: membaca pola belauan dan latar belakang eksperimen penuh, memanggil pangkalan data dan perisian saintifik, mencadangkan fasa kandidat, kemudian menguji semula penjelasannya secara berulang-ulang.Artikel penyelidikanmenyatakan bahawa model telah digunakan di makmal aliran tinggi syarikat tersebut.
Ditingkatkan dari 2.7% kepada 55.3%
Neon bukan model asas baru yang dilatih dari awal. Periodic bermula dengan Kimi K2.6 dengan bobot terbuka, kemudian dilatih semula dengan korpus sains yang terdiri daripada kertas akademik, kod, dan data eksperimen eksklusif, sebelum dihaluskan menggunakan pembelajaran peningkatan berdasarkan data makmal.
Pada ujian dalaman paling mencabar perusahaan, FrontierXRD, kejayaan asal Kimi K2.6 ialah 2.7%, manakala Neon mencapai 55.3%, meningkat sebanyak kira-kira 20 kali ganda. Ujian tersebut mengandungi 134 sampel kompleks daripada laboratorium Periodic.
Perusahaan juga menguji 198 pengukuran XRD dari sistem kimia yang dikekalkan: sistem-sistem ini serta sistem yang lebih besar yang mengandunginya tidak dimasukkan ke dalam data latihan, tetapi sub-sistem yang lebih kecil mungkin pernah muncul. Neon juga memimpin model terkini yang diuji pada set ujian ini, walaupun Periodic secara jelas menyatakan bahawa set soal ini lebih mudah berbanding FrontierXRD.
(Asal mengandungi graf titik prestasi- kos, lengkung pengembangan kuasa komputasi pembelajaran penguatan, dan graf hasil generalisasi pada sistem kimia yang dikekalkan.)
“Melebihi GPT‑6 Astra dan Claude Fable 5.1” di sini mestilah dibataskan kepada penilaian XRD yang dibina sendiri oleh Periodic. Ia tidak bermakna Neon memiliki kemampuan penalaran, pengaturcaraan, atau bahasa umum yang lebih kuat, dan tidak boleh digunakan untuk membina peringkat model komprehensif.
Dan kejayaan 55.3% bermaksud, hampir separuh daripada sampel paling sukar masih belum berjaya diselesaikan. Neon lebih sesuai digunakan sebagai alat untuk memperluas kemampuan analisis saintis, bukan sebagai pakar bahan automatik tanpa pengawasan.
Lab bermula menjadi persekitaran latihan model
Logik utama yang diajukan oleh Periodic adalah: data saintifik berkualiti tinggi yang disediakan oleh internet awam akhirnya terhad, manakala makmal fizikal boleh terus menghasilkan data baru.
Kertas kerja tradisional cenderung memfokuskan pada penerbitan kejayaan. Maklumat mengenai bahan yang tidak berjaya disintesis, suhu dan nisbah yang gagal, serta keanehan peralatan sering tidak dimasukkan ke dalam kertas kerja, tetapi sangat berharga untuk menilai eksperimen seterusnya. Laboratorium autonomi boleh menyimpan semua keputusan — berjaya, gagal, dan tidak pasti.
Perusahaan membahagikan penemuan bahan kepada tiga langkah kitaran:
Pertama, ramalkan bahan apa yang perlu dihasilkan; kemudian ramalkan bagaimana sintesisnya; akhirnya analisis apa yang sebenarnya dihasilkan dalam eksperimen. Keputusan analisis dipulangkan semula kepada model untuk memperbaiki hipotesis seterusnya.
Neon kini terutama memperbaiki langkah ketiga. Peringkat seterusnya bagi Periodic adalah membolehkan model merancang projek penyelidikan secara langsung, menulis proses sintesis, dan memilih eksperimen seterusnya yang paling bernilai maklumat.
Ini berbeza secara penting daripada matematik atau pembelajaran penguatan kod. Program boleh menjalankan ujian dalam beberapa saat, dan jawapan matematik juga boleh diperiksa oleh sistem formal; eksperimen fizikal memerlukan peralatan, bahan, dan masa, kadang-kadang berterusan selama beberapa hari, dan keputusannya mungkin kabur. Syarikat tidak boleh memulakan beribu-ribu eksperimen sebenar segera seperti menghasilkan kod, oleh itu mereka mesti memanfaatkan sepenuhnya data yang telah dikumpulkan untuk melatih dan menyempurnakan model semasa menunggu eksperimen.
1300 unit H200 tidak sama dengan melatih model parameter triliunan dari awal
Periodic menyatakan bahawa skala puncak bagi penghantaran latihan terakhir Neon ialah 1.300 GPU Nvidia H200, yang mencakupi peringkat latihan jangka menengah dan pembelajaran penguatan. Syarikat membandingkannya dengan lebih daripada 100.000 GPU Blackwell yang dikatakan digunakan oleh GPT‑6 Astra, untuk menunjukkan bahawa data profesional boleh mengurangkan keperluan pengiraan untuk melatih kemampuan sains am.
Tetapi ini bukan perbandingan yang sepadan.
Neon mewarisi bobot parameter triliunan dari Kimi K2.6, serta seluruh data dan tenaga komputasi yang telah diinvestasikan sebelumnya dalam pelatihan awalnya. 1.300 unit H200 hanya mewakili skala puncak ketika Periodic melanjutkan pelatihan model, bukan seluruh biaya untuk memperoleh kemampuan parameter triliunan ini. Perusahaan juga tidak mengungkapkan durasi pelatihan penuh, total jam GPU yang terkumpul, konsumsi energi, atau biaya keseluruhan.
Yang lebih berharga ialah butiran kejuruteraannya.Artikel infrastrukturmenyatakan bahawa syarikat tersebut membuat modifikasi di atas Megatron, SGLang, Miles, dan Ray, meningkatkan throughput latihan urutan panjang kepada 4.1 kali ganda berbanding baseline Megatron, serta meningkatkan kelajuan dekod model parameter trilion dari 10 token per permintaan per saat kepada 25.
Satu inferens XRD Agent mungkin berterusan selama lebih daripada satu jam, di mana program sains perlu dijalankan berulang kali. Sistem awal pernah menyebabkan kod yang dihasilkan oleh model meminta 80GB memori, yang menyebabkan keseluruhan tugas latihan gagal. Pasukan kemudian membangunkan persekitaran pengasingan bernama pbox, di mana kod model dijalankan dalam sandbox, serta memanfaatkan sumber CPU yang tidak digunakan di pelayan GPU untuk mengendalikan alat sains.
(Infrastruktur asal mengandungi jejak operasi Agent lebih daripada satu jam, arsitektur latihan dan inferens asinkron, serta graf perbandingan prestasi pbox sandbox.)
Peningkatan tidak datang semata-mata dari model, alat dan konteks juga penting
Periodic juga membandingkan dua persekitaran Agent menggunakan Claude Opus 5 yang sama.
Satu ialah Claude Code ditambah dengan pangkalan data kristal sumber terbuka dan perisian XRD piawai; yang lain ialah persekitaran ilmiah Periodic sendiri, yang merangkumi latar belakang eksperimen, pangkalan data bahan dalaman, keputusan simulasi, dan alat analisis disesuaikan.
Dalam keadaan model yang sama dan kos analisis sekali gus yang hampir serupa, kadar kejayaan persekitaran Periodic mencapai 3.8 kali ganda berbanding yang sebelumnya. Ini menunjukkan bahawa longkang tugas XRD bukan sahaja terletak pada berat model, tetapi juga pada keupayaan model untuk melihat rekod eksperimen yang betul, memanggil alat yang sesuai, dan menyimpan pencapaian penyelidikan sebelumnya.
Oleh itu, kelebihan kompetitif Neon mungkin sukar untuk direplikasi sepenuhnya dengan meniru satu model. Aset yang lebih penting ialah data makmal, pangkalan data, antaramuka instrumen, dan proses analisis di sebalik model tersebut.
Ini juga bermakna bahawa AI saintifik mungkin membentuk persekitaran persaingan yang berbeza daripada model perbualan am: makmal yang lebih besar akan menghasilkan lebih banyak data eksklusif; model yang lebih baik akan mampu membimbing lebih banyak eksperimen; dan eksperimen baharu pula akan memperluaskan kelebihan data tersebut.
Tanpa jawapan piawai, Periodic menggunakan AI untuk menilai AI
Analisis XRD yang kompleks biasanya tidak mempunyai jawapan standard yang murah, unik, dan boleh diverifikasi secara automatik. Pemfitan bentuk puncak yang baik tidak bermakna hasilnya sejalan dengan hukum kimia. Oleh itu, Periodic meminta tiga orang doktor yang berkaitan dengan bahan untuk menandakan ribuan corak, kemudian melatih sistem penilai yang terdiri daripada Claude Opus 5 dan GPT‑5.6 Sol untuk memberi markah kepada output model.
Kesepakatan berpasangan antara tiga pakar manusia adalah 77.2%; kesepakatan antara penilai LLM dan seorang pakar manusia adalah 74.6%; kesepakatan berbanding konsensus pakar adalah 84%.
Hasil-hasil ini menunjukkan bahawa pengadil AI boleh menghampiri penilaian pakar, tetapi tidak sama dengan kebenaran objektif. Perbezaan sudah ada di antara manusia, dan model pengadil mungkin lebih menyukai gaya jawapan tertentu, atau gagal mengesan kesilapan yang tidak dikenal pasti oleh semua penanda.
Lebih penting lagi, model, persekitaran kerja, sampel, dan kaedah penilaian FrontierXRD semuanya direka oleh Periodic. Walaupun syarikat tersebut telah mengumumkan banyak kaedah dan statistik, ia belum menerbitkan set penilaian penuh, data latihan, atau berat Neon yang boleh digunakan pihak luar untuk menjalankan semula, dan hasilnya juga belum melalui proses penilaian rakan sebaya.
"Mula dengan model terbuka" tidak bermakna Neon telah dibuka sumbernya
Periodic secara jelas menyatakan bahawa Neon dilatih semula daripada model berbobot terbuka Kimi K2.6. Oleh itu, sebahagian media sosial memanggil Neon sebagai "model sains berbobot terbuka".
Namun, pada masa pemeriksaan, pengumuman rasmi tidak menyediakan kad model, lesen, atau alamat muat turun berat Neon, serta tidak memberikan kod dan data yang boleh mereplikasi sepenuhnya latihan sederhana dan pembelajaran penguatan. Pernyataan yang tepat ialah: Neon dibina di atas model dengan berat terbuka, bukan berat Neon yang telah dikonfirmasi dibuka kepada umum.
Perbezaan ini penting. Penyelidik luar pada masa ini tidak dapat mengesahkan keputusan 55.3% secara bebas, atau menentukan seberapa banyak peningkatan tersebut berasal daripada data eksperimen, pembelajaran penguatan, alat khas, anggaran penalaran, atau persekitaran penilaian.
Perubahan sebenar ialah AI mula memakan "data baru dunia nyata"
Model ilmiah sebelumnya terutama mempelajari pengetahuan yang telah ditulis dalam kertas, paten, dan rekod pangkalan data. Periodic cuba melangkah seterusnya: membolehkan model memantau eksperimen yang baru saja selesai hari ini dan belum pernah muncul di internet, kemudian menggunakan keputusan ini untuk membimbing eksperimen esok.
Ia belum lagi menjadi “ilmuwan AI” yang lengkap. Manusia masih perlu menentukan objektif penyelidikan, membina makmal, memelihara peralatan, merekabentuk ganjaran, mengesahkan kesimpulan XRD, dan memutuskan bahan mana yang patut diteruskan. Neon kini membuktikan bahawa satu elemen utama boleh diotomatiskan secara ketara: semakin banyak eksperimen, analisis keputusan tidak perlu bergantung sepenuhnya pada peningkatan sepadan pakar manusia.
Jika sistem tertutup ini berkesan, keunggulan kompetitif model sains masa depan mungkin tidak lagi hanya bergantung pada siapa yang memiliki lebih banyak teks awam dan GPU, tetapi juga pada siapa yang mampu menjalankan eksperimen sebenar dengan stabil, merekod kegagalan, dan mengubah dunia semula jadi menjadi persekitaran latihan yang dikemas kini secara berterusan.

