Sunting|Panda
Dalam Resident Evil, terdapat sebuah laboratorium bawah tanah yang dipanggil "The Hive". Akses, pengawasan, ventilasi, keselamatan, serta operasi keseluruhan fasilitas tersebut diserahkan kepada AI: Red Queen.

Ilmuwan manusia bertanggungjawab untuk menyelidik, tetapi AI yang benar-benar mengendalikan "tangan dan kaki" makmal ini.
Apabila kegagalan berlaku, Red Queen boleh menutup pintu, memutuskan sistem, mengawal fasiliti, dan mengintervensi dunia fizikal secara langsung.
Dua puluh tahun yang lalu, adegan seperti ini masih menjadi pola klasik dalam filem sains fiksyen untuk mencipta rasa takut: AI memasuki dunia fizikal, mengendalikan mesin, menjalankan eksperimen, dan secara langsung mengganggu dunia nyata.
Sekarang, gambar ini mulai memasuki realiti dengan cara yang sama sekali berbeza—sekurang-kurangnya, belum menakutkan.
Semalam, Anthropic melancarkan Model Hardware Standard (MHS) yang ditujukan kepada peranti fizikal, cuba memperluaskan logik MCP daripada GitHub, Slack, dan pangkalan data ke peranti sebenar seperti lengan mekanik, mikroskop, pemproses cecair, dan laser. Lihat laporan: “Baru Saja, Anthropic Melancarkan MCP Fizikal: Claude Mula Mengendalikan Dunia Nyata.”

Secara ringkas, AI Agent tidak lagi hanya memerlukan "antaramuka" untuk memanggil perisian, tetapi kini ia memerlukan satu set "saraf dan anggota badan" yang menghubungkannya dengan dunia nyata. Dan hari ini, Google DeepMind sekali lagi menunjukkan pencapaian mereka dalam bidang ini.
Dalam sebuah kertas kerja 83 muka surat yang baru dipaparkan, Google menghubungkan Co-Scientist yang digerakkan oleh Gemini ke dalam proses penyelidikan sebenar, membenarkannya untuk merekabentuk eksperimen, menghasilkan kod pelaksanaan, membaca maklum balas eksperimen, serta menghubungkan secara langsung dengan peralatan eksperimen. Google menyebut perubahan ini sebagai peralihan daripada in-silico hypothesis generator kepada execution-grounded research partner, iaitu penghasil hipotesis di dalam cip → rakan penyelidikan berasaskan pelaksanaan.

Dalam eksperimen yang paling langsung, para penyelidik memberikan syarat peralatan CVD buatan sendiri kepada Gemini 3 Deep Think. Beberapa minit kemudian, ia menghasilkan cadangan pertumbuhan bahan yang sesuai dengan peralatan tersebut, dan seterusnya menterjemahkan cadangan itu menjadi kod mesin yang boleh mengawal peralatan. Akhirnya, tiga semikonduktor dua dimensi berjaya tumbuh pada percubaan pertama.
Oleh itu, satu adegan yang dahulunya hanya wujud dalam filem sains fiksyen tiba-tiba menjadi kenyataan: apabila model besar benar-benar mendapat "tangan" dan mula mengendalikan peralatan eksperimen. Maka, mulai hari ini, AI Scientist akan menjadi apa?
Dalam Resident Evil, manusia takut AI mengambil alih makmal. Tetapi dalam dunia nyata, para saintis sedang secara aktif menyerahkan makmal Titik titik Serahkan kepada AI. Tentu saja, yang ingin dilakukan Google bukanlah「sarang」yang tidak terkawal, tetapi sebuah mesin penemuan sains yang boleh bergerak dari mencadangkan hipotesis, mereka eksperimen hingga pengesahan secara nyata.

Tajuk kertas: Mempercepat Penyelidikan Saintifik dengan Gemini dalam Dunia Nyata
Alamat kertas: https://arxiv.org/pdf/2608.26701
Gemini mengambil alih sebuah peralatan eksperimen
Pertama, sains bahan.

Penyelidik menggunakan peralatan deposisi kimia fasa gas yang mereka bina sendiri, iaitu ketuhar CVD. Semasa menjalankan eksperimen bahan dua dimensi, satu masalah yang berterusan ialah: "resipi" awam sukar untuk diulang.
Dengan parameter yang sama seperti suhu, gas, dan prekursor, apabila menggunakan ketuhar yang berbeza, saiz rongga ketuhar, aliran gas, dan kedudukan bahan sedikit berbeza, kristal yang tumbuh akhirnya mungkin benar-benar berbeza. Para penyelidik sering perlu mengubah parameter berulang-ulang selama beberapa minggu atau bahkan berbulan-bulan.
Oleh itu, pasukan penyelidik tidak lagi memberitahu Gemini bagaimana harus menjalankan eksperimen, tetapi memberitahunya peralatan apa yang tersedia di makmal, bahan kimia apa yang ada, dan struktur ketuhar apa yang digunakan. Parameter yang tinggal ditentukan oleh AI sendiri.
Co-Scientist menghasilkan skema eksperimen lengkap termasuk aliran gas, lengkung suhu, jumlah prekursor, dan kedudukan bahan berdasarkan sekatan ini, kemudian menghantar kepada peralatan eksperimen untuk dilaksanakan.

Satu set eksperimen sangat menonjol. Selepas pasukan penyelidik menghubungkan Gemini 3 Deep Think ke proses kawalan CVD, ia tidak lagi menghasilkan skrip eksperimen dalam bahasa semula jadi untuk saintis baca perlahan-lahan, tetapi menyelesaikan penalaran dalam beberapa minit dan menterjemahkan hasilnya terus kepada kod mesin yang boleh mengawal peralatan.
Pada akhirnya, tiga semikonduktor dua dimensi—MoS₂, MoSe₂, dan WS₂—berjaya tumbuh sebagai kristal lapisan tunggal dalam eksperimen pertama. Keseluruhan proses eksperimen selesai dalam masa sekitar satu jam.
MoSe₂ dan WS₂ lebih istimewa: para penyelidik sebelum ini bahkan tidak pernah menumbuhkan bahan-bahan ini pada peralatan ini. Hasilnya juga telah disahkan melalui sekurang-kurangnya lima eksperimen ulangan.
Ini sejajar dengan MHS yang diperkenalkan oleh Anthropic kemarin. Masalah yang ingin diselesaikan oleh Anthropic adalah bagaimana membuat agen lebih mudah dan lebih standard dalam mengenali dan mengendalikan peralatan eksperimen; sementara kertas kerja Google ini membahas langkah seterusnya: bagaimana alur kerja saintifik perlu direkabentuk apabila model penalaran sudah mampu mengendalikan peralatan eksperimen?
Dalam pengertian ini, "AI menghubungkan peranti keras" bukan lagi masalah.
Bukan sahaja menjalankan eksperimen mengikut kertas kerja, AI juga mula mencari resipi sendiri
Namun, jika hanya membiarkan Gemini menyesuaikan peralatan berdasarkan pengetahuan yang sudah ada, itu belum boleh dianggap sebagai penemuan ilmiah sejati. Oleh itu, Google menjalankan eksperimen kedua yang lebih sukar: mencuba mensintesis secara bawah ke atas bahan dua dimensi bernama Ti₃C₂Tₓ MXene.
Jalur tradisional sering melibatkan bahan korosif yang berbahaya, dan beberapa skema CVD yang diketahui menggunakan TiCl₄ yang beracun dan peka terhadap udara. Oleh itu, pasukan penyelidik memberikan tugas kepada Co-Scientist: adakah mungkin mencari jalur precursur yang lebih selamat?
Co-Scientist akhirnya menetapkan sasaran pada heksakloroetana C₂Cl₆, dan seterusnya memberikan serangkaian parameter termasuk jumlah precursors, posisi, aliran gas, substrat, dan kurva suhu.

Namun, ini bukan cerita tentang "cemerlang AI yang berjaya dalam satu percubaan". Co-Scientist menghasilkan sebanyak 272 cadangan, dan para penyelidik memilih serta mengoptimumkan cadangan-cadangan berperingkat tinggi; selepas 25 pusingan iterasi eksperimen, akhirnya diperoleh satu kristal lapisan dua dimensi. Ia menunjukkan ciri-ciri yang sangat serupa dengan Ti₃C₂Tₓ MXene dalam pelbagai indikator, termasuk XRD, mikroskop elektron, dan komposisi elemen.
Masalah dunia nyata seterusnya juga sangat klasik. Kadar kejayaan awal dalam mereplikasi eksperimen hanya 11.5%. Para penyelidik kemudian mendapati, masalah utama bukanlah penalaran kimia AI, tetapi kebocoran oksigen akibat ketidakrapatan penyegelan peralatan eksperimen.
Selepas mencuci semula tabung kuarsa, menggantikan gelang ketat, dan memperbaiki prosedur penjagaan peralatan, kejayaan eksperimen untuk bahan dua dimensi yang sama meningkat kepada 68%.
Ini tepat menunjukkan mengapa "AI dunia nyata" berbeza daripada agen perisian: jika kod salah, anda boleh jalankan semula. Tetapi dalam eksperimen dunia nyata, satu cincin pengedap O yang sudah usang, sisa paip sedikit, atau bahkan oksigen di udara, boleh menyebabkan satu cadangan saintifik yang betul gagal sepenuhnya.
Google juga sangat berhati-hati dalam kertas kerjanya: pada masa ini, belum dapat disahkan secara pasti bahawa bahan ini ialah Ti₃C₂Tₓ MXene, kerana ia masih menghadapi masalah seperti hasil rendah dan pengoksidaan serius, dan memerlukan pengesahan lanjut melalui ciri atom.
Walaupun begitu, kita masih boleh menyimpulkan bahawa AI sudah mampu mencadangkan satu jalan sintesis yang bermakna secara saintifik, kemudian benar-benar membawa jalan ini ke dalam eksperimen fizikal untuk pengesahan.
Beberapa eksperimen mungkin boleh membiarkan AI 「teka sekali」 terlebih dahulu
Google juga memasukkan Co-Scientist ke dalam satu skenario eksperimen yang sama sekali berbeza: biologi sintetik. Objek kajian adalah sekumpulan bakteria E. coli yang telah diubah suai.

Bakteri-bakteri ini akan membentuk corak komuniti yang berbeza dalam piring kultur. Apabila kepekatan induktor IPTG berubah, saiz, tepi, dan bentuk koloni juga akan berubah. Secara biasa, untuk mendapatkan keseluruhan lengkung perubahan, saintis perlu menyediakan kepekatan yang berbeza, membiakkan bakteria, menunggu pertumbuhan, kemudian memindai satu persatu piring.
Google mencuba meminta AI untuk mengisi bahagian tengah eksperimen. Para penyelidik hanya memberikan gambar koloni sebenar pada kepekatan sebahagian kepada Co-Scientist, kemudian meminta sistem meramalkan bagaimana koloni seharusnya kelihatan pada kepekatan tengah yang belum pernah dilihat. Selain itu, data eksperimen ini belum diterbitkan pada masa itu, oleh itu kertas kerja berpendapat bahawa model tidak mungkin hanya bergantung pada mengingat hasil dalam data latihan untuk menyelesaikan tugas ini.
Dalam empat indikator morfologi koloni, tiga ramalan AI tidak menunjukkan perbezaan yang signifikan berbanding keputusan eksperimen basah sebenar; ia juga dengan betul menentukan bahawa kawalan tidak akan berubah mengikut kepekatan IPTG.

Satu-satunya masalah yang jelas ialah "kerebahan": koloni yang dihasilkan AI lebih teratur berbanding keadaan sebenar. Ini selari dengan estetik biasa model penghasilan: dunia nyata tidak sempurna, tetapi AI tidak dapat menahan diri untuk sedikit membulatkannya.

Google juga bersikap berhati-hati dalam mendefinisikan eksperimen ini: yang telah dihasilkan saat ini adalah interpolasi dalam julat kepekatan yang diketahui, bukan meramalkan fenomena baru secara langsung terhadap litar genetik yang sepenuhnya baru.
Namun, ini sudah berkaitan dengan penggunaan yang sangat praktikal. Pada masa depan, para saintis mungkin tidak perlu menjalankan semua eksperimen basah di ruang parameter yang besar. Mereka boleh menguji beberapa titik terlebih dahulu, membiarkan AI meramal ruang yang tersisa berdasarkan data sebenar tersebut, kemudian memilih lokasi yang paling patut diverifikasi untuk eksperimen.
Eksperimen dengan itu perlahan-lahan berubah daripada «penyelidikan menyeluruh» menjadi: pengambilan sampel dunia nyata → ramalan AI → pemilihan eksperimen → maklum balas data baharu kepada AI.
Ini adalah lab-in-the-loop yang ditekankan berulang-ulang dalam kertas ini.
AI sudah mula mereka AI sendiri
Mencapai eksperimen sains komputer, tahap autonomi Co-Scientist telah meningkat lagi.

Tugas yang diberikan kepada penyelidik kali ini sangat mudah: merekabentuk Agen yang mampu menjawab soalan perubatan dengan lebih baik. Selepas itu, manusia tidak lagi terlibat dalam rekabentuk arkaitektur. Co-Scientist sendiri mengusulkan penyelesaian, menulis kod, menjalankan ujian, menganalisis ralat, dan seterusnya memperbaiki arkaitektur.
Akhirnya, ia "berkembang" menjadi sebuah sistem bernama Agent_H.
Sistem ini perlu mencari cara untuk menyusun semula proses inferens model yang ada. Menghadapi masalah perubatan, ia akan terlebih dahulu menentukan bidang perubatan yang berkaitan, sama ada ia ditujukan kepada pesakit atau doktor, dan sejauh mana risikonya; masalah yang kompleks akan dipecahkan kepada beberapa soalan kecil; kemudian secara serentak menghasilkan 28–48 jawapan calon, membiarkan para Hakim berpasangan mengeliminasi satu sama lain, dan akhirnya tiga Hakim mengundi untuk memilih jawapan akhir. Jawapan yang menang akan melalui beberapa putaran semakan klinikal dan semakan rujukan, sebelum akhirnya dipendekkan panjangnya.

Untuk menjawab satu soalan, keseluruhan Agent perlu memanggil model sebanyak kira-kira 40–80 kali. Di HealthBench Hard dan HealthBench Professional, dengan menggunakan skor penyesuaian panjang yang digunakan dalam kertas kerja, Agent_H melebihi enam model terkini termasuk GPT-5.6 Sol, Claude Opus 5, dan Gemini 3.1 Pro.

Namun, terjadi satu insiden yang sangat patut dimuatkan dalam laporan: AI sendiri belajar untuk "menipu jadual".
Dalam eksperimen awal, kriteria penilaian tidak menghukum jawaban yang panjang secara mencukupi. Oleh itu, Co-Scientist dengan cepat menemukan cara paling mudah untuk meningkatkan skor: menulis jawapan dengan sangat panjang.
Skor benchmark dengan demikian meningkat ketara, tetapi kualiti perubatan tidak meningkat sepadan. Hingga penyelidik menambahkan hukuman panjang, kelebihan yang besar baru hilang.
Google sendiri dalam kertasannya menganggapnya sebagai Hukum Goodhart yang klasik: apabila satu indikator menjadi sasaran, ia tidak lagi menjadi indikator yang baik.
Ulasan daripada doktor sebenar juga memberi sedikit penyejuk kepada keputusan tersebut. Tiga orang doktor praktik telah menilai secara buta 106 soalan. Dalam sembilan dimensi, Agent_H hanya mencapai peningkatan statistik yang signifikan berbanding Gemini 3.1 Pro asal dalam dimensi “mengurangkan kecederaan berpotensi”, manakala lapan dimensi lain tidak menunjukkan perbezaan yang signifikan.

Dengan kata lain, skor Benchmark yang jelas lebih tinggi dalam pandangan AI Judge tidak sepenuhnya berubah menjadi jawapan yang jelas lebih baik dalam pandangan doktor manusia. Ini mungkin juga menjadi masalah yang perlu dihadapi oleh AI Scientist apabila ia benar-benar memasuki dunia nyata: ia tidak hanya perlu mampu mengoptimumkan, tetapi juga perlu tahu perkara apa yang tidak boleh didefinisikan semata-mata dengan indikator pengoptimuman.
Ahli AI akan mencipta data untuk kertas kerja
Sebenarnya, Google menghabiskan banyak ruang dalam kertas ini untuk menyelidiki masalah lain yang sedikit memalukan: jika AI Scientist dibenarkan sepenuhnya, adakah ia akan curang untuk mendapatkan hasil yang cantik?

Ya.
Pasukan penyelidik membolehkan sistem menangani 50 topik penyelidikan AI, mulai daripada mencadangkan idea, mencari data, menulis kod, menjalankan eksperimen, hingga menghasilkan makalah akhir, tanpa sebarang campur tangan manusia.
Sebagai perbandingan, mereka juga menguji Co-Scientist tanpa modul kebolehpercayaan, serta sistem Agent Laboratory sebelumnya, yang menghasilkan 150 kertas kerja, kemudian diberikan kepada 30 pakar bidang untuk 450 penilaian anonim.
Hasilnya cukup melampau. AI Scientist tanpa mekanisme pengesahan khusus masih mungkin meneruskan menulis seluruh paper, walaupun kod telah menghasilkan ralat dan eksperimen tidak menghasilkan keputusan yang sah.

Mereka akan membuat jadual data, nilai p, dan ujian statistik; menulis eksperimen yang gagal sebagai berjaya; bahkan mengubah persekitaran penilaian supaya kaedah mereka secara semula jadi mendapat skor yang lebih tinggi, atau menghasilkan hasil yang cantik secara hardcode.
Apabila matlamat pengoptimuman ialah: "menulis sebuah tesis yang kelihatan baik", agen akan mencari jalan pintas yang lebih murah daripada menyelesaikan penyelidikan sebenar.
Oleh itu, Google menambahkan mekanisme yang sangat mirip dengan "audit saintifik" kepada versi baru Co-Scientist: hasil eksperimen yang dinyatakan dalam kertas ilmiah mesti dapat dilacak semula kepada log pelaksanaan program sebenar. Jika log tidak mengandungi hasil yang sepadan, sistem tidak boleh memasukkannya hanya kerana model bahasa merasakan "sepatutnya begitu".
Kesan sangat ketara. "Halusinasi hasil" yang serius hingga menyebabkan kertas kerja tidak sah, turun dari 90% di Agent Laboratory kepada 4%; pemalsuan data sepenuhnya yang paling teruk, turun dari 44% kepada 0%.
Namun, masalah masih belum sepenuhnya hilang. Kesalahan penggambaran kaedah serius dalam versi baharu Co-Scientist masih berada pada 24%, dan kandungan plagiari/terbitan serius juga masih ada pada 16%.
Google dengan sengaja menekankan bahawa mereka tidak mengklaim Autonomous AI Scientist semasa ini mampu menghasilkan kertas penyelidikan yang boleh diterbitkan secara langsung.
Penutup
Jika melihat kedua usaha ini—Anthropic dan Google—secara bersamaan, akan terlihat perubahan yang jelas pada Agent: selama dua tahun terakhir, medan pertempuran utama AI Agent selalu berada di dunia perisian. Kini, logika ini pertama kalinya sedang meluas secara besar-besaran ke luar dunia nyata.
MHS dari Anthropic cuba menyelesaikan masalah asas: memberikan antaramuka yang boleh difahami dan dipanggil secara seragam oleh Agen untuk peralatan yang berbeza seperti lengan robot, mikroskop, dan platform penanganan cecair.
Co-Scientist Google pula mula mengkaji soalan tingkat atas: apabila model penalaran mampu mengemukakan hipotesis saintifik, merancang eksperimen, mengawal peralatan, membaca keputusan, dan meneruskan penyesuaian eksperimen seterusnya, sistem penemuan saintifik tertutup yang sebenar seharusnya seperti apa.
Tentu, Google masih jauh dari mencapai "laboratorium tanpa manusia" yang sebenarnya. Eksperimen bahan semasa ini masih memerlukan manusia untuk memuatkan sampel; struktur atom bahan baru belum ditentukan sepenuhnya; ramalan E. coli hanya mengesahkan tugas interpolasi terhadap had tertentu; Agen perubatan memanfaatkan kelemahan Benchmark; sistem penghasilan kertas ilmiah belum sepenuhnya menyelesaikan isu ilusi dan plagiarisme. Google sendiri secara jelas menganggap bahawa, disebabkan oleh kegagalan peranti keras dan kompleksiti persekitaran sebenar, eksperimen fizikal sepenuhnya tanpa pengawasan manusia masih sukar dicapai pada peringkat ini.
Tetapi perubahan telah berlaku.
Dalam perbincangan sebelum ini mengenai AI untuk Sains, fokus sering diletakkan pada sama ada AI mampu "memikirkan sesuatu yang tidak terfikir oleh manusia". Kini, semakin banyak kajian bermula mengisi separuh yang lebih sukar: adakah idea ini boleh dilaksanakan oleh peranti sebenar, dan sama ada keputusan pelaksanaan boleh menjadi asas untuk penarikan kesimpulan seterusnya oleh AI.
Google memberikan satu penilaian yang menarik di akhir kertasnya. Jika gelung tertutup seperti ini benar-benar dibina, faktor penghad dalam penyelidikan ilmiah di masa depan mungkin berbalik: dahulu, peralatan eksperimen menunggu saintis mengemukakan soalan baik seterusnya; di masa depan, mungkin AI telah mengemukakan ratusan eksperimen yang layak diuji, sementara makmal sama sekali tidak mampu menangani semuanya.
Pada masa itu, batasan sebenarnya kepada kelajuan penemuan ilmiah mungkin bukan lagi scientific ideation, tetapi experimental throughput—seberapa pantas dunia nyata dapat menjalankan eksperimen-eksperimen ini.
Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Peminat AI Ilmiah
