Google Research mengumumkan kerangka Science One pada 30 Julai 2026, dengan inti mekanisme bernama "Chain-of-Evidence" (CoE), yang memerlukan setiap kesimpulan AI dalam penyelidikan saintifik untuk dikaitkan dengan sumber, kod, dan rekod eksperimen.Penulis artikel, sumber: 0x9999in1, ME News

TL;DR
- Google Research mengumumkan kerangka Science One pada 30 Julai 2026, dengan inti mekanisme bernama "Chain-of-Evidence" (CoE), yang memerlukan setiap kesimpulan AI dalam penyelidikan saintifik untuk dikaitkan dengan sumber, kod, dan rekod eksperimen.
- Sistem penyelidikan AI semasa mempunyai masalah lama yang serius: mengarang rujukan, skor yang tidak boleh dicapai, dan penerangan kaedah tidak sepadan dengan kod. Kadar rujukan ilusi pada sistem asas mencapai sehingga 21%, manakala kadar boleh reproduksi skor hanya serendah 42%.
- Prestasi Science One ialah: tiada khayalan dalam rujukan, semua skor verifikasi betul, dan kadar kekonsistenan antara kaedah dan kod paling tinggi. Menurut pengungkapan, semua 337 rujukan yang dihasilkan adalah benar, semua 12 eksperimen yang boleh dipulihkan sepadan, dan 14 daripada 15 kertas kerja sepadan dengan kod.
- Reka bentuk utama ialah "menghasilkan sambil mengambil bukti", bukan "menulis dahulu, baru tambah rujukan kemudian". Rujukan tidak berasal dari ingatan model, tetapi dari pencarian sebenar melalui API Semantic Scholar.
- Penilaian yang lebih penting: Science One tidak mengorbankan "kecekapan" demi "kejujuran". Ia memenangi 2 emas dan 2 perak di MLE-Bench, serta mencatatkan prestasi terbaik pada masa itu di Parameter-Golf.
- Makna sebenar perkara ini bukanlah tentang AI lain yang boleh menulis kertas kerja, tetapi ia pertama kali menjadikan "boleh disahkan" sebagai asas struktur, bukan sebagai tambahan selepasnya.
Tanya satu soalan yang menyakitkan: Karya ilmiah yang ditulis oleh AI, adakah anda percaya?
Dalam dua tahun terakhir, kemajuan sistem penyelidikan AI sangat mengejutkan.
Ia boleh membaca literatur. Boleh mengemukakan hipotesis. Boleh menjalankan eksperimen. Boleh menulis sepenuhnya sebuah kertas ilmiah yang berstruktur dan bertutur secara profesional. Anda sekilas pandang, tidak akan dapat menemui sebarang kesalahan.
Tetapi masalahnya tersembunyi dalam "sekilas pandang" ini.
Lihat sekelip saja tidak masalah, tapi kalau diteliti lebih dalam bagaimana?
Google Research secara mendalam menyelidiki perkara ini. Mereka mengambil lima sistem penyelidikan autonomi utama, menghasilkan sebanyak 75 kertas kerja dalam lima tugas pengoptimuman sistem, kemudian mempertanyakan setiap butir: Apakah kertas rujukan anda benar-benar wujud? Adakah skor yang anda laporkan masih konsisten apabila kod dijalankan semula? Adakah algoritma yang anda nyatakan digunakan benar-benar ditulis seperti itu dalam kod?
Hasilnya tidak menarik.
Setiap sistem dasar sekurang-kurangnya membuat satu kesilapan sistematik. Kadar ilusi rujukan mencapai sehingga 21%—iaitu, mungkin satu daripada lima rujukan mengarah kepada kertas yang tidak wujud. Kadar lulus pengesahan skor hanya serendah 42%. Konsistensi kaedah dan kod berfluktuasi antara 20% hingga 80%.
Cuba rasakan 42% ini. Lebih daripada separuh kertas kerja, keputusan yang dilaporkan tidak boleh dipulihkan semula dengan menjalankan semula kodnya.
Ini bukan bug kecil. Ini adalah kegagalan kepercayaan.
Kerana sains penyelidikan pada dasarnya berpaksikan "boleh diperbanyak semula" dan "boleh dilacak". Nilai sebuah kertas kerja tidak terletak pada seberapa lancar ia dibaca, tetapi pada sama ada orang lain boleh mengikuti rujukan, kod, dan data yang diberikan untuk kembali melangkah demi langkah dan memastikan ia tidak berbohong. AI telah meningkatkan "kualiti permukaan" kertas kerja, tetapi telah menarik tiang paling asas ini.
Semakin cemerlang permukaannya, semakin tersembunyi masalahnya. Inilah tempat yang paling berbahaya.
Jawapan Google: Bukan bergantung pada kepercayaan, tetapi pada rantai
Pendekatan Science One, pada dasarnya, sangat sederhana.
Kerana tidak boleh mempercayai AI untuk bersikap jujur secara spontan, jangan harap ia akan bertindak secara spontan. Kenakan rantai padanya.
Rantai ini ialah "Rantai Bukti".
Google memberikan perbandingan yang sangat tepat: dalam bidang pangkalan data, terdapat konsep bernama ACID, yang tidak peduli bagaimana Anda membangun pangkalan data, tetapi hanya menetapkan sifat-sifat apa yang harus dipenuhi agar satu transaksi dianggap "boleh dipercaya". Rantai bukti juga sama. Ia tidak menetapkan cara Anda membangun agen saintifik, tetapi hanya menetapkan: setiap hasil yang Anda hasilkan, jika ingin dipercaya, harus memenuhi apa.
Satu prinsip, dua separuh.
Bahagian pertama ialah integriti: setiap pernyataan dalam tesis—sama ada satu petikan, nombor, perihalan kaedah, atau kesimpulan—harus disokong oleh rantai bukti yang didokumentasikan.
Ketepatan separuh kedua: Rantaian ini benar-benar mampu menyokong pernyataan yang digantungkan padanya.
Dalam bahasa yang mudah difahami: Setiap perkataan yang anda katakan harus mempunyai sumber; dan sumber itu harus benar-benar membuktikan perkataan anda.
Bagaimana ia dilaksanakan? Kuncinya ialah masa yang tepat.
Sistem semasa bagaimana ia berfungsi? Pertama-tama, tulis kertas yang panjang lebar, baru kemudian kembali dan tambahkan rujukan serta bukti. Ini seperti membuat cerita terlebih dahulu, baru mencari bukti untuk menyokongnya. Di tempat yang tidak boleh disokong, hanya boleh dicipta. Rujukan ilusi datang daripada sini.
Science One sebaliknya. Pada "ketika ayat ini dihasilkan", ia membina rantai bukti secara serentak. Pernyataan dan bukti tumbuh bersama-sama, bukan dijahit selepas itu.
Pertukaran urutan ini adalah jiwa keseluruhan perkara ini.
Lihat secara terpisah: tiga modul, masing-masing mengendalikan satu bahagian dusta
Struktur Science One terbahagi kepada tiga bahagian, setiap bahagian secara tepat menghalang satu bentuk penipuan.
Bahagian pertama, penyiasat isu, bertanggungjawab atas penipuan kutipan.
Ia tidak bergantung pada "ingatan" model untuk merujuk sumber. Ingatan model adalah tempat lahirnya ilusi—ia akan "mengingat" satu kertas yang sebenarnya tidak wujud. Science One terhubung secara langsung dengan API Semantic Scholar untuk membina peta rujukan yang sebenar, membaca sehingga 100 PDF penuh setiap topik, dan menghasilkan laporan penyelidikan yang terstruktur. Setiap rujukan dalam kertas akhir berasal daripada pencarian API yang sebenar, memutuskan sepenuhnya ketergantungan pada ingatan model.
Rujukan bukan "dibayangkan", tetapi "dikaji". Dengan satu tebukan ini, akar rujukan ilusi diputuskan.
Bahagian kedua, enjin penemuan, menguruskan penipuan rekod eksperimen.
Ia menggunakan strategi "eksplorasi—pemanfaatan" secara selari, mencuba penyelesaian secara serentak pada beberapa cabang. Dalam setiap pusingan, seorang Solver melaksanakan penyelesaian, sementara seorang penilai khas memberi markah. Cabang yang berprestasi baik akan diperhalus semula, manakala semua output penilaian asal akan dimasukkan ke dalam rekod yang ketat dan hanya boleh dibaca.
Baca sahaja. Dua perkataan ini sangat penting. Selepas keputusan asal dicatat, ia tidak boleh diubah. Ingin melaporkan skor yang lebih cantik semasa menulis tesis nanti? Maaf, buku akaun ada di sini, tidak boleh diubah.
Bahagian ketiga, penulis kertas dan pemeriksa penyataan, mengawasi ketidaksepadanan antara kaedah dan kod.
Sebelum memaparkan kertas kerja secara sebenar, ia terlebih dahulu menyusun setiap pernyataan fakta, memberi label bukti dalam baris kepada setiap ayat, dan mengaitkannya dengan produk tertentu dalam ruang kerja. Kemudian, seorang pemeriksa khusus membandingkan setiap pernyataan dengan sumber yang diklaimnya.
Bagaimana jika tidak sepadan? Di sini ada satu butir perincian yang sangat cerdik. Ia bukan sekadar membuangnya dengan kasar, tetapi "menarik balik" — mengatakan dengan lebih berhati-hati, supaya ia kembali ke dalam lingkungan yang disokong oleh bukti. Sejauh mana bukti boleh menyokong, itulah sejauh mana perkataan harus diucapkan.
Tidak berlebihan, dan juga berusaha tidak membuang-buang. Sensibilitas terhadap batas ini lebih canggih daripada pendekatan seragam.
Transcript: Adakah harga kejujuran menjadi lebih bodoh?
Di sini, satu persoalan tajam sepatutnya muncul.
Mengikat AI dengan begitu banyak rantai, memaksa setiap kalimatnya mencari bukti dengan hati-hati, apakah ia tidak lagi berani menjelajah secara berani? Apakah demi "kejujuran", kita telah mengorbankan "kompetensi"?
Kekhawatiran ini sangat munasabah. Ini juga merupakan kontradiksi klasik antara "keselamatan" dan "keupayaan".
Jawapan Science One adalah: Tidak.
Lihat terlebih dahulu lajur Kejujuran. Di bawah protokol audit yang sama—Google menyebutnya CoE Audit, sebuah alat pemeriksaan automatik seperti forensik yang akan memverifikasi semula setiap rujukan dengan pangkalan data akademik semasa—Science One memimpin dalam keempat-empat pemeriksaan integriti. Ia tidak menghasilkan ilusi rujukan; setiap rujukan menunjuk kepada satu kertas akademik yang benar dan boleh dicari; pengesahan skor dilakukan dengan sempurna; dan tahap keselarasan kaedah dan kod adalah yang tertinggi. Menurut data yang didedahkan, semua 337 rujukan yang dihasilkannya adalah benar, semua 12 keputusan eksperimen yang boleh diulang adalah tepat, dan 14 daripada 15 kertas akademik sepadan dengan kod sebenar.
Bandingkan dengan nama-nama menarik dalam garis dasar seperti "penyelesaian hibrida neurosimbolik" — kedengarannya hebat, tetapi bila anda buka kodnya, ia hanyalah peraturan heuristik deterministik yang ringkas. Nama itu untuk orang lihat, kodlah yang menjadi kebenaran.
Lihat semula kolom kecekapan.
Pada lima tugas berdasarkan tolok ukur ADRS, Science One menyamai atau melampaui tahap pakar manusia, dengan dua tugas (Cloudcast dan EPLB) mencapai pencapaian terbaik di semua sistem.
Di luar lingkungan ini, ia juga menantang tugas luar yang lebih sukar. Dalam lima pertandingan Kaggle yang sangat menantang di MLE-Bench, yang mencakup imej perubatan, pengenalan halus, dan kesedaran 3D, ia memenangi dua emas dan dua perak—dalam pertandingan pengesanan objek 3D, sistem lain gagal sepenuhnya, tetapi ia meraih skor setaraf juara. Dalam pertandingan latihan LLM secara masa nyata Parameter-Golf, di mana peranti keras dan saiz fail sangat terhad, sistem lain tidak mampu menghantar sebarang penyerahan yang berkesan, tetapi ia tidak hanya mematuhi semua had, tetapi juga mencatat pencapaian terbaik sehingga 27 April 2026. Dan ia mencapainya dengan menemui teknik algoritma yang benar-benar baru, bukan sekadar menyesuaikan parameter secara sembarangan.
Jadi jawapannya jelas: jujur, tanpa membuatnya menjadi bodoh.
Ini adalah perkara paling penting yang saya perhatikan. Jika Science One hanya mendapat kebersihan dengan cara yang terlalu berhati-hati, maka ia tidak bernilai apa-apa—kerana tiada siapa yang akan menggunakan alat penyelidikan yang bodoh tetapi jujur. Namun, ia membuktikan bahawa kesahihan dan prestasi tinggi boleh dicapai secara serentak. Inilah yang menjadikan "menganggap kejujuran sebagai batasan ketat" bukan sekadar inisiatif moral, tetapi pilihan yang ekonomik dari segi kejuruteraan.
Penilaian saya: Ia penting, tetapi jangan terburu-buru memujainya.
Setelah mengatakan banyak perkataan baik, perlu juga menyejukkan dengan dua pasu air sejuk.
Pertama: Google sendiri menulis dengan jelas di akhir teks, Science One adalah prototip penelitian eksperimen, bukan alat yang boleh digunakan secara langsung dalam produksi.
Ini bukan sikap rendah hati, ini adalah batas. Ia menjalankan lima tugas yang termasuk dalam bidang seperti pengoptimuman sistem—wilayah yang memiliki "penilai jelas yang boleh dinilai secara automatik". Dengan kata lain, baik atau buruknya boleh ditentukan secara objektif oleh mesin. Tetapi bagaimana dengan penyelidikan terkini yang sebenarnya? Banyak nilai hipotesis dan makna kesimpulan tidak mempunyai penilai yang boleh memberi skor dalam jangka pendek. Rantaian bukti boleh menghalang "pengutipan palsu", tetapi tidak boleh menghalang "memilih soalan yang biasa-biasa saja". Ia mengawal kejujuran, tetapi tidak mengawal selera.
Bakul kedua: Rantaian bukti itu sendiri juga mempunyai kos. Setiap topik membaca 100 fail PDF, membina bukti untuk setiap ayat, mengikat label, dan semak semula—proses ini tidak murah. Ia menghabiskan kuasa pengiraan dan masa sambil mengejar kebenaran. Apabila diperluaskan secara besar-besaran, bagaimana cara mengira kos ini masih belum ada jawapannya.
Tetapi setelah menuangkan kedua pasu air itu, saya masih berpendapat ini adalah perkara yang diremehkan.
Mengapa?
Kerana ia mengubah cara soalan diajukan.
Dua tahun lalu, semua orang bertanya: Bolehkah AI melakukan penyelidikan? Seberapa kuatkah ia? Orang-orang membandingkan kemampuan menyelesaikan masalah dan skor dalam senarai peringkat. Pertanyaan yang diajukan oleh Science One adalah dimensi lain: Bolehkah penyelidikan yang dihasilkan oleh AI dipercayai?
Dua soalan ini tidak berada di trek yang sama.
Semakin banyak sistem yang mampu menghasilkan penyelesaian yang cantik, kemampuan menyelesaikan masalah bukan lagi pemisah. Pada masa itu, yang benar-benar membezakan mereka ialah sama ada hasil mereka boleh dipercayai. Google menaikkan "boleh disahkan" ke taraf "warganegara kelas satu", mengatakan ia mesti menjadi batasan peringkat arsitektur, bukan tindakan pembaikan selepas kejadian—penilaian ini, menurut saya, betul dan tepat pada masanya.
Kerana kepercayaan itu perlahan dibina, tetapi cepat runtuh. Jika penyelidikan AI pada peringkat awal telah menghabiskan kepercayaan seluruh komuniti akademik melalui banyak kertas kerja yang kelihatan cemerlang tetapi penuh dengan kelemahan, maka usaha untuk memulihkannya kemudian akan menanggung kos yang terlalu besar untuk ditanggung. Science One melakukan perkara ini dengan memperkuat tulang belakang tapak sebelum ia runtuh.
Penutup
Kembali kepada soalan awal: Anda percaya bahawa tesis yang ditulis oleh AI?
Sebelum Science One, jawapan jujurnya adalah—tidak terlalu berani. Semakin baik ia ditulis, semakin anda perlu berhati-hati.
Science One tidak membuat AI menjadi lebih bijak. Yang ia lakukan ialah perkara lain yang lebih sederhana tetapi lebih sukar: membuat AI belajar untuk meninggalkan bukti yang boleh diuji bagi setiap perkataan yang ia ucapkan.
Terlalu banyak AI yang bijak.
AI yang bertanggungjawab atas dirinya sendiri baru saja bermula.
Langkah ini kecil, ia hanyalah prototaip, dan masih ada banyak masalah yang belum diselesaikan. Tetapi arahnya betul. Kadang-kadang, kepentingan sebenar sesuatu perkara bukan terletak pada seberapa pantas ia boleh berjalan pada masa ini, tetapi pada di mana ia menetapkan tolok ukurnya.
Science One mengalihkan ukuran dari "menulis seolah-olah ia benar" kepada "mampu bertahan semasa diperiksa".
Pindah saja ini, patut.
Rujukan
- Blog Penyelidikan Google. 《Rangka Kerja Science One: Rangka kerja penyelidikan autonom yang boleh diverifikasi melalui Chain-of-Evidence》, 30 Julai 2026.
- Penyelidikan AI Google Cloud. arXiv:2605.26340 Kertas kerja "Science One Framework / Chain-of-Evidence".
- AlphaSignal. 《Google's Science One Framework Fixes AI Research's Fake Citation Crisis》, Julai 2026.
- Zhi Ding Wang. "Kerangka Science One: Sistem Penyelidikan Autonom yang Boleh Diverifikasi Berdasarkan Rantai Bukti", 31 Julai 2026.
- Sakana AI. arXiv:2504.08066《The AI Scientist v2》(Bandingan asas)。
- OpenAI. Projek GitHub "Parameter-Golf" benchmark.
- arXiv:2410.07095 Kertas rujukan MLE-Bench.
- arXiv:2510.06189 Standard ADRS (Reka Bentuk Automatik Sistem Penyelidikan).
