GPT-6 Astra mendapat skor hampir 100% dalam ujian ARC-AGI-3, menarik perhatian. Model ini menghasilkan "model dunia simbolik" yang efisien, mengabstrakkan dunia nyata menjadi simbol logik dan kod sebab-akibat, serta secara mandiri menciptakan sistem simbol algebra DSL untuk merekod peraturan persekitaran dalam permainan grafik asing, membina "kotak pasir maya" untuk simulasi sebelum bertindak. Namun, di belakang skor tinggi ini terdapat kos pengiraan yang mahal—sebanyak $360 setiap soalan, dengan jumlah keseluruhan ujian mencapai $18,000. Presiden ARC Prize Foundation, Greg Kamradt, menunjukkan bahawa skor tinggi bergantung pada kerangka luar Harness dan bukan pencapaian AGI sejati; ia hanya membuktikan bahawa AI semakin bijak.Penulis artikel, sumber: Leifengwang

Setiap soalan membakar 360 dolar, adakah GPT-6 benar-benar lulus AGI?
Model terkuat OpenAI, GPT-6 Astra, akhirnya dilancarkan, dengan terobosan menakjubkan dalam pengendalian komputer, penyelidikan saintifik, dan pertahanan keselamatan. Di antara pencapaian menonjol lainnya, yang paling banyak dibincangkan oleh awam ialah prestasinya yang hampir mencapai 100% dalam ujian ARC-AGI-3.

Apakah ARC-AGI-3? Ini adalah senarai penilaian "kecerdasan" AI yang diiktiraf secara global dalam dunia teknologi hari ini, dan anda boleh memahaminya sebagai peperiksaan masuk ke kelab Mensa untuk AI.
Ujian ini sepenuhnya terdiri daripada soalan pola grafik yang sentiasa berubah, sehingga sukar untuk dilatih melalui latihan. AI mesti mengeksplorasi persekitaran, meneroka tujuan, dan menggunakan kemampuan reaksi serta penalaran secara spontan untuk mengenal pasti pola. Ini merupakan tahap yang lebih tinggi dalam pelbagai penilaian, dan mampu menguji sama ada AI hanyalah sebuah alat atau benar-benar cerdas.
Namun, GPT-6 Astra berhasil melewati ujian ini sepenuhnya; perlu diingat, model sebelumnya, GPT-5.6 Sol, hanya mendapat skor 38,3%, yang merupakan lompatan besar. Kecerdasan ini bahkan mengungguli manusia—dalam 96% tingkat, ia memiliki efisiensi operasional yang lebih tinggi daripada manusia, dengan rata-rata langkah tindakan 51,7% lebih sedikit daripada manusia.
Jika sebuah AI benar-benar memiliki kemampuan untuk membina pola logik dan menyelesaikan masalah dalam persekitaran yang sepenuhnya asing, kita boleh membayangkan bahawa di masa depan, ia mungkin membuat pilihan yang betul dalam keadaan memandu autonomi yang tidak dikenali, atau dengan cepat menghasilkan struktur molekul ubat yang berkesan semasa wabak virus baru yang tidak diketahui.
Untuk mengkaji mengapa GPT-6 Astra begitu bijak, pihak rasmi ARC Prize secara langsung mengkaji semula rekod latar belakangnya, dan mendapati bahawa semasa bermain permainan, ia menghasilkan "model dunia simbolik" yang cekap.

Model Dunia Simbol adalah derivatif lanjutan daripada "Model Dunia". Apabila Model Dunia meramal masa depan dengan gambar seperti seorang seniman, Model Dunia Simbol serta-merta bertindak seperti seorang ahli matematik, mengabstrakkan dunia nyata kepada simbol logik dan kod kausal.
Teknologi ini diakui sebagai jalan penting menuju penalaran tingkat tinggi AI.
Apa itu Symbol World Model?
Dalam masa lalu, salah satu sebab utama model besar gagal mendapat markah tinggi dalam ujian piawai ARC-AGI ialah mereka terbiasa dengan “percubaan dan kesilapan kasar”. AI akan memotong skrin permainan menjadi blok piksel, kemudian mengklik secara rawak; jika salah, ia akan mencuba arah lain, bergantung pada keberuntungan untuk menyelesaikan permainan.
Dalam mod ini, walaupun terdapat beberapa kejayaan skor, AI tidak benar-benar memahami atau menguasai peraturan permainan.
Model dunia simbolik mampu menguasai keseluruhan kerana ia memahami secara penuh hukum fizikal dan hubungan sebab-akibat persekitaran, kemudian membuat pilihan melalui pengiraan yang tepat.
Dalam ujian sebenar, apabila GPT-6 Astra memasuki permainan grafik yang asing, ia akan memulakan pencatatan mendalam terhadap persekitaran yang diperhatikan menggunakan DSL buatannya sendiri, satu sistem simbol algebra eksklusif. Sebagai contoh, ia akan merekod dengan tepat peraturan tersirat permainan, siri arahan yang akan dilaksanakan, dan bahkan memetakan lintasan setiap piksel secara tepat ke dalam sistem koordinat.
Cara merekodkan algebra ini membawa kepada keadaan dunia yang unik dan pasti, berbanding dengan ambiguiti yang dihasilkan oleh model sebelumnya yang menggunakan interaksi bahasa semula jadi, pernyataan simbolik ini akan membawa lompatan epik dalam ketepatan.
Kemudian, ia akan menulis terlebih dahulu logik kod Python dalam fikiran: "Jika saya tekan A, grafik akan berpusing 90 darjah ke kiri."
Kemudian, ia akan membina sebuah "kotak pasir maya" di dalam otaknya, mensimulasikan rancangan seterusnya. Selepas mengesahkan bahawa logiknya tertutup dan tepat, baru ia akan melangkah pertama dalam permainan sebenar. Inilah sebabnya mengapa kecekapan operasinya jauh lebih tinggi daripada manusia.
Untuk menguji batasan kemampuan GPT-6 Astra, platform ujian tim merah PRO‑LONG memasukkannya ke dalam sandbox kod, membenarkan AI menulis dan menjalankan kod tersuai secara bebas.
Hasilnya, GPT-6 Astra mulai menciptakan alat yang "disesuaikan khusus" untuk setiap permainan. Sebagai contoh, dalam permainan labirin kompleks dengan penjaga yang berpatroli, GPT-6 Astra menulis sistem navigasi sendiri, kemudian menambahkan peraturan pertempuran, serta mensimulasikan rute patroli penjaga, akhirnya memprediksi dan mengesahkan hasilnya dengan sempurna melalui rantai alat buatannya sendiri.
Pada tahun-tahun awal, kemampuan menarik kesimpulan simbolik dan mencipta alat sendiri sepenuhnya bergantung pada kerangka kerja pihak ketiga Harness. Pihak ketiga membantu model dalam menterjemahkan gambar, merekam keadaan, dan mengesahkan hasil, tetapi kelemahannya sangat ketara: penghantaran data bolak-balik antara model dan pihak ketiga membawa latensi tinggi; kemampuan kejuruteraan pihak ketiga benar-benar terpisah daripada latihan berat model itu sendiri; disebabkan ketergantungan yang berat terhadap persekitaran pengiraan awan dan skrip luaran, kemampuan tingkat tinggi ini sukar dilaksanakan pada peranti tepi.
Sementara itu, GPT-6 Astra kini mengintegrasikan sejumlah kemampuan Harness secara langsung ke dalam bobot modelnya. Ahli terkemuka yang selalu mempromosikan model dunia simbolik, Gary Marcus, tak dapat menahan pujian terhadap GPT-6 Astra sebagai kemenangan besar dalam jalur ini.
Dalam dua tahun terakhir, banyak pencapaian utama telah muncul dalam bidang ini, dari Harvard dan MIT hingga Google DeepMind, semua pihak sedang mempertaruhkan "model dunia simbolik". Di persimpangan jalan yang tak terhitung jumlahnya menuju AGI, industri sedang mencapai konsensus teknis mendasar.
Skor se Tinggi Ini, AGI Sudah Pasti?
Pembuat soalan sendiri menyejukkan semangat
Yang menariknya, ketika seluruh jaringan bergemuruh dengan skor penilaian ini, ramai yang memperbaharui pernyataan Presiden OpenAI, Greg Brockman, “AGI telah tiba”, tetapi Presiden ARC Prize Foundation, Greg Kamradt, secara langsung menyejukkan semangat tersebut.
Dia adalah tokoh utama dalam kalangan penerbit soalan, dan dia paling berkuasa untuk menentukan bagaimana piawai dirancang dan bagaimana skor ditafsirkan. Dari sudut penilaian, dia percaya bahawa walaupun skor itu benar, ia masih jauh sekali daripada AGI.
Sejauh ini, dia telah melihat banyak pasukan mencapai lebih dari 90% di ARC-AGI-3 menggunakan Agent Harness, seperti PRO-LONG dengan eksternal memori super kuat, Tycho yang mahir dalam penarikan mendalam, dan Prime Agent yang mampu mengembangkan persekitaran pengaturcaraan sendiri.
Produk-produk yang mendapat skor tinggi ini memiliki resep teknikal yang sama, iaitu memiliki lima komponen utama: memori tanpa kehilangan, analisis berprogram, ujian hipotesis eksplisit, keadaan kekal, dan pengiraan dalaman berkos rendah.
Memori tanpa kehilangan bertanggung jawab atas ingatan, analisis berprogram bertanggung jawab atas logik, ujian hipotesis eksplisit bertanggung jawab atas penarikan kesimpulan, keadaan kekal bertanggung jawab atas konteks interaksi berbilang putaran, dan pengiraan dalaman berkos rendah bertanggung jawab atas kuasa pengiraan dalaman yang murah, membolehkan AI mencuba dan gagal secara liar dalam persekitaran maya sebelum mengeluarkan jawapan yang betul. Semua ini bersama-sama membentuk Harness yang tak terkalahkan, yang akan melengkapi kekurangan model itu sendiri.
GPT-6 Astra hampir mencapai skor 100%, menggunakan set harness mewah yang sama, ia memanfaatkan "bas adapter pemasok" yang disesuaikan khas, memanfaatkan perbualan berterusan dan pemampatan konteks untuk menyokong rantai logiknya; setiap selesai satu permainan, ia memerlukan 360 dolar AS tenaga komputasi yang mahal. Jika seluruh ujian dijalankan sepenuhnya, jumlah bil tenaga komputasi akan mencapai jumlah mengejutkan sebanyak 18,000 dolar AS (kira-kira 135,000 yuan China)!
Manusia mungkin hanya memerlukan beberapa minit untuk menyelesaikan teka-teki grafik, dengan mengira kos elektrik berdasarkan penggunaan tenaga 20W otak manusia, kurang daripada setengah sen; walaupun termasuk gaji sebenar yang dibayar kepada peserta, ia setara dengan $12.78 setiap permainan, manakala AI memerlukan $360. Kejayaan yang dicapai dengan “kuasa wang” ini, benarkah ia boleh menjadi AGI yang boleh diakses oleh orang biasa?
Tentu, GPT-6 Astra telah bermula menginternalisasi kemampuan Harness secara berperingkat, dan jika perkembangan ini berterusan, kapasiti pengiraan tersembunyi di dalam model akan menjadi semakin canggih. Namun, kerana proses penalarannya mulai tidak telus, para pembangun tidak tahu sama ada AI benar-benar memahami, atau hanya menemui cara penipuan yang lebih efisien.
Kembali kepada soalan di atas, adakah GPT-6 Astra dianggap sebagai AGI?
Untuk soal ini, Greg Kamradt memberikan respons penuh falsafah di akhir tulisan panjangnya. Mengapa manusia dianggap sebagai “kecerdasan umum”? Kerana manusia mampu menyesuaikan diri dengan dunia apa sahaja yang tidak diketahui, walaupun bayi zaman dahulu dibawa ke masa kini, dia tetap boleh belajar naik kereta bawah tanah dan guna telefon pintar. Kecerdasan ini berterusan selama ribuan tahun, terus mendorong kemajuan teknologi. Tetapi sekarang, ujian yang diperlukan oleh industri teknologi hanyalah ujian “permainan teka-teki grafik” yang diberikan kepada AI.
Ini hanya membuktikan bahawa AI sedang menjadi lebih bijak, tetapi bukan bukti bahawa AGI telah tiba.
