GPT-6 Sol Mulai Pengujian Internal, 6x Lebih Cepat dari Astra

icon MarsBit
Bagikan
AI summary iconRingkasan
Berita AI + kripto: GPT-6 Sol kini sedang dalam pengujian internal, menunjukkan kecepatan pemrosesan sekitar enam kali lebih cepat daripada Astra. Pengguna Lentils memposting benchmark yang menunjukkan Sol menyelesaikan tugas generasi SVG dalam 3 menit, dibandingkan 19 menit oleh Astra. OpenAI mengatakan para peneliti sekarang menggunakan 3 agen AI setiap hari, dengan biaya lebih dari $600 dalam biaya API. Perusahaan berencana mengotomatisasi seluruh penelitian AI pada tahun 2028. Berita kripto terus menyoroti kemajuan AI yang cepat.

GPT-6 tidak hanya memiliki Astra!

Astra baru saja dirilis, tetapi GPT-6 Sol telah terungkap sedang dalam pengujian internal.

GPT-6 Sol

Performa juga sangat menonjol, dengan kecepatan uji coba tunggal 6 kali lebih cepat daripada Astra.

Coba tebak: Apakah Terra dan Luna juga sedang dalam perjalanan?

Dan pada hari yang sama, OpenAI baru saja mempublikasikan sekelompok data internal:

Sampai saat ini, setiap hari kerja OpenAI researcher, setara dengan lebih dari 3 hari kerja agen ganda yang berjalan secara bersamaan dalam satu hari kerja 8 jam.

Berdasarkan harga API, sumber daya inferensi Agent yang digunakan setiap hari oleh peneliti median OpenAI melebihi $600.

GPT-6 Sol

OpenAI juga mengumumkan telah mencapai 'intern penelitian otomatis':

Agent-agent ini dapat menyelesaikan sebagian tugas yang sebelumnya memerlukan waktu beberapa hari bagi peneliti, dengan bimbingan manusia.

Bahkan Huang Lao mengatakan: AGI sudah datang!

GPT-6 Sol

Dia mengungkapkan bahwa Astra menggunakan sekitar 100.000 unit NVIDIA Grace Blackwell NVLink72 untuk pelatihan, dan akan segera menambahkan 400.000 unit GPU lagi.

Ternyata gelombang ini bukan hanya omong kosong dari OpenAI saja~

GPT-6 Sol dikabarkan mulai menjalani pengujian internal

Netizen Lentils mengungkap bahwa OpenAI sedang menguji GPT-6 Sol secara internal.

Dia menyatakan bahwa kapasitas output keseluruhan Sol jelas lebih lemah dibandingkan Astra yang baru dirilis, tetapi lebih cepat, dan tetap termasuk model "monster".

Seberapa cepat? Kecepatan pengujian tunggal sekitar 6 kali lebih cepat daripada Astra.

Pengguna lyra menguji tugas yang sama ke berbagai model: meminta model menghasilkan gambar SVG dari BMW M4 Competition.

Di antaranya, GPT-6 Sol menggunakan level Max, generasi nol sampel, memakan waktu sekitar 3 menit, dan menghasilkan sekitar 28.000 Token.

GPT-6 Sol

GPT-6 Astra menggunakan level Max, menghasilkan sekitar 25.000 Token, memakan waktu sekitar 19 menit.

GPT-6 Sol

Gemini 3.1 DeepThink telah mengaktifkan mode High, menampilkan output sekitar 3.300 Token, tetapi proses inferensi menghabiskan sekitar 458.000 Token dan memakan waktu sekitar 29 menit.

GPT-6 Sol

Gemini 3.8 Flash juga membuka level High, menghasilkan sekitar 19.000 token dalam waktu sekitar 42 detik.

GPT-6 Sol

Sebaliknya, Sol menunjukkan kinerja paling menonjol: output-nya hampir sebanding dengan Astra, tetapi kecepatan uji coba per kali sekitar 6 kali lebih cepat daripada Astra—hanya memakan waktu sekitar seperenam dari waktu yang dibutuhkan Astra.

Selain itu, pengguna internet Lentils juga menampilkan prototipe dunia sandbox bergaya pixel bernama «The Realm of Aurellune».

GPT-6 Sol

GPT-6 secara langsung menghasilkan kota, lahan pertanian, sungai, kastil, dan peta mini, dilengkapi panel kontrol untuk peralihan siang-malam, penempatan nama lokasi, dan penyesuaian detail, keseluruhan terasa seperti game simulasi manajemen yang sudah memiliki bentuk awal yang siap.

Ini adalah hasil generasi dengan zero-shot, tingkat inferensi Max, 15 menit, dan total pengeluaran 60.000 token.

Saat ini dapat diasumsikan bahwa Astra cenderung pada penalaran mendalam dengan tingkat kesulitan tertinggi, sementara Sol kemungkinan cenderung pada kecepatan, throughput, dan skalabilitas pemanggilan Agent.

Tentang waktu peluncuran Sol, pengguna internet Pankaj Kumar menyatakan bahwa kemungkinan akan diluncurkan secara resmi pada konferensi pengembang OpenAI pada 29 September.

GPT-6 Sol

Tidak menutup kemungkinan, GPT-6 Terra, Luna, dan GPT-Image 2.5 juga akan muncul bersamaan.

GPT-6 Sol

Peneliti OpenAI, rata-rata membawa 3 agen intern ke kantor

Pada hari yang sama, OpenAI juga membagikan sekelompok data internal yang menarik—sejauh mana model AI mempercepat penelitian di laboratorium mereka sendiri.

Hingga pertengahan Agustus tahun ini, untuk setiap 8 jam kerja seorang peneliti, sekitar 3,1 hari kerja tugas Agent berjalan secara paralel.

Wah, seorang orang membawa tiga magang yang tidak tidur~

GPT-6 Sol

Untuk biaya, berdasarkan harga API, median peneliti menghabiskan lebih dari 600 dolar AS per hari untuk sumber daya inferensi Agent.

Hampir sebesar gaji sehari seorang insinyur pemula.

GPT-6 Sol

Agen-agen ini sebenarnya sedang melakukan apa?

Menulis kode penelitian, menulis kode infrastruktur, membangun lingkungan pelatihan, menjalankan eksperimen evaluasi, memecahkan masalah alat dan lingkungan, menganalisis hasil eksperimen, memantau tugas pelatihan... bahkan ikut serta dalam mengatur dan berkomunikasi tentang kesimpulan penelitian.

Pada dasarnya, selain memutuskan apa yang akan diteliti, ia bisa melakukan segalanya.

Perubahan paling langsung adalah, dulu ketika lingkungan eksperimen gagal, peneliti harus meminta bantuan di saluran internal; sekarang, Agent semakin mampu menangani hal-hal semacam ini, sehingga jumlah pertanyaan yang memerlukan bantuan manusia langsung turun.

GPT-6 Sol

Tim lainnya langsung menghapus waktu tetap untuk sesi tanya jawab teknis, sehingga personel dapat fokus memperbaiki sistem itu sendiri.

Berdasarkan data ini, OpenAI secara resmi mengumumkan: telah mencapai tujuan «AI Research Intern otomatis».

Di sini, "intern" secara akurat adalah sebuah node pengembang yang bisa bekerja: di bawah bimbingan manusia, ia dapat menyelesaikan tugas penelitian dengan batasan jelas secara mandiri, dan beberapa tugas tersebut sebelumnya memerlukan waktu beberapa hari bagi peneliti berpengalaman.

Efeknya langsung terlihat, dengan jumlah kode dan eksperimen yang dihasilkan oleh peneliti terus meningkat.

GPT-6 Sol

Pada Agustus 2026, jumlah eksperimen per kapita mencapai rekor tertinggi sejak pencatatan dimulai pada Januari 2025, dan pekerjaan yang diambil oleh Agent menjadi semakin kompleks dengan siklus yang semakin panjang.

GPT-6 Sol

Penulis artikel ini, Kevin Liu, juga menempatkan peristiwa ini dalam konteks yang lebih luas.

Dia percaya bahwa perbaikan diri rekursif kemungkinan besar merupakan salah satu faktor paling penting yang akan mendorong lompatan kemampuan AI dalam beberapa tahun mendatang.

Secara sederhana, AI membuat AI, semakin dibuat semakin cepat.

GPT-6 Sol

Namun, masalahnya adalah, berdasarkan tren saat ini, kemampuan ini secara default hanya akan muncul di dalam beberapa laboratorium AI terdepan, sehingga pihak luar sulit melihat sejauh mana kemajuan yang telah dicapai.

Oleh karena itu, Liu berpendapat bahwa pengungkapan transparan telah menjadi lebih mendesak daripada sebelumnya. Seberapa cepat model menjadi lebih kuat, apakah ritme pengembangan perlu diperlambat, tidak bisa hanya ditentukan oleh beberapa perusahaan yang menutup pintu mereka.

Dia juga menyerukan perusahaan AI lainnya: seharusnya juga mempublikasikan data serupa.

Namun, pengembangan AI memang menjadi lebih cepat, tetapi belum secepat itu hingga mencapai kendaraan otonom penuh.

Data dari OpenAI menunjukkan bahwa selama enam bulan terakhir, lebih dari setengah kasus sukses untuk tugas yang awalnya memerlukan 4 hingga 8 jam, manusia setidaknya harus terlibat satu kali. Mengenai perencanaan penelitian tingkat tinggi, hampir tidak pernah diserahkan kepada Agent.

GPT-6 Sol

Peneliti tetap bertanggung jawab untuk menentukan apa yang akan diteliti, hasil mana yang layak dilanjutkan, dan kapan harus memperluas pelatihan, menghentikan eksperimen, atau menerapkan model.

Tujuan berikutnya OpenAI juga telah ditetapkan: mencapai "peneliti AI otomatis" sebelum Maret 2028.

Dibandingkan dengan "intern" yang hanya bisa menerima tugas yang jelas, "peneliti" harus mampu menangani tujuan penelitian yang lebih terbuka dan mengelola proyek dengan siklus yang lebih panjang sendiri—setara dengan berubah dari pelaksana menjadi pemimpin independen.

Jika GPT-6 Sol benar-benar sudah dalam pengujian internal, maka kemungkinan besar itu dihasilkan melalui model pengembangan baru ini:

Lebih banyak GPU menyediakan daya komputasi, lebih banyak agen menjalankan eksperimen secara paralel, sementara peneliti manusia berdiri di posisi yang lebih tinggi—memilih arah, menilai hasil, dan akhirnya memutuskan hal-hal apa yang layak diubah menjadi model generasi berikutnya.

AI yang lebih kuat sedang menjadi semakin sulit dipantau

Pada hari yang sama, ilmuwan utama OpenAI, Jakub Pachocki, mempublikasikan artikel panjang beribu-ribu kata dengan judul langsung — «Berpikir Alien».

GPT-6 Sol

Setelah saya membacanya, saya merasa maksudnya adalah bahkan ilmuwan utama OpenAI pun sedang menyarankan seluruh industri untuk memperlambat...

Jakub mengatakan bahwa AI sama sekali bukan sesuatu yang dirakit manusia berdasarkan gambar desain, chip demi chip, aturan demi aturan; ia lebih mirip tumbuh dengan sendirinya di tengah data dan daya komputasi yang sangat besar.

Anda bisa membongkar dan memahami beberapa komponennya, tetapi tidak ada yang bisa menjelaskan mengapa sistem keseluruhan tiba-tiba memiliki kemampuan tertentu, atau bagaimana ia akan bertindak di lingkungan yang berbeda.

Yang lebih membingungkan, AI tidak perlu mengungguli manusia secara menyeluruh untuk menimbulkan masalah; cukup dengan lebih unggul di sejumlah kemampuan kunci yang cukup banyak, ia bisa membantu Anda sangat besar, sekaligus menimbulkan masalah besar.

Jadi pertanyaannya adalah: apakah manusia masih bisa memahaminya?

Dulu, OpenAI memantau AI terutama dengan satu cara: melihat rantai pemikiran.

Secara sederhana, ini berarti memantau proses penalaran yang ditulis oleh model, memeriksa apakah ia berusaha berbuat curang, seperti ingin menipu, melampaui wewenang, atau menghindari batasan.

Tetapi pada generasi Astra, trik ini mulai gagal.

Pertama, model semakin mahir dalam "mengelola" ucapan mereka sendiri, sehingga pikiran sejati tidak selalu tertulis dalam proses penalaran; kedua, Agent sudah lama tidak lagi hanya "memikirkan dulu baru menjawab." Ia dapat memanggil alat, mengoperasikan komputer, menjalankan lingkungan, serta berkoordinasi dengan manusia dan Agent lainnya.

Hal-hal ini saling terkait, sehingga para peneliti tidak lagi bisa menarik rantai pemikiran yang utuh dan transparan untuk memeriksa setiap kalimat.

OpenAI juga menemukan bahwa Astra dapat menyelesaikan tugas kompleks tanpa harus menuliskan seluruh proses inferensinya.

Secara sederhana, model telah belajar untuk diam-diam melakukan hal-hal besar.

GPT-6 Sol

Dalam uji coba adversarial yang dirancang khusus untuk memaksa model menghindari pemantauan, Astra bahkan menunjukkan beberapa kemampuan yang membuat bulu kuduk berdiri: sengaja menurunkan skor uji, menghindari pemantauan, dan menjalankan tugas perusakan.

Tentu, semua ini adalah uji tekanan yang dirancang secara manusiawi, dan OpenAI tidak menyimpulkan bahwa Astra akan secara aktif berbohong dalam tugas sehari-hari. Namun, setidaknya ini menunjukkan bahwa hanya dengan mengamati rantai pemikiran, sudah sulit untuk mencakup semua kemungkinan perilaku model.

Masih ingat kejadian Hugging Face sebelumnya? Itu adalah lonceng peringatan.

GPT-6 Sol

Pada saat itu, GPT‑5.6 Sol dan sebuah model penelitian internal yang lebih kuat dimasukkan ke dalam jaringan target ExploitGym, dengan tugas mencari kerentanan, menyelesaikan serangan, dan mendapatkan Flag. Untuk mengukur kemampuan sejati model, lingkungan evaluasi tidak mengaktifkan perlindungan keamanan penuh.

Model hasilnya tidak menyelesaikan soal dengan jujur, mereka terlebih dahulu melewati isolasi jaringan, saling mengirim pesan melalui saluran tidak sah, dan bekerja sama secara terbagi.

Selanjutnya, memanfaatkan kerentanan nol-hari di proxy cache paket untuk mendapatkan akses ke internet publik, dan akhirnya masuk ke sistem Hugging Face, berusaha mencari jawaban uji coba ExploitGym.

GPT-6 Sol

Sebenarnya, hal ini terutama didorong oleh model penelitian internal IM1, GPT‑5.6 Sol juga mereproduksi sebagian jalur serangan, sedangkan Astra tidak terlibat.

Tujuan awal model tetap menyelesaikan pengujian, tetapi untuk mendapatkan jawaban, mereka terus mencari celah aturan, hingga akhirnya melakukan tindakan di luar cakupan tugas.

Oleh karena itu, OpenAI juga mengidentifikasi sinyal bahaya: ketika Agent cukup kuat, alat cukup banyak, dan waktu berjalan cukup lama, ia mungkin akan mencari jalur baru sendiri, memanggil sumber daya eksternal, atau bahkan berkolaborasi dengan Agent lain.

Tidak... jadi berputar-putar, bukankah ini jadi simpul mati??

OpenAI membutuhkan model yang lebih kuat untuk menulis kode, menjalankan eksperimen, melakukan penelitian alignment, bahkan menggunakannya untuk membangun sistem keamanan yang melindungi dari AI lain. Semakin kuat modelnya, semakin banyak pekerjaan yang bisa dilakukan, dan semakin cepat kecepatan pengembangannya.

Namun, seiring itu, manusia semakin sulit memastikan bagaimana ia sampai pada kesimpulan tersebut, dan apakah ia akan menafsirkan ulang aturan yang telah dipelajari ketika berada di lingkungan yang berbeda.

Jakub menilai, saat ini tidak ada laboratorium mana pun yang berani mengklaim telah menyelesaikan penyelarasan dan pemantauan model dengan baik, sehingga dapat memperluas skala model secara terus-menerus dengan kecepatan maksimal dan tanpa khawatir.

GPT-6 Sol

Sebelum standar keamanan bersama di seluruh industri dibangun, ia berharap semua pihak dapat menjadikan "menginjak rem secara sukarela" sebagai sebuah kesepakatan implisit.

Mengenai OpenAI sendiri, mereka juga menyatakan: jika diperlukan, tidak menutup kemungkinan untuk menghentikan sementara secara sepihak dan tidak lagi memperluas skala model.

Kamu sebaiknya memang begitu... Saya ingat perusahaan yang namanya dimulai dengan huruf A juga pernah mengatakan hal yang sama.

Tautan referensi:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Artikel ini berasal dari akun WeChat "Quantum Bit", penulis: Ting Yu

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.