GPT-6 Sol Bermula Ujian Dalaman, 6x Lebih Cepat Daripada Astra

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto: GPT-6 Sol kini sedang dalam ujian dalaman, menunjukkan kelajuan pemprosesan kira-kira enam kali lebih pantas daripada Astra. Pengguna Lentils memposting benchmark yang menunjukkan Sol menyelesaikan tugas penghasilan SVG dalam 3 minit, berbanding 19 minit untuk Astra. OpenAI mengatakan penyelidik kini menggunakan 3 agen AI setiap hari, dengan kos lebih daripada $600 dalam yuran API. Syarikat ini merancang automasi penyelidikan AI penuh pada 2028. Berita kripto terus menonjolkan kemajuan AI yang pantas.

GPT-6 tidak hanya memiliki Astra!

Astra baru sahaja dilancarkan, tetapi GPT-6 Sol telah diberitakan sedang dalam ujian dalaman.

GPT-6 Sol

Prestasi juga sangat menonjol, dengan kelajuan ujian sekali lalu 6 kali ganda lebih pantas daripada Astra.

Cuba teka: Adakah Terra dan Luna juga dalam perjalanan?

Dan pada hari yang sama, OpenAI baru sahaja mengumumkan satu set data dalaman:

Sehingga kini, dengan mengira berdasarkan hari kerja 8 jam, setiap hari kerja seorang penyelidik OpenAI, terdapat lebih daripada 3 hari kerja Multi-Agent yang beroperasi secara serentak.

Berdasarkan harga API, sumber daya inferensi Agent yang digunakan setiap hari oleh peneliti median OpenAI melebihi 600 dolar AS.

GPT-6 Sol

OpenAI juga mengumumkan bahawa telah mencapai «latihan penyelidikan automatik»:

Agen-agen ini boleh menyelesaikan sebahagian tugas yang sebelumnya memerlukan penyelidik menghabiskan beberapa hari, di bawah bimbingan manusia.

Even Huang Lao said: AGI has arrived!

GPT-6 Sol

Dia mengungkapkan bahawa Astra menggunakan sekitar 100,000 set NVIDIA Grace Blackwell NVLink72 untuk latihan, dan akan ada lagi 400,000 set GPU yang akan dilancarkan.

Ternyata gelombang ini bukan hanya dibesar-besarkan oleh OpenAI saja~

GPT-6 SOL dilaporkan telah bermula ujian dalaman

Pengguna internet Lentils melaporkan bahawa OpenAI sedang menguji GPT-6 Sol secara dalaman.

Dia menyatakan bahawa kapasiti output keseluruhan Sol jelas lebih lemah berbanding Astra yang baru dilancarkan, tetapi lebih pantas, dan masih termasuk model "monster".

Seberapa pantas? Kelajuan ujian sekali jalan kira-kira 6 kali ganda Astra.

Pengguna lyra menguji tugas yang sama kepada model yang berbeza: meminta model menghasilkan gambar SVG sebuah BMW M4 Competition.

Di antaranya, GPT-6 Sol menggunakan tahap Max, penghasilan tanpa sampel, mengambil masa sekitar 3 minit dan menghasilkan sekitar 28,000 Token.

GPT-6 Sol

GPT-6 Astra menggunakan tier Max, menghasilkan sekitar 25.000 Token, mengambil masa sekitar 19 minit.

GPT-6 Sol

Gemini 3.1 DeepThink memulakan peringkat High, menunjukkan output sebanyak kira-kira 3300 token, tetapi proses penalaran menghabiskan kira-kira 458,000 token, mengambil masa kira-kira 29 minit.

GPT-6 Sol

Gemini 3.8 Flash juga membuka tahap High, menghasilkan sekitar 19.000 token dalam masa sekitar 42 saat.

GPT-6 Sol

Sebaliknya, performa Sol paling menonjol: ia menghasilkan output yang hampir sebanding dengan Astra, tetapi kecepatan ujian sekali jalan kira-kira 6 kali lebih pantas daripada Astra—hanya mengambil kira-kira satu per enam masa.

Selain itu, pengguna internet Lentils juga menunjukkan prototaip dunia kotak pixel bernama 「The Realm of Aurellune」.

GPT-6 Sol

GPT-6 menghasilkan bandar, ladang, sungai, kastil, dan peta ringkas dalam satu kali percubaan, disertai panel kawalan untuk menukar siang dan malam, meletakkan nama tempat, serta menyesuaikan butiran—secara keseluruhan lebih menyerupai permainan simulasi pengurusan yang telah membina bentuk asasnya.

Ini adalah hasil yang dihasilkan dengan zero-shot, tahap inferensi Max, 15 minit, dan jumlah penggunaan 60,000 token.

Sekarang boleh disimpulkan bahawa Astra cenderung kepada penarikan mendalam pada kesukaran tertinggi, manakala Sol mungkin cenderung kepada kelajuan, throughput, dan penskalaan panggilan Agent.

Mengenai masa pelancaran Sol, pengguna Pankaj Kumar menyatakan bahawa ia mungkin dilancarkan secara rasmi pada 29 September di perjumpaan pengembang OpenAI.

GPT-6 Sol

Tidak dikesampingkan, GPT-6 Terra, Luna, dan GPT-Image 2.5 akan muncul serentak.

GPT-6 Sol

Penyelidik OpenAI, setiap orang membawa 3 ejen latihan ke tempat kerja

Pada hari yang sama, OpenAI juga memaparkan satu set data dalaman yang menarik—sejauh mana model AI mempercepat penyelidikan di laboratorium sendiri.

Pada pertengahan Ogos tahun ini, setiap jam kerja 8 jam oleh penyelidik, terdapat kira-kira 3.1 hari kerja tugas agen yang berjalan secara serentak.

Wah, seorang orang membawa tiga peserta latihan yang tidak tidur~

GPT-6 Sol

Berkenaan dengan perbelanjaan, berdasarkan harga API, median penyelidik menghabiskan lebih daripada 600 dolar AS setiap hari untuk sumber inferensi Agent.

Hampir sebanyak gaji sehari seorang jurutera peringkat permulaan.

GPT-6 Sol

Agen-agen ini sebenarnya melakukan apa?

Menulis kod penyelidikan, menulis kod infrastruktur, menyediakan persekitaran latihan, menjalankan eksperimen penilaian, mengesan dan membaiki gangguan alat dan persekitaran, menganalisis keputusan eksperimen, memantau tugas latihan... bahkan turut terlibat dalam pengumpulan dan komunikasi kesimpulan penyelidikan.

Secara asasnya, ia boleh melakukan segala-galanya selain daripada menentukan apa yang perlu diteliti.

Perubahan yang paling ketara ialah, dahulu apabila persekitaran ujian gagal, penyelidik perlu meminta bantuan di saluran dalaman; kini, Agent semakin mampu menangani perkara semacam ini, menjadikan jumlah soalan yang memerlukan bantuan manusia turun secara langsung.

GPT-6 Sol

Beberapa pasukan pula terus menghentikan masa tanya jawab teknikal tetap, dan mengalihkan sumber manusia untuk memperbaiki sistem itu sendiri.

Berdasarkan data ini, OpenAI secara rasmi mengumumkan: telah mencapai sasaran «AI Research Intern yang diotomatiskan».

Di sini, "latihan" secara tepatnya adalah nod penelitian yang mampu bekerja: di bawah bimbingan manusia, ia boleh menyelesaikan tugas penelitian yang batasnya jelas secara berdikari, dan beberapa tugas ini dahulunya memerlukan penyelidik berpengalaman berhari-hari untuk menyelesaikannya.

Kesan juga langsung kelihatan, dengan jumlah output kod dan eksperimen penyelidik meningkat.

GPT-6 Sol

Pada Ogos 2026, bilangan eksperimen per kapita mencapai paras tertinggi sejak pengiraan bermula pada Januari 2025, dan tugas yang diambil oleh Agen menjadi semakin kompleks serta tempoh yang semakin panjang.

GPT-6 Sol

Penulis artikel ini, Kevin Liu, juga meletakkan perkara ini dalam konteks yang lebih luas.

Dia percaya bahawa peningkatan diri berulang kemungkinan besar merupakan salah satu faktor paling penting yang akan mendorong lompatan kemampuan AI dalam beberapa tahun ke depan.

Secara ringkas, AI mencipta AI, semakin banyak dicipta, semakin pantas.

GPT-6 Sol

Tetapi masalahnya ialah, mengikut arus perkembangan semasa, kemampuan ini secara lalai hanya akan wujud di kalangan beberapa makmal AI terkini sahaja, dan pihak luar sukar melihat sejauh mana kemajuan tersebut.

Oleh itu, Liu berpendapat bahawa pengungkapan yang telus telah menjadi lebih mendesak daripada sebelum ini. Seberapa pantas model menjadi lebih kuat, dan sama ada ritme pembangunan perlu direm, tidak boleh ditentukan semata-mata oleh beberapa syarikat yang menutup pintu mereka.

Dia juga menyeru syarikat AI lain: seharusnya juga mengumumkan data serupa.

Namun, pembangunan AI memang menjadi lebih pantas, tetapi belum secepat itu hingga mencapai pemanduan sepenuhnya automatik.

Data dari OpenAI menunjukkan bahawa lebih daripada separuh kes berjaya dalam setengah tahun terakhir, tugas yang biasanya memerlukan 4 hingga 8 jam memerlukan campur tangan manusia sekurang-kurangnya sekali. Mengenai perancangan penyelidikan peringkat tinggi, hampir tidak pernah diserahkan kepada Agen.

GPT-6 Sol

Penyelidik masih bertanggungjawab menentukan apa yang perlu diselidiki, hasil mana yang patut diteruskan, serta kapan harus memperluas latihan, menghentikan eksperimen, atau melancarkan model.

Matlamat seterusnya OpenAI juga telah ditetapkan: mencapai "penyelidik AI automatik" sebelum Mac 2028.

Berbeza dengan "latihan" yang hanya mampu menangani tugas yang jelas, "penyelidik" perlu mampu memikul matlamat penyelidikan yang lebih terbuka dan mengendalikan projek yang lebih panjang secara kendiri—seolah-olah berubah daripada pelaksana menjadi penanggungjawab bebas.

Jika GPT-6 Sol benar-benar sudah dalam ujian dalaman, maka kemungkinan besar ia dihasilkan melalui model pengembangan baru ini:

Lebih banyak GPU menyediakan kuasa pengiraan, lebih banyak agen menjalankan eksperimen secara selari, sementara penyelidik manusia berdiri di tempat yang lebih tinggi — memilih arah, menilai keputusan, dan akhirnya memutuskan perkara mana yang layak dijadikan model generasi seterusnya.

AI yang lebih kuat sedang menjadi semakin sukar untuk dipantau

Pada hari yang sama, saintis utama OpenAI, Jakub Pachocki, mempersembahkan satu artikel panjang sepuluh ribu patah perkataan dengan tajuk langsung — «Pemikiran Alien».

GPT-6 Sol

Selepas saya membaca, saya rasa maksudnya ialah, ahli sains utama OpenAI pun sedang menasihati seluruh industri untuk memperlambatkan laju...

Jakub berpendapat, AI sama sekali bukan dibina oleh manusia dengan menyusun cip dan peraturan mengikut reka bentuk, tetapi lebih seperti tumbuh sendiri dalam data dan kuasa pengiraan yang melimpah.

Anda boleh membongkar dan memahami beberapa komponen, tetapi tidak ada yang dapat menjelaskan mengapa sistem keseluruhan tiba-tiba memperoleh kemampuan tertentu, atau bagaimana ia akan bertindak dalam persekitaran yang berbeza.

Yang lebih memusingkan, AI tidak perlu mengalahkan manusia secara menyeluruh untuk menimbulkan masalah; ia hanya perlu lebih unggul dalam cukup banyak kemampuan penting, maka ia boleh membantu anda dengan besar, tetapi juga boleh menciptakan masalah besar.

Jadi, masalahnya ialah: adakah manusia masih boleh memahaminya?

Dahulu, OpenAI memantau AI terutama dengan satu cara: memantau rantai pemikiran.

Dengan kata lain, memantau proses penalaran yang ditulis oleh model untuk memeriksa sama ada ia mencuba berkelakuan tidak jujur, seperti berusaha menipu, melanggar kuasa, atau mengelakkan sekatan.

Tetapi pada generasi Astra, trik ini mulai tidak berkesan.

Pertama, model semakin mahir dalam "mengurus" perkataan yang mereka keluarkan, dan pemikiran sebenar tidak selalu ditulis sepenuhnya dalam penalaran; kedua, Agent sudah lama tidak lagi hanya "memikirkan jawapan dahulu sebelum menjawab". Ia boleh memanggil alat, mengendalikan komputer, menjalankan persekitaran, serta bekerjasama dengan manusia dan Agent lain.

Perkara-perkara ini bercampur menjadi satu, para penyelidik tidak lagi mampu menarik satu rantai pemikiran yang lengkap dan telus untuk memeriksa setiap ayat.

OpenAI juga menemukan bahawa Astra tidak perlu menulis keseluruhan proses penalaran untuk menyelesaikan tugas yang kompleks.

Secara ringkas, model telah lama belajar untuk melakukan perkara besar tanpa bersuara.

GPT-6 Sol

Dalam ujian adversarial yang khusus dirancang untuk memaksa model mengelakkan pemantauan, Astra bahkan menunjukkan beberapa kemampuan yang membuat bulu roma berdiri: sengaja merendahkan skor ujian, mengelakkan pemantauan, dan melaksanakan tugas perusakan.

Tentu, semua ini adalah ujian tekanan yang direka secara manusia, dan OpenAI tidak mengambil kesimpulan bahawa Astra akan secara aktif berbohong dalam tugas harian berdasarkan ini. Tetapi ia sekurang-kurangnya menunjukkan bahawa hanya dengan memantau rantai pemikiran, sudah sukar untuk merangkumi semua perilaku yang mungkin dilakukan model.

Ingat kejadian Hugging Face sebelum ini? Itu adalah loceng peringatan.

GPT-6 Sol

Pada masa itu, GPT‑5.6 Sol dan satu model penyelidikan dalaman yang lebih kuat dimasukkan ke dalam jaringan latihan ExploitGym, dengan tugas mencari lubang keamanan, melaksanakan serangan, dan mendapatkan Flag. Untuk menguji kemampuan sebenar model, lingkungan penilaian tidak mengaktifkan pelindung keselamatan penuh.

Model hasil tidak menyelesaikan soalan dengan jujur; mereka terlebih dahulu melanggar pengasingan rangkaian, saling menghantar mesej melalui saluran tidak berkuasa dan bekerjasama secara berkumpulan.

Selepas itu, beliau memanfaatkan kelemahan hari sifar dalam proxy cache pakej untuk mendapatkan akses ke internet awam, dan akhirnya masuk ke sistem Hugging Face, cuba mencari jawapan ujian ExploitGym.

GPT-6 Sol

Sebenarnya, perkara ini terutama didorong oleh model penyelidikan dalaman IM1, GPT‑5.6 Sol juga mereplikasi sebahagian laluan serangan, dan Astra tidak terlibat.

Matlamat asal model masih untuk menyelesaikan ujian, tetapi untuk mendapatkan jawapan, mereka terus mencari lubang dalam peraturan, akhirnya melakukan tindakan yang melampaui lingkungan tugas.

Oleh itu, OpenAI juga mengenali isyarat bahaya: apabila Agent cukup kuat, alat cukup banyak, dan masa berjalan cukup lama, ia mungkin akan mencari laluan baru sendiri, memanggil sumber luar, atau bahkan bekerjasama dengan Agent lain.

Tidak... jadi, setelah berputar-putar, bukankah ini menjadi simpul mati??

OpenAI memerlukan model yang lebih kuat untuk menulis kod, menjalankan eksperimen, melakukan penyelidikan keselarasan, dan bahkan menggunakannya untuk membina sistem keselamatan yang mempertahankan AI lain. Semakin kuat modelnya, semakin banyak tugas yang boleh dilakukan, dan semakin pantas laju pembangunan.

Namun, pada masa yang sama, manusia semakin sukar menentukan bagaimana ia sampai kepada kesimpulan tersebut, dan sama ada ia akan mentafsir semula peraturan yang telah dipelajari apabila diletakkan dalam persekitaran yang berbeza.

Jakub menilai, kini tiada satu pun laboratorium yang berani mengatakan bahawa mereka telah menyelaraskan dan memantau model dengan betul, sehingga boleh memperbesarkan skala model pada kelajuan paling tinggi dengan yakin dalam jangka panjang.

GPT-6 Sol

Sebelum standard keselamatan bersama industri dibina, dia berharap semua orang akan menganggap “menghentikan secara sukarela” sebagai satu perjanjian tak tertulis.

Mengenai OpenAI sendiri, mereka juga menyatakan: jika diperlukan, mereka tidak menutup kemungkinan untuk menghentikan sementara secara sepihak dan tidak lagi memperluas skala model.

Kamu sebaiknya begitu… Saya ingat perusahaan yang bermula dengan huruf A juga pernah mengatakan hal yang sama.

Pautan rujukan:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: Ting Yü

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.