Tempoh simpanan model "terkuat" semakin memendek.Penulis artikel, sumber: Dingjiao
Dalam masa sebulan, sembilan model unggulan dilancarkan secara bersamaan, yang tidak biasa dalam industri model besar.
Dari awal bulan, ketika Tencent melancarkan versi rasmi dan sumber terbuka HuanYuan Hy3, hingga akhir bulan ketika Anthropic melancarkan Claude Opus 5, model-model seperti Kimi K3, Qwen3.8-Max versi pra-pandangan, dan Grok 4.5 turut muncul berturut-turut. Julai menjadi satu puncak pelancaran yang jarang berlaku dalam setahun terakhir.

Masa yang dipilih oleh setiap pihak berbeza. Sebahagian pengeluar mengikuti pelancaran selepas pesaing memperbaharui, sebahagian lagi memilih untuk memperkenalkan diri menjelang atau semasa Konvensyen Kecerdasan Buatan Sedunia, sementara ada yang merespons persaingan pasaran melalui penyesuaian harga.
Namun, Julai bukan sahaja tentang bilangan model yang dilancarkan, tetapi lebih penting lagi, pelancaran ini mencerminkan dua perubahan.
Pertama, jurang kemampuan antara model-model semakin mengecil. Indeks Kecerdasan Komprehensif terkini dari Artificial Analysis menunjukkan bahawa jarak antara model-model teratas telah jelas menyempit. Dengan iterasi versi yang pantas, kedudukan "model terkuat" menjadi semakin sukar dipertahankan dalam jangka panjang, dan setiap pihak kini beralih mencari keunggulan dalam tugas yang berbeza, bukan sekadar mengejar kepimpinan mutlak dalam satu dimensi.
Kedua, model sumber terbuka kini memasuki golongan teratas. Di antara model baru yang dilancarkan pada Julai, seperti Tencent Hunyuan Hy3 dan Kimi K3, memilih untuk membuka bobot (membuka parameter model, membenarkan pembangun memuat turun dan menghuraikan sendiri). Di antaranya, Kimi K3 menduduki tempat pertama dalam senarai pengaturcaraan depan Code Arena, melebihi GPT-5.6 Sol dan Claude Fable 5. Dalam dua tahun lalu, model sumber terbuka lebih banyak dipandang sebagai pengekor kepada model tertutup, tetapi persaingan kali ini menunjukkan bahawa model sumber terbuka telah mula bersaing secara langsung dengan model tertutup dalam beberapa skenario pembangunan.
Jadi, apakah penerbitan yang padat sebulan ini membawa perubahan apa, dan apa maksudnya?
01. Tidak lagi hanya membandingkan siapa yang lebih bijak
Dalam beberapa tahun terakhir, industri model besar terutama bersaing dalam kemampuan umum, siapa yang memiliki pengetahuan lebih luas dan jawapan lebih tepat. Tetapi sekarang, dimensi persaingan telah berubah.
Pada putaran ini, kemampuan kod menjadi arah persaingan yang paling jelas.
OpenAI terus memperkuat pemrograman dan penalaran kompleks, serta terus memperluas ekosistem Codex dengan harapan mengikat pengguna pengembang melalui alat pengembangan. Anthropic mempertaruhkan pemahaman kod dan audit keselamatan untuk membantu pembangun mengatasi masalah kejuruteraan kompleks dalam projek berskala besar. Grok 4.5 pula menekankan kelajuan dan kos rendah, serta diintegrasikan dengan alat pemrograman AI Cursor untuk menjangkau skenario pembangunan harian.
Ahmad Yuhang, penyelidik model besar, memberitahu "Dingjiao One" bahawa setiap syarikat sedang memberi tumpuan besar kepada kemampuan pengaturcaraan, dan jurangnya sedang mengecil dengan cepat; contohnya, kemampuan kod Kimi K3 telah meningkat ketara dan kini mendekati tahap model tertutup terkemuka.

Sumber gambar / pexels
Agen merupakan arah lain yang diperjuangkan oleh pelbagai pihak. GPT-5.6 Sol bekerjasama dengan Codex untuk mengkaji pengaturcaraan automatik, Opus 5 menekankan pelaksanaan tugas jangka panjang, Kimi K3 memperlihatkan kemampuan untuk beroperasi berterusan dan menyelesaikan tugas kompleks, manakala Tencent Hunyuan Hy3 cuba menggabungkan ekosistem WeChat untuk mengkaji aplikasi agen.
Namun, agen masih belum matang dalam pekerjaan sebenarnya. Pembangun bebas Bei Cheng menyatakan bahawa kelemahan sebahagian produk agen bukan pada kemampuan untuk memanggil alat, tetapi pada kemampuan pengurusan tugas. Sebagai contoh, mod Ultra Codex akan mengaktifkan banyak agen anak, di mana agen anak yang berbeza membaca fail yang sama berulang kali dan melakukan analisis serupa, akhirnya meningkatkan penggunaan Token, tetapi jumlah kerja yang benar-benar berkesan tidak bertambah. Menurutnya, peningkatan kemampuan agen tidak boleh hanya bergantung pada peningkatan bilangan agen anak; kuncinya ialah mampu menilai tugas mana yang patut dianalisis dan langkah mana yang boleh diabaikan.
Pandangan Yao Yuhang serupa. Beliau percaya bahawa agen pintar adalah arah yang paling patut diperhatikan pada masa ini, tetapi masih jauh daripada matang sepenuhnya. Menurut beliau, agen di bidang vertikal seperti kesihatan dan kewangan masih memiliki peluang besar; kunci utama yang akan membezakan tahap seterusnya bukan sahaja kemampuan model itu sendiri, tetapi juga sejauh mana agen itu mudah digunakan dalam konteks spesifik dan sama ada pelanggan bersedia membayar.
Model tempatan pula mencari terobosan melalui peningkatan kemampuan yang berbeza. Kimi K3 memilih untuk memperkuat kemampuan konteks panjang, pengaturcaraan antara muka, dan reka bentuk produk, serta berada di kedudukan teratas dalam pelbagai ujian pengaturcaraan, dengan kemampuan yang hampir setara dengan model unggul tertutup luar negara.
Pertandingan antara saiz parameter dan kecekapan inferens juga menjadi garis utama lain.
Beberapa model yang dilancarkan pada Julai memasuki julat parameter triliun bahkan beberapa triliun, tetapi ukuran parameter tidak lagi boleh dianggap setara dengan tahap keupayaan. Seiring perkembangan arsitektur MoE, model boleh memiliki kapasiti parameter yang lebih besar, sambil hanya mengaktifkan sebahagian kecil daripadanya untuk menjalankan inferens, mengurangkan kos pengiraan sebenar.
Industri ini membentuk dua lintasan: pertama, terus memperluas skala dengan parameter yang lebih besar untuk mendapatkan kemampuan yang lebih kuat; kedua, menekankan kecekatan dengan menggunakan parameter aktivasi yang lebih kecil untuk mencapai kesan yang hampir setara dengan model unggulan.
Harga juga menjadi pemboleh ubah paling langsung dalam persaingan model Julai.
Pembuat luar negara lebih banyak mengambil strategi penentuan harga yang berbeza. OpenAI memilih untuk lebih memperinci pasaran, memisahkan GPT-5.6 kepada beberapa versi, membolehkan pengguna memilih model yang sesuai dengan kekompleksan tugas; Anthropic terus mempertahankan jalan model unggul berprestasi tinggi, menggunakan siri Opus untuk menjangkau pembangunan bernilai tinggi dan skenario perniagaan; Grok 4.5 pula mengambil strategi harga rendah, dengan harga output hanya seperempat daripada siri Opus, serta menarik pembangun melalui pengikatan dengan Cursor.
Pembuat tempatan pula lebih menekankan kelebihan kos. Dalam enam bulan terakhir, pelbagai pembuat model tempatan berterusan menurunkan harga API, berharap untuk mengurangkan rintangan penggunaan melalui kos yang rendah dan memperluaskan skala pembangun serta pengguna perniagaan.
Ringkasan satu ayat: Persaingan model besar pada Julai telah berkembang dari perbandingan kemampuan tunggal kepada beberapa dimensi termasuk kod, agen, kecekapan parameter, dan harga.
02. Siapa yang melebihi jangkaan, siapa yang mendapat penilaian berbeza?
Berdasarkan perbandingan menyeluruh terhadap perubahan dibandingkan generasi sebelumnya, prestasi dalam senarai, dan umpan balik pembangun, tahap model yang dilancarkan pada Julai boleh dibahagikan kepada tiga kategori.
Pertama, lihat kategori yang melampaui jangkaan: Kimi K3, Grok 4.5, Hunyuan Hy3.
Yang paling diperhatikan ialah Kimi K3. Model ini menggunakan arsitektur MoE dengan jumlah parameter mencapai triliunan, dengan penekanan khusus pada kemampuan konteks panjang, pengembangan antarmuka, dan reka bentuk produk. Pada hari pelancaran, Kimi K3 menduduki tempat pertama dalam senarai pengembangan antarmuka Code Arena dengan skor 1679, meningkat 17 tempat daripada kedudukan ke-18 Kimi K2.6 sebelumnya. Dalam senarai komprehensif Arena seminggu kemudian, Kimi K3 memasuki 10 besar global untuk pertama kalinya.
Namun, Kimi K3 juga mempunyai batasan kemampuan yang jelas. Dalam ujian kebolehpercayaan pengetahuan Artificial Analysis, kadar ilusi meningkat dari 39% pada Kimi K2.6 kepada 51%, dengan kelajuan output sekitar 33 Token/s, jauh lebih rendah berbanding model sejenis.
Pengalaman penggunaan sebenar pembangun juga mengesahkan “kelemahan ini”. Bei Cheng percaya bahawa Kimi K3 memang menunjukkan peningkatan yang ketara berbanding generasi sebelumnya, dengan kelebihan utama terletak pada pembangunan antara muka, reka bentuk UI, dan ekspresi produk. Sebagai contoh, dalam tugas-tugas seperti mengoptimumkan UI laman web atau mereka bentuk antara muka apl, Kimi K3 dapat menghasilkan produk yang lebih baik, tetapi prestasinya tidak stabil apabila berurusan dengan tugas kejuruteraan yang kompleks.

Sumber gambar / pexels
Grok 4.5 juga mendapat perhatian yang sama. Selepas dilancarkan pada 9 Julai, ia memasuki senarai teratas dalam Indeks Pintar Artificial Analysis dan menunjukkan prestasi yang cemerlang dalam ujian panggilan alat, dianggap oleh banyak pembangun sebagai pilihan yang bernilai tinggi.
Pengalaman Bei Cheng sejajar dengan ini; beliau percaya bahawa kelebihan utama Grok 4.5 ialah kelajuan, di mana permintaan yang sama boleh diselesaikan dalam tiga hingga lima minit, manakala GPT-5.6 kadang-kadang memerlukan dua puluh minit atau bahkan setengah jam. Ditambah dengan harga yang lebih rendah, ia sesuai digunakan apabila terdapat keperluan pembangunan pantas. Yao Yuhang berpendapat bahawa kemampuan pemrograman Grok 4.5 telah dioptimaskan secara khusus, dan penggabungannya dengan Cursor memberikan pengalaman keseluruhan yang baik. Sebagai latar belakang, SpaceX sebelum ini mengumumkan pengambilalihan induk Cursor, Anysphere, dengan transaksi dijangka disempurnakan pada suku ketiga; kerjasama data antara xAI dan Cursor juga dianggap membantu mengoptimumkan pengalaman pemrograman Grok 4.5.
Hy3 Huyuan mewakili lompatan dalam jalan peningkatan kecekapan. Model ini mempunyai jumlah parameter keseluruhan 295B, dengan parameter yang diaktifkan hanya 21B, dan mencapai prestasi hampir sebanding dengan model pesaing yang lebih besar dalam pelbagai tolok ukur awam, walaupun dengan ukuran parameter kurang daripada seperlima model unggul. Namun, dalam SWE-Bench Pro, skor Hy3 Huyuan pada 57.9 berbanding 69.2 untuk Claude Opus menunjukkan jurang yang jelas, yang bermakna kemampuan membaiki kod kompleks masih perlu ditingkatkan.
Yao Yuhang percaya bahawa Hunyuan Hy3 menunjukkan kemajuan berbanding model sebelumnya Tencent, dan dengan reka bentuk sumber terbuka dan saiz kecil, ia merupakan pilihan yang baik dalam kategori ukuran sederhana.
Lihat pula kelas yang tetap berada di golongan teratas, tetapi dengan kejutan terhad: GPT-5.6 Sol dan Claude Opus 5.
GPT-5.6 Sol dan Claude Opus 5 masih mengekalkan kedudukan di kalangan teratas, tetapi tidak membawa perubahan besar. GPT-5.6 Sol memperkuat kemampuan penalaran kompleks dan pengaturan agen, mencapai 88.8% dalam ujian Terminal-Bench 2.1 (penilaian kemampuan model menyelesaikan tugas praktikal dalam persekitaran baris arahan), dengan mode Ultra meningkat kepada 91.9%. Claude Opus 5 terus mengekalkan kelebihannya dalam tugas kompleks, dengan penekanan tambahan pada kebolehpercayaan model dalam skenario seperti kejuruteraan kompleks, pemahaman kod, dan analisis keselamatan. Kelebihan Opus 5 ialah prestasinya hampir sebanding dengan Fable 5, tetapi harganya hanya separuh daripadanya.
Dua model ini masih berada di golongan teratas, tetapi tidak membawa lompatan besar.
Bei Cheng menyatakan bahawa GPT-5.6 sudah mampu memenuhi sebahagian besar keperluan pembangunan harian beliau, tetapi apabila menghadapi masalah yang sangat kompleks, beliau akan menggunakan Opus 5 untuk menyelesaikannya. Namun, kemampuan yang lebih kuat juga bermaksud kos yang lebih tinggi. Bagi beliau, Opus 5 lebih berfungsi sebagai "pakar" yang dipanggil semasa menyelesaikan masalah penting.
Terakhir ialah kelas yang mempunyai umpan balik yang berbeza dan masih perlu disahkan: Gemini 3.6 Flash dan versi pra-lihat Qwen3.8-Max.
Yang paling ketara ialah Gemini 3.6 Flash. Ia mendapat skor 50 dalam senarai indeks Penganalisisan Kecerdasan Buatan, sama seperti generasi sebelumnya, 3.5 Flash. Umpan balik daripada komuniti pembangun agak seragam bahawa generasi ini tidak menunjukkan peningkatan ketara berbanding generasi sebelumnya, dan prestasinya kurang baik berbanding pesaing semasa. Namun, ada yang berpendapat bahawa sebagai model ringan, kualiti output Gemini 3.6 Flash masih boleh diterima.
Menurut pengembang bebas Kapdim, pengalaman penggunaan harian Gemini 3.6 Flash adalah baik, walaupun kemampuan pemrogramannya tidak menonjol, pemahaman multimodal tetap sangat cemerlang. Ia menyokong input fail dalam sebarang format, dan gaya serta pengalaman perbualan harian lebih baik berbanding banyak pesaing.
Selepas pelancaran versi pratonton Qwen3.8-Max pada Julai, prestasi model tidak stabil dan mendapat respons yang berbeza dari pasaran. Pengalaman utama Bei Cheng ialah bahawa versi pratonton Qwen3.8-Max mempunyai kedalaman pemikiran yang tinggi, tetapi kadang-kadang terperangkap dalam penalaran yang panjang, "seolah-olah ia memutarbelitkan dirinya sendiri", tetapi akhirnya tidak memberikan penyelesaian yang berkesan. Kapdim pula berpendapat bahawa versi pratonton Qwen3.8-Max di bawah jangkaan; semasa menguji dengan set penilaian estetik depannya sendiri, dia mendapati kemampuan sebenar berbeza jauh daripada promosi. Sebagai produk pratonton yang masih dalam penyesuaian, prestasi akhirnya perlu diverifikasi selepas pelancaran versi rasmi.
Bulan Julai tidak menghasilkan model yang memimpin di semua dimensi, dan model yang berbeza mula membentuk pembahagian tugas berdasarkan skenario tertentu.
Sebagai contoh, Bei Cheng akan memilih alat berdasarkan tugas: GPT-5.6 digunakan untuk pembangunan harian, Grok 4.5 untuk menyelesaikan keperluan dengan cepat, Kimi K3 untuk skenario produk dan frontend, serta Claude Opus 5 untuk menyelesaikan masalah kompleks. Pendekatan Kapdim pula berbeza, beliau akan menggunakan model Fable 5 atau Opus 5 Claude untuk perancangan, kemudian melaksanakannya melalui GPT-5.6 Sol.
03. Penerbitan semakin cepat, perdebatan antara sumber terbuka dan sumber tertutup semakin memanas
Di sebalik rilis padat ini, terdapat beberapa persoalan yang patut dianalisis: mengapa iterasi model semakin cepat, mengapa semuanya berpusat pada bulan Julai, dan mengapa sumber terbuka akan mengejutkan model perniagaan yang sedia ada.
Pertama, cara iterasi model sedang berubah. Di masa lalu, peningkatan kemampuan model besar terutama bergantung pada pelatihan semula model berskala lebih besar, dengan siklus yang panjang dan kos yang tinggi. Namun, seiring dengan kedewasaan teknologi seperti pembelajaran penguatan dan pasca-pelatihan (mengoptimumkan prestasi model selepas pelatihan asas melalui penyesuaian halus, pembelajaran penguatan, dll.), peningkatan model kini lebih banyak bergantung pada pengoptimuman selepas pelatihan.
Yao Yuhang memberitahu 'Dingjiao One' bahawa laju pengeluaran model telah jelas meningkat dalam dua tahun terakhir, dan satu sebab utamanya ialah industri telah menguasai kaedah pasca-pelatihan yang lebih matang. Kini, banyak peningkatan model tidak memerlukan pelatihan semula model, tetapi lebih kepada pengoptimuman berterusan terhadap model asas yang sedia ada melalui cara-cara seperti pembelajaran berpenguatan dan iterasi sendiri.
Ini bermakna, kitaran persaingan model semakin memendek. Dahulu, satu model terkemuka mungkin mengekalkan keunggulan selama berbulan-bulan; kini, jendela keunggulan yang dihasilkan oleh kemas kini versi mungkin hanya beberapa minggu. Jika ritme pelancaran tidak mampu mengikuti, model tersebut boleh dengan cepat digantikan oleh versi baharu. Bagi pengeluar, melancarkan model bukan sekadar persembahan teknikal, tetapi masa pelancaran itu sendiri menjadi sebahagian daripada persaingan.

Sumber gambar / pexels
Kedua, Julai adalah masa di mana beberapa peristiwa bertindih. Bagi pengeluar tempatan, Konvensyen Kecerdasan Buatan Sedunia (WAIC) diadakan pada Julai, di mana pengeluar secara berkumpulan mengumumkan model dan menunjukkan kemajuan teknologi pada atau sekitar masa ini. Bagi pengeluar luar negara, banyak syarikat terkemuka juga memilih untuk mengemas kini model pada peringkat ini, dengan harapan untuk mendapat keuntungan dalam ekosistem pembangun dan persaingan perniagaan.
Selain itu, peraturan persaingan dalam industri sedang berubah. Kemampuan model yang kuat bukan lagi satu-satunya matlamat; persaingan telah meluas kepada bagaimana model digunakan dan bagaimana ia ditukar menjadi pendapatan.
Inilah sebab mengapa perdebatan antara sumber terbuka dan sumber tertutup kembali memanas pada bulan Julai. Selama ini, terdapat jurang kemampuan antara model sumber terbuka dan model sumber tertutup. Namun, dengan sebahagian model sumber terbuka memasuki golongan teratas, satu persoalan yang lebih realistik muncul: apakah pendapatan daripada panggilan API dan langganan syarikat model akan berkurang apabila model berprestasi tinggi boleh diperoleh secara percuma?
Pihak yang menyokong sumber terbuka berpendapat bahawa bobot terbuka dapat menurunkan rintangan teknikal, membolehkan lebih banyak perusahaan dan pembangun terlibat dalam inovasi AI. Sumber terbuka bermaksud pemberi teknologi secara aktif melepaskan sebahagian kepentingan mereka untuk mendorong perkembangan ekosistem; manakala pihak tertutup risau pengguna mereka akan dialihkan ke model sumber terbuka. Syarikat-syarikat seperti Anthropic berpendapat bahawa seiring dengan peningkatan kemampuan model, pembukaan bobot mungkin membawa risiko keselamatan dan memerlukan tatacara yang lebih ketat.
Di sebalik perdebatan ini sebenarnya terdapat kepentingan yang berbeza antara syarikat-syarikat. Bagi syarikat infrastruktur seperti NVIDIA, keterbukaan model bermaksud lebih banyak permintaan penyebaran dan pasaran kuasa pengiraan yang lebih besar. Bagi syarikat model seperti OpenAI dan Anthropic, model tertutup mampu mengekalkan pendapatan daripada panggilan API dan langganan. Namun, perlu diperhatikan sisi lain: keterbukaan sumber terbuka memang akan memperluaskan permintaan penyebaran, tetapi dengan peningkatan kecekapan parameter, penggunaan kuasa pengiraan per tugas mungkin juga diratakan, sehingga pertambahan pasaran kuasa pengiraan tidak semestinya sejajar dengan tahap keterbukaan model. Bagi pengeluar tempatan, keterbukaan berat model bukan sahaja pilihan jalan teknikal, tetapi juga usaha untuk memperoleh ekosistem pembangun, perkhidmatan awan, dan akses kepada komersialisasi seterusnya.
Selepas Julai, persaingan model besar akan berterusan. Komuniti pembangun secara umum mengjangka bahawa model-model baharu seperti DeepSeek V4 versi rasmi, Fable 5.1, dan GPT-6 akan dikeluarkan secara berturut-turut pada bulan Ogos.
Kesenangan kemampuan model semakin mengecil, dan semakin sukar untuk membina keunggulan jangka panjang hanya dengan melancarkan model yang lebih kuat. Yang perlu diperhatikan seterusnya ialah beberapa indikator spesifik: di mana versi rasmi DeepSeek V4 akan mendorong had kemampuan model sumber terbuka, sama ada harga API akan terus menurun, sama ada agen pintar boleh mencipta skenario pembayaran yang stabil, dan sama ada model sumber terbuka boleh dimasukkan ke dalam pelaksanaan persendirian oleh lebih banyak perusahaan. Jawapan kepada soalan-soalan ini akan lebih memberi petunjuk tentang apa yang sebenarnya berubah dalam pertarungan ini berbanding kedudukan dalam senarai.
Gambar utama berasal dari Pexels.
