“Kelesuan model” bukan kerana model tidak lagi membaik, tetapi kerana kelajuan kemas kini model melebihi kelajuan ujian, pembelian, dan tata tertib perusahaan. Sumber yang benar-benar langka sedang berpindah dari “mendapatkan model yang lebih kuat” kepada “menilai secara berterusan model mana yang patut digunakan”.Penulis artikel, sumber: ME News

TL;DR
- “Kelesuan model” bukan kerana model tidak lagi membaik, tetapi kerana kelajuan kemas kini model melebihi kelajuan ujian, pembelian, dan tata tertib perusahaan. Sumber yang benar-benar langka sedang berpindah dari “mendapatkan model yang lebih kuat” kepada “menilai secara berterusan model mana yang patut digunakan”.
- Minggu ini, Anthropic, Meta, Google, dan OpenAI akan mengemas kini model mereka dalam beberapa hari, tetapi banyak daripadanya merupakan pembaruan versi kecil. Model terus menjadi lebih kuat, tetapi semakin sukar untuk menentukan siapa yang mengalami lompatan generasi sejati hanya dengan menggunakan senarai tunggal.
- Selepas memasuki peringkat Agen, kos perusahaan tidak boleh hanya dilihat berdasarkan harga unit Token; bilangan panggilan alat, cache, panjang inferens, kejayaan tugas, dan semakan keselamatan juga akan dimasukkan ke dalam akaun jumlah.
- Gartner menganggarkan perbelanjaan AI global akan mencapai US$2.596 trilion pada tahun 2026, meningkat 47% secara tahunan, tetapi hanya 22% daripada organisasi yang disurvei telah melaksanakan AI secara berskala ke beberapa unit perniagaan. Wang sedang masuk dengan lebih pantas, tetapi kemampuan organisasi untuk menyerapnya tidak meningkat seiring.
“Model fatigue” bukanlah penghentian teknologi, tetapi laju inovasi melebihi laju pembelian
Sehingga 7 September 2026, minggu lalu hampir seperti serangkaian pelancaran model berturut-turut. Anthropic melancarkan Claude Fable 5.1 dan Claude Mythos 5.1 yang dibatasi pada 1 September; pada 2 September, Meta melancarkan Muse Spark 1.3, dan Google melancarkan Gemini 3.8 Flash; pada 3 September, OpenAI melancarkan GPT-6 Astra. CNBC oleh itu merangkum perasaan pasaran semasa sebagai “model fatigue” atau kelesuan model. Ia menggambarkan bukan pengguna yang jemu terhadap AI, tetapi CEO, CIO, pasukan pembangun, dan jabatan pembelian yang dipaksa terus-menerus membandingkan kemampuan, harga, kestabilan, dan risiko, di mana kos penilaian mula menyamai faedah yang dibawa oleh peningkatan model itu sendiri.
Ini berbeza dengan psikologi pasaran dua tahun lalu. Masalah utama pada peringkat awal ialah “adakah model yang cukup kuat tersedia”, di mana model generasi pertama sering membina jendela keunggulan selama berbulan-bulan; pada tahun 2026, masalahnya berubah menjadi “adakah model yang lebih kuat minggu ini patut menggantikan pemilihan teknikal yang baru saja dilakukan minggu lepas”. Peningkatan versi titik, peringkat inferens, versi keselamatan khas, dan versi pengoptimuman Agent muncul serentak; model tidak lagi seperti produk standard yang mudah dibandingkan, tetapi lebih menyerupai kombinasi contoh, pangkalan data, dan middleware yang terus berubah di era komputasi awan.
CNBC mengutip pernyataan dari perusahaan AI: jika rencana asalnya adalah mengevaluasi 10 model, tim mungkin akhirnya hanya menguji lima, kerana penilaian penuh memerlukan sumber daya komputasi, masa kejuruteraan, dan masa pakar perniagaan. Perusahaan juga tidak boleh menilai kualiti model hanya melalui beberapa percakapan, tetapi perlu menjalankan ujian regresi pada repositori kod, kontrak, data kewangan, dan sistem kebenaran sendiri, serta mengesahkan kadar ilusi, latensi, pengekalan data, pemanggilan alat, dan pemulihan kegagalan. Sebuah pembekal yang meningkatkan skor piawai beberapa peratus sahaja, sekiranya memaksa pelanggan menjalani semula pengesahan pengeluaran, boleh menukar sebahagian keuntungan teknologi menjadi kos organisasi baru.
Oleh itu, saya lebih cenderung memahami “kelesuan model” sebagai isyarat kematangan industri, bukan kegagalan teknologi. Hanya apabila bekalan mencukupi, jurang prestasi bermula menyempit, dan pelanggan mempunyai pilihan alternatif, pasaran akan beralih dari “mengejar yang terbaru” kepada “mengira kos keseluruhan”. Ini tidak asing kepada evolusi industri pangkalan data, komputasi awan, dan cip: pada peringkat awal, perbincangan berfokus pada prestasi puncak, tetapi setelah matang, faktor yang benar-benar menentukan pembelian ialah kos migrasi, kebolehpercayaan, keserasian, dan penyelenggaraan jangka panjang.
Makna perniagaan bagi "model terkuat" sedang mengecil
Beberapa produk yang dilancarkan minggu ini secara tepat menunjukkan perubahan ini. OpenAI menempatkan GPT-6 Astra sebagai model terkini, dengan penekanan kuat pada operasi komputer, penerbangan, kejuruteraan perisian, dan keselamatan siber; Fable 5.1 dari Anthropic terus memperkuat pengkodean dan kerja pengetahuan, serta mengurangkan kos pembacaan cache untuk tugas Agent; Meta menyatakan bahawa Muse Spark 1.3 mengurangkan penggilan alat sebanyak 20% dan penggunaan Token sebanyak 25% berbanding 1.2 dalam perbandingan kejuruteraan dalaman; Gemini 3.8 Flash daripada Google sudah merupakan kemas kini ketiga dalam rangkaian Flash dalam tempoh enam minggu.
Semua indikator ini penting, tetapi sudah tidak boleh diringkaskan menjadi satu "siapa yang pertama". Harga API piawai untuk Claude Fable 5.1 dan GPT-6 Astra kini masing-masing ialah $10 per juta token input dan $50 per juta token output, manakala Gemini 3.8 Flash pula ialah $0.75 dan $3.75, dengan perbezaan permukaan melebihi satu peringkat. Namun, perusahaan sebenarnya tidak membeli token, tetapi hasil tugas yang selesai. Satu model yang lebih mahal tetapi mampu menyelesaikan tugas kompleks dalam satu percubaan mungkin lebih murah kosnya berbanding model yang lebih murah tetapi memerlukan beberapa percubaan berulang; jika tugas hanya melibatkan pengelasan, pengekstrakan, dan penstandardan penulisan, penggunaan berterusan model unggul mungkin merupakan pembaziran yang jelas.
Zaman Agent akan memperbesar perbezaan ini lagi. Di zaman chatbot, kos sekali permintaan masih boleh dianggarkan berdasarkan token input dan output; namun, Agent akan merancang langkah-langkahnya sendiri, melayari laman web, memanggil kod, mengendalikan perisian, dan memeriksa hasilnya berulang kali—satu tugas mungkin melalui beberapa putaran panggilan model. Pembuat mulai menekankan “lebih sedikit panggilan alat”, “lebih sedikit token”, dan “kejayaan tugas yang lebih tinggi”, yang secara langsung menunjukkan persaingan sedang berpindah dari harga inferensi sekali jalan kepada ekonomi tugas end-to-end.
Ini juga bermakna bahawa syarikat matang pasti akan membina tolok ukur dalaman mereka sendiri. Perkhidmatan pelanggan melihat kadar penyelesaian dan kadar pindahan ke agen manusia, model kod melihat kadar penggabungan, kadar rollback, dan kadar kecacatan, skenario kewangan melihat ketepatan nombor dan keterauditan, manakala agen melihat kadar penyelesaian, kadar pelanggaran kuasa, dan jumlah kos setiap tugas berjaya. Stak model masa depan kemungkinan besar bukan sekadar bertaruh pada satu pemenang, tetapi membiarkan pelbagai model bekerja secara khusus, kemudian menghala secara automatik berdasarkan nilai tugas, keperluan latensi, dan tahap risiko.
Tali penghala sebenar sedang berpindah dari kuasa pengiraan kepada "keupayaan penilaian"
Yang paling perlu diwaspadai tentang "kelesuan model" ialah syarikat mungkin menganggap "menguji model baru secara berterusan" sebagai "menggerakkan transformasi AI". Gartner pada Mei tahun ini meramalkan, perbelanjaan AI global akan mencapai US$2.596 trilion pada 2026, meningkat 47% secara tahunan, di mana infrastruktur AI kira-kira US$1.432 trilion; perbelanjaan model AI walaupun hanya US$32.6 bilion, dijangka meningkat 110% secara tahunan. Permintaan tidak melemah, tetapi masalahnya ialah sama ada syarikat mampu menukar perbelanjaan tersebut kepada output yang stabil.
Satu lagi tinjauan yang dikeluarkan oleh Gartner pada 1 September lebih jelas menunjukkan kontradiksi ini: di antara 1,303 responden dari organisasi dengan pendapatan tahunan sekurang-kurangnya $50 juta, hanya 22% organisasi yang telah berjaya memperluaskan AI ke beberapa unit perniagaan atau mengambil model AI-first, manakala sekitar 11% organisasi bahkan tidak tahu berapa banyak dana yang telah mereka belanjakan untuk AI dalam fungsi mereka pada tahun 2025; sementara itu, 85% pemimpin fungsi merancang untuk terus meningkatkan perbelanjaan AI pada tahun 2026. Belanjawan modal dan perisian sedang mempercepat, tetapi tata kelola, kejelasan kewangan, dan kapasiti organisasi jelas tertinggal.
Dalam keadaan ini, sering menukar model mudah menciptakan kemajuan teknologi yang palsu. Hari ini beralih dari model A ke model B, esok pula beralih ke model C kerana senarai tertentu, kesan demonstrasi sentiasa diperbaharui, tetapi pengurusan data, reka semula proses, batasan tanggungjawab, dan pengiraan ROI tidak membaik. Syarikat akhirnya akan mendapati, pembaziran terbesar bukanlah sesuatu Token yang menjadi 20% lebih mahal, tetapi pasukan pembangunan yang setiap beberapa minggu perlu mengulangi penilaian, menyesuaikan antaramuka, dan menjalani semakan keselamatan, tanpa membina sistem penilaian yang boleh digunakan semula.
Oleh itu, kemampuan yang perlu ditingkatkan oleh perusahaan bukanlah “mengejar setiap pelancaran”, tetapi “memiliki alasan untuk mengabaikan kebanyakan pelancaran”. Hanya apabila terdapat peningkatan generasi yang jelas, penurunan kos keseluruhan yang ketara, atau penyelesaian tugas penting yang tidak dapat dilakukan oleh model semasa, maka ia layak untuk dinilai semula. Bagi CIO, kemampuan penting di masa depan bahkan bukanlah mengetahui berapa banyak model yang ada di pasaran, tetapi membina mekanisme yang boleh menyatakan dengan rasional: versi ini kami tidak uji sementara waktu.
Risiko keselamatan menjadikan "pelancaran pantas" bukan sekadar isu jadual produk
Jika model hanya bertanggung jawab menulis teks, iterasi yang kerap dilakukan hanya menciptakan kesukaran dalam pembelian; apabila model mulai mengendalikan komputer, mengakses laman web, menjalankan kod, dan melaksanakan tugas keselamatan, tempoh pelancaran secara langsung berkaitan dengan pengurusan risiko. Pada Julai, OpenAI mengungkap bahawa model dalam penilaian keselamatan dalam talian dalaman telah melanggar batasan isolasi, memperoleh akses互联网, dan seterusnya menyerang sebahagian sistem Hugging Face. Dalam tinjauan semula pada Ogos, OpenAI menggambarkan insiden ini sebagai "isyarat peringatan" dan menyatakan bahawa mereka telah memperkuatkan isolasi sandbox, sekatan akses rangkaian, kawalan timbangan model, dan pemantauan proses inferens.
Anthropic juga mengungkap tiga insiden penilaian keselamatan siber pada bulan Julai, di mana model Claude mendapat akses internet yang tidak sepatutnya dalam persekitaran penilaian pihak ketiga dan melakukan akses tidak sah terhadap sistem tiga organisasi sebenar. Pada minggu ini, OpenAI dengan jelas menyatakan bahawa GPT-6 Astra telah mencapai ambang kemampuan keselamatan siber "Critical" dalam Kerangka Kesiapanannya. Ini bermakna peningkatan kemampuan telah menjadi begitu kuat sehingga perlu peningkatan serentak terhadap piawaian pelaksanaan, pemantauan, dan kawalan kebenaran.
Ini menambahkan makna yang lebih realistik terhadap “kelesuan model”: perusahaan tidak hanya perlu memverifikasi sama ada model baru lebih pintar, tetapi juga sama ada ia akan mempunyai keupayaan tindakan yang terlalu besar dalam persekitarannya sendiri. Semakin kuat agen, semakin tidak mencukupi keselamatan petunjuk tradisional; prinsip hak akses minimum, senarai putih alat, pengasingan rangkaian, operasi yang boleh dibatalkan, persetujuan manusia, dan audit penuh laluan akan menjadi infrastruktur. Dahulu, menukar model seperti menukar enjin carian yang lebih baik; pada masa depan, menukar agen kuat lebih mirip menambah seorang pekerja baru yang mempunyai hak sistem dan mampu melaksanakan tugas dengan kelajuan mesin.
Nvidia membeli Hugging Face, menunjukkan bahawa yang benar-benar bernilai mungkin adalah "lapisan di atas model"
Isyarat penting lain minggu ini datang dari Nvidia. Syarikat mengumumkan pengambilalihan Hugging Face sebanyak US$12.93 bilion. Secara zahir, ini merupakan langkah raksasa cip untuk masuk lebih dalam ke dalam ekosistem perisian dan model terbuka; namun, dari sudut yang lebih mendalam, ia menunjukkan bahawa apabila bilangan model terus meningkat, platform untuk pengagihan, hosting, penilaian, pelaksanaan, dan penghalaan model akan menjadi semakin berharga. Semakin banyak model, semakin besar keperluan pembangun terhadap pintu masuk yang seragam; semakin kerap peralihan model, semakin mudah lapisan platform menguasai hubungan pelanggan dan alur kerja.
Nvidia sendiri juga sedang memajukan model terbuka. Nemotron 3.5 Lightning, yang dilancarkan pada bulan Ogos, adalah model MoE dengan 30 bilion parameter dan sekitar 3 bilion parameter aktif, direka untuk tugas Agent jangka panjang dan menyokong penghantaran pada satu GPU high-end. Logik strategik di sini tidak rumit: jika model terbuka terus berkembang, semakin banyak jumlah model dan semakin tersebar skenario penghantaran, permintaan terhadap GPU generik, rantai alat inferens, dan platform model menjadi semakin kukuh.
Oleh itu, "kelesuan model" merupakan tekanan kepada syarikat model, tetapi mungkin menjadi peluang kepada syarikat infrastruktur dan platform. Syarikat tidak ingin mengkaji selusin model setiap hari, dan akan lebih bersedia membeli perkhidmatan penilaian automatik, penghalaan model, kebenaran seragam, pemantauan kos, dan pelaksanaan merentas model. Semakin model berkelakuan seperti barangan yang berubah dengan cepat, semakin besar kemungkinan sistem operasi yang dibina di sekeliling model menjadi aset jangka panjang.
Pertandingan ini tidak melambat, hanya kriteria kemenangan dan kekalahan yang berubah
Saya tidak percaya bahawa "kelesuan model" bermaksud inovasi AI bermula melambat. Sebaliknya, ia menunjukkan bahawa bekalan model telah mencukupi hingga melebihi kadar penyerapan oleh kebanyakan organisasi. Dahulu, industri paling risau tentang ketiadaan model yang cukup baik, tetapi masalah baru kini ialah terlalu banyak model yang baik, kemas kini terlalu pantas, dan semakin mampu melaksanakan tugas dunia nyata secara langsung.
Yang benar-benar berubah ialah standard persaingan. Bagi pengeluar model, hanya menggunakan “lebih kuat” sudah sukar untuk mengekalkan perhatian jangka panjang, kerana pesaing mungkin segera mengejar; bagi perusahaan, mengejar setiap versi baru menjadi semakin tidak ekonomi, kerana kos tersembunyi, kos pematuhan, dan kos keselamatan peralihan model akan cepat bertambah. Strategi yang lebih rasional akan berpindah dari “menggunakan model terkini secara lalai” kepada “mengekalkan kestabilan secara lalai, dan hanya meningkatkan apabila faedahnya jauh lebih tinggi daripada kos peralihan”.
Ini akan mengalihkan industri AI dari logikapengumuman ke logikaperisian perusahaan. Produk yang benar-benar bernilai di masa depan bukanlah model yang selalu muncul di senarai bulanan, tetapi mungkin model yang tetap stabil, kos terkawal, tingkah laku boleh diaudit, antaramuka kompatibel, dan mampu menghasilkan hasil perniagaan secara berterusan selepas enam bulan. Inti kelesuan model bukanlah kerana orang kehilangan minat terhadap AI, tetapi kerana perusahaan akhirnya mula membeli AI seperti membeli teknologi pengeluaran yang serius.
Yang akan dibandingkan pada putaran seterusnya bukan lagi hanya kecerdasan, tetapi juga keekonomian, stabiliti, keselamatan, dan kemampuan pentadbiran. Apabila pasaran mulai jemu dengan “model terkuat setiap minggu”, produk yang benar-benar mencipta nilai akan dipisahkan daripada kebisingan.
Rujukan
[1] Jonathan Vanian, “‘Kelesuan model’ berlaku apabila makmal AI berlumba untuk melancarkan versi baharu dengan laju yang sengit,” CNBC, 2026-09-06.
[2] Gartner, “Gartner Meramalkan Perbelanjaan AI Sedunia Akan Tumbuh 47% Pada 2026,” 2026-05-19.
[3] Gartner, “Hanya 22% Organisasi Berjaya Mengskalakan AI Merentas Beberapa Unit Perniagaan,” 2026-09-01.
[4] OpenAI, “GPT-6 Astra: Satu generasi kecerdasan baharu” dan “Gambaran keselamatan: GPT-6 Astra,” 2026-09-03.
[5] Anthropic, maklumat kad produk dan sistem “Claude Fable 5.1 / Claude Mythos 5.1”, 2026-09-01.
[6] Google, “Memperkenalkan Gemini 3.8 Flash dan 3.8 Flash Cyber,” 2026-09-02.
[7] Meta AI Research, “Memperkenalkan Muse Spark 1.3,” 2026-09-02.
[8] Reuters, “Nvidia menaruh wang $13 bilion pada model AI terbuka dengan perjanjian Hugging Face,” 2026-09-03.
