Seminggu lalu, Qwen3.8-Max-Preview dan Kimi K3 muncul berturut-turut, mendorong skala parameter model besar buatan dalam negeri ke atas 2 triliun.
Namun, persaingan model besar sudah melampaui versi yang hanya melihat Benchmarks dan parameter semata. Kemampuan untuk benar-benar terlibat dalam alur kerja harian adalah ukuran terbaik untuk menilai kapasitas model dasar.
Untuk ini, Biteye hari ini memutuskan untuk menguji apakah ia seekor keledai atau kuda, keluarkan dan lihatlah.
Dengan petua yang sama, “buat permainan web mini pesawat tempur Thunder dengan gaya Biteye dalam satu ayat”, tiga model Qwen3.8, Kimi K3, dan gpt5.6 sol menghasilkan jawapan yang sama sekali berbeza:
- Qwen3.8: Boleh bergerak, dan hanya boleh bergerak
- GPT-5.6 Sol: Efek visual menarik, seperti laman web rasmi jenama
- Kimi K3: Paling banyak trik, paling seru seperti permainan
⚠️ Nota Peringatan: Kerana had kapasiti pengiraan, pendaftaran Kimi K3 tidak lagi dibuka, ujian kali ini akan dipanggil oleh WorkBuddy.
Qwen3.8: Pesawat tempur telah lepas landas, tetapi tidak ada yang berikutnya | Penilaian: 1 bintang⭐
https://x.com/i/status/2079865420576927996
Buka versi Qwen3.8, kesan pertama saya: Anda main-main ke?
Latar belakang biru gelap, di tengah terdapat logo yang bukan asli Biteye, serta butang "Mulai Permainan". Teks hitam dalam tajuk menyatu dengan latar belakang gelap, seolah-olah telah mengaktifkan mod siluman terlebih dahulu.
Setelah memasuki permainan, fungsi asasnya agak terima jadi:
- Seret pesawat tempur dengan tetikus
- Peluru ditembakkan secara automatik
- Pesawat musuh segitiga merah
- Pengiraan mata
- Collision and Termination Mechanism
Dalam ujian sebenar, pesawat tempur boleh menembak berterusan, dan skor meningkat hingga 858; Qwen3.8 sekurang-kurangnya berjalan.
Masalahnya, keseluruhan permainan seperti Demo Canvas baru sahaja dibina: pesawat musuh adalah segitiga, peluru adalah titik cahaya, dan gameplay hampir tidak berubah. Tiada sistem pertumbuhan senjata, tiada sistem item, dan tiada ritme tahap yang jelas.
Seperti yang dinyatakan oleh pasukan Qwen sendiri, latihan lanjutan Qwen3.8 belum selesai dan sedang “diiterasi setiap hari”.
Jelas bahawa seni dan perancang belum masuk ke dalam kumpulan.
GPT-5.6 Sol: Reka bentuk baik, permainan perlu diperkukuh | Penilaian: 3.5 ⭐
https://x.com/i/status/2079865420576927996
Buka versi GPT-5.6 Sol, semangat langsung meningkat.
Kiri adalah tugas yang jelas, tengah adalah kawasan pertempuran, kanan adalah radar visual dan modul telemetri. Latar belakang gelap dengan warna sian fluo, ditambah dengan campuran bahasa Cina dan Inggeris serta elemen jenama Biteye, memberikan kesan visual seperti panel agen 007.
Sistemnya juga jauh lebih kaya berbanding Qwen, contohnya:
- Gelombang
- Armor装甲
- Status Overdrive
- Combo连击
- Rekod tertinggi
- Fungsi ditangguhkan
- Pengendalian ganda tetikus dan papan kekunci
Dalam ujian sebenar, permainan berjalan dengan berjaya dan mendapat 922 mata. Selepas kegagalan, ia tidak hanya menunjukkan "Game Over", tetapi sebaliknya memaparkan "Pesawat Tidak Dalam Talian", dan untuk memulakan semula, ia dipanggil "Sambung Semula". Dari permulaan hingga pengiraan akhir, teks dan visual mengekalkan dunia yang seragam, yang agak canggih.
Namun, masalah GPT-5.6 Sol ialah terlalu berfokus pada pembungkusan. Panel maklumat di kedua-dua sisi mengambil ruang yang besar, manakala kawasan permainan sebenar pula ditekan ke tengah. Ia lebih menyerupai halaman aktiviti jenama yang telah selesai tinggi, dengan sebuah permainan kecil yang disisipkan secara sambil lalu.
Berbanding dengan Qwen3.8, seni, jenama, dan operasi gpt-5.6 semuanya telah tiba, tetapi perancang permainan jelas-jelas tidak bekerja sepenuhnya.
Kimi K3: Orang lain sedang buat demo, ia sudah mula tambah titik pembelian dalam permainan | Penilaian: 4 bintang ⭐
https://x.com/i/status/2079865420576927996
Walaupun skrin pertama Kimi K3 tidak sehebat GPT-5.6 Sol, tetapi apabila penerangan permainan muncul, rasanya berbeza:
- W: Peningkatan kekuatan
- S: StarShield
- B: Bom
- H: Membaiki
- Space: Release Bomb
- P: Dihentikan
- M: Senyap
Selepas memasuki permainan, terdapat tiga nyawa, tahap senjata, bilangan bom, butang jeda, dan suis suara.
Dua versi lain masih perlahan menyelesaikan “bagaimana pesawat bergerak”, sementara Kimi K3 sudah mulai mempertimbangkan bagaimana pemain akan bermain setelah mengumpulkan item.
Ini juga merupakan perbezaan paling ketara antara tiga versi: Qwen menghasilkan fungsi tembakan, Sol menghasilkan pembungkusan visual, manakala Kimi secara aktif menambahkan peralatan, sumber, pertumbuhan, dan kemahiran aktif.
Of course, its visuals are still not detailed. Enemy aircraft and effects are mostly simple geometric shapes, and some logo assets are applied quite directly. But as a small game, it knows best how to constantly give players something new.
Tiga model, masing-masing perlu dimasukkan ke bahagian mana?
Jika ketiga-tiga model dianggap sebagai pekerja baru, ujian ini kira-kira seperti ini:
Permainan yang dihasilkan dalam satu ayat, bukan lagi hanya tentang kod yang dipertaruhkan.
Dengan contoh ujian pesawat tempur Biteye, kini tidak sukar untuk meminta model besar menulis kod, mencipta laman web yang “pesawat bergerak dan peluru ditembakkan”.
Namun, yang benar-benar membedakan adalah, apakah model akan secara aktif merancang umpan balik, tahap, item, pertumbuhan, dan tema visual setelah dilatih dalam logika pendahuluan. Model besar tidak hanya harus memahami kod, tetapi juga benar-benar memahami mengapa pemain bersedia bermain satu ronde lagi.
