Qwen 3.8 Flash Memotong Biaya Menjadi Sepertiga dari DeepSeek-V4-Flash

iconMetaEra
Bagikan
AI summary iconRingkasan
Qwen 3.8 Flash dari Alibaba, kini tersedia di platform Qwen Office, menawarkan 125B MoE dengan 6B parameter aktif per token. Model ini mendukung 262.144 token secara native dan berjalan di GPU 4090. Dihargai 0,8 RMB per juta token masukan, harganya sepertiga dari DeepSeek-V4-Flash. Pedagang yang memantau altcoin untuk diwaspadai mungkin menemukan ini sebagai perkembangan penting. Model ini menangani tugas-tugas kompleks dalam waktu kurang dari empat menit dan siap melalui API. Pada hari yang sama, Zhipu melepaskan GLM-5.3-Flash secara open-source, dengan harga satu per empat puluh dari Claude Opus 4.8. Sentimen pasar, termasuk indeks fear and greed, bisa berubah seiring masuknya model-model hemat biaya semacam ini ke ruang ini.
Alibaba merilis dan mengopen-source model Qwen 3.8 Flash, yang menggunakan arsitektur MoE 125B, hanya mengaktifkan sekitar 6B parameter per token, mendukung konteks asli hingga 262.144 token, dan dapat diperluas hingga 1 juta token melalui YaRN. Inovasi model ini terletak pada kemampuannya berjalan di GPU konsumen 4090, mewujudkan migrasi model teks panjang tingkat pusat data ke perangkat konsumen. Lebih kompetitif lagi, harganya: input satu juta token seharga 0,8 yuan, output seharga 2,7 yuan, hanya sepertiga dari harga DeepSeek-V4-Flash. Uji coba menunjukkan bahwa model ini dapat menyelesaikan penulisan konten untuk empat platform dalam 2 menit, serta ekstraksi catatan rapat, penyusunan tabel, dan pembuatan email dalam 4 menit. Qwen 3.8 Flash telah tersedia di platform Qwen Office, dengan antarmuka API yang juga dibuka secara bersamaan. Pada hari yang sama, Zhipu juga mengopen-source GLM-5.3-Flash, yang performanya sebanding dengan Claude Opus 4.8 namun harganya hanya satu per empat puluh.

Penulis artikel, sumber: Quantum Bit

Model baru Alibaba Qwen, kembali menaikkan standar baru.

Mereka merilis dan mengopensource Qwen 3.8 Flash-Next, yang tidak hanya menghancurkan harga DeepSeek-V4-Flash, tetapi juga langsung menduduki peringkat pertama di Huggingface sejak peluncurannya!

Gambar

Netizen di Twitter juga bergemuruh, bahkan ada insinyur yang membagikan video uji coba langsung dan berseru:

Qwen 3.8 Flash menghilangkan hambatan VRAM,model bahasa panjang tingkat pusat data kini dapat dijalankan di kartu grafis konsumen 4090!

Gambar

Masih ada yang sudah antusias menggunakannya di pekerjaan mereka.

Dalam waktu kurang dari 8 menit, ia menyelesaikan seluruh alur kerja yang mencakup pemrograman Python, analisis multi-tabel, dan pembuatan laporan penelitian:

Gambar

Efek pagoda juga tidak menjadi masalah:

Gambar

Wah, benar-benar keren? Kita juga harus mencobanya.

Gambar

Hanya Rp0,8 per juta token input

Qwen3.8-Flash menggunakan arsitektur MoE 125B, hanya mengaktifkan sekitar 6B parameter per token, secara native mendukung konteks 262144 token, dan dapat diperluas hingga 1M token melalui YaRN.

Sementara itu, ini juga merupakan pra-penyajian arsitektur baru Qwen4.

Dibandingkan dengan Qwen 3.7 Plus, Qwen 3.8 Flash tidak hanya mengurangi parameter aktif menjadi sepertiganya, tetapi juga biaya pelatihannya hanya sepertujuhnya, sementara kemampuan umum, penalaran matematika, dan pemrograman semakin kuat.

Yang lebih mengejutkan lagi adalah harganya: input Qwen 3.8 Flash hanya 0,8 yuan per juta token, output 2,7 yuan, cache hit 0,1 yuan, harga terendah mencapai 1/3 dari DeepSeek-V4-Flash.

Ini jauh lebih besar daripada potongan harga di Pinduoduo (bushi)

Gambar

Baiklah, karena harganya sudah sampai pada tingkat ini, kita tidak akan segan-segan lagi, langsung tingkatkan intensitasnya, gunakan dua uji coba nyata untuk menguji kemampuan sebenarnya dari Qwen 3.8 Flash dalam skenario perkantoran.

Uji coba nyata 1: Merancang empat teks yang disesuaikan dengan platform berbeda untuk produk kamera

Kami mengadakan "Kompetisi Penulisan Konten Cyber", di mana Qwen 3.8 Flash harus menulis ulang dokumen produk kamera yang hampir sepuluh ribu kata menjadi teks untuk Xiaohongshu, Weibo, Douyin, dan Moments, dengan anggaran hanya satu yuan, untuk melihat berapa banyak tugas yang dapat diselesaikannya.

Prompt berikut ini:

Gambar

Setelah mengirimkan prompt, saya pergi ke dapur umum kantor untuk mengambil air, total kurang dari 2 menit.

Ketika kembali melihat, keempat teks dari platform yang berbeda sudah selesai ditulis, dan @brand, gaya, serta tagar topiknya tepat sekali (selain saya tidak akan memposting sepanjang itu di朋友圈 hhh):

Gambar

Gambar

Gambar

Gambar

Dalam waktu kurang dari dua menit, empat draft selesai dikerjakan — kecepatan tangan "pekerja cyber" sudah cukup memadai.

Tapi yang sering membuat pusing di tempat kerja bukanlah menulis konten, melainkan siapa yang akan membersihkan kekacauan setelah rapat selesai.

Karena itu, kami memberinya pekerjaan kedua untuk menguji kemampuan praktisnya di tempat kerja.

Uji coba nyata 2: Mengubah rapat produk mingguan menjadi rencana yang dapat dieksekusi

Kami merekam ulang secara akurat sebuah transkrip rapat asli sepanjang sepuluh ribu kata, dengan gaya yang sama persis seperti yang diterima peserta setelah rapat mingguan—penuh kesalahan ejaan homofon dan obrolan sepele—dengan tema “Rapat Tinjauan Kebutuhan dan Teknis Agent Layanan Pelanggan Cerdas V2.0”, dan Qwen3.8-Flash berhasil menyelesaikan tiga tugas sekaligus: mengekstrak ringkasan, menyusun tabel, dan membuat email pemberitahuan setelah rapat.

Gambar△ Gambar dihasilkan oleh AI, mendengar "token" sebagai "偷啃" benar-benar sangat hidup

Prompt berikut ini:

Gambar

Dalam mode default, Qwen3.8-Flash menyelesaikan semua tugas dalam waktu kurang dari 4 menit, dengan ringkasan lima kesimpulan inti dan pembagian tugas tabel yang akurat, format email sesuai standar, dan penerima email sesuai dengan isi rapat.

Gambar

Gambar

Gambar

Gambar△ Sebagian gambar hasil pengujian

Bahkan tanpa diminta, ia dengan ramah menyusun hal-hal yang belum dibahas dalam rapat, sehingga kami dapat melanjutkan diskusi di rapat berikutnya, be like:

Gambar

Dan sampai tahap ini, kuota saya belum habis!

Ahahaha, rasanya sangat menyenangkan bisa bebas seperti ini.

Sekarang, Qwen 3.8 Flash telah diluncurkan secara perdana di platform "Qianwen Office", dan antarmuka API juga telah dibuka secara bersamaan, silakan coba!

Gambar

Satu Hal Lagi

Perang harga untuk model besar buatan dalam negeri semakin sengit.

Pada waktu yang hampir bersamaan dengan peluncuran open-source Qwen 3.8 Flash, Zhipu juga membuka sumber GLM-5.3-Flash, model multimodal asli pertama dari seri GLM-5, yang sebelumnya menjadi viral online sebagai model besar Ox Alpha.

Dalam evaluasi, kinerja model ini sebanding dengan Claude Opus 4.8, tetapi harganya dipotong menjadi 1/10 dari GLM-5.3.

Gambar

Selain itu, GLM-5.3-Flash juga secara murah hati membuka promosi setengah harga selama dua minggu, yang berarti harga GLM-5.3-Flash selama periode promosi hanya 1/20 dari harga GLM-5.3 dan 1/40 dari harga Opus4.8.

Gambar

Selain itu, Qwen 3.8 Flash dan GLM-5.3-Flash juga memiliki kesamaan, yaitu keduanya kali ini mengejutkan DeepSeek-V4-Flash dengan harga yang sangat rendah (DeepSeek pergi sambil mengeluh):

Gambar△Grafik perbandingan harga DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash

Tak bisa dipungkiri, terlalu kompetitif.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.