DeepSeek Membuka Sumber Framework DeepSpec, Meningkatkan Kecepatan Model V4 hingga 85%

icon MarsBit
Bagikan
AI summary iconRingkasan
DeepSeek telah melepaskan kerangka kerja DeepSpec dan meluncurkan sistem akselerasi DSpark, meningkatkan kecepatan DeepSeek-V4 hingga 85%. Kerangka kerja ini meningkatkan versi Flash dan Pro sebesar 60%-78% tanpa kehilangan kualitas. DSpark menggunakan DFlash dan Markov head yang ringan untuk mengurangi tingkat penolakan dan meningkatkan throughput. DeepSpec mendukung Qwen3 dan Gemma, menawarkan rangkaian alat Python lengkap untuk penyebaran lokal. Pembaruan ini membawa daftar token baru dan menandai acara berita peluncuran token penting bagi pengembang dan pedagang.

Berdasarkan pemantauan Beating, DeepSeek bekerja sama dengan Universitas Peking merilis laporan teknis mengenai kerangka kerja percepatan sampling spekulatif DSpark dan membuka sumber kode penuh DeepSpec. Saat ini, DSpark telah diterapkan pada layanan produksi DeepSeek-V4. Dengan menjamin output tanpa kehilangan informasi, DSpark meningkatkan kecepatan generasi pengguna tunggal sebesar 60% hingga 85% untuk versi Flash, dan 57% hingga 78% untuk versi Pro. DSpark unggul dibandingkan baseline MTP-1 (Multi-Token Prediction-1), secara signifikan meningkatkan throughput sistem secara keseluruhan di bawah batas latensi yang ketat. Sebelumnya, sampling spekulatif multi-token sulit diterapkan di lingkungan produksi nyata. Model draft autoregresif terlalu lambat, sementara model draft paralel karena prediksi independen di setiap posisi, menghasilkan tingkat penerimaan sangat rendah pada bagian akhir urutan panjang. Jika secara sembarangan memverifikasi draft multi-token di bawah beban tinggi, model besar akan membuang banyak daya komputasi untuk memverifikasi kesalahan yang pasti ditolak, menyebabkan penurunan throughput sistem yang parah; oleh karena itu, industri secara umum hanya membatasi diri pada prediksi satu token (MTP-1) di lingkungan produksi. DSpark mengatasi hambatan penurunan throughput di bawah beban tinggi. DSpark pertama-tama menggunakan jaringan utama paralel DFlash untuk menghasilkan state tersembunyi, lalu menambahkan kepala Markov yang sangat ringan. Kepala Markov menyuntikkan korelasi kata berturut-turut secara serial dengan biaya sangat rendah melalui pencarian tabel dan satu operasi perkalian matriks. Sistem ini juga mengintegrasikan kepala prediksi kepercayaan dan algoritma koreksi posterior. Untuk kompatibilitas sempurna dengan penjadwalan nol-overhead di lingkungan produksi dan mencegah kebocoran informasi masa depan, penjadwal menggunakan mekanisme asinkron, memanfaatkan prediksi historis dua langkah sebelumnya untuk secara dinamis menentukan panjang pemotongan kandidat kata, sehingga sepenuhnya mencegah model besar memverifikasi kesalahan ekstrem berisiko tinggi di bawah beban berat. Selain DSpark, perpustakaan kode DeepSpec yang dibuka oleh DeepSeek mendukung secara bawaan model besar open-source seperti Qwen3 dan Gemma. DeepSpec menyediakan rangkaian alat Python lengkap mulai dari unduhan prompt, rekonstruksi cache model besar, pelatihan model draft, hingga evaluasi benchmark. Pengembang dapat langsung menggunakan skrip open-source untuk menyesuaikan dan menerapkan modul percepatan khusus untuk berbagai model besar open-source secara lokal.

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.