Ipinakita ang Teknikal na Mga Spesipikasyon ng DeepSeek V4: 1.6T na Mga Parametro, 384 na Eksperto na Aktibong 6

iconKuCoinFlash
I-share
AI summary iconSummary
Noong Abril 22 (UTC+8), ang PhD student mula sa Princeton na si Yifan Zhang ay nagbahagi ng mga teknikal na indikador para sa DeepSeek V4 sa X. Ang modelo ay may 1.6 trilyong parameter, 384 MoE experts na may 6 na aktibong bawat hakbang, at isang 285B parameter na bersyon na V4-Lite. Ang pagtatrain ay gumamit ng Muon optimizer, 32K pre-training context length, at 1M final context length. Hindi pa nagkomento ang DeepSeek. Ang market sentiment ay patuloy na magkakaiba-iba, na may fear and greed index na nagpapakita ng katamtamang kawalan ng sigurado.

Balita ni ME, noong Abril 22 (UTC+8), ayon sa pagmamasid ng Beating, ang PhD student sa Princeton na si Yifan Zhang ay nag-update ng teknikal na detalye ng DeepSeek V4 sa X. Noong Abril 19, nagpaabot siya ng “V4 next week” at isinampa ang mga pangalan ng tatlong komponente ng arkitektura, at ngayong gabi ay inilabas niya ang buong tabla ng mga parameter, kasama na ang unang pagpapakita ng isang lightweight na bersyon na V4-Lite na may 285B na parameter. Ang kabuuang parameter ng V4 ay 1.6T. Ang mekanismo ng pagpapansin ay DSA2, na nagtatampok ng kombinasyon ng DSA (DeepSeek Sparse Attention) na ginamit ni DeepSeek sa V3.2 at ang NSA (Native Sparse Attention) na ipinakilala sa papel noong simula ng taon, may head-dim na 512, kasama ang Sparse MQA at SWA (sliding window attention). Ang MoE layer ay may 384 na eksperto, na aktibado ang 6 sa bawat pagkakataon, gamit ang Fused MoE Mega-Kernel. Ang residual connection ay patuloy na gumagamit ng Hyper-Connections. Ang mga bagong inilabas na detalye sa training ay kasama ang paggamit ng optimizer na Muon (isang matrix-level optimizer na naglalapat ng Newton-Schulz orthogonalization sa momentum update), pre-training context length na 32K, at paggamit ng GRPO sa reinforcement learning phase kasama ang KL divergence correction. Ang huling context length ay napalawig hanggang 1M. Ang modalidad ay pure text. Hindi si Zhang isang miyembro ng DeepSeek, at wala pang pormal na tugon mula sa opisyal na DeepSeek tungkol sa mga impormasyong ito. (Pinagmulan: BlockBeats)

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.