DeepSeek เปิดตัวรุ่น V4.1-Flash พร้อมพารามิเตอร์ 552 พันล้านและหน้าต่างบริบท 1 ล้านโทเค็น

iconCryptoBriefing
แชร์
AI summary iconสรุป
DeepSeek เปิดตัวโทเค็นใหม่เมื่อวันที่ 10 กันยายน พร้อมโมเดล V4.1-Flash ที่มีพารามิเตอร์ 552B และหน้าต่างบริบท 1 ล้านโทเค็น โมเดลนี้ใช้สถาปัตยกรรม MoE โดยเปิดใช้งาน 8B สำหรับอินพุตและ 16B สำหรับเอาต์พุต เพิ่มการออกแบบแบบไม่สมมาตร Causal Encoder-Decoder และลดการใช้งาน KV cache ลง 75% โมเดลนี้มีประสิทธิภาพดีกว่า DeepSeek V4-Pro และตอนนี้เข้าถึงได้ผ่าน API พร้อมราคาใหม่ตั้งแต่วันที่ 14 กันยายน น้ำหนักของโมเดลได้รับการเปิดแหล่งที่มาบน Hugging Face ภายใต้ใบอนุญาต MIT มอบข่าวการเปิดตัวโทเค็นใหม่ให้กับนักพัฒนาและนักเทรด

DeepSeek เพิ่งเปิดตัวโมเดลที่สามารถประมวลผลบริบทถึงหนึ่งล้านโทเค็น โดยเปิดใช้งานพารามิเตอร์น้อยกว่าบางโมเดลโอเพนซอร์สที่เปิดตัวเมื่อสองปีก่อน V4.1-Flash ที่เปิดตัวเมื่อวันที่ 10 กันยายน แสดงถึงความพยายามล่าสุดของสตาร์ทอัพปัญญาประดิษฐ์จีนในการเขียนใหม่เศรษฐศาสตร์ของโมเดลภาษาขนาดใหญ่

โมเดลนี้บรรจุพารามิเตอร์ 552 พันล้านตัวในสถาปัตยกรรม Mixture-of-Experts (MoE) แต่ใช้งานเพียงประมาณ 8 พันล้านตัวสำหรับงานอินพุต และ 16 พันล้านตัวสำหรับเอาต์พุต ผลลัพธ์คือโมเดลที่มีประสิทธิภาพสูงกว่าที่ขนาดการคำนวณที่ใช้งานจริงจะบ่งชี้

สถาปัตยกรรมที่ทำให้มันทำงาน

V4.1-Flash นำเสนอสถาปัตยกรรม Asymmetric Causal Encoder-Decoder ที่ DeepSeek เรียกใช้ โดยประมวลผลอินพุตและสร้างเอาต์พุตผ่านเส้นทางที่แตกต่างกันซึ่งได้รับการปรับแต่งให้เหมาะสมกับแต่ละงาน แทนที่จะดำเนินการทั้งหมดผ่านเส้นทางเดียว

โฆษณา

หน้าต่างบริบทยืดออกถึง 1 ล้านโทเค็น การรองรับบริบทขนาดใหญ่นี้ใช้ KV cache ที่ใช้พื้นที่ประมาณ 890 ไบต์ต่อโทเค็น หรือประมาณหนึ่งในสี่ของสิ่งที่รุ่น V4-Flash ก่อนหน้าต้องการ

การลดแคชครั้งนี้มีความสำคัญมากกว่าที่ฟังดู เพราะ KV cache เป็นข้อจำกัดด้านหน่วยความจำที่กำหนดจำนวนผู้ใช้พร้อมกันที่โมเดลสามารถให้บริการได้ และความยาวของบทสนทนาของพวกเขา การลดลง 75% หมายความว่าผู้ดำเนินการสามารถให้บริการผู้ใช้ได้ประมาณสี่เท่าบนฮาร์ดแวร์เดียวกัน หรือจัดการกับบริบทที่ยาวนานเป็นสี่เท่าโดยไม่ต้องอัปเกรดคลัสเตอร์ GPU

ในด้านการทดสอบประสิทธิภาพ DeepSeek อ้างว่า V4.1-Flash ทำงานได้ดีกว่ารุ่น V4-Pro ของบริษัทเอง และแข่งขันโดยตรงกับ GPT-5.6 และ Kimi K3 บริษัทได้เริ่มส่งคำขอจาก V4-Pro ไปยังรุ่นใหม่นี้แล้ว โดยราคาที่ปรับใหม่จะมีผลตั้งแต่วันที่ 14 กันยายน

เปิดน้ำหนัก เปิดกลยุทธ์

DeepSeek ได้เปิดเผยน้ำหนักของโมเดลภายใต้ใบอนุญาต MIT บน Hugging Face โมเดลใหม่นี้สามารถเข้าถึงผ่าน API ของ DeepSeek ผ่านจุดสิ้นสุด “deepseek-flash” การรวมกันของน้ำหนักที่เปิดเผยและการเข้าถึงผ่าน API สร้างเส้นทางการรับรองสองทาง: นักพัฒนาที่ต้องการรันการอนุมานบนโครงสร้างพื้นฐานของตนเองสามารถดาวน์โหลดและปรับใช้แบบท้องถิ่น ขณะที่ผู้ที่ต้องการบริการที่จัดการสามารถเรียกใช้ API ตามระดับราคาใหม่ของ DeepSeek

ผลกระทบจากการเสนอขายหุ้นครั้งแรกและการจัดตำแหน่งการแข่งขัน

เวลาเปิดตัว V4.1-Flash ไม่ใช่เรื่องบังเอิญ คาดว่า DeepSeek จะเข้าตลาด STAR ของเซี่ยงไฮ้ และการแสดงให้เห็นถึงแรงผลักดันทางเทคนิคอย่างต่อเนื่องเป็นสิ่งที่ช่วยให้การนำเสนอในระหว่างการเดินทางเพื่อระดมทุนมีน้ำหนักมากขึ้น

ความเข้าใจแบบมัลติโมดัลที่ฝังอยู่ใน V4.1-Flash ซึ่งครอบคลุมทั้งข้อมูลภาพและข้อความ ลดช่องว่างโอกาสในการแข่งขันของคู่แข่งรวมถึง OpenAI และ Moonshot AI ที่พัฒนา Kimi K3

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา