Zhipu เปิดตัวรุ่น GLM-5.3-Flash บนชิปภายในประเทศ 100,000 ตัว แข่งขันกับ NVIDIA

iconMetaEra
แชร์
AI summary iconสรุป
Zhipu AI เปิดตัวรุ่น GLM-5.3-Flash ซึ่งตอนนี้ได้รับการติดตั้งบนคลัสเตอร์ชิปภายในประเทศมากกว่า 100,000 ตัว รุ่นนี้ซึ่งก่อนหน้านี้รู้จักในชื่อ Ox Alpha มีประสิทธิภาพและต้นทุนโทเค็นเทียบเท่ากับ GPU ของ NVIDIA โดยได้คะแนน 57 บนดัชนี AA Intelligence พร้อมราคาที่ต่ำกว่าคู่แข่งชั้นนำ และเป็นโมเดลแบบมัลติโมดัลแบบแท้จริงรุ่นแรกในซีรีส์ GLM-5 ข้อมูลบนโซ่แสดงให้เห็นถึงความสนใจที่เพิ่มขึ้นในโครงสร้างพื้นฐานด้าน AI โดยการวิเคราะห์บนโซ่เน้นการเปลี่ยนไปสู่โซลูชันภายในประเทศที่คุ้มค่า
Zhipu เปิดตัวรุ่นล่าสุด GLM-5.3-Flash ซึ่งก่อนหน้านี้เปิดให้ใช้งานฟรีบนแพลตฟอร์มทดสอบในรูปแบบแอบอ้างว่า Ox Alpha โดยมีปริมาณการใช้งานเกิน 50 ล้านล้านโทเค็นภายในห้าวัน รุ่นนี้ใช้คลัสเตอร์ชิปภายในประเทศมากกว่า 100,000 ตัวในการให้บริการการอนุมาน ประสิทธิภาพฮาร์ดแวร์และต้นทุนต่อโทเค็นได้รับระดับเทียบเท่ากับ GPU ของ NVIDIA ในด้านประสิทธิภาพ รุ่นนี้ได้คะแนน 57 ในดัชนีความฉลาด AA ซึ่งเทียบเท่ากับ Claude Opus 4.8 ในด้านราคา ค่าใช้จ่ายอยู่ที่ 0.8 หยวนต่อการป้อนข้อมูลหนึ่งล้านโทเค็น และ 2.8 หยวนต่อการส่งออกหนึ่งล้านโทเค็น ซึ่งต่ำกว่าคู่แข่งมาก โดยใช้สถาปัตยกรรมแบบผสมผสานระหว่างความสนใจแบบบางส่วนและเชิงเส้น และเป็นรุ่นหลายโมดัลแบบเนทีฟรุ่นแรกของซีรีส์ GLM-5 ในบริบทที่โมเดล AI ในประเทศกำลังปรับขึ้นราคาอย่างทั่วหน้า Zhipu ใช้กลยุทธ์ราคาต่ำเพื่อแย่งชิงส่วนแบ่งตลาด

ผู้เขียนบทความ แหล่งที่มา: วันดี LatePost

วันที่ 26 สิงหาคม ซีปูยืนยันอย่างเป็นทางการ: โมเดลแอบอ้างที่เคยก่อให้เกิดการอภิปรายอย่างกว้างขวางในชุมชนนักพัฒนา Ox Alpha (เรียกในชุมชนจีนว่า “นิวไล”) คือ GLM-5.3-Flash รุ่นล่าสุดของพวกเขา รหัสรุ่นได้รับแรงบันดาลใจจากภาพยนตร์ที่กำลังได้รับความนิยมในประเทศจีนเรื่อง “นิวไล”

ก่อนเปิดตัวอย่างเป็นทางการ โมเดลนี้ได้เปิดให้ทดสอบฟรีในรูปแบบแบบไม่เปิดเผยตัวตนบน OpenRouter และ OpenCode โดยมีปริมาณการใช้งานสะสมเกิน 50 ล้านล้านโทเค็นภายในห้าวัน ทำลายสถิติการเติบโตของการใช้งานบนแพลตฟอร์มทั้งสอง และปัจจุบันปริมาณการใช้งานได้เกินกว่าสองเท่าของ DeepSeek อย่างไรก็ตาม สิ่งที่ดึงดูดความสนใจของตลาดอย่างแท้จริงคือรายละเอียดที่ Zhipu เปิดเผยต่อมา: การใช้งานเหล่านี้ทั้งหมดถูกรองรับโดยชิปของประเทศจีน

Zhizhu ระบุในเอกสารเทคนิคอย่างเป็นทางการว่า ได้ใช้คลัสเตอร์ชิปภายในประเทศมากกว่า 100,000 ตัวสำหรับบริการการอนุมานของโมเดลนี้ “ประสิทธิภาพฮาร์ดแวร์และต้นทุนต่อ token ได้บรรลุระดับที่เทียบเท่ากับ GPU ของ NVIDIA ที่เป็นที่นิยม”

สถาบันวิจัยเซมิคอนดักเตอร์ SemiAnalysis ได้โพสต์ความเห็นบนแพลตฟอร์ม X ว่า: “การจราจรทั้งหมดถูกรองรับโดยชิปภายในประเทศ ประสิทธิภาพฮาร์ดแวร์และต้นทุนต่อโทเค็นสามารถเทียบเท่ากับ GPU ของ NVIDIA ได้แล้ว หลังจากที่ Jalapeño (ชิปการประมวลผลแบบพัฒนาเองของ OpenAI) ประกาศเมื่อวานนี้ กำแพงป้องกัน CUDA จึงถูกท้าทายอีกครั้ง”

100,000 หน่วยการ์ดภายในประเทศ: ซือปู้อธิบายรายละเอียดการติดตั้งชุดชิปภายในประเทศนี้ในเอกสารเทคนิค

ข้อจำกัดหลักของชิปเดี่ยวอยู่ที่ความจุและแบนด์วิดธ์ของหน่วยความจำ ซึ่งการทำให้รองรับความยาวบริบทถึง 1 ล้านโทเค็นนั้นยากมาก ดังนั้น Zhipu จึงได้สร้างเอ็นจิ้นการอนุมานเฉพาะทางบนพื้นฐานของ SGLang โดยใช้เทคโนโลยีต่างๆ เช่น การควอนไทซ์ W8A8, การควอนไทซ์แคชแบบผสม INT8/FP8/BF16 และการขนานแบบเทนเซอร์ภายในโนด พร้อมทั้งนำสถาปัตยกรรมแบบแยกส่วนผลิตจริง Encode–Prefill–Decode (EPD) มาใช้ เพื่อแยกการเข้ารหัสแบบมัลติมีเดีย, การเติมล่วงหน้าคำสั่ง และการถอดรหัสทีละโทเค็นออกเป็นสระงานที่สามารถจัดตารางได้อย่างอิสระ

ZhiPu ระบุว่า ประสิทธิภาพของบริการแบบ end-to-end เพิ่มขึ้นสามเท่าเมื่อเปรียบเทียบกับฐานเริ่มต้นบนฮาร์ดแวร์เดียวกัน

ตามข้อมูลจาก WanDian LatePost ผู้จัดหาชิปชุดนี้อาจมาจาก Huawei, Moore Threads และ Hygon ทาง ZhiPu ยังไม่ได้ให้ความเห็นเกี่ยวกับเรื่องนี้ และเอกสารทางเทคนิคก็ไม่ได้ระบุรุ่นชิปที่แน่นอน

SemiAnalysis ได้เน้นย้ำในความคิดเห็นว่า ก่อนหน้านี้มีมุมมองที่เชื่อว่าเฉพาะห้องปฏิบัติการชั้นนำขั้นสูงเท่านั้นที่มีความสามารถในการประมวลผลขนาด 100 ล้านล้านโทเค็นต่อวัน “แต่ที่นี่ ปริมาณการใช้งานฟรี 100 ล้านล้านโทเค็นต่อวัน ทั้งหมดทำงานบนชิปของประเทศเรา”

โมเดลเอง: เทียบเท่ากับ DeepSeek โดยมีราคาเพียง 1/40 ของ Claude Opus 4.8 GLM-5.3-Flash มีพารามิเตอร์รวม 320B และพารามิเตอร์ที่เปิดใช้งาน 18B ซึ่งมีขนาดพารามิเตอร์ประมาณ 40% ของรุ่นฟลากรุ่นก่อนหน้า GLM-5.3 และใกล้เคียงกับ DeepSeek V4 Flash

ในด้านประสิทธิภาพ การประเมินอย่างเป็นทางการจาก Zhipu แสดงว่า GLM-5.3-Flash ได้รับคะแนน 57 คะแนนใน Artificial Analysis Intelligence Index (AA ดัชนีปัญญาประดิษฐ์รวม) สูงกว่ารุ่นแฟลกชิพรุ่นก่อนหน้า GLM-5.2 เทียบเท่ากับ Claude Opus 4.8 ของ Anthropic และสูงกว่ารุ่นแฟลกชิพของ DeepSeek คือ V4 Pro เวอร์ชันอย่างเป็นทางการที่ได้รับคะแนน 53 คะแนน

ในด้านการกำหนดราคา GLM-5.3-Flash อยู่ที่ 0.8 หยวนต่อการป้อนข้อมูลหนึ่งล้านโทเค็น และ 2.8 หยวนต่อการส่งออกหนึ่งล้านโทเค็น ราคาสำหรับการเข้าถึงแคชคือ 0.23 หยวน ซึ่งเป็นหนึ่งในสิบของ GLM-5.3 และจะมีการลดราคาครึ่งหนึ่งในสองสัปดาห์แรกหลังเปิดตัว

ซีจีกล่าวว่า GLM-5.3-Flash มีราคาเท่ากับ 1/10 ของ GLM-5.3 และในช่วงส่วนลดพิเศษจะอยู่ที่ 1/20 ของ GLM-5.3 และเท่ากับ 1/40 ของ Claude Opus 4.8

เมื่อเทียบกับ DeepSeek V4 Flash หลังการปรับราคา (ค่าป้อนข้อมูลช่วงเย็น 1.5 หยวน ค่าเอาต์พุต 4.5 หยวน) GLM-5.3-Flash ถูกกว่าในสถานการณ์การเรียกใช้งานทั่วไปส่วนใหญ่

การปรับปรุงสถาปัตยกรรม: จำนวนพารามิเตอร์และเลเยอร์ลดลงเกือบครึ่งหนึ่ง GLM-5.3-Flash ใช้การออกแบบสถาปัตยกรรมที่ต่างจาก GLM-5.3 อย่างสิ้นเชิง ซึ่งเป็นเหตุผลหลักที่ทำให้สามารถบรรลุประสิทธิภาพที่สูงขึ้นด้วยต้นทุนที่ต่ำกว่า

เมื่อเปรียบเทียบกับ GLM-4.5 GLM-5.3-Flash มีพารามิเตอร์ทั้งหมดใกล้เคียงกัน (355B เทียบกับ 320B) แต่พารามิเตอร์ที่เปิดใช้งานลดลงจาก 32B เป็น 18B และจำนวนชั้นลดจาก 92 ชั้นเหลือ 45 ชั้น ลดลงเกือบครึ่งหนึ่ง

ZhiPu ระบุว่า GLM-5.3-Flash เป็นโมเดลเปิดแหล่งที่มาขั้นสูงตัวแรกที่ใช้สถาปัตยกรรมผสมระหว่างการให้ความสำคัญแบบบางส่วนและการให้ความสำคัญแบบเชิงเส้น โดยการคำนวณการให้ความสำคัญและขนาด KV cache ลดลง 3.01 เท่าและ 4.44 เท่า เมื่อเทียบกับ GLM-5.3

นอกจากนี้ โมเดลนี้เป็นโมเดลหลายโมดัลแบบเนทีฟตัวแรกของซีรีส์ GLM-5 ที่รองรับการป้อนข้อมูลรูปภาพและวิดีโอ และยังเป็นโมเดลใหม่ตัวแรกที่มีความสามารถหลายโมดัลนับตั้งแต่ Zhipu ให้ความสำคัญกับการเขียนโค้ด

การเปิดตัว GLM-5.3-Flash เกิดขึ้นหลังจากตลาดโมเดล AI ของจีนประสบกับคลื่นการขึ้นราคาอย่างทั่วถึง

ราคาการส่งออกของ Kimi K3 สูงถึง 100 หยวนต่อล้านโทเค็น มากกว่ารุ่นก่อนหน้า K2.6 มากกว่าสามเท่า; หลังจากปรับราคาในช่วงครึ่งปีแรกของ ZhiPu ราคาการส่งออกก็อยู่ที่ 28 หยวน; DeepSeek V4 Pro เพิ่มจากราคา 6 หยวนเป็น 13.5 หยวน และในช่วงเวลาเร่งด่วนอยู่ที่ 27 หยวน; ราคาการส่งออกของ DeepSeek V4 Flash เพิ่มจาก 2 หยวนเป็น 4.5 หยวน และในช่วงเวลาเร่งด่วนอยู่ที่ 9 หยวน

ผลโดยตรงของการขึ้นราคาคือความต้องการที่ล้นออกมา 《เวิ่นเตี้ยน LatePost》 ชี้ว่า หลังจากที่ DeepSeek V4 Flash ปรับราคาขึ้น ปริมาณการเรียกใช้งานบนแพลตฟอร์ม OpenCode ลดลงครึ่งหนึ่ง ความต้องการส่วนนี้กลายเป็นพื้นที่การเติบโตใหม่สำหรับผู้ผลิตโมเดลในประเทศ

กลยุทธ์การกำหนดราคาของ GLM-5.3-Flash ได้รับการออกแบบมาเพื่อตอบโจทย์ช่องว่างนี้

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา