NVIDIA เปิดตัว Vera Rubin NVL72 เพิ่มประสิทธิภาพการประมวลผลของ DeepSeek ขึ้น 30 เท่า

icon MarsBit
แชร์
AI summary iconสรุป
NVIDIA เปิดเผยข่าวบนโซ่แสดงผลการทดสอบ Vera Rubin NVL72 โดยผ่านการประมวลผลของ DeepSeek-V4-Pro เพิ่มขึ้น 30 เท่า ต้นทุนโทเค็นลดลง 35 เท่าเมื่อเทียบกับ GB300 NVL72 แพลตฟอร์มนี้รวมถึง Vera CPU และ Groq 3 LPX ซึ่งขณะนี้ถูกใช้งานโดย SpaceXAI อาจมีการเพิ่มโทเค็นใหม่ตามมาเนื่องจากผลลัพธ์ด้านประสิทธิภาพบ่งชี้ถึงการใช้งาน AI อย่างกว้างขวาง

สุดยอดมาก

เมื่อไม่นานมานี้ นิวเดียได้เปิดเผยข้อมูลการทดสอบบนชิปครั้งแรกของตู้รุ่นแฟลกชิพรุ่นถัดไป Vera Rubin NVL72 ซึ่งเป็นครั้งแรกในประวัติศาสตร์ของบริษัท

และในครั้งนี้ การทดสอบจริงได้ดึงมาโดยตรง DeepSeek -V4-Pro รันงาน "การเข้ารหัสเอเจนต์อัจฉริยะ" ที่แท้จริงที่สุด!

ผลลัพธ์น่าประหลาดใจ: เมื่อเปรียบเทียบกับเครื่องหลักที่ทรงพลังที่สุดในปัจจุบัน GB300 NVL72 ปริมาณการรับส่งข้อมูลต่อเมกะวัตต์ของ Vera Rubin สูงสุดเพิ่มขึ้น 30 เท่า และต้นทุนต่อโทเค็นลดลงสูงสุด 35 เท่า!

เอเจนต์

มีคนตะโกนว่า: “ฉันยังกล้าเขียน PPT หลอกนักลงทุนแบบนี้ไม่ได้!”

ผู้ใช้งานรายอื่นยังแสดงความคิดเห็นอย่างขำขัน: “ก่อนหน้านี้รู้สึกว่า H200 ราคาสามหมื่นดอลลาร์สหรัฐแพงเกินไป แต่ตอนนี้หันกลับมามอง กลับพบว่า H200 ยังไม่ถึงขั้นเป็นรุ่นพื้นฐานเลย”

เอเจนต์

มาพิจารณาอย่างละเอียดกันเถอะ

จาก H200 ถึง GB300 ปริมาณการประมวลผลของงาน Agent จริงเพิ่มขึ้นสูงสุด 30 เท่า ต้นทุนเพิ่มขึ้นประมาณสองเท่า

จาก GB300 ถึง Vera Rubin ปริมาณการประมวลผลพุ่งสูงสุดถึง 30 เท่า ราคาต่อชั้นเครื่องเพิ่มขึ้นประมาณสองเท่า

ตามกฎของมัวร์ของฮวงเหลียง การพัฒนาเทคโนโลยีที่ยิ่งใหญ่ที่สุดของ NVIDIA ในสองปีที่ผ่านมาไม่ใช่ GPU เอง แต่คือการเพิ่มราคาขึ้นสี่เท่า แต่ได้รับความเร็วเพิ่มขึ้นถึง 900 เท่า!

เอเจนต์

ครั้งนี้ NVIDIA ประกาศความจริงที่ขัดกับความเข้าใจทั่วไปแก่ทุกคน: ยุคของ LLM สิ้นสุดลง ยุคของ Agent เริ่มต้นขึ้น เกณฑ์การวัดประสิทธิภาพ AI แบบเดิมทั้งหมดล้าสมัยแล้ว!

เอเจนต์

ในขณะเดียวกัน เวราซีพียูที่ออกแบบมาโดยเฉพาะสำหรับเอเจนต์ ถูกสเปซเอ็กซ์ของมัสก์ติดตั้งอย่างเร่งด่วน และเตรียมส่งขึ้นสู่อวกาศโดยตรง

ในวันเดียวกันนี้ Groq 3 LPX ของ NVIDIA ก็เริ่มผลิตในปริมาณมากอย่างเต็มรูปแบบ

Gemma 4 31B รันอยู่ด้านบน ความเร็วสุดยอด ไปถึง 3,400 โทเค็นต่อวินาทีโดยตรง ความจุของโมเดลพารามิเตอร์ล้านล้าน พุ่งขึ้น 35 เท่า

เอเจนต์

เอเจนต์

บันทึกใหม่เหล่านี้จะเขียนบทใหม่ให้กับโครงสร้างทางธุรกิจของเอเจนต์ตั้งแต่คืนนี้!

ทำไม NVIDIA จึงต้องเปิดตัว Vera Rubin?

ข้อมูลล่าสุดจาก OpenRouter ให้คำตอบว่า: ในโลกแห่งความเป็นจริง จำนวนโทเค็นที่ใช้สำหรับงาน Agent AI นั้นมากกว่าการสนทนาแบบธรรมดาถึง 15 เท่า!

ตัวอย่างเช่น หากให้เอเจนต์ศึกษาบริษัทหนึ่งเพื่อการตัดสินใจลงทุน กระบวนการนี้จะทำให้เอเจนต์และเอเจนต์ย่อยทำการวิเคราะห์อย่างต่อเนื่อง โดยโทเค็นที่สะสมจะกลายเป็นข้อมูลนำเข้าสำหรับขั้นตอนถัดไป การจัดการบริบทยาวจึงเป็นปัจจัยสำคัญที่สุดที่จำกัดประสิทธิภาพของเอเจนต์ AI

เอเจนต์

ยิ่งมีการโต้ตอบของตัวแทนมากเท่าใด ปริมาณการผ่านก็ยิ่งสูงขึ้น—จำนวนตัวแทนเพิ่มขึ้น 10 เท่า การเรียกใช้เครื่องมือเพิ่มขึ้น 2 เท่า ความขัดแย้งระหว่างพลังการประมวลผลและอัลกอริทึมได้สร้างความต้องการใหม่

เอเจนต์

อย่าใช้การพูดคุยเป็นตัวแทนปัญญาประดิษฐ์ ค่าอ้างอิงเก่าถูกยกเลิกทั้งหมด!

ในเวลานี้ การทดสอบมาตรฐาน AI แบบดั้งเดิม (เช่น การทดสอบลำดับความยาวคงที่ 8K/1K) จึงไม่มีประสิทธิภาพอีกต่อไป

NVIDIA อย่างเป็นทางการชี้ชัด: การวัดประสิทธิภาพต้องก้าวหน้า! ไม่สามารถวัดเพียงคำขอการให้เหตุผลเดียวได้อีกต่อไป ต้องจับภาพกระบวนการทำงานของ Agent อย่างสมบูรณ์

สำหรับสิ่งนี้ พวกเขาใช้การทดสอบมาตรฐาน AgentX ของ SemiAnalysis

การทดสอบนี้ไม่ใช่คำถามและคำตอบแบบเดิมๆ อีกต่อไป แต่เป็นการเล่นซ้ำการสนทนาการเขียนโค้ดที่แท้จริง พร้อมการเติบโตของบริบท การเรียกใช้เครื่องมือ และการสร้างซับอินเทลลิเจนซ์

เอเจนต์

นี่คือเหตุผลที่ H200 ดูเหมือนไม่สามารถแข่งขันได้ในสนามใหม่ของ Agent และ Vera Rubin ถูกกำหนดให้ครองราชย์

เวรา รูบิน NVL72 × DeepSeek-V4-Pro:

พลังการขุดมาถึงแล้ว

เพื่อพิสูจน์ความแข็งแกร่งของ Vera Rubin NVL72 นิวเดียได้ใช้ผู้นำด้านโอเพนซอร์ส— DeepSeek ทำการทดสอบบนชิปสำหรับ V4-Pro (1.6T)

เมื่อข้อมูลถูกเปิดเผย ผลลัพธ์น่าตกใจ—

ภายใต้ภาระงาน AgentX ความเร็วในการรับส่งข้อมูลต่อเมกะวัตต์ของ Vera Rubin NVL72 สูงกว่า GB300 NVL72 สูงสุดถึง 30 เท่า!

เอเจนต์

โปรดทราบว่าการเปรียบเทียบนี้ไม่ได้เป็น H200 รุ่นเก่า แต่เป็น GB300 รุ่นหลักที่กำลังได้รับความนิยม

GB300 ในเดียวกัน DeepSeek ในการทดสอบ V4-Pro ปริมาณการรับส่งข้อมูลต่อเมกะวัตต์เพิ่มขึ้น 15 เท่าเมื่อเทียบกับ H200

อย่างไรก็ตาม เวรา รูบิน ได้สูงขึ้นอีก 30 เท่าจากไหล่ของ GB300 และยังเพิ่มขึ้นอีกบนเส้นโค้งพารีโตทั้งหมด!

หมายความว่าอย่างไร

สำหรับโรงงาน AI ที่ถูกจำกัดโดยการจ่ายไฟฟ้า สิ่งนี้ขยายขอบเขตของกฎทางฟิสิกส์โดยตรง

ภายใต้งบประมาณพลังงานเดียวกัน Vera Rubin สามารถทำงานได้มากกว่า 30 เท่าของตัวแทน

สำหรับศูนย์ข้อมูลขนาดเมกะวัตต์หรือกิกะวัตต์ นี่เทียบเท่ากับการสร้างทรัพย์สินการประมวลผลเพิ่มขึ้น 30 เท่าจากอากาศ

นอกจากนี้ เทคโนโลยี NVIDIA DSX MaxLPS สามารถจัดการพลังงานได้ในระดับ GPU, ชั้นวาง และงานโหลด ทำให้สามารถติดตั้ง GPU ได้มากขึ้นสูงสุด 40% ภายในงบประมาณพลังงานเดียวกัน ช่วยเพิ่มประสิทธิภาพการผ่านข้อมูลต่อเมกะวัตต์ให้กับโรงงาน AI อย่างมาก!

เอเจนต์

ต้นทุนโทเค็นลดลง 35 เท่า! สมุดบัญชีของอุตสาหกรรม Agent ถูกเขียนใหม่ทั้งหมด

ต่อการรับส่งข้อมูลหนึ่งเมกะวัตต์ ซึ่งส่งผลโดยตรงต่อต้นทุนในการสร้างโทเค็นแต่ละตัว การเพิ่มขึ้นอย่างรวดเร็วของประสิทธิภาพนำมาซึ่งผลลัพธ์ที่ตรงที่สุดคือการระเบิดทางธุรกิจ

NVIDIA ประกาศว่า Vera Rubin NVL72 ลดต้นทุนการผลิตต่อหนึ่งล้านโทเค็นได้สูงสุดถึง 35 เท่าเมื่อเทียบกับ GB300 NVL72!

เอเจนต์

เมื่อต้นทุนการประมวลผลลดลงแบบเฉียบพลันถึง 35 เท่า บุคลากรดิจิทัลที่ทำงานตลอด 24 ชั่วโมงจะกลายเป็นเรื่องจริง และแอปพลิเคชันระดับซูเปอร์สำหรับผู้ใช้ปลายทางจะเกิดการระเบิดอย่างใหญ่หลวง

การกระทำของลาหวงครั้งนี้ได้เปิดประตูสู่ยุคของแอปพลิเคชันเอเจนต์ทันที

เอเจนต์

การออกแบบร่วมกันอย่างสมบูรณ์แบบ: ฮวงเก่าทำได้อย่างไร?

คุณอาจสงสัย: ทำไมถึงเร็วขึ้น 30 เท่า? ขึ้นอยู่กับกระบวนการชิปเดียวหรือ?

ไม่ใช่แน่นอน

Vera Rubin NVL72 ได้รับการปรับปรุงประสิทธิภาพอย่างน่าทึ่ง nhờ การออกแบบแบบร่วมมืออย่างสุดยอด

เอเจนต์

เช่น บริการแบบแยกส่วน, แคช KV แบบกระจาย, การจัดเส้นทางที่รับรู้ KV, MegaMoE เป็นต้น

เอเจนต์

นอกจากนี้ NVFP4 การลดขนาดแบบควอนไทซ์จะบีบอัดน้ำหนักโมเดลลงเหลือความละเอียด 4 บิต ลดการใช้หน่วยความจำอย่างมากโดยไม่ลดคุณภาพของผลลัพธ์ ทำให้ปริมาณการประมวลผลเพิ่มขึ้นอย่างมาก

ในขณะที่ NVLink รุ่นที่หกร่วมกับโมเดลขนาดใหญ่แบบ MoE ให้เครือข่ายการเชื่อมต่อเร็วกว่าอีเธอร์เน็ตทั่วไปถึง 10 เท่า และมีความหน่วงต่ำกว่า 3 เท่า ทำให้สามารถ DeepSeek โมเดลขนาดใหญ่ที่อิงบนสถาปัตยกรรม MoE สามารถเรียกใช้เครือข่ายย่อย「ผู้เชี่ยวชาญ」ที่แตกต่างกันได้อย่างลื่นไหลระหว่าง GPU 72 ตัว

นี่ไม่ใช่การขายการ์ดจออีกต่อไป ฮวงเจียขายทั้งระบบ “โรงงานผลิต AI”

เอเจนต์

NVIDIA Groq 3 LPX ผลิตในปริมาณมากอย่างเต็มรูปแบบ:

3,400 โทเค็น/วินาที ตัวแทนโค้ดเปลี่ยนไปแล้ว!

ในการประชุม Hot Chips 2026 ครั้งนี้ NVIDIA ยังเปิดเผยข่าวที่น่าตื่นเต้น: Groq 3 LPX ได้เริ่มการผลิตเชิงพาณิชย์ในปริมาณมากแล้ว!

เอเจนต์

Groq 3 LPX เป็นการขยายพื้นที่เฉพาะสำหรับแพลตฟอร์มศูนย์ข้อมูล Vera Rubin NVL72

มันถูกออกแบบมาโดยเฉพาะสำหรับระบบ này โดยเน้นที่การเร่งความเร็วการให้ผลลัพธ์ด้วยความล่าช้าต่ำ

เทคโนโลยีลับนี้ เป็นสิ่งที่ NVIDIA ใช้เงิน 20,000 ล้านดอลลาร์สหรัฐในเดือนธันวาคมปีที่แล้ว เพื่อซื้อจากบริษัทสตาร์ทอัพ Groq

เอเจนต์

ตัวแทนปัญญาประดิษฐ์อาจเผชิญกับปัญหาความล่าช้าในการถอดรหัส เพื่อแก้ไขจุดนี้ Groq 3 LPX ได้แยกการจัดการบริบทขนาดใหญ่และการสร้างโทเค็นอย่างชาญฉลาด

วิธีแก้ปัญหาของ NVIDIA คือให้ GPU ของ Rubin จัดการกับบริบทขนาดใหญ่ และมอบภารกิจการสร้าง Token ด้วยความเร็วสูงสุดให้กับ Groq 3 LPX

อันหนึ่งรับผิดชอบการอ่าน อีกอันรับผิดชอบการเขียน แต่ละคนทำสิ่งที่ตัวเองเก่งที่สุด

เอเจนต์

ในการติดตั้งแบบเต็มรูปแบบระดับชั้นแร็ค ตัวเร่งความเร็ว LP30 ได้สูงสุด 256 ตัวสามารถทำงานร่วมกับ GPU ผ่านการเชื่อมต่อที่มีแบนด์วิดธ์สูงมาก เพื่อสร้างระบบประมวลผลเชิงตรรกะในระดับองค์กร

เอเจนต์

ด้วยเหตุนี้ Groq 3 LPX จึงบรรลุความเร็วในการส่งออกที่สูงที่สุดเป็นประวัติการณ์

ในการทดสอบแบบอ้างอิงของ Artificial Analysis, Groq 3 LPX สามารถรัน Gemma 4 31B ได้ด้วยหน้าต่างบริบทยาว 100,000 Token โดยมีความเร็วในการส่งออกถึง 3,400 Token/วินาที!

ทำให้มันเร็วเป็น 4 เท่าเมื่อเปรียบเทียบกับคู่แข่งในงานที่ต้องการความไวต่อความล่าช้าอย่างสูง

เอเจนต์

งานอัจฉริยะหลายขั้นตอนที่ก่อนหน้านี้ใช้เวลาหลายชั่วโมงในการดำเนินการ ตอนนี้สามารถทำได้ภายในไม่กี่นาที!

เอเจนต์

Groq 3 LPX ลดเวลาในการสร้าง 5000 Token จาก 50 วินาทีเหลือ 1.5 วินาที คิดเป็นความแตกต่าง 34 เท่า

เอเจนต์

นอกจากนี้ ในงานการเข้ารหัส Groq 3 LPX มีความเร็วในการส่งออกสูงสุดที่ 6981 token/s

เอเจนต์

ฮวง เหรินซวี กล่าวอย่างตรงไปตรงมาว่า การขับเคลื่อนการสร้างโทเค็นความเร็วสูงสุดผ่าน LPX ได้บรรลุ “ก้าวกระโดดครั้งยิ่งใหญ่อีกครั้ง” ในด้านความจุและการตอบสนองของ AI

เอเจนต์

Nebius ได้ปรับใช้ชิปนี้ใน Nebius Token Factory เพื่อให้ผู้ใช้ได้รับประสบการณ์ตอบสนองทันทีในทุกขั้นตอนของวงจรตัวแทน

เอเจนต์

ตามมาด้วย Groq เอง

เอเจนต์

เปิดตัว CPU สำหรับ Agent รุ่นแรก

Musk บินขึ้นสู่อวกาศทันทีในคืนนั้น!

ในประกาศครั้งนี้ ขั้นตอนที่มีความทะเยอทะยานที่สุดคือ Vera CPU

เพื่อ Agent นิวเดียได้สร้าง CPU ขึ้นมาเฉพาะ

ซีพียู Vera นี้ถูกออกแบบมาเพื่อเลี้ยงดูตัวแทนอัจฉริยะโดยเฉพาะ

มีการติดตั้งแกน Olympus ที่พัฒนาเองจำนวน 88 แกน หน่วยความจำ LPDDR5X แบนด์วิดธ์สูง แบนด์วิดธ์สูงสุดถึง 1.2 TB/s

เอเจนต์

ทำไมจึงต้องการ CPU แบบใหม่ในยุคของโมเดลขนาดใหญ่?

ที่งาน Hot Chips ผู้บริหารของ NVIDIA Vera CPU กล่าวอย่างตรงไปตรงมาว่า “Agentic AI เป็นงานการคำนวณที่ซับซ้อนที่สุดเท่าที่เคยมีมา”

เอเจนต์

งานหนึ่งงาน ตัวแทนต้องดำเนินการกว่าร้อยขั้นตอนเบื้องหลัง: เรียกใช้เครื่องมือ รันรหัส Python ค้นหาบริบท จัดการข้อมูลปริมาณมหาศาล...

งานการจัดการงานส่งของเหล่านี้ทั้งหมดถูกกดดันให้ CPU รับภาระโดยตรง ดังนั้น NVIDIA จึงต้องสร้าง CPU สำหรับ Agent ขึ้นมาโดยเฉพาะ

เห็นจุดนี้ชัดเจน แมสก์จึงประกาศผ่าน SpaceXAI ทันทีว่าจะเริ่มการปรับใช้ Vera CPU ของ NVIDIA ในระดับใหญ่!

ตั้งแต่เดือนพฤษภาคมปีนี้ นิวเดียได้ส่งตัวอย่าง Vera ชุดแรกไปยังบริษัท A, OpenAI และ SpaceXAI เพื่อให้ทดลองใช้งานล่วงหน้า

เพียงแค่ 3 เดือนต่อมา SpaceXAI ก็รีบนำมันไปใช้งานอย่างเต็มรูปแบบ

ที่บ้ากว่านั้น คือ SpaceXAI กำลังสร้างโรงงานประมวลผลพลังงานจิวัตต์บนแพลตฟอร์ม Vera Rubin เพื่อขับเคลื่อน Grok

นอกจากนี้ กำลังการประมวลผลชุดนี้ยังจะถูกส่งตรงไปยังอวกาศ

มัสก์กล่าวว่า "ทั้งสองบริษัทร่วมมือกันออกแบบ Vera Rubin NVL72 รุ่นปรับปรุง ซึ่งจะนำไปใช้งานในปริมาณมากปี 2028"

เอเจนต์

รุ่นแรกของดาวเทียม AI "Starmind" ของ SpaceXAI วางแผนจะใช้ระบบระดับชั้นวาง Vera Rubin NVL72

เอเจนต์

จาก GPU หนึ่งเครื่อง ไปสู่โรงงาน Agent ทั้งหมด

ในวันเดียวกัน ชิปสองตัวคือ Vera CPU และ Groq 3 LPX ได้เริ่มผลิตในปริมาณมากอย่างสมบูรณ์

This is significant for NVIDIA.

เอเจนต์

ในยุคของโมเดลขนาดใหญ่ นิวไดเอียได้ครองตลาดการฝึกฝนและการอนุมานด้วย GPU

ในยุคของตัวแทน ขอบเขตของมันได้ขยายไปถึง CPU, อุปกรณ์เร่งการประมวลผลเชิงตรรกะ, NVLink ฯลฯ

สิ่งที่ลาหวังขายไปแล้ว ไม่ใช่แค่ GPU หนึ่งชิ้น

เขาต้องการขายโรงงาน AI ที่สามารถผลิตโทเค็นได้อย่างต่อเนื่อง

ครั้งนี้ ล่าหวงกำลังจะวางรากฐานใหม่ให้กับทั้ง “ยุคของตัวแทน”

ข้อมูลอ้างอิง:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

บทความนี้มาจาก微信号 “NewZeus” โดยผู้เขียน: ASI Revelation

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา