สุดยอดมาก
เมื่อไม่นานมานี้ นิวเดียได้เปิดเผยข้อมูลการทดสอบบนชิปครั้งแรกของตู้รุ่นแฟลกชิพรุ่นถัดไป Vera Rubin NVL72 ซึ่งเป็นครั้งแรกในประวัติศาสตร์ของบริษัท
และในครั้งนี้ การทดสอบจริงได้ดึงมาโดยตรง DeepSeek -V4-Pro รันงาน "การเข้ารหัสเอเจนต์อัจฉริยะ" ที่แท้จริงที่สุด!
ผลลัพธ์น่าประหลาดใจ: เมื่อเปรียบเทียบกับเครื่องหลักที่ทรงพลังที่สุดในปัจจุบัน GB300 NVL72 ปริมาณการรับส่งข้อมูลต่อเมกะวัตต์ของ Vera Rubin สูงสุดเพิ่มขึ้น 30 เท่า และต้นทุนต่อโทเค็นลดลงสูงสุด 35 เท่า!

มีคนตะโกนว่า: “ฉันยังกล้าเขียน PPT หลอกนักลงทุนแบบนี้ไม่ได้!”
ผู้ใช้งานรายอื่นยังแสดงความคิดเห็นอย่างขำขัน: “ก่อนหน้านี้รู้สึกว่า H200 ราคาสามหมื่นดอลลาร์สหรัฐแพงเกินไป แต่ตอนนี้หันกลับมามอง กลับพบว่า H200 ยังไม่ถึงขั้นเป็นรุ่นพื้นฐานเลย”

มาพิจารณาอย่างละเอียดกันเถอะ
จาก H200 ถึง GB300 ปริมาณการประมวลผลของงาน Agent จริงเพิ่มขึ้นสูงสุด 30 เท่า ต้นทุนเพิ่มขึ้นประมาณสองเท่า
จาก GB300 ถึง Vera Rubin ปริมาณการประมวลผลพุ่งสูงสุดถึง 30 เท่า ราคาต่อชั้นเครื่องเพิ่มขึ้นประมาณสองเท่า
ตามกฎของมัวร์ของฮวงเหลียง การพัฒนาเทคโนโลยีที่ยิ่งใหญ่ที่สุดของ NVIDIA ในสองปีที่ผ่านมาไม่ใช่ GPU เอง แต่คือการเพิ่มราคาขึ้นสี่เท่า แต่ได้รับความเร็วเพิ่มขึ้นถึง 900 เท่า!

ครั้งนี้ NVIDIA ประกาศความจริงที่ขัดกับความเข้าใจทั่วไปแก่ทุกคน: ยุคของ LLM สิ้นสุดลง ยุคของ Agent เริ่มต้นขึ้น เกณฑ์การวัดประสิทธิภาพ AI แบบเดิมทั้งหมดล้าสมัยแล้ว!

ในขณะเดียวกัน เวราซีพียูที่ออกแบบมาโดยเฉพาะสำหรับเอเจนต์ ถูกสเปซเอ็กซ์ของมัสก์ติดตั้งอย่างเร่งด่วน และเตรียมส่งขึ้นสู่อวกาศโดยตรง
ในวันเดียวกันนี้ Groq 3 LPX ของ NVIDIA ก็เริ่มผลิตในปริมาณมากอย่างเต็มรูปแบบ
Gemma 4 31B รันอยู่ด้านบน ความเร็วสุดยอด ไปถึง 3,400 โทเค็นต่อวินาทีโดยตรง ความจุของโมเดลพารามิเตอร์ล้านล้าน พุ่งขึ้น 35 เท่า


บันทึกใหม่เหล่านี้จะเขียนบทใหม่ให้กับโครงสร้างทางธุรกิจของเอเจนต์ตั้งแต่คืนนี้!
ทำไม NVIDIA จึงต้องเปิดตัว Vera Rubin?
ข้อมูลล่าสุดจาก OpenRouter ให้คำตอบว่า: ในโลกแห่งความเป็นจริง จำนวนโทเค็นที่ใช้สำหรับงาน Agent AI นั้นมากกว่าการสนทนาแบบธรรมดาถึง 15 เท่า!
ตัวอย่างเช่น หากให้เอเจนต์ศึกษาบริษัทหนึ่งเพื่อการตัดสินใจลงทุน กระบวนการนี้จะทำให้เอเจนต์และเอเจนต์ย่อยทำการวิเคราะห์อย่างต่อเนื่อง โดยโทเค็นที่สะสมจะกลายเป็นข้อมูลนำเข้าสำหรับขั้นตอนถัดไป การจัดการบริบทยาวจึงเป็นปัจจัยสำคัญที่สุดที่จำกัดประสิทธิภาพของเอเจนต์ AI

ยิ่งมีการโต้ตอบของตัวแทนมากเท่าใด ปริมาณการผ่านก็ยิ่งสูงขึ้น—จำนวนตัวแทนเพิ่มขึ้น 10 เท่า การเรียกใช้เครื่องมือเพิ่มขึ้น 2 เท่า ความขัดแย้งระหว่างพลังการประมวลผลและอัลกอริทึมได้สร้างความต้องการใหม่

อย่าใช้การพูดคุยเป็นตัวแทนปัญญาประดิษฐ์ ค่าอ้างอิงเก่าถูกยกเลิกทั้งหมด!
ในเวลานี้ การทดสอบมาตรฐาน AI แบบดั้งเดิม (เช่น การทดสอบลำดับความยาวคงที่ 8K/1K) จึงไม่มีประสิทธิภาพอีกต่อไป
NVIDIA อย่างเป็นทางการชี้ชัด: การวัดประสิทธิภาพต้องก้าวหน้า! ไม่สามารถวัดเพียงคำขอการให้เหตุผลเดียวได้อีกต่อไป ต้องจับภาพกระบวนการทำงานของ Agent อย่างสมบูรณ์
สำหรับสิ่งนี้ พวกเขาใช้การทดสอบมาตรฐาน AgentX ของ SemiAnalysis
การทดสอบนี้ไม่ใช่คำถามและคำตอบแบบเดิมๆ อีกต่อไป แต่เป็นการเล่นซ้ำการสนทนาการเขียนโค้ดที่แท้จริง พร้อมการเติบโตของบริบท การเรียกใช้เครื่องมือ และการสร้างซับอินเทลลิเจนซ์

นี่คือเหตุผลที่ H200 ดูเหมือนไม่สามารถแข่งขันได้ในสนามใหม่ของ Agent และ Vera Rubin ถูกกำหนดให้ครองราชย์
เวรา รูบิน NVL72 × DeepSeek-V4-Pro:
พลังการขุดมาถึงแล้ว
เพื่อพิสูจน์ความแข็งแกร่งของ Vera Rubin NVL72 นิวเดียได้ใช้ผู้นำด้านโอเพนซอร์ส— DeepSeek ทำการทดสอบบนชิปสำหรับ V4-Pro (1.6T)
เมื่อข้อมูลถูกเปิดเผย ผลลัพธ์น่าตกใจ—
ภายใต้ภาระงาน AgentX ความเร็วในการรับส่งข้อมูลต่อเมกะวัตต์ของ Vera Rubin NVL72 สูงกว่า GB300 NVL72 สูงสุดถึง 30 เท่า!

โปรดทราบว่าการเปรียบเทียบนี้ไม่ได้เป็น H200 รุ่นเก่า แต่เป็น GB300 รุ่นหลักที่กำลังได้รับความนิยม
GB300 ในเดียวกัน DeepSeek ในการทดสอบ V4-Pro ปริมาณการรับส่งข้อมูลต่อเมกะวัตต์เพิ่มขึ้น 15 เท่าเมื่อเทียบกับ H200
อย่างไรก็ตาม เวรา รูบิน ได้สูงขึ้นอีก 30 เท่าจากไหล่ของ GB300 และยังเพิ่มขึ้นอีกบนเส้นโค้งพารีโตทั้งหมด!
หมายความว่าอย่างไร
สำหรับโรงงาน AI ที่ถูกจำกัดโดยการจ่ายไฟฟ้า สิ่งนี้ขยายขอบเขตของกฎทางฟิสิกส์โดยตรง
ภายใต้งบประมาณพลังงานเดียวกัน Vera Rubin สามารถทำงานได้มากกว่า 30 เท่าของตัวแทน
สำหรับศูนย์ข้อมูลขนาดเมกะวัตต์หรือกิกะวัตต์ นี่เทียบเท่ากับการสร้างทรัพย์สินการประมวลผลเพิ่มขึ้น 30 เท่าจากอากาศ
นอกจากนี้ เทคโนโลยี NVIDIA DSX MaxLPS สามารถจัดการพลังงานได้ในระดับ GPU, ชั้นวาง และงานโหลด ทำให้สามารถติดตั้ง GPU ได้มากขึ้นสูงสุด 40% ภายในงบประมาณพลังงานเดียวกัน ช่วยเพิ่มประสิทธิภาพการผ่านข้อมูลต่อเมกะวัตต์ให้กับโรงงาน AI อย่างมาก!

ต้นทุนโทเค็นลดลง 35 เท่า! สมุดบัญชีของอุตสาหกรรม Agent ถูกเขียนใหม่ทั้งหมด
ต่อการรับส่งข้อมูลหนึ่งเมกะวัตต์ ซึ่งส่งผลโดยตรงต่อต้นทุนในการสร้างโทเค็นแต่ละตัว การเพิ่มขึ้นอย่างรวดเร็วของประสิทธิภาพนำมาซึ่งผลลัพธ์ที่ตรงที่สุดคือการระเบิดทางธุรกิจ
NVIDIA ประกาศว่า Vera Rubin NVL72 ลดต้นทุนการผลิตต่อหนึ่งล้านโทเค็นได้สูงสุดถึง 35 เท่าเมื่อเทียบกับ GB300 NVL72!

เมื่อต้นทุนการประมวลผลลดลงแบบเฉียบพลันถึง 35 เท่า บุคลากรดิจิทัลที่ทำงานตลอด 24 ชั่วโมงจะกลายเป็นเรื่องจริง และแอปพลิเคชันระดับซูเปอร์สำหรับผู้ใช้ปลายทางจะเกิดการระเบิดอย่างใหญ่หลวง
การกระทำของลาหวงครั้งนี้ได้เปิดประตูสู่ยุคของแอปพลิเคชันเอเจนต์ทันที

การออกแบบร่วมกันอย่างสมบูรณ์แบบ: ฮวงเก่าทำได้อย่างไร?
คุณอาจสงสัย: ทำไมถึงเร็วขึ้น 30 เท่า? ขึ้นอยู่กับกระบวนการชิปเดียวหรือ?
ไม่ใช่แน่นอน
Vera Rubin NVL72 ได้รับการปรับปรุงประสิทธิภาพอย่างน่าทึ่ง nhờ การออกแบบแบบร่วมมืออย่างสุดยอด

เช่น บริการแบบแยกส่วน, แคช KV แบบกระจาย, การจัดเส้นทางที่รับรู้ KV, MegaMoE เป็นต้น

นอกจากนี้ NVFP4 การลดขนาดแบบควอนไทซ์จะบีบอัดน้ำหนักโมเดลลงเหลือความละเอียด 4 บิต ลดการใช้หน่วยความจำอย่างมากโดยไม่ลดคุณภาพของผลลัพธ์ ทำให้ปริมาณการประมวลผลเพิ่มขึ้นอย่างมาก
ในขณะที่ NVLink รุ่นที่หกร่วมกับโมเดลขนาดใหญ่แบบ MoE ให้เครือข่ายการเชื่อมต่อเร็วกว่าอีเธอร์เน็ตทั่วไปถึง 10 เท่า และมีความหน่วงต่ำกว่า 3 เท่า ทำให้สามารถ DeepSeek โมเดลขนาดใหญ่ที่อิงบนสถาปัตยกรรม MoE สามารถเรียกใช้เครือข่ายย่อย「ผู้เชี่ยวชาญ」ที่แตกต่างกันได้อย่างลื่นไหลระหว่าง GPU 72 ตัว
นี่ไม่ใช่การขายการ์ดจออีกต่อไป ฮวงเจียขายทั้งระบบ “โรงงานผลิต AI”

NVIDIA Groq 3 LPX ผลิตในปริมาณมากอย่างเต็มรูปแบบ:
3,400 โทเค็น/วินาที ตัวแทนโค้ดเปลี่ยนไปแล้ว!
ในการประชุม Hot Chips 2026 ครั้งนี้ NVIDIA ยังเปิดเผยข่าวที่น่าตื่นเต้น: Groq 3 LPX ได้เริ่มการผลิตเชิงพาณิชย์ในปริมาณมากแล้ว!

Groq 3 LPX เป็นการขยายพื้นที่เฉพาะสำหรับแพลตฟอร์มศูนย์ข้อมูล Vera Rubin NVL72
มันถูกออกแบบมาโดยเฉพาะสำหรับระบบ này โดยเน้นที่การเร่งความเร็วการให้ผลลัพธ์ด้วยความล่าช้าต่ำ
เทคโนโลยีลับนี้ เป็นสิ่งที่ NVIDIA ใช้เงิน 20,000 ล้านดอลลาร์สหรัฐในเดือนธันวาคมปีที่แล้ว เพื่อซื้อจากบริษัทสตาร์ทอัพ Groq

ตัวแทนปัญญาประดิษฐ์อาจเผชิญกับปัญหาความล่าช้าในการถอดรหัส เพื่อแก้ไขจุดนี้ Groq 3 LPX ได้แยกการจัดการบริบทขนาดใหญ่และการสร้างโทเค็นอย่างชาญฉลาด
วิธีแก้ปัญหาของ NVIDIA คือให้ GPU ของ Rubin จัดการกับบริบทขนาดใหญ่ และมอบภารกิจการสร้าง Token ด้วยความเร็วสูงสุดให้กับ Groq 3 LPX
อันหนึ่งรับผิดชอบการอ่าน อีกอันรับผิดชอบการเขียน แต่ละคนทำสิ่งที่ตัวเองเก่งที่สุด

ในการติดตั้งแบบเต็มรูปแบบระดับชั้นแร็ค ตัวเร่งความเร็ว LP30 ได้สูงสุด 256 ตัวสามารถทำงานร่วมกับ GPU ผ่านการเชื่อมต่อที่มีแบนด์วิดธ์สูงมาก เพื่อสร้างระบบประมวลผลเชิงตรรกะในระดับองค์กร

ด้วยเหตุนี้ Groq 3 LPX จึงบรรลุความเร็วในการส่งออกที่สูงที่สุดเป็นประวัติการณ์
ในการทดสอบแบบอ้างอิงของ Artificial Analysis, Groq 3 LPX สามารถรัน Gemma 4 31B ได้ด้วยหน้าต่างบริบทยาว 100,000 Token โดยมีความเร็วในการส่งออกถึง 3,400 Token/วินาที!
ทำให้มันเร็วเป็น 4 เท่าเมื่อเปรียบเทียบกับคู่แข่งในงานที่ต้องการความไวต่อความล่าช้าอย่างสูง

งานอัจฉริยะหลายขั้นตอนที่ก่อนหน้านี้ใช้เวลาหลายชั่วโมงในการดำเนินการ ตอนนี้สามารถทำได้ภายในไม่กี่นาที!

Groq 3 LPX ลดเวลาในการสร้าง 5000 Token จาก 50 วินาทีเหลือ 1.5 วินาที คิดเป็นความแตกต่าง 34 เท่า

นอกจากนี้ ในงานการเข้ารหัส Groq 3 LPX มีความเร็วในการส่งออกสูงสุดที่ 6981 token/s

ฮวง เหรินซวี กล่าวอย่างตรงไปตรงมาว่า การขับเคลื่อนการสร้างโทเค็นความเร็วสูงสุดผ่าน LPX ได้บรรลุ “ก้าวกระโดดครั้งยิ่งใหญ่อีกครั้ง” ในด้านความจุและการตอบสนองของ AI

Nebius ได้ปรับใช้ชิปนี้ใน Nebius Token Factory เพื่อให้ผู้ใช้ได้รับประสบการณ์ตอบสนองทันทีในทุกขั้นตอนของวงจรตัวแทน

ตามมาด้วย Groq เอง

เปิดตัว CPU สำหรับ Agent รุ่นแรก
Musk บินขึ้นสู่อวกาศทันทีในคืนนั้น!
ในประกาศครั้งนี้ ขั้นตอนที่มีความทะเยอทะยานที่สุดคือ Vera CPU
เพื่อ Agent นิวเดียได้สร้าง CPU ขึ้นมาเฉพาะ
ซีพียู Vera นี้ถูกออกแบบมาเพื่อเลี้ยงดูตัวแทนอัจฉริยะโดยเฉพาะ
มีการติดตั้งแกน Olympus ที่พัฒนาเองจำนวน 88 แกน หน่วยความจำ LPDDR5X แบนด์วิดธ์สูง แบนด์วิดธ์สูงสุดถึง 1.2 TB/s

ทำไมจึงต้องการ CPU แบบใหม่ในยุคของโมเดลขนาดใหญ่?
ที่งาน Hot Chips ผู้บริหารของ NVIDIA Vera CPU กล่าวอย่างตรงไปตรงมาว่า “Agentic AI เป็นงานการคำนวณที่ซับซ้อนที่สุดเท่าที่เคยมีมา”

งานหนึ่งงาน ตัวแทนต้องดำเนินการกว่าร้อยขั้นตอนเบื้องหลัง: เรียกใช้เครื่องมือ รันรหัส Python ค้นหาบริบท จัดการข้อมูลปริมาณมหาศาล...
งานการจัดการงานส่งของเหล่านี้ทั้งหมดถูกกดดันให้ CPU รับภาระโดยตรง ดังนั้น NVIDIA จึงต้องสร้าง CPU สำหรับ Agent ขึ้นมาโดยเฉพาะ
เห็นจุดนี้ชัดเจน แมสก์จึงประกาศผ่าน SpaceXAI ทันทีว่าจะเริ่มการปรับใช้ Vera CPU ของ NVIDIA ในระดับใหญ่!
ตั้งแต่เดือนพฤษภาคมปีนี้ นิวเดียได้ส่งตัวอย่าง Vera ชุดแรกไปยังบริษัท A, OpenAI และ SpaceXAI เพื่อให้ทดลองใช้งานล่วงหน้า
เพียงแค่ 3 เดือนต่อมา SpaceXAI ก็รีบนำมันไปใช้งานอย่างเต็มรูปแบบ
ที่บ้ากว่านั้น คือ SpaceXAI กำลังสร้างโรงงานประมวลผลพลังงานจิวัตต์บนแพลตฟอร์ม Vera Rubin เพื่อขับเคลื่อน Grok
นอกจากนี้ กำลังการประมวลผลชุดนี้ยังจะถูกส่งตรงไปยังอวกาศ
มัสก์กล่าวว่า "ทั้งสองบริษัทร่วมมือกันออกแบบ Vera Rubin NVL72 รุ่นปรับปรุง ซึ่งจะนำไปใช้งานในปริมาณมากปี 2028"

รุ่นแรกของดาวเทียม AI "Starmind" ของ SpaceXAI วางแผนจะใช้ระบบระดับชั้นวาง Vera Rubin NVL72

จาก GPU หนึ่งเครื่อง ไปสู่โรงงาน Agent ทั้งหมด
ในวันเดียวกัน ชิปสองตัวคือ Vera CPU และ Groq 3 LPX ได้เริ่มผลิตในปริมาณมากอย่างสมบูรณ์
This is significant for NVIDIA.

ในยุคของโมเดลขนาดใหญ่ นิวไดเอียได้ครองตลาดการฝึกฝนและการอนุมานด้วย GPU
ในยุคของตัวแทน ขอบเขตของมันได้ขยายไปถึง CPU, อุปกรณ์เร่งการประมวลผลเชิงตรรกะ, NVLink ฯลฯ
สิ่งที่ลาหวังขายไปแล้ว ไม่ใช่แค่ GPU หนึ่งชิ้น
เขาต้องการขายโรงงาน AI ที่สามารถผลิตโทเค็นได้อย่างต่อเนื่อง
ครั้งนี้ ล่าหวงกำลังจะวางรากฐานใหม่ให้กับทั้ง “ยุคของตัวแทน”
ข้อมูลอ้างอิง:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
บทความนี้มาจาก微信号 “NewZeus” โดยผู้เขียน: ASI Revelation
