NVIDIA ra mắt Vera Rubin NVL72, tăng gấp 30 lần thông lượng của DeepSeek

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
NVIDIA đã công bố tin tức trên chuỗi cho kết quả kiểm tra Vera Rubin NVL72, với thông lượng DeepSeek-V4-Pro tăng 30 lần. Chi phí token giảm 35 lần so với GB300 NVL72. Nền tảng bao gồm Vera CPU và Groq 3 LPX, hiện đang được SpaceXAI sử dụng. Các danh sách token mới có thể được thêm vào trong tương lai do những cải tiến về hiệu suất cho thấy việc triển khai AI rộng rãi hơn.

Quá đỉnh cao.

Vừa mới đây, NVIDIA đã công bố lần đầu tiên dữ liệu kiểm tra trên chip của tủ thế hệ tiếp theo, Vera Rubin NVL72, trong lịch sử của công ty.

Và lần thực nghiệm này đã trực tiếp thu hút DeepSeek -V4-Pro, thực hiện nhiệm vụ “mã hóa tác nhân thông minh” chân thực nhất!

Kết quả thật đáng kinh ngạc: so với chiếc máy chủ hàng đầu hiện tại GB300 NVL72, Vera Rubin đạt mức thông lượng mỗi megawatt cao nhất tăng 30 lần và chi phí mỗi token giảm tới 35 lần!

Agent

Một người kinh ngạc: “Tôi thậm chí còn không dám viết PPT lừa đảo nhà đầu tư như thế này!”

Một người dùng khác bình luận hài hước: “Trước đây còn chê H200 giá 30.000 USD một chiếc quá đắt, giờ quay đầu nhìn lại, hóa ra H200 thậm chí còn không đáng gọi là phiên bản cơ bản.”

Agent

Hãy cùng phân tích kỹ lưỡng.

Từ H200 đến GB300, thông lượng của tải công việc Agent thực tế đã tăng lên tối đa 30 lần, chi phí tăng khoảng gấp đôi.

Từ GB300 đến Vera Rubin, công suất xử lý tăng trở lại cao nhất 30 lần, giá toàn khung tăng khoảng gấp đôi.

Theo định luật Moore của Old Huang, trong hai năm qua, bước đột phá công nghệ lớn nhất của NVIDIA không phải là GPU bản thân nó, mà là tăng giá lên 4 lần nhưng đổi lấy tốc độ tăng tới 900 lần!

Agent

Lần này, NVIDIA đã công bố một sự thật phi trực quan với tất cả mọi người: Thời đại LLM đã kết thúc, thời đại Agent đã đến, tất cả các tiêu chuẩn đánh giá AI trước đây đều trở nên lỗi thời!

Agent

Trong khi đó, Vera CPU được thiết kế đặc biệt cho các tác nhân đã được SpaceXAI của Musk lắp đặt khẩn cấp trong đêm và thậm chí đang chuẩn bị mang lên không gian.

Cùng trong hôm nay,英伟达Groq 3 LPX cũng đã chính thức sản xuất hàng loạt.

Gemma 4 31B chạy trên đây, tốc độ thực sự tuyệt vời, đạt tới 3.400 token mỗi giây. Thông lượng mô hình với một nghìn tỷ tham số tăng vọt 35 lần.

Agent

Agent

Những kỷ lục mới này sẽ viết lại cục diện thương mại của hệ sinh thái Agent kể từ đêm nay!

Tại sao NVIDIA phải ra mắt Vera Rubin?

Dữ liệu mới nhất từ OpenRouter đã đưa ra câu trả lời: Trong thế giới thực, một tác vụ Agent AI tiêu tốn số lượng Token gấp 15 lần so với cuộc trò chuyện trò chuyện thông thường!

Ví dụ, nếu một Agent được yêu cầu nghiên cứu một công ty để đưa ra quyết định đầu tư, trong quá trình này, agent và các sub-agent sẽ liên tục suy luận, các token tích lũy sẽ trở thành đầu vào cho bước tiếp theo, và xử lý ngữ cảnh dài trở thành yếu tố quan trọng nhất hạn chế AI của agent.

Agent

Số lần tương tác của tác nhân càng nhiều, thông lượng càng lớn—số lượng tác nhân tăng 10 lần, số lần gọi công cụ tăng 2 lần, mâu thuẫn giữa sức mạnh tính toán và thuật toán đã tạo ra nhu cầu mới.

Agent

Đừng coi trò chuyện là trí tuệ nhân tạo, tất cả các tiêu chuẩn cũ đã bị xóa bỏ!

Lúc này, các bài kiểm tra AI truyền thống (như kiểm tra chuỗi độ dài cố định 8K/1K) hoàn toàn không còn hiệu lực.

NVIDIA chính thức làm rõ: Việc đo lường hiệu suất phải được cải tiến! Không thể chỉ đo lường các yêu cầu suy luận đơn lẻ, mà phải nắm bắt toàn bộ luồng công việc của Agent.

Để làm điều này, họ đã sử dụng bài kiểm tra chuẩn AgentX thuộc SemiAnalysis.

Bài kiểm tra này không còn là câu hỏi-trả lời cứng nhắc, mà là phát lại lại các “phiên họp lập trình” thực tế với sự tăng trưởng ngữ cảnh, gọi công cụ và tạo các tác tử con.

Agent

Đó là lý do tại sao H200 dường như không đủ sức trong chiến trường Agent mới, Vera Rubin chắc chắn sẽ lên ngôi.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Quái vật tính toán đã đến

Để chứng minh sức mạnh của Vera Rubin NVL72, NVIDIA trực tiếp sử dụng vị vua mã nguồn mở— DeepSeek Đang thực hiện kiểm tra trên chip V4-Pro (1.6T).

Ngay khi dữ liệu được công bố, kết quả thật đáng kinh ngạc—

Dưới tải trọng AgentX, throughput mỗi megawatt của Vera Rubin NVL72 đã tăng lên tới 30 lần so với GB300 NVL72!

Agent

Lưu ý rằng so sánh ở đây không phải là H200 cũ kỹ, mà là GB300 đang rất được ưa chuộng.

GB300 ở cùng một DeepSeek Trong quá trình thử nghiệm V4-Pro, công suất xử lý mỗi megawatt đã tăng 15 lần so với H200.

Tuy nhiên, Vera Rubin đã nâng cao thêm 30 lần trên vai của GB300, đẩy lên nữa toàn bộ đường cong Pareto!

What does this mean?

Đối với các “nhà máy AI” bị giới hạn bởi nguồn điện, điều này trực tiếp mở rộng ranh giới của các định luật vật lý.

Với cùng một ngân sách điện, Vera Rubin có thể thực hiện gấp 30 lần công việc của các tác nhân.

Đối với các trung tâm dữ liệu công suất megawatt hoặc gigawatt, điều này tương đương với việc tạo ra 30 lần tài sản tính toán từ hư không.

Hơn nữa, công nghệ NVIDIA DSX MaxLPS cho phép quản lý nguồn điện trên cấp độ GPU, kệ và tải công việc, giúp bố trí thêm tới 40% GPU trong cùng ngân sách công suất megawatt, từ đó nâng cao đáng kể sản lượng trên mỗi megawatt của nhà máy AI!

Agent

Chi phí token giảm 35 lần! 「Sổ cái」 của ngành Agent được viết lại hoàn toàn

Mỗi megawatt thông lượng trực tiếp ảnh hưởng đến chi phí sản xuất mỗi token. Sự bùng nổ về hiệu suất mang lại hệ quả trực tiếp nhất là vụ nổ hạt nhân trong mô hình kinh doanh.

NVIDIA thông báo, chi phí sản xuất mỗi triệu token của Vera Rubin NVL72 giảm tới 35 lần so với GB300 NVL72!

Agent

Khi chi phí suy luận giảm đột ngột 35 lần, nhân viên kỹ thuật số hoạt động 24/7 sẽ trở thành hiện thực, và các siêu ứng dụng dành cho người dùng cuối sẽ bùng nổ mạnh mẽ.

Lão Hoàng vừa một nhát chém, trực tiếp mở ra cánh cửa thời đại ứng dụng Agent.

Agent

Thiết kế hợp tác cực đỉnh: Lão Hoàng đã làm được điều đó như thế nào?

Bạn có thể tự hỏi: Tại sao có thể tăng tốc 30 lần? Có phải nhờ vào quy trình của một con chip đơn lẻ không?

Không hẳn.

Vera Rubin NVL72 có sự cải thiện hiệu suất đáng kinh ngạc nhờ vào "thiết kế phối hợp cực hạn".

Agent

Ví dụ như dịch vụ tách rời, bộ nhớ đệm KV phân tán, định tuyến nhận biết KV, MegaMoE, v.v.

Agent

Ngoài ra, NVFP4 nén trực tiếp trọng số mô hình xuống độ chính xác 4 bit, giảm đáng kể dung lượng bộ nhớ mà không làm giảm chất lượng đầu ra, giúp thông lượng tăng vọt ngay lập tức.

Trong khi NVLink thế hệ thứ sáu kết hợp với mô hình lớn MoE cung cấp mạng kết nối nhanh gấp 10 lần và độ trễ thấp hơn 3 lần so với Ethernet thông thường, giúp DeepSeek Mô hình lớn dựa trên kiến trúc MoE có thể linh hoạt gọi các mạng con « chuyên gia » khác nhau giữa 72 GPU.

Đây không còn đơn thuần là bán card đồ họa nữa, Lão Hoàng đang bán cả một “nhà máy điện AI” hoàn chỉnh.

Agent

NVIDIA Groq 3 LPX đã bắt đầu sản xuất hàng loạt:

3400 token/giây, Agent mã đang thay đổi!

Tại hội nghị Hot Chips 2026 này, NVIDIA còn công bố một thông tin gây chấn động: Groq 3 LPX đã bắt đầu sản xuất hàng loạt!

Agent

Groq 3 LPX là phần mở rộng độc quyền cho nền tảng trung tâm dữ liệu Vera Rubin NVL72.

Nó được thiết kế đặc biệt cho hệ thống này, với trọng tâm là tăng tốc suy luận độ trễ thấp.

Công nghệ đen này là thứ mà NVIDIA đã chi 20 tỷ USD vào tháng 12 năm ngoái để mua lại từ công ty khởi nghiệp Groq.

Agent

Các tác nhân AI có thể gặp vấn đề về độ trễ giải mã, để giải quyết điểm đau này, Groq 3 LPX đã tách biệt hoàn toàn việc xử lý ngữ cảnh lớn và tạo token.

Giải pháp của NVIDIA là để GPU Rubin xử lý ngữ cảnh quy mô lớn, đồng thời giao nhiệm vụ tạo Token cực nhanh cho Groq 3 LPX.

Một người phụ trách «đọc», một người phụ trách «ghi», mỗi người làm công việc mình giỏi nhất.

Agent

Trong một triển khai cấp khung hoàn chỉnh, lên đến 256 bộ tăng tốc LP30 có thể phối hợp với GPU thông qua kết nối băng thông siêu cao để tạo thành một động cơ suy luận quy mô doanh nghiệp.

Agent

From this, Groq 3 LPX directly achieved a record-breaking output speed.

Trong bài kiểm tra hiệu năng của Artificial Analysis, Groq 3 LPX chạy Gemma 4 31B với cửa sổ ngữ cảnh siêu dài 100.000 Token, đạt tốc độ đầu ra đáng kinh ngạc là 3.400 Token/giây!

This makes it four times faster in response than competitors for workloads with extremely low latency sensitivity.

Agent

Các tác vụ agent đa bước trước đây mất vài giờ mới hoàn thành, giờ đây có thể hoàn thành trong vài phút!

Agent

Groq 3 LPX khi tạo 5000 Token, thời gian giảm từ 50 giây xuống còn 1,5 giây, chênh lệch 34 lần.

Agent

Và trong các nhiệm vụ mã hóa, tốc độ đầu ra tối đa của Groq 3 LPX là 6981 token/giây.

Agent

Huang Renxun trực tiếp cho biết, việc thúc đẩy tạo token siêu tốc thông qua LPX đã mang lại “một bước nhảy vọt lớn khác” về thông lượng và khả năng phản hồi của AI.

Agent

Nebius đã triển khai chip này trong Nebius Token Factory để mang đến trải nghiệm phản hồi tức thì ở từng bước của chuỗi tác nhân.

Agent

Ngay sau đó là chính Groq.

Agent

Đã ra mắt CPU đầu tiên dành riêng cho Agent,

Musk连夜「đánh lên không gian」!

Bước đi đầy tham vọng nhất trong thông báo lần này chính là Vera CPU.

Để phục vụ Agent, NVIDIA đã chế tạo riêng một con CPU.

Viên CPU Vera này được thiết kế đặc biệt để cung cấp năng lượng cho các tác nhân thông minh,

Nó được trang bị 88 lõi Olympus tự phát triển, bộ nhớ LPDDR5X băng thông cao, băng thông trực tiếp đạt 1,2 TB/s.

Agent

Tại sao thời đại mô hình lớn cần CPU hoàn toàn mới?

Tại sự kiện Hot Chips, quản lý cấp cao của英伟达 Vera CPU trực tiếp cho biết: “Agentic AI là nhiệm vụ tính toán phức tạp nhất trong lịch sử”.

Agent

Một nhiệm vụ, phía sau Agent phải thực hiện hàng trăm bước: gọi công cụ, thực thi mã Python, lật qua ngữ cảnh, xử lý khối lượng dữ liệu khổng lồ...

Tất cả các công việc điều phối giao hàng này đều đè lên CPU để chịu đựng. Do đó, NVIDIA phải chế tạo riêng một CPU cho Agent.

Chính vì nhìn thấy điểm này, SpaceXAI của Musk đã ngay lập tức công bố chính thức triển khai quy mô lớn CPU NVIDIA Vera!

Ngay từ tháng 5 năm nay, NVIDIA đã lặng lẽ gửi những mẫu Vera đầu tiên đến A社, OpenAI và SpaceXAI để họ "thử nghiệm".

Chỉ sau 3 tháng, SpaceXAI đã vội vàng chuyển sang triển khai toàn diện.

Điều điên rồ hơn là SpaceXAI đang xây dựng nhà máy tính toán công suất gigawatt dựa trên nền tảng Vera Rubin để vận hành Grok.

Không chỉ vậy, hệ thống tính toán này còn sẽ được đưa trực tiếp lên không gian.

Musk cho biết: "Hai công ty mạnh mẽ hợp tác, thiết kế một phiên bản tối ưu hóa Vera Rubin NVL72, sẽ được triển khai quy mô lớn vào năm 2028."

Agent

Thế hệ đầu tiên của vệ tinh AI "Starmind" của SpaceXAI sẽ sử dụng hệ thống khung Vera Rubin NVL72.

Agent

Từ một GPU, đến cả một nhà máy Agent

Cùng ngày, hai con chip Vera CPU và Groq 3 LPX chính thức sản xuất hàng loạt.

This is significant for NVIDIA.

Agent

Thời đại mô hình lớn, NVIDIA đã chiếm lĩnh việc huấn luyện và suy luận nhờ GPU.

Thời đại Agent, phạm vi của nó đã mở rộng đến CPU, bộ tăng tốc suy luận, NVLink, v.v.

Lão Hoàng bán không còn chỉ là một con GPU nữa.

Anh ấy muốn bán một nhà máy AI có thể liên tục sản xuất Token.

Lão Hoàng lần này đang chuẩn bị lại nền tảng cho toàn bộ "Thời đại Agent".

Tài liệu tham khảo:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Bài viết này đến từ tài khoản chính thức WeChat “Tân Trí Nguyên”, tác giả: Khải Huyền của ASI

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.