NVIDIA đã tái khởi động dự án GPU tăng tốc tiền điền suy luận AI mang tên "Rubin CPX", dự kiến bắt đầu sản xuất vào quý đầu tiên năm 2027. Sản phẩm này được thiết kế dành cho các kịch bản tiền điền ngữ cảnh dài, trang bị bộ nhớ HBM4 dung lượng 168GB, hiệu năng xấp xỉ GPU Rubin tiêu chuẩn, với công suất tiêu thụ lên tới 2300 watt trên mỗi card. Sản phẩm sử dụng thiết kế khung MGX ETL độc lập, hỗ trợ cấu hình triển khai linh hoạt từ 64 đến 256 GPU. Kiến trúc kết nối được thiết kế theo tầng, sử dụng NVLink trong cùng một khay và Ethernet giữa các khay, nhằm cân bằng giữa hiệu năng và chi phí. Rubin CPX sẽ hoạt động song song với GPU Rubin tiêu chuẩn theo tỷ lệ 1:1, trong đó CPX phụ trách tiền điền và tạo KV Cache, còn GPU Rubin đảm nhiệm giải mã, được tối ưu hóa đặc biệt cho các kịch bản suy luận ngữ cảnh dài.Tác giả bài viết, nguồn: Wall Street Journal
NVIDIA đã lặng lẽ khởi động lại một dự án chip từng bị thị trường cho là đã bị bỏ rơi, nhắm thẳng vào giai đoạn prefill có chi phí cao trong suy luận AI.
NVIDIA đã khởi động lại dự án GPU tăng tốc tiền điền suy luận AI “Rubin CPX” và thực hiện các điều chỉnh lớn trong thiết kế sản phẩm. Theo kế hoạch hiện tại, phiên bản mới của Rubin CPX dự kiến bắt đầu sản xuất vào quý đầu tiên năm 2027.
Việc khởi động lại dự án này gửi đi một tín hiệu rõ ràng: NVIDIA đang tăng cường giải quyết các điểm nghẽn về hiệu suất và chi phí trong giai đoạn tiền điền của suy luận AI. Khi độ dài ngữ cảnh của các mô hình lớn tiếp tục tăng, giai đoạn tiền điền cần xử lý một lượng lớn thông tin đầu vào và tạo KV Cache, hiệu suất của nó直接影响 chi phí tổng thể và tính kinh tế khi triển khai AI.
Guo Mingchi cho biết, hiện hơn 50% tải công việc suy luận AI đến từ xử lý ngữ cảnh đầu vào và xây dựng KV Cache.
Thông số chip được điều chỉnh đáng kể, công suất tính toán gần với Rubin tiêu chuẩn
Về hiệu năng và công suất tiêu thụ, phiên bản CPX mới đã gần bằng GPU Rubin tiêu chuẩn, với công suất tối đa mỗi card đạt 2300 watt. Về bộ nhớ, phiên bản CPX mới đã chuyển sang sử dụng 168GB HBM4, rõ ràng được nâng cấp so với 128GB GDDR7 của giải pháp trước đó, nhưng vẫn thấp hơn 288GB HBM4 của GPU Rubin tiêu chuẩn.
Theo Guo Mingji, tổng dung lượng HBM4 của khay tính toán 8-card CPX khoảng 1,34 TB, đủ để đáp ứng hầu hết các tải công việc tiền điền ngữ cảnh dài và nhu cầu KV Cache tương ứng. Điều này cho thấy Rubin CPX không chỉ đơn thuần theo đuổi sức mạnh tính toán tổng quát cao hơn, mà còn được thiết kế lại nhằm tối ưu dung lượng bộ nhớ đồ họa và hiệu suất tiền điền trong các kịch bản ngữ cảnh dài.
Chuyển từ chia sẻ khung máy sang triển khai độc lập, cấu hình linh hoạt hơn
Rack architecture is also a key focus of this adjustment.
Trong phương án trước, CPX dự định chia sẻ kệ với Rubin GPU; phiên bản mới thay vào đó sử dụng kệ MGX ETL độc lập, cho phép khách hàng mở rộng công suất tính toán của CPX riêng biệt theo nhu cầu thực tế.
Cụ thể, khách hàng có thể chọn quy mô triển khai với 64, 128, 192 hoặc 256 GPU CPX. Mỗi 64 GPU CPX tạo thành một mô-đun kệ, bao gồm 8 khay tính toán, mỗi khay lắp đặt 8 GPU CPX, đồng thời đi kèm một khay chuyển mạch.
Thiết kế mô-đun cho phép khách hàng linh hoạt tăng cường sức mạnh tính toán CPX theo nhu cầu thực tế về tải đã được nạp sẵn, thay vì phải mua theo khung Rubin quy mô lớn cố định.
Thiết kế kết nối phân tầng, giảm chi phí triển khai tiền điền
Trên kiến trúc kết nối, Rubin CPX sử dụng thiết kế phân tầng để cân bằng giữa hiệu suất và chi phí.
Trong một khay tính toán đơn lẻ, 8 GPU CPX được mở rộng Scale-up thông qua NVLink. Băng thông NVLink của mỗi GPU CPX là 1 đến 1,5 TB/s, thấp hơn so với 3,6 TB/s của GPU Rubin tiêu chuẩn.
Trong phạm vi scale-out giữa các khay và bên trong các mô-đun giá, CPX sử dụng liên kết L1 Ethernet đồng toàn bộ Spectrum-6; khi kết nối giữa các mô-đun giá, các công tắc Spectrum-6 của từng mô-đun sẽ kết nối thông qua liên kết quang OSFP.
So với các giải pháp phụ thuộc hoàn toàn vào kết nối GPU băng thông cao, kiến trúc phân tầng này nhấn mạnh hơn vào việc tối ưu chi phí cho các kịch bản tiền điền.
Hợp tác với Rubin GPU, nhắm vào suy luận ngữ cảnh dài
Rubin CPX không phải là GPU phổ thông hoạt động độc lập, mà được sử dụng kết hợp với Vera Rubin NVL72 như một bộ tăng tốc tiền điền.
Theo Guo Mingqi, NVIDIA khuyến nghị triển khai CPX và Rubin GPU theo tỷ lệ 1:1: CPX chịu trách nhiệm tính toán giai đoạn tiền điền và tạo KV Cache, sau đó truyền KV Cache đến Rubin GPU thông qua Ethernet RDMA để GPU này thực hiện giải mã tiếp theo.
Về mặt định vị sản phẩm, cốt lõi của Rubin CPX không phải là thay thế Rubin GPU tiêu chuẩn, mà là chia nhỏ quy trình suy luận AI để các GPU khác nhau đảm nhận nhiệm vụ tiền điền và giải mã.
Guo Mingji định vị đây là giải pháp tối ưu về chi phí cho việc tiền điền ngữ cảnh dài. Khi cửa sổ ngữ cảnh của các mô hình AI không ngừng mở rộng, khối lượng tính toán và quy mô KV Cache ở giai đoạn tiền điền liên tục tăng lên, việc NVIDIA tái khởi động dự án CPX lần này có thể nhằm mục đích giảm thêm chi phí suy luận ngữ cảnh dài thông qua phần cứng chuyên dụng và cách triển khai hỗn hợp.
