NVIDIA khởi động lại dự án bộ tăng tốc prefill Rubin CPX AI inference để ra mắt năm 2027

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
NVIDIA đã công bố một dự án, khởi động lại bộ tăng tốc tiền điền (prefill) Rubin CPX cho AI với kế hoạch ra mắt năm 2027. Được phát triển từ MetaEra, Rubin CPX được thiết kế riêng cho các giai đoạn tiền điền ngữ cảnh dài, tích hợp 168GB HBM4, hiệu năng gần với Rubin và công suất tiêu thụ 2300W. Sản phẩm sẽ được giao hàng vào quý 1 năm 2027 với thiết kế khay mô-đun MGX ETL, hỗ trợ từ 64 đến 256 GPU. Hệ thống sử dụng NVLink trong cùng khay và Ethernet giữa các khay, cân bằng giữa chi phí và tốc độ. Rubin CPX sẽ kết hợp 1:1 với các GPU Rubin tiêu chuẩn, xử lý tiền điền và KV Cache trong khi các GPU còn lại đảm nhiệm quá trình giải mã. Cập nhật này thuộc nhóm tin tức AI + crypto, thể hiện sự tập trung của NVIDIA vào cơ sở hạ tầng AI chuyên dụng.
NVIDIA đã tái khởi động dự án GPU tăng tốc tiền điền suy luận AI mang tên "Rubin CPX", dự kiến bắt đầu sản xuất vào quý đầu tiên năm 2027. Sản phẩm này được thiết kế dành cho các kịch bản tiền điền ngữ cảnh dài, trang bị bộ nhớ HBM4 dung lượng 168GB, hiệu năng xấp xỉ GPU Rubin tiêu chuẩn, với công suất tiêu thụ lên tới 2300 watt trên mỗi card. Sản phẩm sử dụng thiết kế khung MGX ETL độc lập, hỗ trợ cấu hình triển khai linh hoạt từ 64 đến 256 GPU. Kiến trúc kết nối được thiết kế theo tầng, sử dụng NVLink trong cùng một khay và Ethernet giữa các khay, nhằm cân bằng giữa hiệu năng và chi phí. Rubin CPX sẽ hoạt động song song với GPU Rubin tiêu chuẩn theo tỷ lệ 1:1, trong đó CPX phụ trách tiền điền và tạo KV Cache, còn GPU Rubin đảm nhiệm giải mã, được tối ưu hóa đặc biệt cho các kịch bản suy luận ngữ cảnh dài.

Tác giả bài viết, nguồn: Wall Street Journal

NVIDIA đã lặng lẽ khởi động lại một dự án chip từng bị thị trường cho là đã bị bỏ rơi, nhắm thẳng vào giai đoạn prefill có chi phí cao trong suy luận AI.

NVIDIA đã khởi động lại dự án GPU tăng tốc tiền điền suy luận AI “Rubin CPX” và thực hiện các điều chỉnh lớn trong thiết kế sản phẩm. Theo kế hoạch hiện tại, phiên bản mới của Rubin CPX dự kiến bắt đầu sản xuất vào quý đầu tiên năm 2027.

Việc khởi động lại dự án này gửi đi một tín hiệu rõ ràng: NVIDIA đang tăng cường giải quyết các điểm nghẽn về hiệu suất và chi phí trong giai đoạn tiền điền của suy luận AI. Khi độ dài ngữ cảnh của các mô hình lớn tiếp tục tăng, giai đoạn tiền điền cần xử lý một lượng lớn thông tin đầu vào và tạo KV Cache, hiệu suất của nó直接影响 chi phí tổng thể và tính kinh tế khi triển khai AI.

Guo Mingchi cho biết, hiện hơn 50% tải công việc suy luận AI đến từ xử lý ngữ cảnh đầu vào và xây dựng KV Cache.

Thông số chip được điều chỉnh đáng kể, công suất tính toán gần với Rubin tiêu chuẩn

Về hiệu năng và công suất tiêu thụ, phiên bản CPX mới đã gần bằng GPU Rubin tiêu chuẩn, với công suất tối đa mỗi card đạt 2300 watt. Về bộ nhớ, phiên bản CPX mới đã chuyển sang sử dụng 168GB HBM4, rõ ràng được nâng cấp so với 128GB GDDR7 của giải pháp trước đó, nhưng vẫn thấp hơn 288GB HBM4 của GPU Rubin tiêu chuẩn.

Theo Guo Mingji, tổng dung lượng HBM4 của khay tính toán 8-card CPX khoảng 1,34 TB, đủ để đáp ứng hầu hết các tải công việc tiền điền ngữ cảnh dài và nhu cầu KV Cache tương ứng. Điều này cho thấy Rubin CPX không chỉ đơn thuần theo đuổi sức mạnh tính toán tổng quát cao hơn, mà còn được thiết kế lại nhằm tối ưu dung lượng bộ nhớ đồ họa và hiệu suất tiền điền trong các kịch bản ngữ cảnh dài.

Chuyển từ chia sẻ khung máy sang triển khai độc lập, cấu hình linh hoạt hơn

Rack architecture is also a key focus of this adjustment.

Trong phương án trước, CPX dự định chia sẻ kệ với Rubin GPU; phiên bản mới thay vào đó sử dụng kệ MGX ETL độc lập, cho phép khách hàng mở rộng công suất tính toán của CPX riêng biệt theo nhu cầu thực tế.

Cụ thể, khách hàng có thể chọn quy mô triển khai với 64, 128, 192 hoặc 256 GPU CPX. Mỗi 64 GPU CPX tạo thành một mô-đun kệ, bao gồm 8 khay tính toán, mỗi khay lắp đặt 8 GPU CPX, đồng thời đi kèm một khay chuyển mạch.

Thiết kế mô-đun cho phép khách hàng linh hoạt tăng cường sức mạnh tính toán CPX theo nhu cầu thực tế về tải đã được nạp sẵn, thay vì phải mua theo khung Rubin quy mô lớn cố định.

Thiết kế kết nối phân tầng, giảm chi phí triển khai tiền điền

Trên kiến trúc kết nối, Rubin CPX sử dụng thiết kế phân tầng để cân bằng giữa hiệu suất và chi phí.

Trong một khay tính toán đơn lẻ, 8 GPU CPX được mở rộng Scale-up thông qua NVLink. Băng thông NVLink của mỗi GPU CPX là 1 đến 1,5 TB/s, thấp hơn so với 3,6 TB/s của GPU Rubin tiêu chuẩn.

Trong phạm vi scale-out giữa các khay và bên trong các mô-đun giá, CPX sử dụng liên kết L1 Ethernet đồng toàn bộ Spectrum-6; khi kết nối giữa các mô-đun giá, các công tắc Spectrum-6 của từng mô-đun sẽ kết nối thông qua liên kết quang OSFP.

So với các giải pháp phụ thuộc hoàn toàn vào kết nối GPU băng thông cao, kiến trúc phân tầng này nhấn mạnh hơn vào việc tối ưu chi phí cho các kịch bản tiền điền.

Hợp tác với Rubin GPU, nhắm vào suy luận ngữ cảnh dài

Rubin CPX không phải là GPU phổ thông hoạt động độc lập, mà được sử dụng kết hợp với Vera Rubin NVL72 như một bộ tăng tốc tiền điền.

Theo Guo Mingqi, NVIDIA khuyến nghị triển khai CPX và Rubin GPU theo tỷ lệ 1:1: CPX chịu trách nhiệm tính toán giai đoạn tiền điền và tạo KV Cache, sau đó truyền KV Cache đến Rubin GPU thông qua Ethernet RDMA để GPU này thực hiện giải mã tiếp theo.

Về mặt định vị sản phẩm, cốt lõi của Rubin CPX không phải là thay thế Rubin GPU tiêu chuẩn, mà là chia nhỏ quy trình suy luận AI để các GPU khác nhau đảm nhận nhiệm vụ tiền điền và giải mã.

Guo Mingji định vị đây là giải pháp tối ưu về chi phí cho việc tiền điền ngữ cảnh dài. Khi cửa sổ ngữ cảnh của các mô hình AI không ngừng mở rộng, khối lượng tính toán và quy mô KV Cache ở giai đoạn tiền điền liên tục tăng lên, việc NVIDIA tái khởi động dự án CPX lần này có thể nhằm mục đích giảm thêm chi phí suy luận ngữ cảnh dài thông qua phần cứng chuyên dụng và cách triển khai hỗn hợp.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.