Đây là một bí mật không mấy đẹp đẽ về cơ sở hạ tầng AI: một số thiết bị phần cứng đắt nhất hành tinh dành một khoảng thời gian đáng ngạc nhiên để hoàn toàn không làm gì cả. Các GPU, những cỗ máy chủ lực trong đào tạo và suy luận AI hiện đại, thường nằm im khi chờ dữ liệu được truyền từ các hệ thống lưu trữ. DDN và Nvidia hiện đang hợp tác để giải quyết vấn đề này bằng cách cho phép GPU tự khởi tạo việc truy cập dữ liệu, loại bỏ trung gian.
Sự hợp tác tập trung vào nền tảng trí tuệ dữ liệu Infinia của DDN, tích hợp với sáng kiến Storage-Next của Nvidia để cho phép các thao tác dữ liệu được khởi tạo bởi GPU. Về mặt tiếng Anh: thay vì các GPU phải kiên nhẫn chờ CPU truy xuất và truyền dữ liệu, giờ đây các GPU có thể tự chủ động kết nối và lấy dữ liệu mà chúng cần.
Công nghệ thực sự làm gì
Kết quả là độ trễ giảm, tải CPU được tối thiểu hóa và hiệu suất sử dụng GPU được cải thiện đáng kể. Đối với các tổ chức vận hành các nhà máy AI quy mô lớn, nơi hàng ngàn GPU hoạt động đồng thời, ngay cả những cải thiện nhỏ trong hiệu suất sử dụng cũng mang lại tiết kiệm chi phí đáng kể.
CTO của DDN, Sven Oehme, đã khung sự hợp tác dưới góc độ kinh tế, chỉ ra những cải tiến trong “kinh tế của AI ở quy mô lớn.” Jason Hardy, Phó chủ tịch Công nghệ Lưu trữ của Nvidia, nhấn mạnh sự tích hợp liền mạch giữa cơ sở hạ tầng tính toán và dữ liệu là lợi thế chính.
Công nghệ này phù hợp với chiến lược nền tảng rộng hơn năm 2026 của Nvidia, bao gồm nền tảng Nvidia Rubin và các DPUs BlueField-4.
Một đối tác đã được xây dựng trong suốt một thập kỷ
DDN và Nvidia đã hợp tác kể từ năm 2016, khi DDN trở thành nhà cung cấp lưu trữ đầu tiên chứng nhận nền tảng của mình với công nghệ GPUDirect Storage của Nvidia.
GPUDirect Storage cho phép dữ liệu di chuyển trực tiếp giữa bộ nhớ lưu trữ và bộ nhớ GPU mà không cần đi qua bộ nhớ hệ thống trước. Sự hợp tác mới với Infinia đẩy khái niệm này xa hơn bằng cách cho phép GPU chủ động khởi tạo các chuyển đổi dữ liệu thay vì chỉ tiếp nhận một cách thụ động.
DDN dự kiến trình diễn những khả năng này tại Flash Memory Summit, nơi công ty dự kiến chia sẻ các chỉ số hiệu suất và chi tiết về khả năng vận hành.
Tại sao điều này lại quan trọng đối với thị trường cơ sở hạ tầng AI
Khi các mô hình trở nên lớn hơn và bộ dữ liệu huấn luyện mở rộng, khoảng cách giữa khả năng tính toán và việc cung cấp dữ liệu ngày càng gia tăng. Các đợt huấn luyện AI lớn có thể liên quan đến hàng petabyte dữ liệu được phân tán trên các hệ thống lưu trữ phân tán. Mỗi microgiây độ trễ trong truy cập dữ liệu sẽ được nhân lên qua hàng nghìn GPU và hàng triệu lần lặp huấn luyện.
Thay vì chỉ đơn giản làm cho việc lưu trữ nhanh hơn, DDN và Nvidia đang suy nghĩ lại toàn bộ cách dữ liệu chảy qua hệ thống. Việc trao quyền trực tiếp cho GPU trong các thao tác dữ liệu đại diện cho một sự thay đổi căn bản trong cách hoạt động của cơ sở hạ tầng AI.
