Nvidia đang phân phối các mô hình AI như những mẫu dùng thử miễn phí tại Costco. Logic cũng tương tự: một khi bạn đã thử sản phẩm, bạn sẽ quay lại mua phần cứng chạy nó tốt nhất.
Phiên bản mới nhất của công ty, Nemotron 3.5 Lightning, là mô hình có 30 tỷ tham số được ra mắt vào ngày 11 tháng 8 năm 2026. Nó sử dụng kiến trúc Mixture of Experts (MoE) với khoảng 3 tỷ tham số hoạt động, cho phép chạy trên một GPU duy nhất trong khi hỗ trợ cửa sổ ngữ cảnh lên đến 1 triệu token. Đó là một lượng khả năng đáng kể cho một mô hình bạn có thể tải về từ Hugging Face mà không phải trả một xu nào.
Chiến lược lưỡi dao và lưỡi dao, được tăng cường
Nvidia hiện cung cấp dịch vụ suy luận được lưu trữ miễn phí cho hơn 100 mô hình AI thông qua các API của build.nvidia.com. Các nhà phát triển có thể truy cập các mô hình này mà không cần dùng đến thẻ tín dụng, kiểm thử chúng với các tác vụ của riêng mình và xây dựng các ứng dụng dựa trên chúng.
Đầu năm 2026, Nvidia đã ra mắt Nemotron 3 Ultra, một mô hình khổng lồ với 550 tỷ tham số, cùng với Dynamo 1.0, phần mềm được cho là tăng hiệu suất GPU lên tới 7 lần.
Tại sao các mô hình mở lại quan trọng đối với ngành GPU
Ngành công nghiệp AI chủ yếu chia thành hai phe. Một bên là các công ty như OpenAI và Anthropic xây dựng các mô hình đóng, sở hữu độc quyền sau các tường lửa trả phí API. Bên kia là Meta với loạt mô hình Llama và hiện nay là Nvidia đang thúc đẩy các lựa chọn trọng số mở mà bất kỳ ai cũng có thể tải về, chỉnh sửa và triển khai.
Các mô hình được phát hành dưới các giấy phép cho phép, bao gồm toàn bộ các họ như Nemotron và Cosmos. Chúng được tối ưu hóa cho các định dạng phần cứng đặc thù của Nvidia như NVFP4, một định dạng lượng tử hóa được thiết kế dành cho chip Nvidia.
Vào tháng 8 năm 2026, Nvidia cũng ra mắt NeMo Switchyard, một công cụ định tuyến thông minh các tác vụ qua các mô hình khác nhau để giảm chi phí suy luận.
