CUDA lại bị phá vỡ thêm lần nữa...
Lần này, người hành động vẫn là AI do NVIDIA tự tay nuôi dưỡng.
Một công ty nhỏ mới thành lập được một năm, sử dụng AI programming agent, chỉ tốn 10 giờ để xây dựng một phần mềm “tương tự CUDA”.

Dừng lại, dừng lại, dừng lại.
Bạn đang nói rằng đế chế phần mềm mà NVIDIA xây dựng trong gần 20 năm đã bị sao chép chỉ như vậy sao??

Không chỉ vậy. DeepSeek Cũng đang cố gắng viết ít mã CUDA cấp thấp hơn.
Họ đã mở nguồn một thư viện kernel GPU có tên TileKernels, được viết bằng TileLang, giúp tiết kiệm đáng kể công việc viết tay mã CUDA cấp thấp.
Tuy nhiên, chúng ta cũng đã nghe về những “khủng hoảng CUDA” tương tự không phải lần đầu tiên.
Định kỳ, CUDA lại bị mang ra chỉ trích, cứ nói là đã bị thay thế, bị xuyên thủng, hàng rào bảo vệ lại bị lật đổ…
Is that really true?
10 giờ “tái tạo” CUDA
Khi nhắc đến NVIDIA, nhiều người nghĩ ngay đến GPU.
H100, Blackwell, Rubin, nhờ vào từng thế hệ chip mạnh mẽ hơn, NVIDIA đã hưởng lợi nhiều nhất từ làn sóng AI lần này.
Nhưng lợi thế thực sự khó bị lung lay của NVIDIA thực ra không phải là phần cứng, mà là phần mềm.
Chip có thể mua, thông số có thể theo kịp, quy trình sản xuất cũng sẽ được cải tiến. Điều thực sự khiến khách hàng sau khi sử dụng NVIDIA khó có thể chuyển sang hãng khác chính là toàn bộ hệ sinh thái phần mềm xung quanh GPU.
Và CUDA chính là trung tâm của đế chế phần mềm này.
CUDA là viết tắt của Compute Unified Device Architecture, được đội ngũ do Ian Buck, một quản lý cấp cao của NVIDIA, dẫn dắt, mất gần 20 năm để phát triển.
Nó thường được gọi là ngôn ngữ lập trình, nhưng chính xác hơn, CUDA là một toàn bộ nền tảng phần mềm được xây dựng xung quanh GPU của NVIDIA.
Nếu chia đơn giản thành ba lớp, lớp dưới cùng là lớp lõi, bao gồm Kernel, trình biên dịch và thời gian chạy, những thành phần trực tiếp điều khiển chip.
Ở giữa là các thư viện tính toán được tối ưu hóa cao như cuBLAS, cuDNN, cùng các công cụ gỡ lỗi, xác thực và phân tích hiệu suất.
Ở trên cùng là các framework phát triển như PyTorch và TensorFlow, lượng lớn mã nguồn và quy trình làm việc do doanh nghiệp tích lũy, cùng hệ sinh thái nhà phát triển phát triển xung quanh CUDA.

△
Có thể nghe hơi trừu tượng, nhưng bạn có thể tưởng tượng GPU của NVIDIA như một nhà máy.
CUDA ở cấp độ thấp nhất chịu trách nhiệm hướng dẫn máy móc từng bước thực hiện công việc, cấp trung gian cung cấp các công cụ sản xuất sẵn có, còn cấp cao nhất là một hệ thống sản xuất đã hoạt động nhiều năm.
Vì vậy, đối với khách hàng, những gì họ mua không chỉ là một card của NVIDIA, mà là một nhà máy sẵn sàng sử dụng ngay khi mở hộp.
Bây giờ, một anh chàng tên Jeremy Nixon đã mang AI Agent đến.

Nixon là người sáng lập công ty khởi nghiệp phần mềm AI Infinity, trước đây từng là nghiên cứu viên tại Google Brain.
Đội ngũ của anh ấy đã phát triển một tác nhân nghiên cứu AI có tên Ignition, chuyên viết phần mềm cấp thấp cho các chip AI khác nhau.
Nó có thể tạo GPU Kernel, chạy kiểm thử, tìm lỗi, đo hiệu suất, sau đó tự động viết lại mã dựa trên kết quả.
Các kỹ sư con người chịu trách nhiệm đưa ra định hướng cấp cao, còn những công việc rắc rối và tốn não còn lại sẽ được giao cho Agent lặp lại liên tục.
Và vậy là Infinity đã xây dựng một phần mềm tương tự CUDA cho công ty khởi nghiệp chip AI d-Matrix bằng Ignition.
Chỉ mất 10 giờ.
À??
Những mã cấp thấp trước đây cần kỹ sư phần mềm chip điều chỉnh lặp đi lặp lại, giờ thật sự có thể giao cho AI không?

Thật sự không thể nói hoàn toàn là thổi phồng.
AI Agent thực sự rất phù hợp với các nhiệm vụ lập trình có phản hồi rõ ràng.
Liệu mã có thể biên dịch được không, kết quả có tính toán chính xác không, hiệu suất có được cải thiện không, đều có thể tìm được câu trả lời thông qua việc chạy thực tế.
Do đó, Agent có thể tạo thành một vòng lặp hoàn chỉnh:
Viết mã → Biên dịch → Chạy → Kiểm tra tính đúng đắn và hiệu suất → Điều chỉnh dựa trên phản hồi
Tuy nhiên, Infinity chủ yếu tập trung vào lớp đầu tiên của CUDA: tạo và tối ưu hóa Kernel suy luận cho các chip khác nhau, đồng thời xây dựng năng lực phần mềm nền tảng xung quanh các Kernel này.
Nó đang phát triển một thư viện suy luận phổ quát dành cho nhiều loại chip, nhưng điều này không có nghĩa là nó đã sao chép đầy đủ hệ sinh thái mà CUDA đã tích lũy trong gần 20 năm chỉ trong 10 giờ.
Nhưng…
Nhưng!
Bạn thực sự không cần sao chép một CUDA để huy động được 15 triệu USD.

The company's current valuation has also reached $100 million.
Không biết có đe dọa đến NVIDIA không, nhưng vốn đầu tư rõ ràng rất ủng hộ. (doge)
Ở phía suy luận, chiến trường thứ hai đã khởi động!
Nếu AI Agent là vũ khí tấn công thành, thì thị trường suy luận chính là lỗ hổng trên bức tường thành.
Tính toán của mô hình lớn chủ yếu được chia thành hai giai đoạn:
Huấn luyện là tạo mô hình, cần hàng vạn card phối hợp chạy trong vài tháng; suy luận là sử dụng mô hình đã huấn luyện để trả lời câu hỏi, chỉ cần cụm nhỏ hoặc thậm chí một card là đủ.
Ở phía đào tạo, CUDA hiện vẫn gần như không thể giải quyết.
Việc huấn luyện quy mô lớn cực kỳ nhạy cảm với hiệu suất, độ ổn định và sự phối hợp giữa các cụm. Việc giao tiếp giữa các chip, lập lịch bộ nhớ GPU, và cách phục hồi sau lỗi, bất kỳ sự hao hụt hiệu suất nào khi được nhân lên trên hàng ngàn乃至 hàng vạn chip đều sẽ trở thành thời gian và chi phí thực tế.
Do đó, các doanh nghiệp thường rất bảo thủ khi chọn nền tảng đào tạo.
Ngay cả khi các chip khác có thông số kỹ thuật trên giấy tờ tốt, nếu phần mềm chưa đủ chín muồi và cụm máy chưa đủ ổn định, chi phí phần cứng tiết kiệm được rất có thể sẽ được bù đắp gấp đôi thông qua chi phí phát triển và thử nghiệm.
Nhưng ở phía suy luận, luật chơi đã thay đổi.
Marshall Choy, Giám đốc Kinh doanh của công ty chip AI Hàn Quốc Rebellions, cho rằng:
Ở phía suy luận, CUDA không còn là yếu tố quyết định. Đây sẽ là cuộc cạnh tranh giữa các phần mềm mã nguồn mở.

Tại sao đối thủ đều nhắm đến suy luận?
Vì đào tạo quan tâm đến "hiệu suất tối ưu", trong khi suy luận quan tâm đến "chi phí cho mỗi câu trả lời".
Đào tạo cần hàng vạn chip phối hợp, trong khi suy luận có thể chia nhỏ thành cụm nhỏ hoặc thậm chí chỉ một chip; không dám thay đổi chip khi đào tạo, nhưng có thể làm vậy khi suy luận.
Ultimately, as long as it’s fast and affordable, customers are willing to give it a try.
Quan trọng hơn, phần mềm suy luận có thể chạy trên nhiều loại chip khác nhau. Nếu khung suy luận hỗ trợ nhiều loại chip, người dùng có thể chuyển đổi giữa các phần cứng khác nhau mà không cần viết lại mã—
The biggest lock-in effect of CUDA has now been nullified.
Điều này tạo ra cơ hội cho các chip suy luận chuyên dụng.
Không phải mọi nhiệm vụ suy luận đều cần đầy đủ khả năng của CUDA từ đào tạo đến hợp tác cụm. Những chip được thiết kế lại dành riêng cho mô hình cụ thể và bối cảnh cụ thể, chỉ cần chạy nhanh hơn, rẻ hơn hoặc tiết kiệm điện hơn, đều có cơ hội giành lấy một phần thị trường từ NVIDIA.
Ví dụ như d-Matrix, bản thân là một công ty chip chuyên về suy luận.

Công ty được thành lập vào năm 2019, chuyên về chip suy luận AI sinh tạo.
Đồng sáng lập kiêm CEO Sid Sheth từng nhớ lại rằng họ đã nhận định từ rất sớm rằng cơ hội mang lại từ AI inference cuối cùng sẽ vượt qua việc huấn luyện.
Infinity sử dụng AI Agent để xây dựng phần mềm tương tự CUDA trong 10 giờ, phục vụ chính xác cho chip suy luận của d-Matrix.
Vì vậy, câu chuyện đầy đủ về "sự kiện 10 giờ" đã được nối lại:
Một con chip mới muốn gia nhập thị trường suy luận nhưng thiếu phần mềm trưởng thành; AI Agent tạo và tối ưu hóa Kernel nền tảng nhanh chóng, rút ngắn công việc điều chỉnh vốn có thể mất hàng tháng乃至 hàng năm xuống còn vài giờ hoặc vài ngày.
Sid còn nói rõ rằng:
Mặc dù NVIDIA vẫn duy trì vị thế thống trị trong lĩnh vực đào tạo, nhưng lợi thế cạnh tranh trong lĩnh vực suy luận đã bị thu hẹp.

Không chỉ có d-Matrix để ý đến khoảng trống này.
Rebellions, d-Matrix chuyên về suy luận; Cerebras đầu tư vào chip cấp wafer; Inferentia của Amazon, TPU của Google, MI300X của AMD...
Các nhà sản xuất chip và các đế chế điện toán đám mây đều đã bố trí lực lượng trên thị trường suy luận, sẵn sàng giành lấy một phần thị phần từ tay NVIDIA.
Đối với những công ty này, họ không cần thay thế ngay lập tức NVIDIA.
Họ chỉ cần chứng minh rằng, trong một số nhiệm vụ suy luận, có thể chạy nhanh hơn hoặc rẻ hơn mà không cần phụ thuộc vào toàn bộ phần cứng và hệ sinh thái CUDA của NVIDIA.
That's enough.
Liệu hàng rào bảo vệ của NVIDIA có bị phá vỡ hay không
Câu trả lời có thể là… còn xa mới tới.
Trước đây cũng đã nói, 10 giờ để viết lại là “mã tương thích cho một con chip”, trong khi hệ sinh thái CUDA còn có 20 năm tích lũy về thư viện, công cụ gỡ lỗi, cộng đồng và hàng triệu nhà phát triển.
Đây không phải là điều có thể dễ dàng bị lật đổ.
Quan trọng hơn, mã có thể được tạo ra không có nghĩa là có thể sử dụng được.
Bing Xu, người sáng lập INT21, trước đây là giám đốc của công ty phần mềm chip AI HippoML, đã được NVIDIA mua lại, và anh ấy mới rời NVIDIA vào tháng 4 năm nay.

Phán đoán của anh ấy là: Agent có thể tạo ra lượng lớn mã trong thời gian ngắn, nhưng việc xác minh mới là điểm nghẽn lớn nhất.
AI tạo ra mười nghìn dòng mã rất nhanh, nhưng “chứng minh rằng mười nghìn dòng đó tính toán chính xác và chạy ổn định trong mọi trường hợp biên” lại cực kỳ chậm.
Tài sản sâu nhất của CUDA chính là chuỗi công cụ xác thực của nó—vì vậy, anh ấy cho rằng, trong thời đại Agent, hệ sinh thái xác thực sẽ trở thành bức tường phòng thủ tiếp theo của CUDA.
Chris Lattner, đồng sáng lập và CEO của Modular, cũng đã dội một gáo nước lạnh.

Anh ấy cho rằng những cải tiến mang lại bởi agent mã hóa là từng bước, và "sự thổi phồng bị thổi quá mức".
Có ba lý do: Thứ nhất, viết mã chỉ là một phần nhỏ của kỹ thuật phần mềm, tối ưu hóa cho môi trường sản xuất mới quyết định hiệu suất chip và trực tiếp ảnh hưởng đến chi phí chạy AI;
Thứ hai, phần mềm chip là lĩnh vực chuyên sâu và nhỏ, mã nguồn công khai ít hơn nhiều so với phát triển ứng dụng, do đó dữ liệu huấn luyện mà AI có thể học được trong lĩnh vực này vốn đã ít;
Thứ ba, chi phí di chuyển hàng triệu dòng mã hiện có vẫn còn đó, đây không phải là vấn đề kỹ thuật có thể giải quyết, mà thuộc về quyết định tổ chức.
Một điểm dễ bị bỏ qua là: NVIDIA cũng đang tự sử dụng AI.
Ankit Patel, Phó Chủ tịch Hệ sinh thái Nhà phát triển NVIDIA, cho biết:
Chúng tôi cũng đang sử dụng AI Agent để phát triển CUDA nhanh hơn và xác minh ở quy mô lớn hơn.
Dùng chính ngọn giáo của mình để tấn công lá chắn của đối phương, lợi thế tương đối của bên tấn công cũng sẽ bị giảm đi.
Bing Xu tóm lại: Kết quả của cuộc chiến này phụ thuộc vào việc đối thủ có thể đuổi kịp NVIDIA nhanh hơn tốc độ tự cải tiến của NVIDIA hay không.
But it's clear that the world's largest chip manufacturer "has not been sleeping or standing still."
Nhìn chung, trong ngắn hạn, hàng rào bảo vệ của NVIDIA vẫn an toàn, nhưng những thay đổi sẽ bắt đầu lặng lẽ xảy ra ở phía suy luận.
Sự nghi hoặc thực sự về lâu dài là: hào phòng đang chuyển từ “tồn kho mã nguồn” sang “hệ sinh thái xác thực và tối ưu hóa”.
Người nào chiếm được vị trí mới trước, người đó mới là người chiến thắng tiếp theo.
Liên kết tham khảo: [1] https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Bài viết này đến từ tài khoản công chúng WeChat “Quantum Bit”, tác giả: Ting Yu
