GPT-6 Astra sử dụng hơn 100.000 GPU Blackwell, làm nổi bật khoảng cách cụm tiên tiến của Trung Quốc

iconMetaEra
Chia sẻ
AI summary iconTóm tắt
Tin tức AI + tiền mã hóa: GPT-6 Astra đã sử dụng hơn 100.000 GPU Blackwell để đào tạo, cho thấy một giai đoạn mới trong phát triển AI. Các công ty Trung Quốc như ByteDance và DeepSeek đang mở rộng việc sử dụng GPU nhưng vẫn tụt hậu trong việc triển khai Blackwell và hiệu quả cụm. Vấn đề chính của Trung Quốc không phải là số lượng GPU mà là xây dựng các hệ thống hiệu quả cao. Tin tức tiền mã hóa mới nhất cho thấy AI và hạ tầng vẫn là những lĩnh vực chiến lược chính.
GPT-6 Astra công khai tiết lộ đã sử dụng hơn 100.000 GPU Grace Blackwell để huấn luyện, điều này có nghĩa là cuộc cạnh tranh giữa các mô hình tiên tiến đã bước vào thời đại của các cụm siêu lớn.

Tác giả bài viết, nguồn: ME News



TL;DR:

  • GPT-6 Astra công khai tiết lộ đã sử dụng hơn 100.000 GPU Grace Blackwell để huấn luyện, điều này có nghĩa là cuộc cạnh tranh giữa các mô hình tiên tiến đã bước vào thời đại của các cụm siêu lớn.
  • Các công ty mô hình hàng đầu Trung Quốc không phải không có năng lực tính toán quy mô lớn, nhưng thông tin công khai cho thấy vẫn còn khoảng cách rõ rệt về thế hệ GPU tiên tiến và quy mô triển khai tập trung một lần.
  • Các công ty như ByteDance, Kimi và DeepSeek đang mở rộng bố trí năng lực tính toán, nhưng hiện nay chủ yếu tập trung vào kiến trúc Hopper hoặc giải pháp thay thế trong nước, vẫn còn khoảng cách so với cụm Blackwell.
  • Chìa khóa của cuộc cạnh tranh AI đã chuyển từ “có GPU hay không” sang “có thể tiếp cận được GPU thế hệ mới nhất và tổ chức hiệu quả hàng chục nghìn乃至 hàng trăm nghìn chip”.
  • Mặc dù Blackwell đã không còn là kiến trúc mới nhất của NVIDIA, xu hướng Rubin tiếp tục giảm chi phí huấn luyện cũng có nghĩa là khoảng cách dẫn đầu có thể tiếp tục tập trung vào năng lực cơ sở hạ tầng.

Đằng sau 100.000 chip Blackwell, cuộc cạnh tranh mô hình lớn đã bước vào thời đại hạ tầng tính toán

Khi Huang Renxun tiết lộ quy mô huấn luyện GPT-6 Astra, điều mà giới bên ngoài quan tâm không chỉ là con số “100.000 GPU” mà còn là mô hình cạnh tranh AI mới mà con số này đại diện.

Trong vài năm qua, cuộc cạnh tranh giữa các mô hình lớn thường được hiểu là cuộc cạnh tranh về thuật toán, dữ liệu và năng lực kỹ thuật. Sự đổi mới trong kiến trúc mô hình, tối ưu hóa phương pháp huấn luyện và nâng cao hiệu suất suy luận thực sự quyết định khả năng cuối cùng của các sản phẩm AI. Nhưng kể từ sau năm 2026, một xu hướng ngày càng rõ ràng đang hình thành: khi quy mô mô hình tiếp tục mở rộng, năng lực hạ tầng bản thân đã trở thành yếu tố quan trọng quyết định giới hạn công nghệ.

Theo thông tin công khai của Huang Renxun, việc huấn luyện GPT-6 Astra đã sử dụng hơn 100.000 GPU Grace Blackwell, được kết nối thành cụm tốc độ cao thông qua NVLink72. Ông cũng cho biết, lô GPU tiếp theo sẽ có 400.000 GPU được đưa vào hoạt động, nhưng chưa tiết lộ mô hình cụ thể và chủ sở hữu.

Dù chi tiết triển khai tiếp theo ra sao, tín hiệu được truyền tải từ thông tin này rất rõ ràng: việc huấn luyện các mô hình tiên tiến nhất đang chuyển từ cuộc cạnh tranh dựa trên hàng chục nghìn tỷ tham số và hàng nghìn GPU sang cuộc cạnh tranh giữa các cụm GPU tiên tiến quy mô hàng vạn đến hàng trăm nghìn chiếc.

Điều quan trọng ở đây không chỉ là số lượng.

Nếu chỉ so sánh số lượng GPU, các doanh nghiệp Trung Quốc không hoàn toàn thiếu nguồn lực tính toán quy mô lớn. Sự khác biệt thực sự nằm ở khả năng tiếp cận các GPU hiệu năng cao thế hệ mới nhất và khả năng khiến những GPU này phối hợp hiệu quả trong cùng một nhiệm vụ huấn luyện.

Đối với các mô hình lớn, hiệu năng đỉnh của một GPU đơn lẻ chỉ là nền tảng. Để huấn luyện một mô hình lớn, cần sự trao đổi liên tục các tham số và dữ liệu giữa hàng loạt GPU. Nếu hiệu quả kết nối không đủ, ngay cả khi có rất nhiều chip, cũng không thể tạo ra sức mạnh tính toán hiệu quả.

Do đó, cuộc cạnh tranh về cơ sở hạ tầng AI về bản chất đã được nâng cấp từ “mua bao nhiêu card” sang “xây dựng hệ thống tính toán như thế nào”.

Việc bố trí năng lực tính toán của các công ty mô hình hàng đầu Trung Quốc có khoảng cách thế hệ so với thời kỳ Blackwell

Các thông tin công khai hiện tại cho thấy quy mô tính toán của các công ty mô hình hàng đầu Trung Quốc đang tăng nhanh, nhưng vẫn còn khoảng cách rõ rệt so với cụm đào tạo cấp Blackwell đại diện bởi GPT-6 Astra.

ByteDance là một trong những công ty trong nước có bố trí năng lực tính toán gần với mức độ hàng đầu quốc tế. Năm nay, ByteDance đã kết nối khoảng 36.000 GPU B200 thông qua Malaysia. Những chip này thuộc kiến trúc Blackwell của NVIDIA, cùng thế hệ với GB200 mà Astra sử dụng.

Tuy nhiên, cần lưu ý rằng lô B200 này được triển khai ở nước ngoài. Khi công khai giới thiệu cơ sở hạ tầng AI trong lãnh thổ Trung Quốc, ByteDance chủ yếu vẫn sử dụng phiên bản đặc biệt dành cho Trung Quốc H20 dựa trên kiến trúc Hopper, cùng với các chip H800 đã được cấp phép trước đó.

Điều này thể hiện không phải là sự khác biệt đơn thuần về số lượng, mà là sự khác biệt về chuỗi cung ứng và môi trường triển khai.

Blackwell đã được nâng cấp so với Hopper về khả năng tính toán, bộ nhớ đồ họa và khả năng liên kết. Đặc biệt, GB200 không chỉ là một GPU đơn lẻ, mà còn tích hợp CPU Grace và GPU Blackwell, kết nối 72 GPU cùng một miền liên kết tốc độ cao thông qua hệ thống NVL72.

Đối với việc huấn luyện các mô hình lớn, tầm quan trọng của thiết kế cấp hệ thống ngày càng tăng lên. Vì khi quy mô mô hình càng lớn, tỷ lệ giao tiếp giữa các GPU càng cao, khả năng phối hợp hiệu quả giữa các chip sẽ直接影响 hiệu suất huấn luyện.

Mặt tối của Moonlight, nền tảng đứng sau Kimi, cũng bị tiết lộ đã nhận khoảng 20.000 GPU Hopper thông qua Alibaba. Bloomberg trích dẫn nguồn tin cho biết mẫu cụ thể là H200, nhưng Alibaba đã phủ nhận thông tin về mẫu H200.

Nếu tính theo H200, nó vẫn thuộc kiến trúc Hopper thế hệ trước, trong khi B200 đã bước vào thời kỳ Blackwell. Hai sản phẩm này không đơn thuần là mối quan hệ thay thế mới cũ, mà đại diện cho năng lực cơ sở hạ tầng AI ở các giai đoạn khác nhau.

Tình hình của DeepSeek đặc biệt hơn.

DeepSeek vào đầu năm 2025 đã thu hút sự chú ý toàn cầu nhờ các mô hình hiệu suất cao, đường lối kỹ thuật của họ chứng minh rằng tối ưu hóa thuật toán và hiệu quả kỹ thuật có thể giảm một phần nhu cầu về sức mạnh tính toán. Tuy nhiên, theo thông tin công khai, công ty chưa tiết lộ cấu hình phần cứng đào tạo đầy đủ của V4.

Bản ghi chép cuộc họp giao lưu với nhà đầu tư của Lương Văn Phong cho thấy, vào tháng Năm, công ty có khoảng 20.000 đơn vị năng lực tính toán tương đương H, trong đó phần lớn vừa mới về, và các lần mua sắm trong tương lai “cơ bản đều là NVIDIA”. Huawei cung cấp cho DeepSeek khoảng 16.000 đơn vị năng lực 950. Lương Văn Phong cho biết, số thẻ trong nước này tương đương khoảng 4.000 thẻ NVIDIA series B, chỉ đủ cho việc huấn luyện mô hình thế hệ hiện tại.

Những thông tin này phản ánh một thực tế: ngay cả khi các doanh nghiệp Trung Quốc đã sở hữu lượng tính toán AI đáng kể, họ vẫn còn khoảng cách về quy mô so với việc tập trung sử dụng 100.000 GPU thế hệ tiên tiến cùng loại trong một nhiệm vụ huấn luyện.

Điểm yếu thực sự của năng lực tính toán AI tại Trung Quốc không phải là thiếu chip, mà là thiếu khả năng cụm tiên tiến

Khi thảo luận về năng lực tính toán AI của Trung Quốc, dễ rơi vào hai cực đoan.

Một quan điểm cho rằng Trung Quốc hoàn toàn thiếu chip AI tiên tiến, do đó không thể tham gia cạnh tranh; một quan điểm khác cho rằng chỉ cần số lượng chip trong nước tăng lên, Trung Quốc có thể nhanh chóng bắt kịp NVIDIA.

Thực tế, tình huống phức tạp hơn.

Khả năng huấn luyện AI được quyết định bởi nhiều khâu, bao gồm hiệu năng chip, quy trình tiên tiến, dung lượng bộ nhớ video, kết nối tốc độ cao, thiết kế máy chủ, cung cấp điện cho trung tâm dữ liệu, hệ sinh thái phần mềm và khả năng điều phối quy mô lớn.

GPU chỉ là một phần cốt lõi nhất, nhưng không phải tất cả.

Lợi thế lâu dài của NVIDIA không chỉ đến từ phần cứng GPU, mà còn từ hệ sinh thái CUDA, công nghệ kết nối mạng, giải pháp máy chủ và hệ thống hoàn chỉnh được xây dựng cùng các nhà cung cấp điện toán đám mây.

Thời kỳ Blackwell, lợi thế của hệ thống này càng được khuếch đại thêm.

Khi một lần huấn luyện mô hình cần 100.000 GPU, vấn đề đã không còn đơn thuần là mua vài chục nghìn chip, mà là làm thế nào để xây dựng một nhà máy tính toán lớn có thể vận hành ổn định.

Đây cũng là lý do tại sao trong các tài liệu công khai, các công ty Trung Quốc chưa tiết lộ bất kỳ trường hợp nào sử dụng 100.000 GPU thế hệ tiên tiến cùng loại để huấn luyện một mô hình.

Các doanh nghiệp Trung Quốc đang nâng cao năng lực thông qua nhiều cách thức, bao gồm tăng cường triển khai năng lực tính toán ở nước ngoài, mở rộng quy mô tương thích chip trong nước, tối ưu kiến trúc mô hình và nâng cao hiệu quả huấn luyện. Những con đường này đều có giá trị, nhưng trong ngắn hạn rất khó thay thế hoàn toàn lợi thế nền tảng do các cụm GPU tiên tiến nhất mang lại.

Trong vài năm qua, ngành AI của Trung Quốc đã chứng minh một thực tế: sự đổi mới thuật toán có thể thu hẹp đáng kể một số khoảng cách.

Sự xuất hiện của các công ty như DeepSeek cho thấy các đội ngũ kỹ thuật xuất sắc có thể đạt được đột phá trong điều kiện năng lực tính toán hạn chế thông qua tối ưu hóa kiến trúc mô hình, điều chỉnh chiến lược huấn luyện và nâng cao hiệu quả sử dụng tài nguyên.

Nhưng một thực tế khác cũng tồn tại: khi cạnh tranh toàn cầu bước vào giai đoạn mô hình nền tảng thế hệ tiếp theo, tầm quan trọng của quy mô tính toán vẫn sẽ tiếp tục tăng lên.

Tối ưu hóa hiệu suất có thể giảm chi phí, nhưng rất khó để hoàn toàn thay đổi ranh giới năng lực do phần cứng tiên tiến và cụm siêu lớn mang lại.

Sau Blackwell, thời kỳ Rubin có thể làm gia tăng thêm khoảng cách cơ sở hạ tầng

Điều đáng quan tâm hơn là Blackwell không phải là điểm kết thúc của con đường công nghệ hiện tại của NVIDIA.

Kiến trúc Vera Rubin thế hệ tiếp theo của NVIDIA đã bước vào giai đoạn sản xuất hàng loạt. Theo ước tính công khai của NVIDIA, số lượng GPU cần thiết để huấn luyện các mô hình MoE lớn với Rubin có thể giảm xuống khoảng một phần tư so với Blackwell.

Điều này có nghĩa là cuộc cạnh tranh về AI trong tương lai có thể xuất hiện một chu kỳ mới.

Các doanh nghiệp hàng đầu sở hữu kiến trúc mới nhất, nhờ đó có thể thực hiện đào tạo quy mô lớn hơn với ít chip hơn; chi phí đào tạo thấp hơn lại thúc đẩy doanh nghiệp thực hiện nhiều thí nghiệm hơn, từ đó nâng cao thêm khả năng của mô hình.

Các doanh nghiệp tụt hậu nếu chỉ có thể tiếp cận phần cứng thế hệ trước sẽ đối mặt với hai vấn đề: hiệu suất huấn luyện thấp và khó tham gia vào cuộc cạnh tranh với các mô hình quy mô lớn nhất.

Tất nhiên, điều này không có nghĩa là các doanh nghiệp AI của Trung Quốc không có cơ hội.

Lịch sử AI đã nhiều lần chứng minh rằng cạnh tranh công nghệ không hoàn toàn do phần cứng đơn lẻ quyết định. Sự đổi mới mô hình, ứng dụng thực tế, khả năng thương mại hóa và hiệu quả kỹ thuật đều có thể tạo ra những đột phá mới.

Tuy nhiên, nếu quan sát từ góc độ cơ sở hạ tầng, sự kiện GPT-6 Astra sử dụng 100.000 GPU Blackwell thực sự tiết lộ một sự thay đổi đang diễn ra: sân chơi cốt lõi của cuộc cạnh tranh AI toàn cầu đang tiếp tục dịch chuyển từ cấp độ mô hình sang cấp độ cơ sở hạ tầng tính toán.

Trong những năm tới, điều quyết định năng lực cạnh tranh của các công ty AI không chỉ là khả năng huấn luyện một mô hình xuất sắc, mà còn là khả năng xây dựng năng lực huấn luyện liên tục các mô hình thế hệ tiếp theo.

Đối với ngành công nghiệp AI của Trung Quốc, điều thực sự cần theo kịp không phải là một mô hình hay một lần ra mắt cụ thể, mà là toàn bộ năng lực hệ thống từ việc tiếp cận chip, xây dựng trung tâm dữ liệu, điều phối cụm đến hệ sinh thái phần mềm.

Ý nghĩa của 100.000 chiếc Blackwell không nằm ở việc tạo ra một con số ấn tượng, mà ở việc nhắc nhở thị trường: trí tuệ nhân tạo đang bước vào giai đoạn công nghiệp hóa, và cuộc cạnh tranh công nghiệp cuối cùng sẽ được quyết định bởi hạ tầng.

Nguồn tham khảo:

  1. Official NVIDIA materials on Blackwell, GB200 NVL72, Vera Rubin architecture, and AI infrastructure.
  2. Thông tin bài phát biểu công khai và phỏng vấn truyền thông của Huang Renxun.
  3. Bloomberg về tin tức mua sắm năng lực tính toán của Kimi và liên quan đến H200.
  4. Thông tin về cơ sở hạ tầng AI và việc triển khai năng lực tính toán ở nước ngoài của ByteDance đã được công khai.
  5. Tài liệu ghi âm liên quan đến thông tin công khai của DeepSeek và buổi giao lưu với nhà đầu tư của Lương Văn Phong.
  6. Thông tin công khai về hợp tác cơ sở hạ tầng AI và năng lực tính toán mô hình lớn của Alibaba Cloud.
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.