ByteDance được cho là đang chuẩn bị tiền huấn luyện một mô hình AI với khoảng 10 nghìn tỷ tham số, quy mô lớn hơn mọi hệ thống AI Trung Quốc hiện có và đưa công ty vào cạnh tranh trực tiếp với các phòng thí nghiệm phương Tây tiên tiến nhất. Nỗ lực này sẽ yêu cầu khoảng 30.000 GPU và ước tính từ 3 đến 6 tháng huấn luyện liên tục.
Để đặt 10 nghìn tỷ tham số vào bối cảnh, con số này lớn hơn ba lần so với Kimi K3 của Moonshot AI, có 2,8 nghìn tỷ tham số và hiện đang nằm trong số các mô hình lớn nhất được phát triển tại Trung Quốc. Các tham số về cơ bản là những nút điều chỉnh mà mô hình AI tinh chỉnh trong quá trình huấn luyện để học các mẫu trong dữ liệu.
Điều mà ByteDance thực sự đang xây dựng
Mô hình được đề cập sử dụng kiến trúc Mixture of Experts (MoE). Thay vì kích hoạt mọi tham số cho mỗi truy vấn, các mô hình MoE định tuyến mỗi đầu vào đến một tập con các mạng con chuyên biệt gọi là “chuyên gia”. Điều này giúp chúng hiệu quả hơn nhiều khi chạy trong giai đoạn suy luận so với mô hình dày đặc có cùng kích thước tổng thể.
Đội ngũ Seed AI của ByteDance, theo báo cáo gồm khoảng 2.000 nhân viên, đang dẫn dắt nỗ lực này. Đội ngũ này có kinh nghiệm trong việc mở rộng các quá trình huấn luyện, trước đó đã huấn luyện các mô hình lên đến 175 tỷ tham số bằng khoảng 12.000 GPU. ByteDance đã công bố các nghiên cứu về hạ tầng MegaScale, được thiết kế để quản lý các hệ thống huấn luyện phân tán vượt quá 10.000 GPU.
Giai đoạn tiền huấn luyện chỉ là bước đầu tiên. Sau lần chạy đầu tiên, mô hình sẽ được tinh chỉnh trước khi phát hành công khai. Chủ tịch ByteDance, Trương Dật Minh, được cho là đã chỉ đạo đội Seed AI tập trung vào những đột phá công nghệ thực sự thay vì phụ thuộc vào quá trình tinh luyện từ các hệ thống AI phương Tây.
Tại sao ByteDance lại nghĩ rằng họ có thể thực hiện được điều này
ByteDance có một vài lợi thế về cấu trúc khiến đây không chỉ đơn thuần là một dự án mang tính biểu tượng. Công ty vận hành TikTok, phục vụ hơn một tỷ người dùng toàn cầu, và Doubao, một trong những trợ lý AI được sử dụng rộng rãi nhất tại Trung Quốc. Lượng người dùng tiêu dùng lớn này tạo ra khối lượng dữ liệu tương tác khổng lồ, có thể hỗ trợ các quyết định huấn luyện và tinh chỉnh.
Vấn đề lớn nhất trong phòng, tất nhiên, là các hạn chế xuất khẩu của Mỹ đối với các chip AI tiên tiến. Washington đã từng bước siết chặt kiểm soát việc bán các GPU cao cấp của Nvidia và các bộ tăng tốc khác cho các thực thể Trung Quốc. ByteDance chưa công khai chi tiết các mô hình GPU cụ thể nào mà công ty dự định sử dụng cho đợt huấn luyện này, nhưng khả năng huy động 30.000 thiết bị của công ty cho thấy họ đã tìm ra một con đường khả thi để vượt qua các hạn chế này.
Bối cảnh cạnh tranh được định hình lại
ByteDance không phải là phòng thí nghiệm AI Trung Quốc duy nhất có tham vọng lớn. Nhóm Qwen của Alibaba, Baidu và các startup như DeepSeek và Moonshot AI đều đang đẩy mạnh ranh giới về quy mô mô hình. Tuy nhiên, một mô hình 10 nghìn tỷ tham số sẽ là bước nhảy vọt đáng kể so với bất kỳ điều gì họ đã công bố hoặc triển khai công khai.
Mục tiêu này cũng đưa ByteDance vào cuộc thảo luận với các phòng thí nghiệm tiền tuyến phương Tây. Các hệ thống mới nhất của Anthropic, mà ByteDance được cho là đang nhắm đến để sánh ngang, đại diện cho giới hạn hiện tại của khả năng AI được công khai.
Khung thời gian tiền huấn luyện từ 3 đến 6 tháng có nghĩa là các kết quả hoặc biến chứng có thể bắt đầu xuất hiện trước cuối năm 2026.
