Vào ngày 7 tháng 7, có hai tin tức về chip tự nghiên cứu của các công ty AI Trung Quốc trở thành tin nóng.
Trước tiên là bản độc quyền của Reuters: DeepSeek đang phát triển chip riêng của mình. Báo cáo trích dẫn ba nguồn tin am hiểu cho biết chip này nhắm vào việc suy luận (inference), chứ không phải huấn luyện. Báo cáo cho biết DeepSeek đã âm thầm tuyển dụng các kỹ sư thiết kế chip thông qua các kênh không công khai, đồng thời đang liên hệ với các nhà sản xuất bên ngoài và các nhà cung cấp bộ nhớ. DeepSeek chưa phản hồi yêu cầu bình luận, và thông tin này vẫn gây tranh cãi vì hiện tại chỉ có Reuters là nguồn tin duy nhất.

Cùng ngày, The Information lại báo cáo rằng một phòng thí nghiệm Trung Quốc khác là Zhipu cũng đang đánh giá việc phát triển chip tùy chỉnh của riêng mình. Theo các nguồn thạo tin, nguyên nhân là do nhu cầu tăng đột biến đối với GLM-5.2. Theo The Information và nhiều nguồn trích dẫn khác, mô hình này là mô hình tăng trưởng nhanh nhất trên nền tảng tập hợp mô hình Vercel, với lượng token tiêu thụ trung bình mỗi ngày trong tuần đầu tiên lên tới 27 lần. Zhipu đã có những cuộc tiếp xúc ban đầu với nhiều công ty thiết kế chip trong nước, nhưng vẫn chưa chọn đối tác hợp tác; theo đó, toàn bộ dự án có thể cần hơn hai năm. Ngay sau khi tin tức được công bố, cổ phiếu của Zhipu trên thị trường港股 đã tăng khoảng 9,9% trong ngày.

Tất nhiên, cả hai thông báo đều vẫn ở giai đoạn đánh giá ban đầu, chưa có sản phẩm thực tế hay thiết kế hoàn chỉnh.
Thực tế, DeepSeek và Zhipu cũng không phải trường hợp duy nhất. Khi kéo xa ống kính, bạn sẽ nhận ra rằng “các công ty AI tự chế tạo chip” đã trở thành hành động mặc định trong ngành vào năm 2026: từ OpenAI, Anthropic ở bên kia đại dương đến hai phòng thí nghiệm tiên phong trong nước, các động thái đều cực kỳ nhất quán. Bài viết này muốn trả lời câu hỏi: Tại sao?
Tháng trước, OpenAI đã mang chip lên bàn
Nếu tin tức về DeepSeek vẫn còn ở mức đồn thổi, thì OpenAI đã đưa ra sản phẩm thực tế.
Ngày 24 tháng 6, OpenAI và Broadcom đã cùng công bố Jalapeño, chiếc chip tự phát triển đầu tiên của OpenAI, cũng là một ASIC được thiết kế chuyên dụng cho suy luận mô hình lớn.

Richard Ho, trưởng bộ phận phần cứng của OpenAI, cho biết chip này được “thiết kế từ đầu dành riêng cho suy luận LLM”, với đội ngũ thực hiện các tối ưu hóa nhắm mục tiêu vào lõi, việc di chuyển bộ nhớ, mạng và mô hình dịch vụ.
Theo OpenAI giới thiệu, các bài kiểm tra phòng thí nghiệm giai đoạn đầu cho thấy hiệu suất mỗi watt của Jalapeño “vượt trội đáng kể so với mức tiên tiến nhất hiện nay trong ngành”. Tuy nhiên, công ty cũng thừa nhận rằng hiệu suất cuối cùng vẫn đang được đo lường, và báo cáo kỹ thuật chi tiết sẽ được công bố trong vài tháng tới. Những lợi thế hiệu suất do các nhà sản xuất tự tuyên bố chỉ có thể coi là một phía trước khi có các bài benchmark từ bên thứ ba.
Có một vài chi tiết đáng chú ý. Theo Tom's Hardware, con chip này chỉ mất chín tháng từ thiết kế đến流片 (tape-out), và OpenAI cho rằng đây có thể là chu kỳ phát triển ASIC nhanh nhất trong lịch sử bán dẫn tiên tiến hiệu năng cao; và chính các mô hình của chính OpenAI đã thúc đẩy chu kỳ này: sử dụng AI để thiết kế chip tạo ra AI.
Jalapeño dự kiến bắt đầu triển khai vào cuối năm 2026, được liên kết với hợp tác với Broadcom có quy mô 10 GW và sẽ hoàn thành vào năm 2029. Theo báo cáo, Microsoft dự kiến sẽ mua khoảng 40% công suất đầu tiên của Jalapeño.
Anthropic đang do dự, nhưng đã bắt đầu hành động
Hãy xem thêm một phòng thí nghiệm tiên phong khác là Anthropic. Tháng 4 năm nay, Reuters đã率先 báo cáo rằng Anthropic cũng đang xem xét phát triển chip tự nghiên cứu, với ngôn từ rất thận trọng: kế hoạch vẫn ở giai đoạn đầu, công ty thậm chí có thể cuối cùng quyết định chỉ mua mà không tự sản xuất, chưa xác định thiết kế và cũng chưa thành lập đội ngũ chuyên trách.
Tuy nhiên, vào đầu tháng 7, tình hình đã có tiến triển mới. Theo nhiều báo cáo truyền thông, Anthropic đã bắt đầu liên hệ với Samsung để thảo luận về việc thuê sản xuất một con chip tùy chỉnh, được cho là nhắm đến quy trình 2 nanomet và đóng gói tiên tiến của Samsung.
Và Anthropic gần đây đã tuyển dụng Clive Chan, một thành viên đầu tiên của đội ngũ tự phát triển chip của OpenAI.

Trước câu hỏi chất vấn, Anthropic phản hồi rằng "hệ thống phần cứng đa dạng" bao gồm chip của Google, Amazon và NVIDIA vẫn sẽ là trung tâm trong chiến lược tính toán của họ, và không bình luận thêm về hợp tác với Samsung.
Lời tuyên bố chính thức này chính xác đã làm nổi bật động cơ chân thực nhất trong làn sóng tự phát triển chip. Theo dữ liệu từ The Information, NVIDIA nắm giữ khoảng 74% thị phần chip AI toàn cầu; trong khi Anthropic cho đến nay chưa từng chế tạo bất kỳ chip nào của riêng mình, mỗi lần gọi Claude đều chạy trên các chip thuê từ đối tác; và những đối tác này đồng thời cũng là đối thủ cạnh tranh của họ.
Đáng chú ý là thời điểm Anthropic bắt đầu khám phá việc tự phát triển chip trùng với sự gia tăng đột biến doanh thu của họ. Theo thông tin do chính họ công bố, doanh thu hoạt động hàng năm đã vượt quá 30 tỷ USD vào năm 2026, trong khi cuối năm 2025 mới chỉ khoảng 9 tỷ USD. Khi quy mô đạt đến mức này, thì việc tự phát triển chip mới thực sự có ý nghĩa về mặt kinh tế.
Suy luận! Suy luận! Suy luận!
Khi so sánh các tin tức về DeepSeek, Zhipu, OpenAI và Anthropic cạnh nhau, bạn sẽ nhận ra một điểm chung: tất cả đều đang phát triển chip suy luận, chứ không phải chip huấn luyện. Đây không phải là sự tình cờ.
Một sự chuyển dịch cơ cấu đang diễn ra trong ngành là: trọng tâm tiêu thụ năng lượng tính toán đang chuyển từ “đào tạo mô hình” sang “chạy mô hình”. Đào tạo là chi phí một lần, trong khi cung cấp dịch vụ mô hình cho hàng trăm triệu đến hàng tỷ người dùng là chi phí liên tục. Theo phân tích ngành của Introl, hiện tại suy luận đã chiếm khoảng hai phần ba tổng năng lực tính toán AI.

https://introl.com/blog/custom-silicon-inflection-2026-hyperscaler-asics-nvidia-gpu
Và suy luận chính là lĩnh vực thế mạnh của ASIC. Như một ẩn dụ mà tác giả cuốn “Cuộc chiến chip”, Chris Miller, dùng để nói với CNBC: GPU của NVIDIA giống như một con dao Thụy Sĩ, có thể xử lý mọi loại tính toán song song; trong khi ASIC giống như một công cụ chuyên dụng, cực kỳ hiệu quả và nhanh chóng, nhưng bị cố định chỉ thực hiện một loại công việc duy nhất. Giai đoạn huấn luyện cần sự linh hoạt của con dao Thụy Sĩ vì kiến trúc mô hình vẫn đang thay đổi; nhưng một khi mô hình đã được cố định và cần phục vụ hàng loạt yêu cầu lớn, thì “công cụ chuyên dụng” đó lại tiết kiệm điện và rẻ hơn.

https://oplexa.com/custom-asic-market-2026-hyperscalers-ditching-nvidia/
Sự bùng nổ của tác nhân (Agent) đã làm gia tăng thêm khoản nợ này. Một bài phân tích của MindCast AI đã đưa ra một sự phân biệt thú vị:
推理 truyền thống là "chi phí truy vấn": một lần đặt câu hỏi, một lần trả lời, kết toán xong xuôi;
Agent là "chi phí lặp lại": Một mục tiêu của người dùng có thể kích hoạt hàng chục đến hàng trăm lần gọi suy luận, vì agent cần suy luận, lập kế hoạch, truy xuất và thực thi.

Hình ảnh được dịch từ https://www.mindcast-ai.com/p/ai-inference-economy
Khi các tác nhân được triển khai quy mô lớn, sự bất cân xứng kinh tế giữa đào tạo và suy luận sẽ tăng lên theo cách phi tuyến tính. Do đó, tổ chức phân tích này kết luận: kinh tế suy luận không phải là vấn đề cần quan tâm vào năm 2028, mà là một quyết định mua sắm cần thực hiện vào năm 2026.
Một khoản kế toán kinh tế ngày càng hợp lý
Đối với câu hỏi “Tại sao phải tự tạo”, ngành công nghiệp thực sự đã có những con số cụ thể hỗ trợ.
Một ví dụ trực quan nhất đến từ nền tảng hình ảnh AI Midjourney. Theo báo cáo, sau khi chuyển tải tính toán từ GPU của NVIDIA sang TPU thế hệ thứ bảy của Google, chi phí năng lực tính toán hàng tháng của Midjourney đã giảm từ khoảng 2,1 triệu USD xuống còn khoảng 700.000 USD, tức giảm 65%. Khi nhân tỷ lệ này lên với các nhà cung cấp quy mô siêu lớn, những người thực hiện hàng tỷ truy vấn mỗi ngày, như một chuyên gia phân tích đã nói, việc đầu tư hàng tỷ USD để tự phát triển chip trở thành một “bài toán tài chính rõ ràng”.
Câu trả lời cho câu hỏi này đang thay đổi toàn bộ thị trường. Theo dự báo của TrendForce, tốc độ tăng trưởng lượng hàng xuất xưởng của ASIC tùy chỉnh năm 2026 sẽ đạt 44,6%, trong khi GPU thương mại chỉ ở mức 16,1%—đây là lần đầu tiên tốc độ tăng trưởng của chip tùy chỉnh vượt qua GPU. Introl trích dẫn số liệu từ Bloomberg Intelligence cho thấy quy mô lớn hơn: đến năm 2033, toàn bộ thị trường bộ xử lý tăng tốc AI dự kiến đạt 604 tỷ USD, và tỷ trọng của chip tùy chỉnh trong đó đang tiếp tục tăng nhanh.

Các nhà sản xuất quy mô siêu lớn đã bỏ phiếu bằng tiền thật. TPU của Google, Trainium của Amazon, Maia của Microsoft, MTIA của Meta... những con chip tự phát triển này mỗi cái đều phục vụ khối lượng tải suy luận khổng lồ bên trong công ty mẹ của chúng.

https://oplexa.com/custom-asic-market-2026-hyperscalers-ditching-nvidia/
Theo CNBC, chủ tịch kiến trúc sư của Trainium, Ron Diamant, cho biết ASIC này của Amazon có lợi thế về hiệu suất chi phí từ 30% đến 40% so với các nhà cung cấp phần cứng khác trên AWS.
Con số này cho thấy: khi nhu cầu về sức mạnh tính toán của bạn tăng lên quy mô siêu lớn, chip không còn là chi phí nữa, mà trở thành hàng rào cạnh tranh chính. Như một bài phân tích của Oplexa đã nêu, việc kiểm soát chip của riêng bạn có nghĩa là kiểm soát lộ trình hiệu suất, cơ cấu chi phí và chuỗi cung ứng của chính bạn. Ba yếu tố này không thể mua được bằng bất kỳ đơn đặt hàng nào.
Bỏ qua NVIDIA, không chỉ để tiết kiệm chi phí
Nếu như lý do kinh tế là lý do hiển nhiên, thì “không muốn giao vận mệnh cho một công ty” mới là dòng chảy ngầm sâu sắc hơn dưới mặt sóng.
Sức mạnh của NVIDIA đến một phần từ chính con chip, nhưng lớn hơn nhiều là từ CUDA. CUDA là một hệ sinh thái phần mềm đã tích lũy hơn hai mươi năm. Theo phân tích của Spheron, hầu hết các tối ưu hóa推理 LLM nghiêm túc, từ FlashAttention đến xử lý hàng loạt liên tục trong vLLM, đều chỉ chạy trên CUDA. Hệ sinh thái này không chỉ là hàng rào bảo vệ của NVIDIA, mà còn là “chi phí di chuyển” mà bất kỳ nhóm nào muốn thay đổi chip đều phải trả. Theo ước tính, việc di chuyển stack dịch vụ từ vLLM sang Amazon Neuron SDK thường mất từ hai đến sáu tuần thời gian kỹ thuật, và một số kiến trúc mô hình thậm chí không được hỗ trợ.

https://www.spheron.network/blog/hyperscaler-custom-ai-chips-2026-trainium-tpu-maia-mtia-vs-nvidia-gpu/
Chính vì bức tường này cao và dày, động lực để vượt qua nó càng trở nên mạnh mẽ hơn. Đối với các nhà sản xuất quy mô siêu lớn và các phòng thí nghiệm tiên tiến, mỗi tải chạy trên chip tự phát triển đều mang lại nhiều lợi nhuận hơn cho chính họ và tăng thêm sức mạnh trong đàm phán giá với NVIDIA.
TheStreet đưa ra phán đoán rất trực tiếp: điều đang thay đổi là giả định mặc định rằng “các phòng thí nghiệm AI phải chấp nhận mọi mức giá và điều kiện cung cấp do NVIDIA đưa ra”. Microsoft có Maia, Amazon có Trainium, Google có TPU, và các phòng thí nghiệm AI mới nhất hiện nay cũng muốn tự mình tích lũy những lợi thế tương tự.
Phòng thí nghiệm Trung Quốc còn phải đối mặt với một gông cùm khác
Trở lại hai tin nhắn vào ngày 7 tháng 7. Đối với DeepSeek và Zhipu, ngoài tất cả các lý do nêu trên, việc tự phát triển chip còn đối mặt với một vấn đề mà các đối tác Mỹ của họ không có: hạn chế xuất khẩu.
Đồng thời, cần lưu ý rằng tin đồn về việc DeepSeek tự phát triển chip trùng với thời điểm công ty này nhận vốn đầu tư bên ngoài lần đầu tiên: công ty đã hoàn thành vòng huy động vốn hơn 50 tỷ nhân dân tệ, định giá vượt 330 tỷ nhân dân tệ. Việc sản xuất chip tốn rất nhiều tiền, và việc hai sự kiện này xảy ra cùng lúc không hẳn là ngẫu nhiên.
Còn ZhiPu thì đã trở thành phòng thí nghiệm AI Trung Quốc đầu tiên niêm yết trên Sở Giao dịch Chứng khoán Hồng Kông vào tháng 1 năm nay. Cả hai đều đang chuẩn bị sẵn túi tiền cho cuộc đánh cược đắt đỏ này.
Will it succeed?
Tổng hợp những manh mối này, câu trả lời cho câu hỏi “Tại sao các công ty AI đều muốn tự chế tạo chip” thực chất là sự hội tụ của vài lực lượng:推理 thay thế đào tạo trở thành chiến trường chính về năng lực tính toán, tạo cơ hội cho ASIC chuyên dụng phát huy tác dụng; sự bùng nổ của các tác nhân thông minh đẩy chi phí推理 lên mức tăng phi tuyến, khiến mỗi đồng tiết kiệm được đều được khuếch đại; và sự phụ thuộc sâu sắc vào NVIDIA khiến tất cả đều muốn tự tích lũy cho mình một lá bài thương lượng. Đối với các công ty Trung Quốc như DeepSeek và Zhipu, còn phải thêm vấn đề kiểm soát xuất khẩu.
Tuy nhiên, dưới làn sóng nhiệt huyết này, cũng nên tạt một chút nước lạnh. Việc tự phát triển chip không phải là lựa chọn chắc chắn thắng lợi. Chu kỳ thiết kế thường kéo dài từ 18 đến 24 tháng, đòi hỏi đầu tư lớn về kỹ thuật ban đầu, đồng thời cần có tải công việc đủ ổn định và có thể dự đoán được mới đáng để thiết kế xung quanh một kiến trúc cố định. Đối với các công ty khởi nghiệp vẫn đang thử nghiệm kiến trúc mô hình, hay các doanh nghiệp thông thường với nhiều nhiệm vụ đa dạng, tính linh hoạt của GPU NVIDIA lại là lựa chọn hiệu quả hơn.
TechTimes giải thích rõ rằng, lợi thế chi phí 40% đến 65% chỉ thuộc về những tập đoàn lớn thực hiện hàng tỷ truy vấn mỗi ngày; đối với các doanh nghiệp chỉ thực hiện vài chục nghìn truy vấn mỗi tuần, con số này sẽ ngược lại.
Một câu hỏi đáng để tìm hiểu sâu hơn là: làn sóng này rốt cuộc sẽ làm suy yếu NVIDIA, hay chỉ đơn thuần là bổ sung thêm một vị trí cho nó? Phần lớn các phân tích đưa ra câu trả lời thiên về后者. Theo Oplexa, đến năm 2027, số lượng ASIC được giao có thể vượt qua GPU về số lượng, nhưng cả hai thị trường đều sẽ tiếp tục tăng trưởng: cơ sở hạ tầng AI đang phân hóa thành hai con đường khác nhau: các tải công việc cố định, tần suất cao, có thể dự đoán sẽ thuộc về ASIC; trong khi các tải công việc nghiên cứu, đa dạng và kiến trúc vẫn đang phát triển sẽ thuộc về GPU. NVIDIA vẫn nắm giữ vững chắc thị phần đào tạo và phần lớn thị trường.

https://oplexa.com/custom-asic-market-2026-hyperscalers-ditching-nvidia/
DeepSeek và Zhipu liệu có thể tự sản xuất chip của riêng mình hay không, hiện vẫn chưa có câu trả lời, vì cả hai tin tức này đều vẫn đang ở giai đoạn đánh giá sơ bộ.
Nhưng chúng cùng xuất hiện trong một ngày, như hai viên sỏi cùng ném xuống mặt nước, những gợn sóng nổi lên phơi bày cùng một nỗi lo lắng: từ San Francisco đến Bắc Kinh, trong thời đại mà sức mạnh tính toán là quyền lực, không có công ty AI nào muốn sống sót đến vòng tiếp theo lại sẵn sàng trao mãi mãi sinh mệnh của mình cho người khác.
Bài viết này đến từ tài khoản WeChat “Machine Heart” (ID: almosthuman2014), tác giả: Panda
