Tác giả bài viết: Đổng Tĩnh
Nguồn gốc bài viết: 华尔街见闻
OpenAI đã ra mắt chip tự phát triển đầu tiên Jalapeño, làm thay đổi hoàn toàn cục diện ngành chip AI với tốc độ khiến mọi người kinh ngạc — đây không chỉ là một sản phẩm mới, mà còn là một tín hiệu: AI đang tái thiết kế chính cách thức thiết kế chip.
The article from Wall Street Journal reported that, according to Bloomberg on August 25, OpenAI stated that Jalapeño leads NVIDIA's GB300 in two key metrics: AI workload processed per unit of power consumption and response speed. The chip, developed jointly by OpenAI and Broadcom, is specifically designed for the AI inference phase and is expected to be deployed in real-world applications as early as later this year. Richard Ho, Head of Chips at OpenAI, said that Jalapeño delivers strong performance at just 700 watts of low power consumption, significantly reducing data center electricity costs.

Theo tiết lộ từ tổ chức nghiên cứu bán dẫn SemiAnalysis, con chip này chỉ mất khoảng 16 tháng từ khi khởi động thiết kế đến khi hoàn thành quy trình đúc, trong đó nút đóng gói CoWoS quan trọng đã được hoàn thành vào tháng 11 năm 2025, tức chỉ mới cách đây 9 tháng — ngắn hơn nhiều so với chu kỳ thông thường trong ngành từ 18 đến 36 tháng.

Các nhà nghiên cứu của SemiAnalysis đã đến trực tiếp phòng thí nghiệm OpenAI và thực nghiệm Jalapeño bằng bộ công cụ đánh giá tự phát triển InferenceX, kết luận trực tiếp: chip này vượt trội hơn tất cả các chip của NVIDIA, AMD và Google mà họ từng thử nghiệm trước đây về chỉ số hiệu suất trên mỗi watt (perf/W).
Đáng chú ý hơn, thành tích này đạt được trong khi Jalapeño chưa kích hoạt các tối ưu như giải mã đầu cơ, tách triển khai tiền điền và giải mã, trong khi các chip tham gia so sánh đều đã bật cấu hình tối ưu của riêng chúng.
Không ngạc nhiên khi nhà phân tích bán dẫn nổi tiếng Dylan Patel cũng thẳng thắn nói: “Không chỉ Blackwell bị vượt mặt, ngay cả chip Rubin của NVIDIA cũng đã bị vượt qua!”

Phân tích cho rằng kết quả này tạo ra thách thức trực tiếp đối với vị thế thị trường của NVIDIA và khiến thị trường xem xét lại cục diện cạnh tranh trong lĩnh vực chip AI.
Dữ liệu thực tế: Jalapeño vượt trội hơn Blackwell ở nhiều chỉ số then chốt
Kết quả kiểm tra của SemiAnalysis cho thấy Jalapeño có lợi thế rõ rệt về hiệu suất suy luận.
Trên mô hình GPT-OSS 120B, Jalapeño có thể xuất ra khoảng 1459 token mỗi giây, trong khi NVIDIA GB200 chỉ đạt 535 token; về độ trễ đầu đến cuối, Jalapeño hoàn thành một nhiệm vụ chỉ mất 1,65 giây, trong khi GB300 cần gần 6 giây, chênh lệch lên tới 3,6 lần. Trong các kịch bản tương tác cao, khi GB300 được đẩy đến tốc độ giải mã nhanh nhất của nó (169 token mỗi giây), thông lượng của Jalapeño cao gấp 104,3 lần.

Trên chỉ số cốt lõi đo lường hiệu suất năng lượng của trung tâm dữ liệu là số Token đầu ra mỗi megawatt mỗi giây, Jalapeño đạt khoảng 53 triệu Token/MW/s trên mô hình GPT-OSS, trong khi GB200 NVL72 chỉ khoảng 10 triệu.

SemiAnalysis chỉ ra rằng chỉ số này về bản chất tương đương với số Token tạo ra trên mỗi joule, trực tiếp xác định trần thu nhập của trung tâm dữ liệu—trong bối cảnh hiện nay khi năng lực tính toán bị giới hạn bởi điện năng, lợi thế ở khía cạnh này đặc biệt quan trọng.
Từ góc độ chi phí hệ thống, theo SemiAnalysis khi tính toán đầy đủ các yếu tố như điện năng, làm mát và mạng lưới, chi phí sở hữu tổng cộng mỗi giờ mỗi chip của Jalapeño khoảng 1,56 USD, gần bằng với 1,55 USD của H100, trong khi Vera Rubin của NVIDIA lên tới 3,61 USD.

Lưu ý rằng, SemiAnalysis cũng đưa ra một số ý kiến giữ lại quan trọng.
Thứ nhất, mô hình được sử dụng trong bài kiểm tra không phải là mô hình tiên tiến nhất hiện nay; NVIDIA và AMD đã công bố kết quả dựa trên bộ công cụ AgentX trên các mô hình quy mô lớn hơn như DeepSeek V4 Pro và Kimi K3, trong khi Jalapeño vẫn chưa hoàn thành bài kiểm tra AgentX — bộ công cụ này phản ánh tốt hơn hiệu năng trong các kịch bản sản xuất thực tế như đa vòng lặp và ngữ cảnh dài.
Thứ hai, đối tượng so sánh công bằng hơn nên là NVIDIA Vera Rubin cũng sử dụng HBM4, thay vì Blackwell; hiệu suất trên mỗi watt của Vera Rubin tăng khoảng 5,4 lần so với GB200 NVL72, và khi so với Jalapeño, cả hai đều có chi phí sở hữu tổng (TCO) trên mỗi Token gần như tương đương.
Thứ ba, Jalapeño hiện vẫn đang ở giai đoạn mẫu kỹ thuật, sản lượng hàng loạt dự kiến sẽ dần tăng từ năm 2027.
AI thiết kế chip: Hiệu ứng bánh đà của GPT-Astra và Codex
Một trong những lý do cốt lõi khiến Jalapeño có thể hoàn thành phát triển với tốc độ ấn tượng như vậy là sự can thiệp sâu rộng của các công cụ AI. Theo SemiAnalysis tiết lộ, OpenAI đã sử dụng rộng rãi các mô hình AI nội bộ trong quá trình thiết kế chip, bao gồm GPT-Astra — mô hình đã thu hút sự quan tâm lớn từ bên ngoài.
Người dùng nền tảng xã hội X, Andrew Curran, trích dẫn thông tin từ OpenAI cho biết, GPT-Astra đã tham gia sâu vào toàn bộ quá trình phát triển Jalapeño:
Đội ngũ đã sử dụng Codex và GPT-Astra để tinh chỉnh ba mô hình nguồn mở ban đầu không nằm trong kế hoạch sản xuất hàng loạt của Jalapeño, đạt trạng thái hiệu năng cao trong vòng hai tháng.

Điều này có nghĩa là AI không chỉ đang tăng tốc quá trình thiết kế chip, mà còn mở rộng nhanh chóng phạm vi các mô hình mà chip có thể hỗ trợ.
Dữ liệu từ SemiAnalysis đã định lượng hóa thêm đóng góp này:
Thiết kế hỗ trợ AI giúp giảm diện tích đơn vị SIMD 8% và diện tích ma trận engine 10%, đồng thời vượt trội hơn phiên bản ban đầu về thời gian và hiệu suất tiêu thụ năng lượng.

Ở cấp độ phần mềm, OpenAI sử dụng phiên bản mở rộng nội bộ của Codex để viết kernel Jalapeño, với một số đoạn mã kernel dài khoảng 3.000 dòng; trong các mô-đun chú ý và MoE đòi hỏi hiệu năng cao nhất, mã do AI tạo ra nhanh hơn 1,5 đến 1,8 lần so với phiên bản do các kỹ sư hàng đầu con người thực hiện.
SemiAnalysis nhận xét rất sắc sảo: Các mô hình của OpenAI (như GPT-5.6 Sol) chạy trên GPU của NVIDIA đang được sử dụng để thiết kế một con chip đe dọa thực sự đến hàng rào bảo vệ CUDA — "GPU chính của NVIDIA đang trực tiếp nuôi dưỡng người kế nhiệm tiềm năng của chính mình".

Phân tích kiến trúc: Tại sao "phổ quát" lại nhanh hơn?
Ngoài đời thường giả định Jalapeño là một con chip được tùy chỉnh sâu cho các mô hình nội bộ của OpenAI, nhưng kết luận của SemiAnalysis lại ngược lại: Jalapeño là một con chip phổ quát dành cho suy luận AI, có thể chạy nhiều loại mô hình và tải công việc, thậm chí cả trò chơi Doom được di chuyển bởi Codex.
Ở cấp độ kiến trúc, triết lý thiết kế cốt lõi của Jalapeño là "loại bỏ độ trễ cố định". Khác với GPU phụ thuộc vào các cấp bộ nhớ phức tạp, Jalapeño kết nối trực tiếp các lõi tính toán với các lát HBM, đồng bộ hóa giữa các lõi thông qua mạng tập hợp băng thông cao chuyên dụng, giảm đáng kể độ trễ truy cập bộ nhớ.
Ngoài ra, Jalapeño sử dụng lõi thực thi hỗn loạn (OoO) kết hợp bộ nhớ đệm L1, thay vì bộ nhớ tạm được quản lý bằng phần mềm như các bộ tăng tốc khác, giúp nó tiếp cận gần hơn với ngưỡng lý thuyết phần cứng trong các kịch bản khối lượng nhỏ và độ trễ thấp.
Về băng thông bộ nhớ, Jalapeño sử dụng HBM4, đạt băng thông bộ nhớ đơn gói 15,4 TB/s, băng thông HBM mỗi watt đạt 22, trong khi NVIDIA Rubin là 11,1 và GB300 chỉ là 5,71.

SemiAnalysis chỉ ra rằng tốc độ chân HBM4 của Jalapeño đạt 10Gbps, cao hơn nhẹ so với 9.6Gbps của Rubin từ NVIDIA, nhà cung cấp HBM có thể là Samsung.
Đáng chú ý, Jalapeño chọn không triển khai tách biệt giữa tiền điền và giải mã (PDD). SemiAnalysis đã đưa ra giải thích chi tiết về điều này:
Trong môi trường sản xuất thực tế, các thông số như tỷ lệ đầu vào/đầu ra, mức độ đồng thời và tỷ lệ hit bộ nhớ đệm liên tục thay đổi, việc chia池 cố định sẽ dẫn đến giảm hiệu suất sử dụng toàn cầu; trong khi các pool tài nguyên đồng nhất có thể phản ứng linh hoạt với sự thay đổi lưu lượng, điều phối động giữa các yêu cầu nhạy cảm với độ trễ và xử lý hàng loạt có thông lượng cao.
CUDA rào cản: Đã xuất hiện vết nứt?
SemiAnalysis trong báo cáo đã đưa ra một phán斷 đầy tính trọng lượng: hàng rào bảo vệ của CUDA có thể đã chết.
Căn cứ dựa trên sự so sánh tốc độ khởi động phần mềm. Việc sản xuất chip CoWoS của NVIDIA Rubin sớm hơn Jalapeño một tháng, nhưng cho đến nay, dữ liệu hiệu năng công khai của Rubin mà bên ngoài có thể thấy chỉ đến từ mẫu thử nghiệm của CoreWeave, NVIDIA chưa mở cửa cho các bên thứ ba vào phòng thí nghiệm tự do kiểm tra như OpenAI. SemiAnalysis cho rằng điều này phản ánh không phải sự chênh lệch về phần cứng, mà là sự chênh lệch về mức độ trưởng thành của phần mềm.
Việc xây dựng từ đầu một stack phần mềm đã giúp OpenAI thoát khỏi gánh nặng lịch sử và đưa ra các quyết định kiến trúc sạch sẽ hơn. OpenAI sử dụng ngôn ngữ lập trình kernel tự phát triển Gluon (xây dựng dựa trên Triton) cùng engine suy luận nội bộ "Teacup", đồng thời tận dụng Codex để tối ưu hóa kernel nhanh chóng. SemiAnalysis quan sát thấy rằng trong chưa đầy hai tuần, Jalapeño đã tăng gấp hơn 2 lần thông lượng ở tốc độ tương tác cụ thể; trong 8 ngày, nhóm đã mở rộng song song tensor từ TP8 lên TP32, đạt được triển khai quy mô toàn tủ máy xuyên qua các khung máy chủ.
Tuy nhiên, SemiAnalysis cũng chỉ rõ rằng các bài kiểm tra hiện tại chỉ bao gồm tải công việc tương đối đơn giản là 8k1k, và chưa hoàn thành các bài kiểm tra đa vòng dài ngữ cảnh của AgentX. Trong các tải công việc trình thông minh phức tạp hơn, hiệu suất của các thành phần như bộ định tuyến, bộ nhớ đệm tiền tố sẽ trở thành những thử thách mới.
Bước tiếp theo: B0 đã vào nhà máy, bản đồ 10GW đang dần được mở rộng
Câu chuyện của Jalapeño chưa hề kết thúc.
Theo SemiAnalysis tiết lộ, các mẫu thử nghiệm công khai hiện tại đều là phiên bản A0, trong khi phiên bản B0 đã bước vào nhà máy bán dẫn và dự kiến sẽ tăng khoảng 25% hiệu suất trên mỗi watt so với A0—đơn vị tính toán die của B0 sẽ đạt 13,4 PFLOPs MXFP4, với TDP duy trì ở mức 700W.
Ở cấp độ hệ thống, OpenAI hợp tác với Celestica để thiết kế giải pháp kệ hoàn chỉnh: mỗi tủ ASIC chứa 128 chip Jalapeño, hệ thống hai tủ có tổng công suất khoảng 160 kW, tương đương với tủ kép rộng GB300 của NVIDIA.

Về triển khai quy mô lớn, một miền mạng mở rộng đơn lẻ có thể kết nối tối đa 2048 XPU Jalapeño, bao phủ 16 kệ. Về sản xuất hàng loạt, SemiAnalysis dự kiến sẽ tăng dần công suất vào năm 2027, với mục tiêu tiếp theo là quy mô triển khai 100MW.
Bối cảnh chiến lược lớn hơn là OpenAI đã ký kết thỏa thuận hợp tác với Broadcom về 10GW bộ gia tốc tùy chỉnh, mức công suất này tương đương với công suất tối đa của khoảng mười lò phản ứng hạt nhân.
华尔街见闻文章写道,OpenAI 芯片负责人 Richard Ho 表示,公司已达到能够切实降低基础设施成本的功耗和成本水平,"这只是第一步"。他同时强调,英伟达仍是重要合作伙伴,OpenAI 对算力的需求极为庞大,短期内不会放弃现有供应商。
Các chuyên gia phân tích chỉ ra rằng, ý nghĩa của Jalapeño có lẽ không nằm ở việc nó có thể thay thế bao nhiêu chip NVIDIA hôm nay, mà ở chỗ nó chứng minh một điều từng bị nghi ngờ rộng rãi: một công ty AI, sử dụng các công cụ AI, đã tạo ra một con chip thực sự cạnh tranh trong thời gian kỷ lục. Chiếc bánh xe này đã bắt đầu quay.
