Bài viết: Xiao Bing
Ngày 6 tháng 8, AMD công bố việc mua lại công ty chip Toronto Taalas, với mức giá giao dịch chưa được tiết lộ. Công ty khởi nghiệp này, được thành lập năm 2023 và huy động được tổng cộng 219 triệu USD, đã thực hiện một việc nghe có vẻ hơi điên rồ: đốt trực tiếp trọng số mô hình AI vào lớp kim loại của chip để tạo ra chip chuyên dụng chỉ chạy được một mô hình.
GPU hoạt động bằng cách lưu các tham số mô hình trong bộ nhớ显存 băng thông cao (HBM), và trong quá trình suy luận, dữ liệu được liên tục di chuyển vào và ra khỏi các đơn vị tính toán. Quá trình "di chuyển" này tiêu tốn rất nhiều năng lượng và thời gian, được ngành công nghiệp gọi là "bức tường bộ nhớ". Cách tiếp cận của Taalas là loại bỏ hoàn toàn việc di chuyển, cố định trọng số ngay trong các transistor của chip, kết hợp lưu trữ và tính toán thành một thể thống nhất.
Chi phí là chip này chỉ có thể chạy một mô hình, nhưng lợi ích là tốc độ và hiệu quả năng lượng tăng lên cấp số nhân.
17.000 token/giây có nghĩa là gì?
Chip HC1 của Taalas được sản xuất trên quy trình 6nm của TSMC, với diện tích chip 815 mm² và 53 tỷ transistor, mô hình tích hợp bên trong là Llama 3.1 8B của Meta.
Dữ liệu hiệu suất của HC1: khoảng 17.000 token/giây cho một người dùng. Để so sánh, Nvidia H200 đạt khoảng 230 token/giây và H100 đạt khoảng 150 token/giây trên cùng mô hình này. Tốc độ nhanh hơn 73 lần, nhưng công suất tiêu thụ chỉ bằng một phần mười.
Bảng tính kinh tế trực quan hơn: Chi phí suy luận do Taalas công bố vào khoảng 0,75 cent mỗi triệu token (Llama 8B), trong khi giải pháp GPU dao động từ 20 đến 49 cent. Mỗi thẻ HC1 tiêu thụ 250W, một kệ làm mát bằng không khí tiêu chuẩn chứa 10 thẻ chỉ cần 12-15 kW, không cần làm mát bằng chất lỏng, trong khi kệ GPU thường tiêu thụ từ 120 đến 600 kW.
Chuyên gia của Forbes, Karl Freund, khi đánh giá vào tháng Hai, cho biết: “Nhanh hơn 10 lần so với nền tảng suy luận nhanh nhất (Cerebras Wafer-Scale Engine) và nhanh hơn GPU hai cấp độ.”
Tuy nhiên, có một vài điều kiện hạn chế quan trọng. HC1 sử dụng định dạng dữ liệu 3-bit do Taalas tự phát triển kết hợp với tham số 6-bit, lượng tử hóa cực kỳ mạnh mẽ, dẫn đến tổn thất chất lượng là điều chắc chắn xảy ra trong các nhiệm vụ suy luận phức tạp. Dữ liệu 17.000 token/giây đến từ bài kiểm tra chuẩn của nhà sản xuất với đầu vào 1K/đầu ra 1K, không phản ánh hiệu suất thực tế trong môi trường sản xuất. Hơn nữa, Llama 3.1 8B là mô hình được phát hành vào giữa năm 2024, phiên bản lượng tử hóa với 8B tham số thậm chí còn có thể chạy trên Raspberry Pi 5. HC1 thể hiện tiềm năng của kiến trúc, chứ không phải sức cạnh tranh của một sản phẩm đã chín muồi.
Làm gì khi mô hình được thay thế?
Khi nạp mô hình vào chip, câu hỏi trực quan nhất là: Nếu mô hình được cập nhật thì chip sẽ trở nên vô dụng?
Câu trả lời của Taalas là: Không bị loại bỏ. Chu kỳ thiết kế ASIC truyền thống kéo dài hơn hai năm. Taalas đã phát triển một quy trình thiết kế tự động, chỉ cần thay đổi một lượng nhỏ lớp kim loại trên cùng của chip để biên dịch mô hình mới thành chip mới, với chu kỳ khoảng 8 tuần. Công ty đã dự trù chi phí cho 3 lần cập nhật chip trong mô hình chi phí với vòng đời 4 năm.
Câu trả lời này có thể giải quyết một phần sự lo lắng, nhưng không thể xóa bỏ hoàn toàn.
Độ linh hoạt của GPU nằm ở chỗ cùng một card này hôm nay chạy Llama, ngày mai chạy Claude, ngày kia chạy một mô hình mới chưa được phát hành. Chip của Taalas không thể làm được điều này. Nếu một khách hàng đồng thời cần nhiều dịch vụ mô hình (điều này cực kỳ phổ biến trong môi trường sản xuất), họ sẽ cần trang bị một chip khác nhau cho mỗi mô hình, làm tăng độ phức tạp trong quản lý kho và vận hành.
HC2 đang được phát triển, nhắm đến mô hình với quy mô khoảng 20 tỷ tham số, sử dụng độ chính xác nâng cao 4-bit nổi. Taalas ban đầu dự định hỗ trợ mô hình tiên tiến trước cuối năm 2026.
Việc mua lại AMD mang lại sự phối hợp giữa dòng sản phẩm GPU Instinct và hệ thống khung Helios, giúp khách hàng sử dụng GPU để xử lý các tải công việc linh hoạt và thay đổi, đồng thời sử dụng chip Taalas để xử lý suy luận mô hình đơn lẻ ổn định và tần suất cao.
Cuộc đua vũ trang về chip suy luận
AMD mua lại Taalas, trong bối cảnh ngành, đây là giao dịch mới nhất trong làn sóng mua lại chip suy luận trong 8 tháng qua.
Tháng 12 năm 2025, Nvidia đã mua lại Groq với giá 20 tỷ USD, sở hữu kiến trúc suy luận độ trễ thấp dựa trên SRAM.
Tháng 5 năm 2026, Cerebras niêm yết với giá trị thị trường khoảng 56 tỷ USD, trở thành đợt IPO công nghệ lớn nhất kể từ Snowflake năm 2020.
Tháng 6, Etched kết thúc hơn hai năm ẩn mình, thông báo rằng chip đầu tiên dành riêng cho Transformer đã hoàn thành quá trình sản xuất trên quy trình N4P của TSMC, đồng thời sở hữu các hợp đồng khách hàng trị giá hơn 1 tỷ USD. Báo cáo cho biết Intel đã ký biên bản ghi nhớ về việc mua lại SambaNova, trong khi Qualcomm đang tiếp xúc với Tenstorrent.
Các giao dịch này đều chỉ ra một kết luận tương tự: suy luận đang trở thành战场 chính trong chi tiêu năng lực tính toán của AI.
Dự báo ngành cho thấy năm 2026,推理 sẽ chiếm hai phần ba chi tiêu tính toán AI, và đến năm 2030, các ASIC推理 chuyên dụng có thể chiếm 45% thị phần推理. GPU của Nvidia vẫn thống trị thị trường huấn luyện, nhưng kiến trúc phổ quát của nó đang đối mặt với thách thức từ các chip chuyên dụng ở mọi hướng trong lĩnh vực推理.
Taalas nằm ở cực đoan nhất của thang đo này: nó từ bỏ luôn tính phổ quát của "mô hình loại một" và trực tiếp phát triển chip chuyên dụng cho "một mô hình".
Groq sử dụng SRAM thay vì HBM để vượt qua bức tường bộ nhớ, Cerebras dùng diện tích quy mô wafer để đột phá một cách bạo lực, Etched chỉ tối ưu hóa cho kiến trúc Transformer, trong khi Taalas đặt cược táo tợn hơn: họ tin rằng các mô hình AI sẽ dần ổn định, giống như các giao thức truyền thông cuối cùng sẽ hội tụ về một vài tiêu chuẩn duy nhất. Khi các mô hình không còn thay đổi hàng tháng, việc sản xuất chip chuyên dụng riêng cho vài mô hình phổ biến nhất sẽ trở nên kinh tế.
Mô hình cược sẽ “đóng băng”
Giám đốc cấp cao của AMD, Vamsi Boppana, cho biết trong thông báo rằng mục đích của vụ mua lại là mang đến cho khách hàng "giải pháp tính toán tối ưu cho từng loại tải công việc AI". Câu này dịch sang chiến lược cạnh tranh có nghĩa là: GPU đảm nhận tính linh hoạt, chip Taalas đảm nhận hiệu suất cực cao, khách hàng có thể kết hợp theo nhu cầu.
Việc logic này có thể tồn tại hay không phụ thuộc vào một giả định cốt lõi: chu kỳ cập nhật của mô hình AI có bị chậm lại hay không.
Nếu các mô hình lớn liên tục có các bản cập nhật cấp kiến trúc mỗi vài tháng, thì việc đúc trọng số vào chip giống như đổ bê tông lên cát chảy—chưa kịp thu hồi chi phí thì mô hình đã lỗi thời. Nhưng nếu khả năng của các mô hình dần ổn định và các mô hình hàng đầu duy trì dịch vụ ổn định trong một đến hai năm trở thành tiêu chuẩn, thì các chip chuyên dụng kiểu Taalas sẽ trở nên phổ biến như chip nền tảng trong ngành viễn thông, từ những thí nghiệm điên rồ trở thành lựa chọn tất yếu.
Xem lại 12 tháng qua, nhịp độ cập nhật mô hình thực sự đang có những thay đổi tinh vi. Khoảng cách giữa các phiên bản của chuỗi Llama từ 3.1 đến 3.2 và rồi đến 4 đang kéo dài, trong khi sự thay đổi kiến trúc của GPT từ 4 đến 4o và rồi đến 5 đang thu hẹp. Nhiều mô hình mới hơn đang được phát triển dựa trên kiến trúc hiện có thông qua quá trình tinh luyện, lượng tử hóa và tinh chỉnh, cho thấy tốc độ lặp lại của các mô hình nền đang chậm lại.
Nếu xu hướng này tiếp tục, Taala đã đoán đúng.
