AMD 收購 Taalas,以將 AI 模型權重嵌入晶片

iconBitPush
分享
AI summary icon精華摘要
AMD 已收購總部位於多倫多的晶片初創公司 Taalas,該公司將 AI 模型權重直接嵌入矽晶片中。Taalas 的 HC1 晶片基於 TSMC 6nm 製程,可達每秒 17,000 個 token 的速度運行 Meta 的 Llama 3.1 8B 模型,在速度和能效上超越 Nvidia H200 和 H100。該晶片採用 3 位元格式,並透過金屬遮罩變更每 8 週更新一次。AMD 計畫將 Taalas 的推論晶片與其 GPU 產品線整合,以應對 AI 工作負載。此項 AI + 加密貨幣新聞出現在通脹數據變化與對高效運算需求上升的背景下。

作者:小餅

AMD 收購 Taalas:推理芯片開始將模型權重刻進矽片


8 月 6 日,AMD 宣布收購多倫多晶片公司 Taalas,交易價格未披露。這家成立於 2023 年、累計融資 2.19 億美元的初創公司,做了一件聽起來有點瘋狂的事:把 AI 模型的權重直接燒進晶片的金屬層,造出只能跑一個模型的專用晶片。

GPU 的運作方式是將模型參數存儲在高帶寬內存(HBM)中,推理時反覆在計算單元之間搬運數據。這個“搬運”過程消耗了大量能源和時間,被業界稱為“內存牆”。Taalas 的做法是徹底取消搬運,將權重固化在晶片的晶體管中,使存儲與計算合為一體。

代價是這顆晶片只能運行一個模型,收益是速度和能效的數量級躍升。

17000 個代幣/秒意味著什麼?

Taalas 的技術驗證晶片 HC1 基於台積電 6nm 工藝,815 平方毫米芯面,530 億晶體管,它內置的模型是 Meta 的 Llama 3.1 8B。

HC1 的跑分數據:單用戶約 17000 token/秒。作為對比,Nvidia H200 在同一模型上約 230 token/秒,H100 約 150 token/秒。73 倍的速度差距,功耗只有後者的十分之一。

更直觀的經濟賬:Taalas 自報的推理成本約為每百萬 Token 0.75 美分(Llama 8B),GPU 方案在 20 到 49 美分之間。每張 HC1 卡功耗 250W,一個標準風冷機架裝 10 張卡只需要 12-15 KW,不需要液冷,而 GPU 機架動輒 120-600 KW。

Forbes 分析師 Karl Freund 在 2 月的評測中表示:「比最快的推理平台(Cerebras 晶圓級引擎)快 10 倍,比 GPU 快兩個數量級。」

但有幾個重要的限制條件。HC1 使用 Taalas 自研的 3-bit 數據格式搭配 6-bit 參數,量化非常激進,在複雜推理任務上的品質損失是確定存在的。17000 token/秒的數據來自 1K 輸入/1K 輸出的廠商基準測試,不代表生產環境的真實表現。而且 Llama 3.1 8B 是 2024 年中發布的模型,8B 參數量的量化版本甚至能在樹莓派 5 上運行。HC1 展示的是架構的潛力,而非成熟產品的競爭力。

模型換代怎麼辦?

將模型燒入晶片,最直觀的問題是:模型迭代了怎麼辦?晶片就廢了?

Taalas 的回答是:不會廢。傳統 ASIC 設計週期要兩年以上。Taalas 開發了一套自動化設計流程,只需要修改晶片頂層的少量金屬掩膜,就可以把新模型編譯成新晶片,週期約 8 週。公司在成本模型中預設了 4 年生命週期內 3 次晶片更新的費用。

這個回答能解決一部分焦慮,但不能完全消除。

GPU 的靈活性在於同一張卡今天運行 Llama,明天運行 Claude,後天運行一個尚未發布的新模型。Taalas 的晶片無法做到這一點。如果一個客戶同時需要多個模型服務(這在生產環境中極為常見),就需要為每個模型配備不同的晶片,庫存管理和運維複雜度會上升。

HC2 正在開發中,目標是約 200 億參數量級的模型,採用 4-bit 浮點提升精度。Taalas 原計劃 2026 年底前實現前沿級模型的支持。

AMD 的收購讓這條路徑有了 Instinct GPU 產品線和 Helios 機架系統的協同,客戶可以用 GPU 處理靈活多變的工作負載,用 Taalas 芯片處理穩定高頻的單模型推理。

推理晶片的軍備競賽

AMD 收購 Taalas,從行業背景來看,是過去 8 個月推理晶片收購潮的最新一筆。

2025 年 12 月,Nvidia 以 200 億美元收購 Groq,拿下基於 SRAM 的低延遲推理架構。

2026 年 5 月,Cerebras 以約 560 億美元市值 IPO,成為 2020 年 Snowflake 以來最大的科技 IPO。

6 月,Etched 結束兩年多的隱身期,宣布首顆 Transformer 專用晶片於台積電 N4P 工藝上完成流片,手握超過 10 億美元客戶合約。Intel 據報與 SambaNova 簽署了收購意向書,Qualcomm 在接觸 Tenstorrent。

這些交易指向同一個判斷:推理正成為 AI 算力支出的主戰場。

行業預測 2026 年推理將佔 AI 計算支出的三分之二,到 2030 年專用推理 ASIC 可能拿下 45% 的推理市場。Nvidia 的 GPU 仍然統治訓練端,但在推理端,它的通用架構正面臨來自各個方向的專用晶片挑戰。

Taalas 位於這個光譜的最極端位置:它連「一類模型」的通用性都放棄了,直接製作「一個模型」的專用晶片。

Groq 使用 SRAM 來繞過記憶體牆,Cerebras 用晶圓級面積來暴力突破,Etched 僅為 Transformer 架構優化,而 Taalas 的賭注更激進:它賭的是 AI 模型會逐漸穩定下來,就像通訊協議最終會收斂到少數標準。當模型不再每月更替,為最熱門的幾個模型各造一顆專用晶片,在經濟上就是划算的。

賭模型會“凝固”

AMD 高級副總裁 Vamsi Boppana 在公告中表示,收購的目的是為客戶提供「每種 AI 工作負載都有對應的最優計算方案」。這句話轉化為競爭策略即是:GPU 負責靈活性,Taalas 芯片負責極致效率,客戶可按需組合。

This logic holds only if the core assumption is true: whether the update cycle of AI models will slow down.

如果大模型持續每隔幾個月就有架構級更新,那把權重燒進矽片的做法就像在流沙上澆混凝土,晶片還沒回本,模型已經過時了。但如果模型能力趨於收斂,頭部模型穩定服務一兩年成為常態,那 Taalas 式的專用晶片就會像通信行業的基帶晶片一樣,從瘋狂的實驗變成理所當然的選擇。

回看過去 12 個月,模型更新的節奏確實在出現微妙變化。Llama 系列從 3.1 到 3.2 到 4 的間隔在拉長,GPT 從 4 到 4o 到 5 的架構變動幅度在收窄。更多的新模型是在既有架構上做蒸餾、量化和微調,基座模型的迭代正在放緩。

如果這個趨勢繼續,Taalas 賭對了。


Twitter:https://twitter.com/BitpushNewsCN

比推 TG 交流群:https://t.me/BitPushCommunity

比推 TG 訂閱: https://t.me/bitpush

說明:比推所有文章僅代表作者觀點,不構成投資建議
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露