Isinulat ni Xiao Bing
Ago 6, ipinahayag ng AMD ang pagkakabili sa Toronto-based chip company na Taalas, na hindi isinagawa ang presyo ng transaksyon. Ang startup na ito, na itinatag noong 2023 at nakapag-ikot ng $219 milyon sa kabuuan, ay gumawa ng isang bagay na tila magulo: sinunog nito ang weights ng AI model nang direkta sa metal layer ng chip upang lumikha ng isang专用 chip na nagpapatakbo lamang ng isang model.
Ang paraan ng paggana ng GPU ay ang pag-iimbak ng mga parametro ng modelo sa high-bandwidth memory (HBM), at ang paulit-ulit na paghahatid ng data pabalik at paharap sa mga unit ng pagkalkula habang nagpapatakbo. Ang prosesong "paghahatid" na ito ay naglalabas ng malaking dami ng enerhiya at oras, at tinatawag ito ng industriya bilang "memory wall." Ang paraan ng Taalas ay ang pag-alis ng buong proseso ng paghahatid, at ang pagpapakapit ng mga timbang sa mga transistor ng chip, kung saan ang pag-iimbak at pagkalkula ay naging iisang bagay.
Ang gastos ay ang chip na ito ay maaaring patakbuhin lamang ng isang modelo, ngunit ang benepisyo ay ang pagtaas ng bilis at efficiency sa isang orden ng magnitude.
Ano ang ibig sabihin ng 17,000 token/sa segundo?
Ang teknikal na veripikasyon na chip na HC1 ng Taalas ay batay sa proseso ng TSMC na 6nm, may sukat na 815 mm² at 53 bilyon na transistor, at ang nakabuilt na modelo nito ay ang Meta's Llama 3.1 8B.
Mga resulta ng performance ng HC1: humigit-kumulang 17,000 token/segundo per user. Bilang komparasyon, ang Nvidia H200 ay humigit-kumulang 230 token/segundo, habang ang H100 ay 150 token/segundo sa parehong modelo. 73 beses ang bilis, ngunit ang pagkakagamit ng enerhiya ay lamang ang sampu-sampu ng huling dalawa.
Mas malinaw na pagsusuri sa ekonomiya: Ang inihayag na gastos sa pag-iisip ng Taalas ay humigit-kumulang 0.75 sentimo bawat milyong Token (Llama 8B), habang ang mga solusyong GPU ay nasa pagitan ng 20 hanggang 49 sentimo. Bawat HC1 card ay may konsumo ng 250W, at ang isang standard na air-cooled rack na may 10 cards ay kailangan lang ng 12-15 KW, walang kailangang liquid cooling, samantalang ang GPU rack ay karaniwang nasa 120-600 KW.
Ang pagtataya ni Karl Freund, analyst ng Forbes, noong Pebrero ay: “Mas mabilis 10 beses kaysa sa pinakamabilis na platform ng inference (Cerebras Wafer-Scale Engine) at dalawang orden ng magnitude mas mabilis kaysa sa GPU.”
Mayroon ng ilang mahahalagang limitasyon. Ginagamit ng HC1 ang sariling 3-bit data format ng Taalas kasama ang 6-bit parameter, na nagpapakita ng napakalakas na quantization, kung saan ang pagkawala ng kalidad sa mga kumplikadong pag-iisip na gawain ay tiyak na umiiral. Ang data ng 17,000 token/second ay mula sa vendor benchmark na may 1K input/1K output, at hindi ito nagpapakita ng totoong performance sa production environment. Bukod pa rito, ang Llama 3.1 8B ay isang modelong ipinakilala sa gitna ng 2024, at ang quantized version ng 8B parameter ay kaya nang tumakbo sa Raspberry Pi 5. Ipinapakita ng HC1 ang potensyal ng arkitektura, hindi ang kompetitibong kakayahan ng isang matatag na produkto.
Ano ang gagawin kapag nagkakaroon ng pagbabago sa modelo?
Ibinubusok ang modelo sa chip, ang pinakadirektang tanong ay: Ano kung i-iterate ang modelo? Babasagin ba ang chip?
Ang sagot ni Taalas ay: Hindi ito iiwan. Ang tradisyonal na cycle ng pagdidisenyo ng ASIC ay higit sa dalawang taon. Gumawa ang Taalas ng isang automated na proseso ng pagdidisenyo, kung saan ang pagbabago ng kaunting metal mask sa itaas ng chip ay sapat upang i-compile ang bagong model sa bagong chip, na may cycle na halos 8 linggo. Ang kumpanya ay nagtatakda ng gastos para sa 3 pag-update ng chip sa loob ng 4-taong buhay na modelo.
Nakakalutas ng ilang bahagi ng pag-aalala, ngunit hindi ito lubos na natutunaw.
Ang fleksibilidad ng GPU ay nasa katotohanan na ang iisang card ay maaaring gamitin ngayon para sa Llama, bukas para sa Claude, at susunod na araw para sa isang bagong model na hindi pa ipinakilala. Hindi kayang gawin ng chip ng Taalas ang ganitong bagay. Kung ang isang customer ay kailangan ng maraming model para sa serbisyo (na karaniwan sa production environment), kailangan ng iba’t ibang chip para sa bawat model, na magdudulot ng pagtaas sa kahirapan sa pagpapamahala ng inventory at pagpapatakbo.
Nasa pag-unlad na ang HC2, na may layunin na modelo na may halos 20 milyong parameter at gumagamit ng 4-bit floating point para sa pagpapabuti ng precision. Ang Taalas ay orihinal na plano na suportahan ang frontier-level na modelo bago ang katapusan ng 2026.
Ang pagkuha ni AMD ay nagdala ng pagkakasundo sa mga produkto ng Instinct GPU at ang Helios rack system, kung saan ang mga customer ay maaaring gamitin ang GPU para sa mga flexible at nagbabagong workload, at ang Taalas chip para sa stable at high-frequency single-model inference.
Arms race for inference chips
Ang pagkakabili ni AMD sa Taalas ay ang pinakabagong transaksyon sa ilalim ng alon ng pagkakabili ng mga chip para sa inference sa nakaraang 8 buwan.
Sa Disyembre 2025, kinuha ni Nvidia ang Groq sa halagang $20 bilyon, nakakuha ng low-latency inference architecture na batay sa SRAM.
Sa Mayo 2026, ang Cerebras ay IPO na may halagang humigit-kumulang sa $56 bilyon sa market value, ang pinakamalaking tech IPO mula pa noong Snowflake noong 2020.
Sa Hunyo, natapos ng Etched ang dalawang taon at higit pa ng pagkakatago at inanunsyo ang pagkakamit ng unang chip na espesyal na para sa Transformer, na ginawa sa proseso ng TSMC N4P, kasama ang higit sa $1 bilyon na mga kontrata mula sa mga kliyente. Ayon sa mga ulat, sinundan ni Intel ang isang pahayag ng pagkakasundo sa SambaNova, habang tinatawagan ni Qualcomm ang Tenstorrent.
Ang mga transaksyong ito ay nagtuturo sa isang parehong pagpapasiya: ang pag-iisip ay naging pangunahing larangan ng paggastus sa computing power ng AI.
Ayon sa pagtataya ng industriya, ang inference ay magiging tatlong-kalahati ng gastos sa AI computing noong 2026, at hanggang 2030, ang mga espesyalisadong inference ASIC ay maaaring kumuha ng 45% ng market para sa inference. Ang GPU ni Nvidia ay patuloy na namamahala sa training side, ngunit sa inference side, ang kanilang pangkalahatang arkitektura ay nakakaranas ng hamon mula sa mga espesyalisadong chip sa lahat ng direksyon.
Ang Taalas ay nasa pinakamalayong dulo ng spektrum: itinatapon nito ang pagiging pangkalahatan ng "mga modelo ng klase isang" at direktang nagbuo ng espesyalisadong chip para sa "isang modelo".
Ginagamit ng Groq ang SRAM upang iwasan ang memory wall, ginagamit ng Cerebras ang wafer-scale area para mag-brute force, ino-optimize ng Etched ang Transformer architecture, habang mas malaki ang pagsisikap ng Taalas: naniniwala ito na magiging stabil ang AI models, tulad ng mga communication protocol na nagtatapos sa ilang mga istandard. Kapag hindi na nagbabago ang mga model nang buwan-buwan, ang paggawa ng isang espesyal na chip para sa bawat ilang pinakamalikhaing model ay maging ekonomiko.
Ang modelong pagtaya ay magiging “nakaputol”
Sinabi ni Vamsi Boppana, senior vice president ng AMD, sa pahayag na ang layunin ng pagkuha ay magbigay sa mga customer ng "optimal computing solution para sa bawat AI workload." Ang pahayag na ito ay isang estratehiya sa pakikipagkompetensya: ang GPU para sa flexibility, ang Taalas chip para sa extreme efficiency, at ang customer ay maaaring mag-combine ayon sa kanilang pangangailangan.
Ang pagkakatotoo ng logika na ito ay nakasalalay sa isang pangunahing aksiyoma: magiging maikli ba ang pag-update cycle ng AI model.
Kung patuloy na may mga pag-update sa arkitektura ng malalaking modelo bawat ilang buwan, ang pagpapalabas ng weights sa silicon ay parang pagbuhos ng konkreto sa buhangin—bago pa man mabawi ang chip, ang modelo ay naging obsolete na. Ngunit kung ang kakayahan ng modelo ay nagtatapos na at ang pagpapalit ng mga lider na modelo para sa dalawang taon ay naging karaniwan, ang mga espesyalisadong chip tulad ng Taalas ay magiging tulad ng mga baseband chip sa industriya ng komunikasyon—mula sa mga pagsusulit na palabas hanggang sa maging natural na pagpipilian.
Tingnan ang nakaraang 12 buwan, ang ritmo ng pag-update ng modelo ay may mga subtil na pagbabago. Ang pagitan sa Llama series mula sa 3.1 hanggang 3.2 hanggang 4 ay nagsisimula na magtagal, habang ang pagbabago sa arkitektura ng GPT mula sa 4 hanggang 4o hanggang 5 ay nagsisimula nang magmaliit. Mas maraming bagong modelo ay nagpapalit sa umiiral na arkitektura sa pamamagitan ng distilasyon, quantization, at fine-tuning, at ang pagpapalit ng base model ay nagsisimula nang magpabagal.
Kung patuloy ang trend na ito, tama ang pagtaya ni Taalas.
