May-akda: Xiao Bing
AMD ay bumili ng Taalas: Ang mga chip para sa inference ay nagsisimula nang i-etch ang weights ng model sa silikon
Agosto 6, ipinahayag ng AMD ang pagkakabili sa Toronto-based chip company na Taalas, na hindi isinagawa ang presyo ng transaksyon. Ang startup na ito, na itinatag noong 2023 at nakapag-fundraise ng $219 milyon, ay gawa ng isang bagay na tila magulo: sinisira ang mga timbang ng AI model nang direkta sa metal layer ng chip upang lumikha ng isang专用 chip na nagpapatakbo lamang ng isang model.
Ang paraan ng paggana ng GPU ay ang pag-iimbak ng mga parametro ng modelo sa high-bandwidth memory (HBM), at ang paulit-ulit na paghahatid ng data pababa at pataas sa mga unit ng pagkalkula habang nagpapatakbo. Ang prosesong "paghahatid" na ito ay naglalabas ng malaking dami ng enerhiya at oras, at kilala sa industriya bilang "memory wall." Ang paraan ng Taalas ay ang pag-alis ng paghahatid nang buo, at ang pagpapakapit ng mga weight sa mga transistor ng chip, kung saan ang pag-iimbak at pagkalkula ay nagiging iisa.
Ang gastos ay ang chip na ito ay maaaring patakaran ng isang modelo lamang, habang ang benepisyo ay ang pagtaas ng bilis at efficiency sa isang orden ng dakilang paglago.
Ano ang ibig sabihin ng 17,000 token/second?
Ang teknikal na veripikasyon na chip na HC1 ng Taalas ay batay sa 6nm process ng TSMC, may 815 mm² na surface area at 53 bilyon na transistor, at ang nakabuilt na model nito ay ang Meta's Llama 3.1 8B.
Ang performance score ng HC1: humigit-kumulang 17,000 token/segundo per user. Para sa pagkukumpara, ang Nvidia H200 ay humigit-kumulang 230 token/segundo, at ang H100 ay 150 token/segundo sa parehong model. 73 beses ang bilis, ngunit ang pagkakagamit ng enerhiya ay lamang ang sampu-sampu ng huling dalawa.
Mas maayos na pagsusuri ng ekonomiya: Ang inihayag na gastos sa pagpapatakbo ng Taalas ay humigit-kumulang 0.75 sentimo bawat milyong Token (Llama 8B), habang ang mga solusyon sa GPU ay nasa pagitan ng 20 hanggang 49 sentimo. Bawat HC1 card ay may consumpso ng 250W, at ang isang standard na air-cooled rack na may 10 cards ay kailangan lang ng 12-15 KW, walang kailangang liquid cooling, samantalang ang mga rack ng GPU ay maaaring mag-antay ng 120-600 KW.
Sinabi ng analyst ng Forbes na Karl Freund noong pagsusuri noong Pebrero: “Mas mabilis 10 beses kaysa sa pinakamabilis na platform ng inference (Cerebras wafer-scale engine) at dalawang orden ng magnitude mas mabilis kaysa sa GPU.”
Mayroon ng ilang mahahalagang limitasyon. Ginagamit ng HC1 ang sariling 3-bit data format ng Taalas kasama ang 6-bit parameter, na nagpapakita ng matinding quantization, at ang pagkawala ng kalidad sa mga kumplikadong pag-iisip na gawain ay tiyak na umiiral. Ang data ng 17,000 token/second ay mula sa vendor benchmark na may 1K input/1K output, at hindi ito nagpapakita ng totoong performance sa production environment. Bukod pa rito, ang Llama 3.1 8B ay isang modelong ipinakilala sa gitna ng 2024, at ang quantized version ng 8B parameter ay kaya nang tumakbo sa Raspberry Pi 5. Ipinapakita ng HC1 ang potensyal ng arkitektura, hindi ang kakayahan ng isang matatag na produkto.
Ano ang gagawin kapag nagkakaroon ng pagbabago sa modelo?
Ibinubusok ang modelo sa chip, ang pinakamadaling tanong ay: Ano ang gagawin kung i-iterate ang modelo? Babasagin ba ang chip?
Sagot ni Taalas: Hindi ito gagawing walang kwenta. Ang tradisyonal na cycle ng pagdidisenyo ng ASIC ay higit sa dalawang taon. Gumawa ang Taalas ng isang automated design process kung saan ang pagbabago ng kaunting metal mask sa taas ng chip ay sapat upang i-compile ang bagong model sa bagong chip, na may cycle na halos 8 linggo. Ang kumpanya ay naglalagay ng gastos para sa 3 pag-update ng chip sa loob ng 4-taong lifecycle sa kanilang cost model.
Ang sagot na ito ay nakakalutas ng ilang bahagi ng pagkabalisa, ngunit hindi ito maaalis nang buo.
Ang pagkakaroon ng fleksibilidad ng GPU ay ang kakayahang gamitin ang iisang card ngayon para sa Llama, bukas para sa Claude, at kahapon para sa isang bagong model na hindi pa ipinapakita. Hindi kayang gawin ng chip ng Taalas ang ganitong bagay. Kung ang isang customer ay nangangailangan ng maraming model para sa serbisyo (na karaniwan sa production environment), kailangan ng iba’t ibang chip para sa bawat model, na magdudulot ng pagtaas sa kahirapan sa pagpaplano ng inventory at pagpapanatili.
Nasa pag-unlad na ang HC2, na may layunin na modelo na may halos 20 bilyong parameter, gamit ang 4-bit floating point para sa pagpapabuti ng precision. Ang Taalas ay orihinal na plano na suportahan ang frontier-level na modelo bago ang dulo ng 2026.
Ang pagkuha ni AMD ay nagdala ng koordinasyon sa mga produkto ng Instinct GPU at ang Helios rack system, kung saan ang mga customer ay maaaring gamitin ang GPU para sa mga flexible at nagbabagong workload, at ang Taalas chip para sa stable at high-frequency single-model inference.
Ang arms race ng inference chips
Kinuha ng AMD ang Taalas, na ang pinakabagong pagkakabili sa gitna ng alon ng pagkakabili ng mga chip para sa inference sa nakaraang 8 buwan.
Sa Disyembre 2025, kinuha ni Nvidia ang Groq sa halagang $20 bilyon, nakakuha ng low-latency inference architecture na batay sa SRAM.
Sa Mayo 2026, ang Cerebras ay IPO na may halagang halos $56 bilyon sa market capitalization, ang pinakamalaking tech IPO mula pa noong Snowflake noong 2020.
Sa Hunyo, natapos ng Etched ang dalawang taon at higit pa ng pagkakatago at inanunsyo ang kanilang unang chip na espesyal para sa Transformer, na natapos na sa proseso ng TSMC N4P, kasama ang higit sa $1 bilyon na mga kontrata ng mga kliyente. Ayon sa mga ulat, sinignahan ni Intel ang isang letter of intent para sa pagbili kay SambaNova, habang tinatawagan ni Qualcomm si Tenstorrent.
Ang mga transaksyon na ito ay nagtuturo sa isang parehong pagpapasya: ang pag-iisip ay naging pangunahing larangan ng paggastos sa computing power ng AI.
Ayon sa pagtataya ng industriya, ang inference ay magiging tatlong-kalahati ng gastos sa AI computing noong 2026, at hanggang 2030, ang mga espesyalisadong inference ASIC ay maaaring makakuha ng 45% ng market para sa inference. Ang GPU ni Nvidia ay patuloy na namamahala sa training side, ngunit sa inference side, ang kanyang pangkalahatang arkitektura ay nakakatagpo ng hamon mula sa mga espesyalisadong chip sa lahat ng direksyon.
Ang Taalas ay nasa pinakamalayong dulo ng spektrum: itinatapon nito ang universalidad ng "isang uri ng modelo" at direktang nagbuo ng espesyalisadong chip para sa "isang modelo".
Ginagamit ng Groq ang SRAM upang iwasan ang memory wall, ginagamit ng Cerebras ang wafer-scale area para mag-brute force, ino-optimize ng Etched ang Transformer architecture, habang mas malakas ang taya ng Taalas: naniniwala ito na magiging stable na ang AI models, tulad ng mga communication protocol na nagtatapos sa ilang mga standard. Kapag hindi na nagbabago ang mga model araw-araw, ang paggawa ng espesyal na chip para sa bawat ilang pinakamalikhaing model ay ekonomiko.
Ang modelong pagtaya ay magiging “nakaputol”
Sinabi ni Vamsi Boppana, Senior Vice President ng AMD, sa pahayag na ang layunin ng pagkuha ay magbigay sa mga customer ng "optimal computing solution para sa bawat AI workload." Ang pahayag na ito ay isang estratehiya sa pakikipagkompetensya: ang GPU para sa flexibility, ang Taalas chip para sa extreme efficiency, at ang customer ang pumipili ng kombinasyon ayon sa kanilang pangangailangan.
Kakatwiran ng kombinasyong ito ay nakasalalay sa isang pangunahing aksiyoma: magiging mabagal ba ang pag-update ng mga modelo ng AI.
Kung patuloy na may mga pag-update sa arkitektura ng malalaking modelo bawat ilang buwan, ang pagpapalabas ng weights sa silicon ay parang pagbuhos ng konkreto sa buhangin—bago pa man mabawi ang chip, ang modelo ay naging obsolete na. Ngunit kung ang kakayahan ng modelo ay nagsisimulang mag-converge, at ang pagpapagana ng mga lider na modelo nang magkakasama sa loob ng dalawang taon ay naging karaniwan, ang mga espesyalisadong chip tulad ng Taalas ay maaaring maging tulad ng mga baseband chip sa industriya ng komunikasyon: mula sa mga pagsusulit na kakaibang ideya hanggang sa maging natural na pagpipilian.
Tingnan ang nakaraang 12 buwan, ang ritmo ng pag-update ng modelo ay may mga subtil na pagbabago. Ang pagitan sa Llama series mula sa 3.1 hanggang 3.2 at sa 4 ay nagiging mas mahaba, habang ang pagbabago sa arkitektura ng GPT mula sa 4 hanggang 4o at sa 5 ay nagiging mas maliit. Mas maraming mga bagong modelo ay nagsasagawa ng distilasyon, quantization, at fine-tuning sa umiiral na arkitektura, at ang pagpapalit ng base model ay nagsisimulang magpabagal.
Kung patuloy ang trend na ito, tama ang pagtaya ni Taalas.
Twitter:https://twitter.com/BitpushNewsCN
BitPush TG community group: https://t.me/BitPushCommunity
Biyak na ang TG subscription ni BitPush: https://t.me/bitpush
