Ditulis oleh Xiao Bing
Pada 6 Ogos, AMD mengumumkan pengambilalihan syarikat cip Toronto, Taalas, dengan harga transaksi yang tidak diumumkan. Syarikat permulaan ini, yang ditubuhkan pada 2023 dan telah memperoleh pendanaan sebanyak $219 juta, melakukan perkara yang kedengaran agak gila: membakar timbangan model AI secara langsung ke dalam lapisan logam cip untuk menghasilkan cip khusus yang hanya boleh menjalankan satu model.
GPU berfungsi dengan menyimpan parameter model dalam memori berpemandu tinggi (HBM), dan semasa inferens, data dipindahkan berulang kali masuk dan keluar unit pengiraan. Proses "pemindahan" ini menghabiskan banyak tenaga dan masa, dan dikenali sebagai "dinding memori" oleh industri. Pendekatan Taalas adalah menghapuskan pemindahan sepenuhnya, dengan menetapkan berat dalam transistor cip, menggabungkan penyimpanan dan pengiraan menjadi satu.
Harganya ialah cip ini hanya boleh menjalankan satu model, manfaatnya ialah peningkatan berperingkat dalam kelajuan dan kecekapan tenaga.
Apakah 17000 token/second bermaksud apa?
Cip pengesahan teknikal Taalas, HC1, berdasarkan proses 6nm TSMC, dengan luas cip 815 mm² dan 53 miliar transistor, dengan model binaan dalamnya ialah Llama 3.1 8B daripada Meta.
Data performa HC1: sekitar 17,000 token/detik untuk pengguna tunggal. Sebagai perbandingan, Nvidia H200 menghasilkan sekitar 230 token/detik dan H100 sekitar 150 token/detik pada model yang sama. Perbezaan kelajuan 73 kali, dengan penggunaan kuasa hanya sepuluh peratus daripada yang terakhir.
Perkiraan ekonomi yang lebih intuitif: Kos inferens yang dilaporkan Taalas adalah sekitar 0.75 sen setiap juta Token (Llama 8B), manakala penyelesaian GPU berada dalam julat 20 hingga 49 sen. Setiap kad HC1 mempunyai penggunaan kuasa 250W, dan satu rak penyejukan udara standard yang memuatkan 10 kad hanya memerlukan 12-15 KW, tanpa memerlukan penyejukan cecair, manakala rak GPU biasanya memerlukan 120-600 KW.
Analis Forbes, Karl Freund, menilai pada bulan Februari: “10 kali lebih pantas daripada platform inferensia paling pantas (Cerebras Wafer-Scale Engine), dan dua peringkat lebih pantas daripada GPU.”
Namun, terdapat beberapa syarat terhadap HC1. HC1 menggunakan format data 3-bit buatan Taalas bersama parameter 6-bit, dengan kuantisasi yang sangat agresif, sehingga kehilangan kualiti dalam tugas penalaran kompleks adalah pasti. Data 17,000 token/detik berasal dari ujian piawaian pemasok dengan input 1K/output 1K, dan tidak mewakili prestasi sebenar dalam persekitaran pengeluaran. Selain itu, Llama 3.1 8B adalah model yang dilancarkan pertengahan 2024, dan versi kuantisasi dengan 8B parameter bahkan boleh berjalan di Raspberry Pi 5. HC1 menunjukkan potensi arsitektur, bukan daya saing produk yang matang.
Bagaimana jika model diganti?
Memasukkan model ke dalam cip, masalah paling intuitif ialah: apa yang berlaku jika model diubah suai? Cip menjadi tidak berguna?
Jawapan Taalas ialah: Tidak akan dibuang. Kitaran reka bentuk ASIC tradisional memerlukan lebih daripada dua tahun. Taalas telah membangunkan proses reka bentuk automatik yang hanya memerlukan pengubahsuaian sedikit topeng logam pada lapisan atas cip untuk mengkompilasikan model baharu menjadi cip baharu, dengan kitaran sekitar 8 minggu. Syarikat tersebut telah menganggarkan kos untuk tiga kemas kini cip dalam tempoh hayat empat tahun dalam model kos mereka.
Jawapan ini dapat menyelesaikan sebahagian kecemasan, tetapi tidak dapat menghilangkannya sepenuhnya.
Kefleksibelan GPU terletak pada keupayaan kad yang sama untuk menjalankan Llama hari ini, Claude esok, dan model baharu yang belum dilancarkan lusa. Cip Taalas tidak mampu melakukan ini. Jika seorang pelanggan memerlukan perkhidmatan beberapa model secara serentak (yang sangat biasa dalam persekitaran pengeluaran), mereka perlu menyediakan cip yang berbeza untuk setiap model, yang akan meningkatkan kerumitan pengurusan stok dan operasi.
HC2 sedang dalam pembangunan, dengan sasaran model berukuran sekitar 20 bilion parameter menggunakan peningkatan ketepatan 4-bit floating point. Taalas asalnya merancang untuk menyokong model tingkat terkini sebelum akhir 2026.
Pengambilalihan AMD membawa sinergi antara rangkaian produk Instinct GPU dan sistem rak Helios, membolehkan pelanggan menggunakan GPU untuk menangani beban kerja yang fleksibel dan berubah-ubah, serta chip Taalas untuk inferensi model tunggal yang stabil dan frekuensi tinggi.
Perlumbangan cip inferens
AMD mengakuisisi Taalas, yang merupakan transaksi terbaru dalam gelombang pengambilalihan cip inferensia selapan-lapan bulan terakhir dari segi konteks industri.
Pada Disember 2025, Nvidia mengakuisisi Groq seharga US$20 bilion, memperoleh arsitektur inferensi latensi rendah berbasis SRAM.
Pada Mei 2026, Cerebras membuat IPO dengan nilai pasaran sekitar US$560 bilion, menjadi IPO teknologi terbesar sejak Snowflake pada 2020.
Pada Jun, Etched mengakhiri tempoh selama dua tahun lebih tanpa pengumuman, mengumumkan bahawa cip pertama khas untuk Transformer telah berjaya diproduksi menggunakan proses N4P TSMC, dengan kontrak pelanggan melebihi US$1 bilion. Dilaporkan bahawa Intel telah menandatangani surat niat untuk mengambil alih SambaNova, manakala Qualcomm sedang berhubung dengan Tenstorrent.
Transaksi-transaksi ini menunjukkan satu kesimpulan yang sama: penalaran sedang menjadi medan pertempuran utama dalam perbelanjaan kuasa AI.
Ramalan industri memperkirakan bahawa inferens akan mengambil sepertiga daripada perbelanjaan komputasi AI pada tahun 2026, dan pada tahun 2030, ASIC inferens khas mungkin menguasai 45% pasaran inferens. GPU Nvidia masih mendominasi sisi latihan, tetapi dalam inferens, arsitektur generiknya sedang menghadapi cabaran daripada cip khas dari pelbagai arah.
Taalas berada di hujung paling ekstrem spektrum ini: ia melepaskan keupayaan am "model kelas satu" dan terus menghasilkan cip khas untuk "satu model".
Groq menggunakan SRAM untuk mengelakkan dinding memori, Cerebras menggunakan luas wafer untuk menerobos secara kasar, Etched hanya dioptimaskan untuk arsitektur Transformer, sementara Taalas membuat taruhan yang lebih berani: ia bertaruh bahawa model AI akan menjadi stabil seiring masa, seperti protokol komunikasi yang akhirnya bermuara kepada beberapa standard utama. Apabila model tidak lagi berubah setiap bulan, membuat cip khusus terpisah untuk beberapa model paling popular menjadi secara ekonomi bermanfaat.
Model pertaruhan akan "membeku"
Vamsi Boppana, Naib Presiden Kanan AMD, mengatakan dalam pengumuman itu bahawa tujuan pengambilalihan ialah untuk memberikan pelanggan "penyelesaian pengiraan optimum untuk setiap beban kerja AI". Perkataan ini diterjemahkan sebagai strategi persaingan: GPU bertanggungjawab atas fleksibiliti, manakala cip Taalas bertanggungjawab atas kecekapan ekstrem, membolehkan pelanggan menggabungkan mengikut keperluan.
Kebolehan logik kombinasi ini bergantung kepada satu andaian utama: sama ada kitaran kemas kini model AI akan melambat.
Jika model besar terus mengalami pembaharuan aras arsitektur setiap beberapa bulan, maka pendekatan membakar bobot ke dalam silikon ibarat menuangkan konkrit di atas pasir bergerak—chip belum lagi balik modal, model sudah usang. Tetapi jika kemampuan model cenderung mencapai titik stabil, dan model terkemuka mampu memberikan perkhidmatan stabil selama satu atau dua tahun menjadi norma, maka chip khusus seperti Taalas akan menjadi pilihan yang wajar, sama seperti chip baseband dalam industri komunikasi, berubah daripada eksperimen gila menjadi pilihan yang logik.
Melihat semula 12 bulan terakhir, tempoh pembaharuan model memang menunjukkan perubahan halus. Jarak antara Llama 3.1, 3.2, dan 4 semakin memanjang, manakala perubahan arsitektur GPT dari 4 ke 4o ke 5 semakin berkurang. Lebih banyak model baru dibangunkan melalui distilasi, kuantisasi, dan penyesuaian halus pada arsitektur sedia ada, dan kitaran pengembangan model dasar sedang melambat.
Jika tren ini berterusan, Taalas tebak dengan betul.
