Penulis: Xiao Bing
AMD membeli Taalas: Cip inferensia mula mengukir bobot model ke dalam silikon
Pada 6 Ogos, AMD mengumumkan pengambilalihan syarikat cip Toronto, Taalas, dengan harga transaksi yang tidak diumumkan. Syarikat permulaan yang ditubuhkan pada 2023 dan telah memperoleh pendanaan sebanyak $219 juta ini telah melakukan perkara yang kedengarannya agak gila: membakar AI weight secara langsung ke dalam lapisan logam cip, mencipta cip khusus yang hanya boleh menjalankan satu model.
GPU berfungsi dengan menyimpan parameter model dalam memori berpemandu tinggi (HBM), dan semasa inferens, data dipindahkan berulang kali masuk dan keluar unit pengiraan. Proses "pemindahan" ini menghabiskan banyak tenaga dan masa, dan dikenali sebagai "dinding memori" oleh industri. Pendekatan Taalas adalah menghapuskan pemindahan sepenuhnya, dengan mengukuhkan berat dalam transistor cip, menggabungkan penyimpanan dan pengiraan menjadi satu.
Harganya ialah cip ini hanya boleh menjalankan satu model, manfaatnya ialah peningkatan berperingkat dalam kelajuan dan kecekapan tenaga.
Apakah 17000 token/second bermaksud apa?
Cip pengesahan teknikal Taalas, HC1, berdasarkan proses 6nm TSMC, dengan luas cip 815 mm² dan 53 miliar transistor, dengan model binaan dalamnya ialah Llama 3.1 8B daripada Meta.
Data perfomans HC1: sekitar 17,000 token/detik untuk pengguna tunggal. Sebagai perbandingan, Nvidia H200 menghasilkan sekitar 230 token/detik dan H100 sekitar 150 token/detik pada model yang sama. Perbezaan kelajuan 73 kali, dengan penggunaan kuasa hanya sepuluh peratus daripada yang terakhir.
Perhitungan ekonomi yang lebih intuitif: Kos inferens yang dilaporkan oleh Taalas adalah sekitar 0.75 sen setiap juta Token (Llama 8B), manakala penyelesaian GPU berada dalam julat 20 hingga 49 sen. Setiap kad HC1 mempunyai penggunaan kuasa 250W, dan satu rak sejuk-udara standard yang memuatkan 10 kad hanya memerlukan 12-15 KW, tanpa memerlukan penyejukan cecair, manakala rak GPU biasanya memerlukan 120-600 KW.
Analis Forbes, Karl Freund, menilai pada Februari: “Lebih cepat 10 kali daripada platform inferensi tercepat (Cerebras Wafer-Scale Engine), dan lebih cepat dua peringkat daripada GPU.”
Tetapi terdapat beberapa syarat penting. HC1 menggunakan format data 3-bit buatan Taalas bersama parameter 6-bit, dengan kuantisasi yang sangat agresif, sehingga kehilangan kualiti pada tugas penalaran kompleks adalah pasti berlaku. Data 17000 token/detik berasal dari ujian piawaian pemasok dengan input 1K/output 1K, dan tidak mewakili prestasi sebenar dalam persekitaran pengeluaran. Selain itu, Llama 3.1 8B adalah model yang dilancarkan pertengahan 2024, dan versi kuantisasi dengan 8B parameter bahkan boleh berjalan di Raspberry Pi 5. HC1 menunjukkan potensi arsitektur, bukan daya saing produk yang matang.
Apa yang perlu dilakukan apabila model diganti?
Membakar model ke dalam cip, masalah paling intuitif ialah: apa yang berlaku jika model diubah suai? Cip menjadi tidak berguna?
Jawapan Taalas ialah: Tidak akan dibuang. Kitaran reka bentuk ASIC tradisional memerlukan lebih daripada dua tahun. Taalas telah membangunkan proses reka bentuk automatik yang hanya memerlukan perubahan kepada sedikit topeng logam di atas cip untuk mengompilasikan model baharu menjadi cip baharu, dengan kitaran sekitar 8 minggu. Syarikat tersebut telah menganggarkan kos untuk tiga kali pembaharuan cip dalam tempoh hayat empat tahun dalam model kosnya.
Jawapan ini dapat menyelesaikan sebahagian kecemasan, tetapi tidak dapat menghilangkannya sepenuhnya.
Kekeluasan GPU terletak pada keupayaan kad yang sama untuk menjalankan Llama hari ini, Claude esok, dan model baharu yang belum dilancarkan lusa. Cip Taalas tidak mampu melakukan ini. Jika seorang pelanggan memerlukan perkhidmatan beberapa model secara serentak (yang sangat biasa dalam persekitaran pengeluaran), mereka perlu menyediakan cip yang berbeza untuk setiap model, yang akan meningkatkan kerumitan pengurusan stok dan pengurusan operasi.
HC2 sedang dalam pembangunan, dengan sasaran model berukuran sekitar 20 bilion parameter, menggunakan titik terapung 4-bit untuk meningkatkan ketepatan. Taalas asalnya merancang untuk menyokong model terkini sebelum akhir 2026.
Pengambilalihan AMD membawa sinergi antara jajaran produk Instinct GPU dan sistem rak Helios, membolehkan pelanggan menggunakan GPU untuk beban kerja yang fleksibel dan berubah-ubah, serta chip Taalas untuk inferensi model tunggal yang stabil dan frekuensi tinggi.
Perlumbangan cip inferens
AMD mengakuisisi Taalas, yang merupakan transaksi terkini dalam gelombang pengambilalihan chip inferensia selapan-lapan bulan terakhir dari sudut pandang industri.
Pada Disember 2025, Nvidia mengakuisisi Groq sebanyak US$20 bilion, menguasai arsitektur inferensi latensi rendah berbasis SRAM.
Pada Mei 2026, Cerebras membuat IPO dengan nilai pasaran sekitar US$560 bilion, menjadi IPO teknologi terbesar sejak Snowflake pada 2020.
Pada Jun, Etched mengakhiri tempoh tersembunyi selama lebih daripada dua tahun, mengumumkan bahawa cip pertama khas untuk Transformer telah berjaya diproduksi menggunakan proses N4P TSMC, dengan kontrak pelanggan melebihi 10 miliar dolar AS. Dilaporkan bahawa Intel telah menandatangani surat niat untuk mengambil alih SambaNova, manakala Qualcomm sedang berhubung dengan Tenstorrent.
Transaksi-transaksi ini menunjukkan kesimpulan yang sama: penalaran sedang menjadi medan pertempuran utama dalam perbelanjaan kuasa AI.
Perkiraan industri menunjukkan bahawa inferens akan mengambil sepertiga daripada perbelanjaan komputasi AI pada tahun 2026, dan pada tahun 2030, ASIC inferens khas mungkin menguasai 45% pasaran inferens. GPU Nvidia masih mendominasi sisi latihan, tetapi arsitektur umumnya sedang menghadapi cabaran daripada cip khas di sisi inferens.
Taalas berada di hujung paling ekstrem spektrum ini: ia melepaskan keupayaan am "model kelas satu" dan terus menghasilkan cip khas untuk "satu model".
Groq menggunakan SRAM untuk mengelakkan dinding memori, Cerebras menggunakan luas wafer untuk menerobos secara kasar, Etched hanya dioptimaskan untuk arsitektur Transformer, sementara pelaburan Taalas lebih agresif: ia bertaruh bahawa model AI akan menjadi stabil seiring masa, seperti protokol komunikasi yang akhirnya bermuara kepada beberapa standard utama. Apabila model tidak lagi bertukar setiap bulan, membuat cip khusus untuk setiap beberapa model paling popular menjadi ekonomik.
Model pertaruhan akan "membeku"
Vamsi Boppana, Naib Presiden Kanan AMD, mengatakan dalam pengumuman itu bahawa tujuan pengambilalihan ialah untuk memberikan pelanggan "penyelesaian pengiraan optimum untuk setiap beban kerja AI". Perkataan ini diterjemahkan sebagai strategi persaingan: GPU bertanggungjawab atas fleksibiliti, manakala cip Taalas bertanggungjawab atas kecekapan ekstrem, membolehkan pelanggan menggabungkan mengikut keperluan.
Kebolehan logik pasangan ini bergantung kepada satu andaian utama: sama ada kitaran kemas kini model AI akan melambat.
Jika model besar terus mengalami kemasukan arsitektur setiap beberapa bulan, maka pendekatan membakar bobot ke dalam silikon sama seperti menuangkan konkrit di atas pasir bergerak—chip belum pulang modal, model sudah usang. Tetapi jika kemampuan model cenderung mencapai titik stabil, dan model terkemuka mampu memberikan perkhidmatan stabil selama satu atau dua tahun menjadi norma, maka chip khusus seperti Taalas akan menjadi pilihan yang wajar, sama seperti chip baseband dalam industri komunikasi, beralih dari eksperimen gila menjadi pilihan yang logik.
Melihat semula 12 bulan terakhir, tempoh pembaruan model memang menunjukkan perubahan halus. Jarak antara Llama 3.1, 3.2, dan 4 semakin memanjang, manakala perubahan arsitektur antara GPT-4, GPT-4o, dan GPT-5 semakin berkurang. Lebih banyak model baru dibangunkan melalui distilasi, kuantisasi, dan penyesuaian halus pada arsitektur sedia ada, dan kitaran pembaruan model dasar sedang melambat.
Jika tren ini berterusan, Taalas tepat menebak.
Twitter:https://twitter.com/BitpushNewsCN
Kumpulan perbincangan TG BitPush: https://t.me/BitPushCommunity
Langgan BitPush di TG: https://t.me/bitpush
