AMD Mengakuisisi Taalas untuk Mencantumkan Berat Model AI ke Dalam Cip

iconBitPush
Kongsi
AI summary iconRingkasan
AMD telah mengakuisisi syarikat cip berasaskan Toronto, Taalas, yang menanamkan berat model AI secara langsung ke dalam silikon. Cip HC1 Taalas, yang dibina di atas TSMC 6nm, menjalankan model Meta Llama 3.1 8B pada 17,000 token per saat, melebihi Nvidia H200 dan H100 dari segi kelajuan dan kecekapan tenaga. Cip ini menggunakan format 3-bit dan dikemas kini dalam 8 minggu melalui perubahan topeng logam. AMD merancang untuk mengintegrasikan cip inferens Taalas dengan jajaran GPU-nya untuk beban kerja AI. Berita AI + kripto ini muncul semasa data inflasi berubah dan permintaan untuk pengkomputeran yang cekap meningkat.

Penulis: Xiao Bing

AMD membeli Taalas: Cip inferensia mula mengukir bobot model ke dalam silikon


Pada 6 Ogos, AMD mengumumkan pengambilalihan syarikat cip Toronto, Taalas, dengan harga transaksi yang tidak diumumkan. Syarikat permulaan yang ditubuhkan pada 2023 dan telah memperoleh pendanaan sebanyak $219 juta ini telah melakukan perkara yang kedengarannya agak gila: membakar AI weight secara langsung ke dalam lapisan logam cip, mencipta cip khusus yang hanya boleh menjalankan satu model.

GPU berfungsi dengan menyimpan parameter model dalam memori berpemandu tinggi (HBM), dan semasa inferens, data dipindahkan berulang kali masuk dan keluar unit pengiraan. Proses "pemindahan" ini menghabiskan banyak tenaga dan masa, dan dikenali sebagai "dinding memori" oleh industri. Pendekatan Taalas adalah menghapuskan pemindahan sepenuhnya, dengan mengukuhkan berat dalam transistor cip, menggabungkan penyimpanan dan pengiraan menjadi satu.

Harganya ialah cip ini hanya boleh menjalankan satu model, manfaatnya ialah peningkatan berperingkat dalam kelajuan dan kecekapan tenaga.

Apakah 17000 token/second bermaksud apa?

Cip pengesahan teknikal Taalas, HC1, berdasarkan proses 6nm TSMC, dengan luas cip 815 mm² dan 53 miliar transistor, dengan model binaan dalamnya ialah Llama 3.1 8B daripada Meta.

Data perfomans HC1: sekitar 17,000 token/detik untuk pengguna tunggal. Sebagai perbandingan, Nvidia H200 menghasilkan sekitar 230 token/detik dan H100 sekitar 150 token/detik pada model yang sama. Perbezaan kelajuan 73 kali, dengan penggunaan kuasa hanya sepuluh peratus daripada yang terakhir.

Perhitungan ekonomi yang lebih intuitif: Kos inferens yang dilaporkan oleh Taalas adalah sekitar 0.75 sen setiap juta Token (Llama 8B), manakala penyelesaian GPU berada dalam julat 20 hingga 49 sen. Setiap kad HC1 mempunyai penggunaan kuasa 250W, dan satu rak sejuk-udara standard yang memuatkan 10 kad hanya memerlukan 12-15 KW, tanpa memerlukan penyejukan cecair, manakala rak GPU biasanya memerlukan 120-600 KW.

Analis Forbes, Karl Freund, menilai pada Februari: “Lebih cepat 10 kali daripada platform inferensi tercepat (Cerebras Wafer-Scale Engine), dan lebih cepat dua peringkat daripada GPU.”

Tetapi terdapat beberapa syarat penting. HC1 menggunakan format data 3-bit buatan Taalas bersama parameter 6-bit, dengan kuantisasi yang sangat agresif, sehingga kehilangan kualiti pada tugas penalaran kompleks adalah pasti berlaku. Data 17000 token/detik berasal dari ujian piawaian pemasok dengan input 1K/output 1K, dan tidak mewakili prestasi sebenar dalam persekitaran pengeluaran. Selain itu, Llama 3.1 8B adalah model yang dilancarkan pertengahan 2024, dan versi kuantisasi dengan 8B parameter bahkan boleh berjalan di Raspberry Pi 5. HC1 menunjukkan potensi arsitektur, bukan daya saing produk yang matang.

Apa yang perlu dilakukan apabila model diganti?

Membakar model ke dalam cip, masalah paling intuitif ialah: apa yang berlaku jika model diubah suai? Cip menjadi tidak berguna?

Jawapan Taalas ialah: Tidak akan dibuang. Kitaran reka bentuk ASIC tradisional memerlukan lebih daripada dua tahun. Taalas telah membangunkan proses reka bentuk automatik yang hanya memerlukan perubahan kepada sedikit topeng logam di atas cip untuk mengompilasikan model baharu menjadi cip baharu, dengan kitaran sekitar 8 minggu. Syarikat tersebut telah menganggarkan kos untuk tiga kali pembaharuan cip dalam tempoh hayat empat tahun dalam model kosnya.

Jawapan ini dapat menyelesaikan sebahagian kecemasan, tetapi tidak dapat menghilangkannya sepenuhnya.

Kekeluasan GPU terletak pada keupayaan kad yang sama untuk menjalankan Llama hari ini, Claude esok, dan model baharu yang belum dilancarkan lusa. Cip Taalas tidak mampu melakukan ini. Jika seorang pelanggan memerlukan perkhidmatan beberapa model secara serentak (yang sangat biasa dalam persekitaran pengeluaran), mereka perlu menyediakan cip yang berbeza untuk setiap model, yang akan meningkatkan kerumitan pengurusan stok dan pengurusan operasi.

HC2 sedang dalam pembangunan, dengan sasaran model berukuran sekitar 20 bilion parameter, menggunakan titik terapung 4-bit untuk meningkatkan ketepatan. Taalas asalnya merancang untuk menyokong model terkini sebelum akhir 2026.

Pengambilalihan AMD membawa sinergi antara jajaran produk Instinct GPU dan sistem rak Helios, membolehkan pelanggan menggunakan GPU untuk beban kerja yang fleksibel dan berubah-ubah, serta chip Taalas untuk inferensi model tunggal yang stabil dan frekuensi tinggi.

Perlumbangan cip inferens

AMD mengakuisisi Taalas, yang merupakan transaksi terkini dalam gelombang pengambilalihan chip inferensia selapan-lapan bulan terakhir dari sudut pandang industri.

Pada Disember 2025, Nvidia mengakuisisi Groq sebanyak US$20 bilion, menguasai arsitektur inferensi latensi rendah berbasis SRAM.

Pada Mei 2026, Cerebras membuat IPO dengan nilai pasaran sekitar US$560 bilion, menjadi IPO teknologi terbesar sejak Snowflake pada 2020.

Pada Jun, Etched mengakhiri tempoh tersembunyi selama lebih daripada dua tahun, mengumumkan bahawa cip pertama khas untuk Transformer telah berjaya diproduksi menggunakan proses N4P TSMC, dengan kontrak pelanggan melebihi 10 miliar dolar AS. Dilaporkan bahawa Intel telah menandatangani surat niat untuk mengambil alih SambaNova, manakala Qualcomm sedang berhubung dengan Tenstorrent.

Transaksi-transaksi ini menunjukkan kesimpulan yang sama: penalaran sedang menjadi medan pertempuran utama dalam perbelanjaan kuasa AI.

Perkiraan industri menunjukkan bahawa inferens akan mengambil sepertiga daripada perbelanjaan komputasi AI pada tahun 2026, dan pada tahun 2030, ASIC inferens khas mungkin menguasai 45% pasaran inferens. GPU Nvidia masih mendominasi sisi latihan, tetapi arsitektur umumnya sedang menghadapi cabaran daripada cip khas di sisi inferens.

Taalas berada di hujung paling ekstrem spektrum ini: ia melepaskan keupayaan am "model kelas satu" dan terus menghasilkan cip khas untuk "satu model".

Groq menggunakan SRAM untuk mengelakkan dinding memori, Cerebras menggunakan luas wafer untuk menerobos secara kasar, Etched hanya dioptimaskan untuk arsitektur Transformer, sementara pelaburan Taalas lebih agresif: ia bertaruh bahawa model AI akan menjadi stabil seiring masa, seperti protokol komunikasi yang akhirnya bermuara kepada beberapa standard utama. Apabila model tidak lagi bertukar setiap bulan, membuat cip khusus untuk setiap beberapa model paling popular menjadi ekonomik.

Model pertaruhan akan "membeku"

Vamsi Boppana, Naib Presiden Kanan AMD, mengatakan dalam pengumuman itu bahawa tujuan pengambilalihan ialah untuk memberikan pelanggan "penyelesaian pengiraan optimum untuk setiap beban kerja AI". Perkataan ini diterjemahkan sebagai strategi persaingan: GPU bertanggungjawab atas fleksibiliti, manakala cip Taalas bertanggungjawab atas kecekapan ekstrem, membolehkan pelanggan menggabungkan mengikut keperluan.

Kebolehan logik pasangan ini bergantung kepada satu andaian utama: sama ada kitaran kemas kini model AI akan melambat.

Jika model besar terus mengalami kemasukan arsitektur setiap beberapa bulan, maka pendekatan membakar bobot ke dalam silikon sama seperti menuangkan konkrit di atas pasir bergerak—chip belum pulang modal, model sudah usang. Tetapi jika kemampuan model cenderung mencapai titik stabil, dan model terkemuka mampu memberikan perkhidmatan stabil selama satu atau dua tahun menjadi norma, maka chip khusus seperti Taalas akan menjadi pilihan yang wajar, sama seperti chip baseband dalam industri komunikasi, beralih dari eksperimen gila menjadi pilihan yang logik.

Melihat semula 12 bulan terakhir, tempoh pembaruan model memang menunjukkan perubahan halus. Jarak antara Llama 3.1, 3.2, dan 4 semakin memanjang, manakala perubahan arsitektur antara GPT-4, GPT-4o, dan GPT-5 semakin berkurang. Lebih banyak model baru dibangunkan melalui distilasi, kuantisasi, dan penyesuaian halus pada arsitektur sedia ada, dan kitaran pembaruan model dasar sedang melambat.

Jika tren ini berterusan, Taalas tepat menebak.


Twitter:https://twitter.com/BitpushNewsCN

Kumpulan perbincangan TG BitPush: https://t.me/BitPushCommunity

Langgan BitPush di TG: https://t.me/bitpush

Penjelasan: Semua artikel BitPush hanya mewakili pandangan penulis dan bukan merupakan nasihat pelaburan.
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.