Kepelbagaian persaingan cip AI sedang mengalami perubahan mendalam. OpenAI melancarkan cip Jalapeño yang khusus untuk inferensi LLM, NVIDIA menggabungkan GPU dengan LPU Groq untuk mencapai pengiraan heterogen, manakala Google memisahkan latihan dan inferensi kepada dua cip berasingan, TPU 8t dan TPU 8i. Tiga pendekatan ini mencerminkan keperluan sumber daya peranti keras yang berbeza antara latihan dan inferensi: latihan berfokus pada pengiraan matriks dan penghubungan berskala besar, manakala inferensi memerlukan lebar pita HBM yang lebih tinggi, SRAM yang lebih besar, dan laluan rangkaian yang lebih pendek. Seiring jurang resepi cip untuk kedua-dua beban kerja ini semakin melebar, FLOPS bukan lagi satu-satunya ukuran, dan kos Token kini menjadi koordinat baharu dalam persaingan peranti keras AI.Penulis artikel, sumber: Leifengwang
Cost of tokens becomes a new benchmark in the hardware competition for large models
Artificial Intelligence, menyerang dapur yang penuh asap
Kisah robot bekerja di bawah laluan sejuta
Wakil Presiden Covariant AI sebelumnya, Zhoupu Shuzhong, secara langsung merangkum peranan LPU sebagai pengisi kekurangan Vera Rubin di kawasan Decode latensi rendah.

Reka bentuk cip Groq juga hampir seluruhnya berpusat pada perkara ini. Satu rak LPX mempunyai 256 LPU, yang kesemuanya hanya mempunyai 128 GB SRAM, kapasiti yang tidak boleh dibandingkan dengan HBM dalam rak GPU, tetapi lebar pita SRAM teragregasi boleh mencapai 40 PB/s.
Reka bentuk ini menekankan “kedekatan”. HBM mampu menyimpan banyak keadaan model, tetapi berada lebih jauh dari unit pengiraan; SRAM mahal dan sukar diperbesar kapasitinya, tetapi data berada di dalam cip, mampu memberikan lebar pita yang sangat tinggi dan latensi akses yang sangat rendah.

Setiap pengiraan yang dilakukan adalah terhad, dan data diambil secara kerap; dengan meletakkan data lebih dekat kepada ALU, faedahnya akan terasa secara langsung dalam masa tunggu untuk Token seterusnya.
Groq juga mengurangkan pengawasan peranti dinamik. LPU adalah arsitektur eksekusi deterministik, di mana penjadualan arahan terutamanya diselesaikan secara perisian terlebih dahulu. Setiap cip bertindak sebagai pemproses dan penghala secara serentak, dan kompilator akan menjadualkan sumber pengiraan dan sumber rangkaian bersama-sama, bahkan menghilangkan mekanisme seperti kawalan aliran peranti tradisional dan saluran maya.

Harga yang perlu dibayar juga jelas: arsitektur ini tidak seversatil GPU, dan SRAM di atas papan tidak cukup untuk menyimpan status model besar secara penuh. Oleh itu, NVIDIA tidak membiarkan Groq 3 berjalan secara berdiri sendiri untuk keseluruhan model, tetapi menciptakan sistem heterogen yang lebih kompleks.

Prefill dilakukan di GPU, sebahagian besar Decode diletakkan di LPU; Attention dalam Decode boleh kembali ke GPU. GPU dan LPU masing-masing menyimpan KV Cache sendiri, kedua-duanya utamanya bertukar draft Tokens, sambil mengimbangkan pengiraan dan komunikasi melalui micro-batch. Oleh kerana LPU adalah domain serentak, manakala GPU dan KV Cache luaran adalah sistem asinkron, NVIDIA bahkan menambahkan FPGA sebagai jambatan asinkron di antara keduanya.
Struktur ini menunjukkan sejauh mana pembahagian tugas cip AI telah sampai. Ia tidak hanya memisahkan “cip latihan” dan “cip inferens”, tetapi bahkan bahagian yang berbeza dalam satu Decode boleh dilaksanakan pada arsitektur yang berbeza.
Namun, data yang ditunjukkan oleh NVIDIA juga menunjukkan batasan jalan ini: apabila perniagaan hanya mengejar throughput keseluruhan dan boleh menerima latensi yang lebih tinggi, Rubin GPU masih sangat berkesan; semakin tinggi keperluan kelajuan Token untuk pengguna tunggal, LPX baru secara beransur-ansur menunjukkan kelebihannya, dan selepas menggunakan lebih banyak LPU, kecekapan throughput keseluruhan juga akan menurun.

Oleh itu, kemunculan Groq 3 tidak bermaksud GPU ditiadakan dalam inferens. Ia menunjukkan perkara lain: sukar untuk satu GPU yang sama mengekalkan kedua-dua throughput tinggi dan latensi sangat rendah; dengan membiarkan dua jenis peranti masing-masing beroperasi dalam zon yang lebih sesuai, sistem menjadi lebih mudah untuk memperluaskan lengkung prestasi.
Google pula meletakkan potongan ini pada peringkat yang lebih tinggi.

Latihan dan inferens, gunakan dua resepi cip
Google pada generasi TPU 8 menghasilkan TPU 8t dan TPU 8i secara serentak,t untuk latihan,i untuk inferens. Logik di sebalik pengagihan ini secara langsung ditulis pada konfigurasi memori cip.
Hot Chips sedang menunjukkan secara langsung, TPU 8t menggunakan 6 set HBM, manakala TPU 8i pula menggunakan 8 set. Penjelasan yang diberikan oleh Google ialah, inferens setiap unit pengiraan memerlukan lebih banyak HBM, sambil juga memerlukan peratusan SRAM yang lebih tinggi, oleh itu 8i memberikan lebih banyak sumber kepada SRAM, kapasiti memori, dan lebar pita.

Perbezaan ini patut dipertimbangkan dengan teliti. Jika cip AI hanya berbanding kuasa matriks, versi inferens tidak sepatutnya menghabiskan begitu banyak luas cip dan sumber pembungkusan pada memori. Reka bentuk TPU 8i ini menunjukkan bahawa Google melihat bottleneck telah berpindah kepada bekalan data.
Semasa latihan, batch besar dapat mengagihkan kos bacaan berat ke banyak token; semasa decode, setiap token yang dihasilkan adalah sedikit, tetapi berat dan KV Cache masih sering diakses. Oleh itu, jumlah lebar pita HBM yang diperlukan setiap unit FLOPS adalah berbeza untuk kedua-dua tugas ini.
Google bahkan membawa perbezaan ini ke topologi rangkaian. Sebelum ini, 3D Torus yang biasa digunakan TPU lebih sesuai untuk pelatihan, dengan penekanan pada throughput keseluruhan dalam kluster berskala besar. TPU 8i menyokong BoardFly, dengan laluan rangkaian yang lebih pendek: had laluan BoardFly ialah 7 hops, manakala 3D Torus mencapai 16 hops.

Untuk latihan, selepas beberapa lompatan rangkaian tambahan, biasanya masih terdapat banyak pengiraan matriks, di mana masa komunikasi boleh diratakan. Tetingkap pengiraan setiap langkah Decode adalah singkat, dan latensi rangkaian beberapa lompatan lebih mudah terus masuk ke dalam selang token.
MoE menjadikan masalah ini lebih jelas. MoE membolehkan satu Token mengaktifkan hanya sebahagian Expert, yang secara komputasi lebih berkesan, tetapi Router akan menghantar Token ke Expert yang berbeza. Apabila Expert-expert ini tersebar di cip yang berbeza, pengurangan komputasi disertai dengan peningkatan komunikasi All-to-All.

Oleh itu, TPU 8i juga menambahkan Collective Acceleration Engine, yang memproses sebahagian operasi kolektif di I/O Die yang berdekatan dengan antaramuka rangkaian. Data tidak perlu dipindahkan terlebih dahulu ke Compute Die, kemudian melalui HBM untuk menyelesaikan operasi, tetapi boleh mengelakkan sebahagian pergerakan data di dalam cip.
Peruntukan sumber untuk versi latihan TPU 8t jelas lebih condong ke sisi lain. Latihan memerlukan FLOPS yang banyak, serta skala besar untuk menyegerakan parameter dan gradien. Superpod TPU 8t boleh diperluaskan hingga 9600 cip, memiliki sekitar 2 PB HBM bersama dan 121 EFLOPS FP4 keupayaan pengiraan terkumpul, Google juga memperkenalkan rangkaian Virgo untuk menjadikan latihan dalam lingkungan yang lebih luas sebagai sistem khas.

Google juga menyebutkan satu masalah reka bentuk cip yang sangat praktikal: dark silicon.
Luas cip dan anggaran kuasa terhad. Jika sumber pengiraan matriks yang banyak diperlukan untuk latihan dan lebih banyak SRAM, HBM, dan rangkaian latensi rendah yang diperlukan untuk inferens dimasukkan ke dalam cip yang sama, apabila satu beban kerja berjalan, sebahagian litar akan sentiasa menganggur.

Kerana kedua-dua tugas memerlukan nisbah sumber yang berbeza, membuat dua cip secara langsung lebih bersih.
Dari FLOPS ke Ekonomi Token
Menggabungkan ketiga-tiga laluan tersebut, perbezaannya sebenarnya jelas.
OpenAI membuat Jalapeño, mengkhususkan chip ke lapisan inferensi LLM, tetapi mempertahankan penjadwalan fleksibel Prefill dan Decode pada perangkat keras homogen; NVIDIA terus memecah lebih jauh, membagi tahapan inferensi tunggal antara GPU dan Groq LPU; Google memotong ke atas, menjadikan pelatihan dan inferensi sebagai dua TPU terpisah.
Di sebalik rute-rute ini tidak ada prinsip pengiraan baru yang misterius, yang berubah adalah nisbah sumber daya. Pelatihan ingin memperuntukkan lebih banyak transistor kepada pengiraan matriks dan penghubungan berskala besar, kerana Batch yang tinggi boleh mengagihkan kos pengangkutan data; inferensi latensi rendah memerlukan lebar pita HBM yang lebih tinggi, SRAM yang lebih besar, kecekapan tempatan KV Cache yang lebih baik, dan laluan rangkaian yang lebih pendek, kerana banyak masa dihabiskan menunggu data.
Semakin besar perbezaan dalam “resep cip” yang diperlukan oleh dua jenis beban, semakin jelas kehilangan kecekapan apabila menggunakan satu cip serba guna untuk mengendalikan keduanya.
Ini juga sebab nombor utama dalam persaingan peranti keras kali ini sedang berubah. FLOPS masih penting, tetapi kini muncul Tokens/s/user, TBT, TTFT, Tokens/kW, lebar pita HBM, dan latensi rangkaian.
Ia sebenarnya menggambarkan perkara yang sama: kuasa pengiraan sudah berada di sana, sama ada sistem mampu terus memberi data dan menghantar Token yang dihasilkan secepat mungkin.
OpenAI, NVIDIA, dan Google masih belum menetapkan garis pemisah yang sama, dan garis yang sebenarnya akan terus berubah kemudian kemungkinan besar adalah di mana garis ini harus diletakkan.
Latihan dan inferens boleh dipisahkan, Prefill dan Decode boleh dipisahkan, dan perhatian dalaman Decode bersama pengiraan lain juga boleh diperinci lagi. Semakin halus pemisahan, semakin mudah untuk meningkatkan kecekapan setiap tugas, tetapi penjadualan sumber, pengangkutan KV Cache, dan komunikasi antara peranti menjadi lebih kompleks.
Oleh itu, cabaran fasa seterusnya dalam persaingan cip AI mungkin bukan lagi sekadar menghasilkan cip yang lebih kuat.
Yang lebih sukar ialah menentukan: tugas-tugas mana yang patut dilakukan dengan cip khas, dan tugas-tugas mana yang terus diletakkan dalam peranti yang sama, supaya kos Token keseluruhan sistem lebih rendah.
