Yazan: Xiao Bing
6 Ağustos'ta AMD, Toronto merkezli çip şirketi Taalas'ı satın aldığını duyurdu; işlem fiyatı açıklanmadı. 2023 yılında kurulan ve toplamda 219 milyon dolar fon toplayan bu startup, biraz çılgınca bir şey yaptı: AI modelinin ağırlıklarını doğrudan çipin metal katmanlarına yaktı ve sadece bir modeli çalıştıran özel çipler üretti.
GPU, model parametrelerini yüksek bant genişlikli bellekte (HBM) saklar ve çıkarım sırasında verileri hesaplama birimleri arasında sürekli taşır. Bu "taşınma" süreci, endüstride "bellek duvarı" olarak bilinen büyük bir enerji ve zaman tüketimine neden olur. Taalas, ağırlıkları çipin transistörlerine sabitleyerek taşınmayı tamamen ortadan kaldırır ve depolama ile hesaplama birleştirilir.
Maliyeti, bu çipin yalnızca bir modeli çalıştırabilmesi; kazanç ise hız ve verimlilikteki sıralama düzeyindeki artıştır.
17000 token/saniye ne anlama gelir?
Taalas'ın teknik doğrulama çipi HC1, TSMC'nin 6 nm üretim sürecini kullanır, 815 mm² çip alanı ve 53 milyar transistöre sahiptir; dahili modeli Meta'nın Llama 3.1 8B'dir.
HC1'nin performans verisi: Tek bir kullanıcı başına yaklaşık 17.000 token/saniye. Karşılaştırma olarak, Nvidia H200 aynı modelde yaklaşık 230 token/saniye, H100 ise yaklaşık 150 token/saniye. 73 kat hız farkı, tüketilen güç ise sadece ikisinin onda biri.
Daha net bir ekonomik hesap: Taalas,推理 maliyetini yaklaşık olarak her milyon Token için 0,75 sent (Llama 8B) olarak açıkladı; GPU çözümleri ise 20 ile 49 sent arasında. Her HC1 kart 250 W güç tüketiyor, standart bir hava soğutmalı raf 10 kart için yalnızca 12-15 kW güç gerektirir, sıvı soğutmaya gerek yoktur; GPU rafı ise genellikle 120-600 kW güç tüketir.
Forbes analisti Karl Freund, Şubat'ta yaptığı değerlendirmede: “En hızlı inference platformu (Cerebras wafer-level engine)’den 10 kat daha hızlı, GPU’lardan iki sıralık daha hızlı.”
Ancak birkaç önemli sınırlama vardır. HC1, Taalas'ın kendi geliştirdiği 3-bit veri formatını 6-bit parametrelerle birlikte kullanır ve kuantizasyon çok agresiftir; karmaşık çıkarım görevlerinde kalite kaybı kesinlikle mevcuttur. Saniyede 17.000 token verisi, 1K girdi/1K çıktı ile yapılan üretici benchmark testinden gelir ve üretim ortamındaki gerçek performansı yansıtmaz. Ayrıca Llama 3.1 8B, 2024 ortalarında yayınlanan bir modeldir ve 8B parametreli kuantize edilmiş versiyonu hatta Raspberry Pi 5'te çalıştırılabilir. HC1, olgun bir ürünün rekabet gücünü değil, mimarinin potansiyelini göstermektedir.
Model değişimi ne yapmalıyım?
Modeli çipe yazmak, en doğrudan soru: Model güncellendiğinde, çip çöpe mi gidiyor?
Taalas'ın yanıtı şuydu: Hayır, iptal edilmeyecek. Geleneksel ASIC tasarım döngüsü iki yıldan uzundur. Taalas, yeni bir modeli yeni bir çipe derlemek için yalnızca çip üst katmanındaki az sayıda metal maskeyi değiştirmenizi sağlayan otomatik bir tasarım süreci geliştirdi; bu süreç yaklaşık 8 hafta sürer. Şirket, maliyet modelinde 4 yıllık yaşam döngüsü içinde 3 kez çip güncellemesi maliyetini önceden varsaymıştır.
Bu yanıt, kaygının bir kısmını giderir, ancak tamamen ortadan kaldırmaz.
GPU'nun esnekliği, aynı kartın bugün Llama'yı çalıştırmakta, yarın Claude'u çalıştırmakta ve hemen ardından henüz yayınlanmamış yeni bir modeli çalıştırmakta olmasındadır. Taalas'ın çipleri bunu yapamaz. Bir müşterinin üretim ortamında oldukça yaygın olan birden fazla model hizmetine aynı anda ihtiyacı varsa, her model için farklı bir çip gerekecek ve envanter yönetimi ile bakım karmaşıklığı artacaktır.
HC2 geliştiriliyor ve hedeflenen model boyutu yaklaşık 20 milyar parametre, 4-bit kayan nokta ile doğruluk artırılıyor. Taalas, öncü düzey model desteği için orijinal olarak 2026 sonuna kadar planlıyordu.
AMD'nin satın alımı, Instinct GPU ürün hattı ve Helios raf sistemi arasında bir sinerji yaratıyor; müşteriler, GPU'ları esnek ve değişken iş yükleri için, Taalas çiplerini ise sabit ve yüksek frekanslı tek model çıkarımı için kullanabiliyor.
Yapay zeka çiplerinin silahlanma yarışı
AMD, Taalas'ı satın alarak, son 8 aydır süren çıkarım çipleri satın alma dalgasının en son işlemi oldu.
2025 yılında Nvidia, SRAM tabanlı düşük gecikmeli çıkarım mimarisini ele geçirmek için Groq'u 20 milyar dolarla satın aldı.
Mayıs 2026'da, Cerebras, yaklaşık 56 milyar dolarlık bir piyasa değeriyle 2020 Snowflake'den bu yana en büyük teknoloji IPO'su oldu.
Haziran'da Etched, iki yıldan fazla bir süredir gizlilik içindeyken, ilk Transformer özel çipini TSMC N4P prosesinde tamamladığını ve 1 milyar doların üzerinde müşteri sözleşmesine sahip olduğunu duyurdu. Intel'in SambaNova ile satın alma niyet mektubu imzaladığı rapor edildi, Qualcomm ise Tenstorrent ile görüşmeler yapıyor.
Bu işlemler aynı sonuca işaret ediyor: çıkarım, AI hesaplama harcamalarının ana savaş alanı haline geliyor.
Endüstri tahminlerine göre 2026 yılında çıkarım, AI hesaplama harcamalarının üçte ikisini oluşturacak ve 2030 yılına kadar özel çıkarım ASIC'leri çıkarım pazarının %45'ini ele geçirebilir. Nvidia'nın GPU'ları hâlâ eğitim tarafında hakim olsa da, çıkarım tarafında genel mimarisi, çeşitli yönlerden gelen özel çiplerle karşı karşıya kalmaktadır.
Taalas, bu spektrumun en uç noktasında yer alıyor: "birinci sınıf model" genelliğini bile terk edip doğrudan "tek bir model" için özel çip üretiyor.
Groq, bellek duvarını aşmak için SRAM ile HBM'yi değiştirmektedir; Cerebras,晶圆 boyutunu kullanarak brute force ile aşmaktadır; Etched, yalnızca Transformer mimarisi için optimize edilmiştir; Taalas ise daha cesaretli bir tahminde bulunuyor: AI modellerinin, iletişim protokollerinin nihayetinde az sayıda standarta doğru yakınsaması gibi, zamanla istikrarlı hale geleceğine inanıyor. Modeller aylık olarak değiştirilmeye başladığında, en popüler birkaç model için ayrı ayrı özel çipler üretmek ekonomik olarak karlı olacaktır.
Tahmin modeli “donacak”
AMD'nin üst düzey başkanı Vamsi Boppana, duyuruda, satın alımın amacının müşterilere "her AI iş yükü için en uygun hesaplama çözümünü" sunmak olduğunu söyledi. Bu ifade, rekabet stratejisi olarak şu şekilde yorumlanabilir: GPU esneklik için, Taalas çipleri ise maksimum verimlilik için; müşteriler ihtiyaçlarına göre kombinasyon yapar.
Bu kombinasyon mantığının geçerli olup olmayacağını, AI modellerinin güncelleme döngüsünün yavaşlayıp yavaşlamayacağına bağlıdır.
Eğer büyük modeller her birkaç ayda bir mimari düzeyde güncellenmeye devam ederse, ağırlıkları silikonun içine kazımak, çamur üzerine beton dökmek gibi olur; çip henüz maliyetini kazanmadan model obsolet hale gelir. Ancak model yetenekleri bir noktada sabitlenir ve öncü modellerin iki yıl boyunca kararlı bir şekilde hizmet vermesi normale dönüşürse, Taalas tarzı özel çipler, telekomünikasyon endüstrisindeki baz istasyonu çipleri gibi, çılgın denemelerden doğal bir seçim haline gelir.
Geçen 12 ay boyunca, model güncellemelerinin hızında ince bir değişim gözlemlenmektedir. Llama serisi, 3.1'den 3.2'ye ve ardından 4'e geçişlerde aralıklar uzamıştır; GPT, 4'ten 4o'ye ve 5'e geçişlerde mimari değişiklikler daralmıştır. Daha fazla yeni model, mevcut mimariler üzerinde distilasyon, kuantizasyon ve ince ayarlarla geliştirilmektedir; temel modellerin güncellenmesi yavaşlamaktadır.
Eğer bu trend devam ederse, Taala doğru tahmin etti.
