Автор: Сяобін
AMD придбала Taalas: чіпи висновку починають викарбовувати ваги моделей у кремній
6 серпня AMD оголосила про придбання торонтської чіпової компанії Taalas, сума угоди не розголошена. Ця стартап-компанія, заснована у 2023 році та зібравша загалом фінансування у розмірі 219 мільйонів доларів США, зробила щось, що звучить трохи дико: вона випалила ваги ШІ моделей безпосередньо у металеві шари чіпа, створивши спеціалізовані чіпи, здатні запускати лише одну модель.
GPU працює, зберігаючи параметри моделі у високосмуговій пам’яті (HBM) і під час висновку багаторазово переміщаючи дані до обчислювальних блоків і з них. Цей процес "переміщення" споживає велику кількість енергії та часу і в галузі називається "пам’яттєвою стіною". Підхід Taalas полягає у повній відмові від переміщення: ваги фіксуються безпосередньо в транзисторах чіпа, об’єднуючи зберігання та обчислення.
Ціною є те, що цей чіп може запускати лише одну модель, але вигодою є кілька порядків зростання швидкості та енергоефективності.
Що означає 17000 токенів за секунду?
Технологічний чіп HC1 від Taalas виготовлений за технологією TSMC 6 нм, має площу кристала 815 мм² та 53 мільярди транзисторів; вбудована модель — Llama 3.1 8B від Meta.
Дані тестування HC1: приблизно 17 000 токенів/секунду на одного користувача. Для порівняння, Nvidia H200 показує приблизно 230 токенів/секунду, а H100 — 150 токенів/секунду на тій самій моделі. Швидкість у 73 рази вища, при споживанні потужності лише десяту частину.
Більш наочний економічний розрахунок: Taalas повідомляє, що вартість висновку становить приблизно 0,75 цента за мільйон токенів (Llama 8B), тоді як рішення на GPU — від 20 до 49 центів. Кожна карта HC1 споживає 250 Вт, а стандартний повітряно охолоджуваний стенд на 10 карт вимагає лише 12–15 кВт, не потребуючи рідинного охолодження, тоді як стенд на GPU часто споживає 120–600 кВт.
Аналітик Forbes Карл Фройнд у своєму оцінюванні у лютому сказав: «На 10 разів швидше, ніж найшвидша платформа висновку (Cerebras Wafer-Scale Engine), і на два порядки швидше, ніж GPU».
Але є кілька важливих обмежень. HC1 використовує власний 3-бітний формат даних Taalas у поєднанні з 6-бітними параметрами, що призводить до дуже агресивного квантування, і втрата якості при складних завданнях висновку є певною. Дані в 17 000 токенів/сек отримані з фабричного тесту з 1K вхідних/1K вихідних токенів і не відображають реальну продуктивність у виробничому середовищі. Крім того, Llama 3.1 8B — це модель, випущена в середині 2024 року, і її квантована версія з 8B параметрів може працювати навіть на Raspberry Pi 5. HC1 демонструє потенціал архітектури, а не конкурентоспроможність зрілої продукту.
Що робити, якщо модель змінюється?
Записати модель у чіп — найбільш очевидне питання: що робити, якщо модель оновлюється? Чіп стає непридатним?
Відповідь Taalas: не буде виведено з експлуатації. Традиційний цикл розробки ASIC триває більше двох років. Taalas розробила автоматизований процес проектування, який дозволяє шляхом зміни невеликої кількості металевих масок на верхньому рівні чіпа компілювати нову модель у новий чіп за приблизно 8 тижнів. У своїй вартісній моделі компанія передбачила витрати на три оновлення чіпа протягом чотирьох років життєвого циклу.
Ця відповідь може вирішити частину тривоги, але не зможе повністю її видалити.
Гнучкість GPU полягає в тому, що одна й та сама карта сьогодні виконує Llama, завтра — Claude, а післязавтра — нову модель, яка ще не випущена. Чіпи Taalas не можуть цього зробити. Якщо клієнту одночасно потрібні сервіси кількох моделей (що дуже поширено в продуктивному середовищі), потрібно мати окремий чіп для кожної моделі, що збільшує складність управління запасами та експлуатації.
HC2 вже розробляється, метою є модель розміром приблизно 20 мільярдів параметрів з використанням 4-бітної плаваючої точки для підвищення точності. Taalas спочатку планував забезпечити підтримку передових моделей до кінця 2026 року.
Аквізіція AMD надала цій траєкторії синергію між лінійкою продуктів Instinct GPU та системами Helios Rack, дозволяючи клієнтам використовувати GPU для гнучких та змінних навантажень, а чіпи Taalas — для стабільних, високочастотних інференсів однієї моделі.
Змагання з розробки чіпів для висновків
AMD придбала Taalas, що є останньою у серії придбань чіпів для висновків за останні 8 місяців у контексті галузі.
У грудні 2025 року Nvidia придбала Groq за 20 мільярдів доларів США, отримавши архітектуру низької затримки на основі SRAM.
У травні 2026 року Cerebras провела IPO з ринковою капіталізацією близько 56 мільярдів доларів США, ставши найбільшим технологічним IPO з часів Snowflake у 2020 році.
У червні Etched завершила дві з половиною роки прихованого періоду, оголосивши про завершення виробництва першого чіпа, спеціалізованого для Transformer, за допомогою технології TSMC N4P, отримавши контракти на понад 1 мільярд доларів США. Згідно з повідомленнями, Intel підписала лист про наміри щодо придбання SambaNova, а Qualcomm перебуває у контактах з Tenstorrent.
Ці угоди вказують на одну й ту саму думку: міркування стає головною сферою витрат на обчислювальні потужності ШІ.
Прогнози галузі вказують, що у 2026 році витрати на висновки складатимуть дві третини витрат на обчислення ШІ, а до 2030 року спеціалізовані ASIC для висновків можуть захопити 45% ринку висновків. GPU від Nvidia все ще домінують на стороні навчання, але їхня універсальна архітектура стикається з викликами з боку спеціалізованих чіпів у сфері висновків.
Taalas знаходиться на найекстремальнішому кінці цього спектру: він відмовився навіть від універсальності «моделей першого класу» і створив спеціалізований чіп для «однієї моделі».
Groq використовує SRAM замість HBM, щоб обійти пам’ятковий бар’єр, Cerebras застосовує відкритий підхід за рахунок площі на відрізку, Etched оптимізований виключно для архітектури Transformer, а Taalas робить ще більш сміливий прогноз: вона вірить, що AI-моделі поступово стабілізуються, подібно до того, як комунікаційні протоколи зрештою зводяться до кількох стандартів. Коли моделі більше не змінюватимуться щомісяця, виготовлення окремих чіпів для кількох найпопулярніших моделей стане економічно вигідним.
Модель ставки засине
Високопосадовець AMD Вамсі Боппана у оголошенні сказав, що метою придбання є надання клієнтам «оптимального обчислювального рішення для кожного типу AI-навантаження». Це твердження в контексті конкурентної стратегії означає: GPU забезпечують гнучкість, чіпси Taalas — максимальну ефективність, а клієнти комбінують їх за потребою.
Чи може ця логіка виявитися справедливою, залежить від ключового припущення: чи сповільниться цикл оновлень моделей ШІ.
Якщо великі моделі постійно отримують архітектурні оновлення кожні кілька місяців, то вбудовування ваг у напівпровідник подібне до заливання бетону на рухомий пісок — чип ще не окупився, а модель вже застаріла. Але якщо здатність моделей почне стабілізуватися, і головні моделі будуть стабільно працювати протягом одного-двох років, тоді спеціалізовані чипи на зразок Taalas стануть такими ж природними, як базові чипи в телекомунікаційній галузі — від диких експериментів до очевидного вибору.
Поглядаючи на минулих 12 місяців, темпи оновлення моделей справді зазнають тонких змін. Інтервали між Llama 3.1, 3.2 та 4 збільшуються, а зміни архітектури в GPT від 4 до 4o до 5 стають менш значними. Більше нових моделей створюється шляхом дистиляції, квантування та тонкої настройки на основі існуючих архітектур; ітерації базових моделей повільняються.
Якщо цей тренд продовжиться, Талас вгадав.
Twitter:https://twitter.com/BitpushNewsCN
Телеграм-група BitPush:https://t.me/BitPushCommunity
Підписатися на BitPush у TG: https://t.me/bitpush
