AMD придбала Taalas для вбудовування вагів моделей ШІ в напівпровідники для висновків

iconTechFlow
Поділитися
AI summary iconКороткий зміст
AMD оголосила про придбання торонтського стартапу з чіпами Taalas, що переносить новини про ШІ та криптовалюту у Spotlight. Taalas вбудовує ваги моделей ШІ безпосередньо у металеві шари своїх чіпів, виключаючи переміщення даних між пам’яттю та обчислювальними блоками. Чіп HC1, розроблений на технології TSMC 6nm, досяг 17 000 токенів за секунду з Llama 3.1 8B, перевищивши Nvidia H200 у 73 рази при десятій частині споживання енергії. Чіп є специфічним для моделі та використовує агресивну квантизацію, що може вплинути на точність. Taalas планує оновлювати чіпи кожні 8 тижнів, а HC2 спрямований на моделі з 200 мільярдами параметрів. AMD інтегрує чіпи Taalas з лінійкою GPU Instinct для ефективних завантажень ШІ, що робить це ключовою on-chain новиною.

Автор: Xiao Bing

6 серпня AMD оголосила про придбання торонтської чіпової компанії Taalas, сума угоди не розголошувалася. Ця стартап-компанія, заснована у 2023 році та зібравша в сукупності 219 мільйонів доларів США, зробила щось, що звучить трохи дико: вона випалила ваги моделей ШІ безпосередньо в металеві шари чіпа, створивши спеціалізовані чіпи, здатні запускати лише одну модель.

GPU працюють, зберігаючи параметри моделі у високопропускній пам’яті (HBM) і під час висновку багаторазово переміщаючи дані до обчислювальних блоків і з них. Цей процес "переміщення" споживає велику кількість енергії та часу і в галузі називається "стіною пам’яті". Підхід Taalas полягає у повній відмові від переміщення: ваги фіксуються безпосередньо в транзисторах чіпа, об’єднуючи зберігання та обчислення.

Ціною є те, що цей чіп може запускати лише одну модель, але вигодою є кілька порядків зростання швидкості та енергоефективності.

Що означає 17000 токенів за секунду?

Технологічний чіп HC1 від Taalas виготовлений за технологією TSMC 6 нм, має площу кристала 815 мм² та 53 мільярди транзисторів; вбудована модель — Llama 3.1 8B від Meta.

Дані тестування HC1: приблизно 17 000 токенів/секунду на одного користувача. Для порівняння, Nvidia H200 показує приблизно 230 токенів/секунду, а H100 — близько 150 токенів/секунду на тій самій моделі. Швидкість у 73 рази вища, при споживанні потужності лише десяту частину.

Більш наочний економічний розрахунок: Taalas повідомляє, що вартість висновку становить приблизно 0,75 цента за мільйон токенів (Llama 8B), тоді як рішення на GPU коливається від 20 до 49 центів. Кожна карта HC1 споживає 250 Вт, а стандартний повітряно охолоджуваний стенд на 10 карт вимагає лише 12–15 кВт, не потребуючи рідинного охолодження, тоді як стенд на GPU часто споживає 120–600 кВт.

Аналітик Forbes Карл Фройнд у своєму оцінюванні у лютому сказав: «На 10 разів швидше, ніж найшвидша платформа висновку (Cerebras Wafer-Scale Engine), і на два порядки швидше, ніж GPU».

Але є кілька важливих обмежень. HC1 використовує власний 3-бітний формат даних Taalas у поєднанні з 6-бітними параметрами, що призводить до дуже агресивного квантування, і втрата якості при складних завданнях висновку є достовірною. Дані зі швидкістю 17 000 токенів/с отримані з бенчмарку виробника з 1K вхідних/1K вихідних токенів і не відображають реальну продуктивність у виробничому середовищі. Крім того, Llama 3.1 8B — це модель, випущена в середині 2024 року, і її квантована версія з 8B параметрів може працювати навіть на Raspberry Pi 5. HC1 демонструє потенціал архітектури, а не конкурентоспроможність зрілої продукту.

Що робити, якщо модель змінюється?

Записати модель у чіп — найбільш інтуїтивне питання: що робити, якщо модель оновлюється? Чи чіп стає непридатним?

Відповідь Taalas: не буде виведено з експлуатації. Традиційний цикл розробки ASIC триває більше двох років. Taalas розробила автоматизований процес проектування, який дозволяє шляхом зміни невеликої кількості металевих масок на верхньому рівні чіпа компілювати нову модель у новий чіп за приблизно 8 тижнів. У своїй вартісній моделі компанія закладає витрати на три оновлення чіпа протягом чотирьох років життєвого циклу.

Ця відповідь може вирішити частину тривоги, але не зможе повністю її видалити.

Гнучкість GPU полягає в тому, що одна й та сама карта сьогодні виконує Llama, завтра — Claude, а післязавтра — нову модель, яка ще не випущена. Чіпи Taalas не можуть цього зробити. Якщо клієнту одночасно потрібні сервіси кількох моделей (що дуже поширено в продуктивному середовищі), потрібно мати окремий чіп для кожної моделі, що збільшує складність управління запасами та експлуатації.

HC2 вже розробляється, метою є модель розміром приблизно 20 мільярдів параметрів з використанням 4-бітної плаваючої точки для підвищення точності. Taalas спочатку планував забезпечити підтримку передових моделей до кінця 2026 року.

Поглинання AMD надало цій траєкторії синергію між лінійкою продуктів Instinct GPU та системою стелажів Helios: клієнти можуть використовувати GPU для гнучких та змінних навантажень, а чіпи Taalas — для стабільного, високочастотного висновку однієї моделі.

Змагання з виробництва чіпів для висновків

AMD придбала Taalas, що є останньою у серії придбань чіпів для висновків за останні 8 місяців у контексті галузі.

У грудні 2025 року Nvidia придбала Groq за 20 мільярдів доларів США, отримавши архітектуру низької затримки на основі SRAM.

У травні 2026 року Cerebras провела IPO з ринковою капіталізацією близько 56 мільярдів доларів США, ставши найбільшим технологічним IPO з часів Snowflake у 2020 році.

У червні Etched завершила дві з половиною роки прихованого періоду, оголосивши про завершення виробництва першого чіпа, спеціалізованого для Transformer, за допомогою технології TSMC N4P, та отримавши контракти на понад 1 мільярд доларів США. Згідно з повідомленнями, Intel підписала лист про наміри щодо придбання SambaNova, а Qualcomm веде переговори з Tenstorrent.

Ці угоди вказують на одну й ту саму думку: міркування стає головною сферою витрат на обчислювальні потужності ШІ.

Прогнози галузі вказують, що у 2026 році витрати на висновки складатимуть дві третини витрат на AI-обчислення, а до 2030 року спеціалізовані ASIC для висновків можуть захопити 45% ринку висновків. GPU від Nvidia все ще домінують на стороні навчання, але їхня універсальна архітектура стикається з викликами з боку спеціалізованих чіпів усіх напрямків на стороні висновків.

Taalas знаходиться на найекстремальнішому кінці цього спектру: він відмовився навіть від універсальності «моделей першого класу» і створив спеціалізований чіп для «однієї моделі».

Groq використовує SRAM замість HBM, щоб обійти пам’ятковий бар’єр, Cerebras застосовує кристалічну площу для жорсткого подолання, Etched оптимізовано виключно для архітектури Transformer, а Taalas робить ще більш сміливий прогноз: він вірить, що AI-моделі поступово стабілізуються, подібно до того, як комунікаційні протоколи зрештою збігаються до кількох стандартів. Коли моделі більше не змінюватимуться щомісяця, виготовлення окремих чіпів для кількох найпопулярніших моделей стане економічно вигідним.

Модель ставки засине

Високопосадовець AMD Вамсі Боппана у оголошенні сказав, що метою придбання є надання клієнтам «оптимального обчислювального рішення для кожного типу AI-навантаження». Це твердження в контексті конкурентної стратегії означає: GPU забезпечують гнучкість, чіпси Taalas — максимальну ефективність, а клієнти комбінують їх за потребою.

Чи може ця логічна комбінація бути справедливою, залежить від ключового припущення: чи сповільниться цикл оновлень моделей ШІ.

Якщо великі моделі постійно отримують архітектурні оновлення кожні кілька місяців, то вбудовування ваг у напівпровідник подібне до заливання бетону на рухомі піски — чип ще не окупився, а модель вже застаріла. Але якщо здатність моделей почне стабілізуватися, і стабільне функціонування лідируючих моделей протягом одного-двох років стане нормою, тоді спеціалізовані чипи типу Taalas стануть такими ж природними виборами, як базові чипи в телекомунікаційній галузі — від диких експериментів до очевидного рішення.

Поглядаючи на минулих 12 місяців, темпи оновлення моделей справді зазнають тонких змін. Інтервали між Llama 3.1, 3.2 та 4 збільшуються, а зміни архітектури між GPT-4, GPT-4o та GPT-5 стають менш значними. Більшість нових моделей створюються шляхом дистиляції, квантування та тонкої настройки існуючих архітектур — ітерації базових моделей повільняються.

Якщо цей тренд продовжиться, Талас вгадав.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.