Автор: Сяобинь
6 августа AMD объявила о приобретении торонтской чиповой компании Taalas, сумма сделки не раскрывается. Эта стартап-компания, основанная в 2023 году и привлекшая в общей сложности 219 миллионов долларов США, сделала что-то, что звучит немного безумно: она напрямую «сожгла» веса AI-моделей в металлические слои чипа, создав специализированный чип, способный запускать только одну модель.
GPU работает так: параметры модели хранятся в высокополосной памяти (HBM), а во время вывода данные постоянно перемещаются в вычислительные блоки и обратно. Этот процесс "перемещения" потребляет огромное количество энергии и времени и в отрасли называется «памятной стеной». Подход Taalas заключается в полном отказе от перемещения: веса фиксируются непосредственно в транзисторах чипа, объединяя хранение и вычисления в одном устройстве.
Цена — эта чип может запускать только одну модель, выгода — порядковый рост скорости и энергоэффективности.
Что означает 17000 токенов в секунду?
Технологическая проверочная микросхема HC1 от Taalas изготовлена по технологии TSMC 6 нм, имеет площадь кристалла 815 мм² и 53 миллиарда транзисторов; встроенная модель — Llama 3.1 8B от Meta.
Производительность HC1: около 17 000 токенов/секунду на одного пользователя. Для сравнения, Nvidia H200 показывает около 230 токенов/секунду, а H100 — около 150 токенов/секунду на той же модели. Скорость в 73 раза выше при потреблении энергии всего в десять раз меньше.
Более наглядные экономические расчеты: заявленные Taalas затраты на вывод составляют около 0,75 цента за миллион токенов (Llama 8B), в то время как решения на GPU находятся в диапазоне от 20 до 49 центов. Каждая карта HC1 потребляет 250 Вт, и стандартный воздухоохлаждаемый стойка с 10 картами требует всего 12–15 кВт, не нуждаясь в жидкостном охлаждении, в то время как стойки с GPU часто потребляют от 120 до 600 кВт.
Аналитик Forbes Карл Фройнд в своем обзоре в феврале отметил: «В 10 раз быстрее, чем самая быстрая платформа для вывода (Cerebras Wafer-Scale Engine), и на два порядка быстрее, чем GPU».
Однако есть несколько важных ограничений. HC1 использует собственную 3-битную формат данных от Taalas в сочетании с 6-битными параметрами, что обеспечивает крайне агрессивное квантование, и потеря качества при сложных задачах вывода является неизбежной. Данные в 17 000 токенов/секунду получены на базовом тесте производителя с 1K входных и 1K выходных токенов и не отражают реальную производительность в продакшене. Кроме того, Llama 3.1 8B — это модель, выпущенная в середине 2024 года, и её квантованная версия с 8B параметров может работать даже на Raspberry Pi 5. HC1 демонстрирует потенциал архитектуры, а не конкурентоспособность зрелого продукта.
Что делать при смене модели?
Заливка модели в чип: самый интуитивный вопрос — что делать, если модель обновится? Чип станет непригодным?
Ответ Taalas: не будет устаревать. Традиционный цикл разработки ASIC занимает более двух лет. Taalas разработала автоматизированный процесс проектирования, позволяющий компилировать новую модель в новый чип путем изменения лишь небольшого количества металлических масок на верхнем уровне чипа, при этом цикл занимает около 8 недель. В модели затрат компания заложила расходы на три обновления чипа в течение четырехлетнего жизненного цикла.
Этот ответ может частично снять тревогу, но не устранить её полностью.
Гибкость GPU заключается в том, что одна и та же карта сегодня может запускать Llama, завтра — Claude, а послезавтра — новую модель, еще не выпущенную. Чипы Taalas не способны на это. Если клиенту одновременно нужны сервисы нескольких моделей (что крайне распространено в производственной среде), необходимо выделять отдельный чип для каждой модели, что повышает сложность управления запасами и эксплуатации.
HC2 находится в разработке, цель — модель с объемом около 20 миллиардов параметров с использованием 4-битной плавающей запятой для повышения точности. Taalas первоначально планировал поддержку передовых моделей до конца 2026 года.
Поглощение AMD обеспечило синергию между линейкой продуктов Instinct GPU и системой стойки Helios, позволяя клиентам использовать GPU для обработки гибких и изменчивых рабочих нагрузок, а чипы Taalas — для стабильного, высокочастотного инференса одиночных моделей.
Гонка вооружений в области инференс-чипов
AMD приобретает Taalas — это последняя сделка по покупке чипов для вывода за последние восемь месяцев в отраслевом контексте.
В декабре 2025 года Nvidia приобрела Groq за 20 миллиардов долларов США, получив архитектуру низкой задержки на основе SRAM.
В мае 2026 года Cerebras провела IPO с рыночной капитализацией около 56 миллиардов долларов США, став крупнейшим технологическим IPO с момента Snowflake в 2020 году.
В июне Etched завершила более чем двухлетний период скрытности, объявив о завершении потока чипа, специально разработанного для Transformer, на технологическом узле TSMC N4P, и заключила клиентские контракты на сумму более 1 миллиарда долларов США. Сообщается, что Intel подписала соглашение о намерении приобрести SambaNova, а Qualcomm ведет переговоры с Tenstorrent.
Эти сделки указывают на один и тот же вывод: рассуждение становится основной областью расходов на вычислительные мощности ИИ.
Прогнозы отрасли указывают, что к 2026 году расходы на инференс займут две трети всех затрат на вычисления ИИ, а к 2030 году специализированные ASIC для инференса могут захватить 45% рынка инференса. GPU от Nvidia по-прежнему доминируют на стороне обучения, но на стороне инференса их универсальная архитектура сталкивается с вызовами со стороны специализированных чипов со всех сторон.
Taalas находится на самом крайнем конце этого спектра: он отказывается даже от универсальности «модели первого класса» и создает специализированный чип для «одной модели».
Groq использует SRAM вместо HBM, чтобы обойти памятный барьер, Cerebras применяет кристалл-уровневую площадь для грубого преодоления, Etched оптимизирован исключительно для архитектуры Transformer, а Taalas делает более смелую ставку: она полагает, что модели ИИ со временем стабилизируются, как коммуникационные протоколы, которые в конечном итоге сходятся к нескольким стандартам. Когда модели перестанут меняться ежемесячно, изготовление отдельных чипов для нескольких самых популярных моделей станет экономически выгодным.
Модель будет «заморожена»
Старший вице-президент AMD Вамси Боппана заявил в объявлении, что цель приобретения — предоставить клиентам «оптимальное вычислительное решение для каждого типа рабочей нагрузки ИИ». Эта фраза в терминах конкурентной стратегии означает: GPU отвечают за гибкость, чипы Taalas — за максимальную эффективность, клиенты комбинируют их по необходимости.
Возможность реализации этой логики зависит от ключевого предположения: замедлится ли цикл обновления моделей ИИ.
Если крупные модели будут получать архитектурные обновления каждые несколько месяцев, то заливка весов в кремний будет похожа на заливку бетона в песок — чип еще не окупится, а модель уже устареет. Но если способности моделей начнут стремиться к конвергенции, и стабильное обслуживание топовых моделей в течение одного-двух лет станет нормой, то специализированные чипы типа Taalas станут такими же естественным выбором, как базовые чипы в телекоммуникационной отрасли — от безумных экспериментов перейдут к очевидному решению.
Глядя на последние 12 месяцев, темпы обновления моделей действительно претерпели тонкие изменения. Интервалы между обновлениями серии Llama — от 3.1 до 3.2 и затем до 4 — удлиняются, а изменения архитектуры GPT от 4 до 4o и затем до 5 становятся менее значительными. Большинство новых моделей теперь создаются путем дистилляции, квантования и тонкой настройки существующих архитектур; итерации базовых моделей замедляются.
Если этот тренд продолжится, Талас оказался прав.
