AMD приобретает Taalas для встраивания весов ИИ-моделей в чипы

iconBitPush
Поделиться
AI summary iconСводка
AMD приобрела торонтскую стартап-компанию Taalas, которая встраивает веса моделей ИИ непосредственно в кремний. Чип Taalas HC1, изготовленный по технологии TSMC 6 нм, запускает модель Meta Llama 3.1 8B со скоростью 17 000 токенов в секунду, превосходя по скорости и энергоэффективности Nvidia H200 и H100. Чип использует 3-битный формат и обновляется за 8 недель с помощью изменений металлической маски. AMD планирует интегрировать чипы Taalas для инференса в свою линейку GPU для задач ИИ. Эта новость об ИИ и криптовалюте появляется на фоне изменений в данных по инфляции и растущего спроса на эффективные вычисления.

Автор: Сяобин

AMD приобретает Taalas: чипы для вывода начинают вписывать веса моделей прямо в кремний


6 августа AMD объявила о приобретении торонтской чиповой компании Taalas, сумма сделки не раскрывается. Эта стартап-компания, основанная в 2023 году и привлекшая в общей сложности финансирование в размере 219 миллионов долларов США, сделала что-то, звучащее немного безумно: она напрямую «сожгла» веса ИИ моделей в металлические слои чипа, создав специализированный чип, способный запускать только одну модель.

GPU работает так: параметры модели хранятся в высокополосной памяти (HBM), а во время вывода данные многократно перемещаются в вычислительные блоки и обратно. Этот процесс "перемещения" потребляет огромное количество энергии и времени и в отрасли называется «памятной стеной». Подход Taalas заключается в полном отказе от перемещения: веса фиксируются непосредственно в транзисторах чипа, объединяя хранение и вычисления в одном устройстве.

Цена — эта чип может запускать только одну модель, выгода — порядковый рост скорости и энергоэффективности.

Что означает 17000 токенов в секунду?

Технологический чип Taalas HC1 выполнен по технологии TSMC 6 нм, имеет площадь кристалла 815 кв. мм и 53 миллиарда транзисторов; встроенной моделью является Llama 3.1 8B от Meta.

Результаты тестирования HC1: около 17 000 токенов/секунду на одного пользователя. Для сравнения, Nvidia H200 показывает около 230 токенов/секунду, а H100 — около 150 токенов/секунду на той же модели. Скорость в 73 раза выше при потреблении энергии всего в десять раз меньше.

Более наглядная экономическая картина: заявленные Taalas затраты на вывод составляют около 0,75 цента за миллион токенов (Llama 8B), в то время как решения на GPU находятся в диапазоне от 20 до 49 центов. Каждая карта HC1 потребляет 250 Вт, и для стандартного воздухоохлаждаемого стойки с 10 картами требуется всего 12–15 кВт, без необходимости в жидкостном охлаждении, тогда как стойки на GPU потребляют от 120 до 600 кВт.

Аналитик Forbes Карл Фройнд в своем обзоре в феврале отметил: «В 10 раз быстрее, чем самая быстрая платформа для вывода (Cerebras Wafer-Scale Engine), и на два порядка быстрее, чем GPU».

Однако есть несколько важных ограничений. HC1 использует собственную 3-битную формат данных от Taalas в сочетании с 6-битными параметрами, что приводит к крайне агрессивной квантизации, и потеря качества при сложных задачах вывода является гарантированной. Данные в 17000 токенов/сек получены из теста производителя с 1K входных и 1K выходных токенов и не отражают реальную производительность в продакшене. Кроме того, Llama 3.1 8B — это модель, выпущенная в середине 2024 года, и её квантованная версия с 8B параметров может работать даже на Raspberry Pi 5. HC1 демонстрирует потенциал архитектуры, а не конкурентоспособность зрелого продукта.

Что делать при смене модели?

Заливка модели в чип: самый интуитивный вопрос — что делать, если модель обновится? Чип станет непригодным?

Ответ Taalas: не будет устаревать. Традиционный цикл разработки ASIC занимает более двух лет. Taalas разработала автоматизированный процесс проектирования, позволяющий путем изменения небольшого количества металлических масок на верхнем уровне чипа компилировать новую модель в новый чип за примерно 8 недель. В модели затрат компания заложила расходы на три обновления чипов в течение четырехлетнего жизненного цикла.

Этот ответ может частично снять тревогу, но не устранить её полностью.

Гибкость GPU заключается в том, что одна и та же карта сегодня может запускать Llama, завтра — Claude, а послезавтра — новую модель, еще не выпущенную. Чипы Taalas не могут этого сделать. Если клиенту одновременно нужны сервисы нескольких моделей (что крайне распространено в производственной среде), необходимо выделять отдельный чип для каждой модели, что повышает сложность управления запасами и эксплуатации.

HC2 находится в разработке, цель — модель с объемом около 20 миллиардов параметров с использованием 4-битной плавающей запятой для повышения точности. Taalas первоначально планировал поддержку передовых моделей до конца 2026 года.

Приобретение AMD обеспечило синергию между линейкой продуктов Instinct GPU и системой стойки Helios, позволяя клиентам использовать GPU для обработки гибких и изменчивых рабочих нагрузок, а чипы Taalas — для стабильного и высокочастотного инференса одиночных моделей.

Гонка вооружений в области инференс-чипов

AMD приобретает Taalas — это последняя сделка по покупке чипов для вывода за последние восемь месяцев в отраслевом контексте.

В декабре 2025 года Nvidia приобрела Groq за 20 миллиардов долларов США, получив архитектуру низкой задержки на основе SRAM.

В мае 2026 года Cerebras провела IPO с рыночной капитализацией около 56 миллиардов долларов США, став крупнейшим технологическим IPO с момента Snowflake в 2020 году.

В июне Etched завершила более чем двухлетний период скрытности и объявила о завершении потока чипа, специально разработанного для Transformer, на производственном процессе TSMC N4P, имея контракты с клиентами на сумму более 1 миллиарда долларов США. Сообщается, что Intel подписала соглашение о намерениях приобрести SambaNova, а Qualcomm ведет переговоры с Tenstorrent.

Эти сделки указывают на один и тот же вывод: рассуждение становится основной областью расходов на вычислительные мощности ИИ.

Прогнозы отрасли указывают, что к 2026 году расходы на вывод будут составлять две трети всех расходов на ИИ-вычисления, а к 2030 году специализированные ASIC для вывода могут захватить 45% рынка вывода. GPU от Nvidia по-прежнему доминируют на стороне обучения, но на стороне вывода их универсальная архитектура сталкивается с вызовами со стороны специализированных чипов со всех сторон.

Taalas находится на самом крайнем конце этого спектра: он отказывается даже от универсальности «моделей первого класса» и создает специализированный чип для «одной модели».

Groq использует SRAM вместо HBM, чтобы обойти памятный барьер, Cerebras применяет подход «в лоб» с помощью площади на уровне вайфера, Etched оптимизирован исключительно для архитектуры Transformer, а Taalas делает более смелую ставку: она предполагает, что AI-модели со временем стабилизируются, как коммуникационные протоколы, которые в конечном итоге сходятся к нескольким стандартам. Когда модели перестанут меняться каждый месяц, производство отдельных чипов для нескольких самых популярных моделей станет экономически выгодным.

Модель ставок «замерзнет»

Старший вице-президент AMD Вамси Боппана заявил в объявлении, что цель приобретения — предоставить клиентам «оптимальное вычислительное решение для каждого типа рабочей нагрузки ИИ». Эта фраза в терминах конкурентной стратегии означает: GPU отвечают за гибкость, чипы Taalas — за максимальную эффективность, клиенты комбинируют их по необходимости.

Возможность реализации этой логики зависит от ключевого предположения: замедлится ли цикл обновления моделей ИИ.

Если крупные модели будут получать архитектурные обновления каждые несколько месяцев, то заливка весов в кремний будет похожа на заливку бетона в песок — чип еще не окупится, а модель уже устареет. Но если способности моделей начнут стремиться к конвергенции, и стабильное обслуживание топовых моделей в течение одного-двух лет станет нормой, то специализированные чипы типа Taalas станут такими же естественным выбором, как базовые чипы в телекоммуникационной отрасли — от безумных экспериментов перейдут к очевидному решению.

Глядя на последние 12 месяцев, темпы обновления моделей действительно претерпели тонкие изменения. Интервалы между обновлениями серии Llama — от 3.1 до 3.2 и до 4 — удлиняются, а изменения архитектуры GPT от 4 до 4o и до 5 становятся менее значительными. Большинство новых моделей создаются путем дистилляции, квантования и тонкой настройки существующих архитектур; итерации базовых моделей замедляются.

Если этот тренд продолжится, Талас угадал.


Twitter:https://twitter.com/BitpushNewsCN

Телеграм-чат BitPush: https://t.me/BitPushCommunity

Подписка на Telegram от BitPush: https://t.me/bitpush

Примечание: Все статьи Beibit отражают мнение авторов и не являются инвестиционными рекомендациями.
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.