Очень впечатляюще.
Совсем недавно NVIDIA впервые опубликовала данные первых тестов на чипе для следующего поколения флагманского стойкового решения Vera Rubin NVL72.
И, кроме того, это практическое тестирование сразу привлекло DeepSeek -V4-Pro, выполнение самых реалистичных задач «кодирования агентов»!
Результаты удивительны: по сравнению с текущим флагманом GB300 NVL72, производительность Vera Rubin на мегаватт выросла в 30 раз, а стоимость токена снизилась максимум в 35 раз!

Кто-то воскликнул: «Я бы даже не осмелился написать презентацию, чтобы обмануть инвесторов!»
Другие пользователи оставили замечательный комментарий: «Раньше считали, что H200 по цене в 30 000 долларов слишком дорогой, а теперь, оглядываясь назад, понимаешь, что H200 даже не считается базовой версией».

Давайте внимательно разберемся.
От H200 до GB300 пропускная способность реальных рабочих нагрузок агентов увеличилась до 30 раз, а стоимость примерно удвоилась.
От GB300 до Vera Rubin пропускная способность снова выросла вплоть до 30 раз, а цена за полную стойку примерно удвоилась.
Согласно закону Мура от старого Хуанга, за последние два года крупнейшим технологическим прорывом NVIDIA стало не сама GPU, а увеличение цены в 4 раза при одновременном получении ускорения в целых 900 раз!

На этот раз NVIDIA объявила всем о противоречащем интуиции факте: эпоха LLM завершилась, наступила эпоха агентов, и все прежние тестовые показатели ИИ устарели!

В то же время процессор Vera, специально созданный для агентов, был установлен SpaceXAI Маска за ночь, и даже готов к запуску в космос.
Также сегодня NVIDIA Groq 3 LPX полностью перешел на массовое производство.
Gemma 4 31B работает на вершине, скорость просто невероятна — до 3400 токенов в секунду. Пропускная способность модели с триллионом параметров увеличена в 35 раз.


Эти новые рекорды перепишут коммерческую карту экосистемы Agent уже с этой ночи!
Почему NVIDIA должна выпустить Vera Rubin?
Последние данные OpenRouter дают ответ: в реальном мире задача Agent AI потребляет в 15 раз больше токенов, чем обычная чат-диалог!
Например, если агенту поручено изучить компанию для принятия инвестиционного решения, в этом процессе агент и подагенты постоянно рассуждают, и накопленные токены становятся входными данными для следующего шага; обработка длинного контекста становится ключевым ограничением для ИИ-агентов.

Чем больше взаимодействий с агентами, тем выше пропускная способность — при увеличении количества агентов в 10 раз вызовы инструментов увеличились в 2 раза, противоречие между вычислительными мощностями и алгоритмами породило новые потребности.

Не используйте чат как агент, старые стандарты отменены!
В этот момент традиционные тесты ИИ (например, тесты с фиксированной длиной последовательностей 8K/1K) полностью теряют свою эффективность.
NVIDIA официально заявила: измерение производительности должно развиваться! Нельзя больше измерять только отдельные запросы на вывод, необходимо фиксировать полные рабочие процессы агента.
Для этого они использовали тестовый набор AgentX от SemiAnalysis.
Этот тест больше не является жестким вопросно-ответным форматом, а представляет собой воспроизведение реальной «сессии программирования» с контекстным развитием, вызовом инструментов и генерацией подагентов.

Вот почему H200 оказывается не в силах справиться на новом поле боя агентов, Vera Rubin обречена царствовать.
Vera Rubin NVL72 × DeepSeek-V4-Pro:
Прибыл монстр хэш-мощности
Чтобы продемонстрировать мощь Vera Rubin NVL72, NVIDIA напрямую использует короля с открытым исходным кодом — DeepSeek Проведение тестов на чипе для V4-Pro (1.6T).
После публикации данных результаты оказались поразительными—
Под рабочей нагрузкой AgentX пропускная способность Vera Rubin NVL72 на мегаватт повысилась в целых 30 раз по сравнению с GB300 NVL72!

Обратите внимание, что здесь сравнивается не устаревший H200, а популярный основной GB300.
GB300 в таком же DeepSeek В тестировании V4-Pro пропускная способность на мегаватт уже в 15 раз выше, чем у H200.
Однако Верру Рубин подняла на 30 раз выше плечи GB300, повысив всю кривую Парето!
What does this mean?
Для «AI-фабрик», зависящих от электроснабжения, это напрямую расширяет границы физических законов.
При том же энергетическом бюджете Vera Rubin может выполнять в 30 раз больше задач, чем агенты.
Для центров обработки данных мощностью в мегаватты и даже гигаватты это эквивалентно появлению в тридцать раз больше вычислительных активов.
Кроме того, технология NVIDIA DSX MaxLPS позволяет управлять питанием на уровне GPU, стойки и рабочей нагрузки, что позволяет разместить на том же мегаваттном бюджете до 40% больше GPU, значительно повысив пропускную способность на мегаватт для фабрик ИИ!

Стоимость токена снизилась в 35 раз! «Книга учета» индустрии Agent полностью переписана
На каждый мегаватт пропускной способности напрямую влияет стоимость генерации каждого токена. Резкий рост производительности приводит к ядерному взрыву бизнес-модели.
NVIDIA объявила, что производство каждого миллиона токенов на Vera Rubin NVL72 обходится до 35 раз дешевле, чем на GB300 NVL72!

Когда стоимость вычислений снизится в 35 раз, круглосуточные цифровые сотрудники станут реальностью, и на потребительском рынке произойдет взрывной рост суперприложений.
Старый Хуан этим ходом прямо открыл двери эры приложений Agent.

Экстремальный синергетический дизайн: как это удалось старому Хуану?
Вы можете спросить: почему скорость увеличилась в 30 раз? Благодаря технологии одного чипа?
Clearly not.
Vera Rubin NVL72 удивительное повышение производительности благодаря «экстремальному совместному дизайну».

Например, разделенные сервисы, распределенный KV-кэш, KV-осознанная маршрутизация, MegaMoE и т. д.

Кроме того, NVFP4 квантование напрямую сжимает веса модели до 4-битной точности, значительно сокращая использование памяти без потери качества вывода, что мгновенно повышает пропускную способность.
А шестое поколение NVLink вместе с крупными моделями MoE обеспечивает сетевое соединение в 10 раз быстрее и с втрое меньшей задержкой по сравнению с готовыми Ethernet-решениями, что позволяет DeepSeek Эта крупная модель на основе архитектуры MoE может плавно вызывать различные подсети «экспертов» между 72 GPU.
Это уже не просто продажа видеокарт; Лоу продает целую «электростанцию ИИ».

NVIDIA Groq 3 LPX полностью в серийном производстве:
3400 токенов в секунду, код Agent меняется!
На конференции Hot Chips 2026 NVIDIA также объявила потрясающую новость: Groq 3 LPX начал массовое производство!

Groq 3 LPX — это эксклюзивное расширение для платформы центра обработки данных Vera Rubin NVL72.
Он специально разработан для этой системы и ориентирован на снижение задержек при ускорении вывода.
Эта черная магия была куплена NVIDIA в декабре прошлого года за 20 миллиардов долларов у стартапа Groq.

AI-агенты сталкиваются с проблемой задержки декодирования; чтобы устранить эту боль, Groq 3 LPX изящно разделяет обработку большого контекста и генерацию токенов.
Решение NVIDIA заключается в том, чтобы поручить Rubinstein GPU обработку больших контекстов, а задачу сверхбыстрого генерирования токенов — Groq 3 LPX.
Один отвечает за «чтение», другой — за «запись», каждый занимается тем, что у него получается лучше всего.

В полной установке на уровне стойки до 256 ускорителей LP30 могут работать совместно с GPU через сверхвысокополосное соединение, создавая инфраструктуру для инференса корпоративного масштаба.

Благодаря этому Groq 3 LPX напрямую достиг рекордной скорости вывода.
В тестах Artificial Analysis Groq 3 LPX запустил Gemma 4 31B с контекстным окном в 100 000 токенов и достиг скорости вывода удивительные 3 400 токенов/сек!
Это делает его в четыре раза быстрее в ответе, чем конкуренты, в рабочих нагрузках, чрезвычайно чувствительных к задержкам.

Задачи с несколькими шагами, которые раньше занимали несколько часов, теперь можно выполнить за несколько минут!

Groq 3 LPX при генерации 5000 токенов сократил время с 50 секунд до 1,5 секунды — в 34 раза.

Кроме того, в задачах кодирования максимальная скорость вывода Groq 3 LPX составляет 6981 токен/с.

Хуан Рэньсюнь прямо заявил, что продвижение сверхбыстрого генерирования токенов с помощью LPX привело к «еще одному огромному прорыву» в пропускной способности и скорости реакции ИИ.

Nebius уже развернул чип в Nebius Token Factory, чтобы обеспечить мгновенный отклик на каждом этапе цикла агента.

За ним следует сама Groq.

Запущен первый процессор, специально разработанный для агентов,
Маск ночью «отправился в космос»!
Самым амбициозным шагом в этом официальном объявлении стало Vera CPU.
Для Agent NVIDIA специально создала процессор.
Этот процессор Vera специально предназначен для питания агентов.
Он оснащен 88 собственными ядрами Olympus, высокопроизводительной памятью LPDDR5X с пропускной способностью до 1,2 ТБ/с.

Почему в эпоху больших моделей необходимы совершенно новые ЦП?
На мероприятии Hot Chips руководитель英伟达Vera CPU прямо заявил: «Agentic AI — это самая сложная вычислительная задача в истории».

Одна задача требует от агента выполнения сотен шагов: вызов инструментов, выполнение кода на Python, анализ контекста, обработка огромных объемов данных...
Все эти задачи по управлению курьерскими службами ложатся исключительно на CPU. Поэтому NVIDIA должна создать отдельный процессор для агента.
Именно из-за этого Маск и SpaceXAI незамедлительно объявили о масштабном развертывании процессоров NVIDIA Vera!
Еще в мае этого года NVIDIA незаметно отправила первые образцы Vera в A-компанию, OpenAI и SpaceX AI для предварительного тестирования.
Только через три месяца SpaceXAI с нетерпением перешла к полномасштабному развертыванию.
Еще более безумно то, что SpaceXAI строит завод по производству гигаваттной вычислительной мощности на платформе Vera Rubin для запуска Grok.
不仅如此,这套算力还将被直接送往太空。
Маск заявил: «Две компании объединили усилия и разработали усовершенствованную версию Vera Rubin NVL72, которая будет масштабно развернута в 2028 году».

Первая генерация спутника SpaceXAI «Starmind» планируется использовать систему Vera Rubin NVL72 в формате стойки.

От одной GPU до целой фабрики агентов
В тот же день два чипа — Vera CPU и Groq 3 LPX — начали массовое производство.
This is significant for NVIDIA.

В эпоху больших моделей NVIDIA захватила рынок обучения и вывода благодаря GPU.
В эпоху агентов его сфера охватывает CPU, ускорители вывода, NVLink и другие технологии.
Лао Ху продает не просто одну видеокарту.
Он продает AI-фабрику, которая может непрерывно производить токены.
На этот раз Лао Хуан собирается полностью переложить основу для всей «эпохи агентов».
Справочные материалы:
https://x.com/MinLiBuilds/status/2091915873661686204
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение
