NVIDIA представила Vera Rubin NVL72, увеличив пропускную способность DeepSeek в 30 раз

icon MarsBit
Поделиться
AI summary iconСводка
NVIDIA выпустила информацию в блокчейне с результатами тестов Vera Rubin NVL72: пропускная способность DeepSeek-V4-Pro выросла в 30 раз. Стоимость токенов снизилась в 35 раз по сравнению с GB300 NVL72. Платформа включает Vera CPU и Groq 3 LPX, которые сейчас используются SpaceXAI. Возможно, последуют новые листинги токенов, поскольку рост производительности указывает на более широкое применение ИИ.

Очень впечатляюще.

Совсем недавно NVIDIA впервые опубликовала данные первых тестов на чипе для следующего поколения флагманского стойкового решения Vera Rubin NVL72.

И, кроме того, это практическое тестирование сразу привлекло DeepSeek -V4-Pro, выполнение самых реалистичных задач «кодирования агентов»!

Результаты удивительны: по сравнению с текущим флагманом GB300 NVL72, производительность Vera Rubin на мегаватт выросла в 30 раз, а стоимость токена снизилась максимум в 35 раз!

Агент

Кто-то воскликнул: «Я бы даже не осмелился написать презентацию, чтобы обмануть инвесторов!»

Другие пользователи оставили замечательный комментарий: «Раньше считали, что H200 по цене в 30 000 долларов слишком дорогой, а теперь, оглядываясь назад, понимаешь, что H200 даже не считается базовой версией».

Агент

Давайте внимательно разберемся.

От H200 до GB300 пропускная способность реальных рабочих нагрузок агентов увеличилась до 30 раз, а стоимость примерно удвоилась.

От GB300 до Vera Rubin пропускная способность снова выросла вплоть до 30 раз, а цена за полную стойку примерно удвоилась.

Согласно закону Мура от старого Хуанга, за последние два года крупнейшим технологическим прорывом NVIDIA стало не сама GPU, а увеличение цены в 4 раза при одновременном получении ускорения в целых 900 раз!

Агент

На этот раз NVIDIA объявила всем о противоречащем интуиции факте: эпоха LLM завершилась, наступила эпоха агентов, и все прежние тестовые показатели ИИ устарели!

Агент

В то же время процессор Vera, специально созданный для агентов, был установлен SpaceXAI Маска за ночь, и даже готов к запуску в космос.

Также сегодня NVIDIA Groq 3 LPX полностью перешел на массовое производство.

Gemma 4 31B работает на вершине, скорость просто невероятна — до 3400 токенов в секунду. Пропускная способность модели с триллионом параметров увеличена в 35 раз.

Агент

Агент

Эти новые рекорды перепишут коммерческую карту экосистемы Agent уже с этой ночи!

Почему NVIDIA должна выпустить Vera Rubin?

Последние данные OpenRouter дают ответ: в реальном мире задача Agent AI потребляет в 15 раз больше токенов, чем обычная чат-диалог!

Например, если агенту поручено изучить компанию для принятия инвестиционного решения, в этом процессе агент и подагенты постоянно рассуждают, и накопленные токены становятся входными данными для следующего шага; обработка длинного контекста становится ключевым ограничением для ИИ-агентов.

Агент

Чем больше взаимодействий с агентами, тем выше пропускная способность — при увеличении количества агентов в 10 раз вызовы инструментов увеличились в 2 раза, противоречие между вычислительными мощностями и алгоритмами породило новые потребности.

Агент

Не используйте чат как агент, старые стандарты отменены!

В этот момент традиционные тесты ИИ (например, тесты с фиксированной длиной последовательностей 8K/1K) полностью теряют свою эффективность.

NVIDIA официально заявила: измерение производительности должно развиваться! Нельзя больше измерять только отдельные запросы на вывод, необходимо фиксировать полные рабочие процессы агента.

Для этого они использовали тестовый набор AgentX от SemiAnalysis.

Этот тест больше не является жестким вопросно-ответным форматом, а представляет собой воспроизведение реальной «сессии программирования» с контекстным развитием, вызовом инструментов и генерацией подагентов.

Агент

Вот почему H200 оказывается не в силах справиться на новом поле боя агентов, Vera Rubin обречена царствовать.

Vera Rubin NVL72 × DeepSeek-V4-Pro:

Прибыл монстр хэш-мощности

Чтобы продемонстрировать мощь Vera Rubin NVL72, NVIDIA напрямую использует короля с открытым исходным кодом — DeepSeek Проведение тестов на чипе для V4-Pro (1.6T).

После публикации данных результаты оказались поразительными—

Под рабочей нагрузкой AgentX пропускная способность Vera Rubin NVL72 на мегаватт повысилась в целых 30 раз по сравнению с GB300 NVL72!

Агент

Обратите внимание, что здесь сравнивается не устаревший H200, а популярный основной GB300.

GB300 в таком же DeepSeek В тестировании V4-Pro пропускная способность на мегаватт уже в 15 раз выше, чем у H200.

Однако Верру Рубин подняла на 30 раз выше плечи GB300, повысив всю кривую Парето!

What does this mean?

Для «AI-фабрик», зависящих от электроснабжения, это напрямую расширяет границы физических законов.

При том же энергетическом бюджете Vera Rubin может выполнять в 30 раз больше задач, чем агенты.

Для центров обработки данных мощностью в мегаватты и даже гигаватты это эквивалентно появлению в тридцать раз больше вычислительных активов.

Кроме того, технология NVIDIA DSX MaxLPS позволяет управлять питанием на уровне GPU, стойки и рабочей нагрузки, что позволяет разместить на том же мегаваттном бюджете до 40% больше GPU, значительно повысив пропускную способность на мегаватт для фабрик ИИ!

Агент

Стоимость токена снизилась в 35 раз! «Книга учета» индустрии Agent полностью переписана

На каждый мегаватт пропускной способности напрямую влияет стоимость генерации каждого токена. Резкий рост производительности приводит к ядерному взрыву бизнес-модели.

NVIDIA объявила, что производство каждого миллиона токенов на Vera Rubin NVL72 обходится до 35 раз дешевле, чем на GB300 NVL72!

Агент

Когда стоимость вычислений снизится в 35 раз, круглосуточные цифровые сотрудники станут реальностью, и на потребительском рынке произойдет взрывной рост суперприложений.

Старый Хуан этим ходом прямо открыл двери эры приложений Agent.

Агент

Экстремальный синергетический дизайн: как это удалось старому Хуану?

Вы можете спросить: почему скорость увеличилась в 30 раз? Благодаря технологии одного чипа?

Clearly not.

Vera Rubin NVL72 удивительное повышение производительности благодаря «экстремальному совместному дизайну».

Агент

Например, разделенные сервисы, распределенный KV-кэш, KV-осознанная маршрутизация, MegaMoE и т. д.

Агент

Кроме того, NVFP4 квантование напрямую сжимает веса модели до 4-битной точности, значительно сокращая использование памяти без потери качества вывода, что мгновенно повышает пропускную способность.

А шестое поколение NVLink вместе с крупными моделями MoE обеспечивает сетевое соединение в 10 раз быстрее и с втрое меньшей задержкой по сравнению с готовыми Ethernet-решениями, что позволяет DeepSeek Эта крупная модель на основе архитектуры MoE может плавно вызывать различные подсети «экспертов» между 72 GPU.

Это уже не просто продажа видеокарт; Лоу продает целую «электростанцию ИИ».

Агент

NVIDIA Groq 3 LPX полностью в серийном производстве:

3400 токенов в секунду, код Agent меняется!

На конференции Hot Chips 2026 NVIDIA также объявила потрясающую новость: Groq 3 LPX начал массовое производство!

Агент

Groq 3 LPX — это эксклюзивное расширение для платформы центра обработки данных Vera Rubin NVL72.

Он специально разработан для этой системы и ориентирован на снижение задержек при ускорении вывода.

Эта черная магия была куплена NVIDIA в декабре прошлого года за 20 миллиардов долларов у стартапа Groq.

Агент

AI-агенты сталкиваются с проблемой задержки декодирования; чтобы устранить эту боль, Groq 3 LPX изящно разделяет обработку большого контекста и генерацию токенов.

Решение NVIDIA заключается в том, чтобы поручить Rubinstein GPU обработку больших контекстов, а задачу сверхбыстрого генерирования токенов — Groq 3 LPX.

Один отвечает за «чтение», другой — за «запись», каждый занимается тем, что у него получается лучше всего.

Агент

В полной установке на уровне стойки до 256 ускорителей LP30 могут работать совместно с GPU через сверхвысокополосное соединение, создавая инфраструктуру для инференса корпоративного масштаба.

Агент

Благодаря этому Groq 3 LPX напрямую достиг рекордной скорости вывода.

В тестах Artificial Analysis Groq 3 LPX запустил Gemma 4 31B с контекстным окном в 100 000 токенов и достиг скорости вывода удивительные 3 400 токенов/сек!

Это делает его в четыре раза быстрее в ответе, чем конкуренты, в рабочих нагрузках, чрезвычайно чувствительных к задержкам.

Агент

Задачи с несколькими шагами, которые раньше занимали несколько часов, теперь можно выполнить за несколько минут!

Агент

Groq 3 LPX при генерации 5000 токенов сократил время с 50 секунд до 1,5 секунды — в 34 раза.

Агент

Кроме того, в задачах кодирования максимальная скорость вывода Groq 3 LPX составляет 6981 токен/с.

Агент

Хуан Рэньсюнь прямо заявил, что продвижение сверхбыстрого генерирования токенов с помощью LPX привело к «еще одному огромному прорыву» в пропускной способности и скорости реакции ИИ.

Агент

Nebius уже развернул чип в Nebius Token Factory, чтобы обеспечить мгновенный отклик на каждом этапе цикла агента.

Агент

За ним следует сама Groq.

Агент

Запущен первый процессор, специально разработанный для агентов,

Маск ночью «отправился в космос»!

Самым амбициозным шагом в этом официальном объявлении стало Vera CPU.

Для Agent NVIDIA специально создала процессор.

Этот процессор Vera специально предназначен для питания агентов.

Он оснащен 88 собственными ядрами Olympus, высокопроизводительной памятью LPDDR5X с пропускной способностью до 1,2 ТБ/с.

Агент

Почему в эпоху больших моделей необходимы совершенно новые ЦП?

На мероприятии Hot Chips руководитель英伟达Vera CPU прямо заявил: «Agentic AI — это самая сложная вычислительная задача в истории».

Агент

Одна задача требует от агента выполнения сотен шагов: вызов инструментов, выполнение кода на Python, анализ контекста, обработка огромных объемов данных...

Все эти задачи по управлению курьерскими службами ложатся исключительно на CPU. Поэтому NVIDIA должна создать отдельный процессор для агента.

Именно из-за этого Маск и SpaceXAI незамедлительно объявили о масштабном развертывании процессоров NVIDIA Vera!

Еще в мае этого года NVIDIA незаметно отправила первые образцы Vera в A-компанию, OpenAI и SpaceX AI для предварительного тестирования.

Только через три месяца SpaceXAI с нетерпением перешла к полномасштабному развертыванию.

Еще более безумно то, что SpaceXAI строит завод по производству гигаваттной вычислительной мощности на платформе Vera Rubin для запуска Grok.

不仅如此,这套算力还将被直接送往太空。

Маск заявил: «Две компании объединили усилия и разработали усовершенствованную версию Vera Rubin NVL72, которая будет масштабно развернута в 2028 году».

Агент

Первая генерация спутника SpaceXAI «Starmind» планируется использовать систему Vera Rubin NVL72 в формате стойки.

Агент

От одной GPU до целой фабрики агентов

В тот же день два чипа — Vera CPU и Groq 3 LPX — начали массовое производство.

This is significant for NVIDIA.

Агент

В эпоху больших моделей NVIDIA захватила рынок обучения и вывода благодаря GPU.

В эпоху агентов его сфера охватывает CPU, ускорители вывода, NVLink и другие технологии.

Лао Ху продает не просто одну видеокарту.

Он продает AI-фабрику, которая может непрерывно производить токены.

На этот раз Лао Хуан собирается полностью переложить основу для всей «эпохи агентов».

Справочные материалы:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.