NVIDIA представила Vera Rubin NVL72, збільшивши пропускну здатність DeepSeek у 30 разів

icon MarsBit
Поділитися
AI summary iconКороткий зміст
NVIDIA опублікувала он-чейн новини з результатами тестування Vera Rubin NVL72, при цьому пропускна здатність DeepSeek-V4-Pro зросла в 30 разів. Вартість токенів знизилася в 35 разів порівняно з GB300 NVL72. Платформа включає Vera CPU та Groq 3 LPX, які зараз використовуються SpaceXAI. Можливі нові лісти токенів, оскільки зростання продуктивності свідчить про ширше застосування ШІ.

Неймовірно.

Щойно було опубліковано перші дані тестування на чипі для наступного флагманського кабінету NVIDIA — Vera Rubin NVL72.

І, крім того, це практичне тестування безпосередньо привело DeepSeek -V4-Pro, виконуйте найбільш реалістичні завдання «кодування агентів»!

Результати здивували: у порівнянні з поточним лідером ринку GB300 NVL72, Vera Rubin показала зростання пропускної здатності на 30 разів на мегаватт і зниження вартості токенів до 35 разів!

Агент

Хтось вигукнув: «Я навіть не смів би писати презентацію для обману інвесторів так!»

І ще один коментар користувача: «Раніше вважали, що H200 за 30 тисяч доларів — це дорого, а зараз дивишся назад — виявляється, H200 навіть не базова версія».

Агент

Давайте уважно розберемося.

Від H200 до GB300 пропускна здатність реальних робочих навантажень агентів зросла до 30 разів, а витрати приблизно подвоїлися.

Від GB300 до Вери Рубін, пропускна здатність знову зросла до 30 разів, а ціна за повний стенд приблизно подвоїлася.

Згідно з законом Мура від Старого Хуанга, за останні два роки найбільшим технічним проривом NVIDIA було не саме GPU, а те, що ціна зросла в 4 рази, а швидкість — на цілих 900 разів!

Агент

На цей раз NVIDIA оголосила всім про протилежну інтуїції правду: епоха LLM завершилася, настає епоха Agent, і всі попередні стандарти оцінки штучного інтелекту застаріли!

Агент

Тим часом Vera CPU, створена спеціально для агентів, була негайно встановлена SpaceXAI Маска, навіть готуючись вивести її у космос.

Того ж дня також почалося повномасштабне виробництво NVIDIA Groq 3 LPX.

Gemma 4 31B працює вище, швидкість просто неймовірна — до 3400 токенів за секунду. Пропускна здатність моделі з трильйоном параметрів зросла в 35 разів.

Агент

Агент

Ці нові рекорди відразу переписують комерційну карту екосистеми Agent, починаючи з цієї ночі!

Чому NVIDIA повинна випустити Vera Rubin?

Останні дані OpenRouter дають відповідь: у реальному світі завдання Agent AI споживає в 15 разів більше токенів, ніж звичайна розмова!

Наприклад, якщо агент має дослідити компанію для прийняття інвестиційного рішення, то в процесі агент і підагенти постійно міркують, а накопичені токени стають вхідними даними для наступного кроку, і обробка довгого контексту стає найважливішим обмеженням для штучного інтелекту агента.

Агент

Чим більше взаємодій агентів, тим більша пропускна здатність — кількість агентів збільшилася в 10 разів, викликів інструментів — в 2 рази, протиріччя між обчислювальними ресурсами та алгоритмами породило нові потреби.

Агент

Не використовуйте чат як агент, старі базові показники скасовані!

В цей момент традиційні тестові стандарти ШІ (наприклад, тести з фіксованою довжиною послідовності 8K/1K) повністю втрачають ефективність.

NVIDIA офіційно зазначила: вимірювання продуктивності має розвиватися! Більше не можна вимірювати лише окремі запити на висновок, потрібно фіксувати повні робочі процеси агентів.

Для цього вони використали бенчмарк AgentX від SemiAnalysis.

Цей тест більше не є сухими питаннями та відповідями, а є відтворенням реальних «сесій написання коду» з контекстним зростанням, викликом інструментів та генерацією підагентів.

Агент

Ось чому H200 виявляється неспроможним на новому полі бою агентів, а Вера Рубін зобов’язана стати королем.

Вера Рубін NVL72 × DeepSeek-V4-Pro:

Прийшов мінінговий монстр

Щоб продемонструвати потужність Vera Rubin NVL72, NVIDIA безпосередньо використовує короля з відкритим кодом — DeepSeek -V4-Pro (1.6T) проходить внутрішній тест на чипі.

Після публікації даних результати виявилися дивовижними—

Під навантаженням AgentX пропускна здатність Vera Rubin NVL72 на мегаватт зросла в порівнянні з GB300 NVL72 цілих на 30 разів!

Агент

Зверніть увагу, що порівнюється не застарілий H200, а популярний основний GB300.

GB300 у тій же DeepSeek Під час тестування V4-Pro пропускна здатність на мегаватт вже вища в 15 разів порівняно з H200.

Однак Веру Рубін на плечах GB300 підняло ще на 30 разів, піднявши всю криву Парето!

Що це означає?

Для «AI-фабрик», що обмежені електропостачанням, це безпосередньо розширює межі фізичних законів.

За тих самих електричних витрат Vera Rubin може виконати в 30 разів більше роботи агентів.

Для дата-центрів потужністю у мегаватти або навіть гігаватти це еквівалентно з’явленню 30-кратного обсягу обчислювальних активів.

Крім того, технологія NVIDIA DSX MaxLPS дозволяє керувати живленням на рівні GPU, стелажу та завантаження, що дозволяє розмістити до 40% більше GPU в межах того ж бюджету на мегаватти, що дало змогу ще більше підвищити пропускну здатність на мегаватт для AI-фабрик!

Агент

Вартість токенів знизилася в 35 разів! «Книга обліку» індустрії Agent повністю переписана

На кожен мегаватт пропускної здатності безпосередньо впливає вартість генерації кожного токена. Різке зростання продуктивності призводить до найпрямішого наслідку — ядерного вибуху бізнес-моделі.

NVIDIA оголосила, що виробництво кожного мільйона токенів на Vera Rubin NVL72 коштує на 35 разів менше, ніж на GB300 NVL72!

Агент

Коли витрати на обчислення падають у 35 разів, круглодобові цифрові працівники стануть реальністю, і на ринку ToC з’явиться масовий вибух суперзастосунків.

Цей хід старого Хуанга прямо відкрив двері до ери агентів.

Агент

Екстремальний синергічний дизайн: як це зробив Хуанг?

Ви можете запитати: чому швидкість може збільшитися в 30 разів? Чи це завдяки технології однієї чіп-плати?

Звичайно, ні.

Vera Rubin NVL72 здійснила захопливий підйом продуктивності завдяки «екстремальному співробітництву в дизайні».

Агент

Наприклад, розділені сервіси, розподілена KV-кеш-пам’ять, маршрутизація з урахуванням KV, MegaMoE тощо.

Агент

Крім того, NVFP4 квантує ваги моделі прямо до 4-бітної точності, значно зменшуючи використання пам’яті без втрати якості виводу, що різко збільшує пропускну здатність.

А шосте покоління NVLink разом із великою моделлю MoE забезпечує мережу зі швидкістю в 10 разів вищою та затримкою в 3 рази нижчою, ніж у готових етернет-мережах, що дозволяє DeepSeek Ця велика модель на основі архітектури MoE може плавно викликати різні підмережі «експертів» між 72 GPU.

Це вже не продаж відеокарт — старий Хуан продає цілу «AI-електростанцію».

Агент

NVIDIA Groq 3 LPX повністю введено у масове виробництво:

3400 токенів/сек, кодовий агент змінюється!

На конференції Hot Chips 2026 NVIDIA також оголосила захоплюючу новину: Groq 3 LPX почав повномасштабне виробництво!

Агент

Groq 3 LPX — це ексклюзивне розширення для платформи центру обробки даних Vera Rubin NVL72.

Він розроблений спеціально для цієї системи і зосереджений на мінімізації затримки при висновку.

Ця чорна магія була куплена NVIDIA у грудні минулого року за 20 мільярдів доларів США у стартапу Groq.

Агент

AI-агенти можуть стикатися з проблемами затримки декодування; щоб вирішити цю проблему, Groq 3 LPX елегантно розділяє обробку великих контекстів і генерацію токенів.

Рішенням NVIDIA є використання GPU Rubin для обробки великих контекстів та передача завдання швидкого генерування токенів Groq 3 LPX.

Один відповідає за «читання», інший — за «запис», кожен займається тим, що виходить у нього найкраще.

Агент

У повністю розгорнутій установці на рівні стелажу до 256 прискорювачів LP30 можуть працювати разом з GPU через надвисокосмугове з’єднання, створюючи інференс-двигун підприємського рівня.

Агент

Завдяки цьому Groq 3 LPX досяг рекордної швидкості виведення.

У тестах Artificial Analysis Groq 3 LPX запускає Gemma 4 31B у довгому контекстному вікні з 100 000 токенів і досягає швидкості виведення 3 400 токенів/секунду!

Це робить його в 4 рази швидшим у відповіді на завдання, де критично важлива затримка.

Агент

Завдання з кількома кроками, які раніше займали кілька годин, тепер можна виконати за кілька хвилин!

Агент

Groq 3 LPX при генерації 5000 токенів зменшив час з 50 секунд до 1,5 секунди — у 34 рази.

Агент

А в завданнях кодування максимальна швидкість виведення Groq 3 LPX становить 6981 токенів/с.

Агент

Хуан Ренсюнь відкрито сказав, що за допомогою LPX досягнуто «ще одного величезного стрибка» у пропускній здатності та швидкості відповіді AI при генерації токенів.

Агент

Nebius вже розгорнув цей чіп у Nebius Token Factory, щоб забезпечити миттєву відповідь на кожному етапі циклу агентів.

Агент

За ним слідує сама Groq.

Агент

Випущено перший CPU, створений спеціально для Agent,

Маск ніченькою «відправився до космосу»!

Найбільш амбітним кроком у цьому офіційному оголошенні є Vera CPU.

Для Agent NVIDIA спеціально розробила процесор.

Цей процесор Vera створений саме для живлення агентів

Він оснащений 88 власними ядрами Olympus, високопропускною пам’яттю LPDDR5X з пропускною здатністю до 1,2 ТБ/с.

Агент

Чому в епоху великих моделей потрібні нові процесори?

На Hot Chips високопосадовець NVIDIA Vera CPU прямо сказав: «Агентне ШІ — це найскладніша обчислювальна задача в історії».

Агент

Одне завдання, за яким за кулисами виконується сотні кроків: виклик інструментів, виконання коду Python, перегляд контексту, обробка величезних обсягів даних...

Всю цю роботу з планування кур’єрських завдань виконує процесор. Тому NVIDIA повинна створити окремий процесор для агента.

Саме через це Маск і SpaceXAI негайно оголосили про масштабне розгортання процесорів NVIDIA Vera!

Ще у травні цього року NVIDIA таємно надіслала перші зразки Vera до компаній A, OpenAI та SpaceXAI для попереднього тестування.

Лише через три місяці SpaceXAI нетерпляче перейшла до повномасштабного розгортання.

Ще божевільніше те, що SpaceXAI будує фабрику з потужністю в гігавати на платформі Vera Rubin для запуску Grok.

Крім того, цю обчислювальну потужність прямо відправлять у космос.

Маск сказав: «Дві сильні сторони об’єдналися, щоб розробити оптимізовану версію Vera Rubin NVL72, яку планується масово розгорнути у 2028 році».

Агент

Перший покоління AI-супутників SpaceXAI «Starmind» планує використовувати систему Vera Rubin NVL72 у форматі стійки.

Агент

Від однієї GPU до цілої фабрики агентів

Того ж дня обидва чіпи — Vera CPU та Groq 3 LPX — почали повномасштабне виробництво.

Це має велике значення для NVIDIA.

Агент

У епоху великих моделей NVIDIA захопила тренування та висновки завдяки GPU.

У епоху агентів його сфера діяльності розширилася до CPU, прискорювачів висновків, NVLink тощо.

Лао Хуа продаває не просто GPU.

Він продає AI-фабрику, яка може неперервно виробляти токени.

На цей раз Лао Хуан збирається заново закласти фундамент для «епохи агентів».

Джерела:

https://x.com/MinLiBuilds/status/2091915873661686204

https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

Цей матеріал з іншого веб-сайту «XinZhiYuan», автор: ASI Apokalypsis

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.