Якщо згідно з останнім звітом SemiAnalysis, HBM у Rubin Ultra знизився до 192 ГБ, то в сценаріях, чутливих до пам’яті — агентних висновків, довгих контекстів, великих моделей MoE — 192 ГБ буде більш обмеженим, ніж 288 ГБ, що означає, що його реальна ефективна продуктивність у деяких сценаріях наблизиться до або навіть виявиться нижчою, ніж у стандартної версії Vera Rubin. Покращена версія Ultra Rubin має гіршу продуктивність, ніж стандартна Vera Rubin; для розгортання тієї ж моделі може знадобитися більше GPU, що призведе до збільшення накладних витрат на міжкартову комунікацію, розбиття моделі та переміщення даних, зниження ефективної використовуваності однієї карти та зростання вартості генерації одного токена. Іншими словами, хоча виробництво GPU збільшилося, якщо на кожну задачу потрібно більше GPU, загальні витрати на обчислювальну потужність у системному масштабі не обов’язково знизяться. Логіка оновленої версії таким чином не має сенсу. Отже, чи не краще взагалі не випускати Ultra-версію, а продовжувати продавати Vera Rubin до другої половини 2027 року, а потім у 2028 році перейти безпосередньо на наступне покоління архітектури Feynman? 🤔
qinbafrankПоділитися
Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.