BlockBeats повідомляє, 26 липня інвестор Anthropic Deedy зазначив, що всі стартапи, які розробляють чіпи наступного покоління штучного інтелекту, намагаються різними способами зруйнувати домінування NVIDIA, звертаючись до фундаментальної проблеми «переміщення даних». Шість стратегій диференціації включають: видалення DRAM (Groq, який був придбаний NVIDIA за 20 мільярдів доларів), видалення з’єднань (Cerebras, який вже вийшов на ринок з ринковою капіталізацією близько 48 мільярдів доларів), видалення розділення обчислень і пам’яті (d-Matrix), видалення серверної архітектури, орієнтованої на обчислення (Majestic), видалення універсальності (Etched, Taalas, MatX), а також видалення літографічних машин вартістю 400 мільйонів доларів (Substrate).
Лістинг та ціна придбання Cerebras і Groq встановили ціновий стандарт для всього сегменту чіпів для ШІ, а Etched на тиждень подвоїла свою оцінку до 10,3 млрд доларів США, вибухнувши з низького профілю лише за три тижні, що додатково підтверджує швидку переоцінку капіталом цього сегменту. У 18 основних стартапах загальна книжкова вартість приватних компаній становить близько 58 млрд доларів США, а ринкова капіталізація на публічних ринках — близько 48 млрд доларів США, охоплюючи такі сегменти, як висновок, навчання/нові архітектури, системи та виробництво та літографія.
Кожен із цих підходів ставить під сумнів основні припущення архітектури GPU NVIDIA — що пересування даних між обчислювальними одиницями та пам’яттю вимагає часу та енергії. Groq повністю виключає затримки рівнів пам’яті, замінюючи DRAM на SRAM, Cerebras усуває обмеження міжчіпних з’єднань за допомогою чіпів розміром із вироб, d-Matrix виконує обчислення безпосередньо в пам’яті, а Etched відмовляється від універсальності, розробляючи апаратне забезпечення виключно для архітектури Transformer. Екосистема стартапів у сфері AI-чіпів еволюціонувала від однієї історії про заміну GPU на багатоточкову атаку на рівні архітектури. Аквізиція Groq NVIDIA свідчить про те, що компанія розуміє: ключ до наступної конкуренції — не пікове обчислювальне навантаження, а повна реконструкція ефективності пересування даних.
