DeepSeek лише що випустила модель, яка обробляє мільйон токенів контексту, активуючи менше параметрів, ніж деякі відкриті моделі, випущені два роки тому. V4.1-Flash, запущена 10 вересня, — це останній крок китайського стартапу в галузі штучного інтелекту, спрямований на переписування економіки великих мовних моделей.
Модель містить 552 мільярди параметрів у архітектурі Mixture-of-Experts (MoE), але для вхідних завдань активує лише близько 8 мільярдів, а для вихідних — 16 мільярдів. В результаті отримується модель, яка демонструє продуктивність значно вищу, ніж передбачає її активний обчислювальний витратний профіль.
Архітектура, яка робить це можливим
V4.1-Flash вводить асиметричну архітектуру каскадного кодека, яку називає DeepSeek, обробляючи вхідні дані та генеруючи вихід через різні шляхи, оптимізовані для кожної задачі, замість використання єдиного конвеєра.
Вікно контексту розтягується до 1 мільйона токенів. Підтримка цього масштабного контексту забезпечується KV-кешем, який споживає приблизно 890 байт на токен, що становить близько чверті від того, що вимагала попередня модель V4-Flash.
Це зменшення кешу має більше значення, ніж може здатися. KV-кеш — це обмеження пам’яті, яке визначає, скільки одночасних користувачів може обслуговувати модель і як довго можуть тривати їхні розмови. Зменшення на 75% означає, що оператори можуть обслуговувати приблизно в чотири рази більше користувачів на тій самій апаратній платформі або обробляти контексти в чотири рази довші, не оновлюючи свої кластери GPU.
На тестах DeepSeek стверджує, що V4.1-Flash перевершує власну модель V4-Pro та безпосередньо конкурує з GPT-5.6 та Kimi K3. Компанія вже перенаправляє запити з V4-Pro на нову модель, а оновлені ціни вступлять у силу 14 вересня.
Відкриті ваги, відкрита стратегія
DeepSeek випустив ваги моделі за ліцензією MIT на Hugging Face. Нову модель можна отримати через API DeepSeek за ендпоінтом «deepseek-flash». Поєднання відкритих ваг та доступу через API створює дві траєкторії адаптації: розробники, які хочуть запускати висновки на своїй інфраструктурі, можуть завантажити та розгорнути локально, тоді як ті, хто віддає перевагу керованим сервісам, можуть викликати API за новими ціновими тарифами DeepSeek.
Наслідки IPO та конкурентна позиція
Термін запуску V4.1-Flash не випадковий. Очікується, що DeepSeek вийде на ринок STAR Шанхаю, і демонстрація постійного технічного імпульсу — це саме те, що робить презентації для інвесторів більш переконливими.
Багатомодальне розуміння, вбудоване у V4.1-Flash, яке охоплює як візуальні, так і текстові дані, звужує можливості для диференціації конкурентів, включаючи OpenAI та Moonshot AI, яка розробляє Kimi K3.
