DeepSeek только что выпустила модель, которая обрабатывает миллион токенов контекста, активируя меньше параметров, чем некоторые открытые модели, выпущенные два года назад. V4.1-Flash, запущенная 10 сентября, представляет собой последнюю попытку китайского стартапа в области ИИ переписать экономику крупных языковых моделей.
Модель упаковывает 552 миллиарда параметров в архитектуру Mixture-of-Experts (MoE), но для входных задач активирует около 8 миллиардов, а для выходных — 16 миллиардов. В результате получается модель, которая демонстрирует производительность, значительно превышающую то, что можно было бы ожидать по её активному вычислительному следу.
Архитектура, которая обеспечивает её работу
V4.1-Flash представляет асимметричную архитектуру кодировщика-декодера с каскадной обработкой, которую называет DeepSeek: вход обрабатывается и выход генерируется через разные пути, оптимизированные для каждой задачи, а не через единую конвейерную систему.
Окно контекста расширено до 1 миллиона токенов. Для поддержки такого огромного контекста используется KV-кэш, который потребляет примерно 890 байт на токен — примерно четверть от объема, требуемого предыдущей моделью V4-Flash.
Сокращение этого кэша имеет большее значение, чем может показаться. KV-кэш — это ограничение по памяти, определяющее, сколько одновременных пользователей может обслуживать модель и как долго могут длиться их беседы. Сокращение на 75% означает, что операторы могут обслуживать примерно в четыре раза больше пользователей на том же оборудовании или обрабатывать контексты в четыре раза длиннее без апгрейда своих GPU-кластеров.
По результатам тестов DeepSeek утверждает, что V4.1-Flash превосходит собственную модель V4-Pro и напрямую конкурирует с GPT-5.6 и Kimi K3. Компания уже перенаправляет запросы с V4-Pro на новую модель, причем обновленные цены вступят в силу 14 сентября.
Открытые веса, открытая стратегия
DeepSeek выпустил веса модели под лицензией MIT на Hugging Face. Новая модель доступна через API DeepSeek по эндпоинту «deepseek-flash». Сочетание открытых весов и доступа через API создает два пути внедрения: разработчики, желающие запускать инференс на собственной инфраструктуре, могут загрузить и развернуть модель локально, а те, кто предпочитает управляемые сервисы, могут вызывать API по новым тарифам DeepSeek.
Последствия IPO и конкурентная позиция
Время запуска V4.1-Flash не случайно. Ожидается, что DeepSeek выйдет на рынок STAR Шанхая, и демонстрация постоянного технического импульса — это именно то, что делает презентации на рекламных турах более убедительными.
Многообразное понимание, встроенное в V4.1-Flash, охватывающее как визуальные, так и текстовые данные, сужает возможности для дифференциации конкурентов, включая OpenAI и Moonshot AI, разрабатывающих Kimi K3.
