Алибаба выпустила и открыла исходный код модели Qwen 3.8 Flash, использующей архитектуру MoE с 125B параметров, при этом активируется только около 6B параметров на токен. Модель нативно поддерживает контекст до 262144 токенов и может быть расширена до 1M токенов с помощью YaRN. Инновацией модели является возможность её запуска на потребительской видеокарте 4090, что обеспечивает перенос моделей длинного текста с уровня центров обработки данных на потребительское оборудование. Ещё более конкурентоспособной является её цена: 0,8 юаня за миллион входных токенов и 2,7 юаня за миллион выходных токенов — это всего одна треть стоимости DeepSeek-V4-Flash. Тесты показали, что модель может создать тексты для четырёх платформ за 2 минуты, а за 4 минуты — извлечь протоколы совещаний, структурировать таблицы и сгенерировать письма. Qwen 3.8 Flash уже доступна на платформе Qwen Office, одновременно открыт API-интерфейс. В тот же день Zhipu открыла исходный код GLM-5.3-Flash, производительность которой сопоставима с Claude Opus 4.8, а цена составляет одну сороковую от её стоимости.Автор статьи, источник: Quantum Bit
Новая модель Alibaba Qwen снова подняла планку.
Они выпустили и открыли исходный код Qwen 3.8 Flash-Next, который не только мгновенно превзошел по цене DeepSeek-V4-Flash, но и сразу занял первое место на Huggingface!

Пользователи Twitter также взволновались, и даже инженеры выложили видео с реальными тестами, восклицая:
Qwen 3.8 Flash снизил порог требований к VRAM,модель с длинным текстом уровня центра обработки данных теперь работает и на потребительской видеокарте 4090!
Кто-то уже с энтузиазмом применил это в своей работе.
За менее чем 8 минут он прошел всю рабочую цепочку, включающую программирование на Python, анализ нескольких таблиц и генерацию отчетов:

И эффекты башни тоже не проблема:

Вау, правда так круто? Нам тоже обязательно стоит попробовать.

Ввод всего за 0,8 юаня за миллион токенов
Qwen3.8-Flash использует архитектуру MoE с 125B параметров, активируя около 6B параметров на токен, нативно поддерживает контекст до 262144 токенов и может быть расширен до 1M токенов с помощью YaRN.
В то же время это является предварительным развертыванием новой архитектуры Qwen4.
По сравнению с Qwen 3.7 Plus, Qwen 3.8 Flash не только сократил активируемые параметры до 1/3, но и снизил стоимость обучения до 1/9, при этом значительно улучшил общие, математические и программные способности.
Еще более впечатляет цена: за миллион токенов входа Qwen 3.8 Flash стоит всего 0,8 юаня, за выход — 2,7 юаня, при попадании в кэш — 0,1 юаня, цена снижена до 1/3 от DeepSeek-V4-Flash.
Это намного сильнее, чем скидки на Pinduoduo (шутка)

Ладно, ладно, раз цена уже дошла до такого уровня, то давайте не будем церемониться — сразу включим полную мощность и протестируем реальную производительность Qwen 3.8 Flash в офисных задачах с помощью двух практических тестов.
Тест 1: Разработка четырех вариантов текстов для камеры, адаптированных под разные платформы
Мы организовали «Конкурс копирайтинга», в котором Qwen 3.8 Flash должен был за 1 юань переписать почти десятитысячный текст о камере под форматы Xiaohongshu, Weibo, Douyin и WeChat Moments, чтобы проверить, сколько задач он сможет выполнить.
Промпт следующий:

После отправки подсказки я пошел на кухню в офисе налить воды, все заняло менее двух минут.
Вернувшись, я увидел, что все четыре текста для разных платформ уже готовы, и @упоминания бренда, стиля и хэштегов подобраны идеально (кроме того, что я бы не стал публиковать такой длинный пост в朋友圈 hhh):




За менее чем две минуты подготовлено четыре текста — скорость «киберработника» можно считать достаточной.
Но в рабочей среде настоящей головной болью часто бывает не написание текстов, а то, кто уберет после совещания весь этот хаос.
Таким образом, мы дали ему вторую задачу, чтобы проверить его практические навыки работы.
Практическое тестирование 2: Превратить еженедельную встречу по продукту в выполнимый план
Мы воспроизвели в оригинальном виде десятитысячный текст первоначальной стенограммы совещания под названием «Технический обзор требований к агенту умной службы поддержки V2.0» — с множеством орфографических ошибок, похожих по звучанию, и вкраплениями случайных разговоров, которые участники могли бы получить сразу после еженедельного совещания. Qwen3.8-Flash выполнил все три задачи за один проход: извлечение резюме, структурирование в таблицы и составление почтового уведомления после встречи.
△ Изображение сгенерировано ИИ, что “token” звучит как “偷啃” — это действительно жизненно.
Промпт следующий:

В режиме по умолчанию Qwen3.8-Flash успешно завершил все задачи менее чем за 4 минуты, при этом пять основных выводов, распределение задач в таблице, формат письма и получатели точно соответствовали содержанию встречи.



△ Часть графиков тестовых результатов
Даже без запроса он самостоятельно и внимательно структурировал для нас вопросы, которые еще не были решены на встрече, чтобы мы могли продолжить обсуждение на следующем заседании, как будто:

И до этого момента мой лимит еще не исчерпан!
Ахаха, такое ощущение свободы — просто великолепно.
Сейчас Qwen 3.8 Flash уже запущен на платформе «Qianwen Office», а API-интерфейс также доступен — попробуйте!

Еще одно дело
Цена на отечественные крупные модели стала еще ниже.
Практически в то же время, что и открытие исходного кода Qwen 3.8 Flash, Zhipu также открыло исходный код первого нативного мультимодального модели GLM-5.3-Flash из серии GLM-5 — ранее широко известной в интернете модели Ox Alpha.
В тестах производительность модели сопоставима с Claude Opus 4.8, при этом цена снижена до 1/10 от цены GLM-5.3.

Кроме того, GLM-5.3-Flash щедро предлагает акцию со скидкой 50% в течение двух недель, что означает, что цена GLM-5.3-Flash в период акции составляет всего 1/20 от цены GLM-5.3 и 1/40 от цены Opus4.8.

Кроме того, Qwen 3.8 Flash и GLM-5.3-Flash имеют еще одну общую черту: они оба на этот раз застали DeepSeek-V4-Flash врасплох с сверхнизкой ценой (DeepSeek ушел, ругаясь):
△ График сравнения цен DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
Нечего сказать, слишком конкурентно.
