Qwen 3.8 Flash снижает затраты до одной трети от DeepSeek-V4-Flash

iconMetaEra
Поделиться
AI summary iconСводка
Qwen 3.8 Flash от Alibaba теперь доступен на платформе Qwen Office и предлагает 125 млрд MoE с 6 млрд активных параметров на токен. Он нативно поддерживает 262 144 токена и работает на GPU 4090. Стоимость составляет 0,8 юаня за миллион входных токенов, что в три раза дешевле, чем DeepSeek-V4-Flash. Трейдерам, отслеживающим альткоины для наблюдения, это может показаться ключевым развитием. Модель справляется со сложными задачами менее чем за четыре минуты и готова к использованию через API. В тот же день Zhipu открыла исходный код GLM-5.3-Flash по цене, составляющей одну сороковую от Claude Opus 4.8. Рыночный настрой, включая индекс страха и жадности, может измениться с появлением таких экономически эффективных моделей.
Алибаба выпустила и открыла исходный код модели Qwen 3.8 Flash, использующей архитектуру MoE с 125B параметров, при этом активируется только около 6B параметров на токен. Модель нативно поддерживает контекст до 262144 токенов и может быть расширена до 1M токенов с помощью YaRN. Инновацией модели является возможность её запуска на потребительской видеокарте 4090, что обеспечивает перенос моделей длинного текста с уровня центров обработки данных на потребительское оборудование. Ещё более конкурентоспособной является её цена: 0,8 юаня за миллион входных токенов и 2,7 юаня за миллион выходных токенов — это всего одна треть стоимости DeepSeek-V4-Flash. Тесты показали, что модель может создать тексты для четырёх платформ за 2 минуты, а за 4 минуты — извлечь протоколы совещаний, структурировать таблицы и сгенерировать письма. Qwen 3.8 Flash уже доступна на платформе Qwen Office, одновременно открыт API-интерфейс. В тот же день Zhipu открыла исходный код GLM-5.3-Flash, производительность которой сопоставима с Claude Opus 4.8, а цена составляет одну сороковую от её стоимости.

Автор статьи, источник: Quantum Bit

Новая модель Alibaba Qwen снова подняла планку.

Они выпустили и открыли исходный код Qwen 3.8 Flash-Next, который не только мгновенно превзошел по цене DeepSeek-V4-Flash, но и сразу занял первое место на Huggingface!

Изображение

Пользователи Twitter также взволновались, и даже инженеры выложили видео с реальными тестами, восклицая:

Qwen 3.8 Flash снизил порог требований к VRAM,модель с длинным текстом уровня центра обработки данных теперь работает и на потребительской видеокарте 4090!

Изображение

Кто-то уже с энтузиазмом применил это в своей работе.

За менее чем 8 минут он прошел всю рабочую цепочку, включающую программирование на Python, анализ нескольких таблиц и генерацию отчетов:

Изображение

И эффекты башни тоже не проблема:

Изображение

Вау, правда так круто? Нам тоже обязательно стоит попробовать.

Изображение

Ввод всего за 0,8 юаня за миллион токенов

Qwen3.8-Flash использует архитектуру MoE с 125B параметров, активируя около 6B параметров на токен, нативно поддерживает контекст до 262144 токенов и может быть расширен до 1M токенов с помощью YaRN.

В то же время это является предварительным развертыванием новой архитектуры Qwen4.

По сравнению с Qwen 3.7 Plus, Qwen 3.8 Flash не только сократил активируемые параметры до 1/3, но и снизил стоимость обучения до 1/9, при этом значительно улучшил общие, математические и программные способности.

Еще более впечатляет цена: за миллион токенов входа Qwen 3.8 Flash стоит всего 0,8 юаня, за выход — 2,7 юаня, при попадании в кэш — 0,1 юаня, цена снижена до 1/3 от DeepSeek-V4-Flash.

Это намного сильнее, чем скидки на Pinduoduo (шутка)

Изображение

Ладно, ладно, раз цена уже дошла до такого уровня, то давайте не будем церемониться — сразу включим полную мощность и протестируем реальную производительность Qwen 3.8 Flash в офисных задачах с помощью двух практических тестов.

Тест 1: Разработка четырех вариантов текстов для камеры, адаптированных под разные платформы

Мы организовали «Конкурс копирайтинга», в котором Qwen 3.8 Flash должен был за 1 юань переписать почти десятитысячный текст о камере под форматы Xiaohongshu, Weibo, Douyin и WeChat Moments, чтобы проверить, сколько задач он сможет выполнить.

Промпт следующий:

Изображение

После отправки подсказки я пошел на кухню в офисе налить воды, все заняло менее двух минут.

Вернувшись, я увидел, что все четыре текста для разных платформ уже готовы, и @упоминания бренда, стиля и хэштегов подобраны идеально (кроме того, что я бы не стал публиковать такой длинный пост в朋友圈 hhh):

Изображение

Изображение

Изображение

Изображение

За менее чем две минуты подготовлено четыре текста — скорость «киберработника» можно считать достаточной.

Но в рабочей среде настоящей головной болью часто бывает не написание текстов, а то, кто уберет после совещания весь этот хаос.

Таким образом, мы дали ему вторую задачу, чтобы проверить его практические навыки работы.

Практическое тестирование 2: Превратить еженедельную встречу по продукту в выполнимый план

Мы воспроизвели в оригинальном виде десятитысячный текст первоначальной стенограммы совещания под названием «Технический обзор требований к агенту умной службы поддержки V2.0» — с множеством орфографических ошибок, похожих по звучанию, и вкраплениями случайных разговоров, которые участники могли бы получить сразу после еженедельного совещания. Qwen3.8-Flash выполнил все три задачи за один проход: извлечение резюме, структурирование в таблицы и составление почтового уведомления после встречи.

Изображение△ Изображение сгенерировано ИИ, что “token” звучит как “偷啃” — это действительно жизненно.

Промпт следующий:

Изображение

В режиме по умолчанию Qwen3.8-Flash успешно завершил все задачи менее чем за 4 минуты, при этом пять основных выводов, распределение задач в таблице, формат письма и получатели точно соответствовали содержанию встречи.

Изображение

Изображение

Изображение

Изображение△ Часть графиков тестовых результатов

Даже без запроса он самостоятельно и внимательно структурировал для нас вопросы, которые еще не были решены на встрече, чтобы мы могли продолжить обсуждение на следующем заседании, как будто:

Изображение

И до этого момента мой лимит еще не исчерпан!

Ахаха, такое ощущение свободы — просто великолепно.

Сейчас Qwen 3.8 Flash уже запущен на платформе «Qianwen Office», а API-интерфейс также доступен — попробуйте!

Изображение

Еще одно дело

Цена на отечественные крупные модели стала еще ниже.

Практически в то же время, что и открытие исходного кода Qwen 3.8 Flash, Zhipu также открыло исходный код первого нативного мультимодального модели GLM-5.3-Flash из серии GLM-5 — ранее широко известной в интернете модели Ox Alpha.

В тестах производительность модели сопоставима с Claude Opus 4.8, при этом цена снижена до 1/10 от цены GLM-5.3.

Изображение

Кроме того, GLM-5.3-Flash щедро предлагает акцию со скидкой 50% в течение двух недель, что означает, что цена GLM-5.3-Flash в период акции составляет всего 1/20 от цены GLM-5.3 и 1/40 от цены Opus4.8.

Изображение

Кроме того, Qwen 3.8 Flash и GLM-5.3-Flash имеют еще одну общую черту: они оба на этот раз застали DeepSeek-V4-Flash врасплох с сверхнизкой ценой (DeepSeek ушел, ругаясь):

Изображение△ График сравнения цен DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash

Нечего сказать, слишком конкурентно.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.