Alibaba випустила та відкрила модель Qwen 3.8 Flash з архітектурою MoE 125B, де для кожного токена активується лише приблизно 6B параметрів. Модель нативно підтримує контекст до 262144 токенів і може бути розширена до 1M токенів за допомогою YaRN. Її інновація полягає в можливості запуску на споживчих GPU 4090, що забезпечує перенесення моделей довгого тексту з дата-центрів на споживчі апаратні платформи. Її ціна ще більш конкурентна: 0,8 юаня за мільйон токенів на вхід і 2,7 юаня за мільйон токенів на вихід — лише третина від ціни DeepSeek-V4-Flash. Тестування показало, що модель може написати тексти для чотирьох платформ за 2 хвилини, а за 4 хвилини — витягти записи з засідання, впорядкувати таблиці та створити листа. Qwen 3.8 Flash вже доступна на платформі Qwen Office, а також відкрито API. Того ж дня Zhipu відкрила GLM-5.3-Flash, чиї показники за продуктивністю порівнянні з Claude Opus 4.8, а ціна становить лише одну сорокову.Автор статті, джерело: Quantum Bit
Нова модель Alibaba Qwen знову підняла планку.
Вони випустили та відкрили код Qwen 3.8 Flash-Next, який не лише миттєво перевершив DeepSeek-V4-Flash за ціною, але й відразу ж посів перше місце на Huggingface!

Також у твіттері користувачі засміялися, і навіть інженери виклали відео з реальним тестуванням, вигукуючи: "Величезно!"
Qwen 3.8 Flash знищив бар’єр VRAM,велика модель для довгих текстів рівня дата-центру тепер працює на звичайній графічній карті 4090!
Хтось уже ентузіастично застосував це у роботі.
За менше ніж 8 хвилин він пройшов повний робочий процес, що охоплює програмування на Python, аналіз багатьох таблиць та генерацію звітів:

Також не становить проблеми ефект Східних веж:

Вау, це справді таке класне? Ми теж обов’язково спробуємо.

Лише 0,8 юаня за мільйон токенів на вхід
Qwen3.8-Flash використовує архітектуру MoE з 125B параметрів, активуючи лише приблизно 6B параметрів на токен, нативно підтримує контекст до 262144 токенів і може бути розширений до 1M токенів за допомогою YaRN.
Водночас це є попереднім підготовчим етапом для нової архітектури Qwen4.
Порівняно з Qwen 3.7 Plus, Qwen 3.8 Flash не тільки зменшив кількість активованих параметрів до 1/3, але й знизив витрати на навчання до 1/9, при цьому значно покращив загальні, математичні та програмні здібності.
Ще жорсткіше — ціни: Qwen 3.8 Flash — лише 0,8 юаня за вхідні мільйон токенів, 2,7 юаня за вихідні, 0,1 юаня за співпадіння кешу, ціна досягає 1/3 від DeepSeek-V4-Flash.
Це набагато сильніше, ніж розрізання ножицями на Pinduoduo (bushi)

Гаразд, гаразд, оскільки ціна вже дійшла до такого рівня, то не будемо вагатися — відразу збільшимо інтенсивність і перевіримо реальну продуктивність Qwen 3.8 Flash у робочих сценаріях за допомогою двох практичних тестів.
Тест 1: Розробка чотирьох текстів для продукту камери, адаптованих під різні платформи
Ми організували «Виклик копірайтингу», у якому Qwen 3.8 Flash мав за 1 юань переписати тисячі слів технічного опису камери у форматі постів для Xiao Hong Shu, Weibo, Douyin та WeChat Moments, щоб побачити, скільки завдань він зможе виконати.
Наступні підказки:

Після введення підказки я пішов у кухню компанії налити води, це зайняло менше двох хвилин.
Повернувшися, я побачив, що чотири різних текстів уже повністю написані, і @відмічені правильні бренди, стилі та хештеги (крім того, що я б не писав так довгі пости у朋友圈 — hhh):




Менше ніж за дві хвилини написав чотири тексти — швидкість «кіберпрацівника» вважається задовільною.
Але в робочому середовищі справжнім головним білем часто є не написання текстів, а те, хто після зустрічі прибере цей хаос.
Тож ми надали йому другу роботу, щоб перевірити його практичні навички роботи.
Другий тест: перетворити щотижневу зустріч з продуктом у виконуваний план
Ми зберегли оригінальний вигляд десятитисячного тексту засідання — «Вимоги та технічний огляд агента інтелектуальної підтримки V2.0» — з усіма омовами, помилками та побічними розмовами, які зазвичай з’являються після щотижневої зустрічі, і Qwen3.8-Flash за один раз виконав три завдання: виділення зведень, створення таблиць та написання електронного листа з інформацією після зустрічі.
△ Зображення створено за допомогою ШІ, що “token” почулося як “偷啃” — це справді життєво
Наступні підказки:

У режимі за замовчуванням Qwen3.8-Flash успішно виконав усі завдання за менше ніж 4 хвилини, і всі п’ять основних висновків, розподіл завдань у таблиці, формат листа були точними, а отримувачі відповідали змісту зустрічі.



△ Частина графіків тестових результатів
Навіть без запиту він сам відсортував питання, що залишилися нерозв’язаними на зустрічі, щоб ми могли продовжити обговорення на наступному засіданні, як-от:

І на цьому етапі мій ліміт ще не вичерпано!
Ага, це так приємно — відчувати відсутність обмежень.
Зараз Qwen 3.8 Flash вже запущений на платформі «Qianwen Office», а API-інтерфейс також вже доступний — спробуйте!

Ще одна річ
Цінова війна між великими китайськими моделями посилюється.
Майже одночасно з відкритим випуском Qwen 3.8 Flash, Zhipu також відкрила першу нативну багатомодальну модель серії GLM-5 — GLM-5.3-Flash, яка раніше стала вірусною в інтернеті під назвою Ox Alpha.
У тестах продуктивність цієї моделі дорівнює Claude Opus 4.8, а ціна зменшена до 1/10 від GLM-5.3.

Крім того, GLM-5.3-Flash щедро пропонує двотижневу акцію зі знижкою 50%, що означає, що ціна GLM-5.3-Flash під час акції становить лише 1/20 від ціни GLM-5.3 і 1/40 від ціни Opus4.8.

Крім того, Qwen 3.8 Flash і GLM-5.3-Flash мають ще одну спільну рису: обидва вони на цей раз зі значною перевагою в ціні змусили DeepSeek-V4-Flash відступити (DeepSeek відходив, бурчачи собі під ніс):
△ Графік порівняння цін DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash
Нема що казати, надто напружено.
