Qwen 3.8 Flash зменшує витрати до третини від DeepSeek-V4-Flash

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Qwen 3.8 Flash від Alibaba, тепер доступний на платформі Qwen Office, пропонує 125B MoE з 6B активними параметрами на токен. Він підтримує 262 144 токени нативно і працює на GPU 4090. Ціна — 0,8 юаня за мільйон вхідних токенів, що втричі дешевше, ніж DeepSeek-V4-Flash. Трейдери, які стежать за альткоїнами для спостереження, можуть вважати це ключовим розвитком. Модель виконує складні завдання за менше ніж чотири хвилини і готова до використання через API. Того ж дня Zhipu відкрила джерела GLM-5.3-Flash за ціною, що становить одну сорокову від Claude Opus 4.8. Настрій ринку, включаючи індекс страху та жадібності, може змінитися з введенням таких ефективних за витратами моделей.
Alibaba випустила та відкрила модель Qwen 3.8 Flash з архітектурою MoE 125B, де для кожного токена активується лише приблизно 6B параметрів. Модель нативно підтримує контекст до 262144 токенів і може бути розширена до 1M токенів за допомогою YaRN. Її інновація полягає в можливості запуску на споживчих GPU 4090, що забезпечує перенесення моделей довгого тексту з дата-центрів на споживчі апаратні платформи. Її ціна ще більш конкурентна: 0,8 юаня за мільйон токенів на вхід і 2,7 юаня за мільйон токенів на вихід — лише третина від ціни DeepSeek-V4-Flash. Тестування показало, що модель може написати тексти для чотирьох платформ за 2 хвилини, а за 4 хвилини — витягти записи з засідання, впорядкувати таблиці та створити листа. Qwen 3.8 Flash вже доступна на платформі Qwen Office, а також відкрито API. Того ж дня Zhipu відкрила GLM-5.3-Flash, чиї показники за продуктивністю порівнянні з Claude Opus 4.8, а ціна становить лише одну сорокову.

Автор статті, джерело: Quantum Bit

Нова модель Alibaba Qwen знову підняла планку.

Вони випустили та відкрили код Qwen 3.8 Flash-Next, який не лише миттєво перевершив DeepSeek-V4-Flash за ціною, але й відразу ж посів перше місце на Huggingface!

Зображення

Також у твіттері користувачі засміялися, і навіть інженери виклали відео з реальним тестуванням, вигукуючи: "Величезно!"

Qwen 3.8 Flash знищив бар’єр VRAM,велика модель для довгих текстів рівня дата-центру тепер працює на звичайній графічній карті 4090!

Зображення

Хтось уже ентузіастично застосував це у роботі.

За менше ніж 8 хвилин він пройшов повний робочий процес, що охоплює програмування на Python, аналіз багатьох таблиць та генерацію звітів:

Зображення

Також не становить проблеми ефект Східних веж:

Зображення

Вау, це справді таке класне? Ми теж обов’язково спробуємо.

Зображення

Лише 0,8 юаня за мільйон токенів на вхід

Qwen3.8-Flash використовує архітектуру MoE з 125B параметрів, активуючи лише приблизно 6B параметрів на токен, нативно підтримує контекст до 262144 токенів і може бути розширений до 1M токенів за допомогою YaRN.

Водночас це є попереднім підготовчим етапом для нової архітектури Qwen4.

Порівняно з Qwen 3.7 Plus, Qwen 3.8 Flash не тільки зменшив кількість активованих параметрів до 1/3, але й знизив витрати на навчання до 1/9, при цьому значно покращив загальні, математичні та програмні здібності.

Ще жорсткіше — ціни: Qwen 3.8 Flash — лише 0,8 юаня за вхідні мільйон токенів, 2,7 юаня за вихідні, 0,1 юаня за співпадіння кешу, ціна досягає 1/3 від DeepSeek-V4-Flash.

Це набагато сильніше, ніж розрізання ножицями на Pinduoduo (bushi)

Зображення

Гаразд, гаразд, оскільки ціна вже дійшла до такого рівня, то не будемо вагатися — відразу збільшимо інтенсивність і перевіримо реальну продуктивність Qwen 3.8 Flash у робочих сценаріях за допомогою двох практичних тестів.

Тест 1: Розробка чотирьох текстів для продукту камери, адаптованих під різні платформи

Ми організували «Виклик копірайтингу», у якому Qwen 3.8 Flash мав за 1 юань переписати тисячі слів технічного опису камери у форматі постів для Xiao Hong Shu, Weibo, Douyin та WeChat Moments, щоб побачити, скільки завдань він зможе виконати.

Наступні підказки:

Зображення

Після введення підказки я пішов у кухню компанії налити води, це зайняло менше двох хвилин.

Повернувшися, я побачив, що чотири різних текстів уже повністю написані, і @відмічені правильні бренди, стилі та хештеги (крім того, що я б не писав так довгі пости у朋友圈 — hhh):

Зображення

Зображення

Зображення

Зображення

Менше ніж за дві хвилини написав чотири тексти — швидкість «кіберпрацівника» вважається задовільною.

Але в робочому середовищі справжнім головним білем часто є не написання текстів, а те, хто після зустрічі прибере цей хаос.

Тож ми надали йому другу роботу, щоб перевірити його практичні навички роботи.

Другий тест: перетворити щотижневу зустріч з продуктом у виконуваний план

Ми зберегли оригінальний вигляд десятитисячного тексту засідання — «Вимоги та технічний огляд агента інтелектуальної підтримки V2.0» — з усіма омовами, помилками та побічними розмовами, які зазвичай з’являються після щотижневої зустрічі, і Qwen3.8-Flash за один раз виконав три завдання: виділення зведень, створення таблиць та написання електронного листа з інформацією після зустрічі.

Зображення△ Зображення створено за допомогою ШІ, що “token” почулося як “偷啃” — це справді життєво

Наступні підказки:

Зображення

У режимі за замовчуванням Qwen3.8-Flash успішно виконав усі завдання за менше ніж 4 хвилини, і всі п’ять основних висновків, розподіл завдань у таблиці, формат листа були точними, а отримувачі відповідали змісту зустрічі.

Зображення

Зображення

Зображення

Зображення△ Частина графіків тестових результатів

Навіть без запиту він сам відсортував питання, що залишилися нерозв’язаними на зустрічі, щоб ми могли продовжити обговорення на наступному засіданні, як-от:

Зображення

І на цьому етапі мій ліміт ще не вичерпано!

Ага, це так приємно — відчувати відсутність обмежень.

Зараз Qwen 3.8 Flash вже запущений на платформі «Qianwen Office», а API-інтерфейс також вже доступний — спробуйте!

Зображення

Ще одна річ

Цінова війна між великими китайськими моделями посилюється.

Майже одночасно з відкритим випуском Qwen 3.8 Flash, Zhipu також відкрила першу нативну багатомодальну модель серії GLM-5 — GLM-5.3-Flash, яка раніше стала вірусною в інтернеті під назвою Ox Alpha.

У тестах продуктивність цієї моделі дорівнює Claude Opus 4.8, а ціна зменшена до 1/10 від GLM-5.3.

Зображення

Крім того, GLM-5.3-Flash щедро пропонує двотижневу акцію зі знижкою 50%, що означає, що ціна GLM-5.3-Flash під час акції становить лише 1/20 від ціни GLM-5.3 і 1/40 від ціни Opus4.8.

Зображення

Крім того, Qwen 3.8 Flash і GLM-5.3-Flash мають ще одну спільну рису: обидва вони на цей раз зі значною перевагою в ціні змусили DeepSeek-V4-Flash відступити (DeepSeek відходив, бурчачи собі під ніс):

Зображення△ Графік порівняння цін DeepSeek-V4-Flash, Qwen 3.8 Flash, GLM-5.3-Flash

Нема що казати, надто напружено.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.