Заголовок: Alibaba намікає на Qwen 3.8-Flash-Next — попередній варіант з 125 мільярдами параметрів, який активує лише 6 мільярдів на токен, що вказує на Qwen 4 Alibaba представить Qwen 3.8-Flash-Next в середу — компанія описує його як ранній попередній варіант архітектури наступного покоління Qwen 4, а не як завершений флагманський модуль. За інформацією команди Alibaba та поширеного твіту, модель містить 125 мільярдів параметрів, але, як повідомляється, активує лише близько 6 мільярдів параметрів на токен (у твіті також згадувався компонент «+51B N-gram»). Ці цифри та реальна продуктивність моделі залишаються неверифікованими; Alibaba та Hugging Face описують цей реліз як попередній огляд архітектури і не опублікували порівняльні бенчмарки. Чому ці цифри важливі: - Параметри — це «регулятори», якими модель вчиться та адаптується. Більше параметрів зазвичай означає більшу здатність, але й вищі обчислювальні витрати. - Суть у архітектурі mixture-of-experts (MoE): замість запуску всього великого мережевого блоку на кожному вхідному даному, модель перенаправляє кожен запит до невеликої підмножини спеціалізованих «експертних» підмоделей. Це дозволяє моделі з 125 мільярдами параметрів працювати з обчислювальними витратами, подібними до набагато меншої моделі, активуючи лише тих експертів, що стосуються кожного токена. Коротко: майже фронтовий потенціал при цінах на звичайний обчислювальний ресурс — якщо заявлене поведінка MoE підтвердиться. Що каже Alibaba і що залишається невизначеним: - Alibaba позиціонує Qwen 3.8-Flash-Next як мультимодальну модель, побудовану на майбутній архітектурі Qwen 4, щоб розробники могли підготуватися до повного сімейства. - Hugging Face, де очікується з’явлення ваг, також називає його попереднім оглядом архітектури Qwen 4. - Ще не опубліковано незалежних бенчмарків чи прямих порівнянь з лінійкою Qwen 3 чи західними конкурентами, тому продуктивність та компроміси між ресурсами залишаються спекулятивними. Контекст: Китайський рух у напрямку відкритих ваг Китайська спільнота з відкритими вагами дуже активна. Недавні анонси анонімних та інституційних моделей (загадкова модель Ox Alpha, яка перевершила Fable від Anthropic у деяких тестах кодування, а також відкриті ваги від Alibaba, DeepSeek та Moonshot) роблять потужні моделі завантажуваними, налаштовуваними та запусканими локально. Відкриті ваги зменшують залежність від закритих API, знижують витрати на хостинг і дозволяють розробникам уникати надсилання конфіденційних даних до сторонніх сервісів — важливий фактор як для загального штучного інтелекту, так і для криптовалютних проектів. Чому криптовалютна аудиторія має це враховувати: - Інструменти на ланцюгу та боти: дешевші, локально запускаємі великі моделі можуть забезпечити розумнішими агентами на ланцюгу, інструментами аудиту, стратегіями торгівлі та MEV без постійних комiсiй за API. - Конфіденційність та керування: самостийне розгортання моделей зменшує ризик витоку даних щодо приватних ключів, графів транзакцій чи пропретарних торговых сигналiв. - Децентралiзована AI-инфраструктура: вiдкритi ваги можуть прискорити розробку децентралiзованих шарiв інференсу та оракулiв з мiнiмальним довiр’ям, уникнувши залежностi вiд одного постачальника. - Зауваження: поки не з’являться бенчмарки та реальнi цифри витрат, передчасно припускати, що модель забезпечує фронтову якiсть за низьку цiну. Практичний висновок: Qwen 3.8-Flash-Next позицiонується як попереднiй огляд фiлософiї дизайну Qwen 4 — з обiцянкою ефективностi mixture-of-experts та мультимодальних можливостей. Цей релiз значущий, бо якщо заявлене буде пiдтверджено, то вiдкритi ваги моделi з 125 мiльярдами параметрiв у архiтектурi MoE, що активує лише ~6 мiльярдiв на токен, можуть демократизувати потужний штучний інтелект для розробникiв та криптовалютних проектiв. Але нам знадобляться верифiкованi бенчмарки та практичнi тести, щоб пiдтвердити гучнi заявлення. Слiдкуйте за офiцiйним релiзом, вагами на Hugging Face та незалежними оцiнками.
Alibaba анонсує Qwen 3.8-Flash-Next з 125 млрд параметрів та 6 млрд параметрів на токен за допомогою MoE
ChainGPTПоділитися
Alibaba оголосила про запуск токену для Qwen 3.8-Flash-Next, який має бути випущений в цю середу. Модель має 125 мільярдів параметрів, але використовує MoE для активації 6 мільярдів на токен. Hugging Face та Alibaba називають це попереднім оглядом Qwen 4. Поки що немає бенчмарків. Дизайн з відкритими вагами може підтримувати нові лісти токенів та он-чейн інструменти. Продуктивність та ефективність витрат ще не підтверджені.
Джерело:Показати оригінал
Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації.
Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.