Huawei публікує чотири статті IJCAI 2026 щодо ефективності дизайну ШІ

iconMetaEra
Поділитися
AI summary iconКороткий зміст
Huawei опублікувала чотири наукові статті з теми ШІ + криптовалюта на IJCAI 2026, зосереджуючись на ефективності дизайну за допомогою MetaEra. Дослідження охоплює архітектурні інновації, вибір даних, модульну адаптацію та стратегії навчання. Ці методи спрямовані на зменшення обчислювальних витрат при збереженні стабільної продуктивності. Он-чейн новини та досягнення у галузі ШІ продовжують формувати реальні застосування.
Huawei представив чотири статті на IJCAI 2026, що демонструють технічний тренд переходу штучного інтелекту від «щільності масштабу» до «щільності дизайну».

Автор статті, джерело: Leiphone

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

AI переходить до реальних сценаріїв, системна інженерна здатність — це обмеження, а також точка прориву.

IJCAI-ECAI 2026 пройде з 15 по 21 серпня 2026 року в Бремені, Німеччина. Як всебічна провідна конференція в галузі ШІ, IJCAI завжди була ключовим іспитом для перевірки передових досліджень великих компаній за минулий рік: хто зробив реальний прогрес у якому напрямку, які технологічні підходи формують консенсус — статті є найбільш прямою відповіддю.

На тлі проведення конференції AI Science Review також проводить систематичний аналіз статей, прийнятих на цій найвищій конференції, щоб виявити технологічні тенденції та напрямки розвитку галузі.

Чітка тенденція: вартість обчислювальних ресурсів ШІ залишається високою, а гранична вигода від збільшення розміру параметрів давно не встигає за граничними витратами. Цей економічний факт перетворює логіку інновацій — від питання «чи можна зробити більше» до питання «чи можна використовувати ефективніше».

Чотири статті Huawei, прийняті IJCAI 2026, надають технічні шляхи для цього зсуву: за допомогою більш досконалих архітектурних рішень та стратегій навчання для компенсації обмежень, пов’язаних із нестачею даних, і отримання більш високої продуктивності інтелекту на одиницю обчислювальних ресурсів.

Цей технічний зсув також відображає глибокі зміни у впровадженні ШІ: коли технологія виходить за межі лабораторії, конкуренція вже не полягає у точковому прориві в одній здатності, а в системному поєднанні точності, універсальності, даних та обчислювальних потужностей — кожен етап може стати обмеженням, а також точкою прориву.

Наведені чотири статті саме з цих чотирьох напрямків демонструють системну інженерну здатність та вибір технологій Huawei.

01 Подолання масштабу: архітектура + навчання, переписування меж можливостей ієрархічної ViT

У масштабуванні візуальних базових моделей завжди існувала прихована «стеля». Масштабування звичайних ViT рухалося вперед з величезним успіхом, постійно піднімаючи межі від 6B до 22B. Проте ієрархічні ViT завжди залишалися на рівні менше 2B параметрів. Не тому, що не хочуть робити їх більшими — а тому, що їх не можна зробити більшими. Ієрархічні моделі вимагають набагато більше даних і складніших стратегій навчання, ніж звичайні ViT; просте застосування схем масштабування звичайних ViT не працює. Це створює структурний суперечність — ієрархічні ViT природно добре справляються з багатомасштабним представленням та завданнями щільного прогнозування (виявлення об’єктів, сегментація, розуміння відео), але через обмеження масштабу їхні можливості залишаються заблокованими.

Стаття команди Huawei «Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters» підняла межу масштабу з 2B безпосередньо до 30B.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Як це зробити? Відповідь полягає у переробці структури моделі та стратегії навчання — обидва елементи необхідні.

Основним проектним рішенням є архітектура Efficient Hierarchical ViT, яка забезпечує здатність до багатомасштабного витягування ознак, зберігаючи при цьому обчислювальну ефективність.

На основі цієї архітектури команда навчила щільні моделі з параметрами від 200 млн до 5 млрд і ввела різновид розрідженого змішаного експерта (SMoE), щоб збільшити загальну кількість параметрів до 30 млрд — це найбільший відомий розмір параметрів у гієрархічних ViT на даний момент.

У процесі навчання команда розробила двохетапний процес:

На першому етапі виконується самонавчання MAE на ImageNet-21K, щоб модель засвоїла основні закономірності візуальних представлень;

На другому етапі здійснено дистиляцію знань з кількох найсучасніших універсальних базових моделей на наборі даних з 27 мільйонів зображень, що забезпечило стрибок у здатностях.

Результати експериментів надали найбільш переконливих доказів. У лінійній оцінці ImageNet-1K MoE-модель з загальною кількістю параметрів 30 млрд (EHV-5B-MoE), під час висновку активує лише 6,7 млрд параметрів, досягаючи точності 89,0%, що перевершує моделі за архітектурою ViT з більшою загальною кількістю параметрів, такі як EVA-CLIP-18B. Що важливіше, її підвищення продуктивності не обмежується лише класифікацією зображень — вона також відмінно показує себе у завданнях аналізу відео та щільних прогнозувань. Це свідчить про те, що EHV засвоїла не лише класифікаційні ознаки, а справжні високоякісні та узагальнювані візуальні представлення.

Команда Huawei за допомогою цієї роботи довела, що ієрархічні ViT можуть не лише масштабуватися, але й досягати вищої точності з меншою кількістю активованих параметрів під час висновку. Архітектурний дизайн визначає верхню межу можливостей моделі, тоді як стратегія навчання визначає, наскільки повністю ця межа може бути реалізована.

02 Введення попереднього фільтру: парадигмальне інноваційне вибірка навчальних кадрів

Підлогу для базової моделі піднято, але споживання обчислювальних ресурсів відбувається не лише самим моделлю — дані, що подаються моделі, також активно споживають обчислювальні ресурси. При обробці відео великою мовою моделлю (Video-LLMs) основні обчислювальні витрати припадають на кодування кадрів. Щоб контролювати витрати, сучасні моделі майже всі використовують рівномірну вибірку — рівномірне вилучення кадрів.

Однак ключові події у відео ніколи не розподілені рівномірно. Важлива дія може тривати лише одну-дві секунди, і якщо вона випадково потрапляє між двома точками вибірки, її повністю пропускається. Навпаки, довгі статичні кадри кодуються знову і знову, витрачаючи цінні обчислювальні ресурси.

Інший підхід — це метод, заснований на запитах — пошук відповідних кадрів на основі конкретного запиту. Це дійсно працює в сценаріях відео-відповідей, але детальний опис відео — це завдання «без запиту», і цей метод тут не підходить.

Рівномірна вибірка надто груба, а методи, засновані на запитах, непридатні. Як вирішити цю проблему? Команда з AI-даних Huawei запропонувала навчальний вибірник кадрів LFS (Learnable Frame Selector), щоб вирішити цю проблему.

Адреса статті: https://arxiv.org/pdf/2601.14594v1

Їхня основна ідея дуже проста: замість того, щоб вибирати кадри за допомогою人工 правил, краще дати моделі самій навчитися «що дивитися».

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Це парадигма навчання «від кінця до початку»: LFS більше не вчиться вибирати, які кадри мають вищий бал на проміжному етапі, а вчиться вибирати ті кадри, які дозволяють великій моделі створювати кращі описи. Як саме це реалізується? Три ключові дизайнерських рішення:

По-перше, навчіть мережу оцінки, щоб присвоїти кожному кадру оцінку «важливості події».

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Друге, вибір кадрів по сегментах, а не глобальна сортування. Під час вибору кадрів не використовуйте просте правило «перші K кадрів з найвищим рейтингом», а розбийте відео на кілька часових інтервалів і в кожному інтервалі окремо вибирайте найважливіші кадри. Це дозволяє захопити ключові події та забезпечити рівномірний розподіл кадрів у часовій осі.

Третій, і найважливіший крок — спосіб навчання. Після того як LFS вибирає кадри, вони подаються на заморожену Video-LLM для генерації описів. Отримані описи порівнюються зі стандартними описами, створеними людиною, обчислюється втрата, а потім здійснюється зворотне поширення для оновлення параметрів вибірника кадрів. Протягом усього процесу велика мовна модель залишається незмінною, а LFS працює як модуль, який можна підключити та використовувати «на ходу».

Крім того, дослідницька команда виявила проблему: існуючі бази даних детальних описів відео істотно відрізняються від реального людського сприйняття. Тому вони створили нову базу даних ICH-CC, відео якої взяті з реальних комерційних сценаріїв китайської нематеріальної культурної спадщини у галузі кулінарії (наприклад, кухні ресторанів, навчання кулінарії тощо), а всі описи та питання з відповідями були уважно написані людьми, щоб краще відповідати реальним сценаріям використання.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Які результати експерименту?

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

LFS забезпечує загальний і стабільний прогрес на різних моделях і різних тестах. Усі моделі з LFS-підсиленням показали кращі результати на всіх тестових базах порівняно з базовими моделями, що свідчить про те, що LFS не лише добре працює на окремих тестах, але й має певну універсальність.

Це також відповідає основній тезі статті: замість того щоб змусити модель «намагатися» на рівномірно вибраних кадрах, краще зробити розумний відбір на вході — вибравши правильні кадри, ви покращите результати наступних завдань.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

03 Завдання на адаптацію: модульна інтервенція замість тонкої настройки повної моделі

Здатність великих мовних моделей до узагальнення між завданнями завжди була проблемою, яка «на словах важлива, а на практиці складна». Сучасні основні рішення — це динамічна маршрутизація на основі токенів — під час обробки кожного токена потрібно вибирати між кількома LoRA-адаптерами, визначаючи, яким шляхом йти. Цей механізм дійсно ефективний, але його вартість велика: обчислювальна потужність та використання пам’яті залишаються високими, і модель працює повільно та інтенсивно використовує видеопам’ять.

Інший підхід — представлення тонкої настройки (ReFT), який не змінює параметри моделі, а лише редагує представлення префіксних і суфіксних токенів для адаптації до однієї задачі, що значно ефективніше, ніж LoRA. Але він має дві слабкі сторони: по-перше, семантика самих токенів є неоднозначною, і зміна лише перших і останніх недостатньо точна; по-друге, він не має механізму «самонаведення», тому модель не знає, який шар чи яке представлення змінювати, коли зустрічає нову задачу, яку не бачила раніше.

Команда Huawei Cloud співпрацює з кількома університетами та запропонувала модульну рамку RaMod (Representation-Aware Modularity), що успішно розширила підхід ReFT на сценарії узагальнення між завданнями.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Основний підхід можна розбити на дві частини:

Перша частина — це двомодульне представлення та тонка настройка параметрів. ReFT може змінювати лише початок і кінець, тоді як RaMod набагато точніший — він вибирає підмножину прихованих представлень із середніх шарів, відфільтровану за стратегією, щоб здійснити модульне втручання. Те, де саме змінювати та як саме змінювати, визначається обраною стратегією. Це дозволяє більш точно керувати моделлю для вирішення незнайомих завдань.

Друга частина — асинхронний планувальник. Найбільший страх узагальнення між завданнями — це нестача пам’яті GPU. RaMod розробив систему активного планування: виділяє пам’ять лише тоді, коли потрібні втручання, і активно звільняє її після використання. Таким чином, витрати на зберігання зведені до мінімуму.

Ефект відразу помітний. Експерименти показали, що RaMod не лише краще узагальнюється між завданнями, але й значно знижує витрати: порівняно з оригінальними LLM, цей метод зменшив час додаткового попереднього заповнення на 83%, знизив затримку генерації на 100% і зменшив використання відеопам’яті на 79%.

Іншими словами, RaMod змінив адаптацію завдань з «зміни моделі» на «налаштування представлення» — не змінюючи основну частину моделі, а вносячи точкові редагування лише в приховані стани ключових шарів. Якщо цей підхід виявиться ефективним, економіка розгортання великих моделей може бути переписана: один базовий модуль разом із кількома легкими інтервенційними модулями зможе недорого обслуговувати абсолютно різні сценарії завдань, не вимагаючи окремого навчання або завантаження повних копій для кожного сценарію.

Проте перед «переформулюванням» цей метод тонкої настройки представлення все ще потребує відповідей на кілька ключових питань, наприклад, чи зможе він зберегти точність, водночас значно знизивши витрати на обчислювальні ресурси, у складних сценаріях, таких як складні міркування.

04 Дані зламали бар’єр: мовні експерти виконують свої обов’язки, поступове навчання — крок за кроком

Три попередні статті вирішували питання «як ефективніше використовувати моделі». Але багато завдань стикаються з ще більш фундаментальною практичною проблемою: а що, як даних для навчання взагалі недостатньо?

Завдання перекладу мовлення з код-світчингом (Code-Switching, CS) вимагає перекладу мовлення, що містить кілька мов, до цільової мови. Це завдання не лише складне з точки зору семантичного моделювання, але й проблемою є дефіцит даних CS.

Попередні дослідження здебільшого базувалися на двох підходах: або надавали моделі самостійно «зрозуміти» семантичні представлення, що робило результати непередбачуваними, або витрачали величезні кошти на ручну анотацію, що призводило до надто високих витрат і обмежувало масштаб.

Команда Сервісу перекладу Huawei, у співпраці з Університетом Сяммэнь та Університетом Макао, у цій статті запропонувала новий підхід: замість того, щоб дозволити моделі самостійно виявляти семантичні представлення різних мов, краще активно вирівняти їх — створити окрему «команду експертів» для кожної мови, щоб кожна команда відповідала за моделювання семантики власної мови, а потім здійснити єдине вирівнювання.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Адреса статті: https://arxiv.org/pdf/2511.10670

Два ключові дизайни реалізації:

Першим є MoE (мішаний експерт) голосовий проектор. Традиційні проектори ставляться однаково до всіх мов, тому їх ефективність не є ідеальною. У версії MoE для кожної мови виділяється окрема група спеціалістів, кожна з яких відповідає лише за моделювання дрібних голосових характеристик однієї мови. Механізм маршрутизації автоматично направляє голосові характеристики до відповідної групи спеціалістів для цієї мови.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Щоб забезпечити правильну маршрутизацію, у роботі також введено два допоміжних втрати: мовно-специфічна втрата забезпечує, щоб кожен експерт справді вивчив ознаки відповідної мови, а втрата балансування навантаження всередині групи запобігає тому, щоб усі токени збиралися на одному експерті.

Другим є багатоетапна навчальна парадигма. Якщо даних недостатньо, компенсуйте це стратегією. Весь процес навчання складається з чотирьох етапів: спочатку використовуйте дані автоматичного розпізнавання мови (ASR) для попереднього навчання проекторів для кожної мови окремо, щоб закласти основу для вирівнювання мови та тексту; потім об’єднайте проектори різних мов у структуру MoE і спільно оптимізуйте їх за допомогою мовно-специфічних втрат і втрат балансування навантаження; далі поступово переходьте від даних ASR до даних одномовного голосового перекладу (ST), використовуючи перехідні втрати для плавного перенесення; на останньому етапі адаптуйтеся від даних ST до даних змішаного голосового перекладу.

Видатна риса цієї поступової дизайну полягає в тому, що замість того, щоб безпосередньо зосереджувати модель на обмежених даних CS, спочатку використовуються достатні обсяги даних ASR і ST для закріплення базових навичок, а потім поступово переходить до цільової задачі.

Огляд статей Huawei на IJCAI 2026: від «щільності масштабу» до «щільності дизайну»

Експериментально порівняно кілька сильних базових моделей: Whisper, SeamlessM4T, LLaST. На чотирьох тестових наборах Fisher і NTUML2021 цей метод перевершив найкращу з інших моделей — SeamlessM4T, досягнувши максимального значення BLEU 39.52 і максимального значення COMET 81.33.

Цей підхід чітко передає сигнал: у сценаріях з обмеженими даними між мовами досконалий архітектурний дизайн та поступова стратегія навчання, можливо, ефективніші, ніж просте збільшення обсягу даних.

Варто зауважити, що цей підхід є ефективним «ланцюгом» у сценаріях з обмеженою кількістю мов та контролюваною якістю даних, але його масштабованість у загальній багатомовній системі перекладу, що охоплює десятки мов, потребує додаткового обґрунтування.

05 Заключення: обмінюйте щільність дизайну на вартість обчислювальної потужності

30B ієрархічна ViT перебудувала архітектуру моделі, що дозволило 6,7 мільярда активованих параметрів перевершити суперника з 18 мільярдами на ImageNet;

LFS виконує віднімання на вході, відсікаючи велику кількість незначних накладних витрат на кодування кадрів до обчислення;

RaMod стискає повне доналаштування до точкового редагування шару представлення, зменшуючи використання пам’яті та затримку при адаптації між завданнями;

Для перекладу мовних кодів використовується розподіл обов’язків MoE та поступове навчання, що на найменш забезпечених даними напрямках доводить одну істину: мудрість архітектури іноді може компенсувати брак даних.

Чотири статті, чотири напрямки — усі вони вказують на одну й ту саму суть: Huawei замінює «щільність масштабу» на «щільність дизайну». Чотири статті походять з фундаментальних досліджень, даних штучного інтелекту, хмарних сервісів та центру перекладу, що свідчить про те, що пріоритет ефективності — це не просто уподобання окремої команди, а логіка, закладена в кожному технічному рішенні.

Якщо змагання в галузі ШІ за останні два роки можна було порівняти з «гонкою майнерів», то 2026 рік демонструє переломний момент: ера гонки за «технологіями переробки» вже розпочалася. Розріджена активація, інтелектуальний відбір, модульна адаптація, поступове навчання — ці напрямки не залежать від більшої кількості чіпів і обчислювальних потужностей, а ґрунтуються на глибшому розумінні самої проблеми.

Незалежно від великих компаній чи стартапів, гонка параметрів вже минула; на другій половині шляху штучного інтелекту справжнім ключем до перемоги є розуміння проблем реального застосування та інженерна здатність систематично вирішувати ці проблеми.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.