Huawei публикует четыре статьи на IJCAI 2026 по эффективности проектирования ИИ

iconMetaEra
Поделиться
AI summary iconСводка
Huawei опубликовала четыре научные статьи по теме ИИ + криптовалюта на IJCAI 2026, сосредоточившись на эффективности проектирования с использованием MetaEra. Исследование охватывает архитектурные инновации, выбор данных, модульную адаптацию и стратегии обучения. Эти методы направлены на снижение вычислительных затрат при сохранении стабильной производительности. Ончейн-новости и достижения в области ИИ продолжают формировать реальные приложения.
Huawei представила четыре статьи на IJCAI 2026, демонстрируя технологический тренд перехода от «плотности масштаба» к «плотности проектирования» в области ИИ.

Автор статьи, источник: LeFeng.com

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Искусственный интеллект движется к реальным сценариям; системная инженерная способность — это и ограничение, и точка прорыва.

IJCAI-ECAI 2026 пройдет с 15 по 21 августа 2026 года в Бремене, Германия. Как всесторонняя ведущая конференция в области ИИ, IJCAI традиционно служит ключевым испытанием передовых исследовательских достижений крупных компаний за прошедший год: кто сделал реальный прогресс в каком направлении и какие технологические подходы формируют консенсус — статьи дают самый прямой ответ.

Во время проведения конференции AI Science Review также проводит систематический анализ статей, принятых на эту крупнейшую конференцию, чтобы выявить технологические тенденции и отраслевые направления.

Ясный тренд: стоимость вычислительных мощностей ИИ остается высокой, а предельная доходность от увеличения масштаба параметров давно не успевает за предельными затратами. Эта экономическая реальность перестраивает логику технологических инноваций — от «можно ли сделать больше» к «можно ли использовать более экономично».

Четыре статьи Huawei, принятые на IJCAI 2026, предоставляют технические ориентиры для этого перехода: использование более изощренных архитектурных решений и стратегий обучения для компенсации дефицита данных и достижения более высокой производительности интеллекта на единицу вычислительной мощности.

Этот сдвиг в сторону технологического подхода также отражает глубокие изменения в реализации ИИ: когда технологии выходят из лабораторий, конкуренция уже не сводится к одиночному прорыву в какой-либо одной способности, а становится системной координацией точности, обобщаемости, данных и вычислительных мощностей — каждый этап может стать узким местом, а также точкой прорыва.

Эти четыре статьи как раз демонстрируют системные инженерные способности и технологический выбор Huawei в этих четырех направлениях.

01 Преодоление масштаба: архитектура + обучение, переписывание пределов возможностей иерархической ViT

В гонке масштабирования визуальных базовых моделей всегда существует скрытый «потолок». Масштабирование обычных ViT шло уверенно вперед, постоянно повышая лимиты — от 6 млрд до 22 млрд. Однако иерархические ViT всё ещё застряли ниже 2 млрд параметров. Это не потому, что не хотят делать их больше — а потому, что невозможно. Иерархические модели требуют гораздо более высоких стандартов к данным и стратегиям обучения, чем обычные ViT; простое применение методов масштабирования обычных ViT не работает. Это порождает структурный конфликт — иерархические ViT по своей природе отлично справляются с многоуровневым представлением и задачами плотной предикции (обнаружение объектов, сегментация, понимание видео), но из-за ограниченного масштаба их потенциал остаётся заблокированным.

Команда Huawei в своей статье «Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters» подняла предел масштаба с 2B до 30B.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Как это было сделано? Ответ заключается в том, что необходимо переработать как архитектуру модели, так и стратегию обучения — оба компонента обязательны.

Основная архитектурная идея — эффективная иерархическая архитектура ViT. Она обеспечивает возможность извлечения мультискейловых признаков при сохранении вычислительной эффективности.

На основе этой архитектуры команда обучила плотные модели с параметрами от 200 млн до 5 млрд и внедрила варианты разреженного смешивания экспертов (SMoE), увеличив общее количество параметров до 30 млрд — это наибольший известный на данный момент масштаб параметров в области иерархических ViT.

На этапе обучения команда разработала двухэтапный процесс:

На первом этапе выполняется самообучение MAE на ImageNet-21K, чтобы модель освоила основные закономерности визуальных представлений;

На втором этапе знания были извлечены из нескольких передовых универсальных базовых моделей на наборе данных из 27 миллионов изображений, что обеспечило скачок в способностях.

Экспериментальные результаты предоставляют наиболее убедительное доказательство. В линейной оценке ImageNet-1K MoE-модель с общим количеством параметров 30 млрд (EHV-5B-MoE), активируя во время вывода только 6,7 млрд параметров, достигла точности 89,0%, превзойдя модели в рамках обычной архитектуры ViT с большим общим количеством параметров, такие как EVA-CLIP-18B. Более того, её улучшенная производительность не ограничивается классификацией изображений — она также демонстрирует отличные результаты в задачах анализа видео и плотной предиктивной обработки. Это свидетельствует о том, что EHV изучила не только признаки классификации, а действительно высококачественные и обобщаемые визуальные представления.

Команда Huawei с помощью этой работы доказала, что иерархическая ViT может не только масштабироваться, но и достигать более высокой точности на стороне вывода с меньшим количеством активационных параметров. Архитектурный дизайн определяет предел возможностей модели, а стратегия обучения — насколько полно этот предел может быть реализован.

02 Ввод предварительной фильтрации: парадигмальное новшество выборщика обучающих кадров

Потолок для базовой модели повышен, но потребление вычислительных ресурсов происходит не только самой моделью — данные, подаваемые в модель, также значительно потребляют вычислительные ресурсы. При обработке видео большими языковыми моделями (Video-LLMs) основные вычислительные затраты приходятся на кодирование кадров. Для контроля затрат существующие модели практически все используют равномерную выборку — равномерное извлечение кадров.

Однако ключевые события в видео никогда не распределены равномерно. Важное действие может длиться всего одну-две секунды и, если оно попадает между двумя точками выборки, оно полностью пропускается. Напротив, длинные статичные кадры кодируются многократно, тратя драгоценные вычислительные ресурсы.

Альтернативный подход — это запрос-ориентированный метод, при котором соответствующие кадры извлекаются на основе конкретного вопроса. Этот метод действительно эффективен в сценариях видео-вопросов-ответов, но подробное описание видео — это задача «без запроса», и здесь этот метод не применим.

Равномерная выборка слишком грубая, а методы, основанные на запросах, неприменимы. Что делать? Команда AI по данным Huawei предложила обучаемый селектор кадров LFS (Learnable Frame Selector), чтобы решить эту проблему.

Адрес статьи: https://arxiv.org/pdf/2601.14594v1

Их основная идея проста: вместо того чтобы выбирать кадры по人工 правилам, пусть модель сама научится «смотреть на то, что важно».

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Это обучающая парадигма «от конца к началу»: LFS больше не учится выбирать, какие кадры имеют более высокий промежуточный балл, а учится выбирать, какие кадры помогут большой модели написать лучшее описание. Как именно это реализуется? Три ключевых дизайна:

Во-первых, обучите сеть оценки, чтобы присвоить каждой рамке рейтинг «важности события».

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Во-вторых, выбор кадров по сегментам, а не глобальная сортировка. При выборе кадров не используйте простой подход «K кадров с наивысшими оценками», а разбейте всё видео на несколько временных интервалов и в каждом из них отберите наиболее важные кадры. Так вы захватите ключевые события и обеспечите равномерное распределение кадров во временной шкале.

Третий, и самый важный шаг — метод обучения. После того как LFS выбирает кадры, они передаются замороженной Video-LLM для генерации описаний. Затем сгенерированные описания сравниваются с эталонными описаниями, аннотированными человеком, вычисляется потеря и выполняется обратное распространение для обновления параметров селектора кадров. В течение всего процесса сама языковая модель остается неизменной, а LFS работает как модуль, подключаемый «plug-and-play».

Кроме того, исследовательская группа обнаружила значительный разрыв между существующими эталонами подробных описаний видео и реальными когнитивными процессами человека. Поэтому они создали новый эталон ICH-CC, в котором все видео взяты из реальных коммерческих сценариев китайского нематериального культурного наследия в области кулинарии (например, кухни ресторанов, обучающие видео по приготовлению пищи), а все описания и вопросы были тщательно написаны вручную, чтобы лучше соответствовать реальным сценариям применения.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Каковы результаты эксперимента?

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

LFS обеспечивает универсальное и стабильное улучшение на различных моделях и различных тестовых наборах. Все улучшенные версии моделей с LFS превосходят базовые модели на всех тестовых наборах, что свидетельствует о том, что LFS не только демонстрирует высокие результаты на отдельных тестах, но и обладает определенной универсальностью.

Это также отвечает основному тезису статьи: вместо того чтобы заставлять модель «грубо вычислять» на равномерно выбранных кадрах, лучше выполнить интеллектуальный отбор на входе — правильно выбранные кадры приводят к улучшению результатов последующих задач.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

03 Задача адаптации: модульное вмешательство вместо тонкой настройки всей модели

Способность крупных языковых моделей к обобщению между задачами всегда была проблемой, «важной на словах, но трудной на практике». Существующие основные решения используют динамическую маршрутизацию по токенам — при обработке каждого токена необходимо выбрать один из нескольких LoRA-адаптеров, определяя путь. Эта система действительно эффективна, но ее стоимость высока: вычислительная нагрузка и потребление видеопамяти остаются на высоком уровне, что делает работу модели медленной и ресурсоемкой.

Альтернативный подход — представление с тонкой настройкой (ReFT) — не изменяет параметры модели, а лишь редактирует представления префиксных и суффиксных токенов для адаптации к однозадачной задаче, что значительно повышает эффективность по сравнению с LoRA. Однако у него есть два недостатка: во-первых, семантика самих токенов неоднозначна, и изменения только на концах недостаточно точны; во-вторых, отсутствует «самонаправляющий» механизм, из-за которого модель не знает, какие слои и какие представления изменять при столкновении с новыми, ранее не встречавшимися задачами.

Команда Huawei Cloud сотрудничает с несколькими университетами и предложила модульную рамку RaMod (Representation-Aware Modularity), успешно расширив подход ReFT на сценарии переноса между задачами.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Основной подход можно разделить на две части:

Первая часть — это двойное модульное представление и тонкая настройка параметров. ReFT может изменять только начало и конец, тогда как RaMod гораздо точнее — он выбирает подмножество скрытых представлений из средних слоев, отфильтрованное по стратегии, чтобы провести модульное вмешательство. Где и как вносить изменения — всё это выбирается целенаправленно и стратегически. Это позволяет более точно направлять модель на решение незнакомых задач.

Вторая часть — асинхронный планировщик. Самая большая проблема обобщения между задачами — нехватка памяти GPU. RaMod разработал систему активного планирования: выделяется память только при необходимости вмешательства, и она активно освобождается после использования. Благодаря этому затраты на хранение сведены к минимуму.

Эффект мгновенный. Эксперименты показали, что RaMod не только лучше обобщает между задачами, но и значительно снижает затраты: по сравнению с исходными LLM, дополнительное время предзаполнения сократилось на 83%, задержка генерации снизилась на 100%, а использование видеопамяти уменьшилось на 79%.

Другими словами, RaMod превратил адаптацию задачи с «изменения модели» в «настройку представлений» — не трогая основную часть модели, а внося точечные правки только в скрытые состояния ключевых слоев. Если этот подход окажется эффективным, экономика развертывания крупных моделей может быть переписана: один базовый модельный каркас с несколькими легковесными модулями вмешательства сможет недорого обслуживать совершенно разные сценарии задач, не требуя отдельного обучения или загрузки полной копии для каждого сценария.

Однако перед «переформулированием» этот метод тонкой настройки представлений все еще требует ответов на ряд ключевых вопросов, например, сохранит ли он точность при значительной экономии вычислительных ресурсов в сложных сценариях, таких как сложные рассуждения.

04 Прорыв данных: языковые эксперты выполняют свои задачи, постепенное обучение шаг за шагом

Три предыдущие статьи решали проблему «как более эффективно использовать модель». Однако у многих задач есть еще более фундаментальная практическая проблема: а что, если данных для обучения недостаточно?

Задача перевода речи с код-свитчингом (Code-Switching, CS) требует перевода аудио, содержащего несколько языков, на целевой язык. Эта задача не только сложна с точки зрения семантического моделирования, но и проблема дефицита данных CS является серьезной.

Ранние исследования в основном полагались на два подхода: либо полагаться на то, что модель сама «поймет» семантические представления, что делает результаты непредсказуемыми; либо тратить огромные средства на ручную аннотацию, что слишком дорого и не масштабируемо.

Команда сервиса перевода Huawei, в сотрудничестве с Сямэньским университетом и Университетом Макао, в этой статье предлагает новый подход: вместо того чтобы позволять модели самостоятельно выявлять семантические представления различных языков, следует активно выровнять их — создать отдельную «команду экспертов» для каждого языка, чтобы каждая команда отвечала за моделирование семантики своего языка, а затем объединить их в единую систему.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Адрес статьи: https://arxiv.org/pdf/2511.10670

Два ключевых дизайна для конкретной реализации:

Первым является MoE (смешанный эксперт) голосовой проектор. Традиционные проекторы относятся ко всем языкам одинаково, и результат естественно не идеален. В версии MoE каждой языковой группе назначается набор специализированных «экспертов», каждый из которых отвечает за моделирование мелких голосовых характеристик только одного языка. Механизм маршрутизации автоматически направляет голосовые характеристики в соответствующую языковую группу экспертов.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Для обеспечения корректности маршрутизации в работе также введены два вспомогательных потерь: языкоспецифический потерь, обеспечивающий, чтобы каждый эксперт действительно обучался выявлять особенности соответствующего языка, и потерь балансировки нагрузки внутри группы, предотвращающий скопление всех токенов у одного эксперта.

Второй — это многоэтапная обучающая парадигма. Если данных недостаточно, компенсируйте это стратегией. Обучение состоит из четырех этапов: сначала используйте данные автоматического распознавания речи (ASR) для предварительного обучения проекторов для каждого языка отдельно, чтобы заложить основу для выравнивания речи и текста; затем объедините проекторы для каждого языка в структуру MoE и совместно оптимизируйте их с использованием языковых потерь и потерь балансировки нагрузки; далее постепенно переходите от данных ASR к данным одноязычного голосового перевода (ST), используя переходные потери для плавного переноса; наконец, адаптируйте модель с данных ST к данным перекрестного языкового голосового перевода.

Изюминка этой постепенной модели заключается в том, что вместо того чтобы сразу бросать модель на дефицитные данные CS, сначала закрепляются базовые навыки с помощью достаточного количества данных ASR и ST, а затем постепенно переходят к целевой задаче.

Обзор статей Huawei на IJCAI 2026: переход от «плотности масштаба» к «плотности проектирования»

Экспериментально сравнивались несколько сильных базовых моделей: Whisper, SeamlessM4T, LLaST. На четырех тестовых наборах Fisher и NTUML2021 данный метод превзошел все остальные модели, включая наилучшую из них — SeamlessM4T, достигнув максимального значения BLEU 39.52 и максимального значения COMET 81.33.

Сигнал, который передает эта работа, ясен: в сценариях с недостатком данных и межъязыковым взаимодействием тонкая архитектурная разработка и постепенные стратегии обучения, возможно, эффективнее, чем простое увеличение объема данных.

Следует отметить, что этот подход является эффективным «ударным решением» в сценариях с ограниченным количеством языков и контролируемым качеством данных, но его масштабируемость для универсальной многоязычной системы, охватывающей десятки языков, требует дальнейшего обоснования.

05 Заключение: за плотность дизайна — стоимость вычислительной мощности

30B иерархическая ViT перестроила архитектуру модели, позволив 6,7 млрд активируемых параметров превзойти на ImageNet соперника с 18 млрд параметров;

LFS выполняет вычитание на входе, блокируя огромные ненужные накладные расходы на кодирование кадров до вычислений;

RaMod сжимает полную дообучку в точечную правку слоя представлений, снизив одновременно потребление памяти и задержку при адаптации между задачами;

Для перевода с кодового переключения речи используется распределение задач MoE и постепенное обучение, что на самых малозаполненных направлениях доказывает одну вещь: мудрость архитектуры иногда может компенсировать нехватку данных.

Четыре статьи, четыре направления — все они указывают на одну и ту же суть: Huawei заменяет «плотность масштаба» на «плотность дизайна». Четыре статьи поступили из базовых исследований, данных ИИ, облачных сервисов и центра переводов, что свидетельствует о том, что приоритет эффективности — это не просто предпочтение отдельной команды, а логика, встроенная в технические решения на всех этапах.

Если сравнить конкуренцию в области ИИ за последние два года с «гонкой за майнингом», то 2026 год демонстрирует переломный момент: эра гонки за «технологиями переработки» уже началась. Разреженная активация, интеллектуальный отбор, модульная адаптация, постепенное обучение — эти подходы не зависят от большего количества чипов и вычислительной мощности, а основаны на более глубоком понимании самой проблемы.

Как крупные компании, так и стартапы уже прошли фазу параметрического вооружения; во второй половине ИИ настоящим решающим фактором является понимание проблем практического внедрения и инженерная способность систематически решать эти проблемы.

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.