Huawei Menerbitkan Empat Kertas IJCAI 2026 Mengenai Kecekapan Reka Bentuk AI

iconMetaEra
Kongsi
AI summary iconRingkasan
Huawei menerbitkan empat kertas kerja berkaitan AI + kripto di IJCAI 2026, dengan fokus pada kecekapan reka bentuk menggunakan MetaEra. Penyelidikan ini merangkumi inovasi arsitektur, pemilihan data, penyesuaian modular, dan strategi latihan. Kaedah-kaedah ini bertujuan untuk mengurangkan kos pengiraan sambil mengekalkan prestasi yang stabil. Berita di atas rantai dan kemajuan AI terus membentuk aplikasi dunia nyata.
Huawei telah menerima empat kertas kerja di IJCAI 2026, menunjukkan trend teknikal AI yang berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk".

Penulis artikel, sumber: Leifengwang

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

AI menuju skenario nyata, kemampuan kejuruteraan sistemik, adalah halangan dan juga terobosan.

IJCAI-ECAI 2026 akan diadakan di Bremen, Jerman, dari 15 hingga 21 Ogos 2026. Sebagai pertemuan utama komprehensif dalam bidang AI, IJCAI selalu menjadi ujian penting untuk menguji pencapaian terkini dari pelbagai syarikat dalam setahun terakhir: siapa yang membuat kemajuan sebenar dalam arah tertentu, dan teknologi mana yang sedang membentuk konsensus — makalah adalah jawapan paling langsung.

Pada masa persidangan berlangsung, AI Technology Review juga sedang memindai sistemik makalah-makalah yang diterima dalam persidangan puncak ini untuk mengesan trend teknologi dan arah industri.

Satu tren yang jelas: kos kekuatan komputasi AI tetap tinggi, manfaat marjinal daripada peningkatan skala parameter sudah lama tidak mampu mengejar kos marjinal. Realiti ekonomi ini sedang membentuk semula logik inovasi teknologi — beralih dari “bolehkah ia dibuat lebih besar” kepada “bolehkah ia digunakan dengan lebih cekap”.

Empat kertas kerja Huawei yang diterima oleh IJCAI 2026 memberikan rujukan jalan teknikal untuk peralihan ini: menggunakan reka bentuk arsitektur dan strategi latihan yang lebih cekap untuk mengimbangi kekurangan data, serta mendapatkan output kecerdasan yang lebih tinggi per unit pengiraan.

Perubahan berorientasi teknologi ini juga mencerminkan perubahan mendalam dalam pelaksanaan AI: apabila teknologi keluar dari makmal, persaingan bukan lagi tentang keberhasilan titik tunggal dalam satu kemampuan, tetapi tentang pengurusan sistem antara ketepatan, generalisasi, data, dan kekuatan pengiraan—setiap peringkat boleh menjadi bottleneck, dan juga boleh menjadi titik terobosan.

Empat kertas kerja berikut ini, masing-masing dari empat arah ini, menunjukkan kemampuan kejuruteraan sistemik dan pilihan teknologi Huawei.

01 Breaking the Scale Barrier: Architecture + Training, Redefining the Capability Limits of Hierarchical ViT

Dalam perlumbaan memperbesar model visual dasar, selalu wujud satu "atap tersirat". Pembesaran ViT biasa berjalan lancar, memecahkan had atas dari 6B hingga 22B. Namun, ViT berhierarki sentiasa terperangkap di bawah 2B parameter. Bukan kerana tidak mahu membesarkan, tetapi tidak boleh dibesarkan. Model berhierarki memerlukan data dan strategi latihan yang jauh lebih tinggi berbanding ViT biasa; aplikasi mudah strategi pembesaran ViT biasa tidak berkesan. Ini mencipta kontradiksi struktural—ViT berhierarki secara semula jadi unggul dalam perwakilan pelbagai skala dan tugas ramalan padat (pengesanan objek, pemisahan, pemahaman video), tetapi kerana tidak dapat diperbesarkan, had keupayaannya terkunci.

Pasangan pasukan Huawei, "Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters", telah mendorong had skala dari 2B langsung ke 30B.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Bagaimana ia dilakukan? Jawapannya ialah dengan mendesain semula struktur model dan strategi latihan, keduanya sangat penting.

Reka bentuk inti struktur ialah arsitektur Efficient Hierarchical ViT. Ia menjamin kemampuan pengekstrakan ciri berskala pelbagai sambil mempertimbangkan kecekapan pengiraan.

Berdasarkan arsitektur ini, pasukan melatih model padat dengan parameter dari 200M hingga 5B, serta memperkenalkan varian Sparse Mixture of Experts (SMoE) untuk mendorong jumlah parameter keseluruhan hingga 30B—ukuran parameter terbesar yang telah dipublikasikan dalam bidang ViT berhierarki hingga kini.

Dalam latihan, pasukan mereka satu proses dua peringkat:

Pada peringkat pertama, lakukan latihan pra-pengawasan MAE di ImageNet-21K untuk membolehkan model mempelajari hukum asas perwakilan visual;

Pada peringkat kedua, pengetahuan didistilasi daripada beberapa model asas umum terkini terbaik pada set data 27 juta imej untuk mencapai lompatan kemampuan.

Keputusan eksperimen memberikan bukti paling kuat. Dalam penilaian linear ImageNet-1K, model MoE dengan jumlah parameter keseluruhan 30B (EHV-5B-MoE) hanya mengaktifkan 6.7 bilion parameter semasa inferensi, tetapi mencapai ketepatan 89.0%, melebihi model dengan jumlah parameter lebih besar di bawah pendekatan ViT biasa, iaitu EVA-CLIP-18B. Lebih penting lagi, peningkatan prestasinya tidak terhadap pada pengelasan gambar—ia juga menunjukkan prestasi cemerlang dalam analisis video dan tugas ramalan padat. Ini menunjukkan bahawa EHV mempelajari bukan sahaja ciri pengelasan, tetapi juga perwakilan visual berkualiti tinggi dan boleh digeneralisasi.

Pasukan Huawei menggunakan karya ini untuk membuktikan bahawa ViT berhierarki tidak hanya boleh diperbesar, tetapi juga pada sisi inferens, ia mampu mencapai ketepatan yang lebih tinggi dengan parameter aktivasi yang lebih sedikit. Reka bentuk arkaitekture menentukan had kemampuan model, manakala strategi latihan menentukan sejauh mana had ini boleh dilepaskan.

02 Masukkan penapis awal: Paradigma inovatif pemilih kerangka pembelajaran

Tingkap dasar model telah dinaikkan, tetapi penggunaan kuasa pengiraan tidak hanya berlaku pada model itu sendiri, data yang diberikan kepada model juga secara besar-besaran menghabiskan sumber pengiraan. Semasa memproses video, model bahasa besar video (Video-LLMs) menghabiskan kos pengiraan terutamanya pada pengkodan bingkai. Untuk mengawal kos, model semasa hampir semua menggunakan pengambilan sampel seragam—pengambilan bingkai pada selang masa yang sama.

Namun, peristiwa penting dalam video tidak pernah tersebar secara seragam. Satu tindakan penting mungkin hanya berlangsung satu atau dua saat, dan jika ia jatuh tepat di antara dua titik sampel, ia akan benar-benar terlepas. Sebaliknya, gambar statis yang panjang justru dienkod berulang-ulang, membuang sumber daya pengiraan yang berharga.

Pendekatan alternatif ialah kaedah berdasarkan carian—mengambil kerangka yang berkaitan berdasarkan soalan tertentu. Kaedah ini memang berkesan dalam skenario soal-jawab video, tetapi penerangan video terperinci adalah tugas “tanpa carian”, dan kaedah ini tidak berguna di sini.

Pengambilan sampel seragam terlalu kasar, sementara kaedah berdasarkan pertanyaan tidak boleh digunakan. Apa yang perlu dilakukan? Tim data AI Huawei mengusulkan pemilih bingkai yang boleh dipelajari, LFS (Learnable Frame Selector), untuk mencuba menyelesaikan masalah ini.

Alamat kertas: https://arxiv.org/pdf/2601.14594v1

Gagasan utama mereka sangat terus terang: alih-alih bergantung pada peraturan manual untuk memilih bingkai, biarkan model belajar sendiri “apa yang perlu dilihat”.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Ini adalah paradigma latihan "bermula dengan akhir", di mana LFS tidak lagi belajar "memilih frame mana yang mendapat skor lebih tinggi pada tahap sederhana", tetapi belajar "memilih frame mana yang membolehkan model besar menulis huraian yang lebih baik". Bagaimana ia dilakukan secara spesifik? Tiga reka bentuk utama:

Pertama, latih rangkaian penilaian untuk memberi skor "kepentingan peristiwa" pada setiap bingkai.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Kedua, pilih kerangka secara berperingkat bukan pengurutan keseluruhan. Semasa memilih kerangka, jangan gunakan “K kerangka tertinggi skor” yang mudah, tetapi bahagikan keseluruhan video kepada beberapa tempoh masa, dan pilih kerangka paling penting secara berasingan dalam setiap tempoh masa. Ini menangkap peristiwa penting sambil memastikan kerangka tersebar secara seragam pada paksi masa.

Ketiga, langkah paling penting — cara latihan. Selepas LFS memilih bingkai, ia memberikan bingkai-bingkai tersebut kepada Video-LLM yang dibekukan untuk menghasilkan perihalan, kemudian membandingkan perihalan yang dihasilkan dengan perihalan piawai yang ditandai secara manual, mengira kerugian, dan kemudian melakukan penyebaran balik untuk mengemas kini parameter pemilih bingkai. Dalam keseluruhan proses ini, model bahasa besar itu sendiri tidak berubah sama sekali, dan LFS berfungsi seperti modul tambahan yang boleh dicabut dan dipasang.

Selain itu, pasukan penyelidik juga menemui satu masalah: terdapat jurang yang besar antara piawaian deskripsi video terperinci yang sedia ada dengan kognisi sebenar manusia. Oleh itu, mereka membina piawaian baharu sendiri, ICH-CC, di mana semua video berasal dari skenario perniagaan sebenar masakan warisan budaya tak benda China (seperti dapur restoran, pengajaran memasak, dll.), dan semua deskripsi serta soal jawab ditulis secara teliti oleh manusia, lebih dekat dengan aplikasi sebenar.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Bagaimana keputusan ujian?

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

LFS membawa peningkatan yang umum dan stabil pada pelbagai model dan pelbagai piawai. Semua versi yang diperkuat LFS bagi model-model tersebut melebihi model asas pada semua piawai ujian, menunjukkan bahawa LFS tidak hanya berprestasi baik pada satu piawai tunggal, tetapi juga mempunyai keupayaan generik.

Ini juga menjawab proposisi utama kertas tersebut: alih-alih memaksa model menghitung pada kerangka yang diambil secara seragam, lebih baik melakukan penyaringan pintar di input—memilih kerangka yang tepat, dan kinerja tugas turunan akan meningkat pula.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

03 Tugas penyesuaian: Modul representasi menggantikan fine-tuning model penuh

Kemampuan generalisasi lintas tugas model bahasa besar selalu menjadi masalah yang “kelihatan penting dalam ucapan, tetapi sukar dilaksanakan”. Pendekatan utama semasa ini ialah penjajaran dinamik per-token—setiap token semasa pemprosesan perlu membuat pilihan antara beberapa penyesuai LoRA untuk menentukan jalan yang akan diambil. Mekanisme ini memang berkesan, tetapi harganya juga tinggi: penggunaan komputasi dan ingatan GPU tetap tinggi, menjadikan model berjalan perlahan dan memakan banyak ingatan GPU.

Pendekatan alternatif—ReFT (Representation Fine-Tuning)—tidak mengubah parameter model, tetapi hanya mengedit representasi token awal dan akhir untuk mencapai penyesuaian tugas tunggal, dengan kecekapan yang jauh lebih tinggi berbanding LoRA. Namun, ia mempunyai dua kelemahan: pertama, makna token itu sendiri bersifat ambigu, dan hanya mengubah awal dan akhir tidak cukup tepat; kedua, ia kekurangan mekanisme “panduan diri”, jadi apabila model menghadapi tugas baru yang tidak pernah dilihat sebelumnya, ia tidak tahu harus mengubah lapisan mana atau representasi mana.

Pasukan Huawei Cloud bekerjasama dengan pelbagai universiti, mengusulkan kerangka RaMod (Representation-Aware Modularity) yang sedar representasi, berjaya mengembangkan idea ReFT ke dalam skenario generalisasi lintas tugas.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Pendekatan utama boleh dibahagikan kepada dua bahagian:

Bahagian pertama ialah representasi dwi-modul dan penyesuaian parameter. ReFT hanya boleh mengubah awal dan akhir, manakala RaMod jauh lebih halus—ia memilih subset yang telah disaring oleh strategi daripada representasi tersembunyi lapisan tengah, untuk melakukan intervensi modular. Di mana dan bagaimana mengubahnya adalah pilihan yang dipilih dan strategik. Ini membolehkan model dipandu dengan lebih tepat untuk menyelesaikan tugas yang tidak pernah dilihat sebelumnya.

Bahagian kedua ialah penjadual asinkron. Yang paling ditakuti dalam generalisasi antaratugasan ialah kekurangan memori VRAM; RaMod merekabentuk mekanisme penjadualan aktif: hanya alokasikan memori VRAM apabila diperlukan, dan lepaskan secara aktif apabila habis digunakan. Dengan cara ini, beban penyimpanan dipadatkan kepada minimum.

Kesan serta-merta. Eksperimen menunjukkan bahawa RaMod tidak hanya memberikan penggeneralisasian antara tugas yang lebih baik, tetapi juga mengurangkan kos secara besar-besaran: berbanding LLM asal, masa pra-isian tambahan berkurang sebanyak 83%, latensi penghasilan menurun 100%, dan penggunaan memori GPU berkurang 79%.

Dengan kata lain, RaMod mengubah penyesuaian tugas dari “mengubah model” menjadi “menyesuaikan representasi”—tidak menyentuh inti model, hanya melakukan suntingan tepat pada keadaan tersembunyi di lapisan kunci. Jika pendekatan ini berjaya, ekonomi pelaksanaan model besar mungkin akan ditulis semula: satu model dasar yang dipasangkan dengan beberapa modul intervensi ringan boleh melayani pelbagai skenario tugas yang berbeza dengan kos rendah, tanpa perlu melatih atau memuatkan salinan penuh secara berasingan untuk setiap skenario.

Namun, sebelum "penulisan semula", kaedah penyesuaian representasi ini masih memerlukan jawapan terhadap beberapa isu utama, seperti sama ada kejituan masih boleh dikekalkan sambil menjimatkan kos pengiraan secara besar-besaran dalam skenario sukar seperti penarikan kesimpulan yang kompleks.

04 Data Breakthrough: Language Experts Each Fulfill Their Roles, Progressive Training Proceeds Step by Step

Tiga kertas kerja pertama semuanya menyelesaikan "bagaimana menggunakan model dengan lebih cekap". Tetapi banyak tugas masih menghadapi cabaran realiti yang lebih asas: bagaimana jika data latihan tidak mencukupi?

Tugasan terjemahan suara code-switching (CS) memerlukan terjemahan suara yang mengandungi pelbagai bahasa ke dalam bahasa sasaran. Tugasan ini tidak hanya kompleks dari segi pemodelan makna, tetapi juga kekurangan data CS merupakan masalah besar.

Kajian sebelum ini terutamanya bergantung kepada dua pendekatan: sama ada membiarkan model itu sendiri “menghayati” perwakilan makna, yang kesannya tidak boleh dikawal; atau menghabiskan banyak wang untuk penandaan manual, yang kosnya terlalu tinggi dan sukar untuk diskalakan.

Timm Huawei Translation Service, bekerjasama dengan Universiti Xiamen dan Universiti Macau, dalam kertas kerja ini mengusulkan satu pendekatan baharu: alih-alih membiarkan model menggali sendiri representasi makna dalam pelbagai bahasa, lebih baik secara aktif menyelaraskannya—membina satu “pasukan pakar” tersendiri untuk setiap bahasa, di mana setiap pasukan bertanggungjawab atas pemodelan makna bahasa masing-masing, sebelum diselaraskan secara seragam.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Alamat kertas: https://arxiv.org/pdf/2511.10670

Dua reka bentuk utama dalam pelaksanaan spesifik:

Yang pertama ialah pemproyeksi suara MoE (Mixture of Experts). Pemproyeksi tradisional memperlakukan semua bahasa secara sama, maka kesannya tidak begitu baik. Versi MoE mengalokasikan satu set “pakar” khusus untuk setiap bahasa, di mana setiap kumpulan pakar hanya bertanggungjawab atas pemodelan ciri suara halus untuk satu bahasa sahaja. Mekanisme penghalaan akan secara automatik menghantar ciri suara kepada kumpulan pakar yang sesuai dengan bahasa tersebut.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Untuk memastikan penghalaan tidak menyimpang, kertas ini juga memperkenalkan dua fungsi kerugian tambahan: kerugian khusus bahasa memastikan setiap pakar benar-benar mempelajari ciri-ciri bahasa yang berkaitan, dan kerugian keseimbangan beban dalam kumpulan mencegah semua token berkumpul pada satu pakar sahaja.

Yang kedua ialah paradigma latihan berperingkat. Jika data tidak mencukupi, gunakan strategi untuk mengisi kekurangan. Keseluruhan proses latihan dibahagikan kepada empat langkah: pertama, gunakan data pengenalan suara automatik (ASR) untuk melatih pendahuluan setiap projektor bahasa secara berasingan, membina asas penyesuaian suara-teks; kemudian, gabungkan projektor bahasa-bahasa tersebut menjadi struktur MoE, dan mengoptimumkan secara bersama-sama menggunakan kerugian khusus bahasa dan kerugian keseimbangan beban; seterusnya, berpindah secara beransur-ansur dari data ASR ke data terjemahan suara monolingual (ST), menggunakan kerugian peralihan untuk memastikan peralihan yang lancar; akhirnya, sesuaikan dari data ST ke data terjemahan suara campuran (CS).

Kelebihan reka bentuk progresif ini ialah—bukan membiarkan model secara langsung menghadapi data CS yang jarang, tetapi terlebih dahulu memperkuat kemampuan asas dengan data ASR dan ST yang mencukupi, sebelum secara berperingkat beralih kepada tugas sasaran.

Penghimpunan kertas kerja Huawei IJCAI 2026: Berpindah dari "kepadatan skala" kepada "kepadatan reka bentuk"

Eksperimen membandingkan beberapa model asas kuat seperti Whisper, SeamlessM4T, dan LLaST. Pada empat set ujian Fisher dan NTUML2021, kaedah ini melebihi SeamlessM4T, yang merupakan model terbaik di antara yang lain, dengan BLEU tertinggi mencapai 39.52 dan COMET tertinggi mencapai 81.33.

Mesej yang disampaikan oleh kerja ini jelas: dalam skenario lintas bahasa dengan data yang terhad, reka bentuk arsitektur yang halus dan strategi latihan progresif mungkin lebih berkesan daripada sekadar menambah data.

Perlu diperhatikan bahawa pendekatan “senjata utama” ini berkesan dalam skenario dengan jumlah bahasa terhad dan kualiti data yang boleh dikawal, tetapi kebolehluasan dalam sistem terjemahan pelbagai bahasa generik yang perlu menjangkau puluhan bahasa masih memerlukan perbincangan lanjut.

05 Kesimpulan: Menukar kepadatan reka bentuk kepada kos pengiraan

30B ViT berstruktur mengubah kerangka model, membolehkan 6.7 bilion parameter aktif melampaui pesaing 18 bilion di ImageNet;

LFS melakukan pengurangan di input, menghalang beban pengkodean bingkai yang tidak perlu sebelum pengiraan;

RaMod mengompres fine-tuning penuh menjadi suntingan titik tetap pada lapisan representasi, mengurangkan penggunaan memori dan latensi secara serentak untuk penyesuaian antar tugas;

Penterjemahan suara berdasarkan penukaran kod bahasa menggunakan pembahagian tugas MoE dan latihan progresif, membuktikan satu prinsip di lintasan paling kurang data: kebijaksanaan arsitektur kadang-kadang dapat menggantikan kekurangan data.

Empat kertas kerja, empat arah, semuanya menunjuk kepada inti yang sama: Huawei sedang menggantikan "kepadatan skala" dengan "kepadatan reka bentuk". Keempat-empat kertas kerja tersebut datang dari penyelidikan asas, data AI, perkhidmatan awan, dan pusat penterjemahan, menunjukkan bahawa keutamaan kecekapan bukan lagi hanya pilihan sesetengah pasukan, tetapi logik ini telah ditulis ke dalam pilihan teknikal di setiap peringkat.

Jika persaingan AI dalam dua tahun terakhir digambarkan sebagai “perlombaan penambangan”, maka tahun 2026 sedang menunjukkan titik balik: era perlombaan “teknik pemurnian” telah bermula. Aktivasi jarang, penyaringan pintar, adaptasi modular, latihan progresif—jalur-jalur ini tidak bergantung pada lebih banyak chip dan kekuatan komputasi, tetapi pada pemahaman yang lebih mendalam terhadap masalah itu sendiri.

Baik syarikat besar mahupun syarikat rintisan, sudah melalui perlumbaan parameter; babak kedua AI, pemahaman terhadap masalah pelaksanaan sebenar, serta kemampuan kejuruteraan untuk menyelesaikan masalah-masalah ini secara sistematik, adalah titik penentu sebenar.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.