Huawei, AI Tasarım Verimliliği Üzerine Dört IJCAI 2026 Makalesi Yayınlıyor

iconMetaEra
Paylaş
AI summary iconÖzet
Huawei, IJCAI 2026'da MetaEra kullanarak tasarım verimliliğine odaklanan dört AI + kripto haber makalesi yayınladı. Araştırmalar, mimari yenilik, veri seçimi, modüler uyarlama ve eğitim stratejilerini kapsıyor. Bu yöntemler, performansı istikrarlı tutarken hesaplama maliyetlerini azaltmayı hedefliyor. Zincir üzerindeki haberler ve AI ilerlemeleri, gerçek dünya uygulamalarını şekillendirmeye devam ediyor.
Huawei, IJCAI 2026'da dört makaleyi kabul ederek AI'nın "ölçek yoğunluğundan" "tasarım yoğunluğuna" doğru olan teknoloji eğilimini gösteriyor.

Makale yazarı, kaynak: Leifengwang

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Yapay zeka gerçek senaryolara doğru ilerliyor, sistemli mühendislik kapasitesi hem bir engel hem de bir çıkış yolu.

IJCAI-ECAI 2026, 15-21 Ağustos 2026 tarihleri arasında Almanya Bremen'de yapılacak. AI alanındaki kapsamlı üst düzey bir konferans olan IJCAI, büyük şirketlerin geçen yılın öncü araştırma sonuçlarını test etmenin kritik bir alanı olmuştur: Kim hangi yönde gerçek ilerleme kaydetmiştir, hangi teknik yaklaşımlar üzerinde fikir birliği oluşmaktadır? Makaleler en doğrudan cevaplardır.

Kongre sırasında AI Teknoloji Yorumu, bu zirve konferansında yayımlanan makaleleri sistematik olarak tarıyor ve teknoloji eğilimlerini ve sektör yönlerini belirliyor.

Net bir trend: AI hesaplama maliyetleri yüksek seviyede kalırken, parametre boyutu genişlemesinin marjinal getirisi, marjinal maliyeti artık yakalayamıyor. Bu ekonomik gerçek, teknoloji yeniliği mantığını “daha büyük yapılabilir mi?” yerine “daha verimli kullanılabilir mi?” yönünde şekillendiriyor.

Huawei'nin IJCAI 2026'da kabul edilen dört makalesi, veri kıtlığı sınırlamasını dengelemek ve birim hesaplama gücü başına daha yüksek akıllı çıktı elde etmek için daha ince mimari tasarım ve eğitim stratejileri kullanma yönündeki bu dönüşüm için teknik bir yol haritası sunmaktadır.

Bu teknik yönelim değişikliği, AI'nın uygulamaya geçişindeki derin değişiklikleri de yansıtmaktadır: Teknoloji laboratuvarlardan çıktığında, rekabet artık tek bir yetenekteki tekil bir atlamadan ziyade, doğruluk, genelleştirilebilirlik, veri ve hesaplama gücü arasındaki sistemik koordinasyondur—her bir aşama bir darboğaz olabilir, aynı zamanda bir kırılma noktası da olabilir.

Aşağıdaki dört makale, tam olarak bu dört yönden Huawei'nin sistemli mühendislik yeteneğini ve teknoloji seçimini göstermektedir.

01 Ölçek Sınırını Aşmak: Mimari ve Eğitimle Hiyerarşik ViT’in Kapasite Sınırını Yeniden Yazmak

Görsel temel modellerin ölçeklendirme yarışında, her zaman gizli bir “tavan” bulunmuştur. Normal ViT'lerin ölçeklendirilmesi 6B'den 22B'ye kadar sürekli olarak sınırları zorlamıştır. Ancak hiyerarşik ViT'ler, 2B parametreden aşağıda takılı kalmıştır. Büyük yapmak istememek değil, yapamamaktır. Hiyerarşik modeller, normal ViT'lere göre veri ve eğitim stratejilerine çok daha yüksek ihtiyaç duyar; normal ViT'in ölçeklendirme çözümlerini doğrudan uygulamak işe yaramaz. Bu da yapısal bir çelişkiye yol açar — hiyerarşik ViT'ler doğal olarak çok ölçekli temsiller ve yoğun tahmin görevleri (hedef algılama, bölütleme, video anlama) için uygundur, ancak ölçeklenemeyince yeteneklerinin üst sınırı kilitlenir.

Huawei ekibinin bu makalesi olan “Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters”, ölçek sınırını 2B’den doğrudan 30B’ye çıkardı.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Nasıl yapıldı? Cevap, model yapısını ve eğitim stratejisini aynı anda yeniden tasarlamaktır; ikisi de eksik olmamalıdır.

Temel tasarım, verimli hiyerarşik ViT mimarisidir. Çok ölçekli özellik çıkarma yeteneğini korurken hesaplama verimliliğini de dikkate alır.

Bu mimariye dayanarak, takımlar 200M'den 5B parametreye kadar yoğun modelleri eğitti ve toplam parametre sayısını 30B'ye çıkarmak için seyrek uzman karışımlı (SMoE) varyantlarını sundu — bu, şu ana kadar hiyerarşik ViT alanında açıkça duyurulan en büyük parametre boyutudur.

Eğitim sürecinde, ekip iki aşamalı bir süreç tasarladı:

Birinci aşamada, modelin görsel temsilin temel kurallarını öğrenmesi için ImageNet-21K üzerinde MAE öz-denetimli ön-eğitim yapın;

İkinci aşamada, 27 milyon görüntü veri seti üzerinde, birden fazla en ileri düzey genel temel modelden bilgi distilasyonu yoluyla kapasite atlaması sağlanır.

Deneysel sonuçlar en güçlü kanıtı vermiştir. ImageNet-1K doğrusal değerlendirme sırasında, toplam 30 milyar parametreli MoE modeli (EHV-5B-MoE), sadece 6,7 milyar parametre aktifleştirilerek %89,0 doğrulukla, daha büyük toplam parametre sayısına sahip olan EVA-CLIP-18B ViT tabanlı modelini aştı. Daha da önemlisi, performans artışı yalnızca görüntü sınıflandırma ile sınırlı değil; video analizi ve yoğun tahmin görevlerinde de benzer şekilde üstün performans gösterdi. Bu, EHV'nin sadece sınıflandırma özellikleri değil, aynı zamanda gerçek kaliteli ve genellenebilir bir görsel temsil öğrendiğini göstermektedir.

Huawei ekibi, bu çalışmayla hiyerarşik ViT'nin sadece büyütülebileceğini, aynı zamanda çıkarım tarafında daha az aktive parametre kullanarak daha yüksek doğruluk elde edilebileceğini kanıtladı. Mimari tasarım, modelin kapasite sınırını belirlerken, eğitim stratejisi bu sınırın ne kadarının serbest bırakılacağını belirler.

02 Ön Filtre Girdisi: Öğrenilebilir Çerçeve Seçici Paradigma Yeniliği

Model tabanının tavanı yükseltildi, ancak hesaplama gücü tüketimi sadece modelde değil, modele verilen verilerde de büyük ölçüde gerçekleşiyor. Video-büyük dil modelleri (Video-LLMs), video işleme sırasında hesaplama maliyetinin büyük kısmını çerçeve kodlamada harcıyor. Maliyeti kontrol altına almak için mevcut modeller neredeyse tümü eşit aralıklı çerçeveler çekmek için eşit örnekleme yöntemini kullanıyor.

Ancak videodaki kritik olaylar asla eşit şekilde dağılmaz. Önemli bir hareket sadece bir veya iki saniye sürebilir ve eğer tam olarak iki örnekleme noktası arasında düşerse tamamen kaçırılır. Bunun yerine, uzun süren statik sahneler tekrar tekrar kodlanır ve değerli hesaplama kaynakları harcanır.

Diğer bir yaklaşım, sorgu tabanlı yöntemdir—belirli sorulara göre ilgili çerçeveleri aramak. Bu, video soru-cevap senaryolarında gerçekten etkilidir, ancak ayrıntılı video açıklaması bir “sorgusuz” görevdir ve bu yöntem burada işe yaramaz.

Düzgün örnekleme çok kaba, sorgu temelli yöntemler ise kullanılamıyor. Ne yapmalı? Huawei AI Veri Takımı, bu sorunu çözmek için öğrenilebilir çerçeve seçici LFS (Learnable Frame Selector) önerdi.

Kağıt adresi: https://arxiv.org/pdf/2601.14594v1

Temel fikirleri oldukça basit: İnsan kurallarıyla çerçeveler seçmek yerine, modelin kendisinin "neye bakması gerektiğini" öğrenmesi.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Bu, "sonuçtan başlamak" temelinde bir eğitim paradigmadır; LFS, "belirli bir ara puan üzerinde hangi çerçevelerin daha yüksek puan alacağını" öğrenmek yerine, "hangi çerçevelerin büyük modelin daha iyi açıklamalar yazmasını sağlayacağını" öğrenir. Nasıl yapılır? Üç ana tasarım:

İlk olarak, her kareye bir "olay önem" puanı vermek için bir değerlendirme ağı eğitin.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

İkinci olarak,全局排序 yerine bölümlere ayrılmış çerçeveler seçin. Çerçeveleri seçerken basitçe “en yüksek puanlı ilk K adet” değil, tüm videoyu birden fazla zaman aralığına bölün ve her zaman aralığında en önemli çerçeveleri ayrı ayrı seçin. Bu, kritik olayları yakalamanızı ve çerçevelerin zaman ekseni üzerinde eşit şekilde dağılımını sağlar.

Üçüncü ve en kritik adım: eğitim yöntemi. LFS, çerçeveleri seçtikten sonra bunları dondurulmuş Video-LLM'ye vererek açıklamalar üretir, bu ürettiği açıklamaları insan tarafından etiketlenmiş standart açıklamalarla karşılaştırır, kaybı hesaplar ve ardından çerçeveleri seçme modülünün parametrelerini geri yayılım ile günceller. Tüm süreç boyunca büyük dil modeli hiç değişmeden kalır, LFS tamamen tak-çalıştır bir harici modül gibi davranır.

Ayrıca araştırma ekibi, mevcut ayrıntılı video açıklamaları referans seti ile insan gerçek algısı arasında önemli bir fark olduğunu tespit etti. Bu nedenle, tüm videoların Çin’in Maddi Olmayan Kültürel Miras yemeklerinin gerçek ticari sahne kaynaklarından (örneğin, restoran mutfakları, yemek öğretimi vb.) alındığı ve tüm açıklamaların ve soru-cevapların insan tarafından dikkatle yazıldığı yeni bir referans seti olan ICH-CC'yi geliştirdiler.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Deneysel sonuçlar nasıl?

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

LFS, farklı modellerde ve farklı referanslarda genel ve istikrarlı bir artış sağlıyor. Tüm modellerin LFS ile güçlendirilmiş versiyonları, tüm test referanslarında temel modeli aşıyor; bu da LFS'nin yalnızca tek bir referansta değil, genel bir performans kazandırdığını gösteriyor.

Bu, makalenin temel savını yanıtlıyor: Modelin eşit olarak örneklenen çerçeveler üzerinde “zorla” çalışmasının yerine, girdi aşamasında akıllı bir filtreleme yapmak—doğru çerçeveleri seçmek, alt görevlerin performansını da artırır.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

03 Görev Uyumu: Modüler Müdahale Temsili, Tam Model Ince Ayarını Değiştiriyor

Çok büyük dil modellerinin görevler arası genelleştirme yeteneği, uzun zamandır “söylenmesi kolay, uygulanması zor” bir sorun olarak kalmıştır. Mevcut ana akım çözümü, token başına dinamik rota seçimidir—her bir token işlenirken, birden fazla LoRA uygunlaştırıcısı arasında seçim yaparak hangi yolu izleyeceği belirlenir. Bu mekanizma gerçekten etkilidir, ancak maliyeti de yüksektir: hesaplama yükü ve GPU bellek tüketimi yüksek seviyede kalır ve model hem yavaş hem de çok GPU belleği tüketir.

Alternatif bir yaklaşım—ReFT (Representation Fine-Tuning)—model parametrelerini değiştirmek yerine, yalnızca önek ve son ek token temsillerini düzenleyerek tek görev uyumunu sağlar ve LoRA'dan çok daha yüksek verimlilik sunar. Ancak iki eksikliği vardır: Birincisi, tokenlerin kendilerinin anlamları belirsizdir ve yalnızca başlangıç ve bitiş noktalarını değiştirmek yeterince hassas değildir; ikincisi, modelin görmediği yeni görevlerle karşılaştığında hangi katmanı ve hangi temsili değiştirmesi gerektiğini bilmediği bir "kendi kendini yönlendirme" mekanizması yoktur.

Huawei Cloud ekibi, birçok üniversiteyle iş birliği yaparak, ReFT fikrini çoklu görev genelleştirme senaryolarına başarıyla genişleten temsil bilinçli modüler RaMod (Representation-Aware Modularity) çerçevesini önerdi.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Temel yaklaşım iki parçaya ayrılabilir:

İlk bölüm, çift modül temsili ve parametre ince ayarıdır. ReFT yalnızca başlangıç ve bitiş noktalarını değiştirebilir, RaMod ise çok daha ince bir yapıya sahiptir—gizli temsillerin orta katmanlarından bir stratejiyle filtrelenmiş alt küme seçerek modüler müdahale yapar. Nerede ve nasıl değiştirileceği, seçici ve stratejiktir. Bu sayede model, daha önce görülmemiş görevleri daha hassas bir şekilde çözmeye yönlendirilebilir.

İkinci kısım, asenkron zamanlayıcıdır. Görevler arasında genelleştirme için en büyük endişe, GPU belleğinin yetersiz kalmasıdır; RaMod, gerekli müdahaleler için GPU belleği tahsis eden ve kullanıldıktan sonra aktif olarak serbest bırakan bir aktif zamanlama mekanizması tasarladı. Bu sayede, depolama maliyeti en aza indirildi.

Etki anında ortaya çıktı. Deneyler, RaMod'un hem görevler arası genelleme performansının daha iyi olduğunu hem de maliyetlerde büyük bir düşüş olduğunu gösterdi: Orijinal LLM'lere kıyasla, bu yöntem ek ön doldurma süresini %83 azalttı, üretme gecikmesini %100 düşürdü ve GPU bellek kullanımını %79 azalttı.

Başka bir deyişle, RaMod görev uyumunu “modeli değiştirmek”ten “temsilleri ayarlamak”a dönüştürdü—modelin ana yapısını değiştirmeden, yalnızca kritik katmanların gizli durumlarında hedeflenmiş düzenlemeler yaptı. Bu yaklaşım geçerliyse, büyük modellerin dağıtım ekonomisi yeniden yazılabilir: bir temel model, birkaç hafif müdahale modülüyle birlikte, her bir senaryo için ayrı ayrı tam kopyaları eğitme veya yükleme gerekmeden, tamamen farklı görev senaryolarına düşük maliyetle hizmet verebilir.

Ancak "yeniden yazma" öncesinde, bu temsil ayarlaması yönteminin hala cevaplanması gereken bazı kritik soruları vardır; örneğin, karmaşık çıkarım gibi yüksek zorlukta senaryolarda, hesaplama maliyetini büyük ölçüde azaltırken doğruluğu koruyabilir mi.

04 Veri kırılımı: Dil uzmanları görevlerini yerine getiriyor, adım adım ilerleyen eğitim

İlk üç makale, "modeli daha verimli nasıl kullanırız?" sorusunu çözmeye çalışıyor. Ancak birçok görevde daha temel bir gerçeklik zorluğu var: Eğitim verileri yeterli değilse ne olur?

Kod değişimi (Code-Switching, CS) ses çevirimi görevi, birden fazla dilin karışık olduğu sesleri hedef dile çevirmeyi gerektirir. Bu görev hem anlamsal modelleme açısından karmaşıktır hem de CS verilerinin azlığı büyük bir sorundur.

Önceki araştırmalar genellikle iki yola dayanıyordu: ya modellerin kendileri anlamsal temsilleri “anlamasına” izin veriliyordu, bu da sonuçların kontrol edilemez olmasını sağlıyordu; ya da maliyeti çok yüksek olan ve ölçeklenebilirliği sınırlı olan el ile etiketleme yapıyordu.

Huawei Çeviri Hizmetleri Ekibi, Xiamen Üniversitesi ve Macau Üniversitesi ile birlikte hazırladığı bu makalede, modelin farklı dillerin anlamsal temsillerini kendi kendine keşfetmesi yerine, bunları aktif olarak hizalamak için her dil için ayrı bir “uzman ekibi” oluşturup, her ekibin kendi dilinin anlamsal modellemesinden sorumlu olması ve ardından tümüyle hizalanması fikrini öneriyor.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Kağıt adresi: https://arxiv.org/pdf/2511.10670

İki ana tasarım vardır:

İlk olan MoE (Karışık Uzman) ses projeksiyonudur. Geleneksel projeksiyonlar tüm dilleri eşit şekilde ele alır ve doğal olarak iyi sonuçlar vermez. MoE sürümü, her dil için özel bir “uzman” grubu atar ve her uzman grubu yalnızca bir dilden ince ses özellikleri modellemekle sorumludur. Rotalama mekanizması, ses özelliklerini ilgili dilin uzman grubuna otomatik olarak iletir.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Yolun sapmasını önlemek için makale, her uzmanın ilgili dilin özelliklerini gerçekten öğrenmesini sağlayan dil özgü kayıp ve tüm token'ların aynı uzmana yoğunlaşmasını önleyen grup içi yük dengesi kaybını da dahil etti.

İkinci, çok aşamalı eğitim paradigmadır. Veri yetersizse stratejilerle tamamlanır. Eğitim dört adımda ilerler: Önce otomatik sesli tanıma (ASR) verileri kullanılarak her dil için projeksiyon cihazları ayrı ayrı önceden eğitilir, ses-metin hizalamasının temeli oluşturulur; ardından dillere özel projeksiyon cihazları MoE yapısına birleştirilir, dil özgü kayıp ve yük dengeleme kaybı ile birlikte optimize edilir; ardından ASR verilerinden tek dilli ses çevirisi (ST) verilerine geçiş yapılır, geçiş kaybı ile yumuşak bir geçiş sağlanır; son olarak ST verilerinden CS ses çevirisi verilerine uyum sağlanır.

Bu ilerlemeli tasarımın inceliği, modelin doğrudan kıt CS verilerini çözmek yerine, önce yeterli ASR ve ST verileriyle temel becerileri sağlamlaştırmak ve ardından adım adım hedef görevlere yönelmektedir.

Huawei IJCAI 2026 Makale Özeti: "Ölçek Yoğunluğu"ndan "Tasarım Yoğunluğuna" Geçiş

Whisper, SeamlessM4T, LLaST gibi birçok güçlü temel model karşılaştırıldı. Fisher ve NTUML2021'in dört test setinde, bu yöntem SeamlessM4T'in dışında diğer tüm modelleri aştı; BLEU değeri en yüksek 39,52 ve COMET değeri en yüksek 81,33 oldu.

İşin taşıdığı mesaj açık: Veri azlığı olan çok dilli senaryolarda, ince ayarlı mimari tasarım ve adım adım eğitim stratejileri, sadece veri biriktirmekten daha etkili olabilir.

Bu çalışma, dillerin sayısı sınırlı ve veri kalitesi kontrol altında olan senaryolarda etkili bir “keskin alet” çözümüdür, ancak onlarca dilin kapsanmasını gerektiren genel çok dilli çeviri sistemlerinde ölçeklenebilir olup olmadığı daha fazla tartışmaya ihtiyaç duyar.

05 Sonuç: Tasarım yoğunluğu ile hesaplama maliyetini dengeleyin

30B hiyerarşik ViT, model iskeletini yeniden yapılandırarak 6,7 milyar aktive parametreyle ImageNet üzerinde 18 milyar parametrelik rakibini geçti;

LFS, girişte hesaplama öncesinde büyük miktarda anlamsız çerçeve kodlama maliyetini engelliyor;

RaMod, tam ayarlamayı temsil katmanına yönelik sabit nokta düzenlemesine sıkıştırarak, görevler arası uyum için bellek kullanımını ve gecikmeyi birlikte düşürdü;

MoE bölüşümü ve ilerlemeli eğitim kullanılarak dil geçişli ses çevirisi, en az veriye sahip yarışmada bir ilke kanıtladı: mimarinin akıllılığı, bazen veri yoksunluğunu telafi edebilir.

Dört makale, dört farklı yön, aynı çekirdeğe doğru yöneliyor: Huawei, “ölçek yoğunluğunu” “tasarım yoğunluğu” ile değiştiriyor. Bu dört makale, temel araştırmadan, AI verilerine, bulut hizmetlerine ve çeviri hizmet merkezine kadar uzanıyor ve verimlilik önceliğinin sadece bir takımın tercihi olmadığını gösteriyor; bu mantık, tüm teknik seçimlerin içine yazılmış durumda.

Geçen iki yılın AI yarışmasını “maden kazma” olarak karşılaştırırsanız, 2026 yılı bir dönüm noktasını ortaya koyuyor: “metallürji tekniği” yarışmasının başlamış olması. Seyrek aktive etme, akıllı filtreleme, modüler uyumlaştırma, adım adım eğitim—bu yollar daha fazla çip ve hesaplama gücüne değil, soruna daha derin bir anlayışa dayanıyor.

Büyük şirketlerden startup'lara kadar, parametre yarışını zaten geçti; AI'nın ikinci yarısında gerçek dünyaya uygulama sorunlarını anlama ve bu sorunları sistematik olarak çözme mühendislik becerisi gerçek kazanç noktasıdır.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.