2026 yılının ilk yarısında, Çin'in AI alanında dünya modeli yarışması için toplam 90 milyar yuan finansman sağlandı ve bu artış %500'ü aştı.Yazan ve Kaynak: Leifengwang

2026 yılının ilk yarısında, Çin'in AI dünyasındaki para ve insanlar aynı yöne doğru akıyor: Dünya Modeli.
Yalnızca ilk altı ayda, ulusal dünya modeli sektöründe açıklanan toplam finansman tutarı yaklaşık 30 milyar yuan oldu; "vücutlu akıl + dünya modeli" entegrasyonu sektörü de dahil edilirse bu rakam 90 milyar yuanı aştı.
Geçen yılın aynı dönemine kıyasla finansman büyümesi 5 katı aşmıştır.
On milyar dolarlık sermaye ve sonsuz sayıda uzman, dalgalar gibi akın ediyor.
Karşılaşılamaz bir soru: Bu kadar çok kişi içeri girdiğinde, gerçekten bunun ne olduğunu anlamış olan kaç kişi var?
İş yapanlar yön arıyor, yatırımcılar insan arıyor, başucu ajansları organizasyonu inceliyor, büyük şirketlerin strateji departmanları kimin hayatta kalacağını araştırıyor.
Garip bir şey, herkes aynı soruyu soruyor: Kimse dünya modeli konusunu açıklayabilir mi?
Var.
Bugün IDEA Enstitüsü'nün baş bilim insanı ve Vision Future'in kurucusu Zhang Lei ile derin bir röportaj yapıyoruz.
O, IEEE Fellow'dir ve Google Scholar'da 77.000'den fazla alıntıya sahiptir. DINO serisi, COCO'da 5 ay boyunca birinci sırada kaldı. Grounding DINO ve sonraki DINO-X, Google ve Meta'yı geride bırakarak李飞飞 ekibi, NVIDIA, Galaxy General gibi birçok küresel önde gelen kurum tarafından "standart" olarak alıntılandı.
2025 yılında, ekibiyle birlikte IDEA'dan türeyerek Şiqi Gelecek'i kurdu ve angel sermaye turu bir ay içinde yaklaşık 100 milyon yuan到账.
Arkasında iki AI devi duruyor: akademik danışman Zhang Bo akademisyeni (Çin yapay zekânın kurucularından biri), endüstri danışmanı Shen Xiangyang akademisyeni (eski Microsoft küresel yürütici başkanı ve eski Microsoft Asya Araştırma Enstitüsü müdürü).
Ancak bunlar onu aramamızın ana nedenleri değil.
Onu aramamızın nedeni basit: 2026 yılında herkes "dünya modeli nedir?" tartışırken, Zhang Lei, net, uygulanabilir ve hiçbir ana akıma taviz vermeyen cevaplar veren az sayıda kişiden biriydi.
Microsoft Araştırma Enstitüsü baş araştırmacısından IDEA Araştırma Enstitüsü'nde konuk bilim insanına, ardından girişimciye—kariyer yolu birkaç kez yön değiştirdi, ancak araştırma konusu hiçbir zaman değişmedi: “Yapay zekânın nesneleri anlaması”.
Dünya modeli, fiziksel dünyada yirmi yıldır ele alınan bu sorunun kilit cevabıdır.
Dünya modeli yarışını izliyorsanız, bunun gerçekten bir balon olup olmadığını anlamak, hangi yolun kazanacağını bilmek ve hangi tür takımların takip edilmesi en değerli olduğunu değerlendirmek istiyorsanız, bu kişinin konuşmasını okumak değer. Çünkü tamamen zamanınızın değerine layık.
Aşağıda konuşmanın metni yer almaktadır; AI Teknoloji Yorumu, anlamını değiştirmeden düzenlemeler yapmıştır.
Dr. Zhang Lei, IEEE Fellow, kurucu ve CEO'su Vision Future, şu anda IDEA Enstitüsü Bilgisayar Görsel ve Robotik Araştırma Merkezi'nde (CVR) konuk bilim insanı, Hong Kong Üniversitesi of Science and Technology (Guangzhou)’da yan görevli profesör, eski Microsoft Research Asia ve Microsoft Headquarters Research baş araştırmacısı; bilgisayar görsel alanlarında 200’den fazla makale yayımlamıştır, Google Scholar’da 77.000’den fazla alıntıya sahiptir, H-Index’i 107’dir ve 60’tan fazla ABD patentine sahiptir. Büyük ölçekli görüntü tanıma ve çoklu ortam bilgi arama alanlarındaki üstün katkıları nedeniyle IEEE Fellow seçildi.
Vücutlu akıl için en büyük engel vücut değil, beyindir.
AI Teknoloji Yorumu: Son yıl boyunca vücutlu akıl patlaması yaşadı, tüm robot şirketleri hareket kontrolünde giderek daha etkileyici hale geldi, Unitree robotları maraton pistinde koşuyor, Zhiji robotları turlar yapıyor. Ancak uygulama alanlarında hala biraz eksiklik olduğunu gözlemliyoruz. Vücutlu akıl gerçek dünyaya doğru gerçekten nasıl ilerleyebilir ve hangi zorluklar hâlâ aşılması gerekiyor?
Zhang Lei: Robotların çözmesi gereken iki temel şey vardır: başarı oranı ve genelleme yeteneği. Başarı oranı, bir işin yeterince güvenilir şekilde tamamlanıp tamamlanmadığını gösterir; genelleme yeteneği ise aynı görev, çevre veya varlık değiştirildiğinde hâlâ güvenilir şekilde tamamlanabilmektir.
Dört belirli mücadele var:
Birinci olarak, tek senaryoda genelleştirme yetersiz. Şu anda birçok ekip, tek bir senaryoda başarı oranını %70 hatta %80'e çıkarabiliyor, bu büyük bir ilerleme gibi görünüyor. Ancak gerçek uygulamada %80 ne anlama geliyor? Bu, beş işlemde birinin başarısız olacağı anlamına gelir ve hâlâ büyük miktarda insan gücüne ihtiyaç duyar, tamamen bağımsız olarak dağıtılabilir değildir.
İkinci olarak, yatay genişletme senaryolarının genel uygunluğu yetersiz. Önce tek noktadaki yetenekleri tavan seviyesine taşıyın, ardından yatay olarak senaryo uygulama genişliğini artırın ve daha karmaşık ortamlarda daha fazla, daha karmaşık görevler yapmasını sağlayın. Bu, robotların “laboratuvar gösterimi”den “gerçek uygulamaya” geçişini engelleyen en büyük boşluktur.
Üçüncüsü, “beyin”in derin seviyedeki yeteneklerinin eksikliği. Mevcut derin öğrenme, akıllılığın “davranışlarını” değil, “mekanizmasını” (akıllılığın arkasındaki çalışma prensiplerini) daha çok öğrenmektedir. Gövdeli beyin, fiziksel dünyaya yönelik gerçek neden-sonuç çıkarımı (sadece istatistiksel ilişkiler değil, “A nedeniyle B”的 mantıksal zinciri anlama), ortak algı ve uyarlama yeteneğine sahip olmalıdır; bu alanda ise henüz yeni başladık.
Dördüncü olarak, hâlâ “uç” seviyesinde bir uygulama değil. Şu anda çoğu robot, büyük dış hesaplama gücüne hâlâ bağımlı; milyonlarca senaryoda yaygınlaştırıp “uygulama-veri-iterasyon” döngüsünü oluşturabilmek için “insan destek gerektirmeyen” temel sorunu çözmek gerekir.
AI teknoloji yorumu: Dürüst olmak gerekirse, sektörde bu konuda görüşler bölünmüş durumda. Donanım ekibi, Çin tedarik zinciri avantajının açıkça belirgin olduğunu ve önce temel maliyeti düşürmek gerektiğini düşünüyor; algoritma ekibi ise beynin gerçekten kritik nokta olduğunu düşünüyor. Sizin görüşünüz nedir?
Zhang Lei: Beyin daha zor, ancak daha önemli.
Cihaz tarafında, Çin'in donanım yenilemesi gurur verici. Unitree ve Zhiyuan gibi şirketler, simülasyon tabanlı takviyeli öğrenme (sanal ortamda kontrol algoritmalarını eğitip gerçek robotlara aktarma) ile hareket kontrolünü geliştirmekte, motorlar ve aktarım mekanizmaları gibi kritik bileşenleri sürekli olarak iyileştirerek maliyeti ve güvenilirliği büyük ölçüde optimize etmişlerdir ve çok sağlam bir yol izlemişlerdir. Ancak bu cihazların maraton ve performanslarda gösterdiği yetenekler, hayvanların temel yeteneklerine sahip olduğunu söylemekle sınırlıdır; hayvanların doğuştan gelen tepkileri, zıplama, kaçma ve çevreyle etkileşim kurma yetenekleri henüz sağlanamamıştır.
AI Teknoloji Yorumu: “Beyin” daha zor dediniz, nerede zor? Veri yetersiz mi, yoksa akıllılık hakkındaki anlayışımız mı çok sınırlı?
Zhang Lei: Arka plandaki mekanizmayı gerçekten anlamadık. İnsan beyni, diğer hayvanlarla karşılaştırıldığında en büyük farklılığa ve en yüksek zeka düzeyine sahiptir. Şu anda tüm derin öğrenme atılımları, beynin zekasının ne kadar olduğunu yüzeyel olarak gözlemleyip algoritmalarla bunu gerçekleştirmeye dayanmaktadır. Yapay zeka aslında insan zekasını değil, insan davranışını öğrenmektedir. Zhang Bo hocanın sık sık söylediğine göre, büyük dil modelleri insanlar gibi konuşabilir, ancak dil anlaması insanlarla tamamen farklıdır.
Neden dünya modeli yirmi yıl boyunca görmezden gelindi ve bugün birden popüler oldu?
AI Teknoloji Yorumu: Vücutsal patlama ile birlikte "dünya modeli" kavramı aniden popüler hale geldi. Ancak sektör içindeki herkes bunun yeni bir terim olmadığını, 1990'larda zaten akademisyenler tarafından öne sürüldüğünü biliyor. Biz de merak ediyoruz; bu kavram neden yirmi yıl boyunca sessiz kaldı ve bugün aniden bir trend haline geldi?
Zhang Lei: Bu iyi bir soru. Dünya modelleri gerçekten yeni bir kavram değil. 1990’ların başlarında, bilim insanları, ortamı algılayıp eylemlerle hedeflere ulaşan yapay zeka sistemlerinin (akıllı ajanlar) etkileşimleri için ortam modellemeye çalışmış, bu da pekiştirmeli öğrenme algoritmalarını geliştirmeye yardımcı olmuştu; ancak o dönemde derin öğrenme henüz ortaya çıkmamıştı ve kavramın ortaya atılmasından sonra test edilmesi zor oldu.
Bu kavram, 2018-2019 yılları civarında “World Models” adlı makaleler ortaya çıkıp oyun senaryolarında uygulandığında gerçekten doğrulandı, çünkü oyunlar, pekiştirmeli öğrenmeyi test etmek için en iyi ortamdır.
Öğrenme derinleştikçe, AI birkaç yıl sonra oyunlarda insan oyuncuları yenebilmeye başladı. Bu sırada araştırmacılar, AI ajanlarının oyun ortamıyla sürekli etkileşim halindeyken kendi kendine bir dünya modeli "öğrenebilir" olup olmadığını, yani ortamın gelişim sürecini bu modele yerleştirebilir olup olmadığını düşündü. Bu fikir 2018 ile 2020 yılları arasında tamamen doğrulandı.
AI Teknoloji Yorumu: Peki bu, bugünün vücutlu yapay zeka ile nasıl ilişkili? Dinlediğimiz kadarıyla, vücutlu yapay zeka aslında dünya modelini popüler hale getiren tetikleyici mi?
Zhang Lei: Bu bağlantı, dil modellerinden başlamalıdır. Endüstri, önce VLA (Görsel-Dil-Eylem modeli, yani robotlar görüntüyü izleyerek bir sonraki eylemi tahmin eder) yaptı ve dil modelinin taklit öğrenme paradigmalarını kullandı: dil modeli bir sonraki token'ı tahmin eder; gövdeli VLA ise robotun mevcut görüntüyü izleyerek bir sonraki eylemi nasıl yapacağını tahmin etmesidir.
Ancak bu yöntem kısa sürede bir sınır ile karşılaştı. Sınır sadece verilerde değil, verilerin bir tarafı olduğunu düşünüyorum, diğer taraf ise takviyeli öğrenmenin yeterince uygulanmaması. Bir benzetme yapmak gerekirse: taklit öğrenimi dil modellerine konuşmayı öğretir, takviyeli öğrenme ise dil modellerine doğru konuşmayı öğretir.
Robotların akıllılık düzeyi ve hareket başarı oranları, aynı şekilde pekiştirmeli öğrenme gerektirir.
Ancak, pekiştirmeli öğrenmenin gövdeli sistemlere uygulanması iki ölümcül engelle karşılaşıyor: birincisi, veri toplama verimliliği çok düşük, dil modellerinden çok daha düşük; robotlar her eylemi gerçek ortamda gerçekleştirmeli ve fiziksel geri bildirimleri beklemelidir; ikincisi, başarısızlık maliyeti kabul edilemez; bulaşık yıkamayı öğrenemeyen bir robot bulaşıkları kırar, otonom sürüş sistemi kazaları önlemeyi öğrenmek için birçok gerçek kaza yaşamak zorunda kalabilir. Bu, dil modellerinin dijital dünyada düşük maliyetli deneme-yanılma yapmasından tamamen farklıdır.
Dünya modeli tarafından sağlanan sanal ortam, bu sorunların çözümü için tam olarak çıkış yoludur. Bir model, “Bu eylemi yaparsam, ortam nasıl değişir?” diye tahmin edebiliyorsa, robotlar gerçek bir şekilde binlerce tabağı kırmadan önce sanal dünyada sonsuz kez deneme yapabilirler.
(Yazar notu: Bu metnin mantık zincirini basitçe anlayın. Birincisi, robotların bir şeyi yapmayı öğrenmesi için çok sayıda deneme-yanılma gerekir. İkincisi, gerçek dünyada deneme-yanılma çok pahalı ve tehlikelidir. Üçüncüsü, dünya modeli, robotlara bir “sanal eğitim alanı” oluşturmak için kullanılır ve robotlar zihinlerinde tüm eylemlerin sonuçlarını simüle eder. Dördüncüsü, yalnızca en iyi çözüm gerçek dünyada uygulanır. İşte neden dünya modelleri bu noktada tüm endüstrideki ilginin odak noktası haline geldi.)
Hareketi girdi koşulu olarak kullanmıyorsanız, bunu dünya modeli diyemezsiniz.
AI Teknoloji Yorumu: Şu anda endüstride “dünya modeli” teriminin tanımı oldukça karışıktır. Video üretimi yapanlara dünya modeli deniyor, 3D uzay modellemesi yapanlara dünya modeli deniyor, LeCun’un JEPA’sı (birleşik gömme tahmin mimarisi) de dünya modeli olarak adlandırılıyor. Peki sizce, bir modelin bu dört kelimeyi hak etmesi için en az ne gibi koşullara sahip olmalıdır?
Zhang Lei: Dünya modelinin mutlaka eyleme bağlı olması gerekir, yani Eylem Koşullu (Eylem, girdi olarak verildiğinde model, "Eğer belirli bir eylem gerçekleştirilirse çevre nasıl değişir?" sorusunu cevaplayabilmelidir).
Ajanların ortamla etkileşime girebilmesinin nedeni eylemlerdir: Ajanın eylemleri, ortamda değişikliklere neden olur; ortamın değişmesiyle yeni bir durum oluşur ve bu durum, ajanın mevcut eyleminin hedefe ne kadar yaklaştığını bildirir. Bu, tam bir kapalı döngüdür; ortam durumunun her geçişi, önceki adımda gerçekleştirilen spesifik eyleme bağlıdır.
Herkes genellikle dünya modelinin, dil modelinin Sonraki Token Tahmini'ni Sonraki Durum Tahmini'ne dönüştürdüğünü söyler, ancak ben bu tanımın yetersiz olduğunu düşünüyorum; kritik bir koşul eksik. Doğru ifade şudur: Eyleme Dayalı Sonraki Durum Tahmini. Sadece eylem bu öncü koşul ile eklenirse, durum tahmini anlamlı olur ve gerçek anlamda takviyeli öğrenme gereksinimlerine uygun bir dünya modeli oluşturur.
AI Teknoloji Yorumu: Gerçekten de birçok kişi, özellikle yatırımcılar, BP’lerde Sora gibi video üretme modellerini de dünya modelleri olarak adlandırıyor. Ancak sizin önceki kriterlerinize göre, bu modeller açıkça hareket boyutunu eksik tutuyor. Bu sorunu nasıl analiz edersiniz?
Zhang Lei: Burada tartıştığımız dünya modeli, güçlü öğrenme alanından gelen model-tabanlı yöntemlerden türetilmiştir ve akıllı ajanların çevresiyle daha etkili etkileşim kurmasına yardımcı olmayı amaçlar. Dünya modelinin birçok uygulama alanı olsa da, gövdeli akıllılık şu anda en net ve en değerli uygulama alanıdır.
Bu anlamda, Sora gibi yalnızca video üretimi yapan modeller, dünya modeli olarak adlandırılamaz. Temel neden, bu modellerin “hareketleri” modellememesidir; temel olarak tutarlı bir video dizisi üretir ve piksellerin nasıl değişeceğini tahmin eder, ancak robot ve çevre etkileşimlerinin hareketlerini tamamen modellemez. Bu modeller robotlara dolaylı olarak yardımcı olabilir mi? Evet, dünya değişimlerinin bazı kurallarını öğrenebilir, ancak robotların çevresiyle daha iyi etkileşime geçmesine yardımcı olmak zordur.
AI Teknoloji Yorumu: Son zamanlarda popüler olan World Action Model (Dünya Eylem Modeli) nedir? Hareketlerden bahsettiğini duyduk, bu başka bir dünya modeli mi?
Zhang Lei: WAM, pekiştirmeli öğrenme anlamında bir dünya modeli değildir. Gelecekteki görüntülerin sağladığı piksel düzeyli denetim sayesinde eylem tahminini iyileştirir ve bazı görevlerde VLA'dan daha iyi performans göstermiştir. Ancak modellemesi etkiden nedeni doğruya doğru yapar: önce gelecekteki görüntüler oluşturulur, ardından eylemler geriye doğru çıkarılır. Bu nedenle pekiştirmeli öğrenmede kullanılamaz ve burada tartıştığımız dünya modeli tanımına uymaz.
Piksel Takımı vs Gizli Uzay Takımı: İkisi de aslında aynı şeyi yapıyor
AI Teknoloji Yorumu: Yol mücadelesinden bahsedildiğinde, bu şu anda dünya modeli alanındaki en sıcak konu. LeCun, gizli uzay okulunun öncüsü, Sora ise piksel okulunu temsil ediyor. İki yol birbirine tamamen zıt gibi görünüyor, siz ne düşünüyorsunuz?
Zhang Lei: Öncelikle, iki yolun ortak noktaları olduğunu görmeliyiz.
Aslında şu anda herkes bunların oldukça karşıt olduğunu hissediyor, belki de LeCun'un görüşlerini çok net bir şekilde savunması nedeniyle; bir akademisyenin dışarıda kendi görüşünü hatırlatmak için bunu oldukça açık bir şekilde ifade etmesi gerekebilir.
Ancak piksel yolu aslında gizli uzayı da kullanır. Stable Diffusion ve Sora, önce görüntüleri veya videoları düşük boyutlu temsil uzayına sıkıştırır. Bu nedenle, temsil uzayı daha temel bir sorundur. İki yolun gerçek ayrımı, gizli uzayı kullanıp kullanmamak değil, gizli uzaya girdikten sonra neyi koruyup neyi bırakmak olduğudur.
Fark şudur: Gizli uzay yaklaşımı, fiziksel kanunlarla yönlendirilmeyen ışık, gölge ve doku gibi piksel detaylarını dışlamayı hedefler; bu da modelin durum değişimlerinin arkasındaki daha temel kuralları öğrenmesine yardımcı olur. Ancak bu yaklaşım, temsil çökmesi riski taşır: eğer on binlerce farklı görüntü tamamen aynı temsile haritalanırsa, temsil çöker ve model farklı durumları ayırt etme yetisini kaybeder. Piksel yaklaşımı ise tüm detayları yakalamayı hedefler; temelde insan gözünü memnun etmeye çalışır, çünkü insanlar görsel detaylara çok hassastır.
Yapay Zeka Teknoloji Yorumu: Buraya kadar gelirken bir sezgiye sahibiz. İnsan beyni çıkarım yaparken de gizli bir uzayda mı çalışıyor? Gözlerinizi kapatıp bir eylemin sonucunu hayal ederken, beyninizde pixel pixel bir render işlemi mi yapar?
Zhang Lei: Evet. Eğer insan beyninde bir dünya modeli varsa, insanın hareketlerin çevreyi nasıl değiştireceğini hayal etmesi, aslında gizli bir uzayda işlem yapmak demektir ve tamamen her pikseli zihninde tek tek geçirmek değildir. Bu nedenle, dünya modelinin değerlendirilmesinde insan gözünün görüntü kalitesi üzerindeki değerlendirmesi yeterli değildir. Pixel tabanlı bir yol, dünya modeli oluşturmak için gerçek hedefi, pixellerin ne kadar gerçekçi olduğuna değil, ürettiği video dizisinin fiziksel tutarlılığa uygun olmasına odaklanmalıdır.
(Yazar notu: Bu diyalog, AI dünya modellerinin iki yaklaşımı arasındaki çatışmayı anlatıyor. Sora gibi piksel okulunun tek amacı gerçekçi görüntü üretmek olup, bardağın havada asılı kalması, nesnelerin içinden geçmesi veya mumun söndürülememesi gibi fiziksel akla aykırı hatalara sıklıkla yol açıyor; LeCun ve Zhang Lei'nin savunduğu gizli uzay okulu ise önce görüntüyü kurallara dönüştürüp ardından bunları çıkarıyor, bu nedenle fiziksel neden-sonuç ilişkilerini daha iyi anlıyor. Zhang Lei'nin temel yeniliği, gizli uzaya "nesne yapısı" eklemekti; bu sayede AI önce bardak, masa, insan gibi bağımsız nesneleri ayırt edebiliyor, ardından bu nesneler arasındaki etkileşim kurallarını öğreniyor. Bu yaklaşım, Sora'nın görsel hatalarını önlerken, saf soyut gizli uzaylara kıyasla robotların gerçek dünyada engellerden kaçınma, nesneleri tutma ve hareket planlama konularında daha uygun bir temel sunuyor.)
AI Teknoloji Yorumu: LeCun ile aynı gizli uzay yolunda ilerliyorsunuz. Ancak, yaklaşımınızda onunla bir temel fark olduğunu, yani “nesne yapısını dahil etmek” üzerine vurgu yaptığınızı duyduk. Temel fark nedir?
Zhang Lei: Rotamız, LeCun ile aynı ilk prensibi paylaşır: İnsan beyni, aksiyon-koşullu olarak, piksellerde yeniden canlandırmak yerine soyut temsillerde counterfactual akıl yürütme yapar ("Eğer bunu yaparsam ne olur?" senaryoları).
LeCun, son yıllarda I-JEPA, V-JEPA ve LeJEPA ile bu aksiyomu doğruladı: tahmin, temsil uzayında gerçekleşmelidir. Ancak gövdeli yönün fiziksel uzayındaki karmaşıklık çok yüksektir; bu yöntemi büyük ölçekli gerçek ortamlarda uygulamak için gizli uzayda gerekli yapıları eklememiz gerektiğini düşünüyoruz.
Bu görüş, doğruladığımız yeteneklerden kaynaklanmaktadır. Çekirdek ekibimiz tarafından geliştirilen DINO-X, açık dünya ortamında "nesneleri görme" sorununu çözmüştür. Bu nedenle şimdi nesneleri, dünya modelinin tahmin ve planlama temel birimleri haline getirdik. Duyusal olarak, fizik yasaları nesnelere uygulanır; gizli uzay temsilleriyle nesneleri anlamak, fizik yasalarını daha etkili bir şekilde öğrenmeyi sağlar.
AI Teknoloji Yorumu: Bir dakika, bir şey daha sormak istiyoruz. LeCun'un AMI Labs'ı onlarca milyar dolarlık finansmanla bu yönde çaba harcıyor. “Nesne yapısını entegre etme” iyileştirmeniz, onun büyük çerçevesinde daha ileri gidebileceğinize dair neye dayanıyorsunuz?
Zhang Lei: DINO-X üzerinde çalıştığımızdan beri, bu açık nesne algılama genel modeli ile "nesneleri anlama" konusunda dünyada en iyiye ulaştık. Görsel modellerin mekanizmasını ve neden görsel modellerin fiziksel uygunluk sağladığını anlama konumuz, önceki genel nesne anlama hattıyla tamamen uyumlu.
Kısaca, LeCun’un yaklaşımı temel çerçevedir; biz bu çerçeve üzerine nesne yapılarını ekleyip bunu gerçek ortamda kapalı döngüye soktuk. Bu “kapalı döngü” yeteneğini, geçen yıllar içinde kazandık.
DINO serisi neden Google ve Meta'yı geride bırakıyor?
AI Teknoloji Yorumu: Ekibinizin görsel büyük model aşamasındaki başarıları çok belirgin. Grounding DINO ve ardından lanzedilen DINO-X, Google ve Meta'yı geride bırakarak李飞飞 ekibi, NVIDIA, Galaxy General gibi küresel lider kurumlar tarafından standart olarak referans gösteriliyor. Bu konuyu içerde de tartıştık ve biraz “normal dışı” bulduk: Genellikle Çin ekibi yabancı takımları takip eder, siz nasıl tersine geçip yabancı takımların sizi takip etmesini sağladınız?
Zhang Lei: İki boyut öne çıkıyor.
Yapısal olarak, Transformer’ı (özen mekanizmasına dayalı bir derin öğrenme mimarisi ve büyük dil modellerinin temelini oluşturan) nesne algılama alanında SOTA (State of the Art, alanın en iyi seviyesi) düzeyine getiren ilk ekip biziz. Grounding DINO, dil modellerinin yapısını entegre ederek nesne algılamayı ilk kez açık alana genişletti; model artık yalnızca eğitilmiş nesne kategorilerini tanımayıp, daha önce hiç görülmemiş herhangi bir nesneyi tespit edebiliyor. Şu ana kadar en çok alıntılanan ve indirilen açık kaynak modeli olmaya devam ediyor; bu, yapısal bir kırılma olarak değerlendirilebilir.
Grounding DINO'dan sonra, veri ve mühendislik stratejilerimizde kapalı kaynaklı bir yola geçerek doğrulanmış fikirleri Ölçeklendirme yönünde ilerlettik. Aynı zamanda, iş kalitesi konusunda çok yüksek standartlar koydum. Takım o dönemde gençti ve bu kadar güçlü bir çalışma yapmamıştı, ancak hala eşikleri sıkı tuttum ve yalnızca büyük sürüm düzeyinde bir atılım sağlandığında yayınlamayı zorunlu kıldım. Bu nedenle Grounding DINO 1.5'i çıkarmak için yaklaşık bir yıl, DINO-X'i çıkarmak için ise yarım yıl daha harcadık. Bu bir yıldan fazla sürede geliştirilen sürümlerin, endüstride yüksek bir kabul görmesi kanıtlandı.
AI Teknoloji Yorumu: Bu görsel büyük modelleri yapmanız, bugün dünya modelleri yapmakla nasıl ilişkili?
Zhang Lei: Çalışmalarımız birbirini tamamlıyor. Daha önce nesne algılama üzerinde çalışırken, temel hedefimiz robotlara algısal bir temel sağlamaktı; daha sonra birçok ekip, Grounding DINO'yu somut çevre anlama sorunlarını çözmek için kullandı.
Teknoloji yolu itibarıyla, dünya modelleri dilden daha görsel doğrudur ve neredeyse tüm dünya modeli çalışmaları, GPT gibi saf dil tabanlı mimariler üzerine kurulmamıştır.
Takım birikimi açısından, görsel model mekanizmalarına ilişkin anlayışımız, önceki genel nesne anlama teknoloji yoluna çok yüksek bir uyum göstermektedir. Bu da dünya modelini sürekli olarak geliştirmeye yönelik güvenimizi artırır.
Takım, IDEA'dan türeyen 20'den fazla çok istikrarlı bireyden oluşuyor. Kapalı kaynak modelleri geliştirirken, algoritma ve mühendislik konularında güçlü dışarıdan insanları da sürekli çekiyoruz. Bu 20'den fazla kişi, bugün Şiqi Gelecek'in "tohumudur".

DINO serisi modellerden dünya modellerine doğru evrim yolu
AI'nin nesneleri gerçekten "görmesi" nasıl mümkün olur?
AI Teknoloji Yorumu: Var olan gizli uzay çözümlerinin “nesneleri gerçekten anlamadığını” söylüyorsunuz, sahne içindeki bağımsız nesneleri ve nesneler arasındaki ilişkileri bilmiyorlar. Bu nasıl belirleniyor? Modelin nesneleri gerçekten “anlıyor” mu, yoksa sadece “anlıyormuş gibi” mi davranıyor?
Zhang Lei: Anlama doğrudan doğrulanması zordur. Dil modellerinin dilin nasıl anlaşıldığı şu anda kimse açıklayamıyor; yalnızca davranışsal görünümler üzerinden değerlendirme yapılabilir. Sürekli metin üretiyorsa ve insanın söylediğiyle fark edilemezse, anladığını söylersiniz.
Dünya modeli benzer bir zorlukla karşı karşıya. Modelin fiziksel kuralları gerçekten anlayıp anlamadığı veya nesne yapılarını gerçekten yakalayıp yakalamadığı doğrudan açıklanması zor. Ara adımların görselleştirilmesiyle analiz yapacağız; sonuç insan intuisyonuyla uyumluysa, bu nesne yapılarını yakaladığı anlamına gelir.
AI Teknoloji Yorumu: Belirli bir test yöntemi var mı? Deney yaparak görebilir miyiz?
Zhang Lei: Evet. Karşıt gerçeklik testi, modelin farklı eylemleri denemesini ve fiziksel olarak mantıklı sonuçlar verip vermediğini görmeye yardımcı olan iyi bir yöntemdir. Eğer yörünge biraz sapsa bile doğru yapabiliyorsa, bu kuralları öğrendiği anlamına gelir; yapamıyorsa, muhtemelen sadece istatistiksel bir ilişkii öğrenmiştir.
Bu, içgörü gerektirir. Richard Sutton profesörün dediği gibi, insanlar araştırma yaparken her zaman modeli yardımcı olmak ve kendi deneyimlerini içine dökmek ister. Dil modelleri araştırmacıları bir zamanlar söz dizimi yapısını çıkarıp, kelime bölme ve ifadeleri modele beslemek isterdi, ancak sonunda "bir sonraki Token'i tahmin etmek" basit paradigmayı yendiler.
Kendim çok iyi inanıyorum bu basit paradigmayı ileriye doğru iterasyonun gücünü. Aşırı insan tasarımı, kısa vadeli etkili olur ama uzun vadede iterasyonu engeller.
AI teknoloji yorumu: Fiziksel dünyada kum akışı, su akışı, duman ve kumaş gibi sınırları net olmayan bazı zorlu nesneler var. Endişemiz, "nesne odaklı" çerçevenizin, "nesne" kavramı nedeniyle kısıtlanıp kalmaması.
Zhang Lei: Bu soruyu biz de kendimiz düşünüyoruz. Teknik açıdan en basit giriş noktası, nesne bölgelerinin piksellerini ayırarak Mask oluşturmaktır. Geçtiğimiz yıllarda görsel alan, nesne semantik anlayışı ve Mask tahmini konusunda oldukça olgunlaşmıştır; çöl, su kütleleri gibi esnek olmayan nesneler bile işlenebilir.
Bu nedenle, Mask ile başlamak pratik bir başlangıçtır. Genel nesne algılamada birikimimiz, dışarıdaki herhangi bir ekipden daha derindir.
EgoTwin: İnsanın eli, robotun elini öğretiyor
AI Teknoloji Yorumu: Teknik çerçevenizde “eylem hizalama” adında çok önemli bir kavram var; insan eli, iki parmaklı pençe, çok parmaklı zeki el gibi farklı yapıların eylemlerini aynı gizli uzaya haritalandırıyorsunuz. Biz bunu, robotlara farklı “dillerdeki” eylemleri anlama yetisi kazandırmak gibi bir çeviri işlemi olarak anlıyoruz, değil mi?
Zhang Lei: Dünya modelinin girdileri chủ yếu là hai yếu tố: khung hình (trạng thái) và hành động, do đó hành động được hiểu rất quan trọng.
Hareket hizalaması, çok cisimli problemlerin temel gereksinimidir. El ile robot kolu hizalaması daha zordur: Robot kolunun eklemlerinin fiziksel uzaydaki XYZ koordinatları kesin olarak bilinir, ancak insan eli verileri genellikle 2B videodur; insanlar pişirme videosu çeker, ancak bu videoda yalnızca iki boyutlu görüntü vardır, üç boyutlu koordinatlar yoktur. Doğrudan karıştırılması verimsizdir.
Yaptığımız işlem, 3D anahtar noktalarını çıkararak insan elinin 2D videosunu 3D uzayında bir işlem dizisine dönüştürmek ve bu veriyi robot kolu verileriyle aynı fiziksel uzayda hizalamaktır. Bu, şu anda endüstride Ego verisi (birinci şahıs perspektifinden toplanan insan operasyon verileri) olarak bilinen veri toplama ve işleme yöntemidir.
Daha önce duyurduğumuz EgoTwin, bu tür veri toplama sorunlarını çözmeyi amaçlıyor ve şu anda Baidu Cloud veri toplama ekibiyle iş birliği içindeyiz.
AI Teknoloji Yorumu: EgoTwin, "eller nasıl hareket eder" sorununu çözdü. Ancak bir soruyu daha sormak istiyoruz: İnsan videolarında "eller neden böyle hareket eder" niyetini yansıtan daha üst düzey bilgiler de gizlidir; bu kısım nasıl ele alınacak?
Zhang Lei: Daha yüksek seviyedeki eylem niyetlerini anlama konusunu, dünya modeli veya VLA modeline bırakacağız. Ancak bu, verinin kendisinin yeterince yüksek kalitede olmasına bağlıdır. Veri hammaddesi çok önemlidir. Endüstride veri toplama konusunda büyük insan kaynakları ve maliyetler harcanmış olsa da, birçok durumda veri kullanım verimliliği ideal değildir. Grounding DINO ve DINO-X çalışmalarında edindiğimiz temel deneyim, algoritmayı anlayan kişilerin veri üzerinde derinlemesine çalışmasını sağlamaktır; aksi halde toplanan veriler, eğitim sırasında tamamen kullanılamaz hale gelebilir. Algoritma ve veri iki çizgisi de paralel olarak yinelenmelidir.
Zhang Bo ve Shen Xiangyang: İki danışman, aynı temel
AI Teknoloji Yorumu: Sizin arkanzda, yapay zekanın Çinli kurucu ortaklarından biri olan Profesör Zhang Bo ve eski Microsoft Küresel İşletme Başkanı ve eski Microsoft Asya Pasifik Araştırma Enstitüsü Müdürü Profesör Shen Xiangyang’ın durduğunu gözlemledik. Birisi akademik, diğeri endüstriyel yönde; ikisinin de size ne tür etkileri olduğunu merak ediyoruz.
Zhang Lei: Prof. Zhang Bo her zaman benim hocam ve örnek aldığım kişiydi. İlk kez Prof. Zhang ile tanışmam, lisans eğitimimin başlarında Tsinghua Üniversitesi'ndeki laboratuvara girdiğim zamandı; o zamanlar laboratuvarın başkanıydı. O dönemde AGV (otomatik yönlendirme aracısı) üzerinde çalışıyordum ve serbest zamanlarımın çoğunu laboratuvarda donanımı test edip deneyler yaparak geçirdim; o dönemde Prof. Zhang'ın robotikle ilgili çalışmalar yapan doktora öğrencilerini laboratuvarda yönlendirdiğini sık sık görüyordum. Sonra şanslı bir şekilde ben de Prof. Zhang'ın doktora öğrencisi oldum. En çok hatırladığım şey, yeni teknolojilere karşı çok duyarlı olması ve güçlü bir merak sahibi olmasıydı. Deney sonuçlarını incelemek ve tartışmak için ona geldiğimde, her zaman heyecanla yanımıza oturur, "Bunu biraz değiştirip nasıl olduğunu gör" derdi. Bu şekilde kendi anlayışını da derinleştiriyordu. Bir bilim insanının algoritmaya ve sorunlara olan anlayışının tamamen merakla sürüklendiğini görebilirsiniz.
Bugüne kadar faydalı olan diğer bir nokta, "şeyleri tam olarak anlamak" gerektiğini vurgulamasıydı; anlamak yetersizse kandırılırsınız, tam olarak anladığınızda temel prensiplerin nasıl işlediğini öğrenirsiniz. Bu cümle daha sonra öğrencilerimi yönlendirirken benim kuralım haline geldi: Tam anlayış, en iyiyi hedefle.
Shen Xiangyang akademisyenin benim üzerindeki etkisi de çok büyüktü. Microsoft'ta çalışırken, o her zaman benim üst düzey yöneticimdi ve kariyerim boyunca beni etkiledi: Çin'den ABD'ye gitmemi o getirdi, ABD'den Shenzhen'e dönmemi de o ikna etti. Ayrıca, endüstri yönünde çok keskin bir yargıya sahipti ve ekip kurmadan finansmana kadar bana birçok somut öneri ve deneyim paylaştı.
AI Teknoloji Yorumu: Dinlediğimize göre, Profesör Zhang Bo 90 yaşında bile ekibinizle görüşmeye geldi? Bu durum duymakta bile bizi etkiledi.
Zhang Lei: Evet. Geçen yıl Kasım'da, Tsinghua Üniversitesi Yüksek Lisans Eğitim Dairesi, onu Shenzhen'e ders vermeye davet etti. Sabah dersini tamamladıktan sonra, öğleden sonra zamanını tamamen ekibimize ayırdı. Tam bir öğleden sonrası boyunca görüşmeler yaptık, akşam yemeğine birlikte gittik. Görüşleri çok geniş ve genel görsel anlama ile robotik yönlerimiz için birçok öneri sundu. Yaşı ilerlemiş olsa da, düşünceleri çok net, mantıksal ve sorulara derinlikle yaklaşıyor; gençlerle kıyaslandığında hiçbir açıdan geride kalmıyor.
Her dalga hayallerinizi aşar, ancak dalgalar kendiliğinden sizi arar.
AI Teknoloji Yorumu: Son yıllarda, derin öğrenmeden büyük modellere ve gövdeli ve dünya modellerine kadar her dalgada derin bir şekilde yer aldınız. Hangi anın, “Bu tam olarak yapmak istediğim şey” diye düşündürdüğünü bilmek isteriz.
Zhang Lei: Nesne tespiti çalışması, sizin bahsettiğiniz duruma çok yakındır. Bu çalışma, tüm alanın dönüm noktası yaşamasını görmemiz nedeniyle beni çok gururlandırıyor.
Sonraki dünya modeli, benim için oldukça heyecan verici ve tamamen katıldığım bir yön. Geçtiğimiz birkaç on yılda takip edilen pekiştirmeli öğrenme ile dünya modellerinin alternatif gelişimi ve dil modellerinin başarılı paradigmaları buradan esinlenilebilir. Bu yönün tüm AI endüstrisine büyük bir etki sağlayacağını düşünüyorum.
AI Teknoloji Yorumu: Araştırmacıların parlak anları sıkça anlatılır, ancak düşük noktalar nadiren konuşulur. Teknolojik bir düşük nokta yaşadınız mı?
Zhang Lei: Evet. 2018 civarında, nesne tespiti için zayıf denetimli veriler kullanmaya çalıştım; her nesne için kutu etiketlemek yerine sadece resim kategori etiketleriyle tespit yapabiliyordum. Bu yöntem çok çekici geliyordu, uzun bir süre harcadım, ancak tamamen çözemadım.
Daha sonra IDEA'da Grounding DINO'ya geçerek dil anlayışını ve algılama yeteneğini birleştirdik ve sorunu başka bir açıdan çözdük. Bu atılımın bir kısmı, DINO algılama modeli üzerindeki yeniliklerimiz sayesinde oluşturduğumuz sağlam temele dayanıyor, diğer kısmı ise dil modellerinin gelişiminden büyük ölçüde faydalandı. Grounding DINO'nun atılımı 2022 yılının sonunda, 2023 yılının başında gerçekleşti, tam ChatGPT'nin ortaya çıktığı anda. “Veri yeterince büyük olduğunda akıl doğal olarak ortaya çıkar” şeklinde bir ifade var; veri yeterince büyükse, algoritma yeterince basit olabilir.
Zorluklarla karşılaşmak normaldir, önemli olan zor sorularla başa çıkmak için kararlılık göstermektir; bir seferde çözülemiyorsa, farklı bir açıdan yaklaşın, yemek yiyin, uyuyun, sürekli onun etrafında dönmeye devam edin. Gerçekten iyi sorular, yıllarca aklınızda kalır ve bir anında doğal olarak niteliksel bir atılım ortaya çıkar.
AI Teknoloji Yorumu: Şu anda birçok genç de dünya modeli girişiminde bulunuyor, örneğin Nijizhen'in Çen Boyuan ve Ji Jiaming'i, Bai Ze Technology'in Bai Yinqi'si; hatta bunlar hala lisans öğrencileri. Bu durumu ilginç buluyoruz, siz bu “son dalgayı” nasıl görüyorsunuz?
Zhang Lei: Bu, araştırmaya girişin gerçekten daha da kolaylaştığını gösteriyor. Derin öğrenmenin yükselişinden önce, yeni girenlerin temel bilgileri kazanmak için yıllar harcaması gerekiyordu. Şimdi açık kaynak teknolojileri, teknolojiyi basitleştirerek Transformer'ı anlayarak bu alana girmeyi mümkün kılıyor. Gençlerin avantajı, yük taşımamaları ve yeni bir paradigmayı ilk prensiplerden daha kolay kabul etmeleridir. Ancak gerçek zorluklar, derin bir anlayışa, anlayışa ve yönü kontrol etme yeteneğine sahip deneyimli araştırmacılar tarafından çözülebilir.
Sosyal trendler her zaman değişir, ancak sadece trendi takip etmek için takip ederseniz, onu yakalayamazsınız. Asıl mesele şudur: Yöntem ne kadar değişirse değişsin, her ekip her zaman en yetenekli kişilere ihtiyaç duyar. Sadece öğrenmeye devam edin ve temel bilgilerinizi sağlam tutun, en önde giden alanlar sizin için kendiliğinden ortaya çıkacaktır.
Bir ilham
Bu röportajda bizi en çok etkileyen, Zhang Lei'nin parlak teknik başarıları değil, hatta onun yetiştirdiği bu genç yetenekler değil—stajyer Huang Zheng, Li Xuelong ve Microsoft'un ilk yüz tanıma algoritması projesindeki ekip üyeleri Zhu Long, Xiao Rong ve Yan Shuicheng.
Bizi en çok etkileyen, sürekli kullandığı bir kelimeydi: “tam olarak anlama”.
Bu kelimeyi, Zhang Lei otuz yıl boyunca not etti.
1990'ların başlarında Tsinghua kampüsü, yapay zeka hâlâ kimse tarafından dikkate alınmayan bir disiplindi; Zhang Lei, bilgisayar mühendisliği bölümünde bir AGV aracını deneyen bir lisans öğrencisiydi. O dönemde laboratuvar müdürü, doktora öğrencilerine robotikle ilgili çalışmalar yapmalarını önermişti ve bu, Zhang Lei'yi derin bir şekilde etkilemişti; daha sonra o da aynı hocanın öğrencisi olmuştur.
Laboratuvar müdürü Zhang Bo'dur, Çin yapay zekânın kurucularından biri. Zhang Lei her zaman deney sonuçlarını birlikte görmek için onu davet ettiğinde, o her zaman Zhang Lei'nin yanına heyecanla oturur, ekranı bir süre izler, parmağını uzatır: "Bunu biraz değiştir, nasıl olacağını gör." Ödev kontrolü değil, parametreleri değiştirdikten sonra ne olacağını gerçekten merak eder.
Zhang Bo, Zhang Lei'ye öğrettiklerini üç kelimeye indirgedi: "Tam olarak anla."
Anlamazsan aldatılırsın, anlarsan temel prensiplerin nasıl işlediğini görürsün.
Çin'in bir nesli, bu küçük detaylar aracılığıyla bilimsel çalışma ruhunu aktarıyor.
2018 yılında, Zhang Lei, Microsoft'ta zayıf denetimli nesne tespiti üzerinde çalıştı, başaramadı ve konuyu değiştirmedi.
Bu turu başarıyla tamamlayamazsan, farklı bir açıdan yaklaş, yemek yemek ve uyumak bile onun etrafında dönsün.
Bu mecaz değil, onun günlük yaşamı.
Daha sonra IDEA'ya giderek Grounding DINO'yu yaptı ve sorunu başka bir açıdan çözdü. Çığır açan an, 2022 yılının sonunda ChatGPT'nin ortaya çıkışıydı—dil modellerinin yetenekleri yükseldi, veri yeterince büyük oldu.
Zhang Lei, "doğal olarak ortaya çıkmak" şeklinde bir tanımlama kullandı.
AGV aracının parametrelerini değiştirmekten dünya modelini çözmeye kadar otuz yıl geçti. Bu otuz yıl içinde, büyük ölçekli görüntü aramasından genel görsel anlama kadar her soruyu derinlemesine anlayıp en iyi şekilde çözmeyi hedefledi ve nihayetinde “robotlar için dünya modeli oluşturmak” yönüne geri döndü.正如乔布斯所说的“connect the dots”——每一件认真做过的事情,都不会白费。
2025 yılının sonunda, 90 yaşındaki Zhang Bo, Shenzhen'e gelip ders verdi. Sabah dersi bitirdikten sonra, öğleden sonra hemen ShiQi Weilai ofisine gitti. Yedi sekiz genç, onu çevreledi ve o, bütün öğleden sonra boyunca konuştu, akşam yemeğinde çocukluk yıllarını ve bu yöndeki görüşlerini anlattı. Düşünceleri net, mantığı sıkıydı ve gençlerle hiçbir farkı yoktu. Zhang Lei, öğretmenine yaptığı işleri de anlattı.

Zhang Bo akademisyeni, Geleceği Görme etkinliğinde; Zhang Lei, hocasına araştırma ilerlemesini anlatıyor.
Otuz yıl önce, Tsinghua bahçesinde, öğretmen öğrenciyanında oturup şunu dedi: Bunun bir kısmını değiştir, nasıl olacağını gör.
Otuz yıl sonra, Şenzen ofisi, öğrenci 90 yaşındaki hocasına yaptığı dünya modelini anlatıyor.
Bu ne kadar duygusal bir sahne yeniden canlandırması.
İnsanlar yaşlanır, gelgit çekilir, popülerlik soğur, ancak Çinli bilimsel araştırmacıların her bir dünya sorununu "tamamen anlama" isteği asla değişmedi. LeiFeng.com
