Setelah memulai perniagaan, Wang Yunhe telah menghantar hasil model besar pertamanya.
Quantum Bit melaporkan, bekas ketua Laboratorium Noah's Ark Huawei, Pangu Large Model Yuan Yuan Dongdong, yang ditubuhkan oleh Pengurus Utama Wang Yunhe, melancarkan model Agent-Native pertama, NeoHorse.
Model ini disokong oleh infrastruktur dasar dan kemampuan teknologi optimasi Infra dari Wuwen Xinqiong, dengan penyertaan pasukan dari Universiti Tsinghua dan Universiti Peking dalam penyelidikan algoritma dan kaedah latihan, secara bersama-sama mengkaji peningkatan kecekapan penggunaan data dan kesan latihan selepas latihan Agent.
NeoHorse-1 menyediakan dua versi, 4B dan 9B, yang secara khusus dirancang untuk sekumpulan kemampuan yang diperlukan semasa proses Agent, termasuk memanggil alat, membaca maklum balas persekitaran, mengenal pasti ralat, menyesuaikan laluan, dan akhirnya menyelesaikan tugas.

Dalam 10 penilaian yang meliputi Harness Agent, penggunaan alat, kod, dan kepatuhan arahan, selepas Agentic Post-Training, prestasi keseluruhan model 4B telah mencapai/lebih sedikit melebihi model asas 9B.

Sebuah syarikat yang selalu menekankan kerjasama model pelbagai, mengapa pula mulai melatih model sendiri? Primer Rhythm bersedia untuk menyertai meja model asas?
Dari jawapan NeoHorse, arah tidak berubah seperti itu.
Model ini lebih menyerupai pengalaman pelaksanaan model berganda yang telah dikumpulkan oleh Primitive Rhythm, dan pertama kalinya dimasukkan ke dalam parameter model.
Syarikat yang membantu agen memilih model juga telah memulakan latihan model.
Sejak dulu, skor sering menjadi ukuran utama untuk membandingkan model.
Namun, apabila model mula dimasukkan ke dalam sistem Agen dan menangani tugas penuh, keupayaan penjelasan skor tunggal akan berkurang.
Dalam satu tugas, model tidak hanya perlu memberikan jawapan yang kelihatan munasabah, tetapi juga perlu membaca umpan balik persekitaran secara berterusan, mengendalikan ralat, dan menyesuaikan laluan seterusnya berdasarkan kemajuan sebenar; keperluan terhadap kemampuan model berbeza di setiap peringkat.
Dari sini, pasukan Primordial Rhythm membentuk satu penilaian.
Ketidaknormalan model akan menjadi struktur yang berterusan dalam industri AI.
Semakin banyak model dan semakin terperinci pembahagian tugas, semakin jelas perbezaan harga dan kemampuan, semakin diperlukan satu sistem untuk menjawab beberapa soalan—
Langkah ini sepatutnya menggunakan model yang mana? Bahagian mana yang boleh diserahkan kepada model yang lebih murah? Kapan perlu naikkan ke model dengan kemampuan inferens dan pelaksanaan yang lebih kuat? Selepas satu laluan pelaksanaan terhenti, siapa yang sepatutnya mengambil alih? Bolehkah beberapa model memberikan cadangan secara serentak, kemudian menggabungkan hasilnya?
Pasukan Wang Yunhe menyebut sistem lapisan ini sebagai Routing Harness (projek sumber terbuka terkaitnya, OpenSquilla, telah mengintegrasikan pelbagai model, melalui antaramuka seragam, untuk routing halus, pertukaran model, dan kerjasama pelbagai model semasa pengoperasian Agent).

Demikian juga, berdasarkan pemikiran ini, Primordial Rhythm tampaknya tidak mempunyai alasan yang kuat untuk melatih model sendiri. Pasar sudah menyediakan cukup banyak model yang beragam, dan memanggil model mengikut keperluan kelihatan lebih fleksibel.
Seiring sistem penjadualan terus beroperasi, kelas aset lain mulai terkumpul, seperti "tugasan apakah yang memerlukan kemampuan apa", "pada langkah manakah model mudah gagal", "jalan pembaikan macam apa yang berkesan", dan "hasil macam apa yang boleh lulus pengesahan persekitaran".
Maklumat ini, di satu sisi, boleh meningkatkan penilaian laluan, dan di sisi lain, mulai memiliki nilai latihan.
Ini agak seperti platform yang menghubungkan banyak merek dengan pengguna. Permintaan, ulasan, dan umpan balik penggunaan yang terkumpul semasa transaksi boleh membantu produk mencari pengguna yang lebih sesuai, serta memberikan umpan balik lanjutan kepada pembangunan produk.
Proses pasaran perkhidmatan platform ini menjadi sumber data untuk peningkatan produk seterusnya.
NeoHorse bertanggung jawab untuk mengubah sebahagian pengalaman pelaksanaan yang telah dikumpulkan dalam Harness menjadi kemampuan model.
Latih model Agent-Native dengan pengalaman yang dilalui oleh model pelbagai.
Sumber data NeoHorse patut diperhatikan.
Bahan intinya adalah menggabungkan isyarat pelaksanaan Agent yang dihasilkan oleh Routing Harness dengan data awam, untuk membina sistem data yang ditujukan kepada latihan selepas Agent.
Agen akan meninggalkan rekod pelaksanaan yang lengkap setelah menyelesaikan satu tugas di Harness.
- Masukkan tugas → Router menilai keperluan kemampuan apa
- → Pilih satu model
- Model melakukan inferens dan panggilan alat
- → Hasil semula persekitaran
- → Model meneruskan pelaksanaan atau berlaku ralat
- → Sistem beralih model atau menyesuaikan laluan
- → Tugasan selesai atau gagal
Data soalan biasa sering berfokus pada kedua-dua "soalan" dan "jawapan".
Data Routing Harness juga mengandungi beberapa lapisan maklumat tambahan: keupayaan apa yang diperlukan oleh tugas, keputusan pelaksanaan apa yang diambil oleh sistem, dan umpan balik apa yang diberikan oleh persekitaran pada akhirnya.
Sebagai contoh, router awalnya menilai tugas tertentu hanya memerlukan model biasa, tetapi setelah kegagalan berterusan semasa pelaksanaan, ia dinaikkan ke model yang lebih berkuasa, dan tugas tersebut baru dapat diselesaikan.
Jalur ini mengandungi maklumat yang jauh lebih banyak daripada satu kegagalan.
Sistem dapat mengetahui bahawa penilaian kemampuan awal mungkin terlalu rendah, model mengalami masalah pada langkah mana, model yang lebih kuat menggunakan strategi apa, lintasan pelaksanaan mana yang berjaya lulus pengesahan persekitaran, serta berapa banyak Token dan masa yang digunakan secara tambahan untuk menyelesaikan tugas.

Lebih penting lagi, gerakan primitif yang diperhatikan bukanlah penilaian satu model terhadap kemampuannya sendiri, tetapi perbandingan mendatar yang ditinggalkan oleh beberapa model ketika menghadapi tugas yang serupa.
Terdapat rekod pelaksanaan yang berjaya, serta yang gagal di tengah jalan dan kemudian diambil alih oleh model lain.
Dari sudut pandang latihan, trajektori kegagalan bahkan mungkin memberikan maklumat yang lebih banyak.
Jawapan akhir dapat memberitahu model satu laluan yang boleh dilaksanakan, manakala proses kegagalan dan pembaikan menambahkan dua jenis pengetahuan lain, iaitu di mana kesilapan mudah berlaku dan bagaimana menyesuaikan selepas kesilapan berlaku.
Selain hasil yang diberikan oleh beberapa model, juga termasuk laluan sebenar yang dilalui oleh beberapa model dalam persekitaran tugas, ini juga merupakan satu ciri yang menjadikan NeoHorse mudah dikenali.
Bagaimana log kerja agen menjadi kemampuan model?
Memasukkan semua log ke dalam latihan tidak akan secara semula jadi menghasilkan model Agent yang lebih kuat.
Jejak agen biasanya panjang, mengandungi petunjuk sistem, permintaan pengguna, parameter alat, hasil pelaksanaan, percubaan berulang, maklumat ralat, dan banyak output sederhana.
Beberapa langkah memiliki nilai latihan, beberapa lagi lebih dekat kepada bunyi bising. Ada juga alur trajektori yang lengkap, tetapi hasilnya sendiri tidak betul.
Prinsip ritmik pertama-tama perlu menyelesaikan soal "data mana yang patut dipelajari oleh model".
Berdasarkan laporan teknikal, setiap trajektori akan melalui pemeriksaan struktur untuk mengesahkan kesesuaian antara permintaan, respons model, panggilan alat, dan hasil persekitaran.
Seterusnya, sistem akan menilai kualiti pelaksanaan dari enam dimensi, termasuk sama ada objektif pengguna telah dicapai, sama ada arahan dipatuhi, penggunaan alat adalah munasabah, kesimpulan disokong oleh bukti, kemampuan untuk pulih selepas berlakunya ralat, serta sama ada model menghentikan tugas pada masa yang sesuai.
Di sini juga melibatkan masalah yang sering dicampurkan dalam latihan Agen.
Penyelesaian tugas tidak bermakna tujuan pengguna telah dipenuhi—keluaran model yang menyatakan “tugas telah selesai” hanya menunjukkan bahawa proses pelaksanaan telah berhenti, tetapi tidak membuktikan bahawa hasil yang diserahkan memenuhi keperluan pengguna.
Oleh itu, status penyelesaian, tahap pemenuhan matlamat, bukti persekitaran, dan umpan balik pengguna perlu direkodkan sebagai isyarat yang berbeza.
Selepas data disaring, isyarat laluan mula memainkan peranan lain.
Ruter akan menganggarkan kemampuan yang diperlukan untuk tugas tersebut dan membentuk isyarat dalam pelbagai peringkat kemampuan. NeoHorse mengatur urutan sampel semasa latihan, memulakan dengan tugas yang memerlukan kemampuan lebih rendah, kemudian secara beransur-ansur meningkatkan trajektori pelaksanaan yang lebih kompleks, sambil mengekalkan cakupan tugas asas.
Kaedah ini dikenali sebagai Routing-Guided Curriculum, iaitu pembelajaran kurikulum yang dipandu oleh penerusan.
Dengan cara yang lebih mudah difahami, isyarat laluan menentukan secara dalam talian tugas siapa yang perlu dilaksanakan, dan pada peringkat latihan, ia juga boleh memberitahu model tugas mana yang lebih sesuai dipelajari lebih awal dan tugas mana yang lebih sesuai dipelajari kemudian.

Selain penyesuaian halus pengawasan biasa, NeoHorse juga menggunakan Penyulingan On-Policy.
Boleh difahami sebagai membiarkan pelajar menyelesaikan soalan mengikut cara mereka sendiri, kemudian guru memberikan panduan berdasarkan langkah yang sebenarnya diambil oleh pelajar.
Dengan cara ini, model guru menangani masalah yang akan dihadapi oleh model pelajar dalam taburan semasa, bukan sekumpulan kesalahan standard yang telah disediakan sebelumnya.

Selepas melalui peringkat-peringkat ini, pengalaman yang dikumpulkan daripada tugas jangka panjang model ganda mulai digunakan untuk pasca-pelatihan NeoHorse.
After post-training, what is improved?
Berdasarkan hasil laporan teknikal semasa, Agentic Post-Training membawa peningkatan stabil pada kedua-dua skala 4B dan 9B.
Di antaranya, prestasi komprehensif NeoHorse-1-4B (skor purata makro meningkat dari 58.94 kepada 64.87) telah mencapai SOTA pada skala yang sama—melebihi model asalnya Qwen3.5-4B pada semua benchmark yang boleh dibandingkan, serta memimpin secara komprehensif di kalangan model seukuran 4B.

Namun, SOTA tidak bermaksud bahawa kemampuan tersebar secara seragam.
Dengan melihat hasil pembahagian lebih lanjut, peningkatan model 4B terutama berfokus pada satu kelas tugas.
Tugas-tugas semacam ini biasanya mempunyai alur kerja yang相对 jelas, maklum balas persekitaran boleh diperhatikan, kejayaan dan kegagalan boleh diverifikasi, dan standard penghantaran akhir juga cukup jelas.
Sebagai contoh, dalam tugasan jadual projek, model asas walaupun telah menemui fail dalam direktori kerja, tidak meneruskan membaca e-mel yang mengandungi sekatan kebergantungan terkini.
Akibatnya, ia menghasilkan rancangan berdasarkan maklumat yang telah tamat tempoh dan menulis fail ke lokasi yang salah.
Model yang telah menjalani latihan tambahan akan terus membaca bukti baru, mengesan perubahan pada sekatan, mengira semula jadual, mengesahkan hasil, kemudian menyimpan hantarannya ke lokasi yang betul.
Perbezaan antara keduanya terlihat pada rantai pelaksanaan Agen.
Satu model secara kasar mengetahui bagaimana tugas seharusnya dilakukan, manakala model lain telah mampu menggabungkan pengambilan bukti, pembaharuan sekatan, pelaksanaan, pengesahan, dan penghantaran menjadi alur kerja yang lebih lengkap.
Mencapai SOTA pada skala yang sama tidak bermaksud agar NeoHorse-1-4B mengambil alih semua tugas. Primitif Rhythmic lebih memperhatikan bagaimana membahagikan sempadan kemampuan model yang berbeza dengan tepat.
Tugas yang boleh diselesaikan secara stabil oleh model 4B boleh mengurangkan keperluan untuk memanggil model yang lebih besar; tugas yang boleh diselesaikan oleh model yang lebih kuat tidak perlu terus dinaikkan ke model unggul termahal; apabila kekompleksan terus meningkat, tugas tersebut akan diserahkan kepada model yang lebih kuat dalam kolam model.
Di sini secara tepat menghubungkan hubungan antara Routing Harness dan model buatan sendiri.
Model terus memperluas julat kos tugas yang boleh ditanggung, sementara sistem penghalaan menempatkan kemampuan yang berbeza mengikut kesukaran dan prestasi tugas.

Selain caj panggilan API, apakah nilai lain yang dimiliki model ini?
Dengan ini, hubungan antara beberapa garis produk Primitif Rhythm juga menjadi lebih jelas.
Tingkat pertama ialah OpenSquilla versi sumber terbuka.
Dengan produk percuma, sumber terbuka, pelaksanaan tempatan dan desktop, Primitives Rhythm mengurangkan halangan pengembang dalam menggunakan Agent model pelbagai, sambil menghubungkan pengembang dengan pintu masuk tugas.
Tingkat kedua ialah TokenRhythm API.
Ia berposisi sebagai "OpenRouter versi China", yang menyediakan kemampuan pemanggilan pelbagai model melalui antaramuka seragam, memenuhi keperluan pengembang dan perusahaan dalam penggunaan model, serta membantu pembuat model menghubungkan lebih banyak skenario penggunaan.
Perusahaan tidak perlu menyesuaikan antarmuka model secara terpisah untuk banyak model, sehingga lebih mudah untuk menilai, memilih, dan beralih antar model.
Tingkat ketiga adalah perkhidmatan dan kemampuan pelaksanaan yang ditujukan kepada perusahaan.
Industri seperti kewangan dan pembuatan mempunyai keperluan yang berbeza terhadap kebenaran,kestabilan, penghantaran peribadi dan jaminan perkhidmatan, yang seterusnya mencipta ruang perniagaan yang lebih lanjut.
Tingkat keempat ialah NeoHorse.
NeoHorse pertama kali mengesahkan satu sambungan penting: pengalaman berkesan yang dihasilkan semasa pelaksanaan Harness, selepas disaring dan dilatih, memang mempunyai potensi untuk ditukar menjadi kemampuan model itu sendiri.
Dari sini, roda perniagaan yang sebelumnya dicadangkan oleh Primordial Rhythm muncul hasil pertama kali pada aras model.
Ini juga membuka kemungkinan untuk mengoptimumkan perhitungan ekonomi inferensial.
Jika NeoHorse berjaya menerima secara stabil sekumpulan tugas Agent yang frekuensinya tinggi dan standardnya jelas, platform akan memperoleh satu lagi sumber tenaga yang boleh dijadualkan secara bebas.
Tugasan-tugasan ini boleh dioptimakan lagi dari segi kos inferens, kelajuan respons, dan kestabilan, serta memberikan fleksibiliti yang lebih besar dalam konfigurasi penyediaan model. Seiring dengan iterasi berterusan model, lingkungan tugasan yang boleh dicakupi masih memiliki ruang untuk diperluaskan.
Dari sudut pandang ini, apa yang ingin dicapai oleh Primordial Rhythm agak mirip dengan akumulasi proses dalam sistem pembuatan.
Ekosistem model luaran menyediakan kemampuan yang berbeza, dan Harness bertanggungjawab mengatur pelaksanaan; pengalaman yang terbentuk semasa pelaksanaan akan dimasukkan ke dalam peningkatan model seterusnya.
Dari menghubungkan model, menyediakan perkhidmatan, hingga menukar pengalaman yang dihasilkan daripada perkhidmatan tersebut menjadi kemampuan model, serta memperbaiki kecekapan dan kualiti lebih lanjut, ini juga merupakan langkah tambahan yang diambil oleh Primordial Rhythm selain daripada platform pengumpulan API.
Selain model, apa yang dibina oleh primitif ritme?
Siklus dalam konsep Primitif Rhythm boleh dihubungkan melalui beberapa garis perniagaan:
- Routing Harness menghubungkan pembangun dengan tugas Agent
- → Model penyediaan dan permintaan panggilan API TokenRhythm
- → Dilaksanakan oleh organisasi Harness, kumpulkan rute dan jejak tugas
- Jejak yang boleh digunakan telah disaring untuk latihan model
- → Model yang dikemas semula mengembalikan Harness, terlibat dalam tugas penyesuaian
- → Perbaiki pengalaman tugas, jelajahi kelajuan respons dan kecekapan kos yang lebih baik
- → Penggunaan berterusan, peningkatan pembayaran dan kecekapan pengurusan
- → Menyokong penyempurnaan perkhidmatan dan pengeluaran rintisan seterusnya
Salah satu perubahan utama ialah, trajektori yang dihasilkan oleh model tidak lagi hanya berhenti pada peringkat penggunaan dan pemanggilan, tetapi juga boleh menjadi sumber untuk latihan model seterusnya.
Semasa agen menyelesaikan satu tugas, Harness mendapat satu pemerhatian tambahan mengenai sempadan kemampuan.
Satu model gagal, sistem mengetahui di mana kekurangan kemampuan mungkin berlaku; model lain berjaya mengambil alih, dan sistem mendapat satu laluan pembaikan baru; pengguna akhirnya menerima atau menolak hasil tersebut, memberikan umpan balik luaran tambahan.
Semakin banyak tugas yang dikumpulkan, semakin tepat penilaian rute; setelah penilaian rute menjadi lebih tepat, trajektori latihan yang dipilih juga akan lebih mendekati tugas sebenarnya; apabila model menjadi lebih sesuai dengan tugas, perkhidmatan API akan memperoleh peluang untuk meningkatkan kos dan pengalaman.
Jika kitaran ini boleh berterusan dalam jangka panjang, perbezaan antara prinsip getaran dan platform pengumpulan API biasa juga akan secara beransur-ansur memasuki reka bentuk tugas latihan, kaedah latihan, dan parameter model.
Akhirnya ditunjukkan melalui prestasi produk.
Berapa jauh lagi ke RSI?
Di atas adalah latar belakang ketika Primal Rhythm mulai membincangkan RSI (Recursive Self-Improvement, Peningkatan Diri Berulang).
Primal Rhythm kini mengesahkan julat RSI yang lebih dekat kepada satu lingkaran kejuruteraan, yang boleh dibahagikan kepada dua bahagian.
Yang pertama ialah Data-RSI.
Model terus menjalankan tugas di Harness, dan setiap penerusan, panggilan alat, pemulihan kegagalan, serta hasil akhir akan menghasilkan rekod terstruktur baru.
Setelah rekod-rekod ini disaring dan diproses, ia boleh dimasukkan ke dalam kolam data latihan seterusnya. Oleh itu, data latihan tidak perlu bergantung sepenuhnya pada persediaan manual sebelumnya, dan boleh bertambah seiring penggunaan sistem yang berterusan.
Yang kedua ialah Model-RSI.
Sistem mengenal pasti kelemahan kemampuan model semasa berdasarkan keputusan penilaian, menyesuaikan taburan data latihan untuk sesi seterusnya, memperbaharui model, kemudian memasukkan semula model baharu ke dalam Harness untuk dilaksanakan.
Dengan kata lain, model belajar daripada pengalaman pelaksanaan, dan model yang telah dikemaskini pula melaksanakan tugas baru untuk menghasilkan maklum balas baru bagi latihan seterusnya.

Namun, berdasarkan maklumat awam yang ada pada NeoHorse saat ini, sistem ini belum boleh dianggap sebagai RSI yang lengkap.
Laporan teknikal semasa ini mengesahkan satu gelung tertutup "pelaksanaan-penilaian-pemilihan-perbaharui". Reka bentuk isyarat, reka bentuk ganjaran, dan proses latihan masih ditetapkan oleh manusia, dan kestabilan keuntungan berterusan selepas beberapa generasi iterasi model perlu disahkan melalui lebih banyak eksperimen.
Oleh itu, pernyataan yang lebih tepat ialah, pelancaran kali ini oleh NeoHorse telah menyelesaikan dua lapisan pengesahan.
Lapisan pertama adalah dari segi perniagaan, data yang dikumpulkan oleh sistem boleh dimasukkan ke dalam latihan model dan ditukar menjadi peningkatan kemampuan yang boleh diukur.
Lapisan lain adalah secara teknikal, Wang Yunhe memimpin pasukan usahawan menyelesaikan satu ujian kejuruteraan berfokus pada arah RSI.
Semakin banyak model, semakin bernilai syarikat ini?
Of course, for the story of primal rhythm to hold true, several hurdles still need to be overcome.
Pertama, adakah ekosistem sumber terbuka mampu berterusan ditukar kepada penggunaan API dan pendapatan.
Kedua, apakah sistem dapat terus memperoleh trajektori Agen yang berkualiti tinggi dan mencukupi untuk latihan seiring dengan peningkatan jenis tugas.
Ketiga, selepas kemampuan model diperbaiki, adakah ia boleh ditukar secara stabil kepada pengalaman tugas dan kecekapan pelaksanaan yang lebih baik, serta direkodkan dalam data perniagaan.
Keempat, selepas beberapa iterasi model, berapa lama peningkatan kemampuan akan berterusan.
Semua soalan ini memerlukan pemerhatian yang lebih lama.
Dan masih ada satu pemboleh ubah yang tidak boleh dielakkan— DeepSeek 、Qwen、 MiniMax Pembuat model juga sedang meluaskan ke produk Harness dan Agent, dan tren integrasi tegak lurus antara model dan infrastruktur Agent semakin jelas.
Sebagai contoh Primal Rhythm, salah satu perbezaan yang dimiliki syarikat ini ialah model-neutral dan data perbandingan mendatar yang terbentuk semasa pelaksanaan merentas model.
Namun, jika perbezaan kemampuan antara model cukup besar, penjadualan antara model berpeluang menjadi perniagaan yang berdiri sendiri; jika model terkemuka secara beransur-ansur merangkumi lebih banyak tugas, atau pengeluar menggabungkan Routing, panggilan alat, dan kerangka Agent secara bersama-sama, ruang yang tinggal untuk lapisan tengah akan dikurangkan.
Ketika kemampuan hulu semakin kuat dan semakin murah, mengapa lapisan tengah masih diperlukan?
Bagi Primitif Rhythm, NeoHorse sekurang-kurangnya membawa satu sudut pandangan baru kepada masalah ini.
Dahulu ia membuktikan bahawa ia boleh "menggunakan model", kini ia mulai mencuba membuktikan bahawa data yang terkumpul daripada penggunaan jangka panjang model juga boleh membentuk kemampuan modelnya sendiri.
Jika jalan ini berjaya, parit pertahanan Primordial Rhythm tidak akan hanya berada pada strategi penerusan; jika ia gagal, ia masih akan menghadapi semua masalah yang dihadapi oleh lapisan tengah model.
GitHub: https://github.com/TokenRhythm/NeoHorse
Peluk muka: https://huggingface.co/collections/TokenRhythm/neohorse-1
Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: Heng Yu
