Meta dan Universiti Illinois Membangunkan EvoHarness-RL, Meningkatkan Kadar Kejayaan Agen AI kepada 96.9%

iconCryptoBriefing
Kongsi
AI summary iconRingkasan
Penyelidik dari Meta dan Universiti Illinois mengembangkan EvoHarness-RL, lapisan runtime yang berevolusi sendiri untuk agen AI. Sistem ini mencapai kadar kejayaan 96.9% pada tolok piawai, meningkat dari 47.9% tanpanya. Kerangka kerja ini menggunakan keadaan luaran yang terstruktur berupa Kepercayaan, Kemajuan, dan Pengalaman (BPE) untuk menangani tugas-tugas kompleks. Ia menunjukkan tingkah laku muncul seperti penjernihan harness dan evolusi. Kemajuan ini boleh memberi kesan kepada usaha CFT dan meningkatkan likuiditi di pasaran kripto.

Penyelidik dari Meta AI dan Universiti Illinois Urbana-Champaign telah menerbitkan satu kertas kerja baharu yang memperkenalkan EvoHarness-RL, satu lapisan koordinasi yang boleh dilatih yang membolehkan agen model bahasa besar mencipta, mengakses, dan menguruskan keadaan luaran mereka sendiri. Hasilnya: kadar kejayaan 96.9% pada tolok piawai standard, meningkat daripada 47.9% untuk model asas yang berjalan tanpanya.

Apa yang sebenarnya dilakukan oleh EvoHarness-RL

Agen LLM mempunyai jendela konteks yang terhad. Apabila tugas melibatkan banyak langkah, termasuk sambungan API dinamik, log pelayan, submatlamat yang tertunda, dan pemulihan ralat, ingatan dalaman model tidak mencukupi. Ia memerlukan kerangka luaran untuk mengikuti apa yang diyakininya tentang dunia, kemajuan yang telah dibuat, dan apa yang dipelajari daripada kesilapan lampau.

Rangka kerja ini memperkenalkan keadaan luaran yang terstruktur yang dibina berdasarkan tiga komponen: Keyakinan, Kemajuan, dan Pengalaman, yang secara kolektif dipanggil BPE. Keyakinan menangkap pemahaman semasa agen terhadap persekitarannya. Kemajuan mengesan submatlamat yang telah selesai dan yang masih tertunggak supaya agen tidak melangkau langkah atau mengulangi kerja. Pengalaman menyimpan pelajaran daripada kesilapan, seperti pangkalan data yang menolak satu batch disebabkan had kadar API, supaya agen boleh menyesuaikan pendekatannya.

Latihan berlaku dalam dua peringkat. Pertama, penyesuaian berteraskan pengawasan menggunakan demonstrasi pakar mengajar model bagaimana berinteraksi dengan harness. Kemudian, teknik pengoptimuman yang peka kos dipanggil Group Relative Policy Optimization, atau GRPO, menyempurnakan tingkah laku agen untuk menyeimbangkan prestasi tugas terhadap kos komputasi panggilan harness.

Iklan

Penyelidik menguji pendekatan mereka menggunakan model Qwen3-8B di ALFWorld, satu tolok ukur untuk AI berbadan yang memerlukan agen untuk menyelesaikan tugas-tugas rumah tangga melalui beberapa langkah. Kadar kejayaan 96.9% dalam persekitaran yang sudah dikenali sudah menakjubkan, tetapi mungkin lebih bermakna ialah kadar kejayaan 86.6% dalam persekitaran yang tidak pernah dilihat sebelumnya.

Dua tingkah laku yang tidak diprogram secara eksplisit oleh penyelidik

Kertas tersebut menonjolkan dua fenomena muncul yang muncul semasa latihan, yang mana kedua-duanya tidak direkabentuk secara langsung.

Yang pertama ialah “pemanasan harness.” Seiring masa, agen mulai menginternalisasi operasi harness rutin, mengurangkan seberapa kerap ia perlu merujuk keadaan luaran. Panggilan harness berkurang bukan kerana sistem memburuk, tetapi kerana model telah menyerap pola-pola tersebut.

Yang kedua ialah “memanfaatkan evolusi.” Semasa agen dilatih, ia belajar untuk mampat dan menyusun semula keadaan luarannya ke dalam format yang lebih ringkas dan sesuai untuk jenis tugas tertentu. Representasi BPE menjadi lebih ringkas dan lebih khusus tanpa sebarang campur tangan manusia dalam reka bentuknya.

Membina atas kerja sebelumnya

EvoHarness-RL membina atas Meta-Harness, satu projek awal pada Mac 2026 yang berfokus pada mengoptimumkan kod harness melalui teknik carian agen. Di mana Meta-Harness memperlakukan harness sebagai kod yang perlu diperbaiki melalui carian, EvoHarness-RL memperlakukan keseluruhan lapisan koordinasi sebagai sesuatu yang boleh dipelajari, dibina, dan disempurnakan oleh model itu sendiri.

Kertas itu juga melaporkan peningkatan berbanding kerangka agen sedia ada seperti SkillOS dan SkillRL, terutamanya pada tugas-tugas yang tidak dikenali. Kesenjangan antara prestasi pada persekitaran yang dikenali berbanding persekitaran baharu adalah kira-kira 10 peratus untuk EvoHarness-RL, berbanding penurunan yang jauh lebih besar bagi pendekatan pesaing.

Apa yang bermaksud ini terhadap pelaksanaan AI perusahaan

Kadar kejayaan yang melonjak daripada kira-kira 48% kepada 97% dalam persekitaran terkawal bukanlah peningkatan kecil. Kadar generalisasi 86.6% juga penting, kerana tugas perusahaan dunia nyata jarang terlihat persis seperti data latihan.

Pengoptimuman yang peka terhadap kos yang dibina ke dalam peringkat latihan GRPO juga menangani kebimbangan praktikal. Panggilan harness luaran bukanlah percuma. Ia menghabiskan pengiraan dan menambah latensi. Dengan melatih agen untuk meminimumkan panggilan yang tidak perlu melalui penyejukan harness, kerangka kerja menjadi lebih cekap dari masa ke masa tanpa mengorbankan ketepatan.

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.