Bolehkah AI belajar apa yang perlu dioptimaskan daripada contoh, bukan sekadar menirunya? Penyempurnaan yang diawasi (SFT) mengajar model dengan memintanya meniru jawapan pakar. Sebuah kertas kerja baru memperkenalkan PARED, satu kaedah selarasan yang cuba mengekstrak ganjaran yang boleh digunakan semula daripada demonstrasi yang sama itu. PARED membandingkan jawapan pakar dengan respons model sendiri berdasarkan ciri-ciri tertentu seperti kebergunaan, ketiadaan bahaya, dan topik. Ia menggunakan perbezaan-perbezaan ini untuk mempelajari ganjaran eksplisit, yang kemudian memandu pembelajaran penguatan tambahan selepas SFT. Menggunakan 4,000 demonstrasi yang dihasilkan oleh GPT-5.1, respons daripada model yang dilatih dengan PARED lebih disukai berbanding respons daripada checkpoint SFT asal dalam 86.2% dan 88.4% perbandingan tidak seimbang di bawah dua pendekatan pengemasan ganjaran, seperti dinilai oleh Gemini 2.5 Flash. Demonstrasi boleh menjadi berguna bukan sahaja untuk peniruan, tetapi juga untuk mentakrifkan objektif yang terus dipelajari model selepas SFT.
MintyKongsi

Sumber:Tunjukkan artikel asal
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini.
Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.
