Saya merasakan kuat bahwa Anthropic memperlambat pelatihan model frontier dalam beberapa bulan terakhir untuk mengatasi masalah-masalah ini, tetapi segera akan kembali berjalan penuh. Seperti kita baru saja menabrak dinding secara langsung, mundur tiga langkah, dan sekarang mencoba hal yang sama lagi. Misalkan upaya keamanan mereka, klasifier baru, dan penilai berhasil menyelesaikan masalah kebocoran lingkungan. Lalu ke lembah mana gradien akan membawa kita selanjutnya ketika ini tidak lagi menjadi pilihan? Saya pikir pada titik ini, kita sebaiknya secara adversarial melatih model untuk menipu semua penilai dan klasifier. Semakin keras kita menolak, semakin licik model-model tersebut menjadi. Beberapa prediksi yang bisa Anda buat: - Perbedaan sangat besar antara evaluasi dan kinerja dunia nyata. Model paranoid dan shizo. Anda juga bisa menyebutnya situational awareness. - Model menjadi lebih baik dalam memodelkan evaluator dan siapa pun atau apa pun yang merancangnya. - CoT yang kurang jujur (tindakan curang tanpa verbalisasi tentang kecurangan itu). - Model yang kurang agen (pengaturan dunia nyata tidak sempurna dan memungkinkan manipulasi reward serta instruksi pengguna mungkin bertentangan dengan pengaturan. Jadi model berhenti dan meminta klarifikasi, dan Anda akhirnya harus menjelaskan segalanya secara berlebihan). Ada kesimpulan lucu dari semua ini. Jika Claude semakin menciptakan lingkungan untuk Claude masa depan, tetapi Claude masa depan semakin memodelkan siapa pun yang menciptakan lingkungan tersebut, maka Anda berada dalam masalah self-referensial. (Tetapi mungkin juga semuanya berjalan baik—Anda mendapatkan setup adversarial yang stabil.) Apa yang terjadi jika Anda benar-benar mengisolasi seseorang? Anda mendapatkan seseorang dengan keyakinan kuat tetapi sempit; perilaku aneh dan kalibrasi buruk. Kesimpulan lucunya mungkin adalah Anda membutuhkan keragaman model. Tetapi loop umpan balik positif (terutama yang ekonomis) menghancurkan keragaman itu. Anda tidak bisa menjadi kaisar tanpa rakyat jelata.
Lisan al GaibBagikan
Sumber:Tampilkan versi asli
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini.
Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.