Hari ini, Anthropic merilis Claude Fable 5.1 / Mythos 5.1 (model yang sama, tingkat perlindungan berbeda), pembaruan kecil menengah dengan peningkatan kinerja yang tidak signifikan, namun bagi kami lebih penting pada: peningkatan stabilitas dan penurunan harga. Pembaruan resmi sebagai berikut: 1. Peningkatan terbesar pada kemampuan agentic ilmiah Terminal-Bench-Science naik dari 24,7% pada Fable 5 menjadi 52,6%, hampir dua kali lipat, dan jauh melampaui Opus 5 yang berada di 29,0%. 2. Pemrograman dan tugas jangka panjang tanpa pengawasan Terminal-Bench 4.0 meningkat dari 42,0% menjadi 55,8% (Mythos 5.1 mencapai 60,9%), CursorBench 3.2.0 mencapai 73,4%. Millennium menggunakannya untuk mengidentifikasi kerusakan dengan probabilitas satu per sejuta yang tidak terdeteksi oleh tim selama empat hingga lima tahun dan dilewati oleh model lain. 3. Harga turun sekitar 25% Harga cache read turun 75%, menjadi $0,25 per juta token; biaya keseluruhan untuk beban tipikal turun sekitar 25%, dan untuk skenario agentic berat bisa turun hingga 45%. Harga input $10 dan output $50 per juta token tetap sama. 4. Efort rendah sudah cukup Dengan pengaturan Low/Medium, kinerjanya sudah mendekati atau melampaui Fable 5, tetapi dengan biaya jauh lebih rendah—cocok langsung untuk skenario yang sensitif terhadap biaya. 5. Penurunan signifikan pada false positive perlindungan keamanan Jumlah intersepsi perlindungan keamanan jaringan di Claude Code rata-rata turun sekitar 60%, dan sekarang memungkinkan penggunaannya untuk identifikasi kerentanan (tetap tidak diizinkan untuk menulis exploit, pengujian penetrasi, atau pemindaian biner—semua ini akan dialihkan ke Opus). False trigger pada pertanyaan biologis netral (biologi dasar, pertanyaan medis) berkurang 85%. 6. Solusi penyimpanan data perusahaan Enterprise Frontier Safeguards (EFS) baru menyimpan data di cloud pelanggan sendiri, bukan di Anthropic, setara dengan nol penyimpanan data, akan diluncurkan bertahap musim gugur ini; sebelumnya, pelanggan yang memenuhi syarat dapat langsung menggunakan tanpa penyimpanan data. 7. Kinerja alignment lebih baik daripada generasi sebelumnya Lebih sedikit upaya keluar dari lingkungan pengujian untuk mengambil sumber daya, lebih sedikit menggunakan alasan seperti "ini simulasi/evaluasi" untuk membenarkan tindakan, upaya dan keberhasilan reward hacking lebih rendah, serta merupakan model paling tangguh saat ini terhadap prompt injection. Dua hal lain yang perlu diketahui: Akun API baru tidak lagi dapat mengedit secara manual riwayat pemikiran Claude dalam percakapan multi-turn (untuk mencegah distilasi), dan output akan menyertakan watermark teks tak terlihat sesuai persyaratan EU AI Act, tanpa memengaruhi kualitas konten dan tidak mengandung informasi pengguna apa pun.
Dr.RBagikan
Sumber:Tampilkan versi asli
Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini.
Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.