Hari ini, Anthropic melancarkan rilis terbaru Claude Fable 5.1 / Mythos 5.1 (model yang sama, tetapi dengan tingkat pengawasan berbeza), kemas kini sederhana pertengahan, peningkatan prestasi kecil, tetapi bagi kami, ia lebih menekankan peningkatan ketabahan dan penurunan harga. Kemas kini rasmi adalah seperti berikut: 1. Peningkatan terbesar dalam kemampuan agentic ilmiah Terminal-Bench-Science meningkat dari 24.7% pada Fable 5 menjadi 52.6%, hampir ganda, dan jauh melebihi Opus 5 pada 29.0%. 2. Pengekodan dan tugas jangka panjang tanpa pengawasan Terminal-Bench 4.0 meningkat dari 42.0% kepada 55.8% (Mythos 5.1 pada 60.9%), CursorBench 3.2.0 mencapai 73.4%. Millennium menggunakannya untuk mengesan kegagalan berpeluang satu dalam sejuta yang tidak dikesan oleh pasukan selama empat hingga lima tahun dan dilalui oleh model lain. 3. Harga turun sekitar 25% Harga bacaan cache turun 75%, menjadi $0.25/sejuta token; kos keseluruhan beban typikal turun sekitar 25%, dan skenario agentic berat boleh turun sehingga 45%. Harga input $10, output $50/sejuta token kekal tidak berubah. 4. Usaha rendah sudah mencukupi Apabila ditetapkan ke Low/Medium, prestasi sudah hampir atau melebihi Fable 5, tetapi dengan kos jauh lebih rendah—sesuai untuk skenario sensitif kos yang boleh terus turunkan tier. 5. Pengurangan besar dalam kesalahan pengawasan keselamatan Jumlah blok pengawasan keselamatan rangkaian dalam Claude Code berkurang purata sebanyak 60%, dan kini ia dibenarkan digunakan untuk pengenalpastian lubang keamanan (tetapi masih tidak dibenarkan menulis exploit, ujian penetrasi, atau pemindanan binari—aktiviti ini akan dialihkan ke Opus). Pemicuan salah untuk soalan jinak bidang biologi (biologi asas, soalan perubatan) berkurang 85%. 6. Penyelesaian penyimpanan data perusahaan Enterprise Frontier Safeguards (EFS) baharu menyimpan data di awan pelanggan sendiri, bukan di Anthropic, setara dengan penyimpanan data sifar, akan dilancarkan secara berperingkat pada musim gugur ini; sebelum itu, pelanggan yang memenuhi syarat boleh terus menggunakan tanpa penyimpanan data. 7. Prestasi penyesuaian lebih baik daripada generasi sebelumnya Lebih kurang mengambil sumber di luar persekitaran ujian, lebih kurang menggunakan penalaran motivasi seperti "ini adalah simulasi/penilaian" untuk membenarkan tindakan, cubaan dan kejayaan reward hacking lebih rendah, serta merupakan model paling stabil terhadap prompt injection sehingga kini. Dua perkara lain yang perlu diketahui: Akaun API baharu tidak lagi membenarkan pengeditan manual sejarah pemikiran Claude dalam perbualan berbilang putaran (untuk melawan distilasi), dan output akan mengandungi tanda air teks terselindung yang diperlukan oleh EU AI Act, tanpa kesan terhadap kualiti kandungan atau mengandungi sebarang maklumat pengguna.
Dr.RKongsi
Sumber:Tunjukkan artikel asal
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini.
Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.