Anthropic melancurkan Claude Sonnet 5.5, yang cuba memampatkan kemampuan hampir setara dengan Opus 5.5 ke dalam model Agent harian yang lebih murah dan sesuai untuk pemanggilan frekuensi tinggi. Harga API-nya masih pada $2 dan $10 per juta Token masukan/luaran, tetapi pihak rasmi menyatakan kelajuan output meningkat lebih daripada 30%, dengan pengurangan Token yang diperlukan untuk menyelesaikan tugas biasa, sehingga mengurangkan kos tugas individu sehingga 30%. Dalam ujian rasmi, ia mencapai 70.6% dalam Terminal‑Bench 4.0, melebihi 10.3% Sonnet 5 dan 66.4% Opus 5.5; ia juga mencapai 1844 Elo dalam tugas profesional GDPval‑AA, hampir menyamai 1846 Opus. Namun, “Opus separuh harga” bukanlah kesimpulan penuh: Artificial Analysis mendapati bahawa Sonnet 5.5 menghasilkan purata sekitar 193,000 Token output per soalan pada kekuatan inferens maksimum, menjadikannya konfigurasi paling berat dalam hal Token yang pernah diuji, dengan kos per soalan 50% lebih tinggi berbanding Sonnet 5; ujian semakan kod sebenar CodeRabbit juga menunjukkan bahawa walaupun Sonnet 5.5 lebih pantas kira-kira dua kali ganda berbanding generasi sebelumnya, ia masih melewatkan isu-isu sukar yang dapat dikesan oleh Opus. Oleh itu, ia lebih sesuai sebagai model utama baharu yang sesuai untuk tugas yang jelas dan boleh diulang, bukan pengganti menyeluruh kepada Opus.Penulis artikel, sumber: Anthropic
Anthropic menetapkan semula Sonnet sebagai agen harian utama
Sonnet 5.5 ialah model kedua dalam siri Claude 5.5. Berbeza dengan Opus 5.5 yang dilancarkan seminggu yang lalu dan ditujukan untuk tugas terbuka yang kompleks, Anthropic menempatkan ia sebagai model untuk menangani tugas harian yang mempunyai sempadan jelas dan memerlukan pelaksanaan berulang-ulang: memperbaiki ralat program, mengulas kod, menyiasat maklumat, serta menghasilkan dokumen, ucapan, dan lembaran kerja.
Model menyokong input teks dan gambar, menyediakan konteks 1 juta Token, dan boleh digunakan di laman web dan aplikasi seluler Claude, Anthropic API, AWS, Google Cloud, serta Microsoft Azure. Nama API ialahclaude-sonnet-5-5. Anthropic tidak mengumumkan jumlah parameter, arsitektur model, data latihan, atau kekuatan komputasi latihan, oleh itu tidak mungkin menentukan peningkatan tersebut berasal daripada latihan asas, latihan pasca, strategi inferens, atau pengoptimuman rantai alat Agent.
Perbezaan antara ia dan Opus bukan sekadar “kemampuan lebih lemah dan harga lebih murah”. Anthropic ingin membentuk pembahagian tugas model baru: Opus bertanggungjawab atas tugas kompleks yang definisi masalahnya tidak lengkap dan memerlukan penilaian berterusan; Sonnet pula menjalankan tugas yang telah jelas dengan pantas serta memperluaskan bilangan panggilan dengan kos yang lebih rendah.
70.6% berbanding 10.3%, adalah data yang paling menonjol dan paling perlu difahami dengan berhati-hati
Sonnet 5.5 mencapai 70.6% dalam ujian Terminal‑Bench 4.0 yang diumumkan oleh Anthropic, manakala Sonnet 5 hanya 10.3%, bahkan melebihi Opus 5.5 pada 66.4%. Benchmar ini memerlukan Agent untuk menyelesaikan tugas profesional berbilang langkah dalam persekitaran baris arahan, yang mampu mencerminkan kerjasama antara penulisan kod, operasi terminal, dan penggunaan alat.
Peningkatan projek-projek lain tidak sebegitu mencolok, tetapi masih jelas. CursorBench 4.0 meningkat dari 34.1% Sonnet 5 kepada 55.5%, hanya dua peratus jauh daripada 57.8% Opus 5.5; Humanity’s Last Exam dengan alat meningkat dari 54.9% kepada 64.5%; OSWorld 2.1 pengendalian komputer meningkat dari 57.0% kepada 80.1%, hampir mendekati 81.8% Opus.
Dalam tugas pengetahuan profesional GDPval-AA, Sonnet 5.5 mendapat 1844 Elo, manakala Opus 5.5 mendapat 1846; dalam penilaian kerja pengetahuan jangka panjang AA-Briefcase, masing-masing ialah 1811 dan 1822. Anthropic berpendapat bahawa sebahagian pekerjaan profesional dengan sempadan jelas sudah tidak perlu secara lalai memanggil model unggul.
Namun, angka-angka ini tidak boleh digabungkan secara sederhana menjadi “Sonnet telah melampaui Opus”. Kekuatan inferensi yang digunakan oleh projek yang berbeza tidak sepenuhnya sama, dan Anthropic dengan jelas menyatakan bahawa Opus masih jauh lebih kuat dalam tugas yang memerlukan penjagaan penilaian jangka panjang dan pengurusan objektif terbuka.
Satu contoh menarik datang dari FrontierCode. Sonnet 5.5 mencapai 52.1% pada kekuatan inferensi Xhigh, tetapi turun menjadi 46.2% apabila dinaikkan ke Max. Anthropic menjelaskan bahawa model lebih kerap memulakan beberapa sub-Agen semakan kod dalam mod Max, dan dua kali ganda ia melebihi masa atau mengubah kod di luar lingkungan tugas, akhirnya dinilai sebagai gagal.
Keputusan ini menunjukkan bahawa lebih banyak penalaran dan lebih banyak Agen tidak semestinya membawa kepada jawapan yang lebih baik. Model mungkin kehilangan markah kerana pemeriksaan berlebihan, memperluaskan lingkungan tugas, atau menghabiskan anggaran masa.
Setiap token tidak mengalami penurunan harga, mengapa pihak rasmi menyatakan kos tugas 30% lebih rendah?
Harga awal Sonnet 5.5 adalah sama dengan Sonnet 5: $2 per juta token masukan, $10 per juta token keluaran, $2.5 untuk penulisan cache, dan $0.2 untuk pembacaan cache, masing-masing separuh daripada harga yang sepadan untuk Opus 5.5.
Apa yang dikatakan Anthropic bahawa "tugasan tunggal boleh lebih murah sehingga 30%" bukanlah penurunan harga dalam senarai harga API, tetapi kerana model memerlukan langkah dan Token yang lebih sedikit untuk menyelesaikan pekerjaan yang sama. Pihak rasmi menyatakan bahawa kelajuan penghasilan meningkat lebih daripada 30%; Slack dalam ujian dalaman mengamati pengurangan Token output sekitar 14%, Atlassian menyatakan kelajuan Agent meningkat sehingga 30%, manakala Lovable melaporkan pengurangan panggilan alat sebanyak lebih kurang sepertiga dan pengurangan bilangan pemeriksaan Shell hampir separuh.
Semasa diuji pada 2,441 tugas soal jawab, ekstraksi, analisis, dan ramalan kewangan, Sonnet 5.5 purata menggunakan sekitar 121,000 token setiap tugas, manakala Sonnet 5 sebanyak 497,000. Kerana semua ini adalah ujian persendirian mitra, kesukaran tugas, petunjuk, dan output penuh tidak boleh diperiksa oleh pihak luar, tetapi keputusan bersama menunjukkan satu perubahan: model baharu kurang sering mencari semula, membaca semula maklumat, atau melakukan penalaran dalaman yang terlalu panjang.
Ini sangat penting untuk Agent. Dalam perbualan tradisional, mengeluarkan ratusan token sekaligus mempunyai kesan terhadap seseorang; namun, Agent jangka panjang akan membaca semula konteks berulang kali, memanggil alat, dan memperbaiki hasil, di mana kelebihan satu langkah mungkin membesar menjadi perbezaan masa dan kos yang ketara selepas puluhan pusingan.
Kekuatan penalaran tertinggi mengungkap kebenaran kos lain
Ujian bebas untuk Artificial Analysis memberikan skor 56 kepada konfigurasi inferensia tertinggi Sonnet 5.5, hanya tertinggal 2 mata daripada Opus 5.5 yang mendapat 58 dalam indeks kecerdasan komprehensifnya.
Namun, harga untuk mencapai pencapaian ini sangat tinggi: Sonnet 5.5 menghasilkan purata sekitar 193.000 token output setiap ujian, yang merupakan tahap tertinggi yang diukur oleh institusi ini, 60% lebih tinggi daripada Opus 5.5 Max dan Sonnet 5 Max, serta kira-kira tujuh kali ganda GPT‑6 Astra Max. Kos anggaran per soalan mencapai US$7.60, 50% lebih tinggi daripada Sonnet 5.
Ini tidak secara langsung bertentangan dengan pernyataan Anthropic bahawa "kos tugas boleh turun sehingga 30%". Kesimpulan rasmi terutamanya menggambarkan beban kerja typikal dan kekuatan inferens yang lebih rendah; Artificial Analysis mengukur keadaan Max yang diaktifkan untuk mengejar had kemampuan.
Dua set hasil bersama-sama menunjukkan bahawa kekuatan inferens telah menjadi sebahagian produk model. Sonnet 5.5 mungkin menawarkan nilai terbaik dalam mod Rendah atau Sederhana; jika kekuatan inferens dinaikkan ke Maksimum untuk mengejar Opus, walaupun ia lebih murah setiap Token, ia mungkin kehilangan kelebihan kos akibat jumlah penghasilan yang terlalu banyak.
Artificial Analysis juga menemukan bahawa ketepatan pengetahuan fakta Sonnet 5.5 adalah sekitar 54%, lebih rendah daripada 66% Opus; projek penarikan kesimpulan sains juga tertinggal sekitar enam peratus. Istilah “hampir setara dengan Opus” terutamanya berasaskan operasi terminal Agen dan sebahagian kerja pengetahuan, dan tidak boleh dijadikan asas untuk generalisasi terhadap semua kemampuan.
Dalam semakan kod sebenar, kelebihan kelajuan berlaku, dan jurang unggul masih ada
CodeRabbit menjalankan serangkaian ujian hari pelancaran menggunakan kesalahan yang diketahui dari projek sumber terbuka sebenar.
Dalam 13 kes pemeriksaan kod yang sukar, Sonnet 5.5 dengan penalaran menemui 6 masalah, lebih tinggi daripada 4 masalah yang ditemui oleh Sonnet 5; ketepatan komen berkesan masing-masing ialah 41.2% dan 40.0%. Namun, Opus 5.5 dalam mod piawai menemui 8 masalah, dan dalam mod Max menemui 10 masalah, menunjukkan jurang yang masih jelas dalam tugas pemeriksaan yang kompleks.
Dalam ujian lain yang melibatkan 44 Pull Request sebenar, Sonnet 5.5 memerlukan purata 6 minit 33 saat setiap ulasan, manakala Sonnet 5 pula memerlukan 13 minit 31 saat. Yang pertama menghasilkan komen 24% kurang, dan pendapat remeh hanya sekitar sepertiga daripada generasi sebelumnya; berdasarkan harga awam, panggilan model inti purata kira-kira US$0.46, manakala Sonnet 5 pula kira-kira US$1.16.
Namun, skor penutupan kesalahan penuh untuk 44 PR ini belum selesai pada masa artikel diterbitkan, jadi pada masa ini hanya boleh disahkan bahawa ia lebih pantas dan menghasilkan lebih sedikit, tetapi tidak boleh disahkan sama ada ulasan yang ditulis kurang telah menghilangkan lebih banyak masalah sebenar. Sampel 13 kes sukar juga kecil, CodeRabbit sendiri memperingatkan bahawa ia mencukupi untuk mengamati arah, tetapi tidak mencukupi untuk menentukan peringkat am.
Pembahagian tugas model yang lebih munasabah ialah: Sonnet 5.5 bertanggungjawab untuk menjalankan semakan rutin pantas terhadap setiap PR; perubahan yang melibatkan keselamatan, arsitektur inti, atau kesilapan yang dilupakan dengan kos yang tinggi akan dinaikkan ke Opus atau pakar manusia.
Reka bentuk visual mula menjadi ciri jualan untuk model kerja universal
Anthropic juga menekankan kemampuan reka bentuk visual Sonnet 5.5. Demonstrasi rasmi meminta Sonnet 5 dan 5.5 untuk membuat tiga animasi dalam satu fail HTML: 400 ekor burung starling terbang berkelompok, bukit pasir yang dibentuk angin, dan jam besar yang terdiri daripada 24 loceng kecil. Model baharu ini menghasilkan animasi lebih pantas, dengan kualiti animasi, lapisan, dan antaramuka yang lebih tinggi.
Ia juga boleh menghasilkan ucapan berdasarkan templat. Dalam satu ujian dalaman, Anthropic memberikan bahan prestasi kuartalan sebuah syarikat yang disenaraikan, transkrip panggilan, dan templat slaid sepuluh muka surat, dan dua pakar berpendapat versi pertama Sonnet 5.5 boleh dihantar terus.
Ini masih merupakan contoh pilihan pihak pembuat yang tidak mewakili kemampuan model untuk memahami setiap templat perusahaan secara stabil. Keakuratan data grafik kompleks, norma merek, dan sumber rujukan masih memerlukan pemeriksaan manual, tetapi ia mencerminkan arah baru persaingan model: tidak hanya menghasilkan kandungan yang betul, tetapi juga menghantar antaramuka dan dokumen yang hampir siap pakai.
Peningkatan kemampuan keselamatan juga bermakna sebahagian permintaan akan diambil alih oleh model lama
Sonnet 5.5 ialah model Sonnet pertama yang menggunakan perlindungan keselamatan siber tingkat unggul semasa pelancarannya. Anthropic menyatakan bahawa kemampuan keselamatan sibernya hampir setara dengan Opus 5, oleh itu pembaikan vulnabiliti biasa masih boleh dijalankan, tetapi permintaan keselamatan siber berisiko tinggi akan dipindahkan secara telus kepada Sonnet 5.
Perusahaan juga menguji tingkah laku seperti menipu pengguna, bertentangan dengan kepentingan pengguna, membantu penyalahgunaan berisiko tinggi, dan melanggar batas lingkungan dalam sekitar 1850 senario. Pihak rasmi menyatakan bahawa model baharu ini setara atau lebih unggul daripada Sonnet 5 dalam kebanyakan indikator, serta merupakan model Claude yang paling kurang secara aktif menguji batas kontainer.
Namun, ini terutama merupakan penilaian automatik dalaman Anthropic, dan tidak boleh dianggap sebagai bukti lengkap terhadap risiko dalam persekitaran sebenar. Syarikat itu sendiri mengakui bahawa tiada set ujian pun yang mampu mengesan semua mod kegagalan.
Sonnet 5.5 juga merupakan Sonnet pertama yang menambahkan klasifier anti-distilasi, serta memperluas mekanisme "menyimpan konteks pemikiran" untuk mencegah perpindahan konteks inferensi antar akaun. Impaknya terhadap pembangun biasa adalah terhadap, tetapi alur kerja yang memindahkan perbualan Claude Code antar akaun perlu disesuaikan.
Perubahan sebenar bukanlah menjadi yang teratas dalam senarai, tetapi model yang "cukup kuat" mulai menjadi pilihan lalai
Sonnet 5.5 tidak mengumumkan arsitektur model baru, juga tidak secara menyeluruh melampaui Opus. Makna yang lebih penting adalah ia memindahkan sejumlah besar tugas yang sebelumnya memerlukan model unggulan ke model menengah yang lebih cepat dan harga per Token separuhnya.
Untuk sistem yang menjalankan ribuan kali sehari seperti sokongan pelanggan, semakan kod, penyelidikan maklumat, dan penghasilan dokumen, keputusan untuk melaksanakan biasanya bukan berdasarkan skor tertinggi untuk satu tugas, tetapi berdasarkan berapa banyak langkah, berapa banyak token, berapa lama masa tunggu, dan sama ada ralat boleh dinaikkan tahap penanganannya. Nilai Sonnet 5.5 tepat berfokus pada indikator-indikator ini.
