Anthropic meluncurkan Claude Sonnet 5.5, berusaha memadatkan kemampuan yang mendekati Opus 5.5 ke dalam model Agent harian yang lebih terjangkau dan cocok untuk pemanggilan frekuensi tinggi. Harga API-nya tetap sebesar $2 dan $10 per juta Token masukan/keluaran, tetapi pihak resmi menyatakan kecepatan output meningkat lebih dari 30%, dengan jumlah Token yang diperlukan untuk menyelesaikan tugas tipikal berkurang, sehingga biaya per tugas dapat turun hingga 30%. Dalam pengujian resmi, Sonnet 5.5 mencapai 70,6% di Terminal‑Bench 4.0, lebih tinggi daripada 10,3% Sonnet 5 dan 66,4% Opus 5.5; tugas profesional GDPval‑AA juga mencapai 1844 Elo, hampir menyamai Opus di 1846. Namun, "Opus setengah harga" bukanlah kesimpulan lengkap: Artificial Analysis menemukan bahwa Sonnet 5.5 menghasilkan rata-rata sekitar 193.000 Token keluaran per soal pada intensitas penalaran tertinggi, menjadi konfigurasi paling boros Token yang pernah diuji mereka, sehingga biaya per soal justru 50% lebih tinggi daripada Sonnet 5; pengujian kode nyata CodeRabbit juga menunjukkan bahwa meskipun Sonnet 5.5 sekitar dua kali lebih cepat daripada generasi sebelumnya, ia tetap melewatkan masalah sulit yang dapat ditemukan oleh Opus. Oleh karena itu, ia lebih mirip model utama baru yang cocok untuk tugas yang jelas dan berulang, bukan pengganti menyeluruh terhadap Opus.Penulis artikel, sumber: Anthropic
Anthropic menempatkan Sonnet kembali sebagai agen utama sehari-hari
Sonnet 5.5 adalah model kedua dalam seri Claude 5.5. Berbeda dengan Opus 5.5 yang dirilis seminggu lalu dan ditujukan untuk tugas terbuka yang kompleks, Anthropic menempatkan Sonnet 5.5 sebagai model untuk menangani tugas sehari-hari dengan batasan jelas yang memerlukan banyak eksekusi berulang: memperbaiki kesalahan program, meninjau kode, menyelidiki informasi, serta menghasilkan dokumen, presentasi, dan spreadsheet.
Model mendukung input teks dan gambar, menyediakan konteks 1 juta Token, dan dapat digunakan di situs web dan aplikasi seluler Claude, Anthropic API, AWS, Google Cloud, serta Microsoft Azure. Nama API-nya adalahclaude-sonnet-5-5. Anthropic tidak mengungkapkan jumlah parameter, arsitektur model, data pelatihan, atau daya komputasi pelatihan, sehingga tidak mungkin menentukan peningkatan tersebut berasal dari pelatihan dasar, pelatihan lanjutan, strategi inferensi, atau optimasi rantai alat Agent.
Perbedaan antara itu dan Opus bukan hanya “kemampuan lebih lemah dan harga lebih murah”. Anthropic ingin membentuk pembagian tugas model baru: Opus bertanggung jawab atas tugas kompleks yang definisi masalahnya tidak lengkap dan memerlukan penilaian berkelanjutan; Sonnet secara cepat menjalankan pekerjaan yang sudah jelas dan memperluas jumlah panggilan dengan biaya lebih rendah.
70,6% terhadap 10,3%, adalah data yang paling mencolok dan paling perlu dipahami dengan hati-hati
Sonnet 5.5 mendapatkan 70,6% dalam pengujian Terminal-Bench 4.0 yang diumumkan oleh Anthropic, sementara Sonnet 5 hanya 10,3%, bahkan lebih tinggi dari Opus 5.5 yang mencapai 66,4%. Benchmark ini meminta Agent untuk menyelesaikan tugas profesional multi-langkah di lingkungan command line, yang dapat mencerminkan kerja sama antara penulisan kode, operasi terminal, dan penggunaan alat.
Peningkatan proyek lainnya tidak sebesar ini, tetapi tetap signifikan. CursorBench 4.0 naik dari 34,1% Sonnet 5 menjadi 55,5%, hanya selisih sekitar dua poin persentase dari 57,8% Opus 5.5; Humanity’s Last Exam dengan alat meningkat dari 54,9% menjadi 64,5%; OSWorld 2.1 operasi komputer naik dari 57,0% menjadi 80,1%, mendekati 81,8% Opus.
Dalam tugas pengetahuan profesional GDPval-AA, Sonnet 5.5 mendapatkan 1844 Elo, sedangkan Opus 5.5 mendapatkan 1846; dalam evaluasi pekerjaan pengetahuan jangka panjang AA-Briefcase, keduanya masing-masing mendapatkan 1811 dan 1822. Anthropic menyimpulkan bahwa sebagian pekerjaan profesional dengan batasan jelas tidak lagi perlu secara default memanggil model unggulan.
Namun, angka-angka ini tidak dapat disatukan secara sederhana menjadi “Sonnet telah melampaui Opus”. Kekuatan inferensi yang digunakan oleh berbagai proyek tidak sepenuhnya sama, dan Anthropic secara jelas menyatakan bahwa Opus tetap jauh lebih unggul dalam tugas-tugas yang memerlukan pemeliharaan penilaian jangka panjang dan penanganan tujuan terbuka.
Sebuah contoh menarik berasal dari FrontierCode. Sonnet 5.5 mencapai 52,1% pada intensitas inferensi Xhigh, tetapi turun menjadi 46,2% setelah dinaikkan ke Max. Anthropic menjelaskan bahwa model lebih sering memicu beberapa sub-Agent tinjauan kode dalam mode Max, dan dua kali mengalami timeout atau mengubah kode di luar cakupan tugas, sehingga akhirnya dinilai gagal dalam evaluasi.
Hasil ini menunjukkan bahwa lebih banyak inferensi dan lebih banyak Agent tidak secara otomatis menghasilkan jawaban yang lebih baik. Model mungkin kehilangan poin karena pemeriksaan berlebihan, memperluas cakupan tugas, atau menghabiskan anggaran waktu.
Tidak ada penurunan harga untuk setiap token, mengapa pihak resmi menyebut biaya tugas 30% lebih rendah?
Harga publik Sonnet 5.5 sama dengan Sonnet 5: $2 per juta token masukan, $10 per juta token keluaran, $2,5 untuk penulisan cache, dan $0,2 untuk pembacaan cache, masing-masing setengah dari harga yang sesuai pada Opus 5.5.
Yang dimaksud Anthropic dengan "tugas tunggal bisa lebih murah hingga 30%" bukanlah penurunan harga dalam daftar tarif API, melainkan model memerlukan langkah dan Token yang lebih sedikit untuk menyelesaikan pekerjaan yang sama. Pihak resmi menyatakan kecepatan generasinya meningkat lebih dari 30%; Slack dalam pengujian internal melihat pengurangan Token output sekitar 14%, Atlassian menyatakan kecepatan Agent meningkat hingga 30%, sedangkan Lovable melaporkan pengurangan panggilan alat sekitar sepertiga dan jumlah eksekusi Shell hampir setengahnya.
Saat diuji pada 2.441 tugas keuangan, termasuk pertanyaan-jawab, ekstraksi, analisis, dan prediksi, Sonnet 5.5 rata-rata menggunakan sekitar 121.000 token per tugas, sedangkan Sonnet 5 sekitar 497.000. Karena semua ini adalah pengujian pribadi mitra, pihak luar tidak dapat memeriksa tingkat kesulitan tugas, petunjuk, dan output lengkap, tetapi hasilnya secara bersama-sama menunjukkan perubahan: model baru kurang sering melakukan pencarian berulang, membaca ulang informasi, atau melakukan penalaran internal yang terlalu panjang.
Ini sangat penting bagi Agent. Dalam obrolan tradisional, menghasilkan ratusan token sekaligus memiliki dampak terbatas; namun, Agent jangka panjang akan terus-menerus membaca konteks, memanggil alat, dan memperbaiki hasil, di mana satu langkah yang berlebihan dapat membesar menjadi perbedaan waktu dan biaya yang signifikan setelah puluhan siklus.
Kekuatan inferensi tertinggi mengungkap kebenaran biaya lainnya
Uji independen Artificial Analysis memberikan skor 56 untuk konfigurasi inferensi tertinggi Sonnet 5.5, hanya selisih 2 poin dari Opus 5.5 yang mendapat skor 58 dalam indeks kecerdasan komprehensifnya.
Namun, harga untuk mencapai pencapaian ini sangat tinggi: Sonnet 5.5 menghasilkan rata-rata sekitar 193.000 token output per tes, level tertinggi yang pernah diukur oleh lembaga ini, sekitar 60% lebih tinggi daripada Opus 5.5 Max dan Sonnet 5 Max, serta sekitar tujuh kali lipat dari GPT‑6 Astra Max. Biaya perkiraan per soal mencapai $7,60, sekitar 50% lebih tinggi daripada Sonnet 5.
Ini tidak secara langsung bertentangan dengan pernyataan Anthropic bahwa "biaya tugas dapat turun hingga 30%". Kesimpulan resmi terutama menggambarkan beban kerja tipikal dan intensitas inferensi yang lebih rendah; Artificial Analysis mengukur kondisi Max yang diaktifkan untuk mengejar batas kemampuan maksimal.
Dua hasil ini bersama-sama menunjukkan bahwa kekuatan inferensi telah menjadi bagian dari produk model. Sonnet 5.5 pada mode Low atau Medium mungkin menawarkan nilai biaya yang sangat tinggi; jika kekuatan inferensi dinaikkan ke Max untuk mengejar Opus, meskipun biaya per Token lebih murah, hal itu mungkin kehilangan keunggulan biaya karena menghasilkan terlalu banyak output.
Artificial Analysis juga menemukan bahwa akurasi pengetahuan fakta Sonnet 5.5 sekitar 54%, lebih rendah dari 66% Opus; proyek penalaran ilmiah juga tertinggal sekitar enam poin persentase. Istilah "dekat dengan Opus" terutama didasarkan pada operasi terminal Agent dan sebagian pekerjaan pengetahuan, dan tidak dapat digeneralisasi ke semua kemampuan.
Dalam tinjauan kode nyata, keunggulan kecepatan tetap berlaku, dan kesenjangan unggulan juga masih ada
CodeRabbit menjalankan serangkaian pengujian hari rilis menggunakan kesalahan yang diketahui dari proyek open source nyata.
Dari 13 kasus tinjauan kode yang sulit, Sonnet 5.5 dengan fitur penalaran menemukan 6 masalah, lebih tinggi daripada Sonnet 5 yang menemukan 4; akurasi komentar efektif keduanya masing-masing 41,2% dan 40,0%. Namun, Opus 5.5 mode standar menemukan 8 masalah, dan mode Max menemukan 10, menunjukkan bahwa kesenjangan dalam tugas tinjauan kompleks masih jelas.
Dalam serangkaian pengujian lain yang melibatkan 44 Pull Request nyata, Sonnet 5.5 rata-rata memerlukan 6 menit 33 detik per tinjauan, sedangkan Sonnet 5 memerlukan 13 menit 31 detik. Sonnet 5.5 menghasilkan komentar 24% lebih sedikit, dan pendapat sepele hanya sekitar sepertiga dari generasi sebelumnya; berdasarkan harga publik, panggilan model inti rata-rata sekitar $0,46, sedangkan Sonnet 5 sekitar $1,16.
Namun, skor cakupan kesalahan lengkap untuk 44 PR ini belum selesai saat artikel diterbitkan, sehingga saat ini hanya dapat dikonfirmasi bahwa ia lebih cepat dan menghasilkan lebih sedikit, tetapi belum dapat dipastikan apakah komentar yang ditulis lebih sedikit melewatkan lebih banyak masalah nyata. Sampel 13 kasus sulit juga sangat kecil; CodeRabbit sendiri mengingatkan bahwa ini cukup untuk mengamati arah, tetapi tidak cukup untuk menentukan peringkat umum.
Pembagian peran model yang lebih masuk akal adalah: Sonnet 5.5 bertanggung jawab untuk melakukan tinjauan rutin cepat terhadap setiap PR; perubahan yang melibatkan keamanan, arsitektur inti, atau kesalahan yang memiliki biaya tinggi jika terlewat, akan dinaikkan ke Opus atau ahli manusia.
Desain visual mulai menjadi daya tarik model pekerjaan umum
Anthropic juga secara khusus menekankan kemampuan desain visual Sonnet 5.5. Demonstrasi resmi meminta Sonnet 5 dan 5.5 untuk membuat animasi 400 burung starling terbang berkelompok, bukit pasir yang dibentuk angin, dan jam besar yang terdiri dari 24 lonceng kecil dalam satu file HTML. Model baru ini menghasilkan hasil lebih cepat, dengan animasi, hierarki, dan tingkat penyelesaian antarmuka yang lebih tinggi.
Ia juga dapat menghasilkan presentasi berdasarkan template. Dalam sebuah pengujian internal, Anthropic menyediakan bahan laporan kinerja kuartalan perusahaan publik, transkrip panggilan, dan template slide sepuluh halaman, dan dua ahli menyatakan bahwa versi pertama Sonnet 5.5 dapat langsung dikirimkan.
Ini masih merupakan contoh tampilan yang dipilih oleh pabrikan, dan tidak mewakili kemampuan model untuk secara stabil memahami setiap template perusahaan. Akurasi data grafik kompleks, norma merek, dan sumber kutipan tetap memerlukan pemeriksaan manual, tetapi ini mencerminkan arah baru persaingan model: tidak hanya menghasilkan konten yang benar, tetapi juga berusaha menyediakan antarmuka dan dokumen yang mendekati produk jadi.
Peningkatan kemampuan keamanan juga berarti sebagian permintaan akan diambil alih oleh model lama
Sonnet 5.5 adalah model Sonnet pertama yang menggunakan perlindungan keamanan siber kelas atas sejak peluncurannya. Anthropic menyatakan bahwa kemampuan keamanan siber-nya telah mendekati Opus 5, sehingga perbaikan kerentanan biasa masih dapat dilakukan, tetapi permintaan keamanan siber berisiko tinggi akan secara transparan dialihkan ke Sonnet 5.
Perusahaan juga menguji perilaku seperti menyesatkan pengguna, bertentangan dengan kepentingan pengguna, membantu penyalahgunaan berisiko tinggi, dan melampaui batas lingkungan dalam sekitar 1.850 skenario. Pihak resmi menyatakan bahwa model baru ini setara atau lebih unggul daripada Sonnet 5 pada sebagian besar indikator, serta merupakan model Claude paling sedikit yang secara aktif menguji batas kontainer.
Namun, ini terutama merupakan evaluasi otomatis internal Anthropic dan tidak dapat dianggap sebagai bukti lengkap terhadap risiko di lingkungan nyata. Perusahaan sendiri mengakui bahwa tidak ada satu set pengujian pun yang dapat mengidentifikasi semua mode kegagalan.
Sonnet 5.5 adalah Sonnet pertama yang menambahkan klasifier anti-distilasi dan memperluas mekanisme "mempertahankan konten pemikiran" untuk mencegah transfer konteks inferensi di antara akun yang berbeda. Dampaknya terbatas bagi pengembang biasa, tetapi beberapa alur kerja yang memindahkan percakapan Claude Code antar akun perlu disesuaikan.
Perubahan sejati bukanlah peringkat pertama, tetapi "model yang cukup kuat" mulai menjadi pilihan default
Sonnet 5.5 tidak mengumumkan arsitektur model baru, juga tidak secara menyeluruh mengungguli Opus. Makna yang lebih penting adalah memindahkan sejumlah besar pekerjaan yang sebelumnya memerlukan model unggulan ke model menengah yang lebih cepat dan harga per Token setengahnya.
Untuk sistem layanan pelanggan, tinjauan kode, penyelidikan data, dan produksi dokumen yang berjalan ribuan kali setiap hari, keputusan apakah akan menerapkan atau tidak biasanya bukan didasarkan pada skor tertinggi untuk satu tugas saja, tetapi pada berapa banyak langkah yang diperlukan untuk setiap tugas, berapa banyak Token, berapa lama waktu tunggu, dan apakah kesalahan dapat ditangani secara meningkat. Nilai Sonnet 5.5 justru terfokus pada indikator-indikator ini.
