Anthropic memperkenalkan Claude Opus 5.5 pada 22 September, model pertama dalam siri Claude 5.5. Kelebihan utama yang diberikan oleh syarikat ini adalah jelas: mencapai tahap yang setara dengan Claude Fable 5.1 dalam kebanyakan tugas, dengan penurunan kos operasi sebanyak 40% berbanding Opus 5 generasi sebelumnya. Namun, yang benar-benar patut diperhatikan dalam pelancaran ini bukan hanya harga dan senarai peringkat, tetapi bagaimana Anthropic telah mengalihkan fokus ujian mereka kepada tugas jangka panjang, operasi yang tidak boleh dipulihkan, serta perlindungan terhadap serangan penyuntikan petunjuk.
Pihak rasmi menyatakan bahawa Opus 5.5 menunjukkan peningkatan ketara dalam pengkodean kompleks, penyelidikan, dan kerja yang memerlukan keahlian. Di kalangan penguji awal, terdapat pasukan yang berjaya mentransfer sekitar 680,000 baris kod dalam masa kurang daripada sehari; Anthropic juga menekankan bahawa model ini mampu mengekalkan konteks dan kesinambungan perancangan yang lebih panjang. Kes-kes ini boleh menunjukkan had kemampuan, tetapi tidak boleh dianggap sebagai masa penghantaran purata untuk semua projek. Struktur kod, cakupan ujian, dan semakan manusia akan mengubah hasilnya.
Mengurangkan kos bukan bermaksud "versi murah flagship", tetapi semula membahagikan sempadan penggunaan model
Dahulu, Opus biasanya diserahkan kepada tugas yang paling kompleks dan paling mahal, sementara tugas harian lebih banyak diberikan kepada model yang lebih pantas. Jika Opus 5.5 benar-benar mampu mendekati tahap Fable 5.1 dengan kos yang lebih rendah, perusahaan mungkin akan menggunakan model unggulan untuk pemeriksaan kod, analisis dokumen, dan proses penyelidikan dalam jumlah yang lebih besar, bukan hanya dipanggil untuk permintaan bernilai tinggi yang sedikit.
Penurunan kos sebanyak 40% adalah pernyataan rasmi Anthropic berbanding Opus 5, dan tidak bermakna bahawa bil setiap syarikat akan turun sebanyak 40%. Kos sebenar bergantung kepada panjang input dan output, cache, bilangan panggilan alat, dan sama ada tugas memerlukan percubaan semula. Model yang lebih kuat mungkin menghabiskan lebih banyak Token keseluruhan kerana diberi tugas yang lebih panjang. Pembeli perlu menguji “kos keseluruhan untuk menyelesaikan satu tugas” menggunakan beban kerja sendiri, bukan hanya membandingkan harga per unit.
Kemampuan tugas panjang juga perlu diukur berdasarkan kualiti penyelesaian. Satu pemindahan kod besar mungkin menghasilkan banyak perubahan yang kelihatan munasabah, tetapi kos sebenar termasuk ujian regresi, konflik ketergantungan, pelaksanaan dan pemulihan. Jika model memerlukan jurutera menghabiskan berhari-hari untuk memperbaiki masalah pinggir, kelebihan kelajuan akan berkurang. Penilaian paling bernilai harus merekodkan kejayaan, bilangan kali pengambilalihan manusia, dan ralat tidak boleh dipulihkan, bukan hanya bilangan kod yang dihasilkan.
Anthropic menyatakan bahawa Opus 5.5 telah menjalani ujian pra-pelancaran oleh penilai luar seperti Frontier Design dan METR. Keterlibatan luar meningkatkan kredibiliti, tetapi tidak bermakna semua laporan, data asal, dan persekitaran ujian telah dipaparkan sepenuhnya. Pengguna masih perlu membezakan antara hasil yang dilaporkan oleh syarikat, hasil penilaian bebas, dan hasil replikasi dalam persekitaran mereka sendiri.
Ujian keselamatan bermula memantau bentuk insiden sebenar, bukan hanya kadar penolakan soalan singkat
Anthropic menyatakan bahawa Opus 5.5 mencapai pencapaian terbaik syarikat semasa audit tingkah laku automatiknya. Ujian merangkumi ribuan situasi simulasi, dengan fokus utama pada sama ada model akan mengambil tindakan yang sukar dibatalkan, sama ada ia melanggar sempadan yang diberikan pengguna, dan sama ada ia mampu mempertahankan tugas asalnya apabila menghadapi serangan penyuntikan petunjuk. Syarikat juga menambahkan tugas yang mustahil, tugas yang lebih panjang, dan senario yang direka berdasarkan insiden sebenar ke dalam penilaian.
Ini adalah pelajaran yang perlu dipelajari selepas AI agen memasuki persekitaran pengeluaran. Ujian keselamatan tradisional sering bertanya sama ada model akan menjawab soalan sensitif tertentu, tetapi agen yang mampu melihat laman web, memanggil terminal, dan mengubah fail menghadapi risiko yang lebih besar daripada rantai tindakan: ia mungkin terus melaksanakan tindakan berdasarkan anggapan yang salah, atau menganggap teks jahat dalam laman web sebagai arahan. Satu klik yang salah atau peningkatan keizinan lebih sukar dipulihkan berbanding satu jawapan yang tidak sesuai.
“Lebih sedikit pelanggaran” masih tidak sama dengan “tidak akan melanggar”. Anthropic secara jelas mengakui bahawa model mempunyai batasan. Semasa pelaksanaan oleh perusahaan, tetap diperlukan prinsip kuasa minimum, pengesahan tindakan, log yang boleh dilacak, sandbox, dan mekanisme rollback. Terutamanya untuk perubahan pangkalan data pengeluaran, pembayaran, dan infrastruktur, jangan menghilangkan persetujuan manusia hanya kerana skor keselamatan model meningkat.
Ini juga merupakan model pertama yang dilancarkan selepas Anthropic mengusulkan “memperlambat kecepatan terdepan”. Perusahaan berusaha menyampaikan isyarat: terus meningkatkan kemampuan, sambil memasukkan penilaian luar dan ujian keselamatan yang lebih mendekati kejadian sebenar ke dalam proses pelancaran. Namun, penilaian sama ada janji ini boleh dipertahankan bergantung pada sama ada kesilapan berterusan, kaedah ujian, dan kesan pembaikan akan dinyatakan secara berterusan, bukan hanya skor tertinggi dalam satu pelancaran.
Bagi pengguna, yang paling patut diuji dalam Opus 5.5 bukanlah sama ada jawapan perbualan lebih cantik, tetapi sama ada ia mampu mengekalkan kawalan semasa tugas yang berlangsung berjam-jam, menggunakan banyak alat, dan melibatkan banyak langkah, serta berhenti apabila maklumat tidak mencukupi. Persaingan dalam pasaran model sedang berpindah dari “siapa yang menjawab lebih pintar” kepada “siapa yang mampu menyelesaikan tugas kompleks dengan kos yang boleh dikawal”. Penurunan harga memberikan lebih ramai orang peluang untuk mencuba, manakala disiplin keselamatan dan kejuruteraan menentukan sama ada percubaan ini benar-benar boleh memasuki pengeluaran.
Semasa percubaan, syarikat boleh membina satu set perbandingan yang ringkas tetapi ketat: gunakan tugas sebenar yang sama untuk membandingkan Opus 5, Opus 5.5, dan model berkos lebih rendah, rekod masa penyelesaian, jumlah kos, kadar lulus ujian, jumlah pengubahsuaian manusia, dan bilangan tindakan berisiko tinggi. Hanya apabila semua indikator ini meningkat secara serentak, peningkatan tersebut mempunyai makna perniagaan. Demo pada hari pelancaran sesuai untuk mengenal pasti kemungkinan, tetapi penilaian dalaman yang berterusan selama beberapa minggu lebih sesuai untuk menentukan kuasa dan bajet.
