Anthropic baru-baru ini menghadapi pelbagai cabaran teknikal terhadap model Claude. Penghasilan kod mengalami penurunan kebebasan akibat sekatan penanaman tanda air; mekanisme pemikiran adaptif Sonnet 5 membolehkan model yang sama menyesuaikan input pengiraan yang berbeza, mengaburkan sempadan kemampuan garis produk; konteks 1M kelihatan mencukupi, tetapi dalam sesi Agent panjang, model sebenarnya hanya mampu menggunakan kira-kira 20%-30% sahaja, selepas itu berlaku kekeliruan dan pengabaian status; semasa pemampatan konteks, sukar untuk membezakan maklumat mana yang masih sah, dan andaian sementara mungkin disalahertikan sebagai fakta; selepas Agent secara aktif mengubah persekitaran, model mula menganalisis kesilapan baru yang diciptanya sendiri, bukan masalah asal. Artikel tersebut menunjukkan bahawa kebolehpercayaan Agent panjang semakin bergantung kepada kejelasan status, kebolehverifikan tindakan, dan keupayaan untuk membatalkan kesilapan, bukan semata-mata prestasi langkah tunggal model.Penulis artikel, sumber: Leiphone
Yang lebih rumit daripada penurunan skor model ialah model masih dalam peningkatan, tetapi pengguna mulai merasa ia semakin sukar digunakan.
Anthropic baru-baru ini agak berbau begitu.
Beberapa hari ini, sebuah pos di X menggabungkan beberapa keluhan khas Claude dalam tempoh ini: teks dan kod mula ditandai dengan penanda yang boleh dibaca mesin, pengalaman sebenar Sonnet 5 tidak sejajar dengan desas-desus peningkatan model, Fable 5 dijual lebih mahal tetapi sukar untuk dirasakan jelas kelebihannya berbanding Opus 5; dan satu umpan balik yang lebih mencolok ialah konteks Fable 5 hanya digunakan sekitar 20%–30%, selepas itu kemampuannya bermula menurun.

Keempat perkara ini kelihatan tidak berkaitan, satu seolah-olah masalah mekanisme penghasilan, satu seolah-olah masalah keupayaan model, satu seolah-olah masalah penetapan harga, dan satu lagi seolah-olah masalah konteks panjang.
Namun, dilihat dari teknologi semasa Claude, ia sebenarnya terhenti pada lima lokasi yang sangat spesifik: bagaimana model menghasilkan output, berapa banyak pengiraan yang bersedia digunakan semasa inferens, mengapa model yang berbeza semakin sukar dihierarkikan, mengapa konteks panjang gagal sebelum penuh, dan mengapa kemampuan dalam eksperimen sering berkurang apabila digunakan dalam tugas Agen sebenar.
Jadi masalah terkini Anthropic mungkin bukan sekadar "model menurun". Lebih tepatnya, semakin kuat Claude, semakin banyak generasi, pengiraan, konteks, dan masa ejen yang saling menahan satu sama lain.

01
Kesalahan pertama: Merusak ruang penghasilan kod
Tanda yang boleh dibaca mesin diletakkan di dalam teks biasa; cabaran teknikalnya ialah mengekalkan isyarat yang stabil sambil meminimumkan kesan terhadap kualiti penghasilan. Apabila sampai ke kod, masalah ini menjadi jelas lebih sukar, kerana taburan token bahasa semula jadi dan kod tidak sama.

Kertas kerja: https://arxiv.org/pdf/2301.10226
Bahasa semula seringkali mempunyai beberapa calon yang bermakna hampir sama. Maksud yang sama boleh diungkapkan dengan perkataan yang berbeza atau susunan ayat yang diubah, dan model mempunyai kelebihan penghasilan di banyak kedudukan. Salah satu pendekatan biasa untuk watermark teks ialah memanfaatkan kelebihan ini dengan mengubah sedikit kebarangkalian pengambilan antara token yang boleh diterima, sehingga mengumpulkan pola statistik yang mencukupi.
Kod tersebut mempunyai banyak lokasi entropi rendah. Selepas deklarasi pemboleh ubah, rujukan seterusnya hampir pasti hanya boleh menggunakan nama yang sama; medan JSON, tanda petik, dan tanda kurung tertakluk kepada pembatasan struktur yang ketat; parameter fungsi mesti mematuhi antaramuka; dalam laluan, reg eks, SQL, dan arahan Shell, perubahan satu token boleh secara langsung mengubah tingkah laku.
Dari segi taburan kebarangkalian, kedudukan-kedudukan ini sering sangat tajam. Token yang betul mempunyai kebarangkalian yang tinggi, manakala kandidat lain bukan sekadar bentuk alternatif, tetapi mungkin salah. Oleh itu, had utama yang dihadapi oleh watermark kod sebenarnya adalah kapasiti pengkodean.
Jika suatu posisi hanya mempunyai satu output yang munasabah, ia hampir tidak mempunyai ruang untuk membawa isyarat tambahan; jika sistem hanya menyematkan tanda pada posisi berentropi tinggi, ia akan menghadapi masalah kod yang pendek, nisbah token berstruktur tinggi, dan kurangnya posisi yang boleh dimanfaatkan.
Oleh itu, terdapat pertukaran langsung antara kekuatan pengesanan, kualiti penghasilan, dan ketahanan terhadap pengubahsuaian: isyarat yang terlalu lemah sukar untuk dikesan, sekatan yang terlalu kuat mungkin mempengaruhi penghasilan yang betul, dan untuk mengekalkan keupayaan pengesanan selepas pemformatan atau penulisan semula tempatan, diperlukan lebih banyak redudansi isyarat.

Anthropic tidak mengumumkan bagaimana tanda teks Claude secara spesifik mengubah pengambilan sampel, oleh itu tidak mungkin untuk mengaitkan perubahan kualiti Claude Code secara langsung kepada satu algoritma tanda air tertentu.
Yang boleh ditentukan di sini ialah perubahan lain: penghasilan kod sedang menanggung lebih banyak batasan. Selain kebenaran semantik dan pelaksanaan, ia mungkin perlu mematuhi protokol alat, format terstruktur, peraturan keselamatan, dan tanda sumber, manakala kebebasan kod itu sendiri untuk menyerap batasan tambahan ini jauh lebih kecil berbanding bahasa semula jadi.

02
Dosa kedua: Tahap model sedang berubah menjadi lengkung pengiraan
Perubahan yang dibawa oleh pemikiran adaptif Sonnet 5 bukan sekadar membuat model berfikir lebih lama.
Sebelum ini, apabila membincangkan Sonnet, Opus, Fable, mudah untuk memahaminya sebagai beberapa titik kemampuan tetap. Sekarang dengan penambahan effort, model yang sama boleh berada dalam pelbagai julat compute pada masa ujian, dan model itu sendiri sudah tidak lagi mewakili sepenuhnya berapa banyak kemampuan yang digunakan dalam satu permintaan.

Pautan rujukan: https://platform.claude.com/docs/en/build-with-claude/effort
Perubahan ini terutama jelas dalam Coding Agent. Semasa Claude menghadapi satu bug, ia tidak hanya perlu menghasilkan penyelesaian modifikasi, tetapi juga perlu menentukan fail mana yang perlu dibaca, rantai panggilan mana yang perlu diikuti, berapa banyak hipotesis cadangan yang perlu dikekalkan, sama ada perlu menjalankan ujian, sama ada terus memeriksa kebergantungan, dan bila ia menganggap bukti sudah mencukupi.
Tindakan-tindakan ini boleh dilihat sebagai satu pokok carian. Penglibatan pengiraan yang lebih rendah bermaksud cabang-cabang dipotong lebih awal dan penghakiman dibentuk lebih cepat; penglibatan yang lebih tinggi membolehkan model terus mencari dan mengesahkan, mengurangkan kebarangkalian melakukan tindakan secara langsung apabila bukti tidak mencukupi.

Pautan rujukan: https://platform.claude.com/docs/en/build-with-claude/effort
Therefore effort does not regulate mere thinking length, but rather the extent of search scope permitted for an Agent task. This will directly alter Anthropic’s model hierarchy.
If a routine coding task is already easy for Opus, increasing effort will likely cause Opus to quickly enter the performance plateau. Even with a stronger base model, Fable has little remaining difficulty to convert into a noticeable experience gap.
Pengguna perlu membayar perbezaan harga antara model sejak permulaan permintaan. Oleh itu, Fable lebih mudah menunjukkan nilai melalui tugas-tugas seperti kod asing, perancangan berperingkat, operasi lintas alat, pelaksanaan autonomi jangka panjang, dan tugas yang memerlukan pemulihan selepas ralat berlaku.

Pautan rujukan: https://www.anthropic.com/news/claude-opus-5
Ini bermakna perkara yang dijual oleh model tingkat tinggi sedang berubah. Ia tidak lagi menjual hanya “jawapan yang lebih kuat dalam putaran ini”, tetapi kebolehpercayaan tambahan dalam trajektori yang lebih kompleks.
Masalahnya ialah, kelebihan ini memerlukan tugas yang cukup panjang untuk dapat berkembang, dan apabila tugas diperpanjang, kemampuan model bukan lagi faktor penentu utama, kerana keadaan konteks mulai memainkan peranan utama.

03
Kesalahan ketiga: Mampu menyimpan sejarah dalam jumlah besar, tetapi tidak mampu mengurus status semasa
Melihat konteks 1M, ia mudah dipahami sebagai satu memori kerja yang besar, jadi apabila Claude hanya menggunakan 200K atau 300K token dan sudah mulai melewatkan, mengulang, atau mengalami kekeliruan status, ia terasa sangat tidak intuitif.
Tetapi tetingkap konteks mengukur kapasiti, bukan konsistensi status. Sesi Agen panjang bukanlah dokumen statik, tetapi sejarah pelaksanaan yang terus ditambahkan.

Pautan rujukan: https://platform.claude.com/docs/en/build-with-claude/context-windows
Sebuah fail mungkin dimodifikasi beberapa kali; satu bug awalnya dianggap sebagai masalah cache, kemudian ditemui berasal daripada konkuren; satu ujian mungkin gagal terlebih dahulu, kemudian berjaya, dan gagal semula kerana modifikasi baru. Kandungan lama tidak akan dipadam secara automatik apabila status berubah, kandungan baru hanya ditambahkan seterusnya.
Masalah yang muncul di sini bukan hanya retrieval. Model tidak hanya perlu mencari maklumat yang berkaitan dengan tugas semasa, tetapi juga menilai sama ada maklumat tersebut masih sah pada masa kini.
Fungsi lama dan fungsi baru sangat serupa, log ujian lama dan log ujian baru mengandungi banyak token yang sama, dan analisis yang telah dibatalkan mungkin juga berkaitan secara semantik dengan masalah semasa. Attention tidak sukar untuk menemui kandungan ini, tetapi yang sukar ialah menentukan hubungan cakupan di antara mereka.
Pangkalan data boleh mengekalkan keadaan semasa melalui nombor versi, masa kemas kini, transaksi, dan medan eksplisit, manakala konteks bahasa semula jadi biasanya tidak mempunyai struktur seperti ini. Ia lebih dekat dengan log hanya-tambah, di mana model perlu mengembalikan dunia semasa daripada urutan peristiwa.

Pautan rujukan: https://platform.claude.com/docs/en/build-with-claude/context-windows
Oleh itu, kerumitan konteks panjang tidak berpadanan secara ringkas dengan peratusan penggunaan token. Dokumen statik 250K token mungkin jauh lebih mudah diproses berbanding sejarah Agen 250K token, kerana yang terakhir mengandungi banyak objek yang telah diubah, penilaian sementara, keputusan alat, dan keadaan yang telah luput.
Sejarah pemikiran akan menambah lagi kompleksiti ini. Bukan sahaja disimpan dalam sesi itu “apa yang berlaku”, tetapi juga mungkin “mengapa keputusan itu dibuat pada masa itu”. Jika penalaran awal dibina berdasarkan andaian yang kemudiannya dibantah, penalaran itu masih mungkin terus terlibat dalam penilaian seterusnya kerana sangat berkaitan dengan soalan semasa.
Jadi, batasan sebenar 1M konteks bukan hanya berapa banyak maklumat yang boleh dimuatkan, tetapi sama ada model masih mampu memulihkan versi semasa dengan stabil apabila versi sejarah objek yang sama semakin bertambah.

04
Dosa keempat: Yang dipadatkan adalah sejarah, yang dihasilkan semula adalah status
Semasa konteks terus bertambah, compaction kelihatan seperti kaedah semula jadi: memendekkan sejarah lama, kemudian meneruskan pelaksanaan. Tetapi compaction dalam senario Agen bukanlah perkara yang sama dengan ringkasan biasa.
Apabila meringkaskan artikel, kehilangan satu contoh hanya mempengaruhi kelengkapan maklumat; apabila memampatkan jejak Agen, kehilangan satu syarat had yang masih berkesan boleh mengubah laluan pelaksanaan seterusnya.

Pautan rujukan: https://platform.claude.com/cookbook/tool-use-context-engineering-context-engineering-tools
Kerana kompaksi harus menangani bukan "mana kandungan yang penting", tetapi "mana kandungan yang masih berlaku sekarang". Sejarah mungkin mengandungi tugas yang telah selesai, penilaian yang kemudian dibatalkan, batasan antaramuka yang masih berkuasa, keputusan ujian yang telah luput, dan workaround sementara. Kompaktor perlu menyusun semula status masa ini menjadi satu perwakilan yang boleh digunakan untuk peringkat seterusnya.
Jika "Sekarang diduga masalah berasal dari cache" dipadatkan menjadi "masalah berasal dari cache", anggapan sementara menjadi fakta; jika satu skema yang telah ditinggalkan masih dimasukkan ke dalam ringkasan, agen berikutnya mungkin kembali mengikuti laluan lama; jika satu batasan penting tidak dimasukkan ke dalam ringkasan, ia bahkan mungkin tidak lagi dilihat oleh model.
Oleh itu, ukuran utama compaction bukanlah kadar pemampatan, tetapi keaslian status. Ini juga merupakan sebab mengapa Git, ujian, fail tugas, memori, dan handoff terstruktur menjadi semakin penting dalam Agent jangka panjang.
Mereka bukan sekadar menambah maklumat yang boleh dilihat oleh model, tetapi memindahkan beberapa keadaan yang perlu berlaku dalam jangka panjang daripada sejarah bahasa semula jadi ke sistem luaran. Git menentukan versi kod semasa, ujian memberikan keputusan yang boleh diverifikasi, fail tugas merekodkan status penyelesaian, dan keadaan terstruktur membezakan kesimpulan semasa dan cubaan sejarah.
Konteks boleh mengekalkan sejarah yang kaya, tetapi tidak boleh menanggung tanggungjawab pengurusan status sepenuhnya dalam jangka panjang.

Pautan rujukan: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

05
Dosa Kelima: Model memperbaiki Bug yang diciptakannya sendiri, kesalahan menjadi semakin besar
Masalah-masalah sebelumnya masih boleh difahami sebagai bagaimana model memproses input. Agen melangkah lebih jauh lagi, kerana ia akan secara aktif mengubah persekitaran.
Dalam perbualan biasa, kesilapan model biasanya kekal dalam teks output. Agen boleh memodifikasi kod, menjalankan arahan, memasang bergantung, dan menyesuaikan konfigurasi, kemudian membaca hasil baru yang dihasilkan daripada tindakan-tindakan ini.
Oleh itu, kesalahan bukan lagi hanya kesalahan penilaian, tetapi juga menjadi perubahan persekitaran. Andaikan Claude menilai salah satu bug sebagai masalah cache, lalu mengubah logik cache, mekanisme percubaan semula, dan beberapa titik panggilan. Ujian kemudian menghasilkan serangkaian pengecualian baru.
Kesan-kesan ini adalah benar, tetapi ia bukan hasil semula jadi ralat asal, tetapi dihasilkan daripada pengubahsuaian sebelumnya. Ini akan menyebabkan Agen memasuki mod kegagalan yang sangat khusus: model mula menganalisis taburan data yang ia cipta sendiri.

Pautan rujukan: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
Jika ia dapat mengenal pasti "kesilapan-kesilapan baru ini muncul selepas perubahan sebelumnya", ia masih boleh dikembalikan dan andaian asal diperiksa semula; jika hubungan sebab-akibat ini tidak dibina, kesilapan-kesilapan baru mungkin terus dianggap sebagai masalah-masalah berasingan dan dibaiki satu demi satu.
Pada masa ini, setiap langkah operasi tempatan mungkin mempunyai asas, tetapi keseluruhan trajektori tugas telah menyimpang daripada masalah asal. Oleh itu, kebolehpercayaan agen panjang tidak boleh dinilai hanya berdasarkan kadar kebenaran setiap langkah. Yang lebih penting ialah, selepas ralat memasuki persekitaran, sistem mampu mengesan, mengaitkan, dan memulihkan.
Git diff boleh memberitahu model perubahan apa yang baru berlaku, ujian boleh mengesahkan sama ada sesuatu tingkah laku telah rosak, checkpoint dan rollback boleh menghadkan penyebaran ralat, manakala evaluator bebas boleh memberikan pengesahan tambahan di luar penjelasan model sendiri.
Fungsi komponen-komponen ini, pada dasarnya, adalah untuk meningkatkan kemampuan koreksi berputar kepada Agen.

Pautan rujukan: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

06
Penutup: Yang hilang dari Benchmark ialah kebolehpercayaan trajektori
Banyak benchmark mengukur: apakah model dapat menyelesaikan tugas apabila diberikan persekitaran yang telah diinisialisasi. Agen sebenar menambahkan satu tahap kesukaran lagi: persekitaran akan berubah secara berterusan mengikut tindakan model itu sendiri. Oleh itu, dua model yang mempunyai kadar kejayaan akhir yang hampir sama mungkin memberikan pengalaman sebenar yang sangat berbeza.
Satu model mungkin sangat tepat pada peringkat awal, tetapi sekali tersesat, ia terus memperbaiki di sepanjang jalan yang salah; model lain mungkin tidak jauh lebih kuat pada setiap langkah, tetapi mampu mengenal pasti dengan lebih cepat bahawa satu ubah suai mencipta masalah baru, kemudian membatalkan dan memilih jalan lain.
Melihat hanya titik akhir, sukar untuk membezakan dua tindakan ini. Jika tugas Agen diperpanjang, indikator yang lebih bermakna akan menjadi berapa banyak keadaan kunci yang kekal selepas pemadatan, sama ada langkah yang memperkenalkan ralat boleh dikenal pasti selepas perubahan salah berlaku, sama ada keadaan tugas dalaman terus sejajar dengan alam sebenar semasa panggilan alat bertambah, dan berapa besar kos yang perlu dikeluarkan untuk pulih selepas menyimpang.
Indikator-indikator ini tidak mengukur seberapa pintar satu respons, tetapi sama ada satu trajektori boleh kekal terkawal.
Secara keseluruhan, beberapa kategori masalah yang baru-baru ini diungkapkan oleh Anthropic sebenarnya berada pada pelbagai tahap yang berbeza. Selepas masalah-masalah ini muncul secara berpusat, batasan teknologi Claude juga mulai berubah.
Dahulu lebih seperti bertanya sama model sama ada ia boleh menyelesaikan satu soalan tertentu, tetapi kini lebih sukar ialah perkara lain: selepas tugas berjalan selama beberapa jam, melalui puluhan putaran panggilan alat, beberapa kali pemampatan status dan pelbagai pengubahsuaian kod, adakah sistem masih mampu mengekalkan satu dunia semasa yang boleh dipercayai?
Kemampuan model terus meningkat, hanya dapat meningkatkan had setiap langkah penilaian. Kebolehan Agent panjang untuk berfungsi secara stabil semakin bergantung pada satu set kemampuan lain: sama ada keadaan jelas, tindakan boleh disahkan, dan ralat boleh dipulihkan.
