Ipinaglunsad ng Anthropic ang Claude Opus 5.5 na may 40% pagbawas sa gastos at pagkonsentrasyon sa pagkakaroon ng kumpiyansa sa mahabang gawain

icon币界网
I-share
AI summary iconSummary
I-launch ng Anthropic ang Claude Opus 5.5 noong Setyembre 22, 2026, na may 40% pagbawas sa gastos kumpara sa nakaraang bersyon. Ang modelo ay sumusuporta sa pangmatagalang pag-invest sa pamamagitan ng pagpapabuti ng kahusayan para sa mga habang gawain. Ito ay nakakahandle ng kumplikadong coding at pananaliksik, kabilang ang isang 680,000-line code migration sa loob ng higit sa isang araw. Ang update ay nagdaragdag ng proteksyon laban sa prompt injection at nakatuon sa real-world safety testing. Ang mga savings sa gastos ay nagkakaiba batay sa kumplikasyon ng gawain at paggamit ng mga tool.
Binibigyang-diin ng CoinDesk:

Ipinahayag ng Anthropic ang Claude Opus 5.5 noong Setyembre 22, na ang unang modelo sa seriyeng Claude 5.5. Ang pangunahing punto ng kompanya ay diretso: nagtataglay ito ng antas na katumbas ng Claude Fable 5.1 sa karamihan ng mga gawain, at 40% mas mababa ang gastos sa pagpapatakbo kumpara sa nakaraang bersyon na Opus 5. Ngunit ang tunay na dapat tandaan sa pagpapahayag na ito ay hindi lamang ang presyo at mga listahan, kundi ang pagpapalalim ng pagsubok ng Anthropic sa mahabang gawain, mga aksyon na hindi maaaring ibalik, at pagprotekta laban sa prompt injection.

Ayon sa opisyal, may malaking pagpapabuti ang Opus 5.5 sa kompleks na encoding, pananaliksik, at mga gawain na nangangailangan ng espesyalisadong kaalaman. Sa mga unang tester, may isang koponan na nakakumpleto ng paglipat ng humigit-kumulang 680,000 na linya ng code sa loob ng higit sa isang araw; pinahalagahan din ng Anthropic na ang modelo ay kayang panatilihin ang mas mahabang konteksto at tuloy-tuloy na plano. Ang mga kaso ay nagpapakita ng hangganan ng kakayahan, ngunit hindi ito maaaring gamitin bilang average na oras ng pagpapadala para sa lahat ng proyekto. Ang istruktura ng codebase, sakop ng pagsubok, at tao na pagsusuri ay magbabago sa resulta.

Ang pagbawas sa gastos ay hindi katumbas ng “budget version ng flagship,” kundi ang pagbabago sa hangganan ng paggamit ng modelo

Kanina, ang Opus ay karaniwang iniwan para sa mga pinakakomplikado at pinakamahal na gawain, habang ang pang-araw-araw na gawain ay hinihingi sa mga mas mabilis na modelo. Kung talagang makakamit ng Opus 5.5 ang antas ng Fable 5.1 sa mas mababang gastos, maaaring gamitin ng mga negosyo ang flagship model para sa mas malaking bilang ng code review, pag-analisa ng dokumento, at mga proseso ng pag-aaral, at hindi lang sa ilang mga mataas na halagang kahilingan.

Ang pagbaba ng gastos ng 40% ay ang opisyal na pahayag ni Anthropic kumpara sa Opus 5, at hindi ito nangangahulugan na magkakaroon ng parehong pagbaba ng 40% ang bawat negosyo sa kanilang taksil. Ang tunay na gastos ay nakadepende sa haba ng input at output, cache, bilang ng pagtawag sa mga kasangkapan, at kung kailangan bang ulitin ang gawain. Ang mas malakas na modelo ay maaaring mag消耗 ng higit pang kabuuang Token dahil sa mas mahabang gawain na ibinigay sa iyo. Kailangan ng mga nagbili na subukan ang “kabuuang gastos upang matapos ang isang gawain” gamit ang kanilang sariling workload, at hindi lamang ihambing ang presyo bawat yunit.

Ang kakayahan sa mahabang gawain ay dapat masukat din batay sa kalidad ng pagkumpleto. Maaaring magbigay ang isang malaking paglipat ng code ng maraming mga pagbabago na tila makatwiran, ngunit ang totoong gastos ay kasama ang regression testing, mga konplikasyon sa mga dependency, deployment, at rollback. Kung kailangan ng modelong iyon ng mga inhinyero na mag-ayos ng ilang araw para sa mga edge issues, ang pangunahing kahusayan ay mawawala. Ang pinakamahalagang pagtataya ay dapat mag-record ng success rate, bilang ng pagkakataong kinuha ng tao, at mga hindi maibabalik na pagkakamali, hindi lamang ang bilang ng code na nabuo.

Sinabi ng Anthropic na tinest ng mga externong evaluator tulad ng Frontier Design at METR ang Opus 5.5 bago ang paglabas. Ang pakikilahok ng mga externo ay nagpapataas ng kredibilidad, ngunit hindi ito katumbas ng pagpapalabas ng lahat ng mga report, orihinal na data, at mga environment ng pagsubok. Dapat pa ring magkaroon ng pagkakaiba ang mga user sa mga resultang isinampa ng kumpanya, mga resulta mula sa independiyenteng pag-evaluate, at mga resultang maaaring muling isulat sa kanilang sariling environment.

Ang security testing ay nagsisimula nang tumingin sa mga tunay na insidente kaysa sa pagtanggi lamang sa maikling tanong.

Sinabi ng Anthropic na ang Opus 5.5 ay nakamit ang pinakamabuting resulta ng kumpanya sa kanilang automated behavior audit. Ang pagsubok ay nakapalibot sa libu-libong simulated na sitwasyon, na may pangunahing teksto kung ang modelo ay magpapakita ng mga hindi madaling i-reverse na aksyon, kung ito ay lalabas sa mga hangganan na ibinigay ng user, at kung paano ito magpapakita sa harap ng prompt injection. Idinagdag din ng kumpanya ang mga imposibleng gawain, mas mahabang panahong gawain, at mga senaryo batay sa totoong insidente sa pagtataya.

Ito ay isang aralin na kailangang matutunan pagkatapos ng agent-based AI ay pumasok sa production environment. Karaniwang tinatanong ng tradisyonal na pagsubok sa seguridad kung ang model ay magiging sagot sa mga sensitibong tanong, ngunit ang mga agent na may kakayahang bisitahin ang web, gamitin ang terminal, at baguhin ang mga file, ay mas malaking panganib mula sa kanilang mga aksyon: maaari itong patuloy na magpapatupad sa ilalim ng maling priyoridad, o maaari ring kunin ang masasamang teksto sa web bilang mga utos. Isang maling pag-click o pagpapalawak ng pahintulot ay mas mahirap baliktarin kaysa sa isang hindi angkop na sagot.

Hindi ibig sabihin ng “mas kaunting paglabas sa hangganan” na “hindi magkakaroon ng paglabas sa hangganan”. Tinanggap nang malinaw ni Anthropic ang mga limitasyon ng modelo. Dapat pa ring gamitin ang prinsipyong minimum na karapatan, pagkumpirma sa pagkilos, traceable na log, sandbox, at mekanismo ng rollback sa pag-deploy ng negosyo. Lalo na sa production database, pagbabayad, at mga pagbabago sa infrastruktura, hindi dapat tanggalin ang pagpapahintulot ng tao dahil sa pagtaas ng safety score ng modelo.

Ito ang unang paglalabas ng modelo pagkatapos ng pagpapahayag ni Anthropic na “pabagalin ang ritmo sa harap.” Ang mensahe na gustong iparating ng kumpanya ay: patuloy na pagpapabuti ng kakayahan, samantalang isasama ang panlabas na pagtataya at mas malapit sa tunay na insidente ang mga pagsusuri sa kaligtasan sa proseso ng paglalabas. Gayunpaman, ang pagtataya kung matutupad ang pangako ay nakasalalay sa patuloy na paglalabas ng mga kaso ng pagkabigo, mga paraan ng pagsusuri, at epekto ng pag-aayos, hindi lamang sa pinakamataas na marka sa isang paglalabas.

Para sa mga gumagamit, ang pinakamahalagang susuriin sa Opus 5.5 ay hindi kung mas maganda ang mga sagot sa chat, kundi kung kayang itaguyod nito ang pagkakabound sa mahahabang oras, maraming kasangkapan, at maraming hakbang na gawain, at kung kayang huminto kapag kulang ang impormasyon. Ang kompetisyon sa merkado ng mga modelo ay nagbabago mula sa “sino ang mas matalino sa pag-sagot” patungo sa “sino ang kayang tapusin ang mga kumplikadong gawain nang may kontroladong gastos.” Ang pagbaba ng presyo ay nagbibigay ng mas maraming pagkakataon para subukan, ngunit ang kaligtasan at disiplinang inhinyero ang magdedesisyon kung makakapasok ba ang mga subok na ito sa produksyon.

Sa panahon ng pagsubok, maaari ng isang kumpanya magtatag ng isang simplengunit mahigpit na paghahambing: gamitin ang parehong hanay ng totoong gawain upang ihambing ang Opus 5, Opus 5.5, at mga mas mura model, at tandaan ang oras ng pagkumpleto, kabuuang gastos, rate ng pagpasa sa pagsubok, dami ng pagbabago ng tao, at bilang ng mga mataas na panganib na aksyon. Ang pag-upgrade ay may komersyal na kahulugan lamang kung ang lahat ng mga indikator na ito ay nagpabuti nang sabay-sabay. Ang demo sa araw ng paglabas ay angkop para sa pagkilala sa mga posibilidad, ngunit ang tuloy-tuloy na pagsusuri sa loob ng ilang linggo ang angkop para sa pagdedesisyon tungkol sa mga pribilehiyo at budget.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.