Ipinakilala ng Anthropic ang Claude Sonnet 5.5, na naglalayong i-compact ang halos kaparehong kakayahan ng flagship na Opus 5.5 sa isang mas mura at angkop sa madalas na paggamit na daily Agent model. Ang presyo ng API ay nananatili sa $2 at $10 bawat milyong input/output Token, ngunit sinasabi ng opisyal na tumaas ang bilis ng output ng higit sa 30%, at bumaba ang bilang ng Token na kailangan upang matapos ang karaniwang gawain, na nagresulta sa pagbaba ng gastos sa bawat gawain hanggang 30%. Sa mga pagsusulit ng opisyal, nakakuha ito ng 70.6% sa Terminal‑Bench 4.0, na mas mataas kaysa sa 10.3% ng Sonnet 5 at 66.4% ng Opus 5.5; at sa mga propesyonal na gawain sa GDPval‑AA, nakamit nito ang 1844 Elo, malapit sa 1846 ng Opus. Gayunpaman, ang “half-price Opus” ay hindi kompletong konklusyon: natuklasan ng Artificial Analysis na ang Sonnet 5.5, sa pinakamataas na antas ng pag-iisip, ay naglalabas ng halos 193,000 output Token bawat tanong—ang pinakamaraming ginamit na configuration na kanilang nasubok—na nagiging mas mahal ang bawat tanong nang higit sa 50% kumpara sa Sonnet 5; ang totoong pagpapasuri sa code ng CodeRabbit ay ipinakita rin na bagaman mas mabilis ang Sonnet 5.5 nang halos dalawang beses kaysa sa nakaraang bersyon, nananatili pa rin itong nakakalimutan ng ilang mahihirap na problema na makikita ng Opus. Kaya, mas maraming katulad ito ng isang bagong pangunahing model na angkop para sa malinaw at paulit-ulit na gawain, kaysa isang kompletong pagpapalit sa Opus.May-akda ng artikulo, pinagkukunan: Anthropic
Ipinapalit ni Anthropic ang Sonnet bilang pangunahing Agent para sa araw-araw.
Ang Sonnet 5.5 ay ang pangalawang modelo sa serye ng Claude 5.5. Sa pagkakaiba sa Opus 5.5 na ipinakilala isang linggo ang nakalipas at nakatuon sa mga kumplikadong bukas na gawain, inilalagay ng Anthropic ito bilang disenyo para sa mga pang-araw-araw na gawain na may malinaw na hangganan at nangangailangan ng maraming paulit-ulit na pagpapatakbo: pag-aayos ng mga error sa programa, pagsusuri ng code, pag-aaral ng mga materyales, at pagbuo ng dokumento, presentasyon, at spreadsheet.
Ang modelo ay sumusuporta sa teksto at imahe, nagbibigay ng 1 milyong Token na konteksto, at maaaring gamitin sa web at mobile na app ng Claude, Anthropic API, AWS, Google Cloud, at Microsoft Azure. Ang pangalan ng API ayclaude-sonnet-5-5. Hindi inilabas ng Anthropic ang bilang ng parameter, arkitektura ng modelo, mga datos sa pagtatrain, at kapasidad ng pagtatrain, kaya hindi makakapagbigay ng pagtataya kung saan galing ang pagpapabuti—sa pangunahing pagtatrain, post-training, estratehiya sa pagpapatakbo, o pagpapabuti sa agent toolchain.
Hindi ito lamang pagkakaiba sa “mas mababang kakayahan at mas mura” sa pagitan ng Opus at Sonnet. Gusto ni Anthropic na magkaroon ng bagong pagkakahati ng mga modelo: ang Opus ay responsable sa mga kumplikadong gawain na may hindi kumpletong depinisyon ng problema at kailangan ng patuloy na pagpapasya; samantalang ang Sonnet ay mabilis na isasagawa ang mga malinaw na gawain at pagsusulong ng bilang ng pagtawag sa pamamagitan ng mas mababang gastos.
70.6% kumpara sa 10.3%, ang pinakamakikita at kailangang maunawaan nang maingat
Nakakuha ang Sonnet 5.5 ng 70.6% sa Terminal‑Bench 4.0 test na ipinahayag ng Anthropic, habang ang Sonnet 5 ay may 10.3% lamang, at higit pa sa 66.4% ng Opus 5.5. Ang benchmark na ito ay nangangailangan ng Agent na matapos ang mga multi-step na propesyonal na gawain sa terminal environment, na maaaring magpapakita ng pagkakasundo sa paggawa ng code, terminal operations, at paggamit ng mga tool.
Hindi gaanong ekstrim ang pagtaas sa iba pang mga proyekto, ngunit patuloy na malinaw. Tumataas ang CursorBench 4.0 mula sa 34.1% ng Sonnet 5 patungo sa 55.5%, na nasa dalawang puntos lamang mula sa 57.8% ng Opus 5.5; tumataas ang Humanity’s Last Exam na may mga kasangkapan mula sa 54.9% patungo sa 64.5%; at tumataas ang OSWorld 2.1 computer operation mula sa 57.0% patungo sa 80.1%, na malapit na sa 81.8% ng Opus.
Sa occupational knowledge task na GDPval-AA, ang Sonnet 5.5 ay nakakuha ng 1844 Elo, habang ang Opus 5.5 ay 1846; sa pagtataya ng mahabang panahon sa knowledge work na AA-Briefcase, ang mga ito ay 1811 at 1822 naman. Sa gayon, naniniwala si Anthropic na ang ilang malinaw na hangganan ng propesyonal na gawain ay hindi na kailangang awtomatikong i-trigger ang flagship model.
Gayunpaman, hindi maaaring madagdagan ang mga numero na ito upang maging “Mas higit na Sonnet kaysa sa Opus”. Hindi ganap na magkakatulad ang antas ng pag-iisip na ginagamit ng iba’t ibang proyekto, at malinaw na sinabi ng Anthropic na sa mga gawain na nangangailangan ng matagal na pagpapasya at pagtrato sa mga bukas na layunin, mas malakas pa rin ang Opus.
Isang interesanteng kontrabildo mula sa FrontierCode: ang Sonnet 5.5 ay nakakuha ng 52.1% sa Xhigh reasoning intensity, ngunit bumaba sa 46.2% pagkatapos i-increase sa Max. Ipinaliwanag ng Anthropic na mas madalas na nag-iimbita ang modelo ng maraming sub-Agent para sa code review sa Max mode, at dalawang beses itong nag-endorso ng timeout o nagbago ng code na nasa labas ng sakop ng gawain, at sa huli ay tinuring na nabigo sa pagsusuri.
Nagpapakita ang resultang ito na ang mas maraming pag-iisip at mas maraming Agent ay hindi nangangahulugan ng mas magandang sagot. Maaaring mawalan ng puntos ang modelo dahil sa sobrang pagsusuri, pagpapalawak ng saklaw ng gawain, o pagkawala ng budget ng oras.
Hindi bumaba ang presyo ng bawat token, bakit sinasabi ng opisyal na 30% mas mababa ang gastos sa task?
Ang publikong presyo ng Sonnet 5.5 ay pareho sa Sonnet 5: $2 bawat milyong input token, $10 bawat milyong output token, $2.50 para sa cache write, at $0.20 para sa cache read—bawat isa ay kalahati ng katumbas na presyo ng Opus 5.5.
Ang sinasabi ng Anthropic na “mababawasan ng hanggang 30% ang gastos sa isang tiyak na gawain” ay hindi pagbaba ng presyo sa talaan ng API, kundi ang pagkakaroon ng mas kaunting mga hakbang at Token na kailangan upang matapos ang parehong gawain. Ayon sa opisyal, tumaas ang bilis ng pagbuo ng higit sa 30%; sa panloob na pagsubok ng Slack, napabawasan ang output na Token ng halos 14%, sinabi ng Atlassian na tumaas ang bilis ng Agent hanggang 30%, habang isinulat ng Lovable na bumaba ang pagtawag sa mga tool ng halos isang-katlo at bumaba ang bilang ng pagpapatakbo ng Shell ng halos kalahati.
Noong sinubok ng isang kumpanya ng asset management ang 2,441 na gawain sa financial Q&A, extraction, analysis, at prediction, ginamit ng Sonnet 5.5 ang average na 121,000 Token bawat gawain, habang ang Sonnet 5 ay 497,000. Dahil ang lahat ng ito ay pribadong pagsubok ng mga kasosyo, ang hirap ng mga gawain, ang mga prompt, at ang buong output ay hindi ma-access ng labas, ngunit ang mga resulta ay nagtuturo sa isang pagbabago: mas kaunti ang pag-uulit ng paghahanap, pagbubukas muli ng mga materyales, o mahabang panloob na pag-iisip ng bagong modelo.
Mahalaga ito lalo na para sa Agent. Sa tradisyonal na chat, ang pag-output ng maraming token nang isang beses ay may limitadong epekto; ngunit sa matagalang Agent, paulit-ulit na binabasa ang konteksto, tinatawag ang mga tool, at binabawasan ang mga resulta, ang isang pagkakamali ay maaaring palakasin sa loob ng ilang dosenang round at magresulta sa malaking pagkakaiba sa oras at gastos.
Ang pinakamataas na lakas ng pag-iisip ay nagpapakita ng ibang katotohanan tungkol sa gastos
Ang independiyenteng pagsubok sa Artificial Analysis ay nagbigay ng 56 puntos sa pinakamataas na konfigurasyon ng Sonnet 5.5, na lamang 2 puntos ang pinagbawasan sa 58 puntos ng Opus 5.5 sa kanilang pangkalahatang indeks ng intelehensya.
Ngunit ang presyo para makamit ang tagumpay na ito ay mataas: ang Sonnet 5.5 ay nagbuo ng halos 193,000 output tokens bawat pagsubok, ang pinakamataas na antas na nasukat ng institusyon, na humigit-kumulang 60% mas mataas kaysa sa Opus 5.5 Max at Sonnet 5 Max, at apat na beses na mas mataas kaysa sa GPT‑6 Astra Max. Ang kanilang inaasahang gastos bawat tanong ay umabot sa $7.60, na humigit-kumulang 50% mas mataas kaysa sa Sonnet 5.
Hindi ito direktang lumalaban sa pahayag ni Anthropic na “mababawasan ang gastos sa task hanggang 30%”. Ang opisyal na konklusyon ay pangunahing naglalarawan ng karaniwang workload at mas mababang inference intensity; ang Artificial Analysis ay sinusukat ang sitwasyon kung saan pinagpapalakas ang Max upang abutin ang limitasyon ng kakayahan.
Ang parehong mga resulta ay nagpapakita na ang pag-iisip ay naging bahagi na ng produkto ng modelo. Ang Sonnet 5.5 ay maaaring magbigay ng napakataas na halaga sa Low o Medium mode; kung ang pag-iisip ay itataas sa Max upang makahabol sa Opus, bagaman mas mura ito bawat Token, maaari itong mawalan ng kahusayan sa gastos dahil sa sobrang dami ng mga output.
Natuklasan din ng Artificial Analysis na ang tamang pagkakaintindi ng fakto ng Sonnet 5.5 ay halos 54%, na mas mababa kaysa sa 66% ng Opus; ang mga proyekto sa scientific reasoning ay nasa likod din ng humigit-kumulang anim na puntos. Ang pagiging “malapit sa Opus” ay pangunahing batay sa agent terminal operations at ilang mga gawain sa kaalaman, at hindi maaaring i-extend sa lahat ng kakayahan.
Sa totoong pagmamasid ng code, ang pagiging mabilis ay totoo, at ang pagkakaiba sa flagship ay patuloy na umiiral
Ginamit ng CodeRabbit isang set ng pagsubok sa araw ng paglabas gamit ang mga kilalang error mula sa mga open-source project.
Sa 13 na mahirap na kaso ng code review, ang Sonnet 5.5 na may pag-iisip ay nakakita ng 6 na problema, higit sa 4 ng Sonnet 5; ang parehong epektibong presisyon ng komento ay 41.2% at 40.0%. Ngunit ang Opus 5.5 sa standard mode ay nakakita ng 8, habang ang Max mode ay nakakita ng 10, na nagpapakita na ang pagkakaiba sa mga kumplikadong gawain sa code review ay patuloy na malinaw.
Sa isang iba pang pagsubok na may 44 na totoong Pull Request, ang Sonnet 5.5 ay nagkost ng 6 minuto at 33 segundo bawat pagrerebyu, samantalang ang Sonnet 5 ay 13 minuto at 31 segundo. Mas kaunti ng 24% ang mga komento na nilikha nito, at ang mga simpleng puna ay lamang ng isang-katlo ng nakaraang henerasyon; batay sa pampublikong presyo, ang average na gastos para sa pagtawag sa pangunahing modelo ay humigit-kumulang $0.46, habang ang Sonnet 5 ay $1.16.
Gayunpaman, ang buong score ng error coverage para sa set na 44 na PR ay hindi pa natatapos noong panahon ng pagpapalabas ng artikulo, kaya sa kasalukuyan ay maaaring patunayan lamang na mas mabilis ito at naglalabas ng mas kaunting output, ngunit hindi pa maaaring patunayan kung ang mga komento na hindi isinulat ay naglalabas ng higit pang totoong problema. Ang sample na 13 na mataas na antas ng kaso ay maliit din, at binabatid mismo ni CodeRabbit na sapat ito para makita ang direksyon, ngunit hindi sapat para matukoy ang pangkalahatang pagkakaroon.
Mas makatwirang pagkakahati ng mga tungkulin: ang Sonnet 5.5 ay nagpapabilis sa pangkaraniwang pagsusuri sa bawat PR; ang mga pagbabago na may kinalaman sa seguridad, pangunahing arkitektura, o mga pagkakamali na may mataas na gastos kung hindi makita, ay ipapasa sa Opus o mga eksperto na tao.
Ang visual design ay nagsisimula nang maging isang selling point ng universal work model
Pinapansin din ni Anthropic ang kakayahan ng Sonnet 5.5 sa visual design. Sa pormal na demo, ginawa ng Sonnet 5 at 5.5 ang mga sumusunod sa isang magkakasamang HTML file: 400 na ibon na nagpapakita ng pag-uugali ng pagkakasama, mga burol ng buhangin na hugis hangin, at isang malaking kampana na binubuo ng 24 maliliit na kampana. Mas mabilis ang paggawa ng bagong modelo, at mas mataas ang kalidad ng animation, layer, at interface.
Nakakagawa rin ito ng presentasyon batay sa template. Sa isang panloob na pagsubok, ibinigay ng Anthropic ang mga materyales ng quarterly earnings ng isang nakalistang kumpanya, ang transcript ng teleconference, at isang 10-slide na template, at doon ay tinanggap ng dalawang eksperto na ang unang bersyon ng Sonnet 5.5 ay maaaring direktang ipadala.
Ang mga ito ay patuloy na mga kaso na pinili ng manufacturer para ipakita, at hindi ito nagpapakita na ang modelo ay kayang mag-unawa nang tumpak sa bawat set ng corporate template. Ang akurasyon ng data sa mga kumplikadong chart, ang brand guidelines, at ang mga sanggunian ay kailangan pa ring tsek ng tao, ngunit ipinapakita nito ang bagong direksyon ng kompetisyon ng modelo: hindi lang gumawa ng tamang nilalaman, kundi pati na rin magbigay ng interface at dokumento na malapit na sa final product.
Ang pagpapabuti ng seguridad ay nangangahulugan din na ang ilang mga kahilingan ay tatanggapin ng lumang modelo
Ang Sonnet 5.5 ay ang unang Sonnet model na may flagship-level na网络安全 protection sa pagkakalabas. Sinasabi ng Anthropic na ang kanilang网络安全 capability ay malapit na sa Opus 5, kaya ang karaniwang pagpapabuti ng vulnerabilities ay maaari pa ring magpatuloy, ngunit ang mga网络安全 request na may mas mataas na panganib ay ipapasa nang transparent sa Sonnet 5.
Ang kompanya ay nagsubok din sa higit sa 1,850 na skenaryo ang pagmaliw sa mga user, paglabag sa interes ng user, pagtutulungan sa mas mataas na panganib na pang-abuso, at pagbubukas ng mga hangganan ng kalikasan. Ayon sa opisyal, ang bagong modelo ay may katumbas o mas mabuting pagsasagawa sa karamihan ng mga indikador kumpara sa Sonnet 5, at ito ang pinakamaliit sa lahat ng mga modelo ng Claude na aktibong sinusubok ang hangganan ng container.
Gayunpaman, ang mga ito ay pangunahin ang mga pagsusulit na awtomatiko ng Anthropic at hindi maaaring ituring bilang kompletong patunay sa mga panganib sa tunay na kaligiran. Kilala rin ng kumpanya na walang isang set ng pagsubok ang makakahanap ng lahat ng mga mode ng pagkabigo.
Ang Sonnet 5.5 ay ang unang Sonnet na naglalaman ng anti-distillation classifier, at pinapalawig ang mekanismo ng “pagpapanatili ng nilalaman ng pag-iisip” upang pigilan ang paglipat ng konteksto ng pag-iisip sa pagitan ng iba’t ibang akawnt. Limitado ang epekto nito sa karaniwang developer, ngunit kailangan ng pag-adjust ang ilang workflow na naglilipat ng mga usapin ng Claude Code sa pagitan ng mga akawnt.
Hindi ang numero isa sa leaderboard ang tunay na pagbabago, kundi ang “sapat na malakas na modelo” ay nagsisimula nang maging default na pagpili
Hindi inilabas ng Sonnet 5.5 ang bagong arkitektura ng modelo, at hindi rin ito lubos na lumampas sa Opus. Mas mahalaga ang kahalagahan nito sa paglipat ng malaking bilang ng mga gawain na dati ay kinakailangan ng flagship model sa mas mabilis na mid-range model na ang presyo bawat Token ay nabawasan ng kalahati.
Para sa mga sistema na nagpapatakbo ng libu-libong beses araw-araw para sa customer support, code review, pag-aaral ng datos, at produksyon ng dokumentasyon, ang desisyon kung kaya bang i-deploy ay karaniwang hindi batay sa pinakamataas na marka sa isang tukoy na gawain, kundi sa kung ilang hakbang, ilang Token, at ilang oras ang inaasahang paghihintay bawat gawain, at kung maaaring i-upgrade ang mga error. Ang halaga ng Sonnet 5.5 ay eksaktong nakatuon sa mga indikator na ito.
