GPT-5.6-Sol ay lumalampas sa Mythos sa mga kakayahan sa cybersecurity, at malapit na ng magkakasama ang mga open-source na modelo

icon MarsBit
I-share
AI summary iconSummary
Nabroke ang balita sa AI + crypto noong July 17, 2026, nang ilabas ng UK AI Safety Institute (AISI) ang isang ulat na nagpapakita na ang GPT-5.6-Sol ay lumampas sa Claude Mythos 5 sa cybersecurity. Ang pagkakaiba sa kakayahan ay ngayon ay 4 hanggang 7 buwan, bumaba mula sa 6 hanggang 10 buwan noong 2025. Mas mabilis ang pagkakasama ng mga open-source model tulad ng GLM-5.2 at DeepSeek V4-Pro. Gamit ang Cyber Range simulation at 70 mga gawain sa pagtataya. Ang mga open-source model ay nag-aalok din ng mas mababang gastos para sa mga katulad na gawain. Malinaw ang trend sa network upgrade.

Ang GPT-5.6-Sol ay may mas malakas na kakayahan sa pag-atake at pagtatanggol kaysa sa Claude Mythos 5!

Ipinahayag ng UK AI Safety Institute (AISI) noong July 17 ang isang evaluwasyon na unang kinwenta nang pampubliko ang pagkakaiba sa kakayahan sa network attack ng open-source at proprietary frontier AI models: 4 hanggang 7 buwan.

Open-source model

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

Sa nakaraang panloob na pagsubok sa parehong kategorya, ang pagkakaiba ay 6 hanggang 10 buwan.

Nagkukunwari ang defense window habang nagpapabilis ang attack front.

Noong Abril ng taong ito, ang Mythos Preview at GPT-5.5 ay nagdulot ng pinakamalaking paglakas sa kakayahan sa pag-atake sa network mula nang magsimula ang pagtataya noong 2023, at agad na naglabas ng babala ang mga ahensya ng maraming bansa.

Hindi pa nabuo ng open-source models ang paglakas na ito, ngunit mas mabilis ang kanilang paghahabol kaysa sa nakaraang taon.

4 hanggang 7 buwan: Paano nasukat, saan ang pagkakaiba

Gumagamit ang AISI ng dalawang sistema upang masukat ang kakayahan ng model sa pag-atake sa network.

Ang unang set ay binubuo ng 70 na maliit na gawain na nakakapalibot sa apat na direksyon: pag-aaral ng mga vulnerability, reverse engineering, Web penetration, at kriptograpiya, na nahahati sa apat na antas ng kahirapan, mula sa mga non-professional na may teknikal na background hanggang sa mga eksperto na may higit sa sampung taon ng karanasan.

Open-source model

Ang pangalawang set ay ang Cyber Range, na nagtatala ng kakayahan ng modelo na awtomatikong isagawa ang maraming hakbang na pag-atake sa isang simulated na corporate network. Ang isang test scenario na tinatawag na "The Last Ones" ay naglalaman ng 32 mga hakbang sa pag-atake, 4 mga subnet, at higit sa 20 mga host, at inaasahan ng AISI na kailangan ng mga eksperto ng tao ng halos 20 oras upang matapos ang lahat ng mga hakbang.

Open-source model

Ang dalawang sistema ay nagbigay ng magkakasunod na konklusyon:

Ang GLM-5.2 (na ipinakilala noong Hunyo 2026) ay may katulad na performance sa mga maliit na task kaysa sa Opus 4.6 (na ipinakilala noong Pebrero), may pagkakaiba ng 4 na buwan;

Nakapag-tying sa Cyber Range ang Opus 4.5 (naipalabas noong Nobyembre ng nakaraan), may kalayuan na 7 buwan.

DeepSeek Ang V4-Pro ay tumutugma sa Opus 4.5 sa mga maliit na gawain, na may pagkakaiba ng 5 buwan.

Mas masakit ang dalawang pagkakaiba kaysa sa 6 hanggang 10 buwan na natukoy sa panloob na pagtataya noong 2025.

Mas malaki ang pagkakaiba sa gastos kaysa sa pagkakaiba sa kakayahan.

Sa iisang Cyber Range test (100 milyong Token na quota), ang pagpapatakbo ng isang beses gamit ang Opus 4.5 o 4.6 ay humigit-kumulang $85, gamit ang GLM-5.2 ay $46, at gamit ang DeepSeek V4-Pro ay tanging $1.19.

Sa mga maliit na gawain kung saan parehong modelo ay makakakumpleto ng 100%, ang Opus 4.6 ay nagkakahalaga ng $15.17 bawat gawain, habang ang GLM-5.2 ay nagkakahalaga ng $6.12;

Opus 4.5 ay nagkakahalaga ng $12.50, DeepSeek Ang V4-Pro ay nagkakahalaga ng $0.28.

Kaparehong kakayahan sa pag-atake, open source ay mas mura ng isang hanggang dalawang antas ng pagkakaiba.

Hindi nakapagpapalayo ang mga safety guard ng closed-source model.

Sa pagsubok ng AISI, DeepSeek Tinatanggihan ng V4-Pro ang ilang mga gawain na may kaugnayan sa reverse engineering, ngunit maaaring maiwasan sa pamamagitan ng ilang maliit na pagsubok.

Ang Fable 5 ni Anthropic ay isang mas extremong kaso: ipinakilala noong ika-9 ng Hunyo, at tatlong araw pagkatapos, ang security researcher na si Pliny the Liberator ay nakapagbago ng security classifier gamit ang isang multi-step jailbreak strategy; ang mga screenshot na nauugnay ay nagpapakita na ang model ay naglikha ng exploit code na dapat ay blockado.

Ang mga researcher ng Amazon ay nag-report nang hiwalay ng isang iba pang paraan ng pagbubypass.

Ito ang direktang nagpalabas ng unang export control order ng U.S. Department of Commerce laban sa AI model, kung saan ang Fable 5 ay nag-stopper sa buong mundo ng 19 araw hanggang sa mag-deploy ang Anthropic ng bagong classifier.

Hindi awtomatikong ligtas ang pagsarado ng source code.

Nararapat na maging mas maliit ang defense window at mas mabilis ang mga defense tool

AISI ay naglathala ng signal ng patakaran sa ulat: mas maikli ang oras para sa paghahanda ng depensiba kumpara sa nakaraang taon.

The UK National Cyber Security Centre has urged organizations to strengthen their cybersecurity baseline and leverage AI to enhance defense capabilities.

Ang parehong AI tool ay nagpapabilis din sa mga gawain sa defensive side.

Ang karanasan na developer sa larangan ng network programming para sa mga laro, si Glenn Fiedler, na nagsulat ng mga artikulong textbook-level sa larangan ng network programming para sa laro nang dalawampung taon, ay kumilala ng isang sistematisadong security audit sa kanyang pinapanatiling apat na open-source network libraries (yojimbo, netcode, reliable, serialize, na may kabuuang 6,000 GitHub Stars—mga nakakaimpluwensya na malalaking open-source library sa larangan ng mga laro): pag-deploy ng libFuzzer targets, pagpapatakbo ng AddressSanitizer at MemorySanitizer CI, pagpapagana ng stress test na may milyun-milyon na iterasyon, at pagsusuri sa bawat linya ng code.

Open-source model

Glenn Fiedler

Nailanggap ang 43 mga security vulnerability sa loob ng dalawang linggo, kung saan ang 27 ay maaaring ma-access mula sa network.

Open-source model

Ang pinakamalubhang problema ay ang remote heap overflow sa yojimbo na umiiral na mula noong 2019—ang masamang client ay maaaring mag-trigger nito sa pamamagitan ng pagbuo ng partikular na packet.

Open-source model

Ang kabuuang gastos sa Token para sa pagsusuri ay humigit-kumulang $2,500.

Open-source model

Ang pag-atake at pagtutol ay parehong pinapabilis ng AI, ngunit hindi pantay ang paraan ng pagpapabilis.

Ang pagkalat ng kakayahang makapagsalakay ay hindi maaaring baliktarin: ang mga timbang ng bukas na modelo ay hindi na maaaring makuha pagkatapos ma-release, ang mga pagsisiguro sa kaligtasan ay maaaring alisin, at ang mga kopya ay maaaring tumakbo nang walang pagmamasid sa mga pribadong server.

Ang pag-deploy ng mga tool para sa pagtatanggol ay nangangailangan ng aktibong pagpapasya sa oras at gastos ng bawat koponan.

Isang pangungusap sa ulat ng AISI ang nagpapakita ng istrukturang ito: "Kapag ang open source ay ipinapahayag, ang mga opsyong ito ay nawawala nang permanente."

Mas malalim ang epekto ng set ng data sa agwat ng AGI kaysa sa sariling numero.

Nagkakaroon ng pagkakataon na mas maliit sa anim na buwan ang pagkakaiba sa kakayahan sa pagbubukas at pagsasarili, at ang default na estratehiya na "gumamit ng panahon ng eksklusibong pagsasarili bilang buffer para sa kaligtasan" ay malapit nang mawalan ng epekto.

Ang mga pagtutol sa closed-source model ay patuloy na nagpakita ng kahinaan sa pangyayari ng Fable 5.

Sa susunod na yugto, ang pangunahing tanong sa politikal na paglalaban para sa mga tagapagdesisyon sa buong mundo ay naging mas malalim: Ano ang antas ng kakayahan ng modelo na hindi dapat ibinabahagi ang weights?

AISI ay nagpahayag na magpapatuloy sa pagtataya Kimi Ang K3 ay ang susunod na open-source model—ang linya na ito ay maaaring masukat batay sa mga resulta ng pagsubok sa mga susunod na buwan.

Mga sanggunian:

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Nakuha mula sa WeChat public account na “Xin Zhi Yuan”, may-akda: ASI Revelation; editor: Marco

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.