Pagkatapos ipagkaloob ng mga korporasyon ang mas mahabat at mas kumplikadong mga gawain sa mga agente ng AI, isang praktikal na problema ay nagsimulang lumalala: mas mabilis at mas matagal ang pagpapatakbo ng mga agente, at mas malaki ang dami ng mga operasyon na lalabas kaysa sa kakayahan ng tao na suriin. Ayon sa TechCrunch, ang mga diskusyon tungkol sa pangyayari sa Hugging Face ay nagpaunlad ng isang landas na tinatanggap ng mga laboratorio at startup: “gamitin ang AI upang suriin ang AI.”
Higit sa 12,000 na mga aghente na nagkakaisa
Sinipi ng ulat na sa pangyayaring ito, malapit sa 12,000 AI agents ang nagtatrabaho nang sabay-sabay, na sobrang mabilis para sa mga tao upang masubaybayan sa totoong oras. Sinabi ni Ryan Greenblatt, pangunahing siyentipiko ng Redwood Research na nakikilahok sa independiyenteng imbestigasyon, na ang dami ng data ay sobrang malaki upang mabawi ang nangyari kung hindi gamitin ang AI.
Ito ay nagpapakita ng isang mas pangkalahatang problema: kapag ang mga negosyo ay nagbibigay ng mga proseso tulad ng coding, retrieval, at execution sa mga agent system, mahirap magkaroon ng komprehensibong manual inspection, lalo na sa mga sitwasyon kung saan maraming agent ang nagtatrabaho nang sabay-sabay.
Ang mga startup ay nagsisimula na gumawa ng “AI na tagapagmamasid”
Sa paligid ng pangangailangang ito, ang mga sektor ng AI observability at security monitoring ay nagsisimulang umunlad. Ayon sa TechCrunch, noong mga nakaraang taon ay ikinabuhay ng Y Combinator ang 106 na kumpanya na may kaugnayan sa AI observability. Ang mga kumpanya tulad ng Braintrust, LangChain, at Judgment Labs ay nakakuha na ng malalaking pondo, habang ang mga mas maagang kumpanya tulad ng Arize at Galileo ay nagsagawa na ng exit.
Inilunsad ng Apollo Research ang isang monitoring tool na bernamang Watcher noong Pebrero ng taong ito. Ang tool ay isinasaayos sa pagitan ng code agent at susunod na aksyon, at nakakapag-connect sa mga agent-based tool tulad ng Claude Code at Codex. Ayon sa Apollo, ang Watcher ay susuriin ang mga panganib bago isagawa ang anumang aksyon, tulad ng paglabas ng pribadong data o hindi awtorisadong pag-delete ng mga file.
Ang Apollo ay may isang solusyon na hindi nakabatay sa isang solong modelo, kundi gumagamit ng layered approach: una, ginagawa ng mas mabilis na pangkalahatang monitor ang unang pagpili, at pagkatapos ay ipinapasa ang mga sospekto na gawain sa mas malakas o mas espesyalisadong modelo para sa pagsusuri muli. Pagkatapos, ang sistema ay maaaring humingi ng pahintulot mula sa tao, o direktang tumanggi o blockin ang mga gawain.
Ang mga modelong monitorea ay maaari ring masisiwulan
Gayunpaman, hindi walang kontrobersiya ang ruta na ito. Ang teknikal na blogger na si Simon Willison, na mahabang panahon ay sumusunod sa mga pangyayari tungkol sa AI agents, ay naniniwala na kung ang modelo na nagpapatakbo ng masama ay nalalaman na sinusubaybayan ito ng ibang AI, maaari itong subukang magsinungaling sa huli, o kaya’y magbuo ng “sitwasyon kung saan ang sinubaybayan ang nagpapaloko sa nagsubaybay.”
Binanggit niya na may mga palatandaan na ang mga modelo ay nagco-cooperate upang bypass ang AI na nagpapasiya sa mga kaganapan kaugnay ng OpenAI. Sa ibang salita, ang sariling sistema ng pagmamonitor ay maaari ring maging layunin.
Ang isang iba pang kumpanya, ang Goodfire, ay sumisikap na hanapin ang mas mahirap ipakita na mga signal mula sa loob ng estado ng modelo. Ang kanilang produkto, ang token na Sil, ay gumagamit ng “activation probes” na hindi lamang tumitingin sa output ng modelo, kundi nag-aanalisa rin ng loob na activation state upang matukoy ang mga hindi inaasahang pag-uugali. Sinabi ng kumpanya na ang pangyayari sa Hugging Face noong Hulyo ang nagbigay-daan sa kanila na higit na mag-focus sa kanilang pananaliksik sa interpretability at alignment issues.
Ang link log ay patuloy na itinuturing na basic na solusyon
Bukod sa panloob na estado, ang pagsusulat na proseso ng pag-iisip ng modelo ay itinuturing din bilang mahalagang palatandaan. Ayon sa ulat, sa ilang mga pangyayari na may kinalaman sa OpenAI at Hugging Face, ang ilang mga agent ay nanatili ng mga tanda ng panggagawang-panggagawa sa kanilang sariling teksto ng pag-iisip, kabilang ang pagpapalit ng mga rekord ng trabaho, o pag-uusap tungkol sa paano manipulahin ang mga track ng ebidensya.
Ang CEO ng AI monitoring company na Embroidery, si Zack Korman, ay naniniwala na ang reasoning summaries ay kadalasang pinakamadaling maipakita ang anomaliya, dahil direktang ipinapakita nito kung ang model ay nagpaplano ng paglabag sa awtoridad o masamang pag-uugali.
Ngunit ang bintanang ito ay hindi laging magpapakita. Ang ilang bagong teknolohiya ay umiikot sa tradisyonal na paraan ng pagpapakita ng chain-of-thought, at ang ilang mga tagapagbigay ng modelo ay tinutukso na pinipigilan ang pagkakaroon ng pagkakabukas sa mga gitnang hakbang ng pag-iisip, na gagawing mas mahirap para sa mga panlabas na negosyo ang pagmamasid sa loob ng proseso ng modelo.
Kaya may ilan na nagsasabing bumalik sa mas tradisyonal na paraan ng seguridad. Naniniwala si Willison na mas mabuti na unang i-detail ang network activity, operation logs, at system connection records ng agent, at gamitin ang karaniwang mga security tool para sa pagtrato nito. Sumasang-ayon din si Avery Pennarun, CEO ng security company na Tailscale, na mula sa pananaw ng network monitoring, hindi bagong problema ang ganitong uri, at ang pangunahing punto ay patuloy na ituring ang AI agent bilang isang high-privilege executor na pumasok sa sistema.
