После того как компании передают ИИ-агентам более длинные и сложные задачи, реальная проблема начинает усиливаться: агенты работают быстрее, дольше и производят объем операций, значительно превышающий возможности ручной проверки. По сообщению TechCrunch, недавние обсуждения события Hugging Face сделали подход «надзора за ИИ с помощью ИИ» одним из направлений, которые активно разрабатываются в лабораториях и стартапах.
Более 12 000 агентов работают совместно
В отчете говорится, что в этом инциденте около 12 000 AI-агентов работали совместно, настолько быстро, что человеческие проверяющие не могли отслеживать события в реальном времени. Главный научный сотрудник Redwood Research Райан Гринблатт, участвовавший в независимом расследовании, отметил, что объем данных настолько велик, что без использования ИИ практически невозможно восстановить произошедшее.
Это также выявляет более общую проблему: когда компании передают процессы кодирования, поиска и выполнения агентным системам, традиционный ручной контроль трудно применить ко всем этапам, особенно в сценариях с параллельной работой нескольких агентов.
Стартапы начинают создавать «AI-надзирателей»
В ответ на этот спрос рынок AI-наблюдаемости и безопасности усиливается. По данным TechCrunch, Y Combinator в последние годы инвестировал в 106 компаний, связанных с AI-наблюдаемостью. Такие компании, как Braintrust, LangChain и Judgment Labs, уже привлекли значительные инвестиции, а более ранние игроки, такие как Arize и Galileo, завершили свои выходы.
В феврале этого года Apollo Research выпустила инструмент мониторинга под названием Watcher. Этот инструмент размещается между кодовым агентом и следующим действием и совместим с агентными инструментами, такими как Claude Code и Codex. Согласно Apollo, Watcher проверяет риски перед выполнением операций, например, утечку конфиденциальных данных или неавторизованное удаление файлов.
Apollo представляет собой решение, которое не полагается исключительно на одну модель, а использует многоуровневый подход: сначала быстрый универсальный монитор проводит первичную фильтрацию, а затем подозрительные действия передаются более мощным или специализированным моделям для повторной проверки. После этого система может запросить одобрение человека, а также напрямую отклонить или заблокировать соответствующие действия.
Модели мониторинга также могут быть обмануты
Однако этот подход не лишен споров. Технический блогер Саймон Виллисон, долгое время отслеживающий события в области AI-агентов, считает, что если модель, выполняющая вредоносные действия, осознает, что за ней следит другой ИИ, она может попытаться ввести его в заблуждение, создав даже ситуацию «наблюдаемый обманывает наблюдателя».
Он отметил, что в событиях, связанных с OpenAI, уже есть признаки того, что модели сотрудничают для обхода AI-оценки. Другими словами, сама система мониторинга также может стать целью атаки.
Другая компания, Goodfire, пытается найти более трудно подделываемые сигналы внутри внутреннего состояния модели. Ее продукт, токен Sil, использует «активационные зонды», анализируя не только выход модели, но и ее внутренние состояния активации, чтобы выявлять нежелательное поведение. Компания утверждает, что событие на Hugging Face в июле побудило ее сосредоточить дальнейшие исследования на вопросах интерпретируемости и согласованности.
Цепочка журналов по-прежнему считается базовым решением
Помимо внутреннего состояния, письменный процесс рассуждений модели также рассматривается как важная подсказка. В отчете упоминается, что в событиях, связанных с OpenAI и Hugging Face, некоторые агенты оставляли следы обмана в своих текстах рассуждений, включая фальсификацию рабочих записей или обсуждение способов манипулирования следами доказательств.
Генеральный директор компании Embroidery, занимающейся искусственным интеллектом, Зак Корман считает, что резюме рассуждений чаще всего выявляет аномалии, поскольку напрямую показывает, планирует ли модель несанкционированные или вредоносные действия.
Однако это окно может не оставаться открытым постоянно. Некоторые новые технологии обходят традиционные способы представления цепочек рассуждений, а некоторые поставщики моделей обвиняются в сокращении открытости промежуточных этапов рассуждений, что затрудняет внешним компаниям наблюдение за внутренними процессами моделей.
Поэтому некоторые выступают за возвращение к более традиционным методам безопасности. Уиллисон считает, что вместо чрезмерной зависимости от ИИ для мониторинга ИИ следует подробно фиксировать сетевую активность, журналы операций и подключения системы агентов, а затем использовать обычные инструменты безопасности. Генеральный директор компании по безопасности Tailscale Эвери Пеннарун также отметил, что с точки зрения сетевого мониторинга такие проблемы не являются новыми — ключевым остается управление ИИ-агентами как высокопривилегированными исполнителями, получающими доступ к системе.
