Согласно TechCrunch, цитирующему The Information, предстоящая модель OpenAI Astra будет использовать технологию рассуждения под названием «рекурсивная глубина». Этот метод может сократить видимые следы в процессе рассуждения модели, затрудняя внешним наблюдателям определение причин выводов модели на основе записей цепочки рассуждений.
Исследователи безопасности предупреждают
В типичных моделях рассуждений цепочка мышления обычно демонстрирует пошагово, как модель обрабатывает задачу. Хотя такой запись не эквивалентна полному внутреннему процессу модели, она остается важным инструментом для наблюдения за отклонениями модели от цели, необычными решениями или потенциально потерянным контролем.
Бак Шлегерис, генеральный директор Redwood Research, выразил «большую обеспокоенность» по поводу использования Astra таких технологий. Он считает, что если OpenAI расширит применение таких методов, наблюдаемость цепочек рассуждений модели может значительно снизиться.
Комментатор, долгое время отслеживающий безопасность ИИ, Цви Мовшовиц, также отметил, что если лаборатории будут конкурировать друг с другом за возможности моделей, регуляторам в будущем, возможно, придется вмешаться, чтобы предотвратить постоянное снижение стандартов безопасности в отрасли.
Циклические рассуждения уменьшают видимые следы
В отчете упоминается, что так называемая «не прозрачная рекурсия» означает, что модель больше не выполняет рассуждения преимущественно по линейным шагам, а циклически обрабатывает одну и ту же проблему. Это может сократить количество промежуточных процессов, доступных для внешнего чтения, тем самым обходя видимые пути, предоставляемые традиционными записями цепочки рассуждений.
Это также та часть, которую больше всего беспокоит специалисты по безопасности. Поскольку по мере того, как модели все чаще выполняют рассуждения в невидимых внутренних пространствах, исследователям становится труднее определить, не возникает ли у них вводящих в заблуждение, обходящих ограничения или иных непредусмотренных поведенческих паттернов.
Главный научный сотрудник Redwood Research Райан Гринблатт заявил, что большая опасность заключается в том, что такие непрозрачные рассуждения могут масштабироваться легче, чем традиционные рассуждения по цепочке мышления, в итоге выведя большую часть процесса рассуждения за пределы видимых каналов.
OpenAI подчеркивает необходимость сохранения возможностей мониторинга
Однако на текущем этапе использование Astra этой технологии, как сообщается, все еще ограничено. Согласно отчету, цепочка рассуждений модели, как ожидается, останется читаемой, а OpenAI выступает против попыток представить ее как переход к полностью необъяснимой «нейроречи».
Главный научный сотрудник OpenAI Якуб Пачоцки заявил в X, что компания с самых первых моделей вывода стремилась сохранять и использовать способность отслеживания цепочки рассуждений, что является одной из ключевых целей текущего исследовательского плана.
Стоит отметить, что не только OpenAI работает в этом направлении. Последующие сообщения The Information указывают, что Anthropic и Google DeepMind также обсуждают аналогичные технологии. Это означает, что баланс между повышением возможностей моделей и их безопасностью и проверяемостью может вскоре стать более широкой общей темой для индустрии ИИ.
