OpenAI скоро выпустит новую модель «Astra», которая вызывает широкий интерес и споры в кругах исследователей ИИ — её производительность может обеспечить самый значительный прорыв с момента GPT-4, но новая технология рассуждений, лежащая в её основе, вызывает опасения по поводу снижения способности к мониторингу безопасности ИИ.Автор статьи, источник: The Information
Согласно сообщению технологического издания The Information от 2 сентября, Astra использует инновационную технологию, основная суть которой заключается в преодолении ограничений модели при «мышлении» над сложными задачами. Некоторые исследователи считают, что улучшение способностей Astra в программировании и использовании компьютеров может быть сопоставимо с производительностным прорывом, который OpenAI принесла при выпуске GPT-4 в 2023 году, и значительно превосходит результаты, достигнутые при выпуске GPT-5 прошлым летом. Это является положительным сигналом для всей отрасли, которая полагается на повышение производительности ИИ для обоснования крупных инвестиций в строительство центров обработки данных.
Однако это технологическое прорывное достижение также несет собой серьезные риски. Новая технология позволяет модели выполнять глубокие рассуждения без полного вывода «цепочки мышления», что означает, что исследователи могут не иметь возможности так же эффективно, как раньше, контролировать процесс рассуждений модели, ослабляя тем самым существующие механизмы безопасности. В настоящее время OpenAI предпринимает меры для обеспечения видимости цепочки мышления Astra, однако в отрасли сохраняются разногласия по поводу долгосрочных последствий этого компромисса.
Прорыв в производительности: новая технология вывода тесно связана с ключевыми прорывами Astra и такими концепциями, как «циклическая глубина» (recurrent depth) и «циклические трансформеры» (loop transformers).
Согласно сообщению The Information, эта технология обрабатывает вопросы, многократно передавая их через различные «слои» математических вычислений модели, чтобы сгенерировать следующее слово в ответе, позволяя модели демонстрировать способности к рассуждению, значительно превышающие ее собственный масштаб, — эффект, эквивалентный модели гораздо большего размера.
Некоторые исследователи считают, что за счет более мощных навыков кодирования и использования компьютеров производительность Astra может повыситься на величину, сопоставимую с прорывным прогрессом, наблюдавшимся при запуске GPT-4 в 2023 году, и значительно превзойти относительно споконную реакцию рынка при запуске GPT-5 прошлым летом.
Этот прогресс имеет важное значение для всего AI-производственного цикла. Текущее масштабное строительство центров обработки данных по всему миру основано на предположении, что постоянное улучшение AI-возможностей будет стимулировать рост производительности и, в конечном итоге, приведет к более высокой коммерческой прибыли. Если производительность Astra соответствует ожиданиям, это обеспечит надежную поддержку этой инвестиционной логике.
Стоит отметить, что эта технология не является новой концепцией. Пионер в области ИИ Юрген Шмидхубер на платформе X указал, что основная идея «рекуррентной глубины» фактически уже была изложена в его статье 2015 года «On Learning to Think» (arXiv:1511.09249).
Он отметил, что контролирующая сеть C в этой статье по сути является инженером подсказок, который обучается запрашивать независимые нейронные модели мира для проведения абстрактных рассуждений; сгенерированные подсказки и ответы представляют собой внутренние самопорождённые векторные последовательности, не требующие представления в виде естественного языка.

Угроза безопасности: механизм мониторинга цепочки рассуждений сталкивается с вызовами — новые технологии, хотя и повышают производительность, потенциально нарушают существующие рамки безопасности ИИ.
Согласно сообщениям, в настоящее время основные ИИ-модели при решении сложных задач обычно выводят свой процесс рассуждения в текстовой форме, известный как «цепочка мышления» (chain of thought). Этот механизм не только повышает объяснимость модели, но и является важным инструментом для исследователей в мониторинге поведения модели и предотвращении аномальных действий.
Согласно сообщению The Information, мониторинг цепочки рассуждений является одним из основных решений, предложенных OpenAI после хакерской атаки на Hugging Face в июле этого года для предотвращения повторения подобных инцидентов.
Однако новая технология вывода, используемая Astra, может не выводить полные шаги рассуждения при глубоком «мышлении» модели, а выполнять вычисления «молча» внутри модели. Это означает, что чем больше модель полагается на эту новую технологию, тем менее прозрачным становится ее процесс рассуждения для внешних наблюдателей.
В ответ на это OpenAI в настоящее время предпринимает меры для достижения баланса. Компания направляет модель на снижение количества циклов на вычислительном уровне, чтобы обеспечить сохранение определенной степени видимости цепочки рассуждений Astra — чем меньше циклов, тем меньше пространства для «молчаливого мышления» модели.
Крупные лаборатории уже следят за этим трендом; долгосрочные мониторинговые решения еще не разработаны — влияние этой технологии может выйти далеко за рамки одной только OpenAI. Согласно сообщению The Information, вышеупомянутая новая технология вывода стала горячей темой для внутренних обсуждений в крупнейших лабораториях ИИ, и вероятность того, что такие организации, как Anthropic и Google, будут использовать аналогичные подходы, нельзя недооценивать.
Несколько исследователей отметили, что мониторинг цепочки рассуждений никогда не станет окончательным решением для наблюдения за поведением ИИ. По мере постоянного развития возможностей моделей, способность моделей выводить процесс мышления в текстовой форме является в значительной степени побочным продуктом текущих методов обучения.
По мере того как разработчики моделей исследуют новые направления оптимизации и архитектурные решения, тенденция к спонтанному генерированию цепочек рассуждений моделью может постепенно ослабевать, и исследователям придется разрабатывать новые методы мониторинга.
Согласно отчету, текущая ключевая проблема заключается в том, будут ли крупные разработчики ИИ ради достижения более высокой способности к выводу сознательно отказываться от существующих мер безопасности под давлением все более острой конкуренции в производительности. Ответ на этот вопрос во многом определит направление дальнейшего регулирования безопасности ИИ.
