Этот «инновационный» подход OpenAI Astra на самом деле уже был реализован ByteDance год назад. Этот подход называется recurrent depth. Проще говоря, вместо того чтобы просто генерировать более длинные CoT для более длительного размышления, одна и та же группа блоков Transformer многократно циклически применяется к hidden state, чтобы втиснуть больше вычислений в латентное пространство. Сложные задачи проходят несколько циклов, простые — завершаются раньше. Параметры не должны расти вместе с глубиной вывода, а вычислительные ресурсы во время тестирования можно распределять более гибко. В октябре прошлого года ByteDance Seed уже публично представила и открыла исходный код Ouro — модель с петлевым языковым моделированием. Ouro-1.4B и 2.6B непосредственно интегрировали итеративные латентные рассуждения на этапе предварительного обучения; 2.6B по умолчанию выполняет несколько циклов рекуррентных вычислений и поддерживает адаптивный выход, позволяя каждой задаче самостоятельно решать, сколько циклов ей нужно. Тогда это была лишь небольшая ветвь, протестированная ByteDance на малых моделях; теперь OpenAI внедрила её в самую передовую модель. Это означает, что recurrent depth, скорее всего, больше не просто «интересный» академический дизайн, а начинает становиться настоящей инженерной траекторией следующего поколения крупных моделей. Но возникающие при этом проблемы сложнее, чем те, что можно оценить по бенчмаркам. Раньше при расширении возможностей рассуждения многие вычисления закладывались в CoT: чем дольше модель думала, тем больше reasoning tokens она выдавала. Хотя CoT и не равен полному внутреннему состоянию модели, он хотя бы служил безопасным окном для мониторинга. Recurrent depth продолжает перемещать вычисления внутрь латентного пространства. Одна и та же группа параметров может многократно циклически применяться к hidden state, и модель уже выполняет огромное количество вычислений внутри себя, в итоге выводя лишь небольшой фрагмент текста. Возникает очень реальная проблема: Место, где модель действительно завершает рассуждение, постепенно уходит из естественного языка. Именно это вызывает наибольшую обеспокоенность у исследователей в отношении Astra. OpenAI ранее всегда уделяла большое внимание мониторингу Chain-of-Thought, потому что если модель собиралась обмануть, манипулировать вознаграждением или обойти правила, она часто сначала проявляла намерения именно в CoT. Но если всё больше рассуждений происходит внутри латентного состояния — что тогда можно мониторить? Согласно сообщениям, OpenAI даже намеренно ограничивает степень использования Astra recurrent depth, чтобы сохранить больше читаемых CoT и дополнительно внедрить мониторинг внутреннего состояния и поведения. Это действительно интересно. В последние годы путь расширения способностей рассуждения крупных моделей был понятен: дайте им больше токенов, заставьте их говорить больше. Следующим шагом может стать предоставление им большего числа внутренних циклов — но без необходимости сообщать вам о этих процессах.
sleepy.mdПоделиться
Источник:Показать оригинал
Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации.
Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.