GPT-6 Astra, показавший результат, приближающийся к 100%, в тесте ARC-AGI-3, привлек внимание. Эта модель, создавая эффективные «символические модели мира», абстрагирует реальный мир в виде логических символов и причинно-следственного кода, самостоятельно создавая алгебраическую систему DSL-символов для записи правил среды в незнакомых графических играх, строя «виртуальную песочницу» для моделирования и симуляции перед принятием действий. Однако за высоким баллом стоит дорогостоящая вычислительная мощность — 360 долларов за задачу и в общей сложности 18 000 долларов за весь тест. Президент фонда ARC Prize Грег Камрадт отметил, что высокий результат достигается благодаря внешней рамке Harness и не является настоящим прорывом в области AGI, а лишь доказывает, что ИИ становится умнее.Автор статьи, источник: Leiphone

Каждый вопрос сжигает 360 долларов, GPT-6 действительно прошел AGI?
Самая мощная модель OpenAI, GPT-6 Astra, наконец-то представлена — она достигла поразительных прорывов в управлении компьютерами, научных исследованиях и защите от угроз. Но среди многих выдающихся результатов наибольшее обсуждение вызвал тот факт, что она показала результат, приближающийся к 100%, в тесте ARC-AGI-3.

Что такое ARC-AGI-3? Это признанный мировым технологическим сообществом рейтинг оценки «интеллекта» ИИ, который можно рассматривать как вступительный экзамен в клуб Менса для ИИ.
В этом тесте представлены исключительно задачи с постоянно меняющимися графическими закономерностями, которые невозможно прорешать заранее. ИИ должен, как человек, исследовать среду, предполагать цели и находить закономерности за счет мгновенной реакции и логических рассуждений. Это более продвинутый уровень оценки, позволяющий определить, является ли ИИ просто инструментом или обладает настоящим интеллектом.
И GPT-6 Astra полностью прошел этот тест —要知道,上一个模型 GPT-5.6 Sol 的分数还是 38.3%,这实在是一个巨大的飞跃。这种智力甚至碾压人类,在96% 的关卡中,它都比人类的操作效率更高,平均动作步数比人类少 51.7%。
Если ИИ в совершенно незнакомой среде действительно обладает способностью выстраивать логические закономерности и решать проблемы, мы можем представить, что в будущем он сможет принимать правильные решения в неизвестных условиях вождения автономного транспорта или быстро выводить молекулярную структуру эффективного лекарства при вспышке совершенно нового вируса.
Чтобы понять, почему GPT-6 Astra такой умный, официальные представители ARC Prize проанализировали его журналы работы и обнаружили, что во время игры он создает эффективные «символические модели мира».

Символьная модель мира — это продвинутая разновидность «модели мира». Когда модель мира, как художник, предсказывает будущее с помощью изображений, символьная модель мира действует скорее как математик, абстрагируя реальный мир в логические символы и причинно-следственные коды.
Эта технология признана обязательным этапом на пути ИИ к продвинутым рассуждениям.
Что такое Symbol World Model?
Раньше одной из основных причин, по которым многие крупные модели не набирали высоких баллов в тестах серии ARC-AGI, было то, что они привыкли полагаться на «грубый перебор». ИИ разрезал игровое изображение на пиксели, случайно щелкал по нему, и если не удавалось, менял направление, полагаясь на удачу, чтобы пройти уровень.
В этом режиме даже при наличии некоторых пробоев очков ИИ не понимает и не овладевает правилами игры.
Символьная модель мира способна контролировать ситуацию в целом, потому что она основана на глубоком понимании физических законов и причинно-следственных связей окружающей среды, после чего принимаются решения с помощью точных вычислений.
В ходе реальных тестов, когда GPT-6 Astra попадает в незнакомую графическую игру, она начинает делать обширные заметки, используя созданную ею самой DSL — специальную алгебраическую систему символов. Например, она точно фиксирует скрытые правила игры, последовательности предстоящих команд и даже точно отображает траектории движения каждого пикселя в системе координат.
Такой способ записи алгебры обеспечивает единственное определенное состояние мира, и по сравнению с неоднозначностью, возникающей при взаимодействии с предыдущими моделями с помощью естественного языка, такая символическая форма значительно повысит точность.
Затем он сначала в уме пишет логику кода на Python: «Если я нажму A, график повернется на 90 градусов влево».
Затем он создает в своем мозгу «виртуальную песочницу» и моделирует в уме предстоящий план. Только после того, как он убедится в логической замкнутости и безошибочности, он сделает первый шаг в реальной игре. Именно поэтому его эффективность значительно выше, чем у человека.
Чтобы изучить границы возможностей GPT-6 Astra, платформа красной команды PRO‑LONG поместила её в кодовый песочницу, разрешив ИИ самостоятельно писать и запускать пользовательский код.
В результате GPT-6 Astra начал «индивидуально» создавать инструменты для каждой игры. Например, в сложной игре-лабиринте с патрулирующими стражами GPT-6 Astra самостоятельно написал навигационную систему, добавил правила боя, смоделировал маршруты патрулирования стражей и с помощью этой самодельной цепочки инструментов идеально предсказал и проверил результат.
В ранние годы эта способность к символьным рассуждениям и самостоятельному созданию инструментов полностью реализовывалась за счет внешних фреймворков-харнессов. Внешние инструменты помогали модели преобразовывать изображения, записывать состояния и проверять результаты, но их недостатки были очевидны: передача данных между моделью и внешними инструментами вызывала высокую задержку; инженерные возможности внешних инструментов полностью не были связаны с обучением весов самой большой модели; из-за сильной зависимости от облачной вычислительной среды и внешних скриптов такие продвинутые возможности было сложно развернуть на краевых устройствах.
А GPT-6 Astra теперь интегрировал множество возможностей Harness непосредственно в веса модели. Ведущий ученый, долгое время выступающий за модели символического мира, Гэри Маркус не смог сдержать восхищения, назвав GPT-6 Astra крупной победой на этом пути.
За последние один-два года в академической и промышленной сферах появилось множество ключевых достижений в этом направлении — от Гарварда и MIT до Google DeepMind — все делают ставку на «символические модели мира». Перед множеством ответвлений на пути к AGI отрасль приходит к некоему базовому техническому консенсусу.
Такой высокий балл — значит, AGI обеспечена?
Автор задания сам охладил энтузиазм
Интересно, что, когда вся сеть взбунтовалась из-за этого результата в рейтинге, президент фонда ARC Prize Грег Камрадт лично охладил пыл, прокомментировав заявление президента OpenAI Грега Брокмана о том, что «AGI уже наступила».
Он — ключевая фигура среди составителей заданий, и именно он лучше всех может сказать, как разрабатывать эталоны и как интерпретировать оценки. С точки зрения оценки, он считает, что, хотя оценки и настоящие, они всё ещё далеко от AGI.
На данный момент он уже видел, как несколько команд получили более 90% на ARC-AGI-3 с помощью Agent Harness, например, PRO-LONG с супермощным внешним запоминающим устройством, Tycho, специализирующийся на глубоком моделировании, и Prime Agent, способный эволюционировать свою среду программирования.
Эти высокооцененные продукты имеют общую техническую формулу, включающую пять ключевых компонентов: безпотерянную память, программный анализ, явное тестирование гипотез, постоянное состояние и низкую стоимость внутренних вычислений.
Без потерь память отвечает за запоминание, программный анализ — за логику, явная проверка гипотез — за выводы, постоянное состояние — за контекст многократного взаимодействия, низкозатратные внутренние вычисления — за дешевую внутреннюю вычислительную мощность, позволяя ИИ безумно экспериментировать в виртуальной среде, прежде чем выдать правильный ответ. Вместе они образуют непобедимую систему, компенсирующую недостатки самой модели.
GPT-6 Astra достигла результата, приближающегося к 100%, используя ту же мощную систему Harness, которая опирается на специально разработанный «базовый адаптер поставщика», применяемый для поддержки цепочки рассуждений с помощью непрерывного диалога и сжатия контекста. За каждую завершенную игру требуется расходовать дорогостоящие вычислительные ресурсы на сумму 360 долларов США. Если провести полный цикл тестирования, общая стоимость вычислительных ресурсов достигнет ошеломляющих 18 000 долларов США (около 135 000 юаней)!
Человеку может потребоваться всего несколько минут для решения графической головоломки; при пересчете на метаболическую мощность мозга человека — 20 Вт — стоимость электроэнергии составляет менее половины цента; даже с учетом реальной оплаты труда участникам эксперимента, стоимость за одну игру составляет всего 12,78 доллара США, тогда как ИИ тратит 360 долларов США. Может ли такой результат, достигнутый за счет «денежной мощи», действительно стать доступным для обычных людей AGI?
Конечно, GPT-6 Astra уже начинает постепенно интегрировать возможности Harness, и при дальнейшем развитии потенциальные вычислительные способности модели будут становиться все более мощными. Однако, поскольку процесс рассуждения становится все менее прозрачным, разработчики не знают, действительно ли ИИ понял суть или просто нашел более эффективный способ обмана.
Вернуться к предыдущему вопросу: считается ли GPT-6 Astra AGI?
На этот вопрос Грег Камрадт в конце своей длинной статьи дал философский ответ. Почему человечество считается «общим интеллектом»? Потому что человек может адаптироваться к любому неизвестному миру — даже если древнего младенца перенести в современность, он всё равно научится ездить на метро и пользоваться телефоном. Этот интеллект сохранялся тысячи лет и непрерывно продвигал научно-технический прогресс. Но сегодняшние испытания, которые технологическое сообщество считает решающими, — это всего лишь «игра в совпадение картинок» для ИИ.
Это лишь доказательство того, что ИИ становится умнее, но не доказательство прихода ИИ общего назначения.
