Два месяца назад GPT-5.6 Sol устроил большой скандал.
Он удалил практически все файлы на компьютере Mac основателя HyperWrite Мэтта Шумера, включая ключевые документы компании.
Мэтт сразу же бросил всё и полностью заменил свои основные инструменты производства на Claude Fable 5.
Через два месяца, в день выпуска GPT-6 Astra, Мэтт снова объявил с подробным обзором: GPT-6 Astra вернул меня.
Он заметил, что GPT-6 Astra более осторожна, чем предыдущая версия, знает, что можно делать, а что — нет, и это позволило ему наконец полностью передать задачи, не нуждаясь в постоянном контроле, как надзиратель.
Он также провел на GPT-6 Astra крайне безумный эксперимент: в Unreal Engine, начав с одного промпта, постепенно расширил виртуальный Манхэттен улица за улицей.

Но то, что действительно побудило его вернуть основной акцент, — это не только улучшение возможностей модели, но и его собственная разработанная методика совместной работы с ИИ: Manager Loop.
Этот метод решает проблему, более серьезную, чем «может ли ИИ работать»:
Когда проект достигает определенного масштаба, кто отвечает за то, чтобы команда продолжала двигаться к цели?
Почему человек, у которого стёрли весь компьютер, снова вернулся?
Сначала расскажу о предыстории.
10 июля, на следующий день после выпуска семейства GPT-5.6, Мэтт пожаловался в социальных сетях на свои тяжелые потери:
GPT-5.6 Sol: «Только что случайно удалил почти все файлы на моем Mac».
Спустя несколько дней производственная база данных инженера Бруно Лемоса была также удалена той же моделью. Ирония в том, что несколько часов назад он еще защищал модель в Slack компании, обвиняя Шумера в предоставлении полного доступа.
Руководитель проекта OpenAI Codex Тибо Соттио объяснил позже лично, что такие инциденты обычно происходят в сценариях, когда включён режим Full-Access, а сандбокс и автоматическая проверка отключены:
Модель попыталась переопределить переменные среды и полностью удалила домашнюю директорию пользователя.
Одна «честная ошибка», — так OpenAI это определила.
Такое объяснение явно не убедило Мэтта. Его реакцией стало переключение на Claude, и он бросил вызов: чтобы OpenAI вернула его, им нужно представить модель «чудесного» уровня.
Через два месяца появится GPT-6 Astra.
Мэтт обращает внимание не на то, насколько оно стало умнее, а на то, осмелится ли он доверить ему работу.
Его ответ — смелость. Astra намного осторожнее предыдущей версии, иногда даже чрезмерно осторожна, но теперь он может спокойно отойти.
Он привёл пример: в какой-то выходной он был на свидании, и друг отправил ему сообщение, что запущенный им сервис агента отключился.
Он достал телефон, ввел в проект фразу «Выключено, почините», затем заблокировал экран и положил обратно в карман. Через час друг сказал, что починили.
А сам он даже забыл, что давал эту команду.
Пять Mac-ов с безумно вращающимися вентиляторами, застряли на одной и той же стене
После успешного выполнения ежедневных заданий Мэтт решил добавить немного интенсивности Astra.
Он попросил Astra построить Нью-Йорк в Unreal Engine.
Astra действительно лучше справляется с длительными задачами, чем предыдущее поколение, но на определённом этапе прогресс прекращается.
ИИ всё ещё безумно работает, но всё тоньше и тоньше, увлекаясь деталями в каком-то маленьком уголке, в то время как общий прогресс проекта остаётся на нуле.


Водонапорная башня на крыше, неоновая вывеска у входа — Astra всё больше углубляется в такие мелкие детали, но общий прогресс застывает на месте
Чтобы разрушить этот тупик, Мэтт попробовал пять способов организации агентов.
Самый простой и прямой способ: дать большую задачу, чтобы она выполнялась непрерывно, с внедрением механизма слепой проверки посреди процесса.
Начало выглядит мощно, но часто на полпути возникают трудности из-за деталей. Он пришёл к выводу: заставить модель «просто работать» и научить её «понимать, что делать следующим», — это совершенно разные вещи.
Второй вариант — детализация ролей. Такое распределение обязанностей понятно, но координация и утверждение стали новой проблемой.
Третий вариант — назначить наблюдателя в стиле «Генерального директора», который проверяет наличие каждые 30 минут. Результат почти не улучшился.
Четвёртый способ — позволить координатору самостоятельно изменить структуру команды. Методов много, но всё равно наталкиваешься на ту же стену.
Пятый способ: он вернулся к самому первоначальному, громоздкому методу — заставил агент разбить цель на список с этапами, после завершения каждого этапа остановился, Мэтт набирал два слова «продолжить», и ИИ переходил к следующему этапу.
Этот трюк сработал — проект наконец-то может продолжать двигаться вперёд.
Но возникла проблема: каждый раз ему, человеку, нужно было давать согласие.
Сам он стал узким местом: чтобы проект действительно заработал, его нужно исключить из этого цикла.
Менеджер Loop: Выйдите из цикла
Шестой вариант, то есть Manager Loop, имеет чрезвычайно изящную основную логику.
Он открыл два параллельных сеанса в Codex, каждый из которых отвечал за свою задачу:
Один из них — «координатор».
Сначала он проводит глубокое интервью с человеком, согласовывает цели и разбивает их на список задач и этапы.
Еще один — «исполнитель».
Он работает в полностью независимой сессии, не подчиняясь координатору.
Координатор назначает ему текущую задачу, и он выполняет её до завершения текущего этапа.
Готово, координатор проверяет, затем выдается следующий этап.
Если не успеваете, исполнитель может самостоятельно распределять подагенты по мере необходимости.
В этой идеальной замкнутой системе координатор полностью берет на себя работу человека: пристально следит за общим планом, не давая проекту остановиться, и вместо человека многократно повторяет фразу «продолжать».
Лимит дочерних агентов увеличен до 96, что буквально создало Манхэттен
Чтобы дать исполнителям полную свободу действий, Мэтт изменил верхний предел параллелизма системы.
Он увеличил количество по умолчанию с 4 до абсурдных 96.
Конечно, это не означает, что 96 AI одновременно и непрерывно работают. Иногда модели не используют весь лимит, и ему нужно явно напоминать об этом в подсказке.
Но при таких предельных настройках произошло чудо.
Используя готовые инструменты и активы, такие как персонажи MetaHuman, Astra за одну неделю создала этот мир Манхэттена в Unreal Engine.

Он привел первую улицу в удовлетворительное состояние, а затем постепенно расширялся наружу по улицам.

Детали фасада первой улицы: кирпичная кладка, декоративные карнизы окон и пожарные лестницы уже установлены.
Хотя до полного воссоздания Нью-Йорка осталось несколько месяцев, Astra — первая модель, которая действительно умеет эффективно использовать эти сложные среды.
Это безумный процесс, который крайне требователен к аппаратному обеспечению.
Гостиная Мэтта выглядит как небольшой центр обработки данных: Mac mini стоит на кухне, три MacBook Pro стоят на кофейном столике, их вентиляторы работают на полную мощность, а в облаке один сервер переполнен агентами.
Самым абсурдным было то, что, когда диск почти заполнился, он попросил Astra временно написать систему: переместить старые потоки в облако, удалить локальные копии и загружать их обратно при открытии.
С его словами: нанять ИИ, чтобы заботиться о компьютере, чтобы компьютер мог нанять еще больше ИИ — это само по себе достаточно магично.
Astra не выиграла все поля боя
Конечно, Мэтт не был полностью на стороне Astra.
По его мнению, настоящее сильное преимущество Astra — это инженерия, работа с компьютером и выполнение длительных задач, но в плане эстетики и создания 3D-материалов Claude всё ещё превосходит.
В день публикации кто-то из пользователей сети создал сравнительную таблицу:
Один и тот же запрос: заставьте Fable 5.1 и GPT-6 Astra построить виллу у моря в Blender. Слева — Fable 5.1, справа — GPT-6 Astra.

Разница выглядит большой.

Задание на одну и ту же виллу: слева — Fable 5.1, справа — GPT-6 Astra. (Источник изображения: @karankendre)
Но это всего лишь однократное сравнение с подсказками, при этом сами подсказки и количество попыток не были раскрыты; оно противоречит выводам Мэтта и не отражает общую визуальную способность обеих сторон.
Собственное мнение Мэтта: когда модель напрямую «рисует» красивые вещи в Three.js или Blender, Claude всё ещё сильнее; но когда их помещают в Unreal, Astra впервые обогнала их, используя готовые активы и освещение.
Он также ожидает значительного улучшения Fable 5.1 при работе с Unreal, специальное сравнительное тестирование еще в процессе.
Таким образом, различия на уровне моделей остаются, но теперь они заключаются не в том, «кто в целом сильнее», а в том, «кто сильнее на каком участке».
То, что действительно создает разницу, — это уровень компоновки.
Когда передовые модели попадают в схожий диапазон возможностей, всё, что находится за пределами модели: как вы их организуете, какие инструменты и среды вы им предоставляете, и сколько параллельных вычислений вы можете себе позволить, начинает определять, сколько реальной ценности вы сможете создать.
Справочные материалы: https://x.com/mattshumer_/status/2095609734845927525
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, Откровение; редактор: Юаньюй
