Метт Шумер використовує GPT-6 Astra для створення віртуального Манхеттена в Unreal Engine

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Метт Шумер оголосив про новий проект, який використовує GPT-6 Astra для створення віртуального Мангеттена в Unreal Engine. Після інциденту з втратою даних він перейшов з GPT-5.6 на Claude Fable 5, але повернувся до GPT-6 Astra через покращену надійність. Він використовував систему Manager Loop для координації AI-агентів. Хоча Astra добре впоралася зі складними завданнями, Claude залишається лідером у 3D-дизайні. Оголошення про проект підкреслює постійний розвиток AI на тлі змін у трендах інфляційних даних.

Два місяці тому GPT-5.6 Sol спричинив велику катастрофу.

Він видалив майже всі файли на комп’ютері Apple засновника HyperWrite Метта Шумера, включаючи ключові документи компанії.

Матт одразу кинув це і повністю замінив свої основні інструменти виробництва на Claude Fable 5.

Два місяці потому, у день випуску GPT-6 Astra, Метт знову оголосив глибокий огляд: GPT-6 Astra знову мене вигравла.

Він побачив, що GPT-6 Astra обережніша за попередню версію, розуміє, що варто робити, а що ні, і це дозволило йому повністю покласти роботу на неї, не потрібно більше стежити за нею, як наглядач.

Він також провів надзвичайно дикий експеримент на GPT-6 Astra: у Unreal Engine, почавши з одного вказівки, поступово розширив віртуальний Манхеттен вулиця за вулицею.

Unreal Engine

Але справжньою причиною його рішення повернути основні сили було не лише покращення здібностей моделі, а й його власний метод, який він розробив для спільної роботи з ШІ: Manager Loop.

Цей підхід вирішує проблему, яка смертельніша за «чи може ШІ працювати»:

Коли проект досягає певного розміру, хто відповідає за те, щоб команда постійно рухалася до мети?

Чому людина, у якої видалили весь комп’ютер, знову повернулася?

Спочатку розкажу про попередні події.

10 липня, на наступний день після випуску сімейства GPT-5.6, Метт пожалівся у соціальних мережах на свої жахливі втрати:

GPT-5.6 Sol: «Тільки що випадково видалив майже всі файли на своєму Mac».

Кілька днів потому база даних виробничого середовища інженера Бруно Лемоса була видалена тією ж моделлю. Жартома, за кілька годин до цього він ще захищав цю модель у Slack компанії, звинувачуючи Шумера у наданні повного доступу.

Тібо Сотійо, керівник інженерного напрямку OpenAI Codex, пізніше особисто пояснив, що такі інциденти зазвичай відбуваються у сценаріях, коли увімкнено режим повного доступу, а сандбокс і автоматичний контроль не активовано:

Модель намагалася переписати змінні середовища і в результаті повністю знищила домашній каталог користувача.

«Щирою помилкою», — так це визначив OpenAI.

Таке пояснення очевидно не переконало Метта. Його реакцією стало перехід до Claude та погроза: щоб OpenAI змогла повернути мене, їй потрібно представити модель «чудесного» рівня.

Через два місяці з’явиться GPT-6 Astra.

Метт звертає увагу не на те, наскільки воно стало розумнішим, а на те, чи наважується покласти на нього роботу.

Його відповідь — навісно. Astra набагато обережніша за попередню версію, іноді навіть надто, але він нарешті може спокійно відійти.

Він навів приклад: одного вихідного він був на зустрічі, і друг надіслав повідомлення, що його запущений агентський сервіс відключився.

Він витяг телефон, ввів у проект фразу «Вимкнено, виправте», і негайно заблокував екран, поклавши телефон до кишені. Через годину друг сказав, що виправив.

А він сам навіть забув, що давав цю команду.

П’ять Mac-ів з повною швидкістю обертання вентиляторів, застрягли на одній стінці

Після успішного виконання щоденних завдань Метт вирішив додати трохи інтенсивності Astra.

Він попросив Astra побудувати місто Нью-Йорк у Unreal Engine.

Astra справжньо краще справляється з довгими завданнями, ніж попередній покоління, але, як тільки вона досягає певного етапу, прогрес зупиняється.

Штучний інтелект все ще безперервно працює, але все докладніше, занурюючись у дрібні деталі певного кутка, тоді як загальний прогрес проекту залишається на місці.

Unreal Engine

Unreal Engine

Водяна башня на даху, неонова вивіска біля входу — Astra дедалі глибше вникає в такі дрібниці, але загальний прогрес зупинився

Щоб подолати цю ситуацію, Метт спробував п’ять способів організації інтелектуальних агентів.

Найпростіший і найгрубіший спосіб: надати велике завдання, щоб воно виконувалося постійно, додавши механізм сліпого огляду посередині.

Результат на початку вражає, але часто потім застрягаєш у деталях. Він зробив висновок: вимагати від моделі «постійно працювати» і навчати її «знати, що робити на наступному кроці» — це зовсім різні речі.

Другий спосіб — це деталізація ролей. Таке розподілення обов’язків зрозуміле, але координація та схвалення стали новою проблемою.

Третій варіант — це призначення наглядача у стилі «Генерального директора», який перевіряє наявність кожні 30 хвилин. Результат майже не покращився.

Четвертий спосіб — це коли координатор сам налаштовує структуру команди. Може бути багато варіантів, але все одно зустрічаєш ту саму стіну.

П’ятий спосіб: він повернувся до найпростішого методу — змусив агента розбити мету на список із етапами, після завершення кожного етапу зупинитися, а Метт набрав два слова «продовжити», і тоді ШІ переходив до наступного етапу.

Цей трюк справді спрацював — проект знову може поступово рухатися вперед.

Але виникла проблема: кожен раз потрібно, щоб цей людина дав згоду.

Він сам став обмеженням: щоб проект справді зацікавився, його потрібно вилучити з цього циклу.

Менеджер Loop: Вийдіть із циклу

Шостий варіант, а саме Manager Loop, має надзвичайно витончену основну логіку.

Він відкрив два паралельні сеанси в Codex, кожен з яких відповідав за свою справу:

Один із «координаторів».

Спочатку він проводить глибоке інтерв’ю з людиною, після чого обидві сторони згіджуються з цілями, а потім розбивають їх на список завдань та етапи.

Інший — «виконавець».

Він працює в повністю незалежному сеансі, а не підпорядкований координатору.

Координатор призначає йому завдання поточного етапу, і він продовжує працювати над ним до завершення.

Завершено, координатор перевіряє, потім розподіляє наступний етап.

Якщо зайнятий, виконавець може самостійно розподіляти підагенти за потребою.

У цьому ідеальному замкненому циклі координатор повністю взяв на себе роботу людини: уважно стежить за загальним планом, не даючи проекту зупинитися, і замість людини повторює фразу «продовжуйте».

Ліміт дочірніх агентів піднято до 96, щоб навмисно створити Манхеттен

Щоб дати виконавцю повну свободу дій, Метт змінив верхню межу паралелізму системи.

Він збільшив кількість за замовчуванням з 4 до дивовижних 96.

Звичайно, це не означає, що 96 AI постійно одночасно працюють. Іноді модель не використовує весь квоту, і йому потрібно прямо нагадувати в підказці.

Але при таких граничних налаштуваннях відбувається диво.

З використанням готових інструментів та активів (наприклад, персонажів MetaHuman), Astra за тиждень створила цей світ Мангеттена в Unreal Engine.

Unreal Engine

Він відремонтував першу вулицю до задоволення, а потім поступово розширювався від неї назовні.

Unreal Engine

Деталі фасаду першої вулиці: кирпична стіна, орнаменти над вікнами та пожежні сходи вже встановлені.

Хоча до повного відтворення Нью-Йорка залишилося кілька місяців, Astra — це перша модель, яка справді вміє ефективно використовувати ці складні середовища.

Це надзвичайно вимогливий до апаратного забезпечення безумний процес.

Гостиная Метта схожа з малим центром обробки даних: Mac mini стоїть на кухні, три MacBook Pro розташовані на кавовому столику, їхні вентилятори швидко обертаються, а в хмарі один сервер переповнений агентами.

Найбільш абсурдним було те, що коли диск майже заповнився, він попросив Astra тимчасово написати систему: перенести старі потоки до хмари, видалити локальні копії та завантажувати їх знову при відкритті.

Слова його: наняти AI, щоб турбуватися про комп’ютер, щоб комп’ютер міг наняти більше AI — це саме по собі досить магічно.

Astra не виграла всі битви

Звичайно, Метт не схилявся на користь Astra.

На його думку, справжня сила Astra — це інженерія, комп’ютерні операції та довготривалі завдання, але щодо естетики та створення 3D-матеріалів, Claude все ще перевершує.

У день публікації хтось з інтернет-користувачів зробив порівняння:

Одне й те саме завдання: нехай Fable 5.1 і GPT-6 Astra створять у Blender віллу біля моря. Зліва — Fable 5.1, справа — GPT-6 Astra.

Unreal Engine

Різниця виглядає великою.

Unreal Engine

Та сама вілла, зліва — Fable 5.1, справа — GPT-6 Astra. (джерело: @karankendre)

Але це лише один приклад порівняння, при якому не розголошено ні слова підказки, ні кількість спроб; це суперечить висновкам Метта і не відображає загальну візуальну здатність обох компаній.

Сам Метт вважає: коли модель безпосередньо «малює» гарні речі в Three.js або Blender, Claude все ще сильніший; але коли їх запускають у Unreal з використанням наявних активів і освітлення, Astra вперше обігнала.

Він також очікує значного покращення Fable 5.1 у роботі з Unreal, спеціальні порівняльні огляди ще ведуться.

Отже, різниця на рівні моделей все ще існує, просто змінилася з «хто повністю сильніший» на «хто сильніший на певному етапі».

Різницю справді створює шар компонування.

Коли передові моделі входять у схожий діапазон здібностей, те, що за межами моделі: як ви організовуєте їх, які інструменти та середовище надаєте, та скільки паралельних обчислень ви можете собі дозволити, починає визначати, скільки реальної цінності ви зможете отримати.

Джерело: https://x.com/mattshumer_/status/2095609734845927525

Цей матеріал зі сторінки WeChat «Новий розум», автор: АСІ Апокаліпсис; редагування: Юаньюй

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.