Anthropic’s Opus 5 створює 3D-світ «Володаря перснів» за допомогою ШІ

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту з’явилися, коли Opus 5 від Anthropic створив 3D-версію світу *Володаря перснів* за допомогою Three.js. Проект, який очолював дослідник ШІ Карпаті, використав 1 мільйон токенів, 2 години та 5 500 рядків коду. Модель відтворила початок роману у вигляді браузерної 3D-сцени, хоча результат був грубим та абстрактним. Новини про реальні активи (RWA) набирають популярності, оскільки експерименти з ШІ розширюють межі цифрових середовищ.

Не будемо багато говорити, почнемо щоденний відпочинок (doge)!

Щойно великий майстер Kapsi оголосив: «Ми», Anthropic, почали використовувати абсолютно новий підхід для підсилення великих моделей—

Володар перснів.

Оцінка великих моделей

За словами Капасі, цей «тестовий набір „Володаря перснів“» замінює колишній популярний SVG-тест «Пелікан на велосипеді».

Оцінка великих моделей

Капасі прямо передав початок «Володаря Перснів» Opus 5, щоб модель за допомогою Three.js згенерувала цілий «Середзем’я» в реальному часі.

Щодо кінцевого ефекту, він трохи нагадує китайські 3D-анімаційні фільми кінця 1990-х — початку 2000-х: дуже грубий і дуже абстрактний.

Але об’єктивно кажучи, якщо уважно подивитися трохи довше і ви випадково знайомі з місцями зйомок «Володаря перснів» у Гобітшані, Нова Зеландія, то справді можна помітити певну схожість~

Проте саме ця, здавалося б, не надто витончена річ, справді витратила Opus 5: 1 мільйон токенів, 2 години та 5500 рядків коду.

Звичайно, на сцені не лише Клауді одна така красива.

Найсмішнішим є новий блюдо, яке онлайн-користувачі подали на столі DeepSeek Версія V4 Flash.

Прямо цілий «китайці можуть літати», персонажі на зображенні всі плавають.

Зіштовхнувшись із цими зараз очевидними помилками, Капасі виявився досить об’єктивним.

Він зазначив, що Opus 5 наразі не може справді «ввійти» у світ, який він створює, і може лише робити скріншоти у різні моменти часу, а потім повільно перевіряти, де виникли проблеми.

А це саме виявляє очевидний недолік сучасних великих моделей:

Вони вже можуть писати код, створювати сценарії та генерувати ігри, але ще не можуть справді розуміти відео та не грають у ігри, які самі створили.

Дві години, самостійно створити Середземземля

Спочатку розглянемо, як саме проводиться цей тест «Володаря Перснів».

Якщо дотримуватися буквального змісту твіту Капасі, основним підказом для Opus 5 має бути початок першої глави «Очікувана вечеря» з «Володаря Перснів».

Оцінка великих моделей

Білбо Беггінс із Мешкотного Дірка оголосив про організацію величезного святкування 111-річчя, і в Гобіттоні негайно зашуміли…

Цікаві друзі можуть спробувати це самостійно.

Крім того, Капасі вказав у промпті Three.js — це бібліотека JavaScript для створення 3D-сцен за допомогою коду.

Отже, завданням Opus 5 є спочатку зрозуміти текст на початку «Володаря кілець», а потім перетворити його на 3D-світ, який може працювати в реальному часі в браузері.

Оцінка великих моделей

У процесі Opus 5 має складати фігур, будівель та реквізитів з багатокутників, розміщувати їх по координатам x, y, z, а потім налаштовувати камери, освітлення та анімацію.

Коли персонаж має рухатися, куди має повертатися камера, як мають змінюватися світлові ефекти та як мають взаємодіяти об’єкти в сцені — все це потрібно визначити за допомогою коду моделлю.

Хоча останній кадр не можна назвати витонченим, і часто з’являлися проблеми з проникненням моделей, плаванням тощо, наприклад, тіло та голова персонажа розділялися… але цілий сценарій хоча б був реально створений.

Оцінка великих моделей

Варто зауважити, що це не те саме, що відеомодель безпосередньо генерує пікселі кадр за кадром.

Three.js спочатку повинен створити персонажів, об’єкти та сцену як тривимірні об’єкти, а потім на основі коду в реальному часі обчислювати їхнє положення, кут та стан руху.

Отже, демо, яке ми бачимо, — це не звичайне відео, згенероване ШІ, а запис екрану з запущеного 3D-веб-сценарію.

Однак Капасі також зазначив у коментарях, що програмна 3D-генерація та відеогенерація — це не вибір між двома варіантами.

Хтось запропонував передати цей сирій запис екрану з Three.js у Seedance як еталонне відео, а потім використати відеомодель для перерендерингу з вищою якістю.

Оцінка великих моделей

Капасі швидко погодився.

За його задумом, програмний код може відповідати за сценарій та керування, спочатку визначивши, де стоятимуть персонажі, як рухатиметься камера та як розвиватиметься сюжет.

Потім надішліть запис екрану моделі Video-to-Video, щоб вона додала текстури, світло і деталі, і повністю підняла «зовнішній вигляд» всього Середзем’я.

Щодо аудіо, Opus 5 на цей раз не включив його в комплект.

Капасі зазначив, що через особисті вимоги до якості звуку було використано ElevenLabs.

Оцінка великих моделей

Так і з’явився відкриваючий демонстраційний відеоролик «Володаря Перснів» — з образами, кадрами та озвучкою.

Kapasi також відкрив повний проект з відкритим кодом, посилання на який можна знайти в кінці тексту.

Оцінка великих моделей

Нетівні набагато цікавіші за Капасі

Після того як Капасі випустив демо, багато користувачів інтернету також прийшли, щоб протестувати його.

Загалом можна сказати лише:

Ці вебкористувачі мають набагато більше уяви, ніж Капасі.

Хтось запустив проект «Earth Online» за допомогою Claude, метою якого є за допомогою групи AI-агентів охопити всю Землю Клік Побудовано.

Наразі агент ще не створив всю Землю, а лише збудував район прибережної зони Сан-Франциско у стилі лоу-полігон. Але з наявних зображень видно, що пропорції будівель, масштаб персонажів і загальний стиль збережені досить уніфіковано.

Цей ефект трохи схожий на анімаційні фільми у світі LEGO. Стиль нескладний, але персонажі, сцени та рухи стабільно функціонують в одному світі.

Продовжуйте в цьому напрямку — анімація у простому стилі та легкі ігри, які вже мають ознаки AI-натурального підходу.

Інші користувачі створили 3D цифрову модель Нью-Йорка за допомогою Fable 5 та GPT-5.6 Sol і підключили до неї дані в реальному часі.

Модель має не лише правильно розташувати вулиці та будівлі Нью-Йорка, а й зберігати просторові відношення між різними районами. Автор висуває ідею, що ця задача генерації віртуальних світів може стати новим стандартом для просторового міркування.

Ще більше вражаючого чекає вас далі.

Деякі користувачі, які не змогли купити квитки на концерт Канье Веста, просто за допомогою ШІ створили власний концерт у браузері.

Весь проект все ще побудований за допомогою Three.js. Є лише один HTML-файл, жодні готові 3D-моделі не використовуються; сцена, персонажі та освітлення створені повністю за допомогою коду.

На всьому концерті було підготовлено 14 пісень, кожна з яких мала власне світлове оформлення та унікальну сферичну сценічну візуалізацію.

Звичайні користувачі можуть прослуховувати фрагменти, а після підключення Spotify Premium — прослуховувати повні треки та повні виступи.

Не встиг купити квиток — прямо створив собі приватний показ, як же це гірко!

Ще не закінчилося!!!

Капасі також уявляє, що в майбутньому до цих 3D-світів можна додати геймплей, дозволяючи гравцям входити в них у ролі спостерігачів, НПС або навіть персонажів історії.

Результат: гравці вже створили версію гри, перш ніж Капасій міг це організувати.

Оцінка великих моделей

Цей проект також використовує Opus 5 та Three.js, дозволяючи не лише запускати та взаємодіяти, але й додаючи аудіо.

Більше прикладів 3D-дизайну з’являється постійно. Від архітектурних масштабів, планування простору до стилю сцен, Opus 5 вже здатний підтримувати відносну стабільність у проектах достатньо великого масштабу.

Інші приклади також є, але тут ми не наводимо їх усі.

Об’єктивно кажучи, ці твори ще не досягли справжньої зрілості як гри.

Чи цікаві різноманітні ігрові механіки, чи стабільно працюють вони тривалий час, чи гравці справді зможуть залишитися в ньому 15 хвилин — на ці питання поки що немає відповідей.

Але бар’єри для створення реального 3D-контенту та інтерактивних прототипів справді значно знижені.

Тим паче, що можна знайти новий спосіб перевірити здібності моделі, одночасно роблячи це досить цікаво та весело?

Пелікан, їхати більше немає

Тоді чому раптово потрібно, щоб велика модель згенерувала «Володаря перснів»?

Це треба починати з тесту «Пелікан на велосипеді», який став відомим кілька років тому.

Це питання походить від розробника Сімона Вілісона і має бути лише одним реченням:

Створіть SVG-зображення пелікана, який їде на велосипеді.

Оцінка великих моделей

Хоча це питання здається простим, воно дійсно перевіряє модель.

Оскільки SVG виглядає як зображення, але на нижньому рівні є рядок коду.

Модель повинна не лише знати, як виглядають пелікан і велосипед, а й розбити їх на лінії, кола та багатокутники, а потім розташувати кожен елемент за координатами.

Оцінка великих моделей

Ще важливіше, що пелікан і велосипед і так не дуже підходять один одному.

Рама, шини та педалі велосипеда повинні зберігати правильну геометрію; у пелікана ж великий дзьоб, короткі лапи та тіло, яке зовсім не схоже на те, що підходить для їзди на велосипеді.

Оцінка великих моделей

Поєднавши обидва, практично відразу видно, чи розуміє модель просторові відношення:

Чи крутиться колесо прямо, чи ноги дотикаються до педалей, чи птах справді їде на велосипеді, чи його розчленовано на рамі.

Подивіться на ці демонстрації кінця 2024 року~

Тому «пелікан на велосипеді» став класичним тестом для оцінки просторового розуміння, комбінування об’єктів та генерації коду великими моделями.

Оцінка великих моделей

Але зі зростанням потужності моделей цей пелікан скоро доїде до кінця.

Подивіться нижче DeepSeek R1 і DeepSeek З виконання V4 видно, що сьогоднішні моделі вже досить добре впоралися з цим завданням.

Оцінка великих моделей

Ще важливіше, один SVG може оцінити лише одноразовий вивід моделі.

Він не може виміряти, чи здатна модель планувати складний проект, працювати кілька годин поспіль та багаторазово перевіряти та виправляти власні помилки в тисячах рядків коду.

Таким чином, Капасі замінив невелике завдання «намалюй малюнок» на великий проект — «створи світ» —

Пелікан може виходити, Середземземля офіційно приймає естафету.

Оцінка великих моделей

Kapasi's Pelican

Швидко, новина про те, що Капасі змінює завдання для «Пелікан-тесту», дійшла до великих спільнот.

Високо оцінений коментар на Hacker News стверджує, що, хоча якість зображень у цих демонстраціях досить посередня, це саме й свідчить про те, що нам потрібен новий тест, складніший за генерацію окремого зображення.

Новий стандарт має оцінювати не лише здатність моделі правильно намалювати зображення, а й її здатність розуміти світ.

Оцінка великих моделей

В кінці кінців, «пелікан їде на велосипеді» вже дуже довго.

Моделі постійно встановлюють рекорди на цих завданнях, і різниця між ними стає все важче помітити.

Навпаки, створення повного 3D-світу вимагає від моделі розуміння просторових відношень між персонажами та об’єктами, обробки кадрів, рухів та змін сцен, а не просто виклику моделі генерації відео для виведення фрагмента зображення.

Оцінка великих моделей

Звичайно, хтось також висловив протидію.

Pelican test is concise, low-cost, and results are easy to compare.

Щоб протестувати модель, витрачати стільки токенів на генерацію цілого 3D-світу — це наче витрачати обчислювальну потужність на фейерверк.

Оцінка великих моделей

Тим часом, здатність Three.js самостійно вимірювати загальні здібності великих моделей також піддавалася сумнівам.

Деякі вважають, що такі демо можуть підтвердити лише те, що Anthropic добре навчила модель робити код Three.js, але не свідчать про справжнє розуміння простору та фізичного світу моделлю.

Але швидко знайшлися користувачі, які заперечили:

Перетворити абстрактний, нечіткий літературний текст у 3D-анімацію, де модель одночасно має обробляти просторові відношення, фізичні закони, повсякденні об’єкти, а також математичні задачі, пов’язані з 3D-перетвореннями та комп’ютерною графікою.

Якщо це ще вважати просто «вмінням писати Three.js», то це трохи недооцінює ці 5500 рядків коду.

Оцінка великих моделей

Ще один користувач поставив більш відкрите питання:

Чи справді «просторове міркування» відрізняється від міркувань, які великі моделі зазвичай використовують при обробці тексту та коду?

Одна з точок зору стверджує, що чи може зображення бути коректним, залежить від того, чи розуміє модель просторові відношення, такі як «попереду/позаду, всередині/зовні, далеко/близько, перекриття», а також відстань, кут і відносний розмір об’єктів при різних кутах огляду.

Оцінка великих моделей

Але інша думка полягає в тому, що незалежно від того, чи обробляє модель «поруч із каменем» чи «серед масиву», вона, ймовірно, робить те саме: генерує токени по одному на основі контексту, виконуючи міркування в процесі.

Якщо це так, то Opus 5 демонструє не лише раптово з’явившуся «просторову здатність».

Ймовірніше, що загальна здатність великих мовних моделей до розуміння тексту та коду почала природно поширюватися на тривимірний світ.

Від малювання пелікана до побудови середземного світу — завдання здаються змінилися, але, можливо, за ними завжди стоїть той самий питання:

Чи може модель перетворити своє розуміння світу на справжню працюючу структуру?

А в кінці, можливо, є ще більш дивне питання —

Якщо загальна велика модель вже може самостійно писати код для створення 3D-світу та викликати API, такі як Seedance та ElevenLabs, для генерації зображення та звуку, то наскільки необхідно користувачеві самостійно відкривати спеціалізований продукт для генерації відео та вводити запит?

Посилання для довідки

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

Цей матеріал з іншого каналу WeChat «Quantum Bit», автор: henry

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.