Не будемо багато говорити, почнемо щоденний відпочинок (doge)!
Щойно великий майстер Kapsi оголосив: «Ми», Anthropic, почали використовувати абсолютно новий підхід для підсилення великих моделей—
Володар перснів.

За словами Капасі, цей «тестовий набір „Володаря перснів“» замінює колишній популярний SVG-тест «Пелікан на велосипеді».

Капасі прямо передав початок «Володаря Перснів» Opus 5, щоб модель за допомогою Three.js згенерувала цілий «Середзем’я» в реальному часі.
Щодо кінцевого ефекту, він трохи нагадує китайські 3D-анімаційні фільми кінця 1990-х — початку 2000-х: дуже грубий і дуже абстрактний.
Але об’єктивно кажучи, якщо уважно подивитися трохи довше і ви випадково знайомі з місцями зйомок «Володаря перснів» у Гобітшані, Нова Зеландія, то справді можна помітити певну схожість~
Проте саме ця, здавалося б, не надто витончена річ, справді витратила Opus 5: 1 мільйон токенів, 2 години та 5500 рядків коду.
Звичайно, на сцені не лише Клауді одна така красива.
Найсмішнішим є новий блюдо, яке онлайн-користувачі подали на столі DeepSeek Версія V4 Flash.
Прямо цілий «китайці можуть літати», персонажі на зображенні всі плавають.
Зіштовхнувшись із цими зараз очевидними помилками, Капасі виявився досить об’єктивним.
Він зазначив, що Opus 5 наразі не може справді «ввійти» у світ, який він створює, і може лише робити скріншоти у різні моменти часу, а потім повільно перевіряти, де виникли проблеми.
А це саме виявляє очевидний недолік сучасних великих моделей:
Вони вже можуть писати код, створювати сценарії та генерувати ігри, але ще не можуть справді розуміти відео та не грають у ігри, які самі створили.
Дві години, самостійно створити Середземземля
Спочатку розглянемо, як саме проводиться цей тест «Володаря Перснів».
Якщо дотримуватися буквального змісту твіту Капасі, основним підказом для Opus 5 має бути початок першої глави «Очікувана вечеря» з «Володаря Перснів».

Білбо Беггінс із Мешкотного Дірка оголосив про організацію величезного святкування 111-річчя, і в Гобіттоні негайно зашуміли…
Цікаві друзі можуть спробувати це самостійно.
Крім того, Капасі вказав у промпті Three.js — це бібліотека JavaScript для створення 3D-сцен за допомогою коду.
Отже, завданням Opus 5 є спочатку зрозуміти текст на початку «Володаря кілець», а потім перетворити його на 3D-світ, який може працювати в реальному часі в браузері.

У процесі Opus 5 має складати фігур, будівель та реквізитів з багатокутників, розміщувати їх по координатам x, y, z, а потім налаштовувати камери, освітлення та анімацію.
Коли персонаж має рухатися, куди має повертатися камера, як мають змінюватися світлові ефекти та як мають взаємодіяти об’єкти в сцені — все це потрібно визначити за допомогою коду моделлю.
Хоча останній кадр не можна назвати витонченим, і часто з’являлися проблеми з проникненням моделей, плаванням тощо, наприклад, тіло та голова персонажа розділялися… але цілий сценарій хоча б був реально створений.

Варто зауважити, що це не те саме, що відеомодель безпосередньо генерує пікселі кадр за кадром.
Three.js спочатку повинен створити персонажів, об’єкти та сцену як тривимірні об’єкти, а потім на основі коду в реальному часі обчислювати їхнє положення, кут та стан руху.
Отже, демо, яке ми бачимо, — це не звичайне відео, згенероване ШІ, а запис екрану з запущеного 3D-веб-сценарію.
Однак Капасі також зазначив у коментарях, що програмна 3D-генерація та відеогенерація — це не вибір між двома варіантами.
Хтось запропонував передати цей сирій запис екрану з Three.js у Seedance як еталонне відео, а потім використати відеомодель для перерендерингу з вищою якістю.

Капасі швидко погодився.
За його задумом, програмний код може відповідати за сценарій та керування, спочатку визначивши, де стоятимуть персонажі, як рухатиметься камера та як розвиватиметься сюжет.
Потім надішліть запис екрану моделі Video-to-Video, щоб вона додала текстури, світло і деталі, і повністю підняла «зовнішній вигляд» всього Середзем’я.
Щодо аудіо, Opus 5 на цей раз не включив його в комплект.
Капасі зазначив, що через особисті вимоги до якості звуку було використано ElevenLabs.

Так і з’явився відкриваючий демонстраційний відеоролик «Володаря Перснів» — з образами, кадрами та озвучкою.
Kapasi також відкрив повний проект з відкритим кодом, посилання на який можна знайти в кінці тексту.

Нетівні набагато цікавіші за Капасі
Після того як Капасі випустив демо, багато користувачів інтернету також прийшли, щоб протестувати його.
Загалом можна сказати лише:
Ці вебкористувачі мають набагато більше уяви, ніж Капасі.
Хтось запустив проект «Earth Online» за допомогою Claude, метою якого є за допомогою групи AI-агентів охопити всю Землю Клік Побудовано.
Наразі агент ще не створив всю Землю, а лише збудував район прибережної зони Сан-Франциско у стилі лоу-полігон. Але з наявних зображень видно, що пропорції будівель, масштаб персонажів і загальний стиль збережені досить уніфіковано.
Цей ефект трохи схожий на анімаційні фільми у світі LEGO. Стиль нескладний, але персонажі, сцени та рухи стабільно функціонують в одному світі.
Продовжуйте в цьому напрямку — анімація у простому стилі та легкі ігри, які вже мають ознаки AI-натурального підходу.
Інші користувачі створили 3D цифрову модель Нью-Йорка за допомогою Fable 5 та GPT-5.6 Sol і підключили до неї дані в реальному часі.
Модель має не лише правильно розташувати вулиці та будівлі Нью-Йорка, а й зберігати просторові відношення між різними районами. Автор висуває ідею, що ця задача генерації віртуальних світів може стати новим стандартом для просторового міркування.
Ще більше вражаючого чекає вас далі.
Деякі користувачі, які не змогли купити квитки на концерт Канье Веста, просто за допомогою ШІ створили власний концерт у браузері.
Весь проект все ще побудований за допомогою Three.js. Є лише один HTML-файл, жодні готові 3D-моделі не використовуються; сцена, персонажі та освітлення створені повністю за допомогою коду.
На всьому концерті було підготовлено 14 пісень, кожна з яких мала власне світлове оформлення та унікальну сферичну сценічну візуалізацію.
Звичайні користувачі можуть прослуховувати фрагменти, а після підключення Spotify Premium — прослуховувати повні треки та повні виступи.
Не встиг купити квиток — прямо створив собі приватний показ, як же це гірко!
Ще не закінчилося!!!
Капасі також уявляє, що в майбутньому до цих 3D-світів можна додати геймплей, дозволяючи гравцям входити в них у ролі спостерігачів, НПС або навіть персонажів історії.
Результат: гравці вже створили версію гри, перш ніж Капасій міг це організувати.

Цей проект також використовує Opus 5 та Three.js, дозволяючи не лише запускати та взаємодіяти, але й додаючи аудіо.
Більше прикладів 3D-дизайну з’являється постійно. Від архітектурних масштабів, планування простору до стилю сцен, Opus 5 вже здатний підтримувати відносну стабільність у проектах достатньо великого масштабу.
Інші приклади також є, але тут ми не наводимо їх усі.
Об’єктивно кажучи, ці твори ще не досягли справжньої зрілості як гри.
Чи цікаві різноманітні ігрові механіки, чи стабільно працюють вони тривалий час, чи гравці справді зможуть залишитися в ньому 15 хвилин — на ці питання поки що немає відповідей.
Але бар’єри для створення реального 3D-контенту та інтерактивних прототипів справді значно знижені.
Тим паче, що можна знайти новий спосіб перевірити здібності моделі, одночасно роблячи це досить цікаво та весело?
Пелікан, їхати більше немає
Тоді чому раптово потрібно, щоб велика модель згенерувала «Володаря перснів»?
Це треба починати з тесту «Пелікан на велосипеді», який став відомим кілька років тому.
Це питання походить від розробника Сімона Вілісона і має бути лише одним реченням:
Створіть SVG-зображення пелікана, який їде на велосипеді.

Хоча це питання здається простим, воно дійсно перевіряє модель.
Оскільки SVG виглядає як зображення, але на нижньому рівні є рядок коду.
Модель повинна не лише знати, як виглядають пелікан і велосипед, а й розбити їх на лінії, кола та багатокутники, а потім розташувати кожен елемент за координатами.

Ще важливіше, що пелікан і велосипед і так не дуже підходять один одному.
Рама, шини та педалі велосипеда повинні зберігати правильну геометрію; у пелікана ж великий дзьоб, короткі лапи та тіло, яке зовсім не схоже на те, що підходить для їзди на велосипеді.

Поєднавши обидва, практично відразу видно, чи розуміє модель просторові відношення:
Чи крутиться колесо прямо, чи ноги дотикаються до педалей, чи птах справді їде на велосипеді, чи його розчленовано на рамі.
Подивіться на ці демонстрації кінця 2024 року~
Тому «пелікан на велосипеді» став класичним тестом для оцінки просторового розуміння, комбінування об’єктів та генерації коду великими моделями.

Але зі зростанням потужності моделей цей пелікан скоро доїде до кінця.
Подивіться нижче DeepSeek R1 і DeepSeek З виконання V4 видно, що сьогоднішні моделі вже досить добре впоралися з цим завданням.

Ще важливіше, один SVG може оцінити лише одноразовий вивід моделі.
Він не може виміряти, чи здатна модель планувати складний проект, працювати кілька годин поспіль та багаторазово перевіряти та виправляти власні помилки в тисячах рядків коду.
Таким чином, Капасі замінив невелике завдання «намалюй малюнок» на великий проект — «створи світ» —
Пелікан може виходити, Середземземля офіційно приймає естафету.

Kapasi's Pelican
Швидко, новина про те, що Капасі змінює завдання для «Пелікан-тесту», дійшла до великих спільнот.
Високо оцінений коментар на Hacker News стверджує, що, хоча якість зображень у цих демонстраціях досить посередня, це саме й свідчить про те, що нам потрібен новий тест, складніший за генерацію окремого зображення.
Новий стандарт має оцінювати не лише здатність моделі правильно намалювати зображення, а й її здатність розуміти світ.

В кінці кінців, «пелікан їде на велосипеді» вже дуже довго.
Моделі постійно встановлюють рекорди на цих завданнях, і різниця між ними стає все важче помітити.
Навпаки, створення повного 3D-світу вимагає від моделі розуміння просторових відношень між персонажами та об’єктами, обробки кадрів, рухів та змін сцен, а не просто виклику моделі генерації відео для виведення фрагмента зображення.

Звичайно, хтось також висловив протидію.
Pelican test is concise, low-cost, and results are easy to compare.
Щоб протестувати модель, витрачати стільки токенів на генерацію цілого 3D-світу — це наче витрачати обчислювальну потужність на фейерверк.

Тим часом, здатність Three.js самостійно вимірювати загальні здібності великих моделей також піддавалася сумнівам.
Деякі вважають, що такі демо можуть підтвердити лише те, що Anthropic добре навчила модель робити код Three.js, але не свідчать про справжнє розуміння простору та фізичного світу моделлю.
Але швидко знайшлися користувачі, які заперечили:
Перетворити абстрактний, нечіткий літературний текст у 3D-анімацію, де модель одночасно має обробляти просторові відношення, фізичні закони, повсякденні об’єкти, а також математичні задачі, пов’язані з 3D-перетвореннями та комп’ютерною графікою.
Якщо це ще вважати просто «вмінням писати Three.js», то це трохи недооцінює ці 5500 рядків коду.

Ще один користувач поставив більш відкрите питання:
Чи справді «просторове міркування» відрізняється від міркувань, які великі моделі зазвичай використовують при обробці тексту та коду?
Одна з точок зору стверджує, що чи може зображення бути коректним, залежить від того, чи розуміє модель просторові відношення, такі як «попереду/позаду, всередині/зовні, далеко/близько, перекриття», а також відстань, кут і відносний розмір об’єктів при різних кутах огляду.

Але інша думка полягає в тому, що незалежно від того, чи обробляє модель «поруч із каменем» чи «серед масиву», вона, ймовірно, робить те саме: генерує токени по одному на основі контексту, виконуючи міркування в процесі.
Якщо це так, то Opus 5 демонструє не лише раптово з’явившуся «просторову здатність».
Ймовірніше, що загальна здатність великих мовних моделей до розуміння тексту та коду почала природно поширюватися на тривимірний світ.
Від малювання пелікана до побудови середземного світу — завдання здаються змінилися, але, можливо, за ними завжди стоїть той самий питання:
Чи може модель перетворити своє розуміння світу на справжню працюючу структуру?
А в кінці, можливо, є ще більш дивне питання —
Якщо загальна велика модель вже може самостійно писати код для створення 3D-світу та викликати API, такі як Seedance та ElevenLabs, для генерації зображення та звуку, то наскільки необхідно користувачеві самостійно відкривати спеціалізований продукт для генерації відео та вводити запит?
Посилання для довідки
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Цей матеріал з іншого каналу WeChat «Quantum Bit», автор: henry
