Не будем долго говорить, сразу начнем ежедневный отдых (doge)!
Только что великий мастер Капаси объявил: «Мы», Anthropic, начали усиливать крупные модели совершенно новым способом —
Властелин колец.

По словам Капаси, эта «Бенчмарка „Властелина колец“» заменяет ранее популярный SVG-тест «Пеликан на велосипеде».

В частности, Капаси сразу же передал начало «Властелина колец» Opus 5, чтобы модель с помощью Three.js создала целый «Средиземье» в реальном времени.
Что касается конечного результата, он немного напоминает отечественные 3D-мультфильмы конца 90-х — начала 2000-х годов: очень грубый и абстрактный.
Но объективно говоря, если внимательно посмотреть некоторое время и вы случайно знакомы с местом съемок «Властелина Колец» в Хоббитоне, Новая Зеландия, действительно можно заметить некоторое сходство~
Однако именно эта, казалось бы, не слишком изысканная штука действительно стоила Opus 5: 1 миллион токенов, 2 часа и 5500 строк кода.
Of course, Claude is not the only one shining on stage.
Самым смешным, пожалуй, является новое блюдо, поданное интернет-пользователями DeepSeek Версия V4 Flash.
Прямо весь кадр «китайцы могут летать», все персонажи на экране парят.
面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。
Он отметил, что Opus 5 пока не может действительно «попасть» в сгенерированный им мир, а может только делать скриншоты в разные моменты времени и постепенно проверять, где возникли проблемы.
А это как раз выявляет явный недостаток современных крупных моделей:
Они уже могут писать код, создавать сцены и генерировать игры, но всё ещё не могут действительно понимать видео и не играют в свои собственные игры.
Два часа, чтобы вручную создать Средиземье
Давайте сначала рассмотрим, как именно проводится этот тест «Властелина Колец».
Если следовать букве твита Капаси, основной промт, введенный в Opus 5, должен быть началом первой главы «Вожделенного пиршества» из текста «Властелина Колец».

Бильбо Бэггинс из Мешкового Холма объявил, что устроит пышное празднование 111-летия, и в Хоббитоне сразу же раздались шепотки…
Заинтересованные друзья могут попробовать сами.
Кроме того, Капаси также указал в промпте Three.js — библиотеку JavaScript для создания 3D-сцен с помощью кода.
Таким образом, задача Opus 5 заключается в том, чтобы сначала понять текст в начале «Властелина Колец», а затем преобразовать его в 3D-мир, который можно запустить в браузере в реальном времени.

Во время всего процесса Opus 5 должен собирать персонажей, здания и реквизит из многоугольников, поочередно размещать их в системе координат x, y, z, а затем настраивать камеры, освещение и анимацию.
Когда персонажи двигаются, куда поворачивается камера, как меняется освещение и как должны взаимодействовать объекты в сцене — всё это необходимо определить с помощью кода модели.
Хотя финальная сцена не может похвастаться тонкой проработкой, и часто возникают проблемы с проникновением моделей, плаванием и т.д., например, тело и голова персонажа разъединяются… но вся сцена в целом была действительно создана.

Следует отметить, что это не то же самое, что прямая генерация видео моделью пиксель за пикселем.
Three.js сначала должен создать персонажей, объекты и сцену в виде трехмерных объектов, а затем вычислять их положение, угол и состояние движения в реальном времени на основе кода.
Таким образом, демо, которое мы видим, — это не обычное видео, сгенерированное ИИ, а запись экрана работающего 3D-веб-сцены.
Однако Капаси также отметил в комментариях, что программная генерация 3D-изображений и видео — это не выбор между двумя вариантами.
Некоторые пользователи предложили передать эту грубую запись экрана с использованием Three.js в Seedance в качестве эталонного видео, а затем позволить видео-модели перерендерить его с более высоким качеством.

Капаси быстро согласился.
По его замыслу, программный код может отвечать за сценарий и управление, сначала определив, где стоят персонажи, как движется камера и как развивается сюжет.
Затем передайте запись экрана модели Video-to-Video, чтобы она добавила текстуры, свет и детали, полностью повысив визуальную привлекательность всего мира Средиземья.
Что касается аудио, Opus 5 на этот раз не взял всё под свой контроль.
Капаси заявил, что из соображений личных требований к качеству звука в итоге был использован ElevenLabs.

Так появился демонстрационный ролик «Властелина колец» с визуальными образами, кадрами и озвучкой.
Kapasi также открыл исходный код всего проекта; ссылку можно найти в конце статьи.

Интернет-пользователи намного интереснее Капаси.
После того как Капаси выпустил демо, многие пользователи сети также пришли его протестировать.
В целом можно сказать только:
Современные пользователи сети намного креативнее, чем Капаси.
Кто-то запустил проект «Earth Online» с помощью Claude, цель которого — с помощью группы AI-агентов полностью Нажмите Собрано.
Сейчас агент еще не создал всю Землю, а только построил район набережной Сан-Франциско в стиле низкополигональной графики. Однако по имеющимся изображениям пропорции зданий, масштаб персонажей и общий стиль сохранены достаточно единообразно.
Этот эффект немного напоминает анимационные фильмы в стиле Лего. Стиль рисунка несложный, но персонажи, локации и движения стабильно работают в одном мире.
Продолжайте двигаться в этом направлении — анимация в простом стиле и легкие игры уже демонстрируют зародыши AI-натурального подхода.
Также пользователи сети создали 3D цифровую модель Нью-Йорка с использованием Fable 5 и GPT-5.6 Sol и подключили к ней данные в реальном времени.
Модель должна не только правильно разместить улицы и здания Нью-Йорка, но и сохранить пространственные отношения между различными районами. Автор также предлагает, что эта задача генерации виртуального мира может стать новым стандартом для пространственных рассуждений.
Еще больше будет впереди.
Некоторые пользователи не смогли купить билеты на концерт Канье Уэста и вместо этого с помощью ИИ устроили себе виртуальный концерт в браузере.
Весь проект по-прежнему построен с использованием Three.js. Используется только один HTML-файл, никакие готовые 3D-модели не применяются — сцена, персонажи и освещение создаются полностью с помощью кода.
На концерте было подготовлено 14 песен, каждая из которых имеет индивидуальное освещение и уникальную сферическую визуальную сценографию.
Обычные пользователи могут прослушивать фрагменты, а после подключения Spotify Premium — воспроизводить полные треки и целые выступления.
Не успел купить билет — сразу устроил себе частную показ, очень обидно!
Еще не закончилось!!!
Капаси также предположил в конце исходного поста, что в будущем можно добавить геймплей в эти 3D-миры, позволив игрокам входить в них в роли зрителей, НИП или персонажей сюжета.
Результат: игроки уже создали версию игры, прежде чем Капаси успел это организовать.

Этот проект также использует Opus 5 и Three.js, обеспечивая не только работу и интерактивность, но и добавляя аудио.
Больше примеров 3D-дизайна появляется постоянно. От архитектурных масштабов и планировки пространства до стиля сцен — Opus 5 уже способен поддерживать относительно стабильную согласованность в проектах достаточно большого масштаба.
There are many similar examples, which are not listed here one by one.
Объективно говоря, эти произведения все еще далеки от настоящих зрелых игр.
Еще неизвестно, интересны ли запутанные механики, стабильна ли их долгосрочная работа и готовы ли игроки действительно проводить в них 15 минут.
Но барьер для создания реального 3D-контента и интерактивных прототипов действительно значительно снижен.
И разве не прекрасно, что появился новый способ проверить возможности модели, который при этом достаточно интересен и увлекателен?
Пеликан, доехал до конца
Тогда почему внезапно нужно, чтобы крупная модель сгенерировала «Властелин колец»?
Это нужно начинать с теста «Колибри на велосипеде», который стал вирусным несколько лет назад.
Этот вопрос первоначально был предложен разработчиком Саймоном Уиллисоном и требует только одного предложения:
Создайте SVG-изображение пеликана, едущего на велосипеде.

Хотя этот вопрос кажется простым, на самом деле он довольно сложно проверяет модель.
Поскольку SVG выглядит как изображение, но на самом деле представляет собой строку кода.
Модель должна не только знать, как выглядят аист и велосипед, но и разложить их на линии, круги и многоугольники, а затем точно расположить каждый компонент с помощью координат.

Более важно то, что пеликан и велосипед сами по себе не очень подходят друг другу.
Рама, колеса и педали велосипеда должны сохранять правильную геометрию; у пеликана же большой клюв, короткие ноги и телосложение, которое никак не выглядит подходящим для велосипеда.

В сочетании оба элемента позволяют сразу увидеть, понимает ли модель пространственные отношения:
Колесо перекошено или нет, ноги на педалях или нет, птица вообще едет на велосипеде или ее прямо на раме разорвали.
Посмотрите на эти демо конца 2024 года~
Поэтому «аист на велосипеде»一度成为民间测试大模型空间理解、物体组合和代码生成能力的经典测试。

Но по мере того как модель становится все сильнее, этому пеликану скоро конец.
Посмотрите ниже DeepSeek R1 и DeepSeek Из выступления V4 видно, что современные модели уже могут довольно хорошо справиться с этой задачей.

Более того, один SVG может оценить только однократный вывод модели.
Он не может определить, способна ли модель спланировать сложный проект, работать несколько часов подряд и многократно проверять и исправлять свои ошибки в тысячах строк кода.
Таким образом, Капаси заменил небольшую задачу «нарисуй картинку» на масштабный проект «создай мир»—
Пелеканы могут выходить, средиземье официально берет эстафету.

Kapasi's Pelican
Скоро новость о том, что Капаси готовит смену заданий для «Теста пеликана», распространилась по всем сообществам.
Высоко оцененные комментарии на Hacker News считают, что, хотя качество изображений в этих демо-версиях довольно посредственное, это как раз показывает, что нам нужен новый тест, более сложный, чем генерация отдельного изображения.
Новый стандарт должен оценивать не только то, может ли модель правильно нарисовать изображение, но и способна ли она понимать мир.

В конце концов, «пеликан едет на велосипеде» уже слишком долго.
Модели постоянно обновляют рейтинги по таким задачам, и разница между ними становится все труднее заметить.
Напротив, создание полной 3D-сцены требует от модели понимания пространственных отношений между персонажами и объектами, обработки камеры, движений и смены сцен, а не просто вызова модели генерации видео для вывода фрагмента изображения.

Конечно, некоторые выразили возражения.
The pelican test is sufficiently simple, low-cost, and yields easily comparable results.
Чтобы протестировать модель, потратить столько токенов на генерацию всего 3D-мира — это что-то вроде использования вычислительных мощностей для фейерверка.

В то же время подвергается сомнению, может ли сам Three.js оценить комплексные способности крупных моделей.
Некоторые считают, что такие демо могут доказать лишь то, что Anthropic хорошо обучила модель на коде Three.js, но не свидетельствуют о том, что модель действительно понимает пространство и физический мир.
Но вскоре последовали возражения от пользователей сети:
Превратить абстрактный, неясный по смыслу литературный текст в 3D-анимацию — модель должна одновременно обрабатывать пространственные отношения, физические законы, повседневные объекты, а также математические задачи, связанные с 3D-преобразованиями и компьютерной графикой.
Если это всё ещё можно назвать просто «умением писать на Three.js», то это явно недооценивает эти 5500 строк кода.

Другие пользователи задали более открытый вопрос:
Различается ли так называемое «пространственное рассуждение» от рассуждений, которые крупные модели обычно применяют при обработке текста и кода?
Одна из точек зрения заключается в том, может ли изображение быть корректным, в зависимости от того, понимает ли модель пространственные отношения, такие как «перед-за», «внутри-снаружи», «далеко-близко», «перекрытие», а также расстояние, угол и относительный размер объектов при различных углах обзора.

Но другая точка зрения заключается в том, что независимо от того, обрабатывает ли модель «рядом с камнем» или «внутри массива», она, возможно, выполняет одно и то же действие: генерирует токены по одному на основе контекста, выполняя при этом рассуждение.
Если это так, то то, что демонстрирует Opus 5, — это нечто большее, чем внезапно возникшая «пространственная способность».
Скорее всего, универсальные способности больших языковых моделей к пониманию текста и кода начали естественным образом распространяться на трехмерный мир.
От рисования пеликана до создания мира Средиземья — задания кажутся разными, но, возможно, за ними всегда скрывается один и тот же вопрос:
Может ли модель преобразовать свое понимание мира в действительно работающую структуру?
А в конце, возможно, есть еще более безумный вопрос —
Если универсальная крупная модель уже может самостоятельно писать код для создания 3D-мира и вызывать API, такие как Seedance и ElevenLabs, для генерации изображений и звука, то насколько необходимо пользователю самостоятельно открывать специализированный продукт для генерации видео и вводить промпт?
Ссылка для справки
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: henry
