На этот раз Claude действительно оторвался от всех в рейтинге AI-программирования!
В только что обновленном рейтинге MirrorCode Claude Fable 5 снова возглавил его с абсолютным успехом в 64%.
За ним следует GPT-5.6 Sol, его счет составляет лишь одну треть!
На четвёртом месте — GPT-5.5, который показал ещё худший результат: его оценка составила всего 10%, и его даже его предшественник GPT-5.4 одолел без труда.

Более удивительно то, что при использовании таких ресурсоемких языков, как Go, уровень решения Fable 5 составил 64%; при переходе на малоизвестный язык Ada результат все еще остался высоким — 61%.
Известно, что в мире с открытым исходным кодом корпус языка Python примерно в 230 раз больше, чем у Ada.
Но здесь, в Fable 5, результат снизился всего на 3 процента.

Это интересно.
Если модель в основном полагается на запоминание грамматики и распространённых стилей написания популярных языков, то после перехода на Ada результаты должны были снизиться.
А текущий результат указывает на другую возможность —
Самая мощная модель уже освободилась от привязки к конкретным данным и начала учиться создавать полноценный программный проект с нуля.
Застрял на линии прохождения 100%, предельное тестирование 10 миллиардов токенов
В частности, полная версия MirrorCode включает 25 целевых программ, охватывающих области Unix-инструментов, интерпретаторов, запросов данных, биоинформатики, криптографии и инструментов сжатия.
Здесь модель помещается в изолированную среду без доступа в интернет, она не может видеть исходный код оригинального проекта и не может загружать сторонние зависимости. Ей доступны только высококоуровневая документация, часть видимых тестов и исходная программа, которую можно вызывать многократно.
Затем он должен постоянно вводить данные в исходную программу, наблюдать за выводом, чтобы угадать внутреннюю логику, и затем Нажмите Напишите новую программу с согласованным поведением.
Из последнего рейтинга выберите 15 целей Medium и Large. Каждая цель реализуется на двух языках, каждый язык запускается три раза.
Кроме того, для прохождения необходимо достичь 100% выполнения как открытых, так и скрытых тестов; 99,9% недостаточно.
Даже если пропущен один крайний случай, вся операция считается неудачной.

Чтобы заставить модель заполнить и последние несколько пробелов, MirrorCode увеличила бюджет за один раз до 10 миллиардов токенов и разрешила непрерывную работу до 7 дней.
Самая дорогая задача в статье была еще более впечатляющей: модель работала непрерывно 19 дней, и однократные расходы составили 2600 долларов США.
За эти 19 дней модель многократно запускала исходную программу, сравнивала результаты, дописывала функции и повторно запускала тесты. При возникновении ошибок она искала причины, при несовпадении вывода меняла гипотезы, а после успешного прохождения локальных участков переходила к следующему разрыву.
Весь процесс больше похож на отладку, длящуюся несколько дней, чем на однократное создание.

Пример gotree самый наглядный.
Этот биоинформатический инструмент изначально содержал около 16 000 строк кода на Go и более 40 команд.
Claude Opus 4.7 потратил 14 часов и 251 доллар, прошел 2000 из 2001 теста, достигнув завершенности 99,95%.
Хотя он столкнулся с редкой граничной ситуацией, связанной с обработкой даты, и остановился на пороге 100% прохождения MirrorCode, он сократил объем работы, рассчитанный изначально в неделях, до нескольких десятков часов—
Epoch оценивает, что без использования ИИ человеческим инженерам для выполнения той же задачи потребовалось бы как минимум 2–17 недель.
В пустыне текстов Fable 5 упала всего на 3 балла
В статье MirrorCode в качестве эталона использовалась публичная обучающая смесь StarCoder.
При этом Python составляет около 8%, а Ada — всего 0,034%, то есть первый примерно в 230 раз больше второго.

Конечно, мы не можем знать, сколько кода Ada видели закрытые модели. Но, ориентируясь на открытую экосистему, уже достаточно очевидно, насколько редка Ada.
Этот язык в основном используется в аэрокосмической отрасли, обороне и других системах, критически важных для безопасности. Независимо от размера сообщества, количества учебных материалов или открытых проектов, он значительно уступает Python, JavaScript или Go.
А Fable 5 явно не переводит код Go построчно в Ada.
Это скорее похоже на то, чтобы сначала разобраться, как именно работает исходная программа, а затем переписать ту же логику на другом языке.

В сравнении с другими моделями ситуация не так стабильна.
GPT-5.6 Sol снизился с 24% до 19%, GPT-5.4 — с 21% до 12%, GPT-5.5 вообще упал с 17% до 5%. При смене языка разница сразу усиливается.
Передать весь проект ИИ
Сегодня Cursor уже позволил сотням агентов сотрудничать в течение почти недели, написав с нуля более 1 миллиона строк кода браузера, распределенных по 1000 файлам.
Anthropic запустила 16 агентов Claude параллельно, проведя почти 2000 сессий, в результате чего была создана C-компилятор из 100 000 строк кода, способный компилировать ядро Linux 6.9.
В выборке индивидуальных пользователей Codex, раскрытой OpenAI по состоянию на май, 70,2% хотя бы раз отправили задачу, предполагающую более чем один час человеческого труда; 25,6% отправили задачу, предполагающую более чем восемь часов.
Единицы, которые люди передают ИИ, меняются с кода или бага на несколько часов, неделю или даже весь проект.
64% от MirrorCode — это именно количественное выражение такого «проектного поручения».
Он указывает, что при достаточной ясности цели и возможности автоматической проверки результата современные модели уже могут самостоятельно выполнять часть средних и крупных программных проектов.
Для каждого, кто передает свою работу ИИ, изменения уже на пороге—
Раньше вам приходилось следить за написанием каждой строки кода, теперь вы скорее будете проверять, не отклоняется ли он от правильного курса, только на ключевых этапах.
Код станет всё дешевле.
А те, кто умеют четко объяснить проблему и точно проверить результат, будут становиться все ценнее.
Справочные материалы: https://epoch.ai/MirrorCode
Эта статья взята из официального аккаунта WeChat «Новознание», автор: АСИ, Откровение; редактор: Моисей
