Цього разу Claude справді відірвався від решти в рейтингу AI-програмування!
У недавно оновленому рейтингі MirrorCode Claude Fable 5 знову посів перше місце з абсолютною успішністю 64%.
За ним слідує GPT-5.6 Sol, чий бал лише третина від його!
На четвертому місці GPT-5.5 пощастило ще гірше: його результат склав лише 10%, і його навіть його власний попередник GPT-5.4 зміг легко перемогти.

Ще більш дивно, що при використанні мов з високим споживанням ресурсів, таких як Go, рівень розв’язання Fable 5 становить 64%; при переході на маловідому мову Ada результат залишається високим — 61%.
Відомо, що в світі відкритого коду корпус Python приблизно в 230 разів більший, ніж Ada.
Але тут, у Fable 5, результат знизився лише на 3 відсотки.

Це цікаво.
Якщо модель здебільшого залежить від пам’яті про граматику популярних мов та поширені способи написання, то після переходу на Ada результати мали б знизитися.
А тепер результат вказує на іншу можливість—
Найпотужніша модель вже відмовилася від прив’язки до конкретних даних і почала вчитися створювати повний програмний проект з нуля.
Заклинив на 100% лінії проходження, граничне тестування 10 мільярдів токенів
Зокрема, повний MirrorCode містить 25 цільових програм, які охоплюють такі галузі, як інструменти Unix, інтерпретатори, запити даних, біоінформатика, криптографія та інструменти стиснення.
Тут модель поміщається в ізольоване середовище без інтернету, вона не бачить вихідного коду проекту і не може завантажувати сторонні залежності. Вона може отримати лише високорівневу документацію, частину видимих тестів та початкову програму, яку можна викликати повторно.
Потім він має постійно надсилати дані до початкової програми, спостерігати за виводом, щоб вгадати внутрішню логіку, а потім Клікніть Напишіть нову програму з однаковою поведінкою.
З останнього рейтингу вибрано 15 цілей Medium і Large. Кожна ціль реалізована двома мовами, кожна мова запущена тричі.
Крім того, для проходження необхідно досягти 100% виконання як видимих, так і прихованих тестів; 99,9% недостатньо.
Якщо пропустити навіть один крайній випадок, весь запуск все одно вважається невдалим.

Щоб змусити модель заповнити останні пробіли, MirrorCode збільшила бюджет за одну сесію до 10 мільярдів Token, максимально дозволяючи неперервне виконання протягом 7 днів.
Найвартісніше завдання в статті було ще більш неймовірним: модель працювала безперервно 19 днів, і витрати на одну спробу склали 2600 доларів США.
Протягом цих 19 днів модель повторно запускала вихідну програму, порівнювала результати, додавала функції та знову запускала тести. При помилці вона шукала причину, при невідповідності виводу змінювала припущення, а після часткового проходження переходила до наступного розриву.
Весь процес схожий на тривале налагодження протягом кількох днів, а не на одноразове створення.

Приклад gotree найбільш наочний.
Цей біоінформатичний інструмент спочатку мав близько 16 000 рядків коду на Go та понад 40 команд.
Claude Opus 4.7 витратив 14 годин і 251 долар, пройшовши 2000 із 2001 тестів, що становить 99,95% завершення.
Хоча він пропустив рідкісний граничний випадок обробки дати і зупинився на 100%-й лінії проходження MirrorCode, він зменшив обсяг робіт, який спочатку планувався на тиждень, до кількох десятків годин—
Epoch оцінює, що без використання ШІ людські інженери мали б витратити щонайменше 2–17 тижнів на виконання цієї ж задачі.
У пустелі даних Fable 5 втратила лише 3 бали
У статті MirrorCode використовувалися публічні тренувальні дані StarCoder як еталон.
При цьому Python становить приблизно 8%, а Ada — лише 0,034%, перший приблизно у 230 разів більший за другий.

Звичайно, ми не можемо знати, скільки коду Ada бачив закритий моделі. Але, використовуючи відкриту екосистему як еталон, достатньо очевидно, наскільки рідкісною є Ada.
Ця мова переважно використовується в аерокосмічній, оборонній та інших безпеко-критичних системах. Незалежно від розміру спільноти, кількості навчальних матеріалів чи відкритих проектів, вона значно поступається Python, JavaScript або Go.
А Fable 5 очевидно не перекладає код Go по рядках у Ada.
Це більше схоже на те, щоб спочатку зрозуміти, як працює вихідна програма, а потім переписати ту саму поведінку на іншій мові.

Натомість інші моделі не такі стабільні.
GPT-5.6 Sol знизився з 24% до 19%, GPT-5.4 — з 21% до 12%, GPT-5.5 навіть з 17% впав до 5%. При зміні мови розрив одразу збільшується.
Передати весь проект AI
Зараз Cursor вже дозволив сотням агентів співпрацювати протягом майже тижня, щоб написати з нуля понад мільйон рядків коду браузера, розподілених у 1000 файлах.
Anthropic запустила паралельно 16 агентів Claude, які провели майже 2000 сесій, щоб створити C-компілятор з 100 000 рядків коду, здатний компілювати ядро Linux 6.9.
У зразку особистих користувачів Codex, оприлюдненому OpenAI станом на травень, 70,2% принаймні один раз подали завдання, що передбачає більше ніж годину людської роботи; 25,6% подали завдання, що перевищує вісім годин.
Одиниці, які люди передають ШІ, змінюються з коду або бага на півдня, тиждень або навіть весь проект.
64% від MirrorCode — це кількісне вираження такого «проектного ордера».
Він зазначає, що з достатньо чіткою метою та автоматичним прийняттям результатів сучасні моделі вже можуть самостійно виконувати частину середніх та великих програмних продуктів.
Для кожної особи, яка передає свою роботу ШІ, зміни вже поруч —
Раніше вам доводилося стежити за написанням кожного рядка коду, а тепер ви, швидше за все, будете перевіряти його лише на ключових етапах, чи не відхиляється він від курсу.
Код буде ставати все дешевшим.
Ті, хто зможе чітко пояснити проблему і перевірити результат, стануть все ціннішими.
Джерело: https://epoch.ai/MirrorCode
Цей матеріал надійшов із офіційного каналу WeChat «Новий розум», автор: АСІ-Оголошення; редактор: Моїсей
