GPT-6 Astra від OpenAI зайняла перше місце у рейтингу WebDev на Code Arena з результатом 1 797, що створює різницю в 35 балів між нею та Claude Fable 5.1 від Anthropic, який знаходиться на 1 762. Два дні після офіційного запуску 3 вересня 2026 року модель вже переписує ієрархію у сфері веб-розробки з використанням ШІ.
Лідербординг, який обслуговується Arena.ai, — це не звичайний статичний тест. Він використовує систему рейтингу за типом Elo, запропоновану спільнотою — такий самий механізм ранжування, який використовується в конкурсному шахах, де учасники спільноти голосують за те, наскільки добре AI-моделі впоруються з реальними завданнями фронтенд-розробки. Було зареєстровано понад 650 000 голосів для 126 моделей, що робить це одним із найбільш надійних оцінок спільноти в галузі ШІ.
Що робить цей тестовий стандарт іншим
Традиційні AI-тести зазвичай перевіряють моделі на фіксованих наборах даних із заздалегідь визначеними правильними відповідями. Code Arena використовує зовсім інший підхід. Моделі оцінюються за здатність до багатокрокового міркування, використання інструментів та ітеративних кодових робочих процесів — суттєво, це ламаний, нелінійний процес, який супроводжує реальну веб-розробку.
Результат GPT-6 Astra — 1 797 балів — є найвищим, якого коли-небудь досяг будь-яка модель у цьому рейтингу. Claude Fable 5.1, останній конкурент Anthropic, тримався на рівні 1 762.
Конкурентна обстановка стає все більш переповненою
OpenAI та Anthropic — не єдині гравці, що борються за позиції. Раніші дані з лідера-бордингу вересня показували, що моделі від китайських розробників конкурували з обох компаній за провідні місця.
GPT-6 Astra (Max) та Claude Fable 5.1 (Max) мають однакову ціну: $10 за мільйон вхідних токенів і $50 за мільйон вихідних токенів. Обидві пропозиції надають вікно контексту в 1 мільйон токенів.
OpenAI позиціонує GPT-6 Astra як найбільш просунуту модель для програмної інженерії та суміжних застосунків. Модель зараз доступна для підписників ChatGPT та обраних партнерів API та хмари.
