GPT-6 Astra майже ідеальний результат у ARC-AGI-3 викликає дискусію щодо AGI

iconMetaEra
Поділитися
AI summary iconКороткий зміст
GPT-6 Astra майже ідеально впоралася з ARC-AGI-3, використовуючи символічну світову модель для розв’язання складних головоломок краще за людей у 96% завдань. Тест коштував $18 000, а критики стверджували, що він опирався на зовнішні інструменти, а не на справжній ШІ. На тлі зростання інтересу до активів з високим ризиком, результати моделі викликають питання щодо реального прогресу ШІ порівняно з високими витратами на обчислення. Агентства CFT вже стежать, як розвиток ШІ може вплинути на регуляторні рамки.
GPT-6 Astra, який показав результат, що наближається до 100% у тесті ARC-AGI-3, привернув увагу. Ця модель, генеруючи ефективні «символічні світові моделі», абстрагує реальний світ у вигляді логічних символів та причинно-наслідкового коду, самостійно створює систему DSL-алгебраїчних символів для запису правил середовища у невідомих графічних іграх, будує «віртуальний пісочницю» для симуляції та імітації, а потім діє. Однак за високим балом стоїть висока вартість обчислень — 360 доларів за завдання, а загальна вартість усього тесту досягає 18 000 доларів. Президент фонду ARC Prize Грег Камрадт зазначив, що високий результат залежить від зовнішнього фреймворку Harness і не є справжнім проривом у напрямку AGI, а лише підтверджує, що ШІ стає розумнішим.

Автор статті, джерело: Leiphone

Пройдіть тест на ІО штучного інтелекту! Модель символічного світу GPT-6 Astra — це прорив чи витрачання грошей на підняття рейтингу?

Кожна відповідь коштує 360 доларів США — чи пройшов GPT-6 AGI?

Найпотужніша модель OpenAI — GPT-6 Astra — нарешті представлена, вона досягла вражаючих проривів у керуванні комп’ютером, наукових дослідженнях та захисті від загроз. Серед багатьох вражаючих досягнень найбільше обговорень викликає її результат у тесті ARC-AGI-3, який наближається до 100%.

Пройдіть тест на ІО штучного інтелекту! Модель символічного світу GPT-6 Astra — це прорив чи витрачання грошей на підняття рейтингу?

Що таке ARC-AGI-3? Це загальнопризнаний у світовому технологічному співтоваристві рейтинг оцінки «інтелекту» ШІ, який можна розглядати як іспит на вступ до клубу Менса для ШІ.

У цьому тесті лише завдання зі змінними графічними закономірностями, їх неможливо пройти за допомогою зубріння; AI повинен, як людина, досліджувати середовище, припускати мету та виявляти закономірності завдяки миттєвій реакції та логічному мисленню. Це більш просунутий тип оцінки, який краще виявляє, чи є AI просто інструментом, чи справді інтелектом.

А GPT-6 Astra пройшов цей тест на відмінно — слід зазначити, що попередня модель GPT-5.6 Sol набрала лише 38,3%, що є справжнім стрибком. Ця інтелектуальна здатність навіть перевершує людську: у 96% рівнях вона демонструє вищу ефективність, ніж люди, і в середньому виконує на 51,7% менше дій.

Якщо штучний інтелект у повністю незнайомому середовищі справді здатний встановлювати логічні закономірності та вирішувати проблеми, ми можемо уявити, що в майбутньому він може приймати правильні рішення в невідомих умовах автономного вождення або швидко виводити молекулярну структуру ефективного лікування при виникненні абсолютно нового вірусу.

Щоб з’ясувати, чому GPT-6 Astra такий розумний, офіційний організатор ARC Prize відновив його журналів, і виявив, що під час гри він створює ефективні «символічні моделі світу».

Пройдіть тест на ІО штучного інтелекту! Модель символічного світу GPT-6 Astra — це прорив чи витрачання грошей на підняття рейтингу?

Модель символічного світу — це просунута версія «моделі світу». Коли модель світу, як художник, прогнозує майбутнє за допомогою зображень, модель символічного світу подібна до математика, який абстрагує реальний світ у логічні символи та причинно-наслідковий код.

Цю технологію визнано обов’язковим етапом на шляху до просунутого міркування ШІ.

Що таке символічна модель світу?

Раніше однією з основних причин, чому багато великих моделей не отримували високих балів у тестах серії ARC-AGI, було те, що вони звикли до «напіввипадкового перебору». Штучний інтелект розрізав ігровий екран на пікселі, спочатку випадково клацав, якщо не вдавалося — змінював напрямок і проходив рівень за рахунок удачі.

У цьому режимі навіть якщо відбувається якийсь прорив у балах, ІШ не розуміє і не оволодіває правилами гри насправді.

Символічна модель здатна контролювати все завдяки повному розумінню фізичних законів та причинно-наслідкових зв’язків навколишнього середовища та прийняттю рішень на основі точних обчислень.

У реальних тестах, коли GPT-6 Astra потрапляє до незнайомої графічної гри, вона починає робити велику кількість нотаток за допомогою винайденої DSL — власної алгебраїчної символічної системи. Наприклад, вона точно фіксує приховані правила гри, послідовності майбутніх команд та навіть точно відображає траєкторії руху кожного пікселя у координатній системі.

Цей спосіб запису алгебри забезпечує єдиний і визначений стан світу; порівняно з неоднозначністю, що виникає при взаємодії з попередніми моделями за допомогою природної мови, така символічна форма подання забезпечить епічний стрибок у точності.

Потім він спочатку написатиме в голові логіку Python-коду: «Якщо я натисну A, графік повернеться на 90 градусів ліворуч».

Потім він створює у своєму мозку «віртуальну пісочницю», моделюючи майбутні плани в уяві. Лише після того, як він переконається, що логіка замкнена і безпомилкова, він робить перший крок у реальній грі. Ось чому його ефективність у виконанні операцій значно вища, ніж у людей.

Щоб дослідити межі можливостей GPT-6 Astra, платформа червоної команди PRO‑LONG помістила її в кодовий пісочницю, дозволивши ШІ самостійно писати та запускати власний код.

В результаті GPT-6 Astra почав створювати інструменти «на замовлення» для кожної гри. Наприклад, у складній грі-лабіринті з охоронцями, які патрулюють, GPT-6 Astra самостійно написав навігаційну систему, додав правила бою, смоделював маршрути патрулювання охоронців і за допомогою цієї власної інструментальної ланцюжки ідеально передбачив та перевірив результат.

Раніше ці здібності до символічних міркувань та самостійного створення інструментів повністю залежали від зовнішніх фреймворків-харнессів. Харнесс допомагав моделі перетворювати зображення, записувати стан та перевіряти результати, але недоліки були дуже помітними: обмін даними між моделлю та харнессом призводив до високої затримки; інженерні здібності харнессу були повністю відокремлені від навчання ваг моделі; через сильну залежність від хмарних обчислювальних середовищ та зовнішніх скриптів ці високорозвинені здібності важко було розгорнути на краєвих пристроях.

А GPT-6 Astra зараз інтегрував велику кількість здібностей Harness безпосередньо у ваги моделі. Видатний вчений, який завжди захищав моделі символічного світу, Гарі Маркус не зміг не висловити захоплення щодо GPT-6 Astra, назвавши це величезним успіхом цього напрямку.

За останні два роки академічна та промислова сфери в цьому напрямку згенерували велику кількість ключових досягнень — від Гарварду та MIT до Google DeepMind, усі роблять ставку на «символічні світові моделі». Перед багатьма гілками шляху до AGI галузь досягає певної фундаментальної технічної згоди.

Така висока оцінка — AGI вже в безпеці?

Автор завдання особисто охолоджує

Цікаво, що, коли всі в мережі збуджено обговорювали цей рекордний результат, Грег Камрадт, президент фонду ARC Prize, особисто охолодив ентузіазм, відповівши на поширене твердження президента OpenAI Гріга Брокмана про те, що «AGI вже настав».

Він — ключова фігура серед авторів завдань, саме він найбільш авторитетний у питаннях дизайну базових показників та інтерпретації оцінок. З точки зору оцінки він вважає, що хоча оцінки є справжніми, це ще дуже далеко від AGI.

На даний момент він бачив, як багато команд отримали понад 90% на ARC-AGI-3 за допомогою Agent Harness, наприклад PRO-LONG із надзвичайною пам’яттю, Tycho, який спеціалізується на глибокому моделюванні, та Prime Agent, здатний саморозвивати своє середовище програмування.

Ці продукти з високими оцінками мають спільну технічну формулу, яка включає п’ять основних компонентів: безвтратну пам’ять, програмний аналіз, явне тестування гіпотез, сталість стану та низькі витрати на внутрішні обчислення.

Безвтратна пам’ять відповідає за запам’ятовування, програмний аналіз — за логіку, явне тестування припущень — за виведення, тривала стан — за контекст багатокрокових взаємодій, а низьковартісні внутрішні обчислення — за доступну внутрішню обчислювальну потужність, дозволяючи ІІ випробувати безліч варіантів у віртуальному середовищі перед виведенням правильної відповіді. Разом вони утворюють непереможний Harness, який компенсує недоліки моделі.

GPT-6 Astra досягнула результату, близького до 100%, використовуючи ту саму преміальну систему Harness, що й раніше. Вона використовує спеціально розроблений «базовий адаптер постачальника», який використовує безперервні діалоги та стиснення контексту, щоб підтримувати логічний ланцюжок. За кожну гру потрібно витрачати 360 доларів дорогих обчислювальних ресурсів. Якщо повністю провести весь тест, загальна вартість обчислень сягне неймовірних 18 000 доларів (приблизно 135 000 юанів)!

Людина може розв’язати графічну загадку за кілька хвилин; при перерахунку на 20 Вт метаболічної потужності людського мозку вартість електроенергії становить менше півцента; навіть з урахуванням реальної оплати праці учасників, вартість однієї гри становить лише 12,78 долара США, тоді як ШІ витрачає 360 доларів США. Чи може такий результат, досягнутий за допомогою «грошової сили», стати доступним звичайній людині як AGI?

Звичайно, GPT-6 Astra вже почав поступово інтегрувати здібності Harness, і якщо розвиток продовжиться, потенційна обчислювальна потужність моделі стане все більшою. Однак, оскільки процес міркування стає все менш прозорим, розробники не знають, чи справді AI зрозумів, чи просто знайшов більш ефективний спосіб обману.

Повертаючись до попереднього питання, чи вважається GPT-6 Astra AGI?

На це питання Грег Камрадт у своєму довгому тексті надав філософську відповідь. Людей вважають «універсальним інтелектом», бо люди можуть адаптуватися до будь-якого невідомого світу — навіть якщо дитину з давнини помістити в сучасний світ, вона все одно навчиться їздити на метрополітені та користуватися телефоном. Цей інтелект існує тисячі років і постійно сприяє науковому прогресу. Але зараз у світі технологій проводяться тести, які є просто «головоломкою з графікою» для ШІ.

Це лише підтверджує, що ШІ стає розумнішим, але не є доказом настання ШІ загального призначення.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.