Шлях ШІ до майстерності: де існують системи оцінювання, ШІ йде за ними

iconTechFlow
Поділитися
AI summary iconКороткий зміст
Домінування ШІ зростає там, де існують системи оцінки, як у го, шахах та згортанні білків. Хід Лі Седола в AlphaGo, майстерність AlphaZero у шахах та прорив AlphaFold2 у згортанні білків показують, що ШІ процвітає на вимірюваних цілях. Трейдери, які стежать за альткоїнами для спостереження, повинні зауважити цю тенденцію. Коли ШІ поступово захоплює структуровані галузі, індекс страху та жадоби може відображати ринкову невизначеність. Наступна межа? Людська діяльність без чітких метрик.

Автор: Robonaissance

Переклад: Shenchao TechFlow

Огляд Shenchao: Шахи, го, згортання білків — чому ці галузі, які здаються потребувати людської інтуїції та креативності, одна за одною підкорилися ШІ? Ця стаття розкриває невраховану закономірність: чи зможе ШІ перевершити людину, визначається не складністю завдання, а наявністю критеріїв оцінки успіху. Коли у галузі встановлюються стандарти оцінки, вона запускає зворотний відлік до свого підкорення.

Взято з серії «Все, що ви запитуєте», про єдину роботу, яку машина не може виконати замість нас.

Одна десятитисячна

10 березня 2016 року в готелі в Сеулі машина зробила хід, якого ніхто в кімнаті не зрозумів, а її суперник тоді був відсутній.

Лі Шіши вийшов курити. Йому було 33 роки, він мав 18 чемпіонських титулів і вважався найсильнішим гравцем у го свого покоління. Він програв першу партію вчора, і до другої партії його початкова впевненість значно зменшилася, він став більш обережним. Коли він був зовні, AlphaGo зробила 37-й хід, а дослідник DeepMind Хуан Шіцзе замість машини тихо поклав фішку на дошку.

Фішка впала на п’яту лінію.

Для тих, хто не розуміє го, це не має сенсу. Для тих, хто розуміє, це майже безглуздя. На початку та середині гри позиції, що знаходяться так далеко від краю, вважаються неефективними: вони не дають ні землі, ні контролю, і рівнозначні безкоштовному віддаванню очок супернику. Це той тип ходів, які вчитель виправляє у початківців. На коментаторській сцені топовий професійний гравець Майкл Редмонд під час прямого ефіру спочатку подумав, що це помилка сигналу дошки. Він підняв камінь і знову поклав його.

Лі Шіші повернувся і сів, довго дивився на дошку, не рухаючись. Різні оцінки варіювалися від приблизно 12 до 15 хвилин. Фань Ху, європейський чемпіон, якого перемогла AlphaGo п’ять місяців тому, тоді спостерігав за грою в будівлі. Його висновок після довгого спостереження: «Це не людський хід. Я ніколи не бачив, щоб хтось грав так».

Він правий, і це можна кількісно виміряти. У системі DeepMind є механізм оцінки, який, навчаючись на величезній кількості партій людей, оцінює ймовірність того, що людина зробить певний хід у будь-якій позиції. Для 37-го ходу ця оцінка становить приблизно одну десятитисячну.

Машина все ще зробила хід, і цей хід виграв всю гру.

Існує зручне тлумачення цієї історії, яке стверджує, що машина дуже наполегливо вчивалася у людських майстрів і в кінцевому підсумку наздогнала найсильніших з них. Це тлумачення хибне, і цифра одна на мільйон саме підтверджує, чому воно хибне. Система, яка вчиться імітувати ходи людей, має верхню межу — це самі людські ходи. Те, що відбулося в Сеулі, — це те, що система більше не обмежувалася цією межею, бо їй було поставлено метою не схвалення людських майстрів, а перемога.

Ця різниця вказує напрямок, який корисніший, ніж захоплення. Якщо ви хочете знати, які людські діяльності вже програли на чистої здатності, а які — наступні, питання не в тому, наскільки складна ця діяльність, наскільки вона вимагає креативності чи інтуїції. Питання набагато нудніші.

Проблема в тому, чи можна оцінити успіх.

Одна панель за іншою

Шахи програли 19 років тому, і це було зовсім іншим способом.

Deep Blue у 1997 році переміг Каспарова, використовуючи архітектуру, яка за суттю була величезним актом людського вираження. Його функція оцінки — компонент, який аналізує позицію і присвоює їй числове значення — була зібрана та налаштована за допомогою консультантів-гросмейстерів. Людські шахові знання були скрупульозно вилучені зі шахістів і введені в машину. Те, що додала машина, — це здатність до пошуку: швидше проглядати більше ходів наперед, не втомлюючись і не втрачаючи фігур через втрату уваги.

Це справжня перемога, і її слід вважати перемогою. Але зверніть увагу на її форму. Глибоке розуміння шахів Deep Blue — це людське розуміння. Його перевага — у швидкості. Якщо запитати його, чому він оцінює позицію саме так, відповідь в кінцевому підсумку зведеться до когось, хто навчив його цьому.

Через 20 років DeepMind випустила систему під назвою AlphaZero, яка змінила свою форму.

AlphaZero отримав лише правила шахів. Йому не надали бібліотеку відкриттів — каталогів досліджених перших ходів, на які опираються всі серйозні програми. Йому не надали таблиць ендшпілів. Йому не показали жодної партії людини. Він грав сам з собою, починаючи з випадкових ходів і налаштовуючи себе на основі того, що призводить до перемоги.

Приблизно через чотири години DeepMind оцінила, що її рейтинг перевищив рейтинг найсильнішої традиційної програми Stockfish 8. Приблизно через дев’ять годин вона зіграла сто партій з Stockfish у обмеженому часі, вигравши 28, не програвши жодної, і зробивши 72 нічиї. У статті повідомляється, що за 24 години вона досягла надлюдського рівня у шахах, сьогі та го.

Ці цифри часто цитують без іншої частини оповіді, а вона дуже важлива. Ігри самозмагання були згенеровані на п’яти тисячах першого покоління тензорних процесорів, а ще 64 процесори другого покоління навчали мережу — усі працювали паралельно. Чотири години реального часу — це чотири години обчислень — такий обсяг не зможе зібрати ніхто з окремих осіб, навіть декілька інституцій. Досягнення полягає не в тому, що шахи стають легкими. Досягнення в тому, що коли у вас є така кількість обчислювальних потужностей, людські знання більше не є тим, що вам потрібно.

Каспаров мав більше підстав, ніж будь-хто інший з живих, сприймати цей результат як особисту атаку, але він написав огляд у журналі «Science» із великою щирістю. Його спостереження полягало в тому, що AlphaZero грає не в той виснажливий, обережний, схильний до нічиїх шахи, які всі очікували від ідеальної машини. Вона віддає перевагу активності над матеріалом і жертує фігурами для позицій, які здаються їй ризикованими. Він зазначив, що традиційні програми несуть пріоритети та упередження своїх розробників. AlphaZero написала себе сама. Він зробив висновок, що її стиль відображає щось більш справжнє, ніж смаки програмістів, і зауважив, що вона перевіряє набагато менше позицій за секунду, ніж найкращі традиційні двигуни світу, але все одно вигравала.

Цей останній деталь варто запам’ятати. Традиційні двигуни розглядають набагато більше можливостей за секунду, але програли. Перевага AlphaZero полягає не у більшій наполегливості, а у знанні, куди дивитися, і це знання було зібрано лише з мільйонів партій самозігру та правила, хто виграв.

Результати сігі-гігі здаються ще дивнішими для тих, хто має кваліфікацію їх розуміти. Сігі-гігі — це японська настільна гра, у якій з’їдені фігури повертаються до гравця, який їх з’їв, що робить коливання позицій більш інтенсивними, ніж у шахах, а також має сотні років теоретичного досвіду щодо захисту короля. Сильні гравці, які переглядали партії машин, повідомили, що початкові ходи порушували відомі теорії, а король рухався до центру дошки в той момент, коли всі книги радили приховувати його в кутку. Ці партії майже незрозумілі для навчених очей, але вони виграли.

Два системи розташовані поруч, і їхній узгоджений шаблон викликає незручність. Глибокий синій — це людські знання плюс швидкість машини. AlphaZero — це швидкість машини плюс визначення перемоги, людські знання навмисно вилучені. Версія без людських знань краща.

Все це не означає, що машини 2016 року були ідеальними, та ж сама сеульська гра містила докази.

У четвертій партії, залишившись з трьома програшами, Лі Се Ші вставив камінь між двома групами AlphaGo по центру дошки — цей хід пізніше назвали «божественим ходом». Сама AlphaGo оцінила ймовірність того, що людина зробить цей хід, приблизно в одну десятитисячну — дивовижно симетрично. Система не змогла впоратися з ним. Її оцінка ймовірності виграшу розвалилася протягом наступних кількох ходів, її гра погіршилася, і вона програла партію.

Отже, у березні 2016 року на машині ще був пробіл, і людина знайшла його перед обличчям світу, під найбільшим тиском. Це варто чітко сказати, а не мовчки обійти бік. Також варто зазначити, що пізніше відбулося: ці пробіли поступово ліквідувалися, а наступники цієї системи більше не програвали такі партії — топові двигуни вже давно не програвали людям у серйозних змаганнях. Результат 2016 року — це знімок переломного моменту, а не постійна рівновага сил.

З цих дощок і до всього іншого переноситься не сама перемога, а механізм. Шахи та го обречені стати першими, хто впаде — причина дивовижно проста. У грі успіх визначається правилами з абсолютною точністю. Ти виграєш або ні, оцінка безкоштовна, миттєва й непересудна. Система може за вихідні сама з собою зіграти сорок мільйонів партій і отримати сорок мільйонів чітких рішень.

Це вказує на наступне місце, яке варто перевірити. Не ті прості завдання, а ті, що мають власний рахунок.

П’ятдесятирічна проблема

Білки — це ланцюги амінокислот, які згортаються у складні тривимірні форми відразу після синтезу. Форма визначає функцію білка. Послідовність визначає форму. Виведення другого з першого — це відкрита проблема в біології з початку 1970-х років, і вона залишається нерозв’язаною у всіх можливих підходах: від фізичного моделювання з перших принципів до статистичного аналізу еволюційних зв’язків та десятиліть накопичених структурних інтуїцій — все безрезультатно.

У 1994 році група дослідників під керівництвом Джона Мулта зробила щось з цим фактом: усі в галузі стверджували про прогрес, але ніхто не міг це перевірити.

Вони створили конкурс. З того часу кожні два роки структурна оцінка критичного прогнозування (CASP) публікує послідовності білків, структури яких були щойно визначені експериментально, а в деяких випадках — ще не визначені. Будь-яка команда може надіслати свої прогнози. Ніхто не має доступу до відповідей, оскільки для деяких цілей відповіді ще не існують. Коли експериментальні структури з’являються, прогнози порівнюються з ними та оцінюються.

Оцінка проводиться за допомогою показника, що називається глобальним тестом відстані, у діапазоні від 0 до 100, який можна приблизно розуміти як відсоток того, наскільки кінцеве розташування ланцюга достатньо близьке до реального. Мулт зазначив, що приблизно 90 балів неформально вважаються еквівалентними структурі, визначеній у лабораторії. У більшості історії оцінок найкращі прогнози коливалися близько 60 балів.

На CASP14 у 2020 році учасник, зареєстрований як група 427, показав медіанний результат 92,4 за всіма цілями. У найскладнішій категорії — цілях, для яких немає корисних структурних родичів — медіанний результат становив 87,0. Середня похибка становила близько 1,6 ангстрема, що приблизно дорівнює ширині одного атома.

Маулт, який був головою з початку конкурсу, провів глядачів через історію конкурсу перед показом графіків. Графік відобразив всю історію на одному зображенні: двадцять років лінія повзала біля 60, а потім одна лінія вийшла на рівень, якого інші лінії ніколи не досягали.

Група 427 — це AlphaFold2. Moult оголосив, що для однієї поліпептидної ланцюжка проблема вирішена.

Обмежувальні умови повинні бути там, у кожній чесній розповіді. Один ланцюг — це не все в білковій науці. Як білки збираються в комплекси, як вони рухаються та як ведуть себе в живих клітинах — це все ще відкриті питання. Закрита велика виклика — це конкретний, точно сформульований виклик.

А саме ця точність є ключовим моментом цієї історії. Не те, що структурні прогнози були спочатку простими — півстоліття невдач свідчить протилежне. Їх зруйнувало те, що в 1994 році ця галузь створила собі рейтингову таблицю.

Розглядаючи CASP як інженерний, а не науковий проект, він надає чіткий і однозначний показник успіху для будь-якого прогнозу, який можна обчислити за кілька секунд. Він надає неможливий для маніпулювання еталонний факт, оскільки відповіді фізично визначаються іншими в лабораторії. Він забезпечує постійний потік нових завдань, що генеруються за фіксованим розкладом. Він надає тридцятирічну історію оцінених спроб, тобто детальну історію класифікації того, що в цій галузі вважається кращим або гіршим.

Галузь, яка зробила все це, неспроможна підготувала себе до автоматизованих атак. Рахунок — це передумова. Все інше — це інженерія та обчислення, і обидва з них щороку протягом довгого часу стають дедалі дешевшими.

Це поширюється з тривожним легкістю. Де існує дисципліна, що досягла консенсусу щодо базових показників, там з’являється мішень. Для машинного перекладу є базові показники. Для голосового розпізнавання є базові показники. Для класифікації зображень існує набір з мільйоном анотованих фотографій та щорічний конкурс, і кожен, хто бачив цей конкурс, знає, як закінчується історія. Закономірність не в тому, що спочатку падають складні речі, або спочатку падають прості. Закономірність в тому, що спочатку падають вимірювані речі.

Це ставить очевидні питання щодо всього, що ще не було виміряно.

Оцінювати те, що не можна оцінити

Останньою лінією захисту мали б бути ті речі, які не можна оцінити.

Письмо — це стандартний приклад. Жодна програма не може взяти абзац і повернути число, що вказує, наскільки він добрий. Два кваліфіковані редактори можуть не згодитися. Один і той самий редактор може не згодитися з самим собою в різні дні. Якість мови плутається з контекстом, аудиторією, метою та смаком, що не можна звести до одного вимірювання. Якщо машині потрібен рахунок, а мова не має рахунку, то мова безпечна.

Цей аргумент є дійсним. Те, що відбулося з ним, є найважливішою причиною у всьому цьому оповіданні.

У цій галузі не існує об’єктивних критеріїв для оцінки якості письма. Таких критеріїв досі немає. Вона створює оцінку, використовуючи єдиний доступний матеріал — саме людське судження.

Історія цього підходу значно довша, ніж вважають більшість людей. У 2008 році Кнокс і Стоун описали систему під назвою TAMER, в якій люди спостерігали за поведінкою агентів і надавали оцінки, які використовувалися для навчання моделі передбачати, що сказали б люди. Потім навчальні сигнали надавала сама модель, а не люди. У 2017 році Христіано та його колеги опублікували роботу, яку більшість людей вважають прямою вихідною точкою сучасної практики, застосувавши цю ідею до агентів у іграх Atari. У 2019 році Ціглер та його колеги застосували це до мовних моделей, і більшість термінів, що використовуються сьогодні, були визначені саме в цій статті. У 2022 році Оуян та його колеги продемонстрували цей підхід у промисловому масштабі на завданнях слідування інструкціям, і всього кілька місяців потому більшість людей на Землі, не усвідомлюючи цього, зустрілися з цими результатами.

Його основний механізм варто детально розібрати, бо він простіший, ніж здається на перший погляд.

Одна людина сидить перед двома текстами, обидва з яких були згенеровані моделлю за однією й тією ж вказівкою. Завдання — не оцінювати їх. Оцінки саме ті речі, які люди роблять дуже погано, бо сімка одного людини — це п’ятірка іншої, і навіть одна й та ж людина нестабільна протягом одного дня. Завдання — просто сказати, який кращий. Це та оцінка, яку люди можуть надійно зробити, а математичні методи перетворення великої кількості таких порівнянь на єдину шкалу навіть старші за саму галузь, в якій вони використовуються, і сягають роботи Бретлі та Террі 1952 року про парні порівняння.

Розгляньте умови роботи, за яких робляться такі рішення, бо вони в кінцевому підсумку мають вплив. Ця людина робить такі рішення багато разів на годину, отримуючи оплату, і дотримується письмового посібника, який пояснює, що клієнти вважають кращою відповіддю. Деякі пари майже ідентичні. Деякі стосуються тем, про які ця людина нічого не знає, і в таких випадках часто вибирається та відповідь, яка звучить впевненіше та краще структурована, незалежно від того, чи є вона більш точною. Це не критика цих людей. Це опис того, що зробив би будь-хто за таких умов, а отримані вибори є сировиною.

Зібравши достатню кількість таких виборів, ви можете навчити другу модель, завданням якої є передбачення, який із двох текстів людям сподобається більше. Ця друга модель виводить число. А число — це саме те, чого завжди не вистачало.

Уважно розгляньте, що саме тут створюється, бо це легко проігнорувати. Оптимізований бал — це не про факти світу. Це про нашу модель. Це стисла, вивчена імітація суджень певної групи людей, яких найняли в певний час, які працювали за певними інструкціями і, як і всі інші, вдень відчували втомленість. CASP оцінює передбачення на основі фізичної реальності, встановленої в лабораторії, тоді як ця система оцінює тексти на основі статистичних портретів, затверджених людьми.

Цей образ корисний. Але він також є наближенням, і між ним та зображеним об’єктом існують відмінності, яких ніхто повністю не розуміє. Будь-що, що наша модель переваг не змогла відобразити щодо наших реальних переваг, не входить до цілі, отже, не оптимізується і піддається впливу будь-яких обставин — а потужний оптимізатор не має причин захищати цю величину.

Це факт щодо конструкції, і тут не стверджується, наскільки поганими можуть бути наслідки. Поточний акцент вужчий і складніший для спростування. Категорії, які не можна оцінити, менші, ніж здається. Якщо область опоряється вимірюванню, можна побудувати вимірювання на основі людських уподобань і продовжити рух. Ця оборонна лінія діє лише тоді, коли ніхто не подумав створити бали.

Що буде падати наступним?

Це залишає практичне питання та доступну відповідь.

Виберіть будь-яку діяльність, яка вам подобається: роботу, ремесло, професію, завдання, якому ви навчилися вдосконалювати протягом багатьох років. Задайте три питання.

По-перше, чи можна надійно розрізнити успіх і невдачу? Не ідеально, не для кожного, але достатньо послідовно, щоб компетентні оцінювачі більшість часу згоджувалися. Гра легко проходить цей тест. Прогнозування структури білків проходить його, оскільки лабораторії в кінцевому підсумку дають відповідь. Письмо не проходить його в абсолютному сенсі, але проходить у відносному — люди зазвичай можуть сказати, який із двох варіантів кращий.

Друге: чи можна отримати такі судження з низькими витратами і в масштабі? Це питання вирішує не можливість, а терміни. Безкоштовне та миттєве судження, наприклад, у грі, означає, що система може самостійно генерувати мільйони тренувальних даних. Судження, що вимагають лабораторії, повільні, але все ще здійсненні — існує архів оцінок за тридцять років. Судження, що вимагають платного читання тексту людиною, дуже витратні, саме тому було вкладено стільки зусиль у навчання моделей імітувати цих людей і вилучити їх із циклу.

Третє: це не питання того, коли падає одна галузь, а те, що відбудеться після цього: чи є цей бал тим, чого ви справді хочете? Бал у грі — це те, чого ви хочете, бо у грі перемога за визначенням є усім. Структури білків, виміряні за експериментами, дуже близькі до того, чого ви хочете. Модель, навчена на перевагах анотаторів, — це не те, чого ви хочете. Це зображення того, чого ви хочете, а між зображенням і обличчям існує розрив.

Перевірте свою роботу за цими трьома питаннями. Більшість людей швидко знаходять першу відповідь — і вона викликає тривогу. Те, що ми називаємо майстерністю, принаймні в відносному сенсі, можна оцінити, коли здатні люди порівнюють дві спроби біля себе. Друге питання — це справжнє джерело невизначеності, оскільки витрати та масштаб — це рухомі цілі, і вони вже довго рухалися в одному напрямку. Третє питання майже ніхто не задає, а воно визначає, як виглядає ваша галузь з іншого боку.

Варто поступово виконувати цю вправу звичайними справами. Наприклад, радіологія. Чи можна розрізнити успіх і невдачу? Так, і дуже точно, оскільки діагноз в кінцевому підсумку підтверджується або спростовується станом пацієнта. Чи можна отримувати оцінки з низькими витратами в масштабі? Майже так, оскільки лікарні протягом десятиліть накопичували зразки оцінок у вигляді зображень та підтверджених результатів. Чи ця оцінка — те, що ви хочете? Тут відповідь стає складнішою, бо оцінюється відповідність діагнозу записам, але насправді ви хочете, щоб стан пацієнта був добрий — і ці дві речі збігаються більшість часу, але саме в найважливіших випадках розходяться.

Зараз візьміть щось, що здається більш безпечним. Візьмімо управління. Перше питання вже складне, бо люди різняться у думках щодо того, чи є певний менеджер добрий, і ці розбіжності не вирішуються швидко. Друге — ще складніше, бо наслідки управлінських рішень проявляються роки потому і переплітаються з усіма іншими подіями. Третє — найскладніше, бо будь-який запропонований альтернативний показник доброї управлінської діяльності — від рівня збереження персоналу до показників вовлеченості до продуктивності на працівника — очевидно, не є самою суттю. За цією діагностикою, управління не є безпечним через глибину. Воно просто не вимірюється — це інший, менш привабливий вид захисту.

Машини вже зайняли вісь оптимізації. На будь-якій чітко визначеній меті, при достатніх обчислювальних ресурсах, пошук добрих ходів більше не є змаганням, і результати часто не лише кращі за наші, а й більш чужі, досягаючи місць, яких наші традиції навчали нас не шукати. Це не передбачення. Це опис шахів, го, сідзі, структур білків і все більшої кількості речей, які раніше були у списку тих, що можуть робити лише люди.

Залишається сама мета. Хтось вирішив, чим є бали. У кожному з наведених вище випадків це рішення зайняло цілий день, і кожен винятковий результат виник із нього, був вірний йому і не звертав уваги на те, що було пропущено.

Отже, останнє питання варте глибокого обдумування. У вашій роботі вже є бали? Якщо так, то хто їх написав, і чи думали вони про вас, коли писали?

Це друга частина серії «Все, що ви запитуєте», про те, чого нарешті потребує машина, і наскільки погано ми це робимо.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.