Автор: Robonaissance
Перевод: Shenchao TechFlow
DeepChao обзор: Го, шахматы, сворачивание белков — почему эти области, которые кажутся требующими человеческой интуиции и креативности, одна за другой都被 AI преодолены? В этой статье раскрывается игнорируемая закономерность: не сложность задачи определяет, сможет ли AI превзойти человека, а возможность поставить оценку успеху. Когда в области устанавливается система оценки, она запускает обратный отсчет до своего собственного преодоления.
Из серии «Всё, что вы просите», о единственной работе, которую машина не может сделать за нас.
Одна десятитысячная
10 марта 2016 года в отеле в Сеуле машина сделала ход, который никто в комнате не мог понять, а её противник в тот момент отсутствовал.
Ли Седол вышел покурить. Ему было 33 года, он владел 18 титулами чемпиона мира и считался самым сильным го-игроком своего поколения. Он проиграл первую партию накануне, и к началу второй партии его первоначальная уверенность уменьшилась, он стал более осторожным. Пока он был вне комнаты, AlphaGo сделал 37-й ход, и исследователь DeepMind Хуан Шицзе вместо машины тихо положил камень на доску.
Фишка упала на пятую линию.
Для тех, кто не понимает го, это не имеет смысла. Для тех, кто понимает, это почти безумие. На этапе открытия и середины игры позиции, удаленные так далеко от края, считаются неэффективными: они не приносят ни реальной территории, ни защиты, что равносильно бесплатной передаче очков сопернику. Это ход, который учитель исправляет у новичков. На комментаторской скамейке ведущий профессиональный го-игрок Майкл Редмонд во время прямой трансляции матча сначала подумал, что возникла ошибка сигнала доски. Он взял камень в руку, а затем положил его обратно.
Ли Седол вернулся и сел, долго смотрел на доску, не делая хода. Разные оценки времени варьировались от примерно 12 до 15 минут. В то время, когда пяти месяцев назад проиграл AlphaGo, европейский чемпион Фан Хуи наблюдал за игрой в здании. Его вывод после долгого наблюдения был следующим: «Это не ход человека. Я никогда раньше не видел, чтобы кто-то так играл».
Он прав, и это можно количественно оценить. Внутри системы DeepMind существует механизм оценки, который, обучаясь на большом количестве партий людей, оценивает вероятность того, что человек сделает определенный ход в любой позиции. Для 37-го хода эта оценка составляет примерно одну десятитысячную.
Машина всё ещё ходила, и этот ход выиграл всю партию.
Существует удобное толкование этой истории, согласно которому машина усердно училась у человеческих мастеров и в конце концов догнала самых сильных из них. Это толкование неверно, и цифра одна из ста тысяч как раз показывает, почему оно неверно. У системы, обучающейся и имитирующей ходы людей, есть потолок — это сами человеческие ходы. То, что произошло в Сеуле, заключалось в том, что система перестала быть ограниченной этим потолком, потому что её целью было не одобрение человеческих мастеров, а победа в партии.
Это различие указывает на более полезное направление, чем восхищение. Если вы хотите узнать, какие человеческие деятельности уже проиграли по чистому уровню способностей, а какие следующие, вопрос не в том, насколько сложна эта деятельность, насколько она требует креативности или интуиции. Вопрос гораздо более скучный.
Вопрос в том, можно ли оценить успех.
Одна партия за другой
Шахматы проиграли 19 лет назад, и проиграли совершенно иначе.
В 1997 году Deep Blue победила Каспарова, используя архитектуру, которая по сути была грандиозным проявлением человеческого выражения. Его функция оценки — компонент, который анализирует позицию и присваивает ей числовое значение — была собрана и настроена при помощи помощи гроссмейстеров-консультантов. Человеческие знания о шахматах с большим трудом извлекались из шахматистов и вводились в машину. То, что добавила машина, — это способность к поиску: более быстрое просматривание большего количества ходов вперед, без усталости и без потери фигур из-за рассеянности внимания.
Это настоящая победа, и её следует считать победой. Но обратите внимание на её форму. Глубокий синий понимает шахматы так, как понимают их люди. Его преимущество — в скорости. Если спросить его, почему он так оценивает позицию, ответ в конечном итоге приведёт к человеку, который ему это сказал.
Спустя 20 лет DeepMind выпустила систему под названием AlphaZero, которая изменила свою форму.
Альфа-Ноль получила только правила шахмат. Ей не предоставили библиотеку открытий — каталог изученных первых ходов, на которых зависят все серьезные программы. Ей не предоставили таблицы окончаний. Ей не показали ни одной партии человека. Она играла сама с собой, начиная со случайных ходов и корректируя свою игру на основе того, что приводит к победе.
Примерно через четыре часа DeepMind оценила свой рейтинг выше, чем у тогдашней сильнейшей традиционной программы Stockfish 8. Примерно через девять часов она сыграла сто партий против Stockfish в условиях лимита времени, выиграв 28 партий, не проиграв ни одной, и сделав 72 ничьи. В статье сообщается, что за 24 часа она достигла сверхчеловеческого уровня в шахматах, сёги и го.
Эти цифры часто приводят без другой части контекста, которая крайне важна. Игры в самопротивостояние были сгенерированы на пяти тысячах первых поколений тензорных процессоров, а сеть обучалась на еще 64 устройствах второго поколения, все работали параллельно. Четыре часа реального времени — это четыре часа вычислительной нагрузки, объем которой не может собрать ни один частный человек, даже немногие институты. Достижение заключается не в том, что шахматы стали легко осваивать. Достижение в том, что когда у вас столько вычислительной мощности, человеческие знания больше не являются тем, что вам нужно.
Каспаров имел больше оснований, чем кто-либо живой, воспринять этот результат как личное поражение, но он написал обзор в журнале «Science», проявив большую щедрость. Его наблюдение заключалось в том, что AlphaZero играет не в ту сухую, осторожную, склонную к ничьей шахматную игру, которую большинство ожидали от идеальной машины. Она предпочитает активность материальным преимуществам и жертвует фигурами ради позиций, которые, по его мнению, выглядят рискованными. Он отметил, что традиционные программы отражают приоритеты и предвзятости своих создателей. AlphaZero написала сама себя. Он пришел к выводу, что ее стиль поэтому отражает нечто более подлинное, чем вкусы программистов, и отметил, что она проверяет значительно меньше позиций в секунду, чем лучшие традиционные движки в мире, но все равно побеждает.
Этот последний деталь стоит запомнить. Традиционные движки рассматривают гораздо больше возможностей в секунду, но всё равно проиграли. Преимущество AlphaZero заключается не в том, что она смотрит усерднее, а в том, что она знает, куда смотреть — и это знание собрано исключительно из миллионов партий самопротивостояния и правила, определяющего, кто выиграл.
Результаты партий в сёги кажутся ещё более странными тем, кто умеет их читать. Сёги — это японская настольная игра, в которой пойманные фигуры возвращаются к тому игроку, кто их захватил, что делает колебания позиции более интенсивными, чем в шахматах, а также накопленными за сотни лет теориями о том, как обеспечить безопасность короля. Сильные игроки, просмотрев партии машин, сообщили, что открытия нарушают известные теории: король перемещается в центр доски в моменты, когда каждая книга говорит, что его следует укрывать в углу. Эти партии почти не поддаются интерпретации для тренированного глаза, но они побеждают.
Поместите две системы рядом — закономерности становятся настолько ясными, что это пугает. Темно-синий — это человеческие знания плюс скорость машины. AlphaZero — это скорость машины плюс определение победы, человеческие знания намеренно удалены. Версия без человеческих знаний лучше.
Всё это не означает, что машина 2016 года была безупречной — та же самая игра в Сеуле содержала доказательства.
В четвертой партии, отставая три партии к нулю и борясь за достоинство, Ли Седол вставил камень между двумя группами камней AlphaGo в центре доски. Позже этот ход назвали «божественным ходом». Сама AlphaGo оценила вероятность того, что человек сделает этот ход, примерно в одну десятитысячную — удивительно симметрично. Система не смогла справиться с ним. Оценка вероятности победы AlphaGo рухнула в следующих нескольких ходах, ее игра ухудшилась, и она проиграла эту партию.
Таким образом, в марте 2016 года на машине все еще был пробел, и человек, под давлением мирового внимания и при максимальном напряжении, нашел его. Это стоит четко обозначить, а не умалчивать. Также стоит отметить последующие события: такие пробелы систематически устранялись, и последователи этой системы больше не проигрывали такие партии — топовые движки уже давно не проигрывают человеку ни одной партии на серьезных соревнованиях. Результат 2016 года — это снимок момента перехода, а не постоянное равновесие сил.
От этих досок до всего остального, передаётся не сама победа, а механизм. Шахматы и го обречены стать первыми, и причина удивительно проста. В играх успех точно и полностью определён правилами. Ты выигрываешь или проигрываешь — оценка бесплатна, мгновенна и неоспорима. Система может сыграть четыре миллиона партий сама с собой за выходные и получить четыре миллиона однозначных решений.
Это указывает на следующее место, на которое стоит обратить внимание. Не на простые задачи, а на те, которые имеют собственную систему подсчета очков.
Пятидесятилетняя проблема
Белки представляют собой цепочки аминокислот, которые складываются в сложные трёхмерные формы сразу после синтеза. Форма определяет функцию белка. Последовательность определяет форму. Выведение формы из последовательности было открытой проблемой в биологии с начала 1970-х годов — и оставалось нерешённой всеми возможными способами: от физического моделирования на основе первых принципов и статистического анализа эволюционных связей до десятилетий накопленных структурных интуиций — всё безрезультатно.
В 1994 году группа исследователей под руководством Джона Мулта что-то сделала с этим фактом: все в отрасли заявляли о прогрессе, но никто не мог это проверить.
Они организовали конкурс. С тех пор каждые два года структурное предсказание ключевой оценки (CASP) публикует последовательности белков, структуры которых были только что определены экспериментально, а в некоторых случаях даже еще не окончательно установлены, для всех желающих. Любая команда может представить свои предсказания. Никто не имеет доступа к ответам, поскольку для некоторых целей ответы еще не существуют. Когда экспериментальные структуры становятся доступны, предсказания оцениваются и сравниваются с ними.
Оценка проводится с использованием метрики, называемой глобальным тестом расстояния, по шкале от 0 до 100, что можно приблизительно понимать как процент, указывающий, насколько близко конечное положение цепочки к фактическому положению. Мулт упоминал, что примерно 90 баллов неофициально считаются эквивалентными структуре, определенной в лаборатории. В течение большей части истории оценки лучшие прогнозы колебались около 60 баллов.
На CASP14 в 2020 году участник, зарегистрированный под номером 427, показал медианную оценку 92,4 по всем целям. На самых сложных целях — тех, для которых не было полезных структурных аналогов — медианная оценка составила 87,0. Средняя ошибка составляла около 1,6 ангстрем, что примерно равно ширине одного атома.
Моулт, который был председателем с начала конкурса, провел зрителей через историю конкурса перед представлением графиков. График наглядно показал всю историю одной картинкой: двадцать лет линия медленно ползла около отметки 60, а затем одна линия встала на место, которого другие линии никогда не достигали.
Группа 427 — это AlphaFold2. Мулт объявил, что для одиночной белковой цепи проблема решена.
Ограничения должны быть там, в каждом честном повествовании. Одна цепь — это не всё в белковой науке. Как белки собираются в комплексы, как они движутся и как ведут себя в живых клетках — всё это остаётся открытым вопросом. Закрытая великая задача — это конкретная, точно сформулированная задача.
И именно эта точность — суть того, почему здесь рассказывается эта история. То, что построение прогнозов рухнуло, не потому, что оно было слишком простым — полвека неудач говорят об обратном. Оно рухнуло потому, что в 1994 году эта область создала себе систему подсчета очков.
Рассматривая CASP как инженерную задачу, а не научную, мы видим, что она предоставляет четкий и однозначный показатель успеха для любой предсказательной модели, который можно вычислить за несколько секунд. Она предоставляет невозможный для манипуляций эталонный факт, поскольку ответы физически определяются в лаборатории другими исследователями. Она обеспечивает постоянный поток новых задач, генерируемых по фиксированному расписанию. Она предоставляет тридцатилетнюю историю оценок попыток, то есть подробную классификацию того, что в этой области считается лучше или хуже.
Область, которая сделала всё это, случайно подготовила автоматизированные атаки на свои собственные проблемы. Счётчик — это предпосылка. Всё остальное — инженерия и вычисления, и обе они каждый год всё дешевле в течение долгого времени.
Это продвижение с тревожной легкостью. Там, где есть дисциплина, достигшая консенсуса по эталону, появляется мишень. Для машинного перевода есть эталоны оценки. Для распознавания речи есть эталоны оценки. Для классификации изображений существует набор из миллиона аннотированных фотографий и ежегодный конкурс, каждый, кто видел этот конкурс, знает, как заканчивается история. Закон не в том, что сначала падает сложное, или сначала падает простое. Закон в том, что сначала падает то, что измеряется.
Это вызывает очевидные вопросы по поводу всего, что еще не было измерено.
Оценивать то, что нельзя оценить
Последней линией обороны должны были быть те вещи, которые нельзя оценить.
Письмо — это стандартный пример. Нет программы, которая могла бы взять абзац и вернуть число, говорящее, насколько он хорош. Два квалифицированных редактора могут не согласиться. Один и тот же редактор может не согласовываться с самим собой в разные дни. Качество языка переплетено с контекстом, аудиторией, целью и вкусом, которые нельзя свести к измеримой величине. Если машине нужна система оценок, а у языка её нет, то язык в безопасности.
Этот аргумент обоснован. То, что с ним произошло, является наиболее важной причиной во всей этой истории.
В этой области не существует объективных мер для оценки качества письма. Таких мер до сих пор нет. Она создает оценку, используя единственный доступный материал — человеческие суждения.
История этого метода длиннее, чем считают большинство. В 2008 году Кнокс и Стоун описали систему под названием TAMER, в которой люди наблюдали за поведением агентов и давали оценки, используемые для обучения модели, предсказывающей, что скажут люди. Затем обучающие сигналы предоставлялись самой моделью, а не людьми. В 2017 году Христьяно и его коллеги опубликовали работу, которую большинство считают прямым предшественником современной практики, применив эту идею к агентам в играх Atari. В 2019 году Циглер и его коллеги применили её к языковым моделям, и большинство терминов, используемых сегодня, были определены именно в этой статье. В 2022 году Оуян и его коллеги продемонстрировали этот метод в промышленных масштабах на задачах выполнения инструкций, и вскоре после этого большинство людей на Земле, не подозревая об этом, столкнулись с этими результатами.
Его основной механизм стоит изучить подробнее, поскольку он проще, чем кажется по слухам.
Человек сидит перед двумя текстами, оба из которых были сгенерированы моделью по одному и тому же запросу. Задача — не оценивать их. Оценка — это то, что люди делают плохо, потому что семерка одного человека — это пятерка другого, и даже один и тот же человек нестабилен в течение одного дня. Задача — просто сказать, какой из них лучше. Это то, что люди могут надежно определить, а математические методы преобразования множества таких сравнений в согласованную шкалу старше самой области их применения и восходят к работе Брэдли и Терри 1952 года о парных сравнениях.
Подумайте о условиях труда, при которых принимаются такие решения, поскольку они в конечном итоге оказывают влияние. Этот человек делает такие суждения много раз в час, получая вознаграждение, и сверяется с письменным руководством, объясняющим, что клиенты считают лучшим ответом. Некоторые пары практически идентичны. Некоторые касаются тем, о которых этот человек ничего не знает; в таких случаях чаще выбирается тот ответ, который звучит более уверенно и лучше структурирован, независимо от того, насколько он точен. Это не критика этих людей. Это описание того, что сделает любой человек в таких условиях, а полученные выборы являются сырьем.
Собрав достаточное количество таких выборов, вы можете обучить вторую модель, задача которой — предсказать, какую из двух текстовых фраз люди предпочтут. Эта вторая модель выводит число. А число — это то самое единственное, чего не хватало.
Внимательно рассмотрите, что именно здесь создается, — это легко упустить из виду. Оптимизированный балл не отражает фактов о мире. Он отражает нашу модель. Это сжатая, выученная имитация суждений определенной группы людей, которые были наняты в определенное время, работали по определенным инструкциям и, как и все остальные, чувствовали усталость после обеда. CASP оценивает прогнозы на основе физической реальности, установленной в лаборатории, тогда как эта система оценивает тексты на основе статистических портретов, признанных людьми.
Этот портрет полезен. Но он также неизбежно является приближением, и между ним и изображаемым объектом существуют различия, которые никто полностью не понимает. Любые аспекты наших реальных предпочтений, которые не были захвачены нашей моделью предпочтений, не входят в цель, следовательно, не оптимизируются и подвержены любым влияниям — а мощный оптимизатор не имеет причин защищать эту величину.
Это факт о конструкции, и при его изложении не делается никаких утверждений о том, насколько плохи последствия. Текущая точка более узкая и труднее для опровержения. Категории, которые нельзя оценить, меньше, чем кажется. Если область сопротивляется измерению, можно построить измерение на основе человеческих предпочтений и продолжить движение вперёд. Эта защитная линия действует только тогда, когда никто не подумал создать оценку.
Что будет следующим
Это оставляет практический вопрос и доступный ответ.
Выберите любое занятие, которое вам нравится: работу, ремесло, профессию, задачу, которой вы много лет учились владеть. Задайте три вопроса.
Во-первых, можно ли надежно различать успех и неудачу? Не идеально и не для каждого, но достаточно последовательно, чтобы компетентные оценщики в большинстве случаев приходили к единому мнению. Игра легко проходит этот тест. Прогнозирование структуры белков проходит его, потому что лаборатории в конечном итоге дают ответ. Письмо не проходит его в абсолютном смысле, но проходит в относительном, поскольку люди обычно могут сказать, какая из двух попыток лучше.
Во-вторых, можно ли получить такие суждения низкими затратами и в масштабе? Этот вопрос определяет сроки, а не возможность. Бесплатное и мгновенное суждение, например, в игре, означает, что система может самостоятельно генерировать миллионы обучающих данных. Суждение, требующее лаборатории, медленнее, но все еще осуществимо, при этом имеется архив оценок за тридцать лет. Суждение, требующее платного человеческого чтения текста, очень дорогое — именно поэтому было приложено столько усилий для обучения моделей имитировать этих людей и исключать их из цикла.
В-третьих, вопрос не в том, когда та или иная область рухнет, а в том, что произойдет после этого: действительно ли этот результат — то, что вы хотите? Оценка в игре — это то, что вы хотите, потому что в игре победа по определению является всей сутью. Структуры белков, измеренные экспериментально, очень близки к тому, что вы хотите. Модель, обученная на предпочтениях аннотаторов, — это не то, что вы хотите. Это портрет того, что вы хотите, а между портретом и лицом существует разница.
Проверьте свою работу с помощью этих трех вопросов. Большинство людей быстро находят первый ответ, и он вызывает беспокойство. То, что мы называем навыками, по крайней мере в относительном смысле, можно оценить, когда способные люди сравнивают две попытки рядом. Второй вопрос — это настоящая неопределенность, поскольку стоимость и масштаб являются подвижными целями, и они уже долгое время движутся в одном направлении. Третий вопрос почти никто не задает, и именно он определяет, как выглядит ваша область с другой стороны.
Стоит постепенно проводить это упражнение на некоторых обычных вещах. Возьмем, к примеру, радиологию. Можно ли различить успех и неудачу? Да, и очень точно, поскольку диагноз в конечном итоге подтверждается или опровергается состоянием пациента. Можно ли получать оценки дешево и в масштабе? В основном да, поскольку больницы уже десятилетиями накапливают образцы оценок в виде изображений и подтвержденных результатов. Является ли эта оценка тем, чего вы хотите? Здесь ответ становится сложным, поскольку оценивается согласованность с зафиксированным диагнозом, а на самом деле вы хотите, чтобы состояние пациента было хорошим — эти две вещи совпадают в большинстве случаев, но именно в самых важных ситуациях расходятся.
Возьмите что-нибудь, что кажется более безопасным. Возьмем управление. Первая проблема уже сложна, потому что эксперты расходятся во мнениях о том, насколько хорош тот или иной менеджер, и эти разногласия не решаются быстро. Вторая еще сложнее, потому что последствия управленческих решений проявляются только через годы и переплетаются со всеми другими происходящими событиями. Третья самая сложная, потому что любой предложенный альтернативный показатель хорошего управления — от уровня удержания до показателей вовлеченности до производительности на человека — очевидно, не является самим предметом. Согласно этому диагнозу, управление не безопасно из-за глубины. Оно просто не измеряется — это другой, менее привлекательный вид защиты.
Машины уже заняли ось оптимизации. При достаточных вычислительных ресурсах поиск хороших ходов на любых четко определенных целях перестает быть соревнованием, и результаты часто оказываются не только сильнее наших, но и более чуждыми, достигая мест, куда нас учили не смотреть в традиционных подходах. Это не предсказание. Это описание шахмат, го, сёги, структур белков и все большего числа вещей, которые раньше входили в список того, что могут делать только люди.
Остальное — это сама цель. Кто-то решил, что такое оценка. В каждом из приведённых выше случаев это решение заняло целый послеобеденный час, и каждый выдающийся результат возник из него, оставался верным ему и был безразличен ко всему, что было им упущено.
Так что последний вопрос заслуживает глубокого размышления. У вас уже есть оценки в работе? Если да, то кто их написал и думали ли они о вас, когда писали?
Это вторая часть серии «Whatever You Ask For» о том, чего на самом деле хочет машина и насколько плохо мы с этим справляемся.
