AIの達成への道:スコアリングシステムがある場所には、AIが従う

iconTechFlow
共有
AI summary icon概要
スコアリングシステムが存在する場所では、AIの支配が拡大している。囲碁、チェス、タンパク質折りたたみの事例がそれを示している。AlphaGoの李世石への手、AlphaZeroのチェスにおける優位性、AlphaFold2のタンパク質における画期的成果は、AIが測定可能な目標で繁栄することを示している。注目すべきアルトコインを追跡するトレーダーは、この傾向に注目すべきだ。AIが構造化された分野に食い込む中で、フィア・グリード・インデックスは市場の不確実性を反映する可能性がある。次なるフロンティアは、明確な指標のない人間の活動である。

著者:Robonaissance

翻訳:深潮 TechFlow

深潮導読:囲碁、チェス、タンパク質の折りたたみ——これらの分野は人間の直感と創造性を必要とするように思われるが、なぜ次々とAIに攻略されたのか?本記事は、見過ごされてきた法則を明らかにする:AIが人間を上回れるかどうかを決めるのは、タスクの難易度ではなく、成功を評価できるかどうかである。ある分野に評価基準が確立されれば、その分野が攻略されるまでのカウントダウンが開始される。

『Whatever You Ask For』シリーズより、機械が私たちの代わりにできない唯一の仕事について。

1万分の1

2016年3月10日、ソウルのホテルで、一台のマシンが部屋にいた全員が理解できない一手を指し、その対戦相手はその場にいなかった。

李世石は煙草を吸いに出た。当時33歳で、18個の世界タイトルを所有し、その世代で最も優れた囲碁プレイヤーと広く認められていた。前日の第1局で敗れた後、第2局に臨むにあたり、彼の自信は控えめになり、心構えはより慎重になっていた。彼が外にいたとき、AlphaGoは37手を選択し、DeepMindの研究員である黄士傑が機械に代わって、静かに碁盤に石を置いた。

駒が第五線に落ちた。

囲碁を知らない人にとっては、これは意味をなさない。理解している人にとっては、ほぼ馬鹿げている。序盤や中盤において、縁からそれほど離れた場所は効率が悪く、実地も得られず、地盤も守れないため、相手に点を渡すような手とされる。これは指導者が初心者を正すような手である。解説席では、トッププロのマイケル・レッドモンドがライブ配信中に最初は盤面の信号エラーだと考え、石を手に取り、また置き直した。

李世石は戻って座り、長い間碁盤を見つめ、動かなかった。その時間は約12分から15分とさまざまな説がある。5か月前にAlphaGoに敗れたヨーロッパチャンピオンの樊麾は、その時建物内で試合を観戦していた。長く見つめた後、彼は次のように判断した。「これは人間の打ち方ではない。私はこれまでこんな打ち方をした人を見たことがない。」

彼の主張は正しいだけでなく、定量的にも確認できる。DeepMindのシステムには、多数の人類の対局を学習することで、任意の局面において人類が特定の手を打つ確率を推定するメカニズムが組み込まれている。37手目については、この推定値は約1万分の1である。

機械はまだ下りていないが、この一手で勝負が決まった。

この物語には、機械が人間の巨匠たちを一生懸命学び、最終的に最も優れた人間を追い越したという、心地よい解釈がある。しかし、この解釈は誤りであり、この「万分の一」という数字が、なぜそれが誤りなのかをはっきりと示している。人間の手を模倣して学習するシステムには、人間の手がその上限となる。ソウルで起きたことは、その上限から解放されたシステムが登場したということだ。なぜなら、そのシステムに与えられた目標は、人間の巨匠たちの賛同ではなく、勝つことだったからである。

この違いが示す方向性は、称賛よりもはるかに役立つ。どの人間の活動が純粋な能力の観点で既に敗北し、次にどの活動が敗北するかを知りたいのであれば、その活動がどれほど難しいか、どれほど創造性を必要とするか、あるいはどれほど直感を要するかという質問ではない。その質問ははるかに退屈なものだ。

問題は、成功を点数で評価できるかどうかです。

一連の取引が続きます

19年前、チェスは全く異なる方法で敗れた。

1997年にディープブルーがカスパロフを破った際のアーキテクチャは、本質的に巨大な人間の表現行為であった。その評価関数——盤面を見てその良さを数値で示すコンポーネント——は、グランドマスターのアドバイザーの支援のもとで組み立てられ調整された。人間のチェス知識は、人間のプレイヤーから丁寧に抽出され、機械に組み込まれた。機械が追加したのは検索能力である:より多くの手先を速く見通し、疲労することなく、注意散漫で手を落とすことがない。

これは真の勝利であり、勝利とみなすべきである。しかし、その形態に注目しよう。ディープブルーのチェスに対する理解は人間の理解である。その優位性は速度にある。なぜそのように局面を評価するのかと尋ねれば、最終的には、そのように指示した誰かにたどり着くだろう。

20年後、DeepMindはAlphaZeroというシステムを発表し、その形態が変わった。

AlphaZeroにはチェスのルールのみが与えられました。開局庫——あらゆる本格的なプログラムが依存する研究された初手のコレクション——は与えられていません。エンドゲームテーブルも与えられていません。人間の対局も一つも与えられていません。AlphaZeroは自分自身と対戦し、ランダムな手から始め、何が勝利につながるかに基づいて自らを調整しました。

約4時間後、DeepMindはそのレーティングが当時最強の従来プログラムStockfish 8を上回ったと推定した。約9時間後、制限時間条件下でStockfishと100局対戦し、28勝、0敗、72引き分けとなった。論文は、24時間以内にDeepMindがチェス、将棋、囲碁のすべてで人間を上回るレベルに達したと報告している。

これらの数値は、もう一方の叙述なしに引用されることが多いが、もう一方の叙述も重要である。自己対局の棋譜は、第一世代のテンソル処理ユニット5,000個で生成され、さらに第二世代のユニット64個がネットワークの訓練に使用され、すべてが並列で動作した。時計で4時間の時間は、4時間分の計算量を意味する——この規模の計算能力は、個人はもちろん、少数の機関でも組み上げることはできない。達成されたのは、チェスを簡単に学べるようになったことではない。達成されたのは、それほど膨大な計算能力を持ったとき、人間の知識がもはや必要ではなくなるということである。

カスパロフは、この結果を自分への攻撃と捉える理由を、生きている誰よりも持っていたが、彼は『Science』に一篇の評論を掲載し、非常に寛大だった。彼の観察によれば、AlphaZeroが指すのは、誰もが完璧な機械が指すと予想するような退屈で慎重で引き分け志向のチェスではない。それは、子力よりも活性を優先し、彼の見解ではリスクに見える局面のために駒を犠牲にする。彼は、従来のプログラムはそれを書いた人々の優先順位と偏見を反映していると指摘した。AlphaZeroは自分自身を書き換えたのだ。彼は、そのスタイルはプログラマーの嗜好よりもはるかに本物のものを反映していると結論づけ、AlphaZeroが毎秒チェックする局面の数が世界最高の従来エンジンよりはるかに少ないにもかかわらず、勝利したことを観察した。

この細部は覚えておく価値があります。従来のエンジンは、毎秒より多くの可能性を探索しましたが、敗れました。AlphaZeroの優位性は、より一生懸命見ることではなく、どこを見ればよいかを知っていることにあります。そして、その知識は、数百万局の自己対弈と、誰が勝つかというルールのみから構築されています。それ以外には何もありません。

将棋の結果は、読み取る資格のある者にとってはより奇妙である。将棋は日本の棋盤ゲームで、取られた駒はそれを取った側の手元に戻るため、チェスよりも局面の変動が大きい。また、王を安全に守るための何百年にもわたる理論も存在する。強力な棋士たちは、マシンの対局を見た後、開局が既知の理論に反し、王が本に「隅に引きこもるべき」と書かれているタイミングで盤の中央へ移動していると報告した。これらの対局は訓練された目にはほとんど解読不可能だが、それらは勝利を収めた。

二つのシステムを並べると、その規則性が不気味なほど明確である。濃紺は人間の知識と機械の速度の組み合わせである。AlphaZeroは機械の速度と勝利の定義の組み合わせであり、人間の知識は意図的に除去されている。人間の知識を除去したバージョンの方が優れている。

これらすべては、2016年のマシンが完璧であることを意味するものではありません。同じソウルの試合にはその証拠が含まれていました。

第4局、3勝1敗で劣勢の中、李世石は碁盤の中央、AlphaGoの二つの石塊の間に一石を打ち込んだ。これは後に「神の一手」と呼ばれた。AlphaGo自身が人間がこの手を打つ確率を推定したのも約万分の一であり、奇妙なほど対称的だった。システムはこの手に対応できなかった。その後の数手で、AlphaGoは自身の勝利確率の評価を崩し、棋力が低下してこの対局を落とした。

したがって、2016年3月、機械にはまだ穴が存在し、人類は世界の注目と最大のプレッシャーの中、その穴を見つけ出した。これは軽く流すのではなく、明確に述べる価値がある。同様に、その後に起きたことも重要である:このような穴は着実に修正され、そのシステムの後継者はもはやこのような対局で敗れず、トップエンジンは公式な場で長らく人類に一局も敗れていない。2016年の結果は、恒久的な力の均衡ではなく、転換点の瞬間的なスナップショットであった。

これらの盤上から他のすべてのものへと移行するのは勝利そのものではなく、メカニズムである。チェスと囲碁は、その理由が恥ずかしいほど単純であるため、最初に倒れる運命にある。ゲームにおいて、成功はルールによって完全に正確に定義されている。勝つか負けるか、スコアリングは無料で即時的かつ議論の余地がない。システムは週末の間に自分自身と四千万局対戦し、四千万の明確な判定を得ることができる。

これは次に注目すべき場所を示しています。単純なタスクではなく、スコアボードが付いているタスクです。

五十年の難題

タンパク質はアミノ酸の鎖であり、合成された瞬間に複雑な三次元形状に折りたたまれる。形状がタンパク質の機能を決定し、配列が形状を決定する。1970年代初頭以来、前者から後者を導くことは生物学における未解決の課題であり、その難易度はあらゆるアプローチを拒んできた:第一原理に基づく物理シミュレーション、進化的関係の統計的分析、数十年にわたって蓄積された構造的直感——どれも効果を上げられなかった。

1994年、ジョン・ムールトは、分野の全員が進展を主張しているが、誰も検証できないという事実に何らかの対応をした。

彼らは試験を実施した。それ以来、2年ごとに、構造予測の重要な評価(CASP)は、最新の実験的に決定されたタンパク質構造、場合によってはまだ決定途中のものを配列として世界に公開する。どのチームでも予測を提出できる。一部のターゲットについては、正解がまだ存在しないため、誰も正解にアクセスできない。実験的構造が得られ次第、予測結果は比較されてスコアが付けられる。

スコアは、グローバル距離テストという指標を用いて0から100の範囲で評価され、これはチェーンの最終位置が実際の位置に十分近い割合と概ね理解できる。Moultは、約90点が非公式に実験室で決定された構造と同等と見なされていると述べている。これまでの評価の大部分において、最高の予測は約60点付近で推移してきた。

2020年のCASP14において、登録番号427の参加者は、すべてのターゲットにおいて中央値スコア92.4を記録しました。最も難しいカテゴリである、有用な構造的近縁が利用できないターゲットでは、中央値スコアは87.0でした。平均誤差は約1.6エングストロームで、これは原子1個分の幅に相当します。

Moultはコンテスト開始以来議長を務めており、チャートを提示する前に観客にコンテストの歴史を振り返りました。チャートは1枚の図で全体の物語を示しています。20年間のラインは60付近を這い、その後、他のラインが到達したことがない場所にラインが立ちました。

427組はAlphaFold2です。Moultは、単一のタンパク質鎖について、問題は解決されたと発表しました。

限定詞は、すべての誠実な叙述においてそこに存在すべきである。単一の鎖は、タンパク質科学のすべてではない。タンパク質が複合体としてどのように組み合わさり、どのように運動し、生きた細胞内でどのように振る舞うかという問題は、依然として未解決である。閉じられた大規模な課題とは、具体的で正確に述べられた課題である。

そして、この正確性こそが、ここでこの物語を語る要点である。構造予測が崩れたのは、もともと単純だったからではない。半世紀にわたる失敗が逆のことを示している。構造予測を崩したのは、1994年にこの分野が自分自身でスコアボードを築いたことである。

CASPを科学ではなく工学として見ると、それは何を提供するか。それは、あらゆる予測に適用でき、数秒で計算できる明確な成功指標を提供する。答えが他の研究者が実験室で物理的に決定しているため、不正が不可能なベンチマークを提供する。固定スケジュールで継続的に新しい問題を生成する。そして、この分野で「より良い」と「より悪い」の評価記録として、30年にわたる過去の評価済みの試みを提供する。

これらのすべてを実行した分野は、自らの問題に対して無意識のうちに自動化攻撃の準備を整えてしまった。スコアボードは前提条件である。その他のすべては工学と計算であり、両者は長年にわたり毎年ますます安くなっている。

これは非常に不安なほど軽率な推進である。学問分野で基準の合意が形成された場所には、常に標的が設定された。機械翻訳には評価基準がある。音声認識には評価基準がある。画像分類には、百万枚の写真がラベル付けされたデータセットと年次コンテストがあり、そのコンテストを誰もが見て、物語がどのように終わるかを知っている。規則は、難しいものが先に倒れるわけでも、簡単なものが先に倒れるわけでもない。規則は、測定されるものが先に倒れるということである。

これは、まだ測定されていないすべてのものに対して明らかに問題を提起する。

評価できないものに評価をつける

最後の砦は、評価できないものであるべきだった。

執筆は標準的な例である。どのプログラムも、ある段落を入力してその良さを数値で返すことはできない。二人の有能な編集者が意見が一致しないこともある。同じ編集者が異なる日に自分自身と意見が食い違うこともある。言語の質は、文脈、読者、目的、嗜好と絡み合っており、これらはいずれも測定値に還元できない。機械が得点表を必要とする一方で、言語には得点表が存在しないならば、言語は安全である。

この議論は成り立つ。それに起こったことは、この全体の物語において最も重要な理由である。

この分野には、客観的な評価基準が存在しません。まだそのようなものはありません。このシステムは、人間の判断という唯一利用可能な材料を用いてスコアを生成しています。

この方法の歴史は、多くの人が思っているよりもはるかに古い。2008年、KnoxとStoneは、TAMERというシステムを記述し、人間がエージェントの行動を観察して評価を提供し、その評価を用いて人間が何と言うかを予測するモデルを訓練した。その後、訓練信号は人間ではなくモデルが提供した。2017年、Christianoらは、このアイデアをAtariゲームのエージェントに適用した論文を発表し、これは現在の実践の直接的な起源と広く認識されている。2019年、Zieglerらはこの手法を言語モデルに適用し、今日使用されているほとんどの用語はその論文で定義された。2022年、Ouyangらは指示従順タスクにおいて産業規模でこの手法を実証し、その後間もなく、地球上の大多数の人が無意識のうちにその成果に触れた。

その核心メカニズムは、名前が示すよりもはるかにシンプルであるため、具体的に理解する価値があります。

一人が二つのテキストの前に座っており、両方のテキストは同じプロンプトに対してモデルが生成したものである。このタスクはそれらに点数をつけることではない。点数付けは人間が非常に苦手とする作業であり、ある人の7点が別の人の5点になることがあり、同じ人でも午後の中で一貫性がないからである。このタスクは、どちらがより優れているかを述べることだけである。これは人間が信頼性を持って判断できる事項であり、このような比較の集まりを一貫したスケールに変換する数学的手法は、1952年のブラッドリーとテリーによる対比較の研究にまでさかのぼる。

このような判断を下す作業条件を考えてみてください。なぜなら、それらは最終的に影響を及ぼすからです。この人は1時間に何度もこのような判断を下し、報酬を得ながら、顧客がどのような答えをより良いと感じるかを説明した書面のガイドラインに従います。いくつかのペアはほぼ完全に同じです。また、この人がまったく知らないテーマを含むものもあり、その場合、より自信に満ち、整理されている答えが、正確さに関わらず選ばれることが多いです。これはこれらの人の批判ではありません。このような条件のもとで誰でも行う行動の描写であり、由此生じる選択が原材料となるのです。

これらの選択肢を十分に集めれば、二つ目のモデルを訓練できます。この二つ目のモデルの役割は、二つのテキストのうち、人間がどちらを好むかを予測することです。この二つ目のモデルは数値を出力します。そして、その数値こそ、これまで欠けていた唯一の要素でした。

ここで構築されているものをよく見てください。なぜなら、見落とされがちだからです。最適化されたスコアは、世界の事実に関するものではありません。それは私たちのモデルに関するものです。特定の時期に雇われ、特定の指示に従って働き、他の誰かと同じように午後に疲れる一団の判断を圧縮し、学習した模倣です。CASPは実験室で特定された物理的現実に基づいて予測を評価しますが、このシステムは人間が認めた統計的プロフィールに基づいてテキストを評価します。

この画像は役に立ちます。しかし、それは必然的に近似であり、描写された対象との間に差異が存在し、その差異を誰も完全には理解していません。私たちの好みモデルが実際の好みを捉えられていない任何の要素は、目標に含まれていないため、最適化されず、あらゆる状況の影響を受けます——強力な最適化器には、この量を保護する理由がありません。

これは構造に関する事実であり、ここで述べられているのはその結果がどれほど悪いかという主張ではない。眼前的なポイントはより狭く、より反論しづらい。評価できない事物のカテゴリは、見かけほど大きくない。ある分野が測定を拒否する場合、人間の好みから測定値を構築し、進み続けることができる。この防衛線は、誰もスコアを作ろうと考えないときだけ有効である。

次に何が落ちるでしょうか

これは実際の問題と、利用可能な解決策を残しています。

好きな活動を選んでください:仕事、技術、職業、または長年にわたり習得してきたタスク。3つの質問をしてください。

第一に、成功と失敗は信頼性を持って区別できるか?完璧に、あるいはすべての人に可能というわけではないが、十分に一貫性があり、有能力な評価者が大半の場合に一致する意見を出せるほどである。ゲームはこの基準を容易にクリアしている。タンパク質構造予測は、実験室が最終的に答えを生み出すため、この基準を満たす。作文は絶対的な意味ではクリアできないが、相対的な意味ではクリアしている。なぜなら、人々は通常、二つの試みのうちどちらが優れているかを判断できるからである。

第二に、この判断を低コストで大規模に生成できるか?この問題は可能性ではなく、タイミングを決定する。ゲーム内のような無料かつ即時の判断は、システムが数百万の訓練データを自ら生成できることを意味する。実験室が必要な判断は遅いが、30年にわたる評価試行のアーカイブがあるため、依然として実現可能である。有料のヒューマンがテキストを読む必要がある判断は高コストであり、正是そのため、モデルを訓練してこれらのヒューマンをループから除外するための多くの努力が払われてきた。

第三に、この決定はどの分野がいつ崩壊するかではなく、その後何が起こるかです:このスコアは本当にあなたが求めるものでしょうか?ゲームのスコアは、ゲームにおいて勝利が定義上すべての意味を持つため、あなたが求めるものです。実験的に測定されたタンパク質構造は、あなたが求めるものに非常に近いです。注釈者による好みを学習したモデルは、あなたが求めるものではありません。それはあなたが求めるものの肖像画にすぎず、肖像画と実際の顔の間には差があります。

次の3つの質問で自分の仕事を検証してください。多くの人が最初の答えをすぐに、そして不安に感じて導き出します。私たちがスキルと呼ぶもののほとんどは、相対的な意味で、有能力な人が並んで2回試行した際に評価可能です。2番目の質問は、コストと規模が動的な目標であり、長年にわたり一方の方向に移動し続けているため、真の不確実性の所在です。3番目の質問はほとんど誰も問わないものですが、それがあなたの分野の反対側がどのような姿なのかを決定します。

些細なことに対して、ゆっくりとこの練習を積み重ねることが価値がある。放射線科を例に挙げよう。成功と失敗は区別できるか? はい、非常に正確に区別できる。なぜなら、診断は最終的に患者の状態によって裏付けられたり、否定されたりするからだ。判断を低コストで大規模に生成できるか? 基本的には可能だ。なぜなら、病院は数十年にわたり、画像とその確認結果の形でスコアリングのサンプルを蓄積してきたからだ。このスコアは、あなたが求めるものだろうか? ここでは答えが複雑になる。スコアリングの対象は記録された診断との一貫性だが、求められているのは患者の状態が良好であることだからだ。これらは大抵の場合一致するが、最も重要な場面では分離してしまう。

今、より安全に見えるものを手に取ってみよう。管理について考えてみよう。最初の問題はすでに難しい。なぜなら、有能力な人々の間で、与えられた管理者が優れているかどうかについて意見が分かれ、その対立はすぐに解決しないからだ。二番目の問題はさらに難しい。なぜなら、管理の意思決定の結果は数年後にようやく現れ、それ以外のすべての出来事と絡み合ってしまうからだ。三番目の問題は最も難しい。なぜなら、離職率から従業員エンゲージメントスコア、一人当たりの生産性に至るまで、誰かが提案するどんな優れた管理の代替指標も、明らかにその本質そのものではないからだ。この診断に基づけば、管理は深遠であるから安全なのではない。それは測定されていないから安全なのだ。これは別の、あまり好ましくない種類の保護である。

マシンは最適化軸を占めている。十分な計算資源があれば、明確に定義された目標において、良い手を見つけることは競争ではなくなり、その結果はしばしば私たちのものよりも強力であり、さらに私たちの伝統が見ないように教えた場所に到達する。これは予測ではない。チェス、囲碁、将棋、タンパク質構造、そしてかつて人間だけが行えるとされていた多くの分野に対する記述である。

残りは目標そのものである。誰かが得点を決めた。上記の各ケースにおいて、その決定には午後1つ分かかったが、すべての非凡な結果はそれから生まれ、それに忠実であり、それによって見落とされたものは一切無視した。

だから、最後の質問は深く考える価値があります。あなたの仕事にはすでに点数がありますか?もしあるなら、誰が書いたのですか?彼らが書いているとき、あなたのことを考えていましたか?

これは「Whatever You Ask For」シリーズの第2部で、マシンが最終的に私たちに何を必要としているか、そして私たちがどれほどひどく対応しているかについてです。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。