一注数セントの料金で、かつてディープラーニング時代全体を支えたランニング・クラウドワークスプラットフォーム。
今、閉店します。
アマゾンは、自社のクラウドワーキングプラットフォーム「Mechanical Turk」が今年9月30日をもって完全にサービスを終了すると発表しました。

最盛時期、プラットフォーム上では50万人以上がオンラインで雑務を担当し、画像の閲覧、分類、アノテーションを行い、当時のコンピューターがまだ学べなかった小さな作業をすべて手作業で完了させました。
その後、この膨大な「人間の計算能力」は直接ImageNetデータセットの支えとなりました——
MTurkがなければ、ImageNetの数千万枚の画像の手動アノテーションはほぼ不可能である。
ImageNetがなければ、李飛飛は一夜で有名にはならなかったかもしれない。
ヒントン師徒は一戦で神となることはなく、ディープラーニングも2012年に突然復活したわけではない。
21年後、本物のAIはますますこれらの宿題をこなすようになる。
かつてAIに賢く見せかけようとした人々は、このプラットフォームとともに《サービス終了のお知らせ》を受けました。
50万人がオンラインでアルバイトを実施、MTurkが実在の人物を「代役」として手配
Mechanical Turk(MTurk)は2005年にリリースされました。
実は最初、アマゾンはこの技術でAIの歴史を書き換えるなんて考えていませんでした。
MTurkが当時解決したのは、非常に実用的で劇的な問題だった:あるタスクはコンピューターには極めて困難だが、人間にとっては極めて簡単である。。。
そこでアマゾンは、非常に直接的な方法を考え出した:プログラムで解決できないなら、問題を細かく分割して人間に投げればいいじゃないか~
そして、これらの分割された小さなタスクは、HIT(Human Intelligence Task)と呼ばれます。
例えば、ある企業が1万枚の画像を分類する必要がある場合、MTurkの手法では、それを1万個の独立したタスクに分割し、同時にプラットフォームに公開します。
100人が一緒にできれば、1000人でも可能で、数万人が同時に参加すれば、さらに速くなります。
言い換えれば、MTurkは単なる個人の作業速度を上げるのではなく、もともと順番待ちでしかできなかった重労働を「グローバル並列化」可能にしたのです。
本物の人工データのフィードルです。。。

そして、「Mechanical Turk」という名前自体が、この「遊び方」にぴったり当てはまります。
18世紀、ヨーロッパには有名な機械的トルコ人が存在し、外見はチェスを自ら打つ機械のように見え、ナポレオンと対戦することさえできた。
その後、皆は機械の中に常に実際のチェスプレーヤーが隠されていたことに気づいた!?(私が大丈夫だった。。。)
アマゾンはこの典故をインターネットに持ち込み、ほぼ完璧に再現した。プログラムは表面上自動処理のように見えるが、実際に作業をしているのはスクリーンの向こう側の真人間である。
ベゾスは当時、まさに予言的な表現を用いた。
人工的な人工知能(artificial artificial intelligence)。
このアイデアが成功すると、MTurkはすぐにアマゾンの自社ツールから、グローバルなクラウドワーキング市場へと成長した。
2011年までに、MTurkには190カ国から50万人以上のWorkerが集まりました。
人が増えるにつれて、受注できる仕事も急速に増加し、画像の選別、音声の文字起こし、テキスト分類、データクリーニング、感情判断、コンテンツ監査などが含まれる。
機械が困るが、人間なら数秒で判断できるようなタスクは、すべてここに投げ込んでください。
この投げ捨ては、21年間だった。
MTurkがなければ、今日のImageNetやディープラーニング革命はなかった。
2006年前後に戻ります。
プリンストン大学での教職に就いて間もない李飛飛は、当時やや反潮流的な行動を取ることを決意した——
機械に十分な規模のビジュアル百科全書を作成する。
当時、主流のコンピュータビジョンデータセットは、通常数千枚から数万枚の画像しか含まれていず、データが不足していたため、モデルは訓練セットのパターンを暗記するだけの「問題演習専門家」となり、現実世界の多様な物体を真正に理解するのは難しかった。
そこで李飛飛のチームは、当時非常に狂気じみたことを思いついた:機械に「十分に大きな」視覚的世界を構築すること。
ImageNetデータセットがこれによって生まれました。

ImageNetはWordNetを骨格として、現実世界をさまざまな概念に分解し、各概念の下に数百〜数千枚の実際の画像を配置しています。
犬、車、リンゴ、椅子、鳥、魚……定義できるものはできるだけすべて詰め込む。
しかし、すぐに、より現実的な問題が押し寄せてきた——
画像は簡単に見つかるし、Google、Yahoo、Flickrでも検索できるが、問題は検索結果の画像が必ずしも正確ではなく、まったく関係のないものさえあることだ!!!
その後、検索エンジンが画像を回収した後、最終段階として人手で1枚ずつ確認する必要があります。
誇張した数字を挙げると、ImageNetが後に処理しなければならなかった候補画像の規模は1億6千万枚以上!!!これにより、人的リソースの問題は完全に解決不能となった。。。

ImageNetが膨大な手動画像選別に苦しんでいるとき、李飛飛チームは剛剛立ち上げたばかりのAmazon Mechanical Turkに目を向けた。
ImageNetチームは、膨大な画像の選別作業をマイクロタスクに分割し、MTurkプラットフォーム上のグローバルなワーカーに配布し始めました。
壮大なAIインフラが、無数の通常の「マウスクリック」に分解されてしまった。
2009年に発表されたImageNetの論文では、当時のデータセットにすでに5,247の概念と320万枚の整理された画像が収録されていたと記述されている。
ImageNetチームがプロジェクト全体を振り返った際に示した数値は、167カ国から来た49,000人のMTurk作業者です。
言い換えれば、ImageNetの背後でこの画像選別作業を支えていたのは、世界中を網羅する一時的なアノテーションチームだった。
だからこそ、MTurkがなければ当時のImageNetは本当に作れなかったのだ。。。

ImageNetが完成した後、その後の物語は本格的に加速した。
2010年、ImageNetチャレンジが開催され、世界中のモデルが同じデータセットで学習し、同じランキングで競い合うようになった。
2年後、後にAI史に繰り返し記されるコンビが登場した——
トロント大学のジェフリー・ヒントン、および彼の二人の学生アレクサンドル・クリザヘフスキー、イリヤ・ツツケバー。
三人が深度畳み込みニューラルネットワークを用いてImageNet大規模視覚認識チャレンジに参加した。
2012年のImageNetチャレンジで、Top-5誤差率を直接約15%まで引き下げ、従来の手法を大きく上回った。
これにより、コンピュータビジョン分野全体が、膨大なデータ、GPUの計算能力、ディープニューラルネットワークを組み合わせた効果が一気に一段階向上することを初めて直観的に理解しました。

左から右へ:Ilya Sutskever、Geoffrey Hinton、Alex Krizhevsky
これで、アレックス・クリザエフスキーの名前はアレックスネットに溶接された。
イリヤはその後、Google Brainに移り、OpenAIの設立に参加してチーフサイエンティストを務め、退職後にSSIを設立した。
ヒントン氏は後にチューリング賞を受賞し、広くディープラーニングの父の一人と認められた。
李飛飛はスタンフォード大学に戻って教鞭をとり、HAIを共同指導し、ImageNetによって現代コンピュータビジョンの歴史における地位を確立した。
その後、VGGが登場し、GoogLeNetが登場し、ResNetが登場しました。
ImageNetランキングは年々下方に押し下げられ、ディープラーニングは視覚分野から音声分野へと進出し、次に自然言語処理へと突入し、今日の巨大モデル時代に至った。
この世界は本当に不思議です——
李飛飛チームはMTurkを活用してImageNetを構築した;ImageNetにより李飛飛は名声を博した;ヒントン師弟はImageNetで一躍有名になった;ディープラーニングはこの勝利をきっかけに復興へと向かうようになった。
167カ国から約5万人の一般市民が、コンピューターの前に座って、上億枚の候補画像を一つずつ「クリック」してImageNetを構築しました。
AIがやっと仕事を覚えたが、MTurkは先にサービスを終了した
そのため、マシンカル・ターキーが今日サービスを終了することは、まさに一つの時代の閉幕のように思える。
アマゾンの公式見解は控えめで、自社製品およびサービスを継続的に評価している結果、MTurkの提供を停止することを決定したと述べている。
CNBCは以前、データ労働者権利団体Turkopticonのクリスタ・パウロスキーを引用し、MTurkはこれらの年月を通じて衰退しており、アマゾンの投資は減少し続けており、新世代のデータアノテーションプラットフォームも労働者と顧客を次々と奪っていると述べた。
しかし、より直接的な理由は、かつて最も価値があった那些仕事こそ、AIがますます得意になっているからです。。。
2005年には、機械に画像に犬がいるかどうかを判断させることは本格的な難題だったが、現在ではすでにマルチモーダルモデルにとって簡単にこなせる基本的なタスクとなっている。
一方で、AI業界における「人」への需要も変化しています。
最先端のモデルには、プログラマーや医師、弁護士などの専門家がコードを評価し、回答を審査し、推論とセキュリティをテストすることが必要です。
これにより、Scale AI、Mercor、Prolificなどの新プラットフォームが台頭し、専門家をスクリーニング・管理し、より専門的なトレーニングおよび評価データを提供し始めました。
一方で、「誰でも受注可能、1注文数セント」というMTurkのようなクラウドソーシングモデルは、時代にそぐわなくなってきている。。。

さらに不思議なことに、MTurkの作業者自身までAIを始めている!!!
2023年、スイスの研究者による調査では、調査対象のMTurk作業者の中で、AIモデルを使用してテキストタスクを完了した割合が最大で46%に達したことが判明した。
元々、顧客が支払ったのは人間の判断に対する費用でしたが、一部の作業者が注文を受けた後、ChatGPTなどのモデルに質問を渡して回答させている可能性があります。
これは多少ブラックユーモアですね。。。
MTurkの運命は、過去20年間のAIの縮図でもある。
人類は最初、機械の背後に隠れて、一枚一枚の画像を手作業でラベル付けし、なんとかImageNetを構築し、ディープラーニング時代の扉を開いた。
その後、AIはこれらのデータをもとに成長し、ようやく自分で画像を見たり、音を聞いたり、文字を書いたりすることができるようになりました。
21年後、当時AIに賢さを装っていた人々が退場した。
かつて真人のチェスプレーヤーを隠していた「機械のトルコ人」も、ついに戸を閉じることができるようになった。
参照リンク:
[1]https://www.cnbc.com/2026/08/25/amazon-service-that-jeff-bezos-called-artificial-ai-is-shutting-down.html
本文は微信公衆アカウント「量子位」より、著者:夢瑶
