著者:朱雪莹
この2日間、少し異常なAIモデルがSNSで話題になりました。
彼の名前はJevです。
会話はできないし、コードも書けない。ChatGPTのように長い回答を生成することもできない。それだけしかできない:判断を下す。
しかし、そのような「能力が大幅に削減された」と見えるモデルが、開発者コミュニティで急に話題になった。
誰かがそれを使用して40秒で724件のリアルタイム広告を分析し、合計8724回の判断を下した。誰かがそれをClaude Codeに接続して、不要なコンテキストをクリーンアップ专门している。また、誰かがそれをAIエージェントの「審判」として使用し、タスクが本当に完了したかどうかを確認している。LangChainも、Jevをエージェント評価器としてテストし始めた。
さらに驚異的なのは、その速度と価格です。
TypeSafeが実施したテストでは、Jevの最大速度向上が約193.6倍、コスト削減が最大444.6倍となりました。100万トークンの入力にかかるコストは0.042ドルで、出力トークンは無料です。
なぜ、より少ない能力を持つAIが逆に人気になったのか?
エージェント時代に突入した今、AIに必要なのは「深く考えること」だけでなく、膨大で迅速かつ低コストな判断力である——次に何をすべきか、どのツールを呼び出すか、タスクは本当に完了したのか。さらに重要なのは、これらの判断は今後、AIがバックグラウンドで自ら行うようになり、人が画面の前に座り続けて監視する必要がなくなるということだ。Jevが注目しているのは、こうした毎日数百万回発生する小さな判断である。
さらに興味深いことに、Jevモデルの創設者であるDiogo Almeidaは、かつてRLHFに参加していたが、現在ではRLHFを見直し始めている。ChatGPTを使いやすくするこの訓練方法は、AIが真正に自動化へ向かうには適していない可能性があると。
一か月以上前、アルメイダは講演を行った。今改めて振り返ると、その講演はほぼJevの「思想マニュアル」だった。


AIは高等数学ができるのに、なぜカスタマーサポートをうまくできないのか?
ディエゴ・アルメイダの経歴は特異です。
彼はOpenAIで働いており、GPT-4、ChatGPT、およびInstructGPT/RLHFの関連作業に参加しました。つまり、彼は今日の大規模モデルにおいて最も重要な後学習パラダイムの構築に直接関与しました。
しかし、その講演で彼は、自分自身をOpenAI内部で数少ない publicly で ChatGPT を批判する人物の一人だと冗談で語った。
彼のスピーチのテーマはより直接的だ:RLHFの次に何が来るのか?
ディエゴは、一見矛盾しているように見える質問を提起しました。
今日の大規模モデルは、非常に難しい数学の問題やコード、推論、さまざまなベンチマークに挑戦できるようになっています。
しかし、多くの企業が本当に自動化したい業務では、人間が依然として不可欠である。
例えばカスタマーサポート。
AIに資料を調べさせ、ドキュメントを要約させ、返信を起草させることは問題ありません。
しかし、AIに自分で判断させるとしたら:このお金は返金すべきか?このユーザーは賠償すべきか?
企業はすぐに慎重になった。
これらのことが高等数学よりもはるかに簡単なのに、なぜ逆にAIに任せようとはしないのか?
ディエゴの答えはシンプルだ:今日のAIは自動化よりも支援に優れている。
今日のAIはあなたの仕事を手伝うのは上手だが、まだ自分で仕事を完遂するのはあまり得意ではない。
この二つのことは少ししか違わないように見えますが、実際にはまったく異なります。
Claude Codeがどれほど優れていても、あなたは通常、コンピューターの前に座っています。コードを書くのはそれであり、あなたはそれを確認します。ファイルを修正するのはそれであり、あなたはチェックします。間違いがあれば、また修正させるのです。
したがって、Diogoの見解では、Claude Codeは依然としてChatGPTが開いた「協力時代」の一部である。
本当の自動化とは何ですか?
人根本不在场。
AIはバックグラウンドで自ら判断し、自ら実行し、1日で数十万回、あるいは数百万回動作する可能性があり、あなたはその行動を一切見ることはありません。
では、疑問が生じます:なぜ今日のAIはこれほど賢いのに、人間なしでは成り立たないのでしょうか?
ディーゴは、自分自身が非常に熟知しているもの——RLHF——を矛先に向けた。

AIを訓練する際、私たちは人間をループに組み込みました
これは多少皮肉なことです。
RLHFは、まさにDiogoが当時関与して推進した技術路線の一つです。
RLHFの基本的なロジックはそれほど複雑ではありません:人の好みを収集し、モデルを徐々に人の好みに合致させていくことです。
したがって、Diogoはスピーチで、なぜ今日の大規模モデルには常に人間が関与しなければならないのかという非常に明確な説明を提供了しました。
トレーニングの際、私たちは文字通り人間をそのループに組み込みました。
モデルは最初から、どのような回答が人間にとって好まれるかを学習しています。
これは、私たちがすでに非常に熟知している大規模モデルの特徴を説明しています——たとえ知らないことでも、いつもそれらしく話すことができます。
ディーゴは現場で、とても皮肉な例を挙げました。
誰かがChatGPTにげっぷの音声を送り、これが自分自身で作曲した音楽であると伝え、その曲を「誠実で率直に」評価してもらった。
結果、ChatGPTは真面目に、これは陰気で不気味な雰囲気を持つ環境音楽だと称賛した。
ディエゴは次の一文で要約した。「過大な約束は機能の一つだ。」
過剰な約束はバグではなく、機能である。
チャット製品の場合、これは致命的とは限りません。ユーザーはまだ画面の前におり、間違いは修正できます。
しかし、本物の自動化システムはまったく異なります。
機械はあなたの回答が聞き取りやすいかどうかには関心がなく、ただ2つのことを知りたがります:具体的にどう行動すべきか、そしてその確信度はどれほどか。
これにより、1か月以上後に発表されたJevがなぜこれほど異常に見えるのかが説明できる。

だから、JevはAIに「話させない」ことにした
一般的大規模モデルは、最終的に「AかB」の回答のみが必要であっても、しばしばトークンを生成するプロセスを経ます。
Jevはこの部分をそのまま削除しました。
現在、主に3つのことを行っています:
Noul、YesかNoで答えてください;
Choice、複数の選択肢から一つを選ぶ;
スコア、標準に基づいて評価してください。
その後、判断と確率を直接返してください。
小作文を書かないし、おしゃべりにも付き合わない。
公式発表によると、エンドツーエンドの遅延は70〜500ミリ秒と低く、最先端モデルと比較して20〜200倍高速で、価格は40〜400倍安くなっています。
しかし、本当に重要なのは「速さ」ではなく、その後の確率です。
そのため、TypeSafeは新しい訓練方法であるRLCD(Reinforcement Learning for Calibrated Decisions、校準決断強化学習)を提案しました。
AIが何かが80%の確率で発生すると教えた場合、その80%を本当に信じられるのかという問題は非常に現実的です。
理想的には、モデルが80%の確率と判断した出来事は、最終的に約80%が実際に発生すべきである。
これは自動化システムにとって非常に重要です。
99%の確信を持って、直接実行できます。
51%の確信があれば、より強力で高価な大規模モデルに任せたり、人間に振り分けたりできます。
問題なのは、AIが知らないことではなく、AIが自分が知らないことを知らないことだ。
したがって、Jevが本当に変えたいのは、AIの出力対象です。
過去のChatGPTが生成した回答は主に人間が見るためのものだった。Jevが提示した判断と確率は、そのままソフトウェアに渡すことを目的としている。

エージェントの時代には、より大きな脳が必要なのではないかもしれない
これも、なぜJevが今まさに注目されているのかを説明している。
エージェントが実際に動作し始めると、膨大な数の小さな判断が生じます:
次にどのツールを呼び出しますか?このウェブページではどのボタンをクリックすればよいですか?この情報はまだ役に立ちますか?タスクは本当に完了しましたか?結果を再確認する必要がありますか?
これらの問題は一つ一つ見れば難しくないが、エージェントは1日で数十万、数百万回判断する必要がある可能性がある。
毎回「最強の大型モデル」を呼び出し、数秒間「深く考え」て大量のトークンを生成すると、コストと遅延がすぐに上昇する。
Jevが狙っているのは、この層です。
大量の頻繁な小さな判断はJevに任せ、真正に複雑な推論を要するタスクのみ大モデルに委ねる。
これは、TypeSafeがJevをSystem One Modelと呼ぶ理由でもあります。
この概念はダニエル・カーネマンの「システム1」と「システム2」に由来します:一方は迅速で直感的な判断を担当し、他方は遅く複雑な思考を担当します。
Jevの名前は「ジェヴンスのパラドックス」に由来している:
ある資源がますます安くなると、人々はそれを使う量を減らすとは限らず、かえって多く使う可能性がある。
AIを一度呼び出すのが高価であれば、最も重要な場所でのみ使用します。
しかし、AIが価格をほぼ無視できるほど安価と判断した場合はどうでしょうか?
メール1通、ログ1件、ツールの呼び出し1回、ウェブページのボタン1つ、エージェントが実行する各ステップに、AIの判断が組み込まれる可能性があります。
もちろん、今すぐJevが次世代AIを代表すると述べるのは早すぎます。
いわゆる「ゼロホラー」は、規定された回答タイプから逸脱して勝手に作り上げないことを意味するだけで、誤った選択をしないという意味ではない。193.6倍、444.6倍といった極端なデータは、主にTypeSafe自身のテストによるものである。
しかし、Jevが今回爆発的に人気を博した中で、真に注目すべきは、それがGPTやClaudeに挑戦できるかどうかではないかもしれない。
そして、ChatGPTの開発に参加した一人が、より基本的な問題を再び問い直している。
過去数年間、業界全体は、AIにどれだけ長く考えさせ、どれだけ多く話させられるかを模索してきました。
しかし、もし将来本当に必要なのが数十億回のマシン間の判断であるなら、AIはなぜ毎回「一文話す」必要があるのか?
ChatGPTは、機械が人間と話す方法を教えた。
そしてJevが次に注目するのは、人がスクリーンの前に座っていないときに、機械が自ら判断を下せるかどうかである。
