AI 模型 Jev 因在代理時代的二元判斷而受歡迎

icon MarsBit
分享
AI summary icon精華摘要
一個名為 Jev 的新 AI 模型因其在代理時代的二元判斷能力而受到關注。與 ChatGPT 不同,Jev 專注於是/否決策、評分和多項選擇任務,已應用於廣告分析、上下文清理和代理驗證。鏈上分析顯示,Jev 的速度比頂級模型快達 193.6 倍,成本低至 444.6 倍,輸入成本低至每百萬個 token 僅 $0.042。隨著 Jev 的效率日益顯現,開發者中的恐懼與貪婪指數正在上升。其創始人 Diogo Almeida 曾在 OpenAI 負責 RLHF,現致力於推動自動化決策,而非以人為中心的 AI。

作者:朱雪莹

這兩天,一個有點反常的 AI 模型突然刷屏了。

它叫 Jev。

不會聊天,不寫代碼,甚至不會像 ChatGPT 一樣給你生成一大段答案。它只做一件事:做判斷。

但就是這樣一個看起來「能力被砍了一大半」的模型,卻突然在開發者圈火了。

有人用它在40秒內分析724條實時廣告,總共做出8724次判斷;有人將它接入Claude Code,專門清理無用的上下文;還有其他人讓它擔任AI Agent的「裁判」,檢查任務是否真正完成。LangChain也已開始測試Jev作為Agent評估器的表現。

更誇張的是速度和價格。

TypeSafe 公布的測試中,Jev 最高提速約 193.6 倍,成本最多降低 444.6 倍。輸入每百萬 Token 只需 0.042 美元,輸出 Token 更是免費。

一個看起來能力更少的 AI,為何反而火了?

因為已進入 Agent 時代,AI 真正需要的可能不只是「深思熟慮」,還有海量、快速、便宜的判斷:下一步該做什麼、該調用哪個工具、任務到底有沒有完成。更重要的是,這些判斷未來需要 AI 自己在後台完成,不再需要人一直坐在螢幕前盯著。Jev 看上的,就是這些每天可能發生數百萬次的小決定。

更有意思的是,Jev 模型的創始人 Diogo Almeida 恰好曾參與過 RLHF,而現在他開始反思 RLHF:這套讓 ChatGPT 變得好用的訓練方式,可能並不適合 AI 真正走向自動化。

一個多月前,Almeida 曾發表過一場演講。現在回頭再看,那場演講幾乎就是 Jev 的「思想說明書」。

圖片

圖片

AI 都會做高等數學了,為什麼還做不好客服?

Diogo Almeida 的履歷很特殊。

他曾於 OpenAI 工作,參與了 GPT-4、ChatGPT 和 InstructGPT/RLHF 相關工作。也就是說,他曾親自參與構建了今日大模型最重要的後訓練範式。

但在那場演講裡,他一上來就自嘲,是 OpenAI 內部少數幾個公開「黑」ChatGPT 的人之一。

他的演講主題更加直接:What's Next After RLHF?

Diogo 先提出了一個看起來很矛盾的問題。

今天的大型模型已經能夠挑戰極其困難的數學題目,代碼、推理和各類 benchmark 持續攀升。

但在許多企業真正想自動化的業務中,人卻始終無法被取代。

例如客服。

讓 AI 查資料、總結文件、起草回覆,沒問題。

但如果讓 AI 自己決定:這筆錢到底退不退?這個用戶要不要賠償?

企業馬上變得謹慎起來。

這些事情看起來比高等數學簡單得多,為何反而不敢交給 AI?

Diogo 的答案很簡單:今天的 AI 在協助方面令人驚嘆,而非自動化。

Today's AI is good at helping you get things done, but it still isn't quite able to finish the job on its own.

These two things may seem only slightly different, but they are actually completely different.

Claude Code 再強大,你通常還是坐在電腦前。它寫代碼,你看;它修改檔案,你檢查;出錯了,你再讓它改。

因此,在Diogo看來,Claude Code 仍屬於 ChatGPT 開啟的「協助時代」。

什麼是真正的自動化?

The person was not present at all.

AI 在後台自行判斷、自行執行,一天可能運行幾十萬甚至幾百萬次,你甚至永遠不會看到它做了什麼。

問題也就來了:為什麼今天的 AI 如此聰明,卻偏偏离不开人?

Diogo 將矛頭指向了一個他非常熟悉的事物——RLHF。

圖片

我們訓練 AI 時,就把人塞進了迴路裡

這件事多少有點諷刺。

因為 RLHF,正是 Diogo 當年參與推動的技術路線之一。

RLHF 的基本邏輯其實不複雜:收集人類的偏好,然後讓模型越來越符合人類的偏好。

因此,Diogo 在演講中給出了一個非常直白的解釋:為什麼今天的大型模型總需要有人在回路中?

因為在訓練它時,我們實際上把人塞進了那個迴路中。

模型從一開始就在學習:什麼樣的回答,人更喜歡?

這也解釋了大模型一個我們已經非常熟悉的特点——即使不知道,它也經常能說得特別像那麼回事。

Diogo 在現場舉了一個很損的例子。

有人給 ChatGPT 發了一段放屁的錄音,告訴它這是自己創作的一首音樂,請它「真誠、坦率」地評價。

結果 ChatGPT 認真地讚揚,說這是一首充滿陰森、詭異氛圍的環境音樂。

Diogo 甚至用一句話總結:「Overpromising is a feature.」

過度承諾不是 Bug,是 feature。

對於聊天產品來說,這未必致命。用戶仍在螢幕前,錯了可以糾正。

但真正的自動化系統完全不同。

機器不關心你的回答好不好聽,它只需要知道兩件事:到底該怎麼做,以及你到底有多大把握?

這也就解釋了,為何一個多月後發布的 Jev 看起來會如此反常。

圖片

所以,Jev 索性讓 AI 不「說話」了

即使最終只需要回答「A 還是 B」,普通大模型通常也需要經過生成 Token 的過程。

Jev 直接將這部分刪掉。

它目前主要做三件事:

  • Noul,回答 Yes 還是 No;

  • Choice,從幾個選項中選擇一個;

  • Score, rate according to the standard.

然後直接返回判斷和概率。

不給你寫小作文,也不陪你聊天。

官方公布的端到端延遲低至 70—500 毫秒,相比前沿模型快 20—200 倍,價格低 40—400 倍。

但真正關鍵的,其實不是「快」,是後面那個概率。

為此,TypeSafe 提出了一套新的訓練方法:RLCD,Reinforcement Learning for Calibrated Decisions,校准決策強化學習。

它想解決的問題非常現實:如果 AI 告訴你一件事有 80% 的概率發生,這個 80% 到底能不能信?

在理想情況下,模型判斷為 80% 概率的一批事情,最後就應該大約有 80% 真的發生。

This is very important in automated systems.

99% 的把握,可直接執行。

有 51% 的把握,可以交給更強、更貴的大模型,甚至轉交給人。

真正麻煩的不是AI不知道,是AI不知道自己不知道。

所以 Jev 真正想改變的,是 AI 輸出的對象。

過去 ChatGPT 生成的答案,主要是給人看的。Jev 提供的判斷與機率,則是準備直接交給軟體使用的。

圖片

在 Agent 時代,可能需要的不是一個更大的大腦

這也解釋了為什麼 Jev 恰好在現在火了。

因為 Agent 真正運行起來以後,會產生海量的小判斷:

下一步調用哪個工具?這個網頁該點哪個按鈕?這條資訊還有沒有用?任務到底完成沒有?結果要不要重新檢查?

這些問題單獨看都不難,但一個 Agent 一天可能需要判斷幾十萬、幾百萬次。

如果每次都要調用最強的大模型,花幾秒鐘「深思熟慮」,再輸出一大段 Token,成本和延遲很快就會上升。

Jev 想搶的,就是這一層。

將大量高頻的小決定交給 Jev,真正需要複雜推理的任務,再交給大模型。

這也是為什麼 TypeSafe 把 Jev 稱為 System One Model。

這個概念來自丹尼爾·卡尼曼的“系統1”和“系統2”:一個負責快速、直覺式的判斷,一個負責慢速、複雜的思考。

Jev 的名字甚至來自「傑文斯悖論」:

當一種資源變得越來越便宜時,人們未必會減少使用,反而可能使用得更多。

如果調用一次 AI 很貴,你只會把它用在最重要的地方。

但如果 AI 一次判斷便宜到幾乎可以忽略呢?

一封郵件、一條日誌、一次工具調用、一個網頁按鈕、Agent 執行的每一步,都可能加入一次 AI 判斷。

當然,現在就說 Jev 代表下一代 AI 還太早。

它所謂的「零幻覺」,更多意味著不會跳出規定的答案類型亂編,不代表不會選錯;193.6 倍、444.6 倍這樣的極端數據,也主要來自 TypeSafe 自己的測試。

但 Jev 這次爆火真正值得關注的,可能不是它能不能挑戰 GPT 或 Claude。

而是一個參與創造 ChatGPT 的人,正在重新探問一個更根本的問題:

過去幾年,整個行業都在思考,如何讓 AI 想得更久、說得更多。

但如果未來真正需要的是幾十億次機器之間的判斷,AI 為什麼每一次都要先「說一段話」?

ChatGPT 教會了機器如何與人對話。

而 Jev 押注的下一步是:當人不再坐在螢幕前,機器能不能自己做決定?

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露