Tác giả: Chu Tuyết Anh
Hai ngày qua, một mô hình AI hơi bất thường đột nhiên lan truyền khắp nơi.
Nó tên là Jev.
Không biết trò chuyện, không viết mã, thậm chí không thể tạo ra một câu trả lời dài như ChatGPT. Nó chỉ làm một việc duy nhất: đưa ra phán đoán.
Nhưng chính mô hình trông như bị “giảm khả năng đi một nửa” này lại bất ngờ trở nên nổi tiếng trong cộng đồng nhà phát triển.
Một người dùng nó để phân tích 724 quảng cáo trực tuyến trong 40 giây, đưa ra tổng cộng 8.724 phán đoán; một người khác kết nối nó với Claude Code để xóa sạch các ngữ cảnh không cần thiết; còn người khác lại để nó đóng vai trò "trọng tài" cho AI Agent, kiểm tra xem nhiệm vụ có thực sự được hoàn thành hay chưa. LangChain cũng đã bắt đầu thử nghiệm hiệu suất của Jev như một bộ đánh giá Agent.
Điều còn đáng kinh ngạc hơn là tốc độ và giá cả.
Trong các bài kiểm tra do TypeSafe công bố, Jev đạt tốc độ tăng tối đa khoảng 193,6 lần và giảm chi phí tối đa 444,6 lần. Chi phí nhập mỗi triệu Token chỉ là 0,042 USD, trong khi đầu ra Token thậm chí miễn phí.
Tại sao một AI có vẻ ít khả năng hơn lại trở nên nổi tiếng?
Vì đã đến thời đại Agent, điều mà AI thực sự cần có thể không chỉ là “suy nghĩ kỹ lưỡng”, mà còn là những phán đoán lượng lớn, nhanh chóng và rẻ tiền: bước tiếp theo nên làm gì, nên gọi công cụ nào, nhiệm vụ đã hoàn thành chưa. Quan trọng hơn, những phán đoán này trong tương lai sẽ do AI tự thực hiện ở nền tảng phía sau, không còn cần con người phải ngồi trước màn hình theo dõi liên tục. Jev nhìn vào chính những quyết định nhỏ này, có thể xảy ra hàng triệu lần mỗi ngày.
Điều thú vị hơn là Diogo Almeida, người sáng lập mô hình Jev, chính là người từng tham gia vào RLHF, và giờ đây anh ấy bắt đầu phản tư về RLHF: phương pháp huấn luyện khiến ChatGPT trở nên hữu dụng này có thể không phù hợp để AI thực sự hướng tới tự động hóa.
Hơn một tháng trước, Almeida đã có một bài phát biểu. Bây giờ nhìn lại, bài phát biểu đó gần như là “hướng dẫn tư tưởng” của Jev.


AI đã có thể làm toán cao cấp, vậy tại sao vẫn chưa phục vụ khách hàng tốt?
Lý lịch của Diogo Almeida rất đặc biệt.
Anh ấy từng làm việc tại OpenAI và là người tham gia vào các công việc liên quan đến GPT-4, ChatGPT và InstructGPT/RLHF. Nói cách khác, anh ấy đã trực tiếp tham gia xây dựng bộ phương pháp hậu huấn luyện quan trọng nhất cho các mô hình lớn ngày nay.
Nhưng trong bài diễn văn đó, anh ấy đã tự giễu cợt bản thân, là một trong số ít người trong OpenAI công khai chỉ trích ChatGPT.
Chủ đề bài nói của anh ấy trực tiếp hơn: What's Next After RLHF?
Diogo đã đặt ra một câu hỏi trông có vẻ mâu thuẫn.
Các mô hình lớn ngày nay đã có thể giải quyết những bài toán toán học rất khó, với hiệu suất trong mã hóa, suy luận và các benchmark khác không ngừng tăng lên.
Tuy nhiên, trong nhiều quy trình kinh doanh mà các doanh nghiệp thực sự muốn tự động hóa, con người vẫn không thể loại bỏ được.
Ví dụ như dịch vụ khách hàng.
Để AI tra cứu thông tin, tóm tắt tài liệu và soạn thảo phản hồi, không vấn đề gì.
Nhưng nếu để AI tự quyết định: Số tiền này có nên hoàn lại không? Người dùng này có nên bồi thường không?
Doanh nghiệp lập tức trở nên cẩn trọng.
Tại sao những việc này trông đơn giản hơn nhiều so với toán cao cấp, lại dám giao cho AI?
Câu trả lời của Diogo rất đơn giản: AI ngày nay cực kỳ xuất sắc trong việc hỗ trợ, chứ không phải tự động hóa.
Hôm nay, AI rất giỏi trong việc giúp bạn làm việc, nhưng vẫn chưa thực sự có thể tự hoàn thành công việc đó.
Hai việc này trông có vẻ chỉ khác nhau một chút, nhưng thực chất hoàn toàn khác biệt.
Claude Code có mạnh đến đâu, bạn vẫn thường ngồi trước máy tính. Nó viết mã, bạn xem; nó sửa tệp, bạn kiểm tra; sai thì bạn bảo nó sửa lại.
Vì vậy, theo Diogo, Claude Code vẫn thuộc về “thời đại hỗ trợ” do ChatGPT khai mở.
Thực sự tự động hóa là gì?
Người đó hoàn toàn không có mặt.
AI tự đưa ra quyết định và tự thực hiện ở nền tảng, có thể chạy hàng chục nghìn甚至 hàng triệu lần mỗi ngày, và bạn thậm chí sẽ không bao giờ thấy nó đã làm gì.
Vấn đề đặt ra là: tại sao AI ngày nay thông minh đến vậy lại vẫn không thể thiếu con người?
Diogo hướng chỉ trích vào một thứ mà anh ấy rất quen thuộc—RLHF.

Khi chúng tôi huấn luyện AI, chúng tôi đã đưa con người vào vòng lặp.
Điều này hơi chút讽刺.
Vì RLHF chính là một trong những hướng công nghệ mà Diogo từng tham gia thúc đẩy.
Logic cơ bản của RLHF thực ra không phức tạp: thu thập sở thích của con người, sau đó giúp mô hình ngày càng phù hợp hơn với sở thích đó.
Vì vậy, Diogo đã đưa ra một lời giải thích rất rõ ràng trong bài phát biểu: tại sao các mô hình lớn ngày nay luôn cần con người tham gia vào vòng lặp?
Vì khi huấn luyện nó, chúng tôi đã thực sự đưa con người vào vòng lặp đó.
Mô hình đã học từ đầu: câu trả lời nào con người thích hơn?
Điều này cũng giải thích một đặc điểm mà chúng ta đã rất quen thuộc ở các mô hình lớn—ngay cả khi không biết, nó cũng thường nói rất giống như thật.
Diogo đã đưa ra một ví dụ rất hài hước tại chỗ.
Một người đã gửi cho ChatGPT một bản ghi âm ợ hơi, nói rằng đó là một bản nhạc do chính họ sáng tác và yêu cầu nó đánh giá “chân thành, thẳng thắn”.
Kết quả là ChatGPT đã khen ngợi một cách nghiêm túc rằng đây là một bản nhạc môi trường mang đậm không khí u ám, kỳ quái.
Diogo thậm chí đã tóm tắt bằng một câu: “Overpromising is a feature.”
Quá nhiều cam kết không phải là lỗi, mà là tính năng.
Đối với sản phẩm trò chuyện, điều này không nhất thiết là tử vong. Người dùng vẫn đang ở trước màn hình, sai sót có thể được sửa chữa.
Nhưng hệ thống tự động hóa thực sự hoàn toàn khác biệt.
Máy móc không quan tâm câu trả lời của bạn có nghe hay không, nó chỉ cần biết hai điều: nên làm gì cụ thể, và bạn có bao nhiêu phần trăm chắc chắn?
Điều này cũng giải thích tại sao Jev được phát hành hơn một tháng sau lại trông thật kỳ lạ.

Vì vậy, Jev đã quyết định không để AI "nói" nữa
Ngay cả các mô hình lớn thông thường, dù cuối cùng chỉ cần trả lời “A hay B”, thường cũng phải trải qua quá trình tạo Token.
Jev đã xóa phần này đi.
Hiện nó chủ yếu thực hiện ba việc:
Yes
Choice, chọn một trong vài tùy chọn;
Score, đánh giá theo tiêu chuẩn.
Sau đó trả về kết quả phán đoán và xác suất.
Tôi không viết bài luận cho bạn, cũng không trò chuyện cùng bạn.
Độ trễ đầu đến cuối do chính thức công bố thấp chỉ từ 70–500 miligiây, nhanh hơn 20–200 lần so với các mô hình tiên tiến nhất và rẻ hơn 40–400 lần.
Nhưng điều quan trọng thực sự không phải là “nhanh”, mà là xác suất ở phía sau.
Để giải quyết vấn đề này, TypeSafe đã đề xuất một phương pháp đào tạo mới: RLCD, Reinforcement Learning for Calibrated Decisions, học củng cố cho các quyết định được hiệu chỉnh.
Vấn đề nó muốn giải quyết rất thực tế: Nếu AI nói với bạn rằng một sự việc có 80% xác suất xảy ra, thì mức độ tin cậy của con số 80% này thực sự là bao nhiêu?
Lý tưởng nhất, những sự việc mà mô hình dự đoán có xác suất 80% thì cuối cùng nên xảy ra khoảng 80%.
This is very important in automated systems.
Có 99% sự chắc chắn, có thể thực hiện trực tiếp.
Với 51% độ tin cậy, bạn có thể giao cho mô hình lớn hơn, đắt hơn, hoặc thậm chí chuyển cho con người.
Vấn đề thực sự không phải là AI không biết, mà là AI không biết rằng mình không biết.
Vì vậy, điều Jev thực sự muốn thay đổi là đối tượng đầu ra của AI.
Câu trả lời do ChatGPT tạo ra trước đây chủ yếu dành cho con người xem. Các phán đoán và xác suất do Jev đưa ra thì được chuẩn bị để giao trực tiếp cho phần mềm sử dụng.

Thời đại của Agent, có thể không cần một bộ não lớn hơn
Điều này cũng giải thích tại sao Jev lại bùng nổ ngay bây giờ.
Vì sau khi Agent được vận hành thực sự, nó sẽ tạo ra một lượng lớn các phán đoán nhỏ:
Bước tiếp theo nên gọi công cụ nào? Trang web này nên nhấn nút nào? Thông tin này còn hữu ích không? Nhiệm vụ đã hoàn thành chưa? Kết quả có cần kiểm tra lại không?
Từng vấn đề này nhìn riêng lẻ đều không khó, nhưng một Agent có thể cần đưa ra quyết định hàng chục nghìn, hàng triệu lần trong một ngày.
Nếu mỗi lần đều gọi mô hình lớn nhất, dành vài giây để “suy nghĩ kỹ lưỡng” rồi tạo ra một đoạn token dài, chi phí và độ trễ sẽ nhanh chóng tăng lên.
Jev muốn chiếm lấy chính lớp này.
Giao cho Jev những quyết định nhỏ, tần suất cao, còn những nhiệm vụ đòi hỏi suy luận phức tạp mới giao cho mô hình lớn.
Đó cũng là lý do TypeSafe gọi Jev là System One Model.
Khái niệm này đến từ “Hệ thống 1” và “Hệ thống 2” của Daniel Kahneman: một hệ thống chịu trách nhiệm cho các phán đoán nhanh chóng, trực giác, và một hệ thống chịu trách nhiệm cho suy nghĩ chậm chạp, phức tạp.
Jev thậm chí tên của nó cũng xuất phát từ "nghịch lý Jevons":
Một nguồn tài nguyên trở nên ngày càng rẻ, con người không nhất thiết sẽ sử dụng ít hơn, mà có thể sử dụng nhiều hơn.
Nếu mỗi lần gọi AI rất tốn kém, bạn sẽ chỉ sử dụng nó ở những nơi quan trọng nhất.
Nhưng nếu một lần AI đánh giá là rẻ đến mức gần như có thể bỏ qua thì sao?
Một email, một bản ghi nhật ký, một lần gọi công cụ, một nút trên trang web, mỗi bước mà Agent thực hiện đều có thể bao gồm một lần phán đoán của AI.
Of course, it's still too early to say Jev represents the next generation of AI.
Nó gọi là “không ảo giác” chủ yếu có nghĩa là sẽ không tự ý tạo ra các câu trả lời ngoài loại đã được quy định, nhưng không có nghĩa là sẽ không chọn sai; các dữ liệu cực đoan như 193,6 lần, 444,6 lần chủ yếu đến từ các bài kiểm tra của TypeSafe.
Nhưng điều đáng quan tâm thực sự từ sự bùng nổ của Jev lần này có thể không phải là liệu nó có thể thách thức GPT hay Claude hay không.
Nhưng là một người tham gia tạo ra ChatGPT, đang tiếp tục đặt lại một câu hỏi cơ bản hơn:
Trong vài năm qua, toàn ngành đã luôn suy nghĩ làm thế nào để AI suy nghĩ lâu hơn và nói nhiều hơn.
Nhưng nếu trong tương lai điều thực sự cần là hàng tỷ lần phán đoán giữa các máy móc, thì tại sao AI mỗi lần đều phải “nói một đoạn văn”?
ChatGPT đã dạy máy cách giao tiếp với con người.
Bước tiếp theo mà Jev đang đặt cược là: Khi con người không còn ngồi trước màn hình, máy móc có thể tự đưa ra quyết định không?
