May-akda: Zhu Xueying
Sa dalawang araw na ito, isang hindi karaniwang AI model ang biglang naging viral.
Tawagin siya sa Jev.
Hindi makikipag-usap, hindi sumusulat ng code, kahit hindi magagawa ang paggawa ng mahabang sagot tulad ng ChatGPT. Isa lang ang ginagawa nito: gumawa ng desisyon.
Ngunit ang ganitong modelo na tila “napabawasan ang kakayahan nang malaki” ay biglang naging sikat sa komunidad ng mga developer.
Gumagamit ng ilan ng ito ng 40 segundo para suriin ang 724 na aktwal na advertisement, at nagawa nilang gawin ang 8,724 na pagpapasya; gumagamit ng iba nito upang i-connect sa Claude Code para linisin ang hindi kailangang konteksto; at gumagamit pa ng iba nito bilang “hukom” para sa AI Agent upang suriin kung natapos ba talaga ang gawain. Kumukuha na rin ang LangChain ng mga pagsubok sa pagganap ng Jev bilang Agent evaluator.
Mas nakakatamis ang bilis at presyo.
Sa mga pagsubok na ipinahayag ni TypeSafe, ang pinakamataas na pagtaas ng bilis ni Jev ay humigit-kumulang 193.6 beses, at ang pinakamataas na pagbawas sa gastos ay 444.6 beses. Ang pag-input ng bawat milyong Token ay nagkakahalaga ng $0.042 lamang, habang ang pag-output ng Token ay libre pa.
Bakit naging sikat ang isang AI na tila may mas kaunting kakayahan?
Dahil sa pagdating ng Agent era, ang tunay na kailangan ng AI ay maaaring hindi lang ang “malalim na pag-iisip,” kundi pati na rin ang malaking dami, mabilis, at murang pagpapasya: Ano ang susunod na gagawin, alin sa mga tool ang dapat gamitin, at kung tapos na ba ang gawain. Mas mahalaga pa, ang mga pagpapasyang ito ay kailangang gawin ng AI mismo sa background sa hinaharap, hindi na kailangang manatili ang tao sa harap ng screen. Ito ang tinatanggap ni Jev: ang mga maliit na desisyon na maaaring mangyari ng ilang milyon beses araw-araw.
Mas interesante pa, si Diogo Almeida, ang tagapagtatag ng Jev model, ay kumilala mismo sa RLHF, at ngayon ay nagsisimula na siyang mag-isip muli tungkol sa RLHF: ang paraan ng pagtuturo na ginawa ang ChatGPT na maging gamit, ay maaaring hindi angkop para sa tunay na pagpapalawak ng automation sa AI.
Isang buwan at ilang araw na ang nakalipas, nagbigay si Almeida ng isang talumpati. Ngayon, tingnan natin muli, ang talumpating iyon ay halos isang “mga gabay sa pag-iisip” ni Jev.


Nagagawa na ng AI ang mataas na matematika, bakit hindi pa rin mabuting customer service?
Ang resume ni Diogo Almeida ay espesyal.
Nakapagtrabaho siya sa OpenAI at isang miyembro ng team na nagtataguyod ng GPT-4, ChatGPT, at mga proyekto kaugnay ng InstructGPT/RLHF. Ibig sabihin, siya ay direktang nakikilahok sa pagbuo ng pinakamahalagang set ng post-training paradigma para sa mga malalaking modelo ngayon.
Ngunit sa palabas na iyon, sinira niya ang sarili niya sa simula, bilang isa sa mga kaunting tao sa OpenAI na publiko ring pinapaloko ang ChatGPT.
Mas direkta ang paksa ng kanyang talumpati: What's Next After RLHF?
Una unang tanong na tila magkakasalungat ang inihain ni Diogo.
Ang mga malalaking modelo ngayon ay kayang harapin ang mga napakahirap na matematikal na problema, at patuloy na umuunlad sa coding, pag-iisip, at iba’t ibang benchmark.
Ngunit sa maraming mga negosyo na talagang nais automatin, ang mga tao ay patuloy na hindi maaalis.
Halimbawa ang customer service.
Magpapagawa ng paghahanap ng impormasyon, pagsasalin ng mga dokumento, at pagsulat ng mga sagot gamit ang AI, walang problema.
Ngunit kung papayagan ang AI na magdesisyon: Babalikin ba ang perang ito? O kaya ay dapat bang magbayad ng kompensasyon ang user na ito?
Agad na naging maingat ang negosyo.
Kahit na mas simpleng-maliit ang mga bagay na ito kaysa sa mataas na matematika, bakit takot pa rin iwanan sa AI?
Ang sagot ni Diogo ay simpleng: Incredible ang AI ngayon sa pagtutulungan, hindi sa automation.
Ang AI ngayon ay maaaring tumulong sa iyo sa paggawa ng trabaho, ngunit hindi pa gaanong kayang tapusin ang trabaho nang sarili nito.
Ang dalawang bagay na ito ay tila magkakaiba ng kaunti, ngunit sa totoo lang, iba sila.
Kahit gaano katapang ang Claude Code, karaniwan pa rin kang nakaupo sa harap ng computer. Ipinapasa nito ang code, ikaw ang nagbabasa; binabago nito ang mga file, ikaw ang nag-aaral; kung may mali, ipinapagawa mo sa kanya na baguhin muli.
Kaya sa pananaw ni Diogo, ang Claude Code ay patuloy na bahagi ng “Panahon ng Pagtutulungan” na itinatag ng ChatGPT.
Ano ang tunay na automation?
Hindi talaga present ang tao.
Ang AI ay nagpapasya at nagpapatupad sa likod, maaaring mag-run ng ilang dekada o milyon beses araw-araw, at hindi ka na lang makikita kung ano ang ginawa nito.
Nagkakaroon ng tanong: Bakit ang AI ngayon ay sobrang matalino, ngunit kailangan pa rin ng tao?
Inilah ng Diogo ang kanyang pagtutok sa isang bagay na lubos niyang kilala—RLHF.

Noong pinagtrabahuhan namin ang AI, isinama namin ang tao sa loop.
May ilang katwiran sa bagay na ito.
Dahil sa RLHF, na isa lamang sa mga teknikal na direksyon na pinagsanay ni Diogo noong panahon niya.
Ang pangunahang lohika ng RLHF ay hindi kumplikado: kumolekta ng mga preferensya ng tao, tapos gawing mas tugma sa mga preferensya ng tao ang modelo.
Kaya ibinigay ni Diogo ang isang napakalinaw na paliwanag sa kanyang talakayan: bakit lagi kailangan ng tao sa loop ng mga malalaking modelo ngayon?
Dahil sa pagtatrain nito, literal naming isinaksak namin ang mga tao sa loob ng siklo.
Ang modelo ay natututo mula sa simula: Anong uri ng sagot ang mas pinapahalagahan ng mga tao?
Ito rin ang nagpapaliwanag sa isang katangian ng malalaking modelo na naging pamilyar na sa atin—kahit hindi alam, madalas itong magsasalita nang parang totoo.
Diogo ay nagbigay ng isang napakasakit na halimbawa sa lugar.
Ibinigay ng isang tao ang isang recording ng pagpapalabas ng butas sa ChatGPT, sinabing ito ay isang awit na kanyang nilikha, at hiningi nito na “maging tapat at bukas” sa pagtataya.
Ang resulta ay ang ChatGPT ay nagsimula nang seryosong pagsasalang, na ang awit ay isang environmental music na may malalim at maliit na atmospera.
Ginamit ni Diogo ang isang pangungusap bilang pagsusummary: “Overpromising is a feature.”
Ang sobrang pagpapahayag ay hindi bug, kundi feature.
Para sa chat product, hindi ito patay. Nasa harap ng screen pa ang user, kaya maaaring i-correct ang pagkakamali.
Ngunit ang tunay na automated system ay iba.
Hindi nag-aalala ang machine kung gaano kabalikat ang iyong sagot, kailangan lang nito na malaman ang dalawang bagay: ano ang dapat gawin, at gaano ka kalakas ang iyong tiwala?
Ito ang nagpapaliwanag kung bakit tila sobrang kakaiba ang Jev na ipinakilala isang buwan at higit pa ang nakalipas.

Kaya pinilit ni Jev na huwag bigyan ng pagsasalita ang AI
Kahit na ang karaniwang malaking modelo ay kailangan lang magbigay ng sagot na “A o B”, kadalasan ay dumadaan pa rin sa proseso ng pag-generate ng Token.
Wala nang iwanan ng Jev sa bahaging ito.
Nagagawa nito ngayon ang tatlong pangunahing bagay:
Oo o Hindi
Choice, piliin ang isang opsyon mula sa ilang pagpipilian;
Score, ayon sa standard na pagsusuri.
Pagkatapos ay ibalik agad ang pagtataya at probabilidad.
Hindi ako magpapalit ng maikling sanaysay, at hindi kita sasamahan sa pag-uusap.
Ang opisyal na ipinahayag na end-to-end latency ay maaaring mababa hanggang 70–500 millisecond, 20–200 beses mas mabilis kaysa sa mga pinakamodernong modelo, at 40–400 beses mas mura.
Ngunit ang totoo pang mahalaga ay hindi ang “mabilis”, kundi yung probabilidad pagkatapos.
Para sa layuning ito, inilahad ng TypeSafe ang isang bagong paraan ng pagtuturo: RLCD, Reinforcement Learning for Calibrated Decisions, o Reinforcement Learning para sa Mga Kaliwang Desisyon.
Ang problema na nais niyang lutasin ay napakatotoo: Kung sabi ng AI na may 80% na posibilidad na mangyari ang isang bagay, maaari bang paniniwalaan ang 80% na ito?
Sa ideal na sitwasyon, ang mga bagay na binigyang-pagkakataon ng 80% ng model ay dapat magkaroon ng halos 80% na nangyari.
Mahalaga ito sa automated system.
99% ang tiwala, maaaring direktang i-execute.
51% na tiyak, maaaring isauli sa mas malakas at mas mahal na malaking modelo, o kaya'y i-transfer sa tao.
Hindi ang kakulangan ng kaalaman ng AI ang tunay na problema, kundi ang pagkakaroon ng kaalaman ng AI na wala itong kaalaman.
Kaya ang tunay na gustong baguhin ni Jev ay ang layunin ng AI output.
Ang mga sagot na ginawa ng ChatGPT ay pangunguna para sa tao. Ang mga pagpapasya at probabilidad na ibinigay ni Jev ay handa na para sa direkta na paggamit ng software.

Sa panahon ng Agent, maaaring hindi kailangan ng mas malaking utak
Ito rin ang nagpapaliwanag kung bakit si Jev ay naging sikat sa ngayon.
Dahil sa pagpapatakbo ng Agent, magkakaroon ng malaking dami ng maliit na desisyon:
Ano ang susunod na tool na dapat i-call? Ano ang button na dapat i-click sa webpage na ito? May kahulugan pa ba ang mensaheng ito? Natapos na ba ang task? Dapat bang i-recheck ang resulta?
Ang mga tanong na ito ay hindi mahirap kung tingnan nang hihiwalay, ngunit maaaring kailanganin ng isang Agent na magpasya ng ilang daan-daang libo o milyon beses sa isang araw.
Kung bawat beses ay tinatawag na pinakamalakas na malaking modelo, at ginagamit ang ilang segundo para “isipin nang mabuti” bago ibinibigay ang isang malaking halaga ng Token, tataas nang mabilis ang gastos at latency.
Ang layer na ito ang gustong kunin ni Jev.
Ibigay ang malalaking maraming maliit na desisyon kay Jev, at ang mga gawain na nangangailangan ng kumplikadong pag-iisip, ibigay sa malaking modelo.
Ito ang dahilan kung bakit tinatawag ng TypeSafe si Jev bilang System One Model.
Ang konseptong ito ay galing sa “System 1” at “System 2” ni Daniel Kahneman: ang isa ay responsable sa mabilis, intuitibong pagdedesisyon, habang ang isa pa ay responsable sa mabagal, kumplikadong pag-iisip.
Ang Jev ay kahit ang pangalan nito ay galing sa “Paradoks ni Jevons”:
Habang nagiging mas mura ang isang yaman, hindi nangangahulugan na mas kaunti ang paggamit nito—kundi posibleng mas marami ang gamitin.
Kung mahal ang isang pagtawag sa AI, gagamitin mo lang ito sa mga pinakamahalagang bagay.
Pero kung ang isang AI ay nagtataya na mura nang halos maaring ikalimot?
Isang e-mail, isang log, isang pagtawag sa kasangkapan, isang pindutan sa web, bawat hakbang na ginagawa ng Agent, ay maaaring maglalaman ng isang AI na pagpapasya.
Siguro pa rin masyadong maaga ang sabihin na ang Jev ay kumakatawan sa susunod na henerasyon ng AI.
Ang kanyang sinasabing "zero hallucination" ay higit na nangangahulugan na hindi ito lalabas sa mga itinakdang uri ng sagot at magmumula ng mga kakaibang sagot, ngunit hindi nangangahulugan na hindi ito maaaring mali; ang mga extremong data tulad ng 193.6 beses, 444.6 beses ay pangunahing galing sa sariling pagsubok ng TypeSafe.
Ngunit ang tunay na dapat pagtuunan ng pansin sa pagkabigla ni Jev ay hindi kung kayang nitong pigilan ang GPT o Claude.
Ngunit isang tao na nakikilahok sa pagbuo ng ChatGPT, na bumabalik sa isang mas pangunahing tanong:
Sa mga nakalipas na taon, ang buong industriya ay naghahanap kung paano gawing mas mahaba ang pag-iisip at mas marami ang pagsasalita ng AI.
Ngunit kung ang talagang kailangan sa hinaharap ay ilang bilyon na pagpapasya sa pagitan ng mga makina, bakit kailangan ng AI na unang “sabihin ang isang talata” bawat beses?
Pinagturo ng ChatGPT sa mga machine kung paano makipag-usap sa mga tao.
At ang susunod na pagtaya ni Jev ay: Kapag hindi na nakaupo ang tao sa harap ng screen, kayabang ba ng machine na gumawa ng desisyon?
