Autora: Zhu Xueying
Nestes dois dias, um modelo de IA um pouco anormal de repente se tornou viral.
Ele se chama Jev.
Não conversa, não escreve código e nem mesmo gera uma longa resposta como o ChatGPT. Ele faz apenas uma coisa: tomar decisões.
Mas foi exatamente esse modelo, que parece ter tido suas capacidades reduzidas pela metade, que de repente se tornou popular entre os desenvolvedores.
Alguém o usou para analisar 724 anúncios em tempo real em 40 segundos, fazendo um total de 8.724 julgamentos; alguém o conectou ao Claude Code para limpar contextos desnecessários; e alguém o usou como “árbitro” para agentes de IA, verificando se as tarefas foram realmente concluídas. O LangChain também já começou a testar o desempenho do Jev como avaliador de agentes.
Mais ainda, a velocidade e o preço.
Nos testes divulgados pela TypeSafe, o Jev alcançou aumento de velocidade de até 193,6 vezes e redução de custo de até 444,6 vezes. A entrada de cada milhão de tokens custa apenas US$ 0,042, e os tokens de saída são gratuitos.
Por que um AI que parece ter menos capacidade acabou se tornando popular?
Com a chegada da era dos Agentes, o que a IA realmente precisa pode não ser apenas “pensamento profundo”, mas também julgamentos em grande quantidade, rápidos e baratos: o que fazer a seguir, qual ferramenta chamar e se a tarefa foi realmente concluída. Mais importante ainda, esses julgamentos precisarão ser feitos pela própria IA em segundo plano no futuro, sem a necessidade de alguém ficar constantemente diante da tela observando. O que Jev valoriza são exatamente essas pequenas decisões que podem ocorrer milhões de vezes por dia.
Mais interessante ainda, Diogo Almeida, fundador do modelo Jev, participou diretamente do RLHF e agora está refletindo sobre ele: o método de treinamento que tornou o ChatGPT útil pode não ser adequado para a verdadeira automação da IA.
Há mais de um mês, Almeida fez uma palestra. Agora, olhando para trás, essa palestra é quase o “manual de ideias” do Jev.


A IA já consegue fazer matemática avançada, então por que ainda não consegue atender bem ao cliente?
O currículo de Diogo Almeida é especial.
Ele trabalhou na OpenAI e participou dos projetos relacionados ao GPT-4, ChatGPT e InstructGPT/RLHF. Ou seja, ele esteve diretamente envolvido na construção da principal abordagem de pós-treinamento para modelos grandes de hoje.
Mas nesse discurso, ele começou se gracejando, sendo um dos poucos dentro da OpenAI que publicamente criticam o ChatGPT.
O tema da palestra dele é mais direto: What's Next After RLHF?
Diogo primeiro fez uma pergunta que parecia muito contraditória.
Os modelos grandes de hoje já conseguem enfrentar problemas matemáticos muito difíceis, com desempenho contínuo em código, raciocínio e diversos benchmarks.
Mas, nos processos reais das empresas que realmente desejam automatizar, as pessoas ainda não conseguem ser removidas.
Por exemplo, atendimento ao cliente.
Usar IA para pesquisar informações, resumir documentos e redigir respostas está perfeito.
Mas se deixar a IA decidir por si mesma: esse dinheiro deve ser reembolsado ou não? Este usuário deve ser indenizado ou não?
As empresas ficaram imediatamente mais cautelosas.
Claramente, essas coisas parecem muito mais simples do que a matemática avançada, por que então não confiar no AI?
A resposta de Diogo é simples: a IA de hoje é incrível em assistência, não em automação.
Hoje, a IA é muito boa em ajudar você a fazer o trabalho, mas ainda não consegue terminá-lo sozinha.
Essas duas coisas parecem ser apenas um pouco diferentes, mas na realidade são totalmente distintas.
Mesmo que o Claude Code seja mais poderoso, você ainda geralmente fica sentado na frente do computador. Ele escreve o código, você observa; ele altera arquivos, você verifica; se houver erros, você pede que ele corrija.
Então, para Diogo, o Claude Code ainda pertence à "era de assistência" iniciada pelo ChatGPT.
O que é realmente a automação?
A pessoa nem estava presente.
A IA julga e executa sozinha nos bastidores, podendo operar dezenas de milhares ou até milhões de vezes por dia, e você nunca verá o que ela fez.
Aí surge a pergunta: por que a IA de hoje é tão inteligente, mas ainda assim não consegue se livrar do ser humano?
Diogo apontou o dedo para algo com o qual ele está muito familiarizado — RLHF.

Quando treinamos a IA, colocamos pessoas no loop.
Isso é um pouco irônico.
Porque o RLHF é exatamente uma das linhas tecnológicas que Diogo participou de impulsionar.
A lógica básica do RLHF não é complicada: coletar preferências humanas e fazer com que o modelo se torne cada vez mais alinhado às preferências humanas.
Então, Diogo deu uma explicação muito direta na palestra: por que os grandes modelos de hoje sempre precisam de alguém no loop?
Porque, ao treiná-lo, literalmente colocamos pessoas dentro desse circuito.
O modelo está aprendendo desde o início: quais respostas as pessoas preferem?
Isso também explica uma característica dos grandes modelos que já conhecemos muito bem — mesmo sem saber, eles frequentemente conseguem falar como se soubessem.
Diogo apresentou um exemplo bem maldoso ao vivo.
Alguém enviou ao ChatGPT uma gravação de pum, dizendo que era uma música que havia composto, e pediu uma avaliação “sincera e franca”.
O ChatGPT elogiou seriamente, dizendo que se trata de uma música ambiental com uma atmosfera sombria e estranha.
Diogo até resumiu com uma frase: “Overpromising is a feature.”
Overpromising is not a bug, it's a feature.
Para um produto de bate-papo, isso não é necessariamente fatal. O usuário ainda está na frente da tela e pode corrigir erros.
Mas um sistema automatizado real é completamente diferente.
A máquina não se importa se sua resposta é agradável ou não; ela só precisa saber duas coisas: exatamente o que fazer e quão confiante você está?
Isso também explica por que o Jev, lançado mais de um mês depois, parecia tão anormal.

Então, Jev simplesmente impediu o AI de "falar".
Mesmo modelos grandes comuns, que eventualmente precisam apenas responder “A ou B”, geralmente passam pelo processo de geração de tokens.
Jev cortou diretamente esta parte.
Atualmente, ele faz principalmente três coisas:
Novo, responda Sim ou Não;
Choice, escolha um entre várias opções;
Score, avalie conforme o padrão.
Then return the judgment and probability directly.
Não vou escrever um ensaio para você nem conversar com você.
A latência de ponta a ponta divulgada oficialmente é de apenas 70 a 500 milissegundos, 20 a 200 vezes mais rápida que modelos de ponta e 40 a 400 vezes mais barata.
Mas o realmente crucial não é “rápido”, é a probabilidade depois disso.
Para isso, a TypeSafe propôs um novo método de treinamento: RLCD, Reinforcement Learning for Calibrated Decisions, aprendizado por reforço para decisões calibradas.
O problema que ele pretende resolver é muito real: se a IA lhe disser que há 80% de probabilidade de algo acontecer, esse 80% é realmente confiável?
Idealmente, um conjunto de eventos que o modelo avalia como tendo 80% de probabilidade deveria ocorrer em aproximadamente 80% dos casos.
Isso é muito importante em sistemas automatizados.
Com 99% de certeza, pode ser executado diretamente.
Com 51% de certeza, pode ser encaminhado para modelos maiores e mais caros, ou até mesmo para pessoas.
O verdadeiro problema não é a IA não saber, é a IA não saber que não sabe.
Então, o que Jev realmente quer mudar é o objeto da saída da IA.
As respostas geradas anteriormente pelo ChatGPT eram principalmente destinadas a serem lidas por pessoas. As avaliações e probabilidades fornecidas pelo Jev foram preparadas para serem entregues diretamente a softwares.

Na era dos agentes, talvez não seja necessário um cérebro maior
Isso também explica por que Jev se tornou popular justamente agora.
Porque, quando o Agente for realmente executado, gerará uma quantidade massiva de pequenas decisões:
Qual ferramenta chamar a seguir? Qual botão clicar nesta página? Esta informação ainda é útil? A tarefa foi concluída? O resultado precisa ser verificado novamente?
Essas perguntas, vistas individualmente, não são difíceis, mas um agente pode precisar julgar centenas de milhares ou milhões de vezes por dia.
Se sempre for chamado o maior modelo mais poderoso, gastando alguns segundos para “refletir profundamente” antes de gerar um grande trecho de tokens, os custos e a latência aumentam rapidamente.
O que Jev quer pegar é este nível.
Deixe as grandes quantidades de decisões rápidas e frequentes para o Jev, e apenas atribua tarefas que exigem raciocínio complexo ao modelo grande.
É por isso que a TypeSafe chama Jev de System One Model.
Esse conceito vem do "Sistema 1" e "Sistema 2" de Daniel Kahneman: um responsável por julgamentos rápidos e intuitivos, o outro por pensamentos lentos e complexos.
Jev também recebeu seu nome do "Paradoxo de Jevons":
Quando um recurso se torna cada vez mais barato, as pessoas não necessariamente o usam menos; pelo contrário, podem acabar usando mais.
Se chamar a IA for caro, você só a usará nos lugares mais importantes.
Mas e se a IA julgar que está tão barato que pode ser quase ignorado?
Um e-mail, um registro, uma chamada de ferramenta, um botão de página web, cada etapa executada pelo agente, pode envolver uma decisão de IA.
Claro, ainda é cedo demais dizer que Jev representa a próxima geração de IA.
O que ele chama de "zero ilusão" significa mais que não sairá dos tipos de respostas permitidas para inventar coisas, mas não indica que não poderá escolher errado; dados extremos como 193,6 vezes e 444,6 vezes vêm principalmente dos próprios testes da TypeSafe.
Mas o que realmente merece atenção no sucesso repentino de Jev pode não ser se ele consegue desafiar o GPT ou o Claude.
Mas sim uma pessoa que participou na criação do ChatGPT, está voltando a questionar um problema mais fundamental:
Nos últimos anos, toda a indústria tem se perguntado como fazer com que a IA pense por mais tempo e fale mais.
Mas se, no futuro, o que realmente for necessário forem bilhões de julgamentos entre máquinas, por que a IA precisa sempre primeiro “dizer um trecho de texto”?
ChatGPT ensinou às máquinas como falar com as pessoas.
E o próximo passo que Jev aposta é: quando as pessoas não estiverem mais sentadas à frente das telas, os computadores conseguirão tomar decisões por conta própria?
