Auteur : Zhu Xueying
Ces deux derniers jours, un modèle d'IA légèrement anormal a soudainement fait le tour des réseaux.
Il s'appelle Jev.
Ne sait pas discuter, ne sait pas coder, et ne sait même pas vous générer une longue réponse comme ChatGPT. Il ne fait qu'une chose : prendre des décisions.
Mais c’est précisément ce modèle, qui semble avoir vu ses capacités réduites de moitié, qui a soudainement connu un grand succès dans la communauté des développeurs.
Certains l'utilisent pour analyser 724 publicités en temps réel en 40 secondes, effectuant au total 8 724 jugements ; d'autres l'ont intégré à Claude Code pour nettoyer les contextes inutiles ; d'autres encore le font agir comme « arbitre » pour les agents IA, vérifiant si les tâches ont réellement été accomplies. LangChain a également commencé à tester les performances de Jev en tant qu'évaluateur d'agents.
Plus encore, la vitesse et le prix.
Dans les tests publiés par TypeSafe, Jev a atteint une accélération maximale d'environ 193,6 fois et une réduction des coûts maximale de 444,6 fois. L'entrée de un million de tokens coûte seulement 0,042 $, et la sortie de tokens est même gratuite.
Pourquoi une IA qui semble avoir moins de capacités connaît-elle un tel succès ?
À l'ère des agents, ce dont l'IA a vraiment besoin, ce n'est peut-être pas seulement une « réflexion approfondie », mais aussi des jugements massifs, rapides et peu coûteux : que faire ensuite, quel outil appeler, si la tâche est vraiment terminée. Plus important encore, ces jugements devront à l'avenir être effectués automatiquement par l'IA en arrière-plan, sans qu'une personne doive rester constamment devant un écran. Ce que Jev recherche, ce sont ces petites décisions qui peuvent se produire des millions de fois par jour.
Plus intéressant encore, Diogo Almeida, fondateur du modèle Jev, a participé à la RLHF et commence maintenant à remettre en question cette dernière : cette méthode d'entraînement qui a rendu ChatGPT efficace pourrait ne pas être adaptée à une véritable automatisation de l'IA.
Il y a plus d'un mois, Almeida a donné une conférence. En y repensant aujourd'hui, cette conférence ressemble presque à un « manuel d'instructions » de Jev.


L'IA sait déjà faire des mathématiques avancées, alors pourquoi ne fait-elle pas bien le service client ?
Le parcours de Diogo Almeida est particulier.
Il a travaillé chez OpenAI et a participé aux travaux sur GPT-4, ChatGPT et InstructGPT/RLHF. Autrement dit, il a personnellement contribué à la mise en place de la principale méthode d'entraînement postérieur pour les grands modèles d'aujourd'hui.
Mais durant ce discours, il s'est d'abord moqué de lui-même, étant l'un des rares à l'intérieur d'OpenAI à critiquer publiquement ChatGPT.
Son sujet de discours est plus direct : What's Next After RLHF ?
Diogo a d'abord posé une question qui semble contradictoire.
Les grands modèles d'aujourd'hui peuvent déjà résoudre des problèmes mathématiques très complexes, avec des performances en code, raisonnement et divers benchmarks qui ne cessent d'augmenter.
Cependant, dans les processus d'entreprise que les entreprises souhaitent vraiment automatiser, les humains restent incontournables.
Par exemple, le service client.
Faire en sorte que l'IA recherche des informations, résume des documents et rédige des réponses, c'est sans problème.
Mais si on laisse l'IA décider : cet argent doit-il être remboursé ? Ce utilisateur doit-il être indemnisé ?
Les entreprises sont devenues immédiatement prudentes.
Ces choses semblent bien plus simples que les mathématiques avancées, pourquoi n’ose-t-on pas les confier à l’IA ?
La réponse de Diogo est simple : L'IA d'aujourd'hui est incroyable pour l'assistance, pas pour l'automatisation.
L'IA d'aujourd'hui sait bien vous aider à accomplir vos tâches, mais elle n'est pas encore très capable de les terminer seule.
Ces deux choses semblent ne différer que légèrement, mais elles sont en réalité totalement différentes.
Même si Claude Code est très puissant, vous êtes généralement assis devant votre ordinateur. Il écrit le code, vous regardez ; il modifie les fichiers, vous vérifiez ; s’il y a une erreur, vous lui demandez de corriger.
Donc, selon Diogo, Claude Code appartient toujours à l'ère de l'assistance ouverte par ChatGPT.
Qu'est-ce que l'automatisation réelle ?
La personne n'était pas présente.
L'IA juge et exécute automatiquement en arrière-plan, pouvant fonctionner des dizaines de milliers, voire des millions de fois par jour, sans que vous ne voyiez jamais ce qu'elle a fait.
La question se pose donc : pourquoi l’IA d’aujourd’hui est-elle si intelligente, mais dépend-elle encore des humains ?
Diogo dirige son attention vers quelque chose qu'il connaît très bien — le RLHF.

Lorsque nous avons formé l'IA, nous avons intégré les humains dans la boucle.
C'est un peu ironique.
Car le RLHF est précisément l'une des voies technologiques auxquelles Diogo a participé à promouvoir.
La logique de base du RLHF n'est pas compliquée : recueillir les préférences humaines, puis faire en sorte que le modèle s'aligne de plus en plus sur ces préférences.
Diogo a donc donné une explication très claire dans son discours : pourquoi les grands modèles d'aujourd'hui nécessitent-ils toujours une intervention humaine ?
Lors de son entraînement, nous avons littéralement intégré des humains dans ce circuit.
Le modèle apprend dès le départ : quelles réponses les gens préfèrent ?
Cela explique également une caractéristique des grands modèles que nous connaissons déjà bien — même sans le savoir, ils parviennent souvent à parler avec une grande ressemblance à la vérité.
Diogo a donné un exemple très malin sur place.
Quelqu’un a envoyé à ChatGPT un enregistrement de pet, en disant que c’était une musique qu’il avait composée, et lui a demandé d’apporter une évaluation « sincère et franche ».
ChatGPT a sérieusement loué cela, disant qu'il s'agissait d'une musique d'ambiance très sinistre et étrange.
Diogo a même résumé en une phrase : « Overpromising is a feature. »
Overpromising is not a bug, it's a feature.
Pour un produit de chat, ce n'est pas forcément mortel. Les utilisateurs sont encore devant l'écran et peuvent corriger leurs erreurs.
Mais un véritable système automatisé est totalement différent.
La machine ne se soucie pas de la qualité de votre réponse ; elle ne veut que deux choses : quoi faire exactement, et à quel point vous en êtes certain.
Cela explique également pourquoi Jev, publié plus d'un mois plus tard, semblait si anormal.

Alors, Jev a simplement empêché l'IA de « parler »
Même si un modèle généraliste n'a finalement besoin que de répondre « A ou B », il doit souvent passer par le processus de génération de tokens.
Jev a directement supprimé cette partie.
Il fait principalement trois choses actuellement :
Non
Choice, choisir parmi plusieurs options ;
Score, évaluez selon les normes.
Then return the judgment and probability directly.
Je ne vais pas écrire un essai pour toi, ni te tenir compagnie en discutant.
La latence de bout en bout officiellement publiée est de 70 à 500 millisecondes, jusqu'à 20 à 200 fois plus rapide que les modèles de pointe, et jusqu'à 40 à 400 fois moins chère.
Mais ce qui est vraiment crucial, ce n'est pas la « vitesse », c'est la probabilité qui suit.
À cet effet, TypeSafe propose une nouvelle méthode d'entraînement : RLCD, Reinforcement Learning for Calibrated Decisions, apprentissage par renforcement pour des décisions calibrées.
Le problème qu'il cherche à résoudre est très concret : si une IA vous dit qu'il y a 80 % de chances qu'un événement se produise, pouvez-vous vraiment faire confiance à ce 80 % ?
Idéalement, les événements qu'un modèle évalue à une probabilité de 80 % devraient se produire environ 80 % du temps.
Cela est très important dans un système automatisé.
99 % de confiance, vous pouvez exécuter directement.
Avec une certitude de 51 %, vous pouvez le transférer à un modèle plus puissant et plus coûteux, voire à une personne.
Le vrai problème n'est pas que l'IA ne sache pas, c'est que l'IA ne sait pas qu'elle ne sait pas.
Donc, ce que Jev veut vraiment changer, c'est l'objet de la sortie de l'IA.
Les réponses générées par ChatGPT dans le passé étaient principalement destinées aux êtres humains. Les jugements et probabilités fournis par Jev, en revanche, sont conçus pour être directement utilisés par des logiciels.

À l'ère des agents, ce dont on pourrait avoir besoin, ce n'est pas un cerveau plus grand
Cela explique aussi pourquoi Jev a soudainement pris de l'ampleur maintenant.
Car une fois que l'Agent est réellement en marche, il génère une quantité massive de petites décisions :
Quel outil appeler ensuite ? Quel bouton cliquer sur cette page web ? Cette information est-elle encore utile ? La tâche est-elle vraiment terminée ? Faut-il recontrôler les résultats ?
Ces questions, vues individuellement, ne sont pas difficiles, mais un agent peut être amené à les évaluer des dizaines ou des centaines de milliers de fois par jour.
Si chaque fois on appelle le plus grand modèle, qu'on prend quelques secondes pour « réfléchir profondément » et qu'on génère un grand nombre de tokens, les coûts et la latence augmentent rapidement.
Jev veut saisir ce niveau.
Laissez les nombreuses décisions fréquentes et simples à Jev, et réservez les tâches nécessitant un raisonnement complexe aux grands modèles.
C'est aussi pourquoi TypeSafe appelle Jev le System One Model.
Ce concept provient du « système 1 » et du « système 2 » de Daniel Kahneman : l'un responsable des jugements rapides et intuitifs, l'autre des réflexions lentes et complexes.
Jev even takes its name from the "Jevons Paradox":
Lorsqu'une ressource devient de plus en plus bon marché, les gens n'en utilisent pas nécessairement moins ; au contraire, ils pourraient en utiliser davantage.
Si appeler l'IA est coûteux, vous ne l'utilisez que pour les choses les plus importantes.
Mais que se passe-t-il si l'IA juge le prix si bas qu'il peut être presque ignoré ?
Un e-mail, un journal, un appel d'outil, un bouton de page web, chaque étape exécutée par un agent, peut inclure un jugement IA.
Of course, it's still too early to say that Jev represents the next generation of AI.
Ce qu'il appelle « zéro hallucination » signifie davantage qu'il ne sortira pas des types de réponses prévus pour inventer des réponses, mais cela ne signifie pas qu'il ne fera pas d'erreurs ; des données extrêmes telles que 193,6 fois et 444,6 fois proviennent principalement des tests effectués par TypeSafe lui-même.
Mais ce qui mérite vraiment d'être noté dans la popularité soudaine de Jev cette fois-ci, ce n'est peut-être pas sa capacité à défier GPT ou Claude.
Mais plutôt une personne ayant participé à la création de ChatGPT qui réinterroge une question plus fondamentale :
Au cours des dernières années, l'ensemble de l'industrie s'est demandé comment permettre à l'IA de réfléchir plus longtemps et de dire plus de choses.
Mais si, à l'avenir, ce dont on aura vraiment besoin, c'est des milliards de jugements entre machines, pourquoi l'IA devrait-elle à chaque fois « dire un discours » ?
ChatGPT a appris aux machines comment parler aux humains.
La prochaine étape du pari de Jev est : lorsque les humains ne seront plus assis devant leurs écrans, les machines pourront-elles prendre des décisions seules ?
