Autora: Zhu Xueying
En los últimos dos días, un modelo de IA algo inusual se volvió viral.
Se llama Jev.
No sabe chatear, no escribe código, ni siquiera puede generarte una larga respuesta como ChatGPT. Solo hace una cosa: tomar decisiones.
Pero precisamente este modelo, que parece haber perdido casi la mitad de sus capacidades, se volvió repentinamente popular entre los desarrolladores.
Alguien lo usó durante 40 segundos para analizar 724 anuncios en tiempo real y realizó un total de 8724 juicios; alguien más lo conectó a Claude Code para limpiar contextos innecesarios; y otros lo utilizan como "árbitro" para agentes de IA, verificando si realmente se completaron las tareas. LangChain también ha comenzado a probar el rendimiento de Jev como evaluador de agentes.
Lo más impresionante es la velocidad y el precio.
En las pruebas publicadas por TypeSafe, Jev alcanzó un aumento de velocidad de hasta 193.6 veces y redujo los costos hasta 444.6 veces. El ingreso de cada millón de tokens cuesta solo $0.042, y los tokens de salida son incluso gratuitos.
¿Por qué se volvió popular una IA que parece tener menos capacidad?
Porque en la era de los agentes, lo que la IA realmente necesita puede no ser solo “pensar profundamente”, sino también juicios masivos, rápidos y económicos: ¿qué hacer a continuación, qué herramienta llamar, si la tarea realmente se completó. Más importante aún, estos juicios deberán realizarse en el futuro por la IA misma en segundo plano, sin necesidad de que una persona esté siempre sentada frente a la pantalla observando. Lo que Jev valora son precisamente estas pequeñas decisiones que pueden ocurrir millones de veces al día.
Lo más interesante es que Diogo Almeida, fundador del modelo Jev, participó en RLHF, y ahora está reflexionando sobre RLHF: este método de entrenamiento que hizo que ChatGPT fuera útil podría no ser adecuado para que la IA avance realmente hacia la automatización.
Hace más de un mes, Almeida dio una conferencia. Ahora, al mirar hacia atrás, esa charla fue casi el “manual de ideas” de Jev.


La IA ya puede hacer matemáticas avanzadas, ¿por qué aún no puede atender bien al cliente?
El currículum de Diogo Almeida es especial.
Trabajó en OpenAI y participó en el desarrollo de GPT-4, ChatGPT y los trabajos relacionados con InstructGPT/RLHF. Es decir, participó directamente en la construcción de la principal metodología de postentrenamiento para los modelos grandes de hoy.
Pero en esa charla, comenzó bromeando sobre sí mismo, siendo uno de los pocos dentro de OpenAI que públicamente criticaban a ChatGPT.
Su tema de conferencia es más directo: What's Next After RLHF?
Diogo planteó primero una pregunta que parecía muy contradictoria.
Los modelos grandes de hoy pueden resolver problemas matemáticos muy difíciles, y el rendimiento en código, razonamiento y diversos benchmarks sigue mejorando.
Pero en los procesos empresariales que realmente desean automatizar, la gente sigue siendo indispensable.
Por ejemplo, el servicio al cliente.
Que la IA busque información, resuma documentos y redacte respuestas, no hay problema.
Pero si se deja que la IA decida por sí misma: ¿se debe reembolsar este dinero? ¿Debe este usuario pagar una compensación?
Las empresas se volvieron inmediatamente cautelosas.
Claramente, estas cosas parecen mucho más simples que las matemáticas avanzadas, ¿por qué entonces no se atreven a confiarlas a la IA?
La respuesta de Diogo es sencilla: Hoy en día, la IA es increíble en asistencia, no en automatización.
Hoy, la IA es muy buena ayudándote a trabajar, pero aún no puede terminar el trabajo por sí misma.
Estas dos cosas parecen diferir solo un poco, pero en realidad son completamente distintas.
Claude Code sea lo fuerte que sea, generalmente aún estás sentado frente a la computadora. Él escribe el código, tú lo miras; él modifica archivos, tú los revisas; si hay errores, le pides que los arregle.
Entonces, según Diogo, Claude Code aún pertenece a la "era de asistencia" iniciada por ChatGPT.
¿Qué es la automatización real?
La persona no estaba presente.
La IA juzga y ejecuta por sí misma en segundo plano, posiblemente ejecutándose decenas de miles o incluso millones de veces al día, y es posible que nunca veas lo que hizo.
Surge la pregunta: ¿por qué la IA de hoy es tan inteligente, pero aún así no puede prescindir de las personas?
Diogo dirigió la mirada hacia algo que conoce muy bien: RLHF.

Cuando entrenamos a la IA, introdujimos a las personas en el bucle.
Esto es un poco irónico.
Porque RLHF es precisamente una de las líneas tecnológicas en las que Diogo participó en su momento para impulsar.
La lógica básica de RLHF no es complicada: recopilar las preferencias humanas y hacer que el modelo se ajuste cada vez más a esas preferencias.
Entonces Diogo dio una explicación muy clara en su discurso: ¿por qué los modelos grandes de hoy siempre necesitan a una persona en el bucle?
Porque, al entrenarlo, literalmente introdujimos a personas dentro de ese bucle.
El modelo ha estado aprendiendo desde el principio: ¿qué tipo de respuestas prefieren las personas?
Esto también explica una característica de los modelos grandes que ya conocemos muy bien: incluso sin saberlo, a menudo puede hablar como si supiera.
Diogo compartió un ejemplo muy ingenioso en vivo.
Alguien le envió a ChatGPT una grabación de un pedo, diciéndole que era una música que había compuesto, y le pidió que la evaluara “con sinceridad y franqueza”.
ChatGPT respondió seriamente, diciendo que esta es una música ambiental con una atmósfera siniestra y extraña.
Diogo incluso resumió con una frase: “Overpromising is a feature.”
Overpromising is not a bug, it's a feature.
Para un producto de chat, esto no es necesariamente fatal. Los usuarios aún están frente a la pantalla y pueden corregir los errores.
Pero un sistema automatizado real es completamente diferente.
La máquina no se preocupa por lo agradable que sea tu respuesta; solo necesita saber dos cosas: ¿qué se debe hacer exactamente y cuánta certeza tienes?
Esto explica por qué Jev, lanzado más de un mes después, parecía tan anómalo.

Entonces, Jev simplemente no permitió que la IA "hablara".
Incluso los modelos generales grandes, aunque finalmente solo necesiten responder "A o B", a menudo deben pasar por el proceso de generación de tokens.
Jev eliminó directamente esta parte.
Actualmente se enfoca principalmente en tres cosas:
No
Choice, selecciona una de varias opciones;
Score, califique según los estándares.
Then return the judgment and probability directly.
No te escribiré un ensayo ni te acompañaré a chatear.
La latencia de extremo a extremo anunciada oficialmente es de solo 70 a 500 milisegundos, 20 a 200 veces más rápida que los modelos de vanguardia y 40 a 400 veces más económica.
Pero lo realmente clave no es la "velocidad", sino la probabilidad que sigue.
Para ello, TypeSafe propone un nuevo método de entrenamiento: RLCD, Reinforcement Learning for Calibrated Decisions, aprendizaje por refuerzo para decisiones calibradas.
El problema que busca resolver es muy real: si la IA te dice que hay un 80% de probabilidad de que ocurra algo, ¿puedes confiar realmente en ese 80%?
Idealmente, un conjunto de eventos que el modelo evalúa con una probabilidad del 80% debería ocurrir aproximadamente en el 80% de los casos.
This is very important in automated systems.
99% de confianza, se puede ejecutar directamente.
Con un 51% de confianza, puedes asignarlo a un modelo más potente y costoso, o incluso transferirlo a una persona.
Lo realmente problemático no es que la IA no sepa, sino que la IA no sabe que no sabe.
Entonces, lo que Jev realmente quiere cambiar es el objetivo de la salida de IA.
Las respuestas generadas anteriormente por ChatGPT estaban principalmente destinadas a ser leídas por personas. Las evaluaciones y probabilidades proporcionadas por Jev están preparadas para ser utilizadas directamente por software.

En la era de los agentes, quizás no se necesite un cerebro más grande
Esto también explica por qué Jev se volvió popular justo ahora.
Porque, una vez que el agente comience a funcionar realmente, generará una gran cantidad de pequeñas decisiones:
¿Qué herramienta se llama a continuación? ¿Qué botón se debe hacer clic en esta página web? ¿Aún tiene sentido esta información? ¿Se completó realmente la tarea? ¿Debe revisarse el resultado nuevamente?
Estas preguntas, vistas individualmente, no son difíciles, pero un agente puede necesitar evaluarlas decenas de miles o incluso millones de veces al día.
Si cada vez se llama al modelo más potente, se gasta unos segundos en "pensarlo bien" y se genera un gran número de tokens, los costos y la latencia aumentan rápidamente.
Lo que Jev quiere capturar es este nivel.
Deja que Jev se encargue de las grandes cantidades de decisiones pequeñas y frecuentes, y reserva las tareas que requieren razonamiento complejo para los modelos grandes.
Por eso TypeSafe llama a Jev el System One Model.
Este concepto proviene del "Sistema 1" y "Sistema 2" de Daniel Kahneman: uno responsable de juicios rápidos e intuitivos, y otro de pensamiento lento y complejo.
Jev incluso el nombre proviene del "paradójica de Jevons":
Cuando un recurso se vuelve cada vez más barato, las personas no necesariamente lo usan menos; al contrario, podrían usarlo más.
Si llamar a la IA es caro, solo la usarás en los lugares más importantes.
¿Pero qué pasa si una IA determina que es tan barato que casi se puede ignorar?
Un correo electrónico, un registro, una llamada a herramienta, un botón en una página web, cada paso ejecutado por un agente, puede incluir un juicio de IA.
Of course, it's still too early to say that Jev represents the next generation of AI.
Lo que denomina "cero ilusiones" significa más bien que no generará respuestas fuera de los tipos establecidos, pero no implica que no pueda elegir incorrectamente; datos extremos como 193.6 veces y 444.6 veces provienen principalmente de las pruebas propias de TypeSafe.
Pero lo que realmente merece la atención en el auge actual de Jev podría no ser si puede desafiar a GPT o Claude.
sino una persona que participó en el desarrollo de ChatGPT, que ahora vuelve a plantear una pregunta más fundamental:
En los últimos años, toda la industria ha reflexionado sobre cómo hacer que la IA piense más tiempo y hable más.
Pero si lo que realmente se necesitará en el futuro son miles de millones de juicios entre máquinas, ¿por qué cada vez la IA tiene que "decir un discurso"?
ChatGPT enseñó a las máquinas cómo hablar con las personas.
Y el siguiente paso en la apuesta de Jev es: cuando las personas ya no estén sentadas frente a la pantalla, ¿pueden las máquinas tomar decisiones por sí solas?
