Esta semana he pasado más horas de las razonables leyendo documentación de un modelo de IA que no sabe escribir ni una frase (es lo que tiene que este tema te interese más de lo recomendable).
Se llama Jev, y creo que es de los lanzamientos más interesantes del año. No por lo que hace, sino por lo que se niega a hacer.
Si te interesa conocer mas detalles, un jev para dummies, sin hype ni mucho humo, continua leyendo ;)
Lo ha lanzado TypeSafe, una startup de San Francisco fundada por Diogo Almeida, que venía de OpenAI y estuvo en el trabajo que consiguió que ChatGPT siguiera instrucciones. Salió a la luz el 15 de septiembre con una ronda semilla de 40M$. En tres días Vercel, Cloudflare, LangChain y Langfuse ya lo tenían integrado, y Vercel dice que es el modelo que más rápido se ha adoptado en la historia de su plataforma.
Mucha gente lo está vendiendo como "el modelo que nunca alucina". Creo que no lleva del todo razón, y que lo interesante está en otro sitio. Voy a intentar explicarlo para que lo entienda cualquiera.
Un LLM (ChatGPT, Claude, Gemini) todos sabemos ya lo que es. Le preguntas algo y te escribe la respuesta palabra a palabra. Perfecto cuando quieres un informe, un email o código.
Pero casi todo lo que hace un agente de IA en la práctica no son informes. Son decisiones pequeñas. ¿Este email es urgente? ¿Este ticket va a facturación o a soporte técnico? ¿Qué herramienta uso ahora? ¿Esta respuesta está bien o hay que repetirla?
Hasta ahora, para cada una de esas preguntitas llamábamos al consultor. Que se lo piensa, redacta, y luego tu programa tiene que leer lo que ha escrito para sacar un "sí" o un "no". Es como pedirle a un catedrático que te redacte un informe para saber si el semáforo está en verde.
Jev hace otra cosa. Le das la situación (un email, un ticket, una línea de registro) y las preguntas con las respuestas posibles ya definidas. Y te devuelve directamente la decisión con una probabilidad. "Urgente: 0,97". Sin redacción ni explicaciones. De una vez, no palabra a palabra.
La mejor definición que he leído es la de un desarrollador: Jev es un "if" con criterio. Tu programa sabe decidir si un pedido supera los 100€. Lo que no sabe es decidir si el cliente que lo reclama está enfadado. Eso es lo que Jev le añade.
El nombre de la categoría ("System One") viene de Kahneman: el Sistema 1 es rápido e intuitivo, el Sistema 2 lento y deliberado. Los LLM son Sistema 2. Jev es la enfermera de triaje de urgencias que en un vistazo sabe a qué box va cada paciente, no el médico que después escribe el historial.
Responde de tres formas:
Elegir una opción de una lista que tú defines (qué equipo, qué herramienta)
Puntuar según una escala que tú escribes (riesgo del 1 al 5)
Sí o no, con la probabilidad de que sea sí
Y aquí viene lo que ha hecho que media industria le preste atención: el coste.
Cobra 0,042$ por millón de tokens de entrada, y la respuesta es gratis. Según su propio benchmark, cada decisión cuesta unos 0,0004,frente a entre 0,03 y 0,18$ con un LLM de primer nivel. Y tarda menos de medio segundo, frente a los 10 a 38 segundos de los grandes.
Haciendo la cuenta con sus números: una empresa que clasifica un millón de tickets al mes pagaría unos 400$ con Jev. Con un LLM de primer nivel, entre 30.000$ y 180.000$.
Eso no es solo ahorrar. Es que cosas que antes no se hacían porque no salían a cuenta, ahora salen.
Y ya se está viendo en lo que construye la gente estos días :
Un ticket de soporte que entra y en una sola llamada se decide su urgencia, a qué equipo va y si menciona un doble cobro.
LangChain lo usa de portero: decide si cada petición merece el modelo caro o basta con el barato. Langfuse lo ha montado como juez que evalúa si las respuestas de otro modelo son buenas.
Hay quien ha hecho un verificador de datos que pasa resultados de Google por Jev para ver si respaldan una afirmación. Y en su propia demo tienen filtrado de currículums y auditoría de chats de soporte.
Suena muy bien, la verdad. Pero tiene letra pequeña.
Y no, no es más listo que ChatGPT.
En ese mismo benchmark acierta un 67,8%, prácticamente empatado con GPT-5.6 Terra y varios puntos por debajo de Sol u Opus 5.
Su ventaja es velocidad y precio, no inteligencia. Y todas estas cifras las da el propio fabricante, así que habrá que ver qué pasa cuando otros lo prueben con sus datos.
Lo de "nunca alucina" es verdad a medias. No puede inventarse una respuesta que no esté en tu lista, pero sí puede elegir la equivocada con mucha seguridad. Es como un GPS que nunca se inventa una calle, pero a veces te manda por la que no es.
Por eso la probabilidad es lo importante. La idea es que tu programa actúe solo cuando Jev está muy seguro, mande los casos dudosos a un modelo más potente o a una persona, y ponga el listón más alto a todo lo que no tenga marcha atrás.
Tampoco escribe, ni calcula, ni programa. Si le pides un mensaje de felicitación para tu cuñado, lo más que vas a sacar es un 0,92 de que sí, es un cumpleaños ;)
Creo que lo importante no es Jev en sí, sino la idea que hay detrás: dejar de usar el mismo modelo caro para todo.
Igual que en una empresa no pones al director general a clasificar el correo, un agente bien montado va a tener un modelo grande que piensa y escribe cuando hace falta, y otro pequeño que decide miles de veces al día por céntimos.
Estoy convencido que en unos meses tendremos varias alternativas haciendo lo mismo, y que Jev será más la referencia que el único. Pero la categoría viene para quedarse.
También estoy convencido de que los agentes que funcionen de verdad en empresas se van a parecer mucho más a esto que a un chatbot haciéndolo todo.
Y es lo primero que me ha dado ganas de probar en Blinkfire, donde tenemos un montón de decisiones pequeñas de este tipo que nunca nos planteamos automatizar porque no salían a cuenta.