Respuesta corta
- Jev es el primer modelo de TypeSafe AI. Su fabricante lo llama modelo System One: toma decisiones estructuradas para que el software las use directo [3].
- Responde tres tipos de pregunta. Choice elige de una lista, Score puntúa con una rúbrica y Noul da la probabilidad de que una afirmación sea verdadera [3].
- Jev clasifica y valora. Tus reglas deciden qué hacer con esa respuesta y una persona recibe los casos dudosos. Antes de Jev conviene resolver en código todo lo que se puede comprobar.
- En mi radar editorial, un valor por defecto que escribí rellenó con 1,0 las 96 confianzas de las preguntas Noul. La regla que debía mandar los casos dudosos a revisión humana no podía activarse: Choice y Score traen confianza, y Noul trae solo su probabilidad [2].
Un mensaje entrante, de la clasificación a la acción
-
01 · Jev clasifica
«Hola, necesito cotizar un video para el 14 de octubre.»
- Choice · intencióncotizar 0,81
- Score · listo para comprar4 de 5
- Noul · menciona una fecha0,93
-
02 · Tus reglas deciden
- si intención = reclamo → persona
- si confianza < umbral → persona
- si fecha ≥ 0,90 → agendar
- si no → ejecutar
-
03 · Ejecutor o persona
- EjecutorCrea la cotización y propone la fecha.
- PersonaRecibe los reclamos y los casos dudosos, con la respuesta de Jev a la vista.
¿Qué es Jev y quién lo hace?
Jev es un modelo de IA de TypeSafe AI que lee texto y devuelve decisiones tipadas con su probabilidad. No redacta, no conversa y no escribe código. Su fabricante lo presenta como el primer modelo System One, pensado para que un programa use la decisión sin interpretar un texto libre.
Dato oficialTypeSafe AI llama System One a los modelos que toman decisiones estructuradas, frente a los modelos que generan texto token a token [3]. Jev es el primero de esa línea [5].
Nuestra lecturaQuien busca «Jev IA» suele esperar otro chatbot. Conviene ajustar esa expectativa desde el principio: Jev ocupa los pasos de una automatización donde la respuesta válida ya está escrita en una lista, y deja la redacción a un LLM.
¿Cómo funciona una llamada: estado, preguntas y probabilidades?
Envías un estado, que es texto o JSON, y un conjunto de preguntas con nombre. Jev responde todas las preguntas en la misma llamada y te devuelve, por cada una, su respuesta con la probabilidad asociada. No hay conversación ni texto intermedio que tengas que interpretar.
Dato oficialEl estado describe la situación: un mensaje entrante, una ficha de cliente, el resultado de una prueba. Cada pregunta declara su tipo y sus instrucciones, y la API las evalúa contra ese estado en una sola petición [3] [6]. La página de modelos de TypeSafe publica la versión vigente, la ventana de contexto y el precio [1].
Desde ROCALDEEn mis pruebas del 21 y 22 de septiembre de 2026 agrupé hasta 108 preguntas en una llamada. Las mediciones completas están en el artículo sobre qué modelo de IA usar en cada paso de una automatización.
¿Choice, Score o Noul: cuál usar para cada decisión?
Usa Choice cuando la respuesta es una opción de una lista, Score cuando necesitas un puntaje con rúbrica y Noul cuando la pregunta se responde con sí o no. Choice y Score traen un valor de confianza aparte. Noul trae solo la probabilidad de «sí», y esa cifra ya describe toda su respuesta.
| Tipo | Qué le preguntas | Qué devuelve | Confianza aparte | Ejemplo en captación |
|---|---|---|---|---|
| Choice | Elegir una opción de una lista cerrada | La opción, con probabilidad por opción | Sí, entre 0 y 1 | ¿Cotizar, agendar o reclamar? |
| Score | Puntuar según una rúbrica | Un puntaje con su distribución | Sí, entre 0 y 1 | ¿Qué tan listo está para comprar, de 1 a 5? |
| Noul | Estimar si una afirmación es verdadera | Un número entre 0 (no) y 1 (sí) | No | ¿El mensaje menciona una fecha concreta? |
Fuente: documentación de TypeSafe AI [2] [3].
Dato oficialLa documentación de TypeSafe explica que un Noul tiene solo dos resultados posibles, así que su único número describe la distribución completa y no lleva confianza separada [2]. En Choice y Score, la confianza sale de la forma de la distribución de probabilidades [2].
Nuestra lecturaLa diferencia pesa cuando escribes el código que consume la respuesta. En un Noul, la duda se lee en el propio valor: 0,52 es un caso dudoso y 0,97 es un «sí» claro. Si tu código espera un campo de confianza en todas las respuestas, en Noul no lo va a encontrar.
De clasificar a enrutar: dónde van las reglas y dónde la persona
Jev devuelve probabilidades. Tu código las convierte en acciones. Yo uso este orden:
Dónde vive cada decisión en una automatización con Jev
- EntradaLlega un mensaje, un formulario o un archivo.
- Evidencia deterministaEl código comprueba lo comprobable: formato, existencia, pruebas, reglas de negocio.
- Jev clasifica o valoraResponde el juicio que queda, con su probabilidad.
- Las reglas decidenContinuar, reintentar, escalar, detener o derivar. Aquí viven los umbrales.
- Ejecutor o personaEl sistema ejecuta lo aprobado; una persona recibe lo dudoso.
- Comprobar
- Clasificar
- Decidir
- Persona
- Evidencia determinista. Primero resuelvo en código todo lo que se puede comprobar: si el formulario trae un correo válido, si el número de pedido existe, si el archivo pasa la validación, si las pruebas pasan. A un modelo no le pregunto lo que una herramienta ya puede determinar.
- Jev clasifica o valora. Con lo comprobable resuelto, Jev responde el juicio que queda: qué intención tiene el mensaje, qué tan urgente es, si cumple un criterio que no cabe en una expresión regular.
- Las reglas deciden. Una función que yo escribo lee las probabilidades y elige la acción. Cada acción lleva su propio umbral según lo que cuesta equivocarse, como recomienda TypeSafe [2].
- Ejecutor o persona. El sistema ejecuta lo que las reglas aprueban. Una persona recibe lo dudoso o lo riesgoso, con la respuesta de Jev a la vista.
Nuestra lecturaVarias guías de integración de terceros proponen separar la verificación determinista del juicio probabilístico. Coincide con lo que recomienda TypeSafe: descomponer una decisión compleja en preguntas simples y combinarlas con lógica en código [3]. Con el enrutamiento en la etapa 04, puedes leerlo, probarlo y cambiarlo sin tocar el modelo.
Cómo desactivamos nuestra propia revisión humana con un valor por defecto
En mi radar editorial escribí un código que, ante una respuesta Noul sin confianza, asumía confianza 1,0. Noul nunca trae ese campo, así que las 96 confianzas Noul de la corrida quedaron en 1,0. La regla que debía mandar a revisión humana los casos con confianza bajo 0,60 no tenía cómo activarse.
Desde ROCALDEEl radar es un flujo interno que revisa las fuentes de ROCALDE y propone qué temas merecen publicarse. Por cada tema candidato le hace a Jev una Choice sobre el formato y ocho Noul sobre relevancia, evidencia, novedad, riesgo y otros criterios. Después, reglas que escribí convierten esas respuestas en una propuesta que yo apruebo o descarto. Ningún dato de clientes pasa por él.
En la corrida real del 22 de septiembre de 2026 evalué 12 temas:
| Dato de la corrida | Valor |
|---|---|
| Preguntas Noul evaluadas | 96 (12 temas × 8) |
| Confianzas Noul registradas en 1,0 | 96 de 96 |
| Preguntas Noul por tema cubiertas por la regla «confianza bajo 0,60 → revisión humana» | 6 de 8 |
| Veces que esa regla podía activarse con respuestas reales | 0 |
| Temas enviados a revisión humana | 3, por puntaje intermedio |
| Confianza de la Choice sobre el formato | entre 0,20 y 0,58 |
La cadena del error, en cuatro eslabones
- 01 · JevNoul responde 0,52Solo la probabilidad de «sí», como documenta TypeSafe.
- 02 · RespuestaSin campo de confianzaEl campo no existe en un Noul.
- 03 · Mi códigoPone confianza 1,0Un valor por defecto rellena el hueco con certeza.
- 04 · ReglaConfianza < 0,60 → personaCon 1,0 la condición es siempre falsa. El caso dudoso sigue de largo.Nunca se activa
- 96 de 96 confianzas Noul en 1,0
- 6 preguntas por tema bajo la regla
- 0 activaciones posibles
- Corrida del 22-09-2026
La cadena tiene cuatro eslabones. Jev responde un Noul con su probabilidad, sin campo de confianza, tal como lo documenta TypeSafe [2]. Mi código busca la confianza y, si no la encuentra, pone 1,0. La regla de revisión humana pregunta si la confianza es menor que 0,60, y con 1,0 la respuesta es siempre no. El registro de la corrida mostraba «confianza 1,0» en cada Noul, y al revisarlo yo leía certeza donde nadie la había medido.
La prueba automática del radar no lo detectó. Simulaba respuestas Noul con un campo de confianza inventado, en 0,4, y la rama de revisión humana pasaba en verde. Probé mi supuesto sobre la API en lugar de la forma real de su respuesta.
Nuestra lecturaJev respondió según su documentación. El fallo quedó en la etapa 04, la que yo escribo. Una buena clasificación no protege un sistema si el código que la consume rellena huecos con valores optimistas. Las tres escaladas a revisión humana de esa corrida salieron por otra regla, la de puntaje intermedio; sin ella, ningún tema habría llegado a mis manos.
El defecto sigue abierto en el código del radar a la fecha de esta actualización.
Si usas Jev u otro modelo que devuelva probabilidades, revisa esto en tu flujo:
- Lee la forma real de la respuesta de cada tipo de pregunta y no asumas campos que la documentación no promete.
- Cuando falte un dato que alimenta una compuerta de seguridad, manda el caso a revisión humana y deja constancia en el registro.
- Escribe al menos una prueba con una respuesta copiada de la API real.
¿Dónde se queda corto Jev?
Jev no genera texto, lee solo texto y su fabricante declara la mejor precisión en inglés. La calibración de los umbrales queda de tu lado y el alias jev-latest puede cambiar de versión. Para redactar, resumir o conversar necesitas un LLM.
- No genera. Si el paso siguiente es responder al cliente, redactar un resumen o escribir código, Jev no sirve para ese paso [3].
- Solo texto. Una foto, un PDF escaneado o una nota de voz necesitan un paso previo que los convierta en texto [1].
- Idioma. TypeSafe declara su mejor precisión en inglés, con rendimiento variable en otros idiomas [1]. Mis pruebas fueron en español y funcionaron; no medí la diferencia.
- Versión móvil. Si llamas al alias
jev-latest, el modelo puede cambiar de versión sin que tu código cambie [1]. En mi radar registro la versión que respondió en cada corrida. - Umbrales. TypeSafe recomienda empezar con umbrales conservadores y ajustarlos con datos propios [2]. El umbral que sirve para tu negocio lo defines tú con casos reales.
¿Cuándo conviene Jev y cuándo un LLM pequeño o una regla?
Si una regla en código puede resolver la pregunta, usa la regla. Si la pregunta pide juicio y la respuesta cabe en una lista, conviene Jev o un LLM pequeño con salida restringida. Si el paso debe producir texto nuevo, necesitas un LLM, y si la respuesta sale con el nombre de tu negocio, una persona la revisa.
| Si el paso… | Usa | Por qué |
|---|---|---|
| Se comprueba con datos: formato, existencia, pruebas | Una regla en código | Da siempre la misma respuesta y no consume tokens |
| Pide juicio y su respuesta cabe en una lista | Jev o un LLM pequeño con salida cerrada | Obtienes la decisión con su probabilidad |
| Produce texto nuevo | Un LLM | Jev no genera |
| Compromete a tu negocio ante un cliente | Una persona | Alguien responde por el resultado |
Nuestra lecturaJev conviene sobre un LLM pequeño cuando te sirve recibir la probabilidad de cada opción sin interpretar texto y cuando el volumen de decisiones justifica sumar un proveedor a tu flujo. Con veinte mensajes a la semana, la regla o la revisión a mano siguen siendo más simples. El artículo sobre qué modelo de IA usar en cada paso de una automatización desarrolla el criterio de separar decidir de generar.
Automatización con criterio
Jev clasifica. Tus reglas y tu equipo responden por lo que pasa después.
Un modelo de decisión resuelve una pieza. El resto del sistema protege tu operación: la verificación previa, las reglas con umbrales probados y una persona en cada punto donde respondes ante un cliente. En ROCALDE diseñamos automatizaciones de captación con esa estructura.
Preguntas frecuentes
¿Jev es un chatbot como ChatGPT o Claude?
No. Jev no conversa ni redacta. Recibe un texto y preguntas cerradas y devuelve decisiones con probabilidades [3]. Puedes combinarlo con un chatbot: Jev ordena la entrada y el LLM redacta la respuesta.
¿Cuánto cuesta usar Jev?
TypeSafe publica el precio vigente en su página de modelos [1]. Mis pruebas del 21 y 22 de septiembre de 2026 y su costo estimado están en el artículo sobre qué modelo de IA usar.
Fuentes
Consultadas el 28 de septiembre y verificadas nuevamente el 4 de octubre de 2026.
- TypeSafe AI. «Models», documentación oficial. docs.typesafe.ai. Versión y alias, precio, ventana de contexto, modalidad de entrada e idiomas.
- TypeSafe AI. «Confidence», documentación oficial. docs.typesafe.ai. Confianza en Choice y Score, Noul sin confianza separada y umbrales por acción.
- TypeSafe AI. «System One», documentación oficial. docs.typesafe.ai. Definición de los modelos System One, tipos de pregunta y descomposición de decisiones complejas.
- TypeSafe AI. «Noul», documentación oficial. docs.typesafe.ai. Significado del valor entre 0 y 1.
- TypeSafe AI. «Introducing System One Models & Jev», blog oficial. typesafe.ai. Presentación de Jev como primer modelo System One.
- TypeSafe AI. «API reference», documentación oficial. docs.typesafe.ai. Forma de la petición y de la respuesta.
- ROCALDE. Radar editorial, corrida real del 22 de septiembre de 2026. Doce temas con una Choice y ocho Noul por tema, registro de confianzas y reglas de decisión. Sin datos de clientes.
Vigencia de estos datos. Los tipos de pregunta, la semántica de la confianza y los límites de Jev corresponden a la documentación verificada el 4 de octubre de 2026. TypeSafe publicó Jev en septiembre de 2026 y su API puede cambiar. Si llegas aquí después de marzo de 2027, contrasta las fuentes 1 y 2 antes de escribir código contra ellas.