Respuesta corta
- Antes de elegir modelo, separa cada paso en dos tipos. Decidir: la salida es una opción de una lista cerrada. Generar: la salida es texto nuevo. Los pasos de decidir aceptan un modelo pequeño o un modelo de decisión; los de generar necesitan un LLM.
- Todo paso de decidir lleva un umbral de confianza. Sobre el umbral actúa una regla en código; bajo el umbral decide una persona.
- En tres pruebas propias del 21 y 22 de septiembre de 2026 hice 286 decisiones en 7 llamadas. Cada llamada tardó entre 0,78 y 1,61 segundos, y siete casos de SEO cayeron bajo 0,60 y pasaron a revisión.
- Preguntar de frente «¿qué calidad tiene esta pieza?» acertó 1 de 5 veces. Seis preguntas pequeñas combinadas con reglas acertaron 4 de 5.
¿Por qué no usar el modelo de IA más potente en todos los pasos?
Porque pagas razonamiento completo por juicios que duran un segundo. Clasificar un mensaje, marcar spam o elegir a quién derivar son decisiones entre opciones que tú defines. Un modelo pequeño las resuelve más rápido y más barato, y el grande queda para redactar y razonar.
Dato oficialLa guía de Anthropic para elegir modelo propone dos caminos. Uno parte por la eficiencia: empezar con Claude Haiku 4.5, probar el caso y subir de modelo solo si falta capacidad. La guía lo recomienda para tareas de alto volumen y poca complejidad y para aplicaciones sensibles a la latencia o al costo [4]. La misma documentación describe estrategias que combinan un modelo económico para el grueso del trabajo con un modelo de frontera para las decisiones difíciles, de modo que la mayoría de los tokens se cobren a la tarifa baja [5].
Probado por tercerosLa investigación académica llegó antes a la misma idea. FrugalGPT (2023) encadena modelos de menor a mayor costo y reporta igualar al mejor modelo individual con hasta un 98 % menos de costo en sus pruebas [6]. RouteLLM (2024) entrena un enrutador que decide qué consulta va al modelo fuerte y cuál al débil, y reporta costos más de dos veces menores en algunos casos sin perder calidad de respuesta [7]. Esos porcentajes valen para sus conjuntos de prueba y no se trasladan tal cual a tu flujo.
¿Qué diferencia hay entre decidir y generar?
Un paso decide cuando su salida pertenece a una lista cerrada: caliente, tibio o frío; reclamo o consulta; sí o no. Un paso genera cuando su salida es texto que antes no existía: una respuesta, un resumen, un borrador. La prueba práctica es preguntarte si podrías escribir de antemano todas las respuestas válidas.
Nuestra lecturaEn un sistema de captación la mayoría de los pasos deciden. La tabla reparte un flujo típico de entrada de contactos entre las tres manos posibles.
| Paso del flujo | Tipo | Quién lo resuelve |
|---|---|---|
| ¿Es spam o un contacto real? | Decidir | Modelo pequeño o de decisión |
| ¿Qué quiere: cotizar, agendar, reclamar? | Decidir | Modelo pequeño o de decisión |
| ¿Qué tan listo está para comprar? | Decidir con puntaje | Modelo de decisión con umbral |
| ¿Lo paso a una persona? | Decidir | Regla en código sobre la confianza |
| Redactar la respuesta | Generar | LLM |
| Enviar la respuesta a un cliente | Responder por el resultado | Persona |
La última fila no depende del modelo. Mientras un borrador salga con el nombre de tu negocio, alguien responde por él, y ese alguien revisa antes de enviar.
El recorrido de un mensaje entrante, paso por paso
Con los pasos separados, el flujo queda así. Cada color marca qué tipo de inteligencia trabaja en ese punto.
Recorrido de un mensaje entrante en seis pasos
- EntradaLlega un mensaje, un correo o un formulario.
- DecidirUn modelo pequeño elige entre opciones cerradas: intención, urgencia, spam.
- UmbralCon confianza sobre el umbral, una regla en código ejecuta la acción.
- Bajo el umbralEl caso pasa a una persona, sin excepción.
- GenerarSolo si hay que responder, un LLM redacta el borrador.
- AprobarUna persona revisa el borrador y lo envía.
- Decidir
- Generar
- Persona
El modelo caro trabaja en un solo paso de seis, y solo con los mensajes que merecen respuesta. En una bandeja con mucha publicidad y avisos automáticos, esa diferencia define cuánto contexto consumes y cuánto esperas.
¿Qué es un modelo de decisión y en qué se diferencia de un LLM?
Un modelo de decisión lee texto y devuelve una opción de tu lista con la probabilidad de cada opción. No redacta respuestas, no escribe código y no explica su razonamiento. Un LLM genera texto palabra por palabra; un modelo de decisión entrega solo el veredicto.
Dato oficialJev, de TypeSafe AI, es el primer modelo de lo que su fabricante llama modelos System One: modelos que toman decisiones estructuradas para que el software las use directo [3]. Responde a tres tipos de pregunta: Choice elige una opción de una lista, Score puntúa según una rúbrica y Noul estima si una afirmación es verdadera, con un valor entre 0 y 1 [3]. Al 26 de septiembre de 2026 la versión vigente es jev-1.13.0, acepta solo texto, admite 64.000 tokens por pedido, cobra 0,042 dólares por millón de tokens de entrada y no cobra la salida. Su fabricante declara el inglés como idioma de mejor precisión, con rendimiento variable en otros idiomas [1].
La documentación trae dos indicaciones que sirven con cualquier modelo. La primera: si una decisión es compleja, hay que descomponerla y preguntar cada factor por separado, para combinar después las respuestas con lógica en código [3]. La segunda: el umbral de confianza no es un número único. Cada acción lleva el suyo según su riesgo, y el fabricante recomienda empezar conservador y ajustar con datos propios [2].
Uso Jev como caso porque separa los dos trabajos de forma extrema: este modelo no puede generar. El mismo criterio vale si decides con un LLM pequeño y una salida restringida a tu lista de opciones.
Tres pruebas propias con un modelo que solo decide
Desde ROCALDEEntre el 21 y el 22 de septiembre de 2026 usé Jev en tres flujos internos de ROCALDE. Ninguno tocó datos de clientes.
- Intención de búsqueda. Clasifiqué consultas de Search Console y candidatos a título en cinco llamadas: 49 consultas y dos tandas de 12 títulos.
- Radar editorial. Evalué en una sola llamada 12 temas candidatos a publicación, con 9 preguntas por tema.
- Calidad visual. Evalué 5 piezas propias ya revisadas por mí, con 8 preguntas por pieza, para comparar la máquina contra mi criterio.
| Llamada | Latencia medida | Decisiones | Tokens entrada / salida |
|---|---|---|---|
| SEO: 6 tareas de prueba | 6 | 899 / 219 | |
| SEO: 30 consultas sintéticas | 30 | 4.893 / 1.314 | |
| SEO: 13 consultas reales | 26 | 4.399 / 1.129 | |
| SEO: 12 títulos, 2 tandas | 72 | 7.661 / 1.652 | |
| SEO: título final, 3 candidatos | 4 | 964 / 91 | |
| Radar editorial: 12 temas | 108 | 15.997 / 3.822 | |
| Calidad visual: 5 piezas | 40 | 7.188 / 1.151 |
jev-1.13.0; latencia medida en cliente [8].La API registró tokens de salida en todas las llamadas, 9.378 en total. Según la documentación del fabricante esos tokens no se cobran [1]; mis registros miden tokens y latencia y no incluyen la factura.
Lo que pasó bajo el umbral
En las pruebas de SEO fijé 0,60 como umbral: sobre esa confianza la decisión pasaba directo al calendario editorial, bajo ella la revisaba yo. Siete casos cayeron bajo 0,60. Cinco comparten patrón: consultas de marca más servicio, como rocalde seo local, donde el modelo reparte la probabilidad entre intención navegacional y transaccional. Otro fue un empate entre tres títulos candidatos, con probabilidades de 0,36, 0,33 y 0,31 y confianza de 0,05. Elegí ese título con criterio editorial.
El radar editorial dio un resultado parecido. De 12 temas, el modelo y las reglas propusieron no publicar 9, dejaron 3 para revisión humana y no aprobaron ninguno de forma directa. Yo escribí las reglas que convierten sus respuestas en una propuesta, y esas reglas mandan sobre el modelo.
Una pregunta grande contra seis pequeñas
En la prueba de calidad visual comparé dos formas de preguntar sobre las mismas 5 piezas, cada una con una evaluación mía documentada antes de la prueba.
- 1 de 5 Una pregunta directa «¿La calidad es premium, correcta o deficiente?» El modelo calificó de premium tres piezas que yo había calificado de correctas.
- 4 de 5 Seis preguntas y reglas ¿Tiene mecanismo? ¿Tiene dato? ¿Tiene diferencial? Las respuestas se combinan con reglas en código. El único desacuerdo: marcó deficiente una pieza que yo había calificado de correcta.
Nuestra lecturaEl resultado coincide con lo que recomienda el fabricante: preguntas atómicas combinadas en código [3]. «Calidad» es un juicio compuesto; «¿tiene un dato?» es un juicio que alguien resuelve en segundos. Cinco piezas no alcanzan para una conclusión general, y así lo trato.
¿Dónde falla un modelo que solo decide?
Falla en las decisiones ambiguas, en los juicios compuestos y fuera del texto. En mis pruebas los casos dudosos fueron los de marca más servicio y los empates. Una confianza alta indica que la probabilidad se concentró en una opción; la opción correcta puede ser otra.
- Ambigüedad real. Cuando dos opciones son válidas, como con las consultas de marca más servicio, el modelo se reparte. Ese reparto es útil: te avisa. El problema aparece si alguien sube el umbral a mano para que todo pase.
- Juicio compuesto. Una sola pregunta sobre «calidad» acertó 1 de 5. Descompón el juicio antes de delegarlo.
- Solo texto. Jev no lee imágenes, audio ni video [1]. Una foto o una nota de voz necesitan un paso previo que las convierta en texto.
- Idioma. El fabricante declara su mejor precisión en inglés [1]. Mis pruebas fueron en español y funcionaron, pero no medí la diferencia.
- Calibración. La confianza sale de la forma de la distribución de probabilidades [2]. Qué umbral sirve lo decides tú con casos reales de tu negocio.
¿Cuándo vale la pena separar decidir de generar?
Cuando una decisión cerrada se repite muchas veces y hoy la resuelve un modelo grande o una persona que lee todo. Con veinte mensajes a la semana, ordenar a mano sigue siendo más simple. La ganancia aparece con volumen y con la necesidad de responder rápido.
Nuestra lecturaMis tres pruebas sumaron 42.001 tokens de entrada. Al precio publicado de 0,042 dólares por millón [1], equivalen a unos 0,0018 dólares. Para un negocio pequeño ese ahorro no justifica por sí solo el cambio. El beneficio que notas en la operación es el orden: la bandeja llega ordenada, lo dudoso llega marcado y el modelo caro solo lee lo que merece respuesta. El costo pesa cuando el mismo flujo atiende a muchos clientes o a miles de mensajes.
Para empezar sin herramientas nuevas, haz el ejercicio con tu propio flujo:
- Escribe cada paso de tu flujo de entrada de contactos en una línea.
- Marca los pasos cuya respuesta puedes listar de antemano. Esos deciden.
- Para cada paso que decide, escribe qué pasa si la máquina duda y quién recibe el caso.
- Reúne veinte ejemplos reales por decisión y revisa a mano qué respondería el modelo antes de automatizar la acción.
Si quieres ver cómo se arma la pieza que responde con documentos propios, la guía de RAG con n8n y Qdrant muestra ese otro lado del flujo, el que genera.
Automatización con criterio
El modelo ordena la entrada; el sistema decide qué hacer con ella.
Clasificar mensajes es una pieza. Convertirlos en respuestas a tiempo, seguimiento y ventas pide un sistema completo, con umbrales probados y una persona en los puntos donde se responde ante el cliente. En ROCALDE diseñamos automatizaciones de captación con esa exigencia.
Preguntas frecuentes
¿Puedo usar un LLM pequeño en vez de un modelo de decisión?
Sí. El criterio es el mismo: el paso tiene que devolver una opción cerrada y tú tienes que definir qué pasa bajo el umbral. Anthropic recomienda empezar por su modelo más rápido y económico en tareas de alto volumen y subir solo si falta capacidad [4]. Un modelo de decisión como Jev añade probabilidades por opción y no cobra la salida, pero exige otra integración.
¿Qué umbral de confianza debo usar?
Depende de lo que cuesta equivocarse. TypeSafe recomienda umbrales distintos por acción, empezar conservador y ajustar con datos propios [2]. En mis pruebas usé 0,60 para ordenar temas editoriales, donde un error cuesta poco. Para derivar un reclamo o bloquear un pago usaría un umbral más alto y probado con casos reales.
¿Sirve para ordenar correos o mensajes de clientes?
En lo técnico, sí: estos modelos leen texto. Antes de probarlo decide dónde viajan esos datos, porque cada mensaje sale hacia el proveedor del modelo. Mis pruebas usaron consultas de búsqueda y material editorial propio, nunca mensajes de clientes.
¿Cuánto cuesta clasificar con un modelo de decisión?
TypeSafe publica 0,042 dólares por millón de tokens de entrada para Jev, sin costo por salida, al 26 de septiembre de 2026 [1]. Mis tres pruebas sumaron 42.001 tokens de entrada; a ese precio equivalen a unos 0,0018 dólares. Para un negocio pequeño el ahorro en dinero es mínimo; el valor está en ordenar la entrada y marcar la duda.
Fuentes
Consultadas el 26 de septiembre de 2026.
- TypeSafe AI. «Models», documentación oficial.
docs.typesafe.ai.
Versión
jev-1.13.0y alias, precio por token de entrada y salida sin costo, ventana de contexto, entrada solo texto e idiomas. - TypeSafe AI. «Confidence», documentación oficial. docs.typesafe.ai. Cómo se calcula la confianza y umbrales distintos según el riesgo de cada acción.
- TypeSafe AI. «System One», documentación oficial. docs.typesafe.ai. Definición de los modelos System One, preguntas Choice, Score y Noul, y descomposición de decisiones complejas.
- Anthropic. «Choosing the right model», documentación oficial. platform.claude.com. Enfoque que parte por la eficiencia y criterios para subir de modelo.
- Anthropic. «Optimizing for cost and intelligence», documentación oficial. platform.claude.com. Estrategias que combinan un modelo económico con uno de frontera.
- Chen, L., Zaharia, M. y Zou, J. (2023). «FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance». arXiv:2305.05176. Cascada de modelos y reducción de costo de hasta 98 % en sus pruebas.
- Ong, I. et al. (2024). «RouteLLM: Learning to Route LLMs with Preference Data». arXiv:2406.18665. Enrutadores entre modelo fuerte y débil, con costos más de dos veces menores en algunos casos.
- ROCALDE. Mediciones propias del 21 y 22 de septiembre de 2026.
Siete llamadas al modelo
jev-1.13.0en tres flujos internos, con tokens de entrada y salida registrados por la API y latencia medida en cliente. Sin datos de clientes.
Vigencia de estos datos. El precio, la versión y los límites de Jev corresponden al 26 de septiembre de 2026; el alias jev-latest puede cambiar de versión sin aviso. Mis latencias y tokens corresponden a esas llamadas y envejecen con el modelo. Si llegas aquí después de marzo de 2027, contrasta las fuentes 1, 4 y 5 antes de estimar costos.