Jev
El desarrollo de la inteligencia artificial generativa ha estado dominado por la carrera por construir chatbots cada vez más elocuentes y modelos capaces de redactar ensayos, programar código o sostener conversaciones complejas. Sin embargo, TypeSafe AI, una startup con sede en San Francisco fundada por exinvestigadores de OpenAI, ha decidido tomar la dirección opuesta.
El 15 de septiembre de 2026, la compañía emergió del modo sigilo (stealth) con una ronda de inversión semilla de 40 millones de dólares liderada por la firma de capital de riesgo DCVC. Junto al anuncio presentó a Jev, el primer exponente de una nueva categoría tecnológica bautizada como modelos System One.
A diferencia de los modelos de lenguaje masivos (LLM) tradicionales como GPT-6, Claude o Gemini, Jev no sabe escribir, no mantiene chats, no redacta correos ni genera código libre. Su único propósito es recibir un estado no estructurado (un texto, correo o log) y devolver decisiones probabilísticas tipadas de forma paralela en cuestión de milisegundos y a un costo marginal.
El origen del proyecto y la filosofía 'System One'
La compañía está liderada por su CEO y cofundador, Diogo Almeida, exinvestigador de OpenAI y coinventor de la técnica de aprendizaje por refuerzo con retroalimentación humana (RLHF) que hizo posible ChatGPT. El equipo fundador se completa con el CTO Erik Gafni (proveniente de empresas de genómica como Invitae y Freenome) y la COO Sasha Sheng (exingeniera de investigación en Meta y FAIR).
Almeida explicó la motivación detrás de este desarrollo tras dos años de trabajo en secreto: "Pasé años trabajando en modelos diseñados para mejorar la interacción con las personas. Pero si la IA va a cambiar fundamentalmente cómo se realiza el trabajo, las personas no pueden ser los únicos consumidores de inteligencia".
@CompleteSkeptic Post oficial
El nombre System One toma como referencia la distinción planteada por el psicólogo y Premio Nobel Daniel Kahneman en su libro Thinking, Fast and Slow entre el Sistema 1 (pensamiento rápido, intuitivo e instantáneo) y el Sistema 2 (razonamiento lento, deliberativo y analítico). Mientras que los LLMs frontier actúan como un Sistema 2 evaluando cadenas de razonamiento paso a paso, Jev está diseñado para ejecutar los miles de microjuicios rápidos que ocurren dentro del flujo de trabajo de un software.
Por su parte, el nombre Jev rinde homenaje al economista del siglo XIX William Stanley Jevons, célebre por la Paradoja de Jevons: la observación de que, a medida que la eficiencia en el uso de un recurso aumenta, el consumo total de dicho recurso no disminuye, sino que se dispara. La tesis de TypeSafe AI es que al reducir en órdenes de magnitud el costo y la latencia de tomar una decisión semántica, la demanda de decisiones automatizadas en el software explotará.
Arquitectura técnica: ¿Por qué Jev es tan rápido y económico?
En un LLM tradicional, incluso cuando se le exige responder en formato JSON, la arquitectura realiza una pasada generativa secuencial token por token, escribiendo sintaxis como comillas, llaves y espacios. Si la aplicación requiere clasificar un mensaje, el modelo gasta tiempo y cómputo redactando una respuesta completa que luego el software debe analizar (parsear) y validar.
Jev cambia este paradigma mediante tres innovaciones clave:
- Muestreador paralelo (Parallel Sampler): Jev no genera cadenas de texto. El desarrollador define las respuestas o etiquetas permitidas de antemano y el modelo evalúa las probabilidades de todas las alternativas en una sola pasada en paralelo sobre el estado suministrado.
- Entrenamiento RLCD (Reinforcement Learning for Calibrated Decisions): En lugar de usar RLHF (que optimiza las respuestas según la preferencia conversacional humana), Jev utiliza RLCD, un método diseñado para producir probabilidades epistemológicamente honestas y calibradas. Esto significa que si el modelo asigna un 80% de confianza a una decisión, estadísticamente acertará cerca del 80% de las veces en ese nivel de certidumbre.
- Múltiples preguntas por consulta: Permite enviar un único bloque de contexto (state) de hasta 64.000 tokens y realizar decenas de preguntas independientes en la misma llamada a la API sin incrementar significativamente el tiempo de respuesta.
Las tres primitivas de decisión: Choice, Score y Noul
Toda la API de Jev se reduce a tres tipos de preguntas tipadas que no admiten respuestas en texto libre:
- Choice (Elección): Selecciona una etiqueta dentro de una lista cerrada definida por el desarrollador (soporta hasta 255 opciones por pregunta). Devuelve la opción elegida, la distribución de probabilidad de todas las alternativas y un valor de confianza. Es ideal para enrutamiento de tickets, asignación de equipos o etiquetado.
- Score (Puntuación): Ubica un elemento dentro de una escala ordenada descrita en lenguaje natural (por ejemplo, del 0 al 10 o niveles de urgencia). Devuelve la posición en la escala junto con su señal de confianza.
- Noul (o Booleano): Evalúa una afirmación y devuelve una probabilidad numérica directa entre 0.0 y 1.0 (distribución de Bernoulli). Es la primitiva usada para preguntas tipo "¿El cliente solicita un reembolso?" o "¿Este mensaje contiene contenido sensible?".
Precios y latencia: Cifras oficiales e independientes
En la estructura tarifaria publicada por TypeSafe AI, Jev tiene un precio de lista de $0.042 dólares por millón de tokens de entrada (o $42 por mil millones de tokens). Los tokens de salida son completamente gratuitos, debido a que el modelo no genera cadenas de texto. La empresa reporta tiempos de respuesta típicos de 70 a 500 milisegundos.
¿Se cumplen las promesas del fabricante?
En los anuncios iniciales, TypeSafe afirmó que Jev era hasta 193.6 veces más rápido que Claude Sonnet 5 y 444.6 veces más barato que Claude Opus 5. No obstante, la propia empresa aclaró que estos números corresponden al extremo más favorable de sus flujos de trabajo internos.
Para verificar el rendimiento real, la firma de automatización AY Automate (liderada por Adel Dahani) ejecutó el 19 de septiembre de 2026 un benchmark independiente sobre 791 decisiones etiquetadas comparando Jev 1.13 contra modelos como GPT-5.4 nano, Gemini 3.5 Flash-Lite, Claude Haiku 4.5 y GPT-5.6 Terra:
- Velocidad: Jev registró una latencia mediana de 0.33 segundos, siendo de 2 a 3.6 veces más rápido que los LLM más ágiles.
- Costo: Resultó ser de 4.7 a 7.5 veces más barato que los LLM pequeños más económicos y entre 40 y 49 veces más barato por decisión que GPT-5.6 Terra.
- Precisión: Jev se ubicó al mismo nivel de precisión que los modelos pequeños de lenguaje (83.8% en enrutamiento de intenciones de 8 vías y 87.0% en detección de inyección de prompts), quedando ligeramente por detrás de modelos frontier masivos como GPT-5.6 Terra (89.4%).
- La estrategia en cascada: El estudio descubrió que al utilizar Jev para responder las consultas donde su puntaje de confianza superaba el 0.80 y derivar solo el remanente incierto a GPT-5.6 Terra, se logró igualar la precisión exacta del modelo frontier reduciendo los costos totales en un 73-74% y la latencia a la mitad.
Otras evaluaciones independientes arrojaron resultados destacados: la firma Empryo probó Jev en la clasificación de logs de errores de desarrolladores (102 casos reales) y logró un 100% de precisión con una mediana de 273 milisegundos por comprobación (frente a 1.387 ms que tomó un modelo razonador de frontera). Asimismo, Mike Taylor en Every procesó 777 juicios sobre 37 documentos en menos de 0.7 segundos por consulta, y Malte Ubl reportó que Jev superó un benchmark de clasificación previo basado en Gemini 2.5 Flash-Lite ejecutándose 6 veces más rápido.
Casos de uso prácticos y demostraciones reales
Jev no está diseñado para el usuario final en un navegador, sino para integrarse dentro de la arquitectura de software de desarrolladores y empresas. Entre sus aplicaciones más probadas destacan:
- Triaje e hiperclasificación de soporte al cliente: En entornos con miles de tickets o correos entrantes, Jev puede evaluar en cuestión de segundos el departamento de asignación, el nivel de urgencia y el puntaje de frustración del usuario. En una prueba práctica en video, se logró clasificar completamente 300 tickets de soporte en solo 37 segundos por una fracción de centavo de dólar.
- Automatización en tiempo real y videojuegos: Para demostrar el potencial del bucle de decisión subsegundo, TypeSafe exhibió un bot impulsado por IA jugando a Doom en tiempo real, realizando 10 consultas de decisión estructurada por segundo a un costo de unos $7 dólares por hora. Del mismo modo, desarrolladores han creado demostraciones del juego de la culebrita (Snake) donde el modelo decide el movimiento (arriba/abajo/izquierda/derecha) en tiempo real con latencias de ~355 ms.
- Guardarraíles de seguridad y enrutamiento en agentes autónomos: Plataformas como LangChain implementaron la integración
TypeSafeClassifiery middlewares comoAutoModeMiddlewarepara interceptar comandos de terminal (como Bash) antes de su ejecución, evaluando en milisegundos si la acción propuesta representa un riesgo destructivo. - Navegación web (Browser Use) y finanzas: Herramientas como Browserbase y OpenCode emplean Jev para seleccionar qué elemento o botón hacer clic durante la navegación automatizada, mientras que otros desarrolladores lo utilizan para evaluaciones de riesgo en algoritmos de trading financiero.
@MoonGotc Post oficial
Mitos y limitaciones: La verdad sobre las "cero alucinaciones"
Uno de los puntos que más debate ha generado en la comunidad técnica es la afirmación de TypeSafe de que Jev garantiza "cero alucinaciones".
Expertos y análisis de la industria aclaran que esta afirmación es verdadera únicamente en el plano estructural o sintáctico:
- Sin alucinación de esquema: Jev jamás inventará una cuarta opción si el esquema permite tres, ni devolverá un JSON roto, un campo inexistente o un texto conversacional no solicitado.
- Los errores semánticos persisten: El modelo aún puede elegir la opción equivocada con un alto nivel de confianza si la información de entrada es ambigua o compleja.
Asimismo, la propia Guía de Irregularidades de Jev 1.13 documenta limitaciones concretas que el código debe manejar:
- Lógica matemática y conteo: Jev presenta deficiencias documentadas en operaciones aritméticas, conteo directo y precisión numérica.
- Lógica de fechas y tiempo: Medir distancias temporales o comparar marcas de tiempo en texto resulta poco confiable.
- Lectura extremadamente literal: Interpreta instrucciones y negaciones de forma estrictamente literal.
- Degradación por contexto irrelevante: Gran cantidad de información no relacionada en el estado puede degradar la calidad de la decisión.
- Sin conocimiento externo: No posee memoria ni acceso a internet; solo evalúa la información explícitamente provista en la llamada.
Disponibilidad y ecosistema
Acceder a Jev es posible hoy a través de múltiples vías para desarrolladores:
- Acceso directo en TypeSafe AI: Mediante la consola oficial (
console.typesafe.ai) con SDKs oficiales para Python (typesafe-sdk) y Node.js/TypeScript (@typesafe-ai/sdk). - Vercel AI Gateway: Integrado de forma nativa a través de la función
evaluatedel Vercel AI SDK v7 bajo el identificadortypesafe-ai/jev. Vercel reportó que Jev se convirtió en el modelo de más rápida adopción inicial en la historia de su gateway, siendo probado por el 13% de sus equipos de pago en las primeras 24 horas. - OpenRouter: Disponible en el endpoint especializado de decisiones bajo el ID
typesafe/jev-1.13. - Cloudflare Workers AI: Disponible en la infraestructura serverless como
typesafe/al-jev.
El impacto conceptual de Jev ha llevado a la comunidad open source a lanzar proyectos de reproducción en cuestión de días, como Qwen-2.5-1B-RLCD, OpenJev y NanoJev, buscando emular el entrenamiento enfocado en decisiones calibradas.
Conclusión
Jev no viene a reemplazar a GPT-6, Claude o Gemini en la redacción de contenidos ni en el razonamiento creativo complejo. Su verdadero valor radica en descongestionar los flujos de trabajo de software, evitando que las empresas paguen costos elevados y esperen segundos por decisiones binarias o de clasificación que pueden resolverse en milisegundos.
Al posicionarse entre el código determinista tradicional y los grandes modelos generativos, Jev demuestra que el futuro de la inteligencia artificial no solo pasa por hacer modelos más habladores, sino por crear motores de decisión invisibles, rápidos y eficientes para las máquinas.
