Skills Agentes

Jev de TypeSafe: qué es el primer modelo System One

Qué es Jev, el modelo de TypeSafe AI que no genera texto y devuelve decisiones tipadas en 70-500 ms, cuánto cuesta, qué dicen los evals y dónde encaja en un agente.

Publicado
Tiempo de lectura
14 min de lectura
Temas
modelos · jev · typesafe · agentes

TL;DR

  • Jev es el primer modelo "System One" de TypeSafe AI, presentado el 15 de septiembre de 2026. No genera texto: recibe un estado y una lista de preguntas tipadas, y devuelve respuestas tipadas con probabilidades y un nivel de confianza.
  • Responde en 70-500 ms y cuesta 0,042 USD por millón de tokens de entrada. Los tokens de salida son gratis.
  • En los evals de TypeSafe, Jev iguala la precisión media de Sonnet 5 (67,8 %) en 0,4 segundos por caso, frente a 78,1 segundos. Opus 5 sigue siendo más preciso (73,1 %).
  • Lo firma Diogo Almeida, que trabajó en OpenAI en el método RLHF con el que se entrenó ChatGPT. El método de TypeSafe se llama RLCD (aprendizaje por refuerzo para decisiones calibradas).
  • El acceso directo de TypeSafe tiene lista de espera, pero ya se puede probar con ai-cli a través de Vercel AI Gateway.
  • No sustituye a un LLM. Es una pieza para las decisiones pequeñas y repetidas dentro de un agente: clasificar, enrutar, puntuar, filtrar.

Qué es Jev

Jev es un modelo de IA que toma decisiones estructuradas en lugar de escribir texto. TypeSafe lo define como "una llamada a función con inteligencia de frontera: estado no estructurado de entrada, decisiones probabilísticas tipadas de salida".

Un LLM como Claude o GPT recibe texto y devuelve texto. Si tu código necesita una decisión ("¿este ticket es de facturación o técnico?"), tiene que pedirla en el prompt, esperar la respuesta completa y después interpretarla. Jev elimina los dos últimos pasos: la respuesta ya es un valor que tu código puede usar, con la probabilidad de cada opción.

El anuncio llegó con un vídeo de su fundador, Diogo Almeida:

After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI?

I've spent the last 2 years in stealth building a new way to train models (RLCD), and a new type of frontier AI model that we are releasing today: Jev

— Diogo Almeida (@CompleteSkeptic), 15 de septiembre de 2026

Según The Register, TypeSafe sale con 40 millones de dólares de financiación. La tesis de Almeida en ese artículo es que la IA no puede tener a las personas como únicos consumidores: si va a cambiar cómo se trabaja, también tiene que servir a otro software.

Qué es un modelo System One

Un modelo System One es una clase de modelo entrenada para tomar decisiones rápidas y estructuradas que el software usa directamente. El nombre viene de la distinción que popularizó Daniel Kahneman en Pensar rápido, pensar despacio: el Sistema 1 es rápido e intuitivo; el Sistema 2 es lento y deliberado.

Los LLM con razonamiento se parecen al Sistema 2: piensan en voz alta antes de responder. Jev está diseñado para el Sistema 1: juicios rápidos y acotados, del tipo que una persona toma sin pararse a pensar.

La documentación marca los límites con claridad:

  • No escribe respuestas, no genera código y no explica su razonamiento.
  • Solo acepta texto: cadenas, objetos JSON y listas de textos. Imágenes, audio y vídeo no están soportados todavía.
  • Tú defines el espacio de respuestas posibles. El modelo elige dentro de él.

Cómo funciona: estado, preguntas y respuestas tipadas

Una llamada a Jev tiene dos partes: el estado (el contexto que el modelo tiene que evaluar) y las preguntas (lo que quieres saber sobre ese estado). Las preguntas pueden ser de tres tipos:

Tipo Qué pregunta Qué devuelve
Choice ¿Cuál de estas opciones? (hasta 255) La opción elegida, la probabilidad de cada opción y la confianza
Score ¿En qué nivel de esta escala? Una puntuación, la probabilidad de cada nivel y la confianza
Noul ¿Esta afirmación es verdadera? Una probabilidad entre 0 y 1

Los tres tipos se pueden mezclar en una misma llamada. Cada pregunta se evalúa en paralelo y de forma aislada contra el mismo estado, así que añadir preguntas apenas cambia el tiempo de respuesta.

Este es el ejemplo del quickstart oficial: un mensaje de soporte y tres preguntas.

{
  "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
  "model": "jev-latest",
  "questions": {
    "department": {
      "type": "choice",
      "instructions": "Which team should handle this",
      "criteria": {
        "billing": "Payment or subscription issues",
        "technical": "Bugs or integration problems",
        "sales": "Pricing or account questions"
      }
    },
    "frustration": {
      "type": "score",
      "instructions": "How frustrated the customer appears",
      "criteria": [
        "Calm, just stating facts",
        "Frustrated but civil",
        "Very angry, strong language"
      ]
    },
    "is_urgent": {
      "type": "noul",
      "instructions": "The message conveys urgency or time-sensitivity"
    }
  }
}

La respuesta para department es billing con una probabilidad de 0,84, frente a 0,159 para technical, y una confianza de 0,596. Las probabilidades dicen qué opción gana; la confianza resume en un número de 0 a 1 lo concentrada que está esa distribución. Esa es la parte útil: tu código puede actuar solo cuando la confianza supera un umbral y enviar el resto a una persona o a un modelo más grande.

RLCD: el método de entrenamiento

RLCD (Reinforcement Learning for Calibrated Decisions) entrena el modelo para que sus probabilidades reflejen la incertidumbre real, no para que sus respuestas gusten. Es la tercera vía que propone TypeSafe frente a las dos que dominan hoy:

  • RLHF (aprendizaje por refuerzo con feedback humano) enseña al modelo a decir lo que las personas prefieren. Es el método de InstructGPT y ChatGPT, y Almeida figura entre sus coinventores. Según el primer de TypeSafe, ese objetivo funciona para chatbots, pero también premia la complacencia y las alucinaciones dichas con seguridad.
  • RLVR (aprendizaje por refuerzo con recompensas verificables) entrena con problemas cuya respuesta se puede comprobar, como matemáticas o código.
  • RLCD optimiza decisiones acotadas y probabilidades calibradas frente a resultados.

"Calibrado" significa que, sobre muchas predicciones, un 80 % de probabilidad acierta aproximadamente el 80 % de las veces. La propia documentación aclara que la calibración se mide en grupo y no garantiza que una respuesta concreta sea correcta.

Precio y velocidad

Jev cuesta 0,042 USD por millón de tokens de entrada, y la salida no se cobra. TypeSafe sitúa a los LLM actuales entre 0,20 y 10 USD por millón de tokens de entrada, con la salida unas cinco veces más cara.

El tiempo de respuesta de extremo a extremo es de 70 a 500 milisegundos. El anuncio habla de "40-200 veces más rápido con el mismo nivel de inteligencia de frontera".

La comparación más útil está en evals.typesafe.ai, donde TypeSafe mide cuatro flujos de automatización: incidentes de seguridad, revisión de trazas de agentes, procesamiento de facturas y atención al cliente. Estas son las medias de cada modelo en modo workflow (la política dividida en decisiones pequeñas):

Modelo Precisión media Coste por caso Tiempo por caso
Opus 5 73,1 % 0,1761 USD 37,8 s
Terra 67,9 % 0,0304 USD 10,1 s
Sonnet 5 67,8 % 0,1174 USD 78,1 s
Jev 67,8 % 0,0004 USD 0,4 s
Haiku 4.5 53,6 % 0,0195 USD 12,5 s

Fuente: TypeSafe Workflow Evals, consultado el 18 de septiembre de 2026.

Dos matices antes de citar estos números:

  1. La "verdad" la ponen otros modelos. Las etiquetas de referencia son la media de las respuestas de GPT-6 Astra y Claude Fable 5.1, ambos con razonamiento alto. No hay un conjunto etiquetado por personas. Un 67,8 % significa "coincide con esos dos modelos en el 67,8 % de los casos".
  2. Los multiplicadores dependen de con quién compares. Las cifras del titular ("193,6x más rápido, 444,6x más barato") se calculan contra las configuraciones más lentas y caras. Frente a Terra, con la misma precisión, la diferencia es de unas 25 veces en tiempo y 76 en coste. Sigue siendo mucho.

Por tarea, Jev no es uniforme: en atención al cliente llega al 76,0 %, pero en facturas se queda en el 61,8 %, frente al 78,4 % de Opus 5.

Qué está construyendo la gente con Jev

La primera semana deja ejemplos que ilustran bien para qué sirve. Jarrod Watts lo conectó a un feed de precios para decidir compras y ventas en una blockchain con bloques de 300 ms, donde un LLM de varios segundos no llega a tiempo:

I built a trading bot with Jev!

Jev decides if it should "buy" or "sell", given the price feed of an asset pair, and executes real trades.

It uses Monad to place the orders on Kuru's on-chain order book in every 300ms block.

— Jarrod Watts (@jarrodwatts), 16 de septiembre de 2026

Ian Nuttall lo usó para clasificar su propio histórico de publicaciones, un caso de map-reduce sobre miles de textos:

I gave Jev 3,282 of my X posts across 100M views and asked it to find what actually works for growth.

4,252,330 tokens $0.1282 for the full 8m 34s run!

Each post got 8 questions about the topic, hook, tone, whether it teaches something, etc.

— Ian Nuttall (@iannuttall), 17 de septiembre de 2026

Rob Hallam llevó la misma idea un paso más allá: en lugar de analizar lo ya publicado, puntúa cada borrador antes de publicarlo. Combina Jev con SuperX y hace 61 preguntas a cada texto en torno a un segundo. Las cifras de precisión son suyas y no están verificadas de forma independiente:

Jev + SuperX = virality solved ✅

Every post gets 61 questions in ~1s for $0.0004 🤯

> fitted on 9,481 real posts from 207 creators
> picks the viral post 2 in 3 times
> never rewards reply bait

So: write, score, rewrite, stop when it peaks.

Free, no signup. try it below ↓

— Rob Hallam (@robj3d3), 17 de septiembre de 2026

El mismo patrón sirve fuera de las redes propias. Matthew Berman lo aplicó a anuncios de la competencia: cada anuncio es un estado y cada atributo (gancho, formato, oferta, llamada a la acción, fase de conciencia) es una pregunta. Según él, lo llevará a su herramienta StealAds y a un servidor MCP:

jev is INSANE.

in 40 seconds it broke down 724 live ads from 37 brands.

every hook. every format. offer. cta. awareness stage. landing page mismatch. used 9 cents of tokens.
(will be avail in @stealads + mcp)

— Matthew Berman (@TheMattBerman), 17 de septiembre de 2026

La prueba independiente más detallada hasta ahora es la de Mike Taylor en Every. Hizo 11 experimentos y 1.709 juicios por menos de un céntimo en total. Jev leyó 37 documentos y respondió 21 preguntas sobre cada uno en menos de 0,7 segundos. Frente a Fable 5.1, tardó una mediana de 0,35 segundos por pasaje contra 8,83. Detectó seis de siete defectos plantados a propósito; el séptimo sí lo encontró Fable 5.1. Su conclusión: es útil como sistema de alerta temprana, porque la alternativa realista es no revisar nada.

Si el vídeo del anuncio te parece denso, Matija Sosic publicó un resumen de 45 segundos:

Here's a 45-second TL;DR on Jev.

I find the core idea beautifully simple, but the video made it really hard to understand.

— Matija Sosic (@MatijaSosic), 16 de septiembre de 2026

Limitaciones que conviene conocer

  • No genera texto. Si la tarea es redactar, resumir o escribir código, Jev no sirve.
  • Las respuestas están acotadas. Una pregunta Choice admite hasta 255 opciones. Todo lo que el modelo puede decir lo defines tú.
  • "No puede alucinar" hay que leerlo con cuidado. TypeSafe garantiza que la salida siempre respeta el tipo pedido: nunca devuelve un campo inventado ni un JSON roto. Una respuesta bien tipada puede ser incorrecta. The Register y otros análisis ya lo han señalado.
  • La calibración no está publicada. El método se llama "decisiones calibradas", pero la documentación no incluye curvas de calibración ni métricas como el Brier score. Mientras no las haya, conviene medirla con tus propios datos antes de fijar umbrales.
  • El acceso directo tiene lista de espera. La consola de TypeSafe está en acceso anticipado. Mientras tanto, Jev está disponible a través de Vercel AI Gateway (ver cómo probarlo).

Dónde encaja Jev en un agente

Jev tiene más sentido como pieza del harness que como sustituto del modelo principal. En un agente, muchas decisiones no necesitan un LLM de frontera razonando durante segundos: basta un juicio rápido y fiable. Son las decisiones que hoy se resuelven con un prompt caro o con reglas frágiles.

Algunos patrones que la propia documentación describe:

  • Enrutado por intención. Clasificar cada petición y enviarla al manejador adecuado: lógica determinista, un LLM especializado o una persona.
  • Enrutado por confianza. La respuesta dice qué hacer; la confianza dice si hacerlo ya o escalar.
  • Puntuación compuesta. Dividir un juicio complejo en puntuaciones pequeñas y combinarlas en código, con pesos que controlas tú.
  • Verificación de salidas de LLM. Revisar lo que produce otro modelo antes de darlo por bueno.

El último punto conecta con lo que contamos en harness engineering: el harness es quien verifica si una tarea está hecha de verdad. Un verificador que responde en medio segundo por una fracción de céntimo cambia qué comprobaciones compensa hacer en cada paso del loop del agente.

Cómo probar Jev

El acceso directo a TypeSafe (consola, playground y API propia) funciona con lista de espera. La forma más rápida de probar Jev hoy es Vercel AI Gateway, que lo ofrece desde el día del lanzamiento al mismo precio: 0,042 USD por millón de tokens de entrada y salida gratis.

Desde la terminal, con ai-cli

ai-cli es la CLI de Vercel para el AI SDK. Su comando ai evaluate usa Jev como modelo por defecto. Necesitas Node.js 22 o superior y una clave de AI Gateway:

npm install -g ai-cli
export AI_GATEWAY_API_KEY=tu_clave

El texto que pasas por la entrada estándar es el estado. Cada flag añade una pregunta con nombre:

cat ticket.txt |
  ai evaluate \
    --boolean "refund=Refund requested?" \
    --choice "team=Which team?" \
    --choices "team=billing,support" \
    --score "tone=How positive?" \
    --levels "tone=angry,neutral,happy"

--boolean equivale a una pregunta Noul, --choice a una Choice y --score a una Score. La salida es siempre JSON, así que se encadena bien con otras herramientas. Por ejemplo, para que un script solo siga si la probabilidad de reembolso pasa de 0,9:

ai evaluate --boolean "refund=Refund requested?" < ticket.txt |
  jq -e '.answers.refund.probability >= 0.9'

Para preguntas con criterios más detallados, --questions triage.json acepta un archivo con las preguntas definidas en JSON. El README de ai-cli documenta el formato. Un detalle: la confianza nativa de Jev no aparece junto a las probabilidades, sino en los metadatos del proveedor (providerMetadata).

Con la API de TypeSafe

Cuando tengas acceso:

  1. En el playground, pega un texto como estado y añade una pregunta.
  2. Para la API, crea una clave en el panel y llama a POST https://api.typesafe.ai/v1/systemone con el modelo jev-latest.
  3. Hay SDK oficiales para Python y JavaScript. La documentación completa está indexada para agentes en docs.typesafe.ai/llms.txt, útil si lo vas a integrar con Claude Code o con otro agente.

Un buen primer caso, según Taylor: una decisión que tu producto ya toma muchas veces al día y que hoy no revisa nadie.

Preguntas frecuentes

¿Jev es open source?

No. El anuncio no menciona pesos abiertos. Jev se usa a través de la API y el playground de TypeSafe, o a través de Vercel AI Gateway. Lo que sí es público es un adaptador en Python en GitHub.

¿Jev sustituye a Claude o a GPT?

No. Jev no escribe texto ni código. Encaja junto a un LLM: el LLM razona y genera; Jev toma las decisiones rápidas y repetidas alrededor.

¿Qué diferencia hay entre probabilidad y confianza en Jev?

Las probabilidades reparten el peso entre las respuestas posibles. La confianza se calcula a partir de esa distribución: alta si el peso se concentra en una opción, baja si está repartido. Solo la llevan las preguntas Choice y Score. TypeSafe propone tres tramos: actuar solo con confianza alta, pedir confirmación con confianza media y no actuar con confianza baja.

Todos los artículos del blog