Le 15 septembre 2026, la start-up américaine TypeSafe AI a ouvert l'accès anticipé à Jev, un modèle qui ne génère aucun texte. Vous lui transmettez l'état de votre programme et des questions typées ; il renvoie des décisions typées avec leurs probabilités. L'entreprise est dirigée par Diogo Almeida, coauteur de l'article InstructGPT sur lequel ChatGPT a été construit. Ce guide présente Jev et la nouvelle catégorie proposée par la société, le modèle System One, en s'appuyant sur sa documentation officielle.
Ce qu'est Jev
Jev est un modèle dédié uniquement à la décision, publié comme « le premier modèle System One ». La version actuelle est jev-1.13. La différence avec un grand modèle de langage (LLM) tient au format de sortie.
- Un LLM produit de la prose destinée à être lue. Même lorsque vous voulez des données structurées, il faut d'abord lui faire écrire du texte, puis l'analyser dans votre code
- Jev ne génère pas de texte. Il reçoit l'état du programme (state) et des questions typées (questions), et renvoie des valeurs typées, des distributions de probabilité et un indice de confiance
TypeSafe décrit ce choix comme la correction d'une inadéquation : contraindre un système de génération de texte à produire des décisions structurées. Avec Jev, il n'y a rien à analyser ni à relancer : la valeur renvoyée alimente directement votre branchement, votre tri ou votre routage.
Ce que signifie System One
Le nom vient de la pensée rapide et lente de Daniel Kahneman. Le raisonnement long et la rédaction relèvent du système 2, là où les LLM excellent ; les jugements immédiats relèvent du système 1, et c'est pour cela que Jev est conçu. Une bonne image : tout ce qu'un expert du domaine trancherait en cinq secondes, exécuté en grand volume et avec une latence minimale.
Les trois types de question (primitives)
Jev accepte trois types de question, que vous pouvez mélanger dans un même appel d'API. Les questions sont évaluées en parallèle et isolément sur le même état et, selon la documentation, en ajouter modifie à peine le temps de réponse.
- Choice (choix): sélectionne une option dans un ensemble défini. Vous recevez l'option retenue, la distribution de probabilité sur l'ensemble des options et la confiance. Utile pour aiguiller des tickets ou classer des types de documents. La documentation conseille d'ajouter une option « autre » lorsque la liste risque de ne pas être exhaustive
- Score (note): situe l'état sur une échelle ordonnée de niveaux (par exemple : calme et neutre, contrarié mais courtois, très en colère). La note peut tomber entre deux niveaux. Utile pour la gravité, la satisfaction ou le niveau de maîtrise
- Noul (vrai ou faux): répond à une affirmation par une probabilité comprise entre 0 et 1. Près de 1,0, c'est un oui franc ; autour de 0,5, le modèle ne peut pas trancher. Utile pour « est-ce un rapport de bug ? » ou « est-ce une demande de remboursement ? »
Chaque réponse porte en plus une valeur de confiance (confidence) qui indique à quel point la distribution est resserrée. C'est le levier pour n'envoyer que les cas incertains à un humain ou à un LLM.
Vitesse et tarif (chiffres de l'éditeur)
- Temps de réponse de bout en bout de 70 à 500 ms, que l'entreprise présente comme 40 à 200 fois plus rapide que les modèles de pointe à intelligence équivalente pour ce type de tâche
- 0,042 dollar par million de tokens d'entrée (42 dollars le milliard). Les tokens de sortie sont gratuits : seule l'entrée est facturée
- Limites de 250 000 tokens par seconde et 1 200 requêtes par minute, ajustées dynamiquement selon la demande d'après l'éditeur
- 64 000 tokens par requête, avec un plafond de 32 000 pour l'état et la plus longue question réunis
- Entrée en texte uniquement (chaîne, objet JSON ou tableau de textes). Ni image, ni audio, ni vidéo
Selon TechCrunch, Vercel a mesuré des résultats 5 à 18 fois plus rapides et plus précis sur une tâche de classification, et Bryo AI a trouvé Jev 10 à 20 fois moins cher que Gemini pour classer des courriels. Ces chiffres viennent de l'éditeur et de ses clients : à considérer comme une raison de mesurer sur vos propres données, non comme un résultat acquis.
Comment lire « il ne peut pas halluciner »
Jev est présenté comme exempt d'erreurs de type et d'hallucinations. Ce qui est garanti, c'est la forme de la sortie : vous n'obtiendrez jamais une valeur hors de votre liste d'options ni un JSON mal formé, ce qui fait disparaître le code d'analyse et de relance.
Cela ne veut pas dire que le jugement est toujours juste. Ce qui revient est une probabilité calibrée, et une réponse à 0,7 se trompe environ trois fois sur dix, par construction. La documentation recommande elle-même de router selon la confiance. Distinguer « n'invente pas de faits » de « a toujours raison » est le point le plus important dans l'évaluation du modèle.
Les faiblesses publiées par TypeSafe
TypeSafe documente les points faibles de jev-1.13. Pour une décision d'adoption, c'est la page la plus utile qu'elle publie.
- Calcul et comptage peu fiables: nombre de caractères, d'occurrences ou d'éléments d'une liste se dégradent à mesure que l'entrée grossit. La documentation indique clairement que Jev n'est pas une calculatrice
- Dates et heures fragiles: laquelle de deux dates précède l'autre, si l'une tombe dans une fenêtre, quel écart les sépare
- L'indirection nuit à la précision: questions à plusieurs sauts de raisonnement, propriétés de propriétés, doubles négations
- Le contexte hors sujet coûte de la précision: plus l'état contient de matière sans lien avec la décision, plus le résultat se dégrade
- Pas de génération de texte: enchaîner des choix pour fabriquer du texte est lent et de mauvaise qualité
- Les instructions sont prises au mot: le modèle répond à la question écrite, pas à celle que vous aviez en tête ; les cas limites doivent figurer dans les critères
- Les entrées malveillantes ne sont pas traitées: des instructions glissées dans l'état peuvent infléchir la sortie
- L'anglais d'abord: les autres langues, y compris les langues asiatiques, sont « traitées, mais pas aussi bien »
Si vos contenus ne sont pas en anglais, rédigez les instructions et les critères en anglais, ne laissez dans la langue d'origine que le texte à juger, et mesurez la précision avant de vous engager.
Les usages adaptés
- Routage par intention: classer une demande entrante et l'envoyer à la bonne file ou au bon traitement
- Priorité et gravité: noter l'urgence pour ordonner le travail
- Garde-fous et supervision: vérifier en quelques millisecondes que les entrées et sorties d'un agent respectent une politique ; des équipes s'en servent pour détecter les tentatives de contournement
- Routage de modèles: modèle économique pour les demandes simples, modèle de pointe pour les difficiles
- Réordonnancement et appui à la recherche: trier des candidats, juger la pertinence
- Contrôle de flux des agents: garder dans votre code la décision du « quoi ensuite »
À associer à un LLM, non à substituer
Comme Jev n'écrit pas, le schéma efficace le place en amont ou en aval d'un LLM, et non à sa place.
- Faites passer par Jev les décisions à fort volume et n'escaladez que les cas peu sûrs vers un LLM ou un humain (routage par confiance)
- Décomposez un jugement complexe en petites questions recomposées dans le code plutôt qu'en une seule grande question
- Le LLM rédige, Jev décide
Comment démarrer
- L'accès est anticipé : créez une clé d'API dans la console, sur console.typesafe.ai
- Un SDK Python, un SDK JavaScript et TypeScript ainsi qu'une API HTTP sont disponibles. L'alias de modèle par défaut est jev-latest, qui pointe aujourd'hui sur jev-1.13.0
- L'authentification passe par la variable d'environnement TYPESAFE_API_KEY. Une compétence d'agent pour Claude Code et Codex est également publiée
- La documentation n'existe qu'en anglais, et le tarif, les limites et les conditions d'accès peuvent évoluer : vérifiez les pages officielles avant de bâtir dessus
En résumé
Jev n'est pas « le prochain LLM » : c'est un composant différent qui couvre ce que les LLM faisaient mal. Il est rentable partout où une décision n'a pas besoin de prose — classification, aiguillage, notation, garde-fous — à grand volume et faible latence, et il demande des tests soigneux pour le calcul, les dates, la génération et les nuances dans des contenus non anglophones. Premier pas concret : repérez l'endroit de votre chaîne actuelle où un LLM ne fait que classer, remplacez-le par Jev, puis mesurez latence, coût et précision par rapport à l'existant.
Sources : blog de TypeSafe AI, documentation officielle, TechCrunch, 18 septembre 2026. Cet article reflète des informations publiques vérifiées le 19 septembre 2026.