CoAI
Guida

Che cos'è Jev? Il modello System One di TypeSafe AI spiegato

Jev non restituisce testo ma decisioni tipizzate con probabilità. Vediamo come funziona il modello System One di TypeSafe AI, i suoi tre tipi di domanda, quanto costa, dove sbaglia e come abbinarlo a un LLM.

19 settembre 2026Lettura: 7 min

Il 15 settembre 2026 la startup statunitense TypeSafe AI ha aperto l'accesso anticipato a Jev, un modello che non genera alcun testo. Gli passi lo stato del programma e domande tipizzate, e lui restituisce decisioni tipizzate con le relative probabilità. L'azienda è guidata da Diogo Almeida, coautore del paper su InstructGPT su cui è stato costruito ChatGPT. Questa guida illustra Jev e la nuova categoria proposta dall'azienda, il modello System One, sulla base della documentazione ufficiale.

Che cos'è Jev

Jev è un modello dedicato soltanto alle decisioni, pubblicato come «il primo modello System One». La versione attuale è jev-1.13. La differenza rispetto a un modello linguistico di grandi dimensioni (LLM) sta nel formato dell'output.

  • Un LLM genera prosa destinata alla lettura. Anche quando servono dati strutturati, devi prima fargli scrivere del testo e poi analizzarlo nel codice
  • Jev non genera testo. Riceve lo stato del programma (state) e domande tipizzate (questions) e restituisce valori tipizzati, distribuzioni di probabilità e un valore di confidenza

TypeSafe descrive questa scelta come la correzione di un disallineamento: costringere un sistema di generazione testuale a produrre decisioni strutturate. Con Jev non c'è nulla da analizzare né da ritentare: il valore restituito entra direttamente nel tuo ramo condizionale, nell'ordinamento o nel router.

Che cosa significa System One

Il nome viene dal pensiero veloce e lento di Daniel Kahneman. Il ragionamento esteso e la scrittura appartengono al sistema 2, dove gli LLM eccellono; i giudizi immediati appartengono al sistema 1, ed è per questi che Jev è stato costruito. Un'immagine utile: tutto ciò che un esperto del settore deciderebbe in cinque secondi, eseguito in grandi volumi e con latenza minima.

I tre tipi di domanda (primitive)

Jev accetta tre tipi di domanda, mescolabili in un'unica chiamata API. Le domande vengono valutate in parallelo e in modo indipendente sullo stesso stato e, secondo la documentazione, aggiungerne altre cambia a stento il tempo di risposta.

  • Choice (scelta): seleziona un'opzione da un insieme definito. Restituisce l'opzione scelta, la distribuzione di probabilità su tutte le opzioni e la confidenza. Utile per smistare ticket o classificare tipi di documento. La documentazione consiglia di includere un'opzione «altro» quando l'elenco potrebbe non essere esaustivo
  • Score (punteggio): colloca lo stato su una scala ordinata di livelli (per esempio: calmo e neutrale, preoccupato ma civile, molto arrabbiato). Il punteggio può cadere tra due livelli. Utile per gravità, soddisfazione o livello di competenza
  • Noul (vero o falso): risponde a un'affermazione con una probabilità tra 0 e 1. Vicino a 1,0 è un sì netto, intorno a 0,5 il modello non riesce a decidere. Utile per «è una segnalazione di bug?» o «è una richiesta di rimborso?»

Ogni risposta porta con sé anche un valore di confidenza (confidence), che indica quanto è concentrata la distribuzione. È la leva per inviare a una persona o a un LLM solo i casi incerti.

Velocità e prezzo (dati dichiarati dall'azienda)

  • Tempo di risposta end-to-end di 70-500 ms, che l'azienda descrive come 40-200 volte più veloce dei modelli di frontiera a pari intelligenza per questa classe di compiti
  • 0,042 dollari per milione di token in ingresso (42 dollari per miliardo). I token in uscita sono gratuiti: si paga solo l'input
  • Limiti di 250.000 token al secondo e 1.200 richieste al minuto, che secondo l'azienda vengono regolati dinamicamente in base alla domanda
  • 64.000 token per richiesta, con un massimo di 32.000 per lo stato più la domanda più lunga
  • Solo input testuale (stringa, oggetto JSON o array di testi). Nessun input di immagini, audio o video

TechCrunch riferisce che Vercel ha misurato risultati da 5 a 18 volte più rapidi e più accurati in un compito di classificazione, e che Bryo AI ha trovato Jev da 10 a 20 volte più economico di Gemini per classificare le email. Sono dati del fornitore e dei suoi clienti: vanno letti come un motivo per misurare sui propri dati, non come un risultato garantito.

Come interpretare «non può allucinare»

Jev viene promosso come privo di errori di tipo e di allucinazioni. Ciò che è garantito è la forma dell'output: non riceverai mai un valore fuori dall'elenco delle opzioni né un JSON malformato, e per questo sparisce il codice di parsing e di ritentativo.

Non significa però che il giudizio sia sempre corretto. Quello che torna è una probabilità calibrata, e una risposta a 0,7 sbaglia circa il 30% delle volte per costruzione. La documentazione stessa consiglia di instradare in base alla confidenza. Tenere distinto «non inventa fatti» da «ha sempre ragione» è il punto più importante nella valutazione del modello.

I limiti dichiarati da TypeSafe

TypeSafe documenta i punti debole di jev-1.13. Per una decisione di adozione è la pagina più utile che pubblica.

  • Aritmetica e conteggi non affidabili: numero di caratteri, di occorrenze o di elementi di un elenco peggiorano al crescere dell'input. La documentazione afferma esplicitamente che Jev non è una calcolatrice
  • Date e orari fragili: quale data precede l'altra, se una cade in un intervallo, quanto distano tra loro
  • L'indirezione riduce l'accuratezza: domande con più passaggi di ragionamento, proprietà di proprietà, doppie negazioni
  • Il contesto irrilevante costa accuratezza: più materiale estraneo alla decisione contiene lo stato, peggiore è il risultato
  • Nessuna generazione di testo: concatenare scelte per comporre testo è lento e dà risultati scarsi
  • Le istruzioni sono lette letteralmente: risponde alla domanda che hai scritto, non a quella che intendevi, quindi i casi limite vanno messi nei criteri
  • Gli input ostili non sono gestiti: istruzioni inserite nello stato possono spostare l'output
  • Prima l'inglese: le altre lingue, comprese quelle asiatiche, sono «gestite, ma non allo stesso livello»

Se i tuoi contenuti non sono in inglese, scrivi istruzioni e criteri in inglese, lascia nella lingua originale solo il materiale da valutare e misura l'accuratezza prima di impegnarti.

Dove conviene usarlo

  • Instradamento per intento: classificare una richiesta in arrivo e inviarla alla coda o al gestore giusto
  • Priorità e gravità: assegnare un punteggio all'urgenza e ordinare il lavoro
  • Guardrail e monitoraggio: verificare in millisecondi che input e output di un agente rispettino una policy; alcuni team lo usano per intercettare tentativi di jailbreak
  • Instradamento tra modelli: modello economico per le richieste facili, modello di frontiera per quelle difficili
  • Riordinamento e supporto alla ricerca: riordinare candidati, valutare la pertinenza
  • Controllo di flusso degli agenti: tenere nel codice la decisione sul «cosa fare adesso»

Da abbinare a un LLM, non da sostituirgli

Poiché Jev non scrive, lo schema efficace lo mette prima o dopo un LLM, non al suo posto.

  • Fai passare da Jev le decisioni a grande volume e inoltra solo i casi a bassa confidenza a un LLM o a una persona (instradamento basato sulla confidenza)
  • Scomponi un giudizio complesso in domande piccole ricomposte nel codice invece di una sola domanda ampia
  • L'LLM scrive, Jev decide

Come iniziare

  • L'accesso è anticipato: crea una chiave API nella console, su console.typesafe.ai
  • Sono disponibili un SDK Python, un SDK JavaScript e TypeScript e un'API HTTP. L'alias predefinito del modello è jev-latest, che oggi punta a jev-1.13.0
  • L'autenticazione usa la variabile d'ambiente TYPESAFE_API_KEY. È pubblicata anche una agent skill per Claude Code e Codex
  • La documentazione è solo in inglese e prezzo, limiti e condizioni di accesso possono cambiare: verifica le pagine ufficiali prima di costruirci sopra

In sintesi

Jev non è «il prossimo LLM»: è un componente diverso che copre ciò in cui gli LLM erano scarsi. Rende dove una decisione non ha bisogno di prosa — classificazione, smistamento, punteggi, guardrail — con grandi volumi e bassa latenza, mentre richiede test attenti su calcoli, date, generazione e sfumature nei contenuti non in inglese. Un primo passo concreto: individua nel flusso attuale il punto in cui un LLM si limita a classificare, sostituiscilo con Jev e misura latenza, costo e accuratezza rispetto a quello che hai già.

Fonti: blog di TypeSafe AI, documentazione ufficiale, TechCrunch, 18 settembre 2026. Questo articolo riflette informazioni pubbliche verificate il 19 settembre 2026.

Strumenti citati in questo articolo

Torna alle guide