Pensieri lenti e veloci: Jev e i modelli System One per decisioni al posto del testo
Jev di TypeSafe non genera testo: restituisce decisioni tipizzate con probabilità calibrate. Ecco cosa lo separa da un LLM e quando conviene usarlo.
Jev è il primo modello pubblico di TypeSafe AI, un lab con sede a San Francisco, uscito in early access il 15 settembre 2026. È il primo esemplare di una classe che l'azienda chiama System One Models: modelli che non generano testo, ma restituiscono decisioni tipizzate, accompagnate da probabilità calibrate. Per orientarsi conviene lasciar perdere il confronto sul "più bravo" e chiedersi dove va presa la decisione: in codice o in prosa. Se in codice, Jev è nel suo territorio.
Che cos'è un System One Model
Il nome System One viene da Daniel Kahneman e da Thinking, Fast and Slow (in italiano Pensieri lenti e veloci): il pensiero di Sistema 1 è veloce e intuitivo, il Sistema 2 è lento e deliberato. TypeSafe punta esplicitamente sul primo. Jev invece è il nome di William Stanley Jevons, l'economista del paradosso di Jevons: quando l'efficienza di una risorsa aumenta, la domanda non cala, cresce. La scommessa dichiarata è la stessa: ogni ordine di grandezza in meno sul costo dell'intelligenza apre ordini di grandezza in più di casi d'uso.
In termini pratici, un System One Model si comporta come una "function call con intelligenza di frontiera": entra uno stato non strutturato, escono decisioni probabilistiche tipizzate. Lo stato è il materiale da valutare: un messaggio di supporto, un passaggio di testo, lo stato corrente di un'applicazione. Può essere una stringa, un oggetto JSON o un array di testi, e ogni richiesta valuta uno stato contro una o più domande valutate in parallelo.
La differenza fondamentale rispetto a un LLM sta in cosa il modello ottimizza. Un LLM addestrato con RLHF ottimizza per la preferenza umana: risposte e chat che piacciono a un valutatore. Jev è addestrato con RLCD, Reinforcement Learning for Calibrated Decisions: il segnale è la calibrazione della probabilità rispetto all'esito reale. Non impara a scrivere bene, impara a dire quanto è sicuro di una scelta.
In cosa differisce da un LLM
| Dimensione | LLM | Jev / System One |
|---|---|---|
| Addestramento | RLHF o RLVR: preferenze umane o ricompense verificabili | RLCD: decisioni calibrate |
| Output | Stringhe generate token per token | Valori strutturati tipizzati, mai fuori schema |
| Sampling | Sequenziale, autoregressivo | Parallelo, tutte le domande in una query |
| Input | Testo, con enfasi sui messaggi sequenziali | Stato strutturato: stringa, oggetto JSON o array |
| Costo | $0,20-$10 per milione di token in input, output ~5x più caro | $0,042 per milione di token in input, output gratuito |
| Velocità | 3-329 secondi end-to-end | 70ms-500ms |
| Confidenza | Tende a sovrastimare | Sempre comunicata e calibrata |
| Errore tipico | Allucinazioni ed errori di tipo | Mai errori di tipo; può sbagliare il giudizio |
Tre righe della tabella spiegano la differenza architetturale.
Sampling parallelo. Un LLM genera un token alla volta, ognuno condizionato al precedente. Jev valuta tutte le domande di una richiesta in parallelo, in una singola query. È questo che spiega la velocità: sul blog ufficiale TypeSafe dichiara 70ms-500ms end-to-end, da 40x a 200x più veloce di modelli di frontiera su query a forma System One, contro i 3-329 secondi di un LLM.
Output tipizzato. Le risposte possibili sono definite in anticipo e il modello non può uscire dallo schema: niente errori di tipo, niente valori inventati. Il dato dello schema è garantito per costruzione, non misurato empiricamente. Questo è il senso del claim "zero allucinazioni" che compare in home page: Jev non genera stringhe, quindi non può allucinare testo. Può però sbagliare la decisione in sé: la calibrazione riguarda la probabilità media su molte previsioni, non la correttezza di ogni singola risposta.
Confidenza calibrata. Ogni risposta Choice e Score include una distribuzione di probabilità sulle opzioni e un valore confidence tra 0 e 1, derivato da quanto quella distribuzione è concentrata. Un Noul (sì/no) restituisce invece la probabilità che la risposta sia sì, senza confidence separata. Il punto pratico è che il modello comunica la propria incertezza invece di fingere sicurezza.
Jev, in concreto
Il modello corrente è jev-1.13.0, servito dall'endpoint POST /v1/systemone. Gli alias jev-latest e jev-preview puntano entrambi a questa versione: il primo è il default degli SDK, il secondo si sposta avanti quando esce una build di anteprima. Il consiglio della documentazione è di pinnare l'ID di versione se hai tarato soglie di confidence su una release specifica, perché un alias può cambiare risposta sotto di te.
I numeri essenziali, verificati sulla pagina modelli:
- Prezzo: $42 per miliardo di token in input ($0,042 per milione). L'output è gratuito, perché troppo economico da mettere. In home TypeSafe dichiara un prezzo di input 238x inferiore a Claude Fable 5.1.
- Contesto: 64k token per richiesta, di cui 32k per lo
statepiù la domanda più lunga. - Rate limit: 250.000 token al secondo e 1.200 richieste al minuto, dichiarati come dinamici e soggetti a cambiare senza preavviso mentre l'azienda aggiunge GPU.
- Input: solo testo. Niente immagini, audio o video.
Due cose su come Jev gestisce il tuo dominio. Primo, il modello non viene fine-tunato né adattato con i dati del cliente: gli stessi pesi servono tutti gli account, e la personalizzazione passa dalla richiesta (stato, istruzioni, criteri), non dai pesi. Secondo, non viene addestrato sulle richieste o le risposte dei clienti.
Il team è composto da Diogo Almeida (CEO), che ha co-inventato RLHF e InstructGPT e lavorato a OpenAI e Google Brain, Sasha Sheng (COO, ex Meta/FAIR) ed Erik Gafni (CTO, già fondatore di Ravel). La sede è un ufficio a San Francisco, vicino alla stazione Embarcadero. L'uscita dall'anonimato è accompagnata da un seed da 40 milioni di dollari guidato da DCVC, annunciato con il lancio il 15 settembre 2026.
Le primitive: come si fa una domanda a Jev
L'interfaccia è piccola: uno stato più una o più domande, ognuna con un ID, un tipo e delle istruzioni. I tipi sono tre.
- Choice: "quale di queste opzioni?" Restituisce la scelta, la distribuzione di probabilità su ogni opzione e la confidence. Serve per routing e classificazione: quale team gestisce il ticket, che tipo di documento è, che linguaggio di programmazione.
- Score: "su quale livello?" Restituisce una posizione lungo una scala ordinata che definisci tu, più la distribuzione sui livelli e la confidence. Serve per gravità di un bug, frustrazione di un cliente, livello di competenza.
- Noul: "è vero?" Restituisce la probabilità che l'affermazione sia vera, tra 0 e 1. Serve per sì/no puliti: il messaggio richiede un rimborso, contiene dati personali, il curriculum cita sistemi distribuiti.
La regola d'uso più importante è la scomposizione: chiedi un giudizio atomico per domanda, non "analizza questo messaggio e decidi il da farsi". Le domande sullo stesso stato girano in parallelo nella stessa richiesta, quindi aggiungerne costa quasi zero in latenza e pochissimo in token. La guida alla costruzione lo riassume così: il codice resta in controllo, e il modello appare solo dove serve buon senso programmabile su dati non strutturati.
Quando usarlo (e quando no)
Jev vince dove serve una decisione veloce, ripetibile e incastrata in un flusso di codice. I casi più netti, documentati dagli stessi esempi di TypeSafe:
- Routing e classificazione: smistare un ticket al reparto giusto, riconoscere un intento, classificare passaggi RAG prima di mandarli al modello che risponde.
- Scoring: dare un punteggio a una candidatura, a un passaggio recuperato, a una coppia di entità da allineare.
- Eval e verifica: controllare citazioni contro la fonte, verificare una traccia di tool call, giudicare l'output di un altro modello. È il caso "verify everything" che TypeSafe elenca tra i casi d'uso tipici della classe.
- Guardrail: filtrare ogni messaggio in ingresso e in uscita da un'app LLM, con soglie su probabilità di rischio e severità che decidono tra passare, rivedere, bloccare o instradare.
Quando non usarlo è altrettanto chiaro. Jev non genera testo: niente risposte, niente codice, niente spiegazioni del ragionamento, niente sintesi. Non fa ragionamento a catena aperto, non sceglie la propria azione successiva, non è un agente. Se il tuo task ha bisogno di produrre testo, di spiegare un perché, o di una catena di pensiero lunga, un LLM resta lo strumento giusto. Il confine pratico è: se l'output lo consumerà un essere umano che legge, LLM; se lo consumerà un if nel tuo codice, Jev.
Limiti
Prima di integrarlo, quattro cose da mettere in conto.
Niente generazione di testo. È il prezzo strutturale del design, non un difetto. Se hai bisogno sia di decidere sia di scrivere, Jev è un pezzo della pipeline, non la pipeline.
Dipendenza da API hosted. Non c'è un modello da scaricare o self-hostare: si chiama POST /v1/systemone su api.typesafe.ai. La latenza e i rate limit sono quelli di un servizio gestito, e i limiti sono dichiarati come variabili in questa fase.
Early access. Il rilascio è del 15 settembre 2026, con accesso progressivo da una waitlist. I rate limit e i prezzi sono esplicitamente in movimento mentre l'azienda aggiunge capacità.
Inglese come lingua primaria. L'inglese è la lingua principale di addestramento e dove l'accuratezza è migliore. Altre lingue, inclusi gli script CJK, sono accettate ma con accuratezza inferiore: la documentazione consiglia di testare sui propri contenuti prima di affidarsi a Jev per un carico non inglese, e di leggere la confidence quando si fa routing.
Vale anche una nota sulla calibrazione: le eval di workflow pubblicate da TypeSafe mostrano Jev con un'accuratezza tra circa il 61% e il 76% sui quattro workflow di esempio, a un costo per caso tra $0,0001 e $0,0011. È il motivo per cui la confidence conta: Jev non è infallibile, ma dice quando non è sicuro, ed è esattamente il segnale che serve per decidere in codice quando agire da solo e quando passare a un umano o a un modello di ragionamento più costoso.
Verifiche indipendenti
Due test di terze parti, pubblicati entrambi il 20 settembre 2026, hanno messo Jev alla prova contro modelli di frontiera. Non sono fonti primarie TypeSafe: li riporto come verifiche indipendenti, con i numeri e i limiti che dichiarano.
Il primo viene dal blog di LangChain, nel pezzo sull'uso di Jev come giudice per le eval di agenti su LangSmith. Gli autori definiscono il risultato promettente ma preliminare.
- Varianza: il quality score di Jev è risultato da 92 a 913 volte meno variabile di GPT-5.6 Luna, GPT-5.6 Terra e Claude Sonnet 4.6.
- Costo e tempo: in media 0,44 secondi e $0,00035 per chiamata, $0,34 totali contro $28,17 di Claude.
- Accordo con l'oracolo umano: su 500 decisioni binarie Jev concorda in 500 casi su 500, contro il 99,8% di Terra, il 96,4% di Luna e l'80,0% di Claude.
Il secondo viene dal blog di ayautomate, un'agenzia che ha pubblicato codice e risultati grezzi del test su 791 decisioni etichettate contro quattro LLM.
- Latenza: mediana di 0,33 secondi, da 2,0 a 3,6 volte più veloce dei quattro LLM.
- Costo: per decisione 4,7-7,5 volte sotto i due modelli piccoli più economici e 40-49 volte sotto GPT-5.6 Terra.
- Accuratezza: al livello dei modelli piccoli, ma circa 5 punti sotto Terra sul routing a 77 vie (McNemar p=0,029).
- Cascata: con un gate di confidence a 0,80, Jev pareggia Terra al 26-28% del costo.
Gli autori affermano quindi che i valori di punta di TypeSafe, 193,6x e 444,6x, non sono stati replicati rispetto alle loro baseline più conservative.
Fonti
Fonti primarie TypeSafe:
- Introducing System One Models & Jev (blog ufficiale TypeSafe)
- TypeSafe AI, home (claim 193.6x / 444.6x e pricing)
- Workflow evals (benchmark sui quattro workflow)
- Models (versione, prezzi, rate limit, contesto)
- System One (concetto e differenze dagli LLM)
- State (struttura dell'input)
- Primitives (Choice, Score, Noul)
- Confidence (confidence vs probabilità)
- How to build with TypeSafe (architetture e workflow)
- Our Team (fondatori e background)
- TypeSafe AI, comunicato stampa del seed $40M (finanziamento seed guidato da DCVC, via Yahoo Finance)
Verifiche terze indipendenti:
- LangChain, "Jev-as-a-Judge for Agent Evals" (test su LangSmith, 20 settembre 2026)
- ayautomate, "We Tested Jev on 791 Labeled Decisions Against Four LLMs" (benchmark con codice e risultati grezzi, 20 settembre 2026)