Il 15 settembre la startup TypeSafe AI ha presentato Jev, un modello di intelligenza artificiale che non sa scrivere una frase. Lo ha annunciato il fondatore, Diogo Almeida, ex ricercatore di OpenAI, l’azienda che sviluppa ChatGPT. Tre giorni dopo TechCrunch, il sito statunitense di notizie sulla tecnologia, ha raccontato che Jev stava entusiasmando gli sviluppatori, al punto che per un breve periodo TypeSafe non era riuscita a servire tutte le richieste.
Il motivo è una promessa semplice da dire: per un certo tipo di lavoro Jev sarebbe cento volte più veloce ed economico dei modelli che si usano oggi. La promessa ha già un primo riscontro esterno, e il risultato è più interessante del titolo.
Jev: un modello che risponde con una probabilità #
I modelli come ChatGPT, Claude o Gemini generano testo una parola alla volta (tecnicamente un token alla volta, cioè un frammento di parola). Anche quando un programma chiede loro solo un sì o un no, il modello scrive la risposta, e il programma deve leggerla e controllare che abbia senso.
Jev funziona in un altro modo. Riceve un testo, che TypeSafe chiama state (lo stato: una email, un messaggio, un elenco), e alcune domande con le risposte possibili già scritte. Restituisce la risposta scelta e la probabilità di ogni alternativa. La documentazione ufficiale prevede tre tipi di domanda. C’è la scelta fra opzioni (“quale reparto deve gestire questa richiesta?”), il punteggio su una scala (“quanto è arrabbiato questo cliente?”) e il sì o no con la sua probabilità (“il messaggio chiede un rimborso?”).
Nell’esempio della guida introduttiva, a un cliente che scrive di non riuscire a collegare il proprio account di pagamento da tre giorni Jev assegna il reparto tecnico con una probabilità dell’85%. Non spiega perché. Non può nemmeno inventare un reparto che non esiste, perché le risposte possibili le ha scritte chi fa la domanda: è in questo senso che TypeSafe dice che Jev «can’t hallucinate», non può avere allucinazioni.
Diogo Almeida, da InstructGPT a Jev #
Almeida è fra gli autori di InstructGPT, lo studio pubblicato da OpenAI nel marzo 2022 che ha insegnato ai modelli linguistici a seguire istruzioni con il reinforcement learning from human feedback (RLHF, cioè l’addestramento sulle preferenze di persone vere). Secondo Almeida quel lavoro è diventato la ricerca alla base di ChatGPT.
Nel post di presentazione di Jev Almeida parte da una domanda: i modelli sono bravissimi a conversare da anni, allora dov’è l’automazione? La sua risposta è che i modelli attuali sono stati addestrati per piacere a chi li legge, mentre un programma ha bisogno di decisioni affidabili e di sapere quanto fidarsi. TypeSafe ha lavorato due anni senza annunci pubblici e ha sviluppato un nuovo metodo di addestramento, che chiama reinforcement learning for calibrated decisions: le probabilità dichiarate devono corrispondere a quanto spesso il modello ha ragione.
Anche i nomi dicono l’idea. “System One” viene dal Sistema 1 di Daniel Kahneman, lo psicologo premio Nobel per l’economia: il pensiero veloce e intuitivo, contrapposto a quello lento e ragionato. Jev viene da William Stanley Jevons, l’economista dell’Ottocento che osservò come macchine a vapore più efficienti avessero fatto aumentare il consumo di carbone, invece di ridurlo.
Prezzo e velocità di Jev secondo TypeSafe #
Jev costa 0,042 dollari per milione di token in ingresso, e le risposte sono gratuite. Secondo TypeSafe gli altri modelli costano da 0,20 a 10 dollari per milione di token in ingresso, cioè da 5 a 238 volte di più, e fanno pagare le risposte circa cinque volte tanto. TypeSafe dichiara tempi di risposta fra 70 e 500 millisecondi, contro i secondi o i minuti dei modelli più potenti.
I numeri della home page di TypeSafe, 193,6 volte più veloce e 444,6 volte meno caro, vengono da test preparati dall’azienda. Il post di presentazione lo dice: i test li ha scritti il team di TypeSafe, e la risposta giusta è la media di GPT-6 Astra di OpenAI e Claude Fable 5.1 di Anthropic, l’azienda che sviluppa Claude. TypeSafe sostiene che questo riferimento, semmai, sottostimi Jev, ma avverte che nel lavoro vero i guadagni saranno di solito più bassi. Ammette anche di non poter dimostrare che il prezzo non sia sovvenzionato.
Jev contro cinque modelli: il confronto di Good Start Labs #
Il 15 settembre Good Start Labs, una società che usa i videogiochi per addestrare e valutare modelli di intelligenza artificiale, ha pubblicato un confronto fatto con l’accesso anticipato a Jev. Su 6.003 controlli di risposte a domande di ricerca finanziaria, Jev ha dato lo stesso verdetto di Claude Fable 5.1 nel 91,5% dei casi. Un milione di controlli costerebbe 160 dollari con Jev e 33.000 con Fable, circa 200 volte di più. Il 18 settembre Langfuse, una piattaforma per controllare la qualità delle applicazioni che usano l’intelligenza artificiale, ha ripreso i risultati.
Good Start Labs avverte che l’accordo non è accuratezza: dice quanto due giudici concordano, non chi ha ragione. Il costo di Jev è una stima fatta sul listino di TypeSafe, mentre quelli degli altri modelli vengono dalle bollette della prova. E i verdetti di Jev sono di luglio, raccolti prima dell’uscita pubblica del 15 settembre: non è detto che vengano dalla versione oggi in vendita.
Contro i modelli economici la distanza si accorcia. GPT-5.6 Luna di OpenAI costa 400 dollari e concorda con Fable meno di Jev, nell’88,4% dei casi. Gemini 3.8 Flash di Google concorda di più, nel 95,4%, ma costa 1.600 dollari, dieci volte Jev. DeepSeek V4.1 Flash, dell’azienda cinese DeepSeek, è un modello open source, cioè che chiunque può scaricare e riusare, anche a fini commerciali: costa 260 dollari e concorda con Fable nel 93,5% dei casi, due punti più di Jev.
La stessa Good Start Labs riconosce che fra Jev e i modelli di punta c’è ancora uno scarto reale: Jev concorda con gli altri modelli fra l’86% e il 92% delle volte, i modelli fra loro fra l’88% e il 95%. Il vantaggio di Jev è enorme contro i modelli più potenti, e si riduce contro i migliori modelli economici. Per TechCrunch, per ora Jev è l’unico modello di questo tipo. Non è l’unico modo di far costare poco una decisione.
I limiti di Jev, italiano compreso #
TypeSafe pubblica una pagina dei limiti di Jev, rivista il 17 settembre. Jev prende le istruzioni alla lettera, non conta in modo affidabile, legge le date come testo e non le confronta in modo affidabile. Peggiora quando il testo da valutare è lungo e pieno di dettagli inutili, e un testo scritto apposta per ingannarlo può spostarne la risposta.
Per chi lo integra in un programma, quella pagina diventa un metodo di lavoro. Ogni
domanda contiene un solo giudizio, scritto esattamente come va inteso; conti e date
restano nel codice, e a Jev resta il giudizio. Conviene anche indicare la versione
precisa del modello, jev-1.13.0, invece del nome generico jev-latest: quando
esce una versione nuova, avverte TypeSafe, le
risposte possono cambiare senza che il programma se ne accorga.
Per chi lavora in Italia il limite più concreto è la lingua. La documentazione dei modelli dice che l’inglese è la lingua principale dell’addestramento, e che le altre lingue funzionano ma non altrettanto bene: TypeSafe consiglia di provarlo sui propri testi prima di affidargli un lavoro. Al 21 settembre non risultano prove pubbliche di Jev su testi in italiano. L’accesso diretto da TypeSafe passa da una lista d’attesa, ma Jev è disponibile anche dal 16 settembre su Vercel, la piattaforma di hosting, e dal 18 su OpenRouter, un servizio che dà accesso a centinaia di modelli con un solo account.
Resta poi un limite che TypeSafe presenta come una scelta: Jev non spiega mai le sue risposte. Per smistare le email non serve. Per una decisione che un cliente può contestare, qualcuno dovrà comunque saper dire perché.
Il paradosso di Jevons: le domande che Jev apre #
Il nome scelto da TypeSafe è anche una previsione: l’azienda si aspetta che, se una decisione costa una frazione di centesimo, i programmi ne prenderanno molte di più. In una delle demo di TypeSafe, Jev gioca a Doom, il videogioco del 1993, facendo dieci domande al secondo per circa sette dollari l’ora.
Google descrive lo stesso effetto sull’energia: in un anno una richiesta a Gemini è diventata 33 volte meno costosa da servire, ma l’uso dell’AI è cresciuto ancora di più. È uno dei motivi per cui Google studia data center nello spazio.
TypeSafe propone di usare le probabilità per dividere il lavoro: i casi sicuri al programma, quelli incerti a una persona. Ma la documentazione stessa avverte che la calibrazione è misurata su gruppi di risposte e non garantisce la singola risposta. Se regge anche su testi in italiano, per ora, non l’ha misurato nessuno.
Domande frequenti #
Cos’è Jev? #
Jev è un modello di intelligenza artificiale di TypeSafe AI, presentato il 15 settembre 2026. Non genera testo: riceve un testo e alcune domande con le risposte possibili, e restituisce la risposta scelta con la probabilità di ciascuna alternativa. Serve a smistare, classificare e dare voti dentro un programma.
Chi ha creato Jev? #
TypeSafe AI, una startup fondata da Diogo Almeida. Almeida è stato ricercatore di OpenAI ed è fra gli autori di InstructGPT, lo studio del 2022 che secondo lui è alla base di ChatGPT.
Jev funziona in italiano? #
Accetta testi in italiano, ma TypeSafe dichiara che l’inglese è la lingua in cui funziona meglio e consiglia di provarlo sui propri testi. Al 21 settembre 2026 non risultano prove pubbliche in italiano.
Jev sostituisce ChatGPT? #
No. Jev non scrive risposte, riassunti o codice: sceglie fra opzioni decise da chi lo usa. Può sostituire i modelli come ChatGPT solo nei compiti in cui a un programma serve una decisione, non un testo.
Fonti #
TypeSafe AI: presentazione di Jev, 15 settembre 2026; documentazione su System One, guida introduttiva, modelli e prezzi e limiti di Jev 1.13, rivista il 17 settembre 2026.
Good Start Labs, Alex Duffy, Verification is the bottleneck, 15 settembre 2026. Langfuse, Using TypeSafe’s Jev for evals, 18 settembre 2026. TechCrunch, Tim Fernholz, A new kind of AI model from a ChatGPT inventor is thrilling developers, 18 settembre 2026.
Vercel, annuncio su AI Gateway, 16 settembre 2026. OpenRouter, scheda di Jev 1.13. Ouyang e altri, Training language models to follow instructions with human feedback, OpenAI, 4 marzo 2022.