Jev spiegato: come aggiungere decisioni rapide e tipizzate a un agente AI

AIHubMix6 min di lettura
Jev spiegato: come aggiungere decisioni rapide e tipizzate a un agente AI

Jev è meglio compreso come uno strato decisionale per il software. Legge testo o stato strutturato e restituisce classificazioni predefinite, punteggi e probabilità di sì o no. Non scrive una risposta per l'utente. Questa interfaccia più ristretta lo rende rilevante per il routing ad alto volume, il triage, la verifica e i passaggi di guardrail all'interno degli agenti AI.

Il modello pratico è semplice: lascia che Jev prenda decisioni frequenti e reversibili; lascia che il codice aziendale imponga la politica; escalare i casi incerti o consequenziali a un LLM o a un umano capace.

Se Jev è nuovo per te, la spiegazione più breve è questa: Jev è un modello decisionale AI appena rilasciato da TypeSafe AI che si comporta più come una dichiarazione semantica if che come un chatbot. Fornisci contesto e un insieme fisso di domande; restituisce scelte tipizzate, punteggi e probabilità che il codice dell'applicazione può utilizzare immediatamente.

Che cos'è Jev?

TypeSafe AI chiama Jev il suo primo Modello di Sistema Uno, prendendo in prestito il lato “veloce” della distinzione Sistema 1/Sistema 2. Una richiesta fornisce stato del programma e domande tipizzate. Jev valuta le domande in parallelo e restituisce probabilità e valori di confidenza che il software può consumare direttamente.

I tipi di domande disponibili sono:

  1. Noul per la probabilità che una dichiarazione di sì o no sia vera.
  2. Choice per selezionare tra opzioni predefinite, con una distribuzione di probabilità e confidenza.
  3. Score per valutare livelli ordinati, con un punteggio, distribuzione sottostante e confidenza.

Contrariamente a un LLM autoregressivo, Jev non genera stringhe arbitrarie. TypeSafe afferma che questo rende garantito il matching dello schema: la risposta non può inventare un campo o restituire il tipo di dato sbagliato. Può comunque scegliere la risposta valida sbagliata, quindi la sicurezza di tipo non deve essere presentata come infallibilità semantica.

Dove si inserisce Jev in un'architettura di agente?

Usa Jev tra i cambiamenti di stato, quando il sistema ha bisogno di un giudizio vincolato:

Risultato utente o strumento
    -> Jev: classificare, punteggiare, instradare o controllare il rischio
        -> politica dell'applicazione
            -> eseguire un'azione a basso rischio
            -> chiamare un LLM per ragionamento o linguaggio
            -> richiedere una revisione umana

Questo è complementare a un LLM. L'LLM gestisce ragionamenti aperti, spiegazioni e contenuti generati. Jev gestisce domande ripetute le cui possibili risposte sono già note.

Scegli il livello giusto per ogni lavoro

Jev è più facile da comprendere come un componente in un stack di automazione più grande:

LivelloMigliore utilizzo per
JevClassificazione ripetuta, punteggio, instradamento e controlli di rischio
LLMRagionamento complesso, spiegazioni e generazione di testo
Codice applicativoRegole deterministiche, permessi ed esecuzione
Revisore umanoCasi ad alto rischio, ambigui o eccezionali

Questa divisione è l'idea di prodotto dietro Jev: il modello non decide tutto e non ha bisogno di dire tutto. Trasforma il contesto semantico sfocato in un segnale probabilistico tipizzato, mentre il sistema circostante rimane responsabile della politica e dell'azione.

Passo 1: scegli il giusto primo flusso di lavoro

Inizia con una decisione esistente e ad alto volume che utilizza già un LLM più output strutturato. Buoni candidati includono instradamento di ticket di supporto, controlli di qualità dei contenuti, revisione della traccia dell'agente, triage di documenti e selezione del modello.

Evita di iniziare con una decisione che è irreversibile, legalmente sensibile o abbastanza preziosa da rendere la massima accuratezza più importante della latenza e del costo. Evita anche compiti che richiedono output in linguaggio naturale o una spiegazione auditabile: Jev restituisce decisioni e probabilità, non una narrativa di ragionamento.

Passo 2: definisci lo stato e le domande

Fai in modo che lo stato contenga le prove necessarie per la decisione, ma mantieni la politica nel codice dell'applicazione. Decomponi una richiesta ampia in domande indipendenti ogni volta che è possibile.

Per un flusso di lavoro di supporto, una richiesta potrebbe chiedere:

  • Quale coda dovrebbe ricevere il ticket?
  • Quanto è grave il problema?
  • Il messaggio suggerisce abusi?
  • È necessaria una revisione umana?

Aggiungi unknown o none_of_the_above quando la tua lista di opzioni potrebbe non coprire ogni caso reale. Senza un percorso di uscita, un classificatore chiuso deve scegliere un'etichetta valida ma potenzialmente fuorviante.

Passo 3: chiama Jev tramite LangChain

Installa l'integrazione e fornisci la chiave API tramite il tuo ambiente o gestore di segreti:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

Quindi crea una domanda tipizzata:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "Il deploy è fallito due volte e i clienti stanno vedendo 500s. "
        "Qualcuno può controllare ora?"
    ),
    questions={
        "urgent": Noul(
            instructions="Questo ha bisogno di attenzione immediata?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Il risultato è una probabilità che la tua politica può confrontare con una soglia. Non è un'istruzione da eseguire da sola.

Passo 4: costruisci una politica di escalation

Usa più bande invece di un'unica soglia universale:

alta confidenza + bassa conseguenza -> azione automatica
confidenza media                -> verifica LLM
bassa confidenza                   -> revisione umana
alta conseguenza a qualsiasi punteggio    -> controllo o approvazione più forte

Imposta soglie per azione. Assegnare automaticamente un'etichetta a un ticket e approvare automaticamente un pagamento non dovrebbe mai condividere la stessa politica di rischio solo perché entrambi utilizzano probabilità.

Passo 5: usa il routing e i guardrail con attenzione

Il ModelRouterMiddleware di LangChain può utilizzare Jev per inviare lavoro semplice a un modello veloce e lavoro complesso o ad alto rischio a un modello più capace. Questo può ridurre l'uso del modello completo senza costringere ogni richiesta attraverso l'opzione più economica.

Il suo AutoModeMiddleware esperimentale applica Jev ai controlli di rischio delle chiamate agli strumenti e può bloccare una chiamata proposta prima dell'esecuzione. Mantieni controlli deterministici attorno a strumenti sensibili: liste di autorizzazione, sandboxing, credenziali limitate, limiti di frequenza e approvazione umana rimangono necessari perché un classificatore può produrre falsi negativi.

Passo 6: valuta sui tuoi dati

TypeSafe riporta una latenza end-to-end di 70–500 ms, $0.042 per milione di token in input e output non misurato. Nelle sue quattro valutazioni di flusso di lavoro, riporta che Jev ha una media del 67.8% di accordo con le probabilità di riferimento a circa $0.0004 e 0.4 secondi per campione. Lo stesso sistema riporta il 67.9% per GPT-5.6 Terra a $0.0304 e 10.1 secondi, e il 74.1% per GPT-5.6 Sol a $0.0836 e 23.3 secondi.

Questi sono risultati pubblicati dal fornitore, non una previsione universale. Il riferimento è la previsione media di GPT-6 Astra e Fable 5.1 piuttosto che la verità etichettata da umani. TypeSafe nota un possibile bias degli autori del flusso di lavoro e afferma che i maggiori guadagni di velocità e costo sono probabilmente all'estremità alta dei miglioramenti nel mondo reale.

Prima della produzione, confronta Jev con il tuo attuale LLM, regole semplici e un modello specifico per il dominio dove pratico. Misura:

  • Accuratezza, precisione e richiamo per classe.
  • Calibrazione e tasso di errore sicuro.
  • Tasso di astensione ed escalation.
  • p50, p95 e p99 di latenza dalla tua regione di distribuzione.
  • Costo end-to-end dell'intera cascata, inclusi i fallback.
  • Prestazioni sotto cambiamento di distribuzione e input avversari.

Passo 7: aggiungi salvaguardie operative

La prontezza alla produzione richiede più della qualità del modello:

  • Registra la versione dello stato, schema delle domande, probabilità, confidenza, ramo selezionato e risultato successivo.
  • Versiona i prompt o le istruzioni delle domande e le soglie decisionali.
  • Aggiungi timeout, retry limitati, circuit breaker e un fallback deterministico.
  • Rivedi separatamente gli errori ad alta confidenza; sono i fallimenti di automazione più pericolosi.
  • Monitora il drift e ricontrolla le soglie man mano che la popolazione di input cambia.
  • Tieni azioni irreversibili o regolate dietro controlli tecnici e umani più forti.

Il materiale pubblico non rivela attualmente il numero di parametri di Jev, l'architettura dettagliata, il design del premio RLCD, le curve di calibrazione standard, SLA di produzione o latenza di servizio p95/p99. Questi gap dovrebbero diventare domande di valutazione, non assunzioni.

Quando non dovresti usare Jev?

Non usare Jev come modello principale quando hai bisogno di conversazione, sintesi, generazione di codice, spiegazioni dettagliate o ragionamento a lungo termine. È anche un cattivo decisore unico per processi ad alto rischio che richiedono una giustificazione auditabile. In un dominio fisso, un classificatore piccolo convenzionale o un reranker specializzato potrebbero essere più accurati, più economici da possedere o più facili da convalidare.

FAQ

Jev è un LLM?

Non nel senso convenzionale del modello di chat. Consuma stato testuale o strutturato ma restituisce tipi di decisione predefiniti piuttosto che prosa generata.

“Nessuna allucinazione” significa che Jev non può sbagliare?

No. La forma dell'output può essere garantita mentre la risposta selezionata è semanticamente errata. Interpreta l'affermazione come protezione contro errori di schema e tipo.

Jev sostituisce il modello che alimenta un agente?

Di solito no. È meglio posizionato come complemento: Jev per decisioni strutturate rapide, un LLM per ragionamento e linguaggio, e codice o umani per l'applicazione della politica.

Che cos'è RLCD?

TypeSafe lo espande come Reinforcement Learning for Calibrated Decisions, inteso ad allineare la probabilità riportata con la correttezza osservata. Le fonti pubbliche non forniscono ancora dettagli di addestramento sufficienti o prove di calibrazione standard per un audit tecnico indipendente.

Cosa dovrei prototipare per primo?

Scegli una classificazione reversibile ad alto volume già in esecuzione tramite un LLM. Esegui Jev in modalità shadow, confronta le decisioni con risultati etichettati e introduci l'automazione solo dopo che soglie e fallback sono stati convalidati.

Inizia con una decisione misurabile

La proposta più forte di Jev non è “sostituire ogni LLM”. È “smettere di pagare un modello generativo per produrre decisioni che hanno già una forma nota.” Scegli un ramo nel tuo sistema di agenti, definisci l'errore accettabile e la politica di escalation, e testalo contro il tuo traffico.

Utilizza l' introduzione ai Modelli di Sistema Uno e Jev di TypeSafe AI per le affermazioni e le avvertenze originali del modello, e la guida alla costruzione di un sistema con Jev di LangChain per l'integrazione Python e i modelli middleware.

Inizia a usare Jev con AIHubMix

AIHubMix ha aggiunto supporto per Jev, offrendo agli sviluppatori un luogo unico per accedere al nuovo modello decisionale insieme ad altri modelli AI leader.

Visita AIHubMix per provare Jev e trasformare un ramo noto nel tuo flusso di lavoro in un esperimento misurabile. Inizia con una classificazione o un compito di punteggio reversibile, definisci la tua soglia di successo e mantieni un fallback LLM o umano mentre valuti i risultati.