Jev Uitleg: Hoe je Snelle, Getypte Beslissingen aan een AI-Agent kunt Toevoegen

AIHubMix6 min leestijd
Jev Uitleg: Hoe je Snelle, Getypte Beslissingen aan een AI-Agent kunt Toevoegen

Jev wordt het best begrepen als een beslissingslaag voor software. Het leest tekst of gestructureerde status en retourneert vooraf gedefinieerde classificaties, scores en ja-of-nee waarschijnlijkheden. Het schrijft geen antwoord voor de gebruiker. Die beperktere interface maakt het relevant voor routing met hoge volumes, triage, verificatie en controle stappen binnen AI-agenten.

Het praktische patroon is eenvoudig: laat Jev frequente, omkeerbare oordelen vellen; laat bedrijfssoftware beleid afdwingen; escaleer onzekere of ingrijpende gevallen naar een capabele LLM of een mens.

Als Jev nieuw voor je is, is de kortste uitleg dit: Jev is een nieuw vrijgegeven AI-beslissingsmodel van TypeSafe AI dat zich meer gedraagt als een semantische if verklaring dan als een chatbot. Je biedt context en een vaste set vragen; het retourneert getypte keuzes, scores en waarschijnlijkheden die applicatiesoftware onmiddellijk kan gebruiken.

Wat is Jev?

TypeSafe AI noemt Jev zijn eerste System One Model, waarbij het de “snelle” kant van de System 1/System 2-onderscheiding leent. Een verzoek levert programmastatus en getypte vragen. Jev evalueert de vragen parallel en retourneert waarschijnlijkheden en vertrouwenswaarden die software direct kan consumeren.

De beschikbare vraagtypes zijn:

  1. Noul voor de waarschijnlijkheid dat een ja-of-nee verklaring waar is.
  2. Choice voor het selecteren uit vooraf gedefinieerde opties, met een waarschijnlijkheidsverdeling en vertrouwen.
  3. Score voor het beoordelen van geordende niveaus, met een score, onderliggende verdeling en vertrouwen.

In tegenstelling tot een autoregressieve LLM genereert Jev geen willekeurige strings. TypeSafe zegt dat dit schema-matching garandeert: de respons kan geen veld uitvinden of het verkeerde datatype retourneren. Het kan echter nog steeds het verkeerde geldige antwoord kiezen, dus typeveiligheid mag niet worden gepresenteerd als semantische onfeilbaarheid.

Waar past Jev in een agentarchitectuur?

Gebruik Jev tussen statuswijzigingen, wanneer het systeem een beperkte beoordeling nodig heeft:

Gebruiker of toolresultaat
    -> Jev: classificeren, scoren, routeren of risico controleren
        -> applicatiebeleid
            -> voer een laag-risico actie uit
            -> roep een LLM aan voor redenering of taal
            -> vraag om menselijke beoordeling

Dit is aanvullend op een LLM. De LLM behandelt open-eindige redenering, uitleg en gegenereerde inhoud. Jev behandelt herhaalde vragen waarvan de mogelijke antwoorden van tevoren bekend zijn.

Kies de juiste laag voor elke taak

Jev is het gemakkelijkst te begrijpen als een component in een grotere automatiseringsstack:

LaagHet beste te gebruiken voor
JevHerhaalde classificatie, scoring, routing en risicocontroles
LLMComplexe redenering, uitleg en tekstgeneratie
ApplicatiecodeDeterministische regels, machtigingen en uitvoering
Menselijke beoordelaarHoge risico-, ambiguïteit- of uitzonderlijke gevallen

Deze indeling is het productidee achter Jev: het model beslist niet alles en hoeft niet alles te zeggen. Het verandert vage semantische context in een getypte probabilistische signaal, terwijl het omringende systeem verantwoordelijk blijft voor beleid en actie.

Stap 1: kies de juiste eerste workflow

Begin met een bestaande, hoge-volume beslissing die al een LLM plus gestructureerde output gebruikt. Goede kandidaten zijn onder andere routing van supporttickets, kwaliteitscontroles van inhoud, agent-trace beoordeling, document triage en modelselectie.

Vermijd het starten met een beslissing die onomkeerbaar, juridisch gevoelig of waardevol genoeg is dat maximale nauwkeurigheid belangrijker is dan latentie en kosten. Vermijd ook taken die natuurlijke taaloutput of een controleerbare uitleg vereisen: Jev retourneert beslissingen en waarschijnlijkheden, niet een redeneringsverhaal.

Stap 2: definieer de status en vragen

Zorg ervoor dat de status het bewijs bevat dat nodig is voor de beslissing, maar houd beleid in applicatiecode. Decomprimeer een brede aanvraag in onafhankelijke vragen waar mogelijk.

Voor een supportworkflow zou één verzoek kunnen vragen:

  • Welke wachtrij moet het ticket ontvangen?
  • Hoe ernstig is het probleem?
  • Suggereert het bericht misbruik?
  • Is menselijke beoordeling vereist?

Voeg unknown of none_of_the_above toe wanneer je optieslijst mogelijk niet elk echt geval dekt. Zonder een ontsnappingspad moet een gesloten classifier een geldig maar potentieel misleidend label kiezen.

Stap 3: roep Jev aan via LangChain

Installeer de integratie en geef de API-sleutel op via je omgeving of geheimenbeheer:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

Maak vervolgens een getypte vraag:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "De implementatie is twee keer mislukt en klanten zien 500's. "
        "Kan iemand nu kijken?"
    ),
    questions={
        "urgent": Noul(
            instructions="Heeft dit nu aandacht nodig?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Het resultaat is een waarschijnlijkheid die je beleid kunt vergelijken met een drempel. Het is op zichzelf geen instructie om uit te voeren.

Stap 4: bouw een escalatiebeleid

Gebruik meerdere banden in plaats van één universele cutoff:

hoge vertrouwen + laag gevolg -> automatische actie
gemiddeld vertrouwen                -> LLM verificatie
laag vertrouwen                   -> menselijke beoordeling
hoog gevolg bij elke score    -> sterkere controle of goedkeuring

Stel drempels per actie in. Het automatisch toewijzen van een ticketlabel en het automatisch goedkeuren van een betaling zouden nooit hetzelfde risicobeleid moeten delen, alleen omdat beide waarschijnlijkheden gebruiken.

Stap 5: gebruik routing en guardrails zorgvuldig

LangChain’s experimentele ModelRouterMiddleware kan Jev gebruiken om eenvoudig werk naar een snel model te sturen en complex of hoog-risico werk naar een capabeler model. Dit kan het gebruik van het volledige model verminderen zonder elke aanvraag door de goedkoopste optie te dwingen.

De experimentele AutoModeMiddleware past Jev toe op risico-controles van tool-aanroepen en kan een voorgestelde aanroep blokkeren voordat deze wordt uitgevoerd. Houd deterministische controles rond gevoelige tools: allowlists, sandboxing, scoped credentials, rate limits en menselijke goedkeuring blijven noodzakelijk omdat een classifier valse negatieven kan produceren.

Stap 6: evalueer op je eigen gegevens

TypeSafe rapporteert 70–500 ms end-to-end latentie, $0.042 per miljoen invoertokens en onbeperkte output. In zijn vier workflow-evaluaties rapporteert het dat Jev gemiddeld 67.8% overeenstemming heeft met referentiewaarschijnlijkheden bij ongeveer $0.0004 en 0.4 seconden per monster. Dezelfde test rapporteert 67.9% voor GPT-5.6 Terra bij $0.0304 en 10.1 seconden, en 74.1% voor GPT-5.6 Sol bij $0.0836 en 23.3 seconden.

Dit zijn door de leverancier gepubliceerde resultaten, geen universele voorspelling. De referentie is de gemiddelde voorspelling van GPT-6 Astra en Fable 5.1 in plaats van door mensen gelabelde waarheid. TypeSafe merkt mogelijke bias van workflow-auteurs op en zegt dat de grootste headline snelheid en kostenbesparingen waarschijnlijk aan de hoge kant van echte wereldverbeteringen liggen.

Vergelijk voor productie Jev met je huidige LLM, eenvoudige regels en een domeinspecifiek model waar praktisch. Meet:

  • Nauwkeurigheid, precisie en recall per klasse.
  • Kalibratie en vertrouwensfoutpercentage.
  • Afzien en escalatiepercentage.
  • p50, p95 en p99 latentie vanuit je implementatieregio.
  • End-to-end kosten van de gehele cascade, inclusief back-ups.
  • Prestaties onder distributieverschuiving en vijandige invoer.

Stap 7: voeg operationele waarborgen toe

Productgereedheid vereist meer dan modelkwaliteit:

  • Log de statusversie, vraagschema, waarschijnlijkheid, vertrouwen, geselecteerde tak en latere uitkomst.
  • Versie prompts of vraaginstructies en beslissingsdrempels.
  • Voeg time-outs, begrensde herhalingen, circuitbreakers en een deterministische fallback toe.
  • Beoordeel fouten met hoge vertrouwen afzonderlijk; dit zijn de gevaarlijkste automatiseringsfouten.
  • Bewaken drift en herkalibreer drempels naarmate de invoerpopulatie verandert.
  • Houd onomkeerbare of gereguleerde acties achter sterkere technische en menselijke controles.

Publiek materiaal onthult momenteel niet het aantal parameters van Jev, gedetailleerde architectuur, RLCD beloningsontwerp, standaard kalibratiecurves, productie SLA of p95/p99 service latentie. Die hiaten zouden evaluatievragen moeten worden, geen aannames.

Wanneer moet je Jev niet gebruiken?

Gebruik Jev niet als het primaire model wanneer je conversatie, samenvatting, codegeneratie, gedetailleerde uitleg of redenering op lange termijn nodig hebt. Het is ook een slechte enige besluitvormer voor hoog-risico processen die een controleerbare rationale vereisen. In een vast domein kan een conventionele kleine classifier of gespecialiseerde reranker nauwkeuriger, goedkoper in bezit of gemakkelijker te valideren zijn.

FAQ

Is Jev een LLM?

Niet in de conventionele chat-model zin. Het consumeert tekstuele of gestructureerde status maar retourneert vooraf gedefinieerde besluittypes in plaats van gegenereerde proza.

Betekent “geen hallucinatie” dat Jev niet fout kan zijn?

Nee. De outputvorm kan worden gegarandeerd terwijl het geselecteerde antwoord semantisch onjuist is. Interpreteer de claim als bescherming tegen schema- en typefouten.

Vervangt Jev het model dat een agent aandrijft?

Meestal niet. Het is beter gepositioneerd als een aanvulling: Jev voor snelle gestructureerde beslissingen, een LLM voor redenering en taal, en code of mensen voor beleidsafstemming.

Wat is RLCD?

TypeSafe breidt het uit als Reinforcement Learning for Calibrated Decisions, bedoeld om gerapporteerde waarschijnlijkheid af te stemmen op waargenomen correctheid. De publieke bronnen bieden nog niet genoeg trainingsdetails of standaard kalibratiebewijs voor onafhankelijke technische audits.

Wat moet ik eerst prototypen?

Kies één hoge-volume, omkeerbare classificatie die al door een LLM loopt. Voer Jev uit in schaduwmodus, vergelijk beslissingen met gelabelde uitkomsten en introduceer automatisering pas nadat drempels en back-ups zijn gevalideerd.

Begin met één meetbare beslissing

Jev’s sterkste voorstel is niet “vervang elke LLM.” Het is “stop met het betalen van een generatief model om beslissingen te produceren die al een bekende vorm hebben.” Kies één tak in je agent-harnas, definieer de acceptabele fout en escalatiebeleid, en test het tegen je eigen verkeer.

Gebruik TypeSafe AI’s inleiding tot System One Models en Jev voor de oorspronkelijke modelclaims en -waarschuwingen, en LangChain’s gids voor het bouwen van een harnas met Jev voor de Python-integratie en middlewarepatronen.

Begin Jev te gebruiken met AIHubMix

AIHubMix heeft ondersteuning voor Jev toegevoegd, waardoor ontwikkelaars op één plek toegang hebben tot het nieuwe beslissingsmodel naast andere toonaangevende AI-modellen.

Bezoek AIHubMix om Jev uit te proberen en één bekende tak in je workflow om te zetten in een meetbaar experiment. Begin met een omkeerbare classificatie of scoringtaak, definieer je succesdrempel en houd een LLM of menselijke back-up in stand terwijl je de resultaten evalueert.