Jev erklärt: So fügen Sie schnellen, typisierten Entscheidungen zu einem KI-Agenten hinzu

AIHubMix6 Min. Lesezeit
Jev erklärt: So fügen Sie schnellen, typisierten Entscheidungen zu einem KI-Agenten hinzu

Jev wird am besten als Entscheidungsschicht für Software verstanden. Es liest Text oder strukturierte Zustände und gibt vordefinierte Klassifikationen, Punktzahlen und Ja-oder-Nein-Wahrscheinlichkeiten zurück. Es schreibt keine Antwort für den Benutzer. Diese engere Schnittstelle macht es relevant für das Routing mit hohem Volumen, Triage, Verifizierung und Sicherheitsmaßnahmen innerhalb von KI-Agenten.

Das praktische Muster ist einfach: Lassen Sie Jev häufige, umkehrbare Urteile fällen; lassen Sie den Geschäftscode Richtlinien durchsetzen; eskalieren Sie unsichere oder folgenschwere Fälle an ein fähiges LLM oder einen Menschen.

Wenn Jev neu für Sie ist, ist die kürzeste Erklärung dies: Jev ist ein neu veröffentlichtes KI-Entscheidungsmodell von TypeSafe AI, das sich mehr wie eine semantische if Anweisung als wie ein Chatbot verhält. Sie geben Kontext und eine feste Menge an Fragen an; es gibt typisierte Entscheidungen, Punktzahlen und Wahrscheinlichkeiten zurück, die der Anwendungscode sofort verwenden kann.

Was ist Jev?

TypeSafe AI bezeichnet Jev als sein erstes System One Modell und leiht sich die „schnelle“ Seite der Unterscheidung zwischen System 1 und System 2. Eine Anfrage liefert den Programmzustand und typisierte Fragen. Jev bewertet die Fragen parallel und gibt Wahrscheinlichkeiten und Vertrauenswerte zurück, die die Software direkt konsumieren kann.

Die verfügbaren Fragetypen sind:

  1. Noul für die Wahrscheinlichkeit, dass eine Ja-oder-Nein-Aussage wahr ist.
  2. Choice für die Auswahl aus vordefinierten Optionen, mit einer Wahrscheinlichkeitsverteilung und Vertrauen.
  3. Score für die Bewertung geordneter Ebenen, mit einer Punktzahl, zugrunde liegender Verteilung und Vertrauen.

Im Gegensatz zu einem autoregressiven LLM generiert Jev keine willkürlichen Zeichenfolgen. TypeSafe sagt, dass dies die Schemaübereinstimmung garantiert: Die Antwort kann kein Feld erfinden oder den falschen Datentyp zurückgeben. Es kann jedoch immer noch die falsche gültige Antwort wählen, sodass die Typensicherheit nicht als semantische Unfehlbarkeit dargestellt werden darf.

Wo passt Jev in eine Agentenarchitektur?

Verwenden Sie Jev zwischen Zustandsänderungen, wenn das System ein eingeschränktes Urteil benötigt:

Benutzer- oder Toolergebnis
    -> Jev: klassifizieren, bewerten, routen oder Risiko prüfen
        -> Anwendungsrichtlinie
            -> eine risikoarme Aktion ausführen
            -> ein LLM für Argumentation oder Sprache anrufen
            -> menschliche Überprüfung anfordern

Dies ergänzt ein LLM. Das LLM übernimmt offenes Denken, Erklärungen und generierte Inhalte. Jev behandelt wiederholte Fragen, deren mögliche Antworten im Voraus bekannt sind.

Wählen Sie die richtige Schicht für jede Aufgabe

Jev lässt sich am einfachsten als eine Komponente in einem größeren Automatisierungsstapel verstehen:

SchichtAm besten geeignet für
JevWiederholte Klassifizierung, Bewertung, Routing und Risikoüberprüfungen
LLMKomplexe Argumentation, Erklärungen und Textgenerierung
AnwendungscodeDeterministische Regeln, Berechtigungen und Ausführung
Menschlicher PrüferHochriskante, mehrdeutige oder außergewöhnliche Fälle

Diese Aufteilung ist die Produktidee hinter Jev: Das Modell entscheidet nicht alles und muss nicht alles sagen. Es verwandelt unscharfen semantischen Kontext in ein typisiertes probabilistisches Signal, während das umgebende System für Richtlinien und Maßnahmen verantwortlich bleibt.

Schritt 1: Wählen Sie den richtigen ersten Workflow

Beginnen Sie mit einer bestehenden, hochvolumigen Entscheidung, die bereits ein LLM plus strukturierte Ausgaben verwendet. Gute Kandidaten sind das Routing von Support-Tickets, Qualitätsprüfungen von Inhalten, die Überprüfung von Agentenverläufen, Dokumententriage und Modellauswahl.

Vermeiden Sie es, mit einer Entscheidung zu beginnen, die irreversibel, rechtlich sensibel oder wertvoll genug ist, dass maximale Genauigkeit wichtiger ist als Latenz und Kosten. Vermeiden Sie auch Aufgaben, die eine natürliche Sprache oder eine prüfbare Erklärung erfordern: Jev gibt Entscheidungen und Wahrscheinlichkeiten zurück, nicht eine Argumentationsnarrative.

Schritt 2: Definieren Sie den Zustand und die Fragen

Stellen Sie sicher, dass der Zustand die für die Entscheidung erforderlichen Beweise enthält, halten Sie jedoch die Richtlinien im Anwendungscode. Zerlegen Sie eine breite Anfrage in unabhängige Fragen, wann immer es möglich ist.

Für einen Support-Workflow könnte eine Anfrage fragen:

  • Welcher Warteschlange sollte das Ticket zugewiesen werden?
  • Wie schwerwiegend ist das Problem?
  • Deutet die Nachricht auf Missbrauch hin?
  • Ist eine menschliche Überprüfung erforderlich?

Fügen Sie unknown oder none_of_the_above hinzu, wenn Ihre Optionenliste möglicherweise nicht alle realen Fälle abdeckt. Ohne einen Ausweg muss ein geschlossener Klassifizierer ein gültiges, aber potenziell irreführendes Label wählen.

Schritt 3: Rufen Sie Jev über LangChain auf

Installieren Sie die Integration und geben Sie den API-Schlüssel über Ihre Umgebung oder Ihren Geheimnismanager an:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

Erstellen Sie dann eine typisierte Frage:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "Das Deployment ist zweimal fehlgeschlagen und Kunden sehen 500er-Fehler. "
        "Kann sich jemand jetzt darum kümmern?"
    ),
    questions={
        "urgent": Noul(
            instructions="Braucht das jetzt Aufmerksamkeit?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Das Ergebnis ist eine Wahrscheinlichkeit, die Ihre Richtlinie mit einem Schwellenwert vergleichen kann. Es ist keine Anweisung, die von sich aus ausgeführt werden soll.

Schritt 4: Erstellen Sie eine Eskalationsrichtlinie

Verwenden Sie mehrere Bänder anstelle eines einzigen universellen Cutoffs:

hohe Zuversicht + geringe Konsequenz -> automatische Aktion
mittlere Zuversicht                -> LLM-Verifizierung
geringe Zuversicht                   -> menschliche Überprüfung
hohe Konsequenz bei jeder Punktzahl    -> stärkere Kontrolle oder Genehmigung

Setzen Sie Schwellenwerte pro Aktion. Das automatische Zuweisen eines Ticketlabels und das automatische Genehmigen einer Zahlung sollten niemals dieselbe Risikopolitik teilen, nur weil beide Wahrscheinlichkeiten verwenden.

Schritt 5: Verwenden Sie Routing und Sicherheitsmaßnahmen sorgfältig

LangChains experimentelles ModelRouterMiddleware kann Jev verwenden, um einfache Arbeiten an ein schnelles Modell und komplexe oder risikobehaftete Arbeiten an ein fähigeres Modell zu senden. Dies kann die Nutzung des Vollmodells reduzieren, ohne jede Anfrage durch die günstigste Option zu zwingen.

Sein experimentelles AutoModeMiddleware wendet Jev auf Risikoüberprüfungen bei Toolaufrufen an und kann einen vorgeschlagenen Aufruf vor der Ausführung blockieren. Halten Sie deterministische Kontrollen um sensible Tools: Erlauben, Sandboxen, eingeschränkte Berechtigungen, Ratenlimits und menschliche Genehmigungen bleiben notwendig, da ein Klassifizierer falsche Negative erzeugen kann.

Schritt 6: Bewerten Sie mit Ihren eigenen Daten

TypeSafe berichtet von einer End-to-End-Latenz von 70–500 ms, $0.042 pro Million Eingabetokens und unbegrenztem Output. In seinen vier Workflow-Bewertungen berichtet es, dass Jev im Durchschnitt 67,8 % Übereinstimmung mit Referenzwahrscheinlichkeiten bei etwa $0.0004 und 0,4 Sekunden pro Probe erzielt. Dasselbe Testverfahren berichtet 67,9 % für GPT-5.6 Terra bei $0.0304 und 10,1 Sekunden sowie 74,1 % für GPT-5.6 Sol bei $0.0836 und 23,3 Sekunden.

Dies sind vom Anbieter veröffentlichte Ergebnisse, keine universelle Vorhersage. Der Referenzwert ist die durchschnittliche Vorhersage von GPT-6 Astra und Fable 5.1 und nicht die menschlich gekennzeichnete Wahrheit. TypeSafe weist auf mögliche Vorurteile der Workflow-Autoren hin und sagt, dass die größten Geschwindigkeits- und Kostengewinne wahrscheinlich am oberen Ende der realen Verbesserungen liegen.

Vor der Produktion vergleichen Sie Jev mit Ihrem aktuellen LLM, einfachen Regeln und einem domänenspezifischen Modell, wo es praktisch ist. Messen Sie:

  • Genauigkeit, Präzision und Rückruf nach Klasse.
  • Kalibrierung und Vertrauensfehlerquote.
  • Abstinenz- und Eskalationsrate.
  • p50, p95 und p99 Latenz aus Ihrer Bereitstellungsregion.
  • End-to-End-Kosten des gesamten Kaskadensystems, einschließlich Fallbacks.
  • Leistung unter Verteilungsschift und adversarialen Eingaben.

Schritt 7: Fügen Sie operationale Sicherheitsvorkehrungen hinzu

Die Produktionsbereitschaft erfordert mehr als Modellqualität:

  • Protokollieren Sie die Zustandsversion, das Frage-Schema, die Wahrscheinlichkeit, das Vertrauen, den ausgewählten Zweig und das spätere Ergebnis.
  • Versionieren Sie Eingabeaufforderungen oder Frageanweisungen und Entscheidungsschwellen.
  • Fügen Sie Zeitüberschreitungen, begrenzte Wiederholungen, Sicherungsmechanismen und einen deterministischen Fallback hinzu.
  • Überprüfen Sie hochgradige Fehler separat; sie sind die gefährlichsten Automatisierungsfehler.
  • Überwachen Sie Abweichungen und kalibrieren Sie Schwellenwerte neu, wenn sich die Eingabepopulation ändert.
  • Halten Sie irreversible oder regulierte Aktionen hinter stärkeren technischen und menschlichen Kontrollen.

Öffentliches Material gibt derzeit nicht die Anzahl der Parameter von Jev, die detaillierte Architektur, das RLCD-Belohnungsdesign, die Standardkalibrierungskurven, die Produktions-SLA oder die p95/p99-Service-Latenz bekannt. Diese Lücken sollten zu Bewertungsfragen werden, nicht zu Annahmen.

Wann sollten Sie Jev nicht verwenden?

Verwenden Sie Jev nicht als primäres Modell, wenn Sie Konversation, Zusammenfassungen, Codegenerierung, detaillierte Erklärungen oder langfristige Argumentation benötigen. Es ist auch ein schlechter alleiniger Entscheidungsträger für risikobehaftete Prozesse, die eine prüfbare Begründung erfordern. In einem festen Bereich kann ein herkömmlicher kleiner Klassifizierer oder ein spezialisierter Nachbearbeiter genauer, kostengünstiger oder einfacher zu validieren sein.

Häufig gestellte Fragen

Ist Jev ein LLM?

Nicht im herkömmlichen Sinne eines Chat-Modells. Es verarbeitet textuelle oder strukturierte Zustände, gibt jedoch vordefinierte Entscheidungstypen zurück, anstatt Prosa zu generieren.

Bedeutet „keine Halluzination“, dass Jev nicht falsch sein kann?

Nein. Die Form der Ausgabe kann garantiert werden, während die ausgewählte Antwort semantisch falsch ist. Interpretieren Sie die Behauptung als Schutz gegen Schema- und Typfehler.

Ersetzt Jev das Modell, das einen Agenten antreibt?

Normalerweise nicht. Es ist besser als Ergänzung positioniert: Jev für schnelle strukturierte Entscheidungen, ein LLM für Argumentation und Sprache sowie Code oder Menschen für die Durchsetzung von Richtlinien.

Was ist RLCD?

TypeSafe erweitert es als Reinforcement Learning für kalibrierte Entscheidungen, das darauf abzielt, die gemeldete Wahrscheinlichkeit mit der beobachteten Richtigkeit in Einklang zu bringen. Die öffentlichen Quellen bieten noch nicht genügend Trainingsdetails oder standardisierte Kalibrierungsnachweise für eine unabhängige technische Prüfung.

Was sollte ich zuerst prototypisieren?

Wählen Sie eine hochvolumige, umkehrbare Klassifizierung, die bereits durch ein LLM läuft. Führen Sie Jev im Schattenmodus aus, vergleichen Sie Entscheidungen mit gekennzeichneten Ergebnissen und führen Sie die Automatisierung erst ein, nachdem Schwellenwerte und Fallbacks validiert sind.

Beginnen Sie mit einer messbaren Entscheidung

Jevs stärkste Aussage ist nicht „ersetzen Sie jedes LLM“. Es ist „stoppen Sie, ein generatives Modell zu bezahlen, um Entscheidungen zu produzieren, die bereits eine bekannte Form haben.“ Wählen Sie einen Zweig in Ihrem Agenten-Harness, definieren Sie den akzeptablen Fehler und die Eskalationsrichtlinie und testen Sie ihn gegen Ihren eigenen Verkehr.

Verwenden Sie TypeSafe AIs Einführung in System One Modelle und Jev für die ursprünglichen Modellansprüche und -vorbehalte sowie LangChains Leitfaden zum Erstellen eines Harness mit Jev für die Python-Integration und Middleware-Muster.

Beginnen Sie mit der Verwendung von Jev mit AIHubMix

AIHubMix hat die Unterstützung für Jev hinzugefügt und bietet Entwicklern einen Ort, um auf das neue Entscheidungsmodell neben anderen führenden KI-Modellen zuzugreifen.

Besuchen Sie AIHubMix um Jev auszuprobieren und einen bekannten Zweig in Ihrem Workflow in ein messbares Experiment zu verwandeln. Beginnen Sie mit einer umkehrbaren Klassifizierungs- oder Bewertungsaufgabe, definieren Sie Ihren Erfolgsschwellenwert und halten Sie ein LLM oder einen menschlichen Fallback bereit, während Sie die Ergebnisse bewerten.