Jev wyjaśniony: Jak dodać szybkie, typowane decyzje do agenta AI

AIHubMix6 min czytania
Jev wyjaśniony: Jak dodać szybkie, typowane decyzje do agenta AI

Jev najlepiej rozumieć jako warstwę decyzyjną dla oprogramowania. Odczytuje tekst lub zorganizowany stan i zwraca zdefiniowane klasyfikacje, wyniki oraz prawdopodobieństwa tak lub nie. Nie pisze odpowiedzi dla użytkownika. Taki węższy interfejs czyni go istotnym w kontekście wysokowolumenowego routingu, triage, weryfikacji i kroków zabezpieczających w agentach AI.

Praktyczny wzór jest prosty: pozwól Jev podejmować częste, odwracalne osądy; pozwól kodowi biznesowemu egzekwować politykę; eskaluj niepewne lub istotne przypadki do zdolnego LLM lub człowieka.

Jeśli Jev jest dla Ciebie nowością, najkrótsze wyjaśnienie brzmi: Jev to nowo wydany model decyzyjny AI od TypeSafe AI, który zachowuje się bardziej jak semantyczne if niż chatbot. Dostarczasz kontekst i stały zestaw pytań; zwraca typowane wybory, wyniki i prawdopodobieństwa, które kod aplikacji może wykorzystać natychmiast.

Czym jest Jev?

TypeSafe AI nazywa Jev swoim pierwszym Modelem Systemu Pierwszego, zapożyczając „szybką” stronę rozróżnienia System 1/System 2. Żądanie dostarcza stan programu i typowane pytania. Jev ocenia pytania równolegle i zwraca prawdopodobieństwa oraz wartości pewności, które oprogramowanie może bezpośrednio wykorzystać.

Dostępne typy pytań to:

  1. Noul dla prawdopodobieństwa, że stwierdzenie tak lub nie jest prawdziwe.
  2. Choice dla wyboru spośród zdefiniowanych opcji, z rozkładem prawdopodobieństwa i pewnością.
  3. Score dla oceniania uporządkowanych poziomów, z wynikiem, podstawowym rozkładem i pewnością.

W przeciwieństwie do autoregresywnego LLM, Jev nie generuje dowolnych ciągów. TypeSafe twierdzi, że to gwarantuje dopasowanie schematu: odpowiedź nie może wymyślić pola ani zwrócić niewłaściwego typu danych. Może jednak wybrać niewłaściwą, ale ważną odpowiedź, więc bezpieczeństwo typów nie powinno być przedstawiane jako semantyczna nieomylność.

Gdzie Jev pasuje w architekturze agenta?

Użyj Jev pomiędzy zmianami stanu, gdy system potrzebuje ograniczonego osądu:

Wynik użytkownika lub narzędzia
    -> Jev: klasyfikuj, oceniaj, kieruj lub sprawdzaj ryzyko
        -> polityka aplikacji
            -> wykonaj niskoryzykowną akcję
            -> zadzwoń do LLM w celu rozumowania lub języka
            -> poproś o przegląd przez człowieka

To jest komplementarne do LLM. LLM zajmuje się otwartym rozumowaniem, wyjaśnieniami i generowaniem treści. Jev zajmuje się powtarzającymi się pytaniami, których możliwe odpowiedzi są znane z góry.

Wybierz odpowiednią warstwę do każdego zadania

Jev najłatwiej zrozumieć jako jeden komponent w większym stosie automatyzacji:

WarstwaNajlepiej używać do
JevPowtarzająca się klasyfikacja, ocenianie, kierowanie i sprawdzanie ryzyka
LLMZłożone rozumowanie, wyjaśnienia i generowanie tekstu
Kod aplikacjiDeterministyczne zasady, uprawnienia i wykonanie
Recenzent ludzkiPrzypadki wysokiego ryzyka, niejednoznaczne lub wyjątkowe

To podział jest pomysłem na produkt za Jev: model nie decyduje o wszystkim i nie musi mówić wszystkiego. Przekształca niejasny kontekst semantyczny w typowy sygnał probabilistyczny, podczas gdy otaczający system pozostaje odpowiedzialny za politykę i działanie.

Krok 1: wybierz odpowiedni pierwszy przepływ pracy

Rozpocznij od istniejącej, wysokowolumenowej decyzji, która już wykorzystuje LLM oraz zorganizowane wyjście. Dobre kandydaty to kierowanie zgłoszeniami wsparcia, kontrole jakości treści, przegląd śladów agentów, triage dokumentów i wybór modelu.

Unikaj rozpoczynania od decyzji, która jest nieodwracalna, wrażliwa prawnie lub na tyle wartościowa, że maksymalna dokładność ma większe znaczenie niż opóźnienie i koszt. Unikaj również zadań, które wymagają wyjścia w naturalnym języku lub audytowalnego wyjaśnienia: Jev zwraca decyzje i prawdopodobieństwa, a nie narrację rozumowania.

Krok 2: zdefiniuj stan i pytania

Upewnij się, że stan zawiera dowody wymagane do podjęcia decyzji, ale polityka pozostaje w kodzie aplikacji. Rozłóż szerokie żądanie na niezależne pytania, kiedy tylko to możliwe.

Dla przepływu pracy wsparcia, jedno żądanie mogłoby zapytać:

  • Która kolejka powinna otrzymać zgłoszenie?
  • Jak poważny jest problem?
  • Czy wiadomość sugeruje nadużycie?
  • Czy wymagana jest recenzja przez człowieka?

Dodaj unknown lub none_of_the_above gdy Twoja lista opcji może nie obejmować każdego rzeczywistego przypadku. Bez ścieżki ucieczki, zamknięty klasyfikator musi wybrać ważną, ale potencjalnie mylącą etykietę.

Krok 3: wywołaj Jev przez LangChain

Zainstaluj integrację i podaj klucz API przez swoje środowisko lub menedżera sekretów:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

Następnie stwórz typowane pytanie:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "Wdrożenie nie powiodło się dwa razy, a klienci widzą błędy 500. "
        "Czy ktoś może to teraz sprawdzić?"
    ),
    questions={
        "urgent": Noul(
            instructions="Czy to wymaga uwagi teraz?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Wynik to prawdopodobieństwo, które Twoja polityka może porównać z progiem. To nie jest instrukcja do wykonania sama w sobie.

Krok 4: zbuduj politykę eskalacji

Użyj wielu pasm zamiast jednego uniwersalnego progu:

wysoka pewność + niskie konsekwencje -> automatyczna akcja
średnia pewność                -> weryfikacja LLM
niska pewność                   -> przegląd przez człowieka
wysokie konsekwencje przy dowolnym wyniku    -> silniejsza kontrola lub zatwierdzenie

Ustaw progi dla każdej akcji. Automatyczne przypisanie etykiety zgłoszenia i automatyczne zatwierdzenie płatności nigdy nie powinny dzielić tej samej polityki ryzyka tylko dlatego, że obie używają prawdopodobieństw.

Krok 5: używaj routingu i zabezpieczeń ostrożnie

Eksperymentalny ModelRouterMiddleware LangChain może używać Jev do wysyłania prostych zadań do szybkiego modelu i złożonych lub wysokostawkowych zadań do bardziej zdolnego modelu. Może to zmniejszyć wykorzystanie pełnego modelu bez zmuszania każdego żądania do przechodzenia przez najtańszą opcję.

Jego eksperymentalny AutoModeMiddleware zastosowuje Jev do sprawdzania ryzyka wywołań narzędzi i może zablokować proponowane wywołanie przed wykonaniem. Utrzymuj deterministyczne kontrole wokół wrażliwych narzędzi: listy dozwolone, piaskownice, ograniczone uprawnienia, limity czasowe i zatwierdzenie przez człowieka pozostają konieczne, ponieważ klasyfikator może generować fałszywe negatywy.

Krok 6: oceń na swoich danych

TypeSafe raportuje opóźnienie end-to-end od 70 do 500 ms, $0.042 za milion tokenów wejściowych i nieograniczone wyjście. W swoich czterech ocenach przepływu pracy raportuje, że Jev średnio osiąga 67.8% zgodności z referencyjnymi prawdopodobieństwami przy około $0.0004 i 0.4 sekundy na próbkę. Ta sama platforma raportuje 67.9% dla GPT-5.6 Terra przy $0.0304 i 10.1 sekundy oraz 74.1% dla GPT-5.6 Sol przy $0.0836 i 23.3 sekundy.

To są wyniki publikowane przez dostawcę, a nie uniwersalne prognozy. Referencją jest średnia predykcja GPT-6 Astra i Fable 5.1, a nie prawda oznaczona przez ludzi. TypeSafe zauważa możliwy błąd autora przepływu pracy i twierdzi, że największe zyski w zakresie szybkości i kosztów są prawdopodobnie na wysokim końcu rzeczywistych ulepszeń.

Przed wdrożeniem porównaj Jev z obecnym LLM, prostymi zasadami i modelem specyficznym dla dziedziny, gdzie to praktyczne. Mierz:

  • Dokładność, precyzję i czułość według klasy.
  • Kalibrację i wskaźnik błędów pewności.
  • Wskaźnik wstrzymania i eskalacji.
  • p50, p95 i p99 opóźnienia z Twojego regionu wdrożenia.
  • Całkowity koszt całej kaskady, w tym zapasów.
  • Wydajność w przypadku zmiany rozkładu i ataków przeciwnika.

Krok 7: dodaj zabezpieczenia operacyjne

Gotowość do produkcji wymaga więcej niż jakości modelu:

  • Zaloguj wersję stanu, schemat pytania, prawdopodobieństwo, pewność, wybraną gałąź i późniejszy wynik.
  • Wersjonuj podpowiedzi lub instrukcje pytania oraz progi decyzji.
  • Dodaj limity czasowe, ograniczone próby, wyłączniki i deterministyczny zapas.
  • Osobno przeglądaj błędy o wysokiej pewności; są to najniebezpieczniejsze awarie automatyzacji.
  • Monitoruj dryf i przeskaluj progi w miarę zmiany populacji wejściowej.
  • Trzymaj nieodwracalne lub regulowane działania za silniejszymi kontrolami technicznymi i ludzkimi.

Publiczne materiały obecnie nie ujawniają liczby parametrów Jev, szczegółowej architektury, projektu nagrody RLCD, standardowych krzywych kalibracyjnych, SLA produkcji ani opóźnienia usług p95/p99. Te luki powinny stać się pytaniami oceniającymi, a nie założeniami.

Kiedy nie powinieneś używać Jev?

Nie używaj Jev jako głównego modelu, gdy potrzebujesz rozmowy, podsumowania, generowania kodu, szczegółowych wyjaśnień lub rozumowania długoterminowego. Jest również złym jedynym decydentem w procesach wysokiego ryzyka, które wymagają audytowalnego uzasadnienia. W ustalonej dziedzinie konwencjonalny mały klasyfikator lub specjalizowany reranker mogą być dokładniejsze, tańsze w utrzymaniu lub łatwiejsze do walidacji.

FAQ

Czy Jev jest LLM?

Nie w konwencjonalnym sensie modelu czatu. Odczytuje tekstowy lub zorganizowany stan, ale zwraca zdefiniowane typy decyzji, a nie generowaną prozę.

Czy „brak halucynacji” oznacza, że Jev nie może się mylić?

Nie. Kształt wyjścia może być gwarantowany, podczas gdy wybrana odpowiedź jest semantycznie błędna. Interpretuj to twierdzenie jako ochronę przed błędami schematu i typu.

Czy Jev zastępuje model, który napędza agenta?

Zwykle nie. Lepiej jest go postrzegać jako uzupełnienie: Jev do szybkich, zorganizowanych decyzji, LLM do rozumowania i języka, a kod lub ludzie do egzekwowania polityki.

Czym jest RLCD?

TypeSafe rozszerza to jako Uczenie przez Wzmocnienie dla Kalibrowanych Decyzji, mające na celu dostosowanie zgłaszanego prawdopodobieństwa do zaobserwowanej poprawności. Publiczne źródła jeszcze nie dostarczają wystarczających szczegółów dotyczących szkolenia ani standardowych dowodów kalibracyjnych do niezależnego audytu technicznego.

Co powinienem prototypować jako pierwsze?

Wybierz jedną wysokowolumenową, odwracalną klasyfikację, która już działa przez LLM. Uruchom Jev w trybie cienia, porównaj decyzje z oznaczonymi wynikami i wprowadź automatyzację dopiero po zweryfikowaniu progów i zapasów.

Rozpocznij od jednej mierzalnej decyzji

Najsilniejsza propozycja Jev nie brzmi „zastąp każdy LLM”. Brzmi „przestań płacić modelowi generacyjnemu za podejmowanie decyzji, które już mają znany kształt”. Wybierz jedną gałąź w swoim systemie agenta, zdefiniuj akceptowalny błąd i politykę eskalacji, a następnie przetestuj ją na swoim własnym ruchu.

Skorzystaj z wprowadzenia do Modeli Systemu Pierwszego i Jev od TypeSafe AI dla oryginalnych roszczeń i zastrzeżeń dotyczących modelu oraz z przewodnika LangChain dotyczącego budowania systemu z Jev dla integracji Pythona i wzorców middleware.

Rozpocznij korzystanie z Jev z AIHubMix

AIHubMix dodał wsparcie dla Jev, dając deweloperom jedno miejsce do uzyskania dostępu do nowego modelu decyzyjnego obok innych wiodących modeli AI.

Odwiedź AIHubMix aby wypróbować Jev i przekształcić jedną znaną gałąź w swoim przepływie pracy w mierzalny eksperyment. Rozpocznij od odwracalnej klasyfikacji lub zadania oceny, zdefiniuj swój próg sukcesu i utrzymuj zapas LLM lub człowieka w gotowości podczas oceny wyników.