Обяснение на Jev: Как да добавите бързи, типизирани решения към AI агент

AIHubMix6 мин четене
Обяснение на Jev: Как да добавите бързи, типизирани решения към AI агент

Jev най-добре се разбира като слой за вземане на решения за софтуер. Той чете текст или структурирано състояние и връща предварително определени класификации, оценки и вероятности за "да" или "не". Той не пише отговор за потребителя. Тази по-тясна интерфейсна структура го прави релевантен за маршрутизиране с висока честота, триаж, верификация и стъпки за контрол в AI агенти.

Практичният модел е прост: нека Jev прави чести, обратими преценки; нека бизнес кодът прилага политиката; ескалирайте несигурни или значими случаи към способен LLM или човек.

Ако Jev е нов за вас, най-краткото обяснение е следното: Jev е новоиздаден AI модел за вземане на решения от TypeSafe AI, който се държи повече като семантично if изречение, отколкото като чатбот. Вие предоставяте контекст и фиксиран набор от въпроси; той връща типизирани избори, оценки и вероятности, които приложният код може да използва незабавно.

Какво е Jev?

TypeSafe AI нарича Jev своя първи модел на Система 1, заемайки "бързата" страна на разграничението между Система 1 и Система 2. Запитването предоставя програмно състояние и типизирани въпроси. Jev оценява въпросите паралелно и връща вероятности и стойности на увереност, които софтуерът може да консумира директно.

Наличните типове въпроси са:

  1. Noul за вероятността, че изявление с "да" или "не" е вярно.
  2. Choice за избор между предварително определени опции, с разпределение на вероятността и увереност.
  3. Score за оценка на подредени нива, с оценка, основно разпределение и увереност.

За разлика от автогресивен LLM, Jev не генерира произволни низове. TypeSafe казва, че това гарантира съвпадение на схемата: отговорът не може да изобрети поле или да върне грешен тип данни. Все пак, той може да избере неправилен валиден отговор, така че типова безопасност не трябва да се представя като семантична непогрешимост.

Къде се вписва Jev в архитектурата на агентите?

Използвайте Jev между промени в състоянието, когато системата се нуждае от ограничена преценка:

Резултат от потребител или инструмент
    -> Jev: класифицира, оценява, маршрутизира или проверява риск
        -> приложна политика
            -> изпълнява действие с нисък риск
            -> извиква LLM за разсъждения или език
            -> иска преглед от човек

Това е допълващо на LLM. LLM обработва отворени разсъждения, обяснения и генерирано съдържание. Jev обработва повторяеми въпроси, чиито възможни отговори са известни предварително.

Изберете правилния слой за всяка работа

Jev е най-лесен за разбиране като един компонент в по-голям стек за автоматизация:

СлойНай-добре използван за
JevПовторна класификация, оценяване, маршрутизиране и проверки на риск
LLMСложни разсъждения, обяснения и генериране на текст
Приложен кодДетерминирани правила, разрешения и изпълнение
Човешки прегледчикСлучаи с висок риск, неясни или изключителни случаи

Това разделение е продуктова идея зад Jev: моделът не решава всичко и не трябва да казва всичко. Той превръща неясния семантичен контекст в типизиран вероятностен сигнал, докато околната система остава отговорна за политиката и действията.

Стъпка 1: изберете правилния първи работен поток

Започнете с вече съществуващо, високообемно решение, което вече използва LLM плюс структурирани изходи. Добри кандидати включват маршрутизиране на поддръжка, проверки на качеството на съдържанието, преглед на следите на агента, триаж на документи и избор на модел.

Избягвайте да започвате с решение, което е необратимо, юридически чувствително или достатъчно ценно, че максималната точност е по-важна от латентността и разходите. Също така избягвайте задачи, които изискват изход на естествен език или одитируемо обяснение: Jev връща решения и вероятности, а не разказ за разсъждения.

Стъпка 2: определете състоянието и въпросите

Нека състоянието съдържа доказателствата, необходими за решението, но оставете политиката в приложния код. Разделете широкото запитване на независими въпроси, когато е възможно.

За работен поток за поддръжка, едно запитване може да пита:

  • Коя опашка трябва да получи билета?
  • Колко сериозен е проблемът?
  • Предлага ли съобщението злоупотреба?
  • Необходим ли е човешки преглед?

Добавете unknown или none_of_the_above когато списъкът с опции може да не обхваща всеки реален случай. Без изходен път, затворен класификатор трябва да избере валиден, но потенциално подвеждащ етикет.

Стъпка 3: извикайте Jev чрез LangChain

Инсталирайте интеграцията и предоставете API ключа чрез вашата среда или мениджър на тайни:

pip install langchain-typesafe
export TYPESAFE_API_KEY="вашият-api-ключ"

След това създайте типизиран въпрос:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "Разгръщането се провали два пъти и клиентите виждат 500s. "
        "Може ли някой да погледне сега?"
    ),
    questions={
        "urgent": Noul(
            instructions="Трябва ли това да бъде разгледано веднага?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Резултатът е вероятност, с която вашата политика може да сравни с праг. Това не е инструкция за изпълнение сама по себе си.

Стъпка 4: изградете политика за ескалация

Използвайте множество диапазони вместо един универсален праг:

висока увереност + ниски последствия -> автоматично действие
средна увереност                -> верификация от LLM
ниска увереност                   -> човешки преглед
високи последствия при всяка оценка    -> по-силен контрол или одобрение

Настройте прагове за всяко действие. Автоматичното присвояване на етикет на билет и автоматичното одобрение на плащане никога не трябва да споделят същата политика за риск просто защото и двете използват вероятности.

Стъпка 5: използвайте маршрутизиране и контролни механизми внимателно

Експерименталният ModelRouterMiddleware на LangChain може да използва Jev, за да изпраща проста работа на бърз модел и сложна или високорискова работа на по-способен модел. Това може да намали използването на целия модел, без да принуждава всяко запитване да преминава през най-евтиния вариант.

Неговият експериментален AutoModeMiddleware прилага Jev за проверки на риска при извикване на инструменти и може да блокира предложено извикване преди изпълнение. Запазете детерминирани контроли около чувствителни инструменти: списъци с разрешения, пясъчници, ограничени удостоверения, лимити на скоростта и одобрение от човек остават необходими, тъй като класификаторът може да произвежда фалшиви отрицания.

Стъпка 6: оценете на вашите собствени данни

TypeSafe съобщава за латентност от 70–500 ms от край до край, $0.042 на милион входни токена и неограничен изход. В четирите си оценки на работния поток, той съобщава, че Jev средно постига 67.8% съгласие с референтните вероятности при около $0.0004 и 0.4 секунди на проба. Същият инструмент съобщава 67.9% за GPT-5.6 Terra при $0.0304 и 10.1 секунди, и 74.1% за GPT-5.6 Sol при $0.0836 и 23.3 секунди.

Тези резултати са публикувани от доставчика, а не универсална прогноза. Референцията е средната прогноза на GPT-6 Astra и Fable 5.1, а не човешки етикетирана истина. TypeSafe отбелязва възможен пристрастие на автора на работния поток и казва, че най-големите заглавия за бързина и разходи вероятно са на високия край на реалните подобрения.

Преди производството, сравнете Jev с вашия текущ LLM, прости правила и домейн-специфичен модел, където е практично. Измерете:

  • Точност, прецизност и припомняне по клас.
  • Калибрация и процент на уверени грешки.
  • Процент на въздържане и ескалация.
  • p50, p95 и p99 латентност от вашия регион на разгръщане.
  • Обща цена на целия каскад, включително резерви.
  • Представяне при промяна на разпределението и враждебни входове.

Стъпка 7: добавете оперативни предпазни мерки

Готовността за производство изисква повече от качеството на модела:

  • Логвайте версията на състоянието, схемата на въпросите, вероятността, увереността, избрания клон и по-късния резултат.
  • Версирайте подканите или инструкциите за въпроси и праговете на решенията.
  • Добавете таймаути, ограничени повторения, прекъсвачи и детерминиран резерв.
  • Преглеждайте грешки с висока увереност отделно; те са най-опасните автоматизационни провали.
  • Наблюдавайте отклонения и пренастройвайте праговете, когато входното население се променя.
  • Дръжте необратими или регулирани действия зад по-силни технически и човешки контроли.

Публичният материал в момента не разкрива броя на параметрите на Jev, детайлната архитектура, дизайна на наградите RLCD, стандартните калибрационни криви, производствения SLA или латентността на услугата p95/p99. Тези пропуски трябва да станат въпроси за оценка, а не предположения.

Кога не трябва да използвате Jev?

Не използвайте Jev като основен модел, когато се нуждаете от разговор, обобщение, генериране на код, детайлни обяснения или разсъждения с дълъг хоризонт. Той също така е лош единствен вземач на решения за процеси с висок риск, които изискват одитируемо обяснение. В фиксиран домейн, конвенционален малък класификатор или специализиран повторен ранкер може да бъде по-точен, по-евтин за притежаване или по-лесен за валидиране.

Често задавани въпроси

Jev ли е LLM?

Не в конвенционалния смисъл на чат-модел. Той консумира текстово или структурирано състояние, но връща предварително определени типове решения, а не генериран текст.

Дали "без халюцинации" означава, че Jev не може да бъде грешен?

Не. Формата на изхода може да бъде гарантирана, докато избраният отговор е семантично грешен. Интерпретирайте твърдението като защита срещу грешки в схемата и типа.

Дали Jev заменя модела, който захранва агент?

Обикновено не. Той е по-добре позициониран като допълнение: Jev за бързи структурирани решения, LLM за разсъждения и език, и код или хора за прилагане на политиката.

Какво е RLCD?

TypeSafe го разширява като Обучение с подсилване за Калибрирани Решения, предназначено да съгласува докладваната вероятност с наблюдаваната точност. Публичните източници все още не предоставят достатъчно детайли за обучение или стандартни доказателства за калибрация за независим технически одит.

Какво трябва да прототипирам първо?

Изберете едно високообемно, обратимо класифициране, което вече работи чрез LLM. Изпълнете Jev в режим на сянка, сравнете решенията с етикетирани резултати и въведете автоматизация само след като праговете и резервите са валидирани.

Започнете с едно измеримо решение

Най-силното предложение на Jev не е "заменете всеки LLM". То е "спрете да плащате на генеративен модел да произвежда решения, които вече имат известна форма." Изберете един клон във вашия агентски хъб, определете допустимата грешка и политиката за ескалация и я тествайте срещу вашия собствен трафик.

Използвайте TypeSafe AI’s въведението на Система 1 Модели и Jev за оригиналните твърдения и предупреждения за модела, и LangChain’s ръководството за изграждане на хъб с Jev за Python интеграцията и шаблоните за междинен софтуер.

Започнете да използвате Jev с AIHubMix

AIHubMix добави поддръжка за Jev, предоставяйки на разработчиците едно място за достъп до новия модел за вземане на решения наред с други водещи AI модели.

Посетете AIHubMix за да опитате Jev и да превърнете един известен клон във вашия работен поток в измерим експеримент. Започнете с обратимо класифициране или задача за оценка, определете прага на успеха си и запазете LLM или човешки резерв на място, докато оценявате резултатите.