Jev 解釋:如何為 AI 代理添加快速、類型化的決策

推理時代閱讀約 6 分鐘
Jev 解釋:如何為 AI 代理添加快速、類型化的決策

Jev 最好理解為軟體的決策層。它讀取文本或結構化狀態,並返回預定義的分類、分數和是或否的概率。它不會為用戶撰寫答案。這種較狹窄的介面使其與高容量路由、分流、驗證和 AI 代理內的護欄步驟相關。

實際模式很簡單:讓 Jev 做出頻繁的、可逆的判斷;讓業務代碼執行政策;將不確定或重要的案例升級到一個有能力的 LLM 或人類。

如果 Jev 對你來說是新的,最簡短的解釋是:Jev 是 TypeSafe AI 新發布的 AI 決策模型,它的行為更像是語義 if 語句,而不是聊天機器人。你提供上下文和固定的問題集;它返回類型化的選擇、分數和概率,應用代碼可以立即使用。

什麼是 Jev?

TypeSafe AI 將 Jev 稱為其第一個系統一模型,借用了系統 1/系統 2 區分中的“快速”一側。一個請求提供程序狀態和類型化問題。Jev 並行評估問題並返回概率和信心值,軟體可以直接使用。

可用的問題類型包括:

  1. Noul 用於判斷是或否的陳述為真的概率。
  2. Choice 用於在預定義選項中選擇,並附帶概率分佈和信心。
  3. Score 用於評分有序級別,附帶分數、基礎分佈和信心。

與自回歸 LLM 不同,Jev 不會生成任意字符串。TypeSafe 表示這使得模式匹配得以保證:回應無法創建字段或返回錯誤的數據類型。它仍然可以選擇錯誤的有效答案,因此類型安全不應被視為語義上的無誤。

Jev 在代理架構中適合什麼位置?

在狀態變更之間使用 Jev,當系統需要受限的判斷時:

用戶或工具結果
    -> Jev: 分類、評分、路由或檢查風險
        -> 應用政策
            -> 執行低風險行動
            -> 呼叫 LLM 進行推理或語言處理
            -> 請求人工審查

這是對 LLM 的補充。LLM 處理開放式推理、解釋和生成內容。Jev 處理已知可能答案的重複問題。

為每個任務選擇合適的層級

Jev 最容易理解為更大自動化堆棧中的一個組件:

層級最佳用於
Jev重複的分類、評分、路由和風險檢查
LLM複雜的推理、解釋和文本生成
應用代碼確定性規則、權限和執行
人工審查者高風險、模糊或特殊案例

這種劃分是 Jev 背後的產品理念:模型不會決定一切,也不需要說出一切。它將模糊的語義上下文轉化為類型化的概率信號,而周圍的系統則負責政策和行動。

步驟 1:選擇合適的首個工作流程

從現有的高容量決策開始,這些決策已經使用 LLM 以及結構化輸出。良好的候選者包括支持票路由、內容質量檢查、代理追蹤審查、文檔分流和模型選擇。

避免從不可逆、法律敏感或價值足夠高以至於最大準確性比延遲和成本更重要的決策開始。還要避免需要自然語言輸出或可審計解釋的任務:Jev 返回決策和概率,而不是推理敘述。

步驟 2:定義狀態和問題

使狀態包含做出決策所需的證據,但將政策保留在應用代碼中。盡可能將廣泛的請求分解為獨立的問題。

對於支持工作流程,一個請求可以詢問:

  • 哪個隊列應該接收票據?
  • 問題的嚴重程度如何?
  • 消息是否暗示濫用?
  • 是否需要人工審查?

當你的選項列表可能無法涵蓋每個實際案例時,添加 unknown 或 none_of_the_above 。沒有逃生路徑的情況下,封閉的分類器必須選擇一個有效但可能誤導的標籤。

步驟 3:通過 LangChain 調用 Jev

安裝集成並通過你的環境或秘密管理器提供 API 密鑰:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

然後創建一個類型化問題:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "部署失敗兩次,客戶看到 500 錯誤。"
        "現在有人可以查看嗎?"
    ),
    questions={
        "urgent": Noul(
            instructions="這需要立即關注嗎?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

結果是一個概率,你的政策可以與閾值進行比較。這本身並不是一個執行指令。

步驟 4:建立升級政策

使用多個帶而不是單一的通用截止點:

高信心 + 低後果 -> 自動行動
中等信心                -> LLM 驗證
低信心                   -> 人工審查
任何分數的高後果    -> 更強的控制或批准

為每個行動設置閾值。自動分配票據標籤和自動批准付款不應僅因為兩者都使用概率而共享相同的風險政策。

步驟 5:謹慎使用路由和護欄

LangChain 的實驗性 ModelRouterMiddleware 可以使用 Jev 將簡單的工作發送到快速模型,並將複雜或高風險的工作發送到更有能力的模型。這可以減少完整模型的使用,而不必強迫每個請求都經過最便宜的選項。

其實驗性 AutoModeMiddleware 將 Jev 應用於工具調用風險檢查,並可以在執行之前阻止提議的調用。保持對敏感工具的確定性控制:允許列表、沙盒、範圍憑證、速率限制和人工批准仍然是必要的,因為分類器可能會產生假陰性。

步驟 6:在自己的數據上進行評估

TypeSafe 報告 70–500 毫秒的端到端延遲,每百萬個輸入標記 $0.042,並且輸出不計量。在其四個工作流程評估中,它報告 Jev 平均與參考概率達成 67.8% 的一致性,約 $0.0004 和每個樣本 0.4 秒。相同的測試報告 GPT-5.6 Terra 的一致性為 67.9%,價格為 $0.0304 和 10.1 秒,GPT-5.6 Sol 的一致性為 74.1%,價格為 $0.0836 和 23.3 秒。

這些是供應商發布的結果,而不是普遍預測。參考是 GPT-6 Astra 和 Fable 5.1 的平均預測,而不是人類標記的真實。TypeSafe 注意到可能的工作流程作者偏見,並表示最大的標題速度和成本增益可能在現實世界改進的高端。

在生產之前,將 Jev 與你當前的 LLM、簡單規則和實用的特定領域模型進行比較。測量:

  • 按類別的準確性、精確性和召回率。
  • 校準和自信錯誤率。
  • 棄權和升級率。
  • 來自你的部署區域的 p50、p95 和 p99 延遲。
  • 整個級聯的端到端成本,包括後備。
  • 在分佈變化和對抗性輸入下的性能。

步驟 7:添加操作安全措施

生產就緒需要的不僅僅是模型質量:

  • 記錄狀態版本、問題架構、概率、信心、選擇的分支和後續結果。
  • 版本提示或問題指令和決策閾值。
  • 添加超時、有限重試、斷路器和確定性後備。
  • 單獨審查高信心錯誤;這些是最危險的自動化失敗。
  • 監控漂移並隨著輸入人群的變化重新校準閾值。
  • 將不可逆或受管制的行動放在更強的技術和人類控制之後。

公共材料目前未披露 Jev 的參數數量、詳細架構、RLCD 獎勵設計、標準校準曲線、生產 SLA 或 p95/p99 服務延遲。這些缺口應成為評估問題,而不是假設。

什麼時候不應使用 Jev?

當你需要對話、摘要、代碼生成、詳細解釋或長期推理時,不要將 Jev 作為主要模型。對於需要可審計理由的高風險過程,它也是一個不佳的唯一決策者。在固定領域中,傳統的小型分類器或專門的重新排序器可能更準確、擁有成本更低或更容易驗證。

常見問題

Jev 是 LLM 嗎?

不是在傳統聊天模型的意義上。它消耗文本或結構化狀態,但返回預定義的決策類型,而不是生成的散文。

“無幻覺”是否意味著 Jev 不能錯?

不。輸出形狀可以得到保證,而所選答案在語義上是錯誤的。將此聲明解釋為對模式和類型錯誤的保護。

Jev 是否取代了驅動代理的模型?

通常不會。它更適合作為補充:Jev 用於快速結構化決策,LLM 用於推理和語言,代碼或人類用於政策執行。

什麼是 RLCD?

TypeSafe 將其擴展為經過校準的決策的強化學習,旨在使報告的概率與觀察到的正確性對齊。公共來源尚未提供足夠的訓練細節或標準校準證據以進行獨立技術審計。

我應該首先原型什麼?

選擇一個已經通過 LLM 運行的高容量、可逆分類。以影子模式運行 Jev,將決策與標記結果進行比較,並在閾值和後備得到驗證後再引入自動化。

從一個可測量的決策開始

Jev 最強的主張不是“取代每個 LLM”。而是“停止支付生成模型來產生已知形狀的決策。”選擇代理工具中的一個分支,定義可接受的錯誤和升級政策,並將其測試與你自己的流量。

使用 TypeSafe AI 的 系統一模型和 Jev 的介紹 來獲取原始模型聲明和警告,以及 LangChain 的 使用 Jev 構建工具的指南 來獲取 Python 集成和中介模式。

開始使用 AIHubMix 的 Jev

AIHubMix 已經添加了對 Jev 的支持,為開發者提供了一個地方來訪問新的決策模型以及其他領先的 AI 模型。

訪問 AIHubMix 來嘗試 Jev,並將你的工作流程中的一個已知分支轉變為可測量的實驗。從可逆的分類或評分任務開始,定義你的成功閾值,並在評估結果的同時保持 LLM 或人工後備。