Jev 解析:如何为 AI 代理添加快速、类型化的决策

推理时代阅读约 6 分钟
Jev 解析:如何为 AI 代理添加快速、类型化的决策

Jev 最好理解为软件的决策层。它读取文本或结构化状态,并返回预定义的分类、分数和是或否的概率。它不会为用户写出答案。这种更狭窄的接口使其与高容量路由、分流、验证和 AI 代理内部的保护措施步骤相关。

实际模式很简单:让 Jev 进行频繁、可逆的判断;让业务代码执行政策;将不确定或重要的案例升级到一个有能力的 LLM 或人类。

如果 Jev 对你来说是新的,最简短的解释是:Jev 是 TypeSafe AI 新发布的 AI 决策模型,它的行为更像是语义 if 语句,而不是聊天机器人。你提供上下文和固定的问题集;它返回类型化的选择、分数和概率,应用代码可以立即使用。

什么是 Jev?

TypeSafe AI 称 Jev 为其第一个系统一模型,借用系统 1/系统 2 区分中的“快速”一侧。请求提供程序状态和类型化问题。Jev 并行评估这些问题,并返回软件可以直接使用的概率和置信值。

可用的问题类型包括:

  1. Noul 表示一个是或否的陈述为真的概率。
  2. Choice 用于在预定义选项中选择,带有概率分布和置信度。
  3. Score 用于对有序级别进行评分,带有分数、基础分布和置信度。

与自回归 LLM 不同,Jev 不生成任意字符串。TypeSafe 表示这保证了模式匹配:响应不能发明字段或返回错误的数据类型。它仍然可以选择错误的有效答案,因此类型安全不能被视为语义上的无误性。

Jev 在代理架构中适合什么位置?

在状态变化之间使用 Jev,当系统需要受限判断时:

用户或工具结果
    -> Jev: 分类、评分、路由或检查风险
        -> 应用政策
            -> 执行低风险操作
            -> 调用 LLM 进行推理或语言处理
            -> 请求人工审核

这与 LLM 是互补的。LLM 处理开放式推理、解释和生成内容。Jev 处理已知可能答案的重复问题。

为每项工作选择正确的层

Jev 最容易理解为更大自动化堆栈中的一个组件:

最佳用途
Jev重复的分类、评分、路由和风险检查
LLM复杂推理、解释和文本生成
应用代码确定性规则、权限和执行
人工审核者高风险、模糊或特殊案例

这种划分是 Jev 的产品理念:模型并不决定一切,也不需要说出一切。它将模糊的语义上下文转化为类型化的概率信号,而周围的系统仍然负责政策和行动。

步骤 1:选择正确的第一个工作流程

从现有的高容量决策开始,该决策已经使用 LLM 以及结构化输出。好的候选者包括支持票路由、内容质量检查、代理跟踪审核、文档分流和模型选择。

避免从不可逆、法律敏感或足够有价值的决策开始,因为在这种情况下,最大准确性比延迟和成本更重要。还要避免需要自然语言输出或可审计解释的任务:Jev 返回决策和概率,而不是推理叙述。

步骤 2:定义状态和问题

使状态包含做出决策所需的证据,但将政策保留在应用代码中。尽可能将广泛的请求分解为独立的问题。

对于支持工作流程,一个请求可以询问:

  • 哪个队列应该接收该票?
  • 问题的严重程度如何?
  • 消息是否暗示滥用?
  • 是否需要人工审核?

当你的选项列表可能无法覆盖每个真实案例时,添加 unknown 或 none_of_the_above 。没有逃生路径的情况下,封闭分类器必须选择一个有效但可能误导的标签。

步骤 3:通过 LangChain 调用 Jev

安装集成并通过你的环境或秘密管理器提供 API 密钥:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

然后创建一个类型化问题:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "部署失败两次,客户看到 500 错误。"
        "现在有人能看一下吗?"
    ),
    questions={
        "urgent": Noul(
            instructions="这需要立即关注吗?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

结果是一个概率,你的政策可以与阈值进行比较。它本身并不是一个执行指令。

步骤 4:建立升级政策

使用多个带宽而不是单一的通用截止点:

高置信度 + 低后果 -> 自动操作
中等置信度                -> LLM 验证
低置信度                   -> 人工审核
任何分数的高后果        -> 更强的控制或批准

为每个操作设置阈值。自动分配票据标签和自动批准付款不应仅仅因为两者都使用概率而共享相同的风险政策。

步骤 5:谨慎使用路由和保护措施

LangChain 的实验性 ModelRouterMiddleware 可以使用 Jev 将简单工作发送到快速模型,将复杂或高风险工作发送到更强大的模型。这可以减少完整模型的使用,而不强制每个请求都通过最便宜的选项。

其实验性 AutoModeMiddleware 将 Jev 应用于工具调用风险检查,并可以在执行前阻止提议的调用。保持对敏感工具的确定性控制:允许列表、沙盒、范围凭证、速率限制和人工批准仍然是必要的,因为分类器可能会产生假阴性。

步骤 6:在自己的数据上进行评估

TypeSafe 报告的端到端延迟为 70–500 毫秒,每百万输入令牌 $0.042,输出不计量。在其四个工作流程评估中,它报告 Jev 平均与参考概率达成 67.8% 的一致,约为 $0.0004 和每个样本 0.4 秒。相同的测试报告 GPT-5.6 Terra 为 67.9%,价格为 $0.0304,延迟为 10.1 秒,GPT-5.6 Sol 为 74.1%,价格为 $0.0836,延迟为 23.3 秒。

这些是供应商发布的结果,而不是普遍预测。参考是 GPT-6 Astra 和 Fable 5.1 的平均预测,而不是人工标记的真相。TypeSafe 注意到可能的工作流作者偏见,并表示最大的速度和成本收益可能在现实世界改进的高端。

在生产之前,将 Jev 与你当前的 LLM、简单规则和领域特定模型进行比较。测量:

  • 按类别的准确性、精确度和召回率。
  • 校准和置信错误率。
  • 弃权和升级率。
  • 来自你部署区域的 p50、p95 和 p99 延迟。
  • 整个级联的端到端成本,包括后备。
  • 在分布变化和对抗性输入下的性能。

步骤 7:添加操作安全措施

生产准备不仅需要模型质量:

  • 记录状态版本、问题模式、概率、置信度、选择的分支和后续结果。
  • 版本化提示或问题说明和决策阈值。
  • 添加超时、有限重试、断路器和确定性后备。
  • 单独审核高置信度错误;它们是最危险的自动化失败。
  • 监控漂移并在输入人群变化时重新校准阈值。
  • 将不可逆或受监管的操作置于更强的技术和人工控制之下。

公共材料目前未披露 Jev 的参数数量、详细架构、RLCD 奖励设计、标准校准曲线、生产 SLA 或 p95/p99 服务延迟。这些空白应成为评估问题,而不是假设。

何时不应使用 Jev?

当你需要对话、摘要、代码生成、详细解释或长时间推理时,不要将 Jev 作为主要模型。它也是高风险流程的糟糕单一决策者,这些流程需要可审计的理由。在固定领域,传统的小型分类器或专门的重新排序器可能更准确、拥有成本更低或更容易验证。

常见问题

Jev 是 LLM 吗?

在传统聊天模型的意义上不是。它消耗文本或结构化状态,但返回预定义的决策类型,而不是生成的散文。

“没有幻觉”是否意味着 Jev 不会出错?

不。输出形状可以得到保证,而所选答案在语义上可能是错误的。将这一声明解读为对模式和类型错误的保护。

Jev 是否替代驱动代理的模型?

通常不是。它更适合作为补充:Jev 用于快速结构化决策,LLM 用于推理和语言,代码或人类用于政策执行。

什么是 RLCD?

TypeSafe 将其扩展为校准决策的强化学习,旨在使报告的概率与观察到的正确性对齐。公共来源尚未提供足够的训练细节或标准校准证据以供独立技术审计。

我应该首先原型什么?

选择一个已经通过 LLM 运行的高容量、可逆分类。以影子模式运行 Jev,将决策与标记结果进行比较,并在阈值和后备得到验证后再引入自动化。

从一个可测量的决策开始

Jev 最强的主张不是“替换每个 LLM”。而是“停止为生成已经有已知形状的决策而支付生成模型的费用。”选择代理工具中的一个分支,定义可接受的错误和升级政策,并在你的流量中进行测试。

使用 TypeSafe AI 的 系统一模型和 Jev 的介绍 获取原始模型声明和警告,以及 LangChain 的 使用 Jev 构建工具的指南 获取 Python 集成和中间件模式。

开始使用 AIHubMix 中的 Jev

AIHubMix 已添加对 Jev 的支持,为开发人员提供一个地方来访问新的决策模型以及其他领先的 AI 模型。

访问 AIHubMix 尝试 Jev,并将工作流程中的一个已知分支转变为可测量的实验。从可逆分类或评分任务开始,定义成功阈值,并在评估结果时保持 LLM 或人工后备。