Jev é melhor entendido como uma camada de decisão para software. Ele lê texto ou estado estruturado e retorna classificações, pontuações e probabilidades de sim ou não predefinidas. Ele não escreve uma resposta para o usuário. Essa interface mais restrita a torna relevante para roteamento de alto volume, triagem, verificação e etapas de controle dentro de agentes de IA.
O padrão prático é simples: deixe Jev fazer julgamentos frequentes e reversíveis; deixe o código de negócios impor políticas; escale casos incertos ou consequentes para um LLM capaz ou um humano.
Se Jev é novo para você, a explicação mais curta é esta: Jev é um modelo de decisão de IA recém-lançado da TypeSafe AI que se comporta mais como uma declaração semântica if do que um chatbot. Você fornece contexto e um conjunto fixo de perguntas; ele retorna escolhas tipadas, pontuações e probabilidades que o código da aplicação pode usar imediatamente.
O que é Jev?
A TypeSafe AI chama Jev de seu primeiro Modelo de Sistema Um, emprestando o lado “rápido” da distinção Sistema 1/Sistema 2. Uma solicitação fornece estado do programa e perguntas tipadas. Jev avalia as perguntas em paralelo e retorna probabilidades e valores de confiança que o software pode consumir diretamente.
Os tipos de perguntas disponíveis são:
Noulpara a probabilidade de que uma afirmação de sim ou não seja verdadeira.Choicepara selecionar entre opções predefinidas, com uma distribuição de probabilidade e confiança.Scorepara classificar níveis ordenados, com uma pontuação, distribuição subjacente e confiança.
Diferente de um LLM autoregressivo, Jev não gera strings arbitrárias. A TypeSafe diz que isso garante a correspondência de esquema: a resposta não pode inventar um campo ou retornar o tipo de dado errado. Ele ainda pode escolher a resposta válida errada, então a segurança de tipo não deve ser apresentada como infalibilidade semântica.
Onde Jev se encaixa em uma arquitetura de agente?
Use Jev entre mudanças de estado, quando o sistema precisa de um julgamento restrito:
Resultado do usuário ou ferramenta
-> Jev: classificar, pontuar, roteirizar ou verificar risco
-> política da aplicação
-> executar uma ação de baixo risco
-> chamar um LLM para raciocínio ou linguagem
-> solicitar revisão humana
Isso é complementar a um LLM. O LLM lida com raciocínio aberto, explicações e conteúdo gerado. Jev lida com perguntas repetidas cujas possíveis respostas são conhecidas de antemão.
Escolha a camada certa para cada trabalho
Jev é mais fácil de entender como um componente em uma pilha de automação maior:
| Camada | Melhor usado para |
|---|---|
| Jev | Classificação repetida, pontuação, roteamento e verificações de risco |
| LLM | Raciocínio complexo, explicações e geração de texto |
| Código da aplicação | Regras determinísticas, permissões e execução |
| Revisor humano | Casos de alto risco, ambíguos ou excepcionais |
Essa divisão é a ideia do produto por trás do Jev: o modelo não decide tudo e não precisa dizer tudo. Ele transforma um contexto semântico difuso em um sinal probabilístico tipado, enquanto o sistema circundante permanece responsável pela política e ação.
Passo 1: escolha o primeiro fluxo de trabalho certo
Comece com uma decisão existente de alto volume que já utiliza um LLM mais saída estruturada. Bons candidatos incluem roteamento de tickets de suporte, verificações de qualidade de conteúdo, revisão de rastreamento de agentes, triagem de documentos e seleção de modelos.
Evite começar com uma decisão que seja irreversível, legalmente sensível ou valiosa o suficiente para que a máxima precisão importe mais do que latência e custo. Também evite tarefas que exijam saída em linguagem natural ou uma explicação auditável: Jev retorna decisões e probabilidades, não uma narrativa de raciocínio.
Passo 2: defina o estado e as perguntas
Faça com que o estado contenha as evidências necessárias para a decisão, mas mantenha a política no código da aplicação. Decomponha um pedido amplo em perguntas independentes sempre que possível.
Para um fluxo de trabalho de suporte, um pedido poderia perguntar:
- Qual fila deve receber o ticket?
- Quão grave é o problema?
- A mensagem sugere abuso?
- A revisão humana é necessária?
Adicione unknown ou none_of_the_above quando sua lista de opções pode não cobrir todos os casos reais. Sem um caminho de escape, um classificador fechado deve escolher um rótulo válido, mas potencialmente enganoso.
Passo 3: chame Jev através do LangChain
Instale a integração e forneça a chave da API através do seu ambiente ou gerenciador de segredos:
pip install langchain-typesafe
export TYPESAFE_API_KEY="sua-chave-api"
Em seguida, crie uma pergunta tipada:
from langchain_typesafe import Noul, TypeSafeClassifier
classifier = TypeSafeClassifier()
response = classifier.invoke(
state=(
"A implantação falhou duas vezes e os clientes estão vendo 500s. "
"Alguém pode olhar agora?"
),
questions={
"urgent": Noul(
instructions="Isso precisa de atenção agora?"
),
},
)
urgency = response.nouls["urgent"].noul
O resultado é uma probabilidade que sua política pode comparar com um limite. Não é uma instrução para executar por si só.
Passo 4: construa uma política de escalonamento
Use múltiplas faixas em vez de um único corte universal:
alta confiança + baixa consequência -> ação automática
confiança média -> verificação LLM
baixa confiança -> revisão humana
alta consequência em qualquer pontuação -> controle ou aprovação mais rigorosa
Defina limites por ação. Atribuir automaticamente um rótulo de ticket e aprovar automaticamente um pagamento nunca deve compartilhar a mesma política de risco apenas porque ambos usam probabilidades.
Passo 5: use roteamento e guardrails com cuidado
O experimental ModelRouterMiddleware do LangChain pode usar Jev para enviar trabalho simples a um modelo rápido e trabalho complexo ou de alto risco a um modelo mais capaz. Isso pode reduzir o uso de modelo completo sem forçar cada solicitação através da opção mais barata.
Seu experimental AutoModeMiddleware aplica Jev a verificações de risco de chamadas de ferramentas e pode bloquear uma chamada proposta antes da execução. Mantenha controles determinísticos em torno de ferramentas sensíveis: listas de permissão, sandboxing, credenciais com escopo, limites de taxa e aprovação humana permanecem necessários porque um classificador pode produzir falsos negativos.
Passo 6: avalie com seus próprios dados
A TypeSafe relata uma latência de 70–500 ms de ponta a ponta, $0.042 por milhão de tokens de entrada e saída não medida. Em suas quatro avaliações de fluxo de trabalho, ela relata que Jev tem uma média de 67.8% de concordância com probabilidades de referência a cerca de $0.0004 e 0.4 segundos por amostra. O mesmo suporte relata 67.9% para GPT-5.6 Terra a $0.0304 e 10.1 segundos, e 74.1% para GPT-5.6 Sol a $0.0836 e 23.3 segundos.
Esses são resultados publicados pelo fornecedor, não uma previsão universal. A referência é a previsão média do GPT-6 Astra e Fable 5.1, em vez da verdade rotulada por humanos. A TypeSafe observa possível viés do autor do fluxo de trabalho e diz que os maiores ganhos de velocidade e custo são provavelmente no extremo superior das melhorias do mundo real.
Antes da produção, compare Jev com seu LLM atual, regras simples e um modelo específico de domínio onde for prático. Meça:
- Precisão, precisão e recall por classe.
- Calibração e taxa de erro confiante.
- Taxa de abstenção e escalonamento.
- p50, p95 e p99 de latência da sua região de implantação.
- Custo de ponta a ponta de toda a cascata, incluindo alternativas.
- Desempenho sob mudança de distribuição e entradas adversariais.
Passo 7: adicione salvaguardas operacionais
A prontidão para produção requer mais do que qualidade do modelo:
- Registre a versão do estado, esquema de perguntas, probabilidade, confiança, ramo selecionado e resultado posterior.
- Versione prompts ou instruções de perguntas e limites de decisão.
- Adicione timeouts, tentativas limitadas, disjuntores e uma alternativa determinística.
- Revise erros de alta confiança separadamente; eles são as falhas de automação mais perigosas.
- Monitore desvios e recalibre limites à medida que a população de entrada muda.
- Mantenha ações irreversíveis ou regulamentadas atrás de controles técnicos e humanos mais rigorosos.
Material público atualmente não divulga a contagem de parâmetros do Jev, arquitetura detalhada, design de recompensa RLCD, curvas de calibração padrão, SLA de produção ou latência de serviço p95/p99. Essas lacunas devem se tornar perguntas de avaliação, não suposições.
Quando você não deve usar Jev?
Não use Jev como o modelo principal quando precisar de conversa, sumarização, geração de código, explicações detalhadas ou raciocínio de longo prazo. Também é um péssimo tomador de decisão único para processos de alto risco que exigem uma justificativa auditável. Em um domínio fixo, um classificador pequeno convencional ou um reranker especializado pode ser mais preciso, mais barato de manter ou mais fácil de validar.
FAQ
Jev é um LLM?
Não no sentido convencional de modelo de chat. Ele consome estado textual ou estruturado, mas retorna tipos de decisão predefinidos em vez de prosa gerada.
“Sem alucinação” significa que Jev não pode estar errado?
Não. A forma da saída pode ser garantida enquanto a resposta selecionada é semanticamente errada. Interprete a afirmação como proteção contra erros de esquema e tipo.
Jev substitui o modelo que alimenta um agente?
Normalmente não. Ele está melhor posicionado como um complemento: Jev para decisões estruturadas rápidas, um LLM para raciocínio e linguagem, e código ou humanos para aplicação de políticas.
O que é RLCD?
A TypeSafe o expande como Aprendizado por Reforço para Decisões Calibradas, destinado a alinhar a probabilidade relatada com a correção observada. As fontes públicas ainda não fornecem detalhes de treinamento suficientes ou evidências de calibração padrão para auditoria técnica independente.
O que devo prototipar primeiro?
Escolha uma classificação reversível de alto volume que já esteja em execução através de um LLM. Execute Jev em modo sombra, compare decisões com resultados rotulados e introduza automação apenas após validar limites e alternativas.
Comece com uma decisão mensurável
A proposta mais forte do Jev não é “substituir todos os LLMs.” É “parar de pagar um modelo generativo para produzir decisões que já têm uma forma conhecida.” Escolha um ramo em seu suporte de agente, defina o erro aceitável e a política de escalonamento, e teste-o contra seu próprio tráfego.
Use a introdução da TypeSafe AI aos Modelos de Sistema Um e Jev para as reivindicações e advertências do modelo original, e o guia do LangChain para construir um suporte com Jev para a integração em Python e padrões de middleware.
Comece a usar Jev com AIHubMix
AIHubMix adicionou suporte para Jev, dando aos desenvolvedores um lugar para acessar o novo modelo de decisão ao lado de outros modelos de IA líderes.
Visite AIHubMix para experimentar Jev e transformar um ramo conhecido em seu fluxo de trabalho em um experimento mensurável. Comece com uma tarefa de classificação ou pontuação reversível, defina seu limite de sucesso e mantenha um LLM ou uma alternativa humana enquanto avalia os resultados.



