Jevはソフトウェアの意思決定レイヤーとして最もよく理解されます。テキストや構造化された状態を読み取り、事前定義された分類、スコア、およびはい/いいえの確率を返します。ユーザーのために回答を書くことはありません。その狭いインターフェースは、高ボリュームのルーティング、トリアージ、検証、およびAIエージェント内のガードレールステップに関連性を持たせます。
実用的なパターンはシンプルです:Jevに頻繁で可逆的な判断をさせ、ビジネスコードがポリシーを強制し、不確実または重要なケースを能力のあるLLMまたは人間にエスカレーションします。
Jevが初めての方には、最も短い説明は次のとおりです:JevはTypeSafe AIから新たにリリースされたAI意思決定モデルで、チャットボットよりもむしろ意味的な if ステートメントのように振る舞います。コンテキストと固定された質問のセットを提供すると、型付けされた選択肢、スコア、および確率を返し、アプリケーションコードが即座に使用できます。
Jevとは何ですか?
TypeSafe AIはJevをその最初のシステムワンモデルと呼び、システム1/システム2の区別の「迅速な」側面を借用しています。リクエストはプログラムの状態と型付けされた質問を提供します。Jevは質問を並行して評価し、ソフトウェアが直接消費できる確率と信頼度を返します。
利用可能な質問の種類は次のとおりです:
Noulは、はい/いいえのステートメントが真である確率を示します。Choiceは、事前定義されたオプションの中から選択し、確率分布と信頼度を提供します。Scoreは、順序付けられたレベルを評価し、スコア、基礎分布、および信頼度を提供します。
自己回帰型のLLMとは異なり、Jevは任意の文字列を生成しません。TypeSafeは、これによりスキーママッチングが保証されると述べています:応答はフィールドを発明したり、間違ったデータ型を返したりすることはできません。それでも、間違った有効な回答を選択する可能性があるため、型安全性は意味的な誤りを防ぐものとして提示されるべきではありません。
Jevはエージェントアーキテクチャのどこに適合しますか?
状態変化の間に、システムが制約された判断を必要とする場合にJevを使用します:
ユーザーまたはツールの結果
-> Jev: 分類、スコア付け、ルーティング、またはリスクチェック
-> アプリケーションポリシー
-> 低リスクのアクションを実行
-> 推論または言語のためにLLMを呼び出す
-> 人間のレビューを要求
これはLLMを補完するものです。LLMはオープンエンドの推論、説明、および生成されたコンテンツを処理します。Jevは、事前に可能な回答が知られている繰り返しの質問を処理します。
各仕事に適したレイヤーを選択する
Jevは、より大きな自動化スタックの一部として理解するのが最も簡単です:
| レイヤー | 最適な使用目的 |
|---|---|
| Jev | 繰り返しの分類、スコア付け、ルーティング、およびリスクチェック |
| LLM | 複雑な推論、説明、およびテキスト生成 |
| アプリケーションコード | 決定論的ルール、権限、および実行 |
| 人間のレビュアー | 高リスク、あいまい、または例外的なケース |
この分割はJevの製品アイデアの背後にあります:モデルはすべてを決定せず、すべてを言う必要はありません。あいまいな意味的コンテキストを型付けされた確率的信号に変換し、周囲のシステムはポリシーとアクションの責任を持ち続けます。
ステップ1:適切な最初のワークフローを選択する
既存の高ボリュームの意思決定から始め、すでにLLMと構造化された出力を使用しているものを選びます。良い候補には、サポートチケットのルーティング、コンテンツの品質チェック、エージェントトレースのレビュー、ドキュメントのトリアージ、およびモデル選択が含まれます。
不可逆的、法的に敏感、または最大の精度が遅延やコストよりも重要なほど価値のある意思決定から始めることは避けてください。また、自然言語出力や監査可能な説明を必要とするタスクも避けてください:Jevは決定と確率を返し、推論の物語は提供しません。
ステップ2:状態と質問を定義する
状態には決定に必要な証拠を含めますが、ポリシーはアプリケーションコードに保持します。広範なリクエストを可能な限り独立した質問に分解します。
サポートワークフローの場合、1つのリクエストは次のように尋ねることができます:
- どのキューがチケットを受け取るべきですか?
- 問題の深刻度はどのくらいですか?
- メッセージは虐待を示唆していますか?
- 人間のレビューが必要ですか?
オプションリストがすべての実際のケースをカバーしない可能性がある場合は、 unknown または none_of_the_above を追加します。逃げ道がない場合、閉じた分類器は有効だが潜在的に誤解を招くラベルを選択しなければなりません。
ステップ3:LangChainを介してJevを呼び出す
統合をインストールし、環境またはシークレットマネージャーを通じてAPIキーを提供します:
pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"
次に、型付けされた質問を作成します:
from langchain_typesafe import Noul, TypeSafeClassifier
classifier = TypeSafeClassifier()
response = classifier.invoke(
state=(
"デプロイが2回失敗し、顧客が500エラーを見ています。"
"今誰か見てくれますか?"
),
questions={
"urgent": Noul(
instructions="これには今すぐ注意が必要ですか?"
),
},
)
urgency = response.nouls["urgent"].noul
結果は、ポリシーがしきい値と比較できる確率です。それ自体が実行するための指示ではありません。
ステップ4:エスカレーションポリシーを構築する
単一の普遍的なカットオフの代わりに、複数のバンドを使用します:
高い信頼度 + 低い結果 -> 自動アクション
中程度の信頼度 -> LLM検証
低い信頼度 -> 人間のレビュー
任意のスコアでの高い結果 -> より強い制御または承認
アクションごとにしきい値を設定します。チケットラベルを自動的に割り当てたり、支払いを自動的に承認したりすることは、確率を使用しているからといって、同じリスクポリシーを共有すべきではありません。
ステップ5:ルーティングとガードレールを慎重に使用する
LangChainの実験的 ModelRouterMiddleware は、Jevを使用してシンプルな作業を迅速なモデルに送信し、複雑または高リスクの作業をより能力のあるモデルに送信できます。これにより、すべてのリクエストを最も安価なオプションを通さずに、フルモデルの使用を減らすことができます。
その実験的 AutoModeMiddleware は、ツール呼び出しのリスクチェックにJevを適用し、実行前に提案された呼び出しをブロックできます。感度の高いツールの周りには決定論的な制御を維持してください:許可リスト、サンドボックス、スコープ付きの資格情報、レート制限、および人間の承認は必要です。なぜなら、分類器は誤った否定を生成する可能性があるからです。
ステップ6:独自のデータで評価する
TypeSafeは70〜500msのエンドツーエンドのレイテンシ、100万入力トークンあたり$0.042、無制限の出力を報告しています。4つのワークフロー評価では、Jevは約$0.0004および0.4秒で参照確率との合意が平均67.8%であると報告しています。同じハーネスは、$0.0304および10.1秒でGPT-5.6 Terraの67.9%、$0.0836および23.3秒でGPT-5.6 Solの74.1%を報告しています。
これらはベンダーが公開した結果であり、普遍的な予測ではありません。参照は、GPT-6 AstraおよびFable 5.1の平均予測であり、人間がラベル付けした真実ではありません。TypeSafeはワークフロー作成者のバイアスの可能性に注意を促し、最大の見出し速度とコストの向上は、実際の改善の高い範囲である可能性が高いと述べています。
本番前に、Jevを現在のLLM、単純なルール、および実用的なドメイン特化型モデルと比較してください。測定する項目は:
- クラスごとの精度、適合率、再現率。
- キャリブレーションと自信のないエラー率。
- 自発的およびエスカレーション率。
- デプロイメント地域からのp50、p95、およびp99のレイテンシ。
- フォールバックを含む全体のカスケードのエンドツーエンドコスト。
- 分布の変化や敵対的入力に対するパフォーマンス。
ステップ7:運用上の安全策を追加する
生産準備にはモデルの品質以上のものが必要です:
- 状態バージョン、質問スキーマ、確率、信頼度、選択されたブランチ、および後の結果をログに記録します。
- プロンプトまたは質問の指示と決定しきい値のバージョンを管理します。
- タイムアウト、制限付きの再試行、回路ブレーカー、および決定論的なフォールバックを追加します。
- 高信頼度のエラーを別々にレビューします。これらは最も危険な自動化の失敗です。
- ドリフトを監視し、入力集団が変化するにつれてしきい値を再調整します。
- 不可逆的または規制されたアクションは、より強力な技術的および人的制御の背後に保持します。
公開資料は現在、Jevのパラメータ数、詳細なアーキテクチャ、RLCD報酬設計、標準キャリブレーション曲線、生産SLA、またはp95/p99サービスレイテンシを開示していません。これらのギャップは、仮定ではなく評価の質問になるべきです。
Jevを使用すべきでないのはいつですか?
会話、要約、コード生成、詳細な説明、または長期的な推論が必要な場合にJevを主要なモデルとして使用しないでください。また、監査可能な根拠を必要とする高リスクプロセスの単独の意思決定者としても不適切です。固定されたドメインでは、従来の小型分類器や専門の再ランカーの方がより正確で、所有コストが安く、検証が容易である可能性があります。
FAQ
JevはLLMですか?
従来のチャットモデルの意味ではありません。テキストまたは構造化された状態を消費しますが、生成された散文ではなく、事前定義された意思決定タイプを返します。
「幻覚なし」とは、Jevが間違っていることがないことを意味しますか?
いいえ。出力の形状は保証されますが、選択された回答が意味的に間違っている可能性があります。この主張は、スキーマおよび型エラーに対する保護として解釈してください。
Jevはエージェントを動かすモデルを置き換えますか?
通常はいいえ。Jevは補完的な位置にある方が良いです:迅速な構造化された意思決定にはJev、推論と言語にはLLM、ポリシーの強制にはコードまたは人間を使用します。
RLCDとは何ですか?
TypeSafeはこれを「キャリブレーションされた意思決定のための強化学習」と拡張し、報告された確率を観察された正確さと一致させることを目的としています。公開されている情報は、独立した技術監査のための十分なトレーニング詳細や標準キャリブレーション証拠をまだ提供していません。
最初にプロトタイプすべきものは何ですか?
すでにLLMを通じて実行されている高ボリュームの可逆的な分類を1つ選択します。Jevをシャドーモードで実行し、ラベル付けされた結果と比較し、しきい値とフォールバックが検証された後にのみ自動化を導入します。
1つの測定可能な決定から始める
Jevの最も強力な提案は「すべてのLLMを置き換える」ことではありません。それは「既に知られている形状を持つ決定を生成モデルに生産させるために支払うのをやめる」です。エージェントハーネスの1つのブランチを選択し、許容されるエラーとエスカレーションポリシーを定義し、独自のトラフィックに対してテストします。
TypeSafe AIの システムワンモデルとJevの紹介 を使用して、元のモデルの主張と注意事項を確認し、LangChainの Jevを使用したハーネスの構築ガイド を使用して、Python統合とミドルウェアパターンを確認してください。
AIHubMixでJevを使用開始する
AIHubMixはJevのサポートを追加し、開発者が他の主要なAIモデルとともに新しい意思決定モデルにアクセスできる1つの場所を提供します。
AIHubMix を訪れて、Jevを試し、ワークフロー内の1つの既知のブランチを測定可能な実験に変えてください。可逆的な分類またはスコア付けタスクから始め、成功のしきい値を定義し、結果を評価する間はLLMまたは人間のフォールバックを維持してください。



