Jev는 소프트웨어의 결정 레이어로 가장 잘 이해됩니다. 텍스트나 구조화된 상태를 읽고 미리 정의된 분류, 점수 및 예/아니오 확률을 반환합니다. 사용자를 위한 답변을 작성하지 않습니다. 이러한 좁은 인터페이스는 AI 에이전트 내에서 고용량 라우팅, 분류, 검증 및 가드레일 단계와 관련이 있습니다.
실용적인 패턴은 간단합니다: Jev가 자주 되돌릴 수 있는 판단을 하게 하고, 비즈니스 코드가 정책을 시행하게 하며, 불확실하거나 중요한 사례를 능력 있는 LLM 또는 인간에게 에스컬레이션합니다.
Jev가 처음이라면 가장 짧은 설명은 다음과 같습니다: Jev는 TypeSafe AI에서 새로 출시한 AI 결정 모델로, 챗봇보다 의미론적 if 문에 더 가깝게 작동합니다. 컨텍스트와 고정된 질문 세트를 제공하면, 즉시 애플리케이션 코드에서 사용할 수 있는 유형화된 선택, 점수 및 확률을 반환합니다.
Jev란 무엇인가요?
TypeSafe AI는 Jev를 첫 번째 시스템 1 모델이라고 부르며, 시스템 1/시스템 2 구분의 “빠른” 측면을 차용합니다. 요청은 프로그램 상태와 유형화된 질문을 제공합니다. Jev는 질문을 병렬로 평가하고 소프트웨어가 직접 사용할 수 있는 확률과 신뢰 값을 반환합니다.
사용 가능한 질문 유형은 다음과 같습니다:
Noul은 예/아니오 진술이 참일 확률입니다.Choice은 미리 정의된 옵션 중에서 선택하며, 확률 분포와 신뢰도를 포함합니다.Score은 순서가 있는 수준을 평가하며, 점수, 기본 분포 및 신뢰도를 포함합니다.
Jev는 자기 회귀 LLM과 달리 임의의 문자열을 생성하지 않습니다. TypeSafe는 이것이 스키마 일치를 보장한다고 말합니다: 응답이 필드를 발명하거나 잘못된 데이터 유형을 반환할 수 없습니다. 여전히 잘못된 유효한 답변을 선택할 수 있으므로, 유형 안전성을 의미론적 오류가 없음을 나타내는 것으로 간주해서는 안 됩니다.
Jev는 에이전트 아키텍처에서 어디에 적합한가요?
상태 변경 사이에 Jev를 사용하여 시스템이 제한된 판단을 필요로 할 때:
사용자 또는 도구 결과
-> Jev: 분류, 점수, 라우팅 또는 위험 확인
-> 애플리케이션 정책
-> 저위험 작업 실행
-> 추론 또는 언어를 위해 LLM 호출
-> 인간 검토 요청
이는 LLM과 보완적입니다. LLM은 개방형 추론, 설명 및 생성된 콘텐츠를 처리합니다. Jev는 가능한 답변이 미리 알려진 반복 질문을 처리합니다.
각 작업에 적합한 레이어 선택하기
Jev는 더 큰 자동화 스택의 한 구성 요소로 이해하기 가장 쉽습니다:
| 레이어 | 최고의 사용 용도 |
|---|---|
| Jev | 반복적인 분류, 점수 매기기, 라우팅 및 위험 확인 |
| LLM | 복잡한 추론, 설명 및 텍스트 생성 |
| 애플리케이션 코드 | 결정론적 규칙, 권한 및 실행 |
| 인간 검토자 | 고위험, 모호하거나 예외적인 사례 |
이러한 구분은 Jev의 제품 아이디어입니다: 모델은 모든 것을 결정하지 않으며 모든 것을 말할 필요가 없습니다. 모호한 의미론적 컨텍스트를 유형화된 확률 신호로 변환하는 반면, 주변 시스템은 정책과 행동에 대한 책임을 집니다.
1단계: 적절한 첫 번째 워크플로 선택하기
기존의 고용량 결정을 시작하세요. 이미 LLM과 구조화된 출력을 사용하는 경우가 좋습니다. 좋은 후보에는 지원 티켓 라우팅, 콘텐츠 품질 검사, 에이전트 추적 검토, 문서 분류 및 모델 선택이 포함됩니다.
되돌릴 수 없는 결정, 법적으로 민감한 결정 또는 최대 정확도가 지연 및 비용보다 더 중요한 가치가 있는 결정을 시작하는 것은 피하세요. 자연어 출력을 요구하거나 감사 가능한 설명이 필요한 작업도 피하세요: Jev는 결정과 확률을 반환하며, 추론 내러티브는 반환하지 않습니다.
2단계: 상태 및 질문 정의하기
상태에 결정에 필요한 증거를 포함하되, 정책은 애플리케이션 코드에 유지하세요. 가능한 경우 광범위한 요청을 독립적인 질문으로 분해하세요.
지원 워크플로의 경우, 하나의 요청은 다음과 같은 질문을 할 수 있습니다:
- 어떤 큐가 티켓을 받아야 하나요?
- 문제의 심각도는 얼마나 되나요?
- 메시지가 남용을 암시하나요?
- 인간 검토가 필요하나요?
옵션 목록이 모든 실제 사례를 포함하지 않을 수 있는 경우 unknown 또는 none_of_the_above 를 추가하세요. 탈출 경로가 없으면, 닫힌 분류기는 유효하지만 잠재적으로 오해의 소지가 있는 레이블을 선택해야 합니다.
3단계: LangChain을 통해 Jev 호출하기
통합을 설치하고 환경 또는 비밀 관리자를 통해 API 키를 제공하세요:
pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"
그런 다음 유형화된 질문을 생성하세요:
from langchain_typesafe import Noul, TypeSafeClassifier
classifier = TypeSafeClassifier()
response = classifier.invoke(
state=(
"배포가 두 번 실패했고 고객이 500 오류를 보고 있습니다. "
"누군가 지금 확인할 수 있나요?"
),
questions={
"urgent": Noul(
instructions="지금 주의가 필요합니까?"
),
},
)
urgency = response.nouls["urgent"].noul
결과는 귀하의 정책이 임계값과 비교할 수 있는 확률입니다. 그것은 스스로 실행하라는 지시가 아닙니다.
4단계: 에스컬레이션 정책 구축하기
단일 보편적 컷오프 대신 여러 밴드를 사용하세요:
높은 신뢰도 + 낮은 결과 -> 자동 작업
중간 신뢰도 -> LLM 검증
낮은 신뢰도 -> 인간 검토
어떤 점수에서든 높은 결과 -> 더 강한 제어 또는 승인
행동별로 임계값을 설정하세요. 티켓 레이블을 자동으로 할당하고 결제를 자동으로 승인하는 것은 두 가지가 모두 확률을 사용한다고 해서 동일한 위험 정책을 공유해서는 안 됩니다.
5단계: 라우팅 및 가드레일을 신중하게 사용하기
LangChain의 실험적인 ModelRouterMiddleware 는 Jev를 사용하여 간단한 작업을 빠른 모델로 보내고 복잡하거나 고위험 작업을 더 능력 있는 모델로 보낼 수 있습니다. 이는 모든 요청을 가장 저렴한 옵션을 통해 강제로 처리하지 않고 전체 모델 사용을 줄일 수 있습니다.
실험적인 AutoModeMiddleware 는 Jev를 도구 호출 위험 검사에 적용하고 실행 전에 제안된 호출을 차단할 수 있습니다. 민감한 도구 주변에 결정론적 제어를 유지하세요: 허용 목록, 샌드박스, 범위 제한 자격 증명, 속도 제한 및 인간 승인은 여전히 필요합니다. 분류기가 잘못된 부정 결과를 생성할 수 있기 때문입니다.
6단계: 자신의 데이터로 평가하기
TypeSafe는 70–500 ms의 종단 간 대기 시간, 백만 개 입력 토큰당 $0.042 및 무제한 출력을 보고합니다. 네 가지 워크플로 평가에서 Jev는 약 $0.0004 및 샘플당 0.4초에 대해 참조 확률과 평균 67.8%의 일치를 보고합니다. 동일한 하네스는 $0.0304 및 10.1초에 대해 GPT-5.6 Terra에 대해 67.9%, $0.0836 및 23.3초에 대해 GPT-5.6 Sol에 대해 74.1%를 보고합니다.
이들은 공급업체에서 발표한 결과이며, 보편적인 예측이 아닙니다. 참조는 인간 레이블 진실이 아닌 GPT-6 Astra 및 Fable 5.1의 평균 예측입니다. TypeSafe는 가능한 워크플로 작성자 편향을 언급하며, 가장 큰 헤드라인 속도 및 비용 이득은 실제 세계 개선의 높은 끝에서 발생할 가능성이 높다고 말합니다.
생산 전에 Jev를 현재 LLM, 간단한 규칙 및 실용적인 도메인 특정 모델과 비교하세요. 측정하세요:
- 클래스별 정확도, 정밀도 및 재현율.
- 보정 및 신뢰 오류율.
- 자제 및 에스컬레이션 비율.
- 배포 지역에서의 p50, p95 및 p99 대기 시간.
- 전체 캐스케이드의 종단 간 비용, 대체를 포함하여.
- 분포 변화 및 적대적 입력에서의 성능.
7단계: 운영 안전 장치 추가하기
생산 준비는 모델 품질 이상의 것을 요구합니다:
- 상태 버전, 질문 스키마, 확률, 신뢰도, 선택된 분기 및 이후 결과를 기록하세요.
- 프롬프트 또는 질문 지침 및 결정 임계값의 버전을 관리하세요.
- 타임아웃, 제한된 재시도, 회로 차단기 및 결정론적 대체를 추가하세요.
- 높은 신뢰도 오류를 별도로 검토하세요; 이는 가장 위험한 자동화 실패입니다.
- 드리프트를 모니터링하고 입력 집단이 변경됨에 따라 임계값을 재조정하세요.
- 되돌릴 수 없는 또는 규제된 작업은 더 강력한 기술적 및 인간적 통제를 뒤에 두세요.
현재 공개 자료는 Jev의 매개변수 수, 상세 아키텍처, RLCD 보상 설계, 표준 보정 곡선, 생산 SLA 또는 p95/p99 서비스 대기 시간을 공개하지 않습니다. 이러한 격차는 가정이 아닌 평가 질문이 되어야 합니다.
Jev를 사용하지 말아야 할 때는 언제인가요?
대화, 요약, 코드 생성, 상세 설명 또는 장기적 추론이 필요한 경우 Jev를 기본 모델로 사용하지 마세요. 감사 가능한 근거가 필요한 고위험 프로세스의 단독 결정자로도 부적합합니다. 고정 도메인에서는 기존의 소형 분류기나 전문 재정렬기가 더 정확하거나 소유 비용이 적거나 검증하기 쉬울 수 있습니다.
자주 묻는 질문
Jev는 LLM인가요?
전통적인 채팅 모델의 의미에서는 아닙니다. 텍스트 또는 구조화된 상태를 소비하지만 생성된 산문 대신 미리 정의된 결정 유형을 반환합니다.
“환각 없음”이 Jev가 잘못될 수 없다는 의미인가요?
아니요. 출력 형태는 보장될 수 있지만 선택된 답변이 의미론적으로 잘못될 수 있습니다. 이 주장을 스키마 및 유형 오류에 대한 보호로 해석하세요.
Jev가 에이전트를 구동하는 모델을 대체하나요?
보통은 아닙니다. Jev는 빠른 구조적 결정을 위한 보완으로 더 잘 자리 잡고 있으며, LLM은 추론 및 언어를 처리하고, 코드나 인간은 정책 집행을 담당합니다.
RLCD란 무엇인가요?
TypeSafe는 이를 보정된 결정을 위한 강화 학습(Reinforcement Learning for Calibrated Decisions)으로 확장하며, 보고된 확률을 관찰된 정확성과 일치시키는 것을 목표로 합니다. 공개된 출처는 독립적인 기술 감사에 대한 충분한 훈련 세부정보나 표준 보정 증거를 아직 제공하지 않습니다.
무엇을 먼저 프로토타입해야 하나요?
이미 LLM을 통해 실행되고 있는 고용량의 되돌릴 수 있는 분류 중 하나를 선택하세요. Jev를 그림자 모드에서 실행하고, 레이블이 지정된 결과와 결정을 비교하며, 임계값과 대체가 검증된 후에만 자동화를 도입하세요.
하나의 측정 가능한 결정으로 시작하기
Jev의 가장 강력한 제안은 “모든 LLM을 대체하라”가 아닙니다. “이미 알려진 형태의 결정을 생성하기 위해 생성 모델에 비용을 지불하는 것을 중단하라”입니다. 에이전트 하네스의 한 분기를 선택하고, 허용 가능한 오류 및 에스컬레이션 정책을 정의하고, 자신의 트래픽에 대해 테스트하세요.
TypeSafe AI의 시스템 1 모델 및 Jev 소개 를 원래 모델 주장 및 주의 사항에 대해 참고하고, LangChain의 Jev로 하네스를 구축하는 가이드 를 Python 통합 및 미들웨어 패턴에 대해 참고하세요.
AIHubMix와 함께 Jev 사용 시작하기
AIHubMix는 Jev에 대한 지원을 추가하여 개발자가 다른 주요 AI 모델과 함께 새로운 결정 모델에 접근할 수 있는 한 곳을 제공합니다.
AIHubMix 를 방문하여 Jev를 사용해 보고, 워크플로의 알려진 분기를 측정 가능한 실험으로 전환하세요. 되돌릴 수 있는 분류 또는 점수 매기기 작업으로 시작하고, 성공 임계값을 정의하며, 결과를 평가하는 동안 LLM 또는 인간 대체를 유지하세요.



