Giải thích về Jev: Cách thêm quyết định nhanh chóng, có kiểu cho một tác nhân AI

AIHubMixĐọc 6 phút
Giải thích về Jev: Cách thêm quyết định nhanh chóng, có kiểu cho một tác nhân AI

Jev được hiểu tốt nhất như một lớp quyết định cho phần mềm. Nó đọc văn bản hoặc trạng thái có cấu trúc và trả về các phân loại, điểm số và xác suất có hoặc không đã được định nghĩa trước. Nó không viết câu trả lời cho người dùng. Giao diện hẹp hơn đó khiến nó có liên quan đến việc định tuyến khối lượng lớn, phân loại, xác minh và các bước bảo vệ bên trong các tác nhân AI.

Mô hình thực tiễn rất đơn giản: để Jev đưa ra những phán quyết thường xuyên, có thể đảo ngược; để mã doanh nghiệp thực thi chính sách; nâng cao các trường hợp không chắc chắn hoặc có hậu quả đến một LLM có khả năng hoặc một con người.

Nếu Jev là mới đối với bạn, lời giải thích ngắn gọn nhất là: Jev là một mô hình quyết định AI mới được phát hành từ TypeSafe AI, hoạt động giống như một câu lệnh ngữ nghĩa if hơn là một chatbot. Bạn cung cấp ngữ cảnh và một tập hợp câu hỏi cố định; nó trả về các lựa chọn có kiểu, điểm số và xác suất mà mã ứng dụng có thể sử dụng ngay lập tức.

Jev là gì?

TypeSafe AI gọi Jev là Mô hình Hệ thống Một đầu tiên của họ, vay mượn khía cạnh “nhanh” của sự phân biệt Hệ thống 1/Hệ thống 2. Một yêu cầu cung cấp trạng thái chương trình và các câu hỏi có kiểu. Jev đánh giá các câu hỏi song song và trả về xác suất và giá trị độ tin cậy mà phần mềm có thể tiêu thụ trực tiếp.

Các loại câu hỏi có sẵn là:

  1. Noul cho xác suất rằng một câu có hoặc không là đúng.
  2. Choice cho việc chọn giữa các tùy chọn đã được định nghĩa trước, với một phân phối xác suất và độ tin cậy.
  3. Score cho việc đánh giá các mức độ đã được sắp xếp, với một điểm số, phân phối cơ bản và độ tin cậy.

Khác với một LLM tự hồi tiếp, Jev không tạo ra các chuỗi tùy ý. TypeSafe cho biết điều này đảm bảo việc khớp lược đồ: phản hồi không thể phát minh ra một trường hoặc trả về kiểu dữ liệu sai. Nó vẫn có thể chọn câu trả lời hợp lệ sai, vì vậy an toàn kiểu không nên được trình bày như là sự không thể sai về ngữ nghĩa.

Jev phù hợp ở đâu trong kiến trúc tác nhân?

Sử dụng Jev giữa các thay đổi trạng thái, khi hệ thống cần một phán quyết có giới hạn:

Kết quả người dùng hoặc công cụ
    -> Jev: phân loại, điểm số, định tuyến, hoặc kiểm tra rủi ro
        -> chính sách ứng dụng
            -> thực hiện hành động có rủi ro thấp
            -> gọi một LLM để lý luận hoặc ngôn ngữ
            -> yêu cầu xem xét của con người

Điều này bổ sung cho một LLM. LLM xử lý lý luận mở, giải thích và nội dung được tạo ra. Jev xử lý các câu hỏi lặp đi lặp lại mà các câu trả lời có thể biết trước.

Chọn lớp phù hợp cho mỗi công việc

Jev dễ hiểu nhất như một thành phần trong một ngăn xếp tự động hóa lớn hơn:

LớpTốt nhất cho
JevPhân loại lặp lại, điểm số, định tuyến và kiểm tra rủi ro
LLMLý luận phức tạp, giải thích và tạo văn bản
Mã ứng dụngQuy tắc xác định, quyền hạn và thực thi
Người xem xétCác trường hợp có rủi ro cao, không rõ ràng hoặc đặc biệt

Sự phân chia này là ý tưởng sản phẩm đằng sau Jev: mô hình không quyết định mọi thứ và không cần phải nói mọi thứ. Nó biến ngữ cảnh ngữ nghĩa mờ thành một tín hiệu xác suất có kiểu, trong khi hệ thống xung quanh vẫn chịu trách nhiệm về chính sách và hành động.

Bước 1: chọn quy trình làm việc đầu tiên phù hợp

Bắt đầu với một quyết định hiện có, khối lượng lớn đã sử dụng một LLM cộng với đầu ra có cấu trúc. Các ứng viên tốt bao gồm định tuyến vé hỗ trợ, kiểm tra chất lượng nội dung, xem xét dấu vết tác nhân, phân loại tài liệu và chọn mô hình.

Tránh bắt đầu với một quyết định không thể đảo ngược, nhạy cảm về mặt pháp lý, hoặc có giá trị đủ lớn mà độ chính xác tối đa quan trọng hơn độ trễ và chi phí. Cũng tránh các nhiệm vụ yêu cầu đầu ra ngôn ngữ tự nhiên hoặc một giải thích có thể kiểm toán: Jev trả về các quyết định và xác suất, không phải một câu chuyện lý luận.

Bước 2: xác định trạng thái và câu hỏi

Đảm bảo trạng thái chứa bằng chứng cần thiết cho quyết định, nhưng giữ chính sách trong mã ứng dụng. Phân tích một yêu cầu rộng thành các câu hỏi độc lập bất cứ khi nào có thể.

Đối với một quy trình làm việc hỗ trợ, một yêu cầu có thể hỏi:

  • Hàng đợi nào nên nhận vé?
  • Vấn đề nghiêm trọng đến mức nào?
  • Thông điệp có gợi ý về lạm dụng không?
  • Có cần xem xét của con người không?

Thêm unknown hoặc none_of_the_above khi danh sách tùy chọn của bạn có thể không bao gồm mọi trường hợp thực tế. Nếu không có lối thoát, một bộ phân loại đóng phải chọn một nhãn hợp lệ nhưng có thể gây hiểu lầm.

Bước 3: gọi Jev thông qua LangChain

Cài đặt tích hợp và cung cấp khóa API thông qua môi trường hoặc trình quản lý bí mật của bạn:

pip install langchain-typesafe
export TYPESAFE_API_KEY="your-api-key"

Sau đó tạo một câu hỏi có kiểu:

from langchain_typesafe import Noul, TypeSafeClassifier

classifier = TypeSafeClassifier()

response = classifier.invoke(
    state=(
        "Việc triển khai đã thất bại hai lần và khách hàng đang thấy lỗi 500. "
        "Có ai đó có thể xem ngay không?"
    ),
    questions={
        "urgent": Noul(
            instructions="Điều này có cần chú ý ngay bây giờ không?"
        ),
    },
)

urgency = response.nouls["urgent"].noul

Kết quả là một xác suất mà chính sách của bạn có thể so sánh với một ngưỡng. Nó không phải là một chỉ dẫn để thực hiện tự nó.

Bước 4: xây dựng chính sách nâng cao

Sử dụng nhiều băng thay vì một ngưỡng chung:

độ tin cậy cao + hậu quả thấp -> hành động tự động
độ tin cậy trung bình                -> xác minh LLM
độ tin cậy thấp                   -> xem xét của con người
hậu quả cao ở bất kỳ điểm số nào    -> kiểm soát hoặc phê duyệt mạnh mẽ hơn

Đặt ngưỡng cho mỗi hành động. Việc tự động gán nhãn vé và tự động phê duyệt một khoản thanh toán không bao giờ nên chia sẻ cùng một chính sách rủi ro chỉ vì cả hai đều sử dụng xác suất.

Bước 5: sử dụng định tuyến và các biện pháp bảo vệ một cách cẩn thận

Middleware ModelRouterMiddleware thí nghiệm của LangChain có thể sử dụng Jev để gửi công việc đơn giản đến một mô hình nhanh và công việc phức tạp hoặc có rủi ro cao đến một mô hình có khả năng hơn. Điều này có thể giảm việc sử dụng mô hình đầy đủ mà không buộc mọi yêu cầu phải đi qua tùy chọn rẻ nhất.

Middleware AutoModeMiddleware thí nghiệm của nó áp dụng Jev cho các kiểm tra rủi ro gọi công cụ và có thể chặn một cuộc gọi đề xuất trước khi thực hiện. Giữ các kiểm soát xác định xung quanh các công cụ nhạy cảm: danh sách cho phép, cách ly, thông tin xác thực có phạm vi, giới hạn tỷ lệ và phê duyệt của con người vẫn cần thiết vì một bộ phân loại có thể tạo ra các kết quả âm tính giả.

Bước 6: đánh giá trên dữ liệu của riêng bạn

TypeSafe báo cáo độ trễ từ đầu đến cuối từ 70–500 ms, $0.042 cho mỗi triệu token đầu vào và đầu ra không giới hạn. Trong bốn đánh giá quy trình làm việc của nó, nó báo cáo Jev trung bình đạt 67.8% sự đồng thuận với các xác suất tham chiếu ở khoảng $0.0004 và 0.4 giây cho mỗi mẫu. Bộ dụng cụ tương tự báo cáo 67.9% cho GPT-5.6 Terra ở $0.0304 và 10.1 giây, và 74.1% cho GPT-5.6 Sol ở $0.0836 và 23.3 giây.

Đây là kết quả được nhà cung cấp công bố, không phải dự đoán phổ quát. Tham chiếu là dự đoán trung bình của GPT-6 Astra và Fable 5.1 thay vì sự thật được gán nhãn bởi con người. TypeSafe lưu ý rằng có thể có sự thiên lệch của tác giả quy trình làm việc và cho biết rằng những lợi ích lớn nhất về tốc độ và chi phí có thể xảy ra ở đầu cao của những cải tiến trong thế giới thực.

Trước khi sản xuất, so sánh Jev với LLM hiện tại của bạn, các quy tắc đơn giản và một mô hình chuyên biệt trong trường hợp thực tế. Đo lường:

  • Độ chính xác, độ chính xác và độ hồi tưởng theo lớp.
  • Độ hiệu chỉnh và tỷ lệ lỗi tự tin.
  • Tỷ lệ từ chối và nâng cao.
  • Độ trễ p50, p95 và p99 từ khu vực triển khai của bạn.
  • Chi phí từ đầu đến cuối của toàn bộ chuỗi, bao gồm cả các phương án dự phòng.
  • Hiệu suất dưới sự thay đổi phân phối và đầu vào đối kháng.

Bước 7: thêm các biện pháp bảo vệ hoạt động

Chuẩn bị sản xuất yêu cầu nhiều hơn chất lượng mô hình:

  • Ghi lại phiên bản trạng thái, lược đồ câu hỏi, xác suất, độ tin cậy, nhánh đã chọn và kết quả sau đó.
  • Phiên bản các nhắc nhở hoặc hướng dẫn câu hỏi và ngưỡng quyết định.
  • Thêm thời gian chờ, thử lại có giới hạn, bộ ngắt mạch và một phương án dự phòng xác định.
  • Xem xét các lỗi có độ tin cậy cao một cách riêng biệt; chúng là những lỗi tự động hóa nguy hiểm nhất.
  • Theo dõi sự trôi dạt và hiệu chỉnh ngưỡng khi dân số đầu vào thay đổi.
  • Giữ các hành động không thể đảo ngược hoặc được quy định phía sau các kiểm soát kỹ thuật và con người mạnh mẽ hơn.

Tài liệu công khai hiện không tiết lộ số lượng tham số của Jev, kiến trúc chi tiết, thiết kế phần thưởng RLCD, đường cong hiệu chuẩn tiêu chuẩn, SLA sản xuất hoặc độ trễ dịch vụ p95/p99. Những khoảng trống đó nên trở thành các câu hỏi đánh giá, không phải giả định.

Khi nào bạn không nên sử dụng Jev?

Không sử dụng Jev như mô hình chính khi bạn cần hội thoại, tóm tắt, tạo mã, giải thích chi tiết hoặc lý luận dài hạn. Nó cũng không phải là người ra quyết định duy nhất tốt cho các quy trình có rủi ro cao yêu cầu một lý do có thể kiểm toán. Trong một miền cố định, một bộ phân loại nhỏ thông thường hoặc một bộ phân loại chuyên biệt có thể chính xác hơn, rẻ hơn để sở hữu hoặc dễ dàng để xác thực.

Câu hỏi thường gặp

Jev có phải là một LLM không?

Không theo nghĩa mô hình trò chuyện thông thường. Nó tiêu thụ trạng thái văn bản hoặc có cấu trúc nhưng trả về các loại quyết định đã được định nghĩa trước thay vì văn bản được tạo ra.

“Không có ảo giác” có nghĩa là Jev không thể sai không?

Không. Hình dạng đầu ra có thể được đảm bảo trong khi câu trả lời được chọn là sai về mặt ngữ nghĩa. Hiểu tuyên bố này như một sự bảo vệ chống lại các lỗi lược đồ và kiểu.

Jev có thay thế mô hình cung cấp năng lượng cho một tác nhân không?

Thường thì không. Nó được định vị tốt hơn như một bổ sung: Jev cho các quyết định có cấu trúc nhanh, một LLM cho lý luận và ngôn ngữ, và mã hoặc con người cho việc thực thi chính sách.

RLCD là gì?

TypeSafe mở rộng nó thành Học Tăng cường cho Các Quyết định Được Hiệu chỉnh, nhằm mục đích làm cho xác suất báo cáo phù hợp với độ chính xác quan sát được. Các nguồn công khai vẫn chưa cung cấp đủ chi tiết đào tạo hoặc bằng chứng hiệu chuẩn tiêu chuẩn cho việc kiểm toán kỹ thuật độc lập.

Tôi nên tạo mẫu gì trước?

Chọn một phân loại có khối lượng lớn, có thể đảo ngược đã chạy qua một LLM. Chạy Jev ở chế độ bóng, so sánh các quyết định với kết quả được gán nhãn, và giới thiệu tự động hóa chỉ sau khi các ngưỡng và phương án dự phòng được xác thực.

Bắt đầu với một quyết định có thể đo lường

Đề xuất mạnh nhất của Jev không phải là “thay thế mọi LLM.” Nó là “ngừng trả tiền cho một mô hình sinh để sản xuất các quyết định đã có hình dạng biết trước.” Chọn một nhánh trong bộ dụng cụ tác nhân của bạn, xác định lỗi chấp nhận được và chính sách nâng cao, và thử nghiệm nó với lưu lượng của riêng bạn.

Sử dụng TypeSafe AI’s giới thiệu về Mô hình Hệ thống Một và Jev để biết các tuyên bố và cảnh báo mô hình gốc, và LangChain’s hướng dẫn xây dựng một bộ dụng cụ với Jev để biết tích hợp Python và các mẫu middleware.

Bắt đầu sử dụng Jev với AIHubMix

AIHubMix đã thêm hỗ trợ cho Jev, cung cấp cho các nhà phát triển một nơi để truy cập mô hình quyết định mới bên cạnh các mô hình AI hàng đầu khác.

Truy cập AIHubMix để thử nghiệm Jev và biến một nhánh đã biết trong quy trình làm việc của bạn thành một thí nghiệm có thể đo lường. Bắt đầu với một nhiệm vụ phân loại hoặc điểm số có thể đảo ngược, xác định ngưỡng thành công của bạn, và giữ một LLM hoặc phương án dự phòng của con người trong khi bạn đánh giá kết quả.