Kết nối một LLM là đủ để làm cho một ứng dụng tạo ra văn bản. Nhưng điều đó không đủ để làm cho một AI agent hoàn thành một nhiệm vụ trong thế giới thực.
Yêu cầu một mô hình tóm tắt một tài liệu đã có trong ngữ cảnh của nó, và lớp mô hình là đủ. Yêu cầu nó so sánh giá cả của đối thủ hôm nay, làm phong phú hồ sơ công ty, kiểm tra tài khoản xã hội, hoặc chọn API tốt nhất cho một công việc chưa quen thuộc, và nửa còn lại bị thiếu trở nên rõ ràng: agent cần một cách đáng tin cậy để tiếp cận các hệ thống bên ngoài.
Một agent trong sản xuất do đó đưa ra hai quyết định riêng biệt:
- Mô hình nào nên xử lý bước này?
- Công cụ hoặc API nào nên cung cấp dữ liệu hoặc hành động?
AIHubMix giải quyết quyết định đầu tiên với truy cập mô hình thống nhất và định tuyến mô hình theo thời gian yêu cầu. Monid giải quyết quyết định thứ hai với khám phá công cụ trong thời gian chạy, kiểm tra sơ đồ và thực thi theo từng lần gọi. Các sản phẩm nằm trên các lớp khác nhau của cùng một kiến trúc.
Tiết lộ: Bài viết này được tạo ra như một phần của sự hợp tác nội dung với Monid. AIHubMix là nền tảng mô hình được thảo luận bên dưới; Monid là nền tảng công cụ. Mỗi cái có thể được sử dụng độc lập.
Hai vấn đề định tuyến bên trong một AI agent
Một lần chạy agent hiếm khi là một cuộc gọi mô hình đồng nhất. Một agent nghiên cứu có thể phân loại một yêu cầu, tìm kiếm thông tin hiện tại, trích xuất các sự kiện có cấu trúc, so sánh kết quả và viết một câu trả lời cuối cùng. Những bước đó yêu cầu các khả năng khác nhau.
Điều tương tự cũng đúng bên ngoài mô hình. Một nhiệm vụ nghiên cứu công ty có thể cần một API tìm kiếm hôm nay, một điểm cuối làm phong phú công ty vào ngày mai, và một công cụ tự động hóa trình duyệt vào tuần tới. Nếu mỗi mô hình và công cụ được mã hóa cứng tại thời điểm xây dựng, mỗi nhiệm vụ mới trở thành một dự án tích hợp.
Hai lớp này song song:
| Lớp mô hình | Lớp công cụ | |
|---|---|---|
| Quyết định cốt lõi | Mô hình nào nên trả lời? | API nào nên được gọi? |
| Thời gian lựa chọn | Theo yêu cầu | Theo nhiệm vụ, tại thời điểm chạy |
| Đầu vào | Yêu cầu, phương thức, nhu cầu về chất lượng và độ trễ | Mục tiêu, dữ liệu hoặc hành động cần thiết, sơ đồ và giá cả |
| Đầu ra | Một sự hoàn thành của mô hình | Dữ liệu bên ngoài hoặc một hành động đã thực thi |
| Ví dụ | AIHubMix | Monid |
Sự tách biệt này rất quan trọng. Một mô hình tốt hơn không thể tạo ra quyền truy cập vào dữ liệu trực tiếp, và một danh mục công cụ lớn hơn không thể lý luận về dữ liệu mà nó trả về. Agent cần cả hai khả năng, với một hợp đồng rõ ràng giữa chúng.
Monid trình bày cái nhìn bổ sung từ phía công cụ trong Tại sao một AI Agent cần hai tích hợp. Từ phía mô hình, bài học kiến trúc là giống nhau: giữ cho việc lựa chọn mô hình và lựa chọn công cụ độc lập, sau đó tối ưu hóa mỗi lớp cho công việc của riêng nó.
Tại sao một mô hình cố định trở nên đắt đỏ trong một vòng lặp agent
Sử dụng một mô hình ở mọi nơi trông có vẻ đơn giản. Trong thực tế, nó buộc mỗi bước phải chấp nhận cùng một sự đánh đổi giữa khả năng, độ trễ và giá cả.
Xem xét một agent nghiên cứu thị trường:
- Phân loại ý định là ngắn gọn và cơ học.
- Lựa chọn công cụ cần theo dõi hướng dẫn đáng tin cậy.
- Trích xuất các trường từ JSON trả về chủ yếu là chuyển đổi.
- Báo cáo cuối cùng có thể yêu cầu lý luận mạnh mẽ hơn và viết tốt hơn.
Gửi cả bốn bước đến mô hình có khả năng nhất lãng phí tiền cho công việc thường xuyên. Gửi cả bốn đến mô hình rẻ nhất có thể làm giảm chất lượng của đầu ra duy nhất mà người dùng đọc. Khi vòng lặp agent phát triển, sự thỏa hiệp đó được lặp lại trong mỗi cuộc gọi.
AIHubMix cung cấp một điểm cuối tương thích với OpenAI qua một danh mục mô hình rộng lớn. Một tích hợp SDK OpenAI hiện có có thể trỏ đến AIHubMix bằng cách thay đổi khóa API và base_url:
from openai import OpenAI
client = OpenAI(
api_key="<AIHUBMIX_API_KEY>",
base_url="https://aihubmix.com/v1",
)
response = client.chat.completions.create(
model="auto:balanced",
messages=[
{"role": "user", "content": "Phân loại yêu cầu này và đề xuất bước tiếp theo."}
],
)
Đặt model thành auto di chuyển việc lựa chọn mô hình vào đường dẫn yêu cầu. Bộ định tuyến phân tích nhiệm vụ và giải quyết nó thành một mô hình phù hợp. Một hậu tố chính sách làm cho mục tiêu tối ưu hóa trở nên rõ ràng:
| Giá trị Bộ định tuyến | Ưu tiên | Bước agent điển hình |
|---|---|---|
auto |
Chi phí trước | Công việc theo lô và chuyển đổi thường xuyên |
auto:balanced |
Khả năng, chi phí và độ trễ | Công việc agent đa mục đích |
auto:quality_first |
Khả năng trước | Lý luận phức tạp và sản phẩm cuối cùng |
auto:latency_critical |
Tốc độ trước | Các vòng lặp tương tác và lập kế hoạch nhẹ |
Định tuyến không thêm một khoản phí riêng biệt. Yêu cầu được tính phí theo giá niêm yết của mô hình thực sự đã xử lý nó. Mô hình đã được giải quyết và chi tiết định tuyến được công bố trong phản hồi, bao gồm tiêu đề X-Aihubmix-Router-Resolved-Model, vì vậy quyết định vẫn có thể quan sát được thay vì trở thành một hộp đen.
Hành vi đầy đủ, các điểm cuối được hỗ trợ, chính sách và các hạn chế hiện tại được tài liệu hóa trong hướng dẫn AIHubMix LLM Router.
Định tuyến mô hình không cung cấp dữ liệu trực tiếp cho agent
Sau khi định tuyến mô hình được cấu hình, agent có thể chọn một bộ não tốt hơn cho mỗi bước. Nó vẫn không thể biết điều gì đã thay đổi sau dữ liệu huấn luyện của mô hình, truy cập một hệ thống kinh doanh riêng tư, hoặc thực hiện một hành động trong một ứng dụng khác trừ khi một công cụ cung cấp khả năng đó.
Đây là nơi nhiều dự án agent tích lũy mã dễ bị hỏng. Một nhóm kết nối một API tìm kiếm, sau đó một API thu thập dữ liệu, rồi một API làm phong phú. Mỗi tích hợp giới thiệu một tài khoản khác, thông tin xác thực, định dạng yêu cầu, mô hình lỗi và mối quan hệ thanh toán khác nhau. Mô tả công cụ thường được sao chép vào một lời nhắc hệ thống và dần dần trở nên lỗi thời.
Chế độ thất bại là nguy hiểm vì nó có thể trông thành công. Một mô hình có thể tạo ra một cuộc gọi hợp lý chống lại một sơ đồ lỗi thời, nhận được một phản hồi không đầy đủ, và tiếp tục như thể nhiệm vụ đã thành công. Kiểm tra sơ đồ trong thời gian chạy an toàn hơn là yêu cầu mô hình nhớ một hợp đồng API từ quá trình huấn luyện hoặc từ một lời nhắc cũ.
Lớp công cụ do đó nên trả lời ba câu hỏi trước khi thực thi:
- Công cụ nào có thể đáp ứng mục tiêu này?
- Sơ đồ và giá nào áp dụng ngay bây giờ?
- Kết quả của cuộc gọi thực sự đã trả về gì?
Khám phá công cụ là lớp định tuyến thứ hai
Monid biến quyền truy cập công cụ thành một quy trình khám phá-kiểm tra-thực thi. Thay vì yêu cầu nhà phát triển dự đoán mọi API mà một agent có thể cần, agent có thể tìm kiếm một danh mục bằng ngôn ngữ tự nhiên, kiểm tra hợp đồng của một ứng viên, và thực hiện điểm cuối đã chọn.
Quy trình cơ bản trông như thế này:
# 1. Tìm các công cụ phù hợp với mục tiêu
monid discover -q "tìm giá sản phẩm hiện tại từ một trang web công khai"
# 2. Đọc sơ đồ và giá của điểm cuối đã chọn
monid inspect -p PROVIDER_SLUG -e ENDPOINT_PATH
# 3. Thực hiện chỉ sau khi agent đã kiểm tra hợp đồng
monid run -p PROVIDER_SLUG -e ENDPOINT_PATH \
--query '{"url":"https://example.com/product"}'
Khám phá và kiểm tra cho phép agent so sánh các tùy chọn trước khi chi tiêu bất kỳ điều gì. Việc thực thi được tính phí theo mô hình giá của điểm cuối đã chọn. Nhà phát triển giữ một tích hợp trong khi agent có quyền truy cập vào các công cụ từ nhiều nhà cung cấp khác nhau.
Đối với các thời gian chạy agent có thể đọc hướng dẫn thiết lập, Monid cũng xuất bản một kỹ năng có thể đọc được bằng máy:
Thiết lập https://monid.ai/SKILL.md
Tài liệu hướng dẫn quy trình Monid giải thích các giai đoạn danh mục, kiểm tra và thực thi chi tiết hơn.
Cách hai lớp hoạt động cùng nhau
Cổng mô hình và lớp công cụ nên giữ nguyên là các thành phần riêng biệt với một sự chuyển giao nhỏ, rõ ràng:
- Agent nhận được một mục tiêu từ người dùng.
- AIHubMix định tuyến một cuộc gọi lập kế hoạch đến một mô hình phù hợp.
- Kế hoạch xác định thông tin còn thiếu hoặc một hành động bên ngoài cần thiết.
- Monid khám phá các công cụ ứng viên và công bố sơ đồ và giá của chúng.
- Agent chọn và chạy một công cụ trong phạm vi quyền hạn và ngân sách của nó.
- Công cụ trả về các sự kiện hoặc kết quả hành động.
- AIHubMix định tuyến cuộc gọi tổng hợp theo chất lượng, chi phí hoặc độ trễ cần thiết.
- Agent trả về một câu trả lời dựa trên kết quả của công cụ.
Trong Python đơn giản hóa, các cuộc gọi từ phía mô hình có thể giữ nguyên trong khi kết quả công cụ được chèn vào như một ngữ cảnh:
from openai import OpenAI
client = OpenAI(
api_key="<AIHUBMIX_API_KEY>",
base_url="https://aihubmix.com/v1",
)
# Một mô hình nhanh là đủ cho một bước lập kế hoạch nhẹ.
plan = client.chat.completions.create(
model="auto:latency_critical",
messages=[
{
"role": "user",
"content": "Lập kế hoạch cách so sánh giá hiện tại của những sản phẩm này.",
}
],
)
# Agent của bạn sử dụng Monid để khám phá, kiểm tra và chạy một công cụ phù hợp.
# Thay thế các chỗ giữ chỗ này bằng kết quả có cấu trúc được trả về bởi cuộc gọi đó.
tool_result = {
"source": "<source-url>",
"data": "<structured-tool-result>",
}
report = client.chat.completions.create(
model="auto:quality_first",
messages=[
{
"role": "system",
"content": (
"Viết một so sánh ngắn gọn. Chỉ sử dụng kết quả công cụ đã cung cấp, "
"giữ nguyên các URL nguồn, và nêu rõ khi một giá trị bị thiếu."
),
},
{"role": "user", "content": str(tool_result)},
],
)
Chi tiết quan trọng không phải là số lượng dòng. Mà là không lựa chọn nào cần phải được nhúng vĩnh viễn trong logic ứng dụng. Mô hình có thể thay đổi khi lời nhắc thay đổi, và công cụ có thể thay đổi khi nhiệm vụ thay đổi.
Kiểm soát chi phí thuộc về cả hai lớp
Chi phí mô hình và công cụ sử dụng các đơn vị khác nhau, vì vậy chúng nên được đo lường riêng biệt.
Tại lớp mô hình, mô hình đã được giải quyết xác định giá token. AIHubMix làm cho quyết định đó có thể theo dõi và cho phép các nhà phát triển chọn một chính sách định tuyến hoặc hạn chế các mô hình mà một khóa API được phép sử dụng. Các bước thường xuyên có thể ưu tiên chi phí hoặc độ trễ, trong khi các đầu ra hướng đến người dùng có thể ưu tiên chất lượng.
Tại lớp công cụ, một điểm cuối có thể tính phí theo cuộc gọi hoặc theo kết quả. Monid công bố giá trong quá trình kiểm tra, trước khi thực thi. Một agent có thể từ chối một điểm cuối vượt quá ngân sách của nó, ưu tiên một tùy chọn đã được xác minh, hoặc yêu cầu phê duyệt trước khi thực hiện một thao tác bất thường đắt đỏ.
Các kiểm soát sản xuất hữu ích bao gồm:
- Một danh sách cho phép mô hình hoặc trần giá cho mỗi khóa API.
- Một ngân sách tối đa cho cuộc gọi công cụ theo nhiệm vụ.
- Danh sách cho phép nhà cung cấp hoặc điểm cuối cho dữ liệu được quản lý.
- Nhật ký kết nối quyết định định tuyến mô hình với cuộc gọi công cụ và câu trả lời cuối cùng.
- Xác nhận rõ ràng trước khi thực hiện các hành động không thể đảo ngược hoặc nhạy cảm.
- Xác thực đầu ra để dữ liệu công cụ được coi là đầu vào không đáng tin cậy, không phải là hướng dẫn.
Sự tách biệt này cũng làm cho việc gỡ lỗi chi phí dễ dàng hơn. Nếu một lần chạy trở nên đắt đỏ, nhật ký token cho thấy liệu agent đã lý luận quá nhiều, trong khi nhật ký công cụ cho thấy liệu nó đã lấy quá nhiều. Các giải pháp là khác nhau, và kiến trúc nên bảo tồn sự phân biệt đó.
Độ tin cậy yêu cầu các hợp đồng mới và quyết định rõ ràng
Việc lựa chọn động không nên có nghĩa là hành vi không thể đoán trước.
Ở phía mô hình, AIHubMix báo cáo mô hình đã được giải quyết và chính sách định tuyến cho mỗi yêu cầu. Tính nhất quán của mô hình có thể được duy trì qua các công việc nhiều lượt, trong khi hành vi dự phòng có thể chuyển hướng khỏi một mô hình không khỏe mạnh khi cần thiết.
Ở phía công cụ, agent kiểm tra sơ đồ điểm cuối hiện tại trước khi thực hiện một cuộc gọi trả phí. Kết quả khám phá bao gồm thông tin cần thiết để so sánh các ứng viên, và kết quả của cuộc gọi thực tế trở thành bằng chứng bên ngoài duy nhất được đưa vào hoàn thành cuối cùng.
Cùng nhau, những kiểm soát này tạo ra một dấu vết kiểm toán hữu ích:
mục tiêu người dùng
-> quyết định định tuyến và mô hình đã được giải quyết
-> các công cụ ứng viên đã được khám phá
-> sơ đồ và giá đã được kiểm tra
-> điểm cuối đã chọn và kết quả
-> quyết định mô hình cuối cùng và phản hồi dựa trên
Dấu vết đó có giá trị hơn việc chỉ có quyền truy cập vào nhiều mô hình hoặc nhiều API. Nó giải thích lý do tại sao agent đã đưa ra mỗi lựa chọn và bằng chứng nào đã hỗ trợ câu trả lời của nó.
Khi nào bạn không cần cả hai lớp
Không phải mọi quy trình làm việc đều hưởng lợi từ việc lựa chọn trong thời gian chạy.
Nếu một ứng dụng gửi một lời nhắc ổn định đến một mô hình đã được đánh giá, việc chỉ định mô hình đó trực tiếp đơn giản hơn và có thể dự đoán hơn là định tuyến. Nếu một pipeline theo lịch luôn gọi một API đã biết, việc tích hợp API đó trực tiếp có thể rõ ràng hơn là thêm một lớp khám phá.
Kiến trúc hai lớp xứng đáng có vị trí của nó khi sự đa dạng là một phần của khối lượng công việc:
- Các lời nhắc khác nhau đủ để mô hình tốt nhất thay đổi theo từng bước.
- Các agent thực hiện nhiều cuộc gọi mô hình và cần kiểm soát chi phí hoặc độ trễ tích lũy.
- Các công cụ cần thiết không thể được dự đoán hoàn toàn tại thời điểm xây dựng.
- Dữ liệu bên ngoài phải được cập nhật và nguồn của nó phải được nhìn thấy.
- Nhóm muốn thêm khả năng mà không cần thêm một tích hợp nhà cung cấp mới cho mỗi khả năng.
Sử dụng lớp mô hình, lớp công cụ, hoặc cả hai tùy theo các quyết định mà ứng dụng của bạn thực sự cần phải đưa ra.
Xây dựng agent dựa trên các quyết định, không phải phụ thuộc
Một AI agent trong sản xuất không được định nghĩa bởi số lượng mô hình hoặc API mà nó có thể tiếp cận. Nó được định nghĩa bởi việc nó có thể chọn khả năng đúng cho bước hiện tại, hoạt động trong ngân sách, và giải thích những gì đã xảy ra.
AIHubMix cung cấp cho agent một điểm cuối mô hình thống nhất và định tuyến theo thời gian yêu cầu qua các ưu tiên về chi phí, chất lượng và độ trễ. Monid cung cấp cho nó khám phá công cụ trong thời gian chạy, các sơ đồ hiện tại, giá cả rõ ràng, và thực thi qua các nhà cung cấp bên ngoài.
Một lớp quyết định cách agent suy nghĩ. Lớp kia quyết định cách nó tìm hiểu và hành động. Giữ cho những quyết định đó tách biệt tạo ra một agent dễ mở rộng, quan sát và kiểm soát hơn.
Bắt đầu với hướng dẫn nhanh AIHubMix, sau đó kết nối phía công cụ thông qua Monid.
Câu hỏi thường gặp
Định tuyến mô hình cho AI agents là gì?
Định tuyến mô hình chọn một mô hình cho mỗi yêu cầu dựa trên các yếu tố như loại nhiệm vụ, khả năng, chi phí và độ trễ. Với AIHubMix, việc đặt model thành auto hoặc một chính sách như auto:quality_first cho phép lựa chọn theo thời gian yêu cầu trong khi vẫn giữ API tương thích với OpenAI.
Tại sao một AI agent cần công cụ nếu LLM đã có kiến thức?
LLM tạo ra câu trả lời từ ngữ cảnh mà nó nhận được và những gì nó đã học được trong quá trình huấn luyện. Nó không thể biết một cách đáng tin cậy giá cả hiện tại, truy vấn một cơ sở dữ liệu riêng tư, hoặc thực hiện một hành động bên ngoài mà không có một công cụ kết nối. Các công cụ cung cấp dữ liệu trực tiếp và thực thi; mô hình lập kế hoạch và diễn giải kết quả.
Cổng mô hình có giống như một máy chủ MCP hoặc nền tảng công cụ không?
Không. Cổng mô hình định tuyến các yêu cầu suy diễn đến các mô hình. Các máy chủ MCP và nền tảng công cụ cung cấp các khả năng bên ngoài cho một agent. Chúng giải quyết các vấn đề tích hợp bổ sung và có thể được sử dụng cùng nhau.
AIHubMix và Monid có thể được sử dụng độc lập không?
Có. AIHubMix có thể định tuyến các cuộc gọi mô hình cho các ứng dụng không có yêu cầu công cụ động. Monid có thể cung cấp khám phá công cụ cho các agent sử dụng nhà cung cấp hoặc cổng mô hình khác. Sử dụng cả hai là hữu ích khi một agent cần lựa chọn trong thời gian chạy ở cả hai lớp.
Làm thế nào tôi có thể giữ cho việc định tuyến tự động có thể kiểm toán được?
Ghi lại mô hình đã được giải quyết, chính sách định tuyến, công cụ ứng viên, giá đã kiểm tra, điểm cuối đã chọn và kết quả trả về cho mỗi nhiệm vụ. AIHubMix công bố chi tiết định tuyến mô hình trong phản hồi, trong khi Monid tách biệt khám phá và kiểm tra khỏi thực thi để quyết định công cụ có thể được ghi lại trước cuộc gọi trả phí.




