AIHubMix vận hành một mạng lưới tăng tốc toàn cầu tự xây dựng cho lưu lượng API. Sau khi đánh giá các nhà cung cấp tăng tốc bên thứ ba và nhận thấy độ trễ và độ ổn định của họ không đủ cho các khối lượng công việc AI sản xuất, chúng tôi đã triển khai các nút biên riêng, hệ thống giám sát và lập lịch lưu lượng. Bài viết này mô tả các kết quả đo được và kiến trúc đứng sau chúng.
Kết quả đo được
Các số liệu sau đây đến từ việc giám sát sản xuất liên tục sau khi lặp lại thuật toán lập lịch.

Độ trễ phản hồi giảm 75%
Độ trễ API từ đầu đến cuối giảm trung bình 75%. Trong các kịch bản phát trực tuyến, điều này chủ yếu cải thiện thời gian đến token đầu tiên (TTFT), khoảng thời gian giữa việc gửi yêu cầu và nhận token đầu ra đầu tiên, điều này xác định cảm giác phản hồi của một ứng dụng trò chuyện.
Biến động độ trễ giảm 60%
Biến động độ trễ từ yêu cầu đến yêu cầu giảm 60%. Độ trễ nhất quán rất quan trọng cho các ứng dụng sản xuất: nó giữ cho thời gian phản hồi của người dùng có thể dự đoán và giảm thời gian chờ độ trễ.
Tính khả dụng dịch vụ đạt 99.99%
Tính khả dụng đo được trên lưu lượng sản xuất đạt 99.99%. Đây là một con số đo được bao gồm tất cả các giờ, bao gồm cả cuối tuần và ngày lễ.
Kiến trúc
Các nút biên tự xây dựng
Mạng lưới hoạt động trên các nút tăng tốc chuyên dụng được triển khai trên nhiều khu vực, độc lập với bất kỳ nhà cung cấp đường truyền hoặc đám mây nào. Mỗi nút phải vượt qua các tiêu chuẩn về độ trễ, mất gói và tải đỉnh trước khi vào sản xuất; các nút không đạt tiêu chuẩn sẽ bị loại bỏ khỏi nhóm. Lập lịch chọn con đường nhanh nhất có sẵn cho mỗi cuộc gọi API.
Giám sát sức khỏe với các kiểm tra theo phút
Các kiểm tra phân tán ở nhiều khu vực thực hiện kiểm tra sức khỏe đầu cuối trên mỗi nút mỗi phút, bao gồm ba khía cạnh: độ trễ, tỷ lệ thành công và độ ổn định. Toàn bộ mạng lưới được quét mỗi 60 giây, vì vậy các bất thường của nút được phát hiện trong một chu kỳ kiểm tra.
Lập lịch lưu lượng với chuyển đổi tự động khi gặp sự cố
Hệ thống lập lịch tính toán lại điểm sức khỏe cho mỗi nút mỗi phút, dựa trên dữ liệu kiểm tra từ bốn cửa sổ trượt: 1 phút, 5 phút, 15 phút và 1 giờ. Lưu lượng được định tuyến đến nút có điểm số tốt nhất hiện tại. Khi một nút bị suy giảm, việc chuyển đổi sang một nút khỏe mạnh hoàn tất trong mili giây mà không cần can thiệp của con người.
Hoạt động tự động
Quản lý nút, tối ưu hóa lộ trình, triển khai cấu hình, xoay vòng chứng chỉ và phục hồi sự cố đều được tự động hóa. Việc xử lý sự cố không phụ thuộc vào thời gian phản hồi của nhân viên trực: các nút bị suy giảm sẽ bị loại bỏ khỏi vòng quay bởi hệ thống lập lịch ngay khi các kiểm tra phát hiện bất thường.

Điều này có nghĩa gì cho ứng dụng của bạn
- Thời gian đến token đầu tiên (TTFT) thấp hơn và nhất quán hơn trong các phản hồi phát trực tuyến.
- Ít lỗi thời gian chờ và đỉnh độ trễ dưới tải.
- Không cần thay đổi tích hợp: việc tăng tốc tự động áp dụng cho các điểm cuối API tiêu chuẩn.
Câu hỏi thường gặp
Tôi có cần thay đổi tích hợp của mình để hưởng lợi từ mạng lưới tăng tốc không?
Không. Việc tăng tốc áp dụng ở lớp đầu vào của nền tảng. Các điểm cuối API, khóa và định dạng yêu cầu hiện có vẫn hoạt động không thay đổi.
Tần suất kiểm tra sức khỏe của nút là bao nhiêu?
Các kiểm tra phân tán quét mỗi nút trong mạng lưới mỗi 60 giây, đo độ trễ, tỷ lệ thành công và độ ổn định từ đầu đến cuối.
Điều gì xảy ra khi một nút bị suy giảm?
Hệ thống lập lịch tính toán lại điểm sức khỏe mỗi phút từ bốn cửa sổ trượt (1 phút, 5 phút, 15 phút, 1 giờ) và tự động chuyển lưu lượng đến các nút khỏe mạnh. Việc chuyển đổi hoàn tất trong mili giây.
Cập nhật lần cuối: 2026-06-01