Trong tháng này, AIHubMix đã thêm gần 30 mô hình mới trong các lĩnh vực trò chuyện, lập trình, âm thanh, hình ảnh và 3D, và ra mắt một số khả năng nền tảng bao gồm API tạo phương tiện, sửa chữa đầu ra có cấu trúc và API tạo 3D. Phạm vi các phương thức có sẵn thông qua một khóa API duy nhất tiếp tục mở rộng. Dưới đây là những điểm nổi bật.
API tạo phương tiện và tác vụ bất đồng bộ thống nhất
Các điểm cuối tạo phương tiện mới /ai/v1/images/generations và /ai/v1/images/edits hiện đã có sẵn, cùng với các tác vụ bất đồng bộ thống nhất, truy vấn kết quả, tải xuống tài liệu và gọi lại webhook. Quy trình làm việc với hình ảnh và video có thể tích hợp thông qua cùng một vòng đời tác vụ, giúp dễ dàng theo dõi kết quả tạo lâu dài. Các tài liệu được tạo hỗ trợ tải xuống trực tiếp và lấy theo lô. Xem Tác vụ bất đồng bộ.
Sửa chữa đầu ra có cấu trúc
Một khả năng sửa chữa đầu ra có cấu trúc ở cấp khóa mới hiện có sẵn, mặc định bị tắt. Khi được bật, đối với các yêu cầu không phát trực tiếp mà khai báo đầu ra JSON có cấu trúc, khi mô hình trả về JSON với lỗi định dạng như cắt ngắn, dấu phẩy thừa hoặc bao bọc khối mã, nền tảng sẽ tự động sửa chữa nó thành JSON hợp lệ có thể phân tích trước khi trả về. Các giá trị không thay đổi và không cần thay đổi gì từ phía khách hàng. Nó hỗ trợ các giao thức Chat Completions, Responses, Claude và Gemini, và các phản hồi đã sửa chữa mang theo tiêu đề X-JSON-Repaired: true. Xem Sửa chữa đầu ra có cấu trúc.
API tạo 3D
API tạo 3D bất đồng bộ mới /v1/3d/generations ra mắt với Tencent Hunyuan 3D (hy-3d-3.1) là mô hình được hỗ trợ đầu tiên. Nó bao gồm văn bản thành 3D, hình ảnh thành 3D và đầu vào đa góc nhìn, với các tài liệu ở định dạng obj, glb, stl, usdz và fbx cùng với vật liệu PBR, phù hợp cho trò chơi, hiển thị thương mại điện tử, in 3D và thiết kế sản phẩm. Xem API tạo 3D.
Máy chủ MCP chính thức của AIHubMix
Điểm truy cập chính thức cho các khách hàng MCP hiện đã hoạt động: mcp.aihubmix.com/mcp (sao lưu: mcp.inferera.com/mcp). Kết nối nó trong Claude Code, Codex, Cursor và các công cụ khác để truy vấn mô hình và giá cả, tìm kiếm tài liệu, kiểm tra số dư của bạn và gọi các công cụ trò chuyện, tạo hình ảnh và tạo video.
Tìm kiếm Jina và đọc web
Các khả năng Tìm kiếm và Đọc Jina mới cho phép bạn lấy kết quả tìm kiếm và nội dung trang web với khóa API AIHubMix của bạn, phù hợp cho việc truy xuất thông tin bên ngoài, đọc tài liệu và gọi công cụ đại lý. Cả hai đều hỗ trợ các yêu cầu POST, và Reader cũng chấp nhận tải lên nhiều phần của các tệp cục bộ như PDF, Word, Excel, PPT, HTML và hình ảnh. Xem Jina AI.
Cập nhật tính năng khác
- Tạo âm thanh Qwen TTS:
qwen-audio-3.0-tts-plusvàqwen-audio-3.0-tts-flashcó thể được gọi thông qua/v1/audio/speech. Các yêu cầu không phát trực tiếp trả về liên kết kết quả âm thanh, các yêu cầu phát trực tiếp trả về sự kiện tạo âm thanh SSE, với hỗ trợ cho các thẻ cảm xúc và hướng dẫn giọng nói bằng ngôn ngữ tự nhiên. Xem TTS. - Tài liệu bộ nhớ đệm GPT: bắt đầu từ dòng GPT-5.6, các ghi bộ nhớ đệm được tính phí ở mức 1.25x giá đầu vào, các đọc bộ nhớ đệm ở mức 0.1x, và bộ nhớ đệm được giữ ít nhất 30 phút. Bao gồm chi tiết tham số
prompt_cache_keyvà xử lý sự cố khi trúng bộ nhớ đệm. Xem Bộ nhớ đệm GPT. - Veo 3.1 hình ảnh thành video hỗ trợ khung đầu/cuối và hình ảnh tham chiếu: điều khiển các cảnh mở đầu và kết thúc, tham chiếu nhân vật và tham chiếu phong cách với độ chính xác cao hơn. Xem Tạo video.
- Cầu nối phản hồi tự động cho các cuộc gọi công cụ gpt-5.5 và cao hơn: các yêu cầu gửi qua
/v1/chat/completionsvới các công cụ vàreasoning_efforttự động sử dụng khả năng Phản hồi, mang lại cho các khách hàng hiện tại khả năng gọi công cụ đáng tin cậy hơn mà không cần thay đổi gì. Xem API Phản hồi. - Các điểm cuối gốc Gemini đã hoàn thành: SDK
@google/genaihiện hỗ trợ các bộ nhớ gốc, tương tác và bộ nhớ ngữ cảnh khi được gọi qua AIHubMix. Xem SDK Gốc Gemini. - Kết nối phát trực tiếp được mở rộng đến 2 giờ: thời gian kết nối phát trực tiếp tối đa đã được mở rộng từ 1 giờ lên 2 giờ, vì vậy các tác vụ suy nghĩ lâu dài và tạo lâu dài ít có khả năng bị cắt ngắn sớm hơn.
- Truyền tham số hình ảnh Gemini: khi gọi các mô hình đầu ra hình ảnh Gemini thông qua API tương thích với OpenAI,
aspectRatiovàimageSizecó thể được truyền vàoextra_body.generationConfig.imageConfig. - Đầu ra có cấu trúc trên các giao thức:
response_formattương thích với OpenAI vàoutput_config.formatgốc Claude hiện đã thích ứng theo cả hai hướng trên các đường dẫn liên quan. Xem Đầu ra có cấu trúc.
Độ ổn định và sửa lỗi
- Cải tiến khả năng tương thích đa giao thức: Các trường phản hồi tin nhắn, tham số suy nghĩ, tham số
stopvà cấu trúc phản hồi cuộc gọi công cụ được điều chỉnh thêm với từng hệ sinh thái giao thức. - Cải tiến độ tin cậy phát trực tiếp: sửa lỗi đầu ra phát trực tiếp bị cắt ngắn và phản hồi bị phân loại sai là trống rỗng cho một số mô hình, với các bản ghi sử dụng đầy đủ hơn khi khách hàng ngắt kết nối.
- Cải tiến độ chính xác đo lường và tính phí bộ nhớ đệm, vì vậy chi tiết tính phí phản ánh tốt hơn việc sử dụng thực tế.
- Các thông báo lỗi rõ ràng hơn: các lỗi xác thực tham số trả về sớm hơn, và các lỗi cho các mô hình không xác định và hạn ngạch khóa đã cạn kiệt rõ ràng hơn.
Các mô hình mới trong tháng này (gần 30)
Trò chuyện / chung
- claude-opus-5: Mô hình hàng đầu của Anthropic với cửa sổ ngữ cảnh 1M và đầu ra tối đa 128K, được xây dựng cho các tác vụ suy nghĩ nặng, lập trình và tác vụ đại lý dài hạn.
- claude-sonnet-5: cho các kịch bản trò chuyện, suy nghĩ và đại lý.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: ba cấp độ của dòng GPT-5.6 của OpenAI, mỗi cấp có cửa sổ ngữ cảnh 1.050.000, đầu ra tối đa 128K và đầu vào văn bản cộng với hình ảnh. Sol là cấp độ hàng đầu, Terra tương đương với hiệu suất GPT-5.5 với giá bằng một nửa, và Luna nhắm đến các khối lượng công việc nhạy cảm về chi phí.
- qwen3.8-max-preview: mô hình nền tảng Qwen thế hệ mới nhất với 2.4T tham số, có sẵn với mức giảm giá 90% trong thời gian giới hạn.
- kimi-k3: Mô hình mở dài ngữ cảnh của Moonshot AI với 2.8T tham số, cửa sổ ngữ cảnh 1M và đầu vào thị giác gốc. Xem hướng dẫn thực hành Kimi K3.
- grok-4.5: suy nghĩ có thể cấu hình, gọi công cụ và 500K ngữ cảnh, phù hợp cho sửa chữa mã và quy trình làm việc của đại lý.
- tencent-hy3: phát hành GA của Tencent Hunyuan Hy3. Kiến trúc MoE với tổng cộng 295B / 21B tham số hoạt động, cửa sổ ngữ cảnh 256K, mã nguồn mở theo giấy phép Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: các cấp độ mới trong dòng Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Lập trình
- qwen3-coder-480b-a35b-instruct: Mô hình mã hàng đầu của Qwen3 cho việc tạo mã, các đại lý kỹ thuật phần mềm và quy trình gọi công cụ.
Âm thanh
- gpt-audio-1.5: mô hình âm thanh OpenAI đầu tiên có sẵn rộng rãi (GA), hỗ trợ đầu vào và đầu ra âm thanh.
- gpt-4o-transcribe-diarize: Phiên âm ASR với phân loại người nói, chỉ có sẵn thông qua API Phiên âm.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: Các mô hình tổng hợp giọng nói Qwen. Cấp độ plus cung cấp kiểm soát tinh vi hơn về cảm xúc và nhân vật, cấp độ flash cung cấp độ trễ gói đầu tiên dưới 200 ms.
Hình ảnh
- mai-image-2.5-pro: Mô hình tạo và chỉnh sửa hình ảnh hàng đầu của Microsoft với độ chân thực cao và khả năng hiển thị văn bản trong hình ảnh. mai-image-2.5 và mai-image-2.5-flash từ cùng một dòng cũng đã hoạt động.
- gemini-3.1-flash-lite-image: Mô hình khả năng hình ảnh của Google.
3D
- hy-3d-3.1: Phiên bản chuyên nghiệp Tencent Hunyuan 3D, hỗ trợ văn bản thành 3D, hình ảnh thành 3D và đầu vào đa góc nhìn tám chiều.
Truy xuất / xếp hạng lại
- jina-reranker-v3.5: Jina AI xếp hạng lại tài liệu đa ngôn ngữ theo danh sách cho RAG, tìm kiếm và xếp hạng dữ liệu có cấu trúc.
Giá cả và thông báo
- Ưu đãi thời gian giới hạn cho GLM-5.2:
glm-5.2được giảm giá theo khoảng thời gian trong ngày, theo UTC: giảm 50% từ 14:00 đến 24:00 và giảm 30% từ 00:00 đến 14:00 mỗi ngày. Ưu đãi có thời gian giới hạn. - Qwen3.8-Max-Preview giảm 90%: các cuộc gọi được tính phí ở mức 10% giá niêm yết, hiệu quả là 10 lần sử dụng nhiều hơn cho cùng một chi phí. Thời gian giới hạn, ai đến trước sẽ được phục vụ trước.
- Tính phí theo thời gian cho DeepSeek V4: Các mô hình DeepSeek V4 hỗ trợ tính phí cao điểm và ngoài giờ. Các khoản phí theo khoảng thời gian của thời gian gửi yêu cầu, và các yêu cầu phát trực tiếp vượt qua một ranh giới cũng sẽ được định giá theo thời gian gửi.
Câu hỏi thường gặp
Các mô hình nào đã được thêm vào tháng này?
Gần 30 mô hình, bao gồm trò chuyện (claude-opus-5, claude-sonnet-5, dòng GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 và nhiều hơn nữa), lập trình (qwen3-coder-480b-a35b-instruct), âm thanh (gpt-audio-1.5 và dòng qwen-audio-3.0-tts), hình ảnh (dòng mai-image-2.5), 3D (hy-3d-3.1) và xếp hạng lại (jina-reranker-v3.5).
Làm thế nào để tôi kết nối với Máy chủ MCP của AIHubMix?
Thêm điểm truy cập https://mcp.aihubmix.com/mcp vào bất kỳ khách hàng nào hỗ trợ MCP (Claude Code, Codex, Cursor và những người khác). Thông tin xác thực được truyền theo từng yêu cầu bởi khách hàng. Bạn có thể sau đó truy vấn mô hình và giá cả, tìm kiếm tài liệu, kiểm tra số dư của bạn và gọi các công cụ trò chuyện, tạo hình ảnh và tạo video.
Các API tạo phương tiện hỗ trợ những gì?
Gửi yêu cầu tạo và chỉnh sửa hình ảnh thông qua /ai/v1/images/generations và /ai/v1/images/edits, sau đó sử dụng API tác vụ bất đồng bộ thống nhất để truy vấn trạng thái, tải xuống tài liệu và nhận các cuộc gọi lại webhook. Xem Tác vụ bất đồng bộ.
Ưu đãi thời gian giới hạn cho Qwen3.8-Max-Preview là gì?
Các cuộc gọi được tính phí ở mức 10% giá niêm yết, hiệu quả là 10 lần sử dụng nhiều hơn cho cùng một chi phí. Thời gian giới hạn, ai đến trước sẽ được phục vụ trước.
Tham khảo tất cả các mô hình trong bộ sưu tập mô hình và tìm chi tiết tích hợp trong tài liệu.
Cập nhật: 2026-07-31