2026年7月发布亮点:~30个新模型和媒体API

2026年7月31日 · AIHubMix · 6 min read · 更新日志

2026年7月发布亮点:~30个新模型和媒体API

本月,AIHubMix在聊天、编码、音频、图像和3D领域新增了近30个新模型,并推出了多个平台功能,包括媒体生成API、结构化输出修复和3D生成API。通过单个API密钥可用的多种模式继续扩展。以下是亮点。

媒体生成API和统一异步任务

新的媒体生成端点 /ai/v1/images/generations/ai/v1/images/edits 现已可用,此外还有统一异步任务、结果查询、工件下载和Webhook回调。图像和视频工作流可以通过相同的任务生命周期进行集成,便于跟踪长时间运行的生成结果。生成的工件支持直接下载和批量检索。请参见 异步任务

结构化输出修复

新的关键级结构化输出修复功能现已可用,默认情况下处于禁用状态。一旦启用,对于声明结构化JSON输出的非流式请求,当模型返回格式错误的JSON(如截断、尾随逗号或代码块包装)时,平台会自动将其修复为可解析的有效JSON再返回。值保持不变,无需客户端更改。它支持聊天完成、响应、Claude和Gemini协议,修复后的响应携带 X-JSON-Repaired: true 头。请参见 结构化输出修复

3D生成API

新的 /v1/3d/generations 异步3D生成API以腾讯混元3D(hy-3d-3.1)作为首个支持模型。它涵盖文本到3D、图像到3D和多视角输入,生成的工件支持obj、glb、stl、usdz和fbx格式,以及PBR材料,适用于游戏、电子商务展示、3D打印和产品设计。请参见 3D生成API

官方AIHubMix MCP服务器

官方托管的MCP客户端入口现已上线: mcp.aihubmix.com/mcp(备份: mcp.inferera.com/mcp)。在Claude Code、Codex、Cursor等工具中连接它,以查询模型和价格、搜索文档、检查余额,并调用聊天、图像生成和视频生成工具。凭据由客户端按请求传递,服务器不存储API密钥。

Jina搜索和网页阅读

新的Jina搜索和阅读器功能允许您使用AIHubMix API密钥检索搜索结果和网页内容,适用于外部信息检索、文档阅读和代理工具调用。两者都支持POST请求,阅读器还接受本地文件的多部分上传,如PDF、Word、Excel、PPT、HTML和图像。请参见 Jina AI

其他功能更新

  • Qwen TTS音频生成qwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash 可以通过 /v1/audio/speech 调用。非流式请求返回音频结果链接,流式请求返回SSE音频生成事件,支持情感标签和自然语言语音指令。请参见 TTS
  • GPT提示缓存文档:从GPT-5.6系列开始,缓存写入按输入价格的1.25倍计费,缓存读取按0.1倍计费,缓存至少保留30分钟。包括 prompt_cache_key 参数详细信息和缓存命中故障排除。请参见 GPT提示缓存
  • Veo 3.1图像到视频支持首/尾帧和参考图像:更精确地控制开场和闭场镜头、角色参考和风格参考。请参见 视频生成
  • gpt-5.5及以上工具调用的自动响应桥接:通过 /v1/chat/completions 发送的请求与工具和 reasoning_effort 自动使用响应功能,使现有客户端在不进行任何更改的情况下更可靠地调用工具。请参见 响应API
  • Gemini原生端点完成@google/genai SDK现在支持通过AIHubMix调用的原生嵌入、交互和上下文缓存。请参见 Gemini原生SDK
  • 流式连接延长至2小时:最大流式连接时间已从1小时延长至2小时,因此长时间思考和长时间生成任务不太可能被提前切断。
  • Gemini图像参数透传:通过OpenAI兼容API调用Gemini图像输出模型时,可以在 extra_body.generationConfig.imageConfig 中传递 aspectRatioimageSize
  • 跨协议的结构化输出:OpenAI兼容的 response_format 和Claude原生的 output_config.format 现在在相关路径上双向适应。请参见 结构化输出

稳定性和修复

  • 多协议兼容性改进:消息响应字段、思考参数、 stop 参数和工具调用响应结构与每个协议生态系统进一步对齐。
  • 流式可靠性改进:修复了某些模型的流式输出截断和响应被错误分类为空的问题,并在客户端断开连接时提供更完整的使用记录。
  • 缓存计量和计费准确性改进,使计费细节更好地反映实际使用情况。
  • 更清晰的错误信息:参数验证失败的返回更早,对于未知模型和耗尽密钥配额的错误更为明确。

本月新增模型(近30个)

聊天 / 通用

  • claude-opus-5:Anthropic旗舰模型,具有1M上下文窗口和128K最大输出,专为重度推理、编码和长时间代理任务而设计。
  • claude-sonnet-5:适用于聊天、推理和代理场景。
  • gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna:OpenAI GPT-5.6系列的三个层级,每个具有1,050,000上下文窗口、128K最大输出,以及文本加图像输入。Sol是旗舰层级,Terra在半价的情况下匹配GPT-5.5的性能,Luna则针对成本敏感的工作负载。
  • qwen3.8-max-preview:最新一代的Qwen基础模型,具有2.4T参数,现以限时90%的折扣提供。
  • kimi-k3:Moonshot AI开放的长上下文模型,具有2.8T参数、1M上下文窗口和原生视觉输入。请参见 Kimi K3实操指南
  • grok-4.5:可配置的推理、工具调用和500K上下文,适合代码修复和代理工作流。
  • tencent-hy3:腾讯混元Hy3的GA版本。MoE架构,具有295B总参数/21B活跃参数,256K上下文窗口,基于Apache 2.0开源。
  • gemini-3.6-flashgemini-3.5-flash-litegemini-2.5-flash-lite:Google Flash系列的新层级。
  • glm-5.2-fast-previewQwen3-235B-A22B-Instruct-2507command-a-plus-05-2026gemma-4-31blongcat-2.0

编码

  • qwen3-coder-480b-a35b-instruct:Qwen3-Coder旗舰代码模型,用于代码生成、软件工程代理和工具调用工作流。

音频

  • gpt-audio-1.5:首个普遍可用(GA)的OpenAI音频模型,支持音频输入和输出。
  • gpt-4o-transcribe-diarize:带有说话者分离的ASR转录,仅通过转录API提供。
  • qwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash:Qwen语音合成模型。plus层级提供对情感和角色的细粒度控制,flash层级在200毫秒内提供首包延迟。

图像

  • mai-image-2.5-pro:微软旗舰图像生成和编辑模型,具有高保真度的现实感和图像内文本渲染。mai-image-2.5mai-image-2.5-flash 也已上线。
  • gemini-3.1-flash-lite-image:Google图像能力模型。

3D

  • hy-3d-3.1:腾讯混元3D专业版,支持文本到3D、图像到3D和八视角多角度输入。

检索 / 重新排序

  • jina-reranker-v3.5:Jina AI多语言逐项文档重新排序器,用于RAG、搜索和结构化数据排序。

定价和公告

  • GLM-5.2限时日间优惠glm-5.2 按每日时间窗口折扣,UTC时间:每天14:00至24:00折扣50%,00:00至14:00折扣30%。限时优惠。
  • Qwen3.8-Max-Preview九折优惠:调用按列表价格的10%计费,实际上以相同支出获得10倍的使用量。限时,先到先得。
  • DeepSeek V4日间计费:DeepSeek V4模型支持高峰和非高峰计费。费用遵循请求提交时间的时间窗口,跨越边界的流式请求也按提交时间计费。

常见问题

本月新增了哪些模型?
近30个,涵盖聊天(claude-opus-5、claude-sonnet-5、GPT-5.6系列、qwen3.8-max-preview、kimi-k3、grok-4.5、tencent-hy3等)、编码(qwen3-coder-480b-a35b-instruct)、音频(gpt-audio-1.5和qwen-audio-3.0-tts系列)、图像(mai-image-2.5系列)、3D(hy-3d-3.1)和重新排序(jina-reranker-v3.5)。

如何连接到AIHubMix MCP服务器?
在任何支持MCP的客户端(Claude Code、Codex、Cursor等)中添加入口点 https://mcp.aihubmix.com/mcp。凭据由客户端按请求传递。然后,您可以查询模型和价格、搜索文档、检查余额,并调用聊天、图像生成和视频生成工具。

媒体生成API支持什么?
通过 /ai/v1/images/generations/ai/v1/images/edits 提交图像生成和编辑请求,然后使用统一异步任务API查询状态、下载工件并接收Webhook回调。请参见 异步任务

Qwen3.8-Max-Preview限时优惠是什么?
调用按列表价格的10%计费,实际上以相同支出获得10倍的使用量。限时,先到先得。

浏览所有模型,请访问 模型画廊,并在 文档 中查找集成细节。


更新日期:2026-07-31

More from the blog