Este mês, a AIHubMix adicionou quase 30 novos modelos em chat, codificação, áudio, imagem e 3D, e lançou várias capacidades da plataforma, incluindo APIs de geração de mídia, reparo de saída estruturada e uma API de geração 3D. A gama de modalidades disponíveis através de uma única chave de API continua a se expandir. Aqui estão os destaques.
APIs de geração de mídia e tarefas assíncronas unificadas
Novos endpoints de geração de mídia /ai/v1/images/generations e /ai/v1/images/edits estão agora disponíveis, juntamente com tarefas assíncronas unificadas, consultas de resultados, downloads de artefatos e callbacks de webhook. Fluxos de trabalho de imagem e vídeo podem se integrar através do mesmo ciclo de vida da tarefa, facilitando o acompanhamento de resultados de geração de longa duração. Artefatos gerados suportam download direto e recuperação em lote. Veja Tarefas Assíncronas.
Reparo de saída estruturada
Uma nova capacidade de reparo de saída estruturada em nível de chave está disponível, desativada por padrão. Uma vez ativada, para solicitações não streaming que declaram saída JSON estruturada, quando o modelo retorna JSON com erros de formato, como truncamento, vírgulas finais ou wrappers de bloco de código, a plataforma automaticamente o repara em JSON válido e analisável antes de retornar. Os valores permanecem inalterados e nenhuma alteração do cliente é necessária. Suporta os protocolos Chat Completions, Responses, Claude e Gemini, e as respostas reparadas carregam o cabeçalho X-JSON-Repaired: true. Veja Reparo de Saída Estruturada.
API de geração 3D
A nova API assíncrona de geração 3D /v1/3d/generations é lançada com o Tencent Hunyuan 3D (hy-3d-3.1) como o primeiro modelo suportado. Ela cobre texto-para-3D, imagem-para-3D e entrada de múltiplas vistas, com artefatos nos formatos obj, glb, stl, usdz e fbx, além de materiais PBR, adequados para jogos, exibição em e-commerce, impressão 3D e design de produtos. Veja API de Geração 3D.
Servidor MCP Oficial da AIHubMix
O ponto de entrada hospedado oficial para clientes MCP já está ativo: mcp.aihubmix.com/mcp (backup: mcp.inferera.com/mcp). Conecte-o no Claude Code, Codex, Cursor e outras ferramentas para consultar modelos e preços, pesquisar documentação, verificar seu saldo e chamar ferramentas de chat, geração de imagem e geração de vídeo. As credenciais são passadas por solicitação pelo cliente e o servidor não armazena chaves de API.
Busca Jina e leitura da web
Novas capacidades de Busca e Leitor Jina permitem que você recupere resultados de busca e conteúdo de páginas da web com sua chave de API AIHubMix, adequadas para recuperação de informações externas, leitura de documentos e chamadas de ferramentas de agentes. Ambas suportam solicitações POST, e o Leitor também aceita uploads multipart de arquivos locais, como PDF, Word, Excel, PPT, HTML e imagens. Veja Jina AI.
Outras atualizações de recursos
- Geração de áudio TTS Qwen:
qwen-audio-3.0-tts-pluseqwen-audio-3.0-tts-flashpodem ser chamados através de/v1/audio/speech. Solicitações não streaming retornam um link de resultado de áudio, solicitações streaming retornam eventos de geração de áudio SSE, com suporte para tags de emoção e instruções de voz em linguagem natural. Veja TTS. - Documentação de cache de prompt GPT: começando com a série GPT-5.6, gravações de cache são cobradas a 1,25x o preço de entrada, leituras de cache a 0,1x, e caches são retidos por pelo menos 30 minutos. Inclui detalhes do parâmetro
prompt_cache_keye solução de problemas de acertos de cache. Veja Cache de Prompt GPT. - Veo 3.1 imagem-para-vídeo suporta primeiros/últimos quadros e imagens de referência: controle os planos de abertura e fechamento, referências de personagens e referências de estilo com mais precisão. Veja Geração de Vídeo.
- Respostas automáticas para chamadas de ferramentas gpt-5.5 e superiores: solicitações enviadas através de
/v1/chat/completionscom ferramentas ereasoning_effortusam automaticamente as capacidades de Responses, proporcionando aos clientes existentes chamadas de ferramentas mais confiáveis sem quaisquer alterações. Veja API de Respostas. - Endpoints nativos Gemini concluídos: o SDK
@google/genaiagora suporta Embeddings nativos, Interações e Cache de Contexto quando chamado através da AIHubMix. Veja SDK Nativo Gemini. - Conexões streaming estendidas para 2 horas: o tempo máximo de conexão streaming foi estendido de 1 hora para 2 horas, tornando menos provável que tarefas de pensamento longo e geração longa sejam cortadas prematuramente.
- Passagem de parâmetros de imagem Gemini: ao chamar modelos de saída de imagem Gemini através da API compatível com OpenAI,
aspectRatioeimageSizepodem ser passados emextra_body.generationConfig.imageConfig. - Saída estruturada entre protocolos: o
response_formatcompatível com OpenAI e ooutput_config.formatnativo do Claude agora se adaptam em ambas as direções nos caminhos relevantes. Veja Saída Estruturada.
Estabilidade e correções
- Melhorias na compatibilidade entre múltiplos protocolos: campos de resposta de mensagens, parâmetros de pensamento, parâmetros
stope estruturas de resposta de chamadas de ferramentas estão mais alinhados com cada ecossistema de protocolo. - Melhorias na confiabilidade do streaming: corrigido o output de streaming truncado e respostas classificadas incorretamente como vazias para alguns modelos, com registros de uso mais completos quando os clientes se desconectam.
- Melhorias na medição e precisão de cobrança de cache, para que os detalhes de cobrança reflitam melhor o uso real.
- Mensagens de erro mais claras: falhas de validação de parâmetros retornam mais cedo, e erros para modelos desconhecidos e cotas de chave esgotadas são mais explícitos.
Novos modelos este mês (quase 30)
Chat / geral
- claude-opus-5: modelo principal da Anthropic com uma janela de contexto de 1M e 128K de saída máxima, construído para raciocínio intenso, codificação e tarefas de agente de longo prazo.
- claude-sonnet-5: para chat, raciocínio e cenários de agentes.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: três níveis da série OpenAI GPT-5.6, cada um com uma janela de contexto de 1.050.000, 128K de saída máxima, e entrada de texto mais imagem. Sol é o nível principal, Terra iguala o desempenho do GPT-5.5 a metade do preço, e Luna visa cargas de trabalho sensíveis a custos.
- qwen3.8-max-preview: o modelo de fundação Qwen de última geração com 2.4T de parâmetros, disponível com um desconto de 90% por tempo limitado.
- kimi-k3: modelo de longo contexto aberto da Moonshot AI com 2.8T de parâmetros, uma janela de contexto de 1M e entrada de visão nativa. Veja o guia prático do Kimi K3.
- grok-4.5: raciocínio configurável, chamada de ferramentas e 500K de contexto, adequado para reparo de código e fluxos de trabalho de agentes.
- tencent-hy3: o lançamento GA do Tencent Hunyuan Hy3. Arquitetura MoE com 295B no total / 21B de parâmetros ativos, uma janela de contexto de 256K, código aberto sob Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: novos níveis na série Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Codificação
- qwen3-coder-480b-a35b-instruct: modelo de código principal Qwen3-Coder para geração de código, agentes de engenharia de software e fluxos de trabalho de chamada de ferramentas.
Áudio
- gpt-audio-1.5: o primeiro modelo de áudio OpenAI geralmente disponível (GA), suportando entrada e saída de áudio.
- gpt-4o-transcribe-diarize: transcrição ASR com diarização de falantes, disponível apenas através da API de Transcrição.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: modelos de síntese de fala Qwen. O nível plus oferece controle detalhado sobre emoção e personagem, o nível flash entrega latência do primeiro pacote abaixo de 200 ms.
Imagem
- mai-image-2.5-pro: modelo de geração e edição de imagem principal da Microsoft com realismo de alta fidelidade e renderização de texto em imagem. mai-image-2.5 e mai-image-2.5-flash da mesma série também estão ativos.
- gemini-3.1-flash-lite-image: modelo de capacidade de imagem do Google.
3D
- hy-3d-3.1: edição profissional do Tencent Hunyuan 3D, suportando texto-para-3D, imagem-para-3D e entrada de múltiplos ângulos de oito vistas.
Recuperação / reclassificação
- jina-reranker-v3.5: reclassificador de documentos multilíngue Jina AI para RAG, busca e classificação de dados estruturados.
Preços e anúncios
- Oferta de tempo limitado do GLM-5.2:
glm-5.2está com desconto por janela de tempo diária, em UTC: 50% de desconto das 14:00 às 24:00 e 30% de desconto das 00:00 às 14:00 todos os dias. Oferta por tempo limitado. - Qwen3.8-Max-Preview com 90% de desconto: chamadas são cobradas a 10% do preço de tabela, efetivamente 10x mais uso pelo mesmo gasto. Tempo limitado, por ordem de chegada.
- Faturamento por hora do DeepSeek V4: modelos DeepSeek V4 suportam faturamento em horários de pico e fora de pico. As cobranças seguem a janela de tempo do momento da submissão da solicitação, e solicitações de streaming que cruzam um limite também são precificadas no momento da submissão.
FAQ
Quais modelos foram adicionados este mês?
Quase 30, cobrindo chat (claude-opus-5, claude-sonnet-5, a série GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 e mais), codificação (qwen3-coder-480b-a35b-instruct), áudio (gpt-audio-1.5 e a série qwen-audio-3.0-tts), imagem (a série mai-image-2.5), 3D (hy-3d-3.1) e reclassificação (jina-reranker-v3.5).
Como me conecto ao Servidor MCP da AIHubMix?
Adicione o ponto de entrada https://mcp.aihubmix.com/mcp em qualquer cliente habilitado para MCP (Claude Code, Codex, Cursor e outros). As credenciais são passadas por solicitação pelo cliente. Você pode então consultar modelos e preços, pesquisar documentação, verificar seu saldo e chamar ferramentas de chat, geração de imagem e geração de vídeo.
O que as APIs de geração de mídia suportam?
Envie solicitações de geração e edição de imagem através de /ai/v1/images/generations e /ai/v1/images/edits, depois use a API de tarefa assíncrona unificada para consultar status, baixar artefatos e receber callbacks de webhook. Veja Tarefas Assíncronas.
Qual é a oferta por tempo limitado do Qwen3.8-Max-Preview?
Chamadas são cobradas a 10% do preço de tabela, efetivamente 10x mais uso pelo mesmo gasto. Tempo limitado, por ordem de chegada.
Navegue por todos os modelos na galeria de modelos e encontre detalhes de integração na documentação.
Atualizado: 2026-07-31