Destacado de la versión de julio de 2026: ~30 nuevos modelos y APIs de medios

31 jul 2026 · AIHubMix · 6 min read · Registro de cambios

Destacado de la versión de julio de 2026: ~30 nuevos modelos y APIs de medios

Este mes, AIHubMix agregó casi 30 nuevos modelos en chat, codificación, audio, imagen y 3D, y lanzó varias capacidades de la plataforma, incluyendo APIs de generación de medios, reparación de salida estructurada y una API de generación 3D. La gama de modalidades disponibles a través de una sola clave API sigue expandiéndose. Aquí están los aspectos más destacados.

APIs de generación de medios y tareas asíncronas unificadas

Nuevos puntos finales de generación de medios /ai/v1/images/generations y /ai/v1/images/edits ya están disponibles, junto con tareas asíncronas unificadas, consultas de resultados, descargas de artefactos y callbacks de webhook. Los flujos de trabajo de imagen y video pueden integrarse a través del mismo ciclo de vida de tareas, facilitando el seguimiento de resultados de generación de larga duración. Los artefactos generados admiten descarga directa y recuperación por lotes. Ver Tareas Asíncronas.

Reparación de salida estructurada

Una nueva capacidad de reparación de salida estructurada a nivel de clave está disponible, desactivada por defecto. Una vez habilitada, para solicitudes no en streaming que declaren salida JSON estructurada, cuando el modelo devuelve JSON con errores de formato como truncamiento, comas finales o envolturas de bloques de código, la plataforma lo repara automáticamente en JSON válido y parseable antes de devolverlo. Los valores permanecen sin cambios y no se requieren cambios del cliente. Admite los protocolos de Chat Completions, Responses, Claude y Gemini, y las respuestas reparadas llevan el encabezado X-JSON-Repaired: true. Ver Reparación de Salida Estructurada.

API de generación 3D

La nueva API asíncrona de generación 3D /v1/3d/generations se lanza con Tencent Hunyuan 3D (hy-3d-3.1) como el primer modelo soportado. Cubre texto a 3D, imagen a 3D y entrada de múltiples vistas, con artefactos en formatos obj, glb, stl, usdz y fbx, además de materiales PBR, adecuados para juegos, exhibición de comercio electrónico, impresión 3D y diseño de productos. Ver API de Generación 3D.

Servidor MCP oficial de AIHubMix

El punto de entrada alojado oficial para clientes MCP ya está en línea: mcp.aihubmix.com/mcp (respaldo: mcp.inferera.com/mcp). Conéctalo en Claude Code, Codex, Cursor y otras herramientas para consultar modelos y precios, buscar documentación, verificar tu saldo y llamar a herramientas de chat, generación de imágenes y generación de videos.

Búsqueda Jina y lectura web

Nuevas capacidades de Jina Search y Reader te permiten recuperar resultados de búsqueda y contenido de páginas web con tu clave API de AIHubMix, adecuadas para recuperación de información externa, lectura de documentos y llamadas a herramientas de agentes. Ambas admiten solicitudes POST, y Reader también acepta cargas multipart de archivos locales como PDF, Word, Excel, PPT, HTML e imágenes. Ver Jina AI.

Otras actualizaciones de características

  • Generación de audio Qwen TTS: qwen-audio-3.0-tts-plus y qwen-audio-3.0-tts-flash pueden ser llamados a través de /v1/audio/speech. Las solicitudes no en streaming devuelven un enlace de resultado de audio, las solicitudes en streaming devuelven eventos de generación de audio SSE, con soporte para etiquetas de emoción e instrucciones de voz en lenguaje natural. Ver TTS.
  • Documentación de caché de prompts de GPT: comenzando con la serie GPT-5.6, las escrituras de caché se facturan a 1.25x el precio de entrada, las lecturas de caché a 0.1x, y las cachés se retienen durante al menos 30 minutos. Incluye detalles del parámetro prompt_cache_key y solución de problemas de aciertos de caché. Ver Caché de Prompts de GPT.
  • Veo 3.1 imagen a video soporta primeros/últimos fotogramas e imágenes de referencia: controla las tomas de apertura y cierre, referencias de personajes y referencias de estilo con más precisión. Ver Generación de Video.
  • Puente de Respuestas automáticas para llamadas a herramientas gpt-5.5 y superiores: las solicitudes enviadas a través de /v1/chat/completions con herramientas y reasoning_effort utilizan automáticamente las capacidades de Responses, brindando a los clientes existentes una llamada a herramientas más confiable sin cambios. Ver API de Respuestas.
  • Puntos finales nativos de Gemini completados: el SDK @google/genai ahora admite Embeddings nativos, Interacciones y Caché de Contexto cuando se llama a través de AIHubMix. Ver SDK Nativo de Gemini.
  • Conexiones en streaming extendidas a 2 horas: el tiempo máximo de conexión en streaming se ha extendido de 1 hora a 2 horas, por lo que las tareas de pensamiento y generación prolongadas tienen menos probabilidades de ser interrumpidas prematuramente.
  • Passthrough de parámetros de imagen de Gemini: al llamar a modelos de salida de imagen de Gemini a través de la API compatible con OpenAI, aspectRatio y imageSize pueden ser pasados en extra_body.generationConfig.imageConfig.
  • Salida estructurada a través de protocolos: el response_format compatible con OpenAI y el output_config.format nativo de Claude ahora se adaptan en ambas direcciones en las rutas relevantes. Ver Salida Estructurada.

Estabilidad y correcciones

  • Mejoras en la compatibilidad multi-protocolo: los campos de respuesta de mensajes, parámetros de pensamiento, parámetros stop y estructuras de respuesta de llamadas a herramientas están más alineados con cada ecosistema de protocolo.
  • Mejoras en la fiabilidad del streaming: se corrigieron salidas de streaming truncadas y respuestas clasificadas incorrectamente como vacías para algunos modelos, con registros de uso más completos cuando los clientes se desconectan.
  • Mejoras en la medición y precisión de facturación de caché, para que los detalles de facturación reflejen mejor el uso real.
  • Mensajes de error más claros: las fallas de validación de parámetros devuelven antes, y los errores para modelos desconocidos y cuotas de claves agotadas son más explícitos.

Nuevos modelos este mes (casi 30)

Chat / general

  • claude-opus-5: modelo insignia de Anthropic con una ventana de contexto de 1M y 128K de salida máxima, diseñado para razonamiento intenso, codificación y tareas de agentes a largo plazo.
  • claude-sonnet-5: para chat, razonamiento y escenarios de agentes.
  • gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: tres niveles de la serie OpenAI GPT-5.6, cada uno con una ventana de contexto de 1,050,000, 128K de salida máxima, y entrada de texto más imagen. Sol es el nivel insignia, Terra iguala el rendimiento de GPT-5.5 a la mitad del precio, y Luna se dirige a cargas de trabajo sensibles al costo.
  • qwen3.8-max-preview: el modelo base de Qwen de última generación con 2.4T de parámetros, disponible con un descuento del 90% por tiempo limitado.
  • kimi-k3: modelo de contexto largo abierto de Moonshot AI con 2.8T de parámetros, una ventana de contexto de 1M y entrada de visión nativa. Ver la guía práctica de Kimi K3.
  • grok-4.5: razonamiento configurable, llamada a herramientas y 500K de contexto, adecuado para reparación de código y flujos de trabajo de agentes.
  • tencent-hy3: la versión GA de Tencent Hunyuan Hy3. Arquitectura MoE con 295B en total / 21B de parámetros activos, una ventana de contexto de 256K, de código abierto bajo Apache 2.0.
  • gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: nuevos niveles en la serie Google Flash.
  • glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.

Codificación

  • qwen3-coder-480b-a35b-instruct: modelo de código insignia de Qwen3 para generación de código, agentes de ingeniería de software y flujos de trabajo de llamada a herramientas.

Audio

  • gpt-audio-1.5: el primer modelo de audio de OpenAI generalmente disponible (GA), que admite entrada y salida de audio.
  • gpt-4o-transcribe-diarize: transcripción ASR con diarización de hablantes, disponible solo a través de la API de Transcripción.
  • qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: modelos de síntesis de voz de Qwen. El nivel plus ofrece control detallado sobre emoción y carácter, el nivel flash ofrece latencia de primer paquete por debajo de 200 ms.

Imagen

  • mai-image-2.5-pro: modelo insignia de generación y edición de imágenes de Microsoft con realismo de alta fidelidad y renderizado de texto en imagen. mai-image-2.5 y mai-image-2.5-flash de la misma serie también están disponibles.
  • gemini-3.1-flash-lite-image: modelo de capacidad de imagen de Google.

3D

  • hy-3d-3.1: edición profesional de Tencent Hunyuan 3D, que admite texto a 3D, imagen a 3D y entrada de múltiples ángulos de ocho vistas.

Recuperación / reordenamiento

  • jina-reranker-v3.5: Jina AI reordenador de documentos multilingüe listwise para RAG, búsqueda y clasificación de datos estructurados.

Precios y anuncios

  • Oferta limitada de tiempo del día para GLM-5.2: glm-5.2 tiene un descuento por ventana de tiempo diaria, en UTC: 50% de descuento de 14:00 a 24:00 y 30% de descuento de 00:00 a 14:00 cada día. Oferta por tiempo limitado.
  • Qwen3.8-Max-Preview con 90% de descuento: las llamadas se facturan al 10% del precio de lista, efectivamente 10 veces más uso por el mismo gasto. Tiempo limitado, por orden de llegada.
  • Facturación de tiempo del día para DeepSeek V4: los modelos DeepSeek V4 admiten facturación en horas pico y fuera de pico. Los cargos siguen la ventana de tiempo del momento de envío de la solicitud, y las solicitudes de streaming que cruzan un límite también se facturan al momento de envío.

FAQ

¿Qué modelos se agregaron este mes?
Casi 30, cubriendo chat (claude-opus-5, claude-sonnet-5, la serie GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 y más), codificación (qwen3-coder-480b-a35b-instruct), audio (gpt-audio-1.5 y la serie qwen-audio-3.0-tts), imagen (la serie mai-image-2.5), 3D (hy-3d-3.1) y reordenamiento (jina-reranker-v3.5).

¿Cómo me conecto al servidor MCP de AIHubMix?
Agrega el punto de entrada https://mcp.aihubmix.com/mcp en cualquier cliente habilitado para MCP (Claude Code, Codex, Cursor y otros). Las credenciales se pasan por solicitud por el cliente. Luego puedes consultar modelos y precios, buscar documentación, verificar tu saldo y llamar a herramientas de chat, generación de imágenes y generación de videos.

¿Qué admiten las APIs de generación de medios?
Envía solicitudes de generación y edición de imágenes a través de /ai/v1/images/generations y /ai/v1/images/edits, luego utiliza la API de tarea asíncrona unificada para consultar el estado, descargar artefactos y recibir callbacks de webhook. Ver Tareas Asíncronas.

¿Cuál es la oferta por tiempo limitado de Qwen3.8-Max-Preview?
Las llamadas se facturan al 10% del precio de lista, efectivamente 10 veces más uso por el mismo gasto. Tiempo limitado, por orden de llegada.

Explora todos los modelos en la galería de modelos y encuentra detalles de integración en la documentación.


Actualizado: 2026-07-31

More from the blog