Ce mois-ci, AIHubMix a ajouté près de 30 nouveaux modèles dans les domaines du chat, du codage, de l'audio, de l'image et de la 3D, et a lancé plusieurs capacités de plateforme, y compris des API de génération de médias, une réparation de sortie structurée et une API de génération 3D. La gamme de modalités disponibles via une seule clé API continue de s'élargir. Voici les points forts.
API de génération de médias et tâches asynchrones unifiées
De nouveaux points de terminaison de génération de médias /ai/v1/images/generations et /ai/v1/images/edits sont désormais disponibles, ainsi que des tâches asynchrones unifiées, des requêtes de résultats, des téléchargements d'artefacts et des rappels webhook. Les flux de travail d'images et de vidéos peuvent s'intégrer à travers le même cycle de vie de tâche, facilitant le suivi des résultats de génération de longue durée. Les artefacts générés prennent en charge le téléchargement direct et la récupération par lots. Voir Tâches asynchrones.
Réparation de sortie structurée
Une nouvelle capacité de réparation de sortie structurée au niveau de la clé est disponible, désactivée par défaut. Une fois activée, pour les requêtes non diffusées qui déclarent une sortie JSON structurée, lorsque le modèle renvoie un JSON avec des erreurs de format telles que la troncature, des virgules finales ou des wrappers de blocs de code, la plateforme le répare automatiquement en JSON valide et analysable avant de le renvoyer. Les valeurs restent inchangées et aucun changement côté client n'est requis. Elle prend en charge les protocoles Chat Completions, Responses, Claude et Gemini, et les réponses réparées portent l'en-tête X-JSON-Repaired: true. Voir Réparation de sortie structurée.
API de génération 3D
La nouvelle API asynchrone de génération 3D /v1/3d/generations est lancée avec Tencent Hunyuan 3D (hy-3d-3.1) comme premier modèle pris en charge. Elle couvre le texte vers 3D, l'image vers 3D et l'entrée multi-vues, avec des artefacts aux formats obj, glb, stl, usdz et fbx, ainsi que des matériaux PBR, adaptés aux jeux, à l'affichage e-commerce, à l'impression 3D et à la conception de produits. Voir API de génération 3D.
Serveur MCP officiel AIHubMix
Le point d'entrée hébergé officiel pour les clients MCP est désormais en ligne : mcp.aihubmix.com/mcp (sauvegarde : mcp.inferera.com/mcp). Connectez-le dans Claude Code, Codex, Cursor et d'autres outils pour interroger des modèles et des prix, rechercher de la documentation, vérifier votre solde et appeler des outils de génération de chat, d'image et de vidéo. Les identifiants sont transmis par requête par le client et le serveur ne stocke pas les clés API.
Recherche Jina et lecture web
Les nouvelles capacités de recherche et de lecture Jina vous permettent de récupérer des résultats de recherche et du contenu de pages web avec votre clé API AIHubMix, adaptées à la récupération d'informations externes, à la lecture de documents et à l'appel d'outils d'agents. Les deux prennent en charge les requêtes POST, et Reader accepte également les téléchargements multipart de fichiers locaux tels que PDF, Word, Excel, PPT, HTML et images. Voir Jina AI.
Autres mises à jour de fonctionnalités
- Génération audio TTS Qwen :
qwen-audio-3.0-tts-plusetqwen-audio-3.0-tts-flashpeuvent être appelés via/v1/audio/speech. Les requêtes non diffusées renvoient un lien de résultat audio, les requêtes diffusées renvoient des événements de génération audio SSE, avec prise en charge des balises d'émotion et des instructions vocales en langage naturel. Voir TTS. - Documentation sur la mise en cache des invites GPT : à partir de la série GPT-5.6, les écritures de cache sont facturées à 1,25x le prix d'entrée, les lectures de cache à 0,1x, et les caches sont conservés pendant au moins 30 minutes. Comprend les détails du paramètre
prompt_cache_keyet le dépannage des hits de cache. Voir Mise en cache des invites GPT. - Veo 3.1 image vers vidéo prend en charge les premiers/derniers cadres et les images de référence : contrôlez les plans d'ouverture et de fermeture, les références de personnages et les références de style avec plus de précision. Voir Génération vidéo.
- Réponses automatiques pour les appels d'outils gpt-5.5 et supérieurs : les requêtes envoyées via
/v1/chat/completionsavec des outils etreasoning_effortutilisent automatiquement les capacités de Réponses, offrant aux clients existants un appel d'outils plus fiable sans aucun changement. Voir API des Réponses. - Points de terminaison natifs Gemini complétés : le SDK
@google/genaiprend désormais en charge les Embeddings, Interactions et Caching de Contexte natifs lorsqu'il est appelé via AIHubMix. Voir SDK natif Gemini. - Connexions de streaming étendues à 2 heures : le temps maximum de connexion de streaming a été étendu d'1 heure à 2 heures, de sorte que les tâches de réflexion et de génération longues sont moins susceptibles d'être interrompues prématurément.
- Passage des paramètres d'image Gemini : lors de l'appel de modèles de sortie d'image Gemini via l'API compatible OpenAI,
aspectRatioetimageSizepeuvent être passés dansextra_body.generationConfig.imageConfig. - Sortie structurée à travers les protocoles : le
response_formatcompatible OpenAI et leoutput_config.formatnatif de Claude s'adaptent désormais dans les deux sens sur les chemins pertinents. Voir Sortie structurée.
Stabilité et corrections
- Améliorations de la compatibilité multi-protocoles : les champs de réponse des messages, les paramètres de réflexion, les paramètres
stopet les structures de réponse des appels d'outils sont encore mieux alignés avec chaque écosystème de protocole. - Améliorations de la fiabilité du streaming : correction des sorties de streaming tronquées et des réponses mal classées comme vides pour certains modèles, avec des enregistrements d'utilisation plus complets lorsque les clients se déconnectent.
- Améliorations de la mesure et de la facturation du cache, de sorte que les détails de facturation reflètent mieux l'utilisation réelle.
- Messages d'erreur plus clairs : les échecs de validation des paramètres retournent plus tôt, et les erreurs pour les modèles inconnus et les quotas de clés épuisés sont plus explicites.
Nouveaux modèles ce mois-ci (près de 30)
Chat / général
- claude-opus-5 : modèle phare d'Anthropic avec une fenêtre de contexte de 1M et une sortie max de 128K, conçu pour un raisonnement lourd, le codage et des tâches d'agents à long terme.
- claude-sonnet-5 : pour des scénarios de chat, de raisonnement et d'agents.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna : trois niveaux de la série OpenAI GPT-5.6, chacun avec une fenêtre de contexte de 1 050 000, une sortie max de 128K, et une entrée texte plus image. Sol est le niveau phare, Terra correspond à la performance de GPT-5.5 à moitié prix, et Luna cible les charges de travail sensibles au coût.
- qwen3.8-max-preview : le dernier modèle de base Qwen de génération avec 2,4T de paramètres, disponible à un tarif promotionnel de 90 % de réduction.
- kimi-k3 : modèle ouvert Moonshot AI à long contexte avec 2,8T de paramètres, une fenêtre de contexte de 1M et une entrée vision native. Voir le guide pratique Kimi K3.
- grok-4.5 : raisonnement configurable, appel d'outils et 500K de contexte, adapté à la réparation de code et aux flux de travail d'agents.
- tencent-hy3 : la version GA de Tencent Hunyuan Hy3. Architecture MoE avec 295B au total / 21B de paramètres actifs, une fenêtre de contexte de 256K, open source sous Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite : nouveaux niveaux dans la série Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Codage
- qwen3-coder-480b-a35b-instruct : modèle phare de code Qwen3-Coder pour la génération de code, les agents d'ingénierie logicielle et les flux de travail d'appel d'outils.
Audio
- gpt-audio-1.5 : le premier modèle audio OpenAI généralement disponible (GA), prenant en charge l'entrée et la sortie audio.
- gpt-4o-transcribe-diarize : transcription ASR avec diarisation des locuteurs, disponible uniquement via l'API de transcription.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash : modèles de synthèse vocale Qwen. Le niveau plus offre un contrôle fin sur l'émotion et le caractère, le niveau flash fournit une latence de premier paquet inférieure à 200 ms.
Image
- mai-image-2.5-pro : modèle phare de génération et d'édition d'images de Microsoft avec un réalisme haute fidélité et un rendu de texte dans l'image. mai-image-2.5 et mai-image-2.5-flash de la même série sont également disponibles.
- gemini-3.1-flash-lite-image : modèle de capacité d'image de Google.
3D
- hy-3d-3.1 : édition professionnelle de Tencent Hunyuan 3D, prenant en charge le texte vers 3D, l'image vers 3D et l'entrée multi-angle à huit vues.
Récupération / reranking
- jina-reranker-v3.5 : Jina AI multilingue de reranking de documents listwise pour RAG, recherche et classement de données structurées.
Tarification et annonces
- Offre limitée de temps de la journée GLM-5.2 :
glm-5.2est réduit par fenêtre horaire, en UTC : 50 % de réduction de 14:00 à 24:00 et 30 % de réduction de 00:00 à 14:00 chaque jour. Offre limitée. - Qwen3.8-Max-Preview à 90 % de réduction : les appels sont facturés à 10 % du prix de liste, offrant effectivement 10 fois plus d'utilisation pour le même budget. Offre limitée, premier arrivé, premier servi.
- Facturation de temps de jour DeepSeek V4 : les modèles DeepSeek V4 prennent en charge la facturation de pointe et hors pointe. Les frais suivent la fenêtre horaire du moment de soumission de la requête, et les requêtes de streaming qui traversent une frontière sont également tarifées au moment de soumission.
FAQ
Quels modèles ont été ajoutés ce mois-ci ?
Près de 30, couvrant le chat (claude-opus-5, claude-sonnet-5, la série GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 et plus), le codage (qwen3-coder-480b-a35b-instruct), l'audio (gpt-audio-1.5 et la série qwen-audio-3.0-tts), l'image (la série mai-image-2.5), 3D (hy-3d-3.1) et reranking (jina-reranker-v3.5).
Comment puis-je me connecter au serveur MCP AIHubMix ?
Ajoutez le point d'entrée https://mcp.aihubmix.com/mcp dans n'importe quel client compatible MCP (Claude Code, Codex, Cursor et autres). Les identifiants sont transmis par requête par le client. Vous pouvez ensuite interroger des modèles et des prix, rechercher de la documentation, vérifier votre solde et appeler des outils de génération de chat, d'image et de vidéo.
Quelles sont les fonctionnalités des API de génération de médias ?
Soumettez des requêtes de génération et d'édition d'images via /ai/v1/images/generations et /ai/v1/images/edits, puis utilisez l'API de tâche asynchrone unifiée pour interroger l'état, télécharger des artefacts et recevoir des rappels webhook. Voir Tâches asynchrones.
Quelle est l'offre limitée de Qwen3.8-Max-Preview ?
Les appels sont facturés à 10 % du prix de liste, offrant effectivement 10 fois plus d'utilisation pour le même budget. Offre limitée, premier arrivé, premier servi.
Parcourez tous les modèles dans la galerie de modèles et trouvez les détails d'intégration dans la documentation.
Mis à jour : 2026-07-31