Deze maand heeft AIHubMix bijna 30 nieuwe modellen toegevoegd op het gebied van chat, codering, audio, afbeelding en 3D, en verschillende platformmogelijkheden gelanceerd, waaronder media-generatie API's, gestructureerde output reparatie en een 3D-generatie API. Het scala aan modaliteiten dat beschikbaar is via een enkele API-sleutel blijft uitbreiden. Hier zijn de hoogtepunten.
Media-generatie API's en verenigde asynchrone taken
Nieuwe media-generatie eindpunten /ai/v1/images/generations en /ai/v1/images/edits zijn nu beschikbaar, samen met verenigde asynchrone taken, resultaatquery's, artifactdownloads en webhook callbacks. Afbeelding- en videowerkstromen kunnen integreren via dezelfde taaklevenscyclus, waardoor het eenvoudig is om langlopende generatie resultaten te volgen. Gegenereerde artifacts ondersteunen directe downloads en batchophalingen. Zie Asynchrone Taken.
Gestructureerde output reparatie
Een nieuwe sleutel-niveau gestructureerde output reparatie mogelijkheid is beschikbaar, standaard uitgeschakeld. Zodra ingeschakeld, voor niet-streaming verzoeken die gestructureerde JSON-output verklaren, wanneer het model JSON retourneert met opmaakfouten zoals afkapping, achterblijvende komma's of codeblokomslagen, repareert het platform dit automatisch naar parseerbare geldige JSON voordat het retourneert. Waarden blijven onveranderd en er zijn geen wijzigingen aan de client vereist. Het ondersteunt de Chat Completions, Responses, Claude en Gemini protocollen, en gerepareerde antwoorden dragen de X-JSON-Repaired: true header. Zie Gestructureerde Output Reparatie.
3D-generatie API
De nieuwe /v1/3d/generations asynchrone 3D-generatie API wordt gelanceerd met Tencent Hunyuan 3D (hy-3d-3.1) als het eerste ondersteunde model. Het dekt tekst-naar-3D, afbeelding-naar-3D en multi-view input, met artifacts in obj, glb, stl, usdz en fbx formaten plus PBR-materialen, geschikt voor games, e-commerce weergave, 3D-printen en productontwerp. Zie 3D Generatie API.
Officiële AIHubMix MCP Server
Het officiële gehoste toegangspunt voor MCP-clients is nu live: mcp.aihubmix.com/mcp (back-up: mcp.inferera.com/mcp). Verbind het in Claude Code, Codex, Cursor en andere tools om modellen en prijzen op te vragen, documentatie te doorzoeken, je saldo te controleren en chat-, afbeeldinggeneratie- en videogeneratietools aan te roepen. Referenties worden per verzoek door de client doorgegeven en de server slaat geen API-sleutels op.
Jina-zoekopdracht en weblezen
Nieuwe Jina Zoek- en Lezer-mogelijkheden stellen je in staat om zoekresultaten en webpagina-inhoud op te halen met je AIHubMix API-sleutel, geschikt voor externe informatieophaling, documentlezen en agenttool-aanroepen. Beide ondersteunen POST-verzoeken, en Lezer accepteert ook multipart uploads van lokale bestanden zoals PDF, Word, Excel, PPT, HTML en afbeeldingen. Zie Jina AI.
Andere functie-updates
- Qwen TTS audio-generatie:
qwen-audio-3.0-tts-plusenqwen-audio-3.0-tts-flashkunnen worden aangeroepen via/v1/audio/speech. Niet-streaming verzoeken retourneren een audioresultaatlink, streaming verzoeken retourneren SSE audio-generatie evenementen, met ondersteuning voor emotietags en natuurlijke taal steminstructies. Zie TTS. - GPT prompt caching documentatie: beginnend met de GPT-5.6 serie, worden cache-schrijvingen gefactureerd tegen 1,25x de invoerprijs, cache-lezingen tegen 0,1x, en caches worden ten minste 30 minuten bewaard. Inclusief
prompt_cache_keyparameter details en cache hit probleemoplossing. Zie GPT Prompt Caching. - Veo 3.1 afbeelding-naar-video ondersteunt eerste/laatste frames en referentieafbeeldingen: controleer de openings- en sluitshots, karakterreferenties en stijlreferenties met meer precisie. Zie Video Generatie.
- Automatische Antwoorden bruggen voor gpt-5.5 en hogere tool-aanroepen: verzoeken die worden verzonden via
/v1/chat/completionsmet tools enreasoning_effortgebruiken automatisch de Responses-mogelijkheden, waardoor bestaande clients betrouwbaardere tool-aanroepen krijgen zonder enige wijzigingen. Zie Responses API. - Gemini native eindpunten voltooid: de
@google/genaiSDK ondersteunt nu native Embeddings, Interactions en Context Caching wanneer deze worden aangeroepen via AIHubMix. Zie Gemini Native SDK. - Streamingverbindingen verlengd tot 2 uur: de maximale streamingverbindingstijd is verlengd van 1 uur naar 2 uur, zodat lange denk- en lange generatie taken minder waarschijnlijk vroeg worden afgebroken.
- Gemini afbeelding parameter doorgeven: bij het aanroepen van Gemini afbeelding output modellen via de OpenAI-compatibele API, kunnen
aspectRatioenimageSizeworden doorgegeven inextra_body.generationConfig.imageConfig. - Gestructureerde output over protocollen: de OpenAI-compatibele
response_formaten Claude nativeoutput_config.formatpassen zich nu in beide richtingen aan op de relevante paden. Zie Gestructureerde Output.
Stabiliteit en fixes
- Multi-protocol compatibiliteitsverbeteringen: Berichten antwoordvelden, denkparameters,
stopparameters en tool-aanroep antwoordstructuren zijn verder afgestemd op elk protocol ecosysteem. - Streaming betrouwbaarheid verbeteringen: gefixeerde afgebroken streaming output en antwoorden die voor sommige modellen als leeg zijn geclassificeerd, met meer complete gebruiksrecords wanneer clients disconnecten.
- Cache metering en factureringsnauwkeurigheid verbeteringen, zodat factureringsdetails beter de werkelijke gebruik reflecteren.
- Duidelijkere foutmeldingen: parameter validatiefouten worden eerder geretourneerd, en fouten voor onbekende modellen en uitgeputte sleutelquota zijn explicieter.
Nieuwe modellen deze maand (bijna 30)
Chat / algemeen
- claude-opus-5: Anthropic vlaggenschipmodel met een 1M contextvenster en 128K max output, gebouwd voor zware redenering, codering en lange termijn agenttaken.
- claude-sonnet-5: voor chat, redenering en agentscenario's.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: drie niveaus van de OpenAI GPT-5.6 serie, elk met een 1.050.000 contextvenster, 128K max output, en tekst plus afbeelding input. Sol is het vlaggenschipniveau, Terra evenaart de prestaties van GPT-5.5 voor de helft van de prijs, en Luna richt zich op kostenbewuste workloads.
- qwen3.8-max-preview: het nieuwste generatie Qwen foundation model met 2.4T parameters, beschikbaar met een tijdelijke korting van 90%.
- kimi-k3: Moonshot AI open long-context model met 2.8T parameters, een 1M contextvenster en native vision input. Zie de Kimi K3 praktische gids.
- grok-4.5: configureerbare redenering, tool-aanroep en 500K context, geschikt voor code reparatie en agentwerkstromen.
- tencent-hy3: de GA-release van Tencent Hunyuan Hy3. MoE-architectuur met 295B totaal / 21B actieve parameters, een 256K contextvenster, open source onder Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: nieuwe niveaus in de Google Flash serie.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Codering
- qwen3-coder-480b-a35b-instruct: Qwen3-Coder vlaggenschipcode model voor codegeneratie, software-engineering agenten en tool-aanroep werkstromen.
Audio
- gpt-audio-1.5: het eerste algemeen beschikbare (GA) OpenAI audio model, dat audio-invoer en -uitvoer ondersteunt.
- gpt-4o-transcribe-diarize: ASR transcriptie met spreker diarizatie, alleen beschikbaar via de Transcriptie API.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: Qwen spraak synthese modellen. De plus-niveau biedt fijne controle over emotie en karakter, het flash-niveau levert eerste-pakket latentie onder de 200 ms.
Afbeelding
- mai-image-2.5-pro: Microsoft vlaggenschip afbeelding generatie en bewerkingsmodel met hoge-fidelity realisme en in-afbeelding tekstweergave. mai-image-2.5 en mai-image-2.5-flash uit dezelfde serie zijn ook live.
- gemini-3.1-flash-lite-image: Google afbeelding capaciteitsmodel.
3D
- hy-3d-3.1: Tencent Hunyuan 3D professionele editie, ondersteunt tekst-naar-3D, afbeelding-naar-3D en acht-view multi-hoek input.
Ophalen / herordenen
- jina-reranker-v3.5: Jina AI meertalige lijstwijze document herordener voor RAG, zoekopdracht en gestructureerde gegevensrangschikking.
Prijzen en aankondigingen
- GLM-5.2 tijdelijke tijd-van-de-dag aanbieding:
glm-5.2is met korting op basis van dagelijkse tijdvensters, in UTC: 50% korting van 14:00 tot 24:00 en 30% korting van 00:00 tot 14:00 elke dag. Tijdelijke aanbieding. - Qwen3.8-Max-Preview met 90% korting: oproepen worden gefactureerd tegen 10% van de lijstprijs, effectief 10x meer gebruik voor dezelfde uitgave. Tijdelijk, wie het eerst komt, het eerst maalt.
- DeepSeek V4 tijd-van-de-dag facturering: DeepSeek V4 modellen ondersteunen piek- en dalfacturering. Kosten volgen het tijdvenster van de aanvraagindientijd, en streaming verzoeken die een grens overschrijden worden ook geprijsd op het moment van indiening.
FAQ
Welke modellen zijn deze maand toegevoegd?
Bijna 30, waaronder chat (claude-opus-5, claude-sonnet-5, de GPT-5.6 serie, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 en meer), codering (qwen3-coder-480b-a35b-instruct), audio (gpt-audio-1.5 en de qwen-audio-3.0-tts serie), afbeelding (de mai-image-2.5 serie), 3D (hy-3d-3.1) en herordenen (jina-reranker-v3.5).
Hoe verbind ik met de AIHubMix MCP Server?
Voeg het toegangspunt https://mcp.aihubmix.com/mcp toe in elke MCP-geactiveerde client (Claude Code, Codex, Cursor en anderen). Referenties worden per verzoek door de client doorgegeven. Je kunt dan modellen en prijzen opvragen, documentatie doorzoeken, je saldo controleren en chat-, afbeeldinggeneratie- en videogeneratietools aanroepen.
Wat ondersteunen de media-generatie API's?
Dien afbeeldingsgeneratie en bewerkingsverzoeken in via /ai/v1/images/generations en /ai/v1/images/edits, gebruik vervolgens de verenigde asynchrone taak API om de status op te vragen, artifacts te downloaden en webhook callbacks te ontvangen. Zie Asynchrone Taken.
Wat is de Qwen3.8-Max-Preview tijdelijke aanbieding?
Oproepen worden gefactureerd tegen 10% van de lijstprijs, effectief 10x meer gebruik voor dezelfde uitgave. Tijdelijk, wie het eerst komt, het eerst maalt.
Bekijk alle modellen in de modelgalerij en vind integratiedetails in de documentatie.
Bijgewerkt: 2026-07-31