In diesem Monat hat AIHubMix fast 30 neue Modelle in den Bereichen Chat, Programmierung, Audio, Bild und 3D hinzugefügt und mehrere Plattformfunktionen wie Medien-Generierungs-APIs, strukturierte Ausgabe-Reparatur und eine 3D-Generierungs-API eingeführt. Die Palette der Modalitäten, die über einen einzigen API-Schlüssel verfügbar sind, erweitert sich weiterhin. Hier sind die Highlights.
Medien-Generierungs-APIs und vereinheitlichte asynchrone Aufgaben
Neue Medien-Generierungsendpunkte /ai/v1/images/generations und /ai/v1/images/edits sind jetzt verfügbar, zusammen mit vereinheitlichten asynchronen Aufgaben, Ergebnisabfragen, Artefakt-Downloads und Webhook-Rückrufen. Bild- und Video-Workflows können durch denselben Aufgabenlebenszyklus integriert werden, was es einfach macht, lang laufende Generierungsergebnisse zu verfolgen. Generierte Artefakte unterstützen den direkten Download und die Batch-Abholung. Siehe Asynchrone Aufgaben.
Reparatur strukturierter Ausgaben
Eine neue Schlüsselebene für die Reparatur strukturierter Ausgaben ist verfügbar, standardmäßig deaktiviert. Sobald sie aktiviert ist, werden für nicht-streamende Anfragen, die eine strukturierte JSON-Ausgabe deklarieren, wenn das Modell JSON mit Formatfehlern wie Trunkierung, überflüssigen Kommas oder Codeblock-Wrappern zurückgibt, die Plattform es automatisch in parsierbares, gültiges JSON repariert, bevor es zurückgegeben wird. Werte bleiben unverändert und es sind keine Änderungen am Client erforderlich. Es unterstützt die Chat-Vervollständigungen, Antworten, Claude- und Gemini-Protokolle, und reparierte Antworten tragen den X-JSON-Repaired: true Header. Siehe Reparatur strukturierter Ausgaben.
3D-Generierungs-API
Die neue /v1/3d/generations asynchrone 3D-Generierungs-API startet mit Tencent Hunyuan 3D (hy-3d-3.1) als erstem unterstützten Modell. Sie umfasst Text-zu-3D, Bild-zu-3D und Multi-View-Eingaben, mit Artefakten in den Formaten obj, glb, stl, usdz und fbx sowie PBR-Materialien, geeignet für Spiele, E-Commerce-Darstellungen, 3D-Druck und Produktdesign. Siehe 3D-Generierungs-API.
Offizieller AIHubMix MCP-Server
Der offizielle gehostete Einstiegspunkt für MCP-Clients ist jetzt live: mcp.aihubmix.com/mcp (Backup: mcp.inferera.com/mcp). Verbinden Sie ihn in Claude Code, Codex, Cursor und anderen Tools, um Modelle und Preise abzufragen, Dokumentation zu durchsuchen, Ihr Guthaben zu überprüfen und Chat-, Bildgenerierungs- und Video-Generierungs-Tools aufzurufen. Anmeldeinformationen werden pro Anfrage vom Client übermittelt und der Server speichert keine API-Schlüssel.
Jina-Suche und Web-Lesen
Neue Jina-Such- und Reader-Funktionen ermöglichen es Ihnen, Suchergebnisse und Inhalte von Webseiten mit Ihrem AIHubMix-API-Schlüssel abzurufen, geeignet für externe Informationsbeschaffung, Dokumentenlesen und das Aufrufen von Agenten-Tools. Beide unterstützen POST-Anfragen, und Reader akzeptiert auch Multipart-Uploads von lokalen Dateien wie PDF, Word, Excel, PPT, HTML und Bildern. Siehe Jina AI.
Weitere Funktionsupdates
- Qwen TTS-Audio-Generierung:
qwen-audio-3.0-tts-plusundqwen-audio-3.0-tts-flashkönnen über/v1/audio/speechaufgerufen werden. Nicht-streamende Anfragen geben einen Audioergebnislink zurück, Streaming-Anfragen geben SSE-Audio-Generierungsereignisse zurück, mit Unterstützung für Emotionstags und natürliche Sprachbefehle. Siehe TTS. - Dokumentation zur GPT-Prompt-Caching: Ab der GPT-5.6-Serie werden Cache-Schreibvorgänge mit 1,25x des Eingabepreises berechnet, Cache-Lesevorgänge mit 0,1x, und Caches werden mindestens 30 Minuten lang aufbewahrt. Enthält Details zum
prompt_cache_key-Parameter und zur Fehlersuche bei Cache-Treffern. Siehe GPT-Prompt-Caching. - Veo 3.1 Bild-zu-Video unterstützt erste/letzte Frames und Referenzbilder: Steuern Sie die Eröffnungs- und Schlussaufnahmen, Charakterreferenzen und Stilreferenzen präziser. Siehe Video-Generierung.
- Automatische Antworten für Toolaufrufe von gpt-5.5 und höher: Anfragen, die über
/v1/chat/completionsmit Tools undreasoning_effortgesendet werden, verwenden automatisch die Funktionen von Responses, was bestehenden Clients zuverlässigere Toolaufrufe ohne Änderungen ermöglicht. Siehe Responses-API. - Gemini-native Endpunkte abgeschlossen: Das
@google/genaiSDK unterstützt jetzt native Embeddings, Interaktionen und Kontext-Caching, wenn es über AIHubMix aufgerufen wird. Siehe Gemini Native SDK. - Streaming-Verbindungen auf 2 Stunden verlängert: Die maximale Streaming-Verbindungszeit wurde von 1 Stunde auf 2 Stunden verlängert, sodass langwierige Denk- und Generierungsaufgaben weniger wahrscheinlich vorzeitig abgebrochen werden.
- Gemini-Bildparameter-Passthrough: Beim Aufrufen von Gemini-Bildausgabemodellen über die OpenAI-kompatible API können
aspectRatioundimageSizeinextra_body.generationConfig.imageConfigübergeben werden. - Strukturierte Ausgaben über Protokolle hinweg: Das OpenAI-kompatible
response_formatund das Claude-nativeoutput_config.formatpassen sich jetzt in beide Richtungen auf den relevanten Pfaden an. Siehe Strukturierte Ausgaben.
Stabilität und Fehlerbehebungen
- Verbesserungen der Multi-Protokoll-Kompatibilität: Nachrichtenantwortfelder, Denkparameter,
stop-Parameter und Strukturen der Toolaufrufantworten sind weiter an jedes Protokoll-Ökosystem angepasst. - Verbesserungen der Streaming-Zuverlässigkeit: Behebung von abgeschnittenen Streaming-Ausgaben und Antworten, die für einige Modelle fälschlicherweise als leer klassifiziert wurden, mit vollständigeren Nutzungsprotokollen, wenn Clients die Verbindung trennen.
- Verbesserungen der Cache-Messung und Abrechnungsgenauigkeit, sodass die Abrechnungsdetails die tatsächliche Nutzung besser widerspiegeln.
- Deutlichere Fehlermeldungen: Parametervalidierungsfehler werden früher zurückgegeben, und Fehler für unbekannte Modelle und erschöpfte Schlüsselquoten sind expliziter.
Neue Modelle in diesem Monat (fast 30)
Chat / allgemein
- claude-opus-5: Anthropic-Flaggschiffmodell mit einem Kontextfenster von 1M und 128K maximaler Ausgabe, entwickelt für intensives Denken, Programmierung und langfristige Agentenaufgaben.
- claude-sonnet-5: für Chat-, Denk- und Agentenszenarien.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: drei Stufen der OpenAI GPT-5.6-Serie, jede mit einem Kontextfenster von 1.050.000, 128K maximaler Ausgabe und Text- sowie Bildeingabe. Sol ist die Flaggschiff-Stufe, Terra entspricht der Leistung von GPT-5.5 zum halben Preis, und Luna zielt auf kostenbewusste Arbeitslasten ab.
- qwen3.8-max-preview: das neueste Generation Qwen-Grundlagenmodell mit 2,4T Parametern, verfügbar zu einem zeitlich begrenzten Rabatt von 90 %.
- kimi-k3: Moonshot AI offenes Langkontextmodell mit 2,8T Parametern, einem Kontextfenster von 1M und nativer Visionseingabe. Siehe den Kimi K3 praktischen Leitfaden.
- grok-4.5: konfigurierbares Denken, Toolaufrufe und 500K Kontext, geeignet für Code-Reparatur und Agenten-Workflows.
- tencent-hy3: die GA-Version von Tencent Hunyuan Hy3. MoE-Architektur mit 295B insgesamt / 21B aktiven Parametern, einem Kontextfenster von 256K, Open Source unter Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: neue Stufen in der Google Flash-Serie.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Programmierung
- qwen3-coder-480b-a35b-instruct: Qwen3-Coder Flaggschiff-Code-Modell für Code-Generierung, Software-Engineering-Agenten und Toolaufruf-Workflows.
Audio
- gpt-audio-1.5: das erste allgemein verfügbare (GA) OpenAI-Audiomodell, das Audioeingabe und -ausgabe unterstützt.
- gpt-4o-transcribe-diarize: ASR-Transkription mit Sprecher-Diarisation, nur über die Transkriptions-API verfügbar.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: Qwen-Sprachsynthesemodelle. Die Plus-Stufe bietet eine feinkörnige Kontrolle über Emotion und Charakter, die Flash-Stufe liefert eine Erstpaket-Latenz von unter 200 ms.
Bild
- mai-image-2.5-pro: Microsoft Flaggschiff-Modell zur Bildgenerierung und -bearbeitung mit hochrealistischem Realismus und Textdarstellung im Bild. mai-image-2.5 und mai-image-2.5-flash aus derselben Serie sind ebenfalls verfügbar.
- gemini-3.1-flash-lite-image: Google-Bildfähigkeitsmodell.
3D
- hy-3d-3.1: Tencent Hunyuan 3D professionelle Edition, die Text-zu-3D, Bild-zu-3D und acht Ansichten mit mehreren Winkeln unterstützt.
Retrieval / Neurangierung
- jina-reranker-v3.5: Jina AI mehrsprachiger listwise Dokumenten-Neuranker für RAG, Suche und strukturierte Datenrangfolge.
Preise und Ankündigungen
- GLM-5.2 zeitlich begrenztes Angebot nach Tageszeit:
glm-5.2ist nach täglichen Zeitfenstern rabattiert, in UTC: 50 % Rabatt von 14:00 bis 24:00 und 30 % Rabatt von 00:00 bis 14:00 jeden Tag. Zeitlich begrenztes Angebot. - Qwen3.8-Max-Preview mit 90 % Rabatt: Anrufe werden mit 10 % des Listenpreises berechnet, was effektiv 10x mehr Nutzung für die gleiche Ausgabe bedeutet. Zeitlich begrenzt, wer zuerst kommt, mahlt zuerst.
- DeepSeek V4 zeitlich begrenzte Abrechnung: DeepSeek V4-Modelle unterstützen Spitzen- und Nebenzeitenabrechnung. Die Gebühren folgen dem Zeitfenster der Anfrageeinreichungszeit, und Streaming-Anfragen, die eine Grenze überschreiten, werden ebenfalls zum Zeitpunkt der Einreichung bepreist.
FAQ
Welche Modelle wurden in diesem Monat hinzugefügt?
Fast 30, die Chat (claude-opus-5, claude-sonnet-5, die GPT-5.6-Serie, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 und mehr), Programmierung (qwen3-coder-480b-a35b-instruct), Audio (gpt-audio-1.5 und die qwen-audio-3.0-tts-Serie), Bild (die mai-image-2.5-Serie), 3D (hy-3d-3.1) und Neurangierung (jina-reranker-v3.5) abdecken.
Wie verbinde ich mich mit dem AIHubMix MCP-Server?
Fügen Sie den Einstiegspunkt https://mcp.aihubmix.com/mcp in jeden MCP-fähigen Client (Claude Code, Codex, Cursor und andere) ein. Anmeldeinformationen werden pro Anfrage vom Client übermittelt. Sie können dann Modelle und Preise abfragen, die Dokumentation durchsuchen, Ihr Guthaben überprüfen und Chat-, Bildgenerierungs- und Video-Generierungs-Tools aufrufen.
Was unterstützen die Medien-Generierungs-APIs?
Reichen Sie Anfragen zur Bildgenerierung und -bearbeitung über /ai/v1/images/generations und /ai/v1/images/edits ein und verwenden Sie dann die vereinheitlichte asynchrone Aufgaben-API, um den Status abzufragen, Artefakte herunterzuladen und Webhook-Rückrufe zu erhalten. Siehe Asynchrone Aufgaben.
Was ist das zeitlich begrenzte Angebot für Qwen3.8-Max-Preview?
Anrufe werden mit 10 % des Listenpreises berechnet, was effektiv 10x mehr Nutzung für die gleiche Ausgabe bedeutet. Zeitlich begrenzt, wer zuerst kommt, mahlt zuerst.
Durchsuchen Sie alle Modelle in der Modellgalerie und finden Sie Integrationsdetails in der Dokumentation.
Aktualisiert: 2026-07-31