W tym miesiącu AIHubMix dodał prawie 30 nowych modeli w obszarach czatu, kodowania, audio, obrazu i 3D oraz uruchomił kilka możliwości platformy, w tym API generacji mediów, naprawę strukturalnego wyjścia i API generacji 3D. Zakres dostępnych modalności przez jeden klucz API nadal się rozszerza. Oto najważniejsze informacje.
API generacji mediów i zjednoczone zadania asynchroniczne
Nowe punkty końcowe generacji mediów /ai/v1/images/generations i /ai/v1/images/edits są teraz dostępne, razem z zjednoczonymi zadaniami asynchronicznymi, zapytaniami o wyniki, pobieraniem artefaktów i wywołaniami webhook. Przepływy pracy z obrazami i wideo mogą integrować się przez ten sam cykl życia zadania, co ułatwia śledzenie długotrwałych wyników generacji. Wygenerowane artefakty wspierają bezpośrednie pobieranie i zbiorcze pobieranie. Zobacz Zadania asynchroniczne.
Naprawa strukturalnego wyjścia
Nowa funkcjonalność naprawy strukturalnego wyjścia na poziomie klucza jest dostępna, domyślnie wyłączona. Po włączeniu, dla żądań nienadawanych, które deklarują strukturalne wyjście JSON, gdy model zwraca JSON z błędami formatu, takimi jak obcięcie, zbędne przecinki lub opakowania bloków kodu, platforma automatycznie naprawia go na poprawny JSON przed zwróceniem. Wartości pozostają niezmienione i nie są wymagane żadne zmiany po stronie klienta. Obsługuje protokoły Chat Completions, Responses, Claude i Gemini, a naprawione odpowiedzi mają nagłówek X-JSON-Repaired: true. Zobacz Naprawa strukturalnego wyjścia.
API generacji 3D
Nowe asynchroniczne API generacji 3D /v1/3d/generations uruchamia Tencent Hunyuan 3D (hy-3d-3.1) jako pierwszy obsługiwany model. Obsługuje tekst-na-3D, obraz-na-3D i wejście z wielu widoków, z artefaktami w formatach obj, glb, stl, usdz i fbx oraz materiałami PBR, odpowiednimi do gier, wyświetlania e-commerce, druku 3D i projektowania produktów. Zobacz API generacji 3D.
Oficjalny serwer MCP AIHubMix
Oficjalny punkt dostępu dla klientów MCP jest teraz aktywny: mcp.aihubmix.com/mcp (kopie zapasowe: mcp.inferera.com/mcp). Połącz go w Claude Code, Codex, Cursor i innych narzędziach, aby zapytać o modele i ceny, przeszukiwać dokumentację, sprawdzać saldo oraz wywoływać narzędzia do czatu, generacji obrazów i generacji wideo. Poświadczenia są przekazywane w każdym żądaniu przez klienta, a serwer nie przechowuje kluczy API.
Wyszukiwanie Jina i czytanie w sieci
Nowe możliwości wyszukiwania i czytania Jina pozwalają na pobieranie wyników wyszukiwania i treści stron internetowych za pomocą klucza API AIHubMix, odpowiednie do zewnętrznego pozyskiwania informacji, czytania dokumentów i wywoływania narzędzi agenta. Oba wspierają żądania POST, a Reader akceptuje również przesyłanie wielu plików lokalnych, takich jak PDF, Word, Excel, PPT, HTML i obrazy. Zobacz Jina AI.
Inne aktualizacje funkcji
- Generacja audio TTS Qwen:
qwen-audio-3.0-tts-plusiqwen-audio-3.0-tts-flashmogą być wywoływane przez/v1/audio/speech. Żądania nienadawane zwracają link do wyniku audio, żądania nadawane zwracają zdarzenia generacji audio SSE, z obsługą tagów emocji i instrukcji głosowych w naturalnym języku. Zobacz TTS. - Dokumentacja pamięci podręcznej GPT: zaczynając od serii GPT-5.6, zapisy w pamięci podręcznej są rozliczane w wysokości 1,25x ceny wejściowej, odczyty z pamięci podręcznej w wysokości 0,1x, a pamięci podręczne są przechowywane przez co najmniej 30 minut. Zawiera szczegóły dotyczące parametru
prompt_cache_keyoraz rozwiązywanie problemów z trafieniami w pamięci podręcznej. Zobacz Pamięć podręczna podpowiedzi GPT. - Wideo Veo 3.1 obsługuje pierwsze/ostatnie klatki i obrazy referencyjne: kontroluj otwierające i zamykające ujęcia, odniesienia do postaci i odniesienia do stylu z większą precyzją. Zobacz Generacja wideo.
- Automatyczne mostki odpowiedzi dla wywołań narzędzi gpt-5.5 i wyżej: żądania wysyłane przez
/v1/chat/completionsz narzędziami ireasoning_effortautomatycznie korzystają z możliwości Odpowiedzi, co daje istniejącym klientom bardziej niezawodne wywoływanie narzędzi bez jakichkolwiek zmian. Zobacz API Odpowiedzi. - Ukończono natywne punkty końcowe Gemini: SDK
@google/genaiteraz obsługuje natywne Embeddings, Interactions i Context Caching, gdy jest wywoływane przez AIHubMix. Zobacz Natywne SDK Gemini. - Rozszerzenie połączeń strumieniowych do 2 godzin: maksymalny czas połączenia strumieniowego został wydłużony z 1 godziny do 2 godzin, dzięki czemu długie myślenie i długie zadania generacyjne są mniej prawdopodobne, aby zostały przerwane przedwcześnie.
- Przekazywanie parametrów obrazu Gemini: podczas wywoływania modeli wyjściowych obrazów Gemini przez API zgodne z OpenAI,
aspectRatioiimageSizemogą być przekazywane wextra_body.generationConfig.imageConfig. - Strukturalne wyjście w różnych protokołach: zgodne z OpenAI
response_formati natywneoutput_config.formatGemini teraz dostosowują się w obie strony na odpowiednich ścieżkach. Zobacz Strukturalne wyjście.
Stabilność i poprawki
- Udoskonalenia kompatybilności między protokołami: pola odpowiedzi wiadomości, parametry myślenia, parametry
stopi struktury odpowiedzi wywołań narzędzi są dalej dostosowywane do każdego ekosystemu protokołu. - Udoskonalenia niezawodności strumieniowania: naprawiono obcięte wyjścia strumieniowe i odpowiedzi błędnie klasyfikowane jako puste dla niektórych modeli, z bardziej kompletnymi zapisami użycia, gdy klienci się rozłączają.
- Udoskonalenia pomiaru pamięci podręcznej i dokładności rozliczeń, aby szczegóły rozliczeń lepiej odzwierciedlały rzeczywiste użycie.
- Jaśniejsze komunikaty o błędach: błędy walidacji parametrów zwracane są wcześniej, a błędy dla nieznanych modeli i wyczerpanych limitów kluczy są bardziej explicite.
Nowe modele w tym miesiącu (prawie 30)
Czat / ogólne
- claude-opus-5: flagowy model Anthropic z oknem kontekstowym 1M i maksymalnym wyjściem 128K, stworzony do intensywnego rozumowania, kodowania i długoterminowych zadań agenta.
- claude-sonnet-5: do czatu, rozumowania i scenariuszy agenta.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: trzy poziomy serii OpenAI GPT-5.6, każdy z oknem kontekstowym 1,050,000, maksymalnym wyjściem 128K oraz wejściem tekstowym i obrazowym. Sol to flagowy poziom, Terra odpowiada wydajności GPT-5.5 w połowie ceny, a Luna celuje w obciążenia wrażliwe na koszty.
- qwen3.8-max-preview: najnowszy model podstawowy Qwen z 2.4T parametrów, dostępny w ograniczonej ofercie z 90% zniżką.
- kimi-k3: model Moonshot AI z otwartym długim kontekstem z 2.8T parametrów, oknem kontekstowym 1M i natywnym wejściem wizualnym. Zobacz praktyczny przewodnik Kimi K3.
- grok-4.5: konfigurowalne rozumowanie, wywoływanie narzędzi i 500K kontekstu, odpowiednie do naprawy kodu i przepływów pracy agenta.
- tencent-hy3: wydanie GA Tencent Hunyuan Hy3. Architektura MoE z 295B całkowitych / 21B aktywnych parametrów, okno kontekstowe 256K, open source na licencji Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: nowe poziomy w serii Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Kodowanie
- qwen3-coder-480b-a35b-instruct: flagowy model kodu Qwen3-Coder do generacji kodu, agentów inżynierii oprogramowania i przepływów pracy wywoływania narzędzi.
Audio
- gpt-audio-1.5: pierwszy ogólnie dostępny (GA) model audio OpenAI, wspierający wejście i wyjście audio.
- gpt-4o-transcribe-diarize: transkrypcja ASR z diarizacją mówców, dostępna tylko przez API transkrypcyjne.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: modele syntezatora mowy Qwen. Poziom plus oferuje precyzyjną kontrolę nad emocjami i postacią, poziom flash zapewnia opóźnienie pierwszego pakietu poniżej 200 ms.
Obraz
- mai-image-2.5-pro: flagowy model generacji i edycji obrazów Microsoftu z wysoką wiernością realizmu i renderowaniem tekstu w obrazie. mai-image-2.5 i mai-image-2.5-flash z tej samej serii są również dostępne.
- gemini-3.1-flash-lite-image: model możliwości obrazowych Google.
3D
- hy-3d-3.1: profesjonalna edycja Tencent Hunyuan 3D, wspierająca tekst-na-3D, obraz-na-3D i wejście z ośmiu kątów widzenia.
Pozyskiwanie / ponowne klasyfikowanie
- jina-reranker-v3.5: wielojęzyczny model Jina AI do ponownej klasyfikacji dokumentów listwise dla RAG, wyszukiwania i klasyfikacji danych strukturalnych.
Ceny i ogłoszenia
- Ograniczona oferta czasowa GLM-5.2:
glm-5.2jest objęty zniżką w zależności od okna czasowego, w UTC: 50% zniżki od 14:00 do 24:00 i 30% zniżki od 00:00 do 14:00 każdego dnia. Oferta ograniczona czasowo. - Qwen3.8-Max-Preview z 90% zniżką: wywołania są rozliczane w wysokości 10% ceny katalogowej, co efektywnie daje 10x więcej użycia za tę samą wydaną kwotę. Oferta ograniczona czasowo, kto pierwszy, ten lepszy.
- Rozliczanie DeepSeek V4 w zależności od pory dnia: modele DeepSeek V4 wspierają rozliczanie w godzinach szczytu i poza szczytem. Opłaty są zgodne z oknem czasowym czasu złożenia żądania, a żądania strumieniowe, które przekraczają granicę, są również wyceniane według czasu złożenia.
FAQ
Jakie modele zostały dodane w tym miesiącu?
Prawie 30, obejmujące czat (claude-opus-5, claude-sonnet-5, seria GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 i inne), kodowanie (qwen3-coder-480b-a35b-instruct), audio (gpt-audio-1.5 i seria qwen-audio-3.0-tts), obraz (seria mai-image-2.5), 3D (hy-3d-3.1) i ponowne klasyfikowanie (jina-reranker-v3.5).
Jak mogę połączyć się z serwerem MCP AIHubMix?
Dodaj punkt dostępu https://mcp.aihubmix.com/mcp w dowolnym kliencie obsługującym MCP (Claude Code, Codex, Cursor i inne). Poświadczenia są przekazywane w każdym żądaniu przez klienta. Możesz następnie zapytać o modele i ceny, przeszukiwać dokumentację, sprawdzać saldo oraz wywoływać narzędzia do czatu, generacji obrazów i generacji wideo.
Co wspierają API generacji mediów?
Składaj żądania generacji i edycji obrazów przez /ai/v1/images/generations i /ai/v1/images/edits, a następnie użyj zjednoczonego API zadań asynchronicznych, aby zapytać o status, pobrać artefakty i otrzymać wywołania webhook. Zobacz Zadania asynchroniczne.
Co to jest oferta ograniczona czasowo Qwen3.8-Max-Preview?
Wywołania są rozliczane w wysokości 10% ceny katalogowej, co efektywnie daje 10x więcej użycia za tę samą wydaną kwotę. Oferta ograniczona czasowo, kto pierwszy, ten lepszy.
Przeglądaj wszystkie modele w galerii modeli i znajdź szczegóły integracji w dokumentacji.
Zaktualizowano: 2026-07-31