Riflettori sulla Release di Luglio 2026: ~30 Nuovi Modelli e API Media

31 lug 2026 · AIHubMix · 6 min read · Registro modifiche

Riflettori sulla Release di Luglio 2026: ~30 Nuovi Modelli e API Media

Questo mese AIHubMix ha aggiunto quasi 30 nuovi modelli in chat, codifica, audio, immagine e 3D, e ha lanciato diverse capacità della piattaforma tra cui API di generazione media, riparazione di output strutturati e un'API di generazione 3D. La gamma di modalità disponibili tramite una singola chiave API continua ad espandersi. Ecco i punti salienti.

API di generazione media e attività asincrone unificate

Nuovi endpoint di generazione media /ai/v1/images/generations e /ai/v1/images/edits sono ora disponibili, insieme a attività asincrone unificate, query di risultati, download di artefatti e callback webhook. I flussi di lavoro di immagini e video possono integrarsi attraverso lo stesso ciclo di vita delle attività, rendendo facile tracciare i risultati di generazione a lungo termine. Gli artefatti generati supportano il download diretto e il recupero in batch. Vedi Attività Asincrone.

Riparazione di output strutturati

È disponibile una nuova capacità di riparazione di output strutturati a livello di chiave, disabilitata per impostazione predefinita. Una volta abilitata, per le richieste non in streaming che dichiarano output JSON strutturati, quando il modello restituisce JSON con errori di formato come troncamenti, virgole finali o wrapper di blocchi di codice, la piattaforma lo ripara automaticamente in JSON valido e analizzabile prima di restituirlo. I valori rimangono invariati e non sono necessarie modifiche da parte del cliente. Supporta i protocolli Chat Completions, Responses, Claude e Gemini, e le risposte riparate portano l'intestazione X-JSON-Repaired: true. Vedi Riparazione di Output Strutturati.

API di generazione 3D

La nuova API di generazione 3D asincrona /v1/3d/generations viene lanciata con Tencent Hunyuan 3D (hy-3d-3.1) come primo modello supportato. Copre input testo-3D, immagine-3D e input multi-view, con artefatti nei formati obj, glb, stl, usdz e fbx più materiali PBR, adatti per giochi, display e-commerce, stampa 3D e design di prodotto. Vedi API di Generazione 3D.

Server MCP ufficiale di AIHubMix

Il punto di accesso ufficiale ospitato per i client MCP è ora attivo: mcp.aihubmix.com/mcp (backup: mcp.inferera.com/mcp). Connettilo in Claude Code, Codex, Cursor e altri strumenti per interrogare modelli e prezzi, cercare documentazione, controllare il tuo saldo e chiamare strumenti di chat, generazione di immagini e generazione di video. Le credenziali vengono passate per richiesta dal client e il server non memorizza le chiavi API.

Ricerca Jina e lettura web

Le nuove capacità di Ricerca e Lettore Jina ti consentono di recuperare risultati di ricerca e contenuti di pagine web con la tua chiave API di AIHubMix, adatte per il recupero di informazioni esterne, lettura di documenti e chiamata di strumenti agenti. Entrambi supportano richieste POST, e il Lettore accetta anche caricamenti multiparte di file locali come PDF, Word, Excel, PPT, HTML e immagini. Vedi Jina AI.

Altri aggiornamenti delle funzionalità

  • Generazione audio Qwen TTS: qwen-audio-3.0-tts-plus e qwen-audio-3.0-tts-flash possono essere chiamati tramite /v1/audio/speech. Le richieste non in streaming restituiscono un link al risultato audio, le richieste in streaming restituiscono eventi di generazione audio SSE, con supporto per tag emozionali e istruzioni vocali in linguaggio naturale. Vedi TTS.
  • Documentazione di caching dei prompt GPT: a partire dalla serie GPT-5.6, le scritture nella cache vengono addebitate a 1,25 volte il prezzo di input, le letture dalla cache a 0,1 volte, e le cache vengono mantenute per almeno 30 minuti. Include dettagli sul parametro prompt_cache_key e risoluzione dei problemi di hit della cache. Vedi Caching dei Prompt GPT.
  • Veo 3.1 immagine-a-video supporta i primi/ultimi fotogrammi e immagini di riferimento: controlla le riprese di apertura e chiusura, i riferimenti ai personaggi e i riferimenti di stile con maggiore precisione. Vedi Generazione Video.
  • Risposte automatiche per chiamate a strumenti gpt-5.5 e superiori: le richieste inviate tramite /v1/chat/completions con strumenti e reasoning_effort utilizzano automaticamente le capacità di Risposte, offrendo ai clienti esistenti una chiamata a strumenti più affidabile senza alcuna modifica. Vedi API di Risposte.
  • Endpoint nativi Gemini completati: il SDK @google/genai ora supporta Embeddings, Interactions e Context Caching nativi quando chiamato tramite AIHubMix. Vedi SDK Nativo Gemini.
  • Connessioni in streaming estese a 2 ore: il tempo massimo di connessione in streaming è stato esteso da 1 ora a 2 ore, quindi i compiti di pensiero e generazione a lungo termine hanno meno probabilità di essere interrotti prematuramente.
  • Passaggio dei parametri immagine Gemini: quando si chiamano modelli di output immagine Gemini tramite l'API compatibile con OpenAI, aspectRatio e imageSize possono essere passati in extra_body.generationConfig.imageConfig.
  • Output strutturato attraverso i protocolli: il response_format compatibile con OpenAI e il output_config.format nativo di Claude ora si adattano in entrambe le direzioni sui percorsi pertinenti. Vedi Output Strutturato.

Stabilità e correzioni

  • Miglioramenti della compatibilità multi-protocollo: i campi di risposta dei messaggi, i parametri di pensiero, i parametri stop e le strutture di risposta delle chiamate agli strumenti sono ulteriormente allineati con ciascun ecosistema di protocollo.
  • Miglioramenti dell'affidabilità dello streaming: risolto output di streaming troncato e risposte erroneamente classificate come vuote per alcuni modelli, con registri di utilizzo più completi quando i clienti si disconnettono.
  • Miglioramenti della misurazione e della precisione di fatturazione della cache, in modo che i dettagli di fatturazione riflettano meglio l'uso effettivo.
  • Messaggi di errore più chiari: i fallimenti di validazione dei parametri restituiscono prima, e gli errori per modelli sconosciuti e quote di chiavi esaurite sono più espliciti.

Nuovi modelli questo mese (quasi 30)

Chat / generale

  • claude-opus-5: modello di punta di Anthropic con una finestra di contesto di 1M e 128K output massimo, costruito per ragionamenti intensivi, codifica e compiti di agenti a lungo termine.
  • claude-sonnet-5: per chat, ragionamento e scenari di agenti.
  • gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: tre livelli della serie OpenAI GPT-5.6, ciascuno con una finestra di contesto di 1.050.000, 128K output massimo, e input di testo più immagine. Sol è il livello di punta, Terra corrisponde alle prestazioni di GPT-5.5 a metà prezzo, e Luna è destinato a carichi di lavoro sensibili ai costi.
  • qwen3.8-max-preview: il modello di base Qwen di ultima generazione con 2.4T parametri, disponibile a un prezzo scontato del 90% per un tempo limitato.
  • kimi-k3: modello open long-context di Moonshot AI con 2.8T parametri, una finestra di contesto di 1M e input visivi nativi. Vedi la guida pratica Kimi K3.
  • grok-4.5: ragionamento configurabile, chiamata agli strumenti e 500K contesto, adatto per riparazione di codice e flussi di lavoro di agenti.
  • tencent-hy3: il rilascio GA di Tencent Hunyuan Hy3. Architettura MoE con 295B totali / 21B parametri attivi, una finestra di contesto di 256K, open sourced sotto Apache 2.0.
  • gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: nuovi livelli nella serie Google Flash.
  • glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.

Codifica

  • qwen3-coder-480b-a35b-instruct: modello di codice di punta Qwen3-Coder per generazione di codice, agenti di ingegneria del software e flussi di lavoro di chiamata agli strumenti.

Audio

  • gpt-audio-1.5: il primo modello audio OpenAI generalmente disponibile (GA), che supporta input e output audio.
  • gpt-4o-transcribe-diarize: trascrizione ASR con diarizzazione degli oratori, disponibile solo tramite l'API di Trascrizione.
  • qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: modelli di sintesi vocale Qwen. Il livello plus offre un controllo dettagliato su emozione e carattere, il livello flash fornisce una latenza del primo pacchetto inferiore a 200 ms.

Immagine

  • mai-image-2.5-pro: modello di generazione e modifica di immagini di punta di Microsoft con realismo ad alta fedeltà e rendering di testo nell'immagine. mai-image-2.5 e mai-image-2.5-flash della stessa serie sono anche attivi.
  • gemini-3.1-flash-lite-image: modello di capacità immagine di Google.

3D

  • hy-3d-3.1: edizione professionale Tencent Hunyuan 3D, supporta input testo-3D, immagine-3D e input multi-angolo a otto viste.

Recupero / riordinamento

  • jina-reranker-v3.5: Jina AI riordinatore di documenti multilingue listwise per RAG, ricerca e ranking di dati strutturati.

Prezzi e annunci

  • Offerta limitata di GLM-5.2 in base all'orario del giorno: glm-5.2 è scontato in base alla finestra temporale giornaliera, in UTC: 50% di sconto dalle 14:00 alle 24:00 e 30% di sconto dalle 00:00 alle 14:00 ogni giorno. Offerta a tempo limitato.
  • Qwen3.8-Max-Preview al 90% di sconto: le chiamate vengono addebitate al 10% del prezzo di listino, effettivamente 10 volte più utilizzo per la stessa spesa. Tempo limitato, primo arrivato, primo servito.
  • Fatturazione in base all'orario del giorno per DeepSeek V4: i modelli DeepSeek V4 supportano la fatturazione durante le ore di punta e fuori punta. I costi seguono la finestra temporale del momento di invio della richiesta, e le richieste di streaming che attraversano un confine sono anche prezzate al momento dell'invio.

FAQ

Quali modelli sono stati aggiunti questo mese?
Quasi 30, coprendo chat (claude-opus-5, claude-sonnet-5, la serie GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 e altro), codifica (qwen3-coder-480b-a35b-instruct), audio (gpt-audio-1.5 e la serie qwen-audio-3.0-tts), immagine (la serie mai-image-2.5), 3D (hy-3d-3.1) e riordinamento (jina-reranker-v3.5).

Come mi connetto al Server MCP di AIHubMix?
Aggiungi il punto di accesso https://mcp.aihubmix.com/mcp in qualsiasi client abilitato MCP (Claude Code, Codex, Cursor e altri). Le credenziali vengono passate per richiesta dal client. Puoi quindi interrogare modelli e prezzi, cercare documentazione, controllare il tuo saldo e chiamare strumenti di chat, generazione di immagini e generazione di video.

Cosa supportano le API di generazione media?
Invia richieste di generazione e modifica delle immagini tramite /ai/v1/images/generations e /ai/v1/images/edits, quindi utilizza l'API di attività asincrone unificata per interrogare lo stato, scaricare artefatti e ricevere callback webhook. Vedi Attività Asincrone.

Qual è l'offerta a tempo limitato di Qwen3.8-Max-Preview?
Le chiamate vengono addebitate al 10% del prezzo di listino, effettivamente 10 volte più utilizzo per la stessa spesa. Tempo limitato, primo arrivato, primo servito.

Esplora tutti i modelli nella galleria dei modelli e trova i dettagli di integrazione nella documentazione.


Aggiornato: 2026-07-31

More from the blog