Фокус върху изданието от юли 2026: ~30 нови модела и медийни API

31.07.2026 г. · AIHubMix · 6 min read · Промени

Фокус върху изданието от юли 2026: ~30 нови модела и медийни API

Този месец AIHubMix добави почти 30 нови модела в области като чат, кодиране, аудио, изображения и 3D, и стартира няколко нови функционалности на платформата, включително API за генериране на медии, поправка на структурирани изходи и API за 3D генериране. Обхватът на наличните модалности чрез един API ключ продължава да се разширява. Ето основните акценти.

API за генериране на медии и обединени асинхронни задачи

Новите крайни точки за генериране на медии /ai/v1/images/generations и /ai/v1/images/edits вече са налични, заедно с обединени асинхронни задачи, запитвания за резултати, изтегляне на артефакти и обратни повиквания на уебхукове. Работните потоци за изображения и видео могат да се интегрират през същия жизнен цикъл на задачата, което улеснява проследяването на дългосрочни резултати от генерирането. Генерираните артефакти поддържат директно изтегляне и партидно извличане. Вижте Асинхронни задачи.

Поправка на структурирани изходи

Нова функционалност за поправка на структурирани изходи на ниво ключ е налична, деактивирана по подразбиране. След активиране, за нестрийминг запитвания, които декларират структурирани JSON изходи, когато моделът върне JSON с форматиращи грешки като съкращаване, излишни запетаи или обвивки на кодови блокове, платформата автоматично го поправя в парсируем валиден JSON преди да го върне. Стойностите остават непроменени и не са необходими промени от страна на клиента. Поддържа протоколите Chat Completions, Responses, Claude и Gemini, а поправените отговори носят заглавката X-JSON-Repaired: true. Вижте Поправка на структурирани изходи.

API за 3D генериране

Новият асинхронен API за 3D генериране /v1/3d/generations стартира с Tencent Hunyuan 3D (hy-3d-3.1) като първи поддържан модел. Той обхваща текст-към-3D, изображение-към-3D и вход с множество изгледи, с артефакти в формати obj, glb, stl, usdz и fbx, плюс PBR материали, подходящи за игри, електронна търговия, 3D печат и дизайн на продукти. Вижте API за 3D генериране.

Официален AIHubMix MCP сървър

Официалната хоствана входна точка за MCP клиенти вече е активна: mcp.aihubmix.com/mcp (резервно: mcp.inferera.com/mcp). Свържете я в Claude Code, Codex, Cursor и други инструменти, за да запитвате модели и цени, да търсите документация, да проверявате баланса си и да извиквате инструменти за чат, генериране на изображения и генериране на видео. Удостоверенията се предават с всяко запитване от клиента и сървърът не съхранява API ключове.

Jina търсене и четене на уеб

Новите функционалности на Jina Search и Reader ви позволяват да извличате резултати от търсене и съдържание от уеб страници с вашия AIHubMix API ключ, подходящи за извличане на външна информация, четене на документи и извикване на инструменти за агенти. И двете поддържат POST запитвания, а Reader също приема многокомпонентни качвания на локални файлове като PDF, Word, Excel, PPT, HTML и изображения. Вижте Jina AI.

Други актуализации на функциите

  • Генериране на аудио с Qwen TTS: qwen-audio-3.0-tts-plus и qwen-audio-3.0-tts-flash могат да бъдат извиквани чрез /v1/audio/speech. Нестриминг запитванията връщат линк за аудио резултат, а стрийминг запитванията връщат събития за генериране на аудио SSE, с поддръжка за етикети за емоции и инструкции за глас на естествен език. Вижте TTS.
  • Документация за кеширане на GPT подканите: започвайки с серията GPT-5.6, записите в кеша се таксуват на 1.25x цената на входа, четенето от кеша на 0.1x, а кешовете се запазват за поне 30 минути. Включва подробности за параметъра prompt_cache_key и отстраняване на проблеми с кеша. Вижте Кеширане на подканите на GPT.
  • Veo 3.1 генериране на изображения в видео поддържа първи/последни кадри и референтни изображения: контролирайте откриващите и заключителните кадри, референции на герои и референции на стил с по-голяма прецизност. Вижте Генериране на видео.
  • Автоматични отговори за свързване на извиквания на инструменти за gpt-5.5 и по-високи: запитвания, изпратени чрез /v1/chat/completions с инструменти и reasoning_effort, автоматично използват функционалността на отговорите, предоставяйки на съществуващите клиенти по-надеждно извикване на инструменти без никакви промени. Вижте API за отговори.
  • Завършени родни крайни точки на Gemini: SDK @google/genai вече поддържа родни Embeddings, Interactions и Context Caching, когато се извиква чрез AIHubMix. Вижте Gemini Native SDK.
  • Стрийминг връзките разширени до 2 часа: максималното време за стрийминг връзка е удължено от 1 час на 2 часа, така че дългите задачи за мислене и генериране е по-малко вероятно да бъдат прекъснати преждевременно.
  • Параметър за предаване на изображение на Gemini: при извикване на модели за изход на изображения на Gemini чрез OpenAI-съвместимия API, aspectRatio и imageSize могат да бъдат предадени в extra_body.generationConfig.imageConfig.
  • Структуриран изход през протоколите: OpenAI-съвместимият response_format и родният на Claude output_config.format сега се адаптират в двете посоки по съответните пътища. Вижте Структуриран изход.

Стабилност и поправки

  • Подобрения в съвместимостта на много протоколи: Полетата за отговор на съобщения, параметрите за мислене, параметрите stop и структурите на отговорите при извикване на инструменти са допълнително синхронизирани с всяка екосистема на протоколи.
  • Подобрения в надеждността на стрийминг: поправени са съкратени стрийминг изходи и отговори, неправилно класифицирани като празни за някои модели, с по-пълни записи на използването, когато клиентите се изключват.
  • Подобрения в измерването на кеша и точността на фактурирането, така че детайлите за фактуриране по-добре отразяват действителното използване.
  • По-ясни съобщения за грешки: провалите при валидиране на параметри се връщат по-рано, а грешките за неизвестни модели и изчерпани квоти за ключове са по-изрични.

Нови модели този месец (почти 30)

Чат / общо

  • claude-opus-5: флагмански модел на Anthropic с контекстен прозорец от 1M и максимален изход от 128K, създаден за интензивно разсъждение, кодиране и дългосрочни задачи на агенти.
  • claude-sonnet-5: за чат, разсъждение и сценарии на агенти.
  • gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: три нива на серията OpenAI GPT-5.6, всяко с контекстен прозорец от 1,050,000, максимален изход от 128K и вход от текст плюс изображение. Sol е флагманското ниво, Terra съответства на производителността на GPT-5.5 на половин цена, а Luna е насочена към чувствителни на разходи работни натоварвания.
  • qwen3.8-max-preview: най-новото поколение основен модел Qwen с 2.4T параметри, наличен с ограничена времева отстъпка от 90%.
  • kimi-k3: модел с отворен дълъг контекст на Moonshot AI с 2.8T параметри, контекстен прозорец от 1M и вход с родно зрение. Вижте Практическото ръководство за Kimi K3.
  • grok-4.5: конфигурируемо разсъждение, извикване на инструменти и 500K контекст, подходящо за поправка на код и работни потоци на агенти.
  • tencent-hy3: GA версия на Tencent Hunyuan Hy3. MoE архитектура с 295B общо / 21B активни параметри, контекстен прозорец от 256K, с отворен код под Apache 2.0.
  • gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: нови нива в серията Google Flash.
  • glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.

Кодиране

  • qwen3-coder-480b-a35b-instruct: флагманският кодов модел на Qwen3-Coder за генериране на код, агенти за софтуерно инженерство и работни потоци за извикване на инструменти.

Аудио

  • gpt-audio-1.5: първият общодостъпен (GA) аудио модел на OpenAI, поддържащ аудио вход и изход.
  • gpt-4o-transcribe-diarize: ASR транскрипция с диаризация на говорители, налична само чрез API за транскрипция.
  • qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: модели за синтез на реч на Qwen. Нивото плюс предлага прецизен контрол върху емоцията и характера, а нивото флаш предоставя латентност на първия пакет под 200 ms.

Изображение

  • mai-image-2.5-pro: флагманският модел на Microsoft за генериране и редактиране на изображения с висока реалистичност и рендериране на текст в изображения. mai-image-2.5 и mai-image-2.5-flash от същата серия също са активни.
  • gemini-3.1-flash-lite-image: модел на Google за способност за изображения.

3D

  • hy-3d-3.1: професионалната версия на Tencent Hunyuan 3D, поддържаща текст-към-3D, изображение-към-3D и вход с много ъгли.

Извличане / повторно класиране

  • jina-reranker-v3.5: многоезичен документен повторен класификатор на Jina AI за RAG, търсене и класиране на структурирани данни.

Цени и обявления

  • Ограничена времева оферта за GLM-5.2: glm-5.2 е на отстъпка в зависимост от времевия прозорец, в UTC: 50% отстъпка от 14:00 до 24:00 и 30% отстъпка от 00:00 до 14:00 всеки ден. Ограничена времева оферта.
  • Qwen3.8-Max-Preview с 90% отстъпка: извикванията се таксуват на 10% от цената на списъка, ефективно 10x повече използване за същите разходи. Ограничено време, по ред на постъпване.
  • Таксуване на DeepSeek V4 в зависимост от времето на деня: Моделите DeepSeek V4 поддържат таксуване в пикови и непикови часове. Таксите следват времевия прозорец на времето на подаване на запитването, а стрийминг запитванията, които преминават граница, също се таксуват по времето на подаване.

Често задавани въпроси

Кои модели бяха добавени този месец?
Почти 30, обхващащи чат (claude-opus-5, claude-sonnet-5, серията GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 и др.), кодиране (qwen3-coder-480b-a35b-instruct), аудио (gpt-audio-1.5 и серията qwen-audio-3.0-tts), изображения (серията mai-image-2.5), 3D (hy-3d-3.1) и повторно класиране (jina-reranker-v3.5).

Как да се свържа с AIHubMix MCP сървъра?
Добавете входната точка https://mcp.aihubmix.com/mcp в който и да е клиент, поддържащ MCP (Claude Code, Codex, Cursor и др.). Удостоверенията се предават с всяко запитване от клиента. След това можете да запитвате модели и цени, да търсите документация, да проверявате баланса си и да извиквате инструменти за чат, генериране на изображения и генериране на видео.

Какво поддържат API за генериране на медии?
Изпратете запитвания за генериране и редактиране на изображения чрез /ai/v1/images/generations и /ai/v1/images/edits, след което използвайте обединения асинхронен API за задачи, за да запитвате статус, да изтегляте артефакти и да получавате обратни повиквания на уебхукове. Вижте Асинхронни задачи.

Каква е ограничената времева оферта за Qwen3.8-Max-Preview?
Извикванията се таксуват на 10% от цената на списъка, ефективно 10x повече използване за същите разходи. Ограничено време, по ред на постъпване.

Разгледайте всички модели в галерията с модели и намерете подробности за интеграция в документацията.


Актуализирано: 2026-07-31

More from the blog