Цього місяця AIHubMix додав майже 30 нових моделей у сферах чату, кодування, аудіо, зображення та 3D, а також запустив кілька можливостей платформи, включаючи API для генерації медіа, виправлення структурованого виходу та API для 3D-генерації. Діапазон модальностей, доступних через один API-ключ, продовжує розширюватися. Ось основні моменти.
API для генерації медіа та об'єднані асинхронні завдання
Нові кінцеві точки для генерації медіа /ai/v1/images/generations та /ai/v1/images/edits тепер доступні, разом з об'єднаними асинхронними завданнями, запитами результатів, завантаженнями артефактів та зворотними викликами вебхуків. Робочі процеси зображень та відео можуть інтегруватися через один і той же життєвий цикл завдань, що спрощує відстеження тривалих результатів генерації. Згенеровані артефакти підтримують пряме завантаження та пакетне отримання. Дивіться Асинхронні завдання.
Виправлення структурованого виходу
Доступна нова можливість виправлення структурованого виходу на рівні ключа, яка за замовчуванням вимкнена. Після активації, для запитів без потокового режиму, які оголошують структурований JSON вихід, коли модель повертає JSON з помилками формату, такими як обрізка, зайві коми або обгортки блоку коду, платформа автоматично виправляє його в парсований дійсний JSON перед поверненням. Значення залишаються незмінними, і зміни з боку клієнта не потрібні. Це підтримує протоколи Chat Completions, Responses, Claude та Gemini, а виправлені відповіді мають заголовок X-JSON-Repaired: true. Дивіться Виправлення структурованого виходу.
API для 3D-генерації
Новий асинхронний API для 3D-генерації /v1/3d/generations запускається з Tencent Hunyuan 3D (hy-3d-3.1) як першою підтримуваною моделлю. Він охоплює текст до 3D, зображення до 3D та багатопоглядний ввід, з артефактами у форматах obj, glb, stl, usdz та fbx, а також PBR-матеріалами, придатними для ігор, електронної комерції, 3D-друку та дизайну продуктів. Дивіться API для 3D-генерації.
Офіційний сервер AIHubMix MCP
Офіційна хостингова точка входу для клієнтів MCP тепер активна: mcp.aihubmix.com/mcp (резервна копія: mcp.inferera.com/mcp). Підключіть його в Claude Code, Codex, Cursor та інших інструментах, щоб запитувати моделі та ціни, шукати документацію, перевіряти свій баланс та викликати інструменти для чату, генерації зображень та генерації відео. Облікові дані передаються за запитом клієнта, і сервер не зберігає API-ключі.
Пошук Jina та читання веб-сторінок
Нові можливості Jina Search та Reader дозволяють вам отримувати результати пошуку та вміст веб-сторінок за допомогою вашого API-ключа AIHubMix, що підходить для зовнішнього отримання інформації, читання документів та виклику інструментів агентів. Обидва підтримують POST-запити, а Reader також приймає багаточастинні завантаження локальних файлів, таких як PDF, Word, Excel, PPT, HTML та зображення. Дивіться Jina AI.
Інші оновлення функцій
- Генерація аудіо Qwen TTS:
qwen-audio-3.0-tts-plusтаqwen-audio-3.0-tts-flashможна викликати через/v1/audio/speech. Запити без потокового режиму повертають посилання на аудіо результат, запити з потоковим режимом повертають події генерації аудіо SSE, з підтримкою тегів емоцій та інструкцій голосом природною мовою. Дивіться TTS. - Документація кешування запитів GPT: починаючи з серії GPT-5.6, записи кешу стягуються за 1.25x від ціни вводу, читання кешу - за 0.1x, а кеші зберігаються щонайменше 30 хвилин. Включає деталі параметра
prompt_cache_keyта усунення неполадок кешу. Дивіться Кешування запитів GPT. - Veo 3.1 генерація зображення у відео підтримує перші/останні кадри та зображення для посилання: контролюйте відкриваючі та закриваючі кадри, посилання на персонажів та стилі з більшою точністю. Дивіться Генерація відео.
- Автоматичні відповіді для викликів інструментів gpt-5.5 та вище: запити, надіслані через
/v1/chat/completionsз інструментами таreasoning_effort, автоматично використовують можливості Responses, надаючи існуючим клієнтам більш надійний виклик інструментів без жодних змін. Дивіться Responses API. - Завершено рідні кінцеві точки Gemini: SDK
@google/genaiтепер підтримує рідні Embeddings, Interactions та Context Caching при виклику через AIHubMix. Дивіться Gemini Native SDK. - Час потокового з'єднання продовжено до 2 годин: максимальний час потокового з'єднання було продовжено з 1 години до 2 годин, тому тривалі роздуми та тривалі завдання генерації менш імовірно будуть перервані раніше.
- Передача параметрів зображення Gemini: при виклику моделей виходу зображення Gemini через API, сумісний з OpenAI,
aspectRatioтаimageSizeможна передати вextra_body.generationConfig.imageConfig. - Структурований вихід через протоколи: сумісний з OpenAI
response_formatта ріднийoutput_config.formatтепер адаптуються в обох напрямках на відповідних шляхах. Дивіться Структурований вихід.
Стабільність та виправлення
- Покращення сумісності між протоколами: поля відповідей повідомлень, параметри роздумів,
stopпараметри та структури відповідей викликів інструментів ще більше узгоджені з кожною екосистемою протоколу. - Покращення надійності потокового режиму: виправлено обрізані виходи потокового режиму та відповіді, які неправильно класифікувалися як порожні для деяких моделей, з більш повними записами використання, коли клієнти відключаються.
- Покращення точності вимірювання кешу та виставлення рахунків, щоб деталі виставлення рахунків краще відображали фактичне використання.
- Чіткіші повідомлення про помилки: невдачі валідації параметрів повертаються раніше, а помилки для невідомих моделей та вичерпаних квот ключів є більш явними.
Нові моделі цього місяця (майже 30)
Чат / загальні
- claude-opus-5: флагманська модель Anthropic з контекстним вікном 1M та максимальним виходом 128K, створена для важких роздумів, кодування та завдань агентів на тривалий термін.
- claude-sonnet-5: для чатів, роздумів та сценаріїв агентів.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: три рівні серії OpenAI GPT-5.6, кожен з контекстним вікном 1,050,000, максимальним виходом 128K та текстовим плюс зображенням вводу. Sol - це флагманський рівень, Terra відповідає продуктивності GPT-5.5 за половину ціни, а Luna націлена на чутливі до витрат навантаження.
- qwen3.8-max-preview: остання генерація моделі Qwen з 2.4T параметрами, доступна за обмеженою ціною зі знижкою 90%.
- kimi-k3: модель Moonshot AI з відкритим довгим контекстом з 2.8T параметрами, контекстним вікном 1M та рідним зоровим ввідом. Дивіться посібник Kimi K3.
- grok-4.5: конфігуроване розуміння, виклики інструментів та 500K контекст, підходить для виправлення коду та робочих процесів агентів.
- tencent-hy3: GA реліз Tencent Hunyuan Hy3. Архітектура MoE з 295B загальних / 21B активних параметрів, контекстне вікно 256K, відкритий код під Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: нові рівні в серії Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Кодування
- qwen3-coder-480b-a35b-instruct: флагманська модель коду Qwen3-Coder для генерації коду, агентів програмного забезпечення та робочих процесів виклику інструментів.
Аудіо
- gpt-audio-1.5: перша загальнодоступна (GA) аудіомодель OpenAI, що підтримує аудіо ввід та вихід.
- gpt-4o-transcribe-diarize: ASR транскрипція з діаризацією спікерів, доступна лише через API транскрипції.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: моделі синтезу мови Qwen. Рівень плюс пропонує детальний контроль над емоціями та персонажами, рівень флеш забезпечує затримку першого пакета менше 200 мс.
Зображення
- mai-image-2.5-pro: флагманська модель генерації та редагування зображень Microsoft з високоякісним реалізмом та рендерингом тексту в зображеннях. mai-image-2.5 та mai-image-2.5-flash з тієї ж серії також активні.
- gemini-3.1-flash-lite-image: модель можливостей зображення Google.
3D
- hy-3d-3.1: професійне видання Tencent Hunyuan 3D, що підтримує текст до 3D, зображення до 3D та восьмикутний багатопоглядний ввід.
Отримання / повторне ранжування
- jina-reranker-v3.5: багатомовний документний повторний ранжувач Jina AI для RAG, пошуку та ранжування структурованих даних.
Ціни та оголошення
- Обмежена пропозиція GLM-5.2 за часом доби:
glm-5.2має знижку за щоденним часовим вікном, в UTC: 50% з 14:00 до 24:00 та 30% з 00:00 до 14:00 кожного дня. Обмежена пропозиція. - Qwen3.8-Max-Preview зі знижкою 90%: виклики стягуються за 10% від спискової ціни, фактично 10x більше використання за ті ж витрати. Обмежений час, перший прийшов - перший обслуговується.
- Годинне виставлення рахунків DeepSeek V4: моделі DeepSeek V4 підтримують пікове та непікове виставлення рахунків. Витрати слідують за часовим вікном часу подання запиту, а потокові запити, які перетинають межу, також оцінюються за часом подання.
Часті запитання
Які моделі були додані цього місяця?
Майже 30, охоплюючи чат (claude-opus-5, claude-sonnet-5, серію GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 та інші), кодування (qwen3-coder-480b-a35b-instruct), аудіо (gpt-audio-1.5 та серію qwen-audio-3.0-tts), зображення (серія mai-image-2.5), 3D (hy-3d-3.1) та повторне ранжування (jina-reranker-v3.5).
Як я можу підключитися до сервера AIHubMix MCP?
Додайте точку входу https://mcp.aihubmix.com/mcp в будь-якому клієнті з підтримкою MCP (Claude Code, Codex, Cursor та інших). Облікові дані передаються за запитом клієнта. Ви можете запитувати моделі та ціни, шукати документацію, перевіряти свій баланс та викликати інструменти для чату, генерації зображень та генерації відео.
Що підтримують API для генерації медіа?
Подайте запити на генерацію та редагування зображень через /ai/v1/images/generations та /ai/v1/images/edits, а потім використовуйте API об'єднаних асинхронних завдань для запиту статусу, завантаження артефактів та отримання зворотних викликів вебхуків. Дивіться Асинхронні завдання.
Що таке обмежена пропозиція Qwen3.8-Max-Preview?
Виклики стягуються за 10% від спискової ціни, фактично 10x більше використання за ті ж витрати. Обмежений час, перший прийшов - перший обслуговується.
Перегляньте всі моделі в галереї моделей та знайдіть деталі інтеграції в документації.
Оновлено: 2026-07-31