В этом месяце AIHubMix добавил почти 30 новых моделей в области чата, кодирования, аудио, изображений и 3D, а также запустил несколько возможностей платформы, включая API для генерации медиа, исправление структурированного вывода и API для генерации 3D. Ассортимент доступных модальностей через один API-ключ продолжает расширяться. Вот основные моменты.
API генерации медиа и унифицированные асинхронные задачи
Новые конечные точки для генерации медиа /ai/v1/images/generations и /ai/v1/images/edits теперь доступны, вместе с унифицированными асинхронными задачами, запросами результатов, загрузками артефактов и обратными вызовами вебхуков. Рабочие процессы с изображениями и видео могут интегрироваться через один и тот же жизненный цикл задач, что упрощает отслеживание долгосрочных результатов генерации. Сгенерированные артефакты поддерживают прямую загрузку и пакетное извлечение. См. Асинхронные задачи.
Исправление структурированного вывода
Доступна новая возможность исправления структурированного вывода на уровне ключа, отключенная по умолчанию. После включения для нестриминговых запросов, которые объявляют структурированный JSON-вывод, когда модель возвращает JSON с ошибками формата, такими как обрезка, лишние запятые или обертки блоков кода, платформа автоматически исправляет его в парсируемый действительный JSON перед возвратом. Значения остаются неизменными, и изменения со стороны клиента не требуются. Она поддерживает протоколы Chat Completions, Responses, Claude и Gemini, а исправленные ответы содержат заголовок X-JSON-Repaired: true. См. Исправление структурированного вывода.
API генерации 3D
Новый асинхронный API генерации 3D /v1/3d/generations запускается с Tencent Hunyuan 3D (hy-3d-3.1) в качестве первой поддерживаемой модели. Он охватывает текст в 3D, изображение в 3D и многовидовой ввод, с артефактами в форматах obj, glb, stl, usdz и fbx, а также PBR-материалами, подходящими для игр, электронной коммерции, 3D-печати и проектирования продуктов. См. API генерации 3D.
Официальный сервер AIHubMix MCP
Официальная хостинговая точка доступа для клиентов MCP теперь доступна: mcp.aihubmix.com/mcp (резервная копия: mcp.inferera.com/mcp). Подключите его в Claude Code, Codex, Cursor и других инструментах для запроса моделей и цен, поиска документации, проверки вашего баланса и вызова инструментов генерации чата, изображений и видео. Учетные данные передаются с каждым запросом клиентом, и сервер не хранит API-ключи.
Поиск Jina и чтение веб-страниц
Новые возможности поиска и чтения Jina позволяют вам извлекать результаты поиска и содержимое веб-страниц с вашим API-ключом AIHubMix, что подходит для извлечения внешней информации, чтения документов и вызова инструментов агентов. Оба поддерживают POST-запросы, а Reader также принимает многокомпонентные загрузки локальных файлов, таких как PDF, Word, Excel, PPT, HTML и изображения. См. Jina AI.
Другие обновления функций
- Генерация аудио Qwen TTS:
qwen-audio-3.0-tts-plusиqwen-audio-3.0-tts-flashмогут быть вызваны через/v1/audio/speech. Нестрингующие запросы возвращают ссылку на аудиорезультат, стриминговые запросы возвращают события генерации аудио SSE с поддержкой тегов эмоций и инструкций на естественном языке. См. TTS. - Документация кэширования подсказок GPT: начиная с серии GPT-5.6, записи в кэш оплачиваются по ставке 1.25x от цены ввода, чтение из кэша — по ставке 0.1x, а кэши сохраняются как минимум на 30 минут. Включает детали параметра
prompt_cache_keyи устранение неполадок при попадании в кэш. См. Кэширование подсказок GPT. - Veo 3.1 поддерживает первые/последние кадры и эталонные изображения: контролируйте открывающие и закрывающие кадры, эталонные изображения персонажей и стили с большей точностью. См. Генерация видео.
- Автоматические ответы для вызовов инструментов gpt-5.5 и выше: запросы, отправленные через
/v1/chat/completionsс инструментами иreasoning_effort, автоматически используют возможности Responses, предоставляя существующим клиентам более надежный вызов инструментов без каких-либо изменений. См. Responses API. - Завершены нативные конечные точки Gemini: SDK
@google/genaiтеперь поддерживает нативные Embeddings, Interactions и Context Caching при вызове через AIHubMix. См. Gemini Native SDK. - Стриминговые соединения увеличены до 2 часов: максимальное время стримингового соединения увеличено с 1 часа до 2 часов, так что долгие размышления и длительные задачи генерации менее вероятно будут прерваны.
- Передача параметров изображения Gemini: при вызове моделей вывода изображений Gemini через совместимый с OpenAI API,
aspectRatioиimageSizeмогут быть переданы вextra_body.generationConfig.imageConfig. - Структурированный вывод через протоколы: совместимый с OpenAI
response_formatи нативныйoutput_config.formatтеперь адаптируются в обоих направлениях по соответствующим путям. См. Структурированный вывод.
Стабильность и исправления
- Улучшения совместимости между протоколами: поля ответов сообщений, параметры размышления,
stopпараметры и структуры ответов вызовов инструментов дополнительно согласованы с каждой экосистемой протокола. - Улучшения надежности стриминга: исправлены обрезанные стриминговые выводы и ответы, ошибочно классифицированные как пустые для некоторых моделей, с более полными записями использования, когда клиенты отключаются.
- Улучшения точности измерения и выставления счетов кэша, чтобы детали выставления счетов лучше отражали фактическое использование.
- Более четкие сообщения об ошибках: сбои проверки параметров возвращаются раньше, а ошибки для неизвестных моделей и исчерпанных квот ключей более явные.
Новые модели в этом месяце (почти 30)
Чат / общий
- claude-opus-5: флагманская модель Anthropic с контекстным окном 1M и максимальным выводом 128K, созданная для сложного размышления, кодирования и долгосрочных задач агентов.
- claude-sonnet-5: для чата, размышлений и сценариев агентов.
- gpt-5.6-sol / gpt-5.6-terra / gpt-5.6-luna: три уровня серии OpenAI GPT-5.6, каждый с контекстным окном 1,050,000, максимальным выводом 128K и вводом текста плюс изображение. Sol — это флагманский уровень, Terra соответствует производительности GPT-5.5 за половину цены, а Luna нацелена на чувствительные к стоимости рабочие нагрузки.
- qwen3.8-max-preview: последняя версия модели Qwen с 2.4T параметрами, доступная с ограниченной скидкой 90%.
- kimi-k3: открытая модель Moonshot AI с длинным контекстом с 2.8T параметрами, контекстным окном 1M и нативным вводом изображения. См. Практическое руководство Kimi K3.
- grok-4.5: настраиваемое размышление, вызов инструментов и 500K контекста, подходящее для исправления кода и рабочих процессов агентов.
- tencent-hy3: GA релиз Tencent Hunyuan Hy3. Архитектура MoE с 295B общими / 21B активными параметрами, контекстное окно 256K, открытое под лицензией Apache 2.0.
- gemini-3.6-flash, gemini-3.5-flash-lite, gemini-2.5-flash-lite: новые уровни в серии Google Flash.
- glm-5.2-fast-preview, Qwen3-235B-A22B-Instruct-2507, command-a-plus-05-2026, gemma-4-31b, longcat-2.0.
Кодирование
- qwen3-coder-480b-a35b-instruct: флагманская модель кода Qwen3-Coder для генерации кода, агентов программного обеспечения и рабочих процессов вызова инструментов.
Аудио
- gpt-audio-1.5: первая общедоступная (GA) аудиомодель OpenAI, поддерживающая аудиоввод и вывод.
- gpt-4o-transcribe-diarize: ASR транскрипция с диаризацией спикеров, доступная только через API транскрипции.
- qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash: модели синтеза речи Qwen. Уровень plus предлагает тонкую настройку эмоций и персонажей, уровень flash обеспечивает задержку первого пакета менее 200 мс.
Изображение
- mai-image-2.5-pro: флагманская модель генерации и редактирования изображений Microsoft с высоким уровнем реализма и рендерингом текста в изображениях. mai-image-2.5 и mai-image-2.5-flash из той же серии также доступны.
- gemini-3.1-flash-lite-image: модель возможностей изображений Google.
3D
- hy-3d-3.1: профессиональная версия Tencent Hunyuan 3D, поддерживающая текст в 3D, изображение в 3D и многовидовой ввод с восьми углов.
Извлечение / повторная сортировка
- jina-reranker-v3.5: многоязычный документный повторный ранжировщик Jina AI для RAG, поиска и ранжирования структурированных данных.
Цены и объявления
- Ограниченное предложение GLM-5.2 по времени суток:
glm-5.2предлагается со скидкой в зависимости от времени суток, по UTC: 50% скидка с 14:00 до 24:00 и 30% скидка с 00:00 до 14:00 каждый день. Ограниченное предложение. - Qwen3.8-Max-Preview со скидкой 90%: вызовы оплачиваются по ставке 10% от розничной цены, фактически 10x больше использования за те же деньги. Ограниченное время, кто первый, тот и получил.
- Выставление счетов DeepSeek V4 по времени суток: модели DeepSeek V4 поддерживают выставление счетов в пиковые и непиковые часы. Платежи следуют за временным окном времени подачи запроса, а стриминговые запросы, которые пересекают границу, также оцениваются по времени подачи.
Часто задаваемые вопросы
Какие модели были добавлены в этом месяце?
Почти 30, охватывающие чат (claude-opus-5, claude-sonnet-5, серию GPT-5.6, qwen3.8-max-preview, kimi-k3, grok-4.5, tencent-hy3 и другие), кодирование (qwen3-coder-480b-a35b-instruct), аудио (gpt-audio-1.5 и серию qwen-audio-3.0-tts), изображение (серия mai-image-2.5), 3D (hy-3d-3.1) и повторную сортировку (jina-reranker-v3.5).
Как мне подключиться к серверу AIHubMix MCP?
Добавьте точку доступа https://mcp.aihubmix.com/mcp в любом клиенте, поддерживающем MCP (Claude Code, Codex, Cursor и других). Учетные данные передаются с каждым запросом клиентом. Затем вы можете запрашивать модели и цены, искать документацию, проверять свой баланс и вызывать инструменты генерации чата, изображений и видео.
Что поддерживают API генерации медиа?
Отправляйте запросы на генерацию и редактирование изображений через /ai/v1/images/generations и /ai/v1/images/edits, затем используйте унифицированный асинхронный API задач для запроса статуса, загрузки артефактов и получения обратных вызовов вебхуков. См. Асинхронные задачи.
Что такое ограниченное предложение Qwen3.8-Max-Preview?
Вызовы оплачиваются по ставке 10% от розничной цены, фактически 10x больше использования за те же деньги. Ограниченное время, кто первый, тот и получил.
Просмотрите все модели в галерее моделей и найдите детали интеграции в документации.
Обновлено: 2026-07-31