Выбор уровня усилия рассуждения для GPT-6.1 Sol: от низкого до максимального

AIHubMix6 мин чтения
Выбор уровня усилия рассуждения для GPT-6.1 Sol: от низкого до максимального

GPT-6.1 Sol имеет пять уровней усилия рассуждения: low, medium (по умолчанию), high, xhigh и max. Главное изменение по сравнению с GPT-6 Sol заключается в том, что none и minimal исчезли, поэтому low теперь является минимальным уровнем.

Этот единственный параметр влияет как на задержку, так и на стоимость. Вы никогда не видите токены рассуждения, но вы платите за них по тарифу на выход ($10 за миллион для 6.1 Sol на AIHubMix), и они занимают место в окне контекста. Выбор неправильного уровня может привести к тому, что вы заплатите в несколько раз больше, чем нужно.


Что означает каждый уровень

Эта таблица объединяет описания OpenAI из руководства по рассуждению с нашими собственными рекомендациями:

УровеньОписание OpenAIХорошее соответствиеПлохое соответствие
низкийЭффективное рассуждение с умеренным увеличением задержкиПромежуточные шаги в циклах инструментов, поиск, легкое планирование, классификация, извлечение, поддержка ответовСложная отладка, рефакторинг нескольких файлов
средний (по умолчанию)Сбалансированный уровень по умолчанию для большинства рабочих нагрузокПовседневное программирование, обзор кода, написание, типичные задачи агентовИспользование с критической задержкой
высокийСложное рассуждение, сложная отладка, глубокое планированиеСложные ошибки, работа с архитектурой, задачи в стиле SWEВысокий трафик онлайн
очень высокийГлубокие исследования, асинхронная работа, длительные запуски агентовФоновые задачи, исследовательские отчетыВсе, что ваши оценки не обосновали
максимальныйМаксимальное рассуждение для самых сложных задачИспользование компьютера, проблемы исследовательского уровня, тяжелая работа оффлайнПрактически все повседневные запросы

OpenAI называет усилие "регулировочным элементом, а не основным способом восстановления качества." Когда результаты плохие, сначала посмотрите на подсказку, определения инструментов и контекст. Увеличивайте усилие только после этого.


Что говорят бенчмарки о каждом уровне

Это собственные данные OpenAI, собранные Vellum и DataCamp. Рассматривайте их как руководство, а не как истину.

Для программирования высокий уровень обычно достаточен. На DeepSWE v1.1, 6.1 Sol на высоком уровне набирает 75.2, что соответствует Astra на высоком уровне (74.8), за примерно $1.50 за задачу. Его кривая стоимости достигает 72% до 75% за $0.50 до $1.50 за задачу. GPT-6 Sol достиг максимума на 68.8 за примерно $2.60.

Переход на уровень выше среднего не всегда помогает. На AutomationBench, 6.1 Sol набирает 35.4% на среднем уровне и только около 36.0% на более высоком усилии. Для бизнес-автоматизации дополнительные токены рассуждения почти ничего не принесли.

Сохраняйте максимальный уровень для использования компьютера и исследований. На OSWorld 2.0, максимальный уровень получает 71.4 за около $1.30 за задачу. Terminal-Bench Science на максимальном уровне стоит $5.47 за задачу: гораздо дешевле, чем $23.80 Astra, но на порядок выше большинства других рабочих нагрузок.

Низкий уровень тоже стал лучше. Уровень фактических ошибок на низком уровне снизился с 11.4% на 6 Sol до 7.7%. Если вы повышали задачи до среднего на 6 Sol, потому что низкий уровень был недостаточно точным, попробуйте снова низкий уровень.


Начальные точки по случаям использования

Случай использованияНачать сПримечания
Вызовы, которые использовали "нет" на 6 SolнизкийОфициальная карта OpenAI. Если задержка критична, рассмотрите GPT-6 Luna, который все еще поддерживает "нет"
Вызовы, которые использовали минимальный уровеньнизкийНачните с низкого и сравните результаты
Чат-боты, поддержка клиентовнизкийПопросите модель предоставить одно предложение, чтобы получить первый токен быстрее
RAG Q&Aнизкий → среднийКачество извлечения важнее усилия
IDE помощник по программированиюсреднийУровень по умолчанию работает
Автоматизированное исправление ошибок, агенты SWEвысокийDeepSWE показывает, что высокий уровень уже соответствует Astra
Использование компьютера, браузерные агентывысокий → максимальныйOSWorld достигает максимума на максимальном уровне
Фоновое исследование, длительные запускиочень высокийТолько когда оценки показывают прирост. Пакетирование снижает стоимость вдвое, если вам не нужны результаты сразу
Самые сложные исследовательские проблемымаксимальный, или просто используйте AstraOpenAI также рекомендует Astra здесь

Сопоставления none и minimal происходят из руководства по миграции GPT-6 от OpenAI.


Изменение усилия в середине разговора

Распространенный подход — планировать на высоком уровне, выполнять на низком и переключаться обратно на высокий, когда что-то ломается.

Подводный камень: редактирование reasoning.effort в запросе нарушает кэш подсказок. Усилие является частью кэшированного префикса (см. руководство по кэшированию подсказок). На 6.1 Sol чтение кэша стоит $0.10 за миллион токенов, в то время как переписывание кэша стоит $2.50. Это разница в 25 раз.

Семейство GPT-6 исправляет это с помощью элемента ввода configuration_update. Не трогайте уровень reasoning.effort запроса и вставьте обновление перед следующим сообщением пользователя. Вот как это выглядит через Responses API AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Ход 1: планировать на высоком уровне
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="Разберитесь, почему тесты этого репозитория не проходят, и предложите план исправления.",
)

# Ход 2: снизить до низкого для выполнения, не трогая уровень усилия запроса
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # без изменений, чтобы кэш сохранился
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "Выполните шаг 1 плана."},
    ],
)
Форма configuration_update выше является иллюстративной. Проверьте руководство по рассуждению OpenAI для точной схемы. Документы Responses AIHubMix в настоящее время перечисляют четыре уровня (от минимального до высокого), поэтому отправьте небольшой тестовый запрос, чтобы подтвердить, что xhigh, max и configuration_update проходят.

Некоторые ограничения, которые следует знать:

  • Это работает только в стандартном режиме с одним агентом и изменяет только усилие.
  • Два обновления не могут стоять рядом друг с другом.
  • Это не смешивается с автоматической компакцией или усечением. Явная компакция допустима, но добавьте новое обновление после этого.
  • Поле reasoning.effort в ответе все еще показывает значение уровня запроса, поэтому не стоит слишком много на это полагаться.

Настройки, которые идут с усилием

Оставьте место в max_output_tokens. Лимит включает токены рассуждения. Установите его слишком низким, и модель может остановиться, не создав видимого текста. Вы получите status: incomplete и все равно заплатите за ввод и рассуждение. OpenAI предлагает зарезервировать по крайней мере 25,000 токенов для начала и больше для xhigh или max.

Отслеживайте токены рассуждения. Они находятся в usage.output_tokens_details.reasoning_tokens. Просмотр распределения по уровню усилия лучше, чем настройка на ощупь.

Включите сводки, если вам нужна видимость. reasoning.summary: "auto" возвращает сводку рассуждений модели (возможно, вам нужно будет сначала подтвердить вашу организацию). Сырые рассуждения никогда не раскрываются.

Режим Pro — это отдельный переключатель. Он заставляет модель выполнять больше работы, выставляя счета по стандартным тарифам, но с большим количеством токенов в целом. Используйте его для сложных задач, где дополнительная задержка приемлема.


Процесс настройки, который вы действительно можете запустить

  1. Соберите от 20 до 50 реальных задач в набор для оценки.
  2. Запустите базовый уровень на medium. Запишите уровень успеха, среднее количество токенов рассуждения и P95 задержку.
  3. Попробуйте low. Если успех едва падает, переключитесь.
  4. Попробуйте high. Если успех явно улучшается, используйте высокий уровень только для этого типа задач.
  5. Обращайтесь к xhigh или max только когда высокий уровень оказывается недостаточным, и сравните с GPT-6 Astra на высоком уровне, пока вы на этом. Иногда большая модель превосходит большее усилие. На AIHubMix это просто изменение параметра model, а список моделей показывает, что доступно.
  6. Направляйте по типу задачи, а не используйте одну глобальную настройку.

Кратко: начните с среднего, экономьте деньги с низким, используйте высокий для программирования и заставьте xhigh и max доказать свою эффективность в ваших оценках.

Далее: что на самом деле означает цена $2 / $10, когда кэширование, длинный контекст и множители выставления счетов вступают в игру.


Часто задаваемые вопросы

Какой уровень усилия рассуждения по умолчанию для GPT-6.1 Sol? medium. Если вы его не установите, вы получите именно это.

Почему none возвращает ошибку? 6.1 Sol не поддерживает none или minimal. OpenAI рекомендует переключиться на low. Если вам действительно нужно none, оставайтесь на GPT-6 Sol или GPT-6 Luna.

Как выставляются счета за токены рассуждения? По тарифу на выход ($10 за миллион для 6.1 Sol), и они учитываются в окне контекста. Проверьте usage.output_tokens_details.reasoning_tokens для получения фактических данных.

Является ли имя параметра одинаковым в Chat Completions и Responses? Нет. Chat Completions использует верхний уровень reasoning_effort. Responses использует вложенный reasoning: {"effort": ...}. Смешивание их приводит к возврату Unsupported parameter.

Дает ли более высокий уровень всегда лучшие результаты? Нет. На AutomationBench переход на уровень выше среднего только увеличил балл с 35.4% до около 36.0%, при этом стоя заметно дороже. Тестируйте на своих задачах.

Могу ли я изменить усилие в середине разговора? Да. Используйте элемент configuration_update и оставьте уровень reasoning.effort запроса неизменным, чтобы кэш подсказок оставался действительным. Это не работает с автоматической компакцией или усечением.

Почему я получил status: incomplete без вывода? Скорее всего, max_output_tokens было слишком низким, и рассуждение использовало все токены. OpenAI рекомендует зарезервировать как минимум 25,000 токенов.


Продолжайте читать: серия GPT-6.1 Sol


Источники