GPT-6.1 Sol имеет пять уровней усилия рассуждения: low, medium (по умолчанию), high, xhigh и max. Главное изменение по сравнению с GPT-6 Sol заключается в том, что none и minimal исчезли, поэтому low теперь является минимальным уровнем.
Этот единственный параметр влияет как на задержку, так и на стоимость. Вы никогда не видите токены рассуждения, но вы платите за них по тарифу на выход ($10 за миллион для 6.1 Sol на AIHubMix), и они занимают место в окне контекста. Выбор неправильного уровня может привести к тому, что вы заплатите в несколько раз больше, чем нужно.
Что означает каждый уровень
Эта таблица объединяет описания OpenAI из руководства по рассуждению с нашими собственными рекомендациями:
| Уровень | Описание OpenAI | Хорошее соответствие | Плохое соответствие |
|---|---|---|---|
| низкий | Эффективное рассуждение с умеренным увеличением задержки | Промежуточные шаги в циклах инструментов, поиск, легкое планирование, классификация, извлечение, поддержка ответов | Сложная отладка, рефакторинг нескольких файлов |
| средний (по умолчанию) | Сбалансированный уровень по умолчанию для большинства рабочих нагрузок | Повседневное программирование, обзор кода, написание, типичные задачи агентов | Использование с критической задержкой |
| высокий | Сложное рассуждение, сложная отладка, глубокое планирование | Сложные ошибки, работа с архитектурой, задачи в стиле SWE | Высокий трафик онлайн |
| очень высокий | Глубокие исследования, асинхронная работа, длительные запуски агентов | Фоновые задачи, исследовательские отчеты | Все, что ваши оценки не обосновали |
| максимальный | Максимальное рассуждение для самых сложных задач | Использование компьютера, проблемы исследовательского уровня, тяжелая работа оффлайн | Практически все повседневные запросы |
OpenAI называет усилие "регулировочным элементом, а не основным способом восстановления качества." Когда результаты плохие, сначала посмотрите на подсказку, определения инструментов и контекст. Увеличивайте усилие только после этого.
Что говорят бенчмарки о каждом уровне
Это собственные данные OpenAI, собранные Vellum и DataCamp. Рассматривайте их как руководство, а не как истину.
Для программирования высокий уровень обычно достаточен. На DeepSWE v1.1, 6.1 Sol на высоком уровне набирает 75.2, что соответствует Astra на высоком уровне (74.8), за примерно $1.50 за задачу. Его кривая стоимости достигает 72% до 75% за $0.50 до $1.50 за задачу. GPT-6 Sol достиг максимума на 68.8 за примерно $2.60.
Переход на уровень выше среднего не всегда помогает. На AutomationBench, 6.1 Sol набирает 35.4% на среднем уровне и только около 36.0% на более высоком усилии. Для бизнес-автоматизации дополнительные токены рассуждения почти ничего не принесли.
Сохраняйте максимальный уровень для использования компьютера и исследований. На OSWorld 2.0, максимальный уровень получает 71.4 за около $1.30 за задачу. Terminal-Bench Science на максимальном уровне стоит $5.47 за задачу: гораздо дешевле, чем $23.80 Astra, но на порядок выше большинства других рабочих нагрузок.
Низкий уровень тоже стал лучше. Уровень фактических ошибок на низком уровне снизился с 11.4% на 6 Sol до 7.7%. Если вы повышали задачи до среднего на 6 Sol, потому что низкий уровень был недостаточно точным, попробуйте снова низкий уровень.
Начальные точки по случаям использования
| Случай использования | Начать с | Примечания |
|---|---|---|
| Вызовы, которые использовали "нет" на 6 Sol | низкий | Официальная карта OpenAI. Если задержка критична, рассмотрите GPT-6 Luna, который все еще поддерживает "нет" |
| Вызовы, которые использовали минимальный уровень | низкий | Начните с низкого и сравните результаты |
| Чат-боты, поддержка клиентов | низкий | Попросите модель предоставить одно предложение, чтобы получить первый токен быстрее |
| RAG Q&A | низкий → средний | Качество извлечения важнее усилия |
| IDE помощник по программированию | средний | Уровень по умолчанию работает |
| Автоматизированное исправление ошибок, агенты SWE | высокий | DeepSWE показывает, что высокий уровень уже соответствует Astra |
| Использование компьютера, браузерные агенты | высокий → максимальный | OSWorld достигает максимума на максимальном уровне |
| Фоновое исследование, длительные запуски | очень высокий | Только когда оценки показывают прирост. Пакетирование снижает стоимость вдвое, если вам не нужны результаты сразу |
| Самые сложные исследовательские проблемы | максимальный, или просто используйте Astra | OpenAI также рекомендует Astra здесь |
Сопоставления none и minimal происходят из руководства по миграции GPT-6 от OpenAI.
Изменение усилия в середине разговора
Распространенный подход — планировать на высоком уровне, выполнять на низком и переключаться обратно на высокий, когда что-то ломается.
Подводный камень: редактирование reasoning.effort в запросе нарушает кэш подсказок. Усилие является частью кэшированного префикса (см. руководство по кэшированию подсказок). На 6.1 Sol чтение кэша стоит $0.10 за миллион токенов, в то время как переписывание кэша стоит $2.50. Это разница в 25 раз.
Семейство GPT-6 исправляет это с помощью элемента ввода configuration_update. Не трогайте уровень reasoning.effort запроса и вставьте обновление перед следующим сообщением пользователя. Вот как это выглядит через Responses API AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Ход 1: планировать на высоком уровне
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"},
input="Разберитесь, почему тесты этого репозитория не проходят, и предложите план исправления.",
)
# Ход 2: снизить до низкого для выполнения, не трогая уровень усилия запроса
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # без изменений, чтобы кэш сохранился
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "low"}},
{"role": "user", "content": "Выполните шаг 1 плана."},
],
)
Формаconfiguration_updateвыше является иллюстративной. Проверьте руководство по рассуждению OpenAI для точной схемы. Документы Responses AIHubMix в настоящее время перечисляют четыре уровня (от минимального до высокого), поэтому отправьте небольшой тестовый запрос, чтобы подтвердить, чтоxhigh,maxиconfiguration_updateпроходят.
Некоторые ограничения, которые следует знать:
- Это работает только в стандартном режиме с одним агентом и изменяет только усилие.
- Два обновления не могут стоять рядом друг с другом.
- Это не смешивается с автоматической компакцией или усечением. Явная компакция допустима, но добавьте новое обновление после этого.
- Поле
reasoning.effortв ответе все еще показывает значение уровня запроса, поэтому не стоит слишком много на это полагаться.
Настройки, которые идут с усилием
Оставьте место в max_output_tokens. Лимит включает токены рассуждения. Установите его слишком низким, и модель может остановиться, не создав видимого текста. Вы получите status: incomplete и все равно заплатите за ввод и рассуждение. OpenAI предлагает зарезервировать по крайней мере 25,000 токенов для начала и больше для xhigh или max.
Отслеживайте токены рассуждения. Они находятся в usage.output_tokens_details.reasoning_tokens. Просмотр распределения по уровню усилия лучше, чем настройка на ощупь.
Включите сводки, если вам нужна видимость. reasoning.summary: "auto" возвращает сводку рассуждений модели (возможно, вам нужно будет сначала подтвердить вашу организацию). Сырые рассуждения никогда не раскрываются.
Режим Pro — это отдельный переключатель. Он заставляет модель выполнять больше работы, выставляя счета по стандартным тарифам, но с большим количеством токенов в целом. Используйте его для сложных задач, где дополнительная задержка приемлема.
Процесс настройки, который вы действительно можете запустить
- Соберите от 20 до 50 реальных задач в набор для оценки.
- Запустите базовый уровень на
medium. Запишите уровень успеха, среднее количество токенов рассуждения и P95 задержку. - Попробуйте
low. Если успех едва падает, переключитесь. - Попробуйте
high. Если успех явно улучшается, используйте высокий уровень только для этого типа задач. - Обращайтесь к
xhighилиmaxтолько когда высокий уровень оказывается недостаточным, и сравните с GPT-6 Astra на высоком уровне, пока вы на этом. Иногда большая модель превосходит большее усилие. На AIHubMix это просто изменение параметраmodel, а список моделей показывает, что доступно. - Направляйте по типу задачи, а не используйте одну глобальную настройку.
Кратко: начните с среднего, экономьте деньги с низким, используйте высокий для программирования и заставьте xhigh и max доказать свою эффективность в ваших оценках.
Далее: что на самом деле означает цена $2 / $10, когда кэширование, длинный контекст и множители выставления счетов вступают в игру.
Часто задаваемые вопросы
Какой уровень усилия рассуждения по умолчанию для GPT-6.1 Sol? medium. Если вы его не установите, вы получите именно это.
Почему none возвращает ошибку? 6.1 Sol не поддерживает none или minimal. OpenAI рекомендует переключиться на low. Если вам действительно нужно none, оставайтесь на GPT-6 Sol или GPT-6 Luna.
Как выставляются счета за токены рассуждения? По тарифу на выход ($10 за миллион для 6.1 Sol), и они учитываются в окне контекста. Проверьте usage.output_tokens_details.reasoning_tokens для получения фактических данных.
Является ли имя параметра одинаковым в Chat Completions и Responses? Нет. Chat Completions использует верхний уровень reasoning_effort. Responses использует вложенный reasoning: {"effort": ...}. Смешивание их приводит к возврату Unsupported parameter.
Дает ли более высокий уровень всегда лучшие результаты? Нет. На AutomationBench переход на уровень выше среднего только увеличил балл с 35.4% до около 36.0%, при этом стоя заметно дороже. Тестируйте на своих задачах.
Могу ли я изменить усилие в середине разговора? Да. Используйте элемент configuration_update и оставьте уровень reasoning.effort запроса неизменным, чтобы кэш подсказок оставался действительным. Это не работает с автоматической компакцией или усечением.
Почему я получил status: incomplete без вывода? Скорее всего, max_output_tokens было слишком низким, и рассуждение использовало все токены. OpenAI рекомендует зарезервировать как минимум 25,000 токенов.
Продолжайте читать: серия GPT-6.1 Sol
- Какова доля вашего счета за рассуждение? Усилие — это только один рычаг. Кэширование, порог в 272K и скидки на пакетирование все формируют окончательную сумму. См. Что на самом деле стоит GPT-6.1 Sol: за пределами ценника $2 / $10.
- Код, который использовал
none? Переход наlow— это только начало. Вызовы инструментов, параметры выборки и настройки кэша также требуют изменений: Миграция на GPT-6.1 Sol: 9 вещей, которые могут пойти не так. - Насколько лучше 6.1 Sol по сравнению с 6 Sol и Astra? Спецификации и бенчмарки рядом друг с другом в GPT-6.1 Sol против GPT-6 Sol: обновление за одну неделю, которое почти догоняет Astra.



