Вибір рівня розумової діяльності для GPT-6.1 Sol: від низького до максимального

AIHubMix6 хв читання
Вибір рівня розумової діяльності для GPT-6.1 Sol: від низького до максимального

GPT-6.1 Sol має п’ять рівнів розумової діяльності: low, medium (за замовчуванням), high, xhigh, та max. Основна зміна в порівнянні з GPT-6 Sol полягає в тому, що none та minimal зникли, тому low тепер є базовим.

Цей один параметр впливає як на затримку, так і на вартість. Ви ніколи не бачите токени розумування, але ви платите за них за ставкою виходу (10 доларів за мільйон для 6.1 Sol на AIHubMix), і вони займають місце в контекстному вікні. Виберіть неправильний рівень, і ви можете легко заплатити в кілька разів більше, ніж потрібно.


Що означає кожен рівень

Ця таблиця поєднує описи OpenAI з посібника з розумування з нашими власними рекомендаціями:

РівеньОпис OpenAIДобре підходитьПогано підходить
низькийЕфективне розумування з помірним збільшенням затримкиПроміжні кроки в циклах інструментів, пошук, легке планування, класифікація, витяг, підтримка відповідейСкладне налагодження, рефакторинг з кількома файлами
середній (за замовчуванням)Збалансований за замовчуванням для більшості навантаженьЩоденне кодування, перевірка коду, написання, типові завдання агентівВзаємодія з критичною затримкою
високийСкладне розумування, складне налагодження, глибоке плануванняСкладні помилки, архітектурна робота, завдання в стилі SWEВисокий QPS онлайн-трафік
дуже високийГлибоке дослідження, асинхронна робота, тривалі запуски агентівФонові роботи, дослідницькі звітиВсе, що ваші оцінки не виправдали
максимальнийМаксимальне розумування для найскладніших завданьВикористання комп’ютера, проблеми дослідницького рівня, важка робота офлайнПрактично всі щоденні запити

OpenAI називає зусилля "регулятором налаштування, а не основним способом відновлення якості." Коли результати погані, спочатку зверніть увагу на запит, визначення інструментів та контекст. Підвищуйте зусилля лише після цього.


Що кажуть бенчмарки про кожен рівень

Це власні дані OpenAI, зібрані Vellum та DataCamp. Ставтеся до них як до орієнтира, а не як до істини.

Для кодування високий зазвичай достатній. На DeepSWE v1.1, 6.1 Sol на високому рівні отримує 75.2, що відповідає Astra на високому (74.8), за приблизно 1.50 долара за завдання. Його крива витрат досягає 72% до 75% за ціною від 0.50 до 1.50 долара за завдання. GPT-6 Sol досяг максимального значення 68.8 за приблизно 2.60 долара.

Перехід вище середнього не завжди допомагає. На AutomationBench, 6.1 Sol отримує 35.4% на середньому рівні і лише близько 36.0% на вищих зусиллях. Для автоматизації бізнесу додаткові токени розумування не принесли майже нічого.

Залиште максимальний для використання комп’ютера та досліджень. На OSWorld 2.0, максимальний отримує 71.4 за приблизно 1.30 долара за завдання. Terminal-Bench Science на максимальному рівні коштує 5.47 долара за завдання: значно дешевше, ніж 23.80 долара Astra, але на порядок дорожче за більшість інших навантажень.

Низький також покращився. Рівень фактичних помилок на низькому рівні знизився з 11.4% на 6 Sol до 7.7%. Якщо ви підвищили завдання до середнього на 6 Sol, оскільки низький був недостатньо точним, спробуйте знову низький.


Початкові точки за випадком використання

Випадок використанняПочати зПримітки
Виклики, які використовували жоден на 6 SolнизькийОфіційна мапа OpenAI. Якщо затримка критична, розгляньте GPT-6 Luna, який все ще підтримує жоден
Виклики, які використовували мінімальнийнизькийПочніть з низького та порівняйте результати
Чат-боти, підтримка клієнтівнизькийЗапитайте модель про однорядний вступ, щоб отримати перший токен швидше
RAG Q&Aнизький → середнійЯкість витягування важливіша за зусилля
Асистент кодування IDEсереднійЗа замовчуванням працює
Автоматичне виправлення помилок, агенти SWEвисокийDeepSWE показує, що високий вже відповідає Astra
Використання комп’ютера, браузерні агентивисокий → максимальнийOSWorld досягає максимуму
Фонові дослідження, тривалі запускидуже високийТільки коли оцінки показують виграш. Пакет зменшує витрати вдвічі, якщо вам не потрібні результати відразу
Найскладніші дослідницькі проблемимаксимальний, або просто використовуйте AstraOpenAI також рекомендує Astra тут

Мапи none та minimal походять з посібника з міграції GPT-6.


Зміна зусиль під час розмови

Звичайна схема полягає в тому, щоб планувати на високому рівні, виконувати на низькому, а потім знову переходити на високий, коли щось ламається.

Проблема: редагування reasoning.effort в запиті ламає кеш вашого запиту. Зусилля є частиною кешованого префікса (див. посібник з кешування запитів). На 6.1 Sol читання кешу коштує 0.10 долара за мільйон токенів, тоді як переписування кешу коштує 2.50 долара. Це різниця в 25 разів.

Сімейство GPT-6 виправляє це за допомогою елемента введення configuration_update. Залиште зусилля на рівні запиту reasoning.effort незмінним і вставте оновлення перед наступним повідомленням користувача. Ось як це виглядає через API відповідей AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Поворот 1: планувати на високому рівні
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="З’ясуйте, чому тести цього репозиторію не проходять, і запропонуйте план виправлення.",
)

# Поворот 2: знизити до низького для виконання, не торкаючись зусиль на рівні запиту
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # незмінно, тому кеш зберігається
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "Виконайте крок 1 плану."},
    ],
)
Форма configuration_update вище є ілюстративною. Перевірте посібник з розумування OpenAI для точного формату. Документація API відповідей AIHubMix наразі містить чотири рівні (мінімальний до високого), тому надішліть невеликий тестовий запит, щоб підтвердити, що xhigh, max та configuration_update проходять.

Деякі обмеження, які потрібно знати:

  • Це працює лише в стандартному режимі з одним агентом і лише змінює зусилля.
  • Два оновлення не можуть стояти поруч один з одним.
  • Це не змішується з автоматичною компресією або скороченням. Явна компресія допустима, але додайте нове оновлення після цього.
  • Поле reasoning.effort в відповіді все ще показує значення на рівні запиту, тому не читайте в це занадто багато.

Налаштування, які йдуть з зусиллями

Залиште місце в max_output_tokens. Ліміт включає токени розумування. Встановіть його занадто низьким, і модель може зупинитися, не створивши жодного видимого тексту. Ви отримаєте status: incomplete і все ще заплатите за вхідні дані та розумування. OpenAI пропонує зарезервувати принаймні 25,000 токенів на початку, і більше для xhigh або max.

Відстежуйте токени розумування. Вони знаходяться в usage.output_tokens_details.reasoning_tokens. Перегляд розподілу за рівнем зусиль перевершує налаштування на дотик.

Увімкніть підсумки, якщо вам потрібна видимість. reasoning.summary: "auto" повертає підсумок розумування моделі (можливо, вам спочатку потрібно буде підтвердити вашу організацію). Сировинне розумування ніколи не розкривається.

Pro режим - це окремий перемикач. Він змушує модель виконувати більше роботи, нараховується за стандартними тарифами, але з більшою кількістю токенів загалом. Використовуйте його для складних проблем, де додаткова затримка прийнятна.


Процес налаштування, який ви дійсно можете виконати

  1. Зберіть 20-50 реальних завдань у набір оцінювання.
  2. Запустіть базовий тест на medium. Запишіть рівень успіху, середню кількість токенів розумування та затримку P95.
  3. Спробуйте low. Якщо успіх майже не знижується, переходьте.
  4. Спробуйте high. Якщо успіх явно покращується, використовуйте високий лише для цього типу завдань.
  5. Звертайтеся до xhigh або max тільки тоді, коли високий не виправдовує себе, і порівнюйте з GPT-6 Astra на високому, поки ви там. Іноді більша модель перевершує більше зусиль. На AIHubMix це просто зміна параметра model, а список моделей показує, що доступно.
  6. Маршрутизуйте за типом завдання, а не використовуйте одне глобальне налаштування.

Коротка версія: починайте з середнього, економте гроші з низьким, використовуйте високий для кодування, і нехай xhigh та max доведуть свою ефективність у ваших оцінках.

Далі: що насправді означає цінник у 2 долари / 10 доларів, коли кешування, довгий контекст і множники виставлення рахунків вступають в гру.


Питання та відповіді

Який рівень розумової діяльності за замовчуванням для GPT-6.1 Sol? medium. Якщо ви його не встановите, це те, що ви отримаєте.

Чому none повертає помилку? 6.1 Sol не підтримує none або minimal. OpenAI рекомендує перейти на low. Якщо вам дійсно потрібен none, залишайтеся на GPT-6 Sol або GPT-6 Luna.

Як нараховуються токени розумування? За ставкою виходу (10 доларів за мільйон для 6.1 Sol), і вони враховуються в контекстному вікні. Перевірте usage.output_tokens_details.reasoning_tokens для фактичних цифр.

Чи однакове ім’я параметра в Chat Completions та Responses? Ні. Chat Completions використовує верхній рівень reasoning_effort. Responses використовує вкладений reasoning: {"effort": ...}. Змішування їх повертає Unsupported parameter.

Чи завжди вищі зусилля дають кращі результати? Ні. На AutomationBench, перехід вище середнього лише перемістив бал з 35.4% до приблизно 36.0%, при цьому коштував помітно більше. Тестуйте на своїх завданнях.

Чи можу я змінити зусилля в середині розмови? Так. Використовуйте елемент configuration_update і залишайте зусилля на рівні запиту reasoning.effort незмінним, щоб кеш запиту залишався дійсним. Це не працює з автоматичною компресією або скороченням.

Чому я отримав status: incomplete без виходу? Швидше за все, max_output_tokens був занадто низьким, і розумування використало все. OpenAI рекомендує зарезервувати принаймні 25,000 токенів.


Продовжуйте читати: серія GPT-6.1 Sol


Джерела