Избор на усилие за разсъждение за GPT-6.1 Sol: ниско до максимално

AIHubMix6 мин четене
Избор на усилие за разсъждение за GPT-6.1 Sol: ниско до максимално

GPT-6.1 Sol предлага пет нива на усилие за разсъждение: low, medium (по подразбиране), high, xhigh, и max. Голямата промяна от GPT-6 Sol е, че none и minimal са премахнати, така че low сега е основното ниво.

Тази настройка влияе както на латентността, така и на разходите. Никога не виждате токени за разсъждение, но плащате за тях на изходната ставка (10 долара на милион за 6.1 Sol на AIHubMix), и те заемат място в контекстния прозорец. Изберете грешно ниво и лесно можете да платите няколко пъти повече, отколкото е необходимо.


Какво представлява всяко ниво

Таблицата по-долу комбинира описанията на OpenAI от ръководството за разсъждение с нашите собствени препоръки:

НивоОписание на OpenAIДобро съответствиеЛошо съответствие
нискоЕфективно разсъждение с умерено увеличение на латентносттаПромеждутъчни стъпки в цикли на инструменти, търсене, леко планиране, класификация, извличане, поддръжка на отговориТрудно отстраняване на грешки, рефакториране на множество файлове
средно (по подразбиране)Балансът по подразбиране за повечето работни натоварванияЕжедневно кодиране, преглед на код, писане, типични задачи на агентиИнтерактивна употреба, критична за латентността
високоТрудно разсъждение, сложна отстраняване на грешки, дълбоко планиранеСложни грешки, архитектурна работа, задачи в стил SWEОнлайн трафик с висока QPS
много високоДълбоки изследвания, асинхронна работа, дълги сесии на агентиФонови задачи, изследователски докладиВсичко, което вашите оценки не са оправдали
максималноМаксимално разсъждение за най-трудните задачиИзползване на компютри, проблеми от изследователски клас, офлайн тежки задачиПочти всички ежедневни заявки

OpenAI нарича усилието "регулираща ръкохватка, а не основен начин за възстановяване на качеството." Когато резултатите са лоши, първо погледнете към подканата, определенията на инструментите и контекста. Увеличете усилието само след това.


Какво казват бенчмарковете за всяко ниво

Тези числа са на OpenAI, събрани от Vellum и DataCamp. Отнасяйте се към тях като към указание, а не като към евангелие.

За кодиране, високо обикновено е достатъчно. На DeepSWE v1.1, 6.1 Sol при високо постига 75.2, съвпадайки с Astra при високо (74.8), за около 1.50 долара на задача. Кривата на разходите достига 72% до 75% за между 0.50 и 1.50 долара на задача. GPT-6 Sol достигна максимум 68.8 за около 2.60 долара.

Повишаването над средно не винаги помага. На AutomationBench, 6.1 Sol постига 35.4% при средно и само около 36.0% при по-високо усилие. За бизнес автоматизация, допълнителните токени за разсъждение не донесоха почти нищо.

Запазете максималното за компютърна употреба и изследвания. На OSWorld 2.0, максималното постига 71.4 на около 1.30 долара на задача. Terminal-Bench Science при максимално струва 5.47 долара на задача: много по-евтино от 23.80 долара на Astra, но с порядък по-високо от повечето други работни натоварвания.

Ниското също стана по-добро. Процентът на фактически грешки при ниско спадна от 11.4% на 6 Sol до 7.7%. Ако сте увеличили задачите до средно на 6 Sol, защото ниското не беше достатъчно точно, опитайте отново ниското.


Начални точки по случаи на употреба

Случай на употребаЗапочнете отБележки
Обаждания, които използваха никакво на 6 SolнискоОфициалната карта на OpenAI. Ако латентността е критична, помислете за GPT-6 Luna, който все още поддържа никакво
Обаждания, които използваха минималнонискоЗапочнете от ниско и сравнете резултатите
Чатботове, поддръжка на клиентинискоПомолете модела за едноредов предговор, за да получите първия токен по-скоро
RAG Q&Aниско → средноКачеството на извличане е по-важно от усилието
Асистент за кодиране в IDEсредноПо подразбиране работи
Автоматизирано отстраняване на грешки, SWE агентивисокоDeepSWE показва, че високо вече съвпада с Astra
Използване на компютри, браузерни агентивисоко → максималноOSWorld достига максимум
Фонови изследвания, дълги сесиимного високоСамо когато оценките показват печалба. Пакетът намалява разходите наполовина, ако не се нуждаете от резултати веднага
Най-трудните изследователски проблемимаксимално, или просто използвайте AstraOpenAI препоръчва Astra и тук

Картите за none и minimal произлизат от ръководството за миграция на GPT-6 на OpenAI.


Промяна на усилието по време на разговор

Обичаен модел е да се планира на високо, да се изпълнява на ниско и да се превключи обратно на високо, когато нещо се счупи.

Уловката: редактирането на reasoning.effort в заявката нарушава кеша на подканата. Усилието е част от кеширания префикс (вижте ръководството за кеширане на подканата). На 6.1 Sol четенето от кеша струва 0.10 долара на милион токена, докато презаписването на кеша струва 2.50 долара. Това е разлика от 25×.

Семейството GPT-6 решава този проблем с configuration_update елемент за вход.  Оставете нивото на reasoning.effort на заявката непроменено и вмъкнете актуализация преди следващото съобщение от потребителя. Ето как изглежда това чрез AIHubMix Responses API:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Обрат 1: планирайте на високо усилие
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="Разберете защо тестовете на този репо не минават и предложете план за поправка.",
)

# Обрат 2: преминете на ниско за изпълнение, без да променяте усилието на заявката
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # непроменено, така че кешът да оцелее
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "Изпълнете стъпка 1 от плана."},
    ],
)
Формата на configuration_update по-горе е илюстративна. Проверете ръководството за разсъждение на OpenAI за точната схема. Документите на AIHubMix за отговори в момента изброяват четири нива (минимално до високо), така че изпратете малка тестова заявка, за да потвърдите, че xhigh, max и configuration_update преминават.

Някои ограничения, които трябва да знаете:

  • Работи само в стандартен режим с един агент и променя само усилието.
  • Две актуализации не могат да бъдат една до друга.
  • Не се смесва с автоматична компакция или отрязване. Явната компакция е приемлива, но добавете нова актуализация след това.
  • Полето reasoning.effort на отговора все още показва стойността на заявката, така че не се вглеждайте твърде много в него.

Настройки, които вървят с усилието

Оставете място в max_output_tokens. Таванът включва токени за разсъждение. Ако го зададете твърде ниско, моделът може да спре, преди да произведе видим текст. Получавате status: incomplete и все пак плащате за вход и разсъждение. OpenAI предлага да резервирате поне 25,000 токена за начало и повече за много високо или максимално.

Проследявайте токените за разсъждение. Те са в usage.output_tokens_details.reasoning_tokens. Да се гледа разпределението по ниво на усилие е по-добре от настройването на усещане.

Включете обобщения, ако имате нужда от видимост. reasoning.summary: "auto" върща обобщение на разсъжденията на модела (може да се наложи първо да потвърдите вашата организация). Суровите разсъждения никога не се разкриват.

Pro режимът е отделен превключвател. Той кара модела да извършва повече работа, таксувана по стандартни тарифи, но с повече токени общо. Използвайте го за трудни проблеми, където допълнителната латентност е приемлива.


Процес на настройка, който можете наистина да изпълните

  1. Изтеглете 20 до 50 реални задачи в набор за оценка.
  2. Изпълнете базова линия на medium. Запишете процента на успех, средния брой токени за разсъждение и P95 латентността.
  3. Опитайте low. Ако успехът едва спада, превключете.
  4. Опитайте high. Ако успехът очевидно се подобри, използвайте високо само за този тип задачи.
  5. Само прибягвайте до xhigh или max когато високо не е достатъчно, и сравнете с GPT-6 Astra на високо, докато сте на това. Понякога по-голям модел побеждава повече усилие. На AIHubMix това е просто промяна на параметъра model, а списъкът на моделите показва какво е налично.
  6. Направете маршрутизация по тип задача вместо да използвате едно глобално ниво.

Кратката версия: започнете от средно, спестявайте пари с ниско, използвайте високо за кодиране и направете много високо и максимално да се докажат в оценките ви.

Следва: какво означава наистина ценовият етикет от 2 долара / 10 долара, след като кеширането, дългият контекст и множителите за таксуване влязат в игра.


Често задавани въпроси

Какво е стандартното усилие за разсъждение за GPT-6.1 Sol? medium. Ако не го зададете, това е, което получавате.

Защо none върща грешка? 6.1 Sol не поддържа none или minimal. OpenAI препоръчва да преминете на low. Ако наистина се нуждаете от none, останете на GPT-6 Sol или GPT-6 Luna.

Как се таксуват токените за разсъждение? На изходната ставка (10 долара на милион за 6.1 Sol), и те се броят срещу контекстния прозорец. Проверете usage.output_tokens_details.reasoning_tokens за действителните числа.

Името на параметъра ли е същото в Chat Completions и Responses? Не. Chat Completions използва основен reasoning_effort. Responses използва вложен reasoning: {"effort": ...}. Смесването им връща Unsupported parameter.

Дали по-високото усилие винаги дава по-добри резултати? Не. На AutomationBench, повишаването над средно само премести резултата от 35.4% до около 36.0%, докато струваше забележимо повече. Тествайте на собствените си задачи.

Мога ли да променя усилието по средата на разговора? Да. Използвайте елемент configuration_update и оставете нивото на reasoning.effort на заявката непроменено, за да остане кешът на подканата валиден. Не работи с автоматична компакция или отрязване.

Защо получих status: incomplete без изход? Най-вероятно max_output_tokens беше твърде ниско и разсъждението го изразходваше напълно. OpenAI препоръчва да резервирате поне 25,000 токена.


Продължете да четете: серията GPT-6.1 Sol


Източници