GPT-6.1 Sol предлага пет нива на усилие за разсъждение: low, medium (по подразбиране), high, xhigh, и max. Голямата промяна от GPT-6 Sol е, че none и minimal са премахнати, така че low сега е основното ниво.
Тази настройка влияе както на латентността, така и на разходите. Никога не виждате токени за разсъждение, но плащате за тях на изходната ставка (10 долара на милион за 6.1 Sol на AIHubMix), и те заемат място в контекстния прозорец. Изберете грешно ниво и лесно можете да платите няколко пъти повече, отколкото е необходимо.
Какво представлява всяко ниво
Таблицата по-долу комбинира описанията на OpenAI от ръководството за разсъждение с нашите собствени препоръки:
| Ниво | Описание на OpenAI | Добро съответствие | Лошо съответствие |
|---|---|---|---|
| ниско | Ефективно разсъждение с умерено увеличение на латентността | Промеждутъчни стъпки в цикли на инструменти, търсене, леко планиране, класификация, извличане, поддръжка на отговори | Трудно отстраняване на грешки, рефакториране на множество файлове |
| средно (по подразбиране) | Балансът по подразбиране за повечето работни натоварвания | Ежедневно кодиране, преглед на код, писане, типични задачи на агенти | Интерактивна употреба, критична за латентността |
| високо | Трудно разсъждение, сложна отстраняване на грешки, дълбоко планиране | Сложни грешки, архитектурна работа, задачи в стил SWE | Онлайн трафик с висока QPS |
| много високо | Дълбоки изследвания, асинхронна работа, дълги сесии на агенти | Фонови задачи, изследователски доклади | Всичко, което вашите оценки не са оправдали |
| максимално | Максимално разсъждение за най-трудните задачи | Използване на компютри, проблеми от изследователски клас, офлайн тежки задачи | Почти всички ежедневни заявки |
OpenAI нарича усилието "регулираща ръкохватка, а не основен начин за възстановяване на качеството." Когато резултатите са лоши, първо погледнете към подканата, определенията на инструментите и контекста. Увеличете усилието само след това.
Какво казват бенчмарковете за всяко ниво
Тези числа са на OpenAI, събрани от Vellum и DataCamp. Отнасяйте се към тях като към указание, а не като към евангелие.
За кодиране, високо обикновено е достатъчно. На DeepSWE v1.1, 6.1 Sol при високо постига 75.2, съвпадайки с Astra при високо (74.8), за около 1.50 долара на задача. Кривата на разходите достига 72% до 75% за между 0.50 и 1.50 долара на задача. GPT-6 Sol достигна максимум 68.8 за около 2.60 долара.
Повишаването над средно не винаги помага. На AutomationBench, 6.1 Sol постига 35.4% при средно и само около 36.0% при по-високо усилие. За бизнес автоматизация, допълнителните токени за разсъждение не донесоха почти нищо.
Запазете максималното за компютърна употреба и изследвания. На OSWorld 2.0, максималното постига 71.4 на около 1.30 долара на задача. Terminal-Bench Science при максимално струва 5.47 долара на задача: много по-евтино от 23.80 долара на Astra, но с порядък по-високо от повечето други работни натоварвания.
Ниското също стана по-добро. Процентът на фактически грешки при ниско спадна от 11.4% на 6 Sol до 7.7%. Ако сте увеличили задачите до средно на 6 Sol, защото ниското не беше достатъчно точно, опитайте отново ниското.
Начални точки по случаи на употреба
| Случай на употреба | Започнете от | Бележки |
|---|---|---|
| Обаждания, които използваха никакво на 6 Sol | ниско | Официалната карта на OpenAI. Ако латентността е критична, помислете за GPT-6 Luna, който все още поддържа никакво |
| Обаждания, които използваха минимално | ниско | Започнете от ниско и сравнете резултатите |
| Чатботове, поддръжка на клиенти | ниско | Помолете модела за едноредов предговор, за да получите първия токен по-скоро |
| RAG Q&A | ниско → средно | Качеството на извличане е по-важно от усилието |
| Асистент за кодиране в IDE | средно | По подразбиране работи |
| Автоматизирано отстраняване на грешки, SWE агенти | високо | DeepSWE показва, че високо вече съвпада с Astra |
| Използване на компютри, браузерни агенти | високо → максимално | OSWorld достига максимум |
| Фонови изследвания, дълги сесии | много високо | Само когато оценките показват печалба. Пакетът намалява разходите наполовина, ако не се нуждаете от резултати веднага |
| Най-трудните изследователски проблеми | максимално, или просто използвайте Astra | OpenAI препоръчва Astra и тук |
Картите за none и minimal произлизат от ръководството за миграция на GPT-6 на OpenAI.
Промяна на усилието по време на разговор
Обичаен модел е да се планира на високо, да се изпълнява на ниско и да се превключи обратно на високо, когато нещо се счупи.
Уловката: редактирането на reasoning.effort в заявката нарушава кеша на подканата. Усилието е част от кеширания префикс (вижте ръководството за кеширане на подканата). На 6.1 Sol четенето от кеша струва 0.10 долара на милион токена, докато презаписването на кеша струва 2.50 долара. Това е разлика от 25×.
Семейството GPT-6 решава този проблем с configuration_update елемент за вход. Оставете нивото на reasoning.effort на заявката непроменено и вмъкнете актуализация преди следващото съобщение от потребителя. Ето как изглежда това чрез AIHubMix Responses API:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Обрат 1: планирайте на високо усилие
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"},
input="Разберете защо тестовете на този репо не минават и предложете план за поправка.",
)
# Обрат 2: преминете на ниско за изпълнение, без да променяте усилието на заявката
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # непроменено, така че кешът да оцелее
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "low"}},
{"role": "user", "content": "Изпълнете стъпка 1 от плана."},
],
)
Формата наconfiguration_updateпо-горе е илюстративна. Проверете ръководството за разсъждение на OpenAI за точната схема. Документите на AIHubMix за отговори в момента изброяват четири нива (минимално до високо), така че изпратете малка тестова заявка, за да потвърдите, чеxhigh,maxиconfiguration_updateпреминават.
Някои ограничения, които трябва да знаете:
- Работи само в стандартен режим с един агент и променя само усилието.
- Две актуализации не могат да бъдат една до друга.
- Не се смесва с автоматична компакция или отрязване. Явната компакция е приемлива, но добавете нова актуализация след това.
- Полето
reasoning.effortна отговора все още показва стойността на заявката, така че не се вглеждайте твърде много в него.
Настройки, които вървят с усилието
Оставете място в max_output_tokens. Таванът включва токени за разсъждение. Ако го зададете твърде ниско, моделът може да спре, преди да произведе видим текст. Получавате status: incomplete и все пак плащате за вход и разсъждение. OpenAI предлага да резервирате поне 25,000 токена за начало и повече за много високо или максимално.
Проследявайте токените за разсъждение. Те са в usage.output_tokens_details.reasoning_tokens. Да се гледа разпределението по ниво на усилие е по-добре от настройването на усещане.
Включете обобщения, ако имате нужда от видимост. reasoning.summary: "auto" върща обобщение на разсъжденията на модела (може да се наложи първо да потвърдите вашата организация). Суровите разсъждения никога не се разкриват.
Pro режимът е отделен превключвател. Той кара модела да извършва повече работа, таксувана по стандартни тарифи, но с повече токени общо. Използвайте го за трудни проблеми, където допълнителната латентност е приемлива.
Процес на настройка, който можете наистина да изпълните
- Изтеглете 20 до 50 реални задачи в набор за оценка.
- Изпълнете базова линия на
medium. Запишете процента на успех, средния брой токени за разсъждение и P95 латентността. - Опитайте
low. Ако успехът едва спада, превключете. - Опитайте
high. Ако успехът очевидно се подобри, използвайте високо само за този тип задачи. - Само прибягвайте до
xhighилиmaxкогато високо не е достатъчно, и сравнете с GPT-6 Astra на високо, докато сте на това. Понякога по-голям модел побеждава повече усилие. На AIHubMix това е просто промяна на параметъраmodel, а списъкът на моделите показва какво е налично. - Направете маршрутизация по тип задача вместо да използвате едно глобално ниво.
Кратката версия: започнете от средно, спестявайте пари с ниско, използвайте високо за кодиране и направете много високо и максимално да се докажат в оценките ви.
Следва: какво означава наистина ценовият етикет от 2 долара / 10 долара, след като кеширането, дългият контекст и множителите за таксуване влязат в игра.
Често задавани въпроси
Какво е стандартното усилие за разсъждение за GPT-6.1 Sol? medium. Ако не го зададете, това е, което получавате.
Защо none върща грешка? 6.1 Sol не поддържа none или minimal. OpenAI препоръчва да преминете на low. Ако наистина се нуждаете от none, останете на GPT-6 Sol или GPT-6 Luna.
Как се таксуват токените за разсъждение? На изходната ставка (10 долара на милион за 6.1 Sol), и те се броят срещу контекстния прозорец. Проверете usage.output_tokens_details.reasoning_tokens за действителните числа.
Името на параметъра ли е същото в Chat Completions и Responses? Не. Chat Completions използва основен reasoning_effort. Responses използва вложен reasoning: {"effort": ...}. Смесването им връща Unsupported parameter.
Дали по-високото усилие винаги дава по-добри резултати? Не. На AutomationBench, повишаването над средно само премести резултата от 35.4% до около 36.0%, докато струваше забележимо повече. Тествайте на собствените си задачи.
Мога ли да променя усилието по средата на разговора? Да. Използвайте елемент configuration_update и оставете нивото на reasoning.effort на заявката непроменено, за да остане кешът на подканата валиден. Не работи с автоматична компакция или отрязване.
Защо получих status: incomplete без изход? Най-вероятно max_output_tokens беше твърде ниско и разсъждението го изразходваше напълно. OpenAI препоръчва да резервирате поне 25,000 токена.
Продължете да четете: серията GPT-6.1 Sol
- Колко от сметката ви е разсъждение? Усилието е само един лост. Кеширането, прага от 272K и отстъпките за партиди също оформят крайната сума. Вижте Какво наистина струва GPT-6.1 Sol: Отвъд ценовия етикет от 2 долара / 10 долара.
- Код, който използва
none? Преминаването наlowе само началото. Обажданията на инструменти, параметрите за вземане на проби и настройките на кеша също се нуждаят от промени: Мигриране към GPT-6.1 Sol: 9 неща, които могат да се объркат. - Колко по-добър е 6.1 Sol от 6 Sol и Astra? Спецификации и бенчмаркове рамо до рамо в GPT-6.1 Sol срещу GPT-6 Sol: А надстройка за една седмица, която почти настигна Astra.



