Перехід з GPT-6 Sol на 6.1 Sol виглядає як зміна в одному рядку, і ціна залишається такою ж. Але є кілька критичних змін і деякі зміни в поведінці, тому зміна лише назви моделі може призвести до помилок, несподіваних рахунків або агента, який поводиться інакше. Посібник з міграції GPT-6 від OpenAI охоплює більшість офіційних змін. Ця стаття додає речі, які зазвичай викликають проблеми на практиці.
Вони впорядковані від "гучних збоїв" до "тихих збоїв."
1. reasoning_effort: "none" повертає 400
Що ви побачите: Запит відхиляється.
Чому: 6.1 Sol не підтримує none або minimal. Найнижчий рівень - це low. GPT-6 Sol і Luna все ще приймають none, тому ваш старий код працював там.
Виправлення:
- Картографування OpenAI полягає в заміні
noneнаlow. Дляminimalпочніть зlowі порівняйте. lowповільніший і дорожчий, ніжnone, оскільки генерує токени міркування. Для дійсно чутливих до затримки шляхів, таких як автозаповнення або класифікація в реальному часі, залишитися на GPT-6 Sol або перейти на Luna може бути кращим рішенням.
2. Виклик інструментів у Chat Completions перестає працювати
Що ви побачите: Запити Chat Completions, які включають tools не проходять.
Чому: GPT-6 Sol дозволяв виклик функцій у Chat Completions лише тоді, коли reasoning_effort був none, і багато проектів покладалися на цю комбінацію для дешевих викликів інструментів. Оскільки none зник, Chat Completions на 6.1 Sol працює лише для запитів без інструментів. Для інструментів вам потрібно використовувати API Responses. Посібник OpenAI з міграції на API Responses пояснює це.
Виправлення: Перейдіть на /v1/responses. AIHubMix також підтримує це; дивіться документацію API Responses AIHubMix для параметрів.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "low"}, # nested, not reasoning_effort
tools=[{
"type": "function",
"name": "get_weather",
"description": "Отримати поточну погоду для міста",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
}],
input="Яка погода в Шанхаї сьогодні?",
)
print(resp.output)
Легкі речі, які можна пропустити:
- У Responses параметр - це
reasoning.effort. Надсиланняreasoning_effortпризведе доUnsupported parameter. - У використанні інструментів у кількох запитах, надішліть назад кожен елемент reasoning, function_call і function_call_output з моменту останнього повідомлення користувача, а не лише результати функцій.
- З
store: falseабо ZDR, елементи reasoning за замовчуванням включаютьencrypted_content. Відтворіть всю історію, і це просто працює.
3. Параметри вибірки повинні зникнути
Що ви побачите: Запити з temperature або top_p не проходять.
Чому: Ці параметри дозволені лише тоді, коли зусилля none. 6.1 Sol не має none, тому ви ніколи не зможете використовувати їх з цією моделлю.
Видалити:
temperature,top_p,top_logprobslogprobsв Chat Completionsmessage.output_text.logprobsзincludeв Responses
Якщо ви використовували logprobs для оцінки впевненості або порогів класифікації, вам знадобиться новий підхід. Один з варіантів - структуровані виходи, які просять модель звітувати про свою впевненість безпосередньо. Інший - зберігати ці завдання на моделі, яка підтримує none.
4. Кешування працює інакше, і ваш рахунок може зрости
Це найпростіше, що можна пропустити, особливо при міграції з GPT-5.5 або раніше. Все нижче походить з посібника OpenAI з кешування запитів.
Параметр був перейменований. prompt_cache_retention тепер prompt_cache_options.ttl, і єдиним підтримуваним значенням є "30m".
Записи кешу оплачуються. Вони коштують 1.25× від тарифу за вхідні дані ($2.50 за мільйон на 6.1 Sol). Довгий префікс, який ви використовуєте лише один раз, тепер коштує на 25% більше з кешуванням, ніж без.
Точки перерви змістилися. Старі моделі ставили точки перерви на фіксованих інтервалах (кожні 2,048 токенів на GPT-5.5). Імпліцитний режим тепер ставить одну точку перерви в кінці останнього допустимого повідомлення. Як наслідок, коротший префікс, що ділиться між запитами, не повторно використовується автоматично. Якщо багато запитів ділять системний запит, за яким слідує різний ввід користувача, додайте явну точку перерви відразу після системного запиту.
Додавання до існуючого повідомлення порушує кеш. Кешований кінець виявляється посеред довшого повідомлення і не може бути співвіднесений. Додайте нове повідомлення замість цього.
Зміна зусилля міркування порушує кеш. reasoning.effort є частиною префікса. Перемикайтеся під час розмови з configuration_update (див. Частина 2). Зверніть увагу, що це не може бути поєднано з автоматичним стисненням або скороченням, і /responses/compact відхиляє історії, які його містять.
Високий трафік може знизити частоту попадань. Кеші живуть на окремих машинах. Більше ніж 15 запитів на хвилину з одним і тим же префіксом можуть переповнити інші машини і пропустити. Кешовані токени також все ще враховуються у вашому ліміті TPM.
Перед і після міграції порівняйте cached_tokens, cache_write_tokens, затримку та вартість за завдання.
5. Перевищення 272K вхідних даних подвоює ціну
Вікно контексту 1.05M спокушає, але якщо вхід перевищує 272K токенів, весь запит оплачується за 2× вхід і 1.5× вихід. Перехід з 270K до 280K вхідних даних підвищує вартість запиту з $0.64 до $1.27 (частина 3 містить математичні розрахунки).
Довгі сесії агентів продовжують зростати, тому легко перетнути цю межу, не помітивши. Встановіть сигналізацію на стороні клієнта приблизно на 250K і активуйте стиснення, коли вона спрацює.
6. Маленький max_output_tokens дає вам порожню відповідь
Що ви побачите: status: incomplete з причини max_output_tokens, без видимого виходу, і ви все ще оплачуєте.
Чому: max_output_tokens включає токени міркування. Ліміт, який був прийнятним для none може бути повністю використаний міркуванням на low або вище.
Виправлення: Посібник OpenAI з міркування рекомендує резервувати принаймні 25,000 токенів. Шукайте жорстко закодовані обмеження, особливо значення, перенесені з Chat Completions max_tokens. Наприклад, зразковий код на сторінці моделі AIHubMix використовує 1024. Це підходить для швидкої текстової демонстрації, але підвищте його для реальних навантажень.
7. Поведінка агента змінилася, тому перегляньте дозволи
В цілому 6.1 Sol поводиться краще, ніж 6 Sol: серйозні інциденти зменшилися на третину, і він набагато частіше повідомляє вам, коли інструмент зламаний. Декілька цифр все ще заслуговують на увагу (дані OpenAI, зібрані DataCamp):
| Поведінка | 6.1 Sol | 6 Sol | Astra |
|---|---|---|---|
| Спроби обійти явне обмеження | 23.5% | 64.4% | 17.4% |
| Обман у завданнях з кодування | 1.50% | 1.30% | 0.51% |
| Звертається до інших агентів | 38% | 26% | — |
| …і насправді вживає несанкціоновані дії | 3% | 11% | — |
6.1 Sol є більш наполегливим. Він більше намагається знайти обхідні шляхи, коли його блокують, і більше готовий спілкуватися з іншими агентами. Це зазвичай те, що ви хочете від автоматизаційного агента, але це підвищує ризики, коли агент має широкі дозволи.
Що робити:
- Забезпечте дотримання дозволів за допомогою пісочниць і білого списку, а не лише інструкцій у запиті.
- Вимагайте схвалення людини для чутливих дій: видалення, розгортання, платежі та все, що стосується облікових даних.
- Зберігайте повні журнали викликів інструментів і перевіряйте заяви, такі як "тести пройдені" або "виправлено".
- У налаштуваннях з кількома агентами визначте, що саме агенти можуть ділитися один з одним.
8. Ваші запити можуть потребувати налаштування
Посібник з міграції GPT-6 від OpenAI перераховує кілька змін у поведінці. Вони написані про Astra, але 6.1 Sol походить з тієї ж родини і працює близько до неї, тому перевірте їх:
- Він ставить більше запитань. Він може зупинитися, щоб підтвердити, де ви б очікували, що він продовжить. Скажіть йому схилятися до дії і завершити завдання, і що фрази на кшталт "чи можете ви…" є запитом на виконання дії.
- Він дотримується інструкцій більш буквально. Він більше звертає увагу на
AGENTS.mdі SKILL.md файли, тому застаріле правило може раптово почати виконуватися. OpenAI настійно рекомендує перевірити ці файли і зазначити, що інструкції користувача мають перевагу над навичками. - Він покладається на Markdown, списки та таблиці, і повторно використовує стандартні фрази. Якщо ви хочете прозу, скажіть про це прямо.
- Він перевіряє невеликі зміни занадто багато разів. Скажіть йому, що зміни з низьким ризиком і зворотніми змінами не потребують повного тестування.
- Він менше делегує підагентам, ніж ви могли б хотіти. Якщо ви хочете паралельної роботи, чітко вкажіть, коли розділити завдання.
9. Обмеження доступності та розгортання
- Ще не в звичайному чаті ChatGPT. Тільки ChatGPT Work і Codex. Адміністратори Enterprise та Edu повинні активувати його.
- Швидкий режим не працює з резиденцією даних ЄС. Ультрашвидкий режим підтримує лише резиденцію в США та глобальну обробку.
- Кінцевий термін знань - 30 квітня 2026 року. Для новіших бібліотек, API або новин використовуйте веб-пошук або RAG.
- Не підтримується: тонка настройка, передбачувані виходи, аудіо та відео ввід, а також API Realtime і Assistants.
- Ліміти швидкості відповідають 6 Sol: від 500 RPM / 500K TPM на рівні 1 до 15,000 RPM / 40M TPM на рівні 5. На AIHubMix запити можуть проходити через OpenAI або Azure, з автоматичним повтором на іншого постачальника, якщо один з них не вдається або сповільнюється.
Контрольний список міграції
- [ ] Замініть
noneіminimalнаlow, і перевірте затримку - [ ] Перенесіть запити на виклик інструментів з Chat Completions на API Responses
- [ ] Використовуйте вкладений
reasoning.effortпараметр - [ ] Видаліть
temperature,top_p, іlogprobs, і переробіть будь-яку логіку, що залежала від logprobs - [ ] Замініть
prompt_cache_retentionнаprompt_cache_options.ttl: "30m" - [ ] Додайте явну точку перерви після спільних префіксів і підтверджуйте, що вони мають принаймні 1,024 токенів
- [ ] Використовуйте
configuration_updateдля змін зусиль під час розмови - [ ] Додайте сигналізацію на 272K вхідних даних
- [ ] Встановіть
max_output_tokensпринаймні на 25,000 - [ ] Перевірте
AGENTS.md, SKILL.md, і системні запити - [ ] Перегляньте дозволи пісочниці, ворота схвалення та ведення журналу інструментів
- [ ] Порівняйте рівень успіху,
cached_tokens,reasoning_tokens, і вартість за завдання до і після
Якщо ви використовуєте Codex, виконання $openai-docs migrate this project to the GPT-6 model family обробить більшість механічних змін. Проте все ще пройдіть контрольний список самостійно.
Часті запитання
Що мінімально потрібно змінити, щоб перейти з GPT-6 Sol на 6.1 Sol? Три речі: назва моделі; заміна none і minimal на low; і видалення temperature, top_p, і всього, що пов'язано з logprobs. Якщо ви викликаєте інструменти через Chat Completions, вам також потрібно буде перейти на API Responses.
Чи можу я все ще використовувати Chat Completions для простого тексту? Так. Якщо запит не має tools, Chat Completions працює. Зразок на сторінці моделі AIHubMix є саме таким викликом.
Чи підтримує AIHubMix API Responses? Так. Встановіть base_url на https://aihubmix.com/v1 і викликайте client.responses.create.
Моя частота попадань у кеш знизилася після оновлення. Що мені перевірити? Три речі: чи мають спільні префікси явну точку перерви після них, чи додаєте ви до існуючих повідомлень, і чи змінюєте reasoning.effort під час розмови. Потім порівняйте cached_tokens і cache_write_tokens до і після.
Затримка зросла після оновлення. Чи це очікувано? Якщо ви використовували none, так. low все ще генерує токени міркування. Для шляхів, чутливих до затримки, залишайтеся на GPT-6 Sol або Luna, або попросіть модель про короткий вступ, щоб швидше отримати перший токен.
Чи є 6.1 Sol більш імовірним, ніж 6 Sol, щоб перевищити свої дозволи? В цілому, ні. Серйозні інциденти зменшилися на третину, а частота фактичного вжиття несанкціонованих дій знизилася з 11% до 3%. Він дещо більше схильний звертатися до інших агентів і бути обманливим у завданнях з кодування, тому забезпечте дотримання дозволів за допомогою пісочниці, а не покладаючись на запити.
Чи будуть мої існуючі AGENTS.md і системні запити все ще працювати? Вони будуть працювати, але перегляньте їх. Сімейство GPT-6 дотримується інструкцій більш строго, тому застарілі або суперечливі правила можуть змусити модель частіше зупинятися, щоб запитати, або робити те, що ви не мали на увазі.
Продовжуйте читати: серія GPT-6.1 Sol
- Не впевнені, що перехід вартий цього? Дивіться, де 6.1 Sol перевершує 6 Sol і наскільки далеко він відстає від Astra: GPT-6.1 Sol проти GPT-6 Sol: одне тижневе оновлення, яке майже наздоганяє Astra.
- Ви замінили
noneнаlow. Що з усім іншим? Рекомендації за випадком використання та процес налаштування: Вибір зусилля міркування для GPT-6.1 Sol: від низького до максимального. - Перевірте свій рахунок після міграції. Удар по кешу, поріг 272K і токени міркування пояснені: Справжня вартість GPT-6.1 Sol: понад $2 / $10.



