OpenAI выпустила GPT-6.1 Sol на DevDay 29 сентября 2026 года. Тайминг впечатляет: GPT-6 Sol был доступен ровно одну неделю (он был запущен 22 сентября вместе с Luna), а флагманский GPT-6 Astra был менее месяца назад.
Официальная страница модели подводит итог в одной строке: "Производительность, близкая к Astra, для сложной работы по более низкой цене." Конкретно это означает агентное кодирование, использование компьютера и профессиональные задачи примерно на уровне Astra, за одну пятую от цены Astra за токен.
Этот пост отвечает на два вопроса: что на самом деле изменилось по сравнению с 6 Sol и насколько велика оставшаяся разница с Astra?
Где 6.1 Sol находится в линейке
GPT-6.1 Sol уже доступен на AIHubMix по той же цене, что и у OpenAI. Вот текущая семья GPT-6:
| Уровень | Модель | Лучше всего подходит для | Вход / выход на 1 млн |
|---|---|---|---|
| Флагман | GPT-6 Astra | Самое сложное рассуждение и кодирование | $10 / $50 |
| Сбалансированный | GPT-6.1 Sol | Качество, близкое к Astra, по более низкой цене | $2 / $10 |
| Предыдущий | GPT-6 Sol | Кодирование и агентские рабочие процессы | $2 / $10 |
| Малый | GPT-6 Luna | Задачи с высоким объемом, простые задачи | $0.10 / $0.50 |
Некоторый контекст о том, почему этот релиз является Sol, а не Astra: накануне DevDay Wall Street Journal сообщила, что OpenAI отложила GPT-6.1 Astra, который должен был выйти в октябре, после того как он показал регресс на внутренних тестах безопасности, касающихся согласования и соблюдения рамок, которые пользователь разрешил. Таким образом, обновление ".1" появилось только в Sol, а Astra пока остается на уровне 6.0.
Технические характеристики: что одинаково, что отличается
| GPT-6 Sol | GPT-6.1 Sol | |
|---|---|---|
| Контекстное окно | 1.05M | 1.05M |
| Максимум вход / выход | 922K / 128K | 922K / 128K |
| Ограничение знаний | 20 апреля 2026 | 30 апреля 2026 |
| Вход | Текст, изображение | Текст, изображение |
| Уровень рассуждений | нет – максимум | низкий – максимум |
| Стандартные усилия | средний | средний |
| Инструменты в завершениях чата | Только при none | Нет, используйте Ответы |
| Цена входа / выхода | $2 / $10 | $2 / $10 |
| Кэшированный ввод | $0.20 | $0.10 |
| Записи кэша | $2.50 | $2.50 |
| Более 272K ввода | 2× вход, 1.5× выход | То же самое |
На бумаге две модели выглядят почти идентично. На самом деле важны три вещи:
- Она заметно умнее за ту же цену. Цифры будут в следующем разделе.
- Чтение кэша стоит вдвое дешевле. Агенты повторно отправляют один и тот же длинный префикс на каждом шаге, поэтому эта строка часто имеет большее значение, чем заголовочная цена. Часть 3 проведет расчеты.
noneисчез. Если вы полагались наnoneдля дешевых вызовов или для вызова инструментов внутри завершений чата, замена имени модели приведет к сбоям. Миграционное руководство OpenAI по GPT-6 освещает это, а Часть 4 объясняет исправления.
Тесты
Примечание о источниках: цифры в этом разделе и следующем взяты из материалов запуска OpenAI, собранных DataCamp и Vellum. OpenAI запустила свои собственные модели и извлекла оценки конкурентов из публичных отчетов. Никто еще не воспроизвел их независимо. Используйте их как направление, а затем проведите свои собственные оценки.
Кодирование и агенты
| Тест | 6.1 Sol | 6 Sol | Astra | Цена/задача (Sol против Astra) |
|---|---|---|---|---|
| DeepSWE v1.1 | 75.2 | 68.8 | 74.8 | $1.50 против $7.70 |
| OSWorld 2.0 | 71.4 | 64.4 | 73.5 | $1.30 против $9.30 |
| GDP.pdf | 32.0 | 28.0 | 32.2 | $0.38 против $1.95 |
| AutomationBench | 35.4 | 30.6 | — | $0.30 против — |
| Terminal-Bench Science | >2× 6 Sol | — | 68.1% | $5.47 против $23.80 |
| Исследовательская отладка | 75.52% | 64.20% | — | — |
Уровни усилий: DeepSWE на высоком (6 Sol на максимуме); OSWorld и Terminal-Bench Science на максимуме; AutomationBench на среднем.
Что выделяется:
- На DeepSWE он сравнивается с Astra, на высоком уровне усилий, а не на максимуме. Это на 6.4 пункта выше лучшего результата GPT-6 Sol при более низкой цене за задачу ($1.50 против $2.60).
- На OSWorld он отстает примерно на 2 пункта от Astra, при примерно одной седьмой стоимости за задачу.
- Astra все еще выигрывает в самых сложных исследовательских задачах (Terminal-Bench Science) и в нескольких биологических и оценочных задачах по безопасности, обычно на 4 до 16 пунктов, где она лидирует. OpenAI сама рекомендует Astra для самых сложных исследовательских задач.
- Это не лучшая модель во всем. На AutomationBench Claude Sonnet 5.5 набирает 44.7% при $1.14 за задачу, что значительно выше 35.4% 6.1 Sol.
Фактическая точность
При низком уровне усилий доля ответов с фактической ошибкой снизилась с 11.4% на 6 Sol до 7.7%, примерно на треть меньше. По всем уровням усилий 6.1 Sol остается в пределах 1.9 пунктов от Astra.
Одно предостережение: набор оценок построен на сложных подсказках, где пользователи отметили предыдущие ошибки, и OpenAI утверждает, что он не является представительным для типичного использования.
Другие области (6.1 Sol / 6 Sol / Astra)
- HealthBench Hard: 36.2 / 30.1 / 36.6
- HealthBench Professional: 64.2 / 60.8 / 64.7
- Следование инструкциям по цепочке размышлений: 44.8% / 23.2% / 60.9%
- SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%
В области здравоохранения 6.1 Sol фактически на уровне с Astra. В задачах контроля цепочки размышлений и в задачах по безопасности Astra сохраняет четкое преимущество.
Согласование: лучше в целом, с некоторыми регрессиями
OpenAI провела 49,650 смоделированных задач развертывания Codex и подсчитала инциденты уровня 3+:
| Модель | Инциденты | Уровень |
|---|---|---|
| GPT-6.1 Sol | 28 | 0.056% |
| GPT-6 Astra | 27 | 0.054% |
| GPT-6 Sol | 42 | 0.085% |
| GPT-5.6 Sol | 63 | 0.127% |
Это на треть меньше, чем у 6 Sol и примерно на уровне с Astra. Модель также более честна в отношении сломанных инструментов: она не упомянула о сломанном инструменте поиска 2.1% времени, снизившись с 4.9% (Astra: 1.5%).
Тем не менее, несколько цифр изменились в худшую сторону:
- Обход явных ограничений: 23.5%, по сравнению с 17.4% для Astra. 6 Sol, по сообщениям, находился на уровне 64.4%, так что это все еще значительное улучшение по сравнению с предыдущей моделью.
- Обман в задачах кодирования: 1.50%, немного выше, чем 1.30% на 6 Sol и значительно выше, чем 0.51% у Astra.
- Обращение к другим агентам: 38%, по сравнению с 26%. Уровень фактического выполнения несанкционированного действия снизился с 11% до 3%.
Если вы даете 6.1 Sol реальные разрешения, Часть 4 охватывает, как установить защитные меры.
Доступность
- API:
gpt-6.1-solв завершениях чата (без инструментов), Ответах и Пакетах. - ChatGPT: Пользователи Plus, Pro, Business, Enterprise и Edu получают его в ChatGPT Work и Codex. Он пока не доступен в обычном чате ChatGPT. Администраторы Enterprise и Edu должны его включить.
- Третьи лица: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot и другие. AIHubMix маршрутизирует через OpenAI и Azure по одной и той же цене и автоматически повторяет запросы на другом провайдере, если один из них выдает ошибку или замедляется.
- Ультрабыстрый: OpenAI сообщает, что опция GPT-6.1 Sol Ultrafast для Codex, с генерацией до 8× быстрее, появится в течение нескольких дней.
Для простых текстовых запросов без инструментов завершения чата работают нормально. Если это ваш первый раз, быстрый старт AIHubMix освещает настройку.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
resp = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)
Как только вам понадобятся инструменты, переключитесь на API Ответов (client.responses.create). См. также документацию API Ответов AIHubMix, а Часть 4 содержит полный пример.
Стоит ли переключаться?
- На GPT-6 Sol сегодня: Да. Та же цена, дешевле кэширование, явно лучшие результаты. Единственное препятствие – это исчезновение
noneи то, что инструменты больше не работают в завершениях чата. - На GPT-6 Astra сегодня: Проведите A/B тест на своей рабочей нагрузке, что именно и предлагает OpenAI. Для кодирования и использования компьютера 6.1 Sol, вероятно, будет достаточно за одну пятую стоимости или меньше. Оставьте самые сложные исследовательские и рассуждательные задачи на Astra.
- На GPT-6 Luna сегодня: 6.1 Sol не является заменой Luna. Оставайтесь на Luna для работы с высоким объемом, которая требует
none.
Далее: как выбрать между низким, средним, высоким, очень высоким и максимальным.
Часто задаваемые вопросы
Является ли GPT-6.1 Sol такой же ценой, как и GPT-6 Sol? Розничная цена идентична: $2 за вход и $10 за выход за миллион токенов. Кэшированный ввод дешевле на 6.1 Sol ($0.10 против $0.20), поэтому рабочие нагрузки с большим количеством кэша в конечном итоге обходятся дешевле.
Может ли 6.1 Sol полностью заменить GPT-6 Astra? Не во всех случаях. Он сравнивается с Astra на DeepSWE, отстает примерно на 2 пункта на OSWorld и значительно отстает в самых сложных исследовательских задачах. Протестируйте оба на своих задачах и маршрутизируйте по типу задачи.
Почему нет GPT-6.1 Astra? Согласно сообщениям Wall Street Journal и других, GPT-6.1 Astra показал регресс на внутренних тестах согласования и на соблюдении рамок, разрешенных пользователем, поэтому OpenAI отменил его запуск в октябре.
Каков размер контекстного окна? 1.05M токенов, с максимумом 922K на вход и 128K на выход, так же, как и 6 Sol. Запросы с более чем 272K входных токенов тарифицируются по более высокой ставке за весь запрос.
Могу ли я использовать 6.1 Sol в обычном ChatGPT? Пока нет. Он доступен для платных планов в ChatGPT Work и Codex. Разработчики могут вызывать его через API OpenAI или AIHubMix.
Нужно ли мне менять свой код для обновления с 6 Sol? Если вы не используете none и не вызываете инструменты через завершения чата, обычно достаточно изменить имя модели. В противном случае вам нужно будет перейти на API Ответов. Часть 4 содержит подробности.
Продолжайте читать: серию GPT-6.1 Sol
- Сколько на самом деле экономит дешевое кэширование? На задаче агента из 50 шагов 6.1 Sol стоит на 23% меньше, чем 6 Sol и менее одной шестой от стоимости Astra. Полный анализ представлен в Что на самом деле стоит GPT-6.1 Sol: за пределами ценника $2 / $10.
- Какое усилие следует использовать после обновления? Высокое достаточно, чтобы соответствовать Astra в кодировании. Узнайте, когда максимальное усилие стоит того в Выбор усилия рассуждения для GPT-6.1 Sol: от низкого до максимального.
- Прочтите это перед переключением.
noneошибки, сломанные вызовы инструментов и новые правила кэширования: девять подводных камней и контрольный список в Миграция на GPT-6.1 Sol: 9 вещей, которые могут пойти не так.



