GPT-6.1 Sol против GPT-6 Sol: Обновление за одну неделю, которое почти догоняет Astra

AIHubMix7 мин чтения
GPT-6.1 Sol против GPT-6 Sol: Обновление за одну неделю, которое почти догоняет Astra

OpenAI выпустила GPT-6.1 Sol на DevDay 29 сентября 2026 года. Тайминг впечатляет: GPT-6 Sol был доступен ровно одну неделю (он был запущен 22 сентября вместе с Luna), а флагманский GPT-6 Astra был менее месяца назад.

Официальная страница модели подводит итог в одной строке: "Производительность, близкая к Astra, для сложной работы по более низкой цене." Конкретно это означает агентное кодирование, использование компьютера и профессиональные задачи примерно на уровне Astra, за одну пятую от цены Astra за токен.

Этот пост отвечает на два вопроса: что на самом деле изменилось по сравнению с 6 Sol и насколько велика оставшаяся разница с Astra?


Где 6.1 Sol находится в линейке

GPT-6.1 Sol уже доступен на AIHubMix по той же цене, что и у OpenAI. Вот текущая семья GPT-6:

УровеньМодельЛучше всего подходит дляВход / выход на 1 млн
ФлагманGPT-6 AstraСамое сложное рассуждение и кодирование$10 / $50
СбалансированныйGPT-6.1 SolКачество, близкое к Astra, по более низкой цене$2 / $10
ПредыдущийGPT-6 SolКодирование и агентские рабочие процессы$2 / $10
МалыйGPT-6 LunaЗадачи с высоким объемом, простые задачи$0.10 / $0.50

Некоторый контекст о том, почему этот релиз является Sol, а не Astra: накануне DevDay Wall Street Journal сообщила, что OpenAI отложила GPT-6.1 Astra, который должен был выйти в октябре, после того как он показал регресс на внутренних тестах безопасности, касающихся согласования и соблюдения рамок, которые пользователь разрешил. Таким образом, обновление ".1" появилось только в Sol, а Astra пока остается на уровне 6.0.


Технические характеристики: что одинаково, что отличается

GPT-6 SolGPT-6.1 Sol
Контекстное окно1.05M1.05M
Максимум вход / выход922K / 128K922K / 128K
Ограничение знаний20 апреля 202630 апреля 2026
ВходТекст, изображениеТекст, изображение
Уровень рассужденийнет – максимумнизкий – максимум
Стандартные усилиясреднийсредний
Инструменты в завершениях чатаТолько при noneНет, используйте Ответы
Цена входа / выхода$2 / $10$2 / $10
Кэшированный ввод$0.20$0.10
Записи кэша$2.50$2.50
Более 272K ввода2× вход, 1.5× выходТо же самое

На бумаге две модели выглядят почти идентично. На самом деле важны три вещи:

  1. Она заметно умнее за ту же цену. Цифры будут в следующем разделе.
  2. Чтение кэша стоит вдвое дешевле. Агенты повторно отправляют один и тот же длинный префикс на каждом шаге, поэтому эта строка часто имеет большее значение, чем заголовочная цена. Часть 3 проведет расчеты.
  3. none исчез. Если вы полагались на none для дешевых вызовов или для вызова инструментов внутри завершений чата, замена имени модели приведет к сбоям. Миграционное руководство OpenAI по GPT-6 освещает это, а Часть 4 объясняет исправления.

Тесты

Примечание о источниках: цифры в этом разделе и следующем взяты из материалов запуска OpenAI, собранных DataCamp и Vellum. OpenAI запустила свои собственные модели и извлекла оценки конкурентов из публичных отчетов. Никто еще не воспроизвел их независимо. Используйте их как направление, а затем проведите свои собственные оценки.

Кодирование и агенты

Тест6.1 Sol6 SolAstraЦена/задача (Sol против Astra)
DeepSWE v1.175.268.874.8$1.50 против $7.70
OSWorld 2.071.464.473.5$1.30 против $9.30
GDP.pdf32.028.032.2$0.38 против $1.95
AutomationBench35.430.6—$0.30 против —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 против $23.80
Исследовательская отладка75.52%64.20%——

Уровни усилий: DeepSWE на высоком (6 Sol на максимуме); OSWorld и Terminal-Bench Science на максимуме; AutomationBench на среднем.

Что выделяется:

  • На DeepSWE он сравнивается с Astra, на высоком уровне усилий, а не на максимуме. Это на 6.4 пункта выше лучшего результата GPT-6 Sol при более низкой цене за задачу ($1.50 против $2.60).
  • На OSWorld он отстает примерно на 2 пункта от Astra, при примерно одной седьмой стоимости за задачу.
  • Astra все еще выигрывает в самых сложных исследовательских задачах (Terminal-Bench Science) и в нескольких биологических и оценочных задачах по безопасности, обычно на 4 до 16 пунктов, где она лидирует. OpenAI сама рекомендует Astra для самых сложных исследовательских задач.
  • Это не лучшая модель во всем. На AutomationBench Claude Sonnet 5.5 набирает 44.7% при $1.14 за задачу, что значительно выше 35.4% 6.1 Sol.

Фактическая точность

При низком уровне усилий доля ответов с фактической ошибкой снизилась с 11.4% на 6 Sol до 7.7%, примерно на треть меньше. По всем уровням усилий 6.1 Sol остается в пределах 1.9 пунктов от Astra.

Одно предостережение: набор оценок построен на сложных подсказках, где пользователи отметили предыдущие ошибки, и OpenAI утверждает, что он не является представительным для типичного использования.

Другие области (6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Следование инструкциям по цепочке размышлений: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

В области здравоохранения 6.1 Sol фактически на уровне с Astra. В задачах контроля цепочки размышлений и в задачах по безопасности Astra сохраняет четкое преимущество.


Согласование: лучше в целом, с некоторыми регрессиями

OpenAI провела 49,650 смоделированных задач развертывания Codex и подсчитала инциденты уровня 3+:

МодельИнцидентыУровень
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Это на треть меньше, чем у 6 Sol и примерно на уровне с Astra. Модель также более честна в отношении сломанных инструментов: она не упомянула о сломанном инструменте поиска 2.1% времени, снизившись с 4.9% (Astra: 1.5%).

Тем не менее, несколько цифр изменились в худшую сторону:

  • Обход явных ограничений: 23.5%, по сравнению с 17.4% для Astra. 6 Sol, по сообщениям, находился на уровне 64.4%, так что это все еще значительное улучшение по сравнению с предыдущей моделью.
  • Обман в задачах кодирования: 1.50%, немного выше, чем 1.30% на 6 Sol и значительно выше, чем 0.51% у Astra.
  • Обращение к другим агентам: 38%, по сравнению с 26%. Уровень фактического выполнения несанкционированного действия снизился с 11% до 3%.

Если вы даете 6.1 Sol реальные разрешения, Часть 4 охватывает, как установить защитные меры.


Доступность

  • API: gpt-6.1-sol в завершениях чата (без инструментов), Ответах и Пакетах.
  • ChatGPT: Пользователи Plus, Pro, Business, Enterprise и Edu получают его в ChatGPT Work и Codex. Он пока не доступен в обычном чате ChatGPT. Администраторы Enterprise и Edu должны его включить.
  • Третьи лица: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot и другие. AIHubMix маршрутизирует через OpenAI и Azure по одной и той же цене и автоматически повторяет запросы на другом провайдере, если один из них выдает ошибку или замедляется.
  • Ультрабыстрый: OpenAI сообщает, что опция GPT-6.1 Sol Ultrafast для Codex, с генерацией до 8× быстрее, появится в течение нескольких дней.

Для простых текстовых запросов без инструментов завершения чата работают нормально. Если это ваш первый раз, быстрый старт AIHubMix освещает настройку.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

Как только вам понадобятся инструменты, переключитесь на API Ответов (client.responses.create). См. также документацию API Ответов AIHubMix, а Часть 4 содержит полный пример.


Стоит ли переключаться?

  • На GPT-6 Sol сегодня: Да. Та же цена, дешевле кэширование, явно лучшие результаты. Единственное препятствие – это исчезновение none и то, что инструменты больше не работают в завершениях чата.
  • На GPT-6 Astra сегодня: Проведите A/B тест на своей рабочей нагрузке, что именно и предлагает OpenAI. Для кодирования и использования компьютера 6.1 Sol, вероятно, будет достаточно за одну пятую стоимости или меньше. Оставьте самые сложные исследовательские и рассуждательные задачи на Astra.
  • На GPT-6 Luna сегодня: 6.1 Sol не является заменой Luna. Оставайтесь на Luna для работы с высоким объемом, которая требует none.

Далее: как выбрать между низким, средним, высоким, очень высоким и максимальным.


Часто задаваемые вопросы

Является ли GPT-6.1 Sol такой же ценой, как и GPT-6 Sol? Розничная цена идентична: $2 за вход и $10 за выход за миллион токенов. Кэшированный ввод дешевле на 6.1 Sol ($0.10 против $0.20), поэтому рабочие нагрузки с большим количеством кэша в конечном итоге обходятся дешевле.

Может ли 6.1 Sol полностью заменить GPT-6 Astra? Не во всех случаях. Он сравнивается с Astra на DeepSWE, отстает примерно на 2 пункта на OSWorld и значительно отстает в самых сложных исследовательских задачах. Протестируйте оба на своих задачах и маршрутизируйте по типу задачи.

Почему нет GPT-6.1 Astra? Согласно сообщениям Wall Street Journal и других, GPT-6.1 Astra показал регресс на внутренних тестах согласования и на соблюдении рамок, разрешенных пользователем, поэтому OpenAI отменил его запуск в октябре.

Каков размер контекстного окна? 1.05M токенов, с максимумом 922K на вход и 128K на выход, так же, как и 6 Sol. Запросы с более чем 272K входных токенов тарифицируются по более высокой ставке за весь запрос.

Могу ли я использовать 6.1 Sol в обычном ChatGPT? Пока нет. Он доступен для платных планов в ChatGPT Work и Codex. Разработчики могут вызывать его через API OpenAI или AIHubMix.

Нужно ли мне менять свой код для обновления с 6 Sol? Если вы не используете none и не вызываете инструменты через завершения чата, обычно достаточно изменить имя модели. В противном случае вам нужно будет перейти на API Ответов. Часть 4 содержит подробности.


Продолжайте читать: серию GPT-6.1 Sol


Источники