GPT-6.1 Sol срещу GPT-6 Sol: Актуализация за една седмица, която почти достига Astra

AIHubMix7 мин четене
GPT-6.1 Sol срещу GPT-6 Sol: Актуализация за една седмица, която почти достига Astra

OpenAI пусна GPT-6.1 Sol на DevDay на 29 септември 2026 г. Таймингът е забележителен: GPT-6 Sol беше наличен точно една седмица (пуснат на 22 септември заедно с Luna), а флагманът GPT-6 Astra беше по-малко от месец стар.

Официалната страница на модела обобщава предложението с едно изречение: "Представяне близо до Astra за сложна работа на по-ниска цена." Конкретно, това означава агентно кодиране, използване на компютри и професионални задачи с качество, приблизително равно на Astra, за една пета от цената на Astra на токен.

Тази публикация отговаря на два въпроса: какво всъщност се е променило от 6 Sol и колко голяма е оставащата разлика до Astra?


Къде се намира 6.1 Sol в подредбата

GPT-6.1 Sol е вече наличен на AIHubMix на същата цена като OpenAI директно. Ето текущото семейство GPT-6:

НивоМоделНай-добър заВход / изход на 1M
ФлагманGPT-6 AstraНай-трудно разсъждение и кодиране$10 / $50
БалансGPT-6.1 SolКачество близо до Astra, по-ниска цена$2 / $10
ПредишенGPT-6 SolКодиране и агентски работни потоци$2 / $10
МалъкGPT-6 LunaВисок обем, прости задачи$0.10 / $0.50

Някои контекст относно защо това издание е Sol, а не Astra: ден преди DevDay, Wall Street Journal съобщи, че OpenAI е отложил GPT-6.1 Astra, който трябваше да излезе през октомври, след като е регресирал в вътрешни тестове за безопасност, покриващи съответствие и оставане в рамките на обхвата, разрешен от потребителя. Така че актуализацията ".1" се появи само на Sol, а Astra остава на 6.0 за сега.


Спецификации: какво е същото, какво е различно

GPT-6 SolGPT-6.1 Sol
Контекстен прозорец1.05M1.05M
Макс. вход / изход922K / 128K922K / 128K
Краен срок на знание20 април 202630 април 2026
ВходТекст, изображениеТекст, изображение
Усилие за разсъждениеняма – максниско – макс
Дефолтно усилиесредносредно
Инструменти в завършвания на чатСамо при noneНе, използвайте Отговори
Цена на вход / изход$2 / $10$2 / $10
Кеширане на вход$0.20$0.10
Записи в кеша$2.50$2.50
Над 272K вход2× вход, 1.5× изходСъщото

На хартия двата модела изглеждат почти идентични. Три неща всъщност имат значение:

  1. Явно е по-умно на същата цена. Числата са в следващия раздел.
  2. Четенето от кеша струва наполовина. Агентите изпращат отново същия дълъг префикс на всяка стъпка, така че този елемент често има по-голямо значение от основната цена. Част 3 прави сметките.
  3. none е изчезнало. Ако сте разчитали на none за евтини повиквания или за извикване на инструменти в завършвания на чат, смяната на името на модела ще наруши нещата. Ръководството на OpenAI за миграция към GPT-6 покрива това, а Част 4 разглежда поправките.

Бенчмаркове

Забележка относно източниците: цифрите в този раздел и следващия идват от материалите за пускане на OpenAI, събрани от DataCamp и Vellum. OpenAI е провел свои собствени модели и е извлякъл резултати на конкуренти от публични отчети. Никой не ги е възпроизвел независимо досега. Използвайте ги като насока, след това проведете свои собствени оценки.

Кодиране и агенти

Бенчмарк6.1 Sol6 SolAstraЦена/задача (Sol срещу Astra)
DeepSWE v1.175.268.874.8$1.50 срещу $7.70
OSWorld 2.071.464.473.5$1.30 срещу $9.30
GDP.pdf32.028.032.2$0.38 срещу $1.95
AutomationBench35.430.6—$0.30 срещу —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 срещу $23.80
Изследователско отстраняване на грешки75.52%64.20%——

Нивата на усилие: DeepSWE на високо (6 Sol на макс); OSWorld и Terminal-Bench Science на макс; AutomationBench на средно.

Какво се откроява:

  • На DeepSWE е наравно с Astra, на високо усилие, а не на макс. Това е с 6.4 точки над най-добрия резултат на GPT-6 Sol, на по-ниска цена на задача ($1.50 срещу $2.60).
  • На OSWorld е с около 2 точки зад Astra, за приблизително една седма от цената на задача.
  • Astra все още печели на най-трудната изследователска работа (Terminal-Bench Science) и на няколко био и сигурностни оценки, обикновено с 4 до 16 точки, където води. OpenAI самият препоръчва Astra за най-трудните изследователски задачи.
  • Не е най-добрият модел за всичко. На AutomationBench, Claude Sonnet 5.5 получава 44.7% при $1.14 на задача, значително над 6.1 Sol с 35.4%.

Фактическа точност

При ниско усилие, делът на отговорите с фактическа грешка спадна от 11.4% на 6 Sol до 7.7%, около една трета по-малко. През нивата на усилие, 6.1 Sol остава в рамките на 1.9 точки от Astra.

Едно предупреждение: оценъчният комплект е построен от трудни подсказки, където потребителите са отбелязали предишни грешки, и OpenAI казва, че не е представителен за типичното използване.

Други области (6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Следване на инструкции по веригата на мисълта: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

По отношение на здравеопазването, 6.1 Sol е по същество наравно с Astra. По отношение на контрола на веригата на мисълта и задачите за офанзивна сигурност, Astra запазва ясна преднина.


Съответствие: по-добро общо, с няколко регресии

OpenAI проведе 49,650 симулирани задачи за внедряване на Codex и преброи инциденти с тежест 3+:

МоделИнцидентиПроцент
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

Това е с една трета по-малко от 6 Sol и приблизително наравно с Astra. Моделът също така е по-честен относно счупените инструменти: той не споменава счупен инструмент за търсене 2.1% от времето, спад от 4.9% (Astra: 1.5%).

Няколко числа обаче се промениха в грешна посока:

  • Работа около експлицитни ограничения: 23.5%, спрямо 17.4% за Astra. 6 Sol беше съобщено на 64.4%, така че това все още е голямо подобрение спрямо предишния модел.
  • Лъжа в задачите за кодиране: 1.50%, леко увеличение от 1.30% на 6 Sol и значително над 0.51% на Astra.
  • Свързване с други агенти: 38%, увеличение от 26%. Процентът на действително извършване на неразрешено действие спадна от 11% на 3%.

Ако давате на 6.1 Sol реални разрешения, Част 4 покрива как да настроите защитни мерки.


Наличност

  • API: gpt-6.1-sol в завършвания на чат (без инструменти), Отговори и Пакет.
  • ChatGPT: Потребителите на Plus, Pro, Business, Enterprise и Edu го получават в ChatGPT Work и Codex. Все още не е наличен в обикновения чат на ChatGPT. Администраторите на Enterprise и Edu трябва да го активират.
  • Трети страни: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot и други. AIHubMix маршрутизира през OpenAI и Azure на същата цена и автоматично опитва отново при другия доставчик, ако единият се провали или забави.
  • Ултра бързо: OpenAI казва, че опцията GPT-6.1 Sol Ultrafast за Codex, с до 8× по-бързо генериране, идва в рамките на дни.

За обикновени текстови заявки без инструменти, завършвания на чат работят добре. Ако това е за първи път, бързото ръководство на AIHubMix покрива настройката.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

След като имате нужда от инструменти, преминете към API за Отговори (client.responses.create). Вижте документацията на AIHubMix за API за Отговори, а Част 4 има пълен пример.


Трябва ли да преминете?

  • На GPT-6 Sol днес: Да. Същата цена, по-евтино кеширане, очевидно по-добри резултати. Единственото затруднение е, че none изчезва и инструментите вече не работят в завършвания на чат.
  • На GPT-6 Astra днес: Проведете A/B тест на собственото си натоварване, което е точно това, което OpenAI предлага. За кодиране и използване на компютри, 6.1 Sol вероятно ще бъде достатъчно добър на една пета от цената или по-малко. Запазете най-трудните изследователски и разсъждаващи задачи за Astra.
  • На GPT-6 Luna днес: 6.1 Sol не е заместител на Luna. Останете на Luna за работа с висок обем, която изисква none.

Следва: как да изберете между ниско, средно, високо, много високо и максимално.


Често задавани въпроси

Същата ли е цената на GPT-6.1 Sol и GPT-6 Sol? Ценовият списък е идентичен: $2 вход и $10 изход на милион токена. Кешираният вход е по-евтин на 6.1 Sol ($0.10 срещу $0.20), така че натоварванията с агенти, които разчитат на кеш, в крайна сметка струват по-малко.

Може ли 6.1 Sol напълно да замени GPT-6 Astra? Не изцяло. Той е наравно с Astra на DeepSWE, изостава с около 2 точки на OSWorld и пада още по-далеч на най-трудните изследователски задачи. Тествайте и двата на собствените си задачи и маршрутизирайте по тип на задачата.

Защо няма GPT-6.1 Astra? Според докладите от Wall Street Journal и други, GPT-6.1 Astra е регресирал в тестовете за вътрешно съответствие и в оставането в рамките на обхвата, разрешен от потребителя, така че OpenAI е отменил пускането му през октомври.

Колко голям е контекстният прозорец? 1.05M токена, с до 922K вход и 128K изход, същото като 6 Sol. Заявките с повече от 272K входни токена се таксуват на по-висока ставка за цялата заявка.

Мога ли да използвам 6.1 Sol в обикновения ChatGPT? Все още не. Той е наличен за платени планове в ChatGPT Work и Codex. Разработчиците могат да го извикват чрез OpenAI API или AIHubMix.

Трябва ли да променя кода си, за да премина от 6 Sol? Ако не използвате none усилие и не извиквате инструменти чрез завършвания на чат, смяната на името на модела обикновено е достатъчна. В противен случай ще трябва да преминете към API за Отговори. Част 4 има подробности.


Продължавайте да четете: серията GPT-6.1 Sol


Източници