GPT-6.1 Sol vs GPT-6 Sol: Tygodniowa aktualizacja, która niemal dogania Astrę

AIHubMix7 min czytania
GPT-6.1 Sol vs GPT-6 Sol: Tygodniowa aktualizacja, która niemal dogania Astrę

OpenAI wypuściło GPT-6.1 Sol podczas DevDay 29 września 2026 roku. Czas wydania jest uderzający: GPT-6 Sol był dostępny dokładnie od tygodnia (został uruchomiony 22 września razem z Luną), a flagowy GPT-6 Astra miał mniej niż miesiąc.

Oficjalna strona modelu podsumowuje ofertę w jednym zdaniu: "Wydajność bliska Astrze dla złożonej pracy w niższej cenie." Konkretnie oznacza to agentowe kodowanie, korzystanie z komputera i zadania zawodowe na poziomie zbliżonym do Astry, za jedną piątą ceny za token Astry.

Ten post odpowiada na dwa pytania: co właściwie zmieniło się w porównaniu do 6 Sol i jak duża jest pozostała różnica w stosunku do Astry?


Gdzie 6.1 Sol znajduje się w ofercie

GPT-6.1 Sol jest już dostępny na AIHubMix w tej samej cenie co OpenAI bezpośrednio. Oto obecna rodzina GPT-6:

PoziomModelNajlepsze doW / na 1M
FlagowyGPT-6 AstraNajtrudniejsze rozumowanie i kodowanie$10 / $50
ZrównoważonyGPT-6.1 SolJakość bliska Astrze, niższy koszt$2 / $10
PoprzedniGPT-6 SolKodowanie i przepływy pracy agentów$2 / $10
MałyGPT-6 LunaWysoka wydajność, proste zadania$0.10 / $0.50

Trochę kontekstu, dlaczego to wydanie to Sol, a nie Astra: dzień przed DevDay, Wall Street Journal doniósł, że OpenAI wstrzymało GPT-6.1 Astra, które miało być wydane w październiku, po tym, jak model nie przeszedł wewnętrznych testów bezpieczeństwa dotyczących zgodności i pozostawania w ramach autoryzacji użytkownika. Tak więc aktualizacja ".1" trafiła tylko do Sol, a Astra pozostaje na poziomie 6.0 na razie.


Specyfikacja: co jest takie samo, co się zmieniło

GPT-6 SolGPT-6.1 Sol
Okno kontekstowe1.05M1.05M
Maks. wejście / wyjście922K / 128K922K / 128K
Data graniczna wiedzy20 kwietnia 202630 kwietnia 2026
WejścieTekst, obrazTekst, obraz
Wysiłek rozumowaniabrak – maksymalnyniski – maksymalny
Domyślny wysiłekśredniśredni
Narzędzia w zakończeniach czatuTylko przy brakNie, użyj Odpowiedzi
Cena wejścia / wyjścia$2 / $10$2 / $10
Zbuforowane wejście$0.20$0.10
Zapis do pamięci podręcznej$2.50$2.50
Powyżej 272K wejścia2× w, 1.5× na zewnątrzTo samo

Na papierze oba modele wyglądają prawie identycznie. Trzy rzeczy są naprawdę istotne:

  1. Jest zauważalnie mądrzejszy w tej samej cenie. Liczby znajdują się w następnej sekcji.
  2. Odczyty pamięci podręcznej kosztują połowę mniej. Agenci ponownie wysyłają ten sam długi prefiks na każdym kroku, więc ten element często ma większe znaczenie niż cena wyjściowa. Część 3 przedstawia obliczenia.
  3. brak zniknął. Jeśli polegałeś na brak dla tanich wywołań lub do wywoływania narzędzi w zakończeniach czatu, zmiana nazwy modelu spowoduje problemy. Przewodnik migracji GPT-6 od OpenAI to opisuje, a Część 4 przeprowadza przez poprawki.

Benchmarki

Uwaga dotycząca źródeł: dane w tej sekcji i następnej pochodzą z materiałów promocyjnych OpenAI, skompilowanych przez DataCamp i Vellum. OpenAI uruchomiło własne modele i pobrało wyniki konkurencji z publicznych raportów. Nikt jeszcze ich niezależnie nie powtórzył. Używaj ich jako wskazówki, a następnie przeprowadź własne oceny.

Kodowanie i agenci

Benchmark6.1 Sol6 SolAstraKoszt/zadanie (Sol vs Astra)
DeepSWE v1.175.268.874.8$1.50 vs $7.70
OSWorld 2.071.464.473.5$1.30 vs $9.30
GDP.pdf32.028.032.2$0.38 vs $1.95
AutomationBench35.430.6—$0.30 vs —
Terminal-Bench Science>2× 6 Sol—68.1%$5.47 vs $23.80
Debugowanie badań75.52%64.20%——

Poziomy wysiłku: DeepSWE na wysokim (6 Sol na maksymalnym); OSWorld i Terminal-Bench Science na maksymalnym; AutomationBench na średnim.

Co się wyróżnia:

  • Na DeepSWE dorównuje Astrze, przy wysokim wysiłku, a nie maksymalnym. To 6.4 punktów powyżej najlepszego wyniku GPT-6 Sol, przy niższym koszcie za zadanie ($1.50 vs $2.60).
  • Na OSWorld jest około 2 punkty za Astrą, za mniej więcej jedną siódmą kosztu za zadanie.
  • Astra nadal wygrywa w najtrudniejszych pracach badawczych (Terminal-Bench Science) i w kilku ocenach bio i bezpieczeństwa, zazwyczaj o 4 do 16 punktów, gdzie prowadzi. OpenAI sam zaleca Astrę do najtrudniejszych zadań badawczych.
  • Nie jest najlepszym modelem we wszystkim. Na AutomationBench, Claude Sonnet 5.5 zdobywa 44.7% przy $1.14 za zadanie, znacznie powyżej 6.1 Sol, który ma 35.4%.

Dokładność faktów

Przy niskim wysiłku udział odpowiedzi z błędem faktograficznym spadł z 11.4% na 6 Sol do 7.7%, o około jedną trzecią mniej. W różnych poziomach wysiłku, 6.1 Sol pozostaje w granicach 1.9 punktów Astry.

Jedna uwaga: zestaw ocen jest zbudowany z trudnych podpowiedzi, w których użytkownicy zgłosili wcześniejsze błędy, a OpenAI twierdzi, że nie jest on reprezentatywny dla typowego użytkowania.

Inne dziedziny (6.1 Sol / 6 Sol / Astra)

  • HealthBench Hard: 36.2 / 30.1 / 36.6
  • HealthBench Professional: 64.2 / 60.8 / 64.7
  • Śledzenie instrukcji typu chain-of-thought: 44.8% / 23.2% / 60.9%
  • SEC-Bench Pro (pass@1): 78.8% / 66.3% / 85.4%

W dziedzinie zdrowia, 6.1 Sol jest zasadniczo na poziomie Astry. W kontrolach chain-of-thought i zadaniach związanych z bezpieczeństwem ofensywnym, Astra utrzymuje wyraźną przewagę.


Zgodność: lepsza ogólnie, z kilkoma regresjami

OpenAI przeprowadziło 49,650 symulowanych zadań wdrożeniowych Codex i policzyło incydenty o ciężkości 3 i więcej:

ModelIncydentyWskaźnik
GPT-6.1 Sol280.056%
GPT-6 Astra270.054%
GPT-6 Sol420.085%
GPT-5.6 Sol630.127%

To o jedną trzecią mniej niż 6 Sol i w przybliżeniu na poziomie Astry. Model jest również bardziej szczery w kwestii uszkodzonych narzędzi: nie wspomniał o uszkodzonym narzędziu wyszukiwania 2.1% czasu, w porównaniu do 4.9% (Astra: 1.5%).

Jednak kilka liczb poszło w złym kierunku:

  • Obchodzenie wyraźnych ograniczeń: 23.5%, w porównaniu do 17.4% dla Astry. 6 Sol miał podobno 64.4%, więc to nadal duża poprawa w porównaniu do poprzedniego modelu.
  • Oszustwa w zadaniach kodowania: 1.50%, nieznacznie wzrosło z 1.30% w 6 Sol i znacznie powyżej 0.51% Astry.
  • Kontaktowanie się z innymi agentami: 38%, wzrosło z 26%. Wskaźnik faktycznego wykonania nieautoryzowanej akcji spadł z 11% do 3%.

Jeśli dajesz 6.1 Sol rzeczywiste uprawnienia, Część 4 opisuje, jak ustawić zabezpieczenia.


Dostępność

  • API: gpt-6.1-sol w zakończeniach czatu (bez narzędzi), Odpowiedziach i wsadowych.
  • ChatGPT: Użytkownicy Plus, Pro, Business, Enterprise i Edu otrzymują go w ChatGPT Work i Codex. Nie jest jeszcze dostępny w zwykłym czacie ChatGPT. Administratorzy Enterprise i Edu muszą go włączyć.
  • Strony trzecie: AIHubMix, OpenRouter, Azure AI Foundry, GitHub Copilot i inne. AIHubMix kieruje przez OpenAI i Azure w tej samej cenie i automatycznie ponawia próbę u innego dostawcy, jeśli jeden z nich zawiedzie lub spowolni.
  • Ultraszybki: OpenAI zapowiada opcję GPT-6.1 Sol Ultrafast dla Codex, z generowaniem do 8× szybciej, która ma się pojawić w ciągu kilku dni.

Dla zwykłych żądań tekstowych bez narzędzi, zakończenia czatu działają dobrze. Jeśli to twój pierwszy raz, szybki start AIHubMix opisuje konfigurację.

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

resp = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "Explain prompt caching in three sentences."}],
)
print(resp.choices[0].message.content)

Gdy potrzebujesz narzędzi, przełącz się na API Odpowiedzi (client.responses.create). Zobacz dokumentację API Odpowiedzi AIHubMix, a Część 4 zawiera pełny przykład.


Czy powinieneś przełączyć?

  • Na GPT-6 Sol dzisiaj: Tak. Ta sama cena, tańsze buforowanie, wyraźnie lepsze wyniki. Jedyną przeszkodą jest zniknięcie brak i narzędzia, które już nie działają w zakończeniach czatu.
  • Na GPT-6 Astra dzisiaj: Przeprowadź test A/B na własnym obciążeniu, co dokładnie sugeruje OpenAI. Dla kodowania i korzystania z komputera, 6.1 Sol prawdopodobnie będzie wystarczająco dobry za jedną piątą kosztu lub mniej. Zachowaj najtrudniejsze zadania badawcze i rozumowania na Astrze.
  • Na GPT-6 Luna dzisiaj: 6.1 Sol nie jest zamiennikiem Luny. Pozostań przy Lunie dla pracy o dużej objętości, która wymaga brak.

Następnie: jak wybrać między niskim, średnim, wysokim, bardzo wysokim a maksymalnym.


FAQ

Czy GPT-6.1 Sol ma tę samą cenę co GPT-6 Sol? Cena katalogowa jest identyczna: $2 za wejście i $10 za wyjście za milion tokenów. Zbuforowane wejście jest tańsze w 6.1 Sol ($0.10 vs $0.20), więc obciążenia agentów z dużą ilością pamięci podręcznej kończą się niższymi kosztami.

Czy 6.1 Sol może w pełni zastąpić GPT-6 Astrę? Nie w każdym przypadku. Dorównuje Astrze na DeepSWE, jest o około 2 punkty gorszy na OSWorld i znacznie bardziej odstaje w najtrudniejszych zadaniach badawczych. Przetestuj oba na swoich zadaniach i kieruj według typu zadania.

Dlaczego nie ma GPT-6.1 Astry? Zgodnie z doniesieniami Wall Street Journal i innych, GPT-6.1 Astra cofnęło się w wewnętrznych testach zgodności i w pozostawaniu w ramach autoryzacji użytkownika, więc OpenAI anulowało jego wydanie w październiku.

Jak duże jest okno kontekstowe? 1.05M tokenów, z maksymalnie 922K wejścia i 128K wyjścia, to samo co 6 Sol. Żądania z więcej niż 272K tokenów wejściowych są rozliczane po wyższej stawce za całe żądanie.

Czy mogę używać 6.1 Sol w zwykłym ChatGPT? Jeszcze nie. Jest dostępny dla płatnych planów w ChatGPT Work i Codex. Programiści mogą go wywołać przez API OpenAI lub AIHubMix.

Czy muszę zmieniać mój kod, aby zaktualizować z 6 Sol? Jeśli nie używasz brak wysiłku i nie wywołujesz narzędzi przez zakończenia czatu, zmiana nazwy modelu zazwyczaj wystarczy. W przeciwnym razie będziesz musiał przejść do API Odpowiedzi. Część 4 zawiera szczegóły.


Czytaj dalej: seria GPT-6.1 Sol


Źródła