GPT-6.1 Sol ma pięć poziomów wysiłku rozumowania: niski, średni (domyślny), wysoki, bardzo wysoki i maksymalny. Duża zmiana w porównaniu do GPT-6 Sol polega na tym, że żaden i minimalny zniknęły, więc niski jest teraz dolnym poziomem.
To jedno ustawienie wpływa zarówno na opóźnienie, jak i koszt. Nigdy nie widzisz tokenów rozumowania, ale płacisz za nie według stawki wyjściowej (10 USD za milion dla 6.1 Sol na AIHubMix), a zajmują one miejsce w oknie kontekstowym. Wybierz niewłaściwy poziom, a możesz łatwo zapłacić kilka razy więcej, niż potrzebujesz.
Co oznacza każdy poziom
Ta tabela łączy opisy OpenAI z przewodnika po rozumowaniu i nasze własne rekomendacje:
| Poziom | Opis OpenAI | Dobre dopasowanie | Słabe dopasowanie |
|---|---|---|---|
| niski | Efektywne rozumowanie z umiarkowanym wzrostem opóźnienia | Kroki pośrednie w pętlach narzędzi, wyszukiwanie, lekkie planowanie, klasyfikacja, ekstrakcja, wsparcie odpowiedzi | Trudne debugowanie, refaktoryzacja wielu plików |
| średni (domyślny) | Zrównoważony domyślny dla większości obciążeń | Codzienne kodowanie, przegląd kodu, pisanie, typowe zadania agenta | Interaktywne użycie krytyczne dla opóźnienia |
| wysoki | Trudne rozumowanie, złożone debugowanie, głębokie planowanie | Trudne błędy, prace architektoniczne, zadania w stylu SWE | Wysoki ruch online QPS |
| bardzo wysoki | Głębokie badania, prace asynchroniczne, długie uruchomienia agenta | Zadania w tle, raporty badawcze | Cokolwiek, co twoje oceny nie uzasadniły |
| maksymalny | Maksymalne rozumowanie dla najtrudniejszych zadań | Użycie komputera, problemy badawcze, offline ciężkie prace | Prawie wszystkie codzienne prośby |
OpenAI nazywa wysiłek "pokładem regulacyjnym, a nie głównym sposobem na odzyskanie jakości." Kiedy wyniki są złe, najpierw sprawdź polecenie, definicje narzędzi i kontekst. Zwiększ wysiłek dopiero po tym.
Co mówią benchmarki o każdym poziomie
To są własne liczby OpenAI, zebrane przez Vellum i DataCamp. Traktuj je jako przewodnik, a nie dogmat.
Dla kodowania, wysoki poziom jest zazwyczaj wystarczający. Na DeepSWE v1.1, 6.1 Sol na wysokim poziomie uzyskuje 75.2, co odpowiada Astra na wysokim poziomie (74.8), za około 1.50 USD za zadanie. Krzywa kosztów osiąga 72% do 75% za między 0.50 a 1.50 USD za zadanie. GPT-6 Sol osiągnął maksymalnie 68.8 za około 2.60 USD.
Przechodzenie powyżej średniego nie zawsze pomaga. Na AutomationBench, 6.1 Sol uzyskuje 35.4% na średnim poziomie i tylko około 36.0% przy wyższym wysiłku. Dla automatyzacji biznesowej, dodatkowe tokeny rozumowania nie przyniosły prawie nic.
Zachowaj maksymalny poziom dla użycia komputera i badań. Na OSWorld 2.0, maksymalny poziom uzyskuje 71.4 za około 1.30 USD za zadanie. Terminal-Bench Science na maksymalnym poziomie kosztuje 5.47 USD za zadanie: znacznie taniej niż 23.80 USD za Astra, ale o rząd wielkości drożej niż większość innych obciążeń.
Niski poziom również się poprawił. Wskaźnik błędów faktograficznych na niskim poziomie spadł z 11.4% na 6 Sol do 7.7%. Jeśli zwiększyłeś zadania do średniego poziomu na 6 Sol, ponieważ niski nie był wystarczająco dokładny, spróbuj ponownie niskiego poziomu.
Punkty startowe według przypadku użycia
| Przypadek użycia | Zacznij od | Uwagi |
|---|---|---|
| Wywołania, które używały poziomu żaden na 6 Sol | niski | Oficjalne mapowanie OpenAI. Jeśli opóźnienie jest krytyczne, rozważ GPT-6 Luna, który nadal obsługuje poziom żaden |
| Wywołania, które używały poziomu minimalny | niski | Zacznij od niskiego i porównaj wyniki |
| Chatboty, wsparcie klienta | niski | Poproś model o jednozdaniowe wprowadzenie, aby szybciej uzyskać pierwszy token |
| RAG Q&A | niski → średni | Jakość wyszukiwania ma większe znaczenie niż wysiłek |
| Asystent kodowania IDE | średni | Domyślny działa |
| Automatyczne naprawianie błędów, agenci SWE | wysoki | DeepSWE pokazuje, że wysoki już odpowiada Astra |
| Użycie komputera, agenci przeglądarki | wysoki → maksymalny | OSWorld osiąga szczyt na maksymalnym poziomie |
| Badania w tle, długie uruchomienia | bardzo wysoki | Tylko wtedy, gdy oceny pokazują zysk. Partia zmniejsza koszt o połowę, jeśli nie potrzebujesz wyników od razu |
| Najtrudniejsze problemy badawcze | maksymalny, lub po prostu użyj Astra | OpenAI zaleca również Astra w tym przypadku |
Mapowania żaden i minimalny pochodzą z przewodnika migracji GPT-6 OpenAI.
Zmiana wysiłku w trakcie rozmowy
Typowym wzorcem jest planowanie na wysokim poziomie, wykonywanie na niskim, a następnie powrót do wysokiego, gdy coś się zepsuje.
Haczyk: edytowanie reasoning.effort w żądaniu łamie pamięć podręczną polecenia. Wysiłek jest częścią pamięci podręcznej prefiksu (zobacz przewodnik po pamięci podręcznej poleceń). W 6.1 Sol odczyt pamięci podręcznej kosztuje 0.10 USD za milion tokenów, podczas gdy przepisanie pamięci podręcznej kosztuje 2.50 USD. To różnica 25×.
Rodzina GPT-6 naprawia to za pomocą elementu wejściowego configuration_update. Nie zmieniaj poziomu reasoning.effort na poziomie żądania i wstaw aktualizację przed następną wiadomością użytkownika. Oto jak to wygląda przez API odpowiedzi AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Tura 1: planuj na wysokim wysiłku
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "wysoki"},
input="Dowiedz się, dlaczego testy w tym repozytorium nie przechodzą i zaproponuj plan naprawy.",
)
# Tura 2: przejdź na niski poziom do wykonania, nie dotykając poziomu wysiłku żądania
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "wysoki"}, # bez zmian, więc pamięć podręczna przetrwa
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "niski"}},
{"role": "user", "content": "Wykonaj krok 1 planu."},
],
)
Formaconfiguration_updatepowyżej jest ilustracyjna. Sprawdź przewodnik po rozumowaniu OpenAI, aby uzyskać dokładny schemat. Dokumentacja odpowiedzi AIHubMix obecnie wymienia cztery poziomy (minimalny do wysokiego), więc wyślij małe testowe żądanie, aby potwierdzić, żebardzo wysoki,maksymalnyiconfiguration_updateprzechodzą.
Niektóre ograniczenia, które warto znać:
- Działa tylko w standardowym trybie jednego agenta i zmienia tylko wysiłek.
- Dwie aktualizacje nie mogą znajdować się obok siebie.
- Nie łączy się z automatycznym kompresowaniem ani skracaniem. Eksplicytne kompresowanie jest w porządku, ale dodaj świeżą aktualizację później.
- Pole
reasoning.effortodpowiedzi nadal pokazuje wartość na poziomie żądania, więc nie czytaj zbyt wiele w to.
Ustawienia, które idą z wysiłkiem
Zostaw miejsce w max_output_tokens. Limit obejmuje tokeny rozumowania. Ustaw go zbyt nisko, a model może zatrzymać się przed wygenerowaniem jakiegokolwiek widocznego tekstu. Otrzymujesz status: incomplete i nadal płacisz za wejście i rozumowanie. OpenAI sugeruje zarezerwowanie co najmniej 25 000 tokenów na początek, a więcej dla poziomów bardzo wysokiego lub maksymalnego.
Śledź tokeny rozumowania. Są w usage.output_tokens_details.reasoning_tokens. Patrzenie na rozkład według poziomu wysiłku jest lepsze niż dostosowywanie na wyczucie.
Włącz podsumowania, jeśli potrzebujesz widoczności. reasoning.summary: "auto" zwraca podsumowanie rozumowania modelu (możesz najpierw zweryfikować swoją organizację). Surowe rozumowanie nigdy nie jest ujawniane.
Tryb pro to osobny przełącznik. Sprawia, że model wykonuje więcej pracy, rozliczany według standardowych stawek, ale z większą liczbą tokenów ogółem. Użyj go do trudnych problemów, gdzie dodatkowe opóźnienie jest akceptowalne.
Proces dostosowywania, który możesz rzeczywiście przeprowadzić
- Pobierz 20 do 50 rzeczywistych zadań do zestawu oceny.
- Uruchom bazowy test na
średnim. Zarejestruj wskaźnik sukcesu, średnią liczbę tokenów rozumowania i opóźnienie P95. - Spróbuj
niski. Jeśli sukces ledwo spada, przełącz się. - Spróbuj
wysoki. Jeśli sukces wyraźnie się poprawia, użyj wysokiego tylko dla tego typu zadań. - Sięgaj po
bardzo wysokilubmaksymalnytylko wtedy, gdy wysoki nie wystarcza, i porównaj z GPT-6 Astra na wysokim poziomie, gdy już tam jesteś. Czasami większy model przewyższa większy wysiłek. Na AIHubMix to tylko zmiana parametrumodel, a lista modeli pokazuje, co jest dostępne. - Routuj według typu zadania zamiast używać jednego globalnego ustawienia.
W skrócie: zacznij od średniego, oszczędzaj pieniądze na niskim, używaj wysokiego do kodowania i spraw, aby bardzo wysoki i maksymalny udowodniły swoją wartość w twoich ocenach.
Następnie: co naprawdę oznacza cena 2 USD / 10 USD, gdy w grę wchodzą pamięć podręczna, długi kontekst i mnożniki rozliczeniowe.
FAQ
Jaki jest domyślny poziom wysiłku rozumowania dla GPT-6.1 Sol? średni. Jeśli go nie ustawisz, to to otrzymasz.
Dlaczego żaden zwraca błąd? 6.1 Sol nie obsługuje żaden ani minimalny. OpenAI zaleca przejście na niski. Jeśli naprawdę potrzebujesz żaden, pozostań przy GPT-6 Sol lub GPT-6 Luna.
Jak są rozliczane tokeny rozumowania? Według stawki wyjściowej (10 USD za milion dla 6.1 Sol) i liczą się do okna kontekstowego. Sprawdź usage.output_tokens_details.reasoning_tokens dla rzeczywistych liczb.
Czy nazwa parametru jest taka sama w Chat Completions i Responses? Nie. Chat Completions używa górnego poziomu reasoning_effort. Responses używa zagnieżdżonego reasoning: {"effort": ...}. Mieszanie ich zwraca Unsupported parameter.
Czy wyższy wysiłek zawsze daje lepsze wyniki? Nie. Na AutomationBench, przechodzenie powyżej średniego tylko przesunęło wynik z 35.4% do około 36.0%, przy wyraźnie wyższych kosztach. Testuj na własnych zadaniach.
Czy mogę zmienić wysiłek w trakcie rozmowy? Tak. Użyj elementu configuration_update i pozostaw poziom reasoning.effort na poziomie żądania niezmienionym, aby pamięć podręczna polecenia pozostała ważna. Nie działa to z automatycznym kompresowaniem ani skracaniem.
Dlaczego otrzymałem status: incomplete bez wyjścia? Najprawdopodobniej max_output_tokens było zbyt niskie i rozumowanie wykorzystało wszystko. OpenAI zaleca zarezerwowanie co najmniej 25 000 tokenów.
Czytaj dalej: seria GPT-6.1 Sol
- Ile wynosi twoja faktura za rozumowanie? Wysiłek to tylko jeden dźwignia. Pamięć podręczna, próg 272K i zniżki na partie kształtują ostateczną liczbę. Zobacz Co naprawdę kosztuje GPT-6.1 Sol: poza ceną 2 USD / 10 USD.
- Kod, który używał
żaden? Przejście naniskito tylko początek. Wywołania narzędzi, parametry próbkowania i ustawienia pamięci podręcznej również wymagają zmian: Migracja do GPT-6.1 Sol: 9 rzeczy, które mogą pójść źle. - Jak dużo lepszy jest 6.1 Sol od 6 Sol i Astra? Specyfikacje i benchmarki obok siebie w GPT-6.1 Sol vs GPT-6 Sol: Tygodniowa aktualizacja, która prawie dogania Astrę.



