Wybór poziomu wysiłku rozumowania dla GPT-6.1 Sol: niski do maksymalnego

AIHubMix6 min czytania
Wybór poziomu wysiłku rozumowania dla GPT-6.1 Sol: niski do maksymalnego

GPT-6.1 Sol ma pięć poziomów wysiłku rozumowania: niski, średni (domyślny), wysoki, bardzo wysoki i maksymalny. Duża zmiana w porównaniu do GPT-6 Sol polega na tym, że żaden i minimalny zniknęły, więc niski jest teraz dolnym poziomem.

To jedno ustawienie wpływa zarówno na opóźnienie, jak i koszt. Nigdy nie widzisz tokenów rozumowania, ale płacisz za nie według stawki wyjściowej (10 USD za milion dla 6.1 Sol na AIHubMix), a zajmują one miejsce w oknie kontekstowym. Wybierz niewłaściwy poziom, a możesz łatwo zapłacić kilka razy więcej, niż potrzebujesz.


Co oznacza każdy poziom

Ta tabela łączy opisy OpenAI z przewodnika po rozumowaniu i nasze własne rekomendacje:

PoziomOpis OpenAIDobre dopasowanieSłabe dopasowanie
niskiEfektywne rozumowanie z umiarkowanym wzrostem opóźnieniaKroki pośrednie w pętlach narzędzi, wyszukiwanie, lekkie planowanie, klasyfikacja, ekstrakcja, wsparcie odpowiedziTrudne debugowanie, refaktoryzacja wielu plików
średni (domyślny)Zrównoważony domyślny dla większości obciążeńCodzienne kodowanie, przegląd kodu, pisanie, typowe zadania agentaInteraktywne użycie krytyczne dla opóźnienia
wysokiTrudne rozumowanie, złożone debugowanie, głębokie planowanieTrudne błędy, prace architektoniczne, zadania w stylu SWEWysoki ruch online QPS
bardzo wysokiGłębokie badania, prace asynchroniczne, długie uruchomienia agentaZadania w tle, raporty badawczeCokolwiek, co twoje oceny nie uzasadniły
maksymalnyMaksymalne rozumowanie dla najtrudniejszych zadańUżycie komputera, problemy badawcze, offline ciężkie pracePrawie wszystkie codzienne prośby

OpenAI nazywa wysiłek "pokładem regulacyjnym, a nie głównym sposobem na odzyskanie jakości." Kiedy wyniki są złe, najpierw sprawdź polecenie, definicje narzędzi i kontekst. Zwiększ wysiłek dopiero po tym.


Co mówią benchmarki o każdym poziomie

To są własne liczby OpenAI, zebrane przez Vellum i DataCamp. Traktuj je jako przewodnik, a nie dogmat.

Dla kodowania, wysoki poziom jest zazwyczaj wystarczający. Na DeepSWE v1.1, 6.1 Sol na wysokim poziomie uzyskuje 75.2, co odpowiada Astra na wysokim poziomie (74.8), za około 1.50 USD za zadanie. Krzywa kosztów osiąga 72% do 75% za między 0.50 a 1.50 USD za zadanie. GPT-6 Sol osiągnął maksymalnie 68.8 za około 2.60 USD.

Przechodzenie powyżej średniego nie zawsze pomaga. Na AutomationBench, 6.1 Sol uzyskuje 35.4% na średnim poziomie i tylko około 36.0% przy wyższym wysiłku. Dla automatyzacji biznesowej, dodatkowe tokeny rozumowania nie przyniosły prawie nic.

Zachowaj maksymalny poziom dla użycia komputera i badań. Na OSWorld 2.0, maksymalny poziom uzyskuje 71.4 za około 1.30 USD za zadanie. Terminal-Bench Science na maksymalnym poziomie kosztuje 5.47 USD za zadanie: znacznie taniej niż 23.80 USD za Astra, ale o rząd wielkości drożej niż większość innych obciążeń.

Niski poziom również się poprawił. Wskaźnik błędów faktograficznych na niskim poziomie spadł z 11.4% na 6 Sol do 7.7%. Jeśli zwiększyłeś zadania do średniego poziomu na 6 Sol, ponieważ niski nie był wystarczająco dokładny, spróbuj ponownie niskiego poziomu.


Punkty startowe według przypadku użycia

Przypadek użyciaZacznij odUwagi
Wywołania, które używały poziomu żaden na 6 SolniskiOficjalne mapowanie OpenAI. Jeśli opóźnienie jest krytyczne, rozważ GPT-6 Luna, który nadal obsługuje poziom żaden
Wywołania, które używały poziomu minimalnyniskiZacznij od niskiego i porównaj wyniki
Chatboty, wsparcie klientaniskiPoproś model o jednozdaniowe wprowadzenie, aby szybciej uzyskać pierwszy token
RAG Q&Aniski → średniJakość wyszukiwania ma większe znaczenie niż wysiłek
Asystent kodowania IDEśredniDomyślny działa
Automatyczne naprawianie błędów, agenci SWEwysokiDeepSWE pokazuje, że wysoki już odpowiada Astra
Użycie komputera, agenci przeglądarkiwysoki → maksymalnyOSWorld osiąga szczyt na maksymalnym poziomie
Badania w tle, długie uruchomieniabardzo wysokiTylko wtedy, gdy oceny pokazują zysk. Partia zmniejsza koszt o połowę, jeśli nie potrzebujesz wyników od razu
Najtrudniejsze problemy badawczemaksymalny, lub po prostu użyj AstraOpenAI zaleca również Astra w tym przypadku

Mapowania żaden i minimalny pochodzą z przewodnika migracji GPT-6 OpenAI.


Zmiana wysiłku w trakcie rozmowy

Typowym wzorcem jest planowanie na wysokim poziomie, wykonywanie na niskim, a następnie powrót do wysokiego, gdy coś się zepsuje.

Haczyk: edytowanie reasoning.effort w żądaniu łamie pamięć podręczną polecenia. Wysiłek jest częścią pamięci podręcznej prefiksu (zobacz przewodnik po pamięci podręcznej poleceń). W 6.1 Sol odczyt pamięci podręcznej kosztuje 0.10 USD za milion tokenów, podczas gdy przepisanie pamięci podręcznej kosztuje 2.50 USD. To różnica 25×.

Rodzina GPT-6 naprawia to za pomocą elementu wejściowego configuration_update. Nie zmieniaj poziomu reasoning.effort na poziomie żądania i wstaw aktualizację przed następną wiadomością użytkownika. Oto jak to wygląda przez API odpowiedzi AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Tura 1: planuj na wysokim wysiłku
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "wysoki"},
    input="Dowiedz się, dlaczego testy w tym repozytorium nie przechodzą i zaproponuj plan naprawy.",
)

# Tura 2: przejdź na niski poziom do wykonania, nie dotykając poziomu wysiłku żądania
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "wysoki"},           # bez zmian, więc pamięć podręczna przetrwa
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "niski"}},
        {"role": "user", "content": "Wykonaj krok 1 planu."},
    ],
)
Forma configuration_update powyżej jest ilustracyjna. Sprawdź przewodnik po rozumowaniu OpenAI, aby uzyskać dokładny schemat. Dokumentacja odpowiedzi AIHubMix obecnie wymienia cztery poziomy (minimalny do wysokiego), więc wyślij małe testowe żądanie, aby potwierdzić, że bardzo wysoki, maksymalny i configuration_update przechodzą.

Niektóre ograniczenia, które warto znać:

  • Działa tylko w standardowym trybie jednego agenta i zmienia tylko wysiłek.
  • Dwie aktualizacje nie mogą znajdować się obok siebie.
  • Nie łączy się z automatycznym kompresowaniem ani skracaniem. Eksplicytne kompresowanie jest w porządku, ale dodaj świeżą aktualizację później.
  • Pole reasoning.effort odpowiedzi nadal pokazuje wartość na poziomie żądania, więc nie czytaj zbyt wiele w to.

Ustawienia, które idą z wysiłkiem

Zostaw miejsce w max_output_tokens. Limit obejmuje tokeny rozumowania. Ustaw go zbyt nisko, a model może zatrzymać się przed wygenerowaniem jakiegokolwiek widocznego tekstu. Otrzymujesz status: incomplete i nadal płacisz za wejście i rozumowanie. OpenAI sugeruje zarezerwowanie co najmniej 25 000 tokenów na początek, a więcej dla poziomów bardzo wysokiego lub maksymalnego.

Śledź tokeny rozumowania. Są w usage.output_tokens_details.reasoning_tokens. Patrzenie na rozkład według poziomu wysiłku jest lepsze niż dostosowywanie na wyczucie.

Włącz podsumowania, jeśli potrzebujesz widoczności. reasoning.summary: "auto" zwraca podsumowanie rozumowania modelu (możesz najpierw zweryfikować swoją organizację). Surowe rozumowanie nigdy nie jest ujawniane.

Tryb pro to osobny przełącznik. Sprawia, że model wykonuje więcej pracy, rozliczany według standardowych stawek, ale z większą liczbą tokenów ogółem. Użyj go do trudnych problemów, gdzie dodatkowe opóźnienie jest akceptowalne.


Proces dostosowywania, który możesz rzeczywiście przeprowadzić

  1. Pobierz 20 do 50 rzeczywistych zadań do zestawu oceny.
  2. Uruchom bazowy test na średnim. Zarejestruj wskaźnik sukcesu, średnią liczbę tokenów rozumowania i opóźnienie P95.
  3. Spróbuj niski. Jeśli sukces ledwo spada, przełącz się.
  4. Spróbuj wysoki. Jeśli sukces wyraźnie się poprawia, użyj wysokiego tylko dla tego typu zadań.
  5. Sięgaj po bardzo wysoki lub maksymalny tylko wtedy, gdy wysoki nie wystarcza, i porównaj z GPT-6 Astra na wysokim poziomie, gdy już tam jesteś. Czasami większy model przewyższa większy wysiłek. Na AIHubMix to tylko zmiana parametru model, a lista modeli pokazuje, co jest dostępne.
  6. Routuj według typu zadania zamiast używać jednego globalnego ustawienia.

W skrócie: zacznij od średniego, oszczędzaj pieniądze na niskim, używaj wysokiego do kodowania i spraw, aby bardzo wysoki i maksymalny udowodniły swoją wartość w twoich ocenach.

Następnie: co naprawdę oznacza cena 2 USD / 10 USD, gdy w grę wchodzą pamięć podręczna, długi kontekst i mnożniki rozliczeniowe.


FAQ

Jaki jest domyślny poziom wysiłku rozumowania dla GPT-6.1 Sol? średni. Jeśli go nie ustawisz, to to otrzymasz.

Dlaczego żaden zwraca błąd? 6.1 Sol nie obsługuje żaden ani minimalny. OpenAI zaleca przejście na niski. Jeśli naprawdę potrzebujesz żaden, pozostań przy GPT-6 Sol lub GPT-6 Luna.

Jak są rozliczane tokeny rozumowania? Według stawki wyjściowej (10 USD za milion dla 6.1 Sol) i liczą się do okna kontekstowego. Sprawdź usage.output_tokens_details.reasoning_tokens dla rzeczywistych liczb.

Czy nazwa parametru jest taka sama w Chat Completions i Responses? Nie. Chat Completions używa górnego poziomu reasoning_effort. Responses używa zagnieżdżonego reasoning: {"effort": ...}. Mieszanie ich zwraca Unsupported parameter.

Czy wyższy wysiłek zawsze daje lepsze wyniki? Nie. Na AutomationBench, przechodzenie powyżej średniego tylko przesunęło wynik z 35.4% do około 36.0%, przy wyraźnie wyższych kosztach. Testuj na własnych zadaniach.

Czy mogę zmienić wysiłek w trakcie rozmowy? Tak. Użyj elementu configuration_update i pozostaw poziom reasoning.effort na poziomie żądania niezmienionym, aby pamięć podręczna polecenia pozostała ważna. Nie działa to z automatycznym kompresowaniem ani skracaniem.

Dlaczego otrzymałem status: incomplete bez wyjścia? Najprawdopodobniej max_output_tokens było zbyt niskie i rozumowanie wykorzystało wszystko. OpenAI zaleca zarezerwowanie co najmniej 25 000 tokenów.


Czytaj dalej: seria GPT-6.1 Sol


Źródła