Claude Haiku 5.5 Poziomy Wysiłku: Średni Jest Domyślny, Niski Często Wystarcza

AIHubMix8 min czytania
Claude Haiku 5.5 Poziomy Wysiłku: Średni Jest Domyślny, Niski Często Wystarcza

Claude Haiku 5.5 to pierwszy Haiku z ustawieniem wysiłku, a to ustawienie ma większy wpływ na wynik niż cokolwiek innego, co kontrolujesz. W niezależnych testach Artificial Analysis, Haiku 5.5 przy maksymalnym wysiłku uzyskało 43 punkty w Indeksie Inteligencji, a przy niskim wysiłku 29. Maksymalny wysiłek wykorzystał również 440 milionów tokenów wyjściowych, aby przejść przez indeks; niski wykorzystał 32 miliony.

Krótko mówiąc: pozostaw większość pracy na domyślnym, medium. Przenieś proste, wysokowolumenowe trasy na low. Podnieś pracę wiedzy i ścisłe przestrzeganie instrukcji do high. Traktuj xhigh i max jako ustawienia, dla których potrzebujesz dowodów, i porównaj je z Sonnet 5.5, zanim podejmiesz decyzję.

Reszta tego wpisu pokazuje, ile kosztuje każdy poziom, gdzie przejście na wyższy poziom przestaje się opłacać i które ustawienia psują się lub stają się drogie, gdy zmieniasz wysiłek.

Czym jest to ustawienie

Claude Haiku 5.5 obsługuje pięć poziomów: low, medium, high, xhigh i max. Domyślnym poziomem jest medium, co jest nietypowe: większość obecnych modeli Claude ma domyślnie ustawiony poziom high, a tylko Haiku 5.5 i Opus 5.5 mają domyślnie jeden poziom niżej. Wysłanie medium jest równoznaczne z pominięciem parametru.

Wysiłek zastępuje budżet myślenia, który używało Haiku 4.5. Żądanie z thinking: {"type": "enabled", "budget_tokens": N} teraz zwraca 400, więc nie ma starej liczby do przeniesienia. Zgodnie z dokumentacją wysiłku Anthropic, ustawiasz to w output_config:

output_config={"effort": "low"}

Trzy fakty ramują wszystko poniżej:

  • Myślenie jest domyślnie włączone. Haiku 5.5 działa w trybie adaptacyjnego myślenia, chyba że powiedziano inaczej. Niższy wysiłek oznacza mniej myślenia, a w przypadku prostych żądań model może całkowicie pominąć myślenie.
  • Tokeny myślenia są tokenami wyjściowymi. Liczą się do max_tokens i są rozliczane według stawki wyjściowej (0,50 USD za milion w przypadku podpowiedzi do 100K tokenów).
  • Prośba o mniej myślenia w podpowiedzi nie działa. W testach Anthropic model nadal myślał, gdy podpowiedź nakazywała mu odpowiedzieć bezpośrednio. Wysiłek jest dźwignią.

Ile kosztuje każdy poziom

Dwa niezależne źródła zmierzyły Haiku 5.5 w różnych poziomach wysiłku. Dane indeksu pochodzą z Artificial Analysis; dane FrontierCode pochodzą z publicznego pliku wynikowego Cognition, skompilowanego przez Kingy.ai. Żadne z nich nie obejmuje twojego obciążenia roboczego, więc traktuj je jako kształt krzywej, a nie jako swoje liczby.

Indeks Inteligencji Artificial Analysis v4.3.2 (dziesięć ocen, od pracy wiedzy po zadania terminalne):

Wysiłek Wynik indeksu Tokeny wyjściowe dla indeksu Koszt za zadanie Czas do pierwszego tokena
low 29 32M 0,02 USD 9,9 s
medium 34 54M 0,05 USD 13,4 s
high 38 97M 0,08 USD 28,0 s
xhigh 41 180M 0,12 USD n/d
max 43 440M 0,21 USD n/d

Artificial Analysis nie opublikowało figury latencji dla xhigh. Jego figura latencji przy maksymalnym wysiłku wyglądała na anomalię, więc została pominięta.

FrontierCode 1.1 Główne, Haiku 5.5 działające w Claude Code:

Wysiłek Wynik złożony Koszt za wdrożenie Tokeny wyjściowe na wdrożenie
low 34,8% 0,06 USD 23 868
medium 41,6% 0,13 USD 36 172
high 41,9% 0,26 USD 55 149
xhigh 45,8% 0,63 USD 100 847
max 46,4% 1,33 USD 181 387

Koszty są zaokrąglone do centa.

Przeczytaj obie tabele razem, a trzy rzeczy rzucają się w oczy.

Przejście z niskiego na średni to najtańszy krok. W indeksie kupuje 5 punktów za około 1,7 razy więcej tokenów wyjściowych. W FrontierCode kupuje 6,8 punktów za około dwa razy wyższy koszt za wdrożenie.

Przejście z średniego na wysokie może być płaskie. W FrontierCode wysokie uzyskało 0,3 punktu więcej niż średnie i kosztowało około dwa razy więcej. W szerszym indeksie wysokie dodało 4 punkty. To, czy twoje obciążenie robocze wygląda jak pierwszy przypadek, czy drugi, dokładnie określa szybka ocena.

Najwyższe dwa poziomy są drogie. Przejście z wysokiego na maksymalne w indeksie powoduje, że tokeny wyjściowe wzrastają około 4,5 razy za 5 punktów. W FrontierCode maksymalne kosztuje około dziesięć razy więcej niż średnie za 4,8 punktu, a krok z xhigh na max mniej więcej podwaja koszt za 0,6 punktu. Własne wskazówki Anthropic mówią to samo w prostszych słowach: używaj xhigh i max tylko tam, gdzie twoje oceny pokazują zysk, i porównaj je z Sonnet 5.5 pod względem wydajności, kosztów i szybkości najpierw.

Jeszcze jeden powód, dla którego domyślny poziom ma znaczenie: benchmarki uruchomieniowe Anthropic były przeprowadzane przy maksymalnym wysiłku. Wyniki na poziomie średnim są niższe (1277 na GDPval-AA zamiast 1620). Jeśli wdrażasz na domyślnym poziomie, to są liczby, z którymi należy porównywać.

Gdzie zacząć, według obciążenia roboczego

Obciążenie robocze Zacznij od Przenieś się, gdy
Klasyfikacja, kierowanie, tagowanie low Etykiety zmieniają się w trudnych przypadkach
Ekstrakcja z krótkich dokumentów low Pola są pomijane lub łączone
Czat i wsparcie na żywo low Zasady są łamane w długich czatach
Podsumowania i kompresja medium Kluczowe szczegóły wypadają
Praca podagentów w ramach większego modelu medium Główny model powtarza pracę
Kodowanie agentowe, wąskie zmiany medium Testy nie udają się przy pierwszej próbie
Praca wiedzy, długie zadania agentów high Oceny pokazują rezerwę

Te punkty startowe są zgodne z zaleceniami Anthropic dla Haiku 5.5; sygnały "przenieś się" to to, na co należy zwracać uwagę w swoich własnych logach.

Jednym wierszem wartym drugiego spojrzenia jest czat. Niski poziom to najszybszy poziom, co pasuje do wsparcia na żywo. Ale Anthropic zaleca high, gdy przestrzeganie instrukcji ma największe znaczenie, na przykład asystent wsparcia, który musi przestrzegać zasad swojego systemu, podczas gdy użytkownik się sprzecza. Przetestuj oba na rozmowach, które w przeszłości poszły źle.

Co psuje się lub staje się drogie, gdy zmienia się wysiłek

Mały max_tokens może zakończyć odpowiedź, zanim się zacznie. Myślenie liczy się do max_tokens. Limit ustawiony na klasyfikację jednowyrazową, powiedzmy 50 tokenów, może zostać całkowicie wykorzystany na myślenie, a odpowiedź kończy się z stop_reason: "max_tokens" i bez tekstu. Podnieś limit, aby zostawić miejsce, lub obniż wysiłek.

Zmiana wysiłku w trakcie rozmowy resetuje pamięć podręczną. Zmiana wartości wysiłku na najwyższym poziomie między żądaniami unieważnia pamięć podręczną podpowiedzi dla wiadomości rozmowy. Jeśli agent potrzebuje jednego trudnego zwrotu na high w trakcie rozmowy na low, Anthropic oferuje zmianę wysiłku na poziomie wiadomości (nagłówek beta mid-conversation-output-config-2026-07-01, API Claude i Google Cloud), która utrzymuje pamięć podręczną. Wymaga to, aby myślenie było włączone. Warto sprawdzić, czy brama przekazuje ten nagłówek beta, zanim na nim polegniesz.

Wyłączenie myślenia ma swoje ograniczenia. thinking: {"type": "disabled"} jest akceptowane na poziomach low, medium i high. Na poziomach xhigh lub max zwraca 400. Przy wyłączonym myśleniu zmiana wysiłku na poziomie wiadomości również zwraca 400, a model może pominąć wywołanie narzędzia, którego potrzebuje, gdy to samo żądanie prosi o wyjście w formacie JSON. Wskazówka Anthropic to utrzymanie myślenia włączonego i użycie niższego poziomu wysiłku zamiast tego.

Niski wysiłek może zakończyć się wcześniej. Przy długim systemowym podpowiedzi kodującego agenta na poziomie low, Haiku 5.5 czasami kończy przed zakończeniem pracy i zwraca zadanie. W testach Anthropic przejście z low na medium mniej więcej o połowę zmniejszyło wcześniejsze zakończenia i więcej niż podwoiło tokeny wyjściowe na próbę. Przewodnik po podpowiedziach Haiku 5.5 zawiera krótką instrukcję "kontynuuj pracę, aż skończysz", która rozwiązuje ten sam problem po niższej cenie.

Niski i średni mogą pominąć weryfikację. W zadaniach kodowania model czasami zgłasza zmianę jako zakończoną bez przeprowadzenia testu. Przewodnik po podpowiedziach zawiera akapit dotyczący weryfikacji; kosztuje tokeny, ale zwiększa udział sprawdzonych zmian.

Xhigh może zwrócić pustą odpowiedź. W czatach wieloturnych na poziomie xhigh model czasami pisze całą swoją odpowiedź w myśleniu i kończy turę bez widocznego tekstu. Jeśli działasz na xhigh, sprawdź, czy nie ma pustych bloków tekstowych.

Wymuszenie narzędzia pomija myślenie. Haiku 5.5 akceptuje wymuszone tool_choice, ale odpowiedź zaczyna się wtedy od wywołania narzędzia i bez myślenia. Jeśli model musi rozumować przed wywołaniem narzędzia, użyj auto i powiedz w podpowiedzi, kiedy je wywołać.

Przeprowadź własne badanie wysiłku przez AIHubMix

Najłatwiejszym sposobem wyboru jest uruchomienie tych samych 20 do 50 rzeczywistych podpowiedzi na dwóch lub trzech poziomach i porównanie jakości, tokenów wyjściowych i latencji. Przez punkt końcowy AIHubMix Claude native, z ustawionym AIHUBMIX_API_KEY:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Podsumuj ten bilet wsparcia w jednym zdaniu: ...",
    "Wyodrębnij numer faktury i całkowitą kwotę z: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Zapisz `text` obok podpowiedzi i oceniaj go według własnych kryteriów.
    print(f"{effort}: {out_tokens} tokenów wyjściowych, {seconds:.1f}s łącznie")

Jeśli liczba tokenów wyjściowych ledwo zmienia się między low a high, ustawienie prawdopodobnie nie dociera do modelu; sprawdź żądanie, które twoja brama przekazuje. Na stronie Haiku 5.5 na AIHubMix cena za token jest taka sama na każdym poziomie wysiłku, więc liczba tokenów z tego badania przelicza się bezpośrednio na dolary.

FAQ

Jaki jest domyślny poziom wysiłku dla Claude Haiku 5.5?
Średni. Większość obecnych modeli Claude ma domyślnie ustawiony poziom wysoki, więc kod, który polegał na domyślnym ustawieniu dla innego modelu, uruchomi Haiku 5.5 na poziomie niższym, chyba że wyraźnie ustawi wysiłek.

Czy mogę całkowicie wyłączyć myślenie?
Na niskim, średnim i wysokim poziomie, tak, ustawiając myślenie na wyłączone. Na poziomach xhigh i max zwraca to błąd. Anthropic zaleca obniżenie wysiłku zamiast tego, ponieważ model może samodzielnie pominąć myślenie w prostych żądaniach i zachowuje swoje zachowanie wywoływania narzędzi.

Który poziom wysiłku jest najtańszy?
Niski. W testach Artificial Analysis wykorzystał około 32 milionów tokenów wyjściowych dla całego indeksu w porównaniu do 54 milionów na poziomie średnim i 440 milionów na poziomie maksymalnym. Cena za token jest taka sama na każdym poziomie; różnica polega na tym, ile tokenów zostaje wygenerowanych.

Czy maksymalny wysiłek jest wart tego w Haiku 5.5?
Tylko z dowodami z własnych ocen. W FrontierCode maksymalne kosztowało około dziesięć razy więcej niż średnie za zysk 4,8 punktu. W tym momencie Anthropic sugeruje porównanie z Sonnet 5.5, który może osiągnąć tę samą jakość za mniej.

Dlaczego moje odpowiedzi kończą się bez tekstu?
Zwykle dlatego, że myślenie wykorzystało max_tokens przed rozpoczęciem odpowiedzi. Podnieś max_tokens lub obniż wysiłek. Na poziomie xhigh w czatach wieloturnych pusta odpowiedź może również oznaczać, że model umieścił swoją odpowiedź wewnątrz myślenia.

Czy zmiana wysiłku wpływa na pamięć podręczną podpowiedzi?
Tak. Zmiana wysiłku na najwyższym poziomie między żądaniami unieważnia pamięć podręczną wiadomości dla tej rozmowy. Zmiana wysiłku na poziomie wiadomości, obecnie w wersji beta, unika tego.

Dlaczego benchmarki uruchomieniowe nie pasują do tego, co widzę na domyślnym poziomie?
Dane uruchomieniowe były przeprowadzane przy maksymalnym wysiłku. Na poziomie średnim karta systemowa zgłasza niższe wyniki, na przykład 1277 zamiast 1620 na GDPval-AA.

Czytaj dalej: seria Claude Haiku 5.5

Źródła