Claude Haiku 5.5 vs Haiku 4.5: Co teraz kupuje dziesięć centów

AIHubMix8 min czytania
Claude Haiku 5.5 vs Haiku 4.5: Co teraz kupuje dziesięć centów

Claude Haiku 4.5 uzyskał 0,0% w teście Terminal-Bench 4.0. Claude Haiku 5.5 uzyskuje 39,2%, a kosztuje dziesiątą część ceny za token: 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, w porównaniu do 1 USD i 5 USD za Haiku 4.5.

To jest aktualizacja w jednym zdaniu. Mały model Claude przeszedł od "dobry do klasyfikacji, nie do agentów" do użytecznego subagenta, a jego cena teraz odpowiada cenie OpenAI's GPT-6 Luna co do centa. Anthropic wydał go 7 października 2026 jako Claude Haiku 5.5, identyfikator modelu claude-haiku-5-5, i jest już wymieniony na AIHubMix.

Cena wiąże się z warunkami, a wyniki testów również. Ten post omawia, co się zmieniło, jak blisko Haiku 5.5 jest do Sonnet 5.5, gdzie jest złym wyborem i kto powinien teraz przejść na nowy model.

Co się zmieniło, a co nie

Haiku 4.5 Haiku 5.5
Cena wejścia / wyjścia 1 USD / 5 USD 0,10 USD / 0,50 USD
Okno kontekstowe 200K 1M
Maksymalne wyjście 64K 128K
Myślenie Ręczny budżet, wyłączony domyślnie Adaptacyjny, włączony domyślnie
Poziomy wysiłku Brak Pięć, domyślnie średni
Tokeny dla tego samego tekstu Podstawa Około 30% więcej
Narzędzie do użycia w przeglądarce Nie Tak

Ceny Haiku 5.5 dotyczą zapytań do 100K tokenów; dłuższe zapytania kosztują 0,50 USD / 2,50 USD. Ceny są za milion tokenów.

Co pozostaje bez zmian: opis pracy. Anthropic nadal promuje Haiku do pracy o dużej objętości, wrażliwej na koszty (streszczenia, kompresja, zapytania do baz danych, klasyfikacja) oraz do obowiązków subagenta pod większym modelem. Anthropic twierdzi, że istniejące zapytania Haiku 4.5 powinny działać dobrze bez zmian. Istniejący kod zapytań to inna sprawa: pięć wzorców zapytań, które działały na Haiku 4.5, teraz zwraca błąd 400, jak wymienia przewodnik migracji Anthropic migration guide i post migracyjny w tej serii przechodzi przez to.

Dwie zmiany wpływają na to, jak model działa domyślnie. Myślenie jest teraz włączone, chyba że je wyłączysz, więc zapytanie, które nigdy nie wspominało o myśleniu, może wrócić z blokami thinking jako pierwszymi i wydawać tokeny wyjściowe na nie. A Haiku 5.5 jest pierwszym Haiku z ustawieniem wysiłku, które jest teraz głównym regulatorem między kosztem a jakością.

Jak wypada w porównaniu do Haiku 4.5, Luna i Sonnet 5.5

Dane poniżej pochodzą z materiałów promocyjnych Anthropic i karty systemowej Haiku 5.5, skompilowane przez Kingy.ai. Są to dane zgłoszone przez dostawcę, Anthropic sam przeprowadził testy modeli GPT, a nikt jeszcze nie odtworzył pełnej tabeli niezależnie.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (offline) 72,4% 15,7% 48,9% 83,9%
Ostatni egzamin ludzkości 45,9% 10,2% n/d 56,9%
Terminal-Bench 4.0 39,2% 0,0% 16,4% 70,6%
FrontierCode 1.1 Główne 46,4% n/d 42,4% 52,1%
Chartografia 46,4% 6,4% 29,1% 61,6%

Ostatni egzamin ludzkości i Chartografia są bez narzędzi. Wynik FrontierCode Sonnet 5.5 jest przy xhigh wysiłku.

Trzy odczyty mają większe znaczenie niż jakikolwiek pojedynczy wiersz:

  • W porównaniu do Haiku 4.5, to inna klasa modelu. Oceny pracy wiedzy mniej więcej się podwajają, a wiersze agentowe przechodzą z bliskiego zera do użytecznych. Haiku 4.5 nie mogło ukończyć zadania Terminal-Bench; Haiku 5.5 kończy około dwóch na pięć.
  • W porównaniu do GPT-6 Luna, prowadzi w każdym wspólnym wierszu przy tej samej cenie. Najszersze różnice są w użyciu komputera (72,4% vs 48,9%) i Terminal-Bench (39,2% vs 16,4%).
  • W porównaniu do Sonnet 5.5, różnica zależy od zadania. W FrontierCode, Haiku jest w odległości sześciu punktów. W Terminal-Bench, Sonnet uzyskuje 70,6% w porównaniu do 39,2% Haiku. Sam Anthropic twierdzi, że Sonnet 5.5 i Opus 5.5 pozostają lepszym wyborem do skomplikowanego kodowania agentowego.

Przeczytaj drobny druk przed cytowaniem tych liczb

Wyniki główne były przeprowadzane przy maksymalnym wysiłku, najdroższym ustawieniu. Domyślne ustawienie to średni, a wyniki średnie w karcie systemowej są niższe: 1277 na GDPval-AA zamiast 1620, i 1372 na AA-Briefcase zamiast 1578. Jeśli wdrażasz na domyślnym, porównaj z tymi liczbami, a nie z tabelą uruchomieniową.

Wynik OSWorld również wymaga drugiego spojrzenia. 72,4% to częściowy kredyt, uśredniony przez punkty kontrolne. Udział zadań, w których Haiku 5.5 ukończyło każdy punkt kontrolny, wynosi 37,1% (Luna: 17,1%). Dla agenta przeglądarki, który musi ukończyć całe zadanie, 37,1% to liczba, na którą należy planować.

Co zgłosili wczesni klienci

Post promocyjny Anthropic cytuje kilku klientów, którzy testowali model przed wydaniem. Są to wybrane przez dostawcę, ale wskazują na te same obciążenia:

  • AlphaSense wykonuje około 8 milionów zapytań "Zapytaj w dokumencie" tygodniowo. Na 400 testowych zapytaniach, Haiku 5.5 uzyskało 0,84 w porównaniu do 0,76 Haiku 4.5.
  • Box zauważył wzrost o 11 punktów w porównaniu do Haiku 4.5 przy około połowie opóźnienia.
  • Asana zmierzyła ponad 30% niższe opóźnienie na zadanie i do 2,5 razy szybsze wnioskowanie na obrót agenta, w porównaniu do swojego obecnego modelu.
  • HubSpot uzyskał 92,8% w swoim zestawie CRM, najlepszy wynik, jaki widział z małego modelu.
  • Cognition używa Haiku 5.5 jako "pomocnika" pod Opus 5.5 w Devin Fusion i zgłasza, że para uzyskuje wynik FrontierCode 66,2 przy niższych kosztach i opóźnieniach.

Wzór: krótkie, powtarzające się prace nad dokumentami oraz obowiązki subagenta pod większym modelem.

Gdzie Haiku 5.5 jest złym wyborem

  • Kompleksowe kodowanie agentowe. Terminal-Bench to miejsce, gdzie Sonnet 5.5 wyprzedza najdalej. Jeśli zadanie wymaga wielu kroków, niejasnych wymagań lub długiego łańcucha edycji, zacznij od Sonnet 5.5 lub Opus 5.5.
  • Zapytania powyżej 100K tokenów. Okno 1M jest rzeczywiste, ale cena nie jest stała w całym zakresie. Po 100K tokenów całe zapytanie przechodzi na 0,50 USD / 2,50 USD, a ponieważ nowy tokenizer liczy około 30% więcej tokenów, ta linia znajduje się blisko 77K tokenów, jak liczyło Haiku 4.5. Post dotyczący cen w tej serii przechodzi przez liczby.
  • Prace, które wymagają xhigh lub maksymalnego wysiłku, aby przejść. Wyjście staje się długie i drogie przy najwyższych ustawieniach. Wskazówki Anthropic sugerują porównanie z Sonnet 5.5 przed podjęciem decyzji.
  • Zespoły na Priority Tier. Haiku 5.5 tego nie wspiera, więc zobowiązanie do Priority Tier Haiku 4.5 nie przechodzi.
  • Testy bezpieczeństwa. Środki ochrony cybernetycznej Haiku 5.5 są surowsze niż Haiku 4.5 i blokują testy penetracyjne. Oczekuj powodów zatrzymania refusal w tego rodzaju pracy, bez możliwości przełączenia na inny model po stronie serwera.

Wypróbuj to przez AIHubMix

Ustawienie wysiłku Haiku 5.5 znajduje się w output_config API wiadomości, więc punkt końcowy Claude native na AIHubMix jest najprostszą drogą. Zainstaluj aktualne SDK Anthropic (pip install -U anthropic) i skieruj je na AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # zostaw miejsce na myślenie, nie tylko na odpowiedź
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Skategoryzuj ten bilet jako faktura, błąd lub inne: "
                   "'Zostałem obciążony dwukrotnie za październik.'",
    }],
)

# Bloki myślenia mogą być pierwsze, więc wybierz blok tekstowy według typu.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

Dwie rzeczy do sprawdzenia przy pierwszym uruchomieniu. Przeczytaj response.usage.output_tokens przy low i ponownie przy high na tym samym zapytaniu: jeśli liczby się nie zmieniają, ustawienie wysiłku nie dociera do modelu. I zauważ, że strona modelu AIHubMix obecnie podaje długość kontekstu 200K dla tego modelu, poniżej 1M Anthropic, więc potwierdź limit przed wysłaniem bardzo długich zapytań.

Kto powinien przejść, kto powinien poczekać

Przejdź teraz, jeśli zajmujesz się klasyfikacją, ekstrakcją, trasowaniem, streszczeniami lub pytaniami i odpowiedziami w dokumentach z zapytaniami znacznie poniżej 100K tokenów. Otrzymasz znacznie silniejszy model za ułamek ceny tokenów. Zaplanuj godzinę na zmiany w kodzie zapytań, a następnie przetestuj wysiłek low w porównaniu do medium w swoich własnych ocenach.

Przejdź teraz, jeśli używasz dużego modelu do pracy subagenta, do której jest on zbyt wykwalifikowany: wyciąganie figury z teczki, sprawdzanie pliku, streszczanie wyniku narzędzia. To jest rola, którą podkreślają Anthropic i jego klienci wprowadzający.

Poczekaj na sprint, jeśli twoja integracja używa użycia komputera z narzędziem computer_20250124, prefill lub temperature=0. Każde z nich zwraca 400 na Haiku 5.5, a ich naprawa to praca kodowa, a nie zamiana ciągu modelu.

Zostań tam, gdzie jesteś, jeśli twoje obciążenie to długie zapytanie (regularnie powyżej około 77K tokenów Haiku 4.5), zależy od Priority Tier lub jest skomplikowanym kodowaniem agentowym. Dla ostatniej grupy użyteczne porównanie to Haiku 5.5 w porównaniu do Sonnet 5.5 pod względem kosztu za ukończone zadanie, a nie Haiku 5.5 w porównaniu do Haiku 4.5.

Kiedy będziesz gotowy do porównania, lista modeli AIHubMix umieszcza Haiku 5.5, Sonnet 5.5 i Opus 5.5 za jednym kluczem API, więc ta sama ocena może być przeprowadzona dla wszystkich trzech.

FAQ

Czy Claude Haiku 5.5 jest lepszy od Haiku 4.5 we wszystkim?
Na każdym benchmarku w tabeli uruchomieniowej Anthropic, tak, często z dużą przewagą. Wyjątki są praktyczne, a nie jakościowe: Priority Tier nie jest wspierane, zapytania powyżej 100K tokenów kosztują więcej za token niż stawka za krótkie zapytania, a kilka starych wzorców zapytań teraz zwraca błędy.

Czy Haiku 5.5 jest naprawdę 90% tańsze?
Cena za token jest o 90% niższa dla zapytań do 100K tokenów i o 50% niższa powyżej tego. Ponieważ nowy tokenizer liczy około 30% więcej tokenów dla tego samego tekstu, a myślenie teraz produkuje tokeny wyjściowe, Anthropic szacuje typowe oszczędności na około 75%.

Jak Haiku 5.5 wypada w porównaniu do GPT-6 Luna?
Oba modele kosztują 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych. W zgłoszonych wynikach Anthropic, Haiku 5.5 uzyskuje wyższe wyniki w każdym benchmarku, w którym oba się pojawiają, najbardziej wyraźnie w użyciu komputera i Terminal-Bench. Luna utrzymuje swoją podstawową cenę do dłuższej długości zapytania, więc obciążenia długich zapytań powinny być wyceniane osobno.

Czy Haiku 5.5 może zastąpić Sonnet 5.5 w kodowaniu?
Dla wąskich, dobrze określonych zmian i zadań subagenta, warto to przetestować. Dla skomplikowanego kodowania agentowego wieloetapowego, Sonnet 5.5 uzyskuje znacznie wyższe wyniki w teście Terminal-Bench 4.0 (70,6% vs 39,2%), a Anthropic zaleca Sonnet lub Opus do tej pracy.

Czy wyniki benchmarków są przy domyślnym ustawieniu?
Nie. Wyniki główne były przeprowadzane przy maksymalnym wysiłku. Domyślne ustawienie to średnie, gdzie karta systemowa zgłasza niższe wyniki, na przykład 1277 zamiast 1620 na GDPval-AA.

Czy okno kontekstu 1M oznacza, że mogę wysyłać zapytania 1M-tokenowe tanio?
Możesz je wysyłać, ale wszystko powyżej 100K tokenów jest rozliczane po 0,50 USD za wejście i 2,50 USD za wyjście za milion tokenów dla całego zapytania. Sprawdź również limit kontekstu swojego bramki.

Co muszę zmienić w swoim kodzie, aby przejść?
Minimum: identyfikator modelu, wszelkie ręczne budżety myślenia, wszelkie ustawienia temperatury lub top_p, wszelkie prefill asystenta oraz kod, który odczytuje pierwszy blok treści jako odpowiedź. Post migracyjny w tej serii zawiera pełną listę.

Czytaj dalej: seria Claude Haiku 5.5

Źródła