Claude Haiku 5.5 kosztuje 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, co stanowi jedną dziesiątą ceny Haiku 4.5 wynoszącej 1 USD i 5 USD. To dotyczy zapytań do 100 000 tokenów. Powyżej tej linii całe zapytanie jest rozliczane po 0,50 USD i 2,50 USD, co stanowi połowę ceny Haiku 4.5, a nie jedną dziesiątą.
Anthropic szacuje typowe oszczędności na około 75%, a nie 90%, a różnica wynika z trzech rzeczy, które omawia ten post: gdzie twoje zapytania znajdują się w odniesieniu do linii 100K, ile tokenów myślenia generują domyślne ustawienia oraz nowy tokenizer, który liczy ten sam tekst jako około 30% więcej tokenów. Dwa przykłady poniżej pokazują, jak wygląda rzeczywisty rachunek.
Cennik
Ceny za milion tokenów, z postu uruchamiającego Haiku 5.5 od Anthropic Haiku 5.5 oraz strony z cennikiem:
| Typ tokena | Haiku 5.5, krótki | Haiku 5.5, długi | Haiku 4.5 | Sonet 5.5 |
|---|---|---|---|---|
| Wejście | 0,10 USD | 0,50 USD | 1,00 USD | 2,00 USD |
| Wyjście | 0,50 USD | 2,50 USD | 5,00 USD | 10,00 USD |
| Odczyt z pamięci podręcznej | 0,01 USD | 0,05 USD | 0,10 USD | 0,10 USD |
| Zapis do pamięci podręcznej, 5 min | 0,125 USD | 0,625 USD | 1,25 USD | 2,50 USD |
| Zapis do pamięci podręcznej, 1 godzina | 0,20 USD | 1,00 USD | 2,00 USD | 4,00 USD |
"Krótki" oznacza zapytanie o 100 000 tokenów lub mniej; "długi" oznacza powyżej 100 000. API wsadowe obniża ceny wejścia i wyjścia o 50%. Cena odczytu z pamięci podręcznej Sonetu 5.5 została obniżona z 0,20 USD do 0,10 USD w tym samym dniu.
Strona Haiku 5.5 na AIHubMix wymienia te same dwa poziomy, z wyszukiwaniem w sieci za 0,01 USD za zapytanie.
Zasady rozliczeń, które łatwo przeoczyć
Całe zapytanie zmienia poziom, a nie tylko nadmiar. Anthropic wycenia Haiku 5.5 według dwóch cenników wybranych w zależności od długości zapytania. Zapytanie o 100 000 tokenów płaci 0,0100 USD za wejście; zapytanie o 100 001 tokenów płaci 0,0500 USD, a jego wyjście również kosztuje pięć razy więcej. Haiku 5.5 jest tutaj wyjątkiem: inne aktualne modele 1M kontekstu od Anthropic rozliczają pełne okno według swoich standardowych stawek.
Linia pojawia się wcześniej, niż sugerują twoje stare pulpity nawigacyjne. Haiku 5.5 używa nowszego tokenizera, a ten sam tekst produkuje około 30% więcej tokenów niż w Haiku 4.5. Dzieląc 100 000 przez 1,3, linia znajduje się blisko 77 000 tokenów, jak liczyło je Haiku 4.5. Zapytanie o 78 000 tokenów na twoim starym pulpicie staje się w przybliżeniu 101 000 tokenów w Haiku 5.5 i płaci stawkę długą. Ta arytmetyka pochodzi z 30% w przewodniku migracyjnym Anthropic; dokładny wzrost zależy od treści, więc przeliczenie rzeczywistych zapytań w nowym modelu jest konieczne.
Myślenie jest domyślnie włączone i rozlicza się jako wyjście. Haiku 4.5 myślało tylko na żądanie. Haiku 5.5 działa z adaptacyjnym myśleniem na średnim wysiłku, chyba że to zmienisz, więc trasa, która wcześniej zwracała 200 tokenów wyjściowych, może teraz zwracać kilka setek więcej.
Krótki zapytania mogą teraz być buforowane. Minimalna długość zapytania, które można buforować, spada z 4 096 tokenów w Haiku 4.5 do 512 w Haiku 5.5, zgodnie z przewodnikiem migracyjnym Anthropic. Systemowe zapytanie o 3 000 tokenów, które nigdy nie mogło być buforowane w Haiku 4.5, może być teraz buforowane, a odczyt z pamięci podręcznej kosztuje jedną dziesiątą stawki wejściowej.
Poziom priorytetowy nie jest dostępny. Jeśli masz zobowiązanie na poziomie priorytetowym w Haiku 4.5, nie przenosi się ono do Haiku 5.5. Planuj pojemność osobno.
Tokeny buforowane i linia 100K: zakładaj, że się liczą. Anthropic wymienia osobną cenę odczytu z pamięci podręcznej dla każdego poziomu, co sugeruje, że całe zapytanie, buforowane lub nie, decyduje o poziomie. Anthropic nie wyjaśnił tego dokładnie, więc bezpiecznym założeniem jest, że prefiks buforowany o długości 95K plus pytanie o 6K to długie zapytanie.
Przykład 1: klasyfikator zgłoszeń wsparcia
Założenia, w liczbie tokenów Haiku 4.5: systemowe zapytanie o 3 000 tokenów z definicjami narzędzi, zgłoszenie o 1 000 tokenów, odpowiedź o 200 tokenach i 1 milion zgłoszeń miesięcznie. Haiku 4.5 działa z wyłączonym myśleniem.
W Haiku 5.5 ten sam tekst staje się 3 900 + 1 300 tokenów wejściowych i odpowiedzią o 260 tokenach. Zakłada się, że myślenie dodaje 300 tokenów przy niskim wysiłku i 800 przy średnim. Te liczby dotyczące myślenia są założeniami; zmierz swoje.
| Ustawienie | Na zapytanie | Na miesiąc |
|---|---|---|
| Haiku 4.5 | 0,00500 USD | 5 000 USD |
| Haiku 5.5, niski, bez buforowania | 0,00080 USD | 800 USD |
| Haiku 5.5, niski, buforowany prefiks | 0,00045 USD | 453 USD |
| Haiku 5.5, średni, buforowany prefiks | 0,00070 USD | 703 USD |
| Sonet 5.5, średni, buforowany prefiks | 0,01359 USD | 13 674 USD |
Miesięczne wiersze buforowane obejmują około 4 USD zapisów do pamięci podręcznej dla Haiku 5.5 i około 84 USD dla Sonetu 5.5, zakładając jeden zapis 5-minutowy co pięć minut. Sonet 5.5 używa tych samych założeń dotyczących tokenów co Haiku przy średnim.
Jak dodaje się wiersz buforowany niski: 3 900 buforowanych tokenów po 0,01 USD za milion (0,000039 USD), plus 1 300 świeżych tokenów wejściowych po 0,10 USD (0,00013 USD), plus 560 tokenów wyjściowych po 0,50 USD (0,00028 USD), co daje 0,000449 USD za zapytanie.
Wzór: buforowanie i wysiłek razem przenoszą rachunek z 16% starego kosztu (bez buforowania, niski) do 9% (buforowane, niski). Pozostawienie wysiłku na domyślnym poziomie zamiast niskiego dodaje około 250 USD miesięcznie przy tej objętości. Żaden z wyborów nie ma dużego znaczenia w absolutnych wartościach w porównaniu do 5 000 USD za Haiku 4.5, dlatego przypadek klasyfikatora jest miejscem, gdzie 90% w nagłówku jest rzeczywiste.
Przykład 2: przegląd umowy, który przekracza linię
Założenia, w liczbie tokenów Haiku 4.5: umowa plus instrukcje o 70 000 tokenów, odpowiedź o 1 500 tokenów, bez buforowania. W Haiku 5.5 to staje się 91 000 tokenów wejściowych, odpowiedzią o 1 950 tokenach i zakładanymi 2 000 tokenami myślenia przy średnim, więc 3 950 tokenów wyjściowych.
Teraz zwiększ długość umowy o 14%: 80 000 tokenów w Haiku 4.5, 104 000 w Haiku 5.5.
| Rozmiar umowy (liczba tokenów Haiku 4.5) | Haiku 4.5 | Haiku 5.5 | Zmiana |
|---|---|---|---|
| 70 000 tokenów | 0,0775 USD | 0,0111 USD | 86% mniej |
| 80 000 tokenów | 0,0875 USD | 0,0619 USD | 29% mniej |
Drugi wiersz: 104 000 tokenów wejściowych po 0,50 USD za milion (0,052 USD) plus 3 950 tokenów wyjściowych po 2,50 USD (0,0099 USD). Czternaście procent więcej tekstu kosztuje 5,6 razy więcej w Haiku 5.5.
Rozwiązaniem jest pozostanie poniżej linii. Podzielenie dłuższej umowy na dwa wywołania po około 53 000 tokenów każde (połowa umowy plus instrukcje w każdym) kosztuje około 0,015 USD łącznie po stawce krótkiej, co stanowi mniej niż jedna czwarta pojedynczego długiego wywołania. To, czy podział działa, zależy od zadania; przegląd klauzul dzieli się czysto, pytanie, które wymaga całego dokumentu naraz, nie.
Jak to się ma do kosztów za zadanie
W porównaniu do Sonetu 5.5, Haiku 5.5 kosztuje około dwudziestą część ceny za token w przypadku krótkich zapytań. Ale cena za token to nie cena za zakończone zadanie. W przypadku złożonego kodowania agentowego Sonet 5.5 uzyskuje 70,6% w Terminal-Bench 4.0 w porównaniu do 39,2% Haiku 5.5, w raportowanych wynikach Anthropic, a tańsze zapytanie, które nie powiedzie się i zostanie powtórzone lub wykonane przez większy model, nie jest tańsze. Własna rada Anthropic to porównanie z Sonetem 5.5 przed uruchomieniem Haiku na xhigh lub max. Sonet 5.5 również stał się tańszy w tym samym dniu: jego odczyty z pamięci podręcznej zostały zmniejszone o połowę, co, jak mówi Anthropic, obniża koszty większości prac agentowych o około 20%.
W porównaniu do GPT-6 Luna, ceny za krótkie zapytania są identyczne, w tym odczyty z pamięci podręcznej. Różnica tkwi w zasadzie dotyczącej długich zapytań. Stawka długiego kontekstu Luna zaczyna się powyżej 272 000 tokenów wejściowych i wynosi 0,20 USD / 0,75 USD, podczas gdy Haiku 5.5 zaczyna się powyżej 100 000 i wynosi 0,50 USD / 2,50 USD. Dla obciążenia między 100K a 272K tokenów, Luna jest znacznie tańsza w cenie wyjściowej. Oba modele używają różnych tokenizerów, więc porównuj rzeczywiste rachunki, a nie liczby tokenów.
Figury dotyczące progu 100K i efektu tokenizera zostały również omówione przez Newsletter Roo, którego arytmetyka zgadza się z powyższymi przykładami.
Kroki, które obniżają rachunek
- Liczenie tokenów w nowym modelu i powiadamianie przed 100K. Zapisz pełny rozmiar zapytania dla każdego żądania i powiadamiaj przy około 90 000 tokenów, aby zapytania, które przesuwają się w górę, były przycinane lub dzielone przed zmianą poziomu.
- Buforuj stabilny prefiks. Najpierw zapytanie systemowe i definicje narzędzi, na końcu zmienna treść. Przy minimalnej długości 512, większość produkcyjnych zapytań systemowych teraz kwalifikuje się. Przewodnik po buforowaniu zapytań AIHubMix pokazuje format żądania.
- Ustaw wysiłek wyraźnie. Użyj
niskiegodla tras o dużej objętości i prostych. Domyślnyśrednikosztuje więcej przy każdym żądaniu, niezależnie od tego, czy trasa tego potrzebuje, czy nie. - Ustal max_tokens dla myślenia plus odpowiedzi. Zbyt mały i płacisz za myślenie, które kończy się bez odpowiedzi.
- Grupuj to, co może poczekać. API wsadowe obniża ceny wejścia i wyjścia o połowę.
- Wysyłaj do góry zamiast ponownie próbować w dół. Jeśli typ zadania często nie udaje się w Haiku, wyślij go najpierw do Sonetu 5.5 zamiast płacić za próby Haiku plus zapas.
Wzór logowania dla kroków 1 i 2 przez punkt końcowy Claude native AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
SYSTEM_PROMPT = "Ty triage zgłoszenia wsparcia..." # stabilny, buforowany prefiks
def classify(ticket: str) -> str:
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"},
system=[{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": ticket}],
)
u = r.usage
prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
+ (u.cache_creation_input_tokens or 0))
if prompt_tokens > 90_000:
print(f"ostrzeżenie: zapytanie ma {prompt_tokens} tokenów, blisko linii cenowej 100K")
return next(b.text for b in r.content if b.type == "text")
Jeśli cache_read_input_tokens pozostaje na zerze w powtarzających się wywołaniach, coś w prefiksie zmienia się między żądaniami, na przykład znacznik czasu w zapytaniu systemowym.
FAQ
Ile kosztuje Claude Haiku 5.5?
Dla zapytań do 100 000 tokenów, 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych. Dla dłuższych zapytań, 0,50 USD i 2,50 USD, stosowane do całego żądania. Odczyty z pamięci podręcznej kosztują jedną dziesiątą stawki wejściowej, a API wsadowe obniża ceny wejścia i wyjścia o połowę.
Czy Haiku 5.5 jest naprawdę 90% tańsze niż Haiku 4.5?
Za token, w przypadku krótkich zapytań, tak. Za zadanie, mniej: nowy tokenizer liczy około 30% więcej tokenów dla tego samego tekstu, myślenie jest domyślnie włączone, a długie zapytania otrzymują tylko 50% obniżki. Anthropic szacuje typowe oszczędności na około 75%. Klasyfikator krótkich zapytań z buforowaniem może zaoszczędzić około 90%.
Co się stanie, jeśli moje zapytanie przekroczy 100 000 tokenów?
Całe żądanie przechodzi na wyższy cennik, zarówno wejście, jak i wyjście. W powyższym przykładzie umowy 14% więcej tekstu sprawiło, że zapytanie stało się 5,6 razy droższe.
Czy tokeny buforowane liczą się do progu 100K?
Anthropic nie stwierdził tego wprost. Jego cenniki wymieniają osobne ceny odczytu z pamięci podręcznej dla każdego poziomu, więc bezpiecznym założeniem jest, że całe zapytanie, buforowane lub nie, decyduje o poziomie.
Czy tokeny myślenia kosztują dodatkowo?
Są rozliczane jako tokeny wyjściowe po normalnej stawce wyjściowej. Ponieważ myślenie jest domyślnie włączone przy średnim wysiłku, mogą znacząco zwiększyć trasę, która wcześniej produkowała krótkie odpowiedzi. Obniżenie wysiłku zmniejsza je.
Czy Haiku 5.5 jest tańsze niż GPT-6 Luna?
W przypadku zapytań do 100K tokenów ceny wyjściowe są takie same. Między 100K a 272K tokenów, Luna pozostaje przy swojej podstawowej stawce, podczas gdy Haiku 5.5 przechodzi na wyższą, więc Luna jest tam tańsza w cenie wyjściowej. Tokenizery różnią się, więc porównuj rzeczywiste rachunki.
Czy mogę używać poziomu priorytetowego z Haiku 5.5?
Nie. Poziom priorytetowy nie jest obsługiwany w Haiku 5.5, więc zobowiązania w Haiku 4.5 nie są przenoszone.
Czytaj dalej: seria Claude Haiku 5.5
- Niska cena za token opłaca się tylko wtedy, gdy model potrafi wykonać zadanie. Aby zobaczyć, jak Haiku 5.5 wypada w porównaniu do Haiku 4.5, GPT-6 Luna i Sonetu 5.5, przeczytaj Claude Haiku 5.5 vs Haiku 4.5: Co teraz kupuje dziesięć centów
- Tokeny myślenia były największym założeniem w powyższych przykładach. Aby zobaczyć zmierzone liczby tokenów na każdym poziomie wysiłku, przeczytaj Claude Haiku 5.5 Poziomy wysiłku: Średni jest domyślny, Niski jest często wystarczający
- Zmiana tokenizera i nowa minimalna długość buforowania również pojawiają się jako prace migracyjne. Aby zobaczyć błędy i ciche zmiany, których można się spodziewać przy przejściu z Haiku 4.5 do 5.5, przeczytaj Migracja z Claude Haiku 4.5 do 5.5: Pięć błędów 400 i ciche zmiany
Źródła
- Cennik (Dokumentacja platformy Claude)
- Wprowadzenie Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 na AIHubMix
- Claude Haiku 5.5 jest dostępny za 0,10 USD za milion tokenów. Przeczytaj zasady 100K przed migracją (Newsletter Roo)
- Cennik API GPT-6 Luna (OpenRouter)



