Claude Haiku 5.5 Fiyatlandırması: 90% İndirim Arkasındaki 100K Sınırı

AIHubMix8 dk okuma
Claude Haiku 5.5 Fiyatlandırması: 90% İndirim Arkasındaki 100K Sınırı

Claude Haiku 5.5, milyon başına $0.10 giriş token'ı ve $0.50 çıkış token'ı maliyetine sahiptir; bu, Haiku 4.5'in $1 ve $5'inin onda biri kadardır. Bu, 100,000 token'a kadar olan istemler için geçerlidir. Bu sınırın üzerinde, tüm istek $0.50 ve $2.50 olarak faturalandırılır; bu, Haiku 4.5'in fiyatının yarısıdır, onda biri değil.

Anthropic, tipik tasarrufu %75 civarında, %90 değil olarak belirtiyor ve bu fark, bu yazının ele aldığı üç şeyden kaynaklanıyor: istemlerinizin 100K sınırına göre nerede düştüğü, varsayılan ayarların ne kadar düşünme token'ı ürettiği ve aynı metni yaklaşık %30 daha fazla token olarak sayan yeni bir tokenleştirici. Aşağıdaki iki örnek, gerçek bir faturanın nasıl çıktığını gösteriyor.

Fiyat listesi

Milyon başına fiyatlar, Anthropic'in Haiku 5.5 lansman yazısı ve fiyatlandırma sayfası:

Token türü Haiku 5.5, kısa Haiku 5.5, uzun Haiku 4.5 Sonnet 5.5
Giriş $0.10 $0.50 $1.00 $2.00
Çıkış $0.50 $2.50 $5.00 $10.00
Önbellek okuma $0.01 $0.05 $0.10 $0.10
Önbellek yazma, 5 dk $0.125 $0.625 $1.25 $2.50
Önbellek yazma, 1 saat $0.20 $1.00 $2.00 $4.00

"Kısa" 100,000 token veya daha az bir istemi; "uzun" ise 100,000'den fazlasını ifade eder. Batch API, giriş ve çıkışta %50 indirim uygular. Sonnet 5.5'in ön bellek okuma fiyatı, aynı gün $0.20'den $0.10'a düşürüldü.

AIHubMix'teki Haiku 5.5 sayfası, aynı iki katmanı listeler ve web araması için $0.01 talep eder.

Gözden kaçabilecek faturalandırma kuralları

Tüm istek katmanı değişir, sadece fazlası değil. Anthropic, Haiku 5.5'i istem uzunluğuna göre seçilen iki fiyat listesi ile fiyatlandırır. 100,000 token'lık bir istem, girişi için $0.0100 öder; 100,001 token'lık bir istem $0.0500 öder ve çıkışı da beş katı kadar maliyetlidir. Burada Haiku 5.5 bir istisnadır: Anthropic'in diğer mevcut 1M bağlamlı modelleri, tam pencereyi standart oranlarında faturalandırır.

Sınır, eski panellerinizin önerdiğinden daha erken gelir. Haiku 5.5, daha yeni bir tokenleştirici kullanır ve aynı metin, Haiku 4.5'e göre yaklaşık %30 daha fazla token üretir. 100,000'i 1.3'e bölmek, sınırı Haiku 4.5'in saydığı gibi yaklaşık 77,000 token'a yerleştirir. Eski panelinizde 78,000 token'lık bir istem, Haiku 5.5'te yaklaşık 101,000 token'a dönüşür ve uzun oranı öder. Bu aritmetik, Anthropic'in göç kılavuzundaki %30 rakamından gelmektedir; kesin artış içeriğe bağlıdır, bu nedenle yeni modelde gerçek istemleri yeniden sayın.

Düşünme varsayılan olarak açıktır ve çıkış olarak faturalandırılır. Haiku 4.5 yalnızca istenildiğinde düşünüyordu. Haiku 5.5, varsayılan olarak orta çaba ile adaptif düşünmeyi çalıştırır, bu nedenle daha önce 200 çıkış token'ı döndüren bir yol, şimdi birkaç yüz daha fazla döndürebilir.

Kısa istemler artık ön belleğe alınabilir. Minimum ön belleğe alınabilir istem, Haiku 4.5'te 4,096 token'dan Haiku 5.5'te 512 token'a düşmüştür; bu, Anthropic'in göç kılavuzuna göre. Haiku 4.5'te asla ön belleğe alınamayan 3,000 token'lık bir sistem istemi şimdi ön belleğe alınabilir ve bir ön bellek okuma, giriş oranının onda biri kadardır.

Öncelik Katmanı mevcut değil. Eğer Haiku 4.5'te bir Öncelik Katmanı taahhüdünüz varsa, bu Haiku 5.5'e geçmez. Kapasiteyi ayrı planlayın.

Önbellekli token'lar ve 100K sınırı: bunların sayıldığını varsayın. Anthropic, her katman için ayrı bir ön bellek okuma fiyatı listeler, bu da tüm istemin, ön belleğe alınmış olsun ya da olmasın, katmanı belirlediğini öne sürer. Anthropic bunu açıkça belirtmemiştir, bu nedenle güvenli varsayım, 95K ön bellekli bir ön ek ile 6K'lık bir sorunun uzun bir istem olduğu yönündedir.

Çalışılmış örnek 1: bir destek bileti sınıflandırıcısı

Varsayımlar, Haiku 4.5 token sayılarında: bir araç tanımları ile 3,000 token'lık bir sistem istemi, 1,000 token'lık bir bilet, 200 token'lık bir cevap ve ayda 1 milyon istek. Haiku 4.5, düşünme kapalıyken çalışır.

Haiku 5.5'te aynı metin 3,900 + 1,300 giriş token'ı ve 260 token'lık bir cevap haline gelir. Düşünmenin düşük çaba ile 300 token eklediği ve orta ile 800 token eklediği varsayılmaktadır. Bu düşünme rakamları varsayımlardır; kendi rakamlarınızı ölçün.

Kurulum Her istek başına Aylık
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, düşük, ön bellek yok $0.00080 $800
Haiku 5.5, düşük, ön bellekli ön ek $0.00045 $453
Haiku 5.5, orta, ön bellekli ön ek $0.00070 $703
Sonnet 5.5, orta, ön bellekli ön ek $0.01359 $13,674

Aylık ön bellekli satırlar, Haiku 5.5 için yaklaşık $4 ve Sonnet 5.5 için yaklaşık $84 ön bellek yazma maliyetini içerir; her beş dakikada bir 5 dakikalık bir yazma varsayımıyla. Sonnet 5.5, orta seviyede Haiku ile aynı token varsayımlarını kullanır.

Önbellekli düşük satırın nasıl toplandığı: 3,900 ön bellekli token, milyon başına $0.01 ($0.000039), artı 1,300 yeni giriş token'ı $0.10 ($0.00013), artı 560 çıkış token'ı $0.50 ($0.00028), toplamda $0.000449 her istek için.

Desen: ön bellekleme ve çaba birlikte faturayı eski maliyetin %16'sından (ön bellek yok, düşük) %9'a (ön bellekli, düşük) taşır. Çabayı varsayılan olarak bırakmak, bu hacimde ayda yaklaşık $250 ekler. Hiçbir seçim, Haiku 4.5'in $5,000'ine göre mutlak terimlerde çok önemli değildir; bu nedenle sınıflandırıcı durumu, %90 başlığının gerçek olduğu yerdir.

Çalışılmış örnek 2: sınırı aşan bir sözleşme incelemesi

Varsayımlar, Haiku 4.5 token sayılarında: 70,000 token'lık bir sözleşme artı talimatlar, 1,500 token'lık bir cevap, ön bellek yok. Haiku 5.5'te bu, 91,000 giriş token'ı, 1,950 token'lık bir cevap ve varsayılan olarak orta çaba ile 2,000 düşünme token'ı, dolayısıyla 3,950 çıkış token'ı haline gelir.

Şimdi sözleşmeyi %14 daha uzun yapın: Haiku 4.5'te 80,000 token, Haiku 5.5'te 104,000 token.

Sözleşme boyutu (Haiku 4.5 sayımı) Haiku 4.5 Haiku 5.5 Değişim
70,000 token $0.0775 $0.0111 %86 daha düşük
80,000 token $0.0875 $0.0619 %29 daha düşük

İkinci satır: 104,000 giriş token'ı, milyon başına $0.50 ($0.052) artı 3,950 çıkış token'ı $2.50 ($0.0099). %14 daha fazla metin, Haiku 5.5'te 5.6 kat daha pahalıdır.

Çözüm, sınırın altında kalmaktır. Daha uzun sözleşmeyi, her biri yaklaşık 53,000 token olan iki çağrıya bölmek (sözleşmenin yarısı artı talimatlar her birinde) toplamda yaklaşık $0.015 maliyetle kısa oranla, tek uzun çağrının çeyreğinden daha azına mal olur. Bir bölmenin işe yarayıp yaramadığı, göreve bağlıdır; madde madde inceleme temiz bir şekilde bölünür, tüm belgenin bir kerede gerektiği bir soru ise bölünemez.

Görev başına maliyet açısından nasıl karşılaştırılır

Sonnet 5.5'e karşı, Haiku 5.5, kısa istemlerde token başına fiyatın yaklaşık yirmide biri kadardır. Ancak token başına fiyat, tamamlanmış görev başına fiyat değildir. Karmaşık ajans kodlamasında, Sonnet 5.5, Anthropic'in raporladığı sonuçlarda Terminal-Bench 4.0'da %70.6, Haiku 5.5'te %39.2 puan alır ve başarısız olan ve yeniden denenen veya daha büyük bir model tarafından yeniden yapılan daha ucuz bir istek, daha ucuz değildir. Anthropic'in kendi tavsiyesi, Haiku'yu xhigh veya max ile çalıştırmadan önce Sonnet 5.5'e karşı karşılaştırmaktır. Sonnet 5.5 de aynı gün daha ucuz hale geldi: ön bellek okumaları yarıya indirildi, bu da Anthropic'in çoğu ajans çalışmasında yaklaşık %20'lik bir kesinti sağladığını söylediği bir durumdur.

GPT-6 Luna'ya karşı, kısa istem listeleri fiyatları aynıdır, ön bellek okumaları dahil. Fark, uzun istem kuralındadır. Luna'nın uzun bağlam oranı, 272,000 giriş token'ının üzerinde başlar ve $0.20 / $0.75 iken, Haiku 5.5'in oranı 100,000'in üzerinde başlar ve $0.50 / $2.50'dir. 100K ile 272K token arasında bir iş yükü için, Luna liste fiyatında çok daha ucuzdur. İki model farklı tokenleştiriciler kullanır, bu nedenle ölçülen faturaları karşılaştırın, token sayımlarını değil.

100K eşiği ve tokenleştirici etkisi ile ilgili rakamlar da Roo'nun Bülteni tarafından ele alınmıştır; bu bültenin hesaplamaları yukarıdaki örneklerle örtüşmektedir.

Faturayı düşüren adımlar

  1. Yeni modelde token'ları sayın ve 100K'dan önce uyarın. Her isteğin tam istem boyutunu kaydedin ve yaklaşık 90,000 token civarında uyarın, böylece yukarı doğru kayan istemler kesilir veya bölünmeden önce katman değiştirmeden kalır.
  2. Kararlı ön eki ön belleğe alın. Sistem istemi ve araç tanımları önce, değişken içerik en son. 512 token minimum ile, çoğu üretim sistem istemi artık uygun hale geliyor. AIHubMix'in Claude istem ön belleğe alma kılavuzu, istek formatını gösterir.
  3. Çabayı açıkça ayarlayın. Yüksek hacimli, basit yollar için düşük kullanın. Varsayılan orta her istekte daha pahalıdır, yolun buna ihtiyacı olup olmadığına bakılmaksızın.
  4. Düşünme ve cevap için max_tokens boyutunu ayarlayın. Çok küçük olursa, cevap vermeden sona eren düşünme için ödeme yaparsınız.
  5. Bekleyebilecekleri toplu olarak gönderin. Batch API, giriş ve çıkış oranlarını yarıya indirir.
  6. Yeniden denemek yerine yukarı yönlendirin. Eğer bir görev türü Haiku'da sık sık başarısız oluyorsa, önce Sonnet 5.5'e gönderin, Haiku denemeleri ve bir geri dönüş için ödeme yapmaktansa.

AIHubMix'in Claude yerel uç noktası üzerinden adımlar 1 ve 2 için bir günlük kaydı deseni:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Destek biletlerini sınıflandırıyorsunuz..."  # kararlı, ön belleğe alınabilir ön ek

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"uyarı: istem {prompt_tokens} token'da, 100K fiyat sınırına yakın")
    return next(b.text for b in r.content if b.type == "text")

Eğer cache_read_input_tokens tekrar eden çağrılar arasında sıfır kalıyorsa, sistem istemindeki bir zaman damgası gibi, istekler arasında değişen bir şey vardır.

SSS

Claude Haiku 5.5'in maliyeti nedir?
100,000 token'a kadar olan istemler için, milyon başına $0.10 giriş token'ı ve $0.50 çıkış token'ı. Daha uzun istemler için, $0.50 ve $2.50, tüm isteğe uygulanır. Önbellek okumaları, giriş oranının onda biri kadardır ve Batch API, giriş ve çıkış fiyatlarını yarıya indirir.

Haiku 5.5 gerçekten Haiku 4.5'ten %90 daha mı ucuz?
Token başına, kısa istemlerde evet. Görev başına, daha az: yeni tokenleştirici, aynı metin için yaklaşık %30 daha fazla token sayar, düşünme varsayılan olarak açıktır ve uzun istemler yalnızca %50 kesinti alır. Anthropic, tipik bir tasarrufu yaklaşık %75 olarak tahmin ediyor. Önbellekleme ile kısa bir istem sınıflandırıcısı yaklaşık %90 tasarruf sağlayabilir.

Eğer istemim 100,000 token'ı biraz aşarsa ne olur?
Tüm istek daha yüksek fiyat listesine geçer, giriş ve çıkış dahil. Yukarıdaki sözleşme örneğinde, %14 daha fazla metin, isteği 5.6 kat daha pahalı hale getirdi.

Önbellekli token'lar 100K eşiğine dahil mi?
Anthropic bunu açıkça belirtmemiştir. Fiyatlandırması, her katman için ayrı ön bellek okuma fiyatları listeler, bu nedenle güvenli varsayım, tüm istemin, ön belleğe alınmış olsun ya da olmasın, katmanı belirlediğidir.

Düşünme token'ları ekstra maliyetli mi?
Normal çıkış oranında çıkış token'ı olarak faturalandırılırlar. Düşünme varsayılan olarak orta çaba ile açık olduğundan, daha önce kısa cevaplar üreten bir yola belirgin şekilde ekleyebilirler. Çabayı azaltmak bunları azaltır.

Haiku 5.5, GPT-6 Luna'dan daha mı ucuz?
100K token'a kadar istemlerde liste fiyatları aynıdır. 100K ile 272K token arasında, Luna temel oranında kalırken Haiku 5.5 daha yüksek bir orana geçer, bu nedenle Luna burada liste fiyatında daha ucuzdur. Tokenleştiriciler farklıdır, bu nedenle gerçek faturaları karşılaştırın.

Haiku 5.5 ile Öncelik Katmanı kullanabilir miyim?
Hayır. Öncelik Katmanı, Haiku 5.5'te desteklenmiyor, bu nedenle Haiku 4.5'teki taahhütler geçmez.

Devam edin: Claude Haiku 5.5 serisi

Kaynaklar