Claude Haiku 5.5 vs Haiku 4.5: Şimdi On Sent Ne Alır

AIHubMix8 dk okuma
Claude Haiku 5.5 vs Haiku 4.5: Şimdi On Sent Ne Alır

Claude Haiku 4.5, Terminal-Bench 4.0'da %0.0 puan aldı. Claude Haiku 5.5 ise %39.2 puan alıyor ve token başına maliyeti on kat daha az: girdi token'ları için milyon başına 0.10 $ ve çıktı token'ları için milyon başına 0.50 $, Haiku 4.5 için 1 $ ve 5 $'a karşı.

Bu, bir cümledeki yükseltmedir. Küçük Claude modeli "sınıflandırma için yeterli, ajanlar için değil" durumundan kullanılabilir bir alt ajana geçti ve fiyatı artık OpenAI'nin GPT-6 Luna'sıyla aynı seviyeye geldi. Anthropic bunu 7 Ekim 2026'da Claude Haiku 5.5 olarak piyasaya sürdü, model ID'si claude-haiku-5-5 ve şu anda AIHubMix'te listeleniyor.

Fiyat belirli koşullarla birlikte gelir ve benchmark puanları da öyle. Bu yazı, nelerin değiştiğini, Haiku 5.5'in Sonnet 5.5'e ne kadar yakın olduğunu, nerelerde yanlış seçim olduğunu ve kimin şimdi geçiş yapması gerektiğini kapsıyor.

Neler değişti, neler değişmedi

Haiku 4.5 Haiku 5.5
Girdi / çıktı fiyatı 1 $ / 5 $ 0.10 $ / 0.50 $
Bağlam penceresi 200K 1M
Maksimum çıktı 64K 128K
Düşünme Manuel bütçe, varsayılan olarak kapalı Uyarlanabilir, varsayılan olarak açık
Çaba seviyeleri Yok Beş, varsayılan orta
Aynı metin için token'lar Temel Yaklaşık %30 daha fazla
Tarayıcı kullanma aracı Hayır Evet

Haiku 5.5 fiyatları 100K token'a kadar olan istemler için geçerlidir; daha uzun istemler 0.50 $ / 2.50 $ öder. Fiyatlar milyon token başına geçerlidir.

Aynı kalan şey: iş tanımı. Anthropic, Haiku'yu yüksek hacimli, maliyet duyarlı işlerde (özetler, sıkıştırma, veritabanı sorguları, sınıflandırma) ve daha büyük bir model altında alt ajan görevi olarak tanıtmaya devam ediyor. Anthropic, mevcut Haiku 4.5 istemlerinin değişiklik olmadan iyi çalışacağını söylüyor. Mevcut istek kodu ise farklı bir durum: Haiku 4.5'te çalışan beş istek modeli artık 400 hatası döndürüyor, çünkü Anthropic'in göç kılavuzu bunu listeliyor ve bu serideki göç yazısı bunu açıklıyor.

İki değişiklik, modelin varsayılan olarak nasıl davrandığını değiştiriyor. Düşünme artık kapalı değilse açıktır, bu nedenle düşünmeyi hiç belirtmeyen bir istek, önce thinking blokları ile geri dönebilir ve bunlar için çıktı token'ları harcayabilir. Ve Haiku 5.5, maliyet ve kalite arasındaki ana ayar olan bir çaba ayarı olan ilk Haiku'dur.

Haiku 4.5, Luna ve Sonnet 5.5'e karşı nasıl puan alıyor

Aşağıdaki rakamlar, Anthropic'in lansman materyallerinden ve Haiku 5.5 sistem kartından, Kingy.ai tarafından derlenmiştir. Bunlar satıcı tarafından rapor edilen verilerdir (Anthropic, bazı GPT karşılaştırmalarını kendisi gerçekleştirdi, örneğin OSWorld) ve henüz kimse tam tabloyu bağımsız olarak yeniden üretmedi.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (offline) %72.4 %15.7 %48.9 %83.9
İnsanlığın Son Sınavı %45.9 %10.2 n/a %56.9
Terminal-Bench 4.0 %39.2 %0.0 %16.4 %70.6
FrontierCode 1.1 Ana %46.4 n/a %42.4 %52.1
Chartography %46.4 %6.4 %29.1 %61.6

İnsanlığın Son Sınavı ve Chartography araçsızdır. Sonnet 5.5'in FrontierCode puanı xhigh çaba seviyesinde.

Üç okuma, herhangi bir tek satırdan daha önemlidir:

  • Haiku 4.5'e karşı, farklı bir model sınıfıdır. Bilgi işleme puanları yaklaşık iki katına çıkıyor ve ajans satırları neredeyse sıfırdan kullanılabilir hale geliyor. Haiku 4.5, bir Terminal-Bench görevini tamamlayamadı; Haiku 5.5, her beş görevden yaklaşık ikisini tamamlıyor.
  • GPT-6 Luna'ya karşı, her paylaşılan satırda öndedir aynı liste fiyatında. En geniş farklar, bilgisayar kullanımı (72.4% vs 48.9%) ve Terminal-Bench (39.2% vs 16.4%) üzerindedir.
  • Sonnet 5.5'e karşı, fark göreve bağlıdır. FrontierCode'da Haiku altı puan içindedir. Terminal-Bench'te Sonnet, Haiku'nun 39.2%'sine karşı 70.6% puan alır. Anthropic, Sonnet 5.5 ve Opus 5.5'in karmaşık ajans kodlaması için daha iyi bir seçim olmaya devam ettiğini söylüyor.

Bu rakamları alıntılamadan önce küçük yazıyı okuyun

Başlık puanları maksimum çaba ile çalıştırıldı, en pahalı ayar. Varsayılan orta seviyedir ve sistem kartının kendi orta çaba çalışmaları daha düşük sonuçlar verir: GDPval-AA'da 1620 yerine 1277 ve AA-Briefcase'de 1578 yerine 1372. Varsayılan ayarda dağıtım yapıyorsanız, bu rakamlarla karşılaştırın, lansman tablosuyla değil.

OSWorld rakamı da ikinci bir bakış gerektirir. %72.4, kontrol noktaları üzerinden ortalama alınmış kısmi kredidir. Haiku 5.5'in her kontrol noktasını tamamladığı görevlerin oranı %37.1'dir (Luna: %17.1). Tüm işi tamamlaması gereken bir tarayıcı ajansı için, %37.1 planlanacak rakamdır.

Erken müşterilerin raporları

Anthropic'in lansman yazısı, modelin piyasaya sürülmeden önce test eden birkaç müşteriyi alıntılamaktadır. Bunlar satıcı tarafından seçilmiştir, ancak aynı iş yüklerine işaret etmektedir:

  • AlphaSense, haftada yaklaşık 8 milyon "Belgede Sor" çağrısı yapmaktadır. 400 test sorgusunda, Haiku 5.5, Haiku 4.5'in 0.76'sına karşı 0.84 puan aldı.
  • Box, Haiku 4.5'e göre yaklaşık 11 puanlık bir artış gördü ve gecikme süresi yarıdan fazlaydı.
  • Asana, mevcut modeliyle karşılaştırıldığında, görev başına %30'dan fazla daha düşük gecikme ve her ajan dönüşünde 2.5 kat daha hızlı çıkarım ölçtü.
  • HubSpot, CRM paketinde %92.8 puan aldı, bu pakette gördüğü en iyi puandı.
  • Cognition, Haiku 5.5'i Opus 5.5 altında bir "yardımcı" olarak kullanıyor ve bu ikilinin daha düşük maliyet ve gecikme ile 66.2 FrontierCode puanı tuttuğunu bildiriyor.

Desen: belgeler üzerinde kısa, tekrarlanan işler ve daha büyük bir model altında alt ajan görevi.

Haiku 5.5'in yanlış seçim olduğu yerler

  • Karmaşık ajans kodlaması. Terminal-Bench, Sonnet 5.5'in en ileri olduğu yerdir. Bir görev birçok adım, belirsiz gereksinimler veya uzun bir düzenleme zinciri gerektiriyorsa, Sonnet 5.5 veya Opus 5.5 ile başlayın.
  • 100K token'dan fazla istemler. 1M penceresi gerçektir, ancak fiyat bu pencerede düz değildir. 100K token'dan sonra tüm istek 0.50 $ / 2.50 $'ya geçer ve yeni tokenizer, aynı metin için yaklaşık %30 daha fazla token sayar, bu nedenle bu satır, Haiku 4.5'in saydığı gibi yaklaşık 77K token'da oturur. Bu serideki fiyatlandırma yazısı rakamları işler.
  • Geçmek için xhigh veya maksimum gerektiren işler. Çıktı, en üst ayarlarda uzun ve pahalı hale gelir. Anthropic'in kendi rehberi, oraya yerleşmeden önce Sonnet 5.5 ile karşılaştırma yapmanızı önerir.
  • Öncelik Katmanındaki ekipler. Haiku 5.5 bunu desteklemiyor, bu nedenle bir Haiku 4.5 Öncelik Katmanı taahhüdü geçerli değildir.
  • Güvenlik testi. Haiku 5.5'in siber güvenlik önlemleri, Haiku 4.5'ten daha katıdır ve penetrasyon testlerini engeller. Bu tür işler için refusal durdurma nedenleri bekleyin, başka bir modele sunucu tarafında geri dönüş yoktur.

AIHubMix üzerinden deneyin

Haiku 5.5'in çaba ayarı, Mesajlar API'sinin output_config kısmında yer alır, bu nedenle AIHubMix'teki Claude yerel uç noktası en doğrudan yoldur. Güncel bir Anthropic SDK'sını yükleyin (pip install -U anthropic) ve bunu AIHubMix'e yönlendirin:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # sadece cevap için değil, düşünme için de yer bırakın
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Bu bileti fatura, hata veya diğer olarak sınıflandırın: "
                   "'Ekim için iki kez ücretlendim.'",
    }],
)

# Düşünme blokları önce gelebilir, bu nedenle metin bloğunu türüne göre seçin.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

İlk çalışmanızda kontrol etmeniz gereken bir şey: low ve high ayarlarında aynı istemde response.usage.output_tokens'u okuyun: rakamlar hareket etmiyorsa, çaba ayarı modele ulaşmıyor demektir. Haiku 5.5, AIHubMix'te tam 1M bağlam penceresi ile çalışır, bu nedenle uzun istemler olduğu gibi çalışır; sadece 100K fiyat satırını aklınızda bulundurun.

Kim geçiş yapmalı, kim beklemeli

Şimdi geçiş yapın eğer sınıflandırma, çıkarım, yönlendirme, özetleme veya 100K token'ın altında istemlerle belge Q&A yapıyorsanız. Token fiyatının çok daha düşük olduğu çok daha güçlü bir model elde edersiniz. İstek kodu değişiklikleri için bir saat planlayın, ardından kendi değerlendirmelerinizde çaba low ile medium karşılaştırması yapın.

Şimdi geçiş yapın eğer alt ajan çalışması için büyük bir modeli gereksiz yere kullanıyorsanız: bir dosyadan bir rakam çekmek, bir dosyayı kontrol etmek, bir araç sonucunu özetlemek. Bu, Anthropic ve lansman müşterilerinin vurguladığı roldür.

Bir sprint bekleyin eğer entegrasyonunuz computer_20250124 aracı, önceden doldurma veya temperature=0 kullanıyorsa. Bunların her biri Haiku 5.5'te 400 hatası döndürür ve bunları düzeltmek kod çalışması gerektirir, model dizisi değişikliği değil.

Bulunduğunuz yerde kalın eğer iş yükünüz uzun istem (genellikle yaklaşık 77K Haiku 4.5 token'ından fazla), Öncelik Katmanı'na bağımlı veya karmaşık ajans kodlaması gerektiriyorsa. Son grup için, yararlı karşılaştırma, tamamlanan görev başına maliyet açısından Haiku 5.5 ile Sonnet 5.5 arasındadır, Haiku 5.5 ile Haiku 4.5 arasında değil.

Karşılaştırmaya hazır olduğunuzda, AIHubMix model listesi Haiku 5.5, Sonnet 5.5 ve Opus 5.5'i tek bir API anahtarı altında toplar, böylece aynı değerlendirme üçü üzerinde çalışabilir.

SSS

Claude Haiku 5.5, Haiku 4.5'ten her şeyde daha mı iyi?
Anthropic'in lansman tablosundaki her benchmarkta, evet, genellikle geniş bir farkla. İstisnalar pratik olup kalite ile ilgili değildir: Öncelik Katmanı desteklenmiyor, 100K token'dan fazla istemler kısa istem oranından daha pahalıdır ve birkaç eski istek modeli artık hatalar döndürüyor.

Haiku 5.5 gerçekten %90 daha mı ucuz?
Token başına fiyat, 100K token'a kadar %90 daha düşük ve bunun üzerinde %50 daha düşüktür. İstek karışımına göre (Haiku 4.5 isteklerinin yaklaşık %90'ı 100K token'ın altındaydı) ve yeni tokenizer, aynı metin için yaklaşık %30 daha fazla token saydığı için, Anthropic ortalama %75 tasarruf tahmin ediyor. Varsayılan olarak açık olan düşünme, bunun üzerine çıktı token'ları ekler, bu nedenle gerçek faturanızı çaba ayarı da etkiler.

Haiku 5.5, GPT-6 Luna ile nasıl karşılaştırılır?
Her ikisi de milyon başına 0.10 $ girdi token'ı ve 0.50 $ çıktı token'ı fiyatıyla listeleniyor. Anthropic'in rapor edilen sonuçlarında, Haiku 5.5, her iki modelin de göründüğü her benchmarkta daha yüksek puan alıyor, en belirgin olarak bilgisayar kullanımı ve Terminal-Bench'te. Luna, daha uzun bir istem uzunluğuna kadar temel fiyatını koruyor, bu nedenle uzun istem iş yükleri ayrı fiyatlandırılmalıdır.

Haiku 5.5, kodlama için Sonnet 5.5'in yerini alabilir mi?
Dar, iyi tanımlanmış değişiklikler ve alt ajan görevleri için test etmeye değer olabilir. Karmaşık çok adımlı ajans kodlaması için, Sonnet 5.5, Terminal-Bench 4.0'da çok daha yüksek puan alır (%70.6'ya karşı %39.2) ve Anthropic, bu iş için Sonnet veya Opus'u önerir.

Benchmark puanları varsayılan ayarda mı?
Hayır. Başlık puanları maksimum çaba ile çalıştırıldı. Varsayılan orta seviyedir, burada sistem kartı daha düşük sonuçlar bildirir, örneğin GDPval-AA'da 1620 yerine 1277.

1M bağlam penceresi, 1M-token istemleri ucuzca gönderebileceğim anlamına mı geliyor?
Gönderebilirsiniz, ancak 100K token'dan fazlası için tüm istek için milyon başına 0.50 $ girdi ve 2.50 $ çıktı ücreti alınır. AIHubMix de tam 1M penceresini destekler.

Geçiş yapmak için kodumda neyi değiştirmem gerekiyor?
En azından: model ID'si, herhangi bir manuel düşünme bütçesi, herhangi bir sıcaklık veya top_p ayarı, herhangi bir asistan önceden doldurma ve ilk içerik bloğunu cevap olarak okuyan kod. Bu serideki göç yazısı tam listeyi içerir.

Devam edin: Claude Haiku 5.5 serisi

Kaynaklar