Claude Haiku 5.5 Çaba Seviyeleri: Varsayılan Orta, Düşük Genellikle Yeterli

AIHubMix7 dk okuma
Claude Haiku 5.5 Çaba Seviyeleri: Varsayılan Orta, Düşük Genellikle Yeterli

Claude Haiku 5.5, bir çaba ayarına sahip olan ilk Haiku'dur ve bu ayar, kontrol ettiğiniz diğer her şeyden daha fazla etki eder. Artificial Analysis'ın bağımsız çalışmaları sonucunda, Haiku 5.5 maksimum çaba ile Zeka Endeksi'nde 43 puan alırken, düşük çaba ile 29 puan aldı. Maksimum çaba, endeksi geçmek için 440 milyon çıktı token'ı kullanırken; düşük çaba 32 milyon kullandı.

Kısa cevap: çoğu işi varsayılan olan medium seviyede bırakın. Yüksek hacimli, basit yolları low seviyeye düşürün. Bilgi işlerini ve sıkı talimat takibini high seviyeye artırın. xhigh ve max ayarlarını kanıt gerektiren ayarlar olarak değerlendirin ve taahhütte bulunmadan önce bunları Sonnet 5.5 ile karşılaştırın.

Bu yazının geri kalanı, her seviyenin maliyetini, yukarı çıkmanın ne zaman kârlı olmadığını ve çabayı değiştirdiğinizde hangi ayarların bozulduğunu veya pahalı hale geldiğini gösterir.

Ayar nedir

Claude Haiku 5.5, low, medium, high, xhigh ve max olmak üzere beş seviyeyi destekler. Varsayılan seviye medium'dir, bu da alışılmadık bir durumdur: mevcut Claude modellerinin çoğu varsayılan olarak high seviyesindedir ve yalnızca Haiku 5.5 ve Opus 5.5 bir seviye daha düşük varsayılan ayara sahiptir. medium göndermek, parametreyi dışarıda bırakmakla aynıdır.

Çaba, Haiku 4.5'in kullandığı manuel düşünme bütçesinin yerini alır. thinking: {"type": "enabled", "budget_tokens": N} ile yapılan bir istek artık 400 döner, bu nedenle eski bir sayı taşınmaz. Anthropic'in çaba belgelerine göre, bunu output_config içinde ayarlarsınız:

output_config={"effort": "low"}

Aşağıdaki her şeyi çerçeveleyen üç gerçek:

  • Düşünme varsayılan olarak açıktır. Haiku 5.5, aksi belirtilmedikçe uyumlu düşünme yapar. Daha düşük çaba, daha az düşünme anlamına gelir ve basit taleplerde model tamamen düşünmeyi atlayabilir.
  • Düşünme token'ları çıktı token'larıdır. Bunlar max_tokens sayısına dahil edilir ve çıktı oranında faturalandırılır (100K token'a kadar olan istemlerde $0.50 milyon başına).
  • İstemde daha az düşünme istemek işe yaramaz. Anthropic'in testlerinde, model, istem doğrudan yanıt vermesini söylediğinde bile düşünmeye devam etti. Çaba, kolu hareket ettiren unsurdur.

Her seviyenin maliyeti nedir

İki bağımsız kaynak, Haiku 5.5'i çaba seviyeleri boyunca ölçtü. Endeks verileri Artificial Analysis'dan gelir; FrontierCode verileri ise Cognition'ın kamuya açık sonuç dosyasından, Kingy.ai tarafından derlenmiştir. Hiçbiri iş yükünüzü kapsamaz, bu nedenle bunları eğrinin şekli olarak değerlendirin, kendi sayılarınız olarak değil.

Artificial Analysis Zeka Endeksi v4.3.2 (bilgi işlerinden terminal görevlere kadar on değerlendirme):

Çaba Endeks puanı Endeks için çıktı token'ları Görev başına maliyet İlk token için süre
düşük 29 32M $0.02 9.9 s
orta 34 54M $0.05 13.4 s
yüksek 38 97M $0.08 28.0 s
maksimum 43 440M $0.21 n/a

Artificial Analysis, bir xhigh çalışması yayınlamadı. Maksimum çaba gecikme verisi anormal göründüğü için dışarıda bırakılmıştır.

FrontierCode 1.1 Ana, Haiku 5.5 Claude Kodunda çalışıyor:

Çaba Bileşik puan Rollout başına maliyet Rollout başına çıktı token'ları
düşük 34.8% $0.06 23,868
orta 41.6% $0.13 36,172
yüksek 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
maksimum 46.4% $1.33 181,387

Maliyetler cent'e yuvarlanmıştır.

İki tabloyu birlikte okuyun ve üç şey öne çıkıyor.

Düşükten orta seviyeye çıkmak en ucuz adımdır. Endekste, yaklaşık 1.7 kat çıktı token'ı karşılığında 5 puan satın alır. FrontierCode'da, yaklaşık iki kat maliyetle 6.8 puan satın alır.

Orta seviyeden yüksek seviyeye geçiş düz olabilir. FrontierCode'da, yüksek, ortanın 0.3 puan üstünde puan almış ve yaklaşık iki kat maliyetle gelmiştir. Daha geniş endekste, yüksek 4 puan eklemiştir. İş yükünüzün ilk duruma mı yoksa ikinci duruma mı benzediği, tam olarak hızlı bir değerlendirme ile belirlenir.

En üst iki seviye pahalıdır. Endekste yüksekten maksimuma geçişte, çıktı token'ları yaklaşık 4.5 kat artar ve 5 puan alırsınız. FrontierCode'da, maksimum, ortanın maliyetinin yaklaşık on katı kadar ve 4.8 puan için maliyetlidir ve xhigh'dan maksimuma geçişte maliyet yaklaşık iki katına çıkar ve 0.6 puan alırsınız. Anthropic'in kendi rehberliği de aynı şeyi daha sade bir şekilde ifade eder: xhigh ve max ayarlarını yalnızca değerlendirmelerinizin kazanç gösterdiği yerlerde kullanın ve önce performans, maliyet ve hız açısından Sonnet 5.5 ile karşılaştırın.

Varsayılanın önemli olmasının bir nedeni daha: Anthropic'in lansman kıyaslamaları maksimum çaba ile yapılmıştır. Sistem kartının orta çaba sonuçları daha düşüktür (GDPval-AA'da 1277 yerine 1620). Varsayılan ayarda dağıtım yaparsanız, karşılaştırmanız gereken sayılar bunlardır.

İş yüküne göre nereden başlamalı

İş Yükü Başlangıç Seviyesi Ne Zaman Yükseltilmeli
Sınıflandırma, yönlendirme, etiketleme düşük Zor durumlarda etiketler kayar
Kısa belgelerden çıkarım düşük Alanlar atlanır veya birleştirilir
Sohbet ve canlı destek düşük Uzun sohbetlerde kurallar kayar
Özetler ve sıkıştırma orta Anahtar detaylar kaybolur
Daha büyük bir model altında alt ajan çalışması orta Ana model işi yeniden yapar
Ajans kodlaması, dar değişiklikler orta Testler ilk denemede başarısız olur
Bilgi çalışması, uzun ajan görevleri yüksek Değerlendirmeler baş boşluğu gösteriyor

Bu başlangıç noktaları, Anthropic'in Haiku 5.5 için verdiği rehberliği takip eder; "yükselme" sinyalleri, kendi günlüklerinizde dikkat etmeniz gerekenlerdir.

İkinci bir bakış gerektiren tek satır sohbet. Düşük, en hızlı seviyedir ve bu, canlı destek için uygundur. Ancak Anthropic, talimat takibinin en önemli olduğu durumlarda high önerir; örneğin, bir kullanıcı tartışırken sistem istemi kurallarını koruması gereken bir destek asistanı. Geçmişte yanlış giden konuşmalar üzerinde her iki durumu da test edin.

Çaba değiştiğinde ne bozulur veya pahalı hale gelir

Küçük bir max_tokens, yanıtı başlamadan bitirebilir. Düşünme, max_tokens sayısına dahil edilir. Bir kelimelik bir sınıflandırma için ayarlanmış bir sınır, örneğin 50 token, tamamen düşünmeye harcanabilir ve yanıt stop_reason: "max_tokens" ile sonlanır ve metin olmaz. Alanı artırın veya çabayı düşürün.

Sohbet sırasında çabayı değiştirmek önbelleği sıfırlar. İstekler arasında üst düzey çaba değerini değiştirmek, o konuşmanın mesajları için önbellek istemini geçersiz kılar. Bir ajan, low bir konuşma içinde high seviyesinde bir zor dönüşe ihtiyaç duyuyorsa, Anthropic, önbelleği koruyan bir mesaj başına çaba değişikliği sunar (beta başlığı mid-conversation-output-config-2026-07-01, Claude API ve Google Cloud) ve düşünmenin açık olmasını gerektirir. Bir geçidin bu beta başlığını geçirip geçirmediğini kontrol etmek, buna güvenmeden önce değerlidir.

Düşünmeyi kapatmanın sınırları vardır. thinking: {"type": "disabled"} low, medium ve high seviyelerinde kabul edilir. xhigh veya max seviyelerinde bu bir hata döner. Düşünme kapalıyken, bir mesaj başına çaba değişikliği de 400 döner ve model, aynı isteğin JSON çıktısı istemesi durumunda ihtiyaç duyduğu bir araç çağrısını atlayabilir. Anthropic'in tavsiyesi, düşünmeyi açık tutmak ve bunun yerine daha düşük bir çaba seviyesini kullanmaktır.

Düşük çaba erken durabilir. Uzun bir kodlama ajanı sistem istemi ile low seviyesinde, Haiku 5.5 bazen iş tamamlanmadan durur ve görevi geri verir. Anthropic'in testlerinde, low'dan medium'a geçmek, erken durmayı yaklaşık yarıya indirmiş ve deneme başına çıktı token'larını iki katından fazla artırmıştır. Haiku 5.5 istem rehberi, aynı sorunu daha düşük fiyatla ele alan kısa bir "tamamlanana kadar çalışmaya devam et" talimatı içerir.

Düşük ve orta, doğrulamayı atlayabilir. Kodlama görevlerinde, model bazen bir değişikliği test yapmadan tamamlanmış olarak bildirir. İstem rehberinde bunun için bir doğrulama paragrafı vardır; bu token'lara mal olur ancak kontrol edilen değişikliklerin payını artırır.

Xhigh boş bir yanıt dönebilir. xhigh seviyesinde çoklu dönüşlü sohbetlerde, model bazen tüm yanıtını düşünme süresinin içinde yazar ve dönüşü görünür metin olmadan sonlandırır. Eğer xhigh seviyesinde çalışıyorsanız, boş metin bloklarını kontrol edin.

Bir aracı zorlamak düşünmeyi atlar. Haiku 5.5, zorlanmış bir tool_choice'ı kabul eder, ancak yanıt bu durumda araç çağrısı ile başlar ve düşünme olmaz. Modelin aracı çağırmadan önce akıl yürütmesi gerekiyorsa, auto kullanın ve ne zaman çağıracağını istemde belirtin.

Kendi çaba taramanızı AIHubMix üzerinden çalıştırın

Seçmenin en hızlı yolu, aynı 20 ila 50 gerçek istemi iki veya üç seviyede çalıştırmak ve kalite, çıktı token'ları ve gecikmeyi karşılaştırmaktır. AIHubMix Claude native endpoint üzerinden, AIHUBMIX_API_KEY ayarlandığında:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Bu destek biletini bir cümleyle özetleyin: ...",
    "Fatura numarasını ve toplamı çıkarın: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # `text`'i istemle birlikte kaydedin ve kendi değerlendirme kriterlerinize göre derecelendirin.
    print(f"{effort}: {out_tokens} çıktı token'ı, {seconds:.1f}s toplam")

Eğer çıktı token'ları low ve high arasında pek değişmiyorsa, ayar muhtemelen modele ulaşmıyordur; geçidinizin ilettiği isteği kontrol edin. AIHubMix'teki Haiku 5.5 sayfasında, her çaba seviyesinde token başına fiyat aynıdır, bu nedenle bu taramadan elde edilen token sayısı doğrudan dolara dönüşür.

SSS

Claude Haiku 5.5 için varsayılan çaba seviyesi nedir?
Orta. Mevcut çoğu Claude modeli yüksek seviyede varsayılan ayara sahiptir, bu nedenle başka bir model için varsayılan ayara güvenen kod, Haiku 5.5'i bir seviye daha düşük çalıştırır, aksi belirtilmedikçe çaba ayarı yapılmadıkça.

Düşünmeyi tamamen kapatabilir miyim?
Düşük, orta ve yüksek çaba seviyelerinde, evet, düşünmeyi devre dışı bırakarak. Xhigh ve maksimumda bu bir hata döner. Anthropic, bunun yerine çabayı düşürmeyi önerir, çünkü model basit taleplerde düşünmeyi kendiliğinden atlayabilir ve araç çağırma davranışını korur.

Hangi çaba seviyesi en ucuzdur?
Düşük. Artificial Analysis'ın çalışmaları, tüm endeks için yaklaşık 32 milyon çıktı token'ı kullanırken, orta seviyede 54 milyon ve maksimumda 440 milyon kullanmıştır. Token başına fiyat her seviyede aynıdır; fark, üretilen token sayısındadır.

Maksimum çaba Haiku 5.5'te değerli mi?
Sadece kendi değerlendirmelerinizden elde edilen kanıtlarla. FrontierCode'da, maksimum, ortanın maliyetinin yaklaşık on katı kadar ve 4.8 puan kazandırmıştır. Bu noktada Anthropic, Sonnet 5.5 ile karşılaştırma yapmayı önerir; bu, daha az maliyetle aynı kaliteye ulaşabilir.

Yanıtlarım neden metinsiz duruyor?
Genellikle, düşünme max_tokens'ı yanıt başlamadan önce tükettiği için. Max_tokens'ı artırın veya çabayı düşürün. Xhigh seviyesinde çoklu dönüşlü sohbetlerde, boş bir yanıt, modelin yanıtını düşünme süresinin içine koyduğu anlamına da gelebilir.

Çaba değişikliği önbelleklemeyi etkiler mi?
Evet. İstekler arasında üst düzey çaba değişikliği, o konuşmanın önbelleğe alınmış mesajlarını geçersiz kılar. Şu anda beta aşamasında olan bir mesaj başına çaba değişikliği, bunu önler.

Lansman kıyaslamaları neden varsayılanda gördüğümle eşleşmiyor?
Lansman verileri maksimum çaba ile yapılmıştır. Orta seviyede, sistem kartı daha düşük puanlar bildirir; örneğin GDPval-AA'da 1277 yerine 1620.

Devam edin: Claude Haiku 5.5 serisi

Kaynaklar