Claude Haiku 5.5の努力レベル:デフォルトは中、低はしばしば十分

AIHubMix約 8 分で読めます
Claude Haiku 5.5の努力レベル:デフォルトは中、低はしばしば十分

Claude Haiku 5.5は努力設定を持つ最初のHaikuであり、この設定はあなたが制御する他の何よりも請求額に影響を与えます。Artificial Analysisの独立した実行では、Haiku 5.5は最大努力でインテリジェンスインデックスで43点を獲得し、低努力では29点を獲得しました。最大努力では440百万の出力トークンを使用してインデックスを通過し、低努力では32百万を使用しました。

短い答えとしては:ほとんどの作業はデフォルトのmediumに留め、高ボリュームの単純なルートはlowに落とし、知識作業と厳密な指示の遵守をhighに上げることです。xhighとmaxは証拠が必要な設定として扱い、コミットする前にSonnet 5.5と比較してください。

この記事の残りの部分では、各レベルのコスト、どこで上昇が利益をもたらさなくなるか、努力を変更したときにどの設定が壊れるかまたは高くなるかを示します。

設定とは何か

Claude Haiku 5.5は5つのレベルをサポートしています:low、medium、high、xhigh、およびmax。デフォルトはmediumで、これは珍しいことです:現在のほとんどのClaudeモデルはデフォルトでhighに設定されており、Haiku 5.5とOpus 5.5のみが1レベル低いデフォルトを持っています。mediumを送信することは、パラメータを省略するのと同じです。

努力はHaiku 4.5が使用していた手動思考予算を置き換えます。thinking: {"type": "enabled", "budget_tokens": N}を使用したリクエストは現在400を返すため、古い数値を引き継ぐことはありません。Anthropicの努力に関するドキュメントによれば、output_configで設定します:

output_config={"effort": "low"}

以下のすべてをフレームする3つの事実があります:

  • 思考はデフォルトでオンです。 Haiku 5.5は、特に指示がない限り適応的思考を実行します。低い努力は思考を減少させ、単純なリクエストではモデルは思考を完全にスキップできます。
  • 思考トークンは出力トークンです。 それらはmax_tokensにカウントされ、出力レートで請求されます($0.50百万トークンあたり、100Kトークンまでのプロンプト)。
  • プロンプトで思考を減らすように要求しても効果がありません。 Anthropicのテストでは、プロンプトが直接回答するように指示してもモデルは思考を続けました。努力がレバーです。

各レベルのコスト

2つの独立したソースが努力レベルにわたるHaiku 5.5を測定しました。インデックスの数値はArtificial Analysisから、FrontierCodeの数値はCognitionの公開結果ファイルから、Kingy.aiによって編纂されました。どちらもあなたの作業負荷をカバーしていないため、曲線の形状として扱い、あなたの数値としては扱わないでください。

Artificial Analysis インテリジェンスインデックス v4.3.2(知識作業からターミナルタスクまでの10回の評価):

努力 インデックススコア インデックスの出力トークン タスクあたりのコスト 最初のトークンまでの時間
low 29 32M $0.02 9.9 s
medium 34 54M $0.05 13.4 s
high 38 97M $0.08 28.0 s
xhigh 41 180M $0.12 n/a
max 43 440M $0.21 n/a

Artificial Analysisはxhighのレイテンシ数値を公開していません。最大努力のレイテンシ数値は異常に見えたため、省略されています。

FrontierCode 1.1 メイン、Claude Codeで実行されるHaiku 5.5:

努力 総合スコア ロールアウトあたりのコスト ロールアウトあたりの出力トークン
low 34.8% $0.06 23,868
medium 41.6% $0.13 36,172
high 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
max 46.4% $1.33 181,387

コストはセント単位に丸められています。

2つのテーブルを一緒に読み、3つのことが際立ちます。

低から中は最も安価なステップアップです。 インデックスでは、約1.7倍の出力トークンで5ポイントを購入します。FrontierCodeでは、約2倍のロールアウトコストで6.8ポイントを購入します。

中から高はフラットになることがあります。 FrontierCodeでは、高は中より0.3ポイント高く、コストは約2倍です。広範なインデックスでは、高は4ポイントを追加しました。あなたの作業負荷が最初のケースのように見えるか、2番目のケースのように見えるかは、迅速な評価が教えてくれます。

上位2つのレベルは高価です。 インデックスで高から最大に移行すると、出力トークンは約4.5倍増加し、5ポイントを獲得します。FrontierCodeでは、最大は中の約10倍のコストで4.8ポイントを獲得し、xhighからmaxへのステップは約0.6ポイントのためにコストをほぼ倍増させます。Anthropic自身のガイダンスも同じことを平易な言葉で述べています:xhighとmaxは、あなたの評価が利益を示す場合にのみ使用し、まずSonnet 5.5とパフォーマンス、コスト、速度を比較してください。

デフォルトが重要なもう一つの理由:Anthropicのローンチベンチマークは最大努力で実行されました。システムカードの中程度の努力の結果は低く(GDPval-AAで1277、1620ではなく)、デフォルトでデプロイすると、それらの数値と比較することになります。

作業負荷による開始地点

作業負荷 開始地点 移行するタイミング
分類、ルーティング、タグ付け low 難しいケースでラベルがずれる
短い文書からの抽出 low フィールドが見逃されるか、統合される
チャットとライブサポート low 長いチャットでルールが逸脱する
要約と圧縮 medium 重要な詳細が抜け落ちる
大きなモデルの下でのサブエージェント作業 medium リードモデルが作業をやり直す
エージェンティックコーディング、狭い変更 medium テストが最初の試行で失敗する
知識作業、長いエージェントタスク high 評価が余地を示す

これらの開始地点は、Haiku 5.5に関するAnthropicのガイダンスに従っています。「移行するタイミング」は、あなた自身のログで注意すべき信号です。

再度注目すべき行はチャットです。低は最も速いレベルであり、ライブサポートに適しています。しかし、Anthropicは指示遵守が最も重要な場合にはhighを推奨しています。例えば、ユーザーが議論している間にシステムプロンプトのルールを保持する必要があるサポートアシスタントです。過去に問題があった会話で両方をテストしてください。

努力が変更されたときに何が壊れたり高くなったりするか

小さなmax_tokensは、応答が始まる前に終了する可能性があります。 思考はmax_tokensにカウントされます。例えば、50トークンのサイズで1語の分類に合わせたキャップは、思考に完全に使われてしまい、応答はstop_reason: "max_tokens"で終了し、テキストがありません。キャップを上げて余裕を持たせるか、努力を下げてください。

会話中に努力を変更するとキャッシュがリセットされます。 リクエスト間でトップレベルの努力値を変更すると、その会話のメッセージのプロンプトキャッシュが無効になります。エージェントがlowの会話の中でhighで1回の難しいターンを必要とする場合、Anthropicはキャッシュを保持するためのメッセージごとの努力変更(ベータヘッダーmid-conversation-output-config-2026-07-01、Claude APIおよびGoogle Cloud)を提供しています。思考をオンにする必要があります。そのベータヘッダーがゲートウェイを通過するかどうかは、依存する前に確認する価値があります。

思考をオフにするには限界があります。 thinking: {"type": "disabled"}はlow、medium、およびhighで受け入れられます。xhighまたはmaxでは400を返します。思考がオフの場合、メッセージごとの努力変更も400を返し、同じリクエストがJSON出力を要求する際に必要なツール呼び出しをスキップする可能性があります。Anthropicのアドバイスは、思考をオンにして、代わりに低い努力レベルを使用することです。

低い努力は早く終了することがあります。 長いコーディングエージェントのシステムプロンプトがlowである場合、Haiku 5.5は時々作業が完了する前に停止し、タスクを返します。Anthropicのテストでは、lowからmediumに移行すると、早期停止が約半減し、試行あたりの出力トークンが2倍以上になります。Haiku 5.5プロンプトガイドには、同じ問題に対処する「完了するまで作業を続ける」という短い指示があります。

低と中は検証をスキップすることがあります。 コーディングタスクでは、モデルがテストを実行せずに変更を完了したと報告することがあります。プロンプトガイドにはこれに関する検証の段落があり、トークンがかかりますが、チェックされた変更の割合を上げます。

xhighは空の応答を返すことがあります。 xhighでのマルチターンチャットでは、モデルが思考の中に全ての回答を書き込み、可視テキストなしでターンを終了することがあります。xhighで実行する場合は、空のテキストブロックがないか確認してください。

ツールを強制すると思考がスキップされます。 Haiku 5.5は強制されたtool_choiceを受け入れますが、その場合、応答はツール呼び出しから始まり、思考はありません。モデルがツールを呼び出す前に推論する必要がある場合は、autoを使用し、いつ呼び出すかをプロンプトで指定してください。

AIHubMixを通じて独自の努力スイープを実行する

最も早い選択方法は、同じ20から50の実際のプロンプトを2つまたは3つのレベルで実行し、品質、出力トークン、レイテンシを比較することです。AIHubMix Claudeネイティブエンドポイントを通じて、AIHUBMIX_API_KEYを設定して:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "このサポートチケットを1文で要約してください:...",
    "請求書番号と合計を抽出してください:...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # `text`をプロンプトの横に保存し、独自のルーブリックに対して評価します。
    print(f"{effort}: {out_tokens} 出力トークン, {seconds:.1f}s 合計")

lowとhighの間で出力トークンがほとんど変わらない場合、設定がモデルに届いていない可能性があります。ゲートウェイが転送するリクエストを確認してください。AIHubMixのHaiku 5.5ページでは、各努力レベルでのトークンあたりの価格は同じであるため、このスイープからのトークン数はそのままドルに変換されます。

FAQ

Claude Haiku 5.5のデフォルトの努力レベルは何ですか?
中です。現在のほとんどのClaudeモデルは高にデフォルト設定されているため、他のモデルのデフォルトに依存していたコードは、努力を明示的に設定しない限り、Haiku 5.5を1レベル低く実行します。

思考を完全にオフにできますか?
低、中、高の努力では、思考を無効に設定することで可能です。xhighとmaxではエラーが返されます。Anthropicは、モデルが単純なリクエストで自動的に思考をスキップできるため、代わりに努力を下げることを推奨しています。

どの努力レベルが最も安価ですか?
低です。Artificial Analysisの実行では、全体のインデックスに対して約32百万の出力トークンを使用し、中では54百万、最大では440百万を使用しました。トークンあたりの価格はすべてのレベルで同じですが、生成されるトークンの数が異なります。

Haiku 5.5で最大努力は価値がありますか?
あなた自身の評価からの証拠がある場合のみです。FrontierCodeでは、最大は中の約10倍のコストで4.8ポイントの向上を得ました。その時点でAnthropicはSonnet 5.5と比較することを提案しています。Sonnet 5.5は、より少ないコストで同じ品質に達するかもしれません。

なぜ私の応答がテキストなしで停止するのですか?
通常、思考が応答が始まる前にmax_tokensを使い果たしたためです。max_tokensを上げるか、努力を下げてください。xhighでのマルチターンチャットでは、空の応答もモデルが思考の中に回答を入れたことを意味することがあります。

努力を変更するとプロンプトキャッシュに影響しますか?
はい。リクエスト間でトップレベルの努力を変更すると、その会話のキャッシュされたメッセージが無効になります。現在ベータ版のメッセージごとの努力変更はそれを回避します。

なぜローンチベンチマークがデフォルトで見るものと一致しないのですか?
ローンチ数値は最大努力で実行されました。中程度では、システムカードは低いスコアを報告します。例えば、GDPval-AAで1277ではなく1620です。

引き続き読む:Claude Haiku 5.5シリーズ

出典