Claude Haiku 5.5の価格: 90%の削減の背後にある100Kライン

AIHubMix約 8 分で読めます
Claude Haiku 5.5の価格: 90%の削減の背後にある100Kライン

Claude Haiku 5.5は、入力トークンが100万トークンあたり0.10ドル、出力トークンが100万トークンあたり0.50ドルで、Haiku 4.5の1ドルと5ドルの10分の1です。これは、100,000トークンまでのプロンプトに適用されます。そのラインを超えると、全リクエストが0.50ドルと2.50ドルで請求され、Haiku 4.5の価格の半分になります。

Anthropicは、典型的な節約を約75%とし、90%ではないとしています。この違いは、この投稿で説明する3つの要因から来ています: プロンプトが100Kラインに対してどこに位置するか、デフォルト設定が生成する思考トークンの数、そして同じテキストを約30%多くカウントする新しいトークナイザーです。以下の2つの実例が、実際の請求がどのようになるかを示しています。

料金表

トークンあたりの価格、AnthropicのHaiku 5.5の発表記事および価格ページから:

トークンタイプ Haiku 5.5, 短い Haiku 5.5, 長い Haiku 4.5 Sonnet 5.5
入力 $0.10 $0.50 $1.00 $2.00
出力 $0.50 $2.50 $5.00 $10.00
キャッシュ読み取り $0.01 $0.05 $0.10 $0.10
キャッシュ書き込み, 5分 $0.125 $0.625 $1.25 $2.50
キャッシュ書き込み, 1時間 $0.20 $1.00 $2.00 $4.00

「短い」とは100,000トークン以下のプロンプトを意味し、「長い」とは100,000を超えるものを意味します。バッチAPIは入力と出力を50%割引します。Sonnet 5.5のキャッシュ読み取り価格は、同じ日に0.20ドルから0.10ドルに引き下げられました。

AIHubMixのHaiku 5.5ページでは、同じ2つのティアがリストされており、ウェブ検索はリクエストあたり0.01ドルです。

見落としがちな請求ルール

全リクエストがティアを変更し、超過分だけではありません。 Anthropicは、プロンプトの長さによって選ばれた2つの料金表でHaiku 5.5を価格設定しています。100,000トークンのプロンプトはその入力に対して0.0100ドルを支払い、100,001トークンのプロンプトは0.0500ドルを支払い、その出力も5倍の価格になります。Haiku 5.5はここで例外です: Anthropicの他の現在の1Mコンテキストモデルは、標準料金で全ウィンドウを請求します。

ラインは古いダッシュボードが示唆するよりも早く到達します。 Haiku 5.5は新しいトークナイザーを使用しており、同じテキストがHaiku 4.5よりも約30%多くのトークンを生成します。100,000を1.3で割ると、Haiku 4.5がカウントした場合のラインは約77,000トークンになります。古いダッシュボードでの78,000トークンのプロンプトは、Haiku 5.5では約101,000トークンとなり、長い料金が適用されます。この算術はAnthropicの移行ガイドの30%の数字から来ており、正確な増加はコンテンツに依存するため、新しいモデルで実際のプロンプトを再カウントしてください。

思考はデフォルトでオンになっており、出力として請求されます。 Haiku 4.5は、要求されたときのみ思考を行いました。Haiku 5.5は、変更しない限りmediumの努力で適応的思考を実行するため、以前は200の出力トークンを返していたルートが、今では数百トークン多く返すことができます。

短いプロンプトはキャッシュ可能になりました。 最小キャッシュ可能プロンプトは、Haiku 4.5の4,096トークンからHaiku 5.5の512トークンに減少しました。Haiku 4.5ではキャッシュできなかった3,000トークンのシステムプロンプトが今ではキャッシュ可能になり、キャッシュ読み取りは入力料金の10分の1です。

プライオリティティアは利用できません。 Haiku 4.5でプライオリティティアのコミットメントを持っている場合、それはHaiku 5.5に引き継がれません。プランの容量は別途計画してください。

キャッシュされたトークンと100Kライン: カウントされると仮定してください。 Anthropicは各ティアのために別々のキャッシュ読み取り価格をリストしており、これは全プロンプトがキャッシュされているかどうかにかかわらず、ティアを決定することを示唆しています。Anthropicはこれを明示していないため、安全な仮定は、95Kのキャッシュされたプレフィックスと6Kの質問が長いプロンプトであるということです。

実例1: サポートチケット分類器

仮定: Haiku 4.5のトークンカウントで、ツール定義を含む3,000トークンのシステムプロンプト、1,000トークンのチケット、200トークンの回答、月に1百万リクエスト。Haiku 4.5は思考をオフにして実行します。

Haiku 5.5では、同じテキストが3,900 + 1,300の入力トークンと260トークンの回答になります。思考はlowの努力で300トークン、mediumで800トークンを追加すると仮定します。これらの思考の数値は仮定です; あなたのものを測定してください。

設定 リクエストあたり 月あたり
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, 低, キャッシュなし $0.00080 $800
Haiku 5.5, 低, キャッシュされたプレフィックス $0.00045 $453
Haiku 5.5, 中, キャッシュされたプレフィックス $0.00070 $703
Sonnet 5.5, 中, キャッシュされたプレフィックス $0.01359 $13,674

月間キャッシュされた行には、Haiku 5.5の約4ドルのキャッシュ書き込みとSonnet 5.5の約84ドルが含まれています。これは、5分ごとに1回の書き込みを仮定しています。Sonnet 5.5は中程度の努力でHaikuと同じトークンの仮定を使用しています。

キャッシュされたlow行の合計: 3,900キャッシュされたトークンが100万トークンあたり0.01ドル($0.000039)、1,300の新しい入力トークンが0.10ドル($0.00013)、560の出力トークンが0.50ドル($0.00028)で、リクエストあたり$0.000449になります。

パターン: キャッシュと努力が組み合わさることで、請求が古いコストの16%(キャッシュなし、低)から9%(キャッシュあり、低)に移動します。努力をlowの代わりにデフォルトのままにすると、このボリュームで月に約250ドルが追加されます。どちらの選択も、Haiku 4.5の5,000ドルに対してはあまり重要ではないため、分類器のケースが90%の見出しが現実である理由です。

実例2: ラインを超える契約レビュー

仮定: Haiku 4.5のトークンカウントで、契約と指示が70,000トークン、1,500トークンの回答、キャッシュなし。Haiku 5.5では、91,000の入力トークン、1,950トークンの回答、mediumで2,000の思考トークンを仮定し、出力トークンは3,950になります。

契約を14%長くします: Haiku 4.5で80,000トークン、Haiku 5.5で104,000トークン。

契約サイズ(Haiku 4.5カウント) Haiku 4.5 Haiku 5.5 変更
70,000トークン $0.0775 $0.0111 86%低い
80,000トークン $0.0875 $0.0619 29%低い

2行目: 104,000の入力トークンが100万トークンあたり0.50ドル($0.052)で、3,950の出力トークンが2.50ドル($0.0099)です。14%のテキストの増加は、Haiku 5.5で5.6倍のコストになります。

解決策はラインを下回ることです。長い契約を約53,000トークンずつの2回の呼び出しに分割すると(契約の半分と各呼び出しの指示)、短い料金で約0.015ドルの合計コストになります。これは、単一の長い呼び出しの4分の1未満です。分割が機能するかどうかはタスクによります; 条項ごとのレビューはきれいに分割できますが、全体の文書が必要な質問はそうではありません。

タスクあたりのコスト比較

Sonnet 5.5に対して、Haiku 5.5は短いプロンプトのトークンあたりの価格の約20分の1です。しかし、トークンあたりの価格は完成したタスクの価格ではありません。複雑なエージェントコーディングでは、Sonnet 5.5がAnthropicの報告結果でTerminal-Bench 4.0で70.6%を獲得し、Haiku 5.5が39.2%です。失敗して再試行される安価なリクエストや、より大きなモデルによって再実行されるリクエストは安くありません。Anthropic自身のアドバイスは、Haikuをxhighまたはmaxで実行する前にSonnet 5.5と比較することです。Sonnet 5.5も同じ日に安くなりました: そのキャッシュ読み取りは半分になり、Anthropicはこれがほとんどのエージェント作業の約20%を削減すると述べています。

GPT-6 Lunaに対して、短いプロンプトのリスト価格は同じで、キャッシュ読み取りも含まれています。違いは長いプロンプトのルールです。Lunaの長いコンテキスト料金は272,000入力トークンを超えて始まり、$0.20 / $0.75ですが、Haiku 5.5は100,000を超えて始まり、$0.50 / $2.50です。100Kから272Kトークンの間のワークロードでは、Lunaはリスト価格ではるかに安価です。2つのモデルは異なるトークナイザーを使用しているため、測定された請求書を比較してください。

100Kの閾値とトークナイザーの影響に関する数字もRooのニュースレターで説明されており、その算術は上記の例と一致しています。

請求を削減する手順

  1. 新しいモデルでトークンをカウントし、100Kの前に警告します。 各リクエストの完全なプロンプトサイズをログに記録し、約90,000トークンで警告を出します。これにより、上昇するプロンプトがティアを変更する前にトリミングまたは分割されます。
  2. 安定したプレフィックスをキャッシュします。 システムプロンプトとツール定義を最初に、変数コンテンツを最後にします。512トークンの最小値で、ほとんどのプロダクションシステムプロンプトが現在資格を持っています。AIHubMixのClaudeプロンプトキャッシングガイドがリクエストフォーマットを示しています。
  3. 努力を明示的に設定します。 高ボリュームのシンプルなルートにはlowを使用します。デフォルトのmediumは、ルートが必要かどうかにかかわらず、すべてのリクエストでより高価になります。
  4. 思考と回答のためにmax_tokensのサイズを設定します。 小さすぎると、回答がないまま思考に対して支払うことになります。
  5. 待てるものはバッチ処理します。 バッチAPIは入力と出力の料金を半分にします。
  6. 再試行するのではなく、上にルートします。 Haikuでタスクタイプが頻繁に失敗する場合は、Haikuの試行とフォールバックの料金を支払うのではなく、最初にSonnet 5.5に送信します。

手順1と2のためのログパターンは、AIHubMixのClaudeネイティブエンドポイントを通じて:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "あなたはサポートチケットをトリアージします..."  # 安定した、キャッシュ可能なプレフィックス

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"警告: プロンプトが{prompt_tokens}トークンで、100Kの価格ラインに近い")
    return next(b.text for b in r.content if b.type == "text")

もしcache_read_input_tokensが繰り返し呼び出しの間にゼロのままであれば、システムプロンプトのタイムスタンプなど、リクエスト間でプレフィックスの何かが変わっています。

FAQ

Claude Haiku 5.5のコストはいくらですか?
100,000トークンまでのプロンプトには、入力トークンが100万トークンあたり0.10ドル、出力トークンが100万トークンあたり0.50ドルです。より長いプロンプトの場合、0.50ドルと2.50ドルが全リクエストに適用されます。キャッシュ読み取りは入力料金の10分の1で、バッチAPIは入力と出力の価格を半分にします。

Haiku 5.5は本当にHaiku 4.5より90%安いですか?
トークンあたりの価格では、短いプロンプトであればそうです。しかし、タスクあたりではそうではありません: 新しいトークナイザーは同じテキストに対して約30%多くのトークンをカウントし、思考はデフォルトでオンになっており、長いプロンプトは50%の削減しか受けません。Anthropicは典型的な節約を約75%と見積もっています。キャッシュを使用した短いプロンプトの分類器は約90%の節約が可能です。

プロンプトが100,000トークンをわずかに超えた場合はどうなりますか?
全リクエストが高い料金表に移動します。上記の契約例では、14%のテキストの増加がリクエストを5.6倍高くしました。

キャッシュされたトークンは100Kの閾値にカウントされますか?
Anthropicはこれを明示的に述べていません。価格設定は各ティアのために別々のキャッシュ読み取り価格をリストしているため、安全な仮定は、全プロンプトがキャッシュされているかどうかにかかわらず、ティアを決定するということです。

思考トークンは追加料金がかかりますか?
それらは通常の出力料金で出力トークンとして請求されます。思考はデフォルトで中程度の努力でオンになっているため、以前は短い回答を生成していたルートにかなり追加される可能性があります。努力を下げることでそれらを減らすことができます。

Haiku 5.5はGPT-6 Lunaより安いですか?
100Kトークンまでのプロンプトではリスト価格は同じです。100Kから272Kトークンの間では、Lunaは基本料金を維持し、Haiku 5.5は高い料金に移動するため、Lunaはリスト価格で安価です。トークナイザーが異なるため、実際の請求書を比較してください。

Haiku 5.5でプライオリティティアを使用できますか?
いいえ。プライオリティティアはHaiku 5.5ではサポートされていないため、Haiku 4.5のコミットメントは移行されません。

読み続ける: Claude Haiku 5.5シリーズ

出典