Claude Haiku 4.5 は Terminal-Bench 4.0 で 0.0% のスコアを記録しました。Claude Haiku 5.5 は 39.2% のスコアを記録し、トークンあたりのコストは 10 分の 1 です: 入力トークン 100 万あたり $0.10、出力トークン 100 万あたり $0.50 で、Haiku 4.5 の $1 と $5 に対してです。
これが一行でのアップグレードです。小型の Claude モデルは「分類には適しているが、エージェントには不向き」から、使えるサブエージェントに進化し、その価格は今や OpenAI の GPT-6 Luna と同じセント単位になっています。Anthropic は 2026 年 10 月 7 日に Claude Haiku 5.5 をリリースしました。モデル ID は claude-haiku-5-5 で、すでに AIHubMix にリストされています。
価格には条件があり、ベンチマークスコアにも条件があります。この投稿では、何が変わったのか、Haiku 5.5 が Sonnet 5.5 にどれだけ近づいているのか、どこが間違った選択なのか、今すぐ切り替えるべき人は誰かをカバーします。
何が変わったのか、何が変わらなかったのか
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| 入力 / 出力価格 | $1 / $5 | $0.10 / $0.50 |
| コンテキストウィンドウ | 200K | 1M |
| 最大出力 | 64K | 128K |
| 思考 | 手動予算、デフォルトでオフ | 適応型、デフォルトでオン |
| 努力レベル | なし | 5、デフォルトは中程度 |
| 同じテキストのトークン数 | ベースライン | 約 30% 増 |
| ブラウザ使用ツール | いいえ | はい |
Haiku 5.5 の価格は 100K トークンまでのプロンプトに適用されます。長いプロンプトは $0.50 / $2.50 です。価格は百万トークンあたりです。
変わらないこと: 仕事の説明。Anthropic は引き続き Haiku を高ボリュームでコストに敏感な作業(要約、圧縮、データベースクエリ、分類)や、より大きなモデルの下でのサブエージェントの役割として提案しています。Anthropic は既存の Haiku 4.5 プロンプトが変更なしでうまく機能するはずだと述べています。既存のリクエストコードは別の問題です: Haiku 4.5 で機能していた 5 つのリクエストパターンは、Anthropic の 移行ガイド に記載されているように、現在は 400 エラーを返します。
2 つの変更がモデルのデフォルトの動作を変更します。思考は今やオフにしない限りオンになっているため、思考に言及しなかったリクエストでも、最初に thinking ブロックが返され、出力トークンがそれに使われることがあります。そして、Haiku 5.5 は 努力設定 を持つ最初の Haiku です。これはコストと品質の間の主要なダイヤルとなっています。
Haiku 4.5、Luna、Sonnet 5.5 に対するスコア
以下の数値は、Anthropic のローンチ資料と Haiku 5.5 システムカードからのもので、Kingy.ai によってまとめられています。これらはベンダー報告のもので、Anthropic 自身が GPT モデルを実行しており、誰もまだ完全な表を独立して再現していません。
| ベンチマーク | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (オフライン) | 72.4% | 15.7% | 48.9% | 83.9% |
| 人類の最後の試験 | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 メイン | 46.4% | n/a | 42.4% | 52.1% |
| Chartography | 46.4% | 6.4% | 29.1% | 61.6% |
人類の最後の試験と Chartography はツールなしで行われます。Sonnet 5.5 の FrontierCode スコアは xhigh 努力でのものです。
3 つの読み取りが他のどの行よりも重要です:
- Haiku 4.5 に対して、異なるクラスのモデルです。 知識作業の評価はほぼ倍増し、エージェントの行はほぼゼロから使えるようになります。Haiku 4.5 は Terminal-Bench タスクを完了できませんでしたが、Haiku 5.5 は約 5 割を完了します。
- GPT-6 Luna に対して、すべての共有行でリードしています。 最も広いギャップはコンピュータ使用(72.4% 対 48.9%)と Terminal-Bench(39.2% 対 16.4%)です。
- Sonnet 5.5 に対して、ギャップはタスクによります。 FrontierCode では Haiku は 6 ポイント以内です。Terminal-Bench では Sonnet が 70.6% を記録し、Haiku は 39.2% です。Anthropic 自身も Sonnet 5.5 と Opus 5.5 が複雑なエージェントコーディングにはより良い選択肢であると述べています。
これらの数値を引用する前に細かい印刷を読んでください
見出しスコアは最大努力で実行されており、最も高価な設定です。デフォルトは中程度で、システムカードの中程度の努力の実行結果はより低くなります: GDPval-AA では 1620 の代わりに 1277、AA-Briefcase では 1578 の代わりに 1372 です。デフォルトで展開する場合は、これらの数値と比較してください。
OSWorld の数値も再確認が必要です。72.4% は部分的なクレジットで、チェックポイントを平均したものです。Haiku 5.5 がすべてのチェックポイントを完了したタスクの割合は 37.1% です(Luna: 17.1%)。ブラウザエージェントが全体の仕事を完了する必要がある場合、37.1% が計画の基準となります。
初期顧客の報告内容
Anthropic のローンチ投稿では、リリース前にモデルをテストしたいくつかの顧客が引用されています。これらはベンダーが選択したもので、同じ作業負荷を指しています:
- AlphaSense は週に約 800 万回の「ドキュメント内での質問」を実行しています。400 のテストクエリで、Haiku 5.5 は Haiku 4.5 の 0.76 に対して 0.84 のスコアを記録しました。
- Box は Haiku 4.5 に対して 11 ポイントの向上を見ましたが、レイテンシは約半分です。
- Asana はタスクごとのレイテンシが 30% 以上低く、エージェントのターンごとの推論が最大 2.5 倍速くなったと測定しました。
- HubSpot は CRM スイートで 92.8% を記録し、小型モデルから得られた最高のスコアです。
- Cognition は Haiku 5.5 を Opus 5.5 の「サイドキック」として使用し、ペアで FrontierCode スコア 66.2 を低コストとレイテンシで保持していると報告しています。
パターン: ドキュメントに対する短い繰り返し作業と、より大きなモデルの下でのサブエージェントの役割。
Haiku 5.5 が間違った選択である場所
- 複雑なエージェントコーディング。 Terminal-Bench は Sonnet 5.5 が最も先行する場所です。タスクに多くのステップ、あいまいな要件、または長い編集のチェーンが必要な場合は、Sonnet 5.5 または Opus 5.5 から始めてください。
- 100K トークンを超えるプロンプト。 1M ウィンドウは実在しますが、価格はそれに沿って均一ではありません。100K トークンを超えると、全リクエストが $0.50 / $2.50 に移行し、新しいトークナイザーは同じテキストに対して約 30% 多くのトークンをカウントするため、そのラインは Haiku 4.5 がカウントした 77K トークン近くに位置します。このシリーズの価格投稿では数値を詳しく説明しています。
- xhigh または max が必要な作業。 出力は長くなり、最高設定では高価になります。Anthropic のガイダンスは、そこに落ち着く前に Sonnet 5.5 と比較することです。
- プライオリティティアにいるチーム。 Haiku 5.5 はそれをサポートしていないため、Haiku 4.5 のプライオリティティアのコミットメントは引き継がれません。
- セキュリティテスト。 Haiku 5.5 のサイバーセーフガードは Haiku 4.5 よりも厳格で、侵入テストをブロックします。その種の作業では
refusal停止理由が予想され、別のモデルへのサーバーサイドのフォールバックはありません。
AIHubMix を通じて試してみてください
Haiku 5.5 の努力設定は Messages API の output_config にありますので、AIHubMix の Claude ネイティブエンドポイント が最も直接的なルートです。現在の Anthropic SDK をインストールし(pip install -U anthropic)、AIHubMix にポイントを設定してください:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # 思考のための余裕を残す
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "このチケットを請求、バグ、またはその他として分類してください: "
"'10 月に二重請求されました。'",
}],
)
# 思考ブロックが最初に来ることがあるので、テキストブロックをタイプで選択します。
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
最初の実行時に確認すべき 2 つのことがあります。low と high の同じプロンプトで response.usage.output_tokens を読み取ります: 数値が動かない場合、努力設定がモデルに到達していません。また、AIHubMix のモデルページには現在、このモデルのコンテキスト長が 200K と記載されており、Anthropic の 1M よりも低いため、非常に長いプロンプトを送信する前に制限を確認してください。
誰が切り替えるべきか、誰が待つべきか
今すぐ切り替えてください もしあなたが分類、抽出、ルーティング、要約、または 100K トークン未満のプロンプトでのドキュメント Q&A を実行している場合。トークン価格のわずかな部分で、はるかに強力なモデルを得ることができます。リクエストコードの変更に 1 時間を計画し、その後、自分の評価で努力 low を medium と比較してください。
今すぐ切り替えてください もしあなたがサブエージェント作業に対して過剰資格の大きなモデルを使用している場合: 書類からの数字を引き出す、ファイルを確認する、ツールの結果を要約する。これは、Anthropic とそのローンチ顧客が強調する役割です。
スプリントを待ってください もしあなたの統合が computer_20250124 ツール、プレフィル、または temperature=0 を使用している場合。それぞれが Haiku 5.5 で 400 を返し、それを修正するのはコード作業であり、モデル文字列の交換ではありません。
そのままにしておいてください もしあなたの作業負荷が長いプロンプト(定期的に約 77K Haiku 4.5 トークンを超える)、プライオリティティアに依存している、または複雑なエージェントコーディングである場合。最後のグループにとって、有用な比較は Haiku 5.5 と Sonnet 5.5 の完了したタスクあたりのコストであり、Haiku 5.5 と Haiku 4.5 の比較ではありません。
比較の準備ができたら、AIHubMix モデルリスト では Haiku 5.5、Sonnet 5.5、Opus 5.5 が 1 つの API キーの後ろに配置されているため、同じ評価をすべてのモデルに対して実行できます。
FAQ
Claude Haiku 5.5 は Haiku 4.5 よりもすべての面で優れていますか?
Anthropic のローンチテーブルのすべてのベンチマークで、はい、しばしば大きな差で。例外は実用的であり、品質ではなく: プライオリティティアはサポートされておらず、100K トークンを超えるプロンプトは短いプロンプト料金よりもトークンあたりのコストが高く、いくつかの古いリクエストパターンは現在エラーを返します。
Haiku 5.5 は本当に 90% 安いですか?
100K トークンまでのトークンあたりの価格は 90% 低く、これを超えると 50% 低くなります。新しいトークナイザーは同じテキストに対して約 30% 多くのトークンをカウントし、思考が出力トークンを生成するため、Anthropic は典型的な節約を約 75% と見積もっています。
Haiku 5.5 は GPT-6 Luna とどのように比較されますか?
両者は入力トークン 100 万あたり $0.10、出力トークン 100 万あたり $0.50 でリストされています。Anthropic の報告された結果では、Haiku 5.5 は両者が出現するすべてのベンチマークで高いスコアを記録しており、特にコンピュータ使用と Terminal-Bench で明確です。Luna は長いプロンプト長に対して基本価格を維持するため、長いプロンプト作業は別途価格設定されるべきです。
Haiku 5.5 はコーディングのために Sonnet 5.5 を置き換えることができますか?
狭く、明確に範囲を定めた変更やサブエージェントタスクに対しては、テストする価値があります。複雑な多段階エージェントコーディングに関しては、Sonnet 5.5 が Terminal-Bench 4.0 ではるかに高いスコアを記録しており(70.6% 対 39.2%)、Anthropic はその作業には Sonnet または Opus を推奨しています。
ベンチマークスコアはデフォルト設定でのものですか?
いいえ。見出しスコアは最大努力で実行されました。デフォルトは中程度で、システムカードはより低い結果を報告しています。例えば、GDPval-AA では 1620 の代わりに 1277 です。
1M コンテキストウィンドウは、1M トークンのプロンプトを安く送信できることを意味しますか?
送信できますが、100K トークンを超えるものは、全リクエストに対して $0.50 入力および $2.50 出力で請求されます。ゲートウェイのリストされたコンテキスト制限も確認してください。
切り替えるためにコードで何を変更する必要がありますか?
最低限: モデル ID、手動思考予算、温度または top_p 設定、アシスタントのプレフィル、および最初のコンテンツブロックを回答として読み取るコード。移行投稿には完全なリストがあります。
読み続ける: Claude Haiku 5.5 シリーズ
- 見出しスコアは最大努力で実行されましたが、実際には中程度または低で展開することになるでしょう。各レベルがトークンでどのくらいのコストがかかり、ステップダウンすることで何を失うかを確認するには、Claude Haiku 5.5 努力レベル: 中程度がデフォルト、低がしばしば十分 をお読みください。
- 価格の 10 分の 1 の数字は、新しいトークナイザーが移動させるプロンプト長のライン以下でのみ保持されます。作業コストの例や見逃しやすい請求ルールについては、Claude Haiku 5.5 価格: 90% 削減の背後にある 100K ライン をお読みください。
- 切り替えはモデル文字列の変更以上のものです: 5 つの古いリクエストパターンが現在失敗しています。各エラー、その原因、および修正方法については、Claude Haiku 4.5 から 5.5 への移行: 5 つの 400 エラーと静かな変更 をお読みください。
出典
- Claude Haiku 5.5 の紹介 (Anthropic)
- Claude Haiku 5.5 移行ガイド (Claude Platform Docs)
- AIHubMix の Claude Haiku 5.5
- Claude Haiku 5.5: ベンチマーク、仕様、Sol & Luna の比較 (Kingy.ai)
- Claude Haiku 5.5 の知能、パフォーマンス & 価格分析 (Artificial Analysis)



