Claude Haiku 4.5 在 Terminal-Bench 4.0 中得分為 0.0%。Claude Haiku 5.5 的得分為 39.2%,每個 token 的價格僅為十分之一:每百萬個輸入 token 價格為 0.10 美元,每百萬個輸出 token 價格為 0.50 美元,而 Haiku 4.5 的價格為 1 美元和 5 美元。
這就是升級的簡單描述。小型 Claude 模型從「適合分類,不適合代理」變成了一個可用的子代理,現在其價格與 OpenAI 的 GPT-6 Luna 完全相符。Anthropic 於 2026 年 10 月 7 日發布了 Claude Haiku 5.5,模型 ID 為 claude-haiku-5-5,並且已經在 AIHubMix 上列出。
價格附帶條件,基準分數也是如此。這篇文章涵蓋了變化的內容,Haiku 5.5 與 Sonnet 5.5 的接近程度,在哪裡是錯誤的選擇,以及誰應該現在切換。
變化了什麼,沒有變化什麼
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| 輸入/輸出價格 | $1 / $5 | $0.10 / $0.50 |
| 上下文窗口 | 200K | 1M |
| 最大輸出 | 64K | 128K |
| 思考 | 手動預算,默認關閉 | 自適應,默認開啟 |
| 努力等級 | 無 | 五個,默認中等 |
| 相同文本的 tokens | 基準 | 約多 30% |
| 瀏覽器使用工具 | 否 | 是 |
Haiku 5.5 的價格適用於最多 100K tokens 的提示;更長的提示則需支付 $0.50 / $2.50。價格以每百萬 tokens 計算。
保持不變的是工作描述。Anthropic 仍然將 Haiku 定位於高容量、對成本敏感的工作(摘要、壓縮、數據庫查詢、分類)以及在更大模型下的子代理職責。Anthropic 表示,現有的 Haiku 4.5 提示應該能夠正常運行,無需更改。現有請求代碼則是另一回事:五種在 Haiku 4.5 上有效的請求模式現在返回 400 錯誤,正如 Anthropic 的 遷移指南 所列,這系列的遷移文章也會詳細說明。
兩個變化改變了模型的默認行為。思考現在是開啟的,除非你將其關閉,因此一個從未提及思考的請求可能會首先返回 thinking 區塊,並在這些區塊上消耗輸出 tokens。而 Haiku 5.5 是第一個具有 努力設置 的 Haiku,這現在是成本和質量之間的主要調整。
它在 Haiku 4.5、Luna 和 Sonnet 5.5 中的得分
以下數據來自 Anthropic 的發布材料和 Haiku 5.5 系統卡,由 Kingy.ai 編輯。這些數據是供應商報告的,Anthropic 自行運行了 GPT 模型,目前尚無人獨立重現完整的表格。
| 基準 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72.4% | 15.7% | 48.9% | 83.9% |
| 人類最後的考試 | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 主 | 46.4% | n/a | 42.4% | 52.1% |
| 圖表學 | 46.4% | 6.4% | 29.1% | 61.6% |
人類最後的考試和圖表學沒有工具。Sonnet 5.5 的 FrontierCode 得分是在 xhigh 努力下獲得的。
三個數據點比任何單一行更重要:
- 與 Haiku 4.5 相比,它是一個不同類別的模型。 知識工作評分大約翻倍,代理行的得分從接近零提高到可用。Haiku 4.5 無法完成 Terminal-Bench 任務;Haiku 5.5 大約完成五分之二。
- 與 GPT-6 Luna 相比,它在每個共享行上都領先,價格相同。最明顯的差距在於計算機使用(72.4% 對 48.9%)和 Terminal-Bench(39.2% 對 16.4%)。
- 與 Sonnet 5.5 相比,差距取決於任務。 在 FrontierCode 上,Haiku 的得分相差六分。在 Terminal-Bench 上,Sonnet 的得分為 70.6%,而 Haiku 的得分為 39.2%。Anthropic 自己表示,Sonnet 5.5 和 Opus 5.5 仍然是複雜代理編碼的更好選擇。
在引用這些數字之前請仔細閱讀細則
標題分數是在最大努力下運行的,這是最昂貴的設置。默認為中等,系統卡的中等努力運行的結果較低:例如 GDPval-AA 的得分為 1277,而不是 1620。如果你以默認設置進行部署,請與這些數字進行比較,而不是發布圖表。
OSWorld 的數據也需要重新檢查。72.4% 是部分信用,平均計算於檢查點。Haiku 5.5 完成每個檢查點的任務比例為 37.1%(Luna:17.1%)。對於必須完成整個工作的瀏覽器代理來說,37.1% 是計劃的數字。
早期客戶的報告
Anthropic 的發布文章引用了幾位在發布前測試該模型的客戶。這些是供應商選擇的,但它們指向相同的工作負載:
- AlphaSense 每週進行約 800 萬次「文檔查詢」調用。在 400 個測試查詢中,Haiku 5.5 得分為 0.84,而 Haiku 4.5 的得分為 0.76。
- Box 在 Haiku 4.5 上看到的得分提高了 11 分,延遲約減少了一半。
- Asana 測量每個任務的延遲降低了 30% 以上,每次代理回合的推理速度提高了最多 2.5 倍,與其當前模型相比。
- HubSpot 在其 CRM 套件中獲得了 92.8% 的得分,這是它從小型模型中看到的最佳得分。
- Cognition 在 Devin Fusion 中將 Haiku 5.5 作為 Opus 5.5 的「助手」,並報告該組合在較低的成本和延遲下保持 FrontierCode 得分為 66.2。
模式:在文檔上進行短期重複工作,以及在更大模型下的子代理職責。
Haiku 5.5 的錯誤選擇
- 複雜的代理編碼。 Terminal-Bench 是 Sonnet 5.5 最具優勢的地方。如果任務需要多個步驟、模糊的要求或長鏈編輯,請從 Sonnet 5.5 或 Opus 5.5 開始。
- 超過 100K tokens 的提示。 1M 的窗口是真實的,但價格在這方面並不平坦。超過 100K tokens 的整個請求將移至 $0.50 / $2.50,並且由於新的分詞器計算的 tokens 約多 30%,該行在 Haiku 4.5 計算的約 77K tokens 附近。這系列的定價文章會詳細說明這些數字。
- 需要 xhigh 或 max 才能通過的工作。 在最高設置下,輸出變得冗長且昂貴。Anthropic 自己的指導是,在決定之前與 Sonnet 5.5 進行比較。
- 優先級層級的團隊。 Haiku 5.5 不支持此功能,因此 Haiku 4.5 的優先級層級承諾不會轉移。
- 安全測試。 Haiku 5.5 的網絡安全防護比 Haiku 4.5 嚴格,並阻止滲透測試。對於這類工作,預期會出現
refusal停止原因,且不會有伺服器端的回退到其他模型。
通過 AIHubMix 試用
Haiku 5.5 的努力設置位於消息 API 的 output_config 中,因此 AIHubMix 上的 Claude 原生端點 是最直接的路徑。安裝當前的 Anthropic SDK (pip install -U anthropic) 並將其指向 AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # 留出思考的空間,而不僅僅是答案
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "將此票據分類為計費、錯誤或其他:"
"'我在十月被收費兩次。'",
}],
)
# 思考區塊可能會首先出現,因此按類型選擇文本區塊。
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
第一次運行時要檢查兩件事。在相同提示下,分別查看 low 和 high 的 response.usage.output_tokens:如果數字沒有變化,則努力設置未能到達模型。並注意 AIHubMix 的模型頁面目前列出了該模型的 200K 上下文長度,低於 Anthropic 的 1M,因此在發送非常長的提示之前請確認限制。
誰應該切換,誰應該等待
現在切換 如果你進行分類、提取、路由、摘要或文檔 Q&A,且提示遠低於 100K tokens。你將以極低的 token 價格獲得更強大的模型。計劃一小時進行請求代碼的更改,然後在自己的評估中測試努力 low 與 medium。
現在切換 如果你使用大型模型進行子代理工作,這些工作過於合格:從檔案中提取數字、檢查文件、總結工具結果。這是 Anthropic 及其發布客戶強調的角色。
等待一個衝刺 如果你的集成使用計算機使用與 computer_20250124 工具、預填充或 temperature=0。這些都會在 Haiku 5.5 上返回 400,修復它們需要代碼工作,而不是模型字符串的替換。
保持現狀 如果你的工作負載是長提示(通常超過約 77K Haiku 4.5 tokens)、依賴優先級層級或是複雜的代理編碼。對於最後一組,實用的比較是 Haiku 5.5 與 Sonnet 5.5 在每個完成任務的成本,而不是 Haiku 5.5 與 Haiku 4.5 的比較。
當你準備好比較時,AIHubMix 模型列表 將 Haiku 5.5、Sonnet 5.5 和 Opus 5.5 放在一個 API 密鑰後面,因此相同的評估可以針對這三者運行。
常見問題
Claude Haiku 5.5 是否在所有方面都優於 Haiku 4.5?
在 Anthropic 的發布表中的每個基準上,答案是肯定的,通常差距很大。例外是實用性而非質量:不支持優先級層級,超過 100K tokens 的提示每個 token 的成本高於短提示的費率,並且幾種舊的請求模式現在返回錯誤。
Haiku 5.5 真的便宜 90% 嗎?
對於最多 100K tokens 的提示,每個 token 的價格降低了 90%,而超過該數量則降低了 50%。由於新的分詞器計算的 tokens 約多 30%,而思考現在會產生輸出 tokens,Anthropic 估計典型的節省約為 75%。
Haiku 5.5 與 GPT-6 Luna 的比較如何?
兩者的價格均為每百萬個輸入 tokens 0.10 美元和每百萬個輸出 tokens 0.50 美元。在 Anthropic 報告的結果中,Haiku 5.5 在出現的每個基準上得分更高,最明顯的是在計算機使用和 Terminal-Bench 上。Luna 保持其基本價格直到更長的提示長度,因此長提示工作負載應單獨定價。
Haiku 5.5 能取代 Sonnet 5.5 進行編碼嗎?
對於狹窄、範圍明確的變更和子代理任務,可以進行測試。對於複雜的多步代理編碼,Sonnet 5.5 在 Terminal-Bench 4.0 上的得分遠高於 Haiku 5.5(70.6% 對 39.2%),Anthropic 建議對於該工作使用 Sonnet 或 Opus。
基準分數是默認設置嗎?
不是。標題分數是在最大努力下運行的。默認為中等,系統卡報告的結果較低,例如 GDPval-AA 的得分為 1277,而不是 1620。
1M 的上下文窗口是否意味著我可以便宜地發送 1M-token 的提示?
你可以發送它們,但超過 100K tokens 的所有請求都將以每百萬 tokens $0.50 的輸入和 $2.50 的輸出計費。請檢查你的網關列出的上下文限制。
我需要在代碼中更改什麼以進行切換?
至少:模型 ID、任何手動思考預算、任何溫度或 top_p 設置、任何助手預填充,以及將第一個內容區塊讀作答案的代碼。這系列的遷移文章有完整的列表。
繼續閱讀:Claude Haiku 5.5 系列
- 標題分數是在最大努力下運行的,但你可能會在中等或低的情況下進行部署。要了解每個級別的 token 成本以及降級會損失什麼,請閱讀 Claude Haiku 5.5 努力級別:中等是默認,低通常足夠
- 價格為十分之一的數字僅在提示長度低於新分詞器移動的行時成立。要了解工作成本示例和容易忽視的計費規則,請閱讀 Claude Haiku 5.5 定價:90% 削減背後的 100K 行
- 切換不僅僅是模型字符串的更改:五種舊的請求模式現在失效。要了解每個錯誤的原因和修復方法,請閱讀 從 Claude Haiku 4.5 遷移到 5.5:五個 400 錯誤和安靜的變化
來源
- 介紹 Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 遷移指南 (Claude 平台文檔)
- Claude Haiku 5.5 在 AIHubMix 上
- Claude Haiku 5.5:基準、規格、Sol 和 Luna 比較 (Kingy.ai)
- Claude Haiku 5.5 智能、性能和價格分析 (Artificial Analysis)



