Claude Haiku 5.5 與 Haiku 4.5:十美分現在能買到什麼

推理時代閱讀約 8 分鐘
Claude Haiku 5.5 與 Haiku 4.5:十美分現在能買到什麼

Claude Haiku 4.5 在 Terminal-Bench 4.0 中得分為 0.0%。Claude Haiku 5.5 的得分為 39.2%,每個 token 的價格僅為十分之一:每百萬個輸入 token 價格為 0.10 美元,每百萬個輸出 token 價格為 0.50 美元,而 Haiku 4.5 的價格為 1 美元和 5 美元。

這就是升級的簡單描述。小型 Claude 模型從「適合分類,不適合代理」變成了一個可用的子代理,現在其價格與 OpenAI 的 GPT-6 Luna 完全相符。Anthropic 於 2026 年 10 月 7 日發布了 Claude Haiku 5.5,模型 ID 為 claude-haiku-5-5,並且已經在 AIHubMix 上列出。

價格附帶條件,基準分數也是如此。這篇文章涵蓋了變化的內容,Haiku 5.5 與 Sonnet 5.5 的接近程度,在哪裡是錯誤的選擇,以及誰應該現在切換。

變化了什麼,沒有變化什麼

Haiku 4.5 Haiku 5.5
輸入/輸出價格 $1 / $5 $0.10 / $0.50
上下文窗口 200K 1M
最大輸出 64K 128K
思考 手動預算,默認關閉 自適應,默認開啟
努力等級 無 五個,默認中等
相同文本的 tokens 基準 約多 30%
瀏覽器使用工具 否 是

Haiku 5.5 的價格適用於最多 100K tokens 的提示;更長的提示則需支付 $0.50 / $2.50。價格以每百萬 tokens 計算。

保持不變的是工作描述。Anthropic 仍然將 Haiku 定位於高容量、對成本敏感的工作(摘要、壓縮、數據庫查詢、分類)以及在更大模型下的子代理職責。Anthropic 表示,現有的 Haiku 4.5 提示應該能夠正常運行,無需更改。現有請求代碼則是另一回事:五種在 Haiku 4.5 上有效的請求模式現在返回 400 錯誤,正如 Anthropic 的 遷移指南 所列,這系列的遷移文章也會詳細說明。

兩個變化改變了模型的默認行為。思考現在是開啟的,除非你將其關閉,因此一個從未提及思考的請求可能會首先返回 thinking 區塊,並在這些區塊上消耗輸出 tokens。而 Haiku 5.5 是第一個具有 努力設置 的 Haiku,這現在是成本和質量之間的主要調整。

它在 Haiku 4.5、Luna 和 Sonnet 5.5 中的得分

以下數據來自 Anthropic 的發布材料和 Haiku 5.5 系統卡,由 Kingy.ai 編輯。這些數據是供應商報告的,Anthropic 自行運行了 GPT 模型,目前尚無人獨立重現完整的表格。

基準 Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (offline) 72.4% 15.7% 48.9% 83.9%
人類最後的考試 45.9% 10.2% n/a 56.9%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 主 46.4% n/a 42.4% 52.1%
圖表學 46.4% 6.4% 29.1% 61.6%

人類最後的考試和圖表學沒有工具。Sonnet 5.5 的 FrontierCode 得分是在 xhigh 努力下獲得的。

三個數據點比任何單一行更重要:

  • 與 Haiku 4.5 相比,它是一個不同類別的模型。 知識工作評分大約翻倍,代理行的得分從接近零提高到可用。Haiku 4.5 無法完成 Terminal-Bench 任務;Haiku 5.5 大約完成五分之二。
  • 與 GPT-6 Luna 相比,它在每個共享行上都領先,價格相同。最明顯的差距在於計算機使用(72.4% 對 48.9%)和 Terminal-Bench(39.2% 對 16.4%)。
  • 與 Sonnet 5.5 相比,差距取決於任務。 在 FrontierCode 上,Haiku 的得分相差六分。在 Terminal-Bench 上,Sonnet 的得分為 70.6%,而 Haiku 的得分為 39.2%。Anthropic 自己表示,Sonnet 5.5 和 Opus 5.5 仍然是複雜代理編碼的更好選擇。

在引用這些數字之前請仔細閱讀細則

標題分數是在最大努力下運行的,這是最昂貴的設置。默認為中等,系統卡的中等努力運行的結果較低:例如 GDPval-AA 的得分為 1277,而不是 1620。如果你以默認設置進行部署,請與這些數字進行比較,而不是發布圖表。

OSWorld 的數據也需要重新檢查。72.4% 是部分信用,平均計算於檢查點。Haiku 5.5 完成每個檢查點的任務比例為 37.1%(Luna:17.1%)。對於必須完成整個工作的瀏覽器代理來說,37.1% 是計劃的數字。

早期客戶的報告

Anthropic 的發布文章引用了幾位在發布前測試該模型的客戶。這些是供應商選擇的,但它們指向相同的工作負載:

  • AlphaSense 每週進行約 800 萬次「文檔查詢」調用。在 400 個測試查詢中,Haiku 5.5 得分為 0.84,而 Haiku 4.5 的得分為 0.76。
  • Box 在 Haiku 4.5 上看到的得分提高了 11 分,延遲約減少了一半。
  • Asana 測量每個任務的延遲降低了 30% 以上,每次代理回合的推理速度提高了最多 2.5 倍,與其當前模型相比。
  • HubSpot 在其 CRM 套件中獲得了 92.8% 的得分,這是它從小型模型中看到的最佳得分。
  • Cognition 在 Devin Fusion 中將 Haiku 5.5 作為 Opus 5.5 的「助手」,並報告該組合在較低的成本和延遲下保持 FrontierCode 得分為 66.2。

模式:在文檔上進行短期重複工作,以及在更大模型下的子代理職責。

Haiku 5.5 的錯誤選擇

  • 複雜的代理編碼。 Terminal-Bench 是 Sonnet 5.5 最具優勢的地方。如果任務需要多個步驟、模糊的要求或長鏈編輯,請從 Sonnet 5.5 或 Opus 5.5 開始。
  • 超過 100K tokens 的提示。 1M 的窗口是真實的,但價格在這方面並不平坦。超過 100K tokens 的整個請求將移至 $0.50 / $2.50,並且由於新的分詞器計算的 tokens 約多 30%,該行在 Haiku 4.5 計算的約 77K tokens 附近。這系列的定價文章會詳細說明這些數字。
  • 需要 xhigh 或 max 才能通過的工作。 在最高設置下,輸出變得冗長且昂貴。Anthropic 自己的指導是,在決定之前與 Sonnet 5.5 進行比較。
  • 優先級層級的團隊。 Haiku 5.5 不支持此功能,因此 Haiku 4.5 的優先級層級承諾不會轉移。
  • 安全測試。 Haiku 5.5 的網絡安全防護比 Haiku 4.5 嚴格,並阻止滲透測試。對於這類工作,預期會出現 refusal 停止原因,且不會有伺服器端的回退到其他模型。

通過 AIHubMix 試用

Haiku 5.5 的努力設置位於消息 API 的 output_config 中,因此 AIHubMix 上的 Claude 原生端點 是最直接的路徑。安裝當前的 Anthropic SDK (pip install -U anthropic) 並將其指向 AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # 留出思考的空間,而不僅僅是答案
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "將此票據分類為計費、錯誤或其他:"
                   "'我在十月被收費兩次。'",
    }],
)

# 思考區塊可能會首先出現,因此按類型選擇文本區塊。
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

第一次運行時要檢查兩件事。在相同提示下,分別查看 low 和 high 的 response.usage.output_tokens:如果數字沒有變化,則努力設置未能到達模型。並注意 AIHubMix 的模型頁面目前列出了該模型的 200K 上下文長度,低於 Anthropic 的 1M,因此在發送非常長的提示之前請確認限制。

誰應該切換,誰應該等待

現在切換 如果你進行分類、提取、路由、摘要或文檔 Q&A,且提示遠低於 100K tokens。你將以極低的 token 價格獲得更強大的模型。計劃一小時進行請求代碼的更改,然後在自己的評估中測試努力 low 與 medium。

現在切換 如果你使用大型模型進行子代理工作,這些工作過於合格:從檔案中提取數字、檢查文件、總結工具結果。這是 Anthropic 及其發布客戶強調的角色。

等待一個衝刺 如果你的集成使用計算機使用與 computer_20250124 工具、預填充或 temperature=0。這些都會在 Haiku 5.5 上返回 400,修復它們需要代碼工作,而不是模型字符串的替換。

保持現狀 如果你的工作負載是長提示(通常超過約 77K Haiku 4.5 tokens)、依賴優先級層級或是複雜的代理編碼。對於最後一組,實用的比較是 Haiku 5.5 與 Sonnet 5.5 在每個完成任務的成本,而不是 Haiku 5.5 與 Haiku 4.5 的比較。

當你準備好比較時,AIHubMix 模型列表 將 Haiku 5.5、Sonnet 5.5 和 Opus 5.5 放在一個 API 密鑰後面,因此相同的評估可以針對這三者運行。

常見問題

Claude Haiku 5.5 是否在所有方面都優於 Haiku 4.5?
在 Anthropic 的發布表中的每個基準上,答案是肯定的,通常差距很大。例外是實用性而非質量:不支持優先級層級,超過 100K tokens 的提示每個 token 的成本高於短提示的費率,並且幾種舊的請求模式現在返回錯誤。

Haiku 5.5 真的便宜 90% 嗎?
對於最多 100K tokens 的提示,每個 token 的價格降低了 90%,而超過該數量則降低了 50%。由於新的分詞器計算的 tokens 約多 30%,而思考現在會產生輸出 tokens,Anthropic 估計典型的節省約為 75%。

Haiku 5.5 與 GPT-6 Luna 的比較如何?
兩者的價格均為每百萬個輸入 tokens 0.10 美元和每百萬個輸出 tokens 0.50 美元。在 Anthropic 報告的結果中,Haiku 5.5 在出現的每個基準上得分更高,最明顯的是在計算機使用和 Terminal-Bench 上。Luna 保持其基本價格直到更長的提示長度,因此長提示工作負載應單獨定價。

Haiku 5.5 能取代 Sonnet 5.5 進行編碼嗎?
對於狹窄、範圍明確的變更和子代理任務,可以進行測試。對於複雜的多步代理編碼,Sonnet 5.5 在 Terminal-Bench 4.0 上的得分遠高於 Haiku 5.5(70.6% 對 39.2%),Anthropic 建議對於該工作使用 Sonnet 或 Opus。

基準分數是默認設置嗎?
不是。標題分數是在最大努力下運行的。默認為中等,系統卡報告的結果較低,例如 GDPval-AA 的得分為 1277,而不是 1620。

1M 的上下文窗口是否意味著我可以便宜地發送 1M-token 的提示?
你可以發送它們,但超過 100K tokens 的所有請求都將以每百萬 tokens $0.50 的輸入和 $2.50 的輸出計費。請檢查你的網關列出的上下文限制。

我需要在代碼中更改什麼以進行切換?
至少:模型 ID、任何手動思考預算、任何溫度或 top_p 設置、任何助手預填充,以及將第一個內容區塊讀作答案的代碼。這系列的遷移文章有完整的列表。

繼續閱讀:Claude Haiku 5.5 系列

來源