Claude Haiku 5.5 是第一個具有努力設定的 Haiku,而這個設定比你控制的其他任何東西都更能影響結果。在人工分析的獨立運行中,Haiku 5.5 在最大努力下的智力指數得分為 43,而在低努力下得分為 29。最大努力還使用了 4.4 億個輸出標記來完成指數;低努力則使用了 3200 萬。
所以簡短的回答是:將大多數工作保持在預設的 medium。將高容量、簡單的路徑降至 low。提升知識工作和嚴格的指令遵循至 high。將 xhigh 和 max 視為需要證據的設定,並在承諾之前將它們與 Sonnet 5.5 進行比較。
本篇文章的其餘部分將顯示每個級別的成本、提升到更高級別何時不再划算,以及在改變努力時哪些設定會失效或變得昂貴。
設定是什麼
Claude Haiku 5.5 支持五個級別:low、medium、high、xhigh 和 max。預設為 medium,這是不同尋常的:大多數當前的 Claude 模型預設為 high,而只有 Haiku 5.5 和 Opus 5.5 的預設級別較低。發送 medium 與不設置該參數是相同的。
努力取代了 Haiku 4.5 使用的手動思考預算。現在,帶有 thinking: {"type": "enabled", "budget_tokens": N} 的請求返回 400,因此沒有舊的數字可以延續。根據 Anthropic 的 努力文檔,你在 output_config 中設置它:
output_config={"effort": "low"}
以下三個事實框架了下面的所有內容:
- 思考預設為開啟。 Haiku 5.5 會進行自適應思考,除非另有指示。較低的努力意味著較少的思考,在簡單的請求中,模型可以完全跳過思考。
- 思考標記是輸出標記。 它們計入
max_tokens,並以輸出速率計費(每百萬個標記 $0.50,適用於最多 100K 標記的提示)。 - 在提示中要求較少的思考無效。 在 Anthropic 的測試中,當提示告訴模型直接回答時,模型仍然會思考。努力是杠杆。
每個級別的成本
兩個獨立來源測量了 Haiku 5.5 在不同努力級別下的表現。指數數據來自 Artificial Analysis;FrontierCode 數據來自 Cognition 的公共結果檔案,由 Kingy.ai 編制。兩者都不涵蓋你的工作負載,因此將它們視為曲線的形狀,而不是你的數字。
Artificial Analysis 智力指數 v4.3.2(十次評估,從知識工作到終端任務):
| 努力 | 指數得分 | 指數的輸出標記 | 每個任務的成本 | 首次標記的時間 |
|---|---|---|---|---|
| low | 29 | 3200萬 | $0.02 | 9.9 秒 |
| medium | 34 | 5400萬 | $0.05 | 13.4 秒 |
| high | 38 | 9700萬 | $0.08 | 28.0 秒 |
| max | 43 | 4.4 億 | $0.21 | n/a |
Artificial Analysis 沒有發布 xhigh 的運行結果。其最大努力的延遲數據看起來異常,因此被省略。
FrontierCode 1.1 主,Haiku 5.5 在 Claude Code 中運行:
| 努力 | 綜合得分 | 每次推出的成本 | 每次推出的輸出標記 |
|---|---|---|---|
| low | 34.8% | $0.06 | 23,868 |
| medium | 41.6% | $0.13 | 36,172 |
| high | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| max | 46.4% | $1.33 | 181,387 |
成本四捨五入到分。
將這兩個表一起閱讀,有三件事特別突出。
從低到中是最便宜的升級。 在指數上,它以約 1.7 倍的輸出標記購買了 5 分。在 FrontierCode 上,它以約兩倍的推出成本購買了 6.8 分。
從中到高可能是平的。 在 FrontierCode 上,高的得分比中高 0.3 分,成本約為兩倍。在更廣泛的指數上,高確實增加了 4 分。你的工作負載看起來像第一種情況還是第二種情況,正是快速評估告訴你的。
最高的兩個級別很昂貴。 從高到最大,在指數上,輸出標記增加了約 4.5 倍,得分增加了 5 分。在 FrontierCode 上,最大成本約為中等的十倍,得分增加了 4.8 分,而從 xhigh 到 max 的步驟大約使成本翻倍,得分增加 0.6 分。Anthropic 自己的指導以更簡單的術語說明了同樣的事情:僅在評估顯示收益的情況下使用 xhigh 和 max,並首先將它們與 Sonnet 5.5 在性能、成本和速度上進行比較。
預設的重要性還有一個原因:Anthropic 的啟動基準是在最大努力下運行的。系統卡的中等努力結果較低(在 GDPval-AA 上為 1277,而不是 1620)。如果你以預設值進行部署,這些就是需要比較的數字。
根據工作負載開始的地方
| 工作負載 | 從哪裡開始 | 何時升級 |
|---|---|---|
| 分類、路由、標記 | low | 在困難案例中標籤漂移 |
| 從短文檔中提取 | low | 字段被遺漏或合併 |
| 聊天和實時支持 | low | 在長聊天中規則滑動 |
| 摘要和壓縮 | medium | 關鍵細節遺漏 |
| 在更大模型下的子代理工作 | medium | 主模型重新做工作 |
| 代理編碼,狹窄變更 | medium | 測試在第一次嘗試中失敗 |
| 知識工作,長期代理任務 | high | 評估顯示潛力 |
這些起始點遵循 Anthropic 對 Haiku 5.5 的指導;“升級”信號是你在自己的日誌中需要注意的。
值得再次關注的一行是聊天。低等是最快的級別,適合實時支持。但 Anthropic 建議在指令遵循最重要的情況下使用 high,例如當支持助手必須在用戶爭論時遵循其系統提示規則。對於過去出錯的對話,測試兩者。
當努力改變時,什麼會失效或變得昂貴
小的 max_tokens 可能會在回覆開始之前結束回覆。 思考計入 max_tokens。一個為一個單詞分類設置的上限,例如 50 個標記,可能會完全用於思考,回覆以 stop_reason: "max_tokens" 結束,沒有文本。提高上限以留出空間,或降低努力。
在對話中改變努力會重置緩存。 在請求之間改變頂級努力值會使該對話的提示緩存失效。如果代理在 low 對話中需要一次 high 的困難轉折,Anthropic 提供了一個每條消息的努力變更(beta 標頭 mid-conversation-output-config-2026-07-01,Claude API 和 Google Cloud),可以保持緩存。這需要思考開啟。檢查網關是否通過該 beta 標頭是值得的,然後再依賴它。
關閉思考有其限制。 thinking: {"type": "disabled"} 在 low、medium 和 high 下被接受。在 xhigh 或 max 下返回 400。關閉思考後,每條消息的努力變更也會返回 400,並且模型可能會跳過它需要的工具調用,當同一請求要求 JSON 輸出時。Anthropic 的建議是保持思考開啟,並使用較低的努力級別。
低努力可能會提前停止。 在 low 下使用長編碼代理系統提示時,Haiku 5.5 有時會在工作完成之前停止並將任務交回。在 Anthropic 的測試中,從 low 轉到 medium 大約減少了一半的提前停止,並且每次嘗試的輸出標記增加了兩倍多。Haiku 5.5 提示指南 中有一個簡短的“繼續工作直到完成”的指令,解決了同樣的問題,價格較低。
低和中可能會跳過驗證。 在編碼任務中,模型有時會報告變更已完成,而不進行測試。提示指南中有一段驗證段落;這會消耗標記,但會提高檢查變更的比例。
xhigh 可能會返回空回覆。 在 xhigh 的多輪聊天中,模型有時會將整個答案寫在思考中,並以沒有可見文本結束該輪。如果你在 xhigh 下運行,請檢查空文本塊。
強制工具會跳過思考。 Haiku 5.5 接受強制的 tool_choice,但回覆將以工具調用開始,沒有思考。如果模型需要在調用工具之前進行推理,請使用 auto,並在提示中說明何時調用它。
通過 AIHubMix 運行自己的努力掃描
選擇的最快方法是以兩到三個級別運行相同的 20 到 50 個實際提示,並比較質量、輸出標記和延遲。通過 AIHubMix Claude 原生端點,設置 AIHUBMIX_API_KEY:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Summarize this support ticket in one sentence: ...",
"Extract the invoice number and total from: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Save `text` next to the prompt and grade it against your own rubric.
print(f"{effort}: {out_tokens} output tokens, {seconds:.1f}s total")
如果在 low 和 high 之間的輸出標記幾乎沒有變化,則該設定可能無法到達模型;檢查你的網關轉發的請求。在 AIHubMix 上的 Haiku 5.5 頁面,每個標記的價格在每個努力級別下都是相同的,因此這次掃描的標記數量可以直接轉換為美元。
常見問題
Claude Haiku 5.5 的預設努力級別是什麼?
中等。大多數當前的 Claude 模型預設為高,因此依賴於其他模型預設的代碼將使 Haiku 5.5 運行在較低的一級,除非明確設置努力。
我可以完全關閉思考嗎?
在低、中和高努力下,可以通過將思考設置為禁用來實現。在 xhigh 和 max 下則會返回錯誤。Anthropic 建議降低努力,因為模型可以在簡單請求中自行跳過思考,並保持其工具調用行為不變。
哪個努力級別最便宜?
低。在人工分析的運行中,它使用了約 3200 萬個輸出標記來完成整個指數,而中等為 5400 萬,最大為 4.4 億。每個標記的價格在每個級別下都是相同的;差異在於生成的標記數量。
在 Haiku 5.5 上,最大努力值得嗎?
只有在你自己的評估中有證據的情況下。根據 FrontierCode,最大成本約為中等的十倍,得分增加了 4.8 分。在這種情況下,Anthropic 建議與 Sonnet 5.5 進行比較,後者可能以更低的成本達到相同的質量。
為什麼我的回覆會在沒有文本的情況下停止?
通常是因為思考在答案開始之前就用完了 max_tokens。提高 max_tokens 或降低努力。在 xhigh 的多輪聊天中,空回覆也可能意味著模型將其答案放在思考中。
改變努力會影響提示緩存嗎?
是的。在請求之間改變頂級努力會使該對話的緩存消息失效。每條消息的努力變更,當前在測試版中,可以避免這種情況。
為什麼啟動基準與我在預設下看到的數字不匹配?
啟動數據是在最大努力下運行的。在中等努力下,系統卡報告的得分較低,例如在 GDPval-AA 上為 1277,而不是 1620。
繼續閱讀:Claude Haiku 5.5 系列
- 努力決定你生成的標記數量。要了解 Haiku 5.5 與 Haiku 4.5、GPT-6 Luna 和 Sonnet 5.5 在範圍頂部的比較,請閱讀 Claude Haiku 5.5 vs Haiku 4.5: 現在十美分能買到什麼
- 思考標記按輸出計費,提示長度決定費率卡。要將你的努力選擇轉換為每月帳單,請閱讀 Claude Haiku 5.5 定價:90% 削減背後的 100K 線
- 努力取代了舊的思考預算,舊預算現在返回錯誤。要了解該修復及 Haiku 4.5 的其他變更,請閱讀 從 Claude Haiku 4.5 遷移到 5.5:五個 400 錯誤和安靜的變更
來源
- 努力(Claude 平台文檔)
- 提示 Claude Haiku 5.5(Claude 平台文檔)
- AIHubMix 上的 Claude Haiku 5.5
- Claude Haiku 5.5 智力、性能與價格分析(人工分析)
- Claude Haiku 5.5:基準、規格、Sol 與 Luna 比較(Kingy.ai)



