Claude Haiku 4.5 在 Terminal-Bench 4.0 中得分为 0.0%。Claude Haiku 5.5 的得分为 39.2%,每个 token 的成本仅为十分之一:每百万输入 token 0.10 美元,每百万输出 token 0.50 美元,而 Haiku 4.5 的价格为 1 美元和 5 美元。
这就是升级的一行总结。小型 Claude 模型从“适合分类,不适合代理”变成了可用的子代理,其价格现在与 OpenAI 的 GPT-6 Luna 一致。Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5,模型 ID 为 claude-haiku-5-5,并且已经在 AIHubMix 上列出。
价格附带条件,基准分数也是如此。本文涵盖了变化内容、Haiku 5.5 与 Sonnet 5.5 的接近程度、何时是错误选择以及谁应该现在切换。
变化了什么,没变的又是什么
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| 输入/输出价格 | 1 美元 / 5 美元 | 0.10 美元 / 0.50 美元 |
| 上下文窗口 | 200K | 1M |
| 最大输出 | 64K | 128K |
| 思考 | 手动预算,默认关闭 | 自适应,默认开启 |
| 努力级别 | 无 | 五个,默认中等 |
| 相同文本的 tokens | 基线 | 大约多 30% |
| 浏览器使用工具 | 否 | 是 |
Haiku 5.5 的价格适用于最多 100K tokens 的提示;更长的提示支付 0.50 美元 / 2.50 美元。价格是每百万 tokens 的费用。
保持不变的内容:工作描述。Anthropic 仍然将 Haiku 定位于高容量、对成本敏感的工作(摘要、压缩、数据库查询、分类)以及在更大模型下的子代理职责。Anthropic 表示,现有的 Haiku 4.5 提示在没有更改的情况下应该能很好地工作。现有请求代码则是另一个问题:五种在 Haiku 4.5 上有效的请求模式现在返回 400 错误,正如 Anthropic 的 迁移指南 所列,迁移帖子在本系列中进行了详细说明。
两个变化改变了模型的默认行为。思考现在是开启的,除非你将其关闭,因此一个从未提及思考的请求可能会首先返回 thinking 块,并在这些块上消耗输出 tokens。而 Haiku 5.5 是第一个具有 努力设置 的 Haiku,这现在是成本与质量之间的主要调节。
与 Haiku 4.5、Luna 和 Sonnet 5.5 的评分比较
以下数据来自 Anthropic 的发布材料和 Haiku 5.5 系统卡,由 Kingy.ai 汇编。它们是供应商报告的(Anthropic 自己运行了一些 GPT 比较,例如 OSWorld),目前还没有人独立复现完整的表格。
| 基准 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (离线) | 72.4% | 15.7% | 48.9% | 83.9% |
| 人类最后的考试 | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 主 | 46.4% | n/a | 42.4% | 52.1% |
| 图表学 | 46.4% | 6.4% | 29.1% | 61.6% |
人类最后的考试和图表学没有工具。Sonnet 5.5 的 FrontierCode 分数是在高努力下获得的。
三个读数比任何单行更重要:
- 与 Haiku 4.5 相比,它是一个不同级别的模型。 知识工作评分大致翻倍,代理行的得分从接近零上升到可用。Haiku 4.5 无法完成 Terminal-Bench 任务;Haiku 5.5 大约完成五分之二。
- 与 GPT-6 Luna 相比,它在每个共享行上领先,价格相同。最大差距出现在计算机使用(72.4% 对 48.9%)和 Terminal-Bench(39.2% 对 16.4%)。
- 与 Sonnet 5.5 相比,差距取决于任务。 在 FrontierCode 上,Haiku 的得分相差六分。在 Terminal-Bench 上,Sonnet 的得分为 70.6%,而 Haiku 的得分为 39.2%。Anthropic 自身表示,Sonnet 5.5 和 Opus 5.5 仍然是复杂代理编码的更好选择。
在引用这些数字之前,请仔细阅读细则
头条得分是在最大努力下运行的,最昂贵的设置。默认设置为中等,系统卡的中等努力运行的结果较低:例如,GDPval-AA 的得分为 1277,而不是 1620。如果你以默认设置进行部署,请与这些数字进行比较,而不是与发布图表进行比较。
OSWorld 的数据也需要重新审视。72.4% 是部分信用,平均分布在检查点上。Haiku 5.5 完成每个检查点的任务比例为 37.1%(Luna:17.1%)。对于必须完成整个工作的浏览器代理,37.1% 是需要考虑的数字。
早期客户的反馈
Anthropic 的发布帖子引用了几位在发布前测试该模型的客户。这些是供应商选择的,但它们指向相同的工作负载:
- AlphaSense 每周进行约 800 万次“文档中的提问”调用。在 400 个测试查询中,Haiku 5.5 的得分为 0.84,而 Haiku 4.5 的得分为 0.76。
- Box 在 Haiku 4.5 的基础上提高了 11 分,延迟约减少了一半。
- Asana 每个任务的延迟降低了 30% 以上,每个代理回合的推理速度提高了 2.5 倍,与其当前模型相比。
- HubSpot 在其 CRM 套件上获得了 92.8% 的得分,这是它在该套件上看到的最佳得分。
- Cognition 在 Devin Fusion 中将 Haiku 5.5 作为 Opus 5.5 的“助手”,并报告这对组合在较低成本和延迟下的 FrontierCode 得分为 66.2。
模式:在文档上进行短期重复工作,以及在更大模型下的子代理职责。
Haiku 5.5 的错误选择
- 复杂的代理编码。 Terminal-Bench 是 Sonnet 5.5 领先的地方。如果任务需要多个步骤、模糊的要求或长链的编辑,请从 Sonnet 5.5 或 Opus 5.5 开始。
- 超过 100K tokens 的提示。 1M 窗口是真实的,但价格在整个窗口中并不平坦。超过 100K tokens 的整个请求将转为 0.50 美元 / 2.50 美元,并且由于新的分词器计算的 tokens 大约多 30%,该线在 Haiku 4.5 计算时接近 77K tokens。该系列中的定价帖子详细说明了这些数字。
- 需要高努力或最大努力才能通过的工作。 在最高设置下,输出变得冗长且昂贵。Anthropic 自身的指导是,在决定之前与 Sonnet 5.5 进行比较。
- 优先级层的团队。 Haiku 5.5 不支持优先级层,因此 Haiku 4.5 的优先级层承诺不会转移。
- 安全测试。 Haiku 5.5 的网络安全保障比 Haiku 4.5 更严格,并阻止渗透测试。对于这类工作,预计会出现
refusal停止原因,并且没有服务器端的回退到其他模型。
通过 AIHubMix 尝试
Haiku 5.5 的努力设置位于消息 API 的 output_config 中,因此 AIHubMix 上的 Claude 原生端点 是最直接的途径。安装当前的 Anthropic SDK (pip install -U anthropic) 并指向 AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # 留出思考的空间,而不仅仅是答案
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "将此票据分类为账单、错误或其他:"
"'我在十月被收取了两次费用。'",
}],
)
# 思考块可能会首先出现,因此按类型选择文本块。
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
第一次运行时要检查的一件事:在相同提示下读取 response.usage.output_tokens 的 low 和 high 值:如果数字没有变化,则努力设置未达到模型。Haiku 5.5 在 AIHubMix 上使用完整的 1M 上下文窗口,因此长提示可以按原样工作;只需记住 100K 的价格线。
谁应该切换,谁应该等待
现在切换 如果你在进行分类、提取、路由、摘要或文档问答,且提示远低于 100K tokens。你将获得一个更强大的模型,且 token 价格仅为十分之一。计划一个小时进行请求代码的更改,然后在自己的评估中测试努力 low 与 medium 的效果。
现在切换 如果你使用大型模型进行过度合格的子代理工作:从文件中提取数据、检查文件、总结工具结果。这是 Anthropic 及其发布客户强调的角色。
等待一个冲刺 如果你的集成使用带有 computer_20250124 工具的计算机使用、预填充或 temperature=0。这些都会在 Haiku 5.5 上返回 400,修复它们需要代码工作,而不是模型字符串的替换。
保持现状 如果你的工作负载是长提示(通常超过约 77K Haiku 4.5 tokens)、依赖优先级层或是复杂的代理编码。对于最后一组,有用的比较是 Haiku 5.5 与 Sonnet 5.5 在每个完成任务的成本,而不是 Haiku 5.5 与 Haiku 4.5 的比较。
当你准备好比较时,AIHubMix 模型列表 将 Haiku 5.5、Sonnet 5.5 和 Opus 5.5 放在一个 API 密钥后面,因此可以对所有三个进行相同的评估。
常见问题
Claude Haiku 5.5 在所有方面都比 Haiku 4.5 更好吗?
在 Anthropic 的发布表中的每个基准上,答案是肯定的,通常差距很大。例外是实际问题而非质量:不支持优先级层,超过 100K tokens 的提示每个 token 的成本高于短提示费率,且几种旧请求模式现在返回错误。
Haiku 5.5 真的便宜 90% 吗?
对于最多 100K tokens 的提示,每个 token 的价格降低了 90%,而超过该数量的价格降低了 50%。根据请求组合(约 90% 的 Haiku 4.5 请求在 100K tokens 以下)和新的分词器(对于相同文本计算的 tokens 大约多 30%),Anthropic 估计平均节省约 75%。默认开启的思考会在此基础上增加输出 tokens,因此你的实际账单也取决于努力设置。
Haiku 5.5 与 GPT-6 Luna 的比较如何?
两者的价格均为每百万输入 tokens 0.10 美元和每百万输出 tokens 0.50 美元。在 Anthropic 报告的结果中,Haiku 5.5 在每个基准上得分更高,尤其是在计算机使用和 Terminal-Bench 上。Luna 保持其基础价格,直到更长的提示长度,因此长提示工作负载应单独定价。
Haiku 5.5 能替代 Sonnet 5.5 进行编码吗?
对于狭窄、范围明确的更改和子代理任务,值得测试。对于复杂的多步骤代理编码,Sonnet 5.5 在 Terminal-Bench 4.0 上得分远高于 Haiku 5.5(70.6% 对 39.2%),Anthropic 推荐使用 Sonnet 或 Opus 进行此类工作。
基准分数是在默认设置下吗?
不是。头条得分是在最大努力下运行的。默认设置为中等,系统卡报告的结果较低,例如 GDPval-AA 的得分为 1277,而不是 1620。
1M 上下文窗口是否意味着我可以便宜地发送 1M-token 的提示?
你可以发送,但超过 100K tokens 的请求将按每百万 tokens 0.50 美元输入和 2.50 美元输出收费。AIHubMix 也支持完整的 1M 窗口。
我需要在代码中做哪些更改才能切换?
至少需要更改:模型 ID、任何手动思考预算、任何温度或 top_p 设置、任何助手预填充,以及读取第一个内容块作为答案的代码。本系列中的迁移帖子提供了完整列表。
继续阅读:Claude Haiku 5.5 系列
- 头条得分是在最大努力下运行的,但你可能会以中等或低的设置进行部署。要了解每个级别在 tokens 中的成本以及降低设置时会损失什么,请阅读 Claude Haiku 5.5 努力级别:中等是默认,低通常足够
- 价格仅在提示长度线以下保持十分之一的价格,而新的分词器会移动该线。有关工作成本示例和容易遗漏的计费规则,请阅读 Claude Haiku 5.5 定价:90% 削减背后的 100K 线
- 切换不仅仅是模型字符串的更改:五种旧请求模式现在失败。有关每个错误、其原因和修复方法,请阅读 从 Claude Haiku 4.5 迁移到 5.5:五个 400 错误和静默变化
来源
- 介绍 Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 迁移指南 (Claude 平台文档)
- AIHubMix 上的 Claude Haiku 5.5
- Claude Haiku 5.5:基准、规格、Sol 和 Luna 比较 (Kingy.ai)
- Claude Haiku 5.5 智能、性能与价格分析 (Artificial Analysis)



