Claude Haiku 5.5 与 Haiku 4.5:十美分现在能买到什么

推理时代阅读约 8 分钟
Claude Haiku 5.5 与 Haiku 4.5:十美分现在能买到什么

Claude Haiku 4.5 在 Terminal-Bench 4.0 中得分为 0.0%。Claude Haiku 5.5 的得分为 39.2%,每个 token 的成本仅为十分之一:每百万输入 token 0.10 美元,每百万输出 token 0.50 美元,而 Haiku 4.5 的价格为 1 美元和 5 美元。

这就是升级的一行总结。小型 Claude 模型从“适合分类,不适合代理”变成了可用的子代理,其价格现在与 OpenAI 的 GPT-6 Luna 一致。Anthropic 于 2026 年 10 月 7 日发布了 Claude Haiku 5.5,模型 ID 为 claude-haiku-5-5,并且已经在 AIHubMix 上列出。

价格附带条件,基准分数也是如此。本文涵盖了变化内容、Haiku 5.5 与 Sonnet 5.5 的接近程度、何时是错误选择以及谁应该现在切换。

变化了什么,没变的又是什么

Haiku 4.5 Haiku 5.5
输入/输出价格 1 美元 / 5 美元 0.10 美元 / 0.50 美元
上下文窗口 200K 1M
最大输出 64K 128K
思考 手动预算,默认关闭 自适应,默认开启
努力级别 无 五个,默认中等
相同文本的 tokens 基线 大约多 30%
浏览器使用工具 否 是

Haiku 5.5 的价格适用于最多 100K tokens 的提示;更长的提示支付 0.50 美元 / 2.50 美元。价格是每百万 tokens 的费用。

保持不变的内容:工作描述。Anthropic 仍然将 Haiku 定位于高容量、对成本敏感的工作(摘要、压缩、数据库查询、分类)以及在更大模型下的子代理职责。Anthropic 表示,现有的 Haiku 4.5 提示在没有更改的情况下应该能很好地工作。现有请求代码则是另一个问题:五种在 Haiku 4.5 上有效的请求模式现在返回 400 错误,正如 Anthropic 的 迁移指南 所列,迁移帖子在本系列中进行了详细说明。

两个变化改变了模型的默认行为。思考现在是开启的,除非你将其关闭,因此一个从未提及思考的请求可能会首先返回 thinking 块,并在这些块上消耗输出 tokens。而 Haiku 5.5 是第一个具有 努力设置 的 Haiku,这现在是成本与质量之间的主要调节。

与 Haiku 4.5、Luna 和 Sonnet 5.5 的评分比较

以下数据来自 Anthropic 的发布材料和 Haiku 5.5 系统卡,由 Kingy.ai 汇编。它们是供应商报告的(Anthropic 自己运行了一些 GPT 比较,例如 OSWorld),目前还没有人独立复现完整的表格。

基准 Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (离线) 72.4% 15.7% 48.9% 83.9%
人类最后的考试 45.9% 10.2% n/a 56.9%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 主 46.4% n/a 42.4% 52.1%
图表学 46.4% 6.4% 29.1% 61.6%

人类最后的考试和图表学没有工具。Sonnet 5.5 的 FrontierCode 分数是在高努力下获得的。

三个读数比任何单行更重要:

  • 与 Haiku 4.5 相比,它是一个不同级别的模型。 知识工作评分大致翻倍,代理行的得分从接近零上升到可用。Haiku 4.5 无法完成 Terminal-Bench 任务;Haiku 5.5 大约完成五分之二。
  • 与 GPT-6 Luna 相比,它在每个共享行上领先,价格相同。最大差距出现在计算机使用(72.4% 对 48.9%)和 Terminal-Bench(39.2% 对 16.4%)。
  • 与 Sonnet 5.5 相比,差距取决于任务。 在 FrontierCode 上,Haiku 的得分相差六分。在 Terminal-Bench 上,Sonnet 的得分为 70.6%,而 Haiku 的得分为 39.2%。Anthropic 自身表示,Sonnet 5.5 和 Opus 5.5 仍然是复杂代理编码的更好选择。

在引用这些数字之前,请仔细阅读细则

头条得分是在最大努力下运行的,最昂贵的设置。默认设置为中等,系统卡的中等努力运行的结果较低:例如,GDPval-AA 的得分为 1277,而不是 1620。如果你以默认设置进行部署,请与这些数字进行比较,而不是与发布图表进行比较。

OSWorld 的数据也需要重新审视。72.4% 是部分信用,平均分布在检查点上。Haiku 5.5 完成每个检查点的任务比例为 37.1%(Luna:17.1%)。对于必须完成整个工作的浏览器代理,37.1% 是需要考虑的数字。

早期客户的反馈

Anthropic 的发布帖子引用了几位在发布前测试该模型的客户。这些是供应商选择的,但它们指向相同的工作负载:

  • AlphaSense 每周进行约 800 万次“文档中的提问”调用。在 400 个测试查询中,Haiku 5.5 的得分为 0.84,而 Haiku 4.5 的得分为 0.76。
  • Box 在 Haiku 4.5 的基础上提高了 11 分,延迟约减少了一半。
  • Asana 每个任务的延迟降低了 30% 以上,每个代理回合的推理速度提高了 2.5 倍,与其当前模型相比。
  • HubSpot 在其 CRM 套件上获得了 92.8% 的得分,这是它在该套件上看到的最佳得分。
  • Cognition 在 Devin Fusion 中将 Haiku 5.5 作为 Opus 5.5 的“助手”,并报告这对组合在较低成本和延迟下的 FrontierCode 得分为 66.2。

模式:在文档上进行短期重复工作,以及在更大模型下的子代理职责。

Haiku 5.5 的错误选择

  • 复杂的代理编码。 Terminal-Bench 是 Sonnet 5.5 领先的地方。如果任务需要多个步骤、模糊的要求或长链的编辑,请从 Sonnet 5.5 或 Opus 5.5 开始。
  • 超过 100K tokens 的提示。 1M 窗口是真实的,但价格在整个窗口中并不平坦。超过 100K tokens 的整个请求将转为 0.50 美元 / 2.50 美元,并且由于新的分词器计算的 tokens 大约多 30%,该线在 Haiku 4.5 计算时接近 77K tokens。该系列中的定价帖子详细说明了这些数字。
  • 需要高努力或最大努力才能通过的工作。 在最高设置下,输出变得冗长且昂贵。Anthropic 自身的指导是,在决定之前与 Sonnet 5.5 进行比较。
  • 优先级层的团队。 Haiku 5.5 不支持优先级层,因此 Haiku 4.5 的优先级层承诺不会转移。
  • 安全测试。 Haiku 5.5 的网络安全保障比 Haiku 4.5 更严格,并阻止渗透测试。对于这类工作,预计会出现 refusal 停止原因,并且没有服务器端的回退到其他模型。

通过 AIHubMix 尝试

Haiku 5.5 的努力设置位于消息 API 的 output_config 中,因此 AIHubMix 上的 Claude 原生端点 是最直接的途径。安装当前的 Anthropic SDK (pip install -U anthropic) 并指向 AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # 留出思考的空间,而不仅仅是答案
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "将此票据分类为账单、错误或其他:"
                   "'我在十月被收取了两次费用。'",
    }],
)

# 思考块可能会首先出现,因此按类型选择文本块。
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

第一次运行时要检查的一件事:在相同提示下读取 response.usage.output_tokens 的 low 和 high 值:如果数字没有变化,则努力设置未达到模型。Haiku 5.5 在 AIHubMix 上使用完整的 1M 上下文窗口,因此长提示可以按原样工作;只需记住 100K 的价格线。

谁应该切换,谁应该等待

现在切换 如果你在进行分类、提取、路由、摘要或文档问答,且提示远低于 100K tokens。你将获得一个更强大的模型,且 token 价格仅为十分之一。计划一个小时进行请求代码的更改,然后在自己的评估中测试努力 low 与 medium 的效果。

现在切换 如果你使用大型模型进行过度合格的子代理工作:从文件中提取数据、检查文件、总结工具结果。这是 Anthropic 及其发布客户强调的角色。

等待一个冲刺 如果你的集成使用带有 computer_20250124 工具的计算机使用、预填充或 temperature=0。这些都会在 Haiku 5.5 上返回 400,修复它们需要代码工作,而不是模型字符串的替换。

保持现状 如果你的工作负载是长提示(通常超过约 77K Haiku 4.5 tokens)、依赖优先级层或是复杂的代理编码。对于最后一组,有用的比较是 Haiku 5.5 与 Sonnet 5.5 在每个完成任务的成本,而不是 Haiku 5.5 与 Haiku 4.5 的比较。

当你准备好比较时,AIHubMix 模型列表 将 Haiku 5.5、Sonnet 5.5 和 Opus 5.5 放在一个 API 密钥后面,因此可以对所有三个进行相同的评估。

常见问题

Claude Haiku 5.5 在所有方面都比 Haiku 4.5 更好吗?
在 Anthropic 的发布表中的每个基准上,答案是肯定的,通常差距很大。例外是实际问题而非质量:不支持优先级层,超过 100K tokens 的提示每个 token 的成本高于短提示费率,且几种旧请求模式现在返回错误。

Haiku 5.5 真的便宜 90% 吗?
对于最多 100K tokens 的提示,每个 token 的价格降低了 90%,而超过该数量的价格降低了 50%。根据请求组合(约 90% 的 Haiku 4.5 请求在 100K tokens 以下)和新的分词器(对于相同文本计算的 tokens 大约多 30%),Anthropic 估计平均节省约 75%。默认开启的思考会在此基础上增加输出 tokens,因此你的实际账单也取决于努力设置。

Haiku 5.5 与 GPT-6 Luna 的比较如何?
两者的价格均为每百万输入 tokens 0.10 美元和每百万输出 tokens 0.50 美元。在 Anthropic 报告的结果中,Haiku 5.5 在每个基准上得分更高,尤其是在计算机使用和 Terminal-Bench 上。Luna 保持其基础价格,直到更长的提示长度,因此长提示工作负载应单独定价。

Haiku 5.5 能替代 Sonnet 5.5 进行编码吗?
对于狭窄、范围明确的更改和子代理任务,值得测试。对于复杂的多步骤代理编码,Sonnet 5.5 在 Terminal-Bench 4.0 上得分远高于 Haiku 5.5(70.6% 对 39.2%),Anthropic 推荐使用 Sonnet 或 Opus 进行此类工作。

基准分数是在默认设置下吗?
不是。头条得分是在最大努力下运行的。默认设置为中等,系统卡报告的结果较低,例如 GDPval-AA 的得分为 1277,而不是 1620。

1M 上下文窗口是否意味着我可以便宜地发送 1M-token 的提示?
你可以发送,但超过 100K tokens 的请求将按每百万 tokens 0.50 美元输入和 2.50 美元输出收费。AIHubMix 也支持完整的 1M 窗口。

我需要在代码中做哪些更改才能切换?
至少需要更改:模型 ID、任何手动思考预算、任何温度或 top_p 设置、任何助手预填充,以及读取第一个内容块作为答案的代码。本系列中的迁移帖子提供了完整列表。

继续阅读:Claude Haiku 5.5 系列

来源