Claude Haiku 5.5 的输入令牌费用为每百万 $0.10,输出令牌费用为每百万 $0.50,分别是 Haiku 4.5 的 $1 和 $5 的十分之一。这适用于最多 100,000 个令牌的提示。在这一线以上,整个请求的费用为 $0.50 和 $2.50,这比 Haiku 4.5 的价格便宜一半,而不是十分之一。
Anthropic 将典型的节省估计为约 75%,而不是 90%,这种差异来自于本文讨论的三个方面:您的提示相对于 100K 线的位置、默认设置生成的思考令牌数量,以及一种新的分词器,它将相同的文本计算为大约 30% 更多的令牌。下面的两个实例展示了实际账单的计算方式。
费率卡
每百万令牌的价格,来自 Anthropic 的 Haiku 5.5 发布帖子 和 定价页面:
| 令牌类型 | Haiku 5.5, 短 | Haiku 5.5, 长 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 输入 | $0.10 | $0.50 | $1.00 | $2.00 |
| 输出 | $0.50 | $2.50 | $5.00 | $10.00 |
| 缓存读取 | $0.01 | $0.05 | $0.10 | $0.10 |
| 缓存写入,5分钟 | $0.125 | $0.625 | $1.25 | $2.50 |
| 缓存写入,1小时 | $0.20 | $1.00 | $2.00 | $4.00 |
“短”指的是 100,000 个令牌或更少的提示;“长”指的是超过 100,000 的提示。批量 API 对输入和输出减半。Sonnet 5.5 的缓存读取价格在同一天从 $0.20 降至 $0.10。
AIHubMix 上的 Haiku 5.5 页面 列出了相同的两个层级,网络搜索的费用为每次请求 $0.01。
容易忽视的计费规则
整个请求的计费级别会改变,而不仅仅是超出部分。 Anthropic 根据提示长度为 Haiku 5.5 定价,使用两个费率卡。一个 100,000 个令牌的提示为其输入支付 $0.0100;一个 100,001 个令牌的提示支付 $0.0500,其输出费用也要贵五倍。Haiku 5.5 在这里是个例外:Anthropic 其他当前的 1M 上下文模型会按其标准费率对整个窗口计费。
这一线到达的时间比您旧的仪表板所示的要早。 Haiku 5.5 使用了一种较新的分词器,相同的文本产生的令牌数量比 Haiku 4.5 多约 30%。将 100,000 除以 1.3 后,得到的线大约在 77,000 个令牌,按照 Haiku 4.5 的计算方式。您旧仪表板上的 78,000 个令牌提示在 Haiku 5.5 上变为大约 101,000 个令牌,并支付长费率。这个算式来自于 Anthropic 的迁移指南中的 30% 数据,确切的增加取决于内容,因此请在新模型上重新计算实际提示。
思考默认开启,并按输出计费。 Haiku 4.5 只有在请求时才会思考。Haiku 5.5 在 medium 努力级别下运行自适应思考,除非您进行更改,因此以前返回 200 个输出令牌的路径现在可以返回几百个更多的令牌。
短提示现在可以缓存。 根据 Anthropic 的迁移指南,最小可缓存提示从 Haiku 4.5 的 4,096 个令牌降至 Haiku 5.5 的 512 个令牌。一个 3,000 个令牌的系统提示在 Haiku 4.5 上无法缓存,现在可以缓存,并且缓存读取的费用是输入费率的十分之一。
优先级层级不可用。 如果您在 Haiku 4.5 上持有优先级层级的承诺,则不会转移到 Haiku 5.5。请单独规划容量。
缓存令牌和 100K 线:假设它们计入。 Anthropic 为每个层级列出了单独的缓存读取价格,这表明整个提示,无论是否缓存,决定了层级。Anthropic 并没有明确说明这一点,因此安全的假设是,95K 的缓存前缀加上 6K 的问题是一个长提示。
实例 1:支持票分类器
假设,在 Haiku 4.5 的令牌计数中:一个包含工具定义的 3,000 个令牌的系统提示,一个 1,000 个令牌的票据,一个 200 个令牌的答案,以及每月 1,000,000 次请求。Haiku 4.5 在思考关闭的情况下运行。
在 Haiku 5.5 中,相同的文本变为 3,900 + 1,300 个输入令牌和一个 260 个令牌的答案。假设思考在 low 努力级别下增加 300 个令牌,在 medium 努力级别下增加 800 个令牌。这些思考数据是假设;请测量您的数据。
| 设置 | 每次请求 | 每月 |
|---|---|---|
| Haiku 4.5 | $0.00500 | $5,000 |
| Haiku 5.5, 低,无缓存 | $0.00080 | $800 |
| Haiku 5.5, 低,缓存前缀 | $0.00045 | $453 |
| Haiku 5.5, 中,缓存前缀 | $0.00070 | $703 |
| Sonnet 5.5, 中,缓存前缀 | $0.01359 | $13,674 |
每月缓存行包括大约 $4 的 Haiku 5.5 缓存写入和大约 $84 的 Sonnet 5.5 缓存写入,假设每五分钟写入一次 5 分钟的缓存。Sonnet 5.5 使用与 Haiku 相同的令牌假设,努力级别为中。
缓存 low 行的计算方式:3,900 个缓存令牌每百万 $0.01($0.000039),加上 1,300 个新输入令牌每百万 $0.10($0.00013),再加上 560 个输出令牌每百万 $0.50($0.00028),总计每次请求 $0.000449。
模式:缓存和努力级别共同将账单从旧费用的 16%(无缓存,低)降低到 9%(缓存,低)。在这个量级下,将努力级别保持在默认值而不是 low 每月增加大约 $250。与 Haiku 4.5 的 $5,000 相比,这两种选择在绝对值上都没有太大影响,这就是为什么分类器案例是 90% 标题真实的原因。
实例 2:跨越界限的合同审查
假设,在 Haiku 4.5 的令牌计数中:一个包含指令的合同 70,000 个令牌,一个 1,500 个令牌的答案,无缓存。在 Haiku 5.5 中,这变为 91,000 个输入令牌,一个 1,950 个令牌的答案,以及假设的 2,000 个思考令牌,努力级别为 medium,因此输出令牌为 3,950 个。
现在将合同长度增加 14%:在 Haiku 4.5 中为 80,000 个令牌,在 Haiku 5.5 中为 104,000 个令牌。
| 合同大小(Haiku 4.5 计数) | Haiku 4.5 | Haiku 5.5 | 变化 |
|---|---|---|---|
| 70,000 个令牌 | $0.0775 | $0.0111 | 降低 86% |
| 80,000 个令牌 | $0.0875 | $0.0619 | 降低 29% |
第二行:104,000 个输入令牌每百万 $0.50($0.052)加上 3,950 个输出令牌每百万 $2.50($0.0099)。多出 14% 的文本在 Haiku 5.5 上的费用是 5.6 倍。
解决方案是保持在这一线以下。将较长的合同分成两个约 53,000 个令牌的调用(每个合同的一半加上指令)总共花费约 $0.015,低于单个长调用的四分之一。是否可以拆分取决于任务;逐条审查条款可以干净地拆分,而需要整个文档一次性处理的问题则不行。
按任务成本比较
与 Sonnet 5.5 相比,Haiku 5.5 在短提示上的每令牌价格约为其二十分之一。但每令牌的价格并不是每完成任务的价格。在复杂的代理编码中,Sonnet 5.5 在 Terminal-Bench 4.0 上的得分为 70.6%,而 Haiku 5.5 的得分为 39.2%,这是 Anthropic 报告的结果,而一个失败并重新尝试的便宜请求,或者由更大模型重新处理的请求,并不便宜。Anthropic 自己的建议是在以 xhigh 或 max 运行 Haiku 之前,先与 Sonnet 5.5 进行比较。Sonnet 5.5 在同一天也降价:其缓存读取费用减半,Anthropic 表示这将大约减少 20% 的大多数代理工作。
与 GPT-6 Luna 相比,短提示的列表价格是相同的,包括缓存读取。不同之处在于长提示的规则。Luna 的 长上下文费率 从 272,000 个输入令牌以上开始,费用为 $0.20 / $0.75,而 Haiku 5.5 的费用从 100,000 个以上开始,为 $0.50 / $2.50。在 100K 和 272K 令牌之间的工作负载中,Luna 的列表价格要便宜得多。这两个模型使用不同的分词器,因此请比较实际账单,而不是令牌计数。
关于 100K 阈值和分词器效果的数据也已通过 Roo 的新闻通讯 进行了讨论,其算式与上述示例相匹配。
降低账单的步骤
- 在新模型上计算令牌,并在 100K 前发出警报。 记录每个请求的完整提示大小,并在大约 90,000 个令牌时发出警报,以便在提示上升时进行修剪或拆分,以免改变层级。
- 缓存稳定前缀。 首先是系统提示和工具定义,最后是可变内容。由于最小为 512 个令牌,现在大多数生产系统提示都符合条件。AIHubMix 的 Claude 提示缓存指南 显示请求格式。
- 明确设置努力级别。 对于高流量、简单的路径使用
low。默认的medium在每个请求中都要花费更多,无论该路径是否需要。 - 为思考和答案设置 max_tokens。 太小会导致您为没有答案的思考付费。
- 批量处理可以等待的请求。 批量 API 将输入和输出费率减半。
- 向上路由而不是向下重试。 如果某种任务类型在 Haiku 上经常失败,请先将其发送到 Sonnet 5.5,而不是支付 Haiku 尝试加上后备费用。
步骤 1 和 2 的记录模式通过 AIHubMix 的 Claude 原生端点:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
SYSTEM_PROMPT = "您对支持票进行分类..." # 稳定的、可缓存的前缀
def classify(ticket: str) -> str:
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=1024,
output_config={"effort": "low"},
system=[{"type": "text", "text": SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}}],
messages=[{"role": "user", "content": ticket}],
)
u = r.usage
prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
+ (u.cache_creation_input_tokens or 0))
if prompt_tokens > 90_000:
print(f"警告:提示为 {prompt_tokens} 个令牌,接近 100K 价格线")
return next(b.text for b in r.content if b.type == "text")
如果 cache_read_input_tokens 在重复调用中保持为零,则表示请求之间的前缀发生了变化,例如系统提示中的时间戳。
常见问题
Claude Haiku 5.5 的费用是多少?
对于最多 100,000 个令牌的提示,输入令牌为每百万 $0.10,输出令牌为每百万 $0.50。对于更长的提示,费用为 $0.50 和 $2.50,适用于整个请求。缓存读取的费用是输入费率的十分之一,批量 API 将输入和输出价格减半。
Haiku 5.5 真的是比 Haiku 4.5 便宜 90% 吗?
按令牌计算,在短提示上是的。按任务计算则少一些:新的分词器将相同文本计算为大约 30% 更多的令牌,思考默认开启,长提示仅获得 50% 的折扣。Anthropic 估计典型的节省约为 75%。使用缓存的短提示分类器可以节省约 90%。
如果我的提示刚刚超过 100,000 个令牌会发生什么?
整个请求将转到更高的费率卡,输入和输出都一样。在上面的合同示例中,多出 14% 的文本使请求的费用增加了 5.6 倍。
缓存令牌计入 100K 阈值吗?
Anthropic 尚未明确说明这一点。其定价为每个层级列出了单独的缓存读取价格,因此安全的假设是,整个提示,无论是否缓存,决定了层级。
思考令牌需要额外费用吗?
它们按正常输出费率计费。由于思考默认开启且努力级别为中,因此它们可能会显著增加原本只产生短答案的路径。降低努力级别会减少它们。
Haiku 5.5 比 GPT-6 Luna 便宜吗?
在最多 100K 个令牌的提示上,列表价格是相同的。在 100K 和 272K 令牌之间,Luna 保持其基本费率,而 Haiku 5.5 则转到更高的费率,因此在列表价格上 Luna 更便宜。分词器不同,因此请比较实际账单。
我可以在 Haiku 5.5 上使用优先级层级吗?
不可以。Haiku 5.5 不支持优先级层级,因此在 Haiku 4.5 上的承诺不会转移。
继续阅读:Claude Haiku 5.5 系列
- 低每令牌价格只有在模型能够完成任务时才有意义。要了解 Haiku 5.5 与 Haiku 4.5、GPT-6 Luna 和 Sonnet 5.5 的比较,请阅读 Claude Haiku 5.5 vs Haiku 4.5:十美分现在能买到什么
- 思考令牌是上述示例中最大的假设。有关每个努力级别的测量令牌计数,请阅读 Claude Haiku 5.5 努力级别:中是默认,低通常足够
- 分词器的变化和新的缓存最小值也显示为迁移工作。有关从 Haiku 4.5 切换到 5.5 时预期的错误和微小变化,请阅读 从 Claude Haiku 4.5 迁移到 5.5:五个 400 错误和微小变化
来源
- 定价(Claude 平台文档)
- 介绍 Claude Haiku 5.5(Anthropic)
- AIHubMix 上的 Claude Haiku 5.5
- Claude Haiku 5.5 以每百万 $0.10 发布。迁移前请阅读 100K 规则(Roo 的新闻通讯)
- GPT-6 Luna API 定价(OpenRouter)



