Claude Haiku 5.5 定价:90% 降价背后的 100K 线

推理时代阅读约 8 分钟
Claude Haiku 5.5 定价:90% 降价背后的 100K 线

Claude Haiku 5.5 的输入令牌费用为每百万 $0.10,输出令牌费用为每百万 $0.50,分别是 Haiku 4.5 的 $1 和 $5 的十分之一。这适用于最多 100,000 个令牌的提示。在这一线以上,整个请求的费用为 $0.50 和 $2.50,这比 Haiku 4.5 的价格便宜一半,而不是十分之一。

Anthropic 将典型的节省估计为约 75%,而不是 90%,这种差异来自于本文讨论的三个方面:您的提示相对于 100K 线的位置、默认设置生成的思考令牌数量,以及一种新的分词器,它将相同的文本计算为大约 30% 更多的令牌。下面的两个实例展示了实际账单的计算方式。

费率卡

每百万令牌的价格,来自 Anthropic 的 Haiku 5.5 发布帖子 和 定价页面:

令牌类型 Haiku 5.5, 短 Haiku 5.5, 长 Haiku 4.5 Sonnet 5.5
输入 $0.10 $0.50 $1.00 $2.00
输出 $0.50 $2.50 $5.00 $10.00
缓存读取 $0.01 $0.05 $0.10 $0.10
缓存写入,5分钟 $0.125 $0.625 $1.25 $2.50
缓存写入,1小时 $0.20 $1.00 $2.00 $4.00

“短”指的是 100,000 个令牌或更少的提示;“长”指的是超过 100,000 的提示。批量 API 对输入和输出减半。Sonnet 5.5 的缓存读取价格在同一天从 $0.20 降至 $0.10。

AIHubMix 上的 Haiku 5.5 页面 列出了相同的两个层级,网络搜索的费用为每次请求 $0.01。

容易忽视的计费规则

整个请求的计费级别会改变,而不仅仅是超出部分。 Anthropic 根据提示长度为 Haiku 5.5 定价,使用两个费率卡。一个 100,000 个令牌的提示为其输入支付 $0.0100;一个 100,001 个令牌的提示支付 $0.0500,其输出费用也要贵五倍。Haiku 5.5 在这里是个例外:Anthropic 其他当前的 1M 上下文模型会按其标准费率对整个窗口计费。

这一线到达的时间比您旧的仪表板所示的要早。 Haiku 5.5 使用了一种较新的分词器,相同的文本产生的令牌数量比 Haiku 4.5 多约 30%。将 100,000 除以 1.3 后,得到的线大约在 77,000 个令牌,按照 Haiku 4.5 的计算方式。您旧仪表板上的 78,000 个令牌提示在 Haiku 5.5 上变为大约 101,000 个令牌,并支付长费率。这个算式来自于 Anthropic 的迁移指南中的 30% 数据,确切的增加取决于内容,因此请在新模型上重新计算实际提示。

思考默认开启,并按输出计费。 Haiku 4.5 只有在请求时才会思考。Haiku 5.5 在 medium 努力级别下运行自适应思考,除非您进行更改,因此以前返回 200 个输出令牌的路径现在可以返回几百个更多的令牌。

短提示现在可以缓存。 根据 Anthropic 的迁移指南,最小可缓存提示从 Haiku 4.5 的 4,096 个令牌降至 Haiku 5.5 的 512 个令牌。一个 3,000 个令牌的系统提示在 Haiku 4.5 上无法缓存,现在可以缓存,并且缓存读取的费用是输入费率的十分之一。

优先级层级不可用。 如果您在 Haiku 4.5 上持有优先级层级的承诺,则不会转移到 Haiku 5.5。请单独规划容量。

缓存令牌和 100K 线:假设它们计入。 Anthropic 为每个层级列出了单独的缓存读取价格,这表明整个提示,无论是否缓存,决定了层级。Anthropic 并没有明确说明这一点,因此安全的假设是,95K 的缓存前缀加上 6K 的问题是一个长提示。

实例 1:支持票分类器

假设,在 Haiku 4.5 的令牌计数中:一个包含工具定义的 3,000 个令牌的系统提示,一个 1,000 个令牌的票据,一个 200 个令牌的答案,以及每月 1,000,000 次请求。Haiku 4.5 在思考关闭的情况下运行。

在 Haiku 5.5 中,相同的文本变为 3,900 + 1,300 个输入令牌和一个 260 个令牌的答案。假设思考在 low 努力级别下增加 300 个令牌,在 medium 努力级别下增加 800 个令牌。这些思考数据是假设;请测量您的数据。

设置 每次请求 每月
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, 低,无缓存 $0.00080 $800
Haiku 5.5, 低,缓存前缀 $0.00045 $453
Haiku 5.5, 中,缓存前缀 $0.00070 $703
Sonnet 5.5, 中,缓存前缀 $0.01359 $13,674

每月缓存行包括大约 $4 的 Haiku 5.5 缓存写入和大约 $84 的 Sonnet 5.5 缓存写入,假设每五分钟写入一次 5 分钟的缓存。Sonnet 5.5 使用与 Haiku 相同的令牌假设,努力级别为中。

缓存 low 行的计算方式:3,900 个缓存令牌每百万 $0.01($0.000039),加上 1,300 个新输入令牌每百万 $0.10($0.00013),再加上 560 个输出令牌每百万 $0.50($0.00028),总计每次请求 $0.000449。

模式:缓存和努力级别共同将账单从旧费用的 16%(无缓存,低)降低到 9%(缓存,低)。在这个量级下,将努力级别保持在默认值而不是 low 每月增加大约 $250。与 Haiku 4.5 的 $5,000 相比,这两种选择在绝对值上都没有太大影响,这就是为什么分类器案例是 90% 标题真实的原因。

实例 2:跨越界限的合同审查

假设,在 Haiku 4.5 的令牌计数中:一个包含指令的合同 70,000 个令牌,一个 1,500 个令牌的答案,无缓存。在 Haiku 5.5 中,这变为 91,000 个输入令牌,一个 1,950 个令牌的答案,以及假设的 2,000 个思考令牌,努力级别为 medium,因此输出令牌为 3,950 个。

现在将合同长度增加 14%:在 Haiku 4.5 中为 80,000 个令牌,在 Haiku 5.5 中为 104,000 个令牌。

合同大小(Haiku 4.5 计数) Haiku 4.5 Haiku 5.5 变化
70,000 个令牌 $0.0775 $0.0111 降低 86%
80,000 个令牌 $0.0875 $0.0619 降低 29%

第二行:104,000 个输入令牌每百万 $0.50($0.052)加上 3,950 个输出令牌每百万 $2.50($0.0099)。多出 14% 的文本在 Haiku 5.5 上的费用是 5.6 倍。

解决方案是保持在这一线以下。将较长的合同分成两个约 53,000 个令牌的调用(每个合同的一半加上指令)总共花费约 $0.015,低于单个长调用的四分之一。是否可以拆分取决于任务;逐条审查条款可以干净地拆分,而需要整个文档一次性处理的问题则不行。

按任务成本比较

与 Sonnet 5.5 相比,Haiku 5.5 在短提示上的每令牌价格约为其二十分之一。但每令牌的价格并不是每完成任务的价格。在复杂的代理编码中,Sonnet 5.5 在 Terminal-Bench 4.0 上的得分为 70.6%,而 Haiku 5.5 的得分为 39.2%,这是 Anthropic 报告的结果,而一个失败并重新尝试的便宜请求,或者由更大模型重新处理的请求,并不便宜。Anthropic 自己的建议是在以 xhigh 或 max 运行 Haiku 之前,先与 Sonnet 5.5 进行比较。Sonnet 5.5 在同一天也降价:其缓存读取费用减半,Anthropic 表示这将大约减少 20% 的大多数代理工作。

与 GPT-6 Luna 相比,短提示的列表价格是相同的,包括缓存读取。不同之处在于长提示的规则。Luna 的 长上下文费率 从 272,000 个输入令牌以上开始,费用为 $0.20 / $0.75,而 Haiku 5.5 的费用从 100,000 个以上开始,为 $0.50 / $2.50。在 100K 和 272K 令牌之间的工作负载中,Luna 的列表价格要便宜得多。这两个模型使用不同的分词器,因此请比较实际账单,而不是令牌计数。

关于 100K 阈值和分词器效果的数据也已通过 Roo 的新闻通讯 进行了讨论,其算式与上述示例相匹配。

降低账单的步骤

  1. 在新模型上计算令牌,并在 100K 前发出警报。 记录每个请求的完整提示大小,并在大约 90,000 个令牌时发出警报,以便在提示上升时进行修剪或拆分,以免改变层级。
  2. 缓存稳定前缀。 首先是系统提示和工具定义,最后是可变内容。由于最小为 512 个令牌,现在大多数生产系统提示都符合条件。AIHubMix 的 Claude 提示缓存指南 显示请求格式。
  3. 明确设置努力级别。 对于高流量、简单的路径使用 low。默认的 medium 在每个请求中都要花费更多,无论该路径是否需要。
  4. 为思考和答案设置 max_tokens。 太小会导致您为没有答案的思考付费。
  5. 批量处理可以等待的请求。 批量 API 将输入和输出费率减半。
  6. 向上路由而不是向下重试。 如果某种任务类型在 Haiku 上经常失败,请先将其发送到 Sonnet 5.5,而不是支付 Haiku 尝试加上后备费用。

步骤 1 和 2 的记录模式通过 AIHubMix 的 Claude 原生端点:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "您对支持票进行分类..."  # 稳定的、可缓存的前缀

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"警告:提示为 {prompt_tokens} 个令牌,接近 100K 价格线")
    return next(b.text for b in r.content if b.type == "text")

如果 cache_read_input_tokens 在重复调用中保持为零,则表示请求之间的前缀发生了变化,例如系统提示中的时间戳。

常见问题

Claude Haiku 5.5 的费用是多少?
对于最多 100,000 个令牌的提示,输入令牌为每百万 $0.10,输出令牌为每百万 $0.50。对于更长的提示,费用为 $0.50 和 $2.50,适用于整个请求。缓存读取的费用是输入费率的十分之一,批量 API 将输入和输出价格减半。

Haiku 5.5 真的是比 Haiku 4.5 便宜 90% 吗?
按令牌计算,在短提示上是的。按任务计算则少一些:新的分词器将相同文本计算为大约 30% 更多的令牌,思考默认开启,长提示仅获得 50% 的折扣。Anthropic 估计典型的节省约为 75%。使用缓存的短提示分类器可以节省约 90%。

如果我的提示刚刚超过 100,000 个令牌会发生什么?
整个请求将转到更高的费率卡,输入和输出都一样。在上面的合同示例中,多出 14% 的文本使请求的费用增加了 5.6 倍。

缓存令牌计入 100K 阈值吗?
Anthropic 尚未明确说明这一点。其定价为每个层级列出了单独的缓存读取价格,因此安全的假设是,整个提示,无论是否缓存,决定了层级。

思考令牌需要额外费用吗?
它们按正常输出费率计费。由于思考默认开启且努力级别为中,因此它们可能会显著增加原本只产生短答案的路径。降低努力级别会减少它们。

Haiku 5.5 比 GPT-6 Luna 便宜吗?
在最多 100K 个令牌的提示上,列表价格是相同的。在 100K 和 272K 令牌之间,Luna 保持其基本费率,而 Haiku 5.5 则转到更高的费率,因此在列表价格上 Luna 更便宜。分词器不同,因此请比较实际账单。

我可以在 Haiku 5.5 上使用优先级层级吗?
不可以。Haiku 5.5 不支持优先级层级,因此在 Haiku 4.5 上的承诺不会转移。

继续阅读:Claude Haiku 5.5 系列

来源