Claude Haiku 5.5 價格:100K 線背後的 90% 削減

推理時代閱讀約 8 分鐘
Claude Haiku 5.5 價格:100K 線背後的 90% 削減

Claude Haiku 5.5 的價格為每百萬個輸入標記 $0.10 和每百萬個輸出標記 $0.50,這是 Haiku 4.5 的 $1 和 $5 的十分之一。這適用於最多 100,000 個標記的提示。在這條線以上,整個請求的收費為 $0.50 和 $2.50,這是 Haiku 4.5 價格的一半,而不是十分之一。

Anthropic 將典型的節省估計為約 75%,而不是 90%,這一差異來自於本文探討的三個方面:您的提示相對於 100K 線的位置、默認設置生成的思考標記數量,以及一種新的標記器,它將相同的文本計算為約 30% 更多的標記。下面的兩個實例顯示了實際帳單的結果。

價格表

每百萬個標記的價格,來自 Anthropic 的 Haiku 5.5 發布文章 和 定價頁面:

標記類型 Haiku 5.5,短 Haiku 5.5,長 Haiku 4.5 Sonnet 5.5
輸入 $0.10 $0.50 $1.00 $2.00
輸出 $0.50 $2.50 $5.00 $10.00
快取讀取 $0.01 $0.05 $0.10 $0.10
快取寫入,5 分鐘 $0.125 $0.625 $1.25 $2.50
快取寫入,1 小時 $0.20 $1.00 $2.00 $4.00

「短」是指 100,000 個標記或更少的提示;「長」是指超過 100,000 的提示。批量 API 將輸入和輸出減半。Sonnet 5.5 的快取讀取價格在同一天從 $0.20 降至 $0.10。

AIHubMix 的 Haiku 5.5 頁面 列出了相同的兩個層級,網頁搜索每次請求 $0.01。

容易忽略的計費規則

整個請求變更層級,而不僅僅是超出部分。 Anthropic 以兩個根據提示長度選擇的價格表為 Haiku 5.5 定價。100,000 個標記的提示支付 $0.0100 的輸入費用;100,001 個標記的提示支付 $0.0500,輸出費用也要五倍。Haiku 5.5 是這裡的例外:Anthropic 其他當前的 1M 上下文模型按其標準費率計費整個窗口。

這條線比您舊的儀表板所示的來得更早。 Haiku 5.5 使用了一種更新的標記器,相同的文本產生的標記數量比 Haiku 4.5 多約 30%。將 100,000 除以 1.3,將這條線放在 Haiku 4.5 計算的約 77,000 個標記附近。您舊儀表板上的 78,000 個標記的提示在 Haiku 5.5 上變成大約 101,000 個標記,並支付長期費率。這一算術來自於 Anthropic 的遷移指南中的 30% 數字;具體的增加取決於內容,因此請在新模型上重新計算實際提示。

思考默認開啟,並按輸出計費。 Haiku 4.5 只有在要求時才進行思考。Haiku 5.5 在 medium 努力下運行自適應思考,除非您更改它,因此以前返回 200 個輸出標記的路徑現在可以返回幾百個更多的標記。

短提示現在可以快取。 根據 Anthropic 的遷移指南,可快取提示的最小數量從 Haiku 4.5 的 4,096 個標記降至 Haiku 5.5 的 512 個標記。以前在 Haiku 4.5 上無法快取的 3,000 個標記的系統提示現在可以快取,快取讀取的費用是輸入費用的十分之一。

優先層級不可用。 如果您在 Haiku 4.5 上持有優先層級的承諾,則不會轉移到 Haiku 5.5。請單獨計劃容量。

快取標記和 100K 線:假設它們計算在內。 Anthropic 為每個層級列出了單獨的快取讀取價格,這表明整個提示(無論是否快取)決定了層級。Anthropic 尚未明確說明這一點,因此安全的假設是 95K 的快取前綴加上 6K 的問題是一個長提示。

實例 1:支持票分類器

假設,在 Haiku 4.5 的標記計數中:一個包含工具定義的 3,000 個標記的系統提示、一個 1,000 個標記的票、一個 200 個標記的答案,以及每月 100 萬個請求。Haiku 4.5 在思考關閉的情況下運行。

在 Haiku 5.5 中,相同的文本變為 3,900 + 1,300 個輸入標記和一個 260 個標記的答案。假設思考在 low 努力下增加 300 個標記,在 medium 努力下增加 800 個標記。這些思考數字是假設;請測量您的數據。

設置 每次請求 每月
Haiku 4.5 $0.00500 $5,000
Haiku 5.5,低,無快取 $0.00080 $800
Haiku 5.5,低,快取前綴 $0.00045 $453
Haiku 5.5,中,快取前綴 $0.00070 $703
Sonnet 5.5,中,快取前綴 $0.01359 $13,674

每月快取行包括約 $4 的 Haiku 5.5 快取寫入和約 $84 的 Sonnet 5.5 快取寫入,假設每五分鐘寫入一次 5 分鐘。Sonnet 5.5 使用與 Haiku 相同的標記假設,並且為中等。

快取 low 行的總計:3,900 個快取標記每百萬 $0.01($0.000039),加上 1,300 個新輸入標記每百萬 $0.10($0.00013),再加上 560 個輸出標記每百萬 $0.50($0.00028),總共每次請求 $0.000449。

模式:快取和努力一起將帳單從舊成本的 16%(無快取,低)移動到 9%(快取,低)。在這個量級下,將努力保持在默認值而不是 low 每月增加約 $250。這兩種選擇在 Haiku 4.5 的 $5,000 旁邊幾乎沒有影響,這就是為什麼分類器案例是 90% 標題真實的原因。

實例 2:一個超過界限的合同審查

假設,在 Haiku 4.5 的標記計數中:一份包含 70,000 個標記的合同加上說明、一個 1,500 個標記的答案,沒有快取。在 Haiku 5.5 中,這變為 91,000 個輸入標記、一個 1,950 個標記的答案,以及假設的 2,000 個思考標記在 medium 下,因此有 3,950 個輸出標記。

現在將合同長度增加 14%:在 Haiku 4.5 中為 80,000 個標記,在 Haiku 5.5 中為 104,000 個標記。

合同大小(Haiku 4.5 計數) Haiku 4.5 Haiku 5.5 變化
70,000 個標記 $0.0775 $0.0111 降低 86%
80,000 個標記 $0.0875 $0.0619 降低 29%

第二行:104,000 個輸入標記每百萬 $0.50($0.052)加上 3,950 個輸出標記每百萬 $2.50($0.0099)。多出 14% 的文本在 Haiku 5.5 上的成本是 5.6 倍。

解決辦法是保持在這條線以下。將較長的合同拆分為兩個約 53,000 個標記的調用(每個合同的一半加上說明)總共約 $0.015,按短期費率計算,這不到單個長調用的四分之一。是否拆分取決於任務;逐條審查的條款可以乾淨地拆分,而需要整個文檔的問題則無法。

每項任務的成本比較

與 Sonnet 5.5 相比,Haiku 5.5 在短提示上的每標記價格約為二十分之一。但每標記的價格並不是每完成任務的價格。在複雜的代理編碼中,Sonnet 5.5 在 Terminal-Bench 4.0 中的得分為 70.6%,而 Haiku 5.5 的得分為 39.2%,這是 Anthropic 報告的結果,失敗並重試的便宜請求,或者由更大模型重新執行的請求並不便宜。Anthropic 自己的建議是在以 xhigh 或 max 運行 Haiku 之前,先與 Sonnet 5.5 進行比較。Sonnet 5.5 也在同一天變得更便宜:其快取讀取減半,Anthropic 表示這將大約減少大多數代理工作的 20%。

與 GPT-6 Luna 相比,短提示的列表價格是相同的,包括快取讀取。區別在於長提示的規則。Luna 的 長上下文費率 在 272,000 個輸入標記以上開始,價格為 $0.20 / $0.75,而 Haiku 5.5 的價格在 100,000 個以上開始,為 $0.50 / $2.50。對於 100K 到 272K 標記之間的工作負載,Luna 在列表價格上便宜得多。這兩個模型使用不同的標記器,因此請比較實際帳單,而不是標記計數。

關於 100K 閾值和標記器效果的數字也已由 Roo 的通訊 進行了探討,其算術與上述示例相符。

降低帳單的步驟

  1. 在新模型上計算標記並在 100K 前發出警報。 記錄每次請求的完整提示大小,並在約 90,000 個標記時發出警報,以便在提示上升時進行修剪或拆分,避免變更層級。
  2. 快取穩定前綴。 首先是系統提示和工具定義,最後是變量內容。由於最小為 512 個標記,現在大多數生產系統提示都符合條件。AIHubMix 的 Claude 提示快取指南 顯示請求格式。
  3. 明確設置努力程度。 對於高流量、簡單的路徑使用 low。默認的 medium 在每次請求中都會增加成本,無論該路徑是否需要。
  4. 為思考和答案設置 max_tokens。 太小的話,您將為沒有答案的思考付費。
  5. 批量處理可以等待的請求。 批量 API 將輸入和輸出費率減半。
  6. 升級路徑而不是降級重試。 如果某類任務在 Haiku 上經常失敗,則先將其發送到 Sonnet 5.5,而不是支付 Haiku 嘗試加上後備。

AIHubMix 的 Claude 原生端點 的步驟 1 和 2 的日誌模式:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "您對支持票進行分類..."  # 穩定的、可快取的前綴

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"警告:提示為 {prompt_tokens} 個標記,接近 100K 價格線")
    return next(b.text for b in r.content if b.type == "text")

如果 cache_read_input_tokens 在重複調用中保持為零,則表示請求之間前綴中的某些內容正在變化,例如系統提示中的時間戳。

常見問題

Claude Haiku 5.5 的費用是多少?
對於最多 100,000 個標記的提示,每百萬個輸入標記 $0.10,每百萬個輸出標記 $0.50。對於更長的提示,收費為 $0.50 和 $2.50,適用於整個請求。快取讀取的費用是輸入費率的十分之一,批量 API 將輸入和輸出價格減半。

Haiku 5.5 真的比 Haiku 4.5 便宜 90% 嗎?
每標記而言,在短提示上是的。每項任務而言,則較少:新的標記器對相同文本計算約 30% 更多的標記,思考默認開啟,長提示僅獲得 50% 的削減。Anthropic 估計典型的節省約為 75%。帶有快取的短提示分類器可以節省約 90%。

如果我的提示剛超過 100,000 個標記會怎樣?
整個請求將轉移到更高的價格表,無論是輸入還是輸出。在上面的合同示例中,多出 14% 的文本使請求的成本增加了 5.6 倍。

快取標記計算在 100K 閾值內嗎?
Anthropic 尚未明確說明這一點。其定價為每個層級列出了單獨的快取讀取價格,因此安全的假設是整個提示(無論是否快取)決定了層級。

思考標記需要額外費用嗎?
它們按正常的輸出費率計費作為輸出標記。由於思考默認在中等努力下開啟,因此它們可能會顯著增加以前只產生短答案的路徑的成本。降低努力程度會減少它們的數量。

Haiku 5.5 比 GPT-6 Luna 便宜嗎?
對於最多 100K 標記的提示,列表價格是相同的。在 100K 到 272K 標記之間,Luna 保持其基本費率,而 Haiku 5.5 則轉移到更高的費率,因此在列表價格上 Luna 更便宜。標記器不同,因此請比較實際帳單。

我可以在 Haiku 5.5 上使用優先層級嗎?
不可以。Haiku 5.5 不支持優先層級,因此在 Haiku 4.5 上的承諾不會轉移。

繼續閱讀:Claude Haiku 5.5 系列

來源