Giá của Claude Haiku 5.5: Đường 100K phía sau mức giảm 90%

AIHubMixĐọc 8 phút
Giá của Claude Haiku 5.5: Đường 100K phía sau mức giảm 90%

Claude Haiku 5.5 có giá 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra, chỉ bằng một phần mười so với mức giá 1 USD và 5 USD của Haiku 4.5. Điều này áp dụng cho các prompt lên đến 100.000 token. Trên mức đó, toàn bộ yêu cầu sẽ bị tính phí 0,50 USD và 2,50 USD, tức là chỉ bằng một nửa giá của Haiku 4.5 thay vì một phần mười.

Anthropic ước tính mức tiết kiệm điển hình khoảng 75%, không phải 90%, và sự khác biệt đến từ ba yếu tố mà bài viết này sẽ phân tích: vị trí của các prompt của bạn so với đường 100K, số lượng token suy nghĩ mà các cài đặt mặc định tạo ra, và một bộ phân tích mới tính cùng một văn bản thành khoảng 30% nhiều token hơn. Hai ví dụ thực tế dưới đây cho thấy hóa đơn thực tế sẽ ra sao.

Bảng giá

Giá cho mỗi triệu token, từ bài viết ra mắt Haiku 5.5 và trang giá của Anthropic:

Loại token Haiku 5.5, ngắn Haiku 5.5, dài Haiku 4.5 Sonnet 5.5
Đầu vào 0,10 USD 0,50 USD 1,00 USD 2,00 USD
Đầu ra 0,50 USD 2,50 USD 5,00 USD 10,00 USD
Đọc bộ nhớ cache 0,01 USD 0,05 USD 0,10 USD 0,10 USD
Ghi bộ nhớ cache, 5 phút 0,125 USD 0,625 USD 1,25 USD 2,50 USD
Ghi bộ nhớ cache, 1 giờ 0,20 USD 1,00 USD 2,00 USD 4,00 USD

"Ngắn" có nghĩa là một prompt có 100.000 token hoặc ít hơn; "dài" có nghĩa là trên 100.000. API Batch giảm 50% giá đầu vào và đầu ra. Giá đọc bộ nhớ cache của Sonnet 5.5 đã giảm từ 0,20 USD xuống 0,10 USD vào cùng ngày.

Trang Haiku 5.5 trên AIHubMix liệt kê cùng hai cấp độ, với tìm kiếm web ở mức 0,01 USD cho mỗi yêu cầu.

Các quy tắc thanh toán dễ bị bỏ lỡ

Tất cả yêu cầu đều thay đổi cấp độ, không chỉ phần vượt mức. Anthropic định giá Haiku 5.5 với hai bảng giá được chọn theo độ dài prompt. Một prompt 100.000 token trả 0,0100 USD cho đầu vào của nó; một prompt 100.001 token trả 0,0500 USD, và đầu ra của nó cũng tốn gấp năm lần. Haiku 5.5 là trường hợp ngoại lệ ở đây: Các mô hình 1M-context hiện tại khác của Anthropic tính phí toàn bộ cửa sổ theo mức giá tiêu chuẩn của chúng.

Đường giới hạn đến sớm hơn so với những gì bảng điều khiển cũ của bạn gợi ý. Haiku 5.5 sử dụng một bộ phân tích mới hơn, và cùng một văn bản tạo ra khoảng 30% nhiều token hơn so với Haiku 4.5. Chia 100.000 cho 1,3 đưa đường giới hạn gần 77.000 token như Haiku 4.5 đã tính. Một prompt 78.000 token trên bảng điều khiển cũ của bạn trở thành khoảng 101.000 token trên Haiku 5.5 và phải trả theo mức giá dài. Phép toán đó đến từ con số 30% trong hướng dẫn di chuyển của Anthropic; mức tăng chính xác phụ thuộc vào nội dung, vì vậy hãy đếm lại các prompt thực tế trên mô hình mới.

Suy nghĩ được bật theo mặc định và tính phí như đầu ra. Haiku 4.5 chỉ suy nghĩ khi được yêu cầu. Haiku 5.5 chạy suy nghĩ thích ứng với nỗ lực medium trừ khi bạn thay đổi nó, vì vậy một lộ trình trước đây trả về 200 token đầu ra giờ có thể trả về nhiều hơn vài trăm.

Các prompt ngắn giờ có thể được lưu trữ trong bộ nhớ cache. Prompt bộ nhớ cache tối thiểu giảm từ 4.096 token trên Haiku 4.5 xuống 512 trên Haiku 5.5, theo hướng dẫn di chuyển của Anthropic. Một prompt hệ thống 3.000 token mà trước đây không thể lưu trữ trên Haiku 4.5 giờ có thể được lưu trữ, và một lần đọc bộ nhớ cache tốn một phần mười mức giá đầu vào.

Cấp độ Ưu tiên không có sẵn. Nếu bạn có cam kết Cấp độ Ưu tiên trên Haiku 4.5, nó sẽ không được chuyển sang Haiku 5.5. Hãy lập kế hoạch năng lực riêng.

Token đã lưu trữ và đường 100K: giả sử chúng được tính. Anthropic liệt kê một mức giá đọc bộ nhớ cache riêng cho mỗi cấp độ, điều này gợi ý rằng toàn bộ prompt, đã lưu trữ hay không, quyết định cấp độ. Anthropic chưa làm rõ điều này, vì vậy giả định an toàn là một tiền tố đã lưu trữ 95K cộng với một câu hỏi 6K là một prompt dài.

Ví dụ thực tế 1: phân loại vé hỗ trợ

Các giả định, theo số lượng token của Haiku 4.5: một prompt hệ thống 3.000 token với định nghĩa công cụ, một vé 1.000 token, một câu trả lời 200 token, và 1 triệu yêu cầu mỗi tháng. Haiku 4.5 chạy với suy nghĩ tắt.

Trên Haiku 5.5, cùng một văn bản trở thành 3.900 + 1.300 token đầu vào và một câu trả lời 260 token. Giả định rằng suy nghĩ thêm 300 token với nỗ lực low và 800 với nỗ lực medium. Những con số suy nghĩ đó là giả định; hãy đo lường của bạn.

Thiết lập Mỗi yêu cầu Mỗi tháng
Haiku 4.5 0,00500 USD 5.000 USD
Haiku 5.5, thấp, không bộ nhớ cache 0,00080 USD 800 USD
Haiku 5.5, thấp, tiền tố đã lưu trữ 0,00045 USD 453 USD
Haiku 5.5, trung bình, tiền tố đã lưu trữ 0,00070 USD 703 USD
Sonnet 5.5, trung bình, tiền tố đã lưu trữ 0,01359 USD 13.674 USD

Các hàng tháng đã lưu trữ bao gồm khoảng 4 USD cho việc ghi bộ nhớ cache của Haiku 5.5 và khoảng 84 USD cho Sonnet 5.5, giả định một lần ghi 5 phút mỗi năm phút. Sonnet 5.5 sử dụng cùng các giả định token như Haiku ở mức trung bình.

Cách mà hàng đã lưu trữ thấp cộng lại: 3.900 token đã lưu trữ ở mức 0,01 USD cho mỗi triệu (0,000039 USD), cộng với 1.300 token đầu vào mới ở mức 0,10 USD (0,00013 USD), cộng với 560 token đầu ra ở mức 0,50 USD (0,00028 USD), tổng cộng là 0,000449 USD cho mỗi yêu cầu.

Mô hình: việc lưu trữ và nỗ lực cùng nhau làm cho hóa đơn từ 16% chi phí cũ (không bộ nhớ cache, thấp) xuống 9% (đã lưu trữ, thấp). Giữ nỗ lực ở mặc định thay vì thấp thêm khoảng 250 USD mỗi tháng ở khối lượng này. Không lựa chọn nào quan trọng nhiều trong các điều kiện tuyệt đối so với 5.000 USD của Haiku 4.5, đó là lý do tại sao trường hợp phân loại là nơi mà tiêu đề 90% là có thật.

Ví dụ thực tế 2: xem xét hợp đồng vượt qua đường giới hạn

Các giả định, theo số lượng token của Haiku 4.5: một hợp đồng cộng với hướng dẫn 70.000 token, một câu trả lời 1.500 token, không có bộ nhớ cache. Trên Haiku 5.5, điều đó trở thành 91.000 token đầu vào, một câu trả lời 1.950 token, và 2.000 token suy nghĩ giả định ở mức trung bình, vì vậy có 3.950 token đầu ra.

Giờ hãy làm cho hợp đồng dài hơn 14%: 80.000 token trên Haiku 4.5, 104.000 trên Haiku 5.5.

Kích thước hợp đồng (số lượng Haiku 4.5) Haiku 4.5 Haiku 5.5 Thay đổi
70.000 token 0,0775 USD 0,0111 USD Giảm 86%
80.000 token 0,0875 USD 0,0619 USD Giảm 29%

Hàng thứ hai: 104.000 token đầu vào ở mức 0,50 USD cho mỗi triệu (0,052 USD) cộng với 3.950 token đầu ra ở mức 2,50 USD (0,0099 USD). Văn bản dài hơn 14% tốn 5,6 lần nhiều hơn trên Haiku 5.5.

Cách khắc phục là giữ dưới đường giới hạn. Chia hợp đồng dài hơn thành hai cuộc gọi khoảng 53.000 token mỗi cuộc (một nửa hợp đồng cộng với hướng dẫn trong mỗi cuộc) tốn khoảng 0,015 USD tổng cộng theo mức giá ngắn, chưa đến một phần tư của cuộc gọi dài đơn lẻ. Việc chia tách có hiệu quả hay không phụ thuộc vào nhiệm vụ; xem xét từng điều khoản chia tách sạch sẽ, một câu hỏi cần toàn bộ tài liệu một lần thì không.

So sánh chi phí theo nhiệm vụ

So với Sonnet 5.5, Haiku 5.5 có giá khoảng một phần hai mươi so với giá mỗi token cho các prompt ngắn. Nhưng giá mỗi token không phải là giá cho mỗi nhiệm vụ hoàn thành. Trong lập trình phức tạp, Sonnet 5.5 đạt 70,6% trên Terminal-Bench 4.0 so với 39,2% của Haiku 5.5, theo kết quả được báo cáo của Anthropic, và một yêu cầu rẻ hơn mà thất bại và cần thử lại, hoặc được thực hiện lại bởi một mô hình lớn hơn, không rẻ hơn. Lời khuyên của chính Anthropic là so sánh với Sonnet 5.5 trước khi chạy Haiku ở mức xhigh hoặc max. Sonnet 5.5 cũng đã giảm giá vào cùng ngày: giá đọc bộ nhớ cache của nó đã giảm một nửa, điều mà Anthropic cho biết giảm khoảng 20% cho hầu hết các công việc tác động.

So với GPT-6 Luna, giá danh sách cho các prompt ngắn là giống nhau, bao gồm cả việc đọc bộ nhớ cache. Sự khác biệt là quy tắc cho các prompt dài. Mức giá ngữ cảnh dài của Luna bắt đầu trên 272.000 token đầu vào và là 0,20 USD / 0,75 USD, trong khi Haiku 5.5 bắt đầu trên 100.000 và là 0,50 USD / 2,50 USD. Đối với khối lượng công việc giữa 100K và 272K token, Luna rẻ hơn nhiều về giá danh sách. Hai mô hình sử dụng các bộ phân tích khác nhau, vì vậy hãy so sánh hóa đơn thực tế, không phải số lượng token.

Các con số về ngưỡng 100K và hiệu ứng của bộ phân tích cũng đã được phân tích bởi Bản tin của Roo, với phép toán khớp với các ví dụ ở trên.

Các bước giảm hóa đơn

  1. Đếm token trên mô hình mới và cảnh báo trước 100K. Ghi lại kích thước prompt đầy đủ cho mỗi yêu cầu và cảnh báo khi khoảng 90.000 token, để các prompt có xu hướng tăng lên được cắt bớt hoặc chia tách trước khi chúng thay đổi cấp độ.
  2. Lưu trữ tiền tố ổn định. Prompt hệ thống và định nghĩa công cụ trước, nội dung biến đổi sau. Với mức tối thiểu 512 token, hầu hết các prompt hệ thống sản xuất giờ đủ điều kiện. Hướng dẫn lưu trữ prompt Claude của AIHubMix cho thấy định dạng yêu cầu.
  3. Đặt nỗ lực một cách rõ ràng. Sử dụng thấp cho các lộ trình đơn giản, khối lượng lớn. Mặc định trung bình tốn nhiều hơn cho mỗi yêu cầu, bất kể lộ trình có cần hay không.
  4. Đặt kích thước max_tokens cho suy nghĩ cộng với câu trả lời. Quá nhỏ và bạn sẽ phải trả cho suy nghĩ mà không có câu trả lời.
  5. Gộp những gì có thể chờ đợi. API Batch giảm một nửa giá đầu vào và đầu ra.
  6. Chuyển lên thay vì thử lại xuống. Nếu một loại nhiệm vụ thường xuyên thất bại trên Haiku, hãy gửi nó đến Sonnet 5.5 trước thay vì trả tiền cho các nỗ lực Haiku cộng với một phương án dự phòng.

Một mẫu ghi lại cho các bước 1 và 2 thông qua điểm cuối Claude native của AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Bạn phân loại vé hỗ trợ..."  # tiền tố ổn định, có thể lưu trữ

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"Cảnh báo: prompt có {prompt_tokens} token, gần đường giá 100K")
    return next(b.text for b in r.content if b.type == "text")

Nếu cache_read_input_tokens giữ ở mức không trong các cuộc gọi lặp lại, có thể có điều gì đó trong tiền tố đang thay đổi giữa các yêu cầu, chẳng hạn như một dấu thời gian trong prompt hệ thống.

Câu hỏi thường gặp

Giá của Claude Haiku 5.5 là bao nhiêu?
Đối với các prompt lên đến 100.000 token, 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra. Đối với các prompt dài hơn, 0,50 USD và 2,50 USD, áp dụng cho toàn bộ yêu cầu. Các lần đọc bộ nhớ cache tốn một phần mười mức giá đầu vào, và API Batch giảm một nửa giá đầu vào và đầu ra.

Liệu Haiku 5.5 có thực sự rẻ hơn 90% so với Haiku 4.5 không?
Theo từng token, đối với các prompt ngắn, có. Theo từng nhiệm vụ, ít hơn: bộ phân tích mới tính khoảng 30% nhiều token cho cùng một văn bản, suy nghĩ được bật theo mặc định, và các prompt dài chỉ được giảm 50%. Anthropic ước tính mức tiết kiệm điển hình khoảng 75%. Một bộ phân loại với prompt ngắn có bộ nhớ cache có thể tiết kiệm khoảng 90%.

Điều gì xảy ra nếu prompt của tôi chỉ vượt quá 100.000 token?
Toàn bộ yêu cầu chuyển sang bảng giá cao hơn, cả đầu vào và đầu ra. Trong ví dụ hợp đồng ở trên, văn bản dài hơn 14% đã làm cho yêu cầu tốn 5,6 lần nhiều hơn.

Các token đã lưu trữ có được tính vào ngưỡng 100K không?
Anthropic chưa tuyên bố điều này một cách rõ ràng. Giá của nó liệt kê các mức giá đọc bộ nhớ cache riêng cho mỗi cấp độ, vì vậy giả định an toàn là toàn bộ prompt, đã lưu trữ hay không, quyết định cấp độ.

Các token suy nghĩ có tốn thêm không?
Chúng được tính phí như các token đầu ra theo mức giá đầu ra bình thường. Bởi vì suy nghĩ được bật theo mặc định với nỗ lực trung bình, chúng có thể làm tăng đáng kể cho một lộ trình trước đây chỉ tạo ra các câu trả lời ngắn. Giảm nỗ lực sẽ giảm chúng.

Liệu Haiku 5.5 có rẻ hơn GPT-6 Luna không?
Đối với các prompt lên đến 100K token, giá danh sách là giống nhau. Giữa 100K và 272K token, Luna giữ mức giá cơ bản trong khi Haiku 5.5 chuyển sang mức giá cao hơn, vì vậy Luna rẻ hơn ở đó về giá danh sách. Các bộ phân tích khác nhau, vì vậy hãy so sánh hóa đơn thực tế.

Tôi có thể sử dụng Cấp độ Ưu tiên với Haiku 5.5 không?
Không. Cấp độ Ưu tiên không được hỗ trợ trên Haiku 5.5, vì vậy các cam kết trên Haiku 4.5 không được chuyển giao.

Tiếp tục đọc: chuỗi Claude Haiku 5.5

Nguồn