Claude Haiku 5.5 là Haiku đầu tiên có cài đặt nỗ lực, và cài đặt này ảnh hưởng nhiều hơn bất cứ điều gì khác mà bạn kiểm soát. Trong các lần chạy độc lập của Artificial Analysis, Haiku 5.5 ở mức nỗ lực tối đa đạt 43 trên Chỉ số Trí tuệ của nó và ở mức nỗ lực thấp đạt 29. Mức tối đa cũng sử dụng 440 triệu token đầu ra để hoàn thành chỉ số; mức thấp sử dụng 32 triệu.
Vì vậy, câu trả lời ngắn gọn: để hầu hết công việc ở mặc định, medium. Giảm các tuyến đường đơn giản, khối lượng lớn xuống low. Tăng cường công việc tri thức và tuân thủ hướng dẫn nghiêm ngặt lên high. Xem xhigh và max như là các cài đặt mà bạn cần có bằng chứng, và so sánh chúng với Sonnet 5.5 trước khi bạn quyết định.
Các phần còn lại của bài viết này cho thấy mỗi mức độ tốn kém bao nhiêu, nơi mà việc tăng lên không còn hiệu quả, và những cài đặt nào bị hỏng hoặc trở nên đắt đỏ khi bạn thay đổi nỗ lực.
Cài đặt là gì
Claude Haiku 5.5 hỗ trợ năm mức độ: low, medium, high, xhigh, và max. Mặc định là medium, điều này là không bình thường: hầu hết các mô hình Claude hiện tại mặc định là high, và chỉ có Haiku 5.5 và Opus 5.5 mặc định một mức thấp hơn. Gửi medium giống như việc để tham số này ra ngoài.
Nỗ lực thay thế ngân sách suy nghĩ thủ công mà Haiku 4.5 đã sử dụng. Một yêu cầu với thinking: {"type": "enabled", "budget_tokens": N} giờ đây trả về 400, vì vậy không có số cũ nào để chuyển tiếp. Theo tài liệu nỗ lực của Anthropic, bạn thiết lập nó trong output_config:
output_config={"effort": "low"}
Ba sự thật khung cho mọi thứ bên dưới:
- Suy nghĩ được bật theo mặc định. Haiku 5.5 chạy suy nghĩ thích ứng trừ khi được thông báo ngược lại. Nỗ lực thấp có nghĩa là ít suy nghĩ hơn, và trong các yêu cầu đơn giản, mô hình có thể bỏ qua suy nghĩ hoàn toàn.
- Token suy nghĩ là token đầu ra. Chúng tính vào
max_tokensvà tính phí theo tỷ lệ đầu ra (0,50 đô la cho mỗi triệu trên các yêu cầu lên đến 100K token). - Yêu cầu ít suy nghĩ hơn trong yêu cầu không hiệu quả. Trong các thử nghiệm của Anthropic, mô hình vẫn suy nghĩ khi yêu cầu nó trả lời trực tiếp. Nỗ lực là cần thiết.
Chi phí của mỗi mức độ
Hai nguồn độc lập đã đo lường Haiku 5.5 qua các mức độ nỗ lực. Các số liệu chỉ số đến từ Artificial Analysis; các số liệu FrontierCode đến từ tệp kết quả công khai của Cognition, được biên soạn bởi Kingy.ai. Không nguồn nào bao gồm khối lượng công việc của bạn, vì vậy hãy coi chúng như hình dạng của đường cong, không phải là số liệu của bạn.
Chỉ số Trí tuệ Artificial Analysis v4.3.2 (mười đánh giá, từ công việc tri thức đến các nhiệm vụ cuối cùng):
| Nỗ lực | Điểm chỉ số | Token đầu ra cho chỉ số | Chi phí mỗi nhiệm vụ | Thời gian đến token đầu tiên |
|---|---|---|---|---|
| low | 29 | 32M | 0,02 đô la | 9,9 giây |
| medium | 34 | 54M | 0,05 đô la | 13,4 giây |
| high | 38 | 97M | 0,08 đô la | 28,0 giây |
| max | 43 | 440M | 0,21 đô la | không áp dụng |
Artificial Analysis không công bố một lần chạy xhigh. Số liệu độ trễ tối đa của nó trông có vẻ bất thường, vì vậy nó bị loại trừ.
FrontierCode 1.1 Chính, Haiku 5.5 chạy trong Claude Code:
| Nỗ lực | Điểm tổng hợp | Chi phí mỗi lần triển khai | Token đầu ra mỗi lần triển khai |
|---|---|---|---|
| low | 34,8% | 0,06 đô la | 23,868 |
| medium | 41,6% | 0,13 đô la | 36,172 |
| high | 41,9% | 0,26 đô la | 55,149 |
| xhigh | 45,8% | 0,63 đô la | 100,847 |
| max | 46,4% | 1,33 đô la | 181,387 |
Chi phí được làm tròn đến cent.
Đọc hai bảng cùng nhau và ba điều nổi bật.
Bước từ thấp lên trung bình là bước tăng rẻ nhất. Trên chỉ số, nó mua 5 điểm với khoảng 1,7 lần token đầu ra. Trên FrontierCode, nó mua 6,8 điểm với khoảng gấp đôi chi phí mỗi lần triển khai.
Bước từ trung bình lên cao có thể bằng phẳng. Trên FrontierCode, điểm cao hơn trung bình 0,3 điểm và tốn khoảng gấp đôi. Trên chỉ số rộng hơn, điểm cao đã thêm 4 điểm. Việc khối lượng công việc của bạn giống như trường hợp đầu tiên hay trường hợp thứ hai chính xác là điều mà một đánh giá nhanh cho bạn biết.
Hai mức cao nhất rất đắt đỏ. Từ cao đến tối đa trên chỉ số, token đầu ra tăng khoảng 4,5 lần cho 5 điểm. Trên FrontierCode, mức tối đa tốn khoảng mười lần chi phí của mức trung bình cho 4,8 điểm thêm, và bước từ xhigh đến max gần như gấp đôi chi phí cho 0,6 điểm. Hướng dẫn của Anthropic cũng nói điều tương tự bằng những từ đơn giản hơn: chỉ sử dụng xhigh và max ở những nơi mà các đánh giá của bạn cho thấy có lợi, và so sánh chúng với Sonnet 5.5 về hiệu suất, chi phí và tốc độ trước.
Một lý do nữa mà mặc định quan trọng: Các chỉ số khởi động của Anthropic được thực hiện ở mức nỗ lực tối đa. Kết quả nỗ lực trung bình của thẻ hệ thống thấp hơn (1277 trên GDPval-AA thay vì 1620). Nếu bạn triển khai ở mặc định, đó là những số liệu để so sánh.
Nơi bắt đầu, theo khối lượng công việc
| Khối lượng công việc | Bắt đầu tại | Tăng lên khi |
|---|---|---|
| Phân loại, định tuyến, gán nhãn | low | Những nhãn bị trôi trong các trường hợp khó |
| Trích xuất từ tài liệu ngắn | low | Các trường bị bỏ lỡ hoặc gộp lại |
| Hỗ trợ trò chuyện và trực tiếp | low | Các quy tắc bị trượt trong các cuộc trò chuyện dài |
| Tóm tắt và nén | medium | Các chi tiết quan trọng bị bỏ qua |
| Công việc của đại lý dưới một mô hình lớn hơn | medium | Mô hình chính làm lại công việc |
| Lập trình đại lý, thay đổi hẹp | medium | Các bài kiểm tra thất bại trong lần thử đầu tiên |
| Công việc tri thức, nhiệm vụ dài của đại lý | high | Các đánh giá cho thấy có không gian |
Các điểm khởi đầu này tuân theo hướng dẫn của Anthropic cho Haiku 5.5; các tín hiệu "tăng lên" là những gì cần theo dõi trong các nhật ký của riêng bạn.
Hàng duy nhất đáng xem xét lại là trò chuyện. Mức thấp là mức nhanh nhất, phù hợp với hỗ trợ trực tiếp. Nhưng Anthropic khuyến nghị high khi việc tuân thủ hướng dẫn là quan trọng nhất, ví dụ như một trợ lý hỗ trợ phải giữ các quy tắc hệ thống của nó trong khi người dùng tranh luận. Kiểm tra cả hai trên các cuộc trò chuyện đã sai trong quá khứ.
Điều gì bị hỏng hoặc trở nên đắt đỏ khi nỗ lực thay đổi
Một max_tokens nhỏ có thể kết thúc phản hồi trước khi nó bắt đầu. Suy nghĩ tính vào max_tokens. Một giới hạn được thiết kế cho một phân loại một từ, chẳng hạn 50 token, có thể được tiêu hoàn toàn cho suy nghĩ, và phản hồi kết thúc với stop_reason: "max_tokens" và không có văn bản. Tăng giới hạn để để lại không gian, hoặc giảm nỗ lực.
Thay đổi nỗ lực giữa cuộc trò chuyện sẽ đặt lại bộ nhớ cache. Thay đổi giá trị nỗ lực cấp cao nhất giữa các yêu cầu sẽ làm không hợp lệ bộ nhớ cache của các tin nhắn trong cuộc trò chuyện. Nếu một đại lý cần một lượt khó ở high trong một cuộc trò chuyện low, Anthropic cung cấp một thay đổi nỗ lực theo tin nhắn (tiêu đề beta mid-conversation-output-config-2026-07-01, Claude API và Google Cloud) mà giữ lại bộ nhớ cache. Nó yêu cầu suy nghĩ phải được bật. Việc một cổng có truyền tiêu đề beta đó hay không là điều đáng kiểm tra trước khi bạn dựa vào nó.
Tắt suy nghĩ có giới hạn. thinking: {"type": "disabled"} được chấp nhận ở low, medium, và high. Ở xhigh hoặc max nó trả về 400. Khi suy nghĩ tắt, một thay đổi nỗ lực theo tin nhắn cũng trả về 400, và mô hình có thể bỏ qua một cuộc gọi công cụ mà nó cần khi cùng một yêu cầu yêu cầu đầu ra JSON. Lời khuyên của Anthropic là giữ suy nghĩ bật và sử dụng mức nỗ lực thấp hơn thay vào đó.
Nỗ lực thấp có thể dừng sớm. Với một lời nhắc hệ thống lập trình dài ở low, Haiku 5.5 đôi khi dừng lại trước khi công việc hoàn thành và trả lại nhiệm vụ. Trong các thử nghiệm của Anthropic, việc chuyển từ low sang medium đã giảm một nửa việc dừng sớm và tăng hơn gấp đôi token đầu ra mỗi lần thử. Hướng dẫn nhắc Haiku 5.5 có một hướng dẫn ngắn "tiếp tục làm việc cho đến khi hoàn thành" giải quyết cùng một vấn đề với mức giá thấp hơn.
Low và medium có thể bỏ qua xác minh. Trong các nhiệm vụ lập trình, mô hình đôi khi báo cáo một thay đổi là đã hoàn thành mà không chạy thử nghiệm. Hướng dẫn nhắc có một đoạn xác minh cho điều này; nó tốn token nhưng tăng tỷ lệ các thay đổi đã được kiểm tra.
Xhigh có thể trả về một phản hồi trống. Trong các cuộc trò chuyện nhiều lượt ở xhigh, mô hình đôi khi viết toàn bộ câu trả lời của nó bên trong suy nghĩ của nó và kết thúc lượt với không có văn bản hiển thị. Nếu bạn chạy ở xhigh, hãy kiểm tra các khối văn bản trống.
Buộc một công cụ bỏ qua suy nghĩ. Haiku 5.5 chấp nhận một tool_choice bị buộc, nhưng phản hồi sau đó bắt đầu với cuộc gọi công cụ và không có suy nghĩ. Nếu mô hình cần lý luận trước khi gọi công cụ, hãy sử dụng auto và nói trong lời nhắc khi nào để gọi nó.
Chạy quét nỗ lực của riêng bạn qua AIHubMix
Cách nhanh nhất để chọn là chạy cùng 20 đến 50 lời nhắc thực tế ở hai hoặc ba mức và so sánh chất lượng, token đầu ra, và độ trễ. Thông qua điểm cuối Claude gốc AIHubMix, với AIHUBMIX_API_KEY được thiết lập:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Tóm tắt vé hỗ trợ này trong một câu: ...",
"Trích xuất số hóa đơn và tổng từ: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Lưu `text` bên cạnh lời nhắc và đánh giá nó theo thang điểm của riêng bạn.
print(f"{effort}: {out_tokens} token đầu ra, {seconds:.1f}s tổng cộng")
Nếu token đầu ra hầu như không thay đổi giữa low và high, cài đặt có thể không đến được mô hình; kiểm tra yêu cầu mà cổng của bạn chuyển tiếp. Trên trang Haiku 5.5 trên AIHubMix, giá mỗi token là như nhau ở mọi mức độ nỗ lực, vì vậy số lượng token từ quét này chuyển thẳng thành đô la.
Câu hỏi thường gặp
Mức độ nỗ lực mặc định cho Claude Haiku 5.5 là gì?
Trung bình. Hầu hết các mô hình Claude hiện tại mặc định là cao, vì vậy mã mà phụ thuộc vào mặc định cho một mô hình khác sẽ chạy Haiku 5.5 ở một mức thấp hơn trừ khi nó thiết lập nỗ lực một cách rõ ràng.
Tôi có thể tắt hoàn toàn suy nghĩ không?
Ở mức thấp, trung bình và cao, có, bằng cách thiết lập suy nghĩ thành tắt. Ở mức xhigh và max, điều đó trả về lỗi. Anthropic khuyến nghị giảm nỗ lực thay vào đó, vì mô hình có thể tự bỏ qua suy nghĩ trong các yêu cầu đơn giản và giữ nguyên hành vi gọi công cụ của nó.
Mức độ nỗ lực nào là rẻ nhất?
Thấp. Trong các lần chạy của Artificial Analysis, nó sử dụng khoảng 32 triệu token đầu ra cho toàn bộ chỉ số so với 54 triệu ở mức trung bình và 440 triệu ở mức tối đa. Giá mỗi token là như nhau ở mọi mức độ; sự khác biệt là số lượng token được tạo ra.
Có đáng để sử dụng nỗ lực tối đa trên Haiku 5.5 không?
Chỉ với bằng chứng từ các đánh giá của riêng bạn. Trên FrontierCode, mức tối đa tốn khoảng mười lần chi phí của mức trung bình cho một lợi ích 4,8 điểm. Vào thời điểm đó, Anthropic gợi ý so sánh với Sonnet 5.5, có thể đạt được chất lượng tương tự với chi phí thấp hơn.
Tại sao phản hồi của tôi dừng lại mà không có văn bản?
Thường là vì suy nghĩ đã sử dụng hết max_tokens trước khi câu trả lời bắt đầu. Tăng max_tokens hoặc giảm nỗ lực. Ở mức xhigh trong các cuộc trò chuyện nhiều lượt, một phản hồi trống cũng có thể có nghĩa là mô hình đã đặt câu trả lời của nó bên trong suy nghĩ của nó.
Thay đổi nỗ lực có ảnh hưởng đến bộ nhớ cache của lời nhắc không?
Có. Thay đổi nỗ lực cấp cao nhất giữa các yêu cầu sẽ làm không hợp lệ các tin nhắn đã được lưu trong bộ nhớ cache cho cuộc trò chuyện đó. Một thay đổi nỗ lực theo tin nhắn, hiện đang trong giai đoạn beta, tránh được điều đó.
Tại sao các chỉ số khởi động không khớp với những gì tôi thấy ở mặc định?
Các số liệu khởi động được thực hiện ở mức nỗ lực tối đa. Ở mức trung bình, thẻ hệ thống báo cáo điểm thấp hơn, chẳng hạn như 1277 thay vì 1620 trên GDPval-AA.
Tiếp tục đọc: chuỗi Claude Haiku 5.5
- Nỗ lực quyết định số lượng token bạn tạo ra. Để biết cách Haiku 5.5 so sánh với Haiku 4.5, GPT-6 Luna, và Sonnet 5.5 ở đầu dải, hãy đọc Claude Haiku 5.5 vs Haiku 4.5: Những gì mười xu hiện tại mua được
- Các token suy nghĩ được tính phí như đầu ra, và độ dài lời nhắc chọn tỷ lệ. Để biến lựa chọn nỗ lực của bạn thành hóa đơn hàng tháng, hãy đọc Giá cả Claude Haiku 5.5: Dòng 100K phía sau cắt 90%
- Nỗ lực thay thế ngân sách suy nghĩ cũ, và ngân sách cũ giờ đây trả về lỗi. Để biết cách sửa chữa và phần còn lại của sự chuyển đổi từ Haiku 4.5, hãy đọc Di chuyển từ Claude Haiku 4.5 đến 5.5: Năm lỗi 400 và những thay đổi lặng lẽ
Nguồn
- Nỗ lực (Tài liệu nền tảng Claude)
- Nhắc nhở Claude Haiku 5.5 (Tài liệu nền tảng Claude)
- Claude Haiku 5.5 trên AIHubMix
- Phân tích Trí tuệ, Hiệu suất & Giá cả của Claude Haiku 5.5 (Phân tích Nhân tạo)
- Claude Haiku 5.5: Các chỉ số, Thông số, So sánh Sol & Luna (Kingy.ai)



