Claude Haiku 4.5 đạt 0.0% trên Terminal-Bench 4.0. Claude Haiku 5.5 đạt 39.2%, và nó có giá chỉ bằng một phần mười so với mỗi token: $0.10 cho mỗi triệu token đầu vào và $0.50 cho mỗi triệu token đầu ra, so với $1 và $5 cho Haiku 4.5.
Đó là sự nâng cấp trong một câu. Mô hình Claude nhỏ đã chuyển từ "tốt cho phân loại, không cho tác nhân" thành một subagent có thể sử dụng, và giá của nó giờ đây tương đương với GPT-6 Luna của OpenAI đến từng xu. Anthropic đã phát hành nó vào ngày 7 tháng 10 năm 2026 với Claude Haiku 5.5, ID mô hình claude-haiku-5-5, và nó đã được liệt kê trên AIHubMix.
Giá đi kèm với các điều kiện, và điểm chuẩn cũng vậy. Bài viết này đề cập đến những gì đã thay đổi, Haiku 5.5 gần với Sonnet 5.5 như thế nào, nơi nào là lựa chọn sai, và ai nên chuyển đổi ngay bây giờ.
Những gì đã thay đổi và những gì không thay đổi
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Giá đầu vào / đầu ra | $1 / $5 | $0.10 / $0.50 |
| Cửa sổ ngữ cảnh | 200K | 1M |
| Đầu ra tối đa | 64K | 128K |
| Suy nghĩ | Ngân sách thủ công, tắt theo mặc định | Thích ứng, bật theo mặc định |
| Mức độ nỗ lực | Không có | Năm, mặc định trung bình |
| Token cho cùng một văn bản | Cơ sở | Khoảng 30% nhiều hơn |
| Công cụ sử dụng trình duyệt | Không | Có |
Giá Haiku 5.5 áp dụng cho các yêu cầu lên đến 100K token; các yêu cầu dài hơn sẽ phải trả $0.50 / $2.50. Giá là cho mỗi triệu token.
Những gì vẫn giữ nguyên: mô tả công việc. Anthropic vẫn quảng bá Haiku cho công việc có khối lượng lớn, nhạy cảm về chi phí (tóm tắt, nén, truy vấn cơ sở dữ liệu, phân loại) và nhiệm vụ subagent dưới một mô hình lớn hơn. Anthropic cho biết các yêu cầu Haiku 4.5 hiện có nên hoạt động tốt mà không cần thay đổi. Mã yêu cầu hiện có là một vấn đề khác: năm mẫu yêu cầu đã hoạt động trên Haiku 4.5 giờ đây trả về lỗi 400, như danh sách trong hướng dẫn di chuyển của Anthropic và bài viết di chuyển trong loạt bài này sẽ hướng dẫn.
Hai thay đổi làm thay đổi cách mà mô hình hoạt động theo mặc định. Suy nghĩ giờ đây được bật trừ khi bạn tắt nó, vì vậy một yêu cầu mà không bao giờ đề cập đến suy nghĩ có thể quay lại với các khối thinking trước tiên và tiêu tốn token đầu ra cho chúng. Và Haiku 5.5 là Haiku đầu tiên có cài đặt nỗ lực, hiện là nút chính giữa chi phí và chất lượng.
Nó đạt điểm như thế nào so với Haiku 4.5, Luna và Sonnet 5.5
Các số liệu dưới đây đến từ tài liệu phát hành của Anthropic và thẻ hệ thống Haiku 5.5, được biên soạn bởi Kingy.ai. Chúng được báo cáo bởi nhà cung cấp, Anthropic đã tự chạy các mô hình GPT, và chưa ai tái tạo được toàn bộ bảng một cách độc lập.
| Điểm chuẩn | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (offline) | 72.4% | 15.7% | 48.9% | 83.9% |
| Kỳ thi cuối cùng của nhân loại | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main | 46.4% | n/a | 42.4% | 52.1% |
| Chartography | 46.4% | 6.4% | 29.1% | 61.6% |
Kỳ thi cuối cùng của nhân loại và Chartography không có công cụ. Điểm FrontierCode của Sonnet 5.5 đạt ở mức nỗ lực xhigh.
Ba chỉ số quan trọng hơn bất kỳ hàng nào:
- So với Haiku 4.5, đây là một loại mô hình khác. Các đánh giá công việc tri thức gần như gấp đôi, và các hàng tác nhân đi từ gần như không đến có thể sử dụng. Haiku 4.5 không thể hoàn thành một nhiệm vụ Terminal-Bench; Haiku 5.5 hoàn thành khoảng hai trong năm.
- So với GPT-6 Luna, nó dẫn đầu trên mọi hàng chung với cùng mức giá niêm yết. Các khoảng cách rộng nhất là về sử dụng máy tính (72.4% so với 48.9%) và Terminal-Bench (39.2% so với 16.4%).
- So với Sonnet 5.5, khoảng cách phụ thuộc vào nhiệm vụ. Trên FrontierCode, Haiku nằm trong khoảng sáu điểm. Trên Terminal-Bench, Sonnet đạt 70.6% còn Haiku đạt 39.2%. Anthropic tự nói rằng Sonnet 5.5 và Opus 5.5 vẫn là lựa chọn tốt hơn cho lập trình tác nhân phức tạp.
Đọc kỹ trước khi trích dẫn những con số này
Các điểm số tiêu đề được chạy ở mức nỗ lực tối đa, cài đặt đắt nhất. Mặc định là trung bình, và các lần chạy nỗ lực trung bình của thẻ hệ thống có kết quả thấp hơn: 1277 trên GDPval-AA thay vì 1620, và 1372 trên AA-Briefcase thay vì 1578. Nếu bạn triển khai ở mức mặc định, hãy so sánh với những con số đó, không phải bảng phát hành.
Số liệu OSWorld cũng cần xem xét lại. 72.4% là tín dụng một phần, trung bình qua các điểm kiểm tra. Tỷ lệ nhiệm vụ mà Haiku 5.5 hoàn thành mọi điểm kiểm tra là 37.1% (Luna: 17.1%). Đối với một tác nhân trình duyệt phải hoàn thành toàn bộ công việc, 37.1% là con số cần lên kế hoạch.
Những gì khách hàng sớm báo cáo
Bài viết phát hành của Anthropic trích dẫn một số khách hàng đã thử nghiệm mô hình trước khi phát hành. Đây là những khách hàng được nhà cung cấp chọn, nhưng họ chỉ ra cùng một khối lượng công việc:
- AlphaSense thực hiện khoảng 8 triệu cuộc gọi "Hỏi trong Tài liệu" mỗi tuần. Trên 400 truy vấn thử nghiệm, Haiku 5.5 đạt 0.84 so với 0.76 của Haiku 4.5.
- Box thấy có sự tăng 11 điểm so với Haiku 4.5 với độ trễ khoảng một nửa.
- Asana đo được độ trễ thấp hơn hơn 30% cho mỗi nhiệm vụ và nhanh hơn tới 2.5 lần cho mỗi lượt tác nhân, so với mô hình hiện tại của nó.
- HubSpot đạt 92.8% trên bộ CRM của mình, điểm số tốt nhất mà nó từng thấy từ một mô hình nhỏ.
- Cognition sử dụng Haiku 5.5 như một "người hỗ trợ" dưới Opus 5.5 trong Devin Fusion và báo cáo rằng cặp đôi này giữ điểm FrontierCode là 66.2 với chi phí và độ trễ thấp hơn.
Mô hình: công việc ngắn, lặp đi lặp lại qua các tài liệu, và nhiệm vụ subagent dưới một mô hình lớn hơn.
Nơi Haiku 5.5 là lựa chọn sai
- Lập trình tác nhân phức tạp. Terminal-Bench là nơi Sonnet 5.5 dẫn đầu xa nhất. Nếu một nhiệm vụ cần nhiều bước, yêu cầu mơ hồ, hoặc một chuỗi chỉnh sửa dài, hãy bắt đầu với Sonnet 5.5 hoặc Opus 5.5.
- Các yêu cầu trên 100K token. Cửa sổ 1M là có thật, nhưng giá không đồng đều trên đó. Qua 100K token, toàn bộ yêu cầu chuyển sang $0.50 / $2.50, và vì bộ phân tích mới đếm khoảng 30% nhiều token hơn, dòng đó nằm gần 77K token như Haiku 4.5 đã đếm. Bài viết về giá trong loạt bài này sẽ làm rõ các con số.
- Công việc cần xhigh hoặc max để vượt qua. Đầu ra trở nên dài và đắt ở các cài đặt cao nhất. Hướng dẫn của chính Anthropic là so sánh với Sonnet 5.5 trước khi quyết định ở đó.
- Nhóm ở Cấp độ Ưu tiên. Haiku 5.5 không hỗ trợ điều này, vì vậy cam kết Cấp độ Ưu tiên của Haiku 4.5 không được chuyển giao.
- Kiểm tra bảo mật. Các biện pháp bảo vệ mạng của Haiku 5.5 nghiêm ngặt hơn so với Haiku 4.5 và chặn kiểm tra xâm nhập. Mong đợi các lý do dừng
refusalcho loại công việc đó, mà không có phương án dự phòng nào ở phía máy chủ cho một mô hình khác.
Thử nghiệm qua AIHubMix
Cài đặt nỗ lực của Haiku 5.5 nằm trong output_config của API Tin nhắn, vì vậy điểm cuối Claude native trên AIHubMix là con đường trực tiếp nhất. Cài đặt SDK Anthropic hiện tại (pip install -U anthropic) và chỉ định nó đến AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # để lại chỗ cho suy nghĩ, không chỉ câu trả lời
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Phân loại vé này là thanh toán, lỗi, hoặc khác: "
"'Tôi đã bị tính phí hai lần cho tháng Mười.'",
}],
)
# Các khối suy nghĩ có thể đến trước, vì vậy hãy chọn khối văn bản theo loại.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Hai điều cần kiểm tra trong lần chạy đầu tiên của bạn. Đọc response.usage.output_tokens ở low và lại ở high trên cùng một yêu cầu: nếu các con số không thay đổi, cài đặt nỗ lực không đến được mô hình. Và lưu ý rằng trang mô hình của AIHubMix hiện đang liệt kê chiều dài ngữ cảnh 200K cho mô hình này, dưới mức 1M của Anthropic, vì vậy hãy xác nhận giới hạn trước khi gửi các yêu cầu rất dài.
Ai nên chuyển đổi, ai nên chờ đợi
Chuyển đổi ngay nếu bạn thực hiện phân loại, trích xuất, định tuyến, tóm tắt, hoặc Q&A tài liệu với các yêu cầu dưới 100K token. Bạn sẽ nhận được một mô hình mạnh mẽ hơn với giá token chỉ bằng một phần nhỏ. Dành một giờ cho các thay đổi mã yêu cầu, sau đó kiểm tra nỗ lực low so với medium trong các đánh giá của riêng bạn.
Chuyển đổi ngay nếu bạn sử dụng một mô hình lớn cho công việc subagent mà nó quá đủ tiêu chuẩn: lấy một số từ một hồ sơ, kiểm tra một tệp, tóm tắt kết quả của một công cụ. Đây là vai trò mà Anthropic và các khách hàng phát hành của nó nhấn mạnh.
Chờ một vòng nếu tích hợp của bạn sử dụng công cụ sử dụng máy tính với computer_20250124, điền trước, hoặc temperature=0. Mỗi cái trong số đó trả về lỗi 400 trên Haiku 5.5, và việc sửa chữa chúng là công việc mã, không phải chỉ là thay đổi chuỗi mô hình.
Giữ nguyên vị trí của bạn nếu khối lượng công việc của bạn là yêu cầu dài (thường trên khoảng 77K token của Haiku 4.5), phụ thuộc vào Cấp độ Ưu tiên, hoặc là lập trình tác nhân phức tạp. Đối với nhóm cuối cùng, sự so sánh hữu ích là Haiku 5.5 so với Sonnet 5.5 về chi phí cho mỗi nhiệm vụ hoàn thành, không phải Haiku 5.5 so với Haiku 4.5.
Khi bạn sẵn sàng so sánh, danh sách mô hình AIHubMix đặt Haiku 5.5, Sonnet 5.5, và Opus 5.5 dưới một khóa API, vì vậy cùng một đánh giá có thể chạy trên cả ba.
Câu hỏi thường gặp
Claude Haiku 5.5 có tốt hơn Haiku 4.5 ở mọi thứ không?
Trên mọi điểm chuẩn trong bảng phát hành của Anthropic, có, thường là với khoảng cách rộng. Các ngoại lệ là thực tiễn hơn là chất lượng: Cấp độ Ưu tiên không được hỗ trợ, các yêu cầu trên 100K token tốn nhiều hơn mỗi token so với tỷ lệ yêu cầu ngắn, và một số mẫu yêu cầu cũ giờ đây trả về lỗi.
Haiku 5.5 thực sự rẻ hơn 90% không?
Giá mỗi token thấp hơn 90% cho các yêu cầu lên đến 100K token và thấp hơn 50% trên mức đó. Vì bộ phân tích mới đếm khoảng 30% nhiều token cho cùng một văn bản, và suy nghĩ giờ đây tạo ra token đầu ra, Anthropic ước tính tiết kiệm điển hình khoảng 75%.
Haiku 5.5 so với GPT-6 Luna như thế nào?
Cả hai đều có giá $0.10 cho mỗi triệu token đầu vào và $0.50 cho mỗi triệu token đầu ra. Trong các kết quả được báo cáo của Anthropic, Haiku 5.5 đạt điểm cao hơn trên mọi điểm chuẩn mà cả hai đều xuất hiện, rõ ràng nhất là về sử dụng máy tính và Terminal-Bench. Luna giữ giá cơ bản của nó cho đến chiều dài yêu cầu dài hơn, vì vậy các khối lượng công việc yêu cầu dài nên được định giá riêng.
Liệu Haiku 5.5 có thể thay thế Sonnet 5.5 cho lập trình không?
Đối với các thay đổi hẹp, được xác định rõ và các nhiệm vụ subagent, nó có thể đáng để thử nghiệm. Đối với lập trình tác nhân phức tạp nhiều bước, Sonnet 5.5 đạt điểm cao hơn nhiều trên Terminal-Bench 4.0 (70.6% so với 39.2%), và Anthropic khuyến nghị Sonnet hoặc Opus cho công việc đó.
Các điểm số chuẩn có ở cài đặt mặc định không?
Không. Các điểm số tiêu đề được chạy ở mức nỗ lực tối đa. Mặc định là trung bình, nơi thẻ hệ thống báo cáo kết quả thấp hơn, ví dụ 1277 thay vì 1620 trên GDPval-AA.
Cửa sổ ngữ cảnh 1M có nghĩa là tôi có thể gửi các yêu cầu 1M token một cách rẻ không?
Bạn có thể gửi chúng, nhưng bất kỳ thứ gì trên 100K token sẽ bị tính phí $0.50 đầu vào và $2.50 đầu ra cho mỗi triệu token cho toàn bộ yêu cầu. Hãy kiểm tra giới hạn ngữ cảnh được liệt kê của cổng của bạn nữa.
Tôi phải thay đổi gì trong mã của mình để chuyển đổi?
Tối thiểu: ID mô hình, bất kỳ ngân sách suy nghĩ thủ công nào, bất kỳ cài đặt nhiệt độ hoặc top_p nào, bất kỳ điền trước trợ lý nào, và mã đọc khối nội dung đầu tiên như câu trả lời. Bài viết di chuyển trong loạt bài này có danh sách đầy đủ.
Tiếp tục đọc: loạt bài Claude Haiku 5.5
- Các điểm số tiêu đề được chạy ở mức nỗ lực tối đa, nhưng bạn có thể triển khai ở mức trung bình hoặc thấp. Để xem mỗi mức tốn bao nhiêu token và những gì bạn mất khi giảm xuống, hãy đọc Mức độ nỗ lực Claude Haiku 5.5: Trung bình là Mặc định, Thấp thường là Đủ
- Số liệu một phần giá chỉ giữ dưới một dòng chiều dài yêu cầu mà bộ phân tích mới di chuyển. Để biết các ví dụ về chi phí đã làm việc và các quy tắc thanh toán dễ bị bỏ lỡ, hãy đọc Giá Claude Haiku 5.5: Dòng 100K Đằng Sau Giảm 90%
- Chuyển đổi không chỉ là thay đổi chuỗi mô hình: năm mẫu yêu cầu cũ giờ đây không hoạt động. Đối với mỗi lỗi, nguyên nhân của nó, và cách khắc phục, hãy đọc Di chuyển từ Claude Haiku 4.5 đến 5.5: Năm Lỗi 400 và Những Thay Đổi Im Lặng
Nguồn
- Giới thiệu Claude Haiku 5.5 (Anthropic)
- Hướng dẫn di chuyển Claude Haiku 5.5 (Tài liệu Nền tảng Claude)
- Claude Haiku 5.5 trên AIHubMix
- Claude Haiku 5.5: Điểm chuẩn, Thông số, So sánh Sol & Luna (Kingy.ai)
- Phân tích Trí tuệ, Hiệu suất & Giá của Claude Haiku 5.5 (Phân tích Nhân tạo)



