Việc thay đổi từ claude-haiku-4-5 sang claude-haiku-5-5 chỉ là phần nhỏ nhất trong quá trình di chuyển này. Năm mẫu yêu cầu đã hoạt động trên Haiku 4.5 giờ đây trả về lỗi 400, và một số thay đổi khác không gây ra lỗi yêu cầu nhưng làm thay đổi những gì bạn nhận được, chi phí, hoặc cách mà mô hình hoạt động bên trong một tác nhân.
Anthropic cho biết các lời nhắc Haiku 4.5 hiện có nên hoạt động tốt trên Haiku 5.5 mà không cần thay đổi. Mã yêu cầu xung quanh những lời nhắc đó là một câu chuyện khác. Bài viết này liệt kê từng vấn đề mà bạn sẽ gặp phải: những gì bạn sẽ thấy, tại sao điều đó xảy ra, và cách khắc phục, kèm theo một danh sách kiểm tra. Tài liệu tham khảo chính thức là hướng dẫn di chuyển Haiku 5.5 của Anthropic.
Phân loại: khớp với triệu chứng
| Những gì bạn thấy | Nguyên nhân | Cách khắc phục |
|---|---|---|
| 400 trên một yêu cầu với ngân sách suy nghĩ | Suy nghĩ thủ công đã bị loại bỏ | Suy nghĩ thích ứng cộng với nỗ lực |
| 400 với temperature, top_p, hoặc top_k | Các tham số lấy mẫu đã bị khóa | Loại bỏ chúng |
| 400 khi các tin nhắn kết thúc ở lượt trợ lý | Điền trước đã bị loại bỏ | Kết thúc ở lượt người dùng |
| 400 trên việc sử dụng máy tính | Công cụ máy tính cũ bị từ chối | Chuyển sang bộ công cụ máy tính |
| 400 sau khi chỉnh sửa các lượt trước đó | Suy nghĩ bị ràng buộc vào lịch sử | Giữ lịch sử chỉ thêm vào |
| Phân tích trả về văn bản trống hoặc sai | Khối suy nghĩ xuất hiện trước | Chọn các khối theo loại |
| Phản hồi bị cắt hoặc thiếu | Suy nghĩ tính vào giới hạn | Tăng max_tokens hoặc giảm nỗ lực |
| Số lượng token và hóa đơn tăng khoảng 30% | Bộ phân tích mới | Tính lại trên mô hình mới |
| Phản hồi với lý do dừng từ chối | Các bộ phân loại an toàn mới | Xử lý trong khách hàng của bạn |
Năm lỗi đầu tiên thất bại một cách ồn ào. Những lỗi còn lại thất bại một cách âm thầm, điều này làm cho chúng khó phát hiện hơn.
Năm lỗi ồn ào
1. Ngân sách suy nghĩ thủ công
Những gì bạn sẽ thấy: một lỗi 400 trên bất kỳ yêu cầu nào gửi thinking: {"type": "enabled", "budget_tokens": N}.
Tại sao: Haiku 4.5 chỉ hỗ trợ suy nghĩ thủ công mở rộng với ngân sách token. Haiku 5.5 chỉ hỗ trợ suy nghĩ thích ứng, và kiểm soát độ sâu bằng effort.
Cách khắc phục: gửi {"type": "adaptive"} hoặc bỏ qua thinking, và chọn một mức độ nỗ lực. Nơi mà ngân sách cũ nhỏ để tiết kiệm token, hãy chọn một mức độ thấp.
# Trước: Haiku 4.5
thinking={"type": "enabled", "budget_tokens": 8000}
# Sau: Haiku 5.5
thinking={"type": "adaptive"},
output_config={"effort": "medium"},
2. Các tham số lấy mẫu
Những gì bạn sẽ thấy: một lỗi 400 khi một yêu cầu thiết lập temperature, top_p, hoặc top_k.
Tại sao: Haiku 5.5 chỉ chấp nhận các giá trị mặc định: temperature là 1 và top_p là 0.99. Bất kỳ giá trị nào khác của cả hai, bất kỳ top_k nào, hoặc gửi cả temperature và top_p đều trả về lỗi 400, bất kể có sử dụng suy nghĩ hay không. Một top_p là 1 cũng bị từ chối.
Cách khắc phục: loại bỏ cả ba. Trường hợp phổ biến là temperature=0 trên một bộ phân loại, được sử dụng để có được nhãn ổn định. Thay thế nó bằng đầu ra có cấu trúc hoặc một công cụ mà đầu vào là một enum, để tập hợp nhãn được thực thi bởi sơ đồ thay vì bằng cách lấy mẫu. Cũng kiểm tra các lớp SDK và cổng mà thêm các giá trị lấy mẫu mặc định thay mặt cho bạn.
3. Điền trước trợ lý
Những gì bạn sẽ thấy: một lỗi 400 khi mục cuối cùng trong messages là một lượt trợ lý, ngay cả khi suy nghĩ đã tắt.
Tại sao: điền trước không được hỗ trợ trên Haiku 5.5, phù hợp với phần còn lại của dòng sản phẩm Claude hiện tại.
Cách khắc phục: kết thúc messages bằng một lượt người dùng, và thay thế điền trước bằng những gì nó đã được sử dụng. Kiểm soát định dạng trở thành đầu ra có cấu trúc (output_config.format). Một lời mở đầu đã điền trước trở thành một hướng dẫn nhắc hệ thống để trả lời trực tiếp. Một sự tiếp tục của một phản hồi bị gián đoạn chuyển vào tin nhắn người dùng: "Phản hồi trước của bạn kết thúc với [văn bản]. Tiếp tục từ đó."
4. Sử dụng máy tính
Những gì bạn sẽ thấy: một lỗi 400 trên API Claude hoặc Google Cloud khi yêu cầu khai báo công cụ computer_20250124.
Tại sao: trên những nền tảng đó, Haiku 5.5 chỉ hỗ trợ việc sử dụng máy tính thông qua bộ công cụ mới hơn, computer_toolset_20260801.
Cách khắc phục: loại bỏ tiêu đề beta computer-use-2025-01-24, thay thế mục công cụ bằng {"type": "computer_toolset_20260801"}, và cập nhật vòng lặp tác nhân: phân phối trên mỗi tool_use khối name và toolset_name thay vì trên input.action, xử lý mọi khối như vậy trong một lượt, và lặp lại toolset_name trên kết quả. Zoom được bật theo mặc định; nếu môi trường của bạn không thực hiện điều đó, hãy tắt nó trong cấu hình bộ công cụ. Trên Amazon Bedrock, hãy kiểm tra ghi chú tương thích của công cụ sử dụng máy tính trước khi chọn phiên bản. Bộ công cụ cùng loại cũng mang lại việc sử dụng trình duyệt, điều mà Haiku 4.5 chưa bao giờ có.
5. Chỉnh sửa các lượt trước đó
Những gì bạn sẽ thấy: một lỗi 400 khi một yêu cầu gửi lại một khối suy nghĩ sau khi một cái gì đó trước đó đã thay đổi: nhắc hệ thống, danh sách công cụ, hoặc một tin nhắn trước đó.
Tại sao: một khối suy nghĩ của Haiku 5.5 chỉ giữ nguyên giá trị khi mọi thứ được gửi trước đó không thay đổi. Kiểm tra này được thực hiện theo mặc định cho các tài khoản được tạo vào hoặc sau ngày 31 tháng 8 năm 2026, và trên các tài khoản cũ chỉ khi một yêu cầu chọn tham gia.
Cách khắc phục: giữ cho các cuộc trò chuyện chỉ thêm vào. Những thủ phạm phổ biến là một nhắc hệ thống với dấu thời gian, một danh sách công cụ tăng lên khi một plugin kết nối, cắt ngắn phía khách hàng, và các nhắc nhở được tiêm vào lịch sử và bị loại bỏ ở lượt tiếp theo. Đối với các hướng dẫn theo lượt, Haiku 5.5 hỗ trợ các tin nhắn hệ thống bên trong messages, không có tiêu đề beta, mà thêm ngữ cảnh mà không chỉnh sửa những gì đã đến trước đó.
Những lỗi âm thầm
Các khối suy nghĩ xuất hiện trước. Suy nghĩ được bật theo mặc định, vì vậy một phản hồi có thể bắt đầu với một hoặc nhiều khối thinking. Mã đọc response.content[0].text như là câu trả lời sẽ bị hỏng hoặc trả về văn bản trống. Chọn các khối theo type.
Văn bản suy nghĩ trống theo mặc định. Haiku 4.5 trả về suy nghĩ tóm tắt. Haiku 5.5 trả về các khối thinking với trường văn bản trống và chỉ có một chữ ký. Nếu giao diện người dùng của bạn hiển thị các tóm tắt lý do, hãy đặt thinking: {"type": "adaptive", "display": "summarized"}. Dù bằng cách nào, hãy truyền lại các khối suy nghĩ không thay đổi với kết quả công cụ; một bộ tuần tự hóa loại bỏ các khối trống sẽ xóa chúng.
max_tokens giờ đây phải bao gồm suy nghĩ. Một giới hạn được định cỡ cho một câu trả lời ngắn có thể bị sử dụng hết bởi suy nghĩ, kết thúc phản hồi với stop_reason: "max_tokens" trước bất kỳ văn bản nào. Tăng giới hạn hoặc giảm nỗ lực.
Văn bản giống nhau tăng khoảng 30% token. Bộ phân tích mới thay đổi các trường usage, kết quả count_tokens, ngân sách ngữ cảnh, và bất kỳ max_tokens nào được điều chỉnh cho Haiku 4.5. Nó cũng di chuyển đường giá 100K token xuống khoảng 77K token như Haiku 4.5 đã tính. Tính lại các lời nhắc thực tế với mô hình được đặt thành claude-haiku-5-5 trước khi tin tưởng vào bảng điều khiển chi phí.
Mức độ nỗ lực mặc định là trung bình. Haiku 4.5 không có cài đặt nỗ lực. Haiku 5.5 mặc định là medium, điều này có thể là nhiều suy nghĩ hơn mức cần thiết cho một lộ trình đơn giản. Đặt nó một cách rõ ràng.
Các khối suy nghĩ vẫn gắn với tài khoản đã tạo ra chúng. Nếu dịch vụ của bạn phát lại các cuộc trò chuyện đã lưu qua một tài khoản API khác, các khối suy nghĩ của Haiku 5.5 sẽ bị loại bỏ âm thầm và yêu cầu sẽ chạy mà không có lý do đó. Phát lại mỗi cuộc trò chuyện qua tài khoản đã tạo ra nó.
Priority Tier không được chuyển giao. Haiku 5.5 không hỗ trợ Priority Tier, vì vậy hãy lập kế hoạch cho khả năng một cách riêng biệt nếu bạn dựa vào nó cho Haiku 4.5.
Các danh sách cổng có thể khác nhau. Trang Haiku 5.5 trên AIHubMix hiện đang liệt kê chiều dài ngữ cảnh 200K, trong khi Anthropic chỉ định 1M. Xác nhận giới hạn trên lộ trình bạn sử dụng trước khi di chuyển khối lượng công việc với lời nhắc dài.
Những thay đổi hành vi quan trọng đối với các tác nhân có quyền thực sự
Các từ chối là mới, và không có gì bắt chúng cho bạn. Haiku 5.5 chạy các bộ phân loại an toàn trong bốn danh mục: an ninh mạng, sinh học, phát triển LLM biên giới, và thiệt hại chung. Một sự từ chối trở lại như một HTTP 200 bình thường với stop_reason: "refusal" và một danh mục trong stop_details. Không giống như Sonnet 5.5 và Opus 5.5, Haiku 5.5 không có phương án dự phòng phía máy chủ: một danh sách các mô hình dự phòng trả về lỗi 400, và chế độ dự phòng mặc định để lại yêu cầu bị từ chối. Kiểm tra stop_reason trước khi đọc content, và quyết định trong mã của riêng bạn xem có nên diễn đạt lại, nâng cấp lên một mô hình lớn hơn, hoặc dừng lại. Theo bài viết ra mắt, các biện pháp bảo vệ an ninh mạng cho phép một phạm vi công việc phòng thủ rộng hơn so với Sonnet 5.5 nhưng chặn thử nghiệm xâm nhập.
Văn bản người dùng bên trong kết quả công cụ có thể bị bỏ qua. Haiku 5.5 được đào tạo để chống lại việc tiêm nhắc thông qua kết quả công cụ. Nếu bộ khung của bạn gửi một tin nhắn mà người dùng đã nhập giữa nhiệm vụ bên trong một khối tool_result, mô hình có thể coi đó là không đáng tin cậy và bỏ qua nó. Đặt đầu vào của người dùng giữa lượt trong một khối văn bản sau kết quả công cụ cuối cùng, và giữ thông báo của bộ khung trong một tin nhắn hệ thống riêng biệt.
Tại mức nỗ lực thấp, các tác nhân có thể dừng sớm hoặc bỏ qua các kiểm tra. Với một nhắc hệ thống tác nhân lập trình dài ở low, Haiku 5.5 đôi khi trả lại nhiệm vụ trước khi hoàn thành, và ở low và medium đôi khi báo cáo một thay đổi mã là đã hoàn thành mà không chạy thử nghiệm. Hướng dẫn hướng dẫn nhắc Haiku 5.5 của Anthropic có hướng dẫn ngắn cho cả hai. Đối với một tác nhân có thể viết tệp hoặc chạy lệnh, một "đã hoàn thành" chưa được xác minh là nguy hiểm hơn trong hai trường hợp.
Buộc một công cụ bỏ qua suy nghĩ. tool_choice bị buộc vẫn được chấp nhận, nhưng mô hình sau đó gọi công cụ mà không suy nghĩ trước. Đối với các công cụ có tác dụng phụ, auto cộng với một hướng dẫn rõ ràng cho phép mô hình suy nghĩ trước khi hành động.
Các công cụ tìm kiếm cần ngày hôm nay. Khi Haiku 5.5 có một công cụ tìm kiếm, hãy cung cấp cho nó ngày hiện tại trong nhắc hệ thống hoặc mô tả công cụ. Trong thử nghiệm của Anthropic, điều này đã làm cho các câu trả lời được gắn kết với các kết quả gần đây.
Một yêu cầu đã di chuyển qua AIHubMix
Một bộ phân loại Haiku 4.5 đã sử dụng temperature=0, một ngân sách suy nghĩ, và một { đã điền trước cho JSON, được viết lại cho Haiku 5.5 trên điểm cuối Claude bản địa AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # không gian cho suy nghĩ cộng với JSON
output_config={
"effort": "low", # thay thế ngân sách suy nghĩ cũ
"format": { # thay thế điền trước và temperature=0
"type": "json_schema",
"schema": {
"type": "object",
"properties": {
"label": {"type": "string", "enum": ["billing", "bug", "other"]}
},
"required": ["label"],
"additionalProperties": False,
},
},
},
messages=[{"role": "user", "content": "Ticket: 'Tôi đã bị tính phí hai lần cho tháng Mười.'"}],
)
if r.stop_reason == "refusal":
raise RuntimeError(f"từ chối: {r.stop_details}")
text = next(b.text for b in r.content if b.type == "text")
print(text)
Việc một cổng có chuyển tiếp các trường output_config và các tiêu đề beta mới hơn không thay đổi là điều đáng xác nhận trong lần chạy thử nghiệm đầu tiên của bạn. Khi lộ trình đã di chuyển vượt qua các đánh giá của bạn, danh sách mô hình AIHubMix giúp dễ dàng chỉ định cùng một mã cho Sonnet 5.5 cho bất kỳ loại nhiệm vụ nào mà vẫn gặp lỗi trên Haiku.
Danh sách kiểm tra di chuyển
- Thay đổi ID mô hình thành claude-haiku-5-5, không có hậu tố ngày tháng.
- Thay thế mọi ngân sách suy nghĩ bằng suy nghĩ thích ứng và một mức độ nỗ lực rõ ràng.
- Loại bỏ temperature, top_p, và top_k, bao gồm cả các giá trị mặc định được thêm bởi các lớp bọc.
- Thay thế các điền trước trợ lý bằng đầu ra có cấu trúc, hướng dẫn hệ thống, hoặc các tiếp tục lượt người dùng.
- Chuyển việc sử dụng máy tính sang bộ công cụ máy tính và cập nhật vòng lặp tác nhân.
- Giữ lịch sử cuộc trò chuyện chỉ thêm vào nếu các khối suy nghĩ được phát lại.
- Đọc nội dung phản hồi theo loại khối, và giữ các khối suy nghĩ trống khi phát lại.
- Tăng max_tokens trên các lộ trình câu trả lời ngắn, hoặc giảm nỗ lực.
- Xử lý lý do dừng từ chối trước khi đọc nội dung; không cấu hình các phương án dự phòng phía máy chủ.
- Tính lại số lượng token cho các lời nhắc trên mô hình mới và thiết lập lại bảng điều khiển chi phí.
- Kiểm tra các lời nhắc nào hiện vượt quá 100K token và cắt hoặc chia chúng.
- Đặt hiển thị thành tóm tắt nếu người dùng thấy các tóm tắt lý do.
- Gửi đầu vào của người dùng giữa lượt bên ngoài kết quả công cụ.
- Cung cấp ngày hôm nay cho các tác nhân có khả năng tìm kiếm.
- Kiểm tra lại giới hạn tỷ lệ, nhu cầu Priority Tier, và giới hạn ngữ cảnh của cổng của bạn trước khi di chuyển khối lượng.
Câu hỏi thường gặp
Các lời nhắc Haiku 4.5 của tôi có hoạt động trên Haiku 5.5 không?
Anthropic cho biết các lời nhắc hiện có nên hoạt động tốt mà không cần thay đổi. Các tham số yêu cầu xung quanh chúng là những gì gây ra lỗi: ngân sách suy nghĩ, cài đặt lấy mẫu, điền trước, và công cụ sử dụng máy tính cũ đều trả về lỗi.
Tại sao bộ phân loại của tôi lại thất bại khi tôi đã loại bỏ temperature 0?
Nó không nên thất bại, nhưng các nhãn có thể thay đổi nhiều hơn. Sử dụng đầu ra có cấu trúc hoặc một công cụ với trường enum để các nhãn cho phép được thực thi bởi sơ đồ. Điều đó đáng tin cậy hơn so với temperature 0 trước đây.
Tôi có thể tắt suy nghĩ không?
Có, ở mức thấp, trung bình và cao. Ở mức xhigh và max, việc tắt suy nghĩ sẽ trả về lỗi. Anthropic khuyên nên chọn mức độ nỗ lực thấp hơn, vì mô hình có thể tự động bỏ qua suy nghĩ trên các yêu cầu đơn giản.
Mã của tôi nên làm gì khi Haiku 5.5 từ chối?
Kiểm tra lý do dừng trước khi đọc nội dung. Haiku 5.5 không có phương án dự phòng phía máy chủ, vì vậy mã của bạn quyết định xem có nên diễn đạt lại, gửi yêu cầu đến một mô hình lớn hơn, hoặc trả về lỗi cho người dùng.
Tại sao việc sử dụng token của tôi lại tăng lên sau khi di chuyển?
Có hai lý do. Bộ phân tích mới tính khoảng 30% nhiều token hơn cho cùng một văn bản, và suy nghĩ được bật theo mặc định, thêm các token đầu ra. Giảm nỗ lực và tính lại các lời nhắc của bạn trên mô hình mới.
Tôi có cần thay đổi gì cho việc lưu trữ lời nhắc không?
Thường thì không, và nó trở nên dễ dàng hơn: lời nhắc có thể lưu trữ tối thiểu giảm từ 4,096 xuống 512 token, và các khối suy nghĩ từ các lượt trước đó vẫn ở trong tiền tố đã lưu trữ theo mặc định. Tránh chỉnh sửa các lượt trước đó, điều này giờ đây làm vô hiệu hóa các khối suy nghĩ cũng như bộ nhớ cache.
Có thể một cuộc trò chuyện di chuyển từ Haiku 5.5 lên một mô hình lớn hơn không?
Có. Sonnet 5.5 và Opus 5.5 đọc các khối suy nghĩ của Haiku 5.5, vì vậy một cuộc trò chuyện được nâng cấp lên bất kỳ mô hình nào trong số đó vẫn giữ được lý do trước đó. Đối với các mô hình mục tiêu khác, hãy kiểm tra tài liệu về việc bảo tồn suy nghĩ trước.
Tiếp tục đọc: chuỗi Claude Haiku 5.5
- Trước khi lập kế hoạch di chuyển, điều quan trọng là biết liệu mô hình mới có đáp ứng tiêu chuẩn chất lượng của bạn không. Để so sánh với Haiku 4.5, GPT-6 Luna, và Sonnet 5.5, hãy đọc Claude Haiku 5.5 so với Haiku 4.5: Mười xu giờ đây mua được gì
- Bước 2 của danh sách kiểm tra yêu cầu bạn chọn một mức độ nỗ lực. Để biết mỗi mức độ tốn bao nhiêu token và bắt đầu từ đâu, hãy đọc Mức độ nỗ lực của Claude Haiku 5.5: Trung bình là mặc định, Thấp thường là đủ
- Sự thay đổi bộ phân tích di chuyển đường giá cũng như bảng điều khiển của bạn. Để xem điều đó ảnh hưởng đến hóa đơn thực tế như thế nào, hãy đọc Giá cả của Claude Haiku 5.5: Đường 100K phía sau mức giảm 90%
Nguồn
- Hướng dẫn di chuyển Claude Haiku 5.5 (Tài liệu của Claude Platform)
- Hướng dẫn nhắc Claude Haiku 5.5 (Tài liệu của Claude Platform)
- Giới thiệu Claude Haiku 5.5 (Anthropic)
- Claude Haiku 5.5 trên AIHubMix
- Claude Haiku 5.5 đã ra mắt với giá 0,10 đô la cho mỗi triệu token. Đọc quy tắc 100K trước khi bạn di chuyển (Bản tin của Roo)



