OpenAI đã chính thức phát hành gia đình GPT-5.6 vào ngày 9 tháng 7 năm 2026. AIHubMix đã hoàn tất việc tích hợp cả ba cấp độ: gpt-5.6-sol, gpt-5.6-terra, và gpt-5.6-luna hiện đã có sẵn thông qua Chat Completions và Responses. Phiên bản này cũng thay đổi cơ chế lưu trữ lời nhắc và cách tính phí: ghi lưu trữ hiện được tính phí riêng. Bài viết này sẽ đề cập đến vị trí của ba cấp độ và đi qua các thay đổi về lưu trữ từng điểm một.
Những thay đổi với ba cấp độ GPT-5.6
GPT-5.6 đã sửa đổi cách đặt tên: số hiệu chỉ thế hệ mô hình, trong khi Sol, Terra và Luna là các cấp độ khả năng có thể phát triển độc lập. Theo các định nghĩa chính thức, Sol là mô hình hàng đầu, Terra là cấp độ giá thấp hơn với hiệu suất tương đương GPT-5.5, và Luna là cấp độ nhanh nhất, giá thấp nhất.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Vị trí chính thức | Mô hình hàng đầu cho công việc chuyên nghiệp phức tạp | Trí tuệ và chi phí cân bằng | Dành cho khối lượng công việc nhạy cảm về chi phí |
| Cửa sổ ngữ cảnh | 1,050,000 | 1,050,000 | 1,050,000 |
| Đầu ra tối đa | 128,000 | 128,000 | 128,000 |
| Thời điểm cắt đứt kiến thức | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Tương đương thô trong thế hệ trước | Cấp độ không có hậu tố | cấp độ mini | cấp độ nano |
Về khả năng, vị trí chính thức: Sol đạt được kết quả tiên tiến trong các nhiệm vụ lập trình, công việc tri thức, an ninh mạng và khoa học, được OpenAI mô tả là mô hình lập trình tốt nhất của họ cho đến nay, và thiết lập các kỷ lục mới trên Terminal-Bench 2.1 và DeepSWE; Terra tương đương hiệu suất GPT-5.5 với giá chỉ bằng một nửa. Gia đình này bổ sung một mức độ lý luận tối đa, và API Responses có khả năng Gọi Công Cụ Chương Trình và đa tác nhân (Beta).
Giải thích về việc nâng cấp cơ chế lưu trữ
Trước GPT-5.6, việc lưu trữ lời nhắc trên các mô hình GPT hoàn toàn tự động: các tiền tố từ 1,024 token trở lên được lưu trữ tự động, các nhà phát triển không có quyền kiểm soát đối với những gì được lưu trữ hoặc trong bao lâu, và các bộ nhớ cache bị xóa sau 5–10 phút không hoạt động. OpenAI tóm tắt các thay đổi của GPT-5.6 là "lưu trữ lời nhắc có thể dự đoán hơn", với ba điểm cụ thể:
- Thời gian lưu trữ chuyển từ "ít nhất 5 phút" thành "ít nhất 30 phút".
prompt_cache_options.ttlhiện chỉ hỗ trợ"30m"; đó là mức tối thiểu đảm bảo, và thời gian lưu trữ thực tế có thể lâu hơn. - Các điểm dừng rõ ràng là mới. Việc đặt
prompt_cache_breakpointtrên một khối nội dung sẽ cố định ranh giới lưu trữ ở cuối nội dung ổn định, vì vậy các thay đổi sau điểm dừng sẽ không làm vô hiệu hóa tiền tố đã lưu trữ trước đó; vớiprompt_cache_options.modeđược đặt thành"explicit", chỉ các điểm dừng thủ công mới được sử dụng. prompt_cache_keychuyển từ một tối ưu hóa thành một yêu cầu chính thức. Bắt đầu từ GPT-5.6, tham số này nên được thiết lập để cho phép khớp bộ nhớ cache đáng tin cậy hơn; OpenAI khuyến nghị giữ lưu lượng truy cập mỗi khóa khoảng 15 yêu cầu mỗi phút.
Cách đánh giá phí ghi lưu trữ 1.25x
Bắt đầu từ GPT-5.6, ghi lưu trữ được tính phí ở mức 1.25x tỷ lệ đầu vào cơ bản và đọc lưu trữ ở mức 0.1x; trên các mô hình trước đó, ghi lưu trữ không có phí bổ sung. Cách diễn đạt chính thức (từ thông báo GPT-5.6): "Đối với GPT-5.6 và các mô hình sau này, ghi lưu trữ được tính phí ở mức 1.25x tỷ lệ đầu vào không được lưu trữ của mô hình, trong khi đọc lưu trữ tiếp tục nhận được mức giảm 90% cho đầu vào đã lưu trữ."
Các phép toán hòa vốn theo trực tiếp từ các tỷ lệ chính thức: việc ghi một tiền tố tốn thêm 0.25x tỷ lệ đầu vào so với việc không lưu trữ, và mỗi lần truy cập tiếp theo tiết kiệm 0.9x tỷ lệ đầu vào: một tiền tố được sử dụng lại ngay cả một lần cũng tạo ra tiết kiệm ròng, và càng nhiều lần sử dụng lại, tiết kiệm càng lớn.
- Các khối lượng công việc rõ ràng được hưởng lợi: quy trình làm việc của tác nhân với các lời nhắc hệ thống dài, RAG thường xuyên bao gồm tài liệu tham khảo dài, các ứng dụng mang theo các định nghĩa công cụ lớn, và các cuộc hội thoại nhiều lượt chỉ thêm tin nhắn. Những khối lượng công việc này có tỷ lệ sử dụng lại tiền tố cao, vì vậy tỷ lệ đọc 0.1x chiếm ưu thế.
- Các khối lượng công việc cần theo dõi: các yêu cầu dài một lần mà tiền tố của chúng không bao giờ được sử dụng lại. Lưu trữ tự động được bật theo mặc định, vì vậy những yêu cầu này sẽ chịu phí ghi 1.25x không thể phục hồi; việc đặt
prompt_cache_options.modethành"explicit"mà không đặt bất kỳ điểm dừng nào sẽ khiến yêu cầu bỏ qua hoàn toàn bộ nhớ cache và không phát sinh phí ghi.
So sánh: lưu trữ lời nhắc trên GPT-5.6 và Claude
Thiết kế lưu trữ của GPT-5.6 hội tụ với cache_control của Claude trên một số khía cạnh, với sự khác biệt cốt lõi trong hành vi mặc định: GPT tự động lưu trữ mà không cần tham số, trong khi Claude yêu cầu lưu trữ phải được bật trong yêu cầu, hoặc là trường cache_control cấp cao nhất (điểm dừng tự động) hoặc các điểm dừng rõ ràng ở cấp khối nội dung.
| Khía cạnh | Gia đình GPT-5.6 | Gia đình Claude (tất cả các mô hình đang hoạt động) |
|---|---|---|
| Kích hoạt | Lưu trữ tự động, điểm dừng rõ ràng là tùy chọn | Phải được bật: điểm dừng tự động cache_control cấp cao nhất, hoặc điểm dừng rõ ràng ở cấp khối nội dung |
| Tham số điểm dừng | prompt_cache_breakpoint (cấp khối nội dung) |
cache_control (cấp cao nhất hoặc cấp khối nội dung) |
| Giới hạn điểm dừng | Tối đa 4 ghi lưu trữ mới mỗi yêu cầu | Tối đa 4 điểm dừng |
| Thời gian lưu trữ | Ít nhất 30 phút | 5 phút theo mặc định (được làm mới miễn phí trên mỗi lần truy cập), tùy chọn 1 giờ |
| Phí ghi lưu trữ | 1.25x tỷ lệ đầu vào | 1.25x cho cấp độ 5 phút, 2x cho cấp độ 1 giờ |
| Phí đọc lưu trữ | 0.1x tỷ lệ đầu vào | 0.1x tỷ lệ đầu vào |
| Chiều dài tối thiểu có thể lưu trữ | 1,024 token | 512–4,096 token tùy thuộc vào mô hình |
| Yêu cầu truy cập | Giống hệt byte trước điểm dừng | Giống hệt byte trước điểm dừng |
Cột Claude phản ánh các quy tắc được chia sẻ bởi tất cả các mô hình Claude đang hoạt động: 1.25x ghi cho cấp độ 5 phút, 2x cho cấp độ 1 giờ, và 0.1x đọc áp dụng đồng nhất trên toàn bộ dòng sản phẩm (tài liệu lưu trữ lời nhắc của Anthropic), với sự khác biệt theo mô hình giới hạn ở chiều dài tối thiểu có thể lưu trữ; cột GPT-5.6 đến từ hướng dẫn lưu trữ lời nhắc của OpenAI.
Các giới hạn điểm dừng, tỷ lệ ghi (cho các cấp tương ứng), và tỷ lệ đọc hoàn toàn khớp nhau giữa hai nhà cung cấp; về mặt thực tiễn, cùng một chiến lược cấu trúc lời nhắc "nội dung tĩnh trước, nội dung thay đổi sau" được áp dụng giữa chúng. Chi phí di chuyển tập trung vào cú pháp tham số: GPT sử dụng prompt_cache_breakpoint + prompt_cache_key, Claude sử dụng cache_control.
Mô hình lưu trữ giống nhau trong cả hai giao thức
Đối với cùng một kịch bản "lưu trữ một hướng dẫn dài tĩnh", các triển khai tối thiểu trong hai giao thức như sau. Các ví dụ sử dụng gpt-5.6-sol và claude-opus-4-8. Cả hai đều chia sẻ cùng một mức giá đầu vào cơ bản ($5/M), vì vậy các mức giá hiệu quả cho mỗi token được suy ra từ ghi lưu trữ (1.25x) và đọc (0.1x) cũng giống nhau; chỉ có cú pháp là khác nhau.
Giao thức GPT đặt prompt_cache_key ở cấp cao nhất (các tiền tố dài được lưu trữ tự động, không cần dấu hiệu điểm dừng); giao thức Claude đặt cache_control ở cấp cao nhất để bật lưu trữ tự động, chuyển sang các điểm dừng ở cấp khối nội dung khi cần kiểm soát chính xác ranh giới lưu trữ:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Hướng dẫn dài tĩnh, >=1024 token]"
},
{
"role": "user",
"content": "Tóm tắt các số liệu chính."
}
]
}'
Claude (Messages)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Hướng dẫn dài tĩnh, >=1024 token]",
"messages": [
{
"role": "user",
"content": "Tóm tắt các số liệu chính."
}
]
}'
So sánh hai yêu cầu, sự khác biệt chỉ nằm ở: điểm cuối (/v1/chat/completions so với /v1/messages), các tiêu đề xác thực (Authorization: Bearer so với x-api-key + anthropic-version), tham số lưu trữ (cấp cao nhất prompt_cache_key so với cấp cao nhất cache_control), và Claude yêu cầu một max_tokens rõ ràng. Cả hai yêu cầu đều được xác minh trên aihubmix.com (2026-07-10): gpt-5.6-sol trả về cached_tokens: 2816 trong lần gọi thứ hai; claude-opus-4-8 trả về cache_creation_input_tokens: 3632 trong lần gọi đầu tiên và cache_read_input_tokens: 3632 trong lần gọi thứ hai.
Ngoài định dạng yêu cầu, ba sự khác biệt ở cấp cơ chế vẫn còn:
- Kích hoạt: GPT tự động lưu trữ ngay cả khi không có bất kỳ tham số lưu trữ nào, với
prompt_cache_keycải thiện độ tin cậy của việc truy cập; Claude yêu cầu một tuyên bố: một điểm dừngcache_controlở cấp khối nội dung, hoặc chế độ tự độngcache_controlở cấp cao nhất. - Các trường sử dụng: GPT báo cáo số lần đọc lưu trữ trong
prompt_tokens_details.cached_tokens; Claude báo cáo ghi và đọc riêng biệt làcache_creation_input_tokensvàcache_read_input_tokens, giúp dễ dàng xác minh ghi và truy cập một cách độc lập. - Kiểm soát thời gian sống:
ttlcủa GPT-5.6 hiện chỉ hỗ trợ"30m"; Claude mặc định là 5 phút (được làm mới miễn phí trên mỗi lần truy cập), với một"ttl": "1h"tùy chọn (ghi tính phí 2x).
Những gì cần thay đổi khi chuyển đổi mô hình giữa các giao thức
Cổng AIHubMix hỗ trợ các cuộc gọi giữa các giao thức: điểm cuối tương thích với OpenAI có thể gọi các mô hình Claude (cache_control đi trực tiếp vào các khối nội dung theo định dạng OpenAI; xem Thực hành Lưu trữ Lời nhắc), và điểm cuối /v1/messages tương thích với Claude có thể gọi GPT-5.6 (đã xác minh hoạt động). Khi chuyển đổi mô hình, hãy kiểm tra ba điều:
- Thay đổi
modelthành ID mô hình mục tiêu; - Chuyển đổi cú pháp tham số lưu trữ:
prompt_cache_key/ điểm dừng rõ ràng tương ứng vớicache_controlcủa Claude; - Chuyển đổi tên trường sử dụng:
cached_tokenstương ứng vớicache_read_input_tokenscủa Claude.
Các con đường được khuyến nghị cho lưu trữ lời nhắc: Các mô hình GPT thông qua Chat Completions (đường dẫn xác thực trong bài viết này); Các mô hình Claude hoạt động thông qua bất kỳ giao thức nào.
So sánh: GPT-5.6 so với lưu trữ GPT trước đó
| Khía cạnh | Trước GPT-5.6 | GPT-5.6 và các phiên bản sau |
|---|---|---|
| Ghi lưu trữ | Không có phí bổ sung | 1.25x tỷ lệ đầu vào |
| Thời gian lưu trữ | Bị xóa sau 5–10 phút không hoạt động, tối đa 1 giờ | Ít nhất 30 phút |
| Kiểm soát lưu trữ | Không có | Điểm dừng rõ ràng, chế độ rõ ràng, prompt_cache_key khớp đáng tin cậy |
| Thời gian lưu trữ kéo dài 24 giờ | prompt_cache_retention trên một số mô hình |
Thay thế bằng prompt_cache_options.ttl (hiện tại chỉ 30m) |
Các thay đổi chỉ theo một hướng: việc lưu trữ của thế hệ trước không có phí ghi nhưng không thể kiểm soát, với thời gian lưu trữ không chắc chắn; GPT-5.6 tính phí cho các lần ghi trong khi cung cấp một mức độ lưu trữ đảm bảo và các điều khiển lưu trữ chính xác. Theo các tỷ lệ, một tiền tố được sử dụng lại nhiều hơn một lần trung bình tiết kiệm nhiều hơn chi phí ghi bổ sung; mức lưu trữ 30 phút và các điểm dừng có thể kiểm soát giúp việc đạt được tỷ lệ sử dụng lại đó trở nên dễ dự đoán hơn.
Bắt đầu trên AIHubMix
Cả ba cấp độ đều đã hoạt động, với ID mô hình gpt-5.6-sol, gpt-5.6-terra, và gpt-5.6-luna. Lưu trữ không yêu cầu cấu hình thêm; các yêu cầu liên tiếp với cùng một tiền tố dài sẽ truy cập vào bộ nhớ cache:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Bạn là một trợ lý tỉ mỉ để phân tích các báo cáo tài chính hàng quý... [Hướng dẫn dài tĩnh, >=1024 token]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Tóm tắt các số liệu chính trong một câu."},
],
)
print(completion.usage.prompt_tokens_details)
Giá trị usage.prompt_tokens_details.cached_tokens lớn hơn 0 trong lần gọi thứ hai cho thấy đã truy cập vào bộ nhớ cache (ví dụ đo lường: cached_tokens: 2816). Để biết chi tiết về tham số, thông tin thanh toán và khắc phục sự cố truy cập, xem tài liệu Lưu trữ Lời nhắc GPT.
Câu hỏi thường gặp
API nào có thể gọi GPT-5.6 trên AIHubMix?
Chat Completions (/v1/chat/completions), Responses (/v1/responses), và API Messages tương thích với Claude (/v1/messages) đều có thể gọi các mô hình, và cả ba cấp độ đều đã hoạt động. Đối với lưu trữ lời nhắc, Chat Completions hiện là con đường được khuyến nghị.
Nếu khách hàng của tôi không thay đổi gì, điều gì sẽ thay đổi trong thanh toán sau khi nâng cấp lên GPT-5.6?
Lưu trữ lời nhắc tự động áp dụng theo mặc định: các yêu cầu có tiền tố đạt 1,024 token sẽ phát sinh một mục ghi lưu trữ tính phí ở mức 1.25x tỷ lệ đầu vào, và các tiền tố được sử dụng lại sẽ được tính phí ở mức 0.1x tỷ lệ đọc. Các ứng dụng có tỷ lệ sử dụng lại tiền tố cao thường thấy chi phí tổng thể thấp hơn; các yêu cầu dài một lần không bao giờ sử dụng lại tiền tố có thể tắt lưu trữ bằng chế độ rõ ràng.
Tôi đã sử dụng lưu trữ lời nhắc của Claude. Tôi cần thay đổi gì để chuyển sang GPT-5.6?
Chiến lược cấu trúc lời nhắc vẫn giữ nguyên: nội dung tĩnh trước, nội dung thay đổi sau. Các tham số thay đổi từ cache_control sang prompt_cache_breakpoint, cộng với prompt_cache_key; thời gian lưu trữ thay đổi từ các cấp 5 phút/1 giờ sang mức đảm bảo 30 phút.
Làm thế nào để tôi chọn giữa ba cấp độ GPT-5.6?
Theo vị trí chính thức: chọn Sol cho công việc chuyên nghiệp phức tạp và các nhiệm vụ lập trình; chọn Terra cho các khối lượng công việc hàng ngày (hiệu suất tương đương GPT-5.5 với giá chỉ bằng một nửa); chọn Luna cho các tình huống nhạy cảm về chi phí và khối lượng lớn. Cả ba cấp độ đều chia sẻ cùng một cửa sổ ngữ cảnh và đầu ra tối đa, vì vậy bạn có thể phân loại theo độ phức tạp của nhiệm vụ.
Tài liệu chính thức
Thông số mô hình, cơ chế lưu trữ và tỷ lệ thanh toán trong bài viết này đến từ các nguồn chính thức sau:
- Thông báo GPT-5.6 (OpenAI, 2026-07-09)
- Hướng dẫn lưu trữ lời nhắc của OpenAI
- Giá cả của OpenAI
- Tài liệu lưu trữ lời nhắc của Anthropic
Tài liệu liên quan trên trang này: Lưu trữ Lời nhắc GPT · Lưu trữ Lời nhắc Claude · Thực hành Lưu trữ Lời nhắc
Truy cập thư viện mô hình để biết giá cả của GPT-5.6, hoặc khám phá thêm các tùy chọn tích hợp trong trung tâm tài liệu.
Cập nhật lần cuối: 2026-07-10