GPT-6.1 Sol có năm mức độ suy luận: low, medium (mặc định), high, xhigh, và max. Sự thay đổi lớn từ GPT-6 Sol là none và minimal đã biến mất, vì vậy low giờ đây là mức tối thiểu.
Cài đặt này ảnh hưởng đến cả độ trễ và chi phí. Bạn không bao giờ thấy các token suy luận, nhưng bạn phải trả tiền cho chúng theo tỷ lệ đầu ra (10 đô la cho mỗi triệu cho 6.1 Sol trên AIHubMix), và chúng chiếm không gian trong cửa sổ ngữ cảnh. Chọn mức sai và bạn có thể dễ dàng trả nhiều hơn gấp vài lần so với những gì cần thiết.
Mỗi mức độ dùng để làm gì
Bảng này kết hợp mô tả của OpenAI từ hướng dẫn suy luận với các khuyến nghị của chúng tôi:
| Mức độ | Mô tả của OpenAI | Phù hợp tốt | Phù hợp kém |
|---|---|---|---|
| thấp | Suy luận hiệu quả với mức tăng độ trễ vừa phải | Các bước trung gian trong vòng lặp công cụ, tìm kiếm, lập kế hoạch nhẹ, phân loại, trích xuất, hỗ trợ phản hồi | Gỡ lỗi khó khăn, tái cấu trúc nhiều tệp |
| trung bình (mặc định) | Mặc định cân bằng cho hầu hết các khối lượng công việc | Lập trình hàng ngày, xem xét mã, viết, các tác vụ đại lý điển hình | Sử dụng tương tác nhạy cảm với độ trễ |
| cao | Suy luận khó khăn, gỡ lỗi phức tạp, lập kế hoạch sâu | Các lỗi khó, công việc kiến trúc, các tác vụ kiểu SWE | Lưu lượng trực tuyến có QPS cao |
| rất cao | Nghiên cứu sâu, công việc không đồng bộ, chạy đại lý lâu dài | Công việc nền, báo cáo nghiên cứu | Bất cứ điều gì mà các đánh giá của bạn chưa chứng minh |
| tối đa | Suy luận tối đa cho các tác vụ khó khăn nhất | Sử dụng máy tính, vấn đề cấp độ nghiên cứu, công việc nặng ngoại tuyến | Hầu hết các yêu cầu hàng ngày |
OpenAI gọi nỗ lực là "một núm điều chỉnh, không phải là cách chính để phục hồi chất lượng." Khi kết quả không tốt, hãy xem xét trước tiên prompt, định nghĩa công cụ và ngữ cảnh. Chỉ tăng nỗ lực sau đó.
Các tiêu chuẩn nói gì về mỗi mức độ
Đây là số liệu của chính OpenAI, được tổng hợp bởi Vellum và DataCamp. Hãy coi chúng như một hướng dẫn, không phải là chân lý.
Đối với lập trình, cao thường là đủ. Trên DeepSWE v1.1, 6.1 Sol ở mức cao ghi được 75.2, tương đương với Astra ở mức cao (74.8), với khoảng 1.50 đô la cho mỗi tác vụ. Đường cong chi phí của nó đạt 72% đến 75% với mức chi phí từ 0.50 đến 1.50 đô la cho mỗi tác vụ. GPT-6 Sol đạt tối đa 68.8 với khoảng 2.60 đô la.
Đi trên mức trung bình không phải lúc nào cũng giúp ích. Trên AutomationBench, 6.1 Sol ghi được 35.4% ở mức trung bình và chỉ khoảng 36.0% ở mức nỗ lực cao hơn. Đối với tự động hóa doanh nghiệp, các token suy luận bổ sung gần như không mang lại gì.
Giữ mức tối đa cho việc sử dụng máy tính và nghiên cứu. Trên OSWorld 2.0, mức tối đa đạt 71.4 với khoảng 1.30 đô la cho mỗi tác vụ. Terminal-Bench Science ở mức tối đa có giá 5.47 đô la cho mỗi tác vụ: rẻ hơn nhiều so với 23.80 đô la của Astra, nhưng cao hơn nhiều so với hầu hết các khối lượng công việc khác.
Thấp cũng đã cải thiện. Tỷ lệ lỗi thực tế ở mức thấp đã giảm từ 11.4% trên 6 Sol xuống còn 7.7%. Nếu bạn đã nâng mức tác vụ lên trung bình trên 6 Sol vì thấp không đủ chính xác, hãy thử lại mức thấp.
Điểm khởi đầu theo trường hợp sử dụng
| Trường hợp sử dụng | Bắt đầu tại | Ghi chú |
|---|---|---|
| Các cuộc gọi đã sử dụng không trên 6 Sol | thấp | Bản đồ chính thức của OpenAI. Nếu độ trễ là quan trọng, hãy xem xét GPT-6 Luna, vẫn hỗ trợ không |
| Các cuộc gọi đã sử dụng tối thiểu | thấp | Bắt đầu tại mức thấp và so sánh kết quả |
| Chatbots, hỗ trợ khách hàng | thấp | Yêu cầu mô hình đưa ra một lời mở đầu một dòng để lấy token đầu tiên nhanh hơn |
| RAG Q&A | thấp → trung bình | Chất lượng truy xuất quan trọng hơn nỗ lực |
| Trợ lý lập trình IDE | trung bình | Mặc định hoạt động |
| Sửa lỗi tự động, đại lý SWE | cao | DeepSWE cho thấy mức cao đã tương đương với Astra |
| Sử dụng máy tính, đại lý trình duyệt | cao → tối đa | OSWorld đạt đỉnh ở mức tối đa |
| Nghiên cứu nền, chạy lâu dài | rất cao | Chỉ khi các đánh giá cho thấy có lợi. Gộp lại sẽ giảm một nửa chi phí nếu bạn không cần kết quả ngay lập tức |
| Các vấn đề nghiên cứu khó khăn nhất | tối đa, hoặc chỉ sử dụng Astra | OpenAI cũng khuyến nghị Astra ở đây |
Các bản đồ none và minimal đến từ hướng dẫn di chuyển GPT-6 của OpenAI.
Thay đổi nỗ lực giữa cuộc trò chuyện
Một mẫu phổ biến là lập kế hoạch ở mức cao, thực hiện ở mức thấp và quay lại mức cao khi có sự cố xảy ra.
Điều cần lưu ý: chỉnh sửa reasoning.effort trong yêu cầu sẽ làm hỏng bộ nhớ cache của prompt. Nỗ lực là một phần của tiền tố đã được lưu trữ (xem hướng dẫn lưu trữ prompt). Trên 6.1 Sol, một lần đọc bộ nhớ cache có giá 0.10 đô la cho mỗi triệu token, trong khi việc viết lại bộ nhớ cache có giá 2.50 đô la. Đó là sự khác biệt 25×.
Gia đình GPT-6 khắc phục điều này với một mục đầu vào configuration_update. Giữ nguyên reasoning.effort ở cấp yêu cầu và chèn một cập nhật trước thông điệp người dùng tiếp theo. Đây là cách mà điều đó trông như thế nào thông qua API Phản hồi AIHubMix:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Lượt 1: lập kế hoạch ở mức nỗ lực cao
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"},
input="Tìm hiểu lý do tại sao các bài kiểm tra của repo này không thành công và đề xuất một kế hoạch sửa chữa.",
)
# Lượt 2: giảm xuống mức thấp để thực hiện, mà không chạm vào nỗ lực ở cấp yêu cầu
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # không thay đổi, vì vậy bộ nhớ cache vẫn tồn tại
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "low"}},
{"role": "user", "content": "Thực hiện bước 1 của kế hoạch."},
],
)
Hình dạngconfiguration_updateở trên chỉ mang tính minh họa. Kiểm tra hướng dẫn suy luận của OpenAI để biết sơ đồ chính xác. Tài liệu Phản hồi của AIHubMix hiện liệt kê bốn mức (tối thiểu đến cao), vì vậy hãy gửi một yêu cầu thử nghiệm nhỏ để xác nhận rằngxhigh,maxvàconfiguration_updateđược thông qua.
Một số giới hạn cần biết:
- Chỉ hoạt động trong chế độ đại lý đơn tiêu chuẩn và chỉ thay đổi nỗ lực.
- Hai cập nhật không thể đứng cạnh nhau.
- Không kết hợp với nén tự động hoặc cắt ngắn. Nén rõ ràng là ổn, nhưng hãy thêm một cập nhật mới sau đó.
- Trường
reasoning.effortcủa phản hồi vẫn hiển thị giá trị ở cấp yêu cầu, vì vậy đừng đọc quá nhiều vào đó.
Cài đặt đi kèm với nỗ lực
Để lại chỗ trong max_output_tokens. Giới hạn bao gồm các token suy luận. Đặt nó quá thấp và mô hình có thể dừng lại trước khi tạo bất kỳ văn bản nào có thể nhìn thấy. Bạn sẽ nhận được status: incomplete và vẫn phải trả tiền cho đầu vào và suy luận. OpenAI đề xuất dự trữ ít nhất 25.000 token để bắt đầu, và nhiều hơn cho xhigh hoặc max.
Theo dõi các token suy luận. Chúng nằm trong usage.output_tokens_details.reasoning_tokens. Nhìn vào phân phối theo mức độ nỗ lực sẽ tốt hơn việc điều chỉnh theo cảm giác.
Bật tóm tắt nếu bạn cần sự minh bạch. reasoning.summary: "auto" trả về một tóm tắt về suy luận của mô hình (bạn có thể cần xác minh tổ chức của mình trước). Suy luận thô không bao giờ được tiết lộ.
Chế độ pro là một công tắc riêng. Nó khiến mô hình làm nhiều việc hơn, tính phí theo tỷ lệ tiêu chuẩn nhưng với nhiều token hơn tổng thể. Sử dụng nó cho các vấn đề khó khăn mà độ trễ bổ sung là chấp nhận được.
Một quy trình điều chỉnh mà bạn thực sự có thể thực hiện
- Kéo 20 đến 50 tác vụ thực tế vào một bộ đánh giá.
- Chạy một cơ sở ở mức
medium. Ghi lại tỷ lệ thành công, số token suy luận trung bình và độ trễ P95. - Thử
low. Nếu tỷ lệ thành công chỉ giảm nhẹ, hãy chuyển đổi. - Thử
high. Nếu tỷ lệ thành công rõ ràng cải thiện, chỉ sử dụng mức cao cho loại tác vụ đó. - Chỉ sử dụng
xhighhoặcmaxkhi mức cao không đủ, và so sánh với GPT-6 Astra ở mức cao trong khi bạn đang ở đó. Đôi khi một mô hình lớn hơn lại vượt trội hơn so với nỗ lực nhiều hơn. Trên AIHubMix, đó chỉ là một thay đổi đối với tham sốmodel, và danh sách các mô hình cho thấy những gì có sẵn. - Chuyển hướng theo loại tác vụ thay vì sử dụng một cài đặt toàn cầu duy nhất.
Phiên bản ngắn gọn: bắt đầu ở mức trung bình, tiết kiệm tiền với mức thấp, sử dụng mức cao cho lập trình, và để xhigh và max chứng minh giá trị của chúng trong các đánh giá của bạn.
Tiếp theo: những gì nhãn giá 2 đô la / 10 đô la thực sự có nghĩa là khi bộ nhớ cache, ngữ cảnh dài và các bội số thanh toán được đưa vào tính toán.
Câu hỏi thường gặp
Mức độ suy luận mặc định cho GPT-6.1 Sol là gì? medium. Nếu bạn không đặt nó, đó là những gì bạn nhận được.
Tại sao none trả về lỗi? 6.1 Sol không hỗ trợ none hoặc minimal. OpenAI khuyến nghị chuyển sang low. Nếu bạn thực sự cần none, hãy ở lại với GPT-6 Sol hoặc GPT-6 Luna.
Các token suy luận được tính phí như thế nào? Theo tỷ lệ đầu ra (10 đô la cho mỗi triệu cho 6.1 Sol), và chúng tính vào cửa sổ ngữ cảnh. Kiểm tra usage.output_tokens_details.reasoning_tokens để biết số liệu thực tế.
Tên tham số có giống nhau trong Chat Completions và Responses không? Không. Chat Completions sử dụng reasoning_effort ở cấp cao nhất. Responses sử dụng reasoning: {"effort": ...} được lồng ghép. Việc nhầm lẫn chúng sẽ trả về Unsupported parameter.
Nỗ lực cao hơn có luôn mang lại kết quả tốt hơn không? Không. Trên AutomationBench, việc đi trên mức trung bình chỉ di chuyển điểm số từ 35.4% lên khoảng 36.0%, trong khi chi phí tăng rõ rệt. Hãy thử trên các tác vụ của riêng bạn.
Tôi có thể thay đổi nỗ lực giữa chừng trong một cuộc trò chuyện không? Có. Sử dụng một mục configuration_update và giữ nguyên reasoning.effort ở cấp yêu cầu để bộ nhớ cache của prompt vẫn hợp lệ. Nó không hoạt động với nén tự động hoặc cắt ngắn.
Tại sao tôi nhận được status: incomplete mà không có đầu ra? Có thể max_output_tokens quá thấp và suy luận đã sử dụng hết. OpenAI khuyến nghị dự trữ ít nhất 25.000 token.
Tiếp tục đọc: chuỗi GPT-6.1 Sol
- Phần nào trong hóa đơn của bạn là suy luận? Nỗ lực chỉ là một yếu tố. Lưu trữ, ngưỡng 272K và giảm giá gộp đều ảnh hưởng đến con số cuối cùng. Xem Chi phí thực sự của GPT-6.1 Sol: Vượt ra ngoài nhãn giá 2 đô la / 10 đô la.
- Mã đã sử dụng
none? Chuyển sanglowchỉ là khởi đầu. Các cuộc gọi công cụ, tham số lấy mẫu và cài đặt bộ nhớ cache cũng cần thay đổi: Di chuyển sang GPT-6.1 Sol: 9 điều có thể sai. - GPT-6.1 Sol tốt hơn bao nhiêu so với GPT-6 Sol và Astra? Thông số kỹ thuật và tiêu chuẩn cạnh nhau trong GPT-6.1 Sol so với GPT-6 Sol: Một bản nâng cấp trong một tuần gần như bắt kịp Astra.



