Chọn mức độ suy luận cho GPT-6.1 Sol: thấp đến tối đa

AIHubMixĐọc 6 phút
Chọn mức độ suy luận cho GPT-6.1 Sol: thấp đến tối đa

GPT-6.1 Sol có năm mức độ suy luận: low, medium (mặc định), high, xhigh, và max. Sự thay đổi lớn từ GPT-6 Sol là none và minimal đã biến mất, vì vậy low giờ đây là mức tối thiểu.

Cài đặt này ảnh hưởng đến cả độ trễ và chi phí. Bạn không bao giờ thấy các token suy luận, nhưng bạn phải trả tiền cho chúng theo tỷ lệ đầu ra (10 đô la cho mỗi triệu cho 6.1 Sol trên AIHubMix), và chúng chiếm không gian trong cửa sổ ngữ cảnh. Chọn mức sai và bạn có thể dễ dàng trả nhiều hơn gấp vài lần so với những gì cần thiết.


Mỗi mức độ dùng để làm gì

Bảng này kết hợp mô tả của OpenAI từ hướng dẫn suy luận với các khuyến nghị của chúng tôi:

Mức độMô tả của OpenAIPhù hợp tốtPhù hợp kém
thấpSuy luận hiệu quả với mức tăng độ trễ vừa phảiCác bước trung gian trong vòng lặp công cụ, tìm kiếm, lập kế hoạch nhẹ, phân loại, trích xuất, hỗ trợ phản hồiGỡ lỗi khó khăn, tái cấu trúc nhiều tệp
trung bình (mặc định)Mặc định cân bằng cho hầu hết các khối lượng công việcLập trình hàng ngày, xem xét mã, viết, các tác vụ đại lý điển hìnhSử dụng tương tác nhạy cảm với độ trễ
caoSuy luận khó khăn, gỡ lỗi phức tạp, lập kế hoạch sâuCác lỗi khó, công việc kiến trúc, các tác vụ kiểu SWELưu lượng trực tuyến có QPS cao
rất caoNghiên cứu sâu, công việc không đồng bộ, chạy đại lý lâu dàiCông việc nền, báo cáo nghiên cứuBất cứ điều gì mà các đánh giá của bạn chưa chứng minh
tối đaSuy luận tối đa cho các tác vụ khó khăn nhấtSử dụng máy tính, vấn đề cấp độ nghiên cứu, công việc nặng ngoại tuyếnHầu hết các yêu cầu hàng ngày

OpenAI gọi nỗ lực là "một núm điều chỉnh, không phải là cách chính để phục hồi chất lượng." Khi kết quả không tốt, hãy xem xét trước tiên prompt, định nghĩa công cụ và ngữ cảnh. Chỉ tăng nỗ lực sau đó.


Các tiêu chuẩn nói gì về mỗi mức độ

Đây là số liệu của chính OpenAI, được tổng hợp bởi Vellum và DataCamp. Hãy coi chúng như một hướng dẫn, không phải là chân lý.

Đối với lập trình, cao thường là đủ. Trên DeepSWE v1.1, 6.1 Sol ở mức cao ghi được 75.2, tương đương với Astra ở mức cao (74.8), với khoảng 1.50 đô la cho mỗi tác vụ. Đường cong chi phí của nó đạt 72% đến 75% với mức chi phí từ 0.50 đến 1.50 đô la cho mỗi tác vụ. GPT-6 Sol đạt tối đa 68.8 với khoảng 2.60 đô la.

Đi trên mức trung bình không phải lúc nào cũng giúp ích. Trên AutomationBench, 6.1 Sol ghi được 35.4% ở mức trung bình và chỉ khoảng 36.0% ở mức nỗ lực cao hơn. Đối với tự động hóa doanh nghiệp, các token suy luận bổ sung gần như không mang lại gì.

Giữ mức tối đa cho việc sử dụng máy tính và nghiên cứu. Trên OSWorld 2.0, mức tối đa đạt 71.4 với khoảng 1.30 đô la cho mỗi tác vụ. Terminal-Bench Science ở mức tối đa có giá 5.47 đô la cho mỗi tác vụ: rẻ hơn nhiều so với 23.80 đô la của Astra, nhưng cao hơn nhiều so với hầu hết các khối lượng công việc khác.

Thấp cũng đã cải thiện. Tỷ lệ lỗi thực tế ở mức thấp đã giảm từ 11.4% trên 6 Sol xuống còn 7.7%. Nếu bạn đã nâng mức tác vụ lên trung bình trên 6 Sol vì thấp không đủ chính xác, hãy thử lại mức thấp.


Điểm khởi đầu theo trường hợp sử dụng

Trường hợp sử dụngBắt đầu tạiGhi chú
Các cuộc gọi đã sử dụng không trên 6 SolthấpBản đồ chính thức của OpenAI. Nếu độ trễ là quan trọng, hãy xem xét GPT-6 Luna, vẫn hỗ trợ không
Các cuộc gọi đã sử dụng tối thiểuthấpBắt đầu tại mức thấp và so sánh kết quả
Chatbots, hỗ trợ khách hàngthấpYêu cầu mô hình đưa ra một lời mở đầu một dòng để lấy token đầu tiên nhanh hơn
RAG Q&Athấp → trung bìnhChất lượng truy xuất quan trọng hơn nỗ lực
Trợ lý lập trình IDEtrung bìnhMặc định hoạt động
Sửa lỗi tự động, đại lý SWEcaoDeepSWE cho thấy mức cao đã tương đương với Astra
Sử dụng máy tính, đại lý trình duyệtcao → tối đaOSWorld đạt đỉnh ở mức tối đa
Nghiên cứu nền, chạy lâu dàirất caoChỉ khi các đánh giá cho thấy có lợi. Gộp lại sẽ giảm một nửa chi phí nếu bạn không cần kết quả ngay lập tức
Các vấn đề nghiên cứu khó khăn nhấttối đa, hoặc chỉ sử dụng AstraOpenAI cũng khuyến nghị Astra ở đây

Các bản đồ none và minimal đến từ hướng dẫn di chuyển GPT-6 của OpenAI.


Thay đổi nỗ lực giữa cuộc trò chuyện

Một mẫu phổ biến là lập kế hoạch ở mức cao, thực hiện ở mức thấp và quay lại mức cao khi có sự cố xảy ra.

Điều cần lưu ý: chỉnh sửa reasoning.effort trong yêu cầu sẽ làm hỏng bộ nhớ cache của prompt. Nỗ lực là một phần của tiền tố đã được lưu trữ (xem hướng dẫn lưu trữ prompt). Trên 6.1 Sol, một lần đọc bộ nhớ cache có giá 0.10 đô la cho mỗi triệu token, trong khi việc viết lại bộ nhớ cache có giá 2.50 đô la. Đó là sự khác biệt 25×.

Gia đình GPT-6 khắc phục điều này với một mục đầu vào configuration_update. Giữ nguyên reasoning.effort ở cấp yêu cầu và chèn một cập nhật trước thông điệp người dùng tiếp theo. Đây là cách mà điều đó trông như thế nào thông qua API Phản hồi AIHubMix:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Lượt 1: lập kế hoạch ở mức nỗ lực cao
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="Tìm hiểu lý do tại sao các bài kiểm tra của repo này không thành công và đề xuất một kế hoạch sửa chữa.",
)

# Lượt 2: giảm xuống mức thấp để thực hiện, mà không chạm vào nỗ lực ở cấp yêu cầu
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # không thay đổi, vì vậy bộ nhớ cache vẫn tồn tại
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "Thực hiện bước 1 của kế hoạch."},
    ],
)
Hình dạng configuration_update ở trên chỉ mang tính minh họa. Kiểm tra hướng dẫn suy luận của OpenAI để biết sơ đồ chính xác. Tài liệu Phản hồi của AIHubMix hiện liệt kê bốn mức (tối thiểu đến cao), vì vậy hãy gửi một yêu cầu thử nghiệm nhỏ để xác nhận rằng xhigh, max và configuration_update được thông qua.

Một số giới hạn cần biết:

  • Chỉ hoạt động trong chế độ đại lý đơn tiêu chuẩn và chỉ thay đổi nỗ lực.
  • Hai cập nhật không thể đứng cạnh nhau.
  • Không kết hợp với nén tự động hoặc cắt ngắn. Nén rõ ràng là ổn, nhưng hãy thêm một cập nhật mới sau đó.
  • Trường reasoning.effort của phản hồi vẫn hiển thị giá trị ở cấp yêu cầu, vì vậy đừng đọc quá nhiều vào đó.

Cài đặt đi kèm với nỗ lực

Để lại chỗ trong max_output_tokens. Giới hạn bao gồm các token suy luận. Đặt nó quá thấp và mô hình có thể dừng lại trước khi tạo bất kỳ văn bản nào có thể nhìn thấy. Bạn sẽ nhận được status: incomplete và vẫn phải trả tiền cho đầu vào và suy luận. OpenAI đề xuất dự trữ ít nhất 25.000 token để bắt đầu, và nhiều hơn cho xhigh hoặc max.

Theo dõi các token suy luận. Chúng nằm trong usage.output_tokens_details.reasoning_tokens. Nhìn vào phân phối theo mức độ nỗ lực sẽ tốt hơn việc điều chỉnh theo cảm giác.

Bật tóm tắt nếu bạn cần sự minh bạch. reasoning.summary: "auto" trả về một tóm tắt về suy luận của mô hình (bạn có thể cần xác minh tổ chức của mình trước). Suy luận thô không bao giờ được tiết lộ.

Chế độ pro là một công tắc riêng. Nó khiến mô hình làm nhiều việc hơn, tính phí theo tỷ lệ tiêu chuẩn nhưng với nhiều token hơn tổng thể. Sử dụng nó cho các vấn đề khó khăn mà độ trễ bổ sung là chấp nhận được.


Một quy trình điều chỉnh mà bạn thực sự có thể thực hiện

  1. Kéo 20 đến 50 tác vụ thực tế vào một bộ đánh giá.
  2. Chạy một cơ sở ở mức medium. Ghi lại tỷ lệ thành công, số token suy luận trung bình và độ trễ P95.
  3. Thử low. Nếu tỷ lệ thành công chỉ giảm nhẹ, hãy chuyển đổi.
  4. Thử high. Nếu tỷ lệ thành công rõ ràng cải thiện, chỉ sử dụng mức cao cho loại tác vụ đó.
  5. Chỉ sử dụng xhigh hoặc max khi mức cao không đủ, và so sánh với GPT-6 Astra ở mức cao trong khi bạn đang ở đó. Đôi khi một mô hình lớn hơn lại vượt trội hơn so với nỗ lực nhiều hơn. Trên AIHubMix, đó chỉ là một thay đổi đối với tham số model, và danh sách các mô hình cho thấy những gì có sẵn.
  6. Chuyển hướng theo loại tác vụ thay vì sử dụng một cài đặt toàn cầu duy nhất.

Phiên bản ngắn gọn: bắt đầu ở mức trung bình, tiết kiệm tiền với mức thấp, sử dụng mức cao cho lập trình, và để xhigh và max chứng minh giá trị của chúng trong các đánh giá của bạn.

Tiếp theo: những gì nhãn giá 2 đô la / 10 đô la thực sự có nghĩa là khi bộ nhớ cache, ngữ cảnh dài và các bội số thanh toán được đưa vào tính toán.


Câu hỏi thường gặp

Mức độ suy luận mặc định cho GPT-6.1 Sol là gì? medium. Nếu bạn không đặt nó, đó là những gì bạn nhận được.

Tại sao none trả về lỗi? 6.1 Sol không hỗ trợ none hoặc minimal. OpenAI khuyến nghị chuyển sang low. Nếu bạn thực sự cần none, hãy ở lại với GPT-6 Sol hoặc GPT-6 Luna.

Các token suy luận được tính phí như thế nào? Theo tỷ lệ đầu ra (10 đô la cho mỗi triệu cho 6.1 Sol), và chúng tính vào cửa sổ ngữ cảnh. Kiểm tra usage.output_tokens_details.reasoning_tokens để biết số liệu thực tế.

Tên tham số có giống nhau trong Chat Completions và Responses không? Không. Chat Completions sử dụng reasoning_effort ở cấp cao nhất. Responses sử dụng reasoning: {"effort": ...} được lồng ghép. Việc nhầm lẫn chúng sẽ trả về Unsupported parameter.

Nỗ lực cao hơn có luôn mang lại kết quả tốt hơn không? Không. Trên AutomationBench, việc đi trên mức trung bình chỉ di chuyển điểm số từ 35.4% lên khoảng 36.0%, trong khi chi phí tăng rõ rệt. Hãy thử trên các tác vụ của riêng bạn.

Tôi có thể thay đổi nỗ lực giữa chừng trong một cuộc trò chuyện không? Có. Sử dụng một mục configuration_update và giữ nguyên reasoning.effort ở cấp yêu cầu để bộ nhớ cache của prompt vẫn hợp lệ. Nó không hoạt động với nén tự động hoặc cắt ngắn.

Tại sao tôi nhận được status: incomplete mà không có đầu ra? Có thể max_output_tokens quá thấp và suy luận đã sử dụng hết. OpenAI khuyến nghị dự trữ ít nhất 25.000 token.


Tiếp tục đọc: chuỗi GPT-6.1 Sol


Nguồn