GPT-6.1 Sol의 추론 노력 선택: 낮음에서 최대까지

AIHubMix6분 분량
GPT-6.1 Sol의 추론 노력 선택: 낮음에서 최대까지

GPT-6.1 Sol에는 다섯 가지 추론 노력 수준이 있습니다: low, medium (기본값), high, xhigh, 및 max. GPT-6 Sol에서의 큰 변화는 none 과 minimal 가 사라졌다는 점으로, 이제 low 가 바닥이 되었습니다.

이 설정 하나가 지연 시간과 비용 모두에 영향을 미칩니다. 추론 토큰은 보이지 않지만, 출력 요금($10당 백만 토큰)으로 비용을 지불해야 하며, 컨텍스트 창에서 공간을 차지합니다. 잘못된 수준을 선택하면 필요 이상으로 몇 배의 비용을 지불할 수 있습니다.


각 수준의 용도

이 표는 OpenAI의 설명과 추론 가이드 와 우리의 추천을 결합한 것입니다:

수준OpenAI의 설명적합한 경우부적합한 경우
low적당한 지연 시간 증가로 효율적인 추론도구 루프의 중간 단계, 검색, 간단한 계획, 분류, 추출, 지원 응답어려운 디버깅, 다중 파일 리팩토링
medium (기본값)대부분의 작업 부하에 대한 균형 잡힌 기본값일상적인 코딩, 코드 리뷰, 작성, 일반적인 에이전트 작업지연 시간이 중요한 대화형 사용
high어려운 추론, 복잡한 디버깅, 깊은 계획어려운 버그, 아키텍처 작업, SWE 스타일 작업높은 QPS 온라인 트래픽
xhigh심층 연구, 비동기 작업, 긴 에이전트 실행백그라운드 작업, 연구 보고서당신의 평가가 정당화하지 않은 모든 것
max가장 어려운 작업을 위한 최대 추론컴퓨터 사용, 연구 수준 문제, 오프라인 중량 작업거의 모든 일상 요청

OpenAI는 노력을 "주요 품질 회복 방법이 아닌 조정 노브"라고 부릅니다. 결과가 좋지 않을 경우, 먼저 프롬프트, 도구 정의 및 컨텍스트를 살펴보세요. 그 후에만 노력을 높이세요.


각 수준에 대한 벤치마크의 말

이 숫자는 OpenAI의 자체 데이터로,  Vellum 과 DataCamp 에 의해 수집되었습니다. 이들을 가이드로 삼되, 절대적인 진리로 여기지 마세요.

코딩의 경우, 높음이 보통 충분합니다. DeepSWE v1.1에서, 6.1 Sol의 높음은 75.2점을 기록하며, Astra의 높음(74.8)과 일치하며, 작업당 약 $1.50의 비용이 듭니다. 비용 곡선은 작업당 $0.50에서 $1.50 사이에서 72%에서 75%에 도달합니다. GPT-6 Sol은 약 $2.60에 68.8로 최대치를 기록했습니다.

중간 이상으로 가는 것이 항상 도움이 되는 것은 아닙니다. AutomationBench에서, 6.1 Sol은 중간에서 35.4%를 기록하고, 높은 노력에서는 약 36.0%에 불과합니다. 비즈니스 자동화의 경우, 추가 추론 토큰은 거의 아무것도 구매하지 못했습니다.

컴퓨터 사용 및 연구를 위해 최대를 남겨두세요. OSWorld 2.0에서, 최대는 작업당 약 $1.30에 71.4점을 기록합니다. Terminal-Bench Science에서 최대는 작업당 $5.47로, Astra의 $23.80보다 훨씬 저렴하지만, 대부분의 다른 작업보다 한 차원 높은 비용입니다.

낮음도 개선되었습니다. 낮음에서의 사실 오류율은 6 Sol에서 11.4%에서 7.7%로 감소했습니다. 낮음이 충분히 정확하지 않아서 6 Sol에서 작업을 중간으로 올렸다면, 다시 낮음을 시도해 보세요.


사용 사례별 시작점

사용 사례시작점비고
6 Sol에서 없음 사용한 호출lowOpenAI의 공식 매핑입니다. 지연 시간이 중요한 경우, 여전히 없음 지원하는 GPT-6 Luna를 고려하세요.
최소 사용한 호출low낮음에서 시작하고 결과를 비교하세요.
챗봇, 고객 지원low모델에게 한 줄의 서문을 요청하여 첫 번째 토큰을 더 빨리 얻으세요.
RAG Q&Alow → medium검색 품질이 노력보다 더 중요합니다.
IDE 코딩 보조 도구medium기본값이 작동합니다.
자동화된 버그 수정, SWE 에이전트highDeepSWE는 이미 높음이 Astra와 일치한다고 보여줍니다.
컴퓨터 사용, 브라우저 에이전트high → maxOSWorld는 최대에서 정점을 찍습니다.
백그라운드 연구, 긴 실행xhigh평가가 이득을 보여줄 때만 사용하세요. 배치 처리하면 결과가 즉시 필요하지 않을 경우 비용이 절반으로 줄어듭니다.
가장 어려운 연구 문제max 또는 Astra 사용OpenAI는 여기서도 Astra를 추천합니다.

 none 과 minimal 매핑은 OpenAI의 GPT-6 마이그레이션 가이드 에서 가져온 것입니다.


대화 중간에 노력 변경하기

일반적인 패턴은 높은 수준에서 계획하고, 낮은 수준에서 실행하며, 문제가 발생하면 다시 높은 수준으로 전환하는 것입니다.

주의: 요청에서 reasoning.effort 를 편집하면 프롬프트 캐시가 깨집니다. 노력은 캐시된 접두사의 일부입니다(자세한 내용은 프롬프트 캐싱 가이드 참조). 6.1 Sol에서 캐시 읽기는 백만 토큰당 $0.10의 비용이 들고, 캐시를 다시 쓰는 데는 $2.50의 비용이 듭니다. 이는 25배의 차이입니다.

GPT-6 계열은 configuration_update 입력 항목으로 이 문제를 해결합니다. 요청 수준의 reasoning.effort 는 그대로 두고 다음 사용자 메시지 전에 업데이트를 삽입하세요. 다음은 AIHubMix Responses API를 통해 보이는 예입니다:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# 턴 1: 높은 노력으로 계획하기
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},
    input="이 레포의 테스트가 실패하는 이유를 파악하고 수정 계획을 제안하세요.",
)

# 턴 2: 요청 수준의 노력은 건드리지 않고 실행을 위해 낮음으로 전환하기
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "high"},           # 변경되지 않음, 캐시가 유지됨
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "low"}},
        {"role": "user", "content": "계획의 1단계를 수행하세요."},
    ],
)
 configuration_update 형태는 예시입니다. 정확한 스키마는 OpenAI의 추론 가이드를 확인하세요. AIHubMix의 Responses 문서에서는 현재 네 가지 수준(최소에서 높음)을 나열하고 있으므로, 작은 테스트 요청을 보내어 xhigh, max, 및 configuration_update 가 통과하는지 확인하세요.

알아야 할 몇 가지 제한 사항:

  • 표준 단일 에이전트 모드에서만 작동하며, 노력만 변경됩니다.
  • 두 개의 업데이트가 서로 옆에 있을 수 없습니다.
  • 자동 압축이나 잘림과 혼합되지 않습니다. 명시적 압축은 괜찮지만, 그 후에 새로운 업데이트를 추가하세요.
  • 응답의 reasoning.effort 필드는 여전히 요청 수준의 값을 표시하므로, 너무 많은 의미를 부여하지 마세요.

노력과 함께 설정해야 할 사항

 max_output_tokens 에 여유를 두세요. 상한선에는 추론 토큰이 포함됩니다. 너무 낮게 설정하면 모델이 가시적인 텍스트를 생성하기 전에 중단될 수 있습니다. 이 경우 status: incomplete 가 반환되며, 입력 및 추론에 대해 비용을 지불해야 합니다. OpenAI는 시작할 때 최소 25,000 토큰 의 여유를 두는 것을 권장하며, xhigh 또는 max의 경우 더 많은 여유를 두는 것이 좋습니다.

추론 토큰을 추적하세요. 이들은 usage.output_tokens_details.reasoning_tokens 에 포함되어 있습니다. 각 노력 수준별 분포를 살펴보는 것이 감으로 조정하는 것보다 낫습니다.

가시성이 필요하다면 요약을 켜세요. reasoning.summary: "auto" 는 모델의 추론 요약을 반환합니다(먼저 조직을 확인해야 할 수도 있습니다). 원시 추론은 노출되지 않습니다.

프로 모드는 별도의 스위치입니다. 이 모드는 모델이 더 많은 작업을 수행하게 하며, 표준 요금으로 청구되지만 전체적으로 더 많은 토큰을 사용합니다. 추가 지연이 허용되는 어려운 문제에 사용하세요.


실제로 실행할 수 있는 조정 프로세스

  1. 20에서 50개의 실제 작업을 평가 세트로 가져옵니다.
  2.  medium 에서 기준선을 실행합니다. 성공률, 평균 추론 토큰, 및 P95 지연 시간을 기록합니다.
  3.  low 를 시도합니다. 성공률이 거의 떨어지지 않으면 전환합니다.
  4.  high 를 시도합니다. 성공률이 분명히 향상되면 해당 작업 유형에 대해서만 높음을 사용합니다.
  5. 높음이 부족할 때만 xhigh 또는 max 를 선택하고, 그 동안 GPT-6 Astra의 높은 수준과 비교하세요. 때때로 더 큰 모델이 더 많은 노력을 이깁니다. AIHubMix에서는 model 매개변수만 변경하면 되며, 모델 목록 에서 사용 가능한 모델을 확인할 수 있습니다.
  6. 하나의 글로벌 설정을 사용하는 대신 작업 유형별로 라우팅합니다.

짧은 버전: medium에서 시작하고, low로 비용을 절감하며, 코딩에는 high를 사용하고, xhigh 및 max는 평가에서 스스로 증명하게 하세요.

다음은: 캐싱, 긴 컨텍스트 및 청구 배수가 작용할 때 $2 / $10 가격 태그가 실제로 의미하는 바입니다.


자주 묻는 질문

GPT-6.1 Sol의 기본 추론 노력은 무엇인가요? medium입니다. 설정하지 않으면 기본값이 적용됩니다.

왜 none 가 오류를 반환하나요? 6.1 Sol은 none 또는 minimal 을 지원하지 않습니다. OpenAI는 low 로 전환할 것을 권장합니다. 정말 none 이 필요하다면 GPT-6 Sol 또는 GPT-6 Luna를 사용하세요.

추론 토큰은 어떻게 청구되나요? 출력 요금($10당 백만 토큰)으로 청구되며, 컨텍스트 창에 포함됩니다. 실제 숫자는 usage.output_tokens_details.reasoning_tokens 에서 확인하세요.

Chat Completions와 Responses에서 매개변수 이름이 동일한가요? 아니요. Chat Completions는 최상위 reasoning_effort 를 사용하고, Responses는 중첩된 reasoning: {"effort": ...} 를 사용합니다. 이를 혼합하면 Unsupported parameter 가 반환됩니다.

더 높은 노력이 항상 더 나은 결과를 주나요? 아니요. AutomationBench에서 중간 이상으로 가는 것은 점수를 35.4%에서 약 36.0%로 이동시키는 데 그쳤으며, 비용은 눈에 띄게 더 들었습니다. 자신의 작업에서 테스트해 보세요.

대화 중간에 노력을 변경할 수 있나요? 예. 요청 수준의 reasoning.effort 는 변경하지 않고 configuration_update 항목을 사용하여 프롬프트 캐시가 유효하게 유지되도록 합니다. 자동 압축이나 잘림과는 작동하지 않습니다.

왜 출력 없이 status: incomplete 가 반환되었나요? 대부분의 경우 max_output_tokens 가 너무 낮아서 추론이 모두 소모되었기 때문입니다. OpenAI는 최소 25,000 토큰을 예약할 것을 권장합니다.


계속 읽기: GPT-6.1 Sol 시리즈


출처