GPT-6.1 Sol에는 다섯 가지 추론 노력 수준이 있습니다: low, medium (기본값), high, xhigh, 및 max. GPT-6 Sol에서의 큰 변화는 none 과 minimal 가 사라졌다는 점으로, 이제 low 가 바닥이 되었습니다.
이 설정 하나가 지연 시간과 비용 모두에 영향을 미칩니다. 추론 토큰은 보이지 않지만, 출력 요금($10당 백만 토큰)으로 비용을 지불해야 하며, 컨텍스트 창에서 공간을 차지합니다. 잘못된 수준을 선택하면 필요 이상으로 몇 배의 비용을 지불할 수 있습니다.
각 수준의 용도
이 표는 OpenAI의 설명과 추론 가이드 와 우리의 추천을 결합한 것입니다:
| 수준 | OpenAI의 설명 | 적합한 경우 | 부적합한 경우 |
|---|---|---|---|
| low | 적당한 지연 시간 증가로 효율적인 추론 | 도구 루프의 중간 단계, 검색, 간단한 계획, 분류, 추출, 지원 응답 | 어려운 디버깅, 다중 파일 리팩토링 |
| medium (기본값) | 대부분의 작업 부하에 대한 균형 잡힌 기본값 | 일상적인 코딩, 코드 리뷰, 작성, 일반적인 에이전트 작업 | 지연 시간이 중요한 대화형 사용 |
| high | 어려운 추론, 복잡한 디버깅, 깊은 계획 | 어려운 버그, 아키텍처 작업, SWE 스타일 작업 | 높은 QPS 온라인 트래픽 |
| xhigh | 심층 연구, 비동기 작업, 긴 에이전트 실행 | 백그라운드 작업, 연구 보고서 | 당신의 평가가 정당화하지 않은 모든 것 |
| max | 가장 어려운 작업을 위한 최대 추론 | 컴퓨터 사용, 연구 수준 문제, 오프라인 중량 작업 | 거의 모든 일상 요청 |
OpenAI는 노력을 "주요 품질 회복 방법이 아닌 조정 노브"라고 부릅니다. 결과가 좋지 않을 경우, 먼저 프롬프트, 도구 정의 및 컨텍스트를 살펴보세요. 그 후에만 노력을 높이세요.
각 수준에 대한 벤치마크의 말
이 숫자는 OpenAI의 자체 데이터로, Vellum 과 DataCamp 에 의해 수집되었습니다. 이들을 가이드로 삼되, 절대적인 진리로 여기지 마세요.
코딩의 경우, 높음이 보통 충분합니다. DeepSWE v1.1에서, 6.1 Sol의 높음은 75.2점을 기록하며, Astra의 높음(74.8)과 일치하며, 작업당 약 $1.50의 비용이 듭니다. 비용 곡선은 작업당 $0.50에서 $1.50 사이에서 72%에서 75%에 도달합니다. GPT-6 Sol은 약 $2.60에 68.8로 최대치를 기록했습니다.
중간 이상으로 가는 것이 항상 도움이 되는 것은 아닙니다. AutomationBench에서, 6.1 Sol은 중간에서 35.4%를 기록하고, 높은 노력에서는 약 36.0%에 불과합니다. 비즈니스 자동화의 경우, 추가 추론 토큰은 거의 아무것도 구매하지 못했습니다.
컴퓨터 사용 및 연구를 위해 최대를 남겨두세요. OSWorld 2.0에서, 최대는 작업당 약 $1.30에 71.4점을 기록합니다. Terminal-Bench Science에서 최대는 작업당 $5.47로, Astra의 $23.80보다 훨씬 저렴하지만, 대부분의 다른 작업보다 한 차원 높은 비용입니다.
낮음도 개선되었습니다. 낮음에서의 사실 오류율은 6 Sol에서 11.4%에서 7.7%로 감소했습니다. 낮음이 충분히 정확하지 않아서 6 Sol에서 작업을 중간으로 올렸다면, 다시 낮음을 시도해 보세요.
사용 사례별 시작점
| 사용 사례 | 시작점 | 비고 |
|---|---|---|
| 6 Sol에서 없음 사용한 호출 | low | OpenAI의 공식 매핑입니다. 지연 시간이 중요한 경우, 여전히 없음 지원하는 GPT-6 Luna를 고려하세요. |
| 최소 사용한 호출 | low | 낮음에서 시작하고 결과를 비교하세요. |
| 챗봇, 고객 지원 | low | 모델에게 한 줄의 서문을 요청하여 첫 번째 토큰을 더 빨리 얻으세요. |
| RAG Q&A | low → medium | 검색 품질이 노력보다 더 중요합니다. |
| IDE 코딩 보조 도구 | medium | 기본값이 작동합니다. |
| 자동화된 버그 수정, SWE 에이전트 | high | DeepSWE는 이미 높음이 Astra와 일치한다고 보여줍니다. |
| 컴퓨터 사용, 브라우저 에이전트 | high → max | OSWorld는 최대에서 정점을 찍습니다. |
| 백그라운드 연구, 긴 실행 | xhigh | 평가가 이득을 보여줄 때만 사용하세요. 배치 처리하면 결과가 즉시 필요하지 않을 경우 비용이 절반으로 줄어듭니다. |
| 가장 어려운 연구 문제 | max 또는 Astra 사용 | OpenAI는 여기서도 Astra를 추천합니다. |
none 과 minimal 매핑은 OpenAI의 GPT-6 마이그레이션 가이드 에서 가져온 것입니다.
대화 중간에 노력 변경하기
일반적인 패턴은 높은 수준에서 계획하고, 낮은 수준에서 실행하며, 문제가 발생하면 다시 높은 수준으로 전환하는 것입니다.
주의: 요청에서 reasoning.effort 를 편집하면 프롬프트 캐시가 깨집니다. 노력은 캐시된 접두사의 일부입니다(자세한 내용은 프롬프트 캐싱 가이드 참조). 6.1 Sol에서 캐시 읽기는 백만 토큰당 $0.10의 비용이 들고, 캐시를 다시 쓰는 데는 $2.50의 비용이 듭니다. 이는 25배의 차이입니다.
GPT-6 계열은 configuration_update 입력 항목으로 이 문제를 해결합니다. 요청 수준의 reasoning.effort 는 그대로 두고 다음 사용자 메시지 전에 업데이트를 삽입하세요. 다음은 AIHubMix Responses API를 통해 보이는 예입니다:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# 턴 1: 높은 노력으로 계획하기
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"},
input="이 레포의 테스트가 실패하는 이유를 파악하고 수정 계획을 제안하세요.",
)
# 턴 2: 요청 수준의 노력은 건드리지 않고 실행을 위해 낮음으로 전환하기
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "high"}, # 변경되지 않음, 캐시가 유지됨
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "low"}},
{"role": "user", "content": "계획의 1단계를 수행하세요."},
],
)
configuration_update형태는 예시입니다. 정확한 스키마는 OpenAI의 추론 가이드를 확인하세요. AIHubMix의 Responses 문서에서는 현재 네 가지 수준(최소에서 높음)을 나열하고 있으므로, 작은 테스트 요청을 보내어xhigh,max, 및configuration_update가 통과하는지 확인하세요.
알아야 할 몇 가지 제한 사항:
- 표준 단일 에이전트 모드에서만 작동하며, 노력만 변경됩니다.
- 두 개의 업데이트가 서로 옆에 있을 수 없습니다.
- 자동 압축이나 잘림과 혼합되지 않습니다. 명시적 압축은 괜찮지만, 그 후에 새로운 업데이트를 추가하세요.
- 응답의
reasoning.effort필드는 여전히 요청 수준의 값을 표시하므로, 너무 많은 의미를 부여하지 마세요.
노력과 함께 설정해야 할 사항
max_output_tokens 에 여유를 두세요. 상한선에는 추론 토큰이 포함됩니다. 너무 낮게 설정하면 모델이 가시적인 텍스트를 생성하기 전에 중단될 수 있습니다. 이 경우 status: incomplete 가 반환되며, 입력 및 추론에 대해 비용을 지불해야 합니다. OpenAI는 시작할 때 최소 25,000 토큰 의 여유를 두는 것을 권장하며, xhigh 또는 max의 경우 더 많은 여유를 두는 것이 좋습니다.
추론 토큰을 추적하세요. 이들은 usage.output_tokens_details.reasoning_tokens 에 포함되어 있습니다. 각 노력 수준별 분포를 살펴보는 것이 감으로 조정하는 것보다 낫습니다.
가시성이 필요하다면 요약을 켜세요. reasoning.summary: "auto" 는 모델의 추론 요약을 반환합니다(먼저 조직을 확인해야 할 수도 있습니다). 원시 추론은 노출되지 않습니다.
프로 모드는 별도의 스위치입니다. 이 모드는 모델이 더 많은 작업을 수행하게 하며, 표준 요금으로 청구되지만 전체적으로 더 많은 토큰을 사용합니다. 추가 지연이 허용되는 어려운 문제에 사용하세요.
실제로 실행할 수 있는 조정 프로세스
- 20에서 50개의 실제 작업을 평가 세트로 가져옵니다.
-
medium에서 기준선을 실행합니다. 성공률, 평균 추론 토큰, 및 P95 지연 시간을 기록합니다. -
low를 시도합니다. 성공률이 거의 떨어지지 않으면 전환합니다. -
high를 시도합니다. 성공률이 분명히 향상되면 해당 작업 유형에 대해서만 높음을 사용합니다. - 높음이 부족할 때만
xhigh또는max를 선택하고, 그 동안 GPT-6 Astra의 높은 수준과 비교하세요. 때때로 더 큰 모델이 더 많은 노력을 이깁니다. AIHubMix에서는model매개변수만 변경하면 되며, 모델 목록 에서 사용 가능한 모델을 확인할 수 있습니다. - 하나의 글로벌 설정을 사용하는 대신 작업 유형별로 라우팅합니다.
짧은 버전: medium에서 시작하고, low로 비용을 절감하며, 코딩에는 high를 사용하고, xhigh 및 max는 평가에서 스스로 증명하게 하세요.
다음은: 캐싱, 긴 컨텍스트 및 청구 배수가 작용할 때 $2 / $10 가격 태그가 실제로 의미하는 바입니다.
자주 묻는 질문
GPT-6.1 Sol의 기본 추론 노력은 무엇인가요? medium입니다. 설정하지 않으면 기본값이 적용됩니다.
왜 none 가 오류를 반환하나요? 6.1 Sol은 none 또는 minimal 을 지원하지 않습니다. OpenAI는 low 로 전환할 것을 권장합니다. 정말 none 이 필요하다면 GPT-6 Sol 또는 GPT-6 Luna를 사용하세요.
추론 토큰은 어떻게 청구되나요? 출력 요금($10당 백만 토큰)으로 청구되며, 컨텍스트 창에 포함됩니다. 실제 숫자는 usage.output_tokens_details.reasoning_tokens 에서 확인하세요.
Chat Completions와 Responses에서 매개변수 이름이 동일한가요? 아니요. Chat Completions는 최상위 reasoning_effort 를 사용하고, Responses는 중첩된 reasoning: {"effort": ...} 를 사용합니다. 이를 혼합하면 Unsupported parameter 가 반환됩니다.
더 높은 노력이 항상 더 나은 결과를 주나요? 아니요. AutomationBench에서 중간 이상으로 가는 것은 점수를 35.4%에서 약 36.0%로 이동시키는 데 그쳤으며, 비용은 눈에 띄게 더 들었습니다. 자신의 작업에서 테스트해 보세요.
대화 중간에 노력을 변경할 수 있나요? 예. 요청 수준의 reasoning.effort 는 변경하지 않고 configuration_update 항목을 사용하여 프롬프트 캐시가 유효하게 유지되도록 합니다. 자동 압축이나 잘림과는 작동하지 않습니다.
왜 출력 없이 status: incomplete 가 반환되었나요? 대부분의 경우 max_output_tokens 가 너무 낮아서 추론이 모두 소모되었기 때문입니다. OpenAI는 최소 25,000 토큰을 예약할 것을 권장합니다.
계속 읽기: GPT-6.1 Sol 시리즈
- 청구서에서 추론은 얼마나 되나요? 노력은 단지 하나의 레버입니다. 캐싱, 272K 임계값 및 배치 할인 모두 최종 숫자에 영향을 미칩니다. 자세한 내용은 GPT-6.1 Sol의 실제 비용: $2 / $10 가격 태그를 넘어서 를 참조하세요.
-
none을 사용한 코드?low로 전환하는 것은 시작일 뿐입니다. 도구 호출, 샘플링 매개변수 및 캐시 설정도 변경해야 합니다: GPT-6.1 Sol로 마이그레이션: 9가지 잘못될 수 있는 것들. - 6.1 Sol이 6 Sol 및 Astra보다 얼마나 더 나은가요? 사양 및 벤치마크를 나란히 비교한 내용은 GPT-6.1 Sol vs GPT-6 Sol: Astra를 거의 따라잡는 일주일 업그레이드 에서 확인하세요.



