GPT-6.1 Sol의 실제 비용: $2 / $10 가격표를 넘어서

AIHubMix6분 분량
GPT-6.1 Sol의 실제 비용: $2 / $10 가격표를 넘어서

GPT-6.1 Sol 은 GPT-6 Sol과 동일한 목록 가격을 가지고 있습니다: 백만 개의 입력 토큰당 $2, 백만 개의 출력 토큰당 $10. 실제 청구서는 네 가지 다른 요소에 따라 달라집니다: 캐시를 얼마나 자주 사용하는지, 272K 입력 토큰을 초과하는지, 어떤 서비스 계층을 사용하는지, 모델이 소모하는 추론 토큰의 수입니다. 이 게시물에서는 각각에 대해 설명합니다.


전체 가격 목록

표준 요금 (백만 개의 토큰당)

GPT-6.1 SolGPT-6 SolGPT-6 AstraGPT-6 Luna
입력$2.00$2.00$10.00$0.10
캐시된 입력$0.10$0.20$1.00—
캐시 쓰기$2.50$2.50——
출력 (추론 포함)$10.00$10.00$50.00$0.50
Astra의 캐시 요금은 제3자 보고서에서 나온 것입니다. 캐시 쓰기 요금은 OpenAI의 1.25× 규칙에 따라 $12.50이어야 합니다. Luna의 캐시 가격에 대한 내용은 OpenAI의 가격 페이지를 참조하세요.

배수

이 규칙은 GPT-6.1 Sol 모델 페이지에서 가져온 것입니다:

조건무슨 일이 일어나는가
272K 입력 토큰 초과전체 요청이 2× 입력 및 캐시, 1.5× 출력으로 청구됩니다 ($4 / $15, 캐시 읽기 $0.20, 캐시 쓰기 $5)
배치 / 플렉스표준 요금의 절반
빠른 모드표준 요금의 두 배 (EU 데이터 거주지에서는 사용 불가)
지역 처리+10%
도구 호출 (검색, 컴퓨터 사용 등)호출당 청구됩니다. AIHubMix는 웹 검색을 요청당 $0.01로 나열합니다
초고속 (Codex에 도입 예정)아직 공식 가격이 책정되지 않았습니다. 한 보고서에 따르면 6× 표준, 확인되지 않음

AIHubMix에서는 OpenAI 및 Azure 경로가 OpenAI 직접와 동일한 비용이 들며, 272K 초과 계층도 이미 나열되어 있습니다.


실제 변화: 입력의 5%에서 캐시 읽기

목록 가격은 변하지 않았습니다. 캐시 읽기는 입력 요금의 10%($0.20)에서 5%($0.10)로 변경되었습니다. OpenAI의 프롬프트 캐싱 문서 에서는 명확히 설명합니다: 캐시 읽기는 대부분의 모델에서 입력의 0.1×이며 "GPT-6.1 Sol에서는 0.05×입니다."

이는 에이전트가 매 단계에서 동일한 자료를 다시 전송하기 때문에 중요합니다: 시스템 프롬프트, 도구 정의, 저장소 컨텍스트 및 대화 기록. 그들의 입력 대부분은 반복된 내용입니다. 이러한 작업 부하의 경우, 캐시된 요금은 실제 입력 가격과 동일합니다.

작업 예시: 하나의 코딩 에이전트 작업

가정:

  • 200K 토큰의 고정 접두사 (시스템 프롬프트, 도구, 저장소 컨텍스트)
  • 50단계, 각 단계에서 2K의 새로운 입력 토큰을 추가하고 3K의 출력 토큰을 생성 (추론 포함)
  • 간단하게 하기 위해, 접두사는 동일한 크기를 유지하고 1단계에서 캐시에 기록되며 나머지 49단계에서 모두 사용됩니다
6.1 Sol, 캐시 없음6 Sol + 캐시6.1 Sol + 캐시Astra + 캐시
초기 200K 캐시 쓰기—$0.50$0.50$2.50
49 캐시 읽기—$1.96$0.98$9.80
접두사는 일반 입력으로 청구됨$20.00———
100K 새로운 입력 (쓰기 요금 기준)$0.20$0.25$0.25$1.25
150K 출력$1.50$1.50$1.50$7.50
총계$21.70$4.21$3.23$21.05

세 가지 주요 사항:

  1. 캐싱이 가장 큰 레버입니다. 같은 모델, 같은 작업에서 캐시되지 않은 실행은 거의 7배 더 비쌉니다.
  2. 6.1 Sol은 6 Sol보다 약 23% 더 저렴합니다. 여기서도 더 높은 점수를 기록합니다.
  3. 캐시가 많은 작업의 경우, Astra는 5배의 목록 가격 차이가 제안하는 것보다 더 비쌉니다. 이 예에서는 6.5배입니다. Astra는 캐시된 입력을 90% 할인하고 6.1 Sol은 95% 할인합니다.

이는 OpenAI의 보고된 작업당 비용과 일치합니다 (compiled by Vellum and The Next Web): DeepSWE에서 약 $1.50 vs $7.70, OSWorld에서 $1.30 vs $9.30, Terminal-Bench Science에서 $5.47 vs $23.80입니다.

한 가지 주의사항: OpenAI는 Astra가 동일한 작업을 완료하는 데 일반적으로 더 적은 출력 토큰을 필요로 한다고 말합니다. 작업당 비용으로 모델을 비교하세요, 토큰당 비용이 아닙니다.

캐시 쓰기는 무료가 아닙니다

6.1 Sol의 캐시 쓰기는 입력 요금의 1.25배입니다. 접두사가 한 번만 사용된다면, 캐싱은 25% 더 비쌉니다. OpenAI 문서의 공식을 사용하면:

  • 하나의 쓰기와 하나의 읽기: 일반 입력 비용의 1.35배 (6.1 Sol에서는 1.3배), 캐싱 없이 2배
  • 하나의 쓰기와 아홉 개의 읽기: 약 2.15배 (6.1 Sol에서는 약 1.7배), 10배에 비해

최소 캐시 가능 접두사는 1,024 토큰입니다. OpenAI의 손익 분기점 수학에 따르면 102 토큰 이하의 접두사는 결코 이익이 나지 않습니다. 10회 이상의 재사용을 예상한다면, 221 토큰을 초과하는 모든 것을 1,024까지 패딩하는 것이 더 저렴합니다.

단일 턴 분류 또는 대량 추출과 같은 일회성 호출의 경우, 명시적 모드 (prompt_cache_options.mode: "explicit")를 사용하여 중단점을 설정하지 마세요. 쓰기에 대한 요금이 부과되지 않습니다.


272K 절벽

6.1 Sol은 1.05M 토큰의 컨텍스트를 수용하지만 입력이 272K를 초과하면 전체 요청이 더 높은 요금으로 이동합니다, 단지 초과하는 토큰만이 아닙니다.

요청입력출력비용
A270K10K0.27 × $2 + 0.01 × $10 = $0.64
B280K10K0.28 × $4 + 0.01 × $15 = $1.27

10,000개의 입력 토큰이 청구서를 거의 두 배로 늘립니다.

이를 피하는 방법:

  • 클라이언트 측에서 토큰을 계산하고 272K에 도달하기 전에 압축하거나 잘라내기
  • 전체 문서를 보내는 대신 관련 부분을 검색하기
  • 긴 컨텍스트가 정말 필요한 경우, 고정된 부분을 캐시된 접두사에 넣기

추론 노력이 청구서에 나타나는 방식

추론 토큰은 출력 요금으로 청구되며, 백만 개당 $10입니다. 동일한 작업을 낮은 수준에서 최대 수준으로 이동하면 추론 토큰이 10배 이상 증가할 수 있습니다.

OpenAI의 보고된 작업당 비용은 규모를 파악하는 데 도움이 됩니다 (이들은 서로 다른 벤치마크이므로 크기만 비교하세요):

  • AutomationBench (중간): ~$0.30
  • GDP.pdf: ~$0.38
  • DeepSWE (높음): ~$1.50
  • Terminal-Bench Science (최대): ~$5.47

파트 2에서는 수준을 선택하는 방법을 다룹니다. 여기서 한 가지 주의사항: reasoning.effort 를 대화 중간에 변경하면 캐시가 무효화됩니다. 대신 configuration_update 를 사용하세요.


이 가격대에서의 비교

모델입력 / 출력캐시된 입력
GPT-6.1 Sol$2 / $10$0.10
Claude Sonnet 5.5$2 / $10$0.20
GPT-6 Astra$10 / $50$1.00

6.1 Sol과 Claude Sonnet 5.5는 목록 가격이 동일하며, 6.1 Sol의 캐시 요금은 Sonnet의 절반입니다. 그러나 그들은 서로 다른 것들에서 강력합니다. 예를 들어, AutomationBench에서는 Sonnet 5.5가 훨씬 앞서 있습니다. 두 모델의 토큰당 비용이 동일할 때, 작업 부하에서 더 낮은 작업당 비용을 가진 모델이 더 저렴한 모델입니다.

 AIHubMix 모델 목록 는 현재 가격을 보여주며, 하나의 API 키로 모든 모델을 사용할 수 있어 나란히 테스트하기 쉽습니다.

경쟁업체 가격은 제3자 출처에서 가져온 것이며 변경될 수 있습니다. 의존하기 전에 공식 가격 페이지를 확인하세요.

비용 체크리스트

  1. 안정적인 콘텐츠를 먼저 배치하세요. 시스템 프롬프트, 도구 정의 및 참조 자료는 상단에 배치합니다. 타임스탬프 및 사용자별 데이터는 마지막에 배치합니다.
  2. 추가하고, 다시 쓰지 마세요. 요약, 잘라내기 및 압축은 모두 캐시를 재시작합니다.
  3. 도구 목록을 안정적으로 유지하세요. 요청마다 도구를 추가하거나 제거하지 마세요. 대신 tool_choice 또는 allowed_tools 를 사용하세요.
  4. 노력을 configuration_update 로 전환하세요, 요청 매개변수가 아닙니다.
  5. 272K 입력을 초과하지 마세요.
  6. 비긴급 작업은 배치 또는 플렉스를 통해 보내세요 절반 가격으로.
  7. 작업에 따라 경로를 설정하세요. 단순 고용량 작업은 Luna, 대부분의 작업은 6.1 Sol, 가장 어려운 문제는 Astra를 사용하세요.
  8. 세 가지 숫자를 주의하세요: cached_tokens, cache_write_tokens, reasoning_tokens.

결론: 목록 가격은 변하지 않았지만, 캐시 읽기가 50% 더 저렴해졌습니다. 에이전트 작업 부하의 경우, 6.1 Sol은 GPT-6 계열에서 최고의 가치를 제공하는 모델입니다. 캐싱을 잘 사용하고 272K 이하로 유지하는 한 그렇습니다.

다음은 전환 시 발생할 수 있는 문제입니다.


자주 묻는 질문

GPT-6.1 Sol의 비용은 얼마인가요? 백만 개의 입력 토큰당 $2, 백만 개의 출력 토큰당 $10, 캐시된 입력은 $0.10, 캐시 쓰기는 $2.50입니다. 272K 입력 토큰을 초과하는 요청은 전체 요청에 대해 $4 입력 및 $15 출력을 청구합니다.

AIHubMix를 통해 더 저렴한가요, 아니면 OpenAI 직접인가요? 같은 가격입니다. AIHubMix의 OpenAI 및 Azure 경로는 모두 OpenAI의 공식 요금과 일치합니다.

내 청구서가 예상보다 높은 이유는 무엇인가요? 네 가지 일반적인 이유: 추론 토큰은 출력 요금으로 청구됩니다; 272K 입력을 초과했습니다; 캐시를 놓쳤거나 일회성 접두사에 대한 쓰기 요금을 지불했습니다; 또는 빠른 모드 또는 지역 처리가 활성화되어 있습니다.

캐시 쓰기는 추가 비용이 드나요? 작성된 토큰은 입력 요금의 1.25배로 청구됩니다. 이는 정상 입력 요금을 대체하며 추가되지 않습니다. 접두사는 두 번 사용한 후 스스로 비용을 충당합니다. 일회성 접두사의 경우, 명시적 모드를 사용하면 쓰기를 완전히 건너뛸 수 있습니다.

6.1 Sol이 Astra보다 얼마나 더 저렴한가요? 목록 가격에서 5배 더 저렴합니다. 캐시가 많은 에이전트 작업의 경우, 6.1 Sol이 캐시된 입력을 더 많이 할인하므로 차이는 6배에서 7배에 이를 수 있습니다. 그러나 Astra는 종종 작업당 더 적은 출력 토큰을 사용하므로 작업당 비용을 비교하세요.

배치와 캐싱을 결합할 수 있나요? 배치와 플렉스는 모두 절반 가격입니다. 캐싱과 함께 어떻게 쌓이는지 확인하려면 OpenAI의 가격 페이지를 확인하세요.


계속 읽기: GPT-6.1 Sol 시리즈


출처