GPT-5.6 출시: 프롬프트 캐싱 청구 변경 사항 설명

2026년 7월 31일 · AIHubMix · 8 min read · 의견

GPT-5.6 출시: 프롬프트 캐싱 청구 변경 사항 설명

OpenAI는 2026년 7월 9일에 GPT-5.6 패밀리를 공식 출시했습니다. AIHubMix는 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna의 세 가지 계층을 모두 통합했습니다. 이제 Chat Completions 및 Responses를 통해 사용할 수 있습니다. 이번 출시에서는 프롬프트 캐싱 메커니즘과 청구 방식이 변경되었습니다: 캐시 쓰기는 이제 별도로 청구됩니다. 이 게시물에서는 세 가지 계층의 위치를 설명하고 캐싱 변경 사항을 하나씩 살펴봅니다.

세 가지 GPT-5.6 계층의 변경 사항

GPT-5.6은 명명 규칙을 수정했습니다: 숫자는 모델 세대를 나타내며, Sol, Terra, Luna는 독립적으로 발전할 수 있는 기능 계층입니다. 공식 정의에 따르면, Sol은 플래그십 모델, Terra는 GPT-5.5와 유사한 성능을 가진 저가형 계층, Luna는 가장 빠르고 저렴한 계층입니다.

gpt-5.6-sol gpt-5.6-terra gpt-5.6-luna
공식 위치 복잡한 전문 작업을 위한 플래그십 모델 균형 잡힌 지능과 비용 비용에 민감한 작업을 위한 모델
컨텍스트 윈도우 1,050,000 1,050,000 1,050,000
최대 출력 128,000 128,000 128,000
지식 컷오프 2026-02-16 2026-02-16 2026-02-16
이전 세대의 대략적인 동급 모델 접미사가 없는 계층 미니 계층 나노 계층

기능 측면에서 공식적인 입장은 다음과 같습니다: Sol은 코딩, 지식 작업, 사이버 보안 및 과학 작업에서 최첨단 결과를 달성하며, OpenAI는 이를 지금까지의 최고의 코딩 모델로 설명하고 Terminal-Bench 2.1 및 DeepSWE에서 새로운 기록을 세웠습니다; Terra는 GPT-5.5 성능을 절반 가격에 제공합니다. 이 패밀리는 최대 추론 수준을 추가하며, Responses API는 프로그래밍 도구 호출 및 다중 에이전트(베타) 기능을 갖추고 있습니다.

캐싱 메커니즘 업그레이드 설명

GPT-5.6 이전에는 GPT 모델의 프롬프트 캐싱이 완전히 자동이었습니다: 1,024 토큰 이상의 접두사는 자동으로 캐시되었으며, 개발자는 캐시되는 내용이나 기간을 제어할 수 없었고, 비활성 상태가 5~10분 지속되면 캐시는 삭제되었습니다. OpenAI는 GPT-5.6의 변경 사항을 "보다 예측 가능한 프롬프트 캐싱"으로 요약하며, 세 가지 구체적인 사항이 있습니다:

  1. 보존 기간이 "최소 30분"으로 변경되었습니다. prompt_cache_options.ttl는 현재 "30m"만 지원하며, 이는 보장된 최소값이며 실제 보존 기간은 더 길 수 있습니다.
  2. 명시적 캐시 중단점이 새로 추가되었습니다. 콘텐츠 블록에 prompt_cache_breakpoint를 설정하면 안정적인 콘텐츠 끝에서 캐시 경계를 고정하므로 중단점 이후의 변경 사항은 이전의 캐시된 접두사를 무효화하지 않습니다; prompt_cache_options.mode"explicit"로 설정하면 수동 중단점만 사용됩니다.
  3. prompt_cache_key는 최적화에서 공식 요구 사항으로 변경되었습니다. GPT-5.6부터는 이 매개변수를 설정하여 보다 신뢰할 수 있는 캐시 매칭을 가능하게 해야 하며, OpenAI는 키당 트래픽을 대략 분당 15회 요청으로 유지할 것을 권장합니다.

1.25배 캐시 쓰기 청구 평가 방법

GPT-5.6부터 캐시 쓰기는 기본 입력 요금의 1.25배로 청구되며, 캐시 읽기는 0.1배로 청구됩니다; 이전 모델에서는 캐시 쓰기에 추가 요금이 없습니다. 공식 문구(출처: GPT-5.6 발표): "GPT-5.6 및 이후 모델의 경우, 캐시 쓰기는 모델의 비캐시 입력 요금의 1.25배로 청구되며, 캐시 읽기는 계속해서 90% 캐시 입력 할인 혜택을 받습니다."

손익 분기점 수치는 공식 요금에서 직접 파생됩니다: 접두사를 작성하는 데 드는 비용은 비캐시 상태보다 0.25배 더 비싸며, 이후의 각 히트는 0.9배의 입력 요금을 절약합니다: 한 번이라도 재사용된 접두사는 순 절약을 발생시킵니다, 재사용이 많을수록 절약이 커집니다.

  • 명확한 이점을 가진 작업 부하: 긴 시스템 프롬프트가 있는 에이전트 워크플로우, 긴 참조 자료를 반복적으로 포함하는 RAG, 대규모 도구 정의를 포함하는 애플리케이션, 메시지만 추가하는 다중 턴 대화. 이러한 작업 부하는 높은 접두사 재사용을 가지므로 0.1배 읽기 요금이 우세합니다.
  • 주의해야 할 작업 부하: 접두사가 결코 재사용되지 않는 일회성 긴 요청. 자동 캐싱은 기본적으로 활성화되어 있으므로 이러한 요청은 회복할 수 없는 1.25배 쓰기 요금이 발생합니다; prompt_cache_options.mode"explicit"로 설정하고 중단점을 설정하지 않으면 요청이 캐시를 완전히 건너뛰고 쓰기 요금이 발생하지 않습니다.

비교: GPT-5.6과 Claude의 프롬프트 캐싱

GPT-5.6의 캐싱 설계는 여러 측면에서 Claude의 cache_control와 수렴하며, 핵심 차이는 기본 동작입니다: GPT는 매개변수 없이 자동으로 캐시되며, Claude는 요청에서 캐싱을 활성화해야 하며, 최상위 cache_control 필드(자동 중단점) 또는 콘텐츠 블록 수준의 명시적 중단점이 필요합니다.

차원 GPT-5.6 패밀리 Claude 패밀리 (모든 활성 모델)
활성화 자동 캐싱, 명시적 중단점 선택 사항 활성화해야 함: 최상위 cache_control 자동 중단점 또는 콘텐츠 블록 수준의 명시적 중단점
중단점 매개변수 prompt_cache_breakpoint (콘텐츠 블록 수준) cache_control (최상위 또는 콘텐츠 블록 수준)
중단점 제한 요청당 최대 4개의 새로운 캐시 쓰기 최대 4개의 중단점
캐시 보존 최소 30분 기본적으로 5분 (각 히트에서 비용 없이 새로 고침됨), 선택적으로 1시간
캐시 쓰기 청구 1.25배 입력 요금 5분 계층에 대해 1.25배, 1시간 계층에 대해 2배
캐시 읽기 청구 0.1배 입력 요금 0.1배 입력 요금
최소 캐시 가능 길이 1,024 토큰 모델에 따라 512–4,096 토큰
히트 요구 사항 중단점 이전에 바이트 단위로 동일해야 함 중단점 이전에 바이트 단위로 동일해야 함

Claude 열은 모든 활성 Claude 모델이 공유하는 규칙을 반영합니다: 5분 계층에 대해 1.25배 쓰기, 1시간 계층에 대해 2배, 0.1배 읽기가 전체 라인업에 균일하게 적용됩니다 (Anthropic 프롬프트 캐싱 문서), 모델별 차이는 최소 캐시 가능 길이에 국한됩니다; GPT-5.6 열은 OpenAI 프롬프트 캐싱 가이드에서 가져온 것입니다.

중단점 제한, 쓰기 요금(해당 계층에 대해) 및 읽기 요금은 두 제공업체 간에 정확히 일치합니다; 실질적으로 동일한 "정적 콘텐츠 먼저, 변경 콘텐츠 나중" 프롬프트 구조화 전략이 두 모델 간에 적용됩니다. 마이그레이션 비용은 매개변수 구문에 집중됩니다: GPT는 prompt_cache_breakpoint + prompt_cache_key를 사용하고, Claude는 cache_control를 사용합니다.

두 프로토콜 모두 동일한 캐싱 패턴

같은 "정적 긴 지침을 캐시" 시나리오에 대해 두 프로토콜의 최소 구현이 따릅니다. 예제에서는 gpt-5.6-solclaude-opus-4-8를 사용합니다. 두 모델 모두 기본 입력 가격이 동일하므로 캐시 쓰기(1.25배) 및 읽기(0.1배)에서 파생된 유효한 토큰 가격도 동일합니다; 오직 구문만 다릅니다.

GPT 프로토콜은 prompt_cache_key를 최상위 수준에 설정합니다(긴 접두사는 자동으로 캐시되며, 중단점 마커가 필요하지 않음); Claude 프로토콜은 자동 캐싱을 활성화하기 위해 최상위 수준에서 cache_control을 설정하고, 캐시 경계에 대한 정밀한 제어가 필요할 때 콘텐츠 블록 수준의 중단점으로 전환합니다:

GPT-5.6 (Chat Completions)

curl https://aihubmix.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "prompt_cache_key": "my-app-report-v1",
    "messages": [
      {
        "role": "system",
        "content": "[정적 긴 지침, >=1024 토큰]"
      },
      {
        "role": "user",
        "content": "주요 수치를 요약하세요."
      }
    ]
  }'

Claude (Messages)

curl https://aihubmix.com/v1/messages \
  -H "Content-Type: application/json" \
  -H "x-api-key: $AIHUBMIX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -d '{
    "model": "claude-opus-4-8",
    "max_tokens": 1024,
    "cache_control": {"type": "ephemeral"},
    "system": "[정적 긴 지침, >=1024 토큰]",
    "messages": [
      {
        "role": "user",
        "content": "주요 수치를 요약하세요."
      }
    ]
  }'

두 요청을 비교하면 차이는 다음과 같습니다: 엔드포인트 (/v1/chat/completions vs /v1/messages), 인증 헤더 (Authorization: Bearer vs x-api-key + anthropic-version), 캐싱 매개변수(최상위 prompt_cache_key vs 최상위 cache_control), 그리고 Claude는 명시적 max_tokens가 필요합니다. 두 요청은 aihubmix.com에서 확인되었습니다(2026-07-10): gpt-5.6-sol은 두 번째 호출에서 cached_tokens: 2816을 반환했으며; claude-opus-4-8는 첫 번째 호출에서 cache_creation_input_tokens: 3632를 반환하고 두 번째 호출에서 cache_read_input_tokens: 3632를 반환했습니다.

요청 형식 외에도 세 가지 메커니즘 수준의 차이가 남아 있습니다:

  1. 활성화: GPT는 캐싱 매개변수 없이도 자동으로 캐시되며, prompt_cache_key는 히트 신뢰성을 향상시킵니다; Claude는 선언이 필요합니다: 콘텐츠 블록 수준의 cache_control 중단점 또는 최상위 cache_control 자동 모드.
  2. 사용 필드: GPT는 캐시 읽기를 prompt_tokens_details.cached_tokens에서 보고합니다; Claude는 쓰기와 읽기를 각각 cache_creation_input_tokenscache_read_input_tokens로 보고하여 쓰기와 히트를 독립적으로 확인할 수 있습니다.
  3. 수명 제어: GPT-5.6의 ttl는 현재 "30m"만 지원합니다; Claude는 기본적으로 5분(각 히트에서 비용 없이 새로 고침됨)이며, 선택적으로 "ttl": "1h"를 설정할 수 있습니다(쓰기 청구는 2배).

프로토콜 간 모델을 교체할 때 변경해야 할 사항

AIHubMix 게이트웨이는 프로토콜 간 호출을 지원합니다: OpenAI 호환 엔드포인트는 Claude 모델을 호출할 수 있으며(cache_control는 OpenAI 형식의 메시지 콘텐츠 블록으로 직접 들어갑니다; 프롬프트 캐싱 관행 참조), Claude 호환 /v1/messages 엔드포인트는 GPT-5.6을 호출할 수 있습니다(작동 확인됨). 모델을 교체할 때 세 가지 사항을 확인하세요:

  • model을 대상 모델 ID로 변경;
  • 캐싱 매개변수 구문을 전환: prompt_cache_key / 명시적 중단점은 Claude의 cache_control에 해당합니다;
  • 사용 필드 이름을 전환: cached_tokens는 Claude의 cache_read_input_tokens에 해당합니다.

프롬프트 캐싱에 대한 권장 경로: Chat Completions를 통한 GPT 모델(이 게시물에서 확인된 캐시 적중 경로); Claude 모델은 두 프로토콜 모두에서 작동합니다.

비교: GPT-5.6 vs 이전 GPT 캐싱

차원 GPT-5.6 이전 GPT-5.6 및 이후
캐시 쓰기 추가 요금 없음 1.25배 입력 요금
캐시 보존 비활성 상태가 5~10분 지속되면 삭제, 최대 1시간 최소 30분
캐시 제어 없음 명시적 중단점, 명시적 모드, prompt_cache_key 신뢰할 수 있는 매칭
24시간 연장 보존 prompt_cache_retention 일부 모델에서 사용 가능 prompt_cache_options.ttl로 대체됨 (현재 30m만 지원)

변경 사항은 한 방향으로만 향합니다: 이전 세대의 캐싱은 쓰기 요금이 없지만 제어할 수 없고 보존 기간이 불확실했습니다; GPT-5.6은 쓰기에 대해 요금을 부과하면서 보존 기간을 보장하고 정확한 캐시 제어를 제공합니다. 요금에 따르면, 평균적으로 한 번 이상 재사용된 접두사는 추가 쓰기 비용보다 더 많은 절약을 제공합니다; 30분 보존 기간과 제어 가능한 중단점은 그 재사용 비율에 도달하는 것을 보다 예측 가능하게 만듭니다.

AIHubMix 시작하기

세 가지 계층이 모두 활성화되었으며, 모델 ID는 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna입니다. 캐싱은 추가 구성이 필요하지 않으며; 동일한 긴 접두사로 연속 요청을 하면 캐시에 적중합니다:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

long_context = "당신은 분기 재무 보고서를 분석하는 세심한 보조자입니다... [정적 긴 지침, >=1024 토큰]"

for i in range(2):
    completion = client.chat.completions.create(
        model="gpt-5.6-sol",
        prompt_cache_key="my-app-report-assistant-v1",
        messages=[
            {"role": "system", "content": long_context},
            {"role": "user", "content": "주요 수치를 한 문장으로 요약하세요."},
        ],
    )
    print(completion.usage.prompt_tokens_details)

두 번째 호출에서 usage.prompt_tokens_details.cached_tokens 값이 0보다 크면 적중을 나타냅니다(측정된 예: cached_tokens: 2816). 매개변수 세부정보, 청구 세부정보 및 적중 문제 해결에 대한 내용은 GPT 프롬프트 캐싱 문서를 참조하세요.

자주 묻는 질문

어떤 API가 AIHubMix에서 GPT-5.6을 호출할 수 있나요?

Chat Completions (/v1/chat/completions), Responses (/v1/responses), 그리고 Claude 호환 Messages API (/v1/messages)가 모두 모델을 호출할 수 있으며, 세 가지 계층이 모두 활성화되어 있습니다. 프롬프트 캐싱을 위해서는 현재 Chat Completions가 권장 경로입니다.

내 클라이언트가 아무것도 변경하지 않으면 GPT-5.6로 업그레이드한 후 청구에서 어떤 변경이 있나요?

프롬프트 캐싱은 기본적으로 자동으로 적용됩니다: 접두사가 1,024 토큰에 도달하는 요청은 1.25배의 입력 요금으로 청구되는 캐시 쓰기 항목이 발생하며, 재사용된 접두사는 0.1배 읽기 요금으로 청구됩니다. 접두사 재사용이 높은 애플리케이션은 일반적으로 총 비용이 낮아지며; 결코 접두사를 재사용하지 않는 일회성 긴 요청은 명시적 모드로 캐싱을 비활성화할 수 있습니다.

Claude 프롬프트 캐싱을 사용한 적이 있습니다. GPT-5.6로 마이그레이션하려면 무엇을 변경해야 하나요?

프롬프트 구조화 전략은 동일하게 유지됩니다: 정적 콘텐츠 먼저, 변경 콘텐츠 나중. 매개변수는 cache_control에서 prompt_cache_breakpointprompt_cache_key로 변경되며; 보존 기간은 5분/1시간 계층에서 30분 보장으로 변경됩니다.

세 가지 GPT-5.6 계층 중에서 어떻게 선택하나요?

공식적인 위치에 따르면: 복잡한 전문 작업 및 코딩 작업에는 Sol을 선택하고; 일상적인 작업에는 Terra를 선택합니다(GPT-5.5 수준의 성능을 절반 가격에 제공); 비용에 민감한 대량 시나리오에는 Luna를 선택합니다. 세 가지 계층 모두 동일한 컨텍스트 윈도우와 최대 출력을 공유하므로 작업의 복잡성에 따라 라우팅할 수 있습니다.

공식 참조

이 게시물의 모델 사양, 캐싱 메커니즘 및 청구 요금은 다음 공식 출처에서 가져온 것입니다:

이 사이트의 관련 문서: GPT 프롬프트 캐싱 · Claude 프롬프트 캐싱 · 프롬프트 캐싱 관행


모델 갤러리를 방문하여 GPT-5.6 가격을 확인하거나 문서 센터에서 더 많은 통합 옵션을 탐색하세요.


마지막 업데이트: 2026-07-10

More from the blog