OpenAI는 2026년 7월 9일에 GPT-5.6 패밀리를 공식 출시했습니다. AIHubMix는 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna의 세 가지 계층을 모두 통합했습니다. 이제 Chat Completions 및 Responses를 통해 사용할 수 있습니다. 이번 출시에서는 프롬프트 캐싱 메커니즘과 청구 방식이 변경되었습니다: 캐시 쓰기는 이제 별도로 청구됩니다. 이 게시물에서는 세 가지 계층의 위치를 설명하고 캐싱 변경 사항을 하나씩 살펴봅니다.
세 가지 GPT-5.6 계층의 변경 사항
GPT-5.6은 명명 규칙을 수정했습니다: 숫자는 모델 세대를 나타내며, Sol, Terra, Luna는 독립적으로 발전할 수 있는 기능 계층입니다. 공식 정의에 따르면, Sol은 플래그십 모델, Terra는 GPT-5.5와 유사한 성능을 가진 저가형 계층, Luna는 가장 빠르고 저렴한 계층입니다.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| 공식 위치 | 복잡한 전문 작업을 위한 플래그십 모델 | 균형 잡힌 지능과 비용 | 비용에 민감한 작업을 위한 모델 |
| 컨텍스트 윈도우 | 1,050,000 | 1,050,000 | 1,050,000 |
| 최대 출력 | 128,000 | 128,000 | 128,000 |
| 지식 컷오프 | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| 이전 세대의 대략적인 동급 모델 | 접미사가 없는 계층 | 미니 계층 | 나노 계층 |
기능 측면에서 공식적인 입장은 다음과 같습니다: Sol은 코딩, 지식 작업, 사이버 보안 및 과학 작업에서 최첨단 결과를 달성하며, OpenAI는 이를 지금까지의 최고의 코딩 모델로 설명하고 Terminal-Bench 2.1 및 DeepSWE에서 새로운 기록을 세웠습니다; Terra는 GPT-5.5 성능을 절반 가격에 제공합니다. 이 패밀리는 최대 추론 수준을 추가하며, Responses API는 프로그래밍 도구 호출 및 다중 에이전트(베타) 기능을 갖추고 있습니다.
캐싱 메커니즘 업그레이드 설명
GPT-5.6 이전에는 GPT 모델의 프롬프트 캐싱이 완전히 자동이었습니다: 1,024 토큰 이상의 접두사는 자동으로 캐시되었으며, 개발자는 캐시되는 내용이나 기간을 제어할 수 없었고, 비활성 상태가 5~10분 지속되면 캐시는 삭제되었습니다. OpenAI는 GPT-5.6의 변경 사항을 "보다 예측 가능한 프롬프트 캐싱"으로 요약하며, 세 가지 구체적인 사항이 있습니다:
- 보존 기간이 "최소 30분"으로 변경되었습니다.
prompt_cache_options.ttl는 현재"30m"만 지원하며, 이는 보장된 최소값이며 실제 보존 기간은 더 길 수 있습니다. - 명시적 캐시 중단점이 새로 추가되었습니다. 콘텐츠 블록에
prompt_cache_breakpoint를 설정하면 안정적인 콘텐츠 끝에서 캐시 경계를 고정하므로 중단점 이후의 변경 사항은 이전의 캐시된 접두사를 무효화하지 않습니다;prompt_cache_options.mode를"explicit"로 설정하면 수동 중단점만 사용됩니다. prompt_cache_key는 최적화에서 공식 요구 사항으로 변경되었습니다. GPT-5.6부터는 이 매개변수를 설정하여 보다 신뢰할 수 있는 캐시 매칭을 가능하게 해야 하며, OpenAI는 키당 트래픽을 대략 분당 15회 요청으로 유지할 것을 권장합니다.
1.25배 캐시 쓰기 청구 평가 방법
GPT-5.6부터 캐시 쓰기는 기본 입력 요금의 1.25배로 청구되며, 캐시 읽기는 0.1배로 청구됩니다; 이전 모델에서는 캐시 쓰기에 추가 요금이 없습니다. 공식 문구(출처: GPT-5.6 발표): "GPT-5.6 및 이후 모델의 경우, 캐시 쓰기는 모델의 비캐시 입력 요금의 1.25배로 청구되며, 캐시 읽기는 계속해서 90% 캐시 입력 할인 혜택을 받습니다."
손익 분기점 수치는 공식 요금에서 직접 파생됩니다: 접두사를 작성하는 데 드는 비용은 비캐시 상태보다 0.25배 더 비싸며, 이후의 각 히트는 0.9배의 입력 요금을 절약합니다: 한 번이라도 재사용된 접두사는 순 절약을 발생시킵니다, 재사용이 많을수록 절약이 커집니다.
- 명확한 이점을 가진 작업 부하: 긴 시스템 프롬프트가 있는 에이전트 워크플로우, 긴 참조 자료를 반복적으로 포함하는 RAG, 대규모 도구 정의를 포함하는 애플리케이션, 메시지만 추가하는 다중 턴 대화. 이러한 작업 부하는 높은 접두사 재사용을 가지므로 0.1배 읽기 요금이 우세합니다.
- 주의해야 할 작업 부하: 접두사가 결코 재사용되지 않는 일회성 긴 요청. 자동 캐싱은 기본적으로 활성화되어 있으므로 이러한 요청은 회복할 수 없는 1.25배 쓰기 요금이 발생합니다;
prompt_cache_options.mode를"explicit"로 설정하고 중단점을 설정하지 않으면 요청이 캐시를 완전히 건너뛰고 쓰기 요금이 발생하지 않습니다.
비교: GPT-5.6과 Claude의 프롬프트 캐싱
GPT-5.6의 캐싱 설계는 여러 측면에서 Claude의 cache_control와 수렴하며, 핵심 차이는 기본 동작입니다: GPT는 매개변수 없이 자동으로 캐시되며, Claude는 요청에서 캐싱을 활성화해야 하며, 최상위 cache_control 필드(자동 중단점) 또는 콘텐츠 블록 수준의 명시적 중단점이 필요합니다.
| 차원 | GPT-5.6 패밀리 | Claude 패밀리 (모든 활성 모델) |
|---|---|---|
| 활성화 | 자동 캐싱, 명시적 중단점 선택 사항 | 활성화해야 함: 최상위 cache_control 자동 중단점 또는 콘텐츠 블록 수준의 명시적 중단점 |
| 중단점 매개변수 | prompt_cache_breakpoint (콘텐츠 블록 수준) |
cache_control (최상위 또는 콘텐츠 블록 수준) |
| 중단점 제한 | 요청당 최대 4개의 새로운 캐시 쓰기 | 최대 4개의 중단점 |
| 캐시 보존 | 최소 30분 | 기본적으로 5분 (각 히트에서 비용 없이 새로 고침됨), 선택적으로 1시간 |
| 캐시 쓰기 청구 | 1.25배 입력 요금 | 5분 계층에 대해 1.25배, 1시간 계층에 대해 2배 |
| 캐시 읽기 청구 | 0.1배 입력 요금 | 0.1배 입력 요금 |
| 최소 캐시 가능 길이 | 1,024 토큰 | 모델에 따라 512–4,096 토큰 |
| 히트 요구 사항 | 중단점 이전에 바이트 단위로 동일해야 함 | 중단점 이전에 바이트 단위로 동일해야 함 |
Claude 열은 모든 활성 Claude 모델이 공유하는 규칙을 반영합니다: 5분 계층에 대해 1.25배 쓰기, 1시간 계층에 대해 2배, 0.1배 읽기가 전체 라인업에 균일하게 적용됩니다 (Anthropic 프롬프트 캐싱 문서), 모델별 차이는 최소 캐시 가능 길이에 국한됩니다; GPT-5.6 열은 OpenAI 프롬프트 캐싱 가이드에서 가져온 것입니다.
중단점 제한, 쓰기 요금(해당 계층에 대해) 및 읽기 요금은 두 제공업체 간에 정확히 일치합니다; 실질적으로 동일한 "정적 콘텐츠 먼저, 변경 콘텐츠 나중" 프롬프트 구조화 전략이 두 모델 간에 적용됩니다. 마이그레이션 비용은 매개변수 구문에 집중됩니다: GPT는 prompt_cache_breakpoint + prompt_cache_key를 사용하고, Claude는 cache_control를 사용합니다.
두 프로토콜 모두 동일한 캐싱 패턴
같은 "정적 긴 지침을 캐시" 시나리오에 대해 두 프로토콜의 최소 구현이 따릅니다. 예제에서는 gpt-5.6-sol과 claude-opus-4-8를 사용합니다. 두 모델 모두 기본 입력 가격이 동일하므로 캐시 쓰기(1.25배) 및 읽기(0.1배)에서 파생된 유효한 토큰 가격도 동일합니다; 오직 구문만 다릅니다.
GPT 프로토콜은 prompt_cache_key를 최상위 수준에 설정합니다(긴 접두사는 자동으로 캐시되며, 중단점 마커가 필요하지 않음); Claude 프로토콜은 자동 캐싱을 활성화하기 위해 최상위 수준에서 cache_control을 설정하고, 캐시 경계에 대한 정밀한 제어가 필요할 때 콘텐츠 블록 수준의 중단점으로 전환합니다:
GPT-5.6 (Chat Completions)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[정적 긴 지침, >=1024 토큰]"
},
{
"role": "user",
"content": "주요 수치를 요약하세요."
}
]
}'
Claude (Messages)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[정적 긴 지침, >=1024 토큰]",
"messages": [
{
"role": "user",
"content": "주요 수치를 요약하세요."
}
]
}'
두 요청을 비교하면 차이는 다음과 같습니다: 엔드포인트 (/v1/chat/completions vs /v1/messages), 인증 헤더 (Authorization: Bearer vs x-api-key + anthropic-version), 캐싱 매개변수(최상위 prompt_cache_key vs 최상위 cache_control), 그리고 Claude는 명시적 max_tokens가 필요합니다. 두 요청은 aihubmix.com에서 확인되었습니다(2026-07-10): gpt-5.6-sol은 두 번째 호출에서 cached_tokens: 2816을 반환했으며; claude-opus-4-8는 첫 번째 호출에서 cache_creation_input_tokens: 3632를 반환하고 두 번째 호출에서 cache_read_input_tokens: 3632를 반환했습니다.
요청 형식 외에도 세 가지 메커니즘 수준의 차이가 남아 있습니다:
- 활성화: GPT는 캐싱 매개변수 없이도 자동으로 캐시되며,
prompt_cache_key는 히트 신뢰성을 향상시킵니다; Claude는 선언이 필요합니다: 콘텐츠 블록 수준의cache_control중단점 또는 최상위cache_control자동 모드. - 사용 필드: GPT는 캐시 읽기를
prompt_tokens_details.cached_tokens에서 보고합니다; Claude는 쓰기와 읽기를 각각cache_creation_input_tokens와cache_read_input_tokens로 보고하여 쓰기와 히트를 독립적으로 확인할 수 있습니다. - 수명 제어: GPT-5.6의
ttl는 현재"30m"만 지원합니다; Claude는 기본적으로 5분(각 히트에서 비용 없이 새로 고침됨)이며, 선택적으로"ttl": "1h"를 설정할 수 있습니다(쓰기 청구는 2배).
프로토콜 간 모델을 교체할 때 변경해야 할 사항
AIHubMix 게이트웨이는 프로토콜 간 호출을 지원합니다: OpenAI 호환 엔드포인트는 Claude 모델을 호출할 수 있으며(cache_control는 OpenAI 형식의 메시지 콘텐츠 블록으로 직접 들어갑니다; 프롬프트 캐싱 관행 참조), Claude 호환 /v1/messages 엔드포인트는 GPT-5.6을 호출할 수 있습니다(작동 확인됨). 모델을 교체할 때 세 가지 사항을 확인하세요:
model을 대상 모델 ID로 변경;- 캐싱 매개변수 구문을 전환:
prompt_cache_key/ 명시적 중단점은 Claude의cache_control에 해당합니다; - 사용 필드 이름을 전환:
cached_tokens는 Claude의cache_read_input_tokens에 해당합니다.
프롬프트 캐싱에 대한 권장 경로: Chat Completions를 통한 GPT 모델(이 게시물에서 확인된 캐시 적중 경로); Claude 모델은 두 프로토콜 모두에서 작동합니다.
비교: GPT-5.6 vs 이전 GPT 캐싱
| 차원 | GPT-5.6 이전 | GPT-5.6 및 이후 |
|---|---|---|
| 캐시 쓰기 | 추가 요금 없음 | 1.25배 입력 요금 |
| 캐시 보존 | 비활성 상태가 5~10분 지속되면 삭제, 최대 1시간 | 최소 30분 |
| 캐시 제어 | 없음 | 명시적 중단점, 명시적 모드, prompt_cache_key 신뢰할 수 있는 매칭 |
| 24시간 연장 보존 | prompt_cache_retention 일부 모델에서 사용 가능 |
prompt_cache_options.ttl로 대체됨 (현재 30m만 지원) |
변경 사항은 한 방향으로만 향합니다: 이전 세대의 캐싱은 쓰기 요금이 없지만 제어할 수 없고 보존 기간이 불확실했습니다; GPT-5.6은 쓰기에 대해 요금을 부과하면서 보존 기간을 보장하고 정확한 캐시 제어를 제공합니다. 요금에 따르면, 평균적으로 한 번 이상 재사용된 접두사는 추가 쓰기 비용보다 더 많은 절약을 제공합니다; 30분 보존 기간과 제어 가능한 중단점은 그 재사용 비율에 도달하는 것을 보다 예측 가능하게 만듭니다.
AIHubMix 시작하기
세 가지 계층이 모두 활성화되었으며, 모델 ID는 gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna입니다. 캐싱은 추가 구성이 필요하지 않으며; 동일한 긴 접두사로 연속 요청을 하면 캐시에 적중합니다:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "당신은 분기 재무 보고서를 분석하는 세심한 보조자입니다... [정적 긴 지침, >=1024 토큰]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "주요 수치를 한 문장으로 요약하세요."},
],
)
print(completion.usage.prompt_tokens_details)
두 번째 호출에서 usage.prompt_tokens_details.cached_tokens 값이 0보다 크면 적중을 나타냅니다(측정된 예: cached_tokens: 2816). 매개변수 세부정보, 청구 세부정보 및 적중 문제 해결에 대한 내용은 GPT 프롬프트 캐싱 문서를 참조하세요.
자주 묻는 질문
어떤 API가 AIHubMix에서 GPT-5.6을 호출할 수 있나요?
Chat Completions (/v1/chat/completions), Responses (/v1/responses), 그리고 Claude 호환 Messages API (/v1/messages)가 모두 모델을 호출할 수 있으며, 세 가지 계층이 모두 활성화되어 있습니다. 프롬프트 캐싱을 위해서는 현재 Chat Completions가 권장 경로입니다.
내 클라이언트가 아무것도 변경하지 않으면 GPT-5.6로 업그레이드한 후 청구에서 어떤 변경이 있나요?
프롬프트 캐싱은 기본적으로 자동으로 적용됩니다: 접두사가 1,024 토큰에 도달하는 요청은 1.25배의 입력 요금으로 청구되는 캐시 쓰기 항목이 발생하며, 재사용된 접두사는 0.1배 읽기 요금으로 청구됩니다. 접두사 재사용이 높은 애플리케이션은 일반적으로 총 비용이 낮아지며; 결코 접두사를 재사용하지 않는 일회성 긴 요청은 명시적 모드로 캐싱을 비활성화할 수 있습니다.
Claude 프롬프트 캐싱을 사용한 적이 있습니다. GPT-5.6로 마이그레이션하려면 무엇을 변경해야 하나요?
프롬프트 구조화 전략은 동일하게 유지됩니다: 정적 콘텐츠 먼저, 변경 콘텐츠 나중. 매개변수는 cache_control에서 prompt_cache_breakpoint 및 prompt_cache_key로 변경되며; 보존 기간은 5분/1시간 계층에서 30분 보장으로 변경됩니다.
세 가지 GPT-5.6 계층 중에서 어떻게 선택하나요?
공식적인 위치에 따르면: 복잡한 전문 작업 및 코딩 작업에는 Sol을 선택하고; 일상적인 작업에는 Terra를 선택합니다(GPT-5.5 수준의 성능을 절반 가격에 제공); 비용에 민감한 대량 시나리오에는 Luna를 선택합니다. 세 가지 계층 모두 동일한 컨텍스트 윈도우와 최대 출력을 공유하므로 작업의 복잡성에 따라 라우팅할 수 있습니다.
공식 참조
이 게시물의 모델 사양, 캐싱 메커니즘 및 청구 요금은 다음 공식 출처에서 가져온 것입니다:
- GPT-5.6 발표 (OpenAI, 2026-07-09)
- OpenAI 프롬프트 캐싱 가이드
- OpenAI 가격 책정
- Anthropic 프롬프트 캐싱 문서
이 사이트의 관련 문서: GPT 프롬프트 캐싱 · Claude 프롬프트 캐싱 · 프롬프트 캐싱 관행
모델 갤러리를 방문하여 GPT-5.6 가격을 확인하거나 문서 센터에서 더 많은 통합 옵션을 탐색하세요.
마지막 업데이트: 2026-07-10