OpenAI, 9 Temmuz 2026'da GPT-5.6 ailesini resmi olarak duyurdu. AIHubMix, üç katmanın entegrasyonunu tamamladı: gpt-5.6-sol, gpt-5.6-terra ve gpt-5.6-luna artık Sohbet Tamamlamaları ve Yanıtlar aracılığıyla kullanılabilir. Bu sürüm, istem önbellekleme mekanizmasını ve faturalandırmasını da değiştiriyor: önbellek yazmaları artık ayrı olarak faturalandırılıyor. Bu yazı, üç katmanın konumlandırılmasını kapsar ve önbellekleme değişikliklerini madde madde ele alır.
Üç GPT-5.6 katmanında ne değişiyor
GPT-5.6, adlandırma şemasını gözden geçiriyor: numara model neslini belirtirken, Sol, Terra ve Luna bağımsız olarak evrilebilen yetenek katmanlarıdır. Resmi tanımlara göre, Sol, karmaşık profesyonel işler için amiral gemisi modelidir, Terra, GPT-5.5 ile karşılaştırılabilir performansa sahip daha düşük fiyatlı bir katmandır ve Luna, en hızlı ve en düşük fiyatlı katmandır.
| gpt-5.6-sol | gpt-5.6-terra | gpt-5.6-luna | |
|---|---|---|---|
| Resmi konumlandırma | Karmaşık profesyonel işler için amiral gemisi model | Dengeli zeka ve maliyet | Maliyet duyarlı iş yükleri için |
| Bağlam penceresi | 1,050,000 | 1,050,000 | 1,050,000 |
| Maksimum çıktı | 128,000 | 128,000 | 128,000 |
| Bilgi kesimi | 2026-02-16 | 2026-02-16 | 2026-02-16 |
| Önceki nesildeki kaba eşdeğeri | Suffix olmayan katman | mini katman | nano katman |
Yetenekler açısından resmi konum: Sol, kodlama, bilgi çalışmaları, siber güvenlik ve bilim görevlerinde en son sonuçları elde eder, OpenAI tarafından bugüne kadar en iyi kodlama modeli olarak tanımlanır ve Terminal-Bench 2.1 ve DeepSWE'de yeni rekorlar kırar; Terra, yarı fiyatına GPT-5.5 performansına eşdeğerdir. Aile, maksimum akıl yürütme seviyesini ekler ve Yanıtlar API'si Programatik Araç Çağırma ve çoklu ajan (Beta) yeteneklerini kazanır.
Önbellek mekanizması güncellemesi, açıklandı
GPT-5.6'dan önce, GPT modellerinde istem önbellekleme tamamen otomatikti: 1,024 token veya daha fazla olan ön ekler otomatik olarak önbelleğe alınıyordu, geliştiricilerin neyin önbelleğe alınacağı veya ne kadar süreyle kontrolü yoktu ve önbellekler 5-10 dakikalık bir etkinliksizlikten sonra temizleniyordu. OpenAI, GPT-5.6 değişikliklerini "daha öngörülebilir istem önbellekleme" olarak özetliyor ve üç somut noktayı vurguluyor:
- Saklama süresi "en az 30 dakika"ya yükseliyor.
prompt_cache_options.ttlşu anda yalnızca"30m"destekliyor; bu, garantili bir minimumdur ve gerçek saklama süresi daha uzun olabilir. - Açık önbellek kesme noktaları yeni. Bir içerik bloğunda
prompt_cache_breakpointayarlamak, önbellek sınırını kararlı içeriğin sonunda sabitler, böylece kesme noktasından sonraki değişiklikler önceden önbelleğe alınmış ön eki geçersiz kılmaz;prompt_cache_options.mode"explicit"olarak ayarlandığında, yalnızca manuel kesme noktaları kullanılır. prompt_cache_keybir optimizasyondan resmi bir gereksinime geçiyor. GPT-5.6 ile birlikte, parametre daha güvenilir önbellek eşleşmesi sağlamak için ayarlanmalıdır; OpenAI, anahtar başına trafiği yaklaşık 15 istekle sınırlamayı önerir.
1.25x önbellek yazma faturalandırmasını nasıl değerlendirebilirim
GPT-5.6 ile birlikte, önbellek yazmaları temel giriş oranının 1.25 katı oranında faturalandırılır ve önbellek okumaları 0.1 katıdır; önceki modellerde, önbellek yazmalarının ek bir ücreti yoktur. Resmi ifade (bir GPT-5.6 duyurusu): "GPT-5.6 ve sonraki modeller için, önbellek yazmaları modelin önbelleğe alınmamış giriş oranının 1.25 katı olarak faturalandırılırken, önbellek okumaları %90 önbelleğe alınmış giriş indirimini almaya devam eder."
Başabaş hesaplama, resmi oranlardan doğrudan çıkar: bir ön ek yazmak, önbelleğe almamakla kıyaslandığında giriş oranının 0.25 katı daha fazla maliyetlidir ve her sonraki hit 0.9 kat giriş oranı tasarrufu sağlar: bir ön ek bir kez bile yeniden kullanıldığında net bir tasarruf sağlar ve yeniden kullanım arttıkça tasarruf da artar.
- Açıkça fayda sağlayan iş yükleri: uzun sistem istemleri ile ajan iş akışları, sürekli uzun referans materyali içeren RAG, büyük araç tanımları taşıyan uygulamalar ve yalnızca mesaj ekleyen çoklu tur konuşmalar. Bu iş yükleri yüksek ön ek yeniden kullanımı olduğundan, 0.1 kat okuma oranı baskın olur.
- Dikkat edilmesi gereken iş yükleri: ön eki asla yeniden kullanılmayan tek seferlik uzun istekler. Otomatik önbellekleme varsayılan olarak açıktır, bu nedenle bu istekler geri alınamaz 1.25 kat yazma ücreti alır;
prompt_cache_options.mode"explicit"olarak ayarlanıp herhangi bir kesme noktası ayarlanmadığında, istek tamamen önbelleği atlar ve yazma ücreti almaz.
Karşılaştırma: GPT-5.6 ve Claude'da istem önbellekleme
GPT-5.6'nın önbellek tasarımı, birkaç boyutta Claude'un cache_control ile örtüşmektedir, temel fark varsayılan davranıştır: GPT, herhangi bir parametre gerektirmeden otomatik olarak önbelleğe alır, oysa Claude, istekte önbelleğin etkinleştirilmesini gerektirir, ya üst düzey cache_control alanı (otomatik kesme noktası) ya da içerik bloğu düzeyinde açık kesme noktaları.
| Boyut | GPT-5.6 ailesi | Claude ailesi (tüm aktif modeller) |
|---|---|---|
| Etkinleştirme | Otomatik önbellekleme, açık kesme noktaları isteğe bağlı | Etkinleştirilmesi gerekir: üst düzey cache_control otomatik kesme noktası veya içerik bloğu düzeyinde açık kesme noktaları |
| Kesme noktası parametresi | prompt_cache_breakpoint (içerik bloğu düzeyi) |
cache_control (üst düzey veya içerik bloğu düzeyi) |
| Kesme noktası limiti | Her istekte en fazla 4 yeni önbellek yazması | En fazla 4 kesme noktası |
| Önbellek saklama süresi | En az 30 dakika | Varsayılan olarak 5 dakika (her hitte ücretsiz olarak yenilenir), isteğe bağlı 1 saat |
| Önbellek yazma faturalandırması | 1.25 kat giriş oranı | 5 dakikalık katman için 1.25 kat, 1 saatlik katman için 2 kat |
| Önbellek okuma faturalandırması | 0.1 kat giriş oranı | 0.1 kat giriş oranı |
| Minimum önbelleğe alınabilir uzunluk | 1,024 token | Modeline bağlı olarak 512–4,096 token |
| Hit gereksinimi | Kesme noktasından önce byte-for-byte aynı | Kesme noktasından önce byte-for-byte aynı |
Claude sütunu, tüm aktif Claude modelleri tarafından paylaşılan kuralları yansıtır: 5 dakikalık katman için 1.25 kat yazma, 1 saatlik katman için 2 kat ve 0.1 kat okuma oranları tüm seride eşit olarak uygulanır (Anthropic önbellek belgelendirmesi), model bazında farklılıklar yalnızca minimum önbelleğe alınabilir uzunluk ile sınırlıdır; GPT-5.6 sütunu OpenAI önbellek rehberinden gelmektedir.
Kesme noktası limitleri, yazma oranları (karşılık gelen katmanlar için) ve okuma oranları iki sağlayıcı arasında tam olarak eşleşmektedir; pratikte, aynı "statik içerik önce, değişen içerik sonra" istem yapılandırma stratejisi her iki sağlayıcıda da geçerlidir. Geçiş maliyeti, parametre sözdiziminde yoğunlaşmıştır: GPT prompt_cache_breakpoint + prompt_cache_key kullanırken, Claude cache_control kullanmaktadır.
Her iki protokolde de aynı önbellekleme modeli
gpt-5.6-sol ve claude-opus-4-8 kullanmaktadır. Her ikisi de aynı temel giriş fiyatına ($5/M) sahip olduğundan, önbellek yazmalarından (1.25 kat) ve okumalarından (0.1 kat) türetilen etkili token başına fiyatlar da aynıdır; yalnızca sözdizimi farklıdır.
GPT protokolü, prompt_cache_key değerini üst düzeyde ayarlarken (uzun ön ekler otomatik olarak önbelleğe alınır, kesme noktası işaretine gerek yoktur); Claude protokolü, otomatik önbellekleme etkinleştirmek için cache_control değerini üst düzeyde ayarlamakta ve önbellek sınırı üzerinde hassas kontrol gerektiğinde içerik bloğu düzeyinde kesme noktalarına geçmektedir:
GPT-5.6 (Sohbet Tamamlamaları)
curl https://aihubmix.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"prompt_cache_key": "my-app-report-v1",
"messages": [
{
"role": "system",
"content": "[Statik uzun talimatlar, >=1024 token]"
},
{
"role": "user",
"content": "Anahtar rakamları özetleyin."
}
]
}'
Claude (Mesajlar)
curl https://aihubmix.com/v1/messages \
-H "Content-Type: application/json" \
-H "x-api-key: $AIHUBMIX_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-d '{
"model": "claude-opus-4-8",
"max_tokens": 1024,
"cache_control": {"type": "ephemeral"},
"system": "[Statik uzun talimatlar, >=1024 token]",
"messages": [
{
"role": "user",
"content": "Anahtar rakamları özetleyin."
}
]
}'
İki isteği karşılaştırdığımızda, farklılıklar şunlardır: uç nokta (/v1/chat/completions vs /v1/messages), kimlik doğrulama başlıkları (Authorization: Bearer vs x-api-key + anthropic-version), önbellek parametresi (üst düzey prompt_cache_key vs üst düzey cache_control) ve Claude'un açık bir max_tokens gerektirmesi. Her iki istek de aihubmix.com üzerinde doğrulandı (2026-07-10): gpt-5.6-sol ikinci çağrıda cached_tokens: 2816 döndürdü; claude-opus-4-8 ilk çağrıda cache_creation_input_tokens: 3632 ve ikinci çağrıda cache_read_input_tokens: 3632 döndürdü.
İstek formatının ötesinde, üç mekanizma düzeyinde farklılık kalmaktadır:
- Etkinleştirme: GPT, herhangi bir önbellek parametresi olmadan otomatik olarak önbelleğe alır,
prompt_cache_keyhit güvenilirliğini artırır; Claude bir beyan gerektirir: içerik bloğu düzeyinde bircache_controlkesme noktası veya üst düzeycache_controlotomatik modu. - Kullanım alanları: GPT, önbellek okumalarını
prompt_tokens_details.cached_tokensiçinde raporlar; Claude, yazmaları ve okumaları ayrı olarakcache_creation_input_tokensvecache_read_input_tokensolarak raporlar, böylece yazmaları ve hitleri bağımsız olarak doğrulamak kolaydır. - Ömür kontrolü: GPT-5.6'nın
ttlşu anda yalnızca"30m"desteklemektedir; Claude varsayılan olarak 5 dakikadır (her hitte ücretsiz olarak yenilenir), isteğe bağlı"ttl": "1h"(yazmalar 2 kat faturalandırılır).
Protokoller arasında modelleri değiştirirken neyi değiştirmeliyim
AIHubMix geçidi, protokoller arası çağrıları destekler: OpenAI uyumlu uç nokta, Claude modellerini çağırabilir (cache_control doğrudan OpenAI formatındaki mesaj içerik bloklarına gider; bkz. İstem Önbellekleme uygulamaları), ve Claude uyumlu /v1/messages uç noktası GPT-5.6'yı çağırabilir (doğrulandı). Modelleri değiştirirken üç şeyi kontrol edin:
modeldeğerini hedef model kimliğine değiştirin;- Önbellek parametresi sözdizimini değiştirin:
prompt_cache_key/ açık kesme noktaları, Claude'uncache_controldeğerine karşılık gelir; - Kullanım alanı adlarını değiştirin:
cached_tokensClaude'uncache_read_input_tokensdeğerine karşılık gelir.
İstem önbellekleme için önerilen yollar: GPT modelleri Sohbet Tamamlamaları aracılığıyla (bu yazıda doğrulanan önbellek-hiti yolu); Claude modelleri her iki protokol aracılığıyla çalışır.
Karşılaştırma: GPT-5.6 ve önceki GPT önbelleklemesi
| Boyut | GPT-5.6'dan Önce | GPT-5.6 ve sonrası |
|---|---|---|
| Önbellek yazmaları | Ek ücret yok | 1.25 kat giriş oranı |
| Önbellek saklama süresi | 5-10 dakikalık etkinliksizlikten sonra temizlenir, 1 saate kadar | En az 30 dakika |
| Önbellek kontrolü | Yok | Açık kesme noktaları, açık mod, prompt_cache_key güvenilir eşleşme |
| 24 saatlik uzatılmış saklama | prompt_cache_retention bazı modellerde |
prompt_cache_options.ttl ile değiştirildi (şu anda yalnızca 30m) |
Değişiklikler tek bir yönde ilerliyor: önceki nesil önbellekleme yazma ücretlerinden muafken kontrol edilemezdi ve saklama süresi belirsizdi; GPT-5.6 yazmalar için ücret alırken, garantili bir saklama tabanı ve hassas önbellek kontrolleri sunmaktadır. Oranlara göre, ortalama olarak birden fazla kez yeniden kullanılan bir ön ek, ek yazma maliyetinden daha fazla tasarruf sağlar; 30 dakikalık saklama tabanı ve kontrol edilebilir kesme noktaları, bu yeniden kullanım oranına ulaşmayı daha öngörülebilir hale getirir.
AIHubMix'te Başlamak
Üç katman da yayında, model kimlikleri gpt-5.6-sol, gpt-5.6-terra ve gpt-5.6-luna. Önbellekleme ek yapılandırma gerektirmez; aynı uzun ön ek ile ardışık istekler önbelleği etkiler:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
long_context = "Çeyrek dönem finansal raporlarını analiz etmek için titiz bir asistanısınız... [Statik uzun talimatlar, >=1024 token]"
for i in range(2):
completion = client.chat.completions.create(
model="gpt-5.6-sol",
prompt_cache_key="my-app-report-assistant-v1",
messages=[
{"role": "system", "content": long_context},
{"role": "user", "content": "Anahtar rakamları bir cümlede özetleyin."},
],
)
print(completion.usage.prompt_tokens_details)
İkinci çağrıda usage.prompt_tokens_details.cached_tokens değeri 0'dan büyükse, bu bir hit olduğunu gösterir (ölçülen örnek: cached_tokens: 2816). Parametre detayları, faturalandırma ayrıntıları ve hit sorun giderme için GPT İstem Önbellekleme belgelendirmesine bakın.
SSS
AIHubMix'te hangi API'ler GPT-5.6'yı çağırabilir?
Sohbet Tamamlamaları (/v1/chat/completions), Yanıtlar (/v1/responses) ve Claude uyumlu Mesajlar API'si (/v1/messages) tüm modelleri çağırabilir ve üç katman da yayındadır. İstem önbellekleme için şu anda önerilen yol Sohbet Tamamlamalarıdır.
Eğer istemcim hiçbir şeyi değiştirmezse, GPT-5.6'ya yükseltildikten sonra faturalandırmada ne değişir?
İstem önbelleklemesi varsayılan olarak otomatik olarak uygulanır: ön eki 1,024 token'a ulaşan istekler, 1.25 kat giriş oranında faturalandırılan bir önbellek yazma öğesi alır ve yeniden kullanılan ön ekler 0.1 kat okuma oranında faturalandırılır. Yüksek ön ek yeniden kullanımı olan uygulamalar genellikle daha düşük toplam maliyetler görür; asla bir ön eki yeniden kullanmayan tek seferlik uzun istekler, açık mod ile önbellekleme devre dışı bırakılabilir.
Claude istem önbelleklemesini kullandım. GPT-5.6'ya geçmek için neyi değiştirmeliyim?
İstem yapılandırma stratejisi aynı kalır: statik içerik önce, değişen içerik sonra. Parametreler cache_control değerinden prompt_cache_breakpoint ve prompt_cache_key değerine değişir; saklama süresi 5 dakikalık/1 saatlik katmanlardan 30 dakikalık garantili bir tabana değişir.
Üç GPT-5.6 katmanı arasında nasıl seçim yaparım?
Resmi konumlandırmaya göre: karmaşık profesyonel işler ve kodlama görevleri için Sol'u seçin; günlük iş yükleri için Terra'yı seçin (GPT-5.5 seviyesinde performans, yarı fiyatına); maliyet duyarlı, yüksek hacimli senaryolar için Luna'yı seçin. Üç katman da aynı bağlam penceresine ve maksimum çıktıya sahiptir, bu nedenle görev karmaşıklığına göre yönlendirme yapabilirsiniz.
Resmi referanslar
Bu yazıdaki model spesifikasyonları, önbellek mekanizmaları ve faturalandırma oranları şu resmi kaynaklardan gelmektedir:
- GPT-5.6 duyurusu (OpenAI, 2026-07-09)
- OpenAI önbellek rehberi
- OpenAI Fiyatlandırması
- Anthropic önbellek belgelendirmesi
Bu sitedeki ilgili belgelendirme: GPT İstem Önbellekleme · Claude İstem Önbellekleme · İstem Önbellekleme uygulamaları
GPT-5.6 fiyatlandırması için model galerisine göz atın veya belgelendirme merkezinde daha fazla entegrasyon seçeneğini keşfedin.
Son güncelleme: 2026-07-10