Başlık: GLM-5.3 Uygulamalı Kılavuzu: Her Zaman Açık Düşünme, Üç Çaba Seviyesi & API Destek Matrisi
Açıklama: Ağustos 2026 GLM-5.3 kılavuzu: her zaman açık düşünme, üç akıl yürütme çaba seviyesi, akıl yürütme özetleri, paralel araç çağrıları, yapılandırılmış çıktı ve otomatik önbellekleme — doğrulanmış AIHubMix Sohbet / Yanıtlar / Mesajlar örnekleri ile.
Bu makale GLM-5.3 için anahtar API değişikliklerini ve kullanım notlarını kapsar. GLM-5.3, 2026-08-14 tarihinde piyasaya sürülen Z.ai'nın amiral gemisi modelidir — GLM-5.2 ile aynı temel modeli kullanır, tüm kazançlar eğitim sonrası gelmektedir. AIHubMix'te model kimliğicoding-glm-5.3(şu anda sınırlı süreli önizleme rotası), Sohbet Tamamlamaları, Yanıtlar ve Claude uyumlu Mesajlar API'leri aracılığıyla mevcuttur. Ayrıca bakınız: resmi Z.ai sürüm blogu.
Her bölümdeki "Doğrulanmış" sonuçlar ve örnek yanıtlar, 2026-08-14 tarihinde AIHubMix API'leri (Sohbet Tamamlamaları / Yanıtlar / Mesajlar) üzerinden yapılan gerçek çağrılardan gelmektedir.
1. Model Özellikleri Kısaca
| Öğe | Değer |
|---|---|
| Bağlam penceresi | 1M token (resmi tam değer: 1,048,576) |
| Maksimum çıktı | 128K (max_tokens doğrulanmış tavan: 131,072 — aşılması durumunda 400 döner) |
| Girdi modları | Metin |
| Düşünme | Her zaman açık, kapatılamaz; reasoning_effort üç seviyeye sahiptir — low / high / max, varsayılan max |
| GLM-5.2 ile ilişkisi | Aynı temel model, eğitim sonrası yükseltilmiştir: çok daha güçlü kodlama ve uzun vadeli görev performansı, ayrıca ortaya çıkan siber yetenekler |
| AIHubMix model kimliği | coding-glm-5.3 (sınırlı süreli önizleme rotası; resmi ticari API piyasaya sürüldüğünde takip edeceğiz) |
Doğrulanmış: max_tokens: 999999 400 döner ve geçerli aralık hata metninde belirtilmiştir — tavan gerçekten doğrulanmıştır, sessizce kesilmemiştir.# max_tokens=999999 -> HTTP 400
"max_tokens parametresi geçersiz: değer [1,131072] aralığında olmalıdır"
2. GLM-5.3 vs GLM-5.2: Her Zaman Açık Düşünme, reasoning_effort ile Yoğunluk
| Öğe | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Temel model | — | 5.2 ile aynı (tüm kazançlar eğitim sonrası) |
thinking.type |
enabled / disabled — kapatılabilir |
enabled yalnızca — kapatılamaz |
reasoning_effort |
7 değer uyumluluk eşlemesi (etkili seviyeler: max/high) | Üç seviye low / high / max, varsayılan max |
| Konumlandırma | Genel amaçlı amiral gemisi | Kodlama ve uzun vadeli ajans görevleri için güçlendirilmiş, ortaya çıkan siber yeteneklerle |
GLM-5.3'te GLM-5.2'ye göre iki en önemli API değişikliği şunlardır:
thinking.typeartıkdisableddesteklemiyor — düşünme kapatılamaz. Resmi geçiş tavsiyesi: daha önce{"type": "disabled"}gönderen uygulamalar{"type": "enabled"}olarak değiştirmeli vereasoning_effortdeğerini"low"olarak ayarlamalıdır.reasoning_effortüç seviyeye daralıyor:low(hafif) /high(gelişmiş) /max(derin, varsayılan). GLM-5.2 dönemine ait 7 değer uyumluluk eşlemesi artık geçerli değildir; Z.ai, kodlama görevleri içinmax'ı önermektedir.
Doğrulanmış:thinking: {"type": "disabled"}göndermek AIHubMix üzerinden 200 döner ve düşünme hala gerçekleşir (reasoning_contenther zamanki gibi döner) — değer resmi kanal anlamına göre otomatik olarak dönüştürülür, reddedilmez. Eğer istemciniz "düşünmeyi kapatmak için token tasarrufu yap" üzerine kuruluysa,reasoning_effort: "low"kullanın.
Doğrulanmış:reasoning_effortiçin enum dışı değerler de hata olmadan 200 döner (resmi belgelerde belirtilen varsayılanmaxdeğerine geri döner);lowilemaxaynı aritmetik soruda beklenen daha hafif düşünme eğilimini gösterir (27 vs 39 akıl yürütme tokeni).
Sohbet Tamamlamaları
Düşünme içeriği reasoning_content alanında döner; akışta delta.reasoning_content olarak gelir.
from openai import OpenAI
client = OpenAI(
base_url="https://aihubmix.com/v1",
api_key="<AIHUBMIX_API_KEY>",
)
completion = client.chat.completions.create(
model="coding-glm-5.3",
reasoning_effort="max", # low / high / max, varsayılan max
extra_body={"thinking": {"type": "enabled"}},
messages=[
{"role": "user", "content": "Compute the square root of (17*23-19*11), rounded down. Digits only."}
],
)
print(completion.choices[0].message.reasoning_content)
print(completion.choices[0].message.content) # Gözlemlenen: "13"
Doğrulanmış:usage.completion_tokens_details.reasoning_tokensdüşünme kullanımını raporlar — aynı sorudareasoning_effort="low"ile 27,"max"ile 39.
Yanıtlar
Düşünme içeriği reasoning çıktı öğesi olarak döner, metin summary dizisi içinde summary_text olarak bulunur.
from openai import OpenAI
client = OpenAI(
base_url="https://aihubmix.com/v1",
api_key="<AIHUBMIX_API_KEY>",
)
response = client.responses.create(
model="coding-glm-5.3",
input="What is the capital of France? City name only.",
)
# Gözlemlenen response.output öğe türleri: ["reasoning", "message"]
# akıl yürütme öğesi: {"type": "reasoning", "summary": [{"type": "summary_text", "text": "Kullanıcı soruyor..."}]}
# usage.output_tokens_details.reasoning_tokens: 80
Doğrulanmış: varsayılan istek (hiçbirreasoningparametresi olmadan) zatensummary_textilereasoningöğesini içerir — açık bir onay gerekmez.
Mesajlar
Düşünme içeriği yerel thinking içerik blokları olarak döner.
from anthropic import Anthropic
client = Anthropic(
api_key="<AIHUBMIX_API_KEY>",
base_url="https://aihubmix.com"
)
response = client.messages.create(
model="coding-glm-5.3",
max_tokens=4096,
messages=[
{"role": "user", "content": "What is the capital of France? City name only."}
],
)
# Gözlemlenen response.content blok türleri: ["thinking", "text"]
Doğrulanmış: düşünme blokları varsayılan olarak döner; thinking: {"type": "disabled"} bu API'de de 200 döner ve düşünme hala gerçekleşir (resmi "kapatma, düşük seviyeye dönüşür, istek devam eder" kanal anlamıyla tutarlıdır).3. Araç Çağrıları ve Paralel Araçlar
Fonksiyon çağrılarının tüm üç API'de çalıştığı doğrulanmıştır; Yanıtlar API'sinde tek bir tur içinde paralel araç çağrıları da gözlemlenmiştir (Z.ai, GLM-5.3 için supports_parallel_tool_calls: true olarak açıkça belirtmektedir). Üst sınırlar: tools içinde en fazla 128 fonksiyon; tool_choice yalnızca auto destekler.
Sohbet Tamamlamaları
completion = client.chat.completions.create(
model="coding-glm-5.3",
messages=[{"role": "user", "content": "What's the weather in Beijing today?"}],
tools=[{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get weather for a city",
"parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
},
}],
)
# Gözlemlenen: finish_reason "tool_calls", içinde bir get_weather çağrısı ile
Doğrulanmış: tool_choice: "none" çalışır — aynı hava durumu sorusu, araç çağrısı olmadan düz metin döner.Yanıtlar
response = client.responses.create(
model="coding-glm-5.3",
input="Check today's weather in Shanghai and Beijing",
parallel_tool_calls=True,
tools=[{
"type": "function",
"name": "get_weather",
"description": "Get weather for a city",
"parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
}],
)
# Gözlemlenen: tek bir turda 2 paralel function_call çıktı öğesi (her şehir için bir)
Doğrulanmış: bir turda 2 paralel araç çağrısı, resmi supports_parallel_tool_calls: true beyanıyla eşleşmektedir.Mesajlar
response = client.messages.create(
model="coding-glm-5.3",
max_tokens=4096,
tools=[{
"name": "get_weather",
"description": "Get weather for a city",
"input_schema": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
}],
messages=[{"role": "user", "content": "What's the weather in Beijing today?"}],
)
# Gözlemlenen: stop_reason "tool_use"; içerik bir tool_use bloğu içerir
❗ Doğrulanmış: bu API'de, model hala araç çağrıları üretmektedirtool_choice: {"type": "none"}sonrasında — araçları devre dışı bırakmak için,toolsparametresini tamamen kaldırın veya bunun yerine Sohbet Tamamlamaları API'sindetool_choice: "none"kullanın.
4. Yapılandırılmış Çıktı
response_format text ve json_object destekler; üst akışta json_schema modu listelenmemiştir. Sıkı şema uyumu gerektiğinde, JSON Şemasını isteme gömün ve istemci tarafında doğrulayın.
Sohbet Tamamlamaları
completion = client.chat.completions.create(
model="coding-glm-5.3",
messages=[
{"role": "user", "content": "What is the capital of France? Answer in JSON with the key \"answer\"."}
],
response_format={"type": "json_object"},
)
# Gözlemlenen yanıt içeriği: {"answer": "Paris"}
Doğrulanmış: çıktı, istenen anahtarı içeren geçerli bir JSON'dur.
Yanıtlar
response = client.responses.create(
model="coding-glm-5.3",
input="What is the capital of France? Answer in JSON with the key \"answer\".",
text={"format": {"type": "json_object"}},
)
# Gözlemlenen çıktı metni: {"answer": "Paris"}
Mesajlar
# JSON yapısını istemde belirtin; gözlemlenen çıktı geçerli bir JSON'dur
response = client.messages.create(
model="coding-glm-5.3",
max_tokens=4096,
messages=[
{"role": "user", "content": "What is the capital of France? Answer in JSON with the key \"answer\"."}
],
)
# Gözlemlenen yanıt metni: {"answer": "Paris"}
5. Bağlam Önbelleklemesi Otomatik
İçsel önbellekleme varsayılan olarak açıktır ve geçilecek parametre yoktur; tekrar eden uzun ön ekler kullanımda önbellek vuruşlarını rapor eder (alan adı API'ye göre değişir).
Sohbet Tamamlamaları
# aynı uzun ön ek ile ikinci çağrının kullanımı
"prompt_tokens_details": {"cached_tokens": 960}
Doğrulanmış: iki ardışık çağrının ikincisi 960 önbellek tokeni vuruşu yaptı.
Yanıtlar
# aynı uzun ön ek ile ikinci çağrının kullanımı
"input_tokens_details": {"cached_tokens": 960}
Mesajlar
# vuruşlar kullanım.cache_read_input_tokens aracılığıyla rapor edilir
"cache_read_input_tokens": 0
Doğrulanmış: bu turda bu API'de bir önbellek vuruşu yeniden üretilmedi (önbellekler kanal başına ısınır; bir yük dengeleyici değişikliği bir vuruşu kaçırabilir). Vuruş muhasebe alanı Anthropic anlamına göre takip eder.
6. Örnekleme ve Parametre Doğrulama
Örnekleme, GLM ailesi uç noktası kurallarını takip eder: temperature aralığı [0, 1] varsayılan 1.0 ile (not — OpenAI protokolünün [0, 2]'sinden daha dar); top_p aralığı [0.01, 1] varsayılan 0.95 ile. Z.ai, yalnızca birini ayarlamayı önerir.
Doğrulanmış: parametre doğrulaması API'ler arasında farklılık gösterir — Mesajlar API'si, aralık dışıtemperature: 3değerini 400 ile reddeder ve geçerli aralığı[0,1]olarak belirtir, oysa Sohbet Tamamlamaları / Yanıtlar aynı aralık dışı değeri 200 ile sessizce kabul eder. API'ler arasında geçiş yaparken, aralık dışı örnekleme değerlerini yakalamak için geçidi kullanmaya güvenmeyin.
# Mesajlar API'si ile temperature=3 -> HTTP 400
"temperature parametresi geçersiz: değer [0,1] aralığında olmalıdır"
7. Yetenek × API Destek Matrisi
Aşağıdaki her hücre, 2026-08-14 tarihinde AIHubMix canlı API'leri üzerinden yapılan gerçek çağrılarla doğrulanmıştır; hücreler her API için parametre/alan yazımını göstermektedir.
| Yetenek | Sohbet Tamamlamaları | Yanıtlar | Mesajlar |
|---|---|---|---|
| Temel üretim / akış | ✅ | ✅ | ✅ |
| Düşünme içeriği | ✅ reasoning_content alanı |
✅ reasoning çıktı öğesi (summary_text) |
✅ thinking içerik bloğu |
| Düşünme yoğunluğu | ✅ reasoning_effort (low/high/max, varsayılan max) |
✅ soldaki ile aynı | ✅ 200 ile kabul edildi |
| Düşünmeyi devre dışı bırak | ❗ Mümkün değil: disabled 200 döner ve düşünme devam eder (düşük seviyeye dönüştürme anlamıyla) |
➖ anahtar parametre yok | ❗ Sohbet ile aynı |
| Fonksiyon çağrısı | ✅ | ✅ | ✅ |
| Paralel araç çağrıları | — | ✅ 1 turda 2 function_call öğesi |
— |
| Araç çağrılarını devre dışı bırak | ✅ tool_choice: "none" çalışır |
✅ 200 (çağrı gözlemlenmedi) | ❗ {"type": "none"} sonrasında hala çağrılar üretildi |
| Yapılandırılmış çıktı (JSON modu) | ✅ response_format: json_object |
✅ text.format: json_object |
✅ istem talebi ile |
json_schema katı modu |
❗ üst akışta listelenmemiş — şemayı isteme gömün | ❗ soldaki ile aynı | ❗ soldaki ile aynı |
| Otomatik önbellek muhasebesi | ✅ usage.prompt_tokens_details.cached_tokens |
✅ usage.input_tokens_details.cached_tokens |
✅ alan mevcut (bu turda vuruş üretilmedi) |
| Maksimum çıktı doğrulaması | ✅ 400 [1,131072] aralığında | — | — |
| Aralık dışı örnekleme doğrulaması | ❗ sessiz 200 | ❗ sessiz 200 | ✅ 400 [0,1] aralığında |
SSS
AIHubMix'te GLM-5.3 model kimliği nedir? [1m] soneki gerekli mi?
Model kimliği coding-glm-5.3 — olduğu gibi kullanın. glm-5.3[1m] Z.ai'nın Claude Code istemcisi için model adı sözdizimidir ve AIHubMix çağrılarıyla hiçbir ilgisi yoktur; üç API'nin hiçbiri herhangi bir soneke ihtiyaç duymaz.
Düşünmeyi kapatabilir miyim?
Hayır. GLM-5.3 düşünmesi her zaman açıktır ve thinking.type yalnızca enabled destekler; testlerimizde disabled göndermek 200 döner ve düşünme hala gerçekleşir (resmi anlamına göre low seviyeye dönüştürülür). Düşünme tokenlerini tasarruf etmek için reasoning_effort: "low" gönderin.
GLM-5.3, GLM-5.2 ile nasıl ilişkilidir?
Aynı temel model — tüm kazançlar eğitim sonrası gelir (resmi ifadeye göre: "GLM-5.2 ile aynı temel modeli kullanır — her kazanç eğitim sonrası gelir"). İki önemli API değişikliği: düşünme artık devre dışı bırakılamaz ve reasoning_effort üç seviyeye daralır: low/high/max (varsayılan max).
Sıkı json_schema yapılandırılmış çıktı gerekiyorsa ne yapmalıyım?
Üst akışta response_format: json_schema modu listelenmemiştir. Testlerimizde, json_object JSON modu üç API'de de geçerli JSON üretmiştir; sıkı şemalar için, JSON Şemasını isteme gömün ve istemci tarafında doğrulayın.
coding-glm-5.3 üretim sürümü mü?
Şu anda sınırlı süreli bir önizleme rotasıdır (Z.ai'nın model API belgeleri resmi API'yi "yakında" olarak işaretler); AIHubMix, ticari API piyasaya sürüldüğünde takip edecektir. Güncel fiyatlandırma ve durum için model sayfasına bakın.
Fiyatlandırma ve gerçek zamanlı durum için GLM-5.3 model sayfasına bakın; daha fazla model için model galerisine gidin.




