GLM-5.3 Uygulamalı Kılavuzu: Her Zaman Açık Düşünme, Üç Çaba Seviyesi ve API Destek Matrisi

AIHubMix7 dk okuma
GLM-5.3 Uygulamalı Kılavuzu: Her Zaman Açık Düşünme, Üç Çaba Seviyesi ve API Destek Matrisi

Başlık: GLM-5.3 Uygulamalı Kılavuzu: Her Zaman Açık Düşünme, Üç Çaba Seviyesi & API Destek Matrisi

Açıklama: Ağustos 2026 GLM-5.3 kılavuzu: her zaman açık düşünme, üç akıl yürütme çaba seviyesi, akıl yürütme özetleri, paralel araç çağrıları, yapılandırılmış çıktı ve otomatik önbellekleme — doğrulanmış AIHubMix Sohbet / Yanıtlar / Mesajlar örnekleri ile.


Bu makale GLM-5.3 için anahtar API değişikliklerini ve kullanım notlarını kapsar. GLM-5.3, 2026-08-14 tarihinde piyasaya sürülen Z.ai'nın amiral gemisi modelidir — GLM-5.2 ile aynı temel modeli kullanır, tüm kazançlar eğitim sonrası gelmektedir. AIHubMix'te model kimliği coding-glm-5.3 (şu anda sınırlı süreli önizleme rotası), Sohbet Tamamlamaları, Yanıtlar ve Claude uyumlu Mesajlar API'leri aracılığıyla mevcuttur. Ayrıca bakınız: resmi Z.ai sürüm blogu.

Her bölümdeki "Doğrulanmış" sonuçlar ve örnek yanıtlar, 2026-08-14 tarihinde AIHubMix API'leri (Sohbet Tamamlamaları / Yanıtlar / Mesajlar) üzerinden yapılan gerçek çağrılardan gelmektedir.

1. Model Özellikleri Kısaca

Öğe Değer
Bağlam penceresi 1M token (resmi tam değer: 1,048,576)
Maksimum çıktı 128K (max_tokens doğrulanmış tavan: 131,072 — aşılması durumunda 400 döner)
Girdi modları Metin
Düşünme Her zaman açık, kapatılamaz; reasoning_effort üç seviyeye sahiptir — low / high / max, varsayılan max
GLM-5.2 ile ilişkisi Aynı temel model, eğitim sonrası yükseltilmiştir: çok daha güçlü kodlama ve uzun vadeli görev performansı, ayrıca ortaya çıkan siber yetenekler
AIHubMix model kimliği coding-glm-5.3 (sınırlı süreli önizleme rotası; resmi ticari API piyasaya sürüldüğünde takip edeceğiz)
Doğrulanmış: max_tokens: 999999 400 döner ve geçerli aralık hata metninde belirtilmiştir — tavan gerçekten doğrulanmıştır, sessizce kesilmemiştir.
# max_tokens=999999 -> HTTP 400
"max_tokens parametresi geçersiz: değer [1,131072] aralığında olmalıdır"

2. GLM-5.3 vs GLM-5.2: Her Zaman Açık Düşünme, reasoning_effort ile Yoğunluk

Öğe GLM-5.2 GLM-5.3
Temel model 5.2 ile aynı (tüm kazançlar eğitim sonrası)
thinking.type enabled / disabled — kapatılabilir enabled yalnızca — kapatılamaz
reasoning_effort 7 değer uyumluluk eşlemesi (etkili seviyeler: max/high) Üç seviye low / high / max, varsayılan max
Konumlandırma Genel amaçlı amiral gemisi Kodlama ve uzun vadeli ajans görevleri için güçlendirilmiş, ortaya çıkan siber yeteneklerle

GLM-5.3'te GLM-5.2'ye göre iki en önemli API değişikliği şunlardır:

  1. thinking.type artık disabled desteklemiyor — düşünme kapatılamaz. Resmi geçiş tavsiyesi: daha önce {"type": "disabled"} gönderen uygulamalar {"type": "enabled"} olarak değiştirmeli ve reasoning_effort değerini "low" olarak ayarlamalıdır.
  2. reasoning_effort üç seviyeye daralıyor: low (hafif) / high (gelişmiş) / max (derin, varsayılan). GLM-5.2 dönemine ait 7 değer uyumluluk eşlemesi artık geçerli değildir; Z.ai, kodlama görevleri için max'ı önermektedir.
Doğrulanmış: thinking: {"type": "disabled"} göndermek AIHubMix üzerinden 200 döner ve düşünme hala gerçekleşir (reasoning_content her zamanki gibi döner) — değer resmi kanal anlamına göre otomatik olarak dönüştürülür, reddedilmez. Eğer istemciniz "düşünmeyi kapatmak için token tasarrufu yap" üzerine kuruluysa, reasoning_effort: "low" kullanın.

Doğrulanmış: reasoning_effort için enum dışı değerler de hata olmadan 200 döner (resmi belgelerde belirtilen varsayılan max değerine geri döner); low ile max aynı aritmetik soruda beklenen daha hafif düşünme eğilimini gösterir (27 vs 39 akıl yürütme tokeni).

Sohbet Tamamlamaları

Düşünme içeriği reasoning_content alanında döner; akışta delta.reasoning_content olarak gelir.

from openai import OpenAI

client = OpenAI(
    base_url="https://aihubmix.com/v1",
    api_key="<AIHUBMIX_API_KEY>",
)

completion = client.chat.completions.create(
    model="coding-glm-5.3",
    reasoning_effort="max",          # low / high / max, varsayılan max
    extra_body={"thinking": {"type": "enabled"}},
    messages=[
        {"role": "user", "content": "Compute the square root of (17*23-19*11), rounded down. Digits only."}
    ],
)

print(completion.choices[0].message.reasoning_content)
print(completion.choices[0].message.content)   # Gözlemlenen: "13"
Doğrulanmış: usage.completion_tokens_details.reasoning_tokens düşünme kullanımını raporlar — aynı soruda reasoning_effort="low" ile 27, "max" ile 39.

Yanıtlar

Düşünme içeriği reasoning çıktı öğesi olarak döner, metin summary dizisi içinde summary_text olarak bulunur.

from openai import OpenAI

client = OpenAI(
    base_url="https://aihubmix.com/v1",
    api_key="<AIHUBMIX_API_KEY>",
)

response = client.responses.create(
    model="coding-glm-5.3",
    input="What is the capital of France? City name only.",
)

# Gözlemlenen response.output öğe türleri: ["reasoning", "message"]
# akıl yürütme öğesi: {"type": "reasoning", "summary": [{"type": "summary_text", "text": "Kullanıcı soruyor..."}]}
# usage.output_tokens_details.reasoning_tokens: 80
Doğrulanmış: varsayılan istek (hiçbir reasoning parametresi olmadan) zaten summary_text ile reasoning öğesini içerir — açık bir onay gerekmez.

Mesajlar

Düşünme içeriği yerel thinking içerik blokları olarak döner.

from anthropic import Anthropic

client = Anthropic(
    api_key="<AIHUBMIX_API_KEY>",
    base_url="https://aihubmix.com"
)

response = client.messages.create(
    model="coding-glm-5.3",
    max_tokens=4096,
    messages=[
        {"role": "user", "content": "What is the capital of France? City name only."}
    ],
)

# Gözlemlenen response.content blok türleri: ["thinking", "text"]
Doğrulanmış: düşünme blokları varsayılan olarak döner; thinking: {"type": "disabled"} bu API'de de 200 döner ve düşünme hala gerçekleşir (resmi "kapatma, düşük seviyeye dönüşür, istek devam eder" kanal anlamıyla tutarlıdır).

3. Araç Çağrıları ve Paralel Araçlar

Fonksiyon çağrılarının tüm üç API'de çalıştığı doğrulanmıştır; Yanıtlar API'sinde tek bir tur içinde paralel araç çağrıları da gözlemlenmiştir (Z.ai, GLM-5.3 için supports_parallel_tool_calls: true olarak açıkça belirtmektedir). Üst sınırlar: tools içinde en fazla 128 fonksiyon; tool_choice yalnızca auto destekler.

Sohbet Tamamlamaları

completion = client.chat.completions.create(
    model="coding-glm-5.3",
    messages=[{"role": "user", "content": "What's the weather in Beijing today?"}],
    tools=[{
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "Get weather for a city",
            "parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
        },
    }],
)

# Gözlemlenen: finish_reason "tool_calls", içinde bir get_weather çağrısı ile
Doğrulanmış: tool_choice: "none" çalışır — aynı hava durumu sorusu, araç çağrısı olmadan düz metin döner.

Yanıtlar

response = client.responses.create(
    model="coding-glm-5.3",
    input="Check today's weather in Shanghai and Beijing",
    parallel_tool_calls=True,
    tools=[{
        "type": "function",
        "name": "get_weather",
        "description": "Get weather for a city",
        "parameters": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
    }],
)

# Gözlemlenen: tek bir turda 2 paralel function_call çıktı öğesi (her şehir için bir)
Doğrulanmış: bir turda 2 paralel araç çağrısı, resmi supports_parallel_tool_calls: true beyanıyla eşleşmektedir.

Mesajlar

response = client.messages.create(
    model="coding-glm-5.3",
    max_tokens=4096,
    tools=[{
        "name": "get_weather",
        "description": "Get weather for a city",
        "input_schema": {"type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"]},
    }],
    messages=[{"role": "user", "content": "What's the weather in Beijing today?"}],
)

# Gözlemlenen: stop_reason "tool_use"; içerik bir tool_use bloğu içerir
Doğrulanmış: bu API'de, model hala araç çağrıları üretmektedir tool_choice: {"type": "none"} sonrasında — araçları devre dışı bırakmak için, tools parametresini tamamen kaldırın veya bunun yerine Sohbet Tamamlamaları API'sinde tool_choice: "none" kullanın.

4. Yapılandırılmış Çıktı

response_format text ve json_object destekler; üst akışta json_schema modu listelenmemiştir. Sıkı şema uyumu gerektiğinde, JSON Şemasını isteme gömün ve istemci tarafında doğrulayın.

Sohbet Tamamlamaları

completion = client.chat.completions.create(
    model="coding-glm-5.3",
    messages=[
        {"role": "user", "content": "What is the capital of France? Answer in JSON with the key \"answer\"."}
    ],
    response_format={"type": "json_object"},
)

# Gözlemlenen yanıt içeriği: {"answer": "Paris"}
Doğrulanmış: çıktı, istenen anahtarı içeren geçerli bir JSON'dur.

Yanıtlar

response = client.responses.create(
    model="coding-glm-5.3",
    input="What is the capital of France? Answer in JSON with the key \"answer\".",
    text={"format": {"type": "json_object"}},
)

# Gözlemlenen çıktı metni: {"answer": "Paris"}

Mesajlar

# JSON yapısını istemde belirtin; gözlemlenen çıktı geçerli bir JSON'dur
response = client.messages.create(
    model="coding-glm-5.3",
    max_tokens=4096,
    messages=[
        {"role": "user", "content": "What is the capital of France? Answer in JSON with the key \"answer\"."}
    ],
)

# Gözlemlenen yanıt metni: {"answer": "Paris"}

5. Bağlam Önbelleklemesi Otomatik

İçsel önbellekleme varsayılan olarak açıktır ve geçilecek parametre yoktur; tekrar eden uzun ön ekler kullanımda önbellek vuruşlarını rapor eder (alan adı API'ye göre değişir).

Sohbet Tamamlamaları

# aynı uzun ön ek ile ikinci çağrının kullanımı
"prompt_tokens_details": {"cached_tokens": 960}
Doğrulanmış: iki ardışık çağrının ikincisi 960 önbellek tokeni vuruşu yaptı.

Yanıtlar

# aynı uzun ön ek ile ikinci çağrının kullanımı
"input_tokens_details": {"cached_tokens": 960}

Mesajlar

# vuruşlar kullanım.cache_read_input_tokens aracılığıyla rapor edilir
"cache_read_input_tokens": 0
Doğrulanmış: bu turda bu API'de bir önbellek vuruşu yeniden üretilmedi (önbellekler kanal başına ısınır; bir yük dengeleyici değişikliği bir vuruşu kaçırabilir). Vuruş muhasebe alanı Anthropic anlamına göre takip eder.

6. Örnekleme ve Parametre Doğrulama

Örnekleme, GLM ailesi uç noktası kurallarını takip eder: temperature aralığı [0, 1] varsayılan 1.0 ile (not — OpenAI protokolünün [0, 2]'sinden daha dar); top_p aralığı [0.01, 1] varsayılan 0.95 ile. Z.ai, yalnızca birini ayarlamayı önerir.

Doğrulanmış: parametre doğrulaması API'ler arasında farklılık gösterir — Mesajlar API'si, aralık dışı temperature: 3 değerini 400 ile reddeder ve geçerli aralığı [0,1] olarak belirtir, oysa Sohbet Tamamlamaları / Yanıtlar aynı aralık dışı değeri 200 ile sessizce kabul eder. API'ler arasında geçiş yaparken, aralık dışı örnekleme değerlerini yakalamak için geçidi kullanmaya güvenmeyin.
# Mesajlar API'si ile temperature=3 -> HTTP 400
"temperature parametresi geçersiz: değer [0,1] aralığında olmalıdır"

7. Yetenek × API Destek Matrisi

Aşağıdaki her hücre, 2026-08-14 tarihinde AIHubMix canlı API'leri üzerinden yapılan gerçek çağrılarla doğrulanmıştır; hücreler her API için parametre/alan yazımını göstermektedir.

Yetenek Sohbet Tamamlamaları Yanıtlar Mesajlar
Temel üretim / akış
Düşünme içeriği reasoning_content alanı reasoning çıktı öğesi (summary_text) thinking içerik bloğu
Düşünme yoğunluğu reasoning_effort (low/high/max, varsayılan max) ✅ soldaki ile aynı ✅ 200 ile kabul edildi
Düşünmeyi devre dışı bırak ❗ Mümkün değil: disabled 200 döner ve düşünme devam eder (düşük seviyeye dönüştürme anlamıyla) ➖ anahtar parametre yok ❗ Sohbet ile aynı
Fonksiyon çağrısı
Paralel araç çağrıları ✅ 1 turda 2 function_call öğesi
Araç çağrılarını devre dışı bırak tool_choice: "none" çalışır ✅ 200 (çağrı gözlemlenmedi) {"type": "none"} sonrasında hala çağrılar üretildi
Yapılandırılmış çıktı (JSON modu) response_format: json_object text.format: json_object ✅ istem talebi ile
json_schema katı modu ❗ üst akışta listelenmemiş — şemayı isteme gömün ❗ soldaki ile aynı ❗ soldaki ile aynı
Otomatik önbellek muhasebesi usage.prompt_tokens_details.cached_tokens usage.input_tokens_details.cached_tokens ✅ alan mevcut (bu turda vuruş üretilmedi)
Maksimum çıktı doğrulaması ✅ 400 [1,131072] aralığında
Aralık dışı örnekleme doğrulaması ❗ sessiz 200 ❗ sessiz 200 ✅ 400 [0,1] aralığında

SSS

AIHubMix'te GLM-5.3 model kimliği nedir? [1m] soneki gerekli mi?
Model kimliği coding-glm-5.3 — olduğu gibi kullanın. glm-5.3[1m] Z.ai'nın Claude Code istemcisi için model adı sözdizimidir ve AIHubMix çağrılarıyla hiçbir ilgisi yoktur; üç API'nin hiçbiri herhangi bir soneke ihtiyaç duymaz.

Düşünmeyi kapatabilir miyim?
Hayır. GLM-5.3 düşünmesi her zaman açıktır ve thinking.type yalnızca enabled destekler; testlerimizde disabled göndermek 200 döner ve düşünme hala gerçekleşir (resmi anlamına göre low seviyeye dönüştürülür). Düşünme tokenlerini tasarruf etmek için reasoning_effort: "low" gönderin.

GLM-5.3, GLM-5.2 ile nasıl ilişkilidir?
Aynı temel model — tüm kazançlar eğitim sonrası gelir (resmi ifadeye göre: "GLM-5.2 ile aynı temel modeli kullanır — her kazanç eğitim sonrası gelir"). İki önemli API değişikliği: düşünme artık devre dışı bırakılamaz ve reasoning_effort üç seviyeye daralır: low/high/max (varsayılan max).

Sıkı json_schema yapılandırılmış çıktı gerekiyorsa ne yapmalıyım?
Üst akışta response_format: json_schema modu listelenmemiştir. Testlerimizde, json_object JSON modu üç API'de de geçerli JSON üretmiştir; sıkı şemalar için, JSON Şemasını isteme gömün ve istemci tarafında doğrulayın.

coding-glm-5.3 üretim sürümü mü?
Şu anda sınırlı süreli bir önizleme rotasıdır (Z.ai'nın model API belgeleri resmi API'yi "yakında" olarak işaretler); AIHubMix, ticari API piyasaya sürüldüğünde takip edecektir. Güncel fiyatlandırma ve durum için model sayfasına bakın.


Fiyatlandırma ve gerçek zamanlı durum için GLM-5.3 model sayfasına bakın; daha fazla model için model galerisine gidin.