GPT-6.1 Sol için Akıl Yürütme Çabası Seçimi: düşükten maksimuma

AIHubMix6 dk okuma
GPT-6.1 Sol için Akıl Yürütme Çabası Seçimi: düşükten maksimuma

GPT-6.1 Sol, beş akıl yürütme çabası seviyesine sahiptir: düşük, orta (varsayılan), yüksek, xhigh, ve maksimum. GPT-6 Sol'dan büyük değişiklik, none ve minimal seviye kaldırıldığı için düşük artık en alt seviyedir.

Bu tek ayar, hem gecikmeyi hem de maliyeti etkiler. Akıl yürütme token'larını asla göremezsiniz, ancak bunlar için çıktı oranında ($10 milyon başına 6.1 Sol için AIHubMix) ödeme yaparsınız ve bağlam penceresinde yer kaplarlar. Yanlış seviyeyi seçerseniz, ihtiyacınız olandan birkaç kat daha fazla ödeme yapabilirsiniz.


Her seviyenin amacı nedir

Bu tablo, OpenAI'nin akıl yürütme kılavuzu tanımlarını kendi önerilerimizle birleştirir:

SeviyeOpenAI'nin tanımıİyi uyumKötü uyum
düşükMakul bir gecikme artışı ile verimli akıl yürütmeAra adımlar, arama, hafif planlama, sınıflandırma, çıkarım, destek yanıtlarıZor hata ayıklama, çok dosyalı yeniden yapılandırmalar
orta (varsayılan)Çoğu iş yükü için dengeli varsayılanGünlük kodlama, kod incelemesi, yazma, tipik ajan görevleriGecikme kritik etkileşimli kullanım
yüksekZor akıl yürütme, karmaşık hata ayıklama, derin planlamaZor hatalar, mimari çalışmaları, SWE tarzı görevlerYüksek QPS çevrimiçi trafiği
xhighDerin araştırma, asenkron çalışma, uzun ajan çalışmalarıArka plan işleri, araştırma raporlarıDeğerlendirmelerinizin haklı çıkarmadığı her şey
maksimumEn zor görevler için maksimum akıl yürütmeBilgisayar kullanımı, araştırma düzeyindeki problemler, çevrimdışı ağır işlerNeredeyse tüm günlük talepler

OpenAI, çabayı "bir ayar düğmesi, kaliteyi geri kazanmanın birincil yolu değil" olarak tanımlar. Sonuçlar kötü olduğunda, önce isteme, araç tanımlarına ve bağlama bakın. Çabayı yalnızca ondan sonra artırın.


Her seviye hakkında ölçümler ne diyor

Bu, OpenAI'nin kendi verileridir, Vellum ve DataCamp tarafından derlenmiştir. Bunları bir kılavuz olarak değerlendirin, kutsal kitap olarak değil.

Kodlama için yüksek genellikle yeterlidir. DeepSWE v1.1'de, 6.1 Sol yüksek seviyede 75.2 puan alır, bu da Astra'nın yüksek seviyedeki (74.8) puanına eşittir ve görev başına yaklaşık $1.50 maliyetle gelir. Maliyet eğrisi, görev başına $0.50 ile $1.50 arasında %72 ile %75 arasında ulaşır. GPT-6 Sol, yaklaşık $2.60 maliyetle 68.8 puana ulaştı.

Orta seviyenin üzerine çıkmak her zaman yardımcı olmaz. AutomationBench'te, 6.1 Sol orta seviyede %35.4 puan alırken, daha yüksek çabada yalnızca yaklaşık %36.0 puan alır. İş otomasyonu için, ek akıl yürütme token'ları neredeyse hiçbir şey kazandırmadı.

Maksimumu bilgisayar kullanımı ve araştırma için saklayın. OSWorld 2.0'da, maksimum yaklaşık $1.30 maliyetle 71.4 puan alır. Terminal-Bench Science'da maksimum görev başına $5.47 maliyetle çalışır: Astra'nın $23.80'inden çok daha ucuz, ancak çoğu diğer iş yükünden bir büyüklük sırası daha yüksektir.

Düşük seviyede de iyileşme oldu. Düşük seviyedeki gerçek hata oranı, 6 Sol'da %11.4'ten %7.7'ye düştü. Eğer 6 Sol'da düşük yeterince doğru olmadığı için görevleri orta seviyeye yükselttiyseniz, tekrar düşük seviyeyi deneyin.


Kullanım durumuna göre başlangıç noktaları

Kullanım durumuBaşlangıçtaNotlar
6 Sol'da none kullanan çağrılardüşükOpenAI'nin resmi haritalaması. Eğer gecikme kritikse, hala none destekleyen GPT-6 Luna'yı düşünün.
Minimal kullanan çağrılardüşükDüşük seviyeden başlayın ve sonuçları karşılaştırın
Sohbet botları, müşteri desteğidüşükModelden ilk token'ı daha hızlı almak için bir satırlık bir önsöz isteyin
RAG S&Sdüşük → ortaAlım kalitesi çabadan daha önemlidir
IDE kodlama asistanıortaVarsayılan işe yarıyor
Otomatik hata düzeltme, SWE ajanlarıyüksekDeepSWE yüksek seviyede Astra ile eşleşiyor
Bilgisayar kullanımı, tarayıcı ajanlarıyüksek → maksimumOSWorld maksimumda zirve yapıyor
Arka plan araştırması, uzun süreli çalışmalarxhighYalnızca değerlendirmeler bir kazanç gösterdiğinde. Sonuçları hemen almanıza gerek yoksa maliyeti yarıya indirir
En zor araştırma problemlerimaksimum, ya da sadece Astra'yı kullanınOpenAI burada da Astra'yı öneriyor

 none ve minimal eşleştirmeleri, OpenAI'nin GPT-6 geçiş kılavuzu'ndan gelmektedir.


Sohbet ortasında çabayı değiştirme

Yaygın bir model, yüksek seviyede plan yapıp, düşük seviyede uygulama yapmak ve bir şeyler bozulduğunda tekrar yüksek seviyeye dönmektir.

Önemli nokta: istekte reasoning.effort değiştirmek, istem önbelleğinizi bozar. Çaba, önbelleğe alınmış ön ekin bir parçasıdır (bkz.  önbellek kılavuzu). 6.1 Sol'da bir önbellek okuma, milyon token başına $0.10 maliyetindeyken, önbelleği yeniden yazmak $2.50 maliyetindedir. Bu, 25 katlık bir farktır.

GPT-6 ailesi, bunu bir configuration_update giriş öğesi ile düzeltir. İstek düzeyindeki reasoning.effort değerini değiştirmeyin ve bir sonraki kullanıcı mesajından önce bir güncelleme ekleyin. İşte bu,  AIHubMix Yanıtları API'si aracılığıyla nasıl göründüğüdür:

from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

# Dönüş 1: yüksek çaba ile plan yap
r1 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "yüksek"},
    input="Bu repo'nun testlerinin neden başarısız olduğunu anlamaya çalışın ve bir düzeltme planı önerin.",
)

# Dönüş 2: uygulama için düşük seviyeye geçin, istek düzeyindeki çabayı değiştirmeden
r2 = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "yüksek"},           # değişmedi, böylece önbellek korunur
    previous_response_id=r1.id,
    input=[
        {"type": "configuration_update", "reasoning": {"effort": "düşük"}},
        {"role": "user", "content": "Planın 1. adımını gerçekleştirin."},
    ],
)
 configuration_update şeması yukarıda gösterilmiştir. Kesin şemayı görmek için OpenAI'nin akıl yürütme kılavuzuna bakın. AIHubMix'in Yanıtlar belgeleri şu anda dört seviyeyi (minimal ile yüksek) listeliyor, bu nedenle xhigh, maksimum ve configuration_update geçtiğini doğrulamak için küçük bir test isteği gönderin.

Bilinmesi gereken bazı sınırlamalar:

  • Bu yalnızca standart tek ajan modunda çalışır ve yalnızca çabayı değiştirir.
  • İki güncelleme yan yana olamaz.
  • Otomatik sıkıştırma veya kesme ile karışmaz. Açık sıkıştırma iyidir, ancak sonrasında yeni bir güncelleme ekleyin.
  • Yanıtın reasoning.effort alanı hala istek düzeyindeki değeri gösterir, bu nedenle buna fazla anlam yüklemeyin.

Çaba ile birlikte giden ayarlar

 max_output_tokens için yer bırakın. Limit, akıl yürütme token'larını içerir. Çok düşük ayarlarsanız, model görünür metin üretmeden durabilir.  status: incomplete alır ve yine de girdi ve akıl yürütme için ödeme yaparsınız. OpenAI, başlangıçta en az 25.000 token ayırmayı ve xhigh veya maksimum için daha fazlasını önerir.

Akıl yürütme token'larını takip edin. Onlar usage.output_tokens_details.reasoning_tokens alanındadır. Her çaba seviyesine göre dağılıma bakmak, hisse senedi ayarlamaktan daha iyidir.

Görünürlük gerekiyorsa özetleri açın. reasoning.summary: "auto" modelin akıl yürütmesinin bir özetini döndürür (önce organizasyonunuzu doğrulamanız gerekebilir). Ham akıl yürütme asla açığa çıkarılmaz.

Pro modu ayrı bir anahtardır. Modelin daha fazla iş yapmasını sağlar, standart oranlarda faturalandırılır ancak toplamda daha fazla token ile. Ekstra gecikmenin kabul edilebilir olduğu zor problemler için kullanın.


Gerçekten çalıştırabileceğiniz bir ayar süreci

  1. 20 ila 50 gerçek görevi bir değerlendirme setine alın.
  2.  orta seviyede bir temel çalıştırın. Başarı oranını, ortalama akıl yürütme token'larını ve P95 gecikmesini kaydedin.
  3.  düşük deneyin. Eğer başarı oranı çok az düşerse, geçin.
  4.  yüksek deneyin. Eğer başarı belirgin şekilde artarsa, yalnızca o görev türü için yüksek kullanın.
  5. Yalnızca yüksek yetersiz kaldığında xhigh veya maksimum seçeneğine başvurun ve bu arada yüksek seviyede GPT-6 Astra ile karşılaştırın. Bazen daha büyük bir model, daha fazla çabayı geçebilir. AIHubMix'te bu, yalnızca model parametresinde bir değişikliktir ve model listesi mevcut olanı gösterir.
  6. Tek bir küresel ayar yerine görev türüne göre yönlendirin.

Kısa versiyon: orta seviyeden başlayın, düşük ile para kazanın, kodlama için yüksek kullanın ve xhigh ile maksimumun değerlendirmelerinizde kendilerini kanıtlamalarını sağlayın.

Sonraki: $2 / $10 fiyat etiketinin, önbellekleme, uzun bağlam ve faturalandırma çarpanları devreye girdiğinde ne anlama geldiği.


SSS

GPT-6.1 Sol için varsayılan akıl yürütme çabası nedir? orta. Eğer ayarlamazsanız, bu sizin alacağınızdır.

Neden none bir hata döndürüyor? 6.1 Sol, none ve minimal desteklemiyor. OpenAI, düşük seçeneğine geçmenizi önerir. Eğer gerçekten none gerekiyorsa, GPT-6 Sol veya GPT-6 Luna'da kalın.

Akıl yürütme token'ları nasıl faturalandırılır? Çıktı oranında ($10 milyon başına 6.1 Sol) ve bağlam penceresine karşı sayılır. Gerçek sayılar için usage.output_tokens_details.reasoning_tokens kontrol edin.

Parametre adı, Sohbet Tamamlamaları ve Yanıtlar'da aynı mı? Hayır. Sohbet Tamamlamaları, üst düzey reasoning_effort kullanır. Yanıtlar, iç içe geçmiş reasoning: {"effort": ...} kullanır. Karıştırmak, Desteklenmeyen parametre döndürür.

Daha yüksek çaba her zaman daha iyi sonuçlar verir mi? Hayır. AutomationBench'te, orta seviyenin üstüne çıkmak yalnızca puanı %35.4'ten yaklaşık %36.0'a taşımışken, belirgin şekilde daha fazla maliyetle sonuçlanmıştır. Kendi görevlerinizde test edin.

Sohbetin ortasında çabayı değiştirebilir miyim? Evet. Bir configuration_update ögesi kullanın ve istek düzeyindeki reasoning.effort değerini değiştirmeyin, böylece istem önbelleği geçerli kalır. Bu, otomatik sıkıştırma veya kesme ile çalışmaz.

Neden status: incomplete ve hiçbir çıktı almadım? Muhtemelen max_output_tokens çok düşüktü ve akıl yürütme bunu tamamen kullandı. OpenAI, en az 25.000 token ayırmayı önerir.


Devam edin: GPT-6.1 Sol serisi


Kaynaklar