GPT-6.1 Sol, beş akıl yürütme çabası seviyesine sahiptir: düşük, orta (varsayılan), yüksek, xhigh, ve maksimum. GPT-6 Sol'dan büyük değişiklik, none ve minimal seviye kaldırıldığı için düşük artık en alt seviyedir.
Bu tek ayar, hem gecikmeyi hem de maliyeti etkiler. Akıl yürütme token'larını asla göremezsiniz, ancak bunlar için çıktı oranında ($10 milyon başına 6.1 Sol için AIHubMix) ödeme yaparsınız ve bağlam penceresinde yer kaplarlar. Yanlış seviyeyi seçerseniz, ihtiyacınız olandan birkaç kat daha fazla ödeme yapabilirsiniz.
Her seviyenin amacı nedir
Bu tablo, OpenAI'nin akıl yürütme kılavuzu tanımlarını kendi önerilerimizle birleştirir:
| Seviye | OpenAI'nin tanımı | İyi uyum | Kötü uyum |
|---|---|---|---|
| düşük | Makul bir gecikme artışı ile verimli akıl yürütme | Ara adımlar, arama, hafif planlama, sınıflandırma, çıkarım, destek yanıtları | Zor hata ayıklama, çok dosyalı yeniden yapılandırmalar |
| orta (varsayılan) | Çoğu iş yükü için dengeli varsayılan | Günlük kodlama, kod incelemesi, yazma, tipik ajan görevleri | Gecikme kritik etkileşimli kullanım |
| yüksek | Zor akıl yürütme, karmaşık hata ayıklama, derin planlama | Zor hatalar, mimari çalışmaları, SWE tarzı görevler | Yüksek QPS çevrimiçi trafiği |
| xhigh | Derin araştırma, asenkron çalışma, uzun ajan çalışmaları | Arka plan işleri, araştırma raporları | Değerlendirmelerinizin haklı çıkarmadığı her şey |
| maksimum | En zor görevler için maksimum akıl yürütme | Bilgisayar kullanımı, araştırma düzeyindeki problemler, çevrimdışı ağır işler | Neredeyse tüm günlük talepler |
OpenAI, çabayı "bir ayar düğmesi, kaliteyi geri kazanmanın birincil yolu değil" olarak tanımlar. Sonuçlar kötü olduğunda, önce isteme, araç tanımlarına ve bağlama bakın. Çabayı yalnızca ondan sonra artırın.
Her seviye hakkında ölçümler ne diyor
Bu, OpenAI'nin kendi verileridir, Vellum ve DataCamp tarafından derlenmiştir. Bunları bir kılavuz olarak değerlendirin, kutsal kitap olarak değil.
Kodlama için yüksek genellikle yeterlidir. DeepSWE v1.1'de, 6.1 Sol yüksek seviyede 75.2 puan alır, bu da Astra'nın yüksek seviyedeki (74.8) puanına eşittir ve görev başına yaklaşık $1.50 maliyetle gelir. Maliyet eğrisi, görev başına $0.50 ile $1.50 arasında %72 ile %75 arasında ulaşır. GPT-6 Sol, yaklaşık $2.60 maliyetle 68.8 puana ulaştı.
Orta seviyenin üzerine çıkmak her zaman yardımcı olmaz. AutomationBench'te, 6.1 Sol orta seviyede %35.4 puan alırken, daha yüksek çabada yalnızca yaklaşık %36.0 puan alır. İş otomasyonu için, ek akıl yürütme token'ları neredeyse hiçbir şey kazandırmadı.
Maksimumu bilgisayar kullanımı ve araştırma için saklayın. OSWorld 2.0'da, maksimum yaklaşık $1.30 maliyetle 71.4 puan alır. Terminal-Bench Science'da maksimum görev başına $5.47 maliyetle çalışır: Astra'nın $23.80'inden çok daha ucuz, ancak çoğu diğer iş yükünden bir büyüklük sırası daha yüksektir.
Düşük seviyede de iyileşme oldu. Düşük seviyedeki gerçek hata oranı, 6 Sol'da %11.4'ten %7.7'ye düştü. Eğer 6 Sol'da düşük yeterince doğru olmadığı için görevleri orta seviyeye yükselttiyseniz, tekrar düşük seviyeyi deneyin.
Kullanım durumuna göre başlangıç noktaları
| Kullanım durumu | Başlangıçta | Notlar |
|---|---|---|
| 6 Sol'da none kullanan çağrılar | düşük | OpenAI'nin resmi haritalaması. Eğer gecikme kritikse, hala none destekleyen GPT-6 Luna'yı düşünün. |
| Minimal kullanan çağrılar | düşük | Düşük seviyeden başlayın ve sonuçları karşılaştırın |
| Sohbet botları, müşteri desteği | düşük | Modelden ilk token'ı daha hızlı almak için bir satırlık bir önsöz isteyin |
| RAG S&S | düşük → orta | Alım kalitesi çabadan daha önemlidir |
| IDE kodlama asistanı | orta | Varsayılan işe yarıyor |
| Otomatik hata düzeltme, SWE ajanları | yüksek | DeepSWE yüksek seviyede Astra ile eşleşiyor |
| Bilgisayar kullanımı, tarayıcı ajanları | yüksek → maksimum | OSWorld maksimumda zirve yapıyor |
| Arka plan araştırması, uzun süreli çalışmalar | xhigh | Yalnızca değerlendirmeler bir kazanç gösterdiğinde. Sonuçları hemen almanıza gerek yoksa maliyeti yarıya indirir |
| En zor araştırma problemleri | maksimum, ya da sadece Astra'yı kullanın | OpenAI burada da Astra'yı öneriyor |
none ve minimal eşleştirmeleri, OpenAI'nin GPT-6 geçiş kılavuzu'ndan gelmektedir.
Sohbet ortasında çabayı değiştirme
Yaygın bir model, yüksek seviyede plan yapıp, düşük seviyede uygulama yapmak ve bir şeyler bozulduğunda tekrar yüksek seviyeye dönmektir.
Önemli nokta: istekte reasoning.effort değiştirmek, istem önbelleğinizi bozar. Çaba, önbelleğe alınmış ön ekin bir parçasıdır (bkz. önbellek kılavuzu). 6.1 Sol'da bir önbellek okuma, milyon token başına $0.10 maliyetindeyken, önbelleği yeniden yazmak $2.50 maliyetindedir. Bu, 25 katlık bir farktır.
GPT-6 ailesi, bunu bir configuration_update giriş öğesi ile düzeltir. İstek düzeyindeki reasoning.effort değerini değiştirmeyin ve bir sonraki kullanıcı mesajından önce bir güncelleme ekleyin. İşte bu, AIHubMix Yanıtları API'si aracılığıyla nasıl göründüğüdür:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com/v1",
)
# Dönüş 1: yüksek çaba ile plan yap
r1 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "yüksek"},
input="Bu repo'nun testlerinin neden başarısız olduğunu anlamaya çalışın ve bir düzeltme planı önerin.",
)
# Dönüş 2: uygulama için düşük seviyeye geçin, istek düzeyindeki çabayı değiştirmeden
r2 = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "yüksek"}, # değişmedi, böylece önbellek korunur
previous_response_id=r1.id,
input=[
{"type": "configuration_update", "reasoning": {"effort": "düşük"}},
{"role": "user", "content": "Planın 1. adımını gerçekleştirin."},
],
)
configuration_updateşeması yukarıda gösterilmiştir. Kesin şemayı görmek için OpenAI'nin akıl yürütme kılavuzuna bakın. AIHubMix'in Yanıtlar belgeleri şu anda dört seviyeyi (minimal ile yüksek) listeliyor, bu nedenlexhigh,maksimumveconfiguration_updategeçtiğini doğrulamak için küçük bir test isteği gönderin.
Bilinmesi gereken bazı sınırlamalar:
- Bu yalnızca standart tek ajan modunda çalışır ve yalnızca çabayı değiştirir.
- İki güncelleme yan yana olamaz.
- Otomatik sıkıştırma veya kesme ile karışmaz. Açık sıkıştırma iyidir, ancak sonrasında yeni bir güncelleme ekleyin.
- Yanıtın
reasoning.effortalanı hala istek düzeyindeki değeri gösterir, bu nedenle buna fazla anlam yüklemeyin.
Çaba ile birlikte giden ayarlar
max_output_tokens için yer bırakın. Limit, akıl yürütme token'larını içerir. Çok düşük ayarlarsanız, model görünür metin üretmeden durabilir. status: incomplete alır ve yine de girdi ve akıl yürütme için ödeme yaparsınız. OpenAI, başlangıçta en az 25.000 token ayırmayı ve xhigh veya maksimum için daha fazlasını önerir.
Akıl yürütme token'larını takip edin. Onlar usage.output_tokens_details.reasoning_tokens alanındadır. Her çaba seviyesine göre dağılıma bakmak, hisse senedi ayarlamaktan daha iyidir.
Görünürlük gerekiyorsa özetleri açın. reasoning.summary: "auto" modelin akıl yürütmesinin bir özetini döndürür (önce organizasyonunuzu doğrulamanız gerekebilir). Ham akıl yürütme asla açığa çıkarılmaz.
Pro modu ayrı bir anahtardır. Modelin daha fazla iş yapmasını sağlar, standart oranlarda faturalandırılır ancak toplamda daha fazla token ile. Ekstra gecikmenin kabul edilebilir olduğu zor problemler için kullanın.
Gerçekten çalıştırabileceğiniz bir ayar süreci
- 20 ila 50 gerçek görevi bir değerlendirme setine alın.
-
ortaseviyede bir temel çalıştırın. Başarı oranını, ortalama akıl yürütme token'larını ve P95 gecikmesini kaydedin. -
düşükdeneyin. Eğer başarı oranı çok az düşerse, geçin. -
yüksekdeneyin. Eğer başarı belirgin şekilde artarsa, yalnızca o görev türü için yüksek kullanın. - Yalnızca yüksek yetersiz kaldığında
xhighveyamaksimumseçeneğine başvurun ve bu arada yüksek seviyede GPT-6 Astra ile karşılaştırın. Bazen daha büyük bir model, daha fazla çabayı geçebilir. AIHubMix'te bu, yalnızcamodelparametresinde bir değişikliktir ve model listesi mevcut olanı gösterir. - Tek bir küresel ayar yerine görev türüne göre yönlendirin.
Kısa versiyon: orta seviyeden başlayın, düşük ile para kazanın, kodlama için yüksek kullanın ve xhigh ile maksimumun değerlendirmelerinizde kendilerini kanıtlamalarını sağlayın.
Sonraki: $2 / $10 fiyat etiketinin, önbellekleme, uzun bağlam ve faturalandırma çarpanları devreye girdiğinde ne anlama geldiği.
SSS
GPT-6.1 Sol için varsayılan akıl yürütme çabası nedir? orta. Eğer ayarlamazsanız, bu sizin alacağınızdır.
Neden none bir hata döndürüyor? 6.1 Sol, none ve minimal desteklemiyor. OpenAI, düşük seçeneğine geçmenizi önerir. Eğer gerçekten none gerekiyorsa, GPT-6 Sol veya GPT-6 Luna'da kalın.
Akıl yürütme token'ları nasıl faturalandırılır? Çıktı oranında ($10 milyon başına 6.1 Sol) ve bağlam penceresine karşı sayılır. Gerçek sayılar için usage.output_tokens_details.reasoning_tokens kontrol edin.
Parametre adı, Sohbet Tamamlamaları ve Yanıtlar'da aynı mı? Hayır. Sohbet Tamamlamaları, üst düzey reasoning_effort kullanır. Yanıtlar, iç içe geçmiş reasoning: {"effort": ...} kullanır. Karıştırmak, Desteklenmeyen parametre döndürür.
Daha yüksek çaba her zaman daha iyi sonuçlar verir mi? Hayır. AutomationBench'te, orta seviyenin üstüne çıkmak yalnızca puanı %35.4'ten yaklaşık %36.0'a taşımışken, belirgin şekilde daha fazla maliyetle sonuçlanmıştır. Kendi görevlerinizde test edin.
Sohbetin ortasında çabayı değiştirebilir miyim? Evet. Bir configuration_update ögesi kullanın ve istek düzeyindeki reasoning.effort değerini değiştirmeyin, böylece istem önbelleği geçerli kalır. Bu, otomatik sıkıştırma veya kesme ile çalışmaz.
Neden status: incomplete ve hiçbir çıktı almadım? Muhtemelen max_output_tokens çok düşüktü ve akıl yürütme bunu tamamen kullandı. OpenAI, en az 25.000 token ayırmayı önerir.
Devam edin: GPT-6.1 Sol serisi
- Faturanızın ne kadarı akıl yürütme? Çaba yalnızca bir kaldıraçtır. Önbellekleme, 272K eşiği ve Batch indirimleri nihai sayıyı şekillendirir. Ayrıntılar için GPT-6.1 Sol'un Gerçek Maliyeti: $2 / $10 Fiyat Etiketinin Ötesinde'na bakın.
-
nonekullanan kod? Düşük seviyeye geçmek sadece başlangıçtır. Araç çağrıları, örnekleme parametreleri ve önbellek ayarlarının da değişikliklere ihtiyacı vardır: GPT-6.1 Sol'a Geçiş: Yanlış Gidilebilecek 9 Şey. - 6.1 Sol, 6 Sol ve Astra'dan ne kadar daha iyi? Özellikler ve ölçümler yan yana GPT-6.1 Sol vs GPT-6 Sol: Neredeyse Astra'yı Yakalamak İçin Bir Haftalık Güncelleme'da.



