Claude Haiku 5.5 е първият Haiku с настройка за усилие, и тази настройка влияе повече от всичко друго, което контролирате. В независимите тестове на Artificial Analysis, Haiku 5.5 при максимално усилие получи 43 точки в Индекса на интелигентността, а при ниско усилие получи 29. Максималното усилие използва 440 милиона токена за изход, докато ниското използва 32 милиона.
Краткият отговор: оставете повечето задачи на подразбиращото се, medium. Преместете високобройни, прости маршрути на low. Увеличете работата с знания и стриктното следване на инструкции до high. Отнасяйте се към xhigh и max като към настройки, за които ви е необходимо доказателство, и ги сравнете с Sonnet 5.5, преди да се ангажирате.
Останалата част от този пост показва какво струва всяко ниво, къде повишаването спира да се изплаща и кои настройки се провалят или стават скъпи, когато промените усилието.
Каква е настройката
Claude Haiku 5.5 поддържа пет нива: low, medium, high, xhigh и max. По подразбиране е medium, което е необичайно: повечето текущи модели на Claude по подразбиране са high, а само Haiku 5.5 и Opus 5.5 по подразбиране са с едно ниво по-ниско. Изпращането на medium е същото като да оставите параметъра извън.
Усилието замества бюджета за ръчно мислене, който Haiku 4.5 използваше. Запитване с thinking: {"type": "enabled", "budget_tokens": N} сега връща 400, така че няма старо число, което да се пренесе. Според документацията за усилие на Anthropic, задавате го в output_config:
output_config={"effort": "low"}
Три факта оформят всичко по-долу:
- Мисленето е включено по подразбиране. Haiku 5.5 работи с адаптивно мислене, освен ако не е указано друго. По-ниското усилие означава по-малко мислене, а при прости запитвания моделът може да пропусне мисленето напълно.
- Мисловните токени са изходни токени. Те се броят към
max_tokensи се таксуват по изходната ставка ($0.50 на милион за запитвания до 100K токена). - Искането за по-малко мислене в запитването не работи. В тестовете на Anthropic моделът все още мислеше, когато запитването му казваше да отговори директно. Усилието е лостът.
Какво струва всяко ниво
Два независими източника измериха Haiku 5.5 по нива на усилие. Индексните цифри идват от Artificial Analysis; цифрите на FrontierCode идват от публичния файл с резултати на Cognition, компилиран от Kingy.ai. Нито един от тях не обхваща вашето натоварване, така че ги третирайте като форма на кривата, а не като ваши числа.
Индекс на интелигентността на Artificial Analysis v4.3.2 (десет оценки, от работа с знания до терминални задачи):
| Усилие | Индексен резултат | Изходни токени за индекса | Цена на задача | Време до първия токен |
|---|---|---|---|---|
| нисък | 29 | 32M | $0.02 | 9.9 с |
| среден | 34 | 54M | $0.05 | 13.4 с |
| висок | 38 | 97M | $0.08 | 28.0 с |
| максимум | 43 | 440M | $0.21 | n/a |
Artificial Analysis не публикува xhigh тест. Неговата латентност при максимално усилие изглежда аномална, затова е пропусната.
FrontierCode 1.1 Main, Haiku 5.5 работи в Claude Code:
| Усилие | Комбиниран резултат | Цена на разгръщане | Изходни токени на разгръщане |
|---|---|---|---|
| нисък | 34.8% | $0.06 | 23,868 |
| среден | 41.6% | $0.13 | 36,172 |
| висок | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| максимум | 46.4% | $1.33 | 181,387 |
Разходите са закръглени до стотинка.
Прочетете двете таблици заедно и три неща изпъкват.
Преходът от ниско към средно е най-евтиният. В индекса, той купува 5 точки за около 1.7 пъти изходните токени. В FrontierCode, той купува 6.8 точки за около два пъти цената на разгръщането.
Преходът от средно към високо може да бъде плосък. В FrontierCode, високото получи 0.3 точки над средното и струваше около два пъти повече. В по-широкия индекс, високото добави 4 точки. Дали вашето натоварване изглежда като първия случай или втория е точно това, което бързата оценка ви казва.
Двете най-високи нива са скъпи. От високо до максимум в индекса, изходните токени нарастват около 4.5 пъти за 5 точки. В FrontierCode, максимумът струва около десет пъти повече от средното за 4.8 точки, а преходът от xhigh до максимум грубо удвоява разходите за 0.6 точки. Насоките на Anthropic казват същото по-просто: използвайте xhigh и max само там, където вашите оценки показват печалба, и ги сравнете с Sonnet 5.5 по производителност, цена и скорост първо.
Още една причина, поради която подразбиращото се е важно: бенчмарковете на Anthropic бяха проведени при максимално усилие. Резултатите на системната карта при средно усилие са по-ниски (1277 на GDPval-AA вместо 1620). Ако разгръщате на подразбиращото се, това са числата, с които да сравнявате.
Къде да започнете, в зависимост от натоварването
| Натоварване | Започнете с | Преместете се нагоре, когато |
|---|---|---|
| Класификация, маршрутизиране, етикетиране | нисък | Етикетите се отклоняват при трудни случаи |
| Извличане от кратки документи | нисък | Полета се пропускат или сливат |
| Чат и поддръжка на живо | нисък | Правилата се пропускат в дълги чатове |
| Резюмета и компактиране | среден | Ключови детайли отпадат |
| Работа на подагент под по-голям модел | среден | Водещият модел повтаря работата |
| Агентно кодиране, тесни промени | среден | Тестовете се провалят при първия опит |
| Работа с знания, дълги задачи на агенти | висок | Оценките показват резерв |
Тези начални точки следват насоките на Anthropic за Haiku 5.5; сигналите за "преместване нагоре" са това, на което да се внимава в собствените ви логове.
Един ред, който заслужава втори поглед, е чатът. Ниското е най-бързото ниво, което подхожда на поддръжката на живо. Но Anthropic препоръчва high, когато следването на инструкции е най-важно, например поддръжка, която трябва да спазва правилата на системния си подканващ текст, докато потребителят спори. Тествайте и двете на разговорите, които са се провалили в миналото.
Какво се проваля или става скъпо, когато усилието се променя
Малък max_tokens може да прекрати отговора, преди да е започнал. Мисленето се брои към max_tokens. Ограничение, зададено за класификация с една дума, да речем 50 токена, може да бъде изразходвано изцяло за мислене, и отговорът завършва с stop_reason: "max_tokens" и без текст. Увеличете лимита, за да оставите място, или намалете усилието.
Промяната на усилието по време на разговора нулира кеша. Промяната на стойността на усилието на най-високо ниво между запитванията невалидира кеша на подканващите съобщения за разговора. Ако агентът се нуждае от едно трудно завъртане на high вътре в разговор на low, Anthropic предлага промяна на усилието на съобщение (бета заглавие mid-conversation-output-config-2026-07-01, Claude API и Google Cloud), която запазва кеша. Тя изисква мисленето да бъде включено. Дали шлюзът предава това бета заглавие е важно да се провери, преди да разчитате на него.
Изключването на мисленето има ограничения. thinking: {"type": "disabled"} се приема при low, medium и high. При xhigh или max това връща 400. С изключено мислене, промяната на усилието на съобщение също връща 400, и моделът може да пропусне повикване на инструмент, от което се нуждае, когато същото запитване иска JSON изход. Съветът на Anthropic е да оставите мисленето включено и да използвате по-ниско ниво на усилие вместо това.
Ниското усилие може да спре рано. С дълъг подканващ текст за кодиране на агент на low, Haiku 5.5 понякога спира, преди работата да е завършена и връща задачата. В тестовете на Anthropic, преминаването от low към medium грубо наполовина намали ранното спиране и повече от удвои изходните токени на опит. Ръководството за подканване на Haiku 5.5 има кратка инструкция "продължавайте да работите, докато не завършите", която адресира същия проблем на по-ниска цена.
Ниското и средното могат да пропуснат проверка. При задачи по кодиране, моделът понякога съобщава, че промяната е завършена, без да извърши тест. Ръководството за подканване има параграф за проверка за това; струва токени, но увеличава дела на проверените промени.
Xhigh може да върне празен отговор. В многопосочни чатове на xhigh, моделът понякога пише целия си отговор вътре в мисленето си и завършва завъртането без видим текст. Ако работите на xhigh, проверете за празни текстови блокове.
Принуждаването на инструмент пропуска мисленето. Haiku 5.5 приема принудително tool_choice, но отговорът след това започва с повикването на инструмента и без мислене. Ако моделът трябва да разсъждава, преди да извика инструмента, използвайте auto и кажете в подканата кога да го извикате.
Изпълнете собствена проверка на усилието през AIHubMix
Най-бързият начин да изберете е да изпълните същите 20 до 50 реални подканващи текста на две или три нива и да сравните качеството, изходните токени и латентността. Чрез AIHubMix Claude native endpoint, с зададен AIHUBMIX_API_KEY:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Резюмирайте този билет за поддръжка в едно изречение: ...",
"Извлечете номера на фактурата и общата сума от: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Запазете `text` до подканващия текст и го оценете спрямо собствената си рубрика.
print(f"{effort}: {out_tokens} изходни токени, {seconds:.1f}s общо")
Ако изходните токени едва се променят между low и high, настройката вероятно не достига модела; проверете запитването, което вашият шлюз предава. На страницата на Haiku 5.5 в AIHubMix, цената на токен е същата на всяко ниво на усилие, така че броят токени от тази проверка се преобразува директно в долари.
Често задавани въпроси
Какво е нивото на усилие по подразбиране за Claude Haiku 5.5?
Средно. Повечето текущи модели на Claude по подразбиране са високи, така че код, който разчиташе на подразбиращото се за друг модел, ще работи на Haiku 5.5 с едно ниво по-ниско, освен ако не зададе усилието изрично.
Мога ли напълно да изключа мисленето?
При ниско, средно и високо усилие, да, като зададете мисленето на изключено. При xhigh и max това връща грешка. Anthropic препоръчва вместо това да намалите усилието, тъй като моделът може сам да пропусне мисленето при прости запитвания и запазва поведението си при повикване на инструменти.
Кое ниво на усилие е най-евтино?
Ниско. В тестовете на Artificial Analysis то използва около 32 милиона изходни токени за целия индекс в сравнение с 54 милиона при средно и 440 милиона при максимум. Цената на токен е същата на всяко ниво; разликата е в това колко токени се генерират.
Струва ли си максималното усилие на Haiku 5.5?
Само с доказателства от вашите собствени оценки. В FrontierCode, максимумът струва около десет пъти повече от средното за 4.8 точки печалба. В този момент Anthropic предлага да се сравни с Sonnet 5.5, който може да достигне същото качество за по-малко.
Защо отговорите ми спират без текст?
Обикновено, защото мисленето е изразходвало max_tokens преди отговорът да започне. Увеличете max_tokens или намалете усилието. При xhigh в многопосочни чатове, празен отговор може също да означава, че моделът е поставил отговора си вътре в мисленето.
Промяната на усилието влияе ли на кеширането на подканите?
Да. Промяната на усилието на най-високо ниво между запитванията невалидира кешираните съобщения за този разговор. Промяната на усилието на съобщение, в момента в бета, избягва това.
Защо бенчмарковете при стартиране не съвпадат с това, което виждам при подразбиращото се?
Фигурите при стартиране бяха проведени при максимално усилие. При средно, системната карта отчита по-ниски резултати, например 1277 вместо 1620 на GDPval-AA.
Продължете да четете: серията Claude Haiku 5.5
- Усилието определя колко токена генерирате. За това как Haiku 5.5 се сравнява с Haiku 4.5, GPT-6 Luna и Sonnet 5.5 на върха на диапазона, прочетете Claude Haiku 5.5 срещу Haiku 4.5: Какво купуват десет цента сега
- Мисловните токени се таксуват като изходни, а дължината на подканата определя ценовата карта. За да превърнете избора си на усилие в месечна сметка, прочетете Ценообразуване на Claude Haiku 5.5: Линията от 100K зад 90% отстъпка
- Усилието заменя стария бюджет за мислене, а старият бюджет сега връща грешка. За това решение и останалата част от прехода от Haiku 4.5, прочетете Мигриране от Claude Haiku 4.5 до 5.5: Пет 400 грешки и тихите промени
Източници
- Усилие (Документация на платформата Claude)
- Подканване на Claude Haiku 5.5 (Документация на платформата Claude)
- Claude Haiku 5.5 в AIHubMix
- Анализ на интелигентността, производителността и цената на Claude Haiku 5.5 (Artificial Analysis)
- Claude Haiku 5.5: Бенчмаркове, спецификации, Sol и Luna в сравнение (Kingy.ai)



