Claude Haiku 5.5 — это первый Haiku с настройкой усилий, и эта настройка влияет на результат больше, чем что-либо другое, что вы контролируете. В независимых запусках Artificial Analysis Haiku 5.5 при максимальных усилиях набрал 43 балла в Индексе Интеллекта, а при низких усилиях — 29. Максимум также использовал 440 миллионов токенов на выходе для прохождения индекса; низкий использовал 32 миллиона.
Так что короткий ответ: оставьте большую часть работы на уровне по умолчанию, medium. Переведите высокообъемные, простые маршруты на low. Повышайте уровень знаний и строгое следование инструкциям до high. Рассматривайте xhigh и max как настройки, для которых вам нужны доказательства, и сравните их с Sonnet 5.5, прежде чем принимать решение.
Остальная часть этого поста показывает, сколько стоит каждый уровень, где повышение перестает оправдывать затраты и какие настройки ломаются или становятся дорогими при изменении усилий.
Что такое эта настройка
Claude Haiku 5.5 поддерживает пять уровней: low, medium, high, xhigh и max. Уровень по умолчанию — medium, что необычно: большинство текущих моделей Claude по умолчанию используют high, и только Haiku 5.5 и Opus 5.5 по умолчанию на один уровень ниже. Отправка medium эквивалентна отсутствию параметра.
Усилия заменяют ручной бюджет мышления, который использовал Haiku 4.5. Запрос с thinking: {"type": "enabled", "budget_tokens": N} теперь возвращает 400, так что нет старого числа, которое можно было бы перенести. Согласно документации по усилиям от Anthropic, вы устанавливаете его в output_config:
output_config={"effort": "low"}
Три факта формируют все ниже:
- Мыслительный процесс включен по умолчанию. Haiku 5.5 использует адаптивное мышление, если не указано иное. Низкие усилия означают меньше мышления, и при простых запросах модель может полностью пропустить мышление.
- Мыслительные токены — это выходные токены. Они учитываются в
max_tokensи тарифицируются по выходной ставке (0,50 доллара за миллион на запросах до 100K токенов). - Запрос на меньшее мышление в подсказке не работает. В тестировании Anthropic модель все равно думала, когда подсказка говорила ей ответить напрямую. Усилия — это рычаг.
Сколько стоит каждый уровень
Два независимых источника измерили Haiku 5.5 по уровням усилий. Индексные данные получены из Artificial Analysis; данные FrontierCode получены из публичного файла результатов Cognition, составленного Kingy.ai. Ни один из них не охватывает вашу рабочую нагрузку, поэтому рассматривайте их как форму кривой, а не как ваши числа.
Индекс интеллекта Artificial Analysis v4.3.2 (десять оценок, от работы с знаниями до терминальных задач):
| Усилия | Индексный балл | Выходные токены для индекса | Стоимость за задачу | Время до первого токена |
|---|---|---|---|---|
| low | 29 | 32M | $0.02 | 9.9 с |
| medium | 34 | 54M | $0.05 | 13.4 с |
| high | 38 | 97M | $0.08 | 28.0 с |
| max | 43 | 440M | $0.21 | n/a |
Artificial Analysis не опубликовал запуск xhigh. Его показатель задержки при максимальных усилиях выглядел аномально, поэтому он был исключен.
FrontierCode 1.1 Main, Haiku 5.5 работает в Claude Code:
| Усилия | Составной балл | Стоимость за развертывание | Выходные токены за развертывание |
|---|---|---|---|
| low | 34.8% | $0.06 | 23,868 |
| medium | 41.6% | $0.13 | 36,172 |
| high | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| max | 46.4% | $1.33 | 181,387 |
Стоимость округлена до цента.
Сравните две таблицы, и три вещи выделяются.
Переход с низкого на средний — самый дешевый шаг. В индексе он дает 5 баллов за примерно 1,7 раза больше выходных токенов. В FrontierCode он дает 6,8 баллов за примерно вдвое большую стоимость за развертывание.
Переход со среднего на высокий может быть плоским. В FrontierCode высокий набрал 0,3 балла выше среднего и стоил примерно вдвое больше. В более широком индексе высокий добавил 4 балла. То, как выглядит ваша рабочая нагрузка, — это именно то, что быстрая оценка вам подскажет.
Два верхних уровня дороги. Переход с высокого на максимальный в индексе приводит к увеличению выходных токенов примерно в 4,5 раза за 5 баллов. В FrontierCode максимальный стоит примерно в десять раз больше, чем средний, за 4,8 дополнительных балла, а переход с xhigh на max примерно удваивает стоимость за 0,6 балла. Рекомендации Anthropic говорят то же самое более простыми словами: используйте xhigh и max только там, где ваши оценки показывают прирост, и сначала сравните их с Sonnet 5.5 по производительности, стоимости и скорости.
Еще одна причина, почему уровень по умолчанию важен: бенчмарки запуска Anthropic проводились на максимальных усилиях. Результаты системы на среднем уровне ниже (1277 на GDPval-AA вместо 1620). Если вы развертываете на уровне по умолчанию, это те числа, с которыми нужно сравнивать.
С чего начать в зависимости от рабочей нагрузки
| Рабочая нагрузка | Начать с | Перейти на более высокий уровень, когда |
|---|---|---|
| Классификация, маршрутизация, тегирование | low | Метки смещаются в сложных случаях |
| Извлечение из коротких документов | low | Поля пропускаются или объединяются |
| Чат и поддержка в реальном времени | low | Правила слабеют в длинных чатах |
| Резюме и сжатие | medium | Ключевые детали выпадают |
| Работа подагентов в рамках более крупной модели | medium | Ведущая модель переделывает работу |
| Кодирование с агентским подходом, узкие изменения | medium | Тесты не проходят с первой попытки |
| Работа с знаниями, длительные задачи агентов | high | Оценки показывают запас |
Эти начальные точки следуют рекомендациям Anthropic для Haiku 5.5; сигналы "перейти на более высокий уровень" — это то, на что стоит обратить внимание в ваших собственных логах.
Единственная строка, на которую стоит обратить внимание, — это чат. Низкий уровень — самый быстрый, что подходит для поддержки в реальном времени. Но Anthropic рекомендует high, когда следование инструкциям имеет наибольшее значение, например, для помощника по поддержке, который должен придерживаться своих системных правил, пока пользователь спорит. Протестируйте оба варианта на разговорах, которые не удались в прошлом.
Что ломается или становится дорогим при изменении усилий
Небольшой max_tokens может закончить ответ до его начала. Мыслительный процесс учитывается в max_tokens. Ограничение, рассчитанное на классификацию из одного слова, скажем, 50 токенов, может быть полностью потрачено на мышление, и ответ заканчивается с stop_reason: "max_tokens" и без текста. Увеличьте лимит, чтобы оставить место, или уменьшите усилия.
Изменение усилий в середине разговора сбрасывает кэш. Изменение значения усилий верхнего уровня между запросами делает недействительным кэш подсказок для сообщений разговора. Если агенту нужно сделать один сложный ход на high внутри разговора на low, Anthropic предлагает изменение усилий для каждого сообщения (бета-заголовок mid-conversation-output-config-2026-07-01, Claude API и Google Cloud), которое сохраняет кэш. Это требует, чтобы мышление было включено. Стоит проверить, передает ли шлюз этот бета-заголовок, прежде чем полагаться на него.
Отключение мышления имеет свои ограничения. thinking: {"type": "disabled"} принимается на low, medium и high. На xhigh или max это возвращает 400. При отключенном мышлении изменение усилий для каждого сообщения также возвращает 400, и модель может пропустить вызов инструмента, который ей нужен, когда тот же запрос запрашивает вывод в формате JSON. Рекомендация Anthropic — оставить мышление включенным и использовать более низкий уровень усилий вместо этого.
Низкие усилия могут закончиться рано. С длинной системной подсказкой кодирующего агента на low Haiku 5.5 иногда останавливается до завершения работы и возвращает задачу. В тестировании Anthropic переход с low на medium примерно вдвое сократил ранние остановки и более чем удвоил выходные токены за попытку. Руководство по подсказкам Haiku 5.5 содержит короткую инструкцию "продолжать работать до завершения", которая решает ту же проблему по более низкой цене.
Низкие и средние уровни могут пропустить проверку. При выполнении кодировочных задач модель иногда сообщает о завершении изменения без выполнения теста. В руководстве по подсказкам есть параграф о проверке для этого; это стоит токенов, но увеличивает долю проверенных изменений.
Xhigh может вернуть пустой ответ. В многоповоротных чатах на xhigh модель иногда пишет весь свой ответ внутри своего мышления и заканчивает поворот без видимого текста. Если вы работаете на xhigh, проверьте наличие пустых текстовых блоков.
Принудительный инструмент пропускает мышление. Haiku 5.5 принимает принудительный tool_choice, но ответ тогда начинается с вызова инструмента и без мышления. Если модели нужно рассуждать перед вызовом инструмента, используйте auto и укажите в подсказке, когда его вызывать.
Запустите свой собственный анализ усилий через AIHubMix
Самый быстрый способ выбора — запустить одни и те же 20-50 реальных подсказок на двух или трех уровнях и сравнить качество, выходные токены и задержку. Через AIHubMix Claude native endpoint, с установленным AIHUBMIX_API_KEY:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"Суммируйте этот тикет поддержки в одном предложении: ...",
"Извлеките номер счета и общую сумму из: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# Сохраните `text` рядом с подсказкой и оцените его по своей шкале.
print(f"{effort}: {out_tokens} выходных токенов, {seconds:.1f}с всего")
Если выходные токены едва меняются между low и high, настройка, вероятно, не достигает модели; проверьте запрос, который ваш шлюз пересылает. На странице Haiku 5.5 на AIHubMix цена за токен одинакова на каждом уровне усилий, поэтому количество токенов из этого анализа напрямую переводится в доллары.
Часто задаваемые вопросы
Какой уровень усилий по умолчанию для Claude Haiku 5.5?
Средний. Большинство текущих моделей Claude по умолчанию используют высокий уровень, поэтому код, который полагался на уровень по умолчанию для другой модели, будет работать с Haiku 5.5 на один уровень ниже, если не установить усилия явно.
Могу ли я полностью отключить мышление?
На низком, среднем и высоком уровнях — да, установив мышление в отключенное. На xhigh и max это возвращает ошибку. Anthropic рекомендует вместо этого понизить усилия, потому что модель может сама пропустить мышление по простым запросам и сохраняет свое поведение при вызове инструментов.
Какой уровень усилий самый дешевый?
Низкий. В запусках Artificial Analysis он использовал около 32 миллионов выходных токенов для всего индекса против 54 миллионов на среднем и 440 миллионов на максимальном. Цена за токен одинакова на каждом уровне; разница в том, сколько токенов генерируется.
Стоит ли максимальные усилия на Haiku 5.5?
Только с доказательствами из ваших собственных оценок. В FrontierCode максимальный стоил примерно в десять раз больше, чем средний, за прирост в 4,8 балла. На этом этапе Anthropic предлагает сравнить с Sonnet 5.5, который может достичь того же качества за меньшую цену.
Почему мои ответы заканчиваются без текста?
Обычно потому, что мышление использовало max_tokens до начала ответа. Увеличьте max_tokens или понизьте усилия. На xhigh в многоповоротных чатах пустой ответ также может означать, что модель поместила свой ответ внутри своего мышления.
Влияет ли изменение усилий на кэширование подсказок?
Да. Изменение усилий верхнего уровня между запросами делает недействительными кэшированные сообщения для этого разговора. Изменение усилий для каждого сообщения, в настоящее время в бета-версии, избегает этого.
Почему бенчмарки запуска не совпадают с тем, что я вижу на уровне по умолчанию?
Запусковые данные были получены при максимальных усилиях. На среднем уровне системная карта сообщает о более низких оценках, например, 1277 вместо 1620 на GDPval-AA.
Продолжайте читать: серия Claude Haiku 5.5
- Усилия определяют, сколько токенов вы генерируете. Чтобы узнать, как Haiku 5.5 сравнивается с Haiku 4.5, GPT-6 Luna и Sonnet 5.5 на верхнем уровне, прочитайте Claude Haiku 5.5 против Haiku 4.5: Что сейчас можно купить за десять центов
- Мыслительные токены тарифицируются как выходные, а длина подсказки определяет тарифную карту. Чтобы превратить ваш выбор усилий в ежемесячный счет, прочитайте Цены на Claude Haiku 5.5: Линия в 100K за 90% скидки
- Усилия заменяют старый бюджет мышления, и старый бюджет теперь возвращает ошибку. Для этого исправления и остальных изменений при переходе с Haiku 4.5 на 5.5 прочитайте Миграция с Claude Haiku 4.5 на 5.5: Пять ошибок 400 и тихие изменения
Источники
- Усилия (Документация платформы Claude)
- Подсказки для Claude Haiku 5.5 (Документация платформы Claude)
- Claude Haiku 5.5 на AIHubMix
- Анализ интеллекта, производительности и цен на Claude Haiku 5.5 (Artificial Analysis)
- Claude Haiku 5.5: Бенчмарки, спецификации, Sol и Luna в сравнении (Kingy.ai)



