Уровни усилий Claude Haiku 5.5: Средний по умолчанию, низкий часто достаточно

AIHubMix7 мин чтения
Уровни усилий Claude Haiku 5.5: Средний по умолчанию, низкий часто достаточно

Claude Haiku 5.5 — это первый Haiku с настройкой усилий, и эта настройка влияет на результат больше, чем что-либо другое, что вы контролируете. В независимых запусках Artificial Analysis Haiku 5.5 при максимальных усилиях набрал 43 балла в Индексе Интеллекта, а при низких усилиях — 29. Максимум также использовал 440 миллионов токенов на выходе для прохождения индекса; низкий использовал 32 миллиона.

Так что короткий ответ: оставьте большую часть работы на уровне по умолчанию, medium. Переведите высокообъемные, простые маршруты на low. Повышайте уровень знаний и строгое следование инструкциям до high. Рассматривайте xhigh и max как настройки, для которых вам нужны доказательства, и сравните их с Sonnet 5.5, прежде чем принимать решение.

Остальная часть этого поста показывает, сколько стоит каждый уровень, где повышение перестает оправдывать затраты и какие настройки ломаются или становятся дорогими при изменении усилий.

Что такое эта настройка

Claude Haiku 5.5 поддерживает пять уровней: low, medium, high, xhigh и max. Уровень по умолчанию — medium, что необычно: большинство текущих моделей Claude по умолчанию используют high, и только Haiku 5.5 и Opus 5.5 по умолчанию на один уровень ниже. Отправка medium эквивалентна отсутствию параметра.

Усилия заменяют ручной бюджет мышления, который использовал Haiku 4.5. Запрос с thinking: {"type": "enabled", "budget_tokens": N} теперь возвращает 400, так что нет старого числа, которое можно было бы перенести. Согласно документации по усилиям от Anthropic, вы устанавливаете его в output_config:

output_config={"effort": "low"}

Три факта формируют все ниже:

  • Мыслительный процесс включен по умолчанию. Haiku 5.5 использует адаптивное мышление, если не указано иное. Низкие усилия означают меньше мышления, и при простых запросах модель может полностью пропустить мышление.
  • Мыслительные токены — это выходные токены. Они учитываются в max_tokens и тарифицируются по выходной ставке (0,50 доллара за миллион на запросах до 100K токенов).
  • Запрос на меньшее мышление в подсказке не работает. В тестировании Anthropic модель все равно думала, когда подсказка говорила ей ответить напрямую. Усилия — это рычаг.

Сколько стоит каждый уровень

Два независимых источника измерили Haiku 5.5 по уровням усилий. Индексные данные получены из Artificial Analysis; данные FrontierCode получены из публичного файла результатов Cognition, составленного Kingy.ai. Ни один из них не охватывает вашу рабочую нагрузку, поэтому рассматривайте их как форму кривой, а не как ваши числа.

Индекс интеллекта Artificial Analysis v4.3.2 (десять оценок, от работы с знаниями до терминальных задач):

Усилия Индексный балл Выходные токены для индекса Стоимость за задачу Время до первого токена
low 29 32M $0.02 9.9 с
medium 34 54M $0.05 13.4 с
high 38 97M $0.08 28.0 с
max 43 440M $0.21 n/a

Artificial Analysis не опубликовал запуск xhigh. Его показатель задержки при максимальных усилиях выглядел аномально, поэтому он был исключен.

FrontierCode 1.1 Main, Haiku 5.5 работает в Claude Code:

Усилия Составной балл Стоимость за развертывание Выходные токены за развертывание
low 34.8% $0.06 23,868
medium 41.6% $0.13 36,172
high 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
max 46.4% $1.33 181,387

Стоимость округлена до цента.

Сравните две таблицы, и три вещи выделяются.

Переход с низкого на средний — самый дешевый шаг. В индексе он дает 5 баллов за примерно 1,7 раза больше выходных токенов. В FrontierCode он дает 6,8 баллов за примерно вдвое большую стоимость за развертывание.

Переход со среднего на высокий может быть плоским. В FrontierCode высокий набрал 0,3 балла выше среднего и стоил примерно вдвое больше. В более широком индексе высокий добавил 4 балла. То, как выглядит ваша рабочая нагрузка, — это именно то, что быстрая оценка вам подскажет.

Два верхних уровня дороги. Переход с высокого на максимальный в индексе приводит к увеличению выходных токенов примерно в 4,5 раза за 5 баллов. В FrontierCode максимальный стоит примерно в десять раз больше, чем средний, за 4,8 дополнительных балла, а переход с xhigh на max примерно удваивает стоимость за 0,6 балла. Рекомендации Anthropic говорят то же самое более простыми словами: используйте xhigh и max только там, где ваши оценки показывают прирост, и сначала сравните их с Sonnet 5.5 по производительности, стоимости и скорости.

Еще одна причина, почему уровень по умолчанию важен: бенчмарки запуска Anthropic проводились на максимальных усилиях. Результаты системы на среднем уровне ниже (1277 на GDPval-AA вместо 1620). Если вы развертываете на уровне по умолчанию, это те числа, с которыми нужно сравнивать.

С чего начать в зависимости от рабочей нагрузки

Рабочая нагрузка Начать с Перейти на более высокий уровень, когда
Классификация, маршрутизация, тегирование low Метки смещаются в сложных случаях
Извлечение из коротких документов low Поля пропускаются или объединяются
Чат и поддержка в реальном времени low Правила слабеют в длинных чатах
Резюме и сжатие medium Ключевые детали выпадают
Работа подагентов в рамках более крупной модели medium Ведущая модель переделывает работу
Кодирование с агентским подходом, узкие изменения medium Тесты не проходят с первой попытки
Работа с знаниями, длительные задачи агентов high Оценки показывают запас

Эти начальные точки следуют рекомендациям Anthropic для Haiku 5.5; сигналы "перейти на более высокий уровень" — это то, на что стоит обратить внимание в ваших собственных логах.

Единственная строка, на которую стоит обратить внимание, — это чат. Низкий уровень — самый быстрый, что подходит для поддержки в реальном времени. Но Anthropic рекомендует high, когда следование инструкциям имеет наибольшее значение, например, для помощника по поддержке, который должен придерживаться своих системных правил, пока пользователь спорит. Протестируйте оба варианта на разговорах, которые не удались в прошлом.

Что ломается или становится дорогим при изменении усилий

Небольшой max_tokens может закончить ответ до его начала. Мыслительный процесс учитывается в max_tokens. Ограничение, рассчитанное на классификацию из одного слова, скажем, 50 токенов, может быть полностью потрачено на мышление, и ответ заканчивается с stop_reason: "max_tokens" и без текста. Увеличьте лимит, чтобы оставить место, или уменьшите усилия.

Изменение усилий в середине разговора сбрасывает кэш. Изменение значения усилий верхнего уровня между запросами делает недействительным кэш подсказок для сообщений разговора. Если агенту нужно сделать один сложный ход на high внутри разговора на low, Anthropic предлагает изменение усилий для каждого сообщения (бета-заголовок mid-conversation-output-config-2026-07-01, Claude API и Google Cloud), которое сохраняет кэш. Это требует, чтобы мышление было включено. Стоит проверить, передает ли шлюз этот бета-заголовок, прежде чем полагаться на него.

Отключение мышления имеет свои ограничения. thinking: {"type": "disabled"} принимается на low, medium и high. На xhigh или max это возвращает 400. При отключенном мышлении изменение усилий для каждого сообщения также возвращает 400, и модель может пропустить вызов инструмента, который ей нужен, когда тот же запрос запрашивает вывод в формате JSON. Рекомендация Anthropic — оставить мышление включенным и использовать более низкий уровень усилий вместо этого.

Низкие усилия могут закончиться рано. С длинной системной подсказкой кодирующего агента на low Haiku 5.5 иногда останавливается до завершения работы и возвращает задачу. В тестировании Anthropic переход с low на medium примерно вдвое сократил ранние остановки и более чем удвоил выходные токены за попытку. Руководство по подсказкам Haiku 5.5 содержит короткую инструкцию "продолжать работать до завершения", которая решает ту же проблему по более низкой цене.

Низкие и средние уровни могут пропустить проверку. При выполнении кодировочных задач модель иногда сообщает о завершении изменения без выполнения теста. В руководстве по подсказкам есть параграф о проверке для этого; это стоит токенов, но увеличивает долю проверенных изменений.

Xhigh может вернуть пустой ответ. В многоповоротных чатах на xhigh модель иногда пишет весь свой ответ внутри своего мышления и заканчивает поворот без видимого текста. Если вы работаете на xhigh, проверьте наличие пустых текстовых блоков.

Принудительный инструмент пропускает мышление. Haiku 5.5 принимает принудительный tool_choice, но ответ тогда начинается с вызова инструмента и без мышления. Если модели нужно рассуждать перед вызовом инструмента, используйте auto и укажите в подсказке, когда его вызывать.

Запустите свой собственный анализ усилий через AIHubMix

Самый быстрый способ выбора — запустить одни и те же 20-50 реальных подсказок на двух или трех уровнях и сравнить качество, выходные токены и задержку. Через AIHubMix Claude native endpoint, с установленным AIHUBMIX_API_KEY:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Суммируйте этот тикет поддержки в одном предложении: ...",
    "Извлеките номер счета и общую сумму из: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Сохраните `text` рядом с подсказкой и оцените его по своей шкале.
    print(f"{effort}: {out_tokens} выходных токенов, {seconds:.1f}с всего")

Если выходные токены едва меняются между low и high, настройка, вероятно, не достигает модели; проверьте запрос, который ваш шлюз пересылает. На странице Haiku 5.5 на AIHubMix цена за токен одинакова на каждом уровне усилий, поэтому количество токенов из этого анализа напрямую переводится в доллары.

Часто задаваемые вопросы

Какой уровень усилий по умолчанию для Claude Haiku 5.5?
Средний. Большинство текущих моделей Claude по умолчанию используют высокий уровень, поэтому код, который полагался на уровень по умолчанию для другой модели, будет работать с Haiku 5.5 на один уровень ниже, если не установить усилия явно.

Могу ли я полностью отключить мышление?
На низком, среднем и высоком уровнях — да, установив мышление в отключенное. На xhigh и max это возвращает ошибку. Anthropic рекомендует вместо этого понизить усилия, потому что модель может сама пропустить мышление по простым запросам и сохраняет свое поведение при вызове инструментов.

Какой уровень усилий самый дешевый?
Низкий. В запусках Artificial Analysis он использовал около 32 миллионов выходных токенов для всего индекса против 54 миллионов на среднем и 440 миллионов на максимальном. Цена за токен одинакова на каждом уровне; разница в том, сколько токенов генерируется.

Стоит ли максимальные усилия на Haiku 5.5?
Только с доказательствами из ваших собственных оценок. В FrontierCode максимальный стоил примерно в десять раз больше, чем средний, за прирост в 4,8 балла. На этом этапе Anthropic предлагает сравнить с Sonnet 5.5, который может достичь того же качества за меньшую цену.

Почему мои ответы заканчиваются без текста?
Обычно потому, что мышление использовало max_tokens до начала ответа. Увеличьте max_tokens или понизьте усилия. На xhigh в многоповоротных чатах пустой ответ также может означать, что модель поместила свой ответ внутри своего мышления.

Влияет ли изменение усилий на кэширование подсказок?
Да. Изменение усилий верхнего уровня между запросами делает недействительными кэшированные сообщения для этого разговора. Изменение усилий для каждого сообщения, в настоящее время в бета-версии, избегает этого.

Почему бенчмарки запуска не совпадают с тем, что я вижу на уровне по умолчанию?
Запусковые данные были получены при максимальных усилиях. На среднем уровне системная карта сообщает о более низких оценках, например, 1277 вместо 1620 на GDPval-AA.

Продолжайте читать: серия Claude Haiku 5.5

Источники