Claude Haiku 5.5 Рівні зусиль: Середній - за замовчуванням, Низький - часто достатньо

AIHubMix7 хв читання
Claude Haiku 5.5 Рівні зусиль: Середній - за замовчуванням, Низький - часто достатньо

Claude Haiku 5.5 - це перший Haiku з налаштуванням зусиль, і це налаштування впливає на результат більше, ніж будь-що інше, що ви контролюєте. У незалежних запусках Artificial Analysis Haiku 5.5 при максимальних зусиллях набрав 43 бали в Індексі Інтелекту, а при низьких зусиллях - 29. Максимум також використав 440 мільйонів токенів виходу, щоб пройти через індекс; низький використав 32 мільйони.

Отже, коротка відповідь: залиште більшість роботи на за замовчуванням, medium. Знизьте високий обсяг, прості маршрути до low. Підвищте знання та суворе дотримання інструкцій до high. Розглядайте xhigh та max як налаштування, для яких вам потрібні докази, і порівняйте їх з Sonnet 5.5 перед тим, як приймати рішення.

У решті цього посту показано, що коштує кожен рівень, де підвищення перестає бути вигідним, і які налаштування ламаються або стають дорогими, коли ви змінюєте зусилля.

Що таке це налаштування

Claude Haiku 5.5 підтримує п’ять рівнів: low, medium, high, xhigh та max. За замовчуванням використовується medium, що є незвичним: більшість сучасних моделей Claude за замовчуванням використовують high, і лише Haiku 5.5 та Opus 5.5 мають за замовчуванням один рівень нижче. Відправка medium є тим самим, що й залишити параметр без змін.

Зусилля замінює ручний бюджет мислення, який використовував Haiku 4.5. Запит з thinking: {"type": "enabled", "budget_tokens": N} тепер повертає 400, тому немає старого числа, яке потрібно переносити. Згідно з документацією зусиль від Anthropic, ви встановлюєте його в output_config:

output_config={"effort": "low"}

Три факти формують все нижче:

  • Мислення за замовчуванням увімкнено. Haiku 5.5 виконує адаптивне мислення, якщо не вказано інше. Нижчі зусилля означають менше мислення, і на простих запитах модель може зовсім пропустити мислення.
  • Токени мислення - це токени виходу. Вони враховуються в max_tokens і нараховуються за ставкою виходу (0,50 доларів за мільйон на запитах до 100K токенів).
  • Запит на менше мислення в запиті не працює. У тестах Anthropic модель все ще думала, коли запит говорив їй відповісти безпосередньо. Зусилля - це важіль.

Що коштує кожен рівень

Джерела з двох незалежних досліджень виміряли Haiku 5.5 на різних рівнях зусиль. Дані індексу походять з Artificial Analysis; дані FrontierCode походять з публічного файлу результатів Cognition, зібраного Kingy.ai. Жодне з них не охоплює вашу роботу, тому розглядайте їх як форму кривої, а не як ваші числа.

Індекс інтелекту Artificial Analysis v4.3.2 (десять оцінок, від знань до термінальних завдань):

Зусилля Оцінка індексу Токени виходу для індексу Вартість за завдання Час до першого токена
low 29 32M $0.02 9.9 с
medium 34 54M $0.05 13.4 с
high 38 97M $0.08 28.0 с
max 43 440M $0.21 н/д

Artificial Analysis не опублікував запуску xhigh. Його показник затримки при максимальних зусиллях виглядав аномально, тому він не включений.

FrontierCode 1.1 Головний, Haiku 5.5 працює в Claude Code:

Зусилля Складова оцінка Вартість за реалізацію Токени виходу за реалізацію
low 34.8% $0.06 23,868
medium 41.6% $0.13 36,172
high 41.9% $0.26 55,149
xhigh 45.8% $0.63 100,847
max 46.4% $1.33 181,387

Витрати округлені до центу.

Читати дві таблиці разом, три речі виділяються.

Перехід з низького на середній - найдешевший крок. У індексі він купує 5 балів за приблизно 1,7 разу більше токенів виходу. У FrontierCode він купує 6,8 балів за приблизно вдвічі більшу вартість за реалізацію.

Перехід з середнього на високий може бути пласким. У FrontierCode високий набрав 0,3 бали більше, ніж середній, і коштував приблизно вдвічі більше. У більш широкому індексі високий додав 4 бали. Чи виглядає ваша робота як перший випадок чи другий - це саме те, що швидка оцінка вам скаже.

Два верхні рівні дорогі. Від високого до максимального в індексі токени виходу зростають приблизно в 4,5 рази за 5 балів. У FrontierCode максимальний коштує приблизно в десять разів більше, ніж середній за 4,8 бали, а перехід з xhigh на max приблизно подвоює витрати за 0,6 балів. Вказівки Anthropic кажуть те саме простими словами: використовуйте xhigh та max лише там, де ваші оцінки показують вигоду, і спочатку порівняйте їх з Sonnet 5.5 за продуктивністю, вартістю та швидкістю.

Ще одна причина, чому за замовчуванням важливо: бенчмарки запуску Anthropic були проведені при максимальних зусиллях. Результати середніх зусиль системної картки нижчі (1277 на GDPval-AA замість 1620). Якщо ви розгортаєте за замовчуванням, це числа, з якими потрібно порівнювати.

З чого почати, залежно від навантаження

Навантаження Почати з Перейти на вищий рівень, коли
Класифікація, маршрутизація, тегування low Мітки зміщуються у складних випадках
Витягування з коротких документів low Поля пропускаються або об'єднуються
Чат та підтримка в реальному часі low Правила порушуються в довгих чатах
Резюме та стиснення medium Ключові деталі випадають
Робота підагента під більшим моделлю medium Головна модель повторює роботу
Агентне кодування, вузькі зміни medium Тести не проходять з першої спроби
Знання, довгі завдання агента high Оцінки показують запас

Ці початкові точки слідують рекомендаціям Anthropic для Haiku 5.5; сигнали "перейти на вищий рівень" - це те, на що слід звертати увагу у ваших власних журналах.

Є один рядок, який варто переглянути ще раз - чат. Низький рівень є найшвидшим, що підходить для підтримки в реальному часі. Але Anthropic рекомендує high, коли дотримання інструкцій є найважливішим, наприклад, для асистента підтримки, який повинен дотримуватися своїх системних правил, поки користувач сперечається. Протестуйте обидва на розмовах, які пройшли неправильно в минулому.

Що ламається або стає дорогим, коли змінюються зусилля

Маленький max_tokens може закінчити відповідь, перш ніж вона почнеться. Мислення враховується в max_tokens. Ліміт, розрахований на класифікацію одного слова, скажімо, 50 токенів, може бути витрачений повністю на мислення, і відповідь закінчується з stop_reason: "max_tokens" і без тексту. Підвищте ліміт, щоб залишити місце, або знизьте зусилля.

Зміна зусиль під час розмови скидає кеш. Зміна значення зусиль верхнього рівня між запитами анулює кеш запитів для повідомлень розмови. Якщо агенту потрібно одне важке рішення на high всередині розмови на low, Anthropic пропонує зміну зусиль для кожного повідомлення (бета-заголовок mid-conversation-output-config-2026-07-01, Claude API та Google Cloud), яка зберігає кеш. Це вимагає, щоб мислення було увімкнено. Чи проходить шлюз цей бета-заголовок, варто перевірити, перш ніж покладатися на це.

Вимкнення мислення має обмеження. thinking: {"type": "disabled"} приймається на low, medium та high. На xhigh або max це повертає 400. При вимкненому мисленні зміна зусиль для кожного повідомлення також повертає 400, і модель може пропустити виклик інструмента, який їй потрібен, коли той самий запит запитує JSON-вихід. Порада Anthropic - залишити мислення увімкненим і використовувати нижчий рівень зусиль замість цього.

Низькі зусилля можуть закінчитися раніше. З довгим системним запитом кодування на low Haiku 5.5 іноді зупиняється, перш ніж робота закінчена, і повертає завдання назад. У тестах Anthropic перехід з low на medium приблизно вдвічі зменшив раннє завершення і більш ніж удвічі збільшив токени виходу за спробу. Посібник з запитів Haiku 5.5 має коротку інструкцію "продовжуйте працювати, поки не закінчите", яка вирішує ту ж проблему за нижчою ціною.

Низькі та середні можуть пропустити перевірку. У завданнях кодування модель іноді повідомляє про зміну як завершену, не запустивши тест. Посібник з запитів має параграф перевірки для цього; це коштує токенів, але підвищує частку перевірених змін.

Xhigh може повернути порожню відповідь. У багатоповторних чатах на xhigh модель іноді пише всю свою відповідь всередині свого мислення і закінчує поворот без видимого тексту. Якщо ви працюєте на xhigh, перевірте на наявність порожніх текстових блоків.

Примус виклику інструмента пропускає мислення. Haiku 5.5 приймає примусовий tool_choice, але відповідь тоді починається з виклику інструмента і без мислення. Якщо моделі потрібно міркувати перед викликом інструмента, використовуйте auto і вкажіть у запиті, коли його викликати.

Запустіть власний аналіз зусиль через AIHubMix

Найшвидший спосіб вибрати - це запустити ті ж 20-50 реальних запитів на двох або трьох рівнях і порівняти якість, токени виходу та затримку. Через AIHubMix Claude native endpoint, з AIHUBMIX_API_KEY встановленим:

import os
import time
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

prompts = [
    "Підсумуйте цей запит на підтримку в одному реченні: ...",
    "Витягніть номер рахунку та загальну суму з: ...",
]

for effort in ["low", "medium", "high"]:
    out_tokens, seconds = 0, 0.0
    for prompt in prompts:
        start = time.time()
        r = client.messages.create(
            model="claude-haiku-5-5",
            max_tokens=8000,
            output_config={"effort": effort},
            messages=[{"role": "user", "content": prompt}],
        )
        seconds += time.time() - start
        out_tokens += r.usage.output_tokens
        text = next((b.text for b in r.content if b.type == "text"), "")
        # Збережіть `text` поруч із запитом і оцініть його за вашими критеріями.
    print(f"{effort}: {out_tokens} токенів виходу, {seconds:.1f}с всього")

Якщо токени виходу ледь змінюються між low та high, налаштування, ймовірно, не досягає моделі; перевірте запит, який ваш шлюз пересилає. На сторінці Haiku 5.5 на AIHubMix ціна за токен однакова на кожному рівні зусиль, тому кількість токенів з цього аналізу безпосередньо перетворюється на долари.

Часті запитання

Який рівень зусиль за замовчуванням для Claude Haiku 5.5?
Середній. Більшість сучасних моделей Claude за замовчуванням використовують високий рівень, тому код, який покладався на за замовчуванням для іншої моделі, запустить Haiku 5.5 на один рівень нижче, якщо не вказати зусилля явно.

Чи можу я повністю вимкнути мислення?
На низькому, середньому та високому рівнях - так, встановивши мислення на вимкнене. На xhigh та max це повертає помилку. Anthropic рекомендує знижувати зусилля замість цього, оскільки модель може пропустити мислення на простих запитах самостійно і зберігає свою поведінку виклику інструментів.

Який рівень зусиль найдешевший?
Низький. У запусках Artificial Analysis він використав близько 32 мільйонів токенів виходу для всього індексу проти 54 мільйонів на середньому та 440 мільйонів на максимальному. Ціна за токен однакова на кожному рівні; різниця в тому, скільки токенів генерується.

Чи варто використовувати максимальні зусилля на Haiku 5.5?
Тільки з доказами з ваших власних оцінок. У FrontierCode максимальні зусилля коштували приблизно в десять разів більше, ніж середні за приріст у 4,8 бали. На цьому етапі Anthropic пропонує порівняти з Sonnet 5.5, який може досягти такої ж якості за меншу ціну.

Чому мої відповіді закінчуються без тексту?
Зазвичай тому, що мислення використало max_tokens перед початком відповіді. Підвищте max_tokens або знизьте зусилля. На xhigh у багатоповторних чатах порожня відповідь також може означати, що модель помістила свою відповідь всередину свого мислення.

Чи впливає зміна зусиль на кешування запитів?
Так. Зміна зусиль верхнього рівня між запитами анулює кешовані повідомлення для цієї розмови. Зміна зусиль для кожного повідомлення, яка наразі в бета-версії, уникає цього.

Чому бенчмарки запуску не збігаються з тим, що я бачу за замовчуванням?
Запускові дані були проведені при максимальних зусиллях. На середньому рівні системна картка повідомляє про нижчі результати, наприклад, 1277 замість 1620 на GDPval-AA.

Продовжуйте читати: серія Claude Haiku 5.5

Джерела