Цены на Claude Haiku 5.5: Линия в 100K за 90% скидки

AIHubMix8 мин чтения
Цены на Claude Haiku 5.5: Линия в 100K за 90% скидки

Claude Haiku 5.5 стоит $0.10 за миллион входных токенов и $0.50 за миллион выходных токенов, что в десять раз меньше, чем $1 и $5 для Haiku 4.5. Это касается запросов до 100,000 токенов. Сверх этой линии весь запрос тарифицируется по $0.50 и $2.50, что составляет половину цены Haiku 4.5, а не десятую.

Anthropic оценивает типичную экономию примерно в 75%, а не 90%, и разница объясняется тремя факторами, которые рассматриваются в этом посте: где ваши запросы находятся относительно линии в 100K, сколько токенов для размышлений генерируют настройки по умолчанию и новый токенизатор, который считает тот же текст примерно на 30% больше токенов. Два примера ниже показывают, как выглядит реальный счет.

Тарифная карта

Цены за миллион токенов, из поста о запуске Haiku 5.5 и страницы цен Anthropic:

Тип токена Haiku 5.5, короткий Haiku 5.5, длинный Haiku 4.5 Sonnet 5.5
Вход $0.10 $0.50 $1.00 $2.00
Выход $0.50 $2.50 $5.00 $10.00
Чтение кэша $0.01 $0.05 $0.10 $0.10
Запись кэша, 5 мин $0.125 $0.625 $1.25 $2.50
Запись кэша, 1 час $0.20 $1.00 $2.00 $4.00

«Короткий» означает запрос из 100,000 токенов или меньше; «длинный» — более 100,000. API Batch снижает цены на входные и выходные токены на 50%. Цена чтения кэша Sonnet 5.5 была снижена с $0.20 до $0.10 в тот же день.

Страница Haiku 5.5 на AIHubMix перечисляет те же два уровня, с веб-поиском по $0.01 за запрос.

Правила выставления счетов, которые легко пропустить

Весь запрос меняет уровень, а не только излишек. Anthropic оценивает Haiku 5.5 с помощью двух тарифных карт, выбранных в зависимости от длины запроса. Запрос из 100,000 токенов платит $0.0100 за вход; запрос из 100,001 токенов платит $0.0500, и его выход стоит в пять раз больше. Haiku 5.5 — исключение: другие текущие модели с контекстом 1M от Anthropic выставляют счет за полный объем по своим стандартным тарифам.

Линия появляется раньше, чем ваши старые панели управления предполагают. Haiku 5.5 использует новый токенизатор, и тот же текст производит примерно на 30% больше токенов, чем на Haiku 4.5. Деление 100,000 на 1.3 ставит линию около 77,000 токенов, как их считал Haiku 4.5. Запрос на 78,000 токенов на вашей старой панели управления становится примерно 101,000 токенов на Haiku 5.5 и оплачивается по длинному тарифу. Эта арифметика основана на 30% в руководстве по миграции Anthropic; точное увеличение зависит от содержания, поэтому пересчитайте реальные запросы на новой модели.

Размышления включены по умолчанию и тарифицируются как выход. Haiku 4.5 размышлял только по запросу. Haiku 5.5 выполняет адаптивное размышление с усилием medium, если вы не измените это, поэтому маршрут, который раньше возвращал 200 выходных токенов, теперь может вернуть на несколько сотен больше.

Короткие запросы теперь могут быть кэшированы. Минимальный кэшируемый запрос снижен с 4,096 токенов на Haiku 4.5 до 512 на Haiku 5.5, согласно руководству по миграции Anthropic. Системный запрос на 3,000 токенов, который никогда не мог быть кэширован на Haiku 4.5, теперь может быть кэширован, и чтение кэша стоит десятую часть цены входа.

Приоритетный уровень недоступен. Если у вас есть обязательство по Приоритетному уровню на Haiku 4.5, оно не переносится на Haiku 5.5. Планируйте емкость отдельно.

Кэшированные токены и линия в 100K: предположите, что они считаются. Anthropic указывает отдельную цену чтения кэша для каждого уровня, что предполагает, что весь запрос, кэшированный или нет, определяет уровень. Anthropic не уточнил это, поэтому безопасное предположение заключается в том, что кэшированный префикс в 95K плюс вопрос в 6K — это длинный запрос.

Пример 1: классификатор заявок на поддержку

Предположения, в подсчетах токенов Haiku 4.5: системный запрос на 3,000 токенов с определениями инструментов, заявка на 1,000 токенов, ответ на 200 токенов и 1 миллион запросов в месяц. Haiku 4.5 работает с выключенными размышлениями.

На Haiku 5.5 тот же текст становится 3,900 + 1,300 входных токенов и ответом на 260 токенов. Предполагается, что размышления добавляют 300 токенов при low усилии и 800 при medium. Эти цифры размышлений являются предположениями; измерьте свои.

Настройка За запрос В месяц
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, низкое, без кэша $0.00080 $800
Haiku 5.5, низкое, кэшированный префикс $0.00045 $453
Haiku 5.5, среднее, кэшированный префикс $0.00070 $703
Sonnet 5.5, среднее, кэшированный префикс $0.01359 $13,674

Ежемесячные кэшированные строки включают около $4 записей кэша для Haiku 5.5 и около $84 для Sonnet 5.5, предполагая одну запись на 5 минут каждые пять минут. Sonnet 5.5 использует те же предположения о токенах, что и Haiku на среднем уровне.

Как складывается кэшированная строка low: 3,900 кэшированных токенов по $0.01 за миллион ($0.000039), плюс 1,300 свежих входных токенов по $0.10 ($0.00013), плюс 560 выходных токенов по $0.50 ($0.00028), итого $0.000449 за запрос.

Модель: кэширование и усилия вместе перемещают счет с 16% от старой стоимости (без кэша, низкое) до 9% (кэшированный, низкое). Оставляя усилия на уровне по умолчанию вместо low, добавляется около $250 в месяц при этом объеме. Ни один из выборов не имеет большого значения в абсолютных терминах по сравнению с $5,000 Haiku 4.5, поэтому случай классификатора — это то место, где заголовок о 90% реален.

Пример 2: обзор контракта, который пересекает линию

Предположения, в подсчетах токенов Haiku 4.5: контракт плюс инструкции на 70,000 токенов, ответ на 1,500 токенов, без кэширования. На Haiku 5.5 это становится 91,000 входных токенов, ответ на 1,950 токенов и предполагаемые 2,000 токенов размышлений на medium, итого 3,950 выходных токенов.

Теперь сделаем контракт на 14% длиннее: 80,000 токенов на Haiku 4.5, 104,000 на Haiku 5.5.

Размер контракта (подсчет Haiku 4.5) Haiku 4.5 Haiku 5.5 Изменение
70,000 токенов $0.0775 $0.0111 На 86% меньше
80,000 токенов $0.0875 $0.0619 На 29% меньше

Во втором ряду: 104,000 входных токенов по $0.50 за миллион ($0.052) плюс 3,950 выходных токенов по $2.50 ($0.0099). Четырнадцать процентов больше текста стоят в 5.6 раз дороже на Haiku 5.5.

Решение — оставаться ниже линии. Разделение более длинного контракта на два вызова по примерно 53,000 токенов каждый (половина контракта плюс инструкции в каждом) стоит около $0.015 в общей сложности по короткому тарифу, менее четверти стоимости одного длинного вызова. Сработает ли разделение, зависит от задачи; обзор по пунктам делится четко, вопрос, который требует всего документа сразу, — нет.

Как это соотносится по стоимости за задачу

По сравнению с Sonnet 5.5, Haiku 5.5 стоит примерно одну двадцатую от цены за токен на коротких запросах. Но цена за токен — это не цена за завершенную задачу. В сложном агентном кодировании Sonnet 5.5 набирает 70.6% на Terminal-Bench 4.0 по сравнению с 39.2% у Haiku 5.5, согласно отчетам Anthropic, и более дешевый запрос, который не проходит и повторяется, или выполняется более крупной моделью, не является дешевле. Собственные рекомендации Anthropic — сравнивать с Sonnet 5.5 перед запуском Haiku на xhigh или max. Sonnet 5.5 также подешевел в тот же день: его чтения кэша были сокращены вдвое, что, по словам Anthropic, снижает стоимость большинства агентных работ примерно на 20%.

По сравнению с GPT-6 Luna, цены на короткие запросы идентичны, включая чтения кэша. Разница заключается в правиле длинных запросов. Долгосрочная ставка Luna начинается выше 272,000 входных токенов и составляет $0.20 / $0.75, в то время как Haiku 5.5 начинается выше 100,000 и составляет $0.50 / $2.50. Для рабочей нагрузки между 100K и 272K токенов Luna значительно дешевле по списку цен. Обе модели используют разные токенизаторы, поэтому сравнивайте реальные счета, а не подсчеты токенов.

Цифры по порогу в 100K и эффекту токенизатора также были рассмотрены в рассылке Roo, арифметика которой совпадает с приведенными выше примерами.

Шаги, которые снижают счет

  1. Считайте токены на новой модели и предупреждайте перед 100K. Записывайте полный размер запроса для каждого вызова и предупреждайте при достижении около 90,000 токенов, чтобы запросы, которые поднимаются, были обрезаны или разделены до изменения уровня.
  2. Кэшируйте стабильный префикс. Системный запрос и определения инструментов первыми, переменные содержимое последними. С минимальным размером в 512 токенов большинство производственных системных запросов теперь подходят. Руководство по кэшированию запросов Claude от AIHubMix показывает формат запроса.
  3. Явно устанавливайте усилия. Используйте low для маршрутов с высоким объемом и простых. Уровень по умолчанию medium стоит дороже за каждый запрос, независимо от того, нужно ли это маршруту или нет.
  4. Размер max_tokens для размышлений плюс ответ. Слишком маленький, и вы платите за размышления, которые заканчиваются без ответа.
  5. Группируйте то, что может подождать. API Batch снижает цены на входные и выходные токены вдвое.
  6. Отправляйте вверх вместо повторной попытки вниз. Если тип задачи часто не проходит на Haiku, отправляйте его сначала на Sonnet 5.5, а не платите за попытки Haiku плюс резервный вариант.

Шаблон ведения журнала для шагов 1 и 2 через родной конечный пункт Claude от AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Вы сортируете заявки на поддержку..."  # стабильный, кэшируемый префикс

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"предупреждение: запрос на {prompt_tokens} токенов, близко к линии цены в 100K")
    return next(b.text for b in r.content if b.type == "text")

Если cache_read_input_tokens остается равным нулю при повторных вызовах, что-то в префиксе меняется между запросами, например, временная метка в системном запросе.

Часто задаваемые вопросы

Сколько стоит Claude Haiku 5.5?
Для запросов до 100,000 токенов — $0.10 за миллион входных токенов и $0.50 за миллион выходных токенов. Для более длинных запросов — $0.50 и $2.50, применяемые ко всему запросу. Чтения кэша стоят десятую часть цены входа, а API Batch снижает цены на входные и выходные токены вдвое.

Действительно ли Haiku 5.5 на 90% дешевле, чем Haiku 4.5?
За токен, на коротких запросах — да. За задачу — меньше: новый токенизатор считает примерно на 30% больше токенов для того же текста, размышления включены по умолчанию, а длинные запросы получают только 50% скидку. Anthropic оценивает типичную экономию примерно в 75%. Классификатор для коротких запросов с кэшированием может сэкономить около 90%.

Что произойдет, если мой запрос немного превысит 100,000 токенов?
Весь запрос переходит на более высокую тарифную карту, вход и выход одинаково. В приведенном выше примере контракта 14% больше текста сделало запрос в 5.6 раз дороже.

Считаются ли кэшированные токены в пороге в 100K?
Anthropic не заявил об этом явно. В его ценовых списках указаны отдельные цены на чтение кэша для каждого уровня, поэтому безопасное предположение заключается в том, что весь запрос, кэшированный или нет, определяет уровень.

Стоят ли токены размышлений дополнительно?
Они тарифицируются как выходные токены по нормальной выходной ставке. Поскольку размышления включены по умолчанию на среднем уровне, они могут значительно увеличивать стоимость маршрута, который раньше производил короткие ответы. Снижение усилий уменьшает их.

Дешевле ли Haiku 5.5, чем GPT-6 Luna?
На запросах до 100K токенов цены по списку одинаковы. Между 100K и 272K токенов Luna остается на своей базовой ставке, в то время как Haiku 5.5 переходит на более высокую, поэтому Luna дешевле в этом диапазоне по списку цен. Токенизаторы различаются, поэтому сравнивайте реальные счета.

Могу ли я использовать Приоритетный уровень с Haiku 5.5?
Нет. Приоритетный уровень не поддерживается на Haiku 5.5, поэтому обязательства по Haiku 4.5 не переносятся.

Продолжайте читать: серия Claude Haiku 5.5

Источники