Ціни на Claude Haiku 5.5: Лінія 100К за 90% знижки

AIHubMix8 хв читання
Ціни на Claude Haiku 5.5: Лінія 100К за 90% знижки

Claude Haiku 5.5 коштує $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів, що в десять разів менше, ніж $1 і $5 для Haiku 4.5. Це стосується запитів до 100,000 токенів. Вище цієї межі весь запит оплачується за $0.50 і $2.50, що є половиною ціни Haiku 4.5, а не десятою частиною.

Anthropic оцінює звичайну економію приблизно в 75%, а не 90%, і різниця виникає з трьох причин, які розглядаються в цьому пості: де ваші запити знаходяться відносно лінії 100К, скільки токенів для мислення генерують стандартні налаштування, і новий токенізатор, який рахує той же текст як приблизно на 30% більше токенів. Два приклади нижче показують, як виглядає реальний рахунок.

Тарифи

Ціни за мільйон токенів, з посту про запуск Haiku 5.5 від Anthropic Haiku 5.5 та сторінки цін:

Тип токена Haiku 5.5, короткий Haiku 5.5, довгий Haiku 4.5 Sonnet 5.5
Вхідний $0.10 $0.50 $1.00 $2.00
Вихідний $0.50 $2.50 $5.00 $10.00
Читання кешу $0.01 $0.05 $0.10 $0.10
Запис кешу, 5 хв $0.125 $0.625 $1.25 $2.50
Запис кешу, 1 година $0.20 $1.00 $2.00 $4.00

"Короткий" означає запит на 100,000 токенів або менше; "довгий" означає понад 100,000. Batch API знижує ціни на вхідні та вихідні токени на 50%. Ціна читання кешу для Sonnet 5.5 була знижена з $0.20 до $0.10 в той же день.

Сторінка Haiku 5.5 на AIHubMix містить ті ж два рівні, з веб-пошуком за $0.01 за запит.

Правила виставлення рахунків, які легко пропустити

Весь запит змінює рівень, а не лише надлишок. Anthropic ціни Haiku 5.5 з двома тарифами, обраними за довжиною запиту. Запит на 100,000 токенів платить $0.0100 за свій вхід; запит на 100,001 токен платить $0.0500, і його вихід також коштує в п'ять разів більше. Haiku 5.5 є винятком тут: інші поточні моделі 1M-контексту від Anthropic виставляють рахунок за повне вікно за своїми стандартними ставками.

Лінія приходить раніше, ніж ваші старі панелі управління вказують. Haiku 5.5 використовує новий токенізатор, і той же текст виробляє приблизно на 30% більше токенів, ніж на Haiku 4.5. Ділення 100,000 на 1.3 ставить лінію близько 77,000 токенів, як їх рахувала Haiku 4.5. Запит на 78,000 токенів на вашій старій панелі стає приблизно 101,000 токенів на Haiku 5.5 і оплачується за довгим тарифом. Ця арифметика походить з 30% у посібнику з міграції Anthropic; точне збільшення залежить від змісту, тому перераховуйте реальні запити на новій моделі.

Мислення включено за замовчуванням, і воно оплачується як вихід. Haiku 4.5 думав лише за запитом. Haiku 5.5 виконує адаптивне мислення з середнім зусиллям, якщо ви його не зміните, тому маршрут, який раніше повертав 200 вихідних токенів, тепер може повернути кілька сотень більше.

Короткі запити тепер можуть бути кешовані. Мінімальний кешований запит знижується з 4,096 токенів на Haiku 4.5 до 512 на Haiku 5.5, згідно з посібником з міграції Anthropic. Системний запит на 3,000 токенів, який ніколи не міг бути кешованим на Haiku 4.5, тепер може бути кешованим, а читання кешу коштує десяту частину від тарифу на вхід.

Пріоритетний рівень недоступний. Якщо у вас є зобов'язання на Пріоритетний рівень для Haiku 4.5, воно не переходить на Haiku 5.5. Плануйте потужність окремо.

Кешовані токени та лінія 100К: вважайте, що вони рахуються. Anthropic вказує окрему ціну читання кешу для кожного рівня, що свідчить про те, що весь запит, кешований чи ні, визначає рівень. Anthropic не роз'яснив це, тому безпечне припущення полягає в тому, що 95К кешований префікс плюс 6К запит є довгим запитом.

Приклад 1: класифікатор запитів підтримки

Припущення, в рахунках токенів Haiku 4.5: системний запит на 3,000 токенів з визначеннями інструментів, запит на 1,000 токенів, відповідь на 200 токенів і 1 мільйон запитів на місяць. Haiku 4.5 працює без мислення.

На Haiku 5.5 той же текст стає 3,900 + 1,300 вхідних токенів і відповіддю на 260 токенів. Припускається, що мислення додає 300 токенів при низькому зусиллі та 800 при середньому. Ці цифри для мислення є припущеннями; вимірюйте свої.

Налаштування За запитом За місяць
Haiku 4.5 $0.00500 $5,000
Haiku 5.5, низьке, без кешу $0.00080 $800
Haiku 5.5, низьке, кешований префікс $0.00045 $453
Haiku 5.5, середнє, кешований префікс $0.00070 $703
Sonnet 5.5, середнє, кешований префікс $0.01359 $13,674

Місячні кешовані рядки включають близько $4 записів кешу для Haiku 5.5 і близько $84 для Sonnet 5.5, припускаючи один 5-хвилинний запис кожні п'ять хвилин. Sonnet 5.5 використовує ті ж припущення токенів, що й Haiku на середньому рівні.

Як складається кешований рядок низьке: 3,900 кешованих токенів за $0.01 за мільйон ($0.000039), плюс 1,300 нових вхідних токенів за $0.10 ($0.00013), плюс 560 вихідних токенів за $0.50 ($0.00028), всього $0.000449 за запит.

Модель: кешування та зусилля разом зменшують рахунок з 16% від старої вартості (без кешу, низьке) до 9% (кешоване, низьке). Залишаючи зусилля на стандартному рівні замість низьке, додається близько $250 на місяць при такому обсязі. Жоден з виборів не має великого значення в абсолютних термінах поряд з $5,000 Haiku 4.5, тому випадок класифікатора є реальним прикладом 90% зниження.

Приклад 2: огляд контракту, що переходить межу

Припущення, в рахунках токенів Haiku 4.5: контракт плюс інструкції на 70,000 токенів, відповідь на 1,500 токенів, без кешування. На Haiku 5.5 це стає 91,000 вхідних токенів, відповіддю на 1,950 токенів і припущеними 2,000 токенами для мислення на середньому, отже, 3,950 вихідних токенів.

Тепер зробіть контракт на 14% довшим: 80,000 токенів на Haiku 4.5, 104,000 на Haiku 5.5.

Розмір контракту (рахунок Haiku 4.5) Haiku 4.5 Haiku 5.5 Зміна
70,000 токенів $0.0775 $0.0111 86% нижче
80,000 токенів $0.0875 $0.0619 29% нижче

Другий рядок: 104,000 вхідних токенів за $0.50 за мільйон ($0.052) плюс 3,950 вихідних токенів за $2.50 ($0.0099). Чотирнадцять відсотків більше тексту коштує в 5.6 разів дорожче на Haiku 5.5.

Вирішення полягає в тому, щоб залишитися нижче лінії. Розділення довшого контракту на два виклики приблизно по 53,000 токенів кожен (половина контракту плюс інструкції в кожному) коштує близько $0.015 загалом за коротким тарифом, менше чверті від одного довгого виклику. Чи спрацює розділення, залежить від завдання; огляд по пунктам розділяється чисто, питання, яке потребує всього документа одночасно, не може.

Як це порівнюється за вартістю за завдання

Проти Sonnet 5.5, Haiku 5.5 коштує приблизно двадцяту частину ціни за токен на коротких запитах. Але ціна за токен не є ціною за завершене завдання. У складному агентному кодуванні Sonnet 5.5 отримує 70.6% на Terminal-Bench 4.0, тоді як Haiku 5.5 - 39.2%, за даними Anthropic, і дешевший запит, який не вдається і повторюється, або виконується більшим моделлю, не є дешевшим. Власна порада Anthropic - порівнювати з Sonnet 5.5 перед запуском Haiku на xhigh або max. Sonnet 5.5 також подешевшав в той же день: його читання кешу були зменшені вдвічі, що, за словами Anthropic, знижує приблизно на 20% вартість більшості агентних робіт.

Проти GPT-6 Luna, ціни на короткі запити однакові, включаючи читання кешу. Різниця полягає в правилі для довгих запитів. Довгий контекст Luna починається вище 272,000 вхідних токенів і становить $0.20 / $0.75, тоді як Haiku 5.5 починається вище 100,000 і становить $0.50 / $2.50. Для навантаження між 100К і 272К токенів Luna є набагато дешевшою за списковою ціною. Обидві моделі використовують різні токенізатори, тому порівнюйте виміряні рахунки, а не рахунки токенів.

Цифри на порозі 100К та ефект токенізатора також були розглянуті в розсилці Roo, арифметика якої збігається з наведеними вище прикладами.

Кроки, які знижують рахунок

  1. Рахуйте токени на новій моделі та попереджайте перед 100К. Логуйте повний розмір запиту для кожного запиту та попереджайте приблизно на 90,000 токенів, щоб запити, які підвищуються, були скорочені або розділені перед зміною рівня.
  2. Кешуйте стабільний префікс. Спочатку системний запит та визначення інструментів, останні - змінний вміст. З мінімумом у 512 токенів більшість виробничих системних запитів тепер відповідають вимогам. Посібник з кешування запитів AIHubMix показує формат запиту.
  3. Встановіть зусилля явно. Використовуйте низьке для простих маршрутів з високим обсягом. Стандартне середнє коштує дорожче за кожен запит, незалежно від того, чи потрібен маршрут.
  4. Визначте max_tokens для мислення плюс відповідь. Занадто малий, і ви платите за мислення, яке закінчується без відповіді.
  5. Групуйте те, що може почекати. Batch API знижує тарифи на вхідні та вихідні токени вдвічі.
  6. Направляйте вгору замість повторних спроб вниз. Якщо тип завдання часто не вдається на Haiku, спочатку відправте його на Sonnet 5.5, а не платіть за спроби Haiku плюс резервний варіант.

Шаблон ведення обліку для кроків 1 і 2 через рідну точку доступу Claude AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "Ви класифікуєте запити підтримки..."  # стабільний, кешований префікс

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"попередження: запит на {prompt_tokens} токенів, близько до лінії ціни 100К")
    return next(b.text for b in r.content if b.type == "text")

Якщо cache_read_input_tokens залишається нульовим під час повторних викликів, щось у префіксі змінюється між запитами, наприклад, мітка часу в системному запиті.

Часті запитання

Скільки коштує Claude Haiku 5.5?
Для запитів до 100,000 токенів - $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів. Для довших запитів - $0.50 і $2.50, застосовані до всього запиту. Читання кешу коштує десяту частину від тарифу на вхід, а Batch API знижує ціни на вхідні та вихідні токени вдвічі.

Чи дійсно Haiku 5.5 на 90% дешевше, ніж Haiku 4.5?
За токен, на коротких запитах - так. За завданням - менше: новий токенізатор рахує приблизно на 30% більше токенів для того ж тексту, мислення включено за замовчуванням, а довгі запити отримують лише 50% знижку. Anthropic оцінює звичайну економію приблизно в 75%. Класифікатор коротких запитів з кешуванням може заощадити близько 90%.

Що станеться, якщо мій запит перевищить 100,000 токенів?
Весь запит переходить на вищу тарифну картку, вхід і вихід однаково. У наведеному вище прикладі контракту 14% більше тексту зробило запит у 5.6 разів дорожчим.

Чи рахуються кешовані токени до порогу 100К?
Anthropic не заявив про це явно. Його ціноутворення вказує окремі ціни на читання кешу для кожного рівня, тому безпечне припущення полягає в тому, що весь запит, кешований чи ні, визначає рівень.

Чи коштують токени для мислення додатково?
Вони оплачуются як вихідні токени за звичайною ставкою виходу. Оскільки мислення включено за замовчуванням на середньому зусиллі, вони можуть суттєво додати до маршруту, який раніше виробляв короткі відповіді. Зниження зусиль зменшує їх.

Чи дешевше Haiku 5.5, ніж GPT-6 Luna?
На запитах до 100К токенів ціни однакові. Між 100К і 272К токенів Luna залишається на своїй базовій ставці, тоді як Haiku 5.5 переходить на вищу, тому Luna є дешевшою за списковою ціною. Токенізатори різні, тому порівнюйте реальні рахунки.

Чи можу я використовувати Пріоритетний рівень з Haiku 5.5?
Ні. Пріоритетний рівень не підтримується на Haiku 5.5, тому зобов'язання на Haiku 4.5 не переходять.

Продовжуйте читати: серія Claude Haiku 5.5

Джерела