Claude Haiku 5.5 против Haiku 4.5: Что сейчас можно купить за десять центов

AIHubMix8 мин чтения
Claude Haiku 5.5 против Haiku 4.5: Что сейчас можно купить за десять центов

Claude Haiku 4.5 набрал 0.0% на Terminal-Bench 4.0. Claude Haiku 5.5 набирает 39.2%, и стоит в десять раз меньше за токен: $0.10 за миллион входных токенов и $0.50 за миллион выходных токенов, против $1 и $5 для Haiku 4.5.

Вот и обновление в одной строке. Маленькая модель Claude перешла от "подходит для классификации, не для агентов" к использованию в качестве подагента, и теперь ее цена соответствует цене OpenAI's GPT-6 Luna до цента. Anthropic выпустил ее 7 октября 2026 года как Claude Haiku 5.5, идентификатор модели claude-haiku-5-5, и она уже доступна на AIHubMix.

Цена имеет свои условия, как и результаты тестирования. В этом посте рассматривается, что изменилось, насколько близко Haiku 5.5 подходит к Sonnet 5.5, где это неправильный выбор и кто должен переключиться сейчас.

Что изменилось, а что осталось прежним

Haiku 4.5 Haiku 5.5
Цена за вход/выход $1 / $5 $0.10 / $0.50
Контекстное окно 200K 1M
Максимальный выход 64K 128K
Мышление Ручной бюджет, выключен по умолчанию Адаптивный, включен по умолчанию
Уровни усилий Нет Пять, по умолчанию средний
Токены для одного и того же текста Базовый уровень Примерно на 30% больше
Инструмент использования браузера Нет Да

Цены Haiku 5.5 применяются к запросам до 100K токенов; более длинные запросы стоят $0.50 / $2.50. Цены указаны за миллион токенов.

Что остается прежним: описание работы. Anthropic по-прежнему предлагает Haiku для высокообъемной, чувствительной к стоимости работы (резюме, сжатие, запросы к базам данных, классификация) и для подагентской работы под более крупной моделью. Anthropic утверждает, что существующие запросы Haiku 4.5 должны работать хорошо без изменений. Существующий код запросов — это другая история: пять шаблонов запросов, которые работали на Haiku 4.5, теперь возвращают ошибку 400, как указано в руководстве по миграции, и пост о миграции в этой серии объясняет.

Два изменения изменяют поведение модели по умолчанию. Мышление теперь включено, если вы его не выключите, поэтому запрос, который никогда не упоминал мышление, может вернуть блоки thinking первыми и потратить токены на выход на них. И Haiku 5.5 — первая Haiku с настройкой усилий, которая теперь является основным регулятором между стоимостью и качеством.

Как она оценивается по сравнению с Haiku 4.5, Luna и Sonnet 5.5

Цифры ниже взяты из материалов запуска Anthropic и системной карты Haiku 5.5, составленных Kingy.ai. Они сообщаются поставщиком (Anthropic сам проводил некоторые сравнения с GPT, такие как OSWorld), и никто еще не воспроизвел полную таблицу независимо.

Бенчмарк Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (офлайн) 72.4% 15.7% 48.9% 83.9%
Последний экзамен человечества 45.9% 10.2% н/д 56.9%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 Main 46.4% н/д 42.4% 52.1%
Chartography 46.4% 6.4% 29.1% 61.6%

Последний экзамен человечества и Chartography проводились без инструментов. Оценка FrontierCode Sonnet 5.5 была на высоком уровне усилий.

Три показателя важнее любой отдельной строки:

  • По сравнению с Haiku 4.5 это совершенно другой класс модели. Оценки знаний примерно удваиваются, а агентские строки переходят от почти нуля к использованию. Haiku 4.5 не могла завершить задачу Terminal-Bench; Haiku 5.5 завершает около двух из пяти.
  • По сравнению с GPT-6 Luna она лидирует по всем общим строкам по той же цене. Наибольшие разрывы наблюдаются в использовании компьютера (72.4% против 48.9%) и Terminal-Bench (39.2% против 16.4%).
  • По сравнению с Sonnet 5.5 разрыв зависит от задачи. В FrontierCode Haiku находится в пределах шести баллов. В Terminal-Bench Sonnet набирает 70.6%, а Haiku — 39.2%. Сам Anthropic утверждает, что Sonnet 5.5 и Opus 5.5 по-прежнему являются лучшим выбором для сложного агентского кодирования.

Читайте мелкий шрифт перед тем, как цитировать эти цифры

Основные оценки были получены при максимальных усилиях, самом дорогом уровне. По умолчанию используется средний уровень, и результаты средних усилий системы ниже: 1277 на GDPval-AA вместо 1620 и 1372 на AA-Briefcase вместо 1578. Если вы развертываете по умолчанию, сравнивайте с этими цифрами, а не с графиком запуска.

Цифра OSWorld также требует второго взгляда. 72.4% — это частичный кредит, усредненный по контрольным точкам. Доля задач, где Haiku 5.5 завершила каждую контрольную точку, составляет 37.1% (Luna: 17.1%). Для браузерного агента, который должен завершить всю работу, 37.1% — это число, вокруг которого нужно планировать.

Что сообщили ранние клиенты

Пост запуска Anthropic цитирует нескольких клиентов, которые тестировали модель до выпуска. Эти клиенты были выбраны поставщиком, но они указывают на одни и те же рабочие нагрузки:

  • AlphaSense выполняет около 8 миллионов вызовов "Спросить в документе" в неделю. По 400 тестовым запросам Haiku 5.5 набрала 0.84 против 0.76 у Haiku 4.5.
  • Box увидел прирост на 11 пунктов по сравнению с Haiku 4.5 при примерно половине задержки.
  • Asana измерила более чем на 30% меньшую задержку на задачу и до 2.5 раз более быстрое извлечение на поворот агента по сравнению с текущей моделью.
  • HubSpot получил 92.8% на своем CRM-пакете, что является лучшим результатом, который он когда-либо видел на этом пакете.
  • Cognition использует Haiku 5.5 в качестве "помощника" под Opus 5.5 в Devin Fusion и сообщает, что пара держит оценку FrontierCode 66.2 при более низкой стоимости и задержке.

Модель: короткая, повторяющаяся работа с документами и подагентская работа под более крупной моделью.

Где Haiku 5.5 является неправильным выбором

  • Сложное агентское кодирование. Terminal-Bench — это место, где Sonnet 5.5 отстает. Если задача требует многих шагов, неоднозначных требований или длинной цепочки правок, начните с Sonnet 5.5 или Opus 5.5.
  • Запросы более 100K токенов. 1M окно реально, но цена не равномерна по нему. После 100K токенов весь запрос переходит на $0.50 / $2.50, и поскольку новый токенизатор считает примерно на 30% больше токенов, эта линия находится около 77K токенов, как их считала Haiku 4.5. Пост о ценообразовании в этой серии разбирает цифры.
  • Работа, которая требует xhigh или max для прохождения. Выход становится длинным и дорогим на верхних настройках. Собственные рекомендации Anthropic — сравнивать с Sonnet 5.5, прежде чем останавливаться на этом.
  • Команды на Приоритетном уровне. Haiku 5.5 не поддерживает его, поэтому обязательство Haiku 4.5 на Приоритетном уровне не переносится.
  • Тестирование безопасности. Киберзащита Haiku 5.5 строже, чем у Haiku 4.5, и блокирует тестирование на проникновение. Ожидайте refusal как причины остановки для такого рода работы, без серверного резервирования на другую модель.

Попробуйте через AIHubMix

Настройка усилий Haiku 5.5 находится в output_config API сообщений, поэтому родной конечный пункт Claude на AIHubMix является самым прямым маршрутом. Установите текущий SDK Anthropic (pip install -U anthropic) и укажите его на AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # оставьте место для мышления, а не только для ответа
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Классифицируйте этот тикет как выставление счета, ошибку или другое: "
                   "'С меня дважды взяли плату за октябрь.'",
    }],
)

# Блоки мышления могут идти первыми, поэтому выберите текстовый блок по типу.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

Одно, что стоит проверить при первом запуске: прочитайте response.usage.output_tokens на low и снова на high по тому же запросу: если цифры не меняются, настройка усилий не достигает модели. Haiku 5.5 работает с полным контекстным окном в 1M на AIHubMix, поэтому длинные запросы работают как есть; просто имейте в виду ценовую линию в 100K.

Кто должен переключиться, кто должен подождать

Переключитесь сейчас, если вы выполняете классификацию, извлечение, маршрутизацию, резюме или Q&A по документам с запросами значительно ниже 100K токенов. Вы получите гораздо более мощную модель за небольшую цену токенов. Запланируйте час на изменения в коде запроса, а затем протестируйте усилия low против medium на своих собственных оценках.

Переключитесь сейчас, если вы используете большую модель для подагентской работы, для которой она слишком квалифицирована: извлечение данных из файла, проверка файла, резюмирование результата инструмента. Это та роль, на которую акцентируют внимание Anthropic и его клиенты при запуске.

Подождите спринт, если ваша интеграция использует компьютерное использование с инструментом computer_20250124, предварительное заполнение или temperature=0. Каждый из этих запросов возвращает 400 на Haiku 5.5, и их исправление требует работы с кодом, а не просто замены строки модели.

Оставайтесь там, где вы есть, если ваша рабочая нагрузка — это длинные запросы (регулярно более 77K токенов Haiku 4.5), зависит от Приоритетного уровня или представляет собой сложное агентское кодирование. Для последней группы полезное сравнение — это Haiku 5.5 против Sonnet 5.5 по стоимости за завершенную задачу, а не Haiku 5.5 против Haiku 4.5.

Когда вы будете готовы к сравнению, список моделей AIHubMix помещает Haiku 5.5, Sonnet 5.5 и Opus 5.5 под один API-ключ, так что одна и та же оценка может быть выполнена для всех трех.

Часто задаваемые вопросы

Является ли Claude Haiku 5.5 лучше, чем Haiku 4.5 во всем?
По всем бенчмаркам в таблице запуска Anthropic — да, часто с большим отрывом. Исключения носят практический характер, а не качественный: Приоритетный уровень не поддерживается, запросы более 100K токенов стоят дороже за токен, чем ставка для коротких запросов, и несколько старых шаблонов запросов теперь возвращают ошибки.

Действительно ли Haiku 5.5 на 90% дешевле?
Цена за токен на 90% ниже для запросов до 100K токенов и на 50% ниже для запросов свыше. Учитывая смешение запросов (около 90% запросов Haiku 4.5 были менее 100K токенов) и новый токенизатор, который считает примерно на 30% больше токенов для одного и того же текста, Anthropic оценивает среднюю экономию примерно в 75%. Мысли по умолчанию добавляют токены на выход сверху, поэтому ваш фактический счет также зависит от настройки усилий.

Как Haiku 5.5 сравнивается с GPT-6 Luna?
Обе модели стоят $0.10 за миллион входных токенов и $0.50 за миллион выходных токенов. В сообщенных результатах Anthropic Haiku 5.5 набирает больше по всем бенчмаркам, где обе модели представлены, наиболее явно в использовании компьютера и Terminal-Bench. Luna сохраняет свою базовую цену до большей длины запроса, поэтому рабочие нагрузки с длинными запросами должны оцениваться отдельно.

Может ли Haiku 5.5 заменить Sonnet 5.5 для кодирования?
Для узких, четко определенных изменений и задач подагента это может быть стоит протестировать. Для сложного многошагового агентского кодирования Sonnet 5.5 набирает значительно больше на Terminal-Bench 4.0 (70.6% против 39.2%), и Anthropic рекомендует Sonnet или Opus для этой работы.

Являются ли оценки бенчмарков на уровне по умолчанию?
Нет. Основные оценки были получены при максимальных усилиях. По умолчанию используется средний уровень, где системная карта сообщает о более низких результатах, например, 1277 вместо 1620 на GDPval-AA.

Означает ли окно в 1M токенов, что я могу отправлять запросы на 1M токенов дешево?
Вы можете их отправлять, но все, что превышает 100K токенов, будет выставлено по цене $0.50 за вход и $2.50 за выход за миллион токенов для всего запроса. AIHubMix также поддерживает полное окно в 1M.

Что мне нужно изменить в коде, чтобы переключиться?
Минимум: идентификатор модели, любой ручной бюджет на мышление, любые настройки температуры или top_p, любое предварительное заполнение помощника и код, который считывает первый блок содержимого как ответ. Пост о миграции в этой серии содержит полный список.

Продолжайте читать: серия Claude Haiku 5.5

Источники