Claude Haiku 4.5 отримав 0.0% на Terminal-Bench 4.0. Claude Haiku 5.5 отримує 39.2%, і його вартість становить одну десяту від вартості за токен: $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів, проти $1 і $5 для Haiku 4.5.
Ось оновлення в одному реченні. Маленька модель Claude перейшла від "добре для класифікації, не для агентів" до використання як підагент, а її ціна тепер відповідає ціні OpenAI's GPT-6 Luna до центу. Anthropic випустила її 7 жовтня 2026 року під назвою Claude Haiku 5.5, ID моделі claude-haiku-5-5, і вона вже внесена до AIHubMix.
Ціна має умови, і так само й бенчмарк-оцінки. Ця стаття охоплює те, що змінилося, наскільки близько Haiku 5.5 підходить до Sonnet 5.5, де це неправильний вибір і хто має перейти зараз.
Що змінилося, а що залишилося незмінним
| Haiku 4.5 | Haiku 5.5 | |
|---|---|---|
| Ціна за вхідні/вихідні токени | $1 / $5 | $0.10 / $0.50 |
| Вікно контексту | 200K | 1M |
| Максимальний вихід | 64K | 128K |
| Мислення | Ручний бюджет, вимкнено за замовчуванням | Адаптивне, увімкнено за замовчуванням |
| Рівні зусиль | Немає | П'ять, за замовчуванням середні |
| Токени для одного й того ж тексту | Базовий рівень | Приблизно на 30% більше |
| Інструмент використання браузера | Ні | Так |
Ціни Haiku 5.5 застосовуються до запитів до 100K токенів; довші запити коштують $0.50 / $2.50. Ціни вказані за мільйон токенів.
Що залишається незмінним: опис роботи. Anthropic все ще пропонує Haiku для роботи з великим обсягом, чутливої до вартості (резюме, стиснення, запити до бази даних, класифікація) та для підагентних обов'язків під більшим моделлю. Anthropic стверджує, що існуючі запити Haiku 4.5 повинні працювати добре без змін. Існуючий код запиту - це інша справа: п'ять шаблонів запитів, які працювали на Haiku 4.5, тепер повертають помилку 400, як зазначено в посібнику з міграції Anthropic, і пості в цій серії проходять через це.
Два зміни змінюють поведінку моделі за замовчуванням. Мислення тепер увімкнено, якщо ви його не вимкнете, тому запит, який ніколи не згадував про мислення, може повернутися з блоками thinking спочатку і витратити вихідні токени на них. І Haiku 5.5 - перший Haiku з налаштуванням зусиль, яке тепер є основним регулятором між вартістю та якістю.
Як він оцінюється проти Haiku 4.5, Luna та Sonnet 5.5
Цифри нижче походять з матеріалів запуску Anthropic та картки системи Haiku 5.5, зібрані Kingy.ai. Вони є звітними даними постачальника (Anthropic самостійно провела деякі порівняння GPT, такі як OSWorld), і ніхто ще не відтворив повну таблицю незалежно.
| Бенчмарк | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 (офлайн) | 72.4% | 15.7% | 48.9% | 83.9% |
| Останній екзамен людства | 45.9% | 10.2% | n/a | 56.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main | 46.4% | n/a | 42.4% | 52.1% |
| Chartography | 46.4% | 6.4% | 29.1% | 61.6% |
Останній екзамен людства та Chartography не мають інструментів. Результат FrontierCode Sonnet 5.5 за високих зусиль.
Три показники важливіші за будь-який окремий рядок:
- Проти Haiku 4.5 це інший клас моделі. Оцінки знань приблизно подвоюються, а агентські рядки переходять з майже нуля до використання. Haiku 4.5 не змогла завершити завдання Terminal-Bench; Haiku 5.5 завершує приблизно два з п'яти.
- Проти GPT-6 Luna, вона лідирує в кожному спільному рядку за тією ж ціною. Найбільші розриви спостерігаються у використанні комп'ютера (72.4% проти 48.9%) та Terminal-Bench (39.2% проти 16.4%).
- Проти Sonnet 5.5, розрив залежить від завдання. У FrontierCode Haiku знаходиться в межах шести балів. У Terminal-Bench Sonnet отримує 70.6% проти 39.2% Haiku. Anthropic сама стверджує, що Sonnet 5.5 та Opus 5.5 залишаються кращим вибором для складного агентського кодування.
Прочитайте дрібний шрифт перед тим, як цитувати ці цифри
Заголовкові оцінки були проведені на максимальних зусиллях, найдорощих налаштуваннях. За замовчуванням - середні, а результати середніх зусиль картки системи нижчі: 1277 на GDPval-AA замість 1620, і 1372 на AA-Briefcase замість 1578. Якщо ви розгортаєте за замовчуванням, порівнюйте з цими цифрами, а не з графіком запуску.
Цифра OSWorld також потребує другого погляду. 72.4% - це частковий кредит, середній за контрольними точками. Частка завдань, де Haiku 5.5 завершила кожну контрольну точку, становить 37.1% (Luna: 17.1%). Для браузерного агента, який повинен завершити всю роботу, 37.1% - це число, на яке слід орієнтуватися.
Що повідомили ранні клієнти
Пост запуску Anthropic цитує кількох клієнтів, які тестували модель перед випуском. Це вибрані постачальником, але вони вказують на ті ж навантаження:
- AlphaSense виконує близько 8 мільйонів викликів "Запит у документі" на тиждень. На 400 тестових запитів Haiku 5.5 отримала 0.84 проти 0.76 Haiku 4.5.
- Box зафіксувала приріст на 11 пунктів порівняно з Haiku 4.5 при приблизно половині затримки.
- Asana виміряла на 30% меншу затримку на завдання та до 2.5 разів швидше інференцію на поворот агента в порівнянні з її поточною моделлю.
- HubSpot отримала 92.8% на своєму CRM-пакеті, найкращий результат, який вона бачила на цьому пакеті.
- Cognition використовує Haiku 5.5 як "помічника" під Opus 5.5 у Devin Fusion і повідомляє, що пара має оцінку FrontierCode 66.2 за нижчої вартості та затримки.
Модель: коротка, повторювана робота з документами та підагентні обов'язки під більшою моделлю.
Де Haiku 5.5 є неправильним вибором
- Складне агентське кодування. Terminal-Bench - це місце, де Sonnet 5.5 відстає найбільше. Якщо завдання потребує багатьох кроків, неоднозначних вимог або довгого ланцюга редагувань, почніть з Sonnet 5.5 або Opus 5.5.
- Запити понад 100K токенів. Вікно 1M реальне, але ціна не є сталою. Після 100K токенів весь запит переходить на $0.50 / $2.50, і оскільки новий токенізатор рахує приблизно на 30% більше токенів, ця межа знаходиться близько 77K токенів, як їх рахувала Haiku 4.5. Пост про ціни в цій серії розглядає ці цифри.
- Робота, яка потребує xhigh або max для проходження. Вихід стає довгим і дорогим на верхніх налаштуваннях. Власні рекомендації Anthropic - порівняти з Sonnet 5.5 перед остаточним вибором.
- Команди на пріоритетному рівні. Haiku 5.5 не підтримує це, тому зобов'язання Haiku 4.5 на пріоритетному рівні не переходять.
- Тестування безпеки. Кіберзахист Haiku 5.5 суворіший, ніж у Haiku 4.5, і блокує тестування на проникнення. Очікуйте
refusalяк причини зупинки для такого роду роботи, без резервного варіанту на стороні сервера для іншої моделі.
Спробуйте через AIHubMix
Налаштування зусиль Haiku 5.5 знаходиться в output_config API повідомлень, тому рідна точка доступу Claude на AIHubMix є найпрямішим маршрутом. Встановіть актуальний SDK Anthropic (pip install -U anthropic) і вкажіть його на AIHubMix:
import os
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
response = client.messages.create(
model="claude-haiku-5-5",
max_tokens=2000, # залиште місце для мислення, а не лише для відповіді
output_config={"effort": "low"},
messages=[{
"role": "user",
"content": "Класифікуйте цей запит як рахунок, помилку або інше: "
"'Мене двічі стягнули за жовтень.'",
}],
)
# Блоки мислення можуть з'явитися першими, тому виберіть текстовий блок за типом.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)
Одна річ, яку слід перевірити під час першого запуску: прочитайте response.usage.output_tokens на low і знову на high за тим самим запитом: якщо цифри не змінюються, налаштування зусиль не досягає моделі. Haiku 5.5 працює з повним вікном контексту 1M на AIHubMix, тому довгі запити працюють як є; просто пам'ятайте про межу ціни 100K токенів.
Хто має перейти, хто має почекати
Перейдіть зараз, якщо ви виконуєте класифікацію, екстракцію, маршрутизацію, резюме або Q&A документів з запитами значно менше 100K токенів. Ви отримуєте набагато потужнішу модель за частину ціни токенів. Заплануйте годину для змін у коді запиту, а потім протестуйте зусилля low проти medium на ваших власних оцінках.
Перейдіть зараз, якщо ви використовуєте велику модель для підагентних робіт, для яких вона є надто кваліфікованою: витягування цифри з архіву, перевірка файлу, резюмування результату інструменту. Це роль, на якій наголошують Anthropic та її клієнти під час запуску.
Почекайте спринт, якщо ваша інтеграція використовує комп'ютерне використання з інструментом computer_20250124, попереднє заповнення або temperature=0. Кожен з цих варіантів повертає 400 на Haiku 5.5, і їх виправлення - це робота з кодом, а не просто заміна рядка моделі.
Залишайтеся на місці, якщо ваше навантаження є довгим запитом (регулярно понад 77K токенів Haiku 4.5), залежить від пріоритетного рівня або є складним агентським кодуванням. Для останньої групи корисне порівняння - це Haiku 5.5 проти Sonnet 5.5 за вартістю за завершене завдання, а не Haiku 5.5 проти Haiku 4.5.
Коли ви будете готові до порівняння, список моделей AIHubMix ставить Haiku 5.5, Sonnet 5.5 та Opus 5.5 під один API-ключ, тому одна й та ж оцінка може бути проведена проти всіх трьох.
Часті запитання
Чи краще Claude Haiku 5.5 за всім у порівнянні з Haiku 4.5?
На кожному бенчмарку в таблиці запуску Anthropic - так, часто з великою перевагою. Винятки є практичними, а не якісними: пріоритетний рівень не підтримується, запити понад 100K токенів коштують більше за токен, ніж короткі запити, і кілька старих шаблонів запитів тепер повертають помилки.
Чи дійсно Haiku 5.5 на 90% дешевше?
Ціна за токен на 90% нижча для запитів до 100K токенів і на 50% нижча для запитів понад цю межу. Враховуючи змішування запитів (близько 90% запитів Haiku 4.5 були менше 100K токенів) та новий токенізатор, який рахує приблизно на 30% більше токенів для того ж тексту, Anthropic оцінює середню економію приблизно на 75%. Включення мислення за замовчуванням додає вихідні токени зверху, тому ваш фактичний рахунок також залежить від налаштування зусиль.
Як Haiku 5.5 порівнюється з GPT-6 Luna?
Обидва мають ціну $0.10 за мільйон вхідних токенів і $0.50 за мільйон вихідних токенів. У звітах Anthropic Haiku 5.5 отримує вищі оцінки на кожному бенчмарку, де обидва з'являються, найяскравіше у використанні комп'ютера та Terminal-Bench. Luna зберігає свою базову ціну до довшої довжини запиту, тому навантаження з довгими запитами слід оцінювати окремо.
Чи може Haiku 5.5 замінити Sonnet 5.5 для кодування?
Для вузьких, чітко визначених змін і підагентних завдань це може бути варто протестувати. Для складного багатоступеневого агентського кодування Sonnet 5.5 отримує значно вищі оцінки на Terminal-Bench 4.0 (70.6% проти 39.2%), і Anthropic рекомендує Sonnet або Opus для цієї роботи.
Чи є оцінки бенчмарків на налаштуванні за замовчуванням?
Ні. Заголовкові оцінки були проведені на максимальних зусиллях. За замовчуванням - середні, де картка системи повідомляє про нижчі результати, наприклад, 1277 замість 1620 на GDPval-AA.
Чи означає вікно контексту 1M, що я можу надсилати запити на 1M токенів дешево?
Ви можете їх надсилати, але все, що перевищує 100K токенів, оплачується за $0.50 за вхід і $2.50 за вихід за мільйон токенів для всього запиту. AIHubMix також підтримує повне вікно 1M.
Що мені потрібно змінити в моєму коді, щоб перейти?
Принаймні: ID моделі, будь-який ручний бюджет на мислення, будь-яке налаштування температури або top_p, будь-яке попереднє заповнення асистента та код, який читає перший блок контенту як відповідь. Пост про міграцію в цій серії має повний список.
Продовжуйте читати: серія Claude Haiku 5.5
- Заголовкові оцінки були проведені на максимальних зусиллях, але ви, ймовірно, розгорнете на середніх або низьких. Щоб дізнатися, що коштує кожен рівень у токенах і що ви втрачаєте, знижуючи рівень, прочитайте Рівні зусиль Claude Haiku 5.5: середні - за замовчуванням, низькі - часто достатньо
- Цифра в одну десяту ціни дійсна лише нижче межі довжини запиту, яку новий токенізатор переміщує. Для прикладів витрат і правил виставлення рахунків, які легко пропустити, прочитайте Ціни Claude Haiku 5.5: межа 100K за зниженням на 90%
- Перехід - це більше, ніж просто зміна рядка моделі: п'ять старих шаблонів запитів тепер не працюють. Для кожної помилки, її причини та виправлення прочитайте Міграція з Claude Haiku 4.5 до 5.5: п'ять помилок 400 і тихі зміни
Джерела
- Представляємо Claude Haiku 5.5 (Anthropic)
- Посібник з міграції Claude Haiku 5.5 (Документація платформи Claude)
- Claude Haiku 5.5 на AIHubMix
- Claude Haiku 5.5: Бенчмарки, специфікації, Sol & Luna в порівнянні (Kingy.ai)
- Аналіз інтелекту, продуктивності та ціни Claude Haiku 5.5 (Artificial Analysis)



