Claude Haiku 5.5 срещу Haiku 4.5: Какво купува десет цента сега

AIHubMix8 мин четене
Claude Haiku 5.5 срещу Haiku 4.5: Какво купува десет цента сега

Claude Haiku 4.5 получи 0.0% на Terminal-Bench 4.0. Claude Haiku 5.5 получава 39.2%, а цената му е десета част от цената на токен: $0.10 на милион входни токени и $0.50 на милион изходни токени, в сравнение с $1 и $5 за Haiku 4.5.

Това е ъпгрейдът в едно изречение. Малкият модел Claude премина от "добър за класификация, не за агенти" до използваем подагент, а цената му сега съвпада с тази на OpenAI's GPT-6 Luna на стотинка. Anthropic го пусна на 7 октомври 2026 г. като Claude Haiku 5.5, модел ID claude-haiku-5-5, и вече е наличен на AIHubMix.

Цената идва с условия, а така и оценките от бенчмарковете. Тази публикация разглежда какво се е променило, колко близо Haiku 5.5 е до Sonnet 5.5, къде е неправилният избор и кой трябва да премине сега.

Какво се е променило и какво не

Haiku 4.5 Haiku 5.5
Цена за вход/изход $1 / $5 $0.10 / $0.50
Контекстен прозорец 200K 1M
Максимален изход 64K 128K
Мислене Ръчен бюджет, изключен по подразбиране Адаптивен, включен по подразбиране
Нива на усилие Няма Пет, по подразбиране средно
Токени за един и същи текст Базов Около 30% повече
Инструмент за използване на браузър Не Да

Цените на Haiku 5.5 важат за запитвания до 100K токена; по-дълги запитвания плащат $0.50 / $2.50. Цените са на милион токени.

Какво остава същото: описанието на работата. Anthropic все още предлага Haiku за работа с високи обеми и чувствителни на цена (резюмета, компактиране, заявки за бази данни, класификация) и за задължения на подагент под по-голям модел. Anthropic казва, че съществуващите запитвания на Haiku 4.5 трябва да работят добре без промени. Съществуващият код за заявки е различен въпрос: пет модела на заявки, които работеха на Haiku 4.5, сега връщат грешка 400, както е посочено в ръководството за миграция и публикацията за миграция в тази серия.

Две промени променят начина, по който моделът се държи по подразбиране. Мисленето сега е включено, освен ако не го изключите, така че запитване, което никога не е споменавало мислене, може да се върне с блокове thinking първо и да изразходва изходни токени за тях. И Haiku 5.5 е първият Haiku с настройка на усилие, която сега е основният контрол между цена и качество.

Как се представя спрямо Haiku 4.5, Luna и Sonnet 5.5

Данните по-долу идват от материалите за пускане на Anthropic и системната карта на Haiku 5.5, събрани от Kingy.ai. Те са докладвани от доставчика, Anthropic е провел тестовете на GPT моделите сам, и никой все още не е възпроизвел пълната таблица независимо.

Бенчмарк Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 (офлайн) 72.4% 15.7% 48.9% 83.9%
Последният изпит на човечеството 45.9% 10.2% n/a 56.9%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 Main 46.4% n/a 42.4% 52.1%
Chartography 46.4% 6.4% 29.1% 61.6%

Последният изпит на човечеството и Chartography са без инструменти. Резултатът на FrontierCode на Sonnet 5.5 е при xhigh усилие.

Три показателя са по-важни от всяка отделна редица:

  • Срещу Haiku 4.5, това е различен клас модел. Оценките за работа с познания се удвояват, а редовете за агенти преминават от почти нула до използваеми. Haiku 4.5 не можа да завърши задача от Terminal-Bench; Haiku 5.5 завършва около две от пет.
  • Срещу GPT-6 Luna, той води на всеки споделен ред при същата цена на списъка. Най-широките разлики са при използването на компютър (72.4% срещу 48.9%) и Terminal-Bench (39.2% срещу 16.4%).
  • Срещу Sonnet 5.5, разликата зависи от задачата. При FrontierCode, Haiku е в рамките на шест точки. При Terminal-Bench, Sonnet получава 70.6% срещу 39.2% на Haiku. Anthropic сам казва, че Sonnet 5.5 и Opus 5.5 остават по-добрият избор за сложен агентен код.

Прочетете малкия шрифт преди да цитирате тези числа

Основните резултати бяха проведени при максимално усилие, най-скъпата настройка. По подразбиране е средно, а собствените резултати на системната карта при средно усилие са по-ниски: 1277 на GDPval-AA вместо 1620, и 1372 на AA-Briefcase вместо 1578. Ако внедрите по подразбиране, сравнете с тези числа, а не с таблицата за пускане.

Данните от OSWorld също се нуждаят от втори поглед. 72.4% е частичен кредит, средно за контролни точки. Делът на задачите, при които Haiku 5.5 е завършил всяка контролна точка, е 37.1% (Luna: 17.1%). За браузърен агент, който трябва да завърши цялата работа, 37.1% е числото, около което да планирате.

Какво съобщиха ранните клиенти

Публикацията на Anthropic за пускане цитира няколко клиенти, които тествали модела преди пускането. Те са избрани от доставчика, но сочат към същите работни натоварвания:

  • AlphaSense извършва около 8 милиона "Запитвания в документа" на седмица. При 400 тестови запитвания, Haiku 5.5 получи 0.84 срещу 0.76 на Haiku 4.5.
  • Box видя 11-точкова печалба спрямо Haiku 4.5 при около половината латентност.
  • Asana измери над 30% по-ниска латентност на задача и до 2.5x по-бързо извеждане на всеки агент, в сравнение с текущия си модел.
  • HubSpot получи 92.8% на своя CRM пакет, най-добрият резултат, който е виждал от малък модел.
  • Cognition използва Haiku 5.5 като "помощник" под Opus 5.5 в Devin Fusion и съобщава, че двойката държи FrontierCode резултат от 66.2 при по-ниска цена и латентност.

Моделът: кратка, повтаряща се работа върху документи и задължения на подагент под по-голям модел.

Къде Haiku 5.5 е неправилният избор

  • Сложен агентен код. Terminal-Bench е мястото, където Sonnet 5.5 изостава най-много. Ако задача изисква много стъпки, неясни изисквания или дълга верига от редакции, започнете с Sonnet 5.5 или Opus 5.5.
  • Запитвания над 100K токена. 1M прозорецът е реален, но цената не е равномерна. След 100K токена цялото запитване преминава на $0.50 / $2.50, а тъй като новият токенизатор брои около 30% повече токени, тази линия седи близо до 77K токена, както Haiku 4.5 ги броеше. Публикацията за ценообразуване в тази серия разглежда числата.
  • Работа, която изисква xhigh или максимално усилие, за да премине. Изходът става дълъг и скъп при най-високите настройки. Собственото ръководство на Anthropic е да сравните с Sonnet 5.5 преди да се установите там.
  • Екипи на Priority Tier. Haiku 5.5 не го поддържа, така че ангажиментът на Haiku 4.5 Priority Tier не се пренася.
  • Тестове за сигурност. Киберсигурността на Haiku 5.5 е по-строга от тази на Haiku 4.5 и блокира тестовете за проникване. Очаквайте refusal причини за спиране на такъв вид работа, без резервен вариант на сървъра към друг модел.

Опитайте го през AIHubMix

Настройката на усилието на Haiku 5.5 се намира в output_config на API за съобщения, така че Claude native endpoint на AIHubMix е най-прекият маршрут. Инсталирайте актуален Anthropic SDK (pip install -U anthropic) и го насочете към AIHubMix:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=2000,  # оставете място за мислене, не само за отговора
    output_config={"effort": "low"},
    messages=[{
        "role": "user",
        "content": "Класифицирайте този билет като фактуриране, грешка или друго: "
                   "'Бях таксуван два пъти за октомври.'",
    }],
)

# Блоковете за мислене могат да дойдат първи, така че изберете текстовия блок по тип.
answer = next(block.text for block in response.content if block.type == "text")
print(answer)
print(response.usage)

Две неща, които да проверите при първото си стартиране. Прочетете response.usage.output_tokens при low и отново при high на същото запитване: ако числата не се променят, настройката на усилието не достига до модела. И имайте предвид, че страницата на модела на AIHubMix в момента посочва дължина на контекста от 200K за този модел, под 1M на Anthropic, така че потвърдете лимита преди да изпратите много дълги запитвания.

Кой трябва да премине, кой трябва да изчака

Преминете сега, ако извършвате класификация, извличане, маршрутизиране, резюмета или Q&A с документи с запитвания значително под 100K токена. Получавате много по-силен модел на част от цената на токените. Планирайте час за промените в кода на запитванията, след това тествайте усилие low срещу medium на вашите собствени оценки.

Преминете сега, ако използвате голям модел за работа на подагент, за която е преквалифициран: извличане на цифра от файл, проверка на файл, резюмиране на резултат от инструмент. Това е ролята, която Anthropic и клиентите му подчертават.

Изчакайте един спринт, ако вашата интеграция използва компютърна употреба с инструмента computer_20250124, предварително попълване или temperature=0. Всеки от тях връща 400 на Haiku 5.5, а поправянето им е работа с код, а не просто смяна на модел.

Останете там, където сте, ако вашето работно натоварване е дълго запитване (редовно над около 77K токена на Haiku 4.5), зависи от Priority Tier или е сложен агентен код. За последната група, полезното сравнение е Haiku 5.5 срещу Sonnet 5.5 по цена на завършена задача, а не Haiku 5.5 срещу Haiku 4.5.

Когато сте готови да сравните, списъкът на моделите на AIHubMix поставя Haiku 5.5, Sonnet 5.5 и Opus 5.5 зад един API ключ, така че същата оценка може да се проведе срещу всички три.

Често задавани въпроси

По-добър ли е Claude Haiku 5.5 от Haiku 4.5 във всичко?
На всеки бенчмарк в таблицата за пускане на Anthropic, да, често с голяма разлика. Изключенията са практични, а не качествени: Priority Tier не се поддържа, запитвания над 100K токена струват повече на токен от цената за кратки запитвания, а няколко стари модела на запитвания сега връщат грешки.

Наистина ли Haiku 5.5 е 90% по-евтин?
Цената на токен е 90% по-ниска за запитвания до 100K токена и 50% по-ниска над това. Поради факта, че новият токенизатор брои около 30% повече токени за същия текст, и че мисленето сега произвежда изходни токени, Anthropic оценява типичната икономия на около 75%.

Как Haiku 5.5 се сравнява с GPT-6 Luna?
И двете са на цена от $0.10 на милион входни токени и $0.50 на милион изходни токени. В докладваните резултати на Anthropic, Haiku 5.5 получава по-високи оценки на всеки бенчмарк, където и двете се появяват, най-ясно при използване на компютър и Terminal-Bench. Luna запазва основната си цена до по-дълга дължина на запитването, така че работните натоварвания с дълги запитвания трябва да се оценяват отделно.

Може ли Haiku 5.5 да замени Sonnet 5.5 за кодиране?
За тесни, добре определени промени и задачи на подагент, може да си струва да се тества. За сложен многостепенен агентен код, Sonnet 5.5 получава значително по-високи оценки на Terminal-Bench 4.0 (70.6% срещу 39.2%), и Anthropic препоръчва Sonnet или Opus за тази работа.

Дали оценките от бенчмарковете са при настройката по подразбиране?
Не. Основните резултати бяха проведени при максимално усилие. По подразбиране е средно, при което системната карта отчита по-ниски резултати, например 1277 вместо 1620 на GDPval-AA.

Дали 1M контекстният прозорец означава, че мога да изпращам запитвания с 1M токена евтино?
Можете да ги изпращате, но всичко над 100K токена се таксува на $0.50 вход и $2.50 изход на милион токени за цялото запитване. Проверете и лимита на контекста на вашия шлюз.

Какво трябва да променя в кода си, за да премина?
Минимум: ID на модела, всякакъв ръчен бюджет за мислене, всяка настройка на температура или top_p, всяко предварително попълване на асистент и код, който чете първия блок с съдържание като отговор. Публикацията за миграция в тази серия има пълния списък.

Продължете да четете: серията Claude Haiku 5.5

Източници