클로드 하이쿠 5.5 가격: 90% 할인 뒤의 100K 라인

AIHubMix8분 분량
클로드 하이쿠 5.5 가격: 90% 할인 뒤의 100K 라인

클로드 하이쿠 5.5는 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50로, 하이쿠 4.5의 $1 및 $5의 10분의 1 가격입니다. 이는 100,000 토큰까지의 프롬프트에 해당합니다. 그 라인을 초과하면 전체 요청이 $0.50 및 $2.50로 청구되며, 이는 하이쿠 4.5의 가격의 절반입니다.

앤트로픽은 일반적인 절감률을 90%가 아닌 약 75%로 보고하며, 그 차이는 이 게시물에서 다루는 세 가지 요소에서 비롯됩니다: 프롬프트가 100K 라인에 상대적으로 어디에 위치하는지, 기본 설정에서 생성되는 사고 토큰의 수, 그리고 동일한 텍스트를 약 30% 더 많은 토큰으로 계산하는 새로운 토크나이저입니다. 아래의 두 가지 예시를 통해 실제 청구서가 어떻게 나오는지 보여줍니다.

요금 카드

앤트로픽의 하이쿠 5.5 출시 게시물 및 가격 페이지에서의 100만 토큰당 가격:

토큰 유형 하이쿠 5.5, 짧음 하이쿠 5.5, 길음 하이쿠 4.5 소네트 5.5
입력 $0.10 $0.50 $1.00 $2.00
출력 $0.50 $2.50 $5.00 $10.00
캐시 읽기 $0.01 $0.05 $0.10 $0.10
캐시 쓰기, 5분 $0.125 $0.625 $1.25 $2.50
캐시 쓰기, 1시간 $0.20 $1.00 $2.00 $4.00

"짧음"은 100,000 토큰 이하의 프롬프트를 의미하며, "길음"은 100,000을 초과하는 경우입니다. 배치 API는 입력 및 출력을 50% 할인합니다. 소네트 5.5의 캐시 읽기 가격은 같은 날 $0.20에서 $0.10으로 인하되었습니다.

AIHubMix의 하이쿠 5.5 페이지는 같은 두 가지 계층을 나열하며, 웹 검색은 요청당 $0.01입니다.

놓치기 쉬운 청구 규칙

전체 요청이 아닌 초과분만 계층이 변경됩니다. 앤트로픽은 프롬프트 길이에 따라 선택된 두 개의 요금 카드로 하이쿠 5.5의 가격을 책정합니다. 100,000 토큰의 프롬프트는 입력에 대해 $0.0100을 지불하며, 100,001 토큰의 프롬프트는 $0.0500을 지불하고, 출력도 다섯 배 비쌉니다. 하이쿠 5.5는 여기서 예외입니다: 앤트로픽의 다른 현재 1M-컨텍스트 모델은 표준 요금으로 전체 창을 청구합니다.

라인이 이전 대시보드에서 제안하는 것보다 더 빨리 도착합니다. 하이쿠 5.5는 새로운 토크나이저를 사용하며, 동일한 텍스트가 하이쿠 4.5보다 약 30% 더 많은 토큰을 생성합니다. 100,000을 1.3으로 나누면 하이쿠 4.5가 계산한 77,000 토큰 근처에 라인이 위치하게 됩니다. 이전 대시보드에서 78,000 토큰의 프롬프트는 하이쿠 5.5에서 대략 101,000 토큰이 되며, 긴 요금이 적용됩니다. 이 산술은 앤트로픽의 마이그레이션 가이드에서의 30% 수치에서 비롯되며, 정확한 증가는 콘텐츠에 따라 다르므로 새로운 모델에서 실제 프롬프트를 다시 계산해야 합니다.

사고는 기본적으로 활성화되어 있으며, 출력으로 청구됩니다. 하이쿠 4.5는 요청 시에만 사고를 했습니다. 하이쿠 5.5는 기본적으로 medium 노력으로 적응형 사고를 실행하므로, 이전에 200 출력 토큰을 반환하던 경로가 이제는 몇 백 개 더 반환할 수 있습니다.

짧은 프롬프트는 이제 캐시될 수 있습니다. 최소 캐시 가능 프롬프트는 하이쿠 4.5의 4,096 토큰에서 하이쿠 5.5의 512로 감소합니다. 하이쿠 4.5에서는 캐시될 수 없었던 3,000 토큰의 시스템 프롬프트가 이제 캐시될 수 있으며, 캐시 읽기는 입력 요금의 10분의 1입니다.

우선 순위 계층은 사용할 수 없습니다. 하이쿠 4.5에서 우선 순위 계층 약정을 보유하고 있다면, 하이쿠 5.5로 이전되지 않습니다. 용량을 별도로 계획해야 합니다.

캐시된 토큰과 100K 라인: 그들이 계산된다고 가정합니다. 앤트로픽은 각 계층에 대해 별도의 캐시 읽기 가격을 나열하며, 이는 전체 프롬프트가 캐시되었든 아니든 계층을 결정한다고 제안합니다. 앤트로픽은 이를 명확히 설명하지 않았으므로, 안전한 가정은 95K 캐시된 접두사와 6K 질문이 긴 프롬프트라는 것입니다.

예시 1: 지원 티켓 분류기

가정, 하이쿠 4.5 토큰 수 기준: 도구 정의가 포함된 3,000 토큰의 시스템 프롬프트, 1,000 토큰의 티켓, 200 토큰의 답변, 그리고 월 1백만 요청. 하이쿠 4.5는 사고가 꺼져 있습니다.

하이쿠 5.5에서 동일한 텍스트는 3,900 + 1,300 입력 토큰과 260 토큰의 답변이 됩니다. 사고는 low 노력에서 300 토큰, medium에서 800 토큰을 추가하는 것으로 가정합니다. 이러한 사고 수치는 가정입니다; 자신의 수치를 측정하세요.

설정 요청당 월별
하이쿠 4.5 $0.00500 $5,000
하이쿠 5.5, 낮음, 캐시 없음 $0.00080 $800
하이쿠 5.5, 낮음, 캐시된 접두사 $0.00045 $453
하이쿠 5.5, 중간, 캐시된 접두사 $0.00070 $703
소네트 5.5, 중간, 캐시된 접두사 $0.01359 $13,674

월별 캐시된 행에는 하이쿠 5.5에 대해 약 $4의 캐시 쓰기와 소네트 5.5에 대해 약 $84가 포함되어 있으며, 5분마다 한 번의 5분 쓰기를 가정합니다. 소네트 5.5는 중간에서 하이쿠와 동일한 토큰 가정을 사용합니다.

캐시된 low 행이 어떻게 합산되는지: 3,900 캐시된 토큰이 100만 개당 $0.01 ($0.000039), 1,300개의 새로운 입력 토큰이 $0.10 ($0.00013), 560 출력 토큰이 $0.50 ($0.00028)로, 요청당 $0.000449입니다.

패턴: 캐싱과 노력의 조합이 청구서를 이전 비용의 16% (캐시 없음, 낮음)에서 9% (캐시됨, 낮음)으로 이동시킵니다. 노력을 low가 아닌 기본값으로 두면 이 볼륨에서 월 약 $250가 추가됩니다. 어떤 선택도 하이쿠 4.5의 $5,000에 비해 절대적인 측면에서 큰 의미가 없으므로, 분류기 사례가 90% 헤드라인이 실제인 이유입니다.

예시 2: 라인을 넘는 계약 검토

가정, 하이쿠 4.5 토큰 수 기준: 70,000 토큰의 계약 및 지침, 1,500 토큰의 답변, 캐시 없음. 하이쿠 5.5에서 이는 91,000 입력 토큰, 1,950 토큰의 답변, 그리고 medium에서 2,000 사고 토큰으로 가정되어, 총 3,950 출력 토큰이 됩니다.

이제 계약을 14% 더 길게 만듭니다: 하이쿠 4.5에서 80,000 토큰, 하이쿠 5.5에서 104,000 토큰.

계약 크기 (하이쿠 4.5 수치) 하이쿠 4.5 하이쿠 5.5 변화
70,000 토큰 $0.0775 $0.0111 86% 낮음
80,000 토큰 $0.0875 $0.0619 29% 낮음

두 번째 행: 104,000 입력 토큰이 100만 개당 $0.50 ($0.052)와 3,950 출력 토큰이 $2.50 ($0.0099)입니다. 14% 더 많은 텍스트는 하이쿠 5.5에서 5.6배 더 비쌉니다.

해결책은 라인 아래에 머무르는 것입니다. 더 긴 계약을 각각 약 53,000 토큰의 두 호출로 나누면 (계약의 절반과 각 호출의 지침) 약 $0.015의 총 비용이 발생하며, 단일 긴 호출의 4분의 1도 안 됩니다. 분할이 효과가 있는지는 작업에 따라 다릅니다; 조항별 검토는 깔끔하게 분할되지만, 전체 문서가 필요한 질문은 그렇지 않습니다.

작업당 비용 비교

소네트 5.5와 비교할 때, 하이쿠 5.5는 짧은 프롬프트에서 토큰당 가격의 약 20분의 1입니다. 그러나 토큰당 가격이 완료된 작업당 가격은 아닙니다. 복잡한 에이전트 코딩에서 소네트 5.5는 하이쿠 5.5의 39.2%에 비해 Terminal-Bench 4.0에서 70.6%의 점수를 기록하며, 실패하고 재시도되거나 더 큰 모델로 다시 수행되는 저렴한 요청은 저렴하지 않습니다. 앤트로픽의 조언은 하이쿠를 xhigh 또는 max로 실행하기 전에 소네트 5.5와 비교하라는 것입니다. 소네트 5.5도 같은 날 더 저렴해졌습니다: 캐시 읽기가 절반으로 줄어들어, 앤트로픽은 대부분의 에이전트 작업에서 약 20%를 절감한다고 말합니다.

GPT-6 루나와 비교할 때, 짧은 프롬프트의 목록 가격은 동일하며, 캐시 읽기도 포함됩니다. 차이는 긴 프롬프트 규칙입니다. 루나의 긴 컨텍스트 요금은 272,000 입력 토큰 이상에서 시작하며 $0.20 / $0.75이고, 하이쿠 5.5는 100,000 이상에서 시작하며 $0.50 / $2.50입니다. 100K와 272K 토큰 사이의 작업량에 대해 루나는 목록 가격에서 훨씬 저렴합니다. 두 모델은 서로 다른 토크나이저를 사용하므로, 측정된 청구서를 비교해야 합니다.

100K 임계값 및 토크나이저 효과에 대한 수치는 루의 뉴스레터에서도 다루어졌으며, 그 산술은 위의 예시와 일치합니다.

청구서를 줄이는 단계

  1. 새 모델에서 토큰을 계산하고 100K 전에 알림을 설정하세요. 모든 요청에 대해 전체 프롬프트 크기를 기록하고 약 90,000 토큰에서 알림을 설정하여, 위로 이동하는 프롬프트가 계층을 변경하기 전에 잘라내거나 분할되도록 합니다.
  2. 안정적인 접두사를 캐시하세요. 시스템 프롬프트와 도구 정의를 먼저 캐시하고, 변수 콘텐츠는 마지막에 캐시합니다. 최소 512 토큰으로 대부분의 생산 시스템 프롬프트가 이제 자격을 갖춥니다. AIHubMix의 클로드 프롬프트 캐싱 가이드에서 요청 형식을 보여줍니다.
  3. 노력을 명시적으로 설정하세요. 높은 볼륨의 간단한 경로에는 low를 사용하세요. 기본 medium은 경로가 필요하든 아니든 모든 요청에서 더 비쌉니다.
  4. 사고와 답변을 위한 max_tokens 크기를 설정하세요. 너무 작으면 답변 없이 사고에 대해 비용을 지불하게 됩니다.
  5. 기다릴 수 있는 것은 배치하세요. 배치 API는 입력 및 출력 요금을 절반으로 줄입니다.
  6. 재시도하는 대신 경로를 변경하세요. 하이쿠에서 특정 작업 유형이 자주 실패하면, 하이쿠 시도를 지불하는 대신 소네트 5.5로 먼저 보내세요.

AIHubMix의 클로드 네이티브 엔드포인트를 통한 1단계 및 2단계의 로깅 패턴:

import os
import anthropic

client = anthropic.Anthropic(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com",
)

SYSTEM_PROMPT = "지원 티켓을 분류합니다..."  # 안정적이고 캐시 가능한 접두사

def classify(ticket: str) -> str:
    r = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=1024,
        output_config={"effort": "low"},
        system=[{"type": "text", "text": SYSTEM_PROMPT,
                 "cache_control": {"type": "ephemeral"}}],
        messages=[{"role": "user", "content": ticket}],
    )
    u = r.usage
    prompt_tokens = (u.input_tokens + (u.cache_read_input_tokens or 0)
                     + (u.cache_creation_input_tokens or 0))
    if prompt_tokens > 90_000:
        print(f"경고: {prompt_tokens} 토큰으로 프롬프트가 100K 가격 라인에 근접합니다.")
    return next(b.text for b in r.content if b.type == "text")

만약 cache_read_input_tokens가 반복 호출에서 0으로 유지된다면, 요청 간에 접두사에서 변경되는 것이 있습니다, 예를 들어 시스템 프롬프트의 타임스탬프와 같은 것입니다.

자주 묻는 질문

클로드 하이쿠 5.5의 비용은 얼마인가요?
100,000 토큰까지의 프롬프트에 대해 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50입니다. 더 긴 프롬프트의 경우, 전체 요청에 대해 $0.50 및 $2.50이 적용됩니다. 캐시 읽기는 입력 요금의 10분의 1이며, 배치 API는 입력 및 출력 가격을 절반으로 줄입니다.

하이쿠 5.5가 정말 하이쿠 4.5보다 90% 저렴한가요?
짧은 프롬프트에서 토큰당으로는 그렇습니다. 작업당으로는 덜 저렴합니다: 새로운 토크나이저는 동일한 텍스트에 대해 약 30% 더 많은 토큰을 계산하며, 사고는 기본적으로 활성화되어 있고, 긴 프롬프트는 50% 할인만 받습니다. 앤트로픽은 일반적인 절감률을 약 75%로 추정합니다. 캐시가 있는 짧은 프롬프트 분류기는 약 90%를 절감할 수 있습니다.

내 프롬프트가 100,000 토큰을 초과하면 어떻게 되나요?
전체 요청이 더 높은 요금 카드로 이동하며, 입력과 출력 모두 해당됩니다. 위의 계약 예시에서 14% 더 많은 텍스트가 요청을 5.6배 더 비싸게 만들었습니다.

캐시된 토큰이 100K 임계값에 포함되나요?
앤트로픽은 이를 명시적으로 언급하지 않았습니다. 가격 책정에는 각 계층에 대한 별도의 캐시 읽기 가격이 나열되어 있으므로, 전체 프롬프트가 캐시되었든 아니든 계층을 결정한다고 가정하는 것이 안전합니다.

사고 토큰은 추가 비용이 드나요?
그들은 정상 출력 요금으로 출력 토큰으로 청구됩니다. 사고가 기본적으로 중간 노력으로 활성화되어 있기 때문에, 짧은 답변을 생성하던 경로에 눈에 띄게 추가될 수 있습니다. 노력을 줄이면 이들을 줄일 수 있습니다.

하이쿠 5.5가 GPT-6 루나보다 저렴한가요?
100K 토큰까지의 프롬프트에서 목록 가격은 동일합니다. 100K와 272K 토큰 사이에서는 루나가 기본 요금을 유지하는 반면 하이쿠 5.5는 더 높은 요금으로 이동하므로, 그 목록 가격에서 루나가 더 저렴합니다. 토크나이저가 다르므로 실제 청구서를 비교해야 합니다.

하이쿠 5.5에서 우선 순위 계층을 사용할 수 있나요?
아니요. 하이쿠 5.5에서는 우선 순위 계층이 지원되지 않으므로, 하이쿠 4.5의 약정이 이전되지 않습니다.

계속 읽기: 클로드 하이쿠 5.5 시리즈

출처