클로드 하이쿠 5.5는 노력 설정이 있는 첫 번째 하이쿠이며, 이 설정은 당신이 제어하는 다른 어떤 것보다도 더 많은 영향을 미칩니다. 인공지능 분석의 독립 실행에서 하이쿠 5.5는 최대 노력에서 43점을, 낮은 노력에서 29점을 기록했습니다. 최대 노력은 인덱스를 통과하는 데 4억 4천만 개의 출력 토큰을 사용했으며, 낮은 노력은 3천 2백만 개를 사용했습니다.
따라서 간단한 대답은: 대부분의 작업을 기본값인 medium으로 두고, 대량의 간단한 경로는 low로 떨어뜨리세요. 지식 작업과 엄격한 지침 준수는 high로 높이세요. xhigh와 max는 증거가 필요하므로, 이를 사용하기 전에 성능을 Sonnet 5.5와 비교하세요.
이 게시물의 나머지 부분에서는 각 수준의 비용, 상승이 더 이상 이익이 되지 않는 지점, 그리고 노력을 변경할 때 깨지거나 비싸지는 설정을 보여줍니다.
설정이란 무엇인가
클로드 하이쿠 5.5는 다섯 가지 수준을 지원합니다: low, medium, high, xhigh, max. 기본값은 medium이며, 이는 드문 경우입니다: 대부분의 현재 클로드 모델은 기본값이 high이며, 하이쿠 5.5와 오푸스 5.5만이 한 수준 낮은 기본값을 가지고 있습니다. medium을 보내는 것은 매개변수를 생략하는 것과 같습니다.
노력은 하이쿠 4.5가 사용했던 수동 사고 예산을 대체합니다. thinking: {"type": "enabled", "budget_tokens": N}가 있는 요청은 이제 400을 반환하므로, 이전 숫자를 가져올 필요가 없습니다. 앤트로픽의 노력 문서에 따르면, output_config에서 설정합니다:
output_config={"effort": "low"}
다음 세 가지 사실이 아래의 모든 것을 구성합니다:
- 사고는 기본적으로 활성화되어 있습니다. 하이쿠 5.5는 별도로 지시하지 않는 한 적응형 사고를 실행합니다. 낮은 노력은 사고를 줄이며, 간단한 요청에서는 모델이 사고를 완전히 건너뛸 수 있습니다.
- 사고 토큰은 출력 토큰입니다. 이들은
max_tokens에 포함되며 출력 요금($0.50 per million on prompts up to 100K tokens)으로 청구됩니다. - 프롬프트에서 사고를 줄이려는 요청은 효과가 없습니다. 앤트로픽의 테스트에서, 모델은 프롬프트가 직접적으로 대답하라고 지시했을 때도 여전히 사고를 했습니다. 노력은 레버입니다.
각 수준의 비용
두 개의 독립적인 출처가 하이쿠 5.5를 노력 수준에 따라 측정했습니다. 인덱스 수치는 인공지능 분석에서 가져왔으며, FrontierCode 수치는 Cognition의 공개 결과 파일에서 가져왔습니다. 두 출처 모두 귀하의 작업량을 포함하지 않으므로, 이를 곡선의 형태로 간주하고 귀하의 숫자로 보지 마십시오.
인공지능 분석 지능 인덱스 v4.3.2 (지식 작업에서 터미널 작업까지의 10회 평가):
| 노력 | 인덱스 점수 | 인덱스에 대한 출력 토큰 | 작업당 비용 | 첫 번째 토큰까지의 시간 |
|---|---|---|---|---|
| low | 29 | 32M | $0.02 | 9.9 s |
| medium | 34 | 54M | $0.05 | 13.4 s |
| high | 38 | 97M | $0.08 | 28.0 s |
| max | 43 | 440M | $0.21 | n/a |
인공지능 분석은 xhigh 실행을 발표하지 않았습니다. 최대 노력의 대기 시간 수치는 비정상적으로 보였으므로 생략되었습니다.
FrontierCode 1.1 Main, 하이쿠 5.5가 클로드 코드에서 실행됨:
| 노력 | 복합 점수 | 롤아웃당 비용 | 롤아웃당 출력 토큰 |
|---|---|---|---|
| low | 34.8% | $0.06 | 23,868 |
| medium | 41.6% | $0.13 | 36,172 |
| high | 41.9% | $0.26 | 55,149 |
| xhigh | 45.8% | $0.63 | 100,847 |
| max | 46.4% | $1.33 | 181,387 |
비용은 센트로 반올림됩니다.
두 개의 표를 함께 읽으면 세 가지가 두드러집니다.
낮은 수준에서 중간 수준으로의 상승이 가장 저렴합니다. 인덱스에서 약 1.7배의 출력 토큰으로 5점을 구매합니다. FrontierCode에서는 약 두 배의 롤아웃 비용으로 6.8점을 구매합니다.
중간에서 높은 수준으로는 평탄할 수 있습니다. FrontierCode에서 높은 수준은 중간보다 0.3점 높았고 비용은 약 두 배였습니다. 더 넓은 인덱스에서는 높은 수준이 4점을 추가했습니다. 귀하의 작업량이 첫 번째 경우와 두 번째 경우 중 어떤 것인지가 빠른 평가가 알려줍니다.
상위 두 수준은 비쌉니다. 인덱스에서 높은 수준에서 최대 수준으로 상승할 때 출력 토큰은 약 4.5배 증가하여 5점을 얻습니다. FrontierCode에서는 최대 수준이 중간 수준의 약 10배의 비용으로 4.8점을 추가하며, xhigh에서 최대 수준으로의 단계는 대략 0.6점을 위해 비용을 두 배로 증가시킵니다. 앤트로픽의 자체 지침도 같은 내용을 더 간단한 용어로 말합니다: xhigh와 max는 귀하의 평가가 이익을 보여주는 경우에만 사용하고, 성능, 비용, 속도 측면에서 Sonnet 5.5와 비교하십시오.
기본값이 중요한 또 다른 이유: 앤트로픽의 출시 벤치마크는 최대 노력에서 실행되었습니다. 시스템 카드의 중간 노력 결과는 더 낮습니다(예: GDPval-AA에서 1277 대신 1620). 기본값으로 배포하면 비교해야 할 숫자는 이들입니다.
작업량에 따른 시작 지점
| 작업량 | 시작 수준 | 상승 시점 |
|---|---|---|
| 분류, 라우팅, 태깅 | low | 어려운 경우 레이블이 흐트러짐 |
| 짧은 문서에서 추출 | low | 필드가 누락되거나 병합됨 |
| 채팅 및 실시간 지원 | low | 긴 채팅에서 규칙이 흐트러짐 |
| 요약 및 압축 | medium | 주요 세부 정보가 누락됨 |
| 더 큰 모델 아래의 서브 에이전트 작업 | medium | 주 모델이 작업을 다시 수행함 |
| 에이전틱 코딩, 좁은 변경 | medium | 테스트가 첫 번째 시도에서 실패함 |
| 지식 작업, 긴 에이전트 작업 | high | 평가가 여유를 보여줌 |
이 시작 지점들은 앤트로픽의 하이쿠 5.5에 대한 지침을 따릅니다. "상승 시점" 신호는 귀하의 로그에서 주의 깊게 살펴봐야 할 사항입니다.
다시 살펴볼 가치가 있는 한 행은 채팅입니다. 낮은 수준은 가장 빠른 수준으로, 실시간 지원에 적합합니다. 그러나 앤트로픽은 지침 준수가 가장 중요할 때 high를 권장합니다. 예를 들어 사용자가 논쟁할 때 시스템 프롬프트 규칙을 유지해야 하는 지원 도우미입니다. 과거에 잘못된 대화에서 두 가지를 모두 테스트해 보십시오.
노력이 변경될 때 깨지거나 비싸지는 것
작은 max_tokens는 응답을 시작하기 전에 끝낼 수 있습니다. 사고는 max_tokens에 포함됩니다. 예를 들어 50 토큰으로 설정된 한 단어 분류에 맞춘 한도는 사고에 전부 사용될 수 있으며, 응답은 stop_reason: "max_tokens"로 끝나고 텍스트가 없습니다. 여유를 두기 위해 한도를 높이거나 노력을 낮추십시오.
대화 중간에 노력을 변경하면 캐시가 초기화됩니다. 요청 간에 최상위 노력 값을 변경하면 대화의 메시지에 대한 프롬프트 캐시가 무효화됩니다. 에이전트가 low 대화 중에 high에서 어려운 전환이 필요할 경우, 앤트로픽은 캐시를 유지하는 메시지별 노력 변경(베타 헤더 mid-conversation-output-config-2026-07-01, 클로드 API 및 구글 클라우드)을 제공합니다. 사고가 활성화되어 있어야 합니다. 게이트웨이가 해당 베타 헤더를 통과시키는지는 의존하기 전에 확인할 가치가 있습니다.
사고를 끄는 데는 한계가 있습니다. thinking: {"type": "disabled"}는 low, medium, high에서 허용됩니다. xhigh 또는 max에서는 400을 반환합니다. 사고가 꺼져 있을 때 메시지별 노력 변경도 400을 반환하며, 동일한 요청이 JSON 출력을 요청할 때 모델이 필요한 도구 호출을 건너뛸 수 있습니다. 앤트로픽의 조언은 사고를 켜고 대신 낮은 노력 수준을 사용하는 것입니다.
낮은 노력은 조기에 중단될 수 있습니다. 긴 코딩 에이전트 시스템 프롬프트에서 low로 하이쿠 5.5는 때때로 작업이 완료되기 전에 중단되고 작업을 반환합니다. 앤트로픽의 테스트에서 low에서 medium으로 이동하면 조기 중단이 대략 절반으로 줄어들고 시도당 출력 토큰이 두 배 이상 증가했습니다. 하이쿠 5.5 프롬프트 가이드에는 같은 문제를 더 낮은 가격으로 해결하는 "완료될 때까지 작업을 계속하십시오"라는 짧은 지침이 있습니다.
낮은 수준과 중간 수준은 검증을 건너뛸 수 있습니다. 코딩 작업에서 모델은 때때로 테스트를 실행하지 않고 변경 사항을 완료했다고 보고합니다. 프롬프트 가이드에는 이를 위한 검증 단락이 있으며, 비용이 발생하지만 확인된 변경 사항의 비율을 높입니다.
xhigh는 빈 응답을 반환할 수 있습니다. xhigh에서 다중 턴 채팅 중 모델이 사고 안에 전체 답변을 작성하고 가시적인 텍스트 없이 턴을 끝내는 경우가 있습니다. xhigh로 실행하는 경우 빈 텍스트 블록을 확인하십시오.
도구 호출을 강제로 하면 사고를 건너뜁니다. 하이쿠 5.5는 강제 tool_choice를 허용하지만, 응답은 도구 호출로 시작되고 사고가 없습니다. 모델이 도구를 호출하기 전에 추론해야 하는 경우 auto를 사용하고 프롬프트에서 호출 시점을 지정하십시오.
AIHubMix를 통해 자체 노력 스윕 실행
가장 빠른 선택 방법은 20~50개의 실제 프롬프트를 두세 수준에서 실행하고 품질, 출력 토큰 및 대기 시간을 비교하는 것입니다. AIHubMix 클로드 네이티브 엔드포인트를 통해, AIHUBMIX_API_KEY가 설정된 상태에서:
import os
import time
import anthropic
client = anthropic.Anthropic(
api_key=os.environ["AIHUBMIX_API_KEY"],
base_url="https://aihubmix.com",
)
prompts = [
"이 지원 티켓을 한 문장으로 요약하세요: ...",
"다음에서 송장 번호와 총액을 추출하세요: ...",
]
for effort in ["low", "medium", "high"]:
out_tokens, seconds = 0, 0.0
for prompt in prompts:
start = time.time()
r = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8000,
output_config={"effort": effort},
messages=[{"role": "user", "content": prompt}],
)
seconds += time.time() - start
out_tokens += r.usage.output_tokens
text = next((b.text for b in r.content if b.type == "text"), "")
# `text`를 프롬프트 옆에 저장하고 귀하의 기준에 따라 평가하십시오.
print(f"{effort}: {out_tokens} 출력 토큰, {seconds:.1f}s 총")
출력 토큰이 low와 high 사이에서 거의 변하지 않으면, 설정이 모델에 도달하지 못하고 있을 가능성이 높습니다. 귀하의 게이트웨이가 전달하는 요청을 확인하십시오. AIHubMix의 하이쿠 5.5 페이지에서 각 노력 수준의 토큰당 가격은 동일하므로, 이 스윕에서의 토큰 수는 직접적으로 달러로 변환됩니다.
자주 묻는 질문
클로드 하이쿠 5.5의 기본 노력 수준은 무엇인가요?
중간입니다. 대부분의 현재 클로드 모델은 기본값이 높으므로, 다른 모델의 기본값에 의존했던 코드는 명시적으로 노력을 설정하지 않는 한 하이쿠 5.5에서 한 수준 낮게 실행됩니다.
사고를 완전히 끌 수 있나요?
낮은, 중간 및 높은 노력에서는 가능합니다. 사고를 비활성화로 설정하면 됩니다. xhigh와 max에서는 오류가 반환됩니다. 앤트로픽은 대신 노력을 낮추는 것을 권장합니다. 모델은 간단한 요청에서 스스로 사고를 건너뛸 수 있으며 도구 호출 행동을 유지합니다.
어떤 노력 수준이 가장 저렴한가요?
낮은 수준입니다. 인공지능 분석의 실행에서는 전체 인덱스에 대해 약 3천 2백만 개의 출력 토큰을 사용했으며, 중간에서는 5천 4백만 개, 최대에서는 4억 4천만 개를 사용했습니다. 각 수준의 토큰당 가격은 동일하며, 차이는 생성되는 토큰 수입니다.
하이쿠 5.5에서 최대 노력은 가치가 있나요?
자신의 평가에서 증거가 있을 때만 그렇습니다. FrontierCode에서 최대는 중간보다 약 10배 비쌌고 4.8점 상승했습니다. 그 시점에서 앤트로픽은 Sonnet 5.5와 비교하여 같은 품질을 더 낮은 비용으로 얻을 수 있다고 제안합니다.
왜 내 응답이 텍스트 없이 끝나나요?
보통 사고가 응답이 시작되기 전에 max_tokens를 소진했기 때문입니다. max_tokens를 높이거나 노력을 낮추십시오. 다중 턴 채팅에서 xhigh에서는 빈 응답이 모델이 사고 안에 답변을 넣었음을 의미할 수도 있습니다.
노력 변경이 프롬프트 캐싱에 영향을 미치나요?
예. 요청 간에 최상위 노력을 변경하면 해당 대화의 캐시된 메시지가 무효화됩니다. 현재 베타 상태인 메시지별 노력 변경은 이를 피합니다.
출시 벤치마크가 기본값에서 보는 것과 일치하지 않는 이유는 무엇인가요?
출시 수치는 최대 노력에서 실행되었습니다. 중간에서 시스템 카드는 더 낮은 점수를 보고합니다. 예를 들어 GDPval-AA에서 1277 대신 1620입니다.
계속 읽기: 클로드 하이쿠 5.5 시리즈
- 노력이 생성하는 토큰 수를 결정합니다. 하이쿠 5.5가 하이쿠 4.5, GPT-6 루나, 그리고 Sonnet 5.5와 어떻게 비교되는지에 대한 내용은 클로드 하이쿠 5.5 vs 하이쿠 4.5: 지금 10센트로 무엇을 살 수 있나요를 읽어보세요.
- 사고 토큰은 출력으로 청구되며, 프롬프트 길이가 요금 카드를 결정합니다. 노력 선택을 월별 청구서로 전환하려면 클로드 하이쿠 5.5 가격: 90% 컷 뒤의 100K 라인를 읽어보세요.
- 노력은 이전 사고 예산을 대체하며, 이전 예산은 이제 오류를 반환합니다. 이 수정 및 하이쿠 4.5에서의 전환에 대한 나머지 내용은 하이쿠 4.5에서 5.5로 마이그레이션: 다섯 개의 400 오류와 조용한 변화를 읽어보세요.
출처
- 노력 (클로드 플랫폼 문서)
- 하이쿠 5.5 프롬프트 (클로드 플랫폼 문서)
- AIHubMix의 클로드 하이쿠 5.5
- 클로드 하이쿠 5.5 지능, 성능 및 가격 분석 (인공지능 분석)
- 클로드 하이쿠 5.5: 벤치마크, 사양, 솔 & 루나 비교 (킹이.ai)



