블로그 목록

NEW RELEASE · 2026.10.07 / ANALYSIS 10.08

작은 모델. 큰 변화.

Claude Haiku 5.5. 성능은 올라갔다. 단가는 내려갔다. 하지만 실제 작업비까지 저렴할까?

Claude Haiku 5.5독립 벤치마크 · 공식 가격 · 초기 사용기
MODELNOTESRESEARCH / 026
네 가지 모델, 세 가지 기준으로 읽기 ↘
ANTHROPIC / SMALL MODEL
5.5
AA INTELLIGENCE
43 / max
INPUT / 1M TOKENS
$0.10 / ≤100k
독립 벤치마크 + 공식 가격 + 초기 사용기스크롤해서 비교하기 ↓
THE TAKEAWAY

단가는 같아도,
청구서는 다르다.

하이쿠 max는 Luna보다 종합 점수 5점 높다. 그러나 같은 평가의 과제당 비용은 3배. 짧은 작업과 긴 에이전트 작업을 구분해야 이 모델의 가치가 보인다.실제 비용 살펴보기 ↗

01 / CAPABILITY

저가 모델의
성능 기준이 올라갔다.

같은 종합 지표로 비교하면 하이쿠 max가 앞선다.
medium은 비용과 성능의 다른 선택지다.

종합 성능

AA Intelligence Index 높을수록 좋음 ↑
AA Intelligence Index v4.3.2 · 지식·추론·코딩·업무 등 10개 평가의 종합 지표. 점수는 정답률(%)이 아닙니다. [2–6]
+5점

하이쿠 max → Luna max 대비
종합 성능 차이

34점

하이쿠 medium
더 낮은 추론 비용의 선택

설정까지 함께 봐야 한다.

같은 모델도 effort에 따라 성능과 토큰 사용량이 달라진다. 모델 이름만으로 비교하면 실제 운영 결과를 놓친다.

업무별 벤치마크도 살펴보기 +
평가Haiku 5.5GPT-6 LunaHaiku 4.5
Terminal-Bench 4.0 · 터미널 코딩39.2%16.4%0.0%
FrontierCode 1.1 · 코딩46.4%42.4%—
OSWorld 2.1 · 컴퓨터 사용¹72.4%48.9%15.7%

Anthropic 출시 발표의 평가 결과입니다. 독립 종합 지표와 구분해서 읽어야 합니다. ¹ 오프라인 부분집합. 세부 설정은 공식 시스템 카드 참조. [1]

02 / TOKEN PRICING

10만 토큰.
가격이 바뀌는 경계.

짧은 요청에서 하이쿠와 Luna는 같은 단가.
하이쿠는 입력 10만 토큰 초과 시 5배로 오른다.

API 토큰 가격

USD / 100만 토큰 낮을수록 저렴 ↓
입력출력

일반 온라인 API 요금 · 캐시·배치·도구 비용 제외 · DeepSeek은 피크 요금. [1,7–9]

모델 / 요청 조건입력출력캐시 읽기
Haiku 5.5 ≤100k$0.10$0.50$0.01
Haiku 5.5 >100k$0.50$2.50$0.05
GPT-6 Luna 기본 단가$0.10$0.50$0.01
Gemini 3.5 Flash-Lite$0.30$2.50$0.03
DeepSeek V4.1 Flash 피크$0.30$1.20$0.006

100만 토큰당 USD. 하이쿠의 기본 캐시 쓰기는 $0.125, 10만 초과는 $0.625. Luna의 기본 캐시 쓰기는 $0.125. Gemini는 캐시 저장료 $1 / 100만 토큰·시간 별도. DeepSeek 비피크 요금은 표의 절반입니다. Luna의 장문 요청 조건은 공식 가격 문서를 확인하세요.

PRICING CLIFF

같은 하이쿠,
다른 가격 구간.

10만 토큰 초과 요청에는 높은 단가가 적용됩니다.
초과분만 비싸지는 구조로 계산하지 않았습니다.

20k100k 경계200k
예상 1회 토큰 비용$0.0105기본 가격 구간

계산 예시: 캐시 없는 입력 + 출력 5,000토큰 고정. 추론 토큰은 이 출력량에 포함한다고 가정. 도구 비용 제외.

03 / REAL COST

싼 토큰이
싼 작업을 뜻하진 않는다.

추론량과 반복 호출까지 포함한 과제당 비용.
하이쿠의 두 설정을 비교하면 차이가 더 선명하다.

AA 평가 과제당 가중평균 USD. 입력·캐시·추론·답변 토큰 비용을 반영하며, 일반 업무의 예상 청구액은 아닙니다. [2–6]

04 / THROUGHPUT

빠르게 생성한다.
빠르게 끝낼까?

출력 속도와 작업 완료 시간은 다르다.
대기 시간과 생성한 토큰 수도 함께 봐야 한다.

출력 처리량

Tokens / second 높을수록 빠름 ↑
스트리밍 생성 중 처리량. 첫 응답 대기·추론·도구 실행·재시도 시간을 제외합니다. [2–6]
HAIKU MAX / LUNA MAX1.9×

초당 출력 속도

BUT ALSO3.1×

평가 전체 출력 토큰량

하이쿠 max는 더 빠르게 출력하지만, 평가 전체에서 440M 토큰을 생성했다. Luna는 140M. 출력 처리량만으로 전체 작업 시간이 더 짧다고 결론 낼 수 없다.

05 / FIELD REPORTS

출시 첫날의 반응.
기대와 비용 사이.

2026.10.07–08 커뮤니티 초기 사용기.
사용자 보고이며, 독립 재현 결과는 아니다.

POSITIVEReddit / r/ClaudeAI

짧은 요청을 많이 반복할 때는 강하다.

한 사용자는 단일 요청을 대량 반복하는 작업에서 약 3배 빠르고, 구독 사용량이 11배 줄었다고 보고했다. 범위가 좁은 반복 작업에서 긍정적인 경험이 나왔다.

사용기 읽기 ↗
01
COST CONCERNReddit / r/ClaudeAI

에이전트 작업은 10만 토큰을 쉽게 넘긴다.

간단한 작업에서도 10만~20만 토큰에 도달한다는 보고. 한 댓글은 164회 호출 중 145회가 10만을 초과했다고 기록했다. 하위 에이전트라고 항상 짧은 문맥을 쓰는 것은 아니다.

토큰 사용량 논의 ↗
02
SINGLE TESTReddit / voxel pagoda

같은 제작 과제에서 약 12.7배의 비용 차이.

작성자는 복셀 탑 제작에서 하이쿠 xhigh $24.96, Luna xhigh $1.96의 API 환산 비용을 보고했다. 구독 실행 로그로 계산한 단일 사례이며, 결과 품질과 조건이 통제된 비교는 아니다.

비교 기록 읽기 ↗
03
QUALITY CHECKReddit / attribution

문장을 찾는 것과 의미를 맞히는 것은 다르다.

책에서 문장을 찾았지만 인용 주체를 잘못 분류했다는 사용기도 있다. 실제 업무에서는 검색 성공률뿐 아니라 분류·귀속 판단의 정확도를 따로 확인해야 한다.

정확도 관련 댓글 ↗
04
06 / HOW TO CHOOSE

모델 이름보다,
업무의 길이와 난도.

01

분류 · 추출 · 짧은 요약

하이쿠 medium부터 시험. 실제 데이터의 정확도와 오류 처리 비용을 함께 측정한다.

02

긴 코딩 · 에이전트 실행

Luna와 하이쿠를 동일 과제로 비교. 10만 초과 비율, 재시도와 최종 품질까지 기록한다.

03

실시간 사용자 응답

Flash-Lite의 처리량도 비교. 첫 답변 대기 시간과 한국어 품질을 별도로 측정한다.

위 선택 가이드는 공개 측정 결과에 기반한 편집 판단입니다. 특정 서비스에서의 성능 보장은 아닙니다.

APPENDIX / METHODOLOGY

출처와 비교 기준.

공식 발표, 독립 측정, 사용자 경험을 구분했다.
수치는 확인 시점의 스냅샷이다.

성능AA 종합 지표 v4.3.2. Haiku·Luna·DeepSeek은 max, 하이쿠 medium 추가. 업체별 effort는 같은 추론 예산을 의미하지 않는다.

가격100만 토큰당 USD. 일반 API 기준. 배치·도구·세금 제외. DeepSeek 피크 요금. 장문·캐시 저장 조건을 별도 표기했다.

속도생성 중 출력 처리량. AA 표준 입력 워크로드 기준. 토크나이저가 다르므로 같은 tok/s라도 문자 생성 속도는 다를 수 있다.

리뷰출시 첫날의 Reddit 사용기. 만족도 설문이나 커뮤니티 전체의 합의가 아니며, 품질·비용을 재현 검증하지 않았다.

    Design system / 디자인 토큰 +
    Paper#F5F3ED
    Ink#242522
    Signal#D75B35
    Positive#477665

    간격 4 / 8 / 12 / 16 / 24 / 32 / 48 / 64 / 96px · 본문 16px / 1.65 · 숫자 tabular-nums · 최대 본문 폭 1240px · 모션 220 / 600ms · reduced-motion 지원