앤트로픽, 소형 AI 모델 'Claude Haiku 5.5' 공식 출시… 비용 75% 절감 및 추론 노력 조절 지원
앤트로픽이 Claude 5.5 라인업의 경량 모델인 Claude Haiku 5.5를 출시했습니다. Haiku 4.5 대비 평균 75% 저렴해진 실행 비용, 코딩·컴퓨터 사용 성능 강화, 제품군 최초의 추론 노력 조절 기능 및 Sonnet 5.5 캐시 비용 인하를 함께 단행했습니다.
앤트로픽(Anthropic)이 2026년 10월 7일(현지 시각), 자사 최신 파운데이션 모델 라인업의 경량화 엔트리 모델인 '클로드 하이쿠 5.5(Claude Haiku 5.5)'를 공식 출시했습니다. 지난 9월 말 공개된 플래그십 모델 Opus 5.5와 중간급 모델 Sonnet 5.5에 이어 5.5 세대 라인업을 완성하는 이번 릴리즈는, 이전 세대인 Haiku 4.5 대비 실행 비용을 평균 약 75% 절감하면서도 코딩과 컴퓨터 사용(Computer Use) 성능을 대폭 개선한 것이 핵심입니다.

이미지 출처: Anthropic (@claudeai)
Haiku 5.5는 대규모 호출량과 비용 민감도가 높은 엔터프라이즈 환경 및 개발 파이프라인을 정조준해 설계되었습니다. 텍스트 요약, 데이터 분류, 문맥 압축, 데이터베이스 질의와 같은 반복 작업을 고속으로 처리할 뿐만 아니라, 최상위 모델인 Opus 5.5나 Sonnet 5.5와 연계되어 복잡한 코딩 태스크를 병렬로 분담하는 '서브에이전트(Subagent)' 역할에 최적화되었습니다. 또한 Haiku 시리즈 최초로 추론 노력(effort) 설정 기능을 탑재하여 작업 성격에 맞춰 비용과 지능의 우선순위를 직접 제어할 수 있는 유연성을 제공합니다.
평균 75% 비용 절감과 10만 토큰 이하 워크로드 최적화
앤트로픽의 공식 발표에 따르면 Claude Haiku 5.5는 이전 세대인 Haiku 4.5와 비교했을 때 동일하거나 더 뛰어난 성능을 발휘하면서도 평균 실행 비용이 약 75% 저렴해졌습니다. 이는 과거 엔터프라이즈 환경에서 소형 모델을 도입할 때 가장 큰 장벽이었던 대규모 토큰 누적 비용을 대폭 낮춘 결과입니다.
특히 Haiku 5.5는 100,000(10만) 토큰 이하의 입력 길이를 가진 작업에서 탁월한 경제성을 발휘하도록 엔지니어링되었습니다. 앤트로픽의 내부 텔레메트리에 따르면 기존 Haiku 4.5로 유입되던 전체 API 요청의 약 90%가 10만 토큰 미만의 워크로드에 집중되어 있었습니다. 이번 릴리즈는 바로 이 핵심 사용 구간의 처리 효율을 집중적으로 끌어올려, 대규모 트래픽을 처리하는 서비스의 인프라 비용 부담을 실질적으로 경감시켰습니다.
- 대용량 반복 작업 처리: 수만 건의 비정형 문서 요약, 대량 데이터 태깅 및 분류, 컨텍스트 압축 등 높은 처리량이 요구되는 배치 작업에 즉각적인 비용 절감 효과를 제공합니다.
- 실시간 고객 응답 최적화: 표준 속도 기준으로 Claude 5.5 제품군 중 가장 빠른 응답 레이턴시를 유지하여 실시간 챗봇, 라이브 고객 지원(Live Support), 지연 시간에 민감한 상호작용 인터페이스에 최적화되었습니다.
- 정렬 평가(Alignment Evaluations) 개선: 앤트로픽의 안전성 및 정렬 평가 지표 전반에서 Haiku 4.5 대비 눈에 띄는 진전을 기록했으며, 안전성 기준을 벗어나는 미정렬(Misaligned) 응답 비율이 대폭 감소했습니다.
코딩·컴퓨터 사용 도약과 협업형 서브에이전트 아키텍처
Haiku 5.5의 기술적 진보 중 주목할 점은 코딩, 컴퓨터 사용(Computer Use), 지식 작업(Knowledge Work) 전반에서 확인된 성능 도약입니다. 과거 경량 모델이 단순 언어 생성이나 단답형 질문 응답에 머물렀던 것과 달리, Haiku 5.5는 도구 호출과 멀티턴 코드 작성에서 높은 신뢰도를 확보했습니다.
특히 앤트로픽은 Haiku 5.5를 단독 구동 모델뿐만 아니라 계층형 에이전트 시스템의 실무 조력자로 포지셔닝했습니다. 복잡한 시스템 아키텍처 설계나 고난도 로직 추론은 상위 모델인 Claude Opus 5.5가 총괄하고, 중간 수준의 일상 작업과 모듈 개발은 Claude Sonnet 5.5가 담당하며, Haiku 5.5는 하위 서브에이전트로 배치되어 단위 테스트 실행, 보일러플레이트 코드 작성, 오류 로그 파싱, 브라우저 조작을 전담하는 협업 구조입니다.
- 컴퓨터 사용 및 브라우저 제어: 브라우저 기반 GUI 환경에서의 요소 탐색, 폼 입력, 화면 캡처 분석 등 컴퓨터 조작 기능이 개선되어 복잡한 웹 워크플로우를 신속하게 완수할 수 있습니다.
- 코딩 서브에이전트 최적화: 멀티에이전트 하네스에서 병렬로 호출되는 서브에이전트의 토큰 소모량을 획기적으로 줄여, 동일한 예산 범위 내에서 에이전트의 시도 횟수와 탐색 폭을 넓힐 수 있습니다.
- 작업 한계 및 주의점: 심층적인 수리 논리나 장기 추론이 요구되는 복합 문제의 경우 단독 사용보다는 상위 모델(Opus 5.5 / Sonnet 5.5)의 지휘를 받는 서브에이전트 조합으로 구성하는 것이 권장됩니다.
최초의 추론 노력 조절과 클라우드 3사 동시 배포
개발자 경험과 운영 유연성 측면에서 도입된 주요 기능은 Haiku 라인업 최초의 '추론 노력(Adjustable Effort Setting)' 조절 컨트롤입니다.
추론 노력 조절 기능은 호출자가 단일 API 요청 내에서 파라미터를 통해 모델의 사고 깊이와 연산 자원 투입량을 동적으로 설정할 수 있도록 합니다. 단순 데이터 추출이나 포맷 변환과 같은 정형 작업에서는 노력 레벨을 낮춰 비용과 응답 시간을 최소화하고, 다단계 로직 분석이나 정밀 코딩 검증이 필요한 작업에서는 노력 레벨을 높여 상위 지능에 근접한 결과를 도출할 수 있습니다.
또한 Haiku 5.5는 출시와 동시에 아마존 웹 서비스(AWS, GovCloud 포함), 구글 클라우드(Google Cloud), 마이크로소프트 애저(Microsoft Azure) 등 주요 글로벌 클라우드 플랫폼 전반에 일제히 배포되었습니다. Vercel AI Gateway를 비롯한 주요 개발자 게이트웨이에서도 당일 지원이 시작되어, 기존에 Haiku 4.5를 운용하던 개발팀은 복잡한 마이그레이션 절차 없이 즉각적인 드롭인(Drop-in) 업그레이드가 가능합니다.
한편 앤트로픽은 이번 발표와 함께 상위 모델인 Claude Sonnet 5.5의 프롬프트 캐시 읽기(Cache Reads) 비용을 50% 전격 인하했습니다. 백만 토큰당 기존 $0.20에서 $0.10로 조정됨에 따라, 장기 세션을 유지하거나 거대한 코드베이스를 지속적으로 참조하는 에이전트 워크로드의 전반적인 실행 비용이 약 20% 추가 절감됩니다. 각 클라우드 플랫폼별 리전 가용성과 세부 부가 요금 체계는 도입 전 개별 벤더 콘솔을 통해 확인해야 합니다.
출처
- Anthropic 공식 발표: Introducing Claude Haiku 5.5
- Claude 공식 X (@claudeai): Claude Haiku 5.5 공식 출시 발표 스레드
- Amazon Web Services: Claude Haiku 5.5 is now available on AWS GovCloud (US)
- Vercel: Claude Haiku 5.5 now available on AI Gateway