앤스로픽이 소형 모델 Claude Haiku 5.5를 출시했어요. 입력 100만 토큰당 0.10달러, 출력은 0.50달러예요. Sonnet 5.5 캐시 읽기 가격도 절반으로 내렸어요.
앤스로픽이 오늘 Claude Haiku 5.5를 내놨습니다. 가장 먼저 눈에 들어오는 건 역시 가격이에요. 프롬프트가 10만 토큰 이하일 때 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러. 이전 세대와 비교하면 비용이 대략 75% 낮아졌다고 하고, 일부 매체는 최대 90%까지 내렸다고 표현하더라고요. 어느 쪽 기준이든 체감은 확 낮아졌어요. 💰
그럼 성능이 희생됐느냐, 그게 또 아니라서 재밌어요. OSWorld 2.1이라는, 컴퓨터를 직접 조작하는 에이전트 벤치마크에서 72.4%를 기록했고, 이른바 사람이 만든 최고난도 문제 모음인 Humanity's Last Exam에서는 45.9%예요. 소형 모델이 이 정도 숫자를 찍는다는 건, 불과 얼마 전까지 플래그십 전용이던 영역이 아래로 내려오고 있다는 신호죠. 📈
사실 저는 가격표 맨 아래 한 줄이 더 흥미로웠어요. 앤스로픽이 Sonnet 5.5의 캐시 읽기 가격도 절반으로 깎았다는 부분이요. 에이전트 쓰는 분들은 아시겠지만, 긴 컨텍스트를 반복해서 읽는 작업에서는 캐시 읽기 비용이 청구서의 상당 부분을 차지하거든요. 모델 하나 싸게 낸 것보다 이쪽이 실제 비용에는 더 크게 작용할 수도 있어요.
왜 지금일까 생각해 보면, 에이전트가 하루 종일 돌아가는 시대에 병목은 성능이 아니라 단가가 됐기 때문일 거예요. 얼마 전 오픈AI가 상시 에이전트를 내놨고, 구글도 요금제별로 모델 접근을 재편한다고 했잖아요. 다들 "많이 돌리게 만드는 쪽"으로 경쟁하는 거죠. 앤스로픽의 대답이 이번 Haiku 5.5의 가격 인하라고 봐요. 🚀
근데 마냥 좋아할 일만은 아닌 것 같기도 해요. 가격이 이렇게 내려가면 쓰는 양이 폭발하고, 결국 총 지출은 오히려 늘어나는 경우도 흔하니까요. 솔직히 저도 싸다는 이유로 이것저것 돌리다가 월말에 놀란 적이 있어서요. 비용 모니터링은 오히려 더 중요해질 것 같습니다. ⚠️
그리고 벤치마크 숫자는 어디까지나 앤스로픽이 발표한 값이라, 실제 업무에서 어떨지는 써봐야 알 수 있어요. 소형 모델이 서브에이전트나 분류, 문서 처리 같은 반복 업무를 싹 가져가게 될지, 아니면 결국 큰 모델 옆에서 보조 역할에 머물지 궁금하