엔비디아 잡으러 온 오픈AI 자체 칩
브로드컴과 만든 추론칩 '할라피뇨' 첫 벤치마크 공개
브로드컴과 만든 추론칩 '할라피뇨' 첫 벤치마크 공개
104.3배
기존 최고 지연시간 구간 대비 와트당 처리량 격차 (모델별 8.6~104.3배)
GPT-OSS·DeepSeek R1·Kimi K2.5로 검증했어요
실시간 응답이 필요한 워크로드에서 격차가 더 컸어요
KV 캐시를 로컬화해 데이터 이동 지연을 줄였어요
"할라피뇨는 전력 단위당 더 많은 AI 작업을 처리하면서도, 응답은 더 빠르게 돌려줍니다."
— 리처드 호
엔비디아와의 진짜 승부는 아직 시작 전이에요