스타트업 해크트론AI가 앤스로픽 클로드로 오픈AI 내부 시스템까지 뚫었어요. 72시간 만에 발견부터 사내 저장소 접근까지 끝났고, 바운티는 6,500달러였어요. 오퍼스4.8은 실패했지만 오퍼스5는 몇 시간 만에 성공해서 더 화제예요.
3인조 스타트업이 오픈AI를 뚫었다는 소식이 떴어요. 근데 더 재밌는 건, 그 도구가 다른 곳도 아니고 경쟁사 앤스로픽의 클로드였다는 점이에요. 보안 스타트업 해크트론AI 소속 연구원 세 명 — 하시 자이스왈, 모한 페다파티, 라훌 마이니 — 이 오픈AI의 버그바운티 프로그램을 통해 이 실험을 진행했고, 9월 18일 테크크런치를 통해 전말이 공개됐어요. 🔓
시작은 오픈AI 직원용 커뮤니티 포럼이었어요. 이 포럼은 디스코스라는 오픈소스 소프트웨어로 돌아가는데, 이미지 업로드 기능에 구멍이 있었대요. 아이폰에서 흔히 쓰는 HEIC·HEIF 포맷 이미지를 올리면 이미지매직이 변환을 담당하는데, 이때 쓰이는 libheif 라이브러리에 힙 버퍼 오버플로 취약점이 있었던 거예요. 여기에 악성 이미지를 흘려보내면 메모리 읽기·쓰기 권한을 얻어서 임의 코드 실행까지 갈 수 있었다고 해요.
근데 여기서 클로드가 등장해요. 연구팀은 보안 연구자용으로 제공되는 특수 버전 클로드를 썼는데, 처음엔 잘 안 됐대요. 오퍼스4.8로 여러 세션을 돌려봤지만 작동하는 익스플로잇을 못 만들었다고 하더라고요. 근데 앤스로픽이 오퍼스5를 공개하자마자 똑같은 문제를 다시 넣어봤더니, 몇 시간 만에 성공했대요. 모델 하나 바뀌었다고 실패하던 공격이 성공으로 뒤집힌 거죠. 솔직히 이 대목이 제일 소름 돋았어요.
취약점은 여기서 끝이 아니었어요. 포럼 로그인에 쓰이는 싱글사인온 인증 토큰이 오픈AI의 다른 서비스로도 넘어갈 수 있다는 두 번째 구멍도 찾아냈거든요. 이 두 개를 엮으니까 챗GPT·코덱스·깃허브·슬랙·이메일까지 줄줄이 연결된 직원 계정을 장악할 수 있었던 거예요. 실제로 연구팀은 오픈AI 내부 깃허브 저장소에 테스트용 풀 리퀘스트까지 올려서 접근 권한을 증명했대요. ⚠️
타임라인을 보면 7월 25일에 최초 접근에 성공했고, 이틀 뒤인 7월 27일 디스코스 측이 수정 패치를 냈어요. 오픈AI도 문제를 통보받은 뒤 약 14시간 만에 자체 서비스 쪽 구멍을 막았고요. 최초 발견부터 내부 저장소 접근 증명까지는 72시간이 채 안 걸렸다고 해요. 그리고 오픈AI는 이 발견에 6,500달러 바운티