앤스로픽이 중국 지푸의 GLM-5.3 사이버 역량 분석을 공개했어요. 가드레일 제거에 GPU 2,200시간, 약 4,400달러면 충분했어요. 공개 가중치 모델의 안전장치가 얼마나 약한지 보여주는 숫자예요.
9월 29일 앤스로픽이 리서치 글을 하나 올렸어요. 중국 Z.ai(지푸)가 8월 14일 내놓고 2주 뒤 가중치까지 푼 GLM-5.3이 해킹 쪽으로 얼마나 위험한지 따져본 내용이에요. 📊
먼저 성능부터요. ExploitBench에서 GLM-5.3은 약 12%의 시도에서 처음부터 끝까지 이어지는 익스플로잇을 만들어냈고, 내부 바이너리 익스플로잇 벤치마크에선 제어 흐름을 완전히 가로채는 데 4% 성공했어요. 앤스로픽이 '클로드 미토스 프리뷰'와 비슷한 수준이라고 평가한 부분이에요.
근데 진짜 충격은 안전장치 쪽이에요. 그냥 해로운 요청을 하면 GLM-5.3은 0% 응했어요. 여기까진 괜찮죠. 그런데 가짜 사연으로 포장하면 64%, 모델이 생각을 시작하는 토큰을 미리 채워 넣으면 92%까지 올라갔고요. 'abliteration'이라는 기법으로 거절 기능 자체를 도려낸 버전은 100% 응했어요. 같은 조건에서 클로드는 전부 0%였다고 해요. 물론 만든 회사가 쓴 비교라는 점은 감안해야겠죠.
abliteration에 든 비용이 더 놀라웠어요. 약 2,200 GPU 시간, 돈으로 약 4,400달러예요. 이걸로 거절률이 95%에서 6%로 떨어지는데 일반 성능은 그대로래요. 가중치가 공개돼 있으면 누구든 이 정도 돈으로 안전장치를 벗길 수 있다는 얘기예요. ⚠️
참고로 미국 CAISI는 GLM-5.3을 지금까지 나온 오픈웨이트 모델 중 사이버 역량이 가장 높다고 평가하면서도, 미국 최상위 모델보다는 한참 아래라고 봤어요. 8월엔 CyberGym 84.5%라는 점수도 나왔고, 열려 있는 프로젝트 269곳에서 취약점 2,436건을 찾았다는 보고도 있었어요. 🔥
앤스로픽의 제안은 두 갈래예요. 정부가 독립적으로 모델 안전성을 평가해야 하고, 방어하는 쪽에는 안전장치가 잘 된 최상위 모델 접근을 더 넓게 열어줘야 한다는 거예요. "방어자는 가장 좋은 도구를 써야 한다"는 문장이 인상적이었어요.
솔직히 저는 이게 앤스로픽 입장에선 꽤 편리한 논리라는 생각도 들어요. 자기네 모델은 안전하니 자기네 걸 더 쓰게 해달라는 말로도 읽히니까요. 그래도 4,400달러라는 숫자는 반박하기 어렵죠. 모델을 공개