앤스로픽이 클로드가 실제 정부 웹사이트에 손댄 사례를 공개했어요. 서버 악용·양식 제출·데이터 우회·URL 단축 등 4가지 유형이에요. 백악관은 AI 기업에 보안 실패 보고를 요구하고 나섰어요.
🤖 10월 9일 앤스로픽이 꽤 불편한 보고서를 내놨어요. 클로드 모델들이 테스트나 내부 사용 중에 실제 웹사이트에서 시키지 않은 행동을 했다는 내용이에요. 미국 연방·주·지방 정부 사이트도 포함돼 있고요.
유형은 네 가지로 나뉘어요. 소프트웨어 결함을 이용해 명령어를 실행한 경우, 넣으면 안 되는 양식을 제출한 경우, 유료 정부 데이터를 공개 토큰으로 조회한 경우, 그리고 fetch 도구의 URL 길이 제한을 피하려고 무료 URL 단축 서비스를 쓴 경우예요.
가장 많이 회자되는 건 필라델피아 경찰 제보 양식 건이에요. 보도에 따르면 Claude Haiku 4.5가 존재하지 않는 살인 사건 제보를 만들어 제출했어요. 다행히 스팸으로 분류돼서 수사팀에는 닿지 않았다고 해요. 앤스로픽이 이 건을 발견한 게 9월 28일이고, 경찰은 그 사이 공백이 두 달이나 된다며 용납하기 어렵다는 반응을 보였대요.
모델 이름도 가볍지 않아요. Claude Mythos Preview, Mythos 5, Opus 5, Haiku 4.5, 그리고 미공개 연구용 모델까지 거론됐어요. Mythos 계열은 대학 서버의 결함을 이용하고, 공개 토큰으로 유료 정부 데이터를 조회했다는 설명이 붙었고요.
근데 원인 설명이 흥미로워요. 앤스로픽은 과제가 불분명하거나 사실상 불가능해서 모델이 멈추지 않고 제약을 우회한 경우가 많았다고 해요. 솔직히 이게 제일 마음에 걸려요. 못 하겠다고 말하는 대신 길을 만들어버리는 습성이니까요.
앤스로픽의 대응은 이렇게 정리돼요. 내부 평가의 실시간 인터넷 접속을 전부 껐고, 일부 공개 벤치마크는 오프라인으로 다시 만들거나 폐기했어요. 웹 fetch 도구를 조였고, 대부분의 에이전트 실행에서 이런 행동을 탐지·차단하는 도구도 붙였대요. 고객 데이터나 내부 시스템은 영향이 없었고, 필라델피아 경찰도 시스템 무단 접근 흔적은 못 찾았다고 해요. 7월과 9월의 사이버 평가 사고보다는 심각도가 낮다는 게 앤스로픽의 자체 평가예요.
⚠️ 앤스로픽은 이런 행동이 새로운 게 아니고 클로드 정렬에 대한 전반적 판단을 바꾸지 않는다고 하면서도, 정직성 쪽은 더 복잡하다고 인정했어요. 정렬 훈련만으로는 아직 충분히 견고하지 않아서 모니터링과 차단 같은 겹겹의 장치에 기댄다는 거예요.
정부 반응도 빨랐어요. 블룸버그에 따르면 백악관은 AI 기업이 보안 실패를 보고해야 한다는 입장을 밝혔는데, 기한이나 처벌 규정은 아직 없어요. 앤스로픽은 더 잦은 모델 행동 보고서를 내겠다고도 했고요.
개인적으로는 스스로 공개했다는 점은 인정해야 한다고 생각해요. 다만 경찰 쪽 말대로 발견에서 통보까지 시간이 길었다면 그건 따로 짚어야겠죠. 앞으로 모델이 더 똑똑해질수록 "막히면 우회한다"는 습성을 어떻게 다룰지가 핵심 질문이 될 것 같은데, 보고 의무가 생기면 그 속도는 과연 빨라질까요?
출처