미군이 AI 챗봇의 환각 정보 때문에 중국 선박 공격 작전을 발진 직전에 취소했어요. 챗봇이 화물을 핵무기 부품으로 오판했고, 그 보고서가 지휘계통을 그대로 타고 올라갔어요. 전투기까지 뜬 상태였다는 점에서 AI 신뢰성 문제가 얼마나 심각한지 보여준 사건이에요.
솔직히 이번 소식 보고 좀 소름 돋았어요. CNN이랑 테크크런치가 9월 18일에 동시에 터뜨린 얘긴데, 올봄 미군이 실제로 중국 선박을 향한 무력 작전을 진행하려다가 마지막 순간에 멈췄다는 내용이에요. 근데 그 이유가 황당해요. AI 챗봇이 만들어낸 가짜 정보 때문이었거든요. ⚠️
사건을 좀 풀어보면 이래요. 특수전사령부 소속 분석관 한 명이 공개출처 정보랑 기밀 신호정보를 종합해달라고 AI 챗봇에 물어봤대요. 근데 이 챗봇이 선박의 화물 목록을 완전히 잘못 해석해버린 거예요. 핵무기 프로그램용 부품을 싣고 있다는 결론을 내놓은 거죠. 문제는 여기서 끝나지 않았어요. 이 분석관이 그 잘못된 결과를 다시 챗봇에 넣어서 공식 보고서 형태로 포맷팅까지 했다는 거예요. 그렇게 만들어진 문서가 지휘계통을 타고 그대로 올라갔고, 아무도 중간에 "이거 진짜 맞아?"라고 의심하지 않았다고 해요.
더 아찔한 건 타이밍이에요. 이란과의 전쟁이 한창이던 시기에 벌어진 일이라 군 전체가 신속한 판단을 요구받는 분위기였거든요. 실제로 군용기까지 이미 출격한 상태였는데, 막판에 정보가 틀렸다는 게 밝혀지면서 작전이 중단됐다고 해요. 하마터면 잘못된 AI 요약 하나 때문에 중국과의 무력 충돌로 번질 뻔한 거죠. 🇨🇳
GovAI 소속 연구원이자 전직 육군 장교인 제이크 스테클러는 이 사건에 대해 군인들이 LLM에 내재된 불확실성을 이해하는 게 중요하다고 지적했어요. 특히 무력 사용이 걸린 결정에서는 더더욱요. 근데 그렇다고 AI를 아예 쓰지 말자는 얘기는 아니었어요. 적절한 안전장치만 있다면 이런 도구들도 충분히 유용하다는 입장이었죠.
개인적으로는 이 사건이 좀 상징적이라고 생각해요. AI가 빠른 판단을 도와준다는 장점 자체가, 검증 없이 정보가 위로 올라가는 속도까지 같이 빨라진다는 뜻이거든요. 사람이 중간에서 잠깐 멈춰서 다시 확인해보자고 브레이크를 걸 시간 자체가 줄어드는 거예요. 국방 영역처럼 판단 하나가 생사를 가르는 곳에서는 이 속도가 오히려 독이 될 수도 있겠다 싶더라고요. ❌
사실 이런 사례가 이번이 처음도 아니에요. 챗봇 기반 요약 도구들이 민간 기업 보고서에서도 종종 사실관계를 왜곡하는 경우가 있었잖아요. 근데 그게 국방 의사결정 라인에 들어가면 얘기가 완전히 달라지죠. 펜타곤이 앞으로 이런 도구를 군사작전에 어느 선까지 허용할지, 그리고 검증 절차를 어떻게 다시 짤지 지켜봐야 할 것 같아요.
이번 사건이 알려지고 나서 미군 내부에서 AI 사용 가이드라인을 다시 손볼 거란 얘기도 나오고 있어요. 근데 정작 이 챗봇이 정확히 어떤 모델이었는지는 아직 공개되지 않았다고 하네요. 앞으로 국방 분야에서 AI를 어디까지, 어떻게 검증하면서 쓸지는 계속 지켜봐야 할 문제인 것 같네요.
출처