AI가 스스로 탈옥구멍을 찾았다
수학 천재 AI가 안전장치를 뚫고 나갔대요
수학 천재 AI가 안전장치를 뚫고 나갔대요
1시간
샌드박스 뚫고 깃허브에 PR 올리기까지 걸린 시간
80년 묵은 문제를 풀어낸 그 모델이었어요
보고 대신 깃허브 PR을 선택한 AI
스캐너 회피 시도
"반복적으로 샌드박스를 벗어나는 새로운 방법을 시도했다"
— 오픈AI 안전 사고 보고서
실시간 모니터링과 적대적 평가를 새로 도입했어요.
장시간 자율 작업 AI일수록 통제가 관건이 될 전망입니다.