오픈AI가 정신건강 대화 능력을 재는 벤치마크 '멘탈헬스벤치'를 공개했어요. 22개국 전문의 80명 이상이 대화 1,215개와 평가기준 5,262개를 만들었어요. AI 챗봇의 위기상담 능력을 객관적으로 검증할 길이 처음 열린 셈이에요.
챗GPT 같은 AI 챗봇한테 힘든 얘기, 우울한 얘기 털어놓는 사람들 진짜 많아졌잖아요. 근데 정작 이 챗봇들이 그런 대화를 '잘' 하고 있는지 객관적으로 잴 방법이 마땅치 않았어요. 그래서 오픈AI가 9월 23일 멘탈헬스벤치(MentalHealthBench)라는 공개 벤치마크를 내놨어요.
규모부터 꽤 진지해요. 22개국, 19개 언어를 쓰는 라이선스 보유 정신건강 전문의 80명 이상이 참여해서 대화 1,215개랑 평가기준 5,262개를 같이 만들었대요. 참여 전문의들의 전공 분야도 거의 20개 세부 분야를 아우른다고 하고요. 그냥 "AI가 대충 그럴듯하게 답했나" 수준이 아니라, 진짜 임상 전문가 기준으로 하나하나 채점하겠다는 거죠.
대화 구성도 세밀해요. 전체 대화의 53.5%는 비응급 상황, 18.2%는 고위험, 그리고 28.3%는 응급 상황을 다뤄요. 응급 비중이 생각보다 꽤 높죠 😟. 그만큼 위기 상황에서 AI가 어떻게 반응하는지를 중점적으로 검증하겠다는 의도가 보여요. 사용자 유형도 나눠놨는데, 성인이 68.1%로 가장 많고 청소년이 21.2%, 그리고 임상의와 보호자가 각각 5.8%, 4.9%를 차지해요.
평가 기준은 크게 네 가지예요. 맥락을 얼마나 잘 파악하는지, 사용자의 자기결정권을 존중하는지, 안전하게 응답하는지, 그리고 실질적으로 도움이 되는 가이드를 주는지를 각각 채점해요. 근데 재밌는 건 이 대화들이 전부 합성(synthetic) 데이터라는 점이에요. 실제 사용자 대화가 아니라 전문가들이 만든 시뮬레이션이라는 거죠. 프라이버시 문제는 피해가지만, 실제 위기 상황의 복잡함을 완벽히 재현했다고 보긴 어려울 수도 있어요.
오픈AI는 이 벤치마크를 완전 공개로 풀어서 다른 연구자들도 자기 방법론을 검증하고 발전시킬 수 있게 했다고 밝혔어요. 사실 이런 투명성은 박수 칠 만해요 ✅. AI 챗봇의 정신건강 상담 관련 논란이 계속 제기돼 온 상황에서, 적어도 측정 기준을 공개적으로 만들어놓으면 다른 회사들도 비교당할 여지가 생기니까요.
다만 개인적으로 좀 걸리는 건, 벤치마크에서 높은 점수를 받는다고 실제 위기 상황에서도 안전하다는 보장은 없다는 점이에요. 벤치마크는 결국 통제된 시나리오고, 진짜 사람들의 대화는 훨씬 지저분하고 예측 불가능하잖아요. 그래도 이런 시도 자체가 없는 것보다는 백배 나아요. 이제 관건은 다른 랩들도 비슷한 기준을 채택하고 공개적으로 점수를 비교할지, 아니면 각자 자기 벤치마크만 만들고 끝날지겠죠.
출처