오픈AI가 미공개 모델로 만든 수학 결과 372건을 공개했어요. 문제당 평균 3시간, 대부분 프롬프트 하나로 나왔다고 해요. 다만 프롬프트와 연산량은 비공개라 검증이 숙제예요.
오늘 AI 업계에서 제일 시끄러운 소식은 아마 이거일 거예요. 오픈AI가 내부에서 돌리는 최신 챗GPT 계열 프런티어 모델이 그동안 풀리지 않던 수학 문제들에 대한 증명을 무더기로 내놨습니다. 공개된 건 372건이고, 공개 GitHub 저장소에 올라와 있어요. 샘 올트먼은 이걸 두고 "새로운 발견의 시대"라고 표현했고요. 📊
숫자를 조금 더 뜯어볼게요. 모델은 문제 하나에 평균 세 시간 정도를 썼다고 합니다. 그리고 사이언티픽 아메리칸이 오픈AI 대변인에게 확인한 바로는 거의 전부가 단일 에이전트에게 프롬프트 하나를 던진 결과였대요. 사람이 문제마다 붙어서 힌트를 주고 방향을 잡아준 게 아니라는 얘기죠. 이게 사실이라면 꽤 무서운 부분이에요. 🔬
근데 솔직히 여기서 바로 박수만 치기는 어렵습니다. 오픈AI는 쓴 프롬프트도, 문제별 컴퓨팅 시간도 공개하지 않았어요. "한 번에 됐다"는 말을 외부에서 재현해 볼 방법이 지금은 없다는 뜻이에요. 372건이 전부 진짜 새로운 결과인지, 이미 문헌에 어딘가 묻혀 있던 걸 찾아낸 건지도 아직 수학자들이 하나씩 확인해야 하는 단계고요.
참고로 얼마 전에 메타도 Muse Spark로 수학자들과 논문 6편을 낸 적이 있었죠. 그때는 채팅창에서 사람과 같이 풀었다는 점이 포인트였다면, 이번 오픈AI는 규모와 자율성을 앞세운 느낌이에요. 같은 방향인데 접근이 꽤 달라요.
오픈AI는 이 결과를 연구하기 위한 워크숍, 학회, 프로그램에 자금을 대겠다고도 했습니다. 속내를 읽자면, 결과물 자체보다 "검증 생태계"를 먼저 깔아두려는 걸 수도 있어요. 372개를 사람이 다 검증하려면 시간이 어마어마하니까요. ⏰
제 생각엔 이번 발표의 진짜 의미는 372라는 숫자가 아니라 속도의 비대칭이에요. 생성은 몇 시간인데 검증은 몇 달이 걸릴 수 있잖아요. 증명 검증 도구, 그러니까 형식 검증 쪽이 갑자기 엄청 중요해질 것 같아요. 수학계가 이미 충격 상태라는 표현이 나올 정도라는 것도 괜히 나온 말은 아닐 거고요. 🔥
물론 마케팅의 냄새가 아예 없다고는 못 하겠어요. 프롬프트를 안 보여주는 이상 반쪽짜리 공개니까요. 그래도 수백 건 중 일부만 진짜로 인정받아도 역사에 남을 숫자가 되겠죠. 결국 앞으로 몇 주간 수학자들이 어떤 판정을 내리느냐가 이 발표의 무게를 정할 것 같아요. 여러분은 이 372건 중 몇 개가 살아남을 것 같으세요?
출처