그록 4.7 출시가 또 미뤄졌어요, 이번엔 강화학습 버그가 원인이라고 해요. 일론 머스크는 X에서 며칠 더 다듬어야 한다고 직접 밝혔어요. 메타와 오픈AI가 이번 달 신모델을 내놓을 예정이라 타이밍이 애매해졌어요.
솔직히 이번이 처음이 아니에요. xAI는 7월 말에 그록 4.6이 몇 주 안에 나온다, 4.7도 곧 뒤따른다고 예고했었는데, 그 이후로 일정이 계속 뒤로 밀렸거든요. 9월 2일에는 9월 12일 출시를 목표로 잡았다고 알려졌는데, 결국 9월 11일에 머스크가 직접 며칠 더 다듬어야 한다고 X에 올리면서 또 연기가 확정됐어요.
머스크가 밝힌 이유가 좀 흥미로운데요. 그의 트윗을 그대로 옮기면 강화학습 과정에서 응답 길이에 너무 많은 페널티를 준 것 같다, 그래서 충분히 풀 수 있는 어려운 문제도 너무 일찍 포기해버리고 자기 작업을 꼼꼼히 검증하지도 않는다는 거예요. 쉽게 말하면 모델을 짧고 간결하게 답하도록 훈련시켰더니, 부작용으로 어려운 문제를 만나면 진득하게 붙잡고 있지 않고 중간에 포기해버리는 습관이 생긴 거죠.
2.1조 개 파라미터로 알려진 이 모델은 원래 어려운 엔지니어링 문제 해결 능력을 강화하고 그록 4.6의 비용과 접근성 장점을 이어받는 걸 목표로 했다고 해요. 근데 문제는 타이밍이에요. 이번 달 안에 메타랑 오픈AI 모두 경쟁 모델 업데이트를 내놓을 걸로 예상되는 상황이라, xAI 입장에서는 마음이 급할 수밖에 없을 것 같아요. 🚀
이번 지연 발표를 두고 xAI 안팎에서는 반응이 갈리는 분위기예요. 일부 개발자들은 머스크식 표현인 쿠킹이라는 말에 오히려 기대감을 보이면서, 서두르다 어설픈 모델을 내놓는 것보다는 낫다는 반응을 보이고 있어요. 반면 투자자 쪽에서는 xAI가 최근 대규모 자금을 유치하며 몸값을 키워온 만큼, 계속되는 일정 지연이 시장 신뢰에 영향을 줄 수 있다는 우려도 나오고 있고요. ⚠️
개인적으로는 이번 케이스가 조금 다르게 느껴지는 게, 짧게 답하라고 시켰더니 어려운 문제를 포기하더라는 건 단순 버그라기보다 강화학습 보상 설계의 근본적인 딜레마를 보여주는 사례 같아서요. 답을 짧게 만들면서도 끈기 있게 풀게 만드는 균형점을 찾는 게 생각보다 훨씬 까다로운 문제일 수 있겠다 싶더라고요.
일단 xAI는 며칠 더라고 했으니 이번 주 안에는 뭔가 소식이 나올 것 같긴 한데, 7월부터 이어진 연기 패턴을 보면 장담하긴 어려워 보여요. 그록 4.7이 실제로 나왔을 때 이 RL 문제가 제대로 해결됐는지, 아니면 또 다른 부작용이 튀어나올지 지켜봐야 할 것 같아요.
출처