대규모 언어 모델의 다단계 추론 연구
수십억 개의 매개변수를 가진 대규모 언어 모델(LLM)은 특정 훈련 없이도 소수의 예시만으로 학습하는 인컨텍스트 학습 능력을 보인다. 기존 모델들이 언어 과제에서 뛰어난 성능을 보였지만, 기본적인 추론 벤치마크에서는 한계를 드러냈다. 그러나 새로운 인컨텍스트 학습 접근법인 Chain-of-Thought는 이러한 벤치마크에서 강력한 다단계 추론 능력을 입증했다. 본 연구는 LLM의 다단계 추론 분야를 종합적으로 검토한다. 다단계 추론의 생성, 평가, 제어 방식을 체계화하는 분류법을 제시하고, 핵심 접근법과 미해결 과제를 심층적으로 다룬다. 또한, 향후 연구를 위한 구체적인 의제를 제안한다. 연구 결과, 다단계 추론 접근법은 단순한 수학 문제 해결을 넘어 논리, 조합 게임, 로봇 공학 등 다양한 분야의 복잡한 문제들을 성공적으로 해결하고 있음을 확인했다. 특히 외부 도구와 연동하여 코드를 생성하고 실행하는 방식도 활용된다. 많은 다단계 추론 연구는 미세 조정, 외부 최적화 루프, 인컨텍스트 강화 학습, 자기 성찰 등 강화 학습 기법을 적극적으로 활용하고 있다.