CHAPTER 9 몬테카를로법

그림 09-0 거대한 카지노 룰렛 형태의 징검다리를 밟고 에피소드의 끝자락을 탐색해 나가는 도로시와 지니 몬테카를로법 인트로


7장에서 동적 프로그래밍(DP)으로 최적 가치 함수와 최적 정책을 찾았습니다.

DP를 이용하려면 ‘환경 모델(상태 전이 확률과 보상 함수)’을 알고 있어야 합니다.

하지만 안타깝게도 세상에는 환경 모델을 알 수 없는 문제도 많습니다. 혹은 알 수는 있더라도 DP 방식으로는 계산량이 너무 많아서 사실상 풀 수 없을 때가 많습니다.

강화 학습에서는 이처럼 환경 모델을 알 수 없는 상황에서 더 나은 정책을 찾는 문제를 주로 다룹니다. 이런 상황에서 문제를 풀려면 에이전트가 실제로 행동하여 얻은 경험을 토대로 학습해야 합니다.

이번에 배울 주제는 몬테카를로법monte carlo method입니다.

데이터를 반복적으로 샘플링하여 그 결과를 토대로 추정하는 방법을 일컫습니다. 강화 학습에서는 몬테카를로법을 통해 경험으로부터 가치 함수를 추정할 수 있습니다.

여기서 말하는 ‘경험’은 환경과 에이전트가 실제로 상호작용하여 얻는 데이터입니다. 일련의 ‘상태, 행동, 보상’ 데이터가 바로 경험인 것이죠. 이번 장의 목표는 에이전트가 얻은 경험을 바탕으로 가치 함수를 추정하는 것입니다. 이 목표가 달성되면 이어서 최적 정책을 찾는 방법을 살펴볼 것입니다.

이번 장부터 드디어 진정한 강화 학습 문제에 뛰어듭니다. 지금까지 우리는 강화 학습에서 중요한 기초를 차근차근 쌓아왔습니다. 토대를 잘 닦았으니 지금부터 배울 몬테카를로법도 자연스럽게 이해할 수 있을 것입니다.


학습 목차

서브목차