CHAPTER 9 몬테카를로법
그림 09-0 거대한 카지노 룰렛 형태의 징검다리를 밟고 에피소드의 끝자락을 탐색해 나가는 도로시와 지니

7장에서 동적 프로그래밍(DP)으로 최적 가치 함수와 최적 정책을 찾았습니다.
DP를 이용하려면 ‘환경 모델(상태 전이 확률과 보상 함수)’을 알고 있어야 합니다.
하지만 안타깝게도 세상에는 환경 모델을 알 수 없는 문제도 많습니다. 혹은 알 수는 있더라도 DP 방식으로는 계산량이 너무 많아서 사실상 풀 수 없을 때가 많습니다.
강화 학습에서는 이처럼 환경 모델을 알 수 없는 상황에서 더 나은 정책을 찾는 문제를 주로 다룹니다. 이런 상황에서 문제를 풀려면 에이전트가 실제로 행동하여 얻은 경험을 토대로 학습해야 합니다.
이번에 배울 주제는 몬테카를로법monte carlo method입니다.
데이터를 반복적으로 샘플링하여 그 결과를 토대로 추정하는 방법을 일컫습니다. 강화 학습에서는 몬테카를로법을 통해 경험으로부터 가치 함수를 추정할 수 있습니다.
여기서 말하는 ‘경험’은 환경과 에이전트가 실제로 상호작용하여 얻는 데이터입니다. 일련의 ‘상태, 행동, 보상’ 데이터가 바로 경험인 것이죠. 이번 장의 목표는 에이전트가 얻은 경험을 바탕으로 가치 함수를 추정하는 것입니다. 이 목표가 달성되면 이어서 최적 정책을 찾는 방법을 살펴볼 것입니다.
이번 장부터 드디어 진정한 강화 학습 문제에 뛰어듭니다. 지금까지 우리는 강화 학습에서 중요한 기초를 차근차근 쌓아왔습니다. 토대를 잘 닦았으니 지금부터 배울 몬테카를로법도 자연스럽게 이해할 수 있을 것입니다.
학습 목차
- 09.0 몬테카를로법의 수학적 기초와 역사적 유래
- 몬테카를로 방법의 탄생 기원과 전쟁 속 맨해튼 프로젝트 비화, 원주율 추정을 통한 무작위 계산의 힘을 사전 학습합니다.
- 09.1 몬테카를로법 기초
- 확률 분포나 보상 함수(환경 모델)를 몰라도 무작위 시뮬레이션을 통해 기대 가치를 계산하는 기초 아이디어를 배웁니다.
- 09.2 몬테카를로법으로 정책 평가하기
- 에이전트의 에피소드 경험을 바탕으로 상태 가치 함수를 추정하는 몬테카를로 정책 평가 방법을 배웁니다.
- 09.3 몬테카를로법 구현
- 3x4 그리드 월드에서 에피소드를 생성하고 가치 함수를 실제로 평가해 나가는 파이썬 코드를 구현해 봅니다.
- 09.4 몬테카를로법으로 정책 제어하기
- 평가와 개선의 상호작용으로 최적 정책을 제어하는 방법 및 탐색과 이용 딜레마(Epsilon-Greedy)의 필요성을 정복합니다.
- 09.5 오프-정책과 중요도 샘플링
- 현재 정책과 다른 시도를 하며 학습하는 오프-정책의 개념과 수학적인 중요도 샘플링(Importance Sampling) 유도 과정을 배웁니다.
- 09.6 정리
- 9장 몬테카를로 방법의 핵심 수식과 알고리즘 및 온-정책과 오프-정책의 대비 개념을 복습합니다.