09.6 정리

그림 09-6 몬테카를로법 모험 완료의 표식을 획득하고 다음 시간차 학습(TD법)을 향해 미소 지으며 도약하는 도로시와 지니 9장 정리 인트로

몬테카를로법의 가치 함수 추정과 정책 제어, 그리고 오프-정책 중요도 샘플링까지의 핵심 요점을 총정리합니다. 실제 경험에 기반하여 환경의 전체 지도를 알지 못해도 가치와 최적 경로를 찾아낸 도로시처럼, 다음 장인 10장 TD법(시간차 학습)으로 나아가기 위한 몬테카를로식 통찰을 최종 복습해봅시다!


강화 학습에서는 에이전트가 주어진 환경에서 실제로 행동하고 거기서 얻은 경험을 바탕으로 더 나은 정책을 찾습니다. 환경과 에이전트의 이러한 상호작용이 강화 학습의 특징입니다. 이번 장에서 배운 기술은 몬테카를로법입니다. 몬테카를로법을 이용하면 실제로 얻은 경험 데이터로부터 가치 함수를 근사적으로 구할 수 있습니다.

몬테카를로법으로 Q 함수를 평가할 수 있다면, 이어서 Q 함수를 이용하여 정책을 개선할 수 있습니다. 이 평가와 개선을 번갈아 반복하면 더 나은 정책을 얻을 수 있죠. 다만 정책 개선 작업을 완전히 탐욕스럽게 하면 더 이상 ‘탐색’을 할 수 없게 됩니다. 그래서 이번 장에서는 완전한 탐욕 정책이 아닌 $\epsilon$-탐욕 정책으로 갱신하여 활용과 탐색의 균형을 맞췄습니다. 강화 학습 문제에서는 활용과 탐색의 균형을 맞추면서 최선의 행동을 찾아야 합니다.

또한 에이전트의 정책은 역할 측면에서 볼 때, 대상 정책과 행동 정책으로 나뉜다고 설명했습니다. 행동 정책에 따라 실제 행동을 선택하고 그렇게 경험을 쌓아 대상 정책을 갱신합니다. 대상 정책과 행동 정책이 같은 경우를 온-정책, 둘을 분리해서 생각하는 경우를 오프-정책이라고 합니다. 오프-정책에서는 행동 정책에 따라 행동하고 그 결과를 이용하여 대상 정책에 대한 기댓값을 계산해야 합니다. 이 계산을 가능하게 하는 수단이 중요도 샘플링입니다.

서브목차