CHAPTER 13 정책 경사법

그림 13-0 녹색 경사 언덕 위로 마법 화살표(Gradient Ascent)를 뿌려 정책의 최대 성과 지점으로 안내하는 지니와 도로시 정책 경사법 인트로


도로시와 토토의 비유로 이해하기: 도로시는 매번 가치를 수치로 계산하여 비교하는 번거로운 일(가치 함수 추정)을 건너뛰기로 했습니다! 대신 잘했던 모험 경로의 성공 화살표 식물에 물뿌리개로 물을 주어, 그 행동을 취할 확률(정책) 자체를 직접 쑥쑥 자라나게 만드는 지름길 공부법입니다.

지금까지 Q 러닝, SARSA, 몬테카를로법 등을 배웠습니다. 이 기법들은 크게 보면 가치 기반 기법value-based method으로 분류할 수 있습니다. 여기서 말하는 ‘가치’는 행동 가치 함수(Q 함수)나 상태 가치 함수를 뜻합니다. 가치 기반 기법은 가치 함수를 모델링하고 가치 함수를 학습합니다. 그리고 가치 함수를 ‘경유’하여 정책을 얻습니다.

[!NOTE] 가치 기반 기법에서는 ‘일반화한 정책 반복’이라는 아이디어를 바탕으로 최적 정책을 찾는 경우가 많습니다. 가치 함수 평가와 정책 개선을 반복하면서 조금씩 최적 정책에 가까워지는 것입니다(4.5절 참고).

또 다른 전략으로 정책 경사법에 기반한 알고리즘도 다양하게 제안되고 있습니다. 이번 장에서는 가장 간단한 정책 경사법을 살펴본 다음 조금씩 개선합니다. 먼저 REINFORCE 알고리즘을 도출합니다. 그런 다음 한 걸음 더 나아가 ‘베이스라인이 추가된 REINFORCE’와 ‘행위자-비평자’ 기법까지 알아봅니다.

서브목차