07.7 정리

이번 장에서는 동적 프로그래밍(DP)을 이용하여 최적 정책을 구하는 방법을 배웠습니다. 그 주인공은 정책 반복법과 가치 반복법입니다.

정책 반복법은 ‘평가’와 ‘개선’이라는 두 과정을 번갈아 반복합니다. 평가 단계에서는 DP를 이용해 가치 함수를 평가합니다. 가치 함수를 평가할 수 있다면 그 가치 함수를 탐욕화하여 정책을 개선할 수 있습니다. 만약 더 이상 개선되지 않는다면 그 정책이 곧 최적 정책입니다.

가치 반복법은 평가와 개선을 융합한 기법입니다. 다음의 수식 하나만으로 가치 함수를 갱신하죠. 이 갱신을 반복하면 최적 가치 함수에 도달할 수 있습니다(최적 가치 함수를 알면 최적 정책도 얻을 수 있습니다).

\[V_{k+1}(s) = \max_a \sum_{s'} p(s' \mid s, a) \{ r(s, a, s') + \gamma V_k(s') \}\]

또한 정책 반복법과 가치 반복법을 파이썬 코드로 구현했습니다. 그런 다음 ‘그리드 월드’ 문제에 적용하여 최적 정책을 얻어냈습니다.


모험 완료!

지니의 마법 같은 족집게 강의 덕분에 도로시와 토토는 그리드 월드의 모든 보물을 가장 빠르게 찾아내는 완벽한 최적 보물 지도를 완성했습니다.

다음 장부터는 환경의 규칙(확률 p나 보상 r)을 미리 모른 채, 직접 부딪히고 모험하며 배운다는 몬테카를로 방법을 함께 배워볼 예정입니다.

다음 모험지에서 만나요!

그림 07-26 07장 동적 프로그래밍 정복을 자축하는 지니, 도로시, 토토 07장 클리어

서브목차