05.5 정리

그림 05-5 그리드 월드를 성공적으로 완료하여 획득한 우승 트로피를 기뻐하는 도로시와 다음 단계인 벨만 방정식 책을 활짝 펼쳐주는 지니 5장 정리 인트로

마르코프 결정 과정의 기본 뼈대 수식 및 그리드월드 최적 가치 함수 연산을 종합 정리하고 마무리합니다. 에이전트와 환경의 교류 프레임워크를 마스터한 도로시가 트로피를 높이 쥐는 그림처럼, 수작업 연산의 한계를 넘어 좀 더 세련되게 최적 해를 풀어낼 6강 벨만 방정식 마법서의 세계로 지니와 함께 날아가 봅시다!


이번 장에서는 마르코프 결정 과정(MDP)에 대해 알아보았습니다. MDP는 에이전트와 환경의 상호작용을 수식으로 표현한 것입니다. 환경에는 상태 전이 확률(또는 상태 전이 함수)과 보상 함수가 있고, 에이전트에는 정책이 있습니다. 그리고 환경과 에이전트가 영향을 주고받습니다. 이러한 틀 안에서 최적 정책을 찾는 것이 MDP의 목표입니다. 최적 정책이란 모든 상태에서 다른 어떤 정책보다 상태 가치 함수의 값이 더 크거나 같은 정책을 말합니다.

이어서 ‘두 칸짜리 그리드 월드’라는 강화 학습 문제를 풀며 실제로 최적 정책을 찾아냈습니다. 구체적으로는 모든 정책을 나열하고, 각 정책의 상태 가치 함수를 직접 계산하여 구했습니다. 그런 다음 그중에서 가장 좋은 정책, 즉 최적 정책을 찾아냈습니다. 아쉽게도 이번 장에서 사용한 해법은 ‘두 칸짜리 그리드 월드’와 같이 단순한 문제에서만 유효합니다. 다음 장에서는 좀 더 어려운 문제에도 대응하는 방법을 알아보겠습니다.


05.5.1 단원 학습 핵심 요약

이번 5장에서는 행동에 따라 환경이 달라지는 강화 학습의 수학적 토대인 MDP를 마쳤습니다. 핵심 요약은 다음과 같습니다.

  1. 에이전트-환경의 순환 루프: 에이전트는 상태 St에서 정책에 따라 행동 At를 취하고, 환경은 상태 전이 확률 p(s’ s, a)에 따라 다음 상태 St+1로 넘기며 보상 Rt를 제공합니다.
  2. 마르코프 성질: 의사결정에 필요한 모든 핵심 정보는 이전 기록과 상관없이 오직 ‘현재 상태’에 모두 수렴된다는 성질입니다. 이 가설 덕분에 강화 학습 알고리즘 설계가 수학적으로 고도로 단순화됩니다.
  3. 할인 수익 G_t와 상태 가치 함수 v(s): 감쇠 계수 할인율 γ를 곱해 미래의 기대 보상들을 현재 가치로 치환한 총합의 기댓값이 상태 가치 함수입니다.
  4. 최적 정책의 수렴성: 상태 공간과 행동 공간이 정의된 모든 유한 MDP 환경에는 항상 한 개 이상의 결정적 최적 정책 π</sub>이 존재하며, 이는 모든 상태에서 다른 어떤 임의의 정책보다 우월한 기대 가치 함수 *v*(s)를 보장합니다.
서브목차