06.7 정리

그림 06-7 벨만 최적의 메달을 목에 걸고, 지니 요정이 선물해 준 7장 동적 계획법 마법 책을 힘차게 여는 도로시와 토토 6장 정리 인트로

벨만 방정식과 벨만 최적 방정식의 뼈대 공식을 최종적으로 대조 정리합니다. 상태 가치와 행동 가치 계산법을 정복하여 금빛 메달을 얻은 도로시처럼, 이제 수동 계산을 뛰어넘어 컴퓨터가 스스로 가치를 갱신해 나갈 거대한 7장 동적 계획법(Dynamic Programming) 세계의 출발선 앞에 지니와 함께 서봅시다!


이번 장에서는 벨만 방정식을 알아보았습니다. 벨만 방정식을 도출하고 단순한 문제를 벨만 방정식을 이용하여 풀었습니다. 구체적으로는 벨만 방정식을 이용해 연립방정식을 얻고 이를 통해 가치 함수를 구할 수 있었습니다. 안타깝게도 실용적인 문제에서는 상태 공간이 커질수록 계산량이 너무 많아져서 연립방정식을 직접 푸는 방법은 적용하기 힘듭니다. 하지만 벨만 방정식은 앞으로 배울 수많은 강화 학습 알고리즘의 뼈대이자 출발점 역할을 합니다.

강화 학습의 궁극적인 목표는 최적 정책을 찾는 것입니다. 이를 위해 최적 정책에서 성립하는 특별한 벨만 방정식인 벨만 최적 방정식에 대해서도 배웠습니다. 최적 정책의 가치 함수를 구할 수만 있다면, 우리는 아주 간단하게(다음 상태들의 가치만을 비교하는 방식으로) 최적 정책을 즉시 얻을 수 있습니다.

마지막으로 이번 장에서 배운 가장 핵심적인 세 가지 식들을 다시 한번 대조하여 정리해 봅니다.


1. 벨만 기댓값 방정식 (Bellman Expectation Equation)

특정 정책 π를 따를 때, 현재 상태/행동의 가치와 다음 상태/행동의 가치 사이의 일관된 기대 관계를 나타냅니다.

상태 가치 함수 vπ(s) \(v_{\pi}(s) = \sum_{a, s'} \pi(a \mid s) p(s' \mid s, a) \{ r(s, a, s') + \gamma v_{\pi}(s') \}\)

행동 가치 함수 qπ(s, a) \(q_{\pi}(s, a) = \sum_{s'} p(s' \mid s, a) \left\{ r(s, a, s') + \gamma \sum_{a'} \pi(a' \mid s') q_{\pi}(s', a') \right\}\)


2. 벨만 최적 방정식 (Bellman Optimality Equation)

모든 정책 중 가장 가치가 높은 최적 정책 π* 하에서 성립하는 비선형 방정식입니다. 정책에 의한 행동 선택 확률 a π(a s)가 최댓값 선택 연산인 maxa로 단순화되는 것이 가장 큰 특징입니다.

최적 상태 가치 함수 v*(s) \(v_*(s) = \max_a \sum_{s'} p(s' \mid s, a) \{ r(s, a, s') + \gamma v_*(s') \}\)

최적 행동 가치 함수 q*(s, a) \(q_*(s, a) = \sum_{s'} p(s' \mid s, a) \{ r(s, a, s') + \gamma \max_{a'} q_*(s', a') \}\)


3. 최적 정책 구하기 (Finding the Optimal Policy)

최적 상태 가치 함수 v*(s) 또는 최적 행동 가치 함수 q*(s, a)를 알고 있을 때, 에이전트가 취할 수 있는 최적의 결정적 정책 μ*는 다음과 같이 정의됩니다.

\[\begin{aligned} \mu_*(s) &= \operatorname{argmax}_a q_*(s, a) \\ &= \operatorname{argmax}_a \sum_{s'} p(s' \mid s, a) \{ r(s, a, s') + \gamma v_*(s') \} \end{aligned}\]
서브목차