강화학습 Part 1: 이론적 배경
마법 요정 지니와 함께 본격적인 강화학습의 여정을 떠나봅니다. Part 1에서는 에이전트가 환경과 어떻게 상호작용하는지 그 수학적 기틀인 마르코프 결정 과정(MDP)과 가치 함수 및 가치 반복을 푸는 벨만 방정식을 학습하여 강화학습의 굳건한 이론적 뼈대를 구축합니다.
그림 Part 1 요술 고양이 지니가 벨만 방정식을 통해 상태 가치 함수와 전이 과정을 친절하게 설명하는 수업 시간
학습 단원 목록
- 3강 밴디트 문제
- 머신러닝 분류와 강화학습의 차이점을 파악하고, 탐색(Exploration)과 활용(Exploitation)을 조화롭게 이끄는 epsilon-greedy Bandit 알고리즘을 직접 코드로 구현합니다.
- 4강 마르코프
- 현재 상태 정보만으로 미래 상태가 결정되는 마르코프 성질을 이해하고, 마르코프 체인과 은닉 마르코프 모델(HMM)의 이론적 기초를 정립합니다.
- 5강 마르코프 결정 과정 (MDP)
- 에이전트와 환경의 상호작용을 수학적으로 정립하고, 할인율(gamma)과 즉각 보상(Reward)을 결합한 누적 반환값의 기댓값을 공식화합니다.
- 6강 벨만 방정식
- 강화학습의 핵심인 상태 가치 함수와 Q-함수(행동 가치 함수) 간의 재귀적 관계를 나타내는 벨만 방정식 및 벨만 최적 방정식을 유도합니다.
요술 고양이 지니가 칠판에 적어주는 핵심 방정식의 규칙을 차근차근 따라가다 보면, 어느새 복잡한 에이전트의 상태 전이를 내 손으로 직접 수식으로 모델링할 수 있게 됩니다. 준비되셨다면 좌측 메뉴의 3강 밴디트 문제부터 힘차게 모험을 시작해보세요!
서브목차