강화학습 Part 2: 강화학습
에이전트가 최적의 정책을 찾아내기 위해 활용하는 강화학습의 대표적인 3가지 핵심 풀이 방식을 학습합니다. 환경의 확률 모델을 완벽하게 아는 상태에서 수학적으로 해결하는 동적 프로그래밍(DP)부터, 전이 확률을 알지 못할 때 샘플 경험의 기댓값으로 학습하는 몬테카를로법(MC) 및 시간차 학습(TD)의 진수를 직접 구현하며 학습합니다.
그림 Part 2 Jiny가 Dorothy에게 최적 정책으로 향하는 세 갈래 마법의 길(DP, MC, TD)을 소개해주는 장면
학습 단원 목록
- 7강 동적 프로그래밍
- 격자 세상(Grid World) 예제를 활용하여 가치 테이블을 반복 업데이트하는 정책 평가, 정책 반복법(Policy Iteration), 가치 반복법(Value Iteration)을 순수 코드로 작성합니다.
- 9강 몬테카를로법
- 실제 무작위 시뮬레이션(샘플 경험)의 평균값으로 최적 정책을 제어하는 MC 기법 및 오프-정책(Off-policy) 학습을 위한 중요도 샘플링을 정립합니다.
- 10강 TD법
- 에피소드가 끝나지 않아도 매 스텝마다 실시간으로 가치 함수를 업데이트하는 시간차 학습, SARSA, 그리고 대표적인 모델-프리 오프-정책 기법인 Q-Learning 알고리즘을 구현합니다.
동적 계획법, 몬테카를로, 그리고 시간차 학습까지 강화학습의 3대 핵심 기둥을 정복하고 나면, 딥러닝과 강화학습을 영리하게 결합할 준비가 완료됩니다. 좌측 메뉴의 7강 동적 프로그래밍부터 함께 모험을 재개해볼까요?
서브목차