12.5 정리
그림 12-5 카트폴(CartPole) 제어 완수 축하 훈장을 들고 지니 요정과 하이파이브를 하는 도로시

12장 DQN의 광활한 여정을 정리합니다. OpenAI Gym의 CartPole을 안정적으로 학습시킨 경험 재생 및 타깃 신경망의 필요성을 복습하고, 이를 바탕으로 확률적 오차를 제어하며 가치 함수를 우회해 완벽한 정책 자체를 직접 경사 하강하는 13장 정책 경사법(Policy Gradient)의 출발선으로 발걸음을 떼어 봅시다!
이번 장에서는 DQN을 알아보았습니다. DQN의 핵심은 경험 재생과 목표 신경망입니다. 경험 재생은 경험 데이터를 반복해 사용하는 구조입니다. 경험 재생은 데이터의 효율을 높이고 샘플 사이의 상관성을 줄여줍니다. 목표 신경망은 TD 목표를 별도의 신경망에서 계산하는 기법입니다. 다른 신경망을 사용함으로써 TD 목표가 고정되어 신경망 학습이 안정적으로 이루어집니다.
DQN은 등장 후 시간이 제법 흘렀지만 여전히 중요한 기술입니다. 그 증거로 DQN 기반 기법들이 여전히 많이 연구되고 제안되고 있습니다. 이번 장에서는 DQN을 확장한 기법들인 Double DQN, 우선순위 경험 재생, Dueling DQN을 소개했습니다.
OpenAI Gym에 대해서도 알아보았습니다. Gym에는 다양한 문제가 준비되어 있고 일관된 인터페이스를 제공하여 다른 문제로 손쉽게 전환할 수 있습니다. 이번 장에서는 Gym이 제공하는 <카트 폴> 문제를 DQN으로 풀어보았습니다. 그리고 아타리를 플레이하는 데 필요한 기법들도 설명했습니다.
(빈 페이지)