CHAPTER 14 한 걸음 더

그림 14-0 무대 위 행동하는 배우 도로시(Actor)와 감독 의자에 앉아 심사판을 들고 평가해주는 감독 지니(Critic) 액터 크리틱 인트로


도로시와 토토의 비유로 이해하기: 이제 도로시와 토토는 환상의 역할을 분담합니다. 도로시는 무대 위에서 열심히 몸을 움직여 춤을 추는 연기자(Actor, 정책망) 역할을 맡고, 토토는 모자를 쓰고 채점판을 들며 도로시의 춤 점수를 엄격하고 따뜻하게 매겨 피드백을 주는 심사위원(Critic, 가치망) 역할을 맡아 더 복잡한 세상에 도전합니다!

이번 장에서는 심층 강화 학습의 최신 기술과 동향을 살펴보고 미래를 전망해보겠습니다. 먼저 A3C, DDPG, PPO 등 정책 경사법에서 파생된 고급 알고리즘과 레인보우 같은 DQN의 발전된 형태를 알아봅니다. 이어서 알파고나 로봇 제어와 같은 실용 사례를 살펴본 후, 마지막으로 심층 강화 학습이 지닌 잠재력과 앞으로 극복해야 할 과제들을 이야기하겠습니다.

서브목차