1강 강화학습이란?
강화학습(Reinforcement Learning)은 에이전트가 환경과 스스로 상호작용하며 어떤 행동이 가장 큰 상(보상)을 받는지 몸으로 직접 겪어가며 배우는 과정입니다.
요정 고양이 지니가 도로시와 토토를 위해 펼쳐준 알록달록한 보물 지도 숲길처럼, 사과(보상)를 따먹고 웅덩이(함정)를 피하며 최선의 길을 스스로 찾아내는 놀라운 인공지능의 세계로 첫 발을 내딛어볼까요?

그림 01-0 지니가 소환한 요술 지도를 따라 사과나무와 장애물이 가득한 숲속으로 첫 탐험을 시작하는 도로시와 토토
이 1강에서는 본격적인 수식과 코드에 들어가기에 앞서, 강화학습의 개념이 무엇이고 기존 머신러닝과 어떻게 다르며, 어떤 기원과 핵심 요소들로 이루어져 있는지 스토리와 비유를 통해 차근차근 살펴보겠습니다.
1강 세부 목차
학습자의 학습 흐름과 흥미를 이끌기 위해 총 8개의 서브 챕터로 나누어 모험을 진행합니다. 아래 링크를 클릭해 순서대로 모험에 합류해 보세요!
01.1 AI의 세 가지 마법: 머신러닝, 딥러닝, 강화학습 구분하기
인공지능을 이루는 세 가지 큰 마법 학파(머신러닝, 딥러닝, 강화학습)의 특징과 차이점을 세 마법 안경을 통해 비교해 봅니다.
01.2 왜 강화학습을 공부해야 할까?
거대 자본과 데이터 라벨링 요정들이 없어도, 나만의 아이디어와 정교한 코딩(지혜)만으로 엄청난 성능을 이끌어낼 수 있는 강화학습의 매력을 설명합니다.
01.3 스키너의 쥐 실험과 일상의 강화
행동심리학자 스키너의 상자 실험을 들여다보고, 우리 일상 속 자전거 타기와 아기 걸음마에 녹아있는 ‘시행착오’와 ‘강화’의 원리를 배웁니다.
01.4 강화학습의 4대 핵심 요소
에이전트와 환경이 주고받는 마법의 수레바퀴를 이해하고, 이를 움직이는 4대 요소인 정책(π), 보상(r), 가치 함수(v, q), 모델(Model)의 개념을 정의합니다.
01.5 탐색과 활용의 딜레마
이미 아는 단골 식당으로 갈 것인가(활용), 새로운 맛집을 개척할 것인가(탐색). 에이전트가 일생 동안 고민해야 하는 아름다운 줄타기를 맛있는 요리에 비유해 살펴봅니다.
01.6 순차적 행동 결정 문제와 알파고
매 순간의 결정이 다음 미래를 바꾸는 ‘순차적 행동 결정 문제’를 정의하고, 경우의 수가 무한에 가까운 바둑과 로봇 제어에서 강화학습과 인공신경망이 어떻게 결합하는지 배웁니다.
01.7 맛보기 예제: 틱택토와 브레이크아웃
가치 테이블을 그리는 단순한 보드게임 틱택토의 시간차 갱신 공식과, 딥마인드가 설계한 브레이크아웃(벽돌 깨기)의 DQN 큐함수 및 터널 뚫기 전략을 미리 맛봅니다.
01.8 강화학습의 역사와 기원
심리학의 ‘시행착오’, 수학의 ‘최적 제어 및 벨만 방정식’, 컴퓨터공학의 ‘시간차 학습’이라는 세 가지 마법의 갈래가 어떻게 하나로 엮여 현대 강화학습으로 대결합했는지 배웁니다.
🌟 1강을 마치며: 강화학습이란?
1강에서는 본격적인 수식과 구현 코드를 학습하기 전, 강화학습이 무엇이고 어떤 발자취를 따라 발전했는지를 살펴보았습니다.
- 지도/비지도 학습과의 차이: 정답 라벨이 주어지는 지도학습이나 패턴을 찾는 비지도학습과 달리, 강화학습은 에이전트가 환경과 부딪히며 받는 피드백인 보상을 극대화하는 방향으로 최적의 행동 지침(정책)을 학습합니다.
- 4대 핵심 요소: 의사결정의 주체인 에이전트와 그 외 모든 배경인 환경이 상태, 행동, 보상을 주고받는 순환 고리를 형성하며, 이 고리는 정책, 보상, 가치 함수, 환경 모델이라는 4가지 뼈대로 정의됩니다.
- 탐색과 활용의 딜레마: 이미 검증된 최고 보상을 고집할지(활용), 더 나은 기회를 위해 미지의 길을 탐색할지(탐색)에 대한 균형을 맞추는 것이 강화학습의 영원한 과제입니다.
- 순차적 의사결정과 딥러닝의 결합: 매 선택이 미래의 상태에 연쇄 영향을 주는 복잡한 순차적 문제(MDP)를 풀기 위해, 현대 강화학습은 바둑이나 로봇 공학처럼 상태 공간이 방대한 경우 인공신경망(DQN 등)을 결합하여 가치와 정책을 예측·근사하는 기법을 활용합니다.
- 역사적 기원: 행동심리학의 시행착오 학습, 수학/제어공학의 최적 제어(동적 계획법), 컴퓨터공학의 시간차 학습이라는 서로 다른 세 갈래의 역사적 실타래가 리처드 서튼 교수를 비롯한 선구자들에 의해 하나로 엮여 현대 강화학습이 정립되었습니다.
이제 우리는 강화학습의 전체 지도와 핵심 개념을 머릿속에 그렸습니다. 다음 2강에서는 강화학습의 수식을 이해하고 본격적으로 학습하기 전에 꼭 짚고 넘어가야 할 기초 수학과 확률 개념들을 차근차근 함께 배워보도록 하겠습니다!