강화학습 기초: 확률과 기초수학

강화학습이라는 미지의 격자 나라를 모험할 때, 우리 앞길에는 수많은 공식과 불확실성이라는 높은 장벽이 놓여 있습니다.

지니가 친절하게 적어주는 마법의 대수식, 합을 계산하는 시그마, 그리고 전이를 묶는 행렬 상자들을 손에 쥐게 된다면, 복잡하게 얽혀 있는 보물 지도들이 한눈에 훤히 읽히게 되죠!

확률과 기초수학 인트로 그림 02-0 지니의 마법 칠판 앞에 모여 강화학습 모험 지도를 해독하기 위한 필수 기초 수학과 확률의 기초를 공부하는 도로시와 토토

이 모험 지도를 거침없이 해독할 수 있도록 돕는 강력한 비밀 열쇠, 확률과 기초수학을 지니와 함께 기쁘게 정복해봅시다!


2강 세부 목차

학습자의 학습 흐름과 흥미를 이끌기 위해 총 12개의 서브 챕터로 나누어 모험을 진행합니다. 아래 링크를 클릭해 순서대로 모험에 합류해 보세요!

02.1 식의 구성과 치환, 교환/분배법칙

긴 보상 수열의 식을 깔끔하게 치환하여 간소화하고, 공통인수로 묶어내는 분배법칙을 다룹니다. 복잡해 보이는 강화학습의 점진적 가치 공식들을 직관적으로 인수분해하고 분석하는 토대가 됩니다.

02.2 지수와 거듭제곱

지수의 정의와 곱셈 법칙, 그리고 1보다 작은 밑의 지수가 커질수록 값이 0으로 기하급수적으로 작아지는 지수적 감쇄(Decay) 현상을 배웁니다. 이는 과거 보상의 가치를 최근으로 올수록 상대적으로 깎아주는 비정상 밴디트의 감쇄 가중치와 직결됩니다.

02.3 함수의 정의와 대응

입력값과 출력값을 일대일 또는 다대일로 짝짓는 대응 관계와 집합을 학습합니다. 강화학습의 핵심인 가치 함수 v(s)의 개념을 정립하고, 수학 함수와 파이썬 프로그래밍 함수의 유사성 및 결정적 차이점을 탐구합니다.

02.4 일차방정식과 연립방정식

등식의 성질, 이항 법칙 및 대입/가감을 통한 2원 연립방정식 풀이를 학습하고, 격자 세상 속 여러 상태들의 가치 함수들이 서로 얽혀 있을 때 연립을 통해 참값을 구해내는 실전 능력을 기릅니다.

02.5 수열과 등비수열의 합

보상이 매 시점마다 늘어서는 수열의 기본 성질과, 감쇄 가중치의 누적 총합을 구하는 등비수열의 합 공식을 학습합니다. 이를 통해 보상 가중치의 누적합이 1.0으로 보존 및 수렴하게 되는 통계적 성질을 유도합니다.

02.6 시그마(Σ) 기호와 합 공식

합의 기호 시그마(Σ)의 뜻과 연산 성질(실수배, 덧셈 분배)을 이해하고, 벨만 방정식 속 행동(a)과 다음 상태(s’)의 총합 연산 구조를 올바르게 해독합니다.

02.7 증분 평균과 재귀적 업데이트

데이터를 리스트에 전부 보관하지 않아도 실시간으로 가치 평균을 구해내는 증분 평균 공식을 대수로 유도합니다. “새로운 생각은 이전 생각에 예측 오차의 일부를 보정하는 것”이라는 강화학습의 핵심 재귀 갱신 법칙을 정리합니다.

02.8 경우의 수와 순열/조합 기초 및 심화

경우의 수와 합/곱의 법칙, 경우의 수 심화(중복 합/곱), 팩토리얼, 순열, 조합의 개념과 계산 방식을 재미있게 배워봅니다.

02.9 확률의 정의와 성질 (수학적/실험적/기하학적 확률)

표본공간과 사건의 정의, 통계적 확률이 수학적 확률에 가까워지는 대수의 법칙, 면적으로 구하는 기하학적 확률, 여사건과 배반사건의 성질을 정리합니다.

02.10 확률의 역사와 덧셈정리 (조합 활용 확률 계산)

확률 이론의 탄생 비화인 ‘상금 분배 문제’, 조합을 사용해 복잡한 가짓수 속에서 구하는 확률 계산, 덧셈정리의 활용법을 살펴봅니다.

02.11 조건부 확률과 독립시행 (몬티 홀 & 생일 패러독스)

과거의 행동이 다음 상태 전이 확률에 영향을 주는지 다루고, 독립/종속, 독립시행, 그리고 상식과 수학의 괴리를 보여주는 몬티 홀 & 생일 패러독스 오류를 탐구합니다.

02.12 행동과 상태 전이를 묶는 행렬의 기초

선형대수의 뼈대인 행렬(Matrix)과 벡터(Vector)의 정의를 익히고, 행렬 곱셈 연산법을 마스터하여 마르코프 체인의 복잡한 상태 확률 전이를 단 한 줄의 식으로 압축 표현하는 힘을 기릅니다.


2강 학습 정리

지니와 함께 격자 세상을 건너기 전, 든든한 징검다리가 되어줄 2강의 핵심 수학 장치들을 다음과 같이 정리해봅시다.

  1. 식의 변형과 방정식: 복잡한 다항식은 공통인수로 묶고 치환하여 대입 전개하며, 등식의 이항 성질을 활용해 각 상태의 가치들이 순환적으로 얽힌 연립방정식의 해를 정확하게 찾아낼 수 있습니다.
  2. 함수와 대응 관계: 정의역(상태 집합)의 모든 원소가 공역(실수 가치)의 원소에 오직 하나씩 짝지어지는 함수의 기본 정의를 통해 가치 함수 v(s)의 대수적 본질을 다졌으며, 수학 함수(불변성, 결정성)와 파이썬 프로그래밍 함수(부작용 가능성, 실행 명령 묶음)의 공통점과 차이점을 정립했습니다.
  3. 수열과 감쇄합: 시간의 순서대로 얻는 보상은 수열의 형태를 띠며, 시간의 가치를 깎는 감쇄율로 인해 각 시점의 가중치 합은 등비수열의 합시그마(Σ) 기호를 통해 1.0에 도달하여 수렴함을 유도했습니다.
  4. 실시간 평균 계산: 모든 과거 기록을 기억하여 소모적인 sum 연산을 반복하는 대신, 직전 평균과 현재 오차의 학습률 보정분만을 더하는 증분 평균 공식을 유도하여 실시간 업데이트의 뼈대를 완성했습니다.
  5. 확률적 전이와 선형대수: 무작위 불확실성을 계량하는 경우의 수/조합조건부 확률의 인과성을 이해했고, 이 확률 분포를 한 묶음으로 처리하여 예측하는 선형대수 행렬과 벡터의 곱셈을 정립했습니다.

💡 다음 모험 안내 수학적 기초 체력을 든든하게 기른 도로시와 토토는 드디어 3강 밴디트 문제의 세계에 진입합니다! 3강에서는 여러 개의 레버(행동) 중 가장 사과가 많이 나오는 최적의 레버를 탐색과 활용의 딜레마를 겪으며 직접 찾아내고, 실시간으로 각 레버의 가치를 업데이트하는 밴디트 에이전트를 만나게 됩니다. 3강 모험으로 출발해봅시다!

서브목차