콘텐츠로 이동
Study Note강화학습

0. 시작하기 전에

이 덱은 “강화학습이 무엇인가”보다 “이 문제에 그걸 쓸 것인가” 를 먼저 묻는다

이 장에서 처음 나오는 말6개
RLReinforcement Learning · 강화학습
정답이 붙은 데이터가 아니라 점수(보상) 만 받고, 시행착오로 행동 규칙을 고쳐 가는 학습 방식.
에이전트 · 환경Agent · Environment
행동하는 쪽이 에이전트, 그 행동을 받아 상태와 보상을 돌려주는 쪽이 환경. 둘 사이의 왕복이 강화학습의 유일한 데이터원이다.
정책Policy · π
"이 상태에서 무슨 행동을 하나"를 정하는 함수. 학습의 최종 산출물이 이것이다.
스텝 · 에피소드Step · Episode
행동 한 번이 스텝, 시작부터 끝(넘어짐·장 마감)까지가 에피소드. 비용은 스텝 수로 센다.
피지컬 AIPhysical AI
카메라·모터를 통해 실제 물리 세계에서 행동하는 AI. 로봇 제어·자율주행이 여기 속한다. 화면 안에서 끝나는 AI와 대비되는 말이다.
sim-to-real시뮬레이션-실물 전이
시뮬레이터에서 배운 정책을 실제 기계에 옮기는 것. 옮기면 대개 안 되고, 그 격차를 줄이는 것이 로봇 RL의 절반이다.

강화학습을 실제로 쓰는 자리로 가려는 사람을 대상으로 한다. 구체적으로는 세 가지를 준비한다 —

원리를 제대로

MDP · 벨만 · 정책 경사까지, 왜 그 식이 그렇게 생겼는지를 안다. 논문을 읽을 때 기호에서 막히지 않을 정도까지가 목표다.

트레이딩에 적용

시장을 환경으로 놓으면 무엇이 특이한가. 어디까지가 실전에서 돌아가고 어디부터가 백테스트 착시인가 (11~13장).

피지컬 AI로 진입

로봇에서 RL이 실제로 굴러가는 이유와 그 스택 — 시뮬레이터 · 병렬 학습 · sim-to-real · 모방학습 (14~16장).

일자리 관점

이 분야의 직무가 실제로 어떻게 나뉘고, 각 자리에서 뭘 시키고, 뭘 준비해 두면 되는지 (17장).

전제하는 것과 전제하지 않는 것

섹션 제목: “전제하는 것과 전제하지 않는 것”
전제한다전제하지 않는다
파이썬 · NumPy강화학습 경험 전혀 없어도 된다
신경망 기초 — 층 · 손실 함수 · 경사하강PyTorch 숙련도 (코드는 읽을 수 있는 수준으로만)
미분·확률의 학부 1학년 수준 감각측도론 · 확률 과정 · 볼록 최적화
—금융 지식 (11장이 필요한 만큼 준다)
—로봇 제어 이론 (14장이 필요한 만큼 준다)

무엇을 다루고 무엇을 안 다루나

섹션 제목: “무엇을 다루고 무엇을 안 다루나”

깊게 파는 것과 이름만 남기는 것을 미리 정해 둔다. 강화학습은 알고리즘 이름이 지나치게 많은 분야라, 다 훑으면 아무것도 안 남는다.

다룬다정도안 다룬다이유
MDP · 벨만 · 탐색과 활용전부수렴 증명 · 후회 경계이 덱은 이론 교재가 아니다
DQN 계열 · PPO · SAC실제로 쓰는 수준까지A3C · TRPO · Rainbow 개별 트릭이름과 “언제 필요한가”만
오프라인 RL (CQL · IQL)개념과 함정최신 변종 논문두 응용 모두에 필요한 만큼
보상 설계 · 평가 · 디버깅가장 두껍게—여기서 성패가 갈린다
모방학습 · VLA개념과 RL과의 관계모델별 구조 상세세대가 반년마다 바뀐다
LLM 쪽 RL (RLHF · GRPO)직무 지형으로만 (17장)구현 · 실습이 덱의 두 응용 축이 아니다
멀티 에이전트 · 게임 이론이름만—두 응용에서 주력이 아니다

알고리즘 장(4~7) 은 네 단계로 고정한다. 이 순서가 이 덱의 약속이다.

단계무엇
①앞의 방법이 어디서 막혔나 — 새 알고리즘은 항상 앞의 실패에서 나온다
②아이디어 한 문장 — 무엇을 바꿨나
③실제 동작 — 의사코드와 그림
④언제 쓰고 언제 안 쓰나 — 고르는 기준

응용 장(11~16) 도 네 단계로 고정한다.

단계무엇
①이 도메인을 MDP로 놓으면 — 상태 · 행동 · 보상 표
②여기서만 생기는 함정
③실제로 쓰이는 자리와 안 쓰이는 자리
④도구와 시작점

이 사이트에는 수식 렌더러가 없다. 그래서 식은 코드 블록과 백틱으로 적고, 바로 아래에 그 식이 하는 말을 한국어 한 문장으로 붙인다.

Q(s,a) ← Q(s,a) + α · [ r + γ · max_a' Q(s',a') − Q(s,a) ]
└──────── TD 타깃 ────────┘

지금 칸에 적어 둔 점수를, “받은 보상 + 다음 칸의 최고 점수” 쪽으로 조금씩 옮긴다.

식을 못 읽어도 그 아래 문장만 읽으면 진도가 나가게 쓴다. 기호는 유니코드로 쓴다 — α(학습률) · γ(할인율) · π(정책) · θ(신경망 파라미터).

강화학습은 게임을 넘어 여러 제품·연구 시스템에 쓰이지만, 적용 범위와 공개 근거의 강도는 영역마다 다르다. 어디에 공개 사례가 있고 어디가 아직 검증하기 어려운지를 구분한다.

영역상태이 덱
LLM 후처리 (RLHF · 검증 가능한 보상)널리 쓰임 선호·검증 보상 기반 후처리의 공개 사례가 많고 구체 레시피는 다르다17장에서 직무로만
로봇 제어 (보행 · 조작)활발 보행 sim-to-real과 조작 모방학습의 공개 사례가 많다14~16장
최적 체결 · 입찰 · 추천사례 있음 공개 산업 사례가 있으나 내부 운영 근거는 제한적이다13장
“주가를 예측해 매매”검증 주의 공개 연구는 많지만 실제 운용 성과 검증이 어렵다11~12장에서 왜인지
산업 제어 · 냉각 · 물류사례 있음 성공 사례는 있으나 도입 장벽이 높다1장
자율주행 전체를 RL로아님 부분 모듈(계획·시뮬)에 쓴다14장

이 덱이 쓰는 도구다. 버전은 아래 표에 있는 것만 신뢰한다.

자리도구성격
환경 인터페이스Gymnasium 1.3reset() / step() 규약의 사실상 표준. 옛 gym의 후계
알고리즘 구현Stable-Baselines3 2.9검증된 구현체. 실험의 기준선을 잡을 때
알고리즘 학습용CleanRL알고리즘 하나 = 파일 하나. 읽고 고치기 위한 것
물리 시뮬레이션MuJoCo 3.11연구·벤치마크의 기본. 무료
로봇 대규모 학습Isaac Lab 3.0(beta)GPU에서 수천 개 로봇을 동시에. Isaac Sim 6.0 위
실물 로봇 · 모방학습LeRobot 0.6데이터셋 · 정책 · 실기 제어를 한 스택으로
금융 RL(특정 프레임워크 없음)아래 주의

2026-08-12에 공식 출처(PyPI · GitHub Releases)로 확인한 값이다.

항목버전날짜
Gymnasium1.3.02026-04-22
Stable-Baselines32.9.0 (Python ≥3.10, PyTorch ≥2.8)—
MuJoCo3.11.02026-07-28
Isaac Lab3.0.0 beta2 패치 (Isaac Sim 6.0.1)2026-07-02
LeRobotv0.6.12026-08-03
Isaac GR00Tn1.7 (early access)2026-04-18
FinRL0.3.72024-04-12

모델 이름(π0.x · GR00T N1.x 등)은 세대가 반년마다 바뀐다. 이 덱은 특정 세대에 서술을 걸지 않고 “이 자리를 채우는 물건” 으로 역할을 쓴다.

  • 새 문제를 보고 “이건 RL 문제인가” 를 근거를 대며 판정할 수 있다
  • PPO와 SAC 중 무엇을 왜 고르는지, 오프라인 RL이 왜 다른 싸움인지 설명할 수 있다
  • 학습이 안 될 때 보상 · 관측 · 정규화 · 종료 조건 순으로 의심할 줄 안다
  • 트레이딩 RL 논문을 읽고 백테스트가 어디서 새는지 짚을 수 있다
  • 로봇 학습 스택의 구성 요소와 sim-to-real 기법들이 각각 무슨 문제를 푸는지 안다
  • 이 분야 채용 공고를 읽고 자기에게 없는 것이 무엇인지 안다