① 판정 — 시작 전
- 결정이 여러 번 이어지나
- 행동의 영향이 이후 결정과 결합되나
- 전체 행동 순서를 채점할 수 있나
- 밴딧 · MPC · 예측+규칙 · 모방학습으로 되지 않나
- 시행착오를 어디서 몇 백만 번 하나
- 점수를 매길 수 있나 — 못 매기면 문제 정의부터
강화학습을 아는 것은 알고리즘 목록이 아니라 판정 · 설계 · 검증의 습관이다
전체 지도장별 한 문장세 장의 카드다음 단계| 장 | 하나만 남긴다면 |
|---|---|
| 0 | RL은 “정답은 못 쓰는데 채점은 되는” 자리에서 이겼다 |
| 1 | 진단 질문 셋 — 결정이 이어지는가 · 행동의 영향이 미래와 결합되는가 · 전체 순서를 채점할 수 있는가. 지연 보상은 흔하지만 필수는 아니다 |
| 2 | 첫 산출물은 코드가 아니라 MDP 다섯 칸 표다. 상태 표현으로 마르코프 성질을 근사한다 |
| 3 | 벨만은 가치를 “지금 보상 + 다음 가치” 로 쓴 재귀다. Q러닝의 max는 탐욕적 타깃 정책을 만든다 |
| 4 | DQN의 두 처방 — 경험 재생과 타깃 네트워크. 지금도 많은 딥 off-policy 방법의 부품이다 |
| 5 | 좋았던 행동의 확률을 올린다. 실질 신호는 어드밴티지 Q − V다 |
| 6 | 대량 병렬 수집이면 PPO, 수집 비용이 크면 SAC를 먼저 비교한다. PPO 클립은 비율·KL을 강제 제한하지 않는다 |
| 7 | 오프라인의 적은 데이터에 없는 행동을 좋게 평가하는 낙관이다. BC를 못 이기면 실패다 |
| 8 | 에이전트는 시킨 대로가 아니라 준 대로 한다. 이상하면 보상 함수를 소리 내어 읽는다 |
| 9 | 손실 곡선은 지표가 아니다. 진단은 기준선 → 관측 → 보상 → 그다음에야 하이퍼파라미터 |
| 10 | 시드 몇 개의 최고값으로 말하지 않는다. 여러 과제는 IQM, 두 방법 비교는 차이의 구간·개선 확률을 본다 |
| 11 | 시장은 MDP의 전제를 거의 다 어긴다. 재생은 시뮬레이터가 아니다 |
| 12 | 전체 기간 정규화가 가장 흔한 미래 정보 누출이다. 비용을 2배로 해도 남는지 본다 |
| 13 | 되는 자리는 “무엇을 살까”가 아니라 “어떻게 실행할까” 다 — 체결·마켓메이킹·헤징 |
| 14 | 로봇에서 되는 이유는 연습장을 만들 수 있어서다. 대가는 sim-to-real 격차 |
| 15 | 판을 바꾼 것은 알고리즘이 아니라 GPU 안에서 도는 환경 수천 개다 |
| 16 | 모방학습이 싸게 만들고 강화학습이 실제로 되게 민다 |
| 17 | 변별력은 알고리즘이 아니라 환경 설계 · 검증 · 도메인 지식에 있다 |
① 판정 — 시작 전
② 설계 — MDP 다섯 칸
terminated와 truncated를 나눴나③ 디버깅 — 안 오를 때
④ 검증 — 믿기 전에
이 덱이 둘을 같이 둔 이유를 마지막으로 정리한다.
| 로봇 (피지컬 AI) | 시스템 트레이딩 | |
|---|---|---|
| 환경 | 만들 수 있다 | 못 만든다 |
| 샘플 | GPU에서 수천 개 병렬. 실물보다 싸지만 계산비는 든다 | 과거 로그 중심. 일봉 20년 ≈ 5천 스텝 |
| 흔한 접근 | 대규모 시뮬에서 PPO 등, 실물 데이터에는 SAC·모방 등 | 오프라인 RL · 지도학습 하이브리드 |
| 보상 | 명확 (넘어짐 · 속도 추종) | 잡음 (수익률) — 그래서 체결 비용 쪽으로 문제를 옮긴다 |
| 진짜 적 | sim-to-real 격차 | 과적합과 비정상성 |
| 최종 관문 | 실물에서 오래 돌기 | 소액 실전에서 백테스트대로 나오기 |
| 실무의 실체 | 시뮬과 실물을 맞추는 계측 | 누출 없는 검증 체계 |
| 공개 사례 | 보행 sim-to-real과 조작 모방학습 사례가 활발 | 체결의 산업 사례가 있고, 장기 방향 매매는 검증 난도가 높음 |
같은 알고리즘이 왜 한쪽에서 주력이고 다른 쪽에서는 안 쓰이는지 — 이 표 하나로 설명된다. 새 도메인을 만났을 때도 같은 질문을 먼저 한다: “여기에는 연습장이 있는가, 샘플은 얼마인가, 보상은 계산 가능한가.”
작은 것부터 직접 돌린다.
카트폴 DQN → 연속 제어 PPO/SAC 비교. 시드 5개로 분포를 보고하는 습관을 여기서 붙인다.
환경을 하나 처음부터 만든다.
Gymnasium 규약으로. 리워드 해킹을 한 번 당해 보는 것이 이 단계의 소득이다 (8장).
도메인을 고른다.
로봇이면 15장의 경로(MuJoCo → Isaac Lab → 실물), 트레이딩이면 12~13장의 경로(누출 없는 백테스트 → 체결 시뮬레이터).
하나를 논문처럼 정리한다.
문제 정의 · MDP 표 · 기준선 · 시드 분포 · 절제 실험 · 실패한 것과 그 이유. 이것이 17장에서 말한 “좋은 포트폴리오”다.
한 가지만 지킨다면 — 자기 결과를 스스로 의심하는 습관이다. 이 분야에서 가장 흔한 실패는 알고리즘을 몰라서가 아니라 되는 줄 알았는데 아니었던 것을 늦게 발견해서 생긴다.