콘텐츠로 이동
Study Note강화학습

11. 시장이라는 환경 — 트레이딩이 왜 특히 어려운가

시장은 환경이 나쁜 게 아니라, 강화학습이 전제하는 것을 거의 다 어긴다

이 장에서 처음 나오는 말6개
비정상성Non-stationarity
전이 확률과 보상 분포가 시간에 따라 변하는 것. MDP의 기본 전제가 깨진다.
신호 대 잡음비SNR · Signal-to-Noise Ratio
예측 가능한 성분 대 잡음의 비. 주가 수익률은 이 값이 극단적으로 낮다.
시장 충격Market Impact
내 주문이 가격을 불리한 쪽으로 밀어내는 현상. 규모가 커질수록 커진다.
슬리피지Slippage
내려는 가격과 실제 체결 가격의 차이. 백테스트가 가장 자주 무시하는 비용.
호가창Order Book · LOB
각 가격에 걸린 매수·매도 주문의 목록. 미시구조 전략의 관측 대상이다.
알파 소멸Alpha Decay
전략이 알려지고 사람들이 따라 하면서 수익원이 사라지는 현상. 시장 고유의 적대성이다.

2장의 다섯 칸에 시장을 채워 넣는 것 자체는 어렵지 않다.

칸흔한 선택
S최근 수익률·변동성·거래량 특징, 보유 포지션, 현금, 남은 시간
A목표 비중 (연속) 또는 매수/관망/매도 (이산)
P시장 — 우리가 못 만든다
R손익, 또는 위험 조정 손익 − 거래 비용
γ과제 horizon과 위험 선호에 맞춰 정함. 0.99의 보상 가중치는 약 100스텝 규모에서 크게 감쇠

문제는 채우는 게 아니라, 채우고 나면 MDP의 전제 대부분이 안 맞는다는 것이다. 이 장은 그 어긋남을 하나씩 짚는다. 이걸 모르고 시작하면 백테스트만 예쁜 결과가 나온다.

MDP의 네 전제(전이·보상 고정, 관측 가능, 샘플 추가 확보, 보상 신호)가 시장에서 각각 비정상성·부분 관측·유한한 역사·극저 SNR로 깨져 과적합이 기본값이 되는 구조

로봇의 중력은 안 변한다. 시장은 금리 국면, 유동성, 참가자 구성, 규제가 다 바뀐다.

시기통했던 것
저금리·상승장눌림목 매수, 성장주 집중
급락 국면현금·역추세
고변동 구간변동성 매도가 파산으로

MDP는 P와 R이 고정이라고 가정하고 만들어졌다. 시장은 환경 자체가 학습 중에 바뀌므로, “과거에서 배운 최적 정책”이 미래에 최적이라는 보장이 원리적으로 없다.

② 신호 대 잡음비가 극단적으로 낮다

섹션 제목: “② 신호 대 잡음비가 극단적으로 낮다”

이것이 트레이딩이 로봇보다 근본적으로 어려운 이유다.

로봇시장
“잘한 행동”의 즉각적 증거넘어지지 않았다 — 명확올랐다 — 거의 운
예측 가능한 성분물리 법칙 — 거의 전부수익률의 극히 일부
잡음 대비 신호크다매우 작다

일간 수익률 예측에서 설명력이 몇 퍼센트만 나와도 훌륭한 것으로 취급된다. 나머지는 잡음이고, 강화학습은 그 잡음 속에서 공로 배분까지 해야 한다.

이 조합이 무슨 뜻인지가 중요하다 — 잡음에 맞춰 학습하기가 너무 쉽다. 학습 구간에서 아름다운 수익 곡선이 나오는 것은 성과가 아니라 기본값이다.

③ 부분 관측 — 상태를 못 본다

섹션 제목: “③ 부분 관측 — 상태를 못 본다”

시장의 진짜 상태는 “모든 참가자의 의도와 포지션”인데, 우리가 보는 것은 그 그림자다.

진짜 상태우리가 보는 것
큰 손의 미체결 의도호가창 스냅숏 (숨은 물량은 안 보인다)
다른 전략들의 포지션체결 기록
뉴스가 반영되는 속도가격 변화

POMDP이므로 과거를 접어 넣어야 한다(2장) — 그러면 상태 차원이 커지고, 데이터는 유한하니 과적합이 더 심해진다.

④ 내 행동이 시장을 바꾼다 — 시장 충격

섹션 제목: “④ 내 행동이 시장을 바꾼다 — 시장 충격”

규모에 따라 갈린다. 이 갈림이 “어디에 RL을 쓸 수 있나” 를 정한다.

규모시장 충격RL 관점
개인 소액유동성이 충분한 종목에서는 작을 수 있다순차 비용·제약이 약하면 예측 문제에 가깝다 (1장)
기관 대형 주문크다순차 결정 문제가 진짜로 성립 → RL의 자리 (13장)
마켓메이킹내 호가가 곧 시장의 일부마찬가지로 RL의 자리

9장 끝에서 말한 그 숫자다.

데이터스텝 수
일봉 20년 (1종목)약 5,000
분봉 5년 (1종목)약 50만
틱·호가 데이터 1년수억 (대신 저장·처리 비용이 크다)

PPO로 사족 보행 하나 배우는 데 수억 스텝이 든다는 것과 비교하면, 단순 스텝 수만 비교해도 일봉 데이터는 대규모 로봇 시뮬레이션보다 여러 자릿수 적다. 게다가 그 5,000 스텝은 서로 강하게 상관돼 있고(연속된 날), 독립 표본이 아니다.

이 차이는 일봉 RL에서 모델 용량과 검증을 특히 보수적으로 잡아야 하는 이유다. 반대로 호가 단위 문제는 기록된 데이터가 훨씬 많고, 체결·시장조성 같은 공개 산업 사례도 있다.

⑥ 적대적이고, 알파는 소멸한다

섹션 제목: “⑥ 적대적이고, 알파는 소멸한다”

로봇의 지형은 로봇에 맞서지 않는다. 시장의 참가자들은 서로에 맞서고, 서로를 학습한다. 좋은 전략은 자본이 몰리면서 수익원이 줄어든다. 성공이 성공을 갉아먹는 구조다.

로봇과의 결정적 차이가 이것이다. “과거 데이터를 재생하면 시뮬레이터 아닌가?” — 아니다. 재생은 내가 아무것도 안 했을 때의 세계를 다시 트는 것이다.

재생 방식성립하나왜
과거 가격을 재생하고 그 가격에 체결소액이면 근사적으로내 주문이 없는 세계라서
대량 주문을 재생 위에서 체결성립 안 한다호가를 밀어내는 반응이 데이터에 없다
시장 충격 모델을 붙인 재생부분적으로충격 모델 자체가 가정이다. 13장의 표준 접근
에이전트 기반 시장 시뮬레이터연구 단계참가자 행동을 가정해야 한다
학습된 세계 모델위험하다모델이 만든 세계에 과적합 (7장)

그래서 무엇이 되고 무엇이 안 되나

섹션 제목: “그래서 무엇이 되고 무엇이 안 되나”
잘 되는 쪽잘 안 되는 쪽
호라이즌초·분 (하루 안에 끝난다)일·주 (레짐이 바뀐다)
데이터호가·틱 — 풍부하다일봉 — 유한하다
보상체결 단가 · 재고 비용 — 계산 가능미래 수익률 — 거의 잡음
순차 결합내 주문이 이후 호가·체결 기회를 바꾼다소액 방향 매매는 결합이 약할 수 있다
기준선TWAP · VWAP 등 명확한 비교 대상“시장 수익률”뿐
대표 문제최적 체결 · 마켓메이킹 · 헤징“주가 예측 매매”

이 표가 11~13장의 결론을 미리 담고 있다. 강화학습이 트레이딩에서 실제로 값을 하는 자리는 “무엇을 살까”가 아니라 “어떻게 실행할까” 쪽이다.

  • 시장은 MDP의 전제를 거의 다 어긴다 — 비정상성 · 부분 관측 · 유한한 데이터 · 극저 SNR
  • 학습 구간에서 아름다운 수익 곡선이 나오는 것은 성과가 아니라 기본값이다
  • 비정상성 대응은 셋 — 호라이즌 축소 · 레짐을 상태에 · 재학습 절차까지 백테스트
  • 내 주문이 시장을 바꾸는가가 결정적이다. 안 바꾸면 RL이 아니라 예측 문제다
  • 일봉 20년은 약 5천 스텝이고 서로 상관돼 있다. 대규모 시뮬레이션과 비교하면 데이터가 매우 적다
  • 재생은 시뮬레이터가 아니다 — 내 주문이 없던 세계의 재생이라 대량 주문에 안 맞는다
  • 그래서 방법이 정해진다 — 오프라인 RL + 강한 정규화 + 시간 분할 검증 + 충격 모델 + 소액 배포
  • 실제로 되는 자리는 “무엇을 살까”가 아니라 “어떻게 실행할까” 다
  • 논문을 읽을 때 넷을 본다 — 비용 · 워크포워드 · 시드 수 · 단순 기준선 비교