learning from demostration에서는 오차가 궤적 길이의 제곱의 상한을 갖는다.offline RL, imitation learning등등 model based RL(LfD는 아니지만)도 roll out이 너무 길어지면 문제가 발생한다...그 이유는 간단하게는 data와 test distribution의 차이에 발생한다. action을 했는데 좋지 못한 action을 했다. -> 그 다음 state가 좋지 못한 state가 입력된다. 좋지 못한것은 학습시 못봤던 state일 확률이 높아진다는 뜻이다. 못봤던 입력에 대해서 출력을 내야하므로 출력의 부정확도가 올라가고 계속 이런 과정을 시간에 대해 반복한다.강화학습의 특징은 next input이 이 전의 action에 대해 causality를..