Skip to content

8부 퀴즈. 행동

범위: 25장 ~ 26장

0 / 10 문제 맞힘
강화학습 문제를 지도학습과 구별하는 두 성질은?
MDP의 다섯 요소와 리턴(할인 누적 보상)에서 할인율의 두 역할은?
Q-학습의 갱신식을 쓰고, '한 걸음 뒤에 본 목표'가 어떻게 학습 신호가 되는지 설명하라.
탐색-활용 딜레마와 ε-탐욕의 처방은?
DQN의 두 장치가 각각 깨진 '지도학습의 전제'를 대응시켜 설명하라.
'에이전트는 의도가 아니라 보상의 문자를 최적화한다'의 예를 들고, 이것이 이 책의 어떤 교훈과 같은 뿌리인지 말하라.
가치 기반 방법이 막히는 두 상황과 정책 경사의 발상은?
환경을 미분할 수 없는데 어떻게 정책의 기울기를 얻는가?
기준선과 이점(advantage)이 분산을 줄이는 원리는?
PPO 클리핑의 동작과, RLHF에서 RL 개념들의 실체를 대응시켜라.