Action-value function 는 다음과 같은 질문에 대한 답을 지닌 함수다.
“ 만약 내가 현재 state 에서 action 를 취한 이후 policy 를 따른다면 얻을 수 있는 expected cumulative return(expected return) 은 얼마인가?”
정의는 다음과 같다.
마지막 Bellman Equation에서 는 state 에 대한 state-value function을 의미한다.
Vs. State-value Function
는 사실상 선택할 수 있는 가 하나밖에 없고, 을 만족하는 경우의 값으로 생각할 수 있다.