# 강화학습과 LLM - 1.2 가치 기대 함수

![Image](https://upload.cafenono.com/image/slashpageHome/20231206/173836_O87JNPYSxYVyInFnFv?q=75&s=1280x180&t=outside&f=webp)

 
**벨만 기대 방정식**
마르코프 결정 과정 문제를 풀기 위해 상태와 행동의 판단 기준을 만든 식
ex) 시험 하루 전에 도서관에 있는 상태 
ex) 시험 하루 전에 도서관에서 잠을 자는 행동의 상태

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173148_jGCWcISToICwdOfQHW?q=75&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173207_eSeFrfhhSjw2Kjm2mR?q=75&s=1280x180&t=outside&f=webp)

**벨만 최적 방정식**

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173214_fcweUl3heAK7uGS3D0?q=75&s=1280x180&t=outside&f=webp)

**가치 기대 함수**

전이 확률과 보상 값이 알려져 있는 경우 아래 방법 수렴 보장.

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173304_REoz5KJvzr01qHsVZs?q=75&s=1280x180&t=outside&f=webp)

**가치 이터레이션**

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173319_eELb3Knpx1uwQwaup8?q=75&s=1280x180&t=outside&f=webp)

Max 값 이용 (벨만 최적 방정식)
목표 지점의 보상이 0이고 매 time-step에 마다 -1 
감가율 = 1

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173324_yUM97zeksP4Gr1A40r?q=75&s=1280x180&t=outside&f=webp)

출처: [https://sumniya.tistory.com/10](https://sumniya.tistory.com/10) 

[[Ch.4] Dynamic Programming](https://sumniya.tistory.com/10)

가치 이터레이션
V_1
1행 2열 가치 계산 : -1 + max([0,0,0,0]) = -1
즉각적인 보상 -1 에 max(v) 가 모두 0 이었으므로 모두 -1 이 됨.
V_2
1행 2열 가치 계산 : -1 + max([0,-1,-1,-1]) = -1
3행 3열 가치 계산 : -1 + max([-1,-1,-1,-1]) = -2

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173419_5RZtEjflX8feCEQ9pQ?q=75&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173440_79jxW6sv01z0fxmqmw?q=75&s=1280x180&t=outside&f=webp)

**결과**

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173449_WD0agzXtayW8H9w3a0?q=75&s=1280x180&t=outside&f=webp)

**정책 이터레이션**
목표 지점의 보상이 0이고 매 time-step에 마다 -1 
감가율 = 1
각 행동 확률은 0.25
가치 기대 함수 이용
K = 0 : 초기화

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173515_nwZhKghemBdPI9fIuT?q=75&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173519_opJly2ljkSW6vdZbdk?q=75&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173529_bLChfnBxrlM85wklAp?q=75&s=1280x180&t=outside&f=webp)

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173534_m94ws2KSwKDy2cln6R?q=75&s=1280x180&t=outside&f=webp)

 
하지만 현실 대부분의 문제는 모델(전이 확률, 보상)을 알지 못함 → Model Free

2가지 접근 방법
-  가치 함수(V, Q)를 추정하여 학습 한다.
-  정책 자체를 학습한다.

![Image](https://upload.cafenono.com/image/slashpagePost/20231206/173607_ckI6UAxnJGqe873dIb?q=75&s=1280x180&t=outside&f=webp)

출처: [https://link.springer.com/chapter/10.1007/978-981-15-4095-0_3](https://link.springer.com/chapter/10.1007/978-981-15-4095-0_3)

[](https://link.springer.com/chapter/10.1007/978-981-15-4095-0_3)

For the site tree, see the [root Markdown](https://slashpage.com/kpmg-lighthouse.md).
