Sign In

Toward Learning POMDPs Beyond Full-Rank Actions and State Observability

Author
  • Haebom
Category
Empty

저자

Seiji Shaw, Travis Manderson, Chad Kessens, Nicholas Roy

💡 개요

본 연구는 숨겨진 상태를 가진 시스템, 예를 들어 잠금 메커니즘과 같은 환경에서 자율 에이전트가 학습하고 추론할 수 있도록 하는 것을 목표로 합니다. 이를 위해 부분적으로 관찰 가능한 마르코프 결정 과정(POMDP)의 매개변수를 학습하는 방법을 제안합니다. 제안된 방법은 예측 상태 표현(PSR)을 활용하여 POMDP의 상태, 전이, 관찰 모델을 추론하며, 이는 향후 다양한 목표와 보상 함수에 대한 계획 수립에 활용될 수 있습니다.

🔑 시사점 및 한계

PSR을 통해 POMDP 모델을 학습할 수 있으며, 이를 통해 다양한 계획 문제를 해결할 수 있습니다.
제안된 방법은 상태 공간의 일부를 분할하여 학습하며, 이는 동일한 관찰 분포를 가지는 상태들에 대한 전이 행렬이 풀랭크(full-rank)인 경우에 유효합니다.
학습된 POMDP 모델을 사용하여 새로운 목표에 대한 계획을 생성할 수 있습니다.
상태 공간을 분할하는 것 이상으로 POMDP를 학습하는 것은 순차적 데이터만으로는 불가능함을 보였습니다.
👍