메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(한국과학기술원) (한국과학기술원  )
저널정보
Korean Institute of Information Scientists and Engineers 정보과학회 컴퓨팅의 실제 논문지 정보과학회 컴퓨팅의 실제 논문지 제30권 제4호
오류 신고하기

피인용 0

검색

    초록·키워드

    강화 학습 (RL)의 성공은 주어진 환경의 저차원 표현을 효과적으로 활용함으로써 이루어진다고 생각된다. 이런 현상의 이론적인 분석을 위해, 대개 마르코프 결정 과정 (MDP)에 일정한 구조적 가정을 부과함으로써 형식화된다. 본 연구에서는 블락 마르코프 결정 과정 (BMDP)에 초점을 두며, 여기서는 관측 가능한 상태들이 군집화의 구조를 이루며, 이들 간의 전이는 저차원의 잠재적인 상태들 간의 전이로 표현된다. 최근에 BMDP에서 군집화의 거의 최적의 이론적 분석을 통해 오류율에 대한 하한 및 그와 거의 일치하는 성능 보장을 가진 2단계 알고리즘이 제안되었다. 본 논문에서는 제안된 알고리즘을 정규적이지 않은 합성 BMDP 환경에서 구현하고 시뮬레이션함으로써, 정규적 가정이 꼭 필요하다는 것을 실험적으로 검증한다. 또한, 매우 놀랍게도, 일정 수준까지의 임의적인 오염이 마치 암시적 정규화처럼 작용하여, 정규적 가정이 없는 상태에서도 군집화 성능이 잘 나오는 것을 확인하였다.

    최근 본 자료 전체보기