인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
개인구독
소속 기관이 없으신 경우, 개인 정기구독을 하시면 저렴하게
논문을 무제한 열람 이용할 수 있어요.
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
초록·키워드
시뮬레이션 기반 자율주행 강화학습에서는 다양한 시각 환경에서의 일반화된 정책 학습이 주요 과제이다. 그러나 복합 환경의 동시 학습은 수렴 불안정성과 정책의 과적합 문제를 야기할 수 있다. 이에 본 연구는 환경 간 전이를 고려한 순차적 Multi-Critic PPO 구조를 제안한다. 본 구조는 각 시각 환경에 대해 독립적인 Critic을 학습하며, 이전 환경의 Critic 가중치를 전이함으로써 새로운 환경에서의 초기 학습 곡선을 크게 개선하고, 수렴 속도와 TD-error 안정성을 동시에 향상시킨다. 모든 환경에서 공유되는 Actor와 Encoder는 환경 간 경험을 통합하여 일반화된 정책 학습을 유도한다. MORAI 시뮬레이터 기반 실험을 통해 제안 기법은 기존의 Single-Critic PPO 및 비전이형 Multi-Critic PPO에 비해 평균 reward, 수렴 속도, 정책 안정성 측면에서 향상된 성능을 나타냈다. 향후 자동 환경 분류에 기반한 critic 선택 전략으로의 확장 가능성도 논의된다.
본문·목차
인공지능 문자 인식 모델을 통해 추출된 텍스트로, 일부 오타나 오류가 포함될 수 있으나 지속적으로 개선 중입니다.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
최근 본 자료 전체보기
UCI(KEPA) : I410-151-26-02-095659844