메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(국민대학교) (국민대학교) (국민대학교) (국민대학교) (국민대학교)
저널정보
한국자동차공학회 한국자동차공학회 추계학술대회 및 전시회 2025년 한국자동차공학회 추계학술대회 및 전시회
오류 신고하기

피인용 0

검색

    초록·키워드

    시뮬레이션 기반 자율주행 강화학습에서는 다양한 시각 환경에서의 일반화된 정책 학습이 주요 과제이다. 그러나 복합 환경의 동시 학습은 수렴 불안정성과 정책의 과적합 문제를 야기할 수 있다. 이에 본 연구는 환경 간 전이를 고려한 순차적 Multi-Critic PPO 구조를 제안한다. 본 구조는 각 시각 환경에 대해 독립적인 Critic을 학습하며, 이전 환경의 Critic 가중치를 전이함으로써 새로운 환경에서의 초기 학습 곡선을 크게 개선하고, 수렴 속도와 TD-error 안정성을 동시에 향상시킨다. 모든 환경에서 공유되는 Actor와 Encoder는 환경 간 경험을 통합하여 일반화된 정책 학습을 유도한다. MORAI 시뮬레이터 기반 실험을 통해 제안 기법은 기존의 Single-Critic PPO 및 비전이형 Multi-Critic PPO에 비해 평균 reward, 수렴 속도, 정책 안정성 측면에서 향상된 성능을 나타냈다. 향후 자동 환경 분류에 기반한 critic 선택 전략으로의 확장 가능성도 논의된다.

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-26-02-095659844