메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교) (성균관대학교)
저널정보
Korean Institute of Information Scientists and Engineers 한국정보과학회 학술발표논문집 한국정보과학회 2025 한국컴퓨터종합학술대회 논문집
오류 신고하기

피인용 0

검색

    초록·키워드

    거대언어모델(Large Language Model, LLM)의 활용이 확대됨에 따라, 인간 중심 응답과 사회적 책임성을 고려한 인간 선호 정렬 (human preference alignment)의 중요성이 부각되고 있다. 기존의 감독학습(Supervised Fine-Tuning, SFT) 방식이 인간의 가치 판단을 반영하는 데 한계가 있음에 따라, 최근 이를 극복하기 위한 다양한 강화학습 기반의 알고리즘이 제안되고 있다. 본 연구에서는 PPO, DPO, CPO, ORPO, KTO와 같은 주요 RLHF(Reinforcement Learning from Human Feedback) 기반 알고리즘의 인간 선호 ... 전체 초록 보기

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-25-02-093746170