메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(서울대학교) (서울대학교) (성신여자대학교) (서울대학교)
저널정보
Korean Institute of Information Scientists and Engineers 정보과학회 컴퓨팅의 실제 논문지 정보과학회 컴퓨팅의 실제 논문지 제32권 제3호
오류 신고하기

피인용 0

검색

    초록·키워드

    본 연구는 거대언어모델(LLM)이 답변 품질을 직접 채점(Direct scoring)하는 ‘LLM-as-a-Judge’ 패러다임에서 리커트 척도 설계가 판정 신뢰도에 미치는 영향을 분석한다. 기존 연구가 영어권의 쌍별 비교 방식에 편중되었다는 한계를 고려하여, 한국어 및 영어 환경에서 평가 지시문 내 척도 변인에 따른 신뢰도 변화를 실증한다. NLG-Eval 데이터셋을 활용한 실험 결과, 첫째, ‘수치가 높을수록 우수한 품질’을 의미하는 오름차순 설계가 내림차순 설계보다 높은 판정 신뢰도를 나타냈다. 둘째, 수치에 기반하거나 상세 설명이 결합된 척도가 단어 기반 척도보다 높은 일관성을 보였다. 셋째, 한국어 환경의 전반적인 신뢰도는 영어보다 낮았으나, 리커트 척도 설계에 따른 신뢰도 변화 양상은 두 언어에서 유사하게 관찰되었다. 이러한 실험 결과를 바탕으로, 본 연구는 견고한 LLM-as-a-Judge 시스템 구축을 위한 실질적인 평가 지시문 설계 가이드라인을 도출하여 제시한다.

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-26-02-096252250