메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(서울대학교) (서울대학교) (서울대학교) (성신여자대학교) (서울대학교)
저널정보
한국방송·미디어공학회 한국방송미디어공학회 학술발표대회 논문집 한국방송·미디어공학회 2025 하계학술대회
오류 신고하기

피인용 0

검색

    초록·키워드

    비디오에 대한 질문에 답변하기 위해서는 시각적 콘텐츠에 대한 깊이 있는 이해가 요구된다. 최근 연구에서는 질문을 보조 질문-답변 쌍(sub-QA)으로 분해하여 다단계 추론을 하는 방식으로 문제를 해결하고자 하였다. 그러나 기존 접근법은 생성한 sub-QA 내에 오류가 있을 가능성을 간과함으로써 많은 경우 잘못된 결론에 도달하는 한계를 지닌다. 특히 생성된 보조 질의응답이 주어진 질문과 무관하거나 응답이 틀렸더라도 적절한 검증 없이 추론이 이루어졌다. 본 연구에서는 이러한 문제를 해결하기 위해 Logit-based Multi-step Reasoning (LMR) 프레임워크를 제안한다. LMR 프레임워크는 모든 sub-QA 를 사용하는 대신, 다양한 추론 경로를 구성할 수 있도록 서로 다른 sub-QA 부분집합을 선별한다. 각 추론 경로로부터 생성된 답변의 점수를 계산한 후 가장 높은 점수를 가지는 경로의 답변을 최종 결과로 선택하여, LMR 프레임워크는 부정확한 정보가 포함될 가능성을 최소화할 수 있다. 또한 점수 계산 과정에서 응답의 확률값만을 활용하므로, 추가 훈련 없이 다양한 모델에 손쉽게 적용 가능한 유연성을 제공한다. 실험 결과, 제안하는 방법은 제로샷 비디오 질의응답 (VideoQA) 과제에서 여러 모델과 데이터셋에 걸쳐 일관된 성능 향상을 달성함으로써 그 효과와 범용성을 입증하였다.

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-25-02-093572590