인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
개인구독
소속 기관이 없으신 경우, 개인 정기구독을 하시면 저렴하게
논문을 무제한 열람 이용할 수 있어요.
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
초록·키워드
비디오에 대한 질문에 답변하기 위해서는 시각적 콘텐츠에 대한 깊이 있는 이해가 요구된다. 최근 연구에서는 질문을 보조 질문-답변 쌍(sub-QA)으로 분해하여 다단계 추론을 하는 방식으로 문제를 해결하고자 하였다. 그러나 기존 접근법은 생성한 sub-QA 내에 오류가 있을 가능성을 간과함으로써 많은 경우 잘못된 결론에 도달하는 한계를 지닌다. 특히 생성된 보조 질의응답이 주어진 질문과 무관하거나 응답이 틀렸더라도 적절한 검증 없이 추론이 이루어졌다. 본 연구에서는 이러한 문제를 해결하기 위해 Logit-based Multi-step Reasoning (LMR) 프레임워크를 제안한다. LMR 프레임워크는 모든 sub-QA 를 사용하는 대신, 다양한 추론 경로를 구성할 수 있도록 서로 다른 sub-QA 부분집합을 선별한다. 각 추론 경로로부터 생성된 답변의 점수를 계산한 후 가장 높은 점수를 가지는 경로의 답변을 최종 결과로 선택하여, LMR 프레임워크는 부정확한 정보가 포함될 가능성을 최소화할 수 있다. 또한 점수 계산 과정에서 응답의 확률값만을 활용하므로, 추가 훈련 없이 다양한 모델에 손쉽게 적용 가능한 유연성을 제공한다. 실험 결과, 제안하는 방법은 제로샷 비디오 질의응답 (VideoQA) 과제에서 여러 모델과 데이터셋에 걸쳐 일관된 성능 향상을 달성함으로써 그 효과와 범용성을 입증하였다.
본문·목차
인공지능 문자 인식 모델을 통해 추출된 텍스트로, 일부 오타나 오류가 포함될 수 있으나 지속적으로 개선 중입니다.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
최근 본 자료 전체보기
UCI(KEPA) : I410-151-25-02-093572590