인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
개인구독
소속 기관이 없으신 경우, 개인 정기구독을 하시면 저렴하게
논문을 무제한 열람 이용할 수 있어요.
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
초록·키워드
본 논문에서는 영어와 한국어 간 다국어 단어 임베딩을 이용한 동의어 검색 서비스를 구현하는 방법을 제시한다. IT 업계에서는 "머신러닝-기계학습-machine learning", "코스트-비용-cost"와 같이 동일한 의미를 지닌 단어들이 영어 및 한국어로 다양한 형태로 불리며 사용되고 있다. 이러한 단어들을 효율적으로 검색하고 확인할 수 있도록 돕기 위해, 본 논문에서는 FastText 기반의 Multilingual Word Embedding 모델인 MUSE를 활용하여 워드 벡터를 생성하였다.
본 연구에서는 위키피디아에서 제공하는 최신 영어 및 한국어 데이터 및 워드벡터를 사용하였으며, 추가적으로 영한 음역 데이터셋을 확보하여 임베딩 생성 시 학습에 포함시켰다. 이를 통해 영어와 한국어 간의 의미적 유사성을 효과적으로 반영한 임베딩을 구축하였다. 결과적으로, 제안된 시스템은 다양한 형태의 동의어를 정확하고 빠르게 검색할 수 있도록 하여 다국어 환경에서의 정보 검색 효율성을 크게 향상시킬 수 있음을 보인다.
본 논문에서는 모델 설계 및 구현 과정, 데이터 전처리 방법, 그리고 실험 결과와 함께 제안된 시스템의 유용성을 평가하고, 향후 연구 방향에 대해 논의한다.
본 연구에서는 위키피디아에서 제공하는 최신 영어 및 한국어 데이터 및 워드벡터를 사용하였으며, 추가적으로 영한 음역 데이터셋을 확보하여 임베딩 생성 시 학습에 포함시켰다. 이를 통해 영어와 한국어 간의 의미적 유사성을 효과적으로 반영한 임베딩을 구축하였다. 결과적으로, 제안된 시스템은 다양한 형태의 동의어를 정확하고 빠르게 검색할 수 있도록 하여 다국어 환경에서의 정보 검색 효율성을 크게 향상시킬 수 있음을 보인다.
본 논문에서는 모델 설계 및 구현 과정, 데이터 전처리 방법, 그리고 실험 결과와 함께 제안된 시스템의 유용성을 평가하고, 향후 연구 방향에 대해 논의한다.
본문·목차
인공지능 문자 인식 모델을 통해 추출된 텍스트로, 일부 오타나 오류가 포함될 수 있으나 지속적으로 개선 중입니다.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.