인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
개인구독
소속 기관이 없으신 경우, 개인 정기구독을 하시면 저렴하게
논문을 무제한 열람 이용할 수 있어요.
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
초록·키워드
본 연구는 고대 중국어 자연어 처리에 초점을 맞추어, 파이썬(Python) 환경에서 구동 가능한 중국어 형태소 분석기를 비교 분석하는 것을 목적으로 한다. 형태소 분석기는 자연어 처리와 텍스트 마이닝의 기본이 되며, 고대 중국어 텍스트 마이닝 등 관련 연구에서도 필수적이다. 현재 중국에서는 다양한 형태소 분석기가 개발되었으나, 대부분 현대 중국어 분석에 최적화되어 있어 고대 중국어 분석에는 정확성이 떨어지는 등의 한계가 있다.
본 연구에서 검토한 분석기는 jieba, jiayan, HanLP, THULAC, LTP, PKUSeg, Stanford CoreNLP, bert-ancient-chinese, sikufenci, FudanNLP, HanmunRoBERTa 등이며, 이 중 bert-ancient-chinese, Stanford CoreNLP, sikufenci, HanmunRoBERTa, FudanNLP는 파이썬 환경과의 호환성 부족으로 인해 고대 중국어 분석에 제약이 있었다. 반면, jieba, jiayan, HanLP, THULAC, LTP, PKUSeg는 상대적으로 파이썬에서 안정적인 구동이 가능하였다.
jieba는 고유명사 인식은 양호하나 실사와 허사의 구분이 모호한 모습을 보여서 분절하지 않고 하나의 토큰으로 보는 경향이 일부 있었다. jiayan은 고유명사 인식은 양호하나 복합명사 인식에서는 일부 불안정한 경향이 있었다. HanLP는 고유명사 인식은 양호하나 대규모 텍스트 처리에는 한계가 있었다. THULAC은 명사와 술어 성분의 분리에서 한계를 보여서 하나의 토큰으로 보는 경향이 있었다. LTP와 PKUSeg는 梁惠王등의 고유명사를 잘 인식하지 못하는 경향이 있다. 종합적으로 볼 때 jiayan이 비교적 양호한 성능을 보이는 것으로 나타났다.
본 연구에서 검토한 분석기는 jieba, jiayan, HanLP, THULAC, LTP, PKUSeg, Stanford CoreNLP, bert-ancient-chinese, sikufenci, FudanNLP, HanmunRoBERTa 등이며, 이 중 bert-ancient-chinese, Stanford CoreNLP, sikufenci, HanmunRoBERTa, FudanNLP는 파이썬 환경과의 호환성 부족으로 인해 고대 중국어 분석에 제약이 있었다. 반면, jieba, jiayan, HanLP, THULAC, LTP, PKUSeg는 상대적으로 파이썬에서 안정적인 구동이 가능하였다.
jieba는 고유명사 인식은 양호하나 실사와 허사의 구분이 모호한 모습을 보여서 분절하지 않고 하나의 토큰으로 보는 경향이 일부 있었다. jiayan은 고유명사 인식은 양호하나 복합명사 인식에서는 일부 불안정한 경향이 있었다. HanLP는 고유명사 인식은 양호하나 대규모 텍스트 처리에는 한계가 있었다. THULAC은 명사와 술어 성분의 분리에서 한계를 보여서 하나의 토큰으로 보는 경향이 있었다. LTP와 PKUSeg는 梁惠王등의 고유명사를 잘 인식하지 못하는 경향이 있다. 종합적으로 볼 때 jiayan이 비교적 양호한 성능을 보이는 것으로 나타났다.
본문·목차
인공지능 문자 인식 모델을 통해 추출된 텍스트로, 일부 오타나 오류가 포함될 수 있으나 지속적으로 개선 중입니다.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
최근 본 자료 전체보기
UCI(KEPA) : I410-151-25-02-093845785