메뉴 건너뛰기
소속 기관 / 학교 인증
인증하면 논문, 학술자료 등을  무료로 열람할 수 있어요.
한국대학교, 누리자동차, 시립도서관 등 나의 기관을 확인해보세요
(국내 대학 90% 이상 구독 중)
고객센터 ENG
주제분류

논문 기본 정보

저자정보
(한국외국어대학교)
저널정보
한국중어중문학회 중어중문학 中語中文學 第100輯
오류 신고하기

피인용 0

검색

    초록·키워드

    본 연구는 고대 중국어 자연어 처리에 초점을 맞추어, 파이썬(Python) 환경에서 구동 가능한 중국어 형태소 분석기를 비교 분석하는 것을 목적으로 한다. 형태소 분석기는 자연어 처리와 텍스트 마이닝의 기본이 되며, 고대 중국어 텍스트 마이닝 등 관련 연구에서도 필수적이다. 현재 중국에서는 다양한 형태소 분석기가 개발되었으나, 대부분 현대 중국어 분석에 최적화되어 있어 고대 중국어 분석에는 정확성이 떨어지는 등의 한계가 있다.
    본 연구에서 검토한 분석기는 jieba, jiayan, HanLP, THULAC, LTP, PKUSeg, Stanford CoreNLP, bert-ancient-chinese, sikufenci, FudanNLP, HanmunRoBERTa 등이며, 이 중 bert-ancient-chinese, Stanford CoreNLP, sikufenci, HanmunRoBERTa, FudanNLP는 파이썬 환경과의 호환성 부족으로 인해 고대 중국어 분석에 제약이 있었다. 반면, jieba, jiayan, HanLP, THULAC, LTP, PKUSeg는 상대적으로 파이썬에서 안정적인 구동이 가능하였다.
    jieba는 고유명사 인식은 양호하나 실사와 허사의 구분이 모호한 모습을 보여서 분절하지 않고 하나의 토큰으로 보는 경향이 일부 있었다. jiayan은 고유명사 인식은 양호하나 복합명사 인식에서는 일부 불안정한 경향이 있었다. HanLP는 고유명사 인식은 양호하나 대규모 텍스트 처리에는 한계가 있었다. THULAC은 명사와 술어 성분의 분리에서 한계를 보여서 하나의 토큰으로 보는 경향이 있었다. LTP와 PKUSeg는 梁惠王등의 고유명사를 잘 인식하지 못하는 경향이 있다. 종합적으로 볼 때 jiayan이 비교적 양호한 성능을 보이는 것으로 나타났다.

    최근 본 자료 전체보기

      UCI(KEPA) : I410-151-25-02-093845785