인문학
사회과학
자연과학
공학
의약학
농수해양학
예술체육학
복합학
개인구독
소속 기관이 없으신 경우, 개인 정기구독을 하시면 저렴하게
논문을 무제한 열람 이용할 수 있어요.
지원사업
학술연구/단체지원/교육 등 연구자 활동을 지속하도록 DBpia가 지원하고 있어요.
커뮤니티
연구자들이 자신의 연구와 전문성을 널리 알리고, 새로운 협력의 기회를 만들 수 있는 네트워킹 공간이에요.
초록·키워드
변형 규칙 기반 품사 태거는 태깅 규칙을 코퍼스로부터 자동 학습할 수 있고, 견고하며 태깅 결과를 이해하고 분석하기가 쉽다는 장점을 갖는다. 이에 최근 한국어 특성을 고려한 변형 규칙 기반 한국어 품사 태거가 개발되었다. 하지만 이 시스템은 오류 어절의 어휘 정보를 사용하지 않으므로 수정 가능 오류에 대한 변형 규칙이 제대로 학습되지 못하며, 변형 규칙 적용 과정에 새로운 오류를 발생시킨다는 문제점이 있다. 이에 본 논문은 오류 어절의 어휘 정보를 참조할 수 있는 세부 변형 규칙 추출을 이용한 변형 규칙 기반 한국어 품사 태거의 개선 방안을 제안한다. 어휘 정보를 참조할 수 있는 세부 변형 규칙의 형태는 특정 문맥 C에서 어절 W의 어절 태그 α를 어절 태그 β로 변형한다와 같다. 제안된 방법은 약 10만 어절 크기의 학습 코퍼스에서 57개의 세부 규칙을 학습하였고, 2만 어절 크기의 실험 코퍼스에 적용한 결과 95.6%의 정확도를 보임으로써 기존의 변형 규칙 기반 품사 태거의 정확도를 약 15.4% 향상시켰다. 특성을 고려할 수 있는 변형 규칙 틀과 변형 규칙을 사용하였다[11, 12]. 한국어 특성을 고려할 수 있도록 제안된 변형 규칙은 특정 문맥 C에서 어절 태그 α를 어절 태그 β로 변형한다와 같이 어절 태그 변형 규칙이다. 어절 태그 변형 규칙은 어절을 구성하는 형태소 품사 열로 정의되는 어절 태그를 수정함으로써, Brill이 사용한 변형 규칙 형태로 처리할 수 없는 한 어절내 두 가지 이상의 형태소 태깅 오류를 수정할 수 있다. 예를 들면, “내가 먹은¹ 감”에서 ‘먹은’이 먹(명사)+은(조사) 로 잘못 태깅 되었을 때, 특정 문맥 C에서 어절 태그, ‘명사+조사’를 어절 태그, ‘동사+어미’로 변형한다와 같은 변형 규칙은 한 어절내 발생한 두가지의 형태소 태깅 오류를 수정할 수 있다. 변형 규칙 기반 한국어 품사 태깅 시스템에서 사용한 초기 태거는 Twoply HMM[6]에서 어절 발생 확률을 계산하기 위하여 사용한 어절내 HMM을 이용하였다. 어절내 HMM은 어절내 형태소 전이 확률과 형태소 발생 확률을 마르코프 모델에 적용하여 어절의 발생 확률을 계산한다. 어절내 HMM을 이용한 초기 태거는 338,016개의 형태소 크기의 학습 코퍼스를 이용하여 학습시켰으며, 실험 코퍼스에서 약 91.6%의 정확도를 보였다.
본문·목차
인공지능 문자 인식 모델을 통해 추출된 텍스트로, 일부 오타나 오류가 포함될 수 있으나 지속적으로 개선 중입니다.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.
오류를 발견하셨다면 해당 부분을 드래그한 후 ' 를 통해 신고해주세요.