도움말

한국어 품사 및 동형이의어 태깅을 위한 단계별 전이모델

A Stage Transition Model for Korean Part-of-Speech and Homograph Tagging
정보과학회논문지 : 소프트웨어 및 응용 제39권 제11호, 2012.11, 889-901 (13 pages)
인용정보 복사
Quick View Quick View
구매하기 6,000원
인용하기
이용수 : 249건
피인용수 : 1건
분야내 활용도 : 5%
자세히 보기 >

· 이용수 : 2010년부터 집계한 원문다운로드수

· 피인용수 : DBpia 논문 가운데 해당 논문을 인용한 논문수

· 분야내 활용도 : 최근 24개월간 DBpia 이용수를 기준으로 산출 / 0%에 가까울 수록 활용도가 높고, 100%에 가까울 수록 활용도가 낮음

초록
한국어 의미처리시스템은 어절의 형태소를 분석하고, 품사와 동형이의어를 분별해야 한다. 이를 위해 최근의 연구들은 말뭉치를 기계학습하여 품사 및 동형이의어 태깅하는 방법들을 제안하고 있으며, 기계학습에서 자료부족 문제를 해결하는 것에 집중하고 있다. 본 논문에서는 말뭉치를 기계학습하여 품사와 동형이의어를 동시에 태깅하는 방법을 제안한다. 이 방법은 자료부족 문제를 해결하기 위해 단계별 전이모델을 사용하며, 각 전이모델마다 다른 가중치를 적용한다. 또한 부분적으로 전이빈도가 0인 경우를 위해 최소 전이점수를 계산하는 예외 처리 루틴을 포함한다. 실험을 위해 1천만 어절의 세종 말뭉치를 사용하였으며, 이 중 90%를 학습하고 나머지 10%를 테스트하였다. 실험 결과 품사와 동형이의어 둘 다에 대해 96.44%의 태깅 정확률을 보였으며, 품사만을 고려할 경우 98.0%의 태깅 정확률을 보여 본 논문에서 제안하는 단계별 전이모델이 한국어와 같은 교착어의 품사 및 동형이의어 태깅에 적합한 방법임을 알 수 있다.

A Korean semantic processing system must analyze morpheme and disambiguate the POS and homograph for words. The recent researches proposed machine learning model using corpus, and focused on resolving the data sparseness problem. This paper proposes a method of simultaneous tagging for the POS and homograph using machine learning of corpus. The proposed method uses stage transition model for resolving the data sparseness problem, and applies different weight to each transition model. The tagging system includes exception routine that calculates minimum transition score in the case of no transition between words. For the experiment we used the 10 million words Sejong corpus and learned 90% of the Sejong corpus and tested 10%. The experiments shows that the accuracy is 96.44% for the POS and homograph tagging and 98.0% for the only POS tagging. From the experiment, the proposed stage transition model is adequate for tagging POS and homograph of agglutinative language like Korean.

목차
요약
Abstract
1. 서론
2. 관련 연구
3. 단계별 전이모델
4. 구현 태깅시스템(UTagger)
5. 실험과 결과 분석
6. 결론 및 향후 연구 방안
참고문헌
키워드
참고문헌 (23)

현재 논문의 참고문헌을 찾아 신청해주세요!

  1. Dong Myung Kim , 2009 , Simultaneous Korean POS and Homonym Tagging System using HMM , 석사 , Ulsan University

  2. Myeong-jin Hwang , 2007 , A Dynamic Link Model for Korean POS-Tagging , Proc. of Conference of Hangul and Korean Information Processing : 282 ~ 289

  3. Jung-ho Shin , 1994 , An HMM Part-of-Speech Tagger for Korean Based on Wordphras , Proc. of Conference of Hangul and Korean Information Processing : 389 ~ 394

  4. Young-Hoon Kim , 2002 , An Efficient Korean Part - of - Speech Tagging , Journal of the Korea Contents Association 2 (2) : 98 ~ 102

  5. Jae-Hoon Kim , 1995 , An Efficient Korean Part - of - Speech Tagging using a Hidden Markov Model , Journal of KIISE 22 (1) : 136 ~ 146

  6. 박희근 , 2007 , 어절별 중의성 해소 규칙을 이용한 혼합형 한국어 품사 태깅 시스템 , 정보과학회논문지 : 컴퓨팅의 실제 및 레터 13 (6) : 427 ~ 431

  7. Yuhwan Kang , 1999 , Korean Part- of-Speech Tagging using Constrained-Rule and Main POS Information among Words , Proc. of the 11th Conference on Hangul and Korean Language Information Processing : 433 ~ 437

  8. Scott M. Thede , 1999 , A Second-Order Hidden Markov Model for Part-of-Speech Tagging , Proc. of the 37th of ACL : 175 ~ 182

  9. Julian Kupiec , 1992 , Robust part-of-speech tagging using a hidden Markov model , Computer Speech and Language 6 (3) : 225 ~ 242

  10. Eugene Charniak , 1993 , Equations for part-of- speech tagging , Proc. of the Eleventh National Conference on Artifical Intellige : 784 ~ 789

  • 처음
  •  
  • 이전
  •  
  • 1
  •  
  • 2
  •  
  • 3
  •  
  • 다음
  •  
  • 마지막
인용된 논문 (1)

알림서비스 신청하고 '인용된 논문' 정보를 메일로 확인 하세요!

제 1 저자의 다른 논문 (10)

신준철 식별저자 저자의 상세정보를 확인해 보세요.

권호 내 다른 논문 (10)

정보과학회논문지 : 소프트웨어 및 응용 제39권 제11호 의 상세정보를 확인해 보세요.

추천 논문 (10)

DBpia 추천논문과 함께 다운받은 논문을 제공합니다. 논문 초록의 텍스트마이닝과 이용 및 인용 관계 분석을 통해 추천해 드리는 연관논문을 확인해보세요.

DBpia 추천논문

더 많은 추천논문을 확인해 보세요!

함께 다운받은 논문

지표

이용현황

· 이용수

· 이용순위 상위 Top3

자세히 보기 >
No 상위 이용이관 이용수
1 충북대학교 16
2 서울대학교 14
3 연세대학교 14

활용도

· 활용지수

· 논문의 활용도 추이 (주제분야 기준)

자세히 보기 >

: %

2016-09
2016-10
2016-11
2016-12
0
20
40
60
80
100
  • 0%
  • 20%
  • 40%
  • 60%
  • 80%
  • 100%

피인용수

상세정보
저작권 정책

누리미디어에서 제공되는 모든 저작물의 저작권은 원저작자에게 있으며, 누리미디어는 각 저작물의 내용을 보증하거나 책임을 지지 않습니다. 단, 누리미디어에서 제공되는 서지정보는 저작권법에 의해 보호를 받는 저작물로, 사전 허락 없이 임의로 대량 수집하거나 프로그램에 의한 주기적 수집 이용, 무단 전재, 배포하는 것을 금하며, 이를 위반할 경우, 저작권법 및 관련법령에 따라 민, 형사상의 책임을 질 수 있습니다.

맨 위로 이동