HMM 품사 태깅에서 신뢰성 척도와 규칙을 이용한 오류 수정 [韩语论文]

资料分类免费韩语论文 责任编辑:金一助教更新时间:2017-04-28
提示:本资料为网络收集免费论文,存在不完整性。建议下载本站其它完整的收费论文。使用可通过查重系统的论文,才是您毕业的保障。

품사 태깅에 있어 통계 기반 접근 방법을 이용한 시스템의 정확도는 훈련 데이터의 양에 좌우될 뿐 아니라, 말뭉치가 충분할지라도 수작업으로 구축한 말뭉치의 경우 항상 오류의 가능성을 ...

품사 태깅에 있어 통계 기반 접근 방법을 이용한 시스템의 정확도는 훈련 데이터의 양에 좌우될 뿐 아니라, 말뭉치가 충분할지라도 수작업으로 구축한 말뭉치의 경우 항상 오류의 가능성을 내포하고 있으며 언어의 특성상 통계적으로 신뢰할만한 데이터의 수집에도 어려움이 따른다. 일반적으로 데이터 부족 문제나 데이터 오류문제의 해결을 위해 평탄화(smoothing) 기법이나 재추정(reestimation) 기법과 같은 수학적 방법을 사용한다. 훈련 데이터로 사용되는 말뭉치는 많은 사람들이 수작업으로 구축하므로 작업자 중 일부가 언어에 대한 지식이 부족하다거나 주관적인 판단에 의한 태깅 실수를 포함할 수도 있기 때문에 단순한 저빈도와 관련된 잡음 외의 오류들이 포함될 수 있는데 이러한 오류들은 재추정이나 평탄화 기법으로 해결될 수 있는 문제가 아니다.
본 논문에서는 HMM(Hidden Markov Model)을 이용한 한국어 품사 태깅에서 재추정 후 여전히 존재하는 말뭉치의 잡음에 인한 태깅 오류 해결을 위한 방안을 제시한다. 본 논문에서는 비터비 알고리즘 적용 단계에서 데이터 부족과 말뭉치의 오류로 인해 문제가 되는 부분을 찾아내고 규칙을 통해 수정을 하여 태깅 결과를 개선하는 방안을 제안한다. 실험결과는 오류가 존재하는 말뭉치를 사용하여 구현된 HMM과 비터비 알고리즘을 적용한 태깅 정확도에 비해 오류를 수정하는 과정을 거친 후 정확도가 향상됨을 보여준다.

Tagging system is significantly effected by corpus in statistical part-of-speech tagging. Since tagged corpus is made by many people together and their linguistic knowledge is different from each other, it is hard to guarantee coherency. Therefore, ta...

Tagging system is significantly effected by corpus in statistical part-of-speech tagging. Since tagged corpus is made by many people together and their linguistic knowledge is different from each other, it is hard to guarantee coherency. Therefore, tagged corpus always has some errors. In this , we propose a measure to detect conditions to make error, and find potential tagging error by using the measure, and correct the potential tagging error by predefined rule. Experimental results showed that the precision of tagging system using our method is improved more than the precision of pure HMM tagging system.

韩语论文韩语毕业论文
免费论文题目: