Analisis Morfologi untuk Menangani Out-of-Vocabulary Words pada Part-of-Speech Tagger Bahasa Indonesia Menggunakan Hidden Markov Model

Jurnal Linguistik Komputasional (JLK) Pub Date : 2019-03-25 DOI:10.26418/JLK.V2I1.13

Febyana Ramadhanti, Yudi Wibisono, R. Sukamto

引用次数: 6

Abstract

Part-of-speech (PoS) tagger merupakan salah satu task dalam bidang natural language processing (NLP) sebagai proses penandaan kategori kata (part-of-speech) untuk setiap kata pada teks kalimat masukan. Hidden markov model (HMM) merupakan algoritma PoS tagger berbasis probabilistik, sehingga sangat tergantung pada train corpus. Terbatasnya komponen dalam train corpus dan luasnya kata dalam bahasa Indonesia menimbulkan masalah yang disebut out-of-vocabulary (OOV) words. Penelitian ini membandingkan PoS tagger yang menggunakan HMM+AM (analisis morfologi) dan PoS tagger HMM tanpa AM, dengan menggunakan train corpus dan testing corpus yang sama. Testing corpus mengandung 30% tingkat OOV dari 6.676 token atau 740 kalimat masukan. Hasil yang diperoleh dari sistem HMM saja memiliki akurasi 97.54%, sedangkan sistem HMM dengan metode analisis morfologi memiliki akurasi tertinggi 99.14%.

查看原文本刊更多论文

印尼语词性标注器的词性分析。蒙古纳坎隐马尔科夫模型

tagger是自然语言处理(NLP)领域的一个任务，为输入句文本中的每个单词进行标记类别。隐藏马可夫模型是一个基于概率的邮政编码算法，这在很大程度上取决于语料库。语料库中组件的有限和单词的广度导致了一种叫做vocabulary的问题。该研究比较了一个使用mm +AM(形态分析)的tagger和一个嗯不使用AM的tagger，使用相同的火车语料库和测试语料库。验证语料库包含6676个令牌或740个输入句中的30%的OOV水平。从mm系统中获得的分数仅为97% .54%，而具有形态分析方法的HMM系统的准确率最高为99.14%。

本文章由计算机程序翻译，如有差异，请以英文原文为准。

求助全文

约1分钟内获得全文求助全文

来源期刊

Jurnal Linguistik Komputasional (JLK)

自引率

0.00%

发文量