| 講演抄録/キーワード |
| 講演名 |
2013-09-13 10:30
極大部分文字列の列挙による教師なし単語分割 ○河内祐太・井上真郷(早大) NLC2013-25 |
| 抄録 |
(和) |
教師なし単語分割とは,日本語文章等の単語を区切ることや,人間の語彙獲得過程を再現することなどを目的として,既存の辞書や人手を介さずに,また特定の言語に依存するような規則を用いずに,与えられた文章それ自体のみから単語境界を推定する手法である.本研究では,文章の生成モデルに基づいた,極大部分文字列を用いた確定的な探索による手法を提案する.また,未知言語を模した
データとして,この分野で標準的に用いられる英語音素列データを用いて評価を行い,検討する. |
| (英) |
Unsupervised word segmentation is a method for estimating word boundaries from a given sentence itself, without any word delimiters, using rules depending on some specific languages, or man-made dictionaries. It is used to segment words in languages that have no word delimiters, such as Japanese, and aims to simulate the human's language aquisition. In this research, we propose a deterministic searching approch using maximal substrings based on a generative model of sentence. We evaluate the algorithm by using phonemic transcripts in English as an unknown language, which is a sentence that is widely used for evaluating the segmentation methods in this field. |
| キーワード |
(和) |
単語分割 / 極大部分文字列 / 語彙獲得 / 生成モデル / / / / |
| (英) |
word segmentation / maximal substrings / language aquisition / generative model / / / / |
| 文献情報 |
信学技報, vol. 113, no. 213, NLC2013-25, pp. 55-60, 2013年9月. |
| 資料番号 |
NLC2013-25 |
| 発行日 |
2013-09-05 (NLC) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
査読に ついて |
本技術報告は査読を経ていない技術報告であり,推敲を加えられていずれかの場に発表されることがあります. |
| PDFダウンロード |
NLC2013-25 |