| 講演抄録/キーワード |
| 講演名 |
2012-02-28 13:00
CrowdSourcingを用いた単語への読み付け、及びアクセント付け ○芦川将之・西山 修・下郡信宏(東芝) AI2011-36 |
| 抄録 |
(和) |
自然言語の研究を行うにあたっては膨大な語彙を必要とする。研究の精度を高く保つためには、既存の語彙に加えて新語や未知語といった語彙を常に取り入れていかなければならない。新語や未知語の単語表記に関してはWebなどからある程度まで自動的に抽出することが可能だが、実際に有用なものとするためには単語表記だけでは十分ではなく、「読み」や「アクセント」などといった自動的に付与することのできない情報が必要となる。従来はそれらの作業は専門家に依頼することで対応していたが金銭的、時間的コストが高いという問題があった。本作業ではプライベートなCrowdSourcingSystemを構築し、語彙の収集に用いることで改善することを提案する。 |
| (英) |
Investigation of natural language require to huge quantities of vocabularies. It is important to consistently correct new vocabularies and unknown vocabularies to keep high quality of investigation. Web Crawler can correct new vocabularies and unknown vocabularies from Web, but Web Crawler can't correct reading and accent about new vocabularies and unknown vocabularies. Making reading and accent data to new vocabularies is generally very expensive. This paper proposes a method to make reading and accent data to vocabularies with CrowdSourcing, and driving down cost of making readings and accent data to to new vocabularies. |
| キーワード |
(和) |
クラウドソーシング / 新語 / 未知語 / Web / / / / |
| (英) |
CrowdSourcing / Unknown Words / New Words / Unregistered Words / / / / |
| 文献情報 |
信学技報, vol. 111, no. 447, AI2011-36, pp. 11-16, 2012年2月. |
| 資料番号 |
AI2011-36 |
| 発行日 |
2012-02-21 (AI) |
| ISSN |
Print edition: ISSN 0913-5685 Online edition: ISSN 2432-6380 |
著作権に ついて |
技術研究報告に掲載された論文の著作権は電子情報通信学会に帰属します.(許諾番号:10GA0019/12GB0052/13GB0056/17GB0034/18GB0034) |
| PDFダウンロード |
AI2011-36 |