文本挖掘的分词原理1. 分词的基本原理2. N元模型3. 维特比算法与分词4. 常用分词工具5. 结语
在做文本挖掘的时候,首先要做的预处理就是分词。英文单词天然有空格隔开容易按照空格分词,但是也有时候需要把多个单词做为一个分词,比如一些名词如“New York”,需要做为一个词看待。而中文由于没有空格,分词就是一个需要专门去解决的问题了。无论是英文还是中文,分词的原理都是类似的,本文就对文本挖掘时的分词原理做一个总结。1. 分词的基本原理 现代分词都是基于统计的分词,而统计的样本内容...