2023年09月归档_寒冷山水的博客_Mysql,电脑硬件,C#,GMS认证,自然语言处理领域博主

N-gram提取特征

N-Gram是一种基于统计语言模型的算法。它的基本思想是将文本里面的内容按照字节进行大小为N的滑动窗口操作，形成了长度是N的字节片段序列。每一个字节片段称为gram，对所有gram的出现频度进行统计，并且按照事先设定好的阈值进行过滤，形成关键gram列表，也就是这个文本的向量特征空间，列表中的每一种gram就是一个特征向量维度。例子比如我们现在使用单元Unigram、二元的Bi-gram和三元的Tri-gram模型来对进行特征提取。我们的训练样本为：1）我去了北京天安门2）我是中国人

自然语言处理 2023-09-02 240 点赞 3 评论 363 浏览

寒冷山水

N-gram提取特征

他的专栏

他的归档

热门文章