当前位置:   article > 正文

NLP自然语言处理-机器学习和自然语言处理介绍(三)_nlp 新词发现

nlp 新词发现

NLP自然语言处理-机器学习和自然语言处理介绍-新词发现和TF-IDF
1. 新词发现
(1)为什么要做新词发现
① 如果没有词表,那我们如何发现词;
② 随着数据量的增加,旧的词表会逐步满足不了后续的需求;
③ 补充词表有助于下游任务的实现。
④ 词相当于一种固定搭配,词的内部是稳固的,也叫内部凝固度凝固度
;而词的外部是不稳定的,称为左右熵左右熵

例如下图:河北这个词是稳固的,但是后边跟的就不是固定的了。
在这里插入图片描述
(2)何为重要词
① 当我们对文章进行分词处理后,需要利用词对文档进行理解,那么我们需要的就是文档中的重要词;如下:
在这里插入图片描述
② 假如一个词在某类文本(假设为A类)中出现次数很多,而在其他类别文本(非A类)出现很少,那么这个词是A类文本的重要词(高权重词&#x

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/知新_RL/article/detail/626503
推荐阅读
相关标签
  

闽ICP备14008679号