赞
踩
中文分词(Chinese Word Segmentation)指的是将一个汉字序列切分成一个一个单独的词。中文分词是文本挖掘的基础,对于输入的一段中文,成功的进行中文分词,可以达到电脑自动识别语句含义的效果。
TF-IDF(term frequency–inverse document frequency)是一种用于信息搜索和信息挖掘的常用加权技术。在搜索、文献分类和其他相关领域有广泛的应用。
TF-IDF的主要思想是,如果某个词或短语在一篇文章中出现的频率TF高,并且在其他文章中很少出现,则认为此词或者短语具有很好的类别区分能力,适合用来分类。TF词频(Term Frequency)指的是某一个给定的词语在该文件中出现的次数。IDF反文档频率(Inverse Document Frequency)的主要思想是:如果包含词条的文档越少,IDF越大,则说明词条具有很好的类别区分能力。
将训练集,测试集,按8-2分割,8-部分作为训练样本,2-部分作为测试样本,对样本标题进行最大分词,根据TF-IDF分类算法:
其中,TFi是单词出现在第i类中的频率,IDF是单词逆类别函数。N代表类别总数,n代表单词出现的类别数,为了避免N与n相等而出现0值,故将N加1。IDF表示一个单词出现的类别数与其在某一类别中的比重成反比。即某一单词出现的类别数越多,其代表某类的比重越小。取全部关键词的Wi值生成关键词库中间结果,关键词库生成数目可受参数配置。
S计算测试集与关键词库匹配的Wi值相加,排序取最大S值,取相对应的i作为最终分类,分为重要资源库与非重要资源库两类,正确分类率91.96%。
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。