当前位置:   article > 正文

大数据开发 NLP文本相似度(1),腾讯+华为+阿里面试真题分享_相似度 文本 对比 腾讯 百度 阿里

相似度 文本 对比 腾讯 百度 阿里

应用:

  • 相似文章

• 使用TF-IDF算法,找出两篇文章的关键词;

• 每篇文章各取出若干个关键词,合并成一个集合,计算每篇文章对于这个集合

中的词的词频;

• 生成两篇文章各自的词频向量;

• 计算两个向量的余弦相似度,值越大就表示越相似。

  • 文章摘要

在这里插入图片描述

5.L C S 定 义

• 最长公共子序列(Longest Common Subsequence)

• 一个序列S任意删除若干个字符得到的新序列T,则T叫做S的子序列

• 两个序列X和Y的公共子序列中,长度最长的那个,定义为X和Y的最长公共子序

– 字符串12455与245576的最长公共子序列为2455

– 字符串acdfg与adfc的最长公共子序列为adf

• 注意区别最长公共子串(Longest Common Substring)

– 最长公共子串要求连接

L C S 作 用

• 求两个序列中最长的公共子序列算法

– 生物学家常利用该算法进行基因序列比对ÿ

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/Gausst松鼠会/article/detail/666091
推荐阅读
相关标签
  

闽ICP备14008679号