搜索
查看
编辑修改
首页
UNITY
NODEJS
PYTHON
AI
GIT
PHP
GO
CEF3
JAVA
HTML
CSS
搜索
盐析白兔
这个屌丝很懒,什么也没留下!
关注作者
热门标签
jquery
HTML
CSS
PHP
ASP
PYTHON
GO
AI
C
C++
C#
PHOTOSHOP
UNITY
iOS
android
vue
xml
爬虫
SEO
LINUX
WINDOWS
JAVA
MFC
CEF3
CAD
NODEJS
GIT
Pyppeteer
article
热门文章
1
海光CPU测试zlib性能对比_hygon c86 7285 32-core processor
2
内网穿透方案@远程串流控制方案@简单易用的虚拟组网方案
3
Gui Guider 生成代码移植到匠芯创平台系列--手动添加移植代码_gui guider 移植
4
Pure Admin框架学习笔记---1 (认识它)
5
D触发器的工作原理以及Verilog代码(一/二)_异步d触发器真值表
6
解决php curl 报错:SSL connect error_ssl. connect error (curle ssl connect error): open
7
c语言模拟按键win d,Windows平台模拟按键方法总结
8
ssm基于java的出入登记管理系统x15sw【独家源码】计算机毕业设计问题的解决方案与方法_出入登记系统
9
Google Safe Browsing API中的黑名单(phishing list,malware list)_google safebrowsing phishing
10
opencascade AIS_Shape源码学习【重中之重】_opencascade 比例
当前位置:
article
> 正文
全文搜索引擎
作者:盐析白兔 | 2024-08-18 15:05:34
赞
踩
全文搜索引擎
本文转载自xum2008的博客,主要介绍13款现有的开源搜索引擎,你可以将它们用在你的项目中以实现检索功能。
1. Lucene
Lucene的开发语言是Java,也是Java家族中最为出名的一个开源搜索引擎,在Java世界中已经是标准的全文检索程序,它提供了完整的查询引擎和索引引擎,没有中文分词引擎,需要自己去实现,因此用Lucene去做一个搜素引擎需要自己去架构.另外它不支持实时搜索,但linkedin和twitter有分别对Lucene改进的实时搜素. 其中Lucene有一个C++移植版本叫CLucene,CLucene因为使用C++编写,所以理论上要比lucene快.
官方主页:http://lucene.apache.org/
CLucene官方主页:http://sourceforge.net/projects/clucene/
2. Sphinx
Sphinx是一个用C++语言写的开源搜索引擎,也是现在比较主流的搜索引擎之一,在建立索引的事件方面比Lucene快50%,但是索引文件比Lucene要大一倍,因此Sphinx在索引的建立方面是空间换取事件的策略,在检索速度上,和lucene相差不大,但检索精准度方面Lucene要优于Sphinx,另外在加入中文分词引擎难度方面,Lucene要优于Sphinx.其中Sphinx支持实时搜索,使用起来比较简单方便.
官方主页:http://sphinxsearch.com/about/sphinx/
3. Xapian
Xapian是一个用C++编写的全文检索程序,它的api和检索原理和lucene在很多方面都很相似,算是填补了lucene在C++中的一个空缺.
官方主页:http://xapian.org/
4. Nutch
Nutch是一个用java实现的开源的web搜索引擎,包括爬虫crawler,索引引擎,查询引擎. 其中Nutch是基于Lucene的,Lucene为Nutch提供了文本索引和搜索的API.
对于应该使用Lucene还是使用Nutch,应该是如果你不需要抓取数据的话,应该使用Lucene,最常见的应用是:你有数据源,需要为这些数据提供一个搜索页面,在这种情况下,最好的方式是直接从数据库中取出数据,并用Lucene API建立索引.
官方主页:http://nutch.apache.org/
5. DataparkSearch
DataparkSearch是一个用C语言实现的开源的搜索引擎. 其中网页排序是采用神经网络模型. 其中支持HTTP,HTTPS,FTP,NNTP等下载网页.包括索引引擎,检索引擎和中文分词引擎(这个也是唯一的一个开源的搜索引擎里有中文分词引擎).能个性化定制搜索结果,拥有完整的日志记录.
官方主页:http://www.dataparksearch.org/
6. Zettair
Zettair是根据Justin Zobel的研究成果为基础的全文检索实验系统.它是用C语言实现的. 其中Justin Zobel在全文检索领域很有名气,是业界第一个系统提出倒排序索引差分压缩算法的人,倒排列表的压缩大大提高了检索和加载的性能,同时空间膨胀率也缩小到相当优秀的水平. 由于Zettair是源于学术界,代码是由RMIT University的搜索引擎组织写的,因此它的代码简洁精炼,算法高效,是学习倒排索引经典算法的非常好的实例. 其中支持linux,windows,mac os等系统.
官方主页:http://www.seg.rmit.edu.au/zettair/about.html
7. Indri
Indri是一个用C语言和C++语言写的全文检索引擎系统,是由University of Massachusetts和Carnegie Mellon University合作推出的一个开源项目. 特点是跨平台,API接口支持Java,PHP,C++.
官方主页:http://www.lemurproject.org/indri/
8. Terrier
Terrier是由School of Computing Science,Universityof Glasgow用java开发的一个全文检索系统.
官方主页:http://terrier.org/
9. Galago
Galago是一个用java语言写的关于文本搜索的工具集. 其中包括索引引擎和查询引擎,还包括一个叫TupleFlow的分布式计算框架(和google的MapReduce很像).这个检索系统支持很多Indri查询语言.
官方主页:http://www.galagosearch.org/
10. Zebra
Zebra是一个用C语言实现的检索程序,特点是对大数据的支持,支持EMAIL,XML,MARC等格式的数据.
官方主页:https://www.indexdata.com/zebra
11. Solr
Solr是一个用java开发的独立的企业级搜索应用服务器,它提供了类似于Web-service的API接口,它是基于Lucene的全文检索服务器,也算是Lucene的一个变种,很多一线互联网公司都在使用Solr,也算是一种成熟的解决方案.
官方主页:http://lucene.apache.org/solr/
12. Elasticsearch
Elasticsearch是一个采用java语言开发的,基于Lucene构造的开源,分布式的搜索引擎. 设计用于云计算中,能够达到实时搜索,稳定可靠. Elasticsearch的数据模型是JSON.
官方主页:http://www.elasticsearch.org/
13. Whoosh
Whoosh是一个用纯python写的开源搜索引擎.
官方主页:https://bitbucket.org/mchaput/whoosh/wiki/Home
声明:
本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:
https://www.wpsshop.cn/w/盐析白兔/article/detail/997927
推荐阅读
article
【华为OD机试真题】395
、
最长
合法
表达式
| 机试真题+思路参考+代码解析(
C++
、
Java
、
Py...
题目描述>提取
字符串
中的
最长
合法
简单
数学
表达式
,
字符串
长度
最长
的,并计算
表达式
的值。如果没有,则返回0>
简单
数学
表达式
...
赞
踩
article
华为
OD机试 - 提取
字符串
中
的
最长
数学
表达式
(
Java
2024 D卷 100分)...
华为
OD机试 2024D卷题库疯狂收录中,刷题。_提取
字符串
中
的
最长
数学
表达式
提取
字符串
中
的
最长
数学
表达式
...
赞
踩
article
算法系列之十八:用天文方法
计算
二十四
节气
(上) ._
vsop87
行星
轨道
计算
节气
java
...
二十四
节气
在中国古代历法中扮演着非常重要的角色,本文将介绍
二十四
节气
的基本知识,以及如何使用VSOP82/87
行星
运行理...
赞
踩
article
24
节气
算法_
节气
算法
java
calendar
...
本文详细探讨了计算中国传统24
节气
的算法,从天文历法基础出发,解释了如何根据太阳黄经的变化确定每个
节气
的具体日期。通过对...
赞
踩
article
力扣:3132. 找出与
数组
相加
的
整数
II(
Java
,枚举)...
移除 nums1 中下标为 [0,4]
的
两个元素,并且每个元素与 -2
相加
后,nums1 变为 [18,14,10]...
赞
踩
article
Java
集合
框架:
TreeMap
的介绍、使用、原理与源码解析_
java
集合
tree
...
Map 在
Java
里面分为两种:HashMap 和
TreeMap
,区别就是
TreeMap
有序,HashMap ...
赞
踩
article
力扣
面试常见150题
:
数组
篇(
java
+
c++
)_
力扣
java
常用...
给你一个字符串s,由若干单词组成,单词前后用一些空格字符隔开。返回字符串中最后一个单词的长度。单词是指仅由字母组成、不包...
赞
踩
article
力扣
:
两数之和(
java
)_
java
的
两个
int
[]
相加
...
题目
:
给定一个整数数组 nums和一个整数目标值 target,请你在该数组中找出和为目标值 target 的那
两个
整数...
赞
踩
article
【Py/
Java
/C++三种语言详解】
LeetCode
每日一题240115【
链表
】
LeetCode
8...
60+天陪伴式学习,40+直播课时,300+动画图解视频,300+
LeetCode
经典题,200+华为OD真题/大厂真题...
赞
踩
article
Java
编程语言
的优点
和
特点_
java
优点
和
特点...
总之,
Java
语言具有简单易学、平台无关、安全性高、多线程支持
和
大量相关资料
和
库等优点。由于
Java
应用程序是在虚...
赞
踩
article
java
有什么
缺点
_
java
的
缺点
...
java
缺点
_
java
的
缺点
java
的
缺点
虽然 Jav...
赞
踩
article
基于
java
的ssm框架
在线
购书
商城
系统
_
购物车
书籍
java
...
本课题是根据用户的需要以及网络的优势建立的一个
在线
购书
商城
系统
,来满足用户网络查看、购买所需图书的需求。本
在线
购书
商城
系...
赞
踩
article
python
、
java
、
Go哪个前景好?_
go
语言
和
java
哪个更有前途...
01 Python难度:★欢迎度:★★★★☆创始于:1991年学完之后可以干什么:web开发
、
应用开发
、
大数据
、
数据挖掘...
赞
踩
article
Java
ExecutorService
:
你真的了解
它
吗?...
Java
ExecutorService
是
Java
并发编程中一个强大的工具,
它
提供了一种管理线程生命周期和执行多个异步任...
赞
踩
article
java
数据
权限
中间件
_
位运算+
数据
库两种方式实现
中间件
权限
操作...
1
数据
库实现
权限
操作既是管理又是超级管理员的需要五表关联1.1 四表联动1.2 表设计models.py#
权限
系统四...
赞
踩
article
Java
基础——
Scanner
类_
java
scanner
...
本文介绍了
Scanner
类相关的知识。_
java
scanner
java
scanner
...
赞
踩
article
Docker 部署
Jenkins
Jenkins
下载插件失败(
java
.io.
IOException
...
Docker
Jenkins
插件 下载 失败 版本_
jenkins
(2.361.4)
or
higher
requi...
赞
踩
article
Eclipse
启动
过程 _
eclipse
4.6 (
neon
)
java
ee 安装了怎么
启动
使用...
一般安装JDK的时候,会同时在系统目录下也安装一个JRE环境。开始我把安装在系统目录下的JRE环境卸载了,在环境变量中...
赞
踩
article
Linux
JAVA
JDK
JRE
环境变量
安装与配置...
背景: 阅读新闻 [日期:2017-12-10] 来源:renwole.com 作者:任我乐 [字体:大 ...
赞
踩
article
2024年
华为
OD机试真题-
贪吃
的
猴子
-
Java
-OD统一考试(C卷)_
华为
od
贪吃
的
猴子
...
猴子
在果园面临一排香蕉,每次可以从头或尾取N次香蕉。给定每串香蕉数量和N,求最大获取香蕉数。例如,输入7, [1 2 2...
赞
踩
相关标签
华为od
c++
java
python
最长合法表达式
开发语言
算法
360
日历
bt
qt
生活
leetcode
栗筝i 的 Java 技术栈
Java基础
Java集合
TreeMap
r-tree
面试
字符串
力扣