搜索
查看
编辑修改
首页
UNITY
NODEJS
PYTHON
AI
GIT
PHP
GO
CEF3
JAVA
HTML
CSS
搜索
小惠珠哦
这个屌丝很懒,什么也没留下!
关注作者
热门标签
jquery
HTML
CSS
PHP
ASP
PYTHON
GO
AI
C
C++
C#
PHOTOSHOP
UNITY
iOS
android
vue
xml
爬虫
SEO
LINUX
WINDOWS
JAVA
MFC
CEF3
CAD
NODEJS
GIT
Pyppeteer
article
热门文章
1
监督学习与无监督学习—机器学习的两大方法_较两种机器学习方法
2
[android]毕业设计基于ncnn模型实现android车辆识别车牌角度矫正车牌文本识别车牌颜色识别源码和实现过程_车牌检测模型转换ncnn
3
python车牌识别系统 深度学习 车牌实时检测 OpenCV 毕业设计(源码)_车牌识别csdn
4
深入浅出 区块链密码学(学习笔记2.0)——对称加密_区块链密钥是显示怎样的密码
5
王炸级产品:字节跳动的Seed-TTS
6
【STM32单片机】智能电饭煲设计_电饭煲c程序
7
1980python个性化电影推荐管理系统mysql数据库Django结构layUI布局elasticsearch存储计算机软件工程网页
8
优质免费的 5 款翻译 API 接口推荐_免费翻译api
9
pg 出现视图依赖表,导致字段不能修改_cannot alter type of a column used by a view or ru
10
常见B端产品经理面试问题及答案(二)【11年大厂面试官呕心制作】_计算总监面试产品经理
当前位置:
article
> 正文
开源搜索引擎_开源 搜索引擎方案
作者:小惠珠哦 | 2024-06-26 01:53:00
赞
踩
开源 搜索引擎方案
开源搜索引擎
分类
Lucene系搜索引擎,java开发,包括:
Lucene
Solr
Elasticsearch
Katta、Compass等都是基于Lucene封装
Sphinx搜索引擎,C++开发,简单高性能
引擎对比
Lucene
Lucene的开发语言是Java,也是Java家族中最为出名的一个开源搜索引擎,在Java世界中已经是标准的全文检索程序,它提供了完整的查询引擎和索引引擎,没有中文分词引擎,需要自己去实现,因此用Lucene去做一个搜素引擎需要自己去架构,另外它不支持实时搜索。但是solr和elasticsearch都是基于Lucene封装。
优势:成熟的解决方案,有很多的成功案例。apache 顶级项目,正在持续快速的进步。庞大而活跃的开发社区,大量的开发人员。它只是一个类库,有足够的定制和优化空间:经过简单定制,就可以满足绝大部分常见的需求;经过优化,可以支持 10亿+ 量级的搜索。
缺点:需要额外的开发工作。所有的扩展,分布式,可靠性等都需要自己实现;非实时,从建索引到可以搜索中间有一个时间延迟,而当前的“近实时”(Lucene Near Real Time search)搜索方案的可扩展性有待进一步完善
Apache Solr
简介
Solr是一个高性能,采用Java开发,基于Lucene的全文搜索服务器
文档通过Http利用XML加到一个搜索集合中
查询该集合也是通过一个XML/JSON响应来实现。它的主要特性包括:高效、灵活的缓存功能,垂直搜索功能,高亮显示搜素结果,通过索引复制来提高可用性,提供一套强大Data Schema来定义字段,类型和设置文本分析,提供基于Web的管理界面等
优势:
Solr有一个更大、更成熟的用户、开发和贡献者社区。
支持添加多种格式的索引,如:HTML、PDF、微软 Office 系列软件格式以及 JSON、XML、CSV 等纯文本格式。
Solr比较成熟、稳定。
不考虑建索引的同时进行搜索,速度更快。
缺点:建立索引时,搜索效率下降,实时索引搜索效率不高。
ElasticSearch
简介:ElasticSearch是一个基于Lucene构建的开源,分布式,RESTful搜索引擎。设计用于云计算中,能够达到实时搜索,稳定,可靠,快速,安装使用方便。支持通过HTTP使用JSON进行数据索引
优点:
Elasticsearch是分布式的。不需要其他组件,分发是实时的,被叫做”Push replication”。
Elasticsearch 完全支持 Apache Lucene 的接近实时的搜索。
处理多租户(multitenancy)不需要特殊配置,而Solr则需要更多的高级设置。
Elasticsearch 采用 Gateway 的概念,使得完备份更加简单。
各节点组成对等的网络结构,某些节点出现故障时会自动分配其他节点代替其进行工作。
缺点:还不够自动(不适合当前新的Index Warmup API)
ElasticSearch和Solr的比较
二者安装都很简单
Solr利用Zookeeper进行分布式管理,而ElasticSearch自身带有分布式协调管理功能
Solr 支持更多格式的数据,而 Elasticsearch 仅支持json文件格式;
Solr 官方提供的功能更多,而 Elasticsearch 本身更注重于核心功能,高级功能多有第三方插件提供;
Solr 在传统的搜索应用中表现好于 Elasticsearch,但在处理实时搜索应用时效率明显低于 Elasticsearch。
总之,Solr 是传统搜索应用的有力解决方案,但 Elasticsearch 更适用于新兴的实时搜索应用。
Sphinx
Sphinx是一个基于SQL的全文检索引擎,特别为一些脚本语言(PHP,Python,Perl,Ruby)设计搜索API接口
Sphinx是一个用C++语言写的开源搜索引擎,也是现在比较主流的搜索引擎之一,在建立索引的事件方面比Lucene快50%,但是索引文件比Lucene要大一倍,因此Sphinx在索引的建立方面是空间换取事件的策略,在检索速度上,和lucene相差不大,但检索精准度方面Lucene要优于Sphinx,另外在加入中文分词引擎难度方面,Lucene要优于Sphinx.其中Sphinx支持实时搜索,使用起来比较简单方便.
Sphinx可以非常容易的与SQL数据库和脚本语言集成。当前系统内置MySQL和PostgreSQL 数据库数据源的支持,也支持从标准输入读取特定格式 的XML数据。通过修改源代码,用户可以自行增加新的数据源(例如:其他类型的DBMS 的原生支持)
Sphinx的特点
高速的建立索引(在当代CPU上,峰值性能可达到10MB/S)
高性能的搜索(在2-4GB的文本数据上,平均每次检索响应时间小于0.1s)
开处理海量数据(目前已知可以处理超过100GB的文本数据,在单一CPU的系统可处理100M文档)
提供了优秀的相关度算法,基于短语相似读和统计(BM25)的复合Ranking方阿飞
支持分布式搜索
支持短语搜索
提供文档摘要生产
可作为MySQL的存储引起提供搜索服务
支持布尔、短语、词语相似度等多种检索模式
文档支持多个全文检索字段(最大不超过32个)
文档支持多个额外的属性信息(例如:分组信息,时间戳等)
支持断词
声明:
本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:
https://www.wpsshop.cn/w/小惠珠哦/article/detail/758035
推荐阅读
article
鸿蒙
OS
开发
实例:【
ArkTS
类库异步并发简述
Promise
】_
鸿蒙
开发
[
object
promis...
then方法可接受两个参数,一个处理fulfilled状态的函数,另一个处理rejected状态的函数。使用catch方...
赞
踩
article
鸿蒙
Arkts
开发框架经验分享之主页面
Tabs
_
鸿蒙
arkts
tab
...
在其中的核心函数是:}中的函数//
_
鸿蒙
arkts
tab
鸿蒙
arkts
tab
目录 ...
赞
踩
article
DNS
Proxy: 灵活、
安全
的
DNS
代理
解决方案
...
DNS
Proxy: 灵活、
安全
的
DNS
代理
解决方案
项目地址:https://gitcode.com/ARwMq9b6/d...
赞
踩
article
ShardingSphere
之
分库
&
分表
_shardingspheredatasourcefacto...
笔者日常:看朋友发了一篇关于
ShardingSphere
的文章,我对
ShardingSphere
挺感兴趣的,于是就学了下...
赞
踩
article
毫无
基础
的
人如何
入门
Python
?
Python
入门
教程
拿走不谢啦!_无
基础
自学
python
...
随着人工智能
的
发展,
Python
近两年也是大火,越来越多
的
人加入到
Python
学习大军,对于毫无
基础
的
人该如何
入门
Pyt...
赞
踩
article
WPF
——
Expander
折叠栏 、
菜单
标签
menu
_
wpf
expander
...
Expander
控件有一个箭头按钮。单击箭头时,
Expander
中的子元素将显示或隐藏。箭头“展开”控件,使其子控件可见...
赞
踩
article
2024年
华为
OD机试真题-
分
披萨
-
Python
-OD统一考试(C卷)_
分
披萨
od
题目
...
接下来的第2行到第N+1行(共N行),每行为一个正整数,表示第i块
披萨
的大小。“吃货”和“馋嘴”两人到
披萨
店点了一份铁盘...
赞
踩
article
微信
小
程序
如何取得
用户
的
openid
_
微信
小
程序
获取
用户
openid
...
通过以上步骤,可以在
微信
小
程序
中获取
用户
的
openid
。在实际应用中,可以将
openid
作为
用户
身份的唯一标识,用于关联...
赞
踩
article
Ubuntu
22.04
中
python
3
site
-
package
路径问题_
python
sit...
今年用
Ubuntu
22.04
,才注意到安装的
site
-
package
s 是在每个用户的/home 下。这样如果一个p...
赞
踩
article
linux
下
各个
端口及他们的作用
_
dssys
.
pro
...
# /etc/services:# $Id: services,v 1.48 2009/11/11 14:32:31 o...
赞
踩
article
spark
-
sql
的
常见
的
命令
行操作_
spark
-
sql
命令
...
这里
的
spark
不是 Scala 中
的
包名,而是创建
的
spark
Session 对象
的
变量名称,所以必须先创建 S...
赞
踩
article
JavaWeb
期末大
作业
Javaweb
项目
Javaweb
Servlet
html
_javawe...
管理系统
javaweb
项目
javaweb
大
作业
可用 管理系统
javaweb
servlet
html
jsp js...
赞
踩
article
mac
设置环境变量.
bash
_
profile
或 /usr/
local
_
bash
profile
文件在...
若在多个 shell(如 Bash、Zsh)之间切换,可能需要在每个 shell 的配置文件中进行相应的设置!_
bash
...
赞
踩
article
mysql
触发器
...
什么是
触发器
:
触发器
是与表有关的数据库对象,在满足条件时触发。执行
触发器
中定义的语句集合。触发的这种特性可以协助应用...
赞
踩
article
中文
语音
识别
转文字的王者,阿里
达摩院
FunAsr
足可与
Whisper
相颉顽_
whisper
-larg...
君不言
语音
识别
技术则已,言则必称
Whisper
,没错,OpenAi开源的
Whisper
确实是世界主流
语音
识别
技术的魁首,...
赞
踩
article
AWVS
安装及
破解
...
AWVS
的安装与
破解
AWVS
安装及
破解
AWVS
是一款漏洞扫描工具 注:
破解
包可能被识...
赞
踩
article
【附源码】计算机毕业设计SSM汽车
维修服务
系统
_
软件工程
大作业
汽车修理
管理
系统
系统
流程图
...
项目运行环境配置:(Webstorm也行)+ Eclispe(IntelliJ IDEA,Eclispe,MyEclis...
赞
踩
article
【实战】
gateway
开始
动态
路由
报错
404
_
gateway
404
...
通过debug网关服务FilteringWebHandler类排查问题,发现
gateway
开启
动态
路由
(spring....
赞
踩
article
Agents
and Multi-
Agents
System 智能与多智能体系统_
agent
s mu...
文章目录Week2 Embedded
Agents
2.1 Math revision2.2 Accessible and...
赞
踩
article
linux
上如何
安装
diff
-
gaussian
-
rasterization
(研一菜鸟
,
记录一下花半天...
我的理解是服务器的驱动是12.0
,
本地cuda12.0
,
anaconda创建的虚拟环境下的pytorch版本编译的时候没...
赞
踩
相关标签
harmonyos
鸿蒙开发
程序员
OpenHarmony
鸿蒙系统
移动开发
鸿蒙
前端
分库分表
分库分表的实现
ShardingSphere实现分库分表
ShardingSphere切片分库分表
Java分库分表
Python
Python入门教程
wpf
华为od
python
华为
算法
开发语言
微信小程序
小程序
ubuntu