`
tjc
  • 浏览: 66810 次
  • 性别: Icon_minigender_1
  • 来自: 上海
社区版块
存档分类
最新评论

垂直搜索引擎行业应用技术探讨

阅读更多

 

在简单过滤之后,选择研究apache nutch来进行数据爬取。

在深入了解和学习之后,发现
Nutch 实现网页爬取,通过plugin机制可以自定义相应的规则和数据处理逻辑,结合hadoop实现数据的分布式存储。

nutch可以定制,针对不同的数据源实现特定的爬取和数据分析规则。但如何实现nutch的分布式,比如多机部署?还是单机?如何提高nutch的爬取速度?

nutch爬取下来的数据可以存放在hadoop里,通过建立索引命令可以让solr来为数据进行索引。但是存在一个问题,solr建立的索引是存放在solr配置的目录里的,可是这样不就存在数据冗余存放的问题吗?这里有一篇文章  solr是如何存储索引的  http://p-x1984.iteye.com/blog/1149980 

通过solr搜索后如何建立搜索结果数据和nutch爬取后存放在hadoop中的数据的关联?比如通过nutch爬取网页信息后,可以通过设置solr中schema.xml 来对content字段进行存储和索引,content存放的是网页爬取下来的内容信息。如果通过设置,将scheme中定义的所有字段都进行存储和索引,那么nutch存储的数据是不是就没有用处可以删除了呢? 


对于获取到的数据,除了提供查询搜索功能外,还有很多值得挖掘的信息,那如何有效的对数据进行挖掘? mahout ?

大家对Nutch+hadoop+solr的行业应用前景如何看?







分享到:
评论

相关推荐

    网页库级垂直搜索引擎技术

    垂直搜索引擎的选型;网页库级垂直搜索引擎技术(二)如何做好一个垂直搜索引擎;信息抽取的资料文档

    垂直搜索引擎与旅游行业探讨借鉴.pdf

    垂直搜索引擎与旅游行业探讨借鉴.pdf

    基于Lucene_Heritrix的垂直搜索引擎的研究与应用

    探讨了Lucene和Heritrix在构建垂直搜索引擎中的应用。 1、垂直搜索引擎的基本介绍 2、基于Java 的全文检索引擎—Jakarta Lucene 3、网络爬虫Heritrix 4、Lucene和Heritrix在构建垂直搜索引擎中的应用(含代码) 5、...

    垂直搜索引擎赢利模式探讨

    垂直搜索引擎赢利模式探讨,不依赖网站访问量,利用所挖掘的行业信息的双向特性,通过信息 撮合和定向信息发送等手段来实现赢利。

    垂直搜索引擎应用中的若干策略探讨

    垂直搜索引擎应用中的若干策略探讨

    综合搜索引擎与垂直搜索引擎的比较研究

    搜索引擎是目前互联网信息服务的主要工具, 它...本文从信息服务的角度出发, 通过对综合搜索引擎与垂直搜索引擎在信息服 务各个要素方面的比较, 找出它们之间的竞争与合作的关系, 为当前的搜索引擎发展做出初步的 分析。

    垂直搜索引擎的设计与实现

    论文研究了搜索引擎的相关技术,通过分析基于查询串方式的搜索引擎和分类目录式搜索引擎的整体结构,设计了垂直搜索引擎的系统结构,并对其中涉及的关键技术:触b搜集器、信息抽取技术、中文分词和检索技术进行了深入...

    垂直搜索引擎聚焦爬虫技术研究

    介绍了一种垂直搜索引擎的爬虫设计方案,这是主题搜索引擎的核心部分。

    SOPI垂直搜索引擎系统 V2.2

    自动生成对网站的配置,提高工作效率及降低工作难度,垂直搜索引擎对不同网站进行不同配置是必然的,本系统应用自动化技术将人工工作降到最低,将工作人员的技术要求降至最低。 可以从多个界而采集信息,系统进行...

    垂直搜索引擎研究

    基于lucene的垂直搜索引擎研究,开题报告

    垂直搜索引擎系统

    DDH垂直搜索引擎系统是一个Java实现的垂直搜索引擎系统,是一套整合了Nutch/UCI/SOLR的网络信息整合系统。借助DDH你可以快速构建多领域的垂直搜索引擎系统。目前DDH整合了Nutch2.2.1+UCI1.0+SOLR4。

    HiGo垂直搜索引擎系统 v7.3.rar

    HiGo垂直搜索引擎开源版系统需要独立服务器支持,也可以用你本地电脑做服务器来调试,基于lucence mysql asp.net,支持数据索引,中文分词,模糊查询,爬虫采集,精确采集规则模式和模糊采集规则模式相混合(模糊采集...

    垂直搜索引擎网络爬虫的研究与实现.pdf

    垂直搜索引擎网络爬虫的研究与实现.pdf垂直搜索引擎网络爬虫的研究与实现.pdf垂直搜索引擎网络爬虫的研究与实现.pdf垂直搜索引擎网络爬虫的研究与实现.pdf

    垂直搜索引擎源代码

    垂直搜索引擎,自带爬虫,sql2008数据库,并发高,处理速度快,有web页面查询。dell 1950 可以每秒处理10g的查询,支持上亿的数据。

    搜索引擎-垂直搜索引擎关键技术研究.pdf

    搜索引擎-垂直搜索引擎关键技术研究.pdf

    垂直搜索引擎完全开源版 c#开发基于Lucene.net 带效果预览图片

    垂直搜索引擎完全开源版 c#开发基于Lucene.net 1.前台结合Lucene的搜索引擎功能,使得数据搜索更快; 2.新增加采集功能,采集时图片下载,flash下载功能,默认配置的是南海网分类信息的采集规则; 3.该代码简洁,...

    横瓜垂直搜索引擎V3.2-横瓜Windows平台的垂直搜索引擎

    横瓜垂直搜索引擎,是Windows平台的垂直搜索引擎(不提供网络爬虫),最大可容量6000万条记录。 对于100万条记录规模的数据库,可在2分钟内完成所有架构工作。横瓜垂直搜索引擎分词速度约为 2500万字/分钟,约占99.984...

    垂直搜索引擎完全开源版

    网博垂直搜索引擎完全开源版 1.前台结合Lucene的搜索引擎功能,使得数据搜索更快; 2.新增加采集功能,采集时图片下载,flash下载功能,默认配置的是南海网分类信息的采集规则; 3.该代码简洁,完全开源,可以与...

    基于Java的垂直搜索引擎的设计与实现.pdf

    基于Java的垂直搜索引擎的设计与实现.pdf基于Java的垂直搜索引擎的设计与实现.pdf基于Java的垂直搜索引擎的设计与实现.pdf基于Java的垂直搜索引擎的设计与实现.pdf

    垂直搜索引擎研究 pdf

    垂直搜索引擎研究垂直搜索引擎研究垂直搜索引擎研究垂直搜索引擎研究

Global site tag (gtag.js) - Google Analytics