Chinaunix首页 | 论坛 | 博客
  • 博客访问: 1967047
  • 博文数量: 606
  • 博客积分: 9991
  • 博客等级: 中将
  • 技术积分: 5725
  • 用 户 组: 普通用户
  • 注册时间: 2008-07-17 19:07
文章分类

全部博文(606)

文章存档

2011年(10)

2010年(67)

2009年(155)

2008年(386)

分类:

2008-12-19 16:49:40

nutch通过相关词进行搜索网页的时候,会查询出这个关键词对应的相关信息..

比如:title,url,content等等.

通过URL我们可以链接到相关真实的URL.

而网页快照其实是nutch在索引时,索引以前网页的内容.

所有当点击网页快照时,我们根据索引文档的ID,去索引出原网页内容.

 Hit hit = new Hit(getIndexNo,getIndexDocNo);
 HitDetails details = bean.getDetails(hit);
 String content = new String(bean.getContent(details)); 

nutch 网页快照的中文问题

tomcat下的ROOT目录(nutch所在的目录)
修改cached.jsp,把
***
else
content = new String( bean.getContent(details) );
改成
content = new String( bean.getContent(details) ,"utf-8");
就ok了 

阅读(1844) | 评论(0) | 转发(0) |
给主人留下些什么吧!~~