本月博客排行
年度博客排行
-
第1名
青否云后端云 -
第2名
zw7534313 -
第3名
大家都说我很棒 - wy_19921005
- liyihz2008
- gengyun12
- e_e
- luxurioust
- zysnba
- robotmen
- Alsmile
- gaozzsoft
- jywhltj
- cpongo1
- hbxflihua
- qepwqnp
- 解宜然
- gashero
- sichunli_030
- vipbooks
- fantaxy025025
- wallimn
- cuityang
- ssydxa219
- gdpglc
- javashop
- ranbuijj
- jickcai
- hanbaohong
- johnsmith9th
- appalese
- gaojingsong
- weiyides
- java-007
- zhangyi0618
- AVI
- 淡看人生
- laiyangdeli
- liunancun
- xpenxpen
- lemonhandsome
- 龙哥IT
- nychen2000
- ouanui
- conkeyn
- jveqi
- panshunchang
- tanling8334
- MagicLee
- wjianwei666
最新文章列表
Nutch源代码解读--2
Nutch0.9代码详细分析之2 主要分析网页爬取之后的页面处理
前一次主要介绍了Nutch爬取网页的流程,在爬取完网页后返回一个ProtocalOutput对象,对爬行回来的信息进行了封装,包括ProtocalStatus返回的HTTP状态码,Content网页的主体内容等信息信息。在Fetcher中,如果我们继续往下看,会看到nutch根据不同的ProtocalStatus返回的状 ...