HTML and URL Parser -

vergilwang

浏览: 125074 次
性别:
来自: 北京

最近访客更多访客>>

iris19860111

u_lama

KEYS123456789

2644781824

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

HTML and URL Parser

博客分类：

HTML
Crawler

HTMLParser是python用来解析html的模块。它可以分析出html里面的标签、数据等等，是一种处理html的简便途径。HTMLParser采用的是一种事件驱动的模式，当HTMLParser找到一个特定的标记时，它会去调用一个用户定义的函数，以此来通知程序处理。它主要的用户回调函数的命名都是以handler_开头的，都是HTMLParser的成员函数。当我们使用时，就从HTMLParser派生出新的类，然后重新定义这几个以handler_开头的函数即可。这几个函数包括：
handle_startendtag 处理开始标签和结束标签
handle_starttag 处理开始标签，比如<xx>
handle_endtag 处理结束标签，比如</xx>
handle_charref 处理特殊字符串，就是以&#开头的，一般是内码表示的字符
handle_entityref 处理一些特殊字符，以&开头的，比如  
handle_data 处理数据，就是<xx>data</xx>中间的那些数据
handle_comment 处理注释
handle_decl 处理<!开头的，比如<!DOCTYPE html PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN"
handle_pi 处理形如<?instruction>的东西
这里我以从网页中获取到url为例，介绍一下。要想获取到url，肯定是要分析<a>标签，然后取到它的href属性的值。下面是代码：

#-*-encoding:gb2312-*-
importHTMLParser

classMyParser(HTMLParser.HTMLParser):
def__init__(self):
HTMLParser.HTMLParser.__init__(self)

defhandle_starttag(self,tag,attrs):
#这里重新定义了处理开始标签的函数
iftag=='a':
#判断标签<a>的属性
forname,valueinattrs:
ifname=='href':
printvalue

if__name__=='__main__':
a='<html><head><title>test</title><body><ahref="http://www.163.com">链接到163</a></body></html>'

my=MyParser()
#传入要分析的数据，是html的。
my.feed(a)

分享到：

Crawler Index Page | sgmllib Introduction

2012-08-10 17:21
浏览 310
评论(0)
分类:开源软件
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

HTML and URL Parser

评论

发表评论

相关推荐

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

HTML and URL Parser

评论

发表评论

相关推荐

python crawler(1)

python crawler(2)

python spider code

python 爬虫抓站

scapy递归爬

scapy安装and简介

抓取网页并解析HTML

sgmllib Introduction

Crawler Index Page

Larbin 安装遇到的问题（fedora）

Larbin的使用

Larbin使用方法2

Customization larbin

使用python 提取html文件中的特定数据

用span实现空格的精确设定 空格

{HTML5}JQueryMobile页面跳转参数的传递解决方案

最近访客更多访客>>

用span实现空格的精确设定空格