`

HTMLParser 解析html字符串,提取纯文本

阅读更多

今天在群里问别人怎么提取文本,也没有具体告诉我用什么,只是说用htmlParser就可提取,查了查API,发现有个类很不错,两句话搞定哈。

 

 import org.htmlparser.Parser;
import org.htmlparser.visitors.TextExtractingVisitor;

public class Test {
 public static void main(String[] args) throws Exception {

String sss = "<div class='title'>商品详细说明:</div><p style='word-break: break-all'>ESTEE LAUDER     Perfectly Clean Splash Away Foaming Cleanser<br />为中性/混合性肌肤度身订制的清洁产品。 <br />";
  Parser parser = new Parser(sss);
  TextExtractingVisitor visitor = new TextExtractingVisitor();
  parser.visitAllNodesWith(visitor);
  System.out.println(visitor.getExtractedText());

 }
}

 

如果解析出现问题,可以在文件之间加入div标签。如:<div>+sss+</div>

根据测试,此方式必须得有div标签才不会报错,可以先添加然后解析的时候自动就没了。

 

大家还有其它方式解析,可以一起讨论:

 

具体可参考:www.gegeyigui.com 就有相关应用。

分享到:
评论
3 楼 liuxinglanyue 2010-11-17  
正好用到了,谢谢了。
2 楼 yangfuchao418 2010-09-26  
Jsoup.parse(html).text()
1 楼 marc0658 2010-06-18  

这么好的文章居然没人说两句?????
好文章在些沉寂真是。。。。。唉,,说什么好呢。。找了大半天了。。。

相关推荐

Global site tag (gtag.js) - Google Analytics