`
234390216
  • 浏览: 10194154 次
  • 性别: Icon_minigender_1
  • 来自: 深圳
博客专栏
A5ee55b9-a463-3d09-9c78-0c0cf33198cd
Oracle基础
浏览量:460821
Ad26f909-6440-35a9-b4e9-9aea825bd38e
springMVC介绍
浏览量:1771877
Ce363057-ae4d-3ee1-bb46-e7b51a722a4b
Mybatis简介
浏览量:1395481
Bdeb91ad-cf8a-3fe9-942a-3710073b4000
Spring整合JMS
浏览量:393917
5cbbde67-7cd5-313c-95c2-4185389601e7
Ehcache简介
浏览量:678253
Cc1c0708-ccc2-3d20-ba47-d40e04440682
Cas简介
浏览量:529320
51592fc3-854c-34f4-9eff-cb82d993ab3a
Spring Securi...
浏览量:1178774
23e1c30e-ef8c-3702-aa3c-e83277ffca91
Spring基础知识
浏览量:462010
4af1c81c-eb9d-365f-b759-07685a32156e
Spring Aop介绍
浏览量:150169
2f926891-9e7a-3ce2-a074-3acb2aaf2584
JAXB简介
浏览量:66890
社区版块
存档分类
最新评论

使用POI转换word doc文件

    博客分类:
  • poi
阅读更多

使用POI转换word doc文件

目录

1       转换为Html文件

2       转换为Xml文件

3       转换为Text文件

 

       POI中还存在有针对于word doc文件进行格式转换的功能。我们可以将word的内容转换为对应的Html文件,也可以把它转换为底层用来描述doc文档的xml文件,还可以把它转换为底层用来描述doc文档的xml格式的text文件。这些格式转换都是通过AbstractWordConverter特定的子类来完成的。

 

1       转换为Html文件

       doc文档转换为对应的Html文档是通过WordToHtmlConverter类进行的。它会尽量的利用Html的方式来呈现原文档的样式。示例代码:

   /**
    * Word转换为Html
    * @throws Exception
    */
   @Test
   public void testWordToHtml() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToHtmlConverter converter = new WordToHtmlConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //对HWPFDocument进行转换
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.html"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
       transformer.setOutputProperty( OutputKeys.METHOD, "html" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }

2       转换为Xml文件

       doc文档转换为对应的Xml文件是通过WordToFoConverter类进行的。它可以把doc文档转换为底层用来描述doc文档的Xml文档。示例代码:

   /**
    * Word转Fo
    * @throws Exception
    */
   @Test
   public void testWordToFo() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToFoConverter converter = new WordToFoConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //对HWPFDocument进行转换
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.xml"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
//     transformer.setOutputProperty( OutputKeys.METHOD, "html" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }
 

 

3       转换为Text文件

       doc文档转换为text文档是通过WordToTextConverter来进行的。它可以把doc文档转换为底层用于描述doc文档的Xml格式的text文档。示例代码:

   /**
    * Word转换为Text
    * @throws Exception
    */
   @Test
   public void testWordToText() throws Exception {
      InputStream is = new FileInputStream("D:\\test.doc");
      HWPFDocument wordDocument = new HWPFDocument(is);
      WordToTextConverter converter = new WordToTextConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
      //对HWPFDocument进行转换
      converter.processDocument(wordDocument);
        Writer writer = new FileWriter(new File("D:\\converter.txt"));
       Transformer transformer = TransformerFactory.newInstance().newTransformer();
       transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
       //是否添加空格
        transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
       transformer.setOutputProperty( OutputKeys.METHOD, "text" );
       transformer.transform(
                   new DOMSource(converter.getDocument() ),
                   new StreamResult( writer ) );
   }

 

 

 (注:本文是基于poi3.9所写)

分享到:
评论
2 楼 zi_wu_xian 2016-08-19  
用POI读word文件还行,要是写文件还是别用poi,生成的文件格式不标准,用户都不能打开了。要是读取数据库中的数据填充到word模板动态生成word文件还是用PageOffice提供的接口比较好。www.zhuozhengsoft.com的下载中心就可以下载试用开发包,里面有demo
1 楼 pangpang514 2014-04-03  
转换为Text文件时,会将里边的标题中大写数字格式化为小写 如:
转换前:
二、 宣布。
三、 宣布。
四、 宣布。
五、 宣布。
六、 宣布。

转换后:
2 宣布。
3 宣布。
4 宣布。
5 宣布。
6 宣布。

相关推荐

Global site tag (gtag.js) - Google Analytics