目录

1       转换为Html文件

2       转换为Xml文件

3       转换为Text文件

在POI中还存在有针对于word doc文件进行格式转换的功能。我们可以将word的内容转换为对应的Html文件,也可以把它转换为底层用来描述doc文档的xml文件,还可以把它转换为底层用来描述doc文档的xml格式的text文件。这些格式转换都是通过AbstractWordConverter特定的子类来完成的。

1       转换为Html文件

将doc文档转换为对应的Html文档是通过WordToHtmlConverter类进行的。它会尽量的利用Html的方式来呈现原文档的样式。示例代码:

Java代码  
  1. /**
  2. * Word转换为Html
  3. * @throws Exception
  4. */
  5. @Test
  6. public void testWordToHtml() throws Exception {
  7. InputStream is = new FileInputStream("D:\\test.doc");
  8. HWPFDocument wordDocument = new HWPFDocument(is);
  9. WordToHtmlConverter converter = new WordToHtmlConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
  10. //对HWPFDocument进行转换
  11. converter.processDocument(wordDocument);
  12. Writer writer = new FileWriter(new File("D:\\converter.html"));
  13. Transformer transformer = TransformerFactory.newInstance().newTransformer();
  14. transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
  15. //是否添加空格
  16. transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
  17. transformer.setOutputProperty( OutputKeys.METHOD, "html" );
  18. transformer.transform(
  19. new DOMSource(converter.getDocument() ),
  20. new StreamResult( writer ) );
  21. }

2       转换为Xml文件

将doc文档转换为对应的Xml文件是通过WordToFoConverter类进行的。它可以把doc文档转换为底层用来描述doc文档的Xml文档。示例代码:

Java代码  
  1. /**
  2. * Word转Fo
  3. * @throws Exception
  4. */
  5. @Test
  6. public void testWordToFo() throws Exception {
  7. InputStream is = new FileInputStream("D:\\test.doc");
  8. HWPFDocument wordDocument = new HWPFDocument(is);
  9. WordToFoConverter converter = new WordToFoConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
  10. //对HWPFDocument进行转换
  11. converter.processDocument(wordDocument);
  12. Writer writer = new FileWriter(new File("D:\\converter.xml"));
  13. Transformer transformer = TransformerFactory.newInstance().newTransformer();
  14. transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
  15. //是否添加空格
  16. transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
  17. //     transformer.setOutputProperty( OutputKeys.METHOD, "html" );
  18. transformer.transform(
  19. new DOMSource(converter.getDocument() ),
  20. new StreamResult( writer ) );
  21. }

3       转换为Text文件

将doc文档转换为text文档是通过WordToTextConverter来进行的。它可以把doc文档转换为底层用于描述doc文档的Xml格式的text文档。示例代码:

Java代码  
  1. /**
  2. * Word转换为Text
  3. * @throws Exception
  4. */
  5. @Test
  6. public void testWordToText() throws Exception {
  7. InputStream is = new FileInputStream("D:\\test.doc");
  8. HWPFDocument wordDocument = new HWPFDocument(is);
  9. WordToTextConverter converter = new WordToTextConverter(DocumentBuilderFactory.newInstance().newDocumentBuilder().newDocument());
  10. //对HWPFDocument进行转换
  11. converter.processDocument(wordDocument);
  12. Writer writer = new FileWriter(new File("D:\\converter.txt"));
  13. Transformer transformer = TransformerFactory.newInstance().newTransformer();
  14. transformer.setOutputProperty( OutputKeys.ENCODING, "utf-8" );
  15. //是否添加空格
  16. transformer.setOutputProperty( OutputKeys.INDENT, "yes" );
  17. transformer.setOutputProperty( OutputKeys.METHOD, "text" );
  18. transformer.transform(
  19. new DOMSource(converter.getDocument() ),
  20. new StreamResult( writer ) );
  21. }

(注:本文是基于poi3.9所写)

转载于:https://www.cnblogs.com/telwanggs/p/4933059.html

使用POI转换word doc文件相关推荐

  1. html转换成word文档没有边框,解决 apache poi 转换 word(docx) 文件到 html 文件表格没边框的问题...

    1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 ${表格匹配信息} 30 31 32 33 ...

  2. 利用poi读取word模板文件生成新的word文档

    利用poi读取word模板文件生成新的word文档 利用poi读取word模板文件,并回填逻辑数据,生成并导出需要的word文档源码.解决模板读取异常问题,提供wordUtils工具类(各种功能实现) ...

  3. java word模板poi生成文件_利用poi读取word模板文件生成新的word文档

    利用poi读取word模板文件生成新的word文档 利用poi读取word模板文件,并回填逻辑数据,生成并导出需要的word文档源码.解决模板读取异常问题,提供wordUtils工具类(各种功能实现) ...

  4. 15个最好的PDF转word的在线转换器,将PDF文件转换成doc文件

    PDF是一种文件格式,包含文本,图像,数据等,这是独立于操作系统的文件类型.它是一个开放的标准,压缩,另一方面DOC文件和矢量图形是由微软文字处理文件.该文件格式将纯文本格式转换为格式化文档.它支持几 ...

  5. 使用POI 导出word模板文件

    maven依赖 <dependency><groupId>org.apache.poi</groupId><artifactId>poi</art ...

  6. 使用POI读写word docx文件

    目录 1     读docx文件 1.1     通过XWPFWordExtractor读 1.2     通过XWPFDocument读 2     写docx文件 2.1     直接通过XWPF ...

  7. docx poi 原理_使用POI读写word docx文件

    目录 1     读docx文件 1.1     通过XWPFWordExtractor读 1.2     通过XWPFDocument读 2     写docx文件 2.1     直接通过XWPF ...

  8. 转换word等文件为swf文件

    一.首先将word类文件转换为pdf格式文件 我这里使用的是PDFdoTool工具,支持多种文件转为pdf,这个工具应该很简单就可以下载到,这里就不贴下载方式了: 注意:转换word文件时,不要打开此 ...

  9. Word doc文件在未到英文单词末尾换行

    最近表妹遇到好几次这个问题,在查看doc文件的时候显示如下: 可以看到在每一行的末尾未到单词结束就随意换行了,这种问题一般是单词周围附近存在文档无法识别的特殊符号导致文档无法将单词有效分隔开导致的. ...

最新文章

  1. 刷前端面经笔记(十一)
  2. C# Post数据和接收简单示例【转】
  3. 深入理解softmax函数
  4. 探秘HDFS —— 发展历史、核心概念、架构、工作机制 (上)| 博文精选
  5. CSDN 请勿使用默认标题 解决方案
  6. javscript 创建类的三种方法【转】
  7. Android Sqlite3数据库操作
  8. liunx中查看安装软件和卸载软件和启动程序
  9. 宝塔控制面板忘记密码怎么找回?
  10. R语言smoothHR包_“统计学诺贝尔奖”授予R语言软件工程师
  11. 中国石油大学(北京)-《 公共社交礼仪 》-​​​​​​​第一阶段在线作业
  12. 大师放大师傅撒旦法的萨芬
  13. 移动端H5控制台调试(手机web页面控制台调试)
  14. tftp工作流程计算机网络,tftpd32使用方法,[转载]利用GhostSrv+Tftpd32网络克隆攻略
  15. 脑残的NODE_MODULE_VERSION,node冷眼看着electron
  16. OWASP ZAP 扫描漏洞误报分析
  17. 数据、数据元素、数据项和数据对象
  18. virtualenv虚拟环境中安装MySQL-python
  19. Java实习生也么找实习工作
  20. dns修改服务器端口号,域名解析服务器端口号设置多少

热门文章

  1. (85)Verilog HDL:板间信号同步
  2. (43)Verilog HDL 二分频设计
  3. oracle存储过程导出查询结果,ORACLE如何实现函数、包、存储过程的导入和导出
  4. 蓝桥杯单片机:模块代码
  5. STM32使用DMA发送串口数据
  6. Nginx基本数据结构之ngx_array_t
  7. 【重难点】【JVM 01】OOM 出现的原因、方法区、类加载机制、JVM 中的对象
  8. 二分法解决力扣374.猜数字大小 C语言
  9. Spring-第1天
  10. 第三天,编码设置,主键设置与删除,无关子查询,相关子查询,表与表之间的关系...