前言

更多内容,请访问我的 个人博客。

前言

全网找了一番,用python创建和更新word(.docx)文档,还是 python-docx 包比较好用。

依赖Python 2.6, 2.7, 3.3, or 3.4

lxml >= 2.3.2

安装模块由于 python-docx 已经提交给 PyPI 仓库,所以可以使用 pip 安装,如下: pip install python-docx

如果同时安装了 python2 和 python3 那么 pip 可能不能用,可以使用 pip3 来安装,如下: pip3 install python-docx

python-docx 也可以使用 easy_install 来安装,如下:easy_install python-docx

如果不能使用 pip 和 easy_install ,可以在 PyPI 下载包、解压、运行 setup.py ,如下: tar xvzf python-docx-{version}.tar.gz cd python-docx-{version} python setup.py install python-docx 还依赖 lxml 包 ,使用前2种方法会自动安装所需依赖包,第三种方法需要自己手动安装。

处理word文档

新建文档类

首先新建一个空白文档类 Document ,如下:

from docx import Document

document = Document()

编辑已存在的word文档

python-docx 不仅可以创建word文档,还可以编辑已存在的word文档。

其实吧,这玩意儿只能编辑已存在的word文档,之所以有个“创建空白文档”的功能,只不过是拷贝一份空白word文档到工作区间,再在空白文档上编辑,看起来似乎是“创建空白文档”罢了。本质上还是编辑已存在的word文档,捂脸中...

打开一个word文档,编辑完后,一定要记得保存。如果保存文件名和原文件名不一样,则会另存为一份word文档;若文件名一样,则会不加提示的保存修改内容。如下:

from docx import Document

document = Document('existing-document-file.docx')

document.save('new-file-name.docx')

新增段落

在word中 段落 是最常见的,创建段落 paragraph 的操作如下:

paragraph = document.add_paragraph('这是个段落。')

在此段落之前插入一个段落,如下:

prior_paragraph = paragraph.insert_paragraph_before('这是前面的段落。')

新增标题

新增标题代码如下:

document.add_heading('这是个标题')

修改标题大小,有1-9种规格,如下:

document.add_heading('The role of dolphins', level=2)

如果使用 level=0 ,则会新增一个带有下划线样式的标题。

新增分页符

代码如下:

document.add_page_break()

新增表格

创建一个2行2列的表格 Table,如下:

table = document.add_table(rows=2, cols=2)

获取第一行第二列的单元格类,如下:

cell = table.cell(0, 1)

写入数据,如下:

cell.text = '这是第一行第二列的单元格'

不仅如此,还能以数组的形式获取整个行或列,如下:

row = table.rows[1]

row.cells[0].text = '第二行第一列'

row.cells[1].text = '第二行第二列'

或循环操作,如下:

for row in table.rows:

for cell in row.cells:

print(cell.text)

用 len() 方法获取行数或列数,如下:

row_count = len(table.rows)

col_count = len(table.columns)

增加行,如下:

row = table.add_row()

设置表格样式,如下:

table.style = 'LightShading-Accent1'

插入图片

插入本地图片,如下:

document.add_picture('demo.png')

默认情况下,图片大小往往不尽如人意,调整图片大小,如下:

from docx.shared import Inches

document.add_picture('demo.png', width=Inches(1.0), height=Inches(1.0))

若同时定义宽度和高度,则图片会被拉伸或压缩到指定大小;若仅定义宽度或高度,则图会自适应调整大小。所以,建议仅定义宽度即可。

段落操作

设置段落样式

设置段落样式,如下:

document.add_paragraph('这是一个样式为 ListBullet 的段落', style='ListBullet')

paragraph = document.add_paragraph('这是一个样式为 ListBullet 的段落')

paragraph.style = 'List Bullet'

设置段落对齐方式

段落对齐方式有 左对齐 、 文字居中 、 右对齐 、 文本两端对齐等,更多对齐方式请移步 WD_ALIGN_PARAGRAPH

from docx.enum.text import WD_ALIGN_PARAGRAPH

# LEFT => 左对齐

# CENTER => 文字居中

# RIGHT => 右对齐

# JUSTIFY => 文本两端对齐

paragraph = document.add_paragraph("你说啥")

paragraph_format = paragraph.paragraph_format

paragraph_format.alignment = WD_ALIGN_PARAGRAPH.CENTER

设置段落缩进

设置段落缩进,可为负值,如下:

from docx.shared import Inches

paragraph = document.add_paragraph("你说啥")

paragraph_format = paragraph.paragraph_format

paragraph_format.left_indent = Inches(0.5)

也可以设置首行缩进,如下:

paragraph_format.first_line_indent = Inches(-0.25)

设置段落制表符

设置段落间距

分为 段前 和 段后 ,设置值用 Pt 单位是 磅 ,如下:

paragraph_format.space_before = Pt(18)

paragraph_format.space_after = Pt(12)

设置段落行距

当行距为 最小值 和 固定值 时,设置值单位为 磅 ,需要用 Pt ;当行距为 多倍行距 时,设置值为数值,如下:

from docx.shared import Length

#SINGLE => 单倍行距(默认)

#ONE_POINT_FIVE => 1.5倍行距

#DOUBLE2 => 倍行距

#AT_LEAST => 最小值

#EXACTLY => 固定值

#MULTIPLE => 多倍行距

paragraph.line_spacing_rule = WD_LINE_SPACING.EXACTLY #固定值

paragraph_format.line_spacing = Pt(18) # 固定值18磅

paragraph.line_spacing_rule = WD_LINE_SPACING.MULTIPLE #多倍行距

paragraph_format.line_spacing = 1.75 # 1.75倍行间距

设置段落分页孤行控制

防止在页面顶端单独打印段落末行或在页面底端单独打印段落首行。

与下段同页

防止在选中段落与后面一段间插入分页符。

段中不分页

防止在段落中出现分页符。

段前分页

在选中段落前插入分页符。

#widow_control => 孤行控制

#keep_with_next => 与下段同页

#page_break_before => 段前分页

#keep_together => 段中不分页

paragraph_format.keep_with_next = True

字体操作

设置粗体和斜体

在设置粗体和斜体之前,我们先简单了解一下 段落 里的运行机制。段落包含很多块级的格式,比如缩进、行高、制表符等。每一个小片段叫做一个 run ,可以对 run 设置粗体和斜体等属性。

我们可以设置如下:

paragraph = document.add_paragraph()

paragraph.add_run('这是一个带有')

paragraph.add_run('粗体').bold = True

paragraph.add_run('和')

paragraph.add_run('斜体').italic = True

paragraph.add_run('的段落。')

设置字体属性

对 run 设置字体、大小、颜色下划线等,更多属性请移步 Font ,如下:

from docx.shared import RGBColor,Pt

#all_caps => 全部大写字母

#bold => 加粗

#color => 字体颜色

#complex_script => 是否为“复杂代码”

#cs_bold => “复杂代码”加粗

#cs_italic => “复杂代码”斜体

#double_strike => 双删除线

#emboss => 文本以凸出页面的方式出现

#hidden => 隐藏

#imprint => 印记

#italic => 斜体

#name => 字体

#no_proof => 不验证语法错误

#outline => 显示字符的轮廓

#shadow => 阴影

#small_caps => 小型大写字母

#snap_to_grid => 定义文档网格时对齐网络

#strike => 删除线

#subscript => 下标

#superscript => 上标

#underline => 下划线

paragraph = document.add_paragraph()

paragraph.add_run('这是一个带有')

paragraph.add_run('颜色').font.color.rgb = RGBColor(54, 95, 145)

paragraph.add_run('的')

paragraph.add_run('大字').font.size = Pt(36) # 字体大小设置,和word里面的字号相对应

设置字符样式

除了设置段落样式外,还可以设置一组字符样式,比如字体、大小、颜色、粗体、斜体等,如下:

# 自定义样式 Emphasis

paragraph = document.add_paragraph('这是一个带有')

paragraph.add_run('自定义样式', 'Emphasis')

paragraph.add_run('的段落')

paragraph = document.add_paragraph('这是一个带有 ')

run = paragraph.add_run('自定义样式')

run.style = 'Emphasis'

paragraph.add_run('的段落')

页眉和页脚

枚举的文档

名称解释

更多编程教学请关注公众号:潘高陪你学编程

python处理word_python-docx处理word文档相关推荐

  1. 【Python】导出docx格式Word文档中的文本、图片和附件等

    [Python]导出docx格式Word文档中的文本.图片和附件等 零.需求 为批量批改学生在机房提交的实验报告,我需要对所有的实验文档内容进行处理.需要批量提取Word文档中的图片和附件以便进一步检 ...

  2. Python批量提取docx格式Word文档中所有批注

    封面图片:<Python程序设计基础与应用>(ISBN:9787111606178),董付国,机械工业出版社 图书详情: 用书教师可以联系董老师获取教学大纲.课件.源码.教案.考试系统等配 ...

  3. Python批量提取docx格式Word文档中所有文本框内的文本

    功能描述: 批量提取指定Word文档(docx格式)中所有文本框中的文本. 测试文件: 参考代码: 执行结果:

  4. python-docx中文开发文档_使用Python语言-docx生成Word文档

    本文主要向大家介绍了使用Python语言-docx生成Word文档,通过具体的内容向大家展示,希望对大家学习Python语言有所帮助. < 学会来使用python操作数据表和PDF,今天我们尝试 ...

  5. python word排版_使用Python通过win32 COM实现Word文档的写入与保存方法

    通过win32 COM接口实现软件的操作本质上来看跟直接操作软件一致,这跟我之前经常用的通过各种扩展的组件或者库实现各种文件的处理有较大的差异.如果有过Windows下使用Word的经历,那么使用wi ...

  6. Word处理控件Aspose.Words功能演示:在 Python 中比较两个 Word 文档

    在各种情况下执行 Word 文档的比较以确定差异.各种在线工具允许您比较 Word 文档,但是,您可能需要在应用程序中实现比较功能.为实现它,本文展示了如何在 Python 中比较两个 Word 文档 ...

  7. Python 读取 PDF 信息插入 Word 文档

    Python 读取 PDF 信息插入 Word 文档 思路 PDFMiner模块 docx-mailmerge 模块 回顾 代码下载 Hello,上个周末没能搞事情,被一个代码需求给绊住了:朋友在平时 ...

  8. 如何将多个 Docx 格式 Word 文档批量转为 Doc 格式

    概要:前面我们介绍过常见的 Word 文档有多种格式,比如 Doc.Docx,并且详细介绍了如何批量将多个 Doc 格式的 Word 文档批量转为 Docx 格式文档,相信对大家都有一些的帮助.那 D ...

  9. C# DocX操作Word文档(.docx)

    using System; using System.Collections.Generic; using System.Linq; using System.Reflection; using Sy ...

  10. docx格式word文档打不开问题的解决

    注册表里"计算机\HKEY_CLASSES_ROOT.docx""的WPS.Docx.6改为Word.Document.12可以解决右键新建的docx格式word文档打不 ...

最新文章

  1. 现在python已经更新到哪个版本了-Python 3.8 已发布 你会升级么?
  2. javascript 中 split 函数分割字符串成数组
  3. boost::fusion::as_nview用法的测试程序
  4. ftp之高级配置——虚拟用户
  5. css两列等高,css 多列等高
  6. 报错curl: (7) Failed to connect to 127.0.0.1 port xxxx: Connection refused
  7. Vue 进阶系列(一)之响应式原理及实现
  8. android系统一直显示通知栏_Android8以上 显示通知栏简单实现
  9. 2016.7.15 NOIP2014模拟试题解题报告(又名:方克顺和他的正余弦朋友们(
  10. Android日志工具Log的使用
  11. 反插值法求函数方程的根(内附代码及例题)
  12. 硬盘的那些事(主分区、扩展分区、逻辑分区、活动分区、系统分区、启动分区、引导扇区、MBR等
  13. win10-11全版本下载地址MSDN纯净版ISO-20220217更新
  14. MIMIC-iv官方SQL查询标注(简单基础篇)
  15. 【PS功能学习】04:祖传抠图技法
  16. Dnguard旗舰版代加密加壳服务 20/次
  17. EduCoder Pandas高效化运算与时间序列处理 第3关:Pandas时间序列的高级应用
  18. InputStream读取数据
  19. 2023深圳大学计算机考研信息汇总
  20. 如何将Nginx的版本号隐藏

热门文章

  1. Spring爸爸又给Spring MVC生了个弟弟叫Spring WebFlux
  2. shell脚本移动文件
  3. 链家新房性能挑战赛小结
  4. 线性代数复习 第二章 矩阵
  5. 【Rust日报】 2019-05-01
  6. 如何录制电脑屏幕和声音?分享3个实用的方法,赶紧收藏
  7. IDEA构建VUE脚手架
  8. encode和decode
  9. npm小技巧: 安装指定的依赖版本
  10. python编程socket套接字常用属性