百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

python-docx处理word文档(python如何处理word文档)

off999 2024-11-03 14:17 20 浏览 0 评论

前言

全网找了一番,用python创建和更新word(.docx)文档,还是 python-docx 包比较好用。

依赖

  • Python 2.6, 2.7, 3.3, or 3.4
  • lxml >= 2.3.2

安装模块

  • 由于 python-docx 已经提交给 PyPI 仓库,所以可以使用 pip 安装,如下:
pip install python-docx
如果同时安装了 python2 和 python3 那么 pip 可能不能用,可以使用 pip3 来安装,如下:1Copypip3 install python-docxCopy

如果同时安装了 python2python3 那么 pip 可能不能用,可以使用 pip3 来安装,如下:

pip3 install python-docx
  • python-docx 也可以使用 easy_install 来安装,如下:
easy_install python-docx
  • 如果不能使用 pipeasy_install ,可以在 PyPI 下载包、解压、运行 setup.py ,如下:
tar xvzf python-docx-{version}.tar.gz
cd python-docx-{version}
python setup.py install

python-docx 还依赖 lxml 包 ,使用前2种方法会自动安装所需依赖包,第三种方法需要自己手动安装。

处理word文档

新建文档类

首先新建一个空白文档类 Document ,如下:

from docx import Document

document = Document()

编辑已存在的word文档

python-docx 不仅可以创建word文档,还可以编辑已存在的word文档。
其实吧,这玩意儿只能编辑已存在的word文档,之所以有个“创建空白文档”的功能,只不过是拷贝一份空白word文档到工作区间,再在空白文档上编辑,看起来似乎是“创建空白文档”罢了。本质上还是编辑已存在的word文档,捂脸中…
打开一个word文档,编辑完后,一定要记得保存。如果保存文件名和原文件名不一样,则会另存为一份word文档;若文件名一样,则会不加提示的保存修改内容。如下:

from docx import Document

document = Document('existing-document-file.docx')
document.save('new-file-name.docx')

新增段落

在word中 段落 是最常见的,创建段落 paragraph 的操作如下:

paragraph = document.add_paragraph('这是个段落。')

在此段落之前插入一个段落,如下:

prior_paragraph = paragraph.insert_paragraph_before('这是前面的段落。')

新增标题

新增标题代码如下:

document.add_heading('这是个标题')

修改标题大小,有1-9种规格,如下:

document.add_heading('The role of dolphins', level=2)

如果使用 level=0 ,则会新增一个带有下划线样式的标题。

新增分页符

代码如下:

document.add_page_break()

新增表格

创建一个2行2列的表格 Table,如下:

table = document.add_table(rows=2, cols=2)

获取第一行第二列的单元格类,如下:

cell = table.cell(0, 1)

写入数据,如下:

cell.text = '这是第一行第二列的单元格'

不仅如此,还能以数组的形式获取整个行或列,如下:

row = table.rows[1]
row.cells[0].text = '第二行第一列'
row.cells[1].text = '第二行第二列'

或循环操作,如下:

for row in table.rows:
    for cell in row.cells:
        print(cell.text)

len() 方法获取行数或列数,如下:

row_count = len(table.rows)
col_count = len(table.columns)

增加行,如下:

row = table.add_row()

设置表格样式,如下:

table.style = 'LightShading-Accent1'

插入图片

插入本地图片,如下:

document.add_picture('demo.png')

默认情况下,图片大小往往不尽如人意,调整图片大小,如下:

from docx.shared import Inches

document.add_picture('demo.png', width=Inches(1.0), height=Inches(1.0))

若同时定义宽度和高度,则图片会被拉伸或压缩到指定大小;若仅定义宽度或高度,则图会自适应调整大小。所以,建议仅定义宽度即可。

段落操作

设置段落样式

设置段落样式,如下:

document.add_paragraph('这是一个样式为 ListBullet 的段落', style='ListBullet')

paragraph = document.add_paragraph('这是一个样式为 ListBullet 的段落')
paragraph.style = 'List Bullet'

设置段落对齐方式

段落对齐方式有 左对齐文字居中右对齐文本两端对齐等,更多对齐方式请移步 WD_ALIGN_PARAGRAPH

from docx.enum.text import WD_ALIGN_PARAGRAPH

# LEFT      =>  左对齐
# CENTER    =>  文字居中
# RIGHT     =>  右对齐
# JUSTIFY   =>  文本两端对齐

paragraph = document.add_paragraph("你说啥")
paragraph_format = paragraph.paragraph_format
paragraph_format.alignment = WD_ALIGN_PARAGRAPH.CENTER

设置段落缩进

设置段落缩进,可为负值,如下:

from docx.shared import Inches

paragraph = document.add_paragraph("你说啥")
paragraph_format = paragraph.paragraph_format
paragraph_format.left_indent = Inches(0.5)

也可以设置首行缩进,如下:

paragraph_format.first_line_indent = Inches(-0.25)

设置段落制表符

详情请移步 TabStops

设置段落间距

分为 段前段后 ,设置值用 Pt 单位是 ,如下:

paragraph_format.space_before = Pt(18)
paragraph_format.space_after = Pt(12)

设置段落行距

当行距为 最小值固定值 时,设置值单位为 ,需要用 Pt ;当行距为 多倍行距 时,设置值为数值,如下:

from docx.shared import Length

#SINGLE         =>  单倍行距(默认)
#ONE_POINT_FIVE =>  1.5倍行距
#DOUBLE2        =>  倍行距
#AT_LEAST       =>  最小值
#EXACTLY        =>  固定值
#MULTIPLE       =>  多倍行距

paragraph.line_spacing_rule = WD_LINE_SPACING.EXACTLY #固定值
paragraph_format.line_spacing = Pt(18) # 固定值18磅
paragraph.line_spacing_rule = WD_LINE_SPACING.MULTIPLE #多倍行距
paragraph_format.line_spacing = 1.75 # 1.75倍行间距

设置段落分页

  • 孤行控制
    防止在页面顶端单独打印段落末行或在页面底端单独打印段落首行。
  • 与下段同页
    防止在选中段落与后面一段间插入分页符。
  • 段中不分页
    防止在段落中出现分页符。
  • 段前分页
    在选中段落前插入分页符。
#widow_control => 孤行控制
#keep_with_next => 与下段同页
#page_break_before => 段前分页
#keep_together => 段中不分页

paragraph_format.keep_with_next = True


字体操作

设置粗体和斜体

在设置粗体和斜体之前,我们先简单了解一下 段落 里的运行机制。段落包含很多块级的格式,比如缩进、行高、制表符等。每一个小片段叫做一个 run ,可以对 run 设置粗体和斜体等属性。
我们可以设置如下:

paragraph = document.add_paragraph()
paragraph.add_run('这是一个带有')
paragraph.add_run('粗体').bold = True
paragraph.add_run('和')
paragraph.add_run('斜体').italic = True
paragraph.add_run('的段落。')

设置字体属性

run 设置字体、大小、颜色下划线等,更多属性请移步 Font ,如下:

from docx.shared import RGBColor,Pt

# all_caps => 全部大写字母
# bold => 加粗
# color => 字体颜色
# complex_script => 是否为“复杂代码”
# cs_bold => “复杂代码”加粗
# cs_italic => “复杂代码”斜体
# double_strike => 双删除线
# emboss => 文本以凸出页面的方式出现
# hidden => 隐藏
# imprint => 印记
# italic => 斜体
# name => 字体
# no_proof => 不验证语法错误
# outline => 显示字符的轮廓
# shadow => 阴影
# small_caps => 小型大写字母
# snap_to_grid => 定义文档网格时对齐网络
# strike => 删除线
# subscript => 下标
# superscript => 上标
# underline => 下划线

paragraph = document.add_paragraph()
paragraph.add_run('这是一个带有')
paragraph.add_run('颜色').font.color.rgb = RGBColor(54, 95, 145)
paragraph.add_run('的')
paragraph.add_run('大字').font.size = Pt(36) # 字体大小设置,和word里面的字号相对应

设置字符样式

除了设置段落样式外,还可以设置一组字符样式,比如字体、大小、颜色、粗体、斜体等,如下:

# 自定义样式 Emphasis

paragraph = document.add_paragraph('这是一个带有')
paragraph.add_run('自定义样式', 'Emphasis')
paragraph.add_run('的段落')

paragraph = document.add_paragraph('这是一个带有 ')
run = paragraph.add_run('自定义样式')
run.style = 'Emphasis'
paragraph.add_run('的段落')

页眉和页脚

更多内容请移步 Working with Headers and Footers

枚举的文档

  • MSO_COLOR_TYPE
  • MSO_THEME_COLOR_INDEX
  • WD_PARAGRAPH_ALIGNMENT
  • WD_BUILTIN_STYLE
  • WD_CELL_VERTICAL_ALIGNMENT
  • WD_COLOR_INDEX
  • WD_LINE_SPACING
  • WD_ORIENTATION
  • WD_TABLE_ALIGNMENT
  • WD_ROW_HEIGHT_RULE
  • WD_SECTION_START
  • WD_STYLE_TYPE
  • WD_TAB_ALIGNMENT
  • WD_TAB_LEADER
  • WD_TABLE_DIRECTION
  • WD_UNDERLINE

相关推荐

大文件传不动?WinRAR/7-Zip 入门到高手,这 5 个技巧让你效率翻倍

“这200张照片怎么传给女儿?微信发不了,邮箱附件又超限……”62岁的张阿姨对着电脑犯愁时,儿子只用了3分钟就把照片压缩成一个文件,还教她:“以后用压缩软件,比打包行李还方便!”职场人更懂这...

电脑解压缩软件推荐——7-Zip:免费、高效、简洁的文件管理神器

在日常工作中,我们经常需要处理压缩文件。无论是下载软件包、接收文件,还是存储大量数据,压缩和解压缩文件都成为了我们日常操作的一部分。而说到压缩解压软件,7-Zip绝对是一个不可忽视的名字。今天,我就来...

设置了加密密码zip文件要如何打开?这几个方法可以试试~

Zip是一种常见的压缩格式文件,文件还可以设置密码保护。那设置了密码的Zip文件要如何打开呢?不清楚的小伙伴一起来看看吧。当我们知道密码想要打开带密码的Zip文件,我们需要用到适用于Zip格式的解压缩...

大文件想要传输成功,怎么把ZIP文件分卷压缩

不知道各位小伙伴有没有这样的烦恼,发送很大很大的压缩包会受到限制,为此,想要在压缩过程中将文件拆分为几个压缩包并且同时为所有压缩包设置加密应该如何设置?方法一:使用7-Zip免费且强大的文件管理工具7...

高效处理 RAR 分卷压缩包:合并解压操作全攻略

在文件传输和存储过程中,当遇到大文件时,我们常常会使用分卷压缩的方式将其拆分成多个较小的压缩包,方便存储和传输。RAR作为一种常见的压缩格式,分卷压缩包的使用频率也很高。但很多人在拿到RAR分卷...

2个方法教你如何删除ZIP压缩包密码

zip压缩包设置了加密密码,每次解压文件都需要输入密码才能够顺利解压出文件,当压缩包文件不再需要加密的时候,大家肯定想删除压缩包密码,或是忘记了压缩包密码,想要通过删除操作将压缩包密码删除,就能够顺利...

速转!漏洞预警丨压缩软件Winrar目录穿越漏洞

WinRAR是一款功能强大的压缩包管理器,它是档案工具RAR在Windows环境下的图形界面。该软件可用于备份数据,缩减电子邮件附件的大小,解压缩从Internet上下载的RAR、ZIP及其它类...

文件解压方法和工具分享_文件解压工具下载

压缩文件减少文件大小,降低文件失效的概率,总得来说好处很多。所以很多文件我们下载下来都是压缩软件,很多小伙伴不知道怎么解压,或者不知道什么工具更好,所以今天做了文件解压方法和工具的分享给大家。一、解压...

[python]《Python编程快速上手:让繁琐工作自动化》学习笔记3

1.组织文件笔记(第9章)(代码下载)1.1文件与文件路径通过importshutil调用shutil模块操作目录,shutil模块能够在Python程序中实现文件复制、移动、改名和删除;同时...

Python内置tarfile模块:读写 tar 归档文件详解

一、学习目标1.1学习目标掌握Python内置模块tarfile的核心功能,包括:理解tar归档文件的原理与常见压缩格式(gzip/bz2/lzma)掌握tar文件的读写操作(创建、解压、查看、过滤...

使用python展开tar包_python拓展

类Unix的系统,打包文件经常使用的就是tar包,结合zip工具,可以方便的打包并解压。在python的标准库里面有tarfile库,可以方便实现生成了展开tar包。使用这个库最大的好处,可能就在于不...

银狐钓鱼再升级:白文件脚本化实现GO语言后门持久驻留

近期,火绒威胁情报中心监测到一批相对更为活跃的“银狐”系列变种木马。火绒安全工程师第一时间获取样本并进行分析。分析发现,该样本通过阿里云存储桶下发恶意文件,采用AppDomainManager进行白利...

ZIP文件怎么打开?2个简单方法教你轻松搞定!

在日常工作和生活中,我们经常会遇到各种压缩文件,其中最常见的格式之一就是ZIP。ZIP文件通过压缩数据来减少文件大小,方便我们进行存储和传输。然而,对于初学者来说,如何打开ZIP文件可能会成为一个小小...

Ubuntu—解压多个zip压缩文件.zip .z01 .z02

方法将所有zip文件放在同一目录中:zip_file.z01,zip_file.z02,zip_file.z03,...,zip_file.zip。在Zip3.0版本及以上,使用下列命令:将所有zi...

如何使用7-Zip对文件进行加密压缩

7-Zip是一款开源的文件归档工具,支持多种压缩格式,并提供了对压缩文件进行加密的功能。使用7-Zip可以轻松创建和解压.7z、.zip等格式的压缩文件,并且可以通过设置密码来保护压缩包中的...

取消回复欢迎 发表评论: