百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

用python5分钟搞定精美的PDF文档(python pdfkit)

off999 2024-09-21 20:58 46 浏览 0 评论


介绍

Pandas非常善于处理大量数据并在多个文本和可视化表示中对其进行汇总。支持输出到CSV,Excel,HTML,json等。如果想将多个数据组合到一个文档中,那么会有点困难。例如,如果要在一个Excel工作表上放置两个DataFrame,则需要使用Excel库手动构建输出。

本文将介绍如何将多条信息组合成一个HTML模板,然后使用和将其转换为精美的PDF文档。

下面看看生成的PDF效果吧:

过程

使用Pandas将数据输出到Excel文件中的多个工作表或从pandas DataFrames创建多个Excel文件非常方便。但是,如果您想将多个信息组合到一个文件中,那么直接从Pandas完成它的方法并不多。幸运的是,python有很多工具可以办到。

在本文中,将使用通过以下流程来创建多页PDF 文档。

这种方法的好处在于您可以将自己的工具替换为此工作流程。如果您想在HTML之外使用其他类型的标记,请选择Jinja。

工具

首先,使用HTML作为模板语言,因为它可能是生成结构化数据并允许相对丰富的格式化的最简单方法。每个人都知道(或可以弄清楚)足够的HTML来生成一个简单的报告。最困难的部分是弄清楚如何将HTML呈现为PDF。选择了WeasyPrint,相对而言是最佳解决方案,因为它仍在积极维护,可以相对容易地使用它。另外效果也很好。遗憾的是,此时文档有点缺乏,确实可以从HTML生成PDF。

数据

下面是导入数据并生成数据透视表以及CPU和软件销售的平均数量和价格的一些汇总统计数据。

导入模块,并读入销售渠道信息。

from __future__ import print_function
import pandas as pd
import numpy as np
df = pd.read_excel("sales-funnel.xlsx")
df.head()

透视数据进行总结。

sales_report = pd.pivot_table(df, index=["Manager", "Rep", "Product"], values=["Price", "Quantity"],
 aggfunc=[np.sum, np.mean], fill_value=0)
sales_report.head()

生成有关整个数据集的一些总体描述性统计信息。在这种情况下,我们希望显示CPU和软件销售的平均数量和价格。

print(df[df["Product"]=="CPU"]["Quantity"].mean())
print(df[df["Product"]=="CPU"]["Price"].mean())
print(df[df["Product"]=="Software"]["Quantity"].mean())
print(df[df["Product"]=="Software"]["Price"].mean())
1.88888888889
51666.6666667
1.0
10000.0

理想情况下,现在要做的是通过经理分组汇总数据,并在页面上包含一些摘要统计数据,以帮助理解单个结果与全国平均值的比较。

DataFrame选项

幸运的是,DataFrame有一个 to_clipboard() 将整个DataFrame复制到剪贴板的功能,然后您可以轻松地将其粘贴到Excel中。

稍后将在模板中使用的另一个选项是 to_html() 生成包含一个应用了最小样式的完全组合的HTML表。

模板

Jinja模板功能非常强大,支持许多高级功能,例如沙盒执行和自动转义,这些都不是此应用程序所必需的。但是,随着您的报告变得越来越复杂或您选择将Jinja用于您的网络应用,这些功能将为您提供良好的服务。

Jinja的另一个不错的功能是它包含多个 ,这些允许我们以Pandas中难以做到的方式格式化我们的一些数据。

为了在应用程序中使用Jinja,需要做三件事:

· 创建一个模板

· 将变量添加到模板上下文中

· 将模板渲染为HTML

这是一个非常简单的模板,称之为myreport.html :

<!DOCTYPE html> 
< html > 
< head lang = "en" > 
 < meta charset = "UTF-8" > 
 < title > {{title}} </ title > 
</ head > 
< body > 
 < h2 >销售漏斗报告 - 国家</ h2 >
 {{national_pivot_table}}
</ body > 
</ html >

这段代码的两个关键部分是 {{ title }} 和 {{ national_pivot_table }} 。它们本质上是我们在呈现文档时将提供的变量的占位符。

要填充这些变量,需要创建一个Jinja环境并读取模板:

from jinja2 import Environment, FileSystemLoader
env = Environment(loader=FileSystemLoader('.'))
template = env.get_template("myreport.html")

在上面的示例中,假设模板位于当前目录中。

另一个关键组件是创建 env 。这个变量是我们将内容传递给模板的方式。我们创建一个名为的字典template_var ,其中包含我们想要传递给模板的所有变量。

请注意变量的名称如何与模板匹配。

template_vars = {"title" : "Sales Funnel Report - National",
 "national_pivot_table": sales_report.to_html()}

最后一步是使用输出中包含的变量呈现HTML。这将创建一个我们最终将传递给PDF创建引擎的字符串。

html_out = template.render(template_vars)

为简洁起见,我不会显示完整的HTML,但您应该明白这一点。

生成PDF

该PDF创建部分比较简单为好。我们需要进行一些导入并将字符串传递给PDF 生成器。

from weasyprint import HTML
HTML(string=html_out).write_pdf("report.pdf")

此命令创建一个类似于以下内容的PDF报告:

啊。很酷,它是一个PDF,但它很难看。主要问题是没有加入任何css样式。

对于本文的其余部分,将使用blue print的作为的style.css的基础,如下所示。这个CSS的是:

· 它相对较小且易于理解

· 它可以在PDF引擎中运行而不会抛出错误和警告

· 它包括看起来相当不错的基本表格式

让我们尝试使用我们更新的样式表重新渲染它:

HTML(string=html_out).write_pdf(args.outfile.name, stylesheets=["style.css"])

只需添加一个简单的样式表就会产生巨大的差异!

更复杂的模板

为了生成更有用的报告,将结合上面显示的摘要统计信息以及分析报告,以便为每个经理包含一个自己单独的PDF页面。

让我们从更新的模板(myreport.html)开始:

<!DOCTYPE html> 
< html > 
< head lang = "en" > 
 < meta charset = "UTF-8" > 
 < title > {{title}} </ title > 
</ head > 
< body > 
< div class = "容器" > 
 < h2 >销售漏斗报告 - 国家</ h2 >
 {{national_pivot_table}}
 {%include"summary.html"%}
</ div > 
< div class = "container" >
 {%为经理在Manager_Detail%}
 < p style = "page-break-before:always" > </ p > 
 < h2 >销售渠道报告 - {{manager.0}} </ h2 >
 {{manager.1}}
 {%include"summary.html"%}
 {%endfor%}
</ div > 
</ body > 
</ html >

你会注意到的第一件事是有一个 include 声明提到了另一个文件。这 include 允许引入一段HTML并在代码的不同部分中重复使用它。在这种情况下,摘要包含希望包含在每个报告中的一些简单的国家级统计数据,以便管理人员可以将其绩效与全国平均水平进行比较。

这是summary.html的样子:

< h3 >国家概要:CPU </ h3 > 
 < ul > 
 < li >平均数量:{{CPU.0 | round(1)}} </ li > 
 < li >平均价格:{{CPU.1 | round( 1)}} </ li > 
 </ ul > 
< h3 >国家摘要:软件</ h3 > 
 < ul > 
 < li >平均数量:{{Software.0 | round(1)}} </ li > 
 < li >平均价格:{{Software.1 | round(1)}} </ li > 
 </ ul >

在此代码段中,您将看到我们可以访问的其他变量: CPU 和 Software 。其中每个都是一个python列表,其中包括CPU和软件销售的平均数量和价格。

您可能还注意到我们使用管道 | 将 round 每个值用于1位小数。这是使用Jinja过滤器的一个具体示例。

还有一个for循环,允许我们在报告中显示每个经理的详细信息。Jinja的模板语言只包含一小部分改变控制流的代码。基本for循环几乎是任何模板的支柱,因此它们应该对大多数人有意义。

我想调出一段看起来有点不合适的最后一段代码:

< p style = "page-break-before:always" > </ p >

这是一个简单的CSS指令,我把它放在每个页面上以确保CSS中断。

额外的统计数据

现在已经完成了模板,这里是如何创建模板中使用的其他上下文变量。

这是一个简单的汇总函数:

def get_summary_stats(df,product):
 """
 For certain products we want National Summary level information on the reports
 Return a list of the average quantity and price
 """
 results = []
 results.append(df[df["Product"]==product]["Quantity"].mean())
 results.append(df[df["Product"]==product]["Price"].mean())
 return results

还需要创建经理详细信息:

manager_df = []
for manager in sales_report.index.get_level_values(0).unique():
 manager_df.append([manager, sales_report.xs(manager, level=0).to_html()])

最后,使用以下变量调用模板:

template_vars = {"title" : "National Sales Funnel Report",
 "CPU" : get_summary_stats(df, "CPU"),
 "Software": get_summary_stats(df, "Software"),
 "national_pivot_table": sales_report.to_html(),
 "Manager_Detail": manager_df}
# Render our file and create the PDF using our css style file
html_out = template.render(template_vars)
HTML(string=html_out).write_pdf("report.pdf",stylesheets=["style.css"])

让python改变生活!如果满意上面的生成PDF讲解,点赞和评论。

获取文中代码请微信关注 "python_dada"公众号,输入“精美PDF”获取。

相关推荐

hdd硬盘和ssd(ssd硬盘和hdd硬盘是什么意思)

HDD硬盘和SSD硬盘是两种不同类型的电脑存储设备,它们有着以下区别:1.工作原理:HDD硬盘使用机械旋转的磁盘和读写磁头来存储和读取数据,而SSD硬盘则使用闪存存储数据,类似于USB闪存盘。2....

电脑免费软件下载大全(电脑上免费的下载软件)

正常情况下,如果我们想要在自己的电脑上面下载一个不要钱的单机游戏,那么我们是可以直接在我们的软件管理中心进行一个下载的,这个时候我们只需要通过一个权限就能够正常的下载,当然我们也是可以在一些小游戏的软...

mpp文件转换excel(mpp转换成pdf)

要将Excel表格转换为MPP格式,您可以按照以下步骤操作:1.打开Excel表格并确保数据按照项目的不同阶段或任务进行组织。2.将Excel表格中的数据复制到一个新的MicrosoftProj...

win7旗舰版开机密码忘记按f2

方法如下:开始-控制面板-用户帐户;在打开的更改用户帐户界面点击要更改的帐户;然后点击帐户左面的更改密码按钮;在打开的页面上,输入一次当前使用的密码,输入2次要更改的新密码然后保存退出就可以了...

笔记本无音频输出设备(笔记本无音频输出设备)

1、没有声卡驱动,解决方法就是找到笔记本的官网,下载电脑声卡的驱动安装即可。2、没有外界的音频播放设备,解决方法就是买一个外界的音频播放设备插到电脑主机的音频接口上即可。笔记本电脑显示未安装任何音频输...

iso文件能用手机打开吗(iso文件能用手机打开吗安全吗)

一般的压缩软件就可以打开的,比如,好压软件,这个打开只是解压形式的,如果你说的是运行iso文件,这个没有,况且安卓系统也不支持iso运行ISO文件一般用于光盘镜像文件的存储,如果想要在手机上运行ISO...

win7系统卡顿怎么优化(win7很慢很卡怎么优化)

1、首先打开安全卫士,进入安全卫士首页,单击软件窗口右下角的“更多”图标,打开扩展应用程序。2、单击选择“我的工具”。3、在我的工具菜单里面找到“人工服务”单击打开人工服务。4、在人工服务对话框有很多...

如何查看c盘微信聊天记录(如何查看c盘微信聊天记录内存大小)

微信群中的消息只要没删除基本都能保存,想要找微信群中几个多月前的消息可以直接根据日期来查找聊天记录。操作如下:1、打开想要查找记录的微信群,点击右上角人形图标;2、点击查找聊天内容;3、选择按日...

office2016家庭版激活密钥(office家庭版激活码2019)

走淘宝吧,因为零售版的密钥只能用一次。大概几块钱就能激活2016。如果你不在乎钱的话可以向我一样,订阅一个office365.实在不行可以和几个人一起买一个家庭版的365.出现这个情况,找微软申诉是没...

移动硬盘驱动器下载安装(移动硬盘驱动器下载安装教程)

1、右键单击您的桌面,选择“新建文件夹”,并命名该文件夹(例如“usb驱动程序”);2、然后到本站下载驱动程序;3、将其解压缩至在您的桌面上刚刚创建的usb驱动程序文件夹;4、单击开始菜单,然后选择设...

电脑硬盘格式化工具(电脑 格式化硬盘)

硬盘格式化工具很多,PQMACGIG8.0(中文就叫硬盘分区魔法师)是比较好的一个,这个是在WINDOWS下比叫好用,(个人感觉)FDISK也是比较好的一个,这个一般用在DOS下分区格式化WIN...

photoshop是一款什么软件(ps指的是什么软件)

这个说法是错误的,ps软件“即:photoshop”是由美国著名的“adobe阿多比”公司出品的专业的图像处理软件,它不是由微软公司出品的软件。众所周知的是,微软公司以设计视窗操作系统名满全球,它出...

ipad越狱的好处与坏处(ipad越狱好不好)

  好处一:  1、重命名、重组应用程序  如果你看着Sparrow(iOS最优秀邮件客户端)这个名字不爽,越狱之后就可以改成“Email”,如果你觉得“豆瓣电台”这个名字不给力,那就改成“中央人民广...

win7光盘重装系统步骤图解(win7光盘如何重装系统)

1.确认您的电脑支持从光盘启动。如果支持,可以直接将Windows7安装光盘插入电脑的光驱中。 2.打开电脑,按下F2、F10、F12或Delete等键进入BIOS设置界面。 ...

电脑已联网却无法上网(电脑已经联网了但是不能上网)

电脑连上网后,仍可能存在无法上网的情况,这可能是由多种原因造成的。以下是一些可能的原因和解决方法:1.浏览器问题:有时候,浏览器可能会出现故障,导致无法正常访问网络。您可以尝试清除浏览器的缓存和co...

取消回复欢迎 发表评论: