python编程实践:下载文件模块wget的使用
off999 2024-09-16 00:43 32 浏览 0 评论
wget是Linux中的一个下载文件的工具,是在Linux下开发的开放源代码的软件,后来被移植到包括Windows在内的各个平台上,也就是wget目前是跨平台的下载软件了。wget工具体积小但功能完善,它支持断点下载功能,同时支持http,https,ftp协议下载方式,支持http代理服务器和设置起来方便简单。
本教程,不是介绍wget软件的如何使用,而是介绍如何在 Python 中使用 wget 模块进行文件下载。通过使用 wget 库,我们可以轻松地从网络上下载各种文件,如文本、图像、视频、音频、压缩、grib2等文件,也就是说所有文件都能下载,当然需要服务器支持,服务器不支持下载的文件,你也下载不了。
网络上有wget模块的讲解,但是大多不系统、不全面。应粉丝的要求,本人通过网络搜索整理、查看源代码、加上自己的理解和实践,形成本教程。
一、安装wget模块
pip install wget目前wget的版本是3.2。
二、wget模块参数说明
wget.download(url, out=None, bar=bar_adaptive)- url:要下载的url。下载url到系统的临时目录中,然后从URL或HTTP headers自动检测文件名并命名,如果当前有相同的名字,则自动改名,添加“(1)(2)”等字符。
- out:输出文件名或目录
- bar:跟踪下载进度的函数(可视化等)
- return:返回url被下载到的文件名
三、下载文件
下载文件实例1:
url:是我随便在网上找的一个链接。它是一个压缩软件执行程序。
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = wget.download(url)
print(localfile) #win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe返回的是:win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528 1.exe,也就是下载的文件名。
下载文件实例2:
下载文件并保存在当前目录下。
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
wget.download(url,out=localfile)运行的效果下图所示。
它有一个默认的下载进度栏,非常直观和方便。
三、设置代理
有时,我们下载文件的过程中,需要用到http代理服务器来下载文件,这时怎么办,wget 模块也提供了相应的功能。这时我们可以使用 proxy参数来指定http代理服务器的地址。示例如下:
import wget
url = 'https://xxx.xxx.com/test.rar'
localfile = './test.rar'
proxy = 'http://proxy.xxx.xxx.com:20080'
wget.download(url, localfile, proxy=proxy)四、下载进度
翻看wget的源程序,bar_adaptive函数就是它下载文件的进度显示的函数。它有三个参数,current:当前已经下载文件的大小, total:文件的大小, width=80:显示字符的宽度。
这个例子我就不具体讲解了,有兴趣的可以仔细学习一下。
def bar_adaptive(current, total, width=80):
"""Return progress bar string for given values in one of three
styles depending on available width:
[.. ] downloaded / total
downloaded / total
[.. ]
if total value is unknown or <= 0, show bytes counter using two
adaptive styles:
%s / unknown
%s
if there is not enough space on the screen, do not display anything
returned string doesn't include control characters like \r used to
place cursor at the beginning of the line to erase previous content.
this function leaves one free character at the end of string to
avoid automatic linefeed on Windows.
"""
# process special case when total size is unknown and return immediately
if not total or total < 0:
msg = "%s / unknown" % current
if len(msg) < width: # leaves one character to avoid linefeed
return msg
if len("%s" % current) < width:
return "%s" % current
# --- adaptive layout algorithm ---
#
# [x] describe the format of the progress bar
# [x] describe min width for each data field
# [x] set priorities for each element
# [x] select elements to be shown
# [x] choose top priority element min_width < avail_width
# [x] lessen avail_width by value if min_width
# [x] exclude element from priority list and repeat
# 10% [.. ] 10/100
# pppp bbbbb sssssss
min_width = {
'percent': 4, # 100%
'bar': 3, # [.]
'size': len("%s" % total)*2 + 3, # 'xxxx / yyyy'
}
priority = ['percent', 'bar', 'size']
# select elements to show
selected = []
avail = width
for field in priority:
if min_width[field] < avail:
selected.append(field)
avail -= min_width[field]+1 # +1 is for separator or for reserved space at
# the end of line to avoid linefeed on Windows
# render
output = ''
for field in selected:
if field == 'percent':
# fixed size width for percentage
output += ('%s%%' % (100 * current // total)).rjust(min_width['percent'])
elif field == 'bar': # [. ]
# bar takes its min width + all available space
output += bar_thermometer(current, total, min_width['bar']+avail)
elif field == 'size':
# size field has a constant width (min == max)
output += ("%s / %s" % (current, total)).rjust(min_width['size'])
selected = selected[1:]
if selected:
output += ' ' # add field separator
return output下面我给出了三个小例子,希望给大家以启迪。
例子1,显示直接用sys.stdout.write,而且用了"\r"符号,只回车不换行。也就是从头开始显示,但不换新行。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def bar_progress(current, total, width=80):
progress_message = "Downloading: %d%% [%d / %d] bytes" % (current / total * 100, current, total)
# 不要使用print(),因为它显示,总是会另起新的一行显示。
sys.stdout.write("\r" + progress_message)
sys.stdout.flush()
wget.download(url,out=localfile,bar=bar_progress)运行效果如下:
例子2,和例子1类似,但是实现了下载的进度条。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def progress_bar(current, total, width=80):
progress = current / total
bar = '#' * int(progress * width)
percentage = round(progress * 100, 2)
tempstr = f'[{bar:<{width}}] {percentage}%'
sys.stdout.write("\r" + tempstr)
sys.stdout.flush()
wget.download(url,out=localfile,bar=progress_bar)运行效果如下:
例子3,是在和例子2基础上改写,进度条从“######”改为“..........”,没有使用sys.stdout.write,而是直接返回要显示的字符串。
这就是直接仿照官方源代码改写的。也就是说,自定义的进度条,只需要返回要显示的字符串即可。
import sys
import wget
url = 'https://motzdown.mydown.com/package/wincompress_1/win%E8%A7%A3%E5%8E%8B%E7%BC%A9_1800_1_31_2528.exe'
localfile = './win解压缩_1800_1_31_2528.exe'
def progress_bar(current, total, width=80):
progress = current / total
bar = '.' * int(progress * width)
percentage = round(progress * 100, 2)
tempstr = f'[{bar:<{width}}] {percentage}%'
return tempstr
wget.download(url,out=localfile,bar=progress_bar)运行效果如下:
需要说明的是,有时您下载的文件大小,服务器没有给出,这时total的数值就不知道。对于这一点,bar_adaptive的代码考虑得非常全面。本教程给的三个自定义进度函数,没有考虑这种情况,如果遇见这种情况,程序会出错退出的。有兴趣的粉丝,可以参照bar_adaptive的代码进行完善。有不懂的,可以在评论区讨论。
五、异常处理
在使用 wget 进行文件下载时,不可避免地会遇到一些异常的情况,如连接到服务器出现问题、下载过程中出现中断或出现错误等。为了确保程序的不意外中断、能继续执行后面的任务,我们可以使用异常处理来处理这些异常情况,这样我们可以根据日志来判断程序执行的情况,从而采取具体的处理措施。当然这种异常处理是一般程序的处理方法,这里只是介绍,非wget所独有。示例如下:
try:
wget.download(url, localfile)
except Exception as e:
print(f'An error occurred: {e}')相关推荐
- 阿里云国际站ECS:阿里云ECS如何提高网站的访问速度?
-
TG:@yunlaoda360引言:速度即体验,速度即业务在当今数字化的世界中,网站的访问速度已成为决定用户体验、用户留存乃至业务转化率的关键因素。页面加载每延迟一秒,都可能导致用户流失和收入损失。对...
- 高流量大并发Linux TCP性能调优_linux 高并发网络编程
-
其实主要是手里面的跑openvpn服务器。因为并没有明文禁p2p(哎……想想那么多流量好像不跑点p2p也跑不完),所以造成有的时候如果有比较多人跑BT的话,会造成VPN速度急剧下降。本文所面对的情况为...
- 性能测试100集(12)性能指标资源使用率
-
在性能测试中,资源使用率是评估系统硬件效率的关键指标,主要包括以下四类:#性能测试##性能压测策略##软件测试#1.CPU使用率定义:CPU处理任务的时间占比,计算公式为1-空闲时间/总...
- Linux 服务器常见的性能调优_linux高性能服务端编程
-
一、Linux服务器性能调优第一步——先搞懂“看什么”很多人刚接触Linux性能调优时,总想着直接改配置,其实第一步该是“看清楚问题”。就像医生看病要先听诊,调优前得先知道服务器“哪里...
- Nginx性能优化实战:手把手教你提升10倍性能!
-
关注△mikechen△,十余年BAT架构经验倾囊相授!Nginx是大型架构而核心,下面我重点详解Nginx性能@mikechen文章来源:mikechen.cc1.worker_processe...
- 高并发场景下,Spring Cloud Gateway如何抗住百万QPS?
-
关注△mikechen△,十余年BAT架构经验倾囊相授!大家好,我是mikechen。高并发场景下网关作为流量的入口非常重要,下面我重点详解SpringCloudGateway如何抗住百万性能@m...
- Kubernetes 高并发处理实战(可落地案例 + 源码)
-
目标场景:对外提供HTTPAPI的微服务在短时间内收到大量请求(例如每秒数千至数万RPS),要求系统可弹性扩容、限流降级、缓存减压、稳定运行并能自动恢复。总体思路(多层防护):边缘层:云LB...
- 高并发场景下,Nginx如何扛住千万级请求?
-
Nginx是大型架构的必备中间件,下面我重点详解Nginx如何实现高并发@mikechen文章来源:mikechen.cc事件驱动模型Nginx采用事件驱动模型,这是Nginx高并发性能的基石。传统...
- Spring Boot+Vue全栈开发实战,中文版高清PDF资源
-
SpringBoot+Vue全栈开发实战,中文高清PDF资源,需要的可以私我:)SpringBoot致力于简化开发配置并为企业级开发提供一系列非业务性功能,而Vue则采用数据驱动视图的方式将程序...
- Docker-基础操作_docker基础实战教程二
-
一、镜像1、从仓库获取镜像搜索镜像:dockersearchimage_name搜索结果过滤:是否官方:dockersearch--filter="is-offical=true...
- 你有空吗?跟我一起搭个服务器好不好?
-
来人人都是产品经理【起点学院】,BAT实战派产品总监手把手系统带你学产品、学运营。昨天闲的没事的时候,随手翻了翻写过的文章,发现一个很严重的问题。就是大多数时间我都在滔滔不绝的讲理论,却很少有涉及动手...
- 部署你自己的 SaaS_saas如何部署
-
部署你自己的VPNOpenVPN——功能齐全的开源VPN解决方案。(DigitalOcean教程)dockovpn.io—无状态OpenVPNdockerized服务器,不需要持久存储。...
- Docker Compose_dockercompose安装
-
DockerCompose概述DockerCompose是一个用来定义和管理多容器应用的工具,通过一个docker-compose.yml文件,用YAML格式描述服务、网络、卷等内容,...
- 京东T7架构师推出的电子版SpringBoot,从构建小系统到架构大系统
-
前言:Java的各种开发框架发展了很多年,影响了一代又一代的程序员,现在无论是程序员,还是架构师,使用这些开发框架都面临着两方面的挑战。一方面是要快速开发出系统,这就要求使用的开发框架尽量简单,无论...
- Kubernetes (k8s) 入门学习指南_k8s kubeproxy
-
Kubernetes(k8s)入门学习指南一、什么是Kubernetes?为什么需要它?Kubernetes(k8s)是一个开源的容器编排系统,用于自动化部署、扩展和管理容器化应用程序。它...
欢迎 你 发表评论:
- 一周热门
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python写入txt (66)
- python读取文件夹下所有文件 (59)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)
