彻底教你解决python中编码问题
off999 2024-11-25 15:56 39 浏览 0 评论
我们在使用python开发的过程中,编码问题是很常见,但是又很头疼问题。尤其以python2最为严重,虽然在python3中有所修改,但仍然是很多 Python 开发者的噩梦,无论你是工作多年的Python开发者,还是初学python的开发者。而碰到这种问题,我们经常是花费大力气,Google、百度、论坛、博客,非常欣慰的解决了问题,但是在下一次再遇到同样的问题,又要重复以上过程。下面我就总结一下python的编码问题,一定要收藏哦
Python 3 中 str 与 bytes
在 Python3中,字符串有两种类型 ,str和bytes。
- unicode string(str 类型):以 Unicode code points 形式存储,人类认识的形式
- byte string(bytes 类型):以 byte 形式存储,机器认识的形式
在 Python 3 中你定义的所有字符串,都是 unicode string类型,使用 type 和 isinstance 可以判别
# python3
>>> str_obj = "你好"
>>> type(str_obj)
<class 'str'>
>>> isinstance("你好", str)
True
>>> isinstance("你好", bytes)
Falsebytes是一个二进制序列对象,只要在定义字符串时前面加一个b,就表示bytes类型的字符串对象。
# python3
>>> byte_obj = b"Hello World!"
>>> type(byte_obj)
<class 'bytes'>
>>> isinstance(byte_obj, str)
False
>>> isinstance(byte_obj, bytes)
True但是在定义中文字符串时,如果直接加上b,就会报错,应该使用encode转码一下。
>>> byte_obj=b"你好"
File "<stdin>", line 1
SyntaxError: bytes can only contain ASCII literal characters.
>>> str_obj="你好"
>>> str_obj.encode("utf-8")
b'\xe4\xbd\xa0\xe5\xa5\xbd'Python 2 中 str 与 unicode
在Python2里,字符串也只有两种类型,unicode和str。
只有 unicode object 和非unicode object其实应该叫 str object)的区别:
- unicode string(unicode类型):以Unicode code points形式存储,人类认识的形式
- byte string(str 类型):以byte形式存储,机器认识的形式
当我们直接使用双引号或单引号包含字符的方式来定义字符串时,就是 str 字符串对象
# python2
>>> str_obj="你好"
>>> type(str_obj)
<type 'str'>
>>> isinstance(str_obj, bytes)
True
>>> isinstance(str_obj, str)
True而当我们在双引号或单引号前面加个u,就表明我们定义的是 unicode 字符串对象
# python2
>>> unicode_obj = u"你好"
>>> type(unicode_obj)
<type 'unicode'>
>>> isinstance(unicode_obj, bytes)
False
>>> isinstance(unicode_obj, str)
False如何检测对象的编码
所有的字符,在 unicode 字符集中都有对应的编码值(英文叫做:code point)
把这些编码值按照一定的规则保存成二进制字节码,就是我们说的编码方式,常见的有:UTF-8,GB2312 等。
也就是说,当我们要将内存中的字符串持久化到硬盘中的时候,都要指定编码方法,而反过来,读取的时候,也要指定正确的编码方法(这个过程叫解码),不然会出现乱码。
那问题就来了,当我们知道了其对应的编码方法,我们就可以正常解码,但并不是所有时候我们都能知道应该用什么编码方式去解码?
这时候就要用到python的库--chardet ,需要单独安装
python3 -m pip install chardetchardet有一个detect方法,可以预测其编码格式
>>> import chardet
>>> chardet.detect('今天天气很不错'.encode('gbk'))
{'encoding': 'GB2312', 'confidence': 0.99, 'language': 'Chinese'}为什么说是预测呢,通过上面的输出来看,我们看到有一个confidence字段,表示预测的可信度。
既然是预测,那么如果样本数越多,当然预测就越接近真实值,若你的字符数较少,就有可能出现预测失误,举例如下:比如只有 中文 两个字,就像下面这样,我们是 使用 gbk 编码的,使用 chardet 却识别成 KOI8-R 编码。
>>> str_obj = "中文"
>>> byte_obj = bytes(a, encoding='gbk') # 先得到一个 gbk 编码的 bytes
>>> chardet.detect(byte_obj)
{'encoding': 'KOI8-R', 'confidence': 0.682639754276994, 'language': 'Russian'}
>>> str_obj2 = str(byte_obj, encoding='KOI8-R')
>>> str_obj2
'жпнд'中文字符,而且我们使用的gbk进行编码,但是预测出来却是俄语,KOI8-R编码。所以为了编码诊断的准确,要尽量使用足够多的字符。
chardet 支持多国的语言,从官方文档中可以看到支持如下这些语言(https://chardet.readthedocs.io/en/latest/supported-encodings.html)
编码与解码的区别
编码和解码,其实就是str与bytes的相互转化的过程,我们这里只说python3的
- 编码:encode方法,把字符串对象转化为二进制字节序列
- 解码:decode方法,把二进制字节序列转化为字符串对象
如果我们知道一串字符串的编码格式,如何来转成unicode呢?
有两种方法
第一种是,直接使用 decode 方法
>>> byte_obj.decode('gbk')
'中文'第二种是,使用 str 类来转
>>> str_obj = str(byte_obj, encoding='gbk')
>>> str_obj
'中文'如何设置文件编码
在Python 2中,默认使用的是 ASCII 编码来读取的,因此,我们在使用Python 2的时候,如果你的python文件里有中文,运行是会报错的。
SyntaxError: Non-ASCII character '\xe4' in file demo.py原因就是 ASCII 编码表太小,无法解释中文。
而在 Python 3 中,默认使用的是 uft-8 来读取,所以省了不少的事。
对于这个问题,通常解决方法有两种:
第一种方法
在 python2 中,可以在文件头部指定编译器读取源码时采取的编码和解码方式
# -*- coding: utf-8 -*-
# coding:utf-8
# coding=utf-8 以上三种书写方式,任选一种即可
第二种方法
import sys
reload(sys)
sys.setdefaultencoding('utf-8') 这里在调用sys.setdefaultencoding(‘utf-8’) 设置默认的解码方式之前,执行了reload(sys),这是必须的,因为python在加载完sys之后,会删除 sys.setdefaultencoding 这个方法,我们需要重新载入sys,才能调用 sys.setdefaultencoding 这个方法。
总结
除了以上介绍的编码和解码问题,实际使用当中还有很多编解码相关的情况,比如控制台中输出结果和实际文件中输出结果不一样,这就是因为默认的编码方式不同造成的。这种问题在调试的时候是最常见的。限于篇幅问题,后面我们有时间再进行详细的解释,可能需要出一个视频。今天就先到这里。
- 上一篇:Python中文编码大合集
- 下一篇:简单易学的Python 中文编码
相关推荐
- xpsp2系统下载地址(windows xp sp2 iso)
-
WindowsXPProfessionalSP2产品密钥是微软公司的一个软件密钥,用于授权用户使用该软件的完整功能。它通常与产品许可证一起使用,用于确保软件的合法性和安全性。使用Windows...
- 开机microsoft登录不上
-
1、系统问题:如果系统版本比较低,可能会由于旧系统存在某些BUG未修复或业务功能未优化,使手机在使用APP等应用过程中出现卡的情况,建议更新到最新的ios系统使用。2、内存问题:如果内存比较小,在运行...
- 如何取消win10开机密码(如何取消win10开机密码账户登录)
-
取消Windows10的开机密码可以通过以下方法进行操作:方法一:使用用户账户设置1.打开“开始”菜单,点击“设置”图标。2.在设置窗口中,点击“帐户”选项。3.在左侧菜单中,选择“登录选项”。4....
- 免费解压文件的软件(免费解压文件的软件电脑)
-
1、快压快压(kuaizip)是一款非常流氓的压缩和解压缩软件,一款免费、方便、快速的压缩和解压缩利器,拥有一流的压缩技术,是国内第一款具备自主压缩格式的软件。快压自身的压缩格式KZ具有超大的压缩比和...
- 无线usb网卡插上去没有反应(为什么usb无线网卡插上去没反应)
-
当出现电脑无法识别无线网卡的情况时,是简单的方法就是将无线USB网卡插到电脑后置USB接口上,以保证供电的充足。当然如果是偶然出现无法识别的情况,建议重启一下电脑试试。启用USB无线网卡驱动:右击“计...
- 怎么登录自己家的路由器(怎么登录自己家的路由器账号)
-
登陆家里的路由器方法:1、先查看ip,方法:win+r---输入:cmd---在再黑白界面输入:ipconfig,按回车。2、根据网关查看路由器地址。若网关是:192.168.2.1,那么路由器的ip...
- linux操作系统安装步骤(linux系统详细安装步骤)
-
1.选择“中文(简体)”,然后点击“安装Ubuntu”。2.点击“继续”。3.然后点击“现在安装”。4.选择地址的时区,然后点击“继续”。5.选择“汉语”,然后点击“继续”。6.输入用户的名字。7.设...
- 苹果手机怎么设置定时关机(苹果手机怎么设置定时关机重启)
-
苹果手机可以设置定时关机,但无法设置定时开机。具体操作步骤如下:进入苹果手机自带的时钟。点击屏幕有下角的计时器。点击画面中间的计时结束启用选项。选择画面最下方的“停止播放”。之后再点击画面右上角的设定...
- 无线网wifi密码忘记了怎么办
-
忘记wifi密码后,可以在路由器后台查看。1.在浏览器的地址栏中,输入路由器上的管理地址,进入后台界面;2.在后台界面里,找到“无线设置”选项,点击它;3.在新界面里,点击wifi密码右侧的小眼睛图标...
-
- win7系统无法正常开机怎么办
-
解决方法如下1,出现无法启动的原因,要注意是开机启动不了,还是在进度条那里缓冲,过不去.如果是开机启动不了,那就要看一下内存条、电源等有没有问题?如果是在进度条那里,那就看下方的三种方法。2,第一种方法:1,开机按F8键.2,选择最近一次的...
-
2025-11-16 07:51 off999
- 现在装win7还需要激活吗(现在安装win7旗舰版还需密钥吗)
-
要激活 Windows7如果是预装在计算机中的,买来之后便不用激活,这里预装指的是在厂商那里。正版的Windows7安装到计算机中,有三十天的试用期,若要永久使用,就要使...
- 2025显卡性能排行榜天梯图(2020年显卡性能天梯图)
-
MacBookPro的显卡水平处于笔记本独立显卡Nvidia920M和940M之间。属于低端显卡级,玩玩LOL啥的还可以,其他的大型游戏就算了,MAC不适合打游戏。MacBookPro搭载的8代...
- 网络对时服务器(对时服务器端口)
-
对等网是指在网络中所有计算机的地位都是平等的,既是服务器也是客户机,所有计算机中安装的都是相同的单机操作系统如Windows98/XP/Vista/7等,它可以设置共享资源,但受连接数限制,一般是只允...
- 如何强制删除u盘文件(强制删除u盘内容)
-
1、电脑上下载安装安全杀毒类软件。2、使用强力卸载。3、找到U盘上需要卸载的文件,右击强力卸载可以卸载顽固型文件。4、被暂用的文件也删除不了可以退出U盘重启电脑重新开机插入U盘进行删除。5、不能删除的...
- directx官方下载win7(directx download)
-
点开始-----运行,输入dxdiag,回车后打开“DirectX诊断工具”窗口,进入“显示”选项卡,看一下是否启用了加速,没有的话,单击下面的“DirectX功能”项中的“启用”按钮,这样便打开了D...
欢迎 你 发表评论:
- 一周热门
-
-
抖音上好看的小姐姐,Python给你都下载了
-
全网最简单易懂!495页Python漫画教程,高清PDF版免费下载
-
Python 3.14 的 UUIDv6/v7/v8 上新,别再用 uuid4 () 啦!
-
python入门到脱坑 输入与输出—str()函数
-
飞牛NAS部署TVGate Docker项目,实现内网一键转发、代理、jx
-
宝塔面板如何添加免费waf防火墙?(宝塔面板开启https)
-
Python三目运算基础与进阶_python三目运算符判断三个变量
-
(新版)Python 分布式爬虫与 JS 逆向进阶实战吾爱分享
-
慕ke 前端工程师2024「完整」
-
失业程序员复习python笔记——条件与循环
-
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python写入txt (66)
- python读取文件夹下所有文件 (59)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)
