python进阶100集(5)你真的了解python字符串吗?
off999 2025-07-10 19:54 34 浏览 0 评论
之前在python基础专辑里面我们分享了python的一个常用的数据类型:字符串!但是你真的了解字符串的结构吗?今天我们就来详细深入剖析一下python字符串的细节!
1. 什么是Python字符串?
Python字符串(string)是由Unicode码点(code points)组成的不可变序列,用于表示文本信息。例如:
text = "Hello 世界"
# 包含ASCII字符和Unicode中文字符2. Python数据结构中是否有字符和字符串?
有字符串类型:Python原生支持 s t r 类型(如"a", "Python")
无独立字符类型:单个字符在Python中是长度为1的字符串(如'a'的类型是s t r)
示例验证:
print(type('a')) # 输出: <class 'str'>
print(type("abc")) # 输出: <class 'str'>3. 字符串的单个元素是字符吗?
字符串的每个元素是一个Unicode码点(逻辑上的"字符"),技术上是通过长度为1的字符串实现:
s = "A字"
print(s[0]) # 'A' → 英文(1个码点)
print(s[1]) # '字' → 中文(1个码点)
print(s[2]) # '' → 火箭emoji(1个码点,UTF-16中占2个代码单元)注意:某些字符(如emoji)在内存中可能需要多个字节存储,但对Python用户透明操作。
4. 为什么字符串不可变?
根本原因:C Python的字符串驻留(Interning)优化机制
优势 | 底层原理说明 |
内存效率高 | 相同字符串重用内存(如a="hi"; b="hi",id(a)==id(b)) |
哈希值可缓存 | 字典键快速查找(字符串哈希值只需计算一次) |
线程安全 | 多线程无需加锁(因数据不可修改) |
防止意外修改 | 避免作为函数参数时被意外修改(如def modify(s): s[0]='X' 会引发错误) |
示例证明不可变性:
s = "Python"
s[0] = "J" # 报错: TypeError: 'str' object does not support item assignment5. 字符串底层结构(CPython源码解析)
在C Python中,字符串结构定义于
Include/cpython/unicodeobject.h:
核心结构体
typedef struct {
PyObject_HEAD // 所有Python对象的公共头部
Py_ssize_t length; // 字符串长度(码点数量)
Py_hash_t hash; // 缓存哈希值(初次计算后存储)
struct {
unsigned int interned:2; // 是否驻留(INTERNED状态标志)
unsigned int kind:3; // 编码类型(1/2/4字节)
unsigned int compact:1; // 是否紧凑存储(非堆分配)
// ... 其他标志位
} state;
wchar_t *wstr; // 宽字符缓存(兼容旧API)
} PyUnicodeObject;编码类型(kind)详解
编码种类 | 单个字符大小 | 能表示的最大 Unicode 码点 | 示例字符 |
1 字节 | 8 bit | U+00FF(Latin-1) | ASCII 字符 |
2 字节 | 16 bit | U+FFFF(BMP) | 常用中文 |
4 字节 | 32 bit | U+10FFFF(完整 Unicode) | Emoji、古文字 |
内存布局示例(字符串"Py")
内存地址: 0x1000 → [对象头]
0x1008 → length=2
0x1010 → hash=缓存值
0x1018 → state (kind=1, interned=1, ...)
0x1020 → 数据区: 'P' (0x50) → 'y' (0x79)
内存布局示意图(可视化)
以下是一个简化的字符串 "hello" 在内存中的布局图(假设为 ASCII 字符串):
如果是中文字符串 "你好",则可能使用 2 字节编码(UTF-16):
6. 字符串驻留(Interning)
为了提高效率,C Python 会对一些字符串进行驻留(interning),即多个相同字符串共享同一块内存地址。
驻留规则(常见情况):
小写变量名、常量名(如 a, myvar)
只含字母、数字和下划线的字符串
短字符串(通常小于 20 字符)
>>> a = "hello"
>>> b = "hello"
>>> a is b
True注意:并不是所有字符串都会被驻留,例如:
>>> x = "he" + "llo"
>>> y = "hello"
>>> x is y
False # 不一定驻留7 .字符串内存占用分析(实际测试)
我们可以使用 sys.getsizeof() 来查看字符串对象的内存开销:
import sys
s = "hello"
print(sys.getsizeof(s)) # 输出: 49 bytes(Python 3.11)
s2 = "你好"
print(sys.getsizeof(s2)) # 输出: 78 bytes(2个字符,每个字符可能占用 2 或 4 字节)注意:getsizeof() 只返回对象本身的大小,并不包括所引用的 data 数据区,要获取真实总内存需手动计算。
关键特性总结
特性 | Python字符串实现方式 |
字符类型 | 无独立字符类型,用长度为1的字符串表示 |
不可变性 | 通过驻留机制优化内存和哈希 |
内存结构 | 动态选择1/2/4字节存储(根据最大码点) |
元素访问 | O(1)时间复杂度(直接通过索引访问码点) |
Unicode支持 | 原生支持全Unicode字符集(包括emoji) |
注:Python 3.0+ 全面使用Unicode存储,解决Python 2的str/unicode分离问题。
相关推荐
- 云骑士装机大师官方网站(云骑士装机大师软件下载)
-
就是感觉正规吧,还有就是小白那种的比较多,专业店一忽悠就掏钱做系统了。懂装机的哪有花钱去装系统的不靠谱,因为会造成个人信息的泄露。云骑士装机大师是网络装机系统,在网络上能够实现一键装机,非常的简洁方便...
- 万能钥匙下载免费(安心上网万能钥匙下载免费)
-
行1.使用手机功能表中自带的浏览器上网,直接搜索需要的软件进行下载安装(下载安卓版本格式为apk)。2.使用电脑下载APK格式的安装包,连接数据线传输至手机,操作手机在应用程序-我的文件中找到安装包,...
- 500兆宽带用什么路由器(家用路由器什么牌子好 信号强)
-
1、飞鱼星千兆无线路由器家用2600M双频企业级高速穿墙500M光纤游戏加速VW1900/千兆双频/1900M/大型企业路由器无线500m推荐理由:可以提供企业级别的性能,空旷环境覆盖更广大,...
- xp系统怎么卸载软件(xp怎么卸载程序)
-
1、选中此电脑,点击鼠标右键。2、选择属性点击一下。3、在打开的界面选择控制面板。4、点击程序选项下方的卸载。5、选择要卸载的程序软件,点击鼠标右键。6、点击弹出的选项卸载/更改。7、也可以使用电脑管...
- 笔记本电脑系统修复软件(笔记本电脑程序修复)
-
1、超级兔子2013系统修复软件超级兔子是一款完整的系统维护工具。拥有电脑系统评测、垃圾清理和注册表清理、可疑文件和插件检测、网页防护等功能,同时自带一些实用的系统工具,可清理你大多数的文件、注册表里...
- 联想保修服务包括哪些(联想保修都保修什么)
-
1、保修36个月的硬件包括:CPU、内存。2、保修24个月的硬件包括:主板、显卡、LCD屏、硬盘、电源适配器、键盘、鼠标模块。3、保修12个月的硬件包括:LCD之附件、光驱、DVD、CDR/W、软驱...
- 系统科学大会(中国系统科学学会)
-
2021年各种科学大会的召开时间取决于疫情的发展和国家政策的调整。一些大型的国际科学会议可能会推迟或者采用线上形式进行,以保障参会人员的安全和健康。同时,一些国内的学术会议也会受到疫情的影响,需要推迟...
- win10系统下载的内容在哪(win10下载的软件在哪个文件夹)
-
进入C:\Windows\SoftwareDistribution\Download目录下,通过win10应用商店中下载的安装包都放在此目录下。进入C:\Windows\SoftwareDistrib...
- 下载原版xp系统光盘(xp光盘系统安装教程怎么安装)
-
方法步骤步骤如下:1、首先打开计算机,在电脑光驱上放入XP光盘,启动电脑后不停按F12、F11、Esc等启动热键,在弹出的启动菜单中选择DVD选项,回车。2、进入光盘主菜单,按数字2或点击选项2运行w...
- windows7中文版下载安装(windows7安装包下载)
-
谢邀,如果你戳设置-时间和语言-区域和语言,右边的语言提示“只允许使用一种语言包”,那么你的系统就是家庭中文版。家庭中文版限定系统界面只能使用简体中文显示,其他功能则与普通家庭版没有区别,也可以使用其...
- win7开机按f2怎么重装系统(win7开机按f12怎么重装系统)
-
开机或重启时,在进入Windows前按F2进入BIOS。 ←→移动到第三个好像是BOOT。 然后将EXTENELBOOT选项设置为ENABLE 最后按F5将第一启动项目设置为EXTENEL...
-
- win10驱动管理(win10驱动程序)
-
win10由于联网后会自动安装驱动,如果自动安装驱动没出现问题,即可视为最佳驱动,若出现问题,卸载出问题的驱动,然后去查自己主板型号,在主板供应商官网下载对应驱动即是最佳01Windows10驱动更新调整当前当你插入连接即插即用(Pn...
-
2025-12-29 05:51 off999
- 手机上怎么找qq邮箱登录(用手机怎么找到qq邮箱)
-
入口是“联系人”选项卡。qq邮箱手机在QQ主菜单中选择下方的“联系人”选项卡;3、在“联系人”中选取“公众号”选项卡;4、在公众号中菜单中找到或搜索“QQ邮箱提醒”,点击进入;5、点击“进入邮箱”;6...
- amd显卡控制面板
-
AMD显卡控制面板是用来管理你的AMD显卡的,可以在控制面板中进行设置一些简单的调整,来提升显卡性能和效果。1、先打开AMD控制面板。2、打开“垂直同步(V-SYNC)”功能,可调整细节,改善影像流畅...
- win10老是未响应卡死(window10总是未响应)
-
具体方法:1、如果win10中的应用程序出现不响应的情况,应该是应用程序加载失败了。可以通过重置方法来解决win10应用程序无响应。2、登录win10系统,用管理员身份运行Powershell(可在C...
欢迎 你 发表评论:
- 一周热门
-
-
抖音上好看的小姐姐,Python给你都下载了
-
全网最简单易懂!495页Python漫画教程,高清PDF版免费下载
-
Python 3.14 的 UUIDv6/v7/v8 上新,别再用 uuid4 () 啦!
-
飞牛NAS部署TVGate Docker项目,实现内网一键转发、代理、jx
-
python入门到脱坑 输入与输出—str()函数
-
宝塔面板如何添加免费waf防火墙?(宝塔面板开启https)
-
Python三目运算基础与进阶_python三目运算符判断三个变量
-
(新版)Python 分布式爬虫与 JS 逆向进阶实战吾爱分享
-
失业程序员复习python笔记——条件与循环
-
系统u盘安装(win11系统u盘安装)
-
- 最近发表
- 标签列表
-
- python计时 (73)
- python安装路径 (56)
- python类型转换 (93)
- python进度条 (67)
- python吧 (67)
- python的for循环 (65)
- python格式化字符串 (61)
- python静态方法 (57)
- python列表切片 (59)
- python面向对象编程 (60)
- python 代码加密 (65)
- python串口编程 (77)
- python封装 (57)
- python写入txt (66)
- python读取文件夹下所有文件 (59)
- python操作mysql数据库 (66)
- python获取列表的长度 (64)
- python接口 (63)
- python调用函数 (57)
- python多态 (60)
- python匿名函数 (59)
- python打印九九乘法表 (65)
- python赋值 (62)
- python异常 (69)
- python元祖 (57)
