百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

python进阶100集(5)你真的了解python字符串吗?

off999 2025-07-10 19:54 34 浏览 0 评论

之前在python基础专辑里面我们分享了python的一个常用的数据类型:字符串!但是你真的了解字符串的结构吗?今天我们就来详细深入剖析一下python字符串的细节!

1. 什么是Python字符串?

Python字符串(string)是由Unicode码点(code points)组成的不可变序列,用于表示文本信息。例如:

text = "Hello 世界" 
# 包含ASCII字符和Unicode中文字符

2. Python数据结构中是否有字符和字符串?

有字符串类型:Python原生支持 s t r 类型(如"a", "Python")

无独立字符类型:单个字符在Python中是长度为1的字符串(如'a'的类型是s t r)

示例验证:

print(type('a')) # 输出: <class 'str'>
print(type("abc")) # 输出: <class 'str'>

3. 字符串的单个元素是字符吗?

字符串的每个元素是一个Unicode码点(逻辑上的"字符"),技术上是通过长度为1的字符串实现:

s = "A字"
print(s[0]) # 'A' → 英文(1个码点)
print(s[1]) # '字' → 中文(1个码点)
print(s[2]) # '' → 火箭emoji(1个码点,UTF-16中占2个代码单元)

注意:某些字符(如emoji)在内存中可能需要多个字节存储,但对Python用户透明操作。

4. 为什么字符串不可变?

根本原因:C Python的字符串驻留(Interning)优化机制

优势

底层原理说明

内存效率高

相同字符串重用内存(如a="hi"; b="hi"id(a)==id(b)

哈希值可缓存

字典键快速查找(字符串哈希值只需计算一次)

线程安全

多线程无需加锁(因数据不可修改)

防止意外修改

避免作为函数参数时被意外修改(如def modify(s): s[0]='X' 会引发错误)

示例证明不可变性:

s = "Python"
s[0] = "J" # 报错: TypeError: 'str' object does not support item assignment

5. 字符串底层结构(CPython源码解析)

在C Python中,字符串结构定义于
Include/cpython/unicodeobject.h:

核心结构体

typedef struct {
    PyObject_HEAD // 所有Python对象的公共头部
    Py_ssize_t length; // 字符串长度(码点数量)
    Py_hash_t hash; // 缓存哈希值(初次计算后存储)
    struct {
        unsigned int interned:2; // 是否驻留(INTERNED状态标志)
        unsigned int kind:3; // 编码类型(1/2/4字节)
        unsigned int compact:1; // 是否紧凑存储(非堆分配)
        // ... 其他标志位
    } state;
    wchar_t *wstr; // 宽字符缓存(兼容旧API)
} PyUnicodeObject;

编码类型(kind)详解

编码种类

单个字符大小

能表示的最大 Unicode 码点

示例字符

1 字节

8 bit

U+00FF(Latin-1)

ASCII 字符

2 字节

16 bit

U+FFFF(BMP)

常用中文

4 字节

32 bit

U+10FFFF(完整 Unicode)

Emoji、古文字

内存布局示例(字符串"Py")

内存地址: 0x1000 → [对象头]
0x1008 → length=2
0x1010 → hash=缓存值
0x1018 → state (kind=1, interned=1, ...)
0x1020 → 数据区: 'P' (0x50) → 'y' (0x79)

内存布局示意图(可视化)

以下是一个简化的字符串 "hello" 在内存中的布局图(假设为 ASCII 字符串):

如果是中文字符串 "你好",则可能使用 2 字节编码(UTF-16):

6. 字符串驻留(Interning)

为了提高效率,C Python 会对一些字符串进行驻留(interning),即多个相同字符串共享同一块内存地址。

驻留规则(常见情况):

小写变量名、常量名(如 a, myvar)

只含字母、数字和下划线的字符串

短字符串(通常小于 20 字符)

>>> a = "hello"
>>> b = "hello"
>>> a is b
True

注意:并不是所有字符串都会被驻留,例如:

>>> x = "he" + "llo"
>>> y = "hello"
>>> x is y
False # 不一定驻留

7 .字符串内存占用分析(实际测试)

我们可以使用 sys.getsizeof() 来查看字符串对象的内存开销:

import sys
s = "hello"
print(sys.getsizeof(s)) # 输出: 49 bytes(Python 3.11)
s2 = "你好"
print(sys.getsizeof(s2)) # 输出: 78 bytes(2个字符,每个字符可能占用 2 或 4 字节)

注意:getsizeof() 只返回对象本身的大小,并不包括所引用的 data 数据区,要获取真实总内存需手动计算。


关键特性总结

特性

Python字符串实现方式

字符类型

无独立字符类型,用长度为1的字符串表示

不可变性

通过驻留机制优化内存和哈希

内存结构

动态选择1/2/4字节存储(根据最大码点)

元素访问

O(1)时间复杂度(直接通过索引访问码点)

Unicode支持

原生支持全Unicode字符集(包括emoji)

注:Python 3.0+ 全面使用Unicode存储,解决Python 2的str/unicode分离问题。


相关推荐

云骑士装机大师官方网站(云骑士装机大师软件下载)

就是感觉正规吧,还有就是小白那种的比较多,专业店一忽悠就掏钱做系统了。懂装机的哪有花钱去装系统的不靠谱,因为会造成个人信息的泄露。云骑士装机大师是网络装机系统,在网络上能够实现一键装机,非常的简洁方便...

万能钥匙下载免费(安心上网万能钥匙下载免费)

行1.使用手机功能表中自带的浏览器上网,直接搜索需要的软件进行下载安装(下载安卓版本格式为apk)。2.使用电脑下载APK格式的安装包,连接数据线传输至手机,操作手机在应用程序-我的文件中找到安装包,...

500兆宽带用什么路由器(家用路由器什么牌子好 信号强)

1、飞鱼星千兆无线路由器家用2600M双频企业级高速穿墙500M光纤游戏加速VW1900/千兆双频/1900M/大型企业路由器无线500m推荐理由:可以提供企业级别的性能,空旷环境覆盖更广大,...

xp系统怎么卸载软件(xp怎么卸载程序)

1、选中此电脑,点击鼠标右键。2、选择属性点击一下。3、在打开的界面选择控制面板。4、点击程序选项下方的卸载。5、选择要卸载的程序软件,点击鼠标右键。6、点击弹出的选项卸载/更改。7、也可以使用电脑管...

笔记本电脑系统修复软件(笔记本电脑程序修复)

1、超级兔子2013系统修复软件超级兔子是一款完整的系统维护工具。拥有电脑系统评测、垃圾清理和注册表清理、可疑文件和插件检测、网页防护等功能,同时自带一些实用的系统工具,可清理你大多数的文件、注册表里...

联想保修服务包括哪些(联想保修都保修什么)

1、保修36个月的硬件包括:CPU、内存。2、保修24个月的硬件包括:主板、显卡、LCD屏、硬盘、电源适配器、键盘、鼠标模块。3、保修12个月的硬件包括:LCD之附件、光驱、DVD、CDR/W、软驱...

系统科学大会(中国系统科学学会)

2021年各种科学大会的召开时间取决于疫情的发展和国家政策的调整。一些大型的国际科学会议可能会推迟或者采用线上形式进行,以保障参会人员的安全和健康。同时,一些国内的学术会议也会受到疫情的影响,需要推迟...

win10系统下载的内容在哪(win10下载的软件在哪个文件夹)

进入C:\Windows\SoftwareDistribution\Download目录下,通过win10应用商店中下载的安装包都放在此目录下。进入C:\Windows\SoftwareDistrib...

下载原版xp系统光盘(xp光盘系统安装教程怎么安装)

方法步骤步骤如下:1、首先打开计算机,在电脑光驱上放入XP光盘,启动电脑后不停按F12、F11、Esc等启动热键,在弹出的启动菜单中选择DVD选项,回车。2、进入光盘主菜单,按数字2或点击选项2运行w...

windows7中文版下载安装(windows7安装包下载)

谢邀,如果你戳设置-时间和语言-区域和语言,右边的语言提示“只允许使用一种语言包”,那么你的系统就是家庭中文版。家庭中文版限定系统界面只能使用简体中文显示,其他功能则与普通家庭版没有区别,也可以使用其...

win7开机按f2怎么重装系统(win7开机按f12怎么重装系统)

开机或重启时,在进入Windows前按F2进入BIOS。  ←→移动到第三个好像是BOOT。  然后将EXTENELBOOT选项设置为ENABLE  最后按F5将第一启动项目设置为EXTENEL...

win10驱动管理(win10驱动程序)
win10驱动管理(win10驱动程序)

win10由于联网后会自动安装驱动,如果自动安装驱动没出现问题,即可视为最佳驱动,若出现问题,卸载出问题的驱动,然后去查自己主板型号,在主板供应商官网下载对应驱动即是最佳01Windows10驱动更新调整当前当你插入连接即插即用(Pn...

2025-12-29 05:51 off999

手机上怎么找qq邮箱登录(用手机怎么找到qq邮箱)

入口是“联系人”选项卡。qq邮箱手机在QQ主菜单中选择下方的“联系人”选项卡;3、在“联系人”中选取“公众号”选项卡;4、在公众号中菜单中找到或搜索“QQ邮箱提醒”,点击进入;5、点击“进入邮箱”;6...

amd显卡控制面板

AMD显卡控制面板是用来管理你的AMD显卡的,可以在控制面板中进行设置一些简单的调整,来提升显卡性能和效果。1、先打开AMD控制面板。2、打开“垂直同步(V-SYNC)”功能,可调整细节,改善影像流畅...

win10老是未响应卡死(window10总是未响应)

具体方法:1、如果win10中的应用程序出现不响应的情况,应该是应用程序加载失败了。可以通过重置方法来解决win10应用程序无响应。2、登录win10系统,用管理员身份运行Powershell(可在C...

取消回复欢迎 发表评论: