百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术资源 > 正文

python进阶100集(5)你真的了解python字符串吗?

off999 2025-07-10 19:54 3 浏览 0 评论

之前在python基础专辑里面我们分享了python的一个常用的数据类型:字符串!但是你真的了解字符串的结构吗?今天我们就来详细深入剖析一下python字符串的细节!

1. 什么是Python字符串?

Python字符串(string)是由Unicode码点(code points)组成的不可变序列,用于表示文本信息。例如:

text = "Hello 世界" 
# 包含ASCII字符和Unicode中文字符

2. Python数据结构中是否有字符和字符串?

有字符串类型:Python原生支持 s t r 类型(如"a", "Python")

无独立字符类型:单个字符在Python中是长度为1的字符串(如'a'的类型是s t r)

示例验证:

print(type('a')) # 输出: <class 'str'>
print(type("abc")) # 输出: <class 'str'>

3. 字符串的单个元素是字符吗?

字符串的每个元素是一个Unicode码点(逻辑上的"字符"),技术上是通过长度为1的字符串实现:

s = "A字"
print(s[0]) # 'A' → 英文(1个码点)
print(s[1]) # '字' → 中文(1个码点)
print(s[2]) # '' → 火箭emoji(1个码点,UTF-16中占2个代码单元)

注意:某些字符(如emoji)在内存中可能需要多个字节存储,但对Python用户透明操作。

4. 为什么字符串不可变?

根本原因:C Python的字符串驻留(Interning)优化机制

优势

底层原理说明

内存效率高

相同字符串重用内存(如a="hi"; b="hi"id(a)==id(b)

哈希值可缓存

字典键快速查找(字符串哈希值只需计算一次)

线程安全

多线程无需加锁(因数据不可修改)

防止意外修改

避免作为函数参数时被意外修改(如def modify(s): s[0]='X' 会引发错误)

示例证明不可变性:

s = "Python"
s[0] = "J" # 报错: TypeError: 'str' object does not support item assignment

5. 字符串底层结构(CPython源码解析)

在C Python中,字符串结构定义于
Include/cpython/unicodeobject.h:

核心结构体

typedef struct {
    PyObject_HEAD // 所有Python对象的公共头部
    Py_ssize_t length; // 字符串长度(码点数量)
    Py_hash_t hash; // 缓存哈希值(初次计算后存储)
    struct {
        unsigned int interned:2; // 是否驻留(INTERNED状态标志)
        unsigned int kind:3; // 编码类型(1/2/4字节)
        unsigned int compact:1; // 是否紧凑存储(非堆分配)
        // ... 其他标志位
    } state;
    wchar_t *wstr; // 宽字符缓存(兼容旧API)
} PyUnicodeObject;

编码类型(kind)详解

编码种类

单个字符大小

能表示的最大 Unicode 码点

示例字符

1 字节

8 bit

U+00FF(Latin-1)

ASCII 字符

2 字节

16 bit

U+FFFF(BMP)

常用中文

4 字节

32 bit

U+10FFFF(完整 Unicode)

Emoji、古文字

内存布局示例(字符串"Py")

内存地址: 0x1000 → [对象头]
0x1008 → length=2
0x1010 → hash=缓存值
0x1018 → state (kind=1, interned=1, ...)
0x1020 → 数据区: 'P' (0x50) → 'y' (0x79)

内存布局示意图(可视化)

以下是一个简化的字符串 "hello" 在内存中的布局图(假设为 ASCII 字符串):

如果是中文字符串 "你好",则可能使用 2 字节编码(UTF-16):

6. 字符串驻留(Interning)

为了提高效率,C Python 会对一些字符串进行驻留(interning),即多个相同字符串共享同一块内存地址。

驻留规则(常见情况):

小写变量名、常量名(如 a, myvar)

只含字母、数字和下划线的字符串

短字符串(通常小于 20 字符)

>>> a = "hello"
>>> b = "hello"
>>> a is b
True

注意:并不是所有字符串都会被驻留,例如:

>>> x = "he" + "llo"
>>> y = "hello"
>>> x is y
False # 不一定驻留

7 .字符串内存占用分析(实际测试)

我们可以使用 sys.getsizeof() 来查看字符串对象的内存开销:

import sys
s = "hello"
print(sys.getsizeof(s)) # 输出: 49 bytes(Python 3.11)
s2 = "你好"
print(sys.getsizeof(s2)) # 输出: 78 bytes(2个字符,每个字符可能占用 2 或 4 字节)

注意:getsizeof() 只返回对象本身的大小,并不包括所引用的 data 数据区,要获取真实总内存需手动计算。


关键特性总结

特性

Python字符串实现方式

字符类型

无独立字符类型,用长度为1的字符串表示

不可变性

通过驻留机制优化内存和哈希

内存结构

动态选择1/2/4字节存储(根据最大码点)

元素访问

O(1)时间复杂度(直接通过索引访问码点)

Unicode支持

原生支持全Unicode字符集(包括emoji)

注:Python 3.0+ 全面使用Unicode存储,解决Python 2的str/unicode分离问题。


相关推荐

推荐一款Python的GUI可视化工具(python 可视化工具)

在Python基础语法学习完成后,进一步开发应用界面时,就需要涉及到GUI了,GUI全称是图形用户界面(GraphicalUserInterface,又称图形用户接口),采用图形方式显示的计算机操...

教你用Python绘制谷歌浏览器的3种图标

前两天在浏览matplotlib官方网站时,笔者无意中看到一个挺有意思的图片,就是用matplotlib制作的火狐浏览器的logo,也就是下面这个东东(网页地址是https://matplotlib....

小白学Python笔记:第二章 Python安装

Windows操作系统的python安装:Python提供Windows、Linux/UNIX、macOS及其他操作系统的安装包版本,结合自己的使用情况,此处仅记录windows操作系统的python...

Python程序开发之简单小程序实例(9)利用Canvas绘制图形和文字

Python程序开发之简单小程序实例(9)利用Canvas绘制图形和文字一、项目功能利用Tkinter组件中的Canvas绘制图形和文字。二、项目分析要在窗体中绘制图形和文字,需先导入Tkinter组...

一文吃透Python虚拟环境(python虚拟环境安装和配置)

摘要在Python开发中,虚拟环境是一种重要的工具,用于隔离不同项目的依赖关系和环境配置。本文将基于windows平台介绍四种常用的Python虚拟环境创建工具:venv、virtualenv、pip...

小白也可以玩的Python爬虫库,收藏一下

最近,微软开源了一个项目叫「playwright-python」,作为一个兴起项目,出现后受到了大家热烈的欢迎,那它到底是什么样的存在呢?今天为你介绍一下这个传说中的小白神器。Playwright是...

python环境安装+配置教程(python安装后怎么配置环境变量)

安装python双击以下软件:弹出一下窗口需选择一些特定的选项默认选项不需要更改,点击next勾选以上选项,点击install进度条安装完毕即可。到以下界面,证明安装成功。接下来安装库文件返回电脑桌面...

colorama,一个超好用的 Python 库!

大家好,今天为大家分享一个超好用的Python库-colorama。Github地址:https://github.com/tartley/coloramaPythoncolorama库是一...

python制作仪表盘图(python绘制仪表盘)

今天教大家用pyecharts画仪表盘仪表盘(Gauge)是一种拟物化的图表,刻度表示度量,指针表示维度,指针角度表示数值。仪表盘图表就像汽车的速度表一样,有一个圆形的表盘及相应的刻度,有一个指针...

总结90条写Python程序的建议(python写作)

  1.首先  建议1、理解Pythonic概念—-详见Python中的《Python之禅》  建议2、编写Pythonic代码  (1)避免不规范代码,比如只用大小写区分变量、使用容易...

[oeasy]python0137_相加运算_python之禅_import_this_显式转化

变量类型相加运算回忆上次内容上次讲了是从键盘输入变量input函数可以有提示字符串需要有具体的变量接收输入的字符串输入单个变量没有问题但是输入两个变量之后一相加就非常离谱添加图片注释,不超过1...

Python入门学习记录之一:变量(python中变量的规则)

写这个,主要是对自己学习python知识的一个总结,也是加深自己的印象。变量(英文:variable),也叫标识符。在python中,变量的命名规则有以下三点:>变量名只能包含字母、数字和下划线...

掌握Python的&quot;魔法&quot;:特殊方法与属性完全指南

在Python的世界里,以双下划线开头和结尾的"魔法成员"(如__init__、__str__)是面向对象编程的核心。它们赋予开发者定制类行为的超能力,让自定义对象像内置类型一样优雅工...

11个Python技巧 不Pythonic 实用大于纯粹

虽然Python有一套强大的设计哲学(体现在“Python之禅”中),但总有一些情况需要我们“打破规则”来解决特定问题。这触及了Python哲学中一个非常核心的理念:“实用主义胜于纯粹主义”...

Python 从入门到精通 第三课 诗意的Python之禅

导言:Python之禅,英文名是TheZenOfPython。最早由TimPeters在Python邮件列表中发表,它包含了影响Python编程语言设计的20条软件编写原则。它作为复活节彩蛋...

取消回复欢迎 发表评论: