Effective Python 条款 3:搞懂 bytes 与 str,别再被编码 BUG 折磨😭
- 🔍 基础概念:bytes 和 str 到底是什么?
- 🥪 经典设计模式:Unicode 三明治(Unicode sandwich)
- to_str:不管输入是 bytes 还是 str,返回 str
- to_bytes:不管输入是 bytes 还是 str,返回 bytes
- ⚠️大坑一:bytes 和 str 不能混用!看着像,实际水火不容
- ⚠️大坑二:文件 open 模式,文本模式 vs 二进制模式
- 💡重要小技巧:文本模式务必显式指定 encoding
📖 出处:《Effective Python》第 3 条|了解 bytes 与 str 的区别 💡 阅读目标:彻底分清字节和字符串,避开 Python 编码解码的各种玄学报错
不知道写 Python 的你有没有遇到过这种崩溃时刻: 明明看着内容一模一样的两段文本,判断==却返回 False; 字符串拼接直接抛出TypeError;读取二进制文件突然蹦出UnicodeDecodeError;同样一段代码,在 Windows 跑正常,放到 Linux 直接炸锅😵。
绝大多数情况下,这些诡异的报错,根源都来自 **bytes**字节 和 **str**字符串 的混淆。很多新手甚至老开发都在这里踩坑,今天我们就把这两个 “长相相似但水火不容” 的类型讲明白。
Bilibili 同步视频
Effective Python 条款3:搞懂bytes与str,别再被编码BUG折磨
🔍 基础概念:bytes 和 str 到底是什么?
Python3 中将字符序列拆分成两种完全独立的类型:
bytes****:原始 8 位字节序列 bytes 存储的是机器看得懂的原始二进制 8 位无符号数字,打印时会以b'xxx'形式展示,大多对应 ASCII 原始字节。
a = b'hx65llo'print(list(a))print(a)
输出:
[104, 101, 108, 108, 111]b'hello'
把它转列表,你看到的是每个字符对应的字节数字,这是计算机底层的原始数据。
str****:Unicode 字符串(人类可读文本)str里面保存的是Unicode 码点,是专门给人类阅读的文本字符,支持全世界各国语言,汉字、拼音重音、emoji 都可以直接存。
a = 'au0300 propos'print(list(a))print(a)
输出:
['a', '`', ' ', 'p', 'r', 'o', 'p', 'o', 's']à propos
✨重点划黑板:strUnicode 文本本身没有绑定任何编码!bytes字节本身也不知道自己是什么编码!
❗编码 encode / 解码 decode 是桥梁
编码解码必须手动指定编码(最常用 UTF‑8),千万不要无脑依赖系统默认编码,不同操作系统默认编码不一样,这就是跨平台 BUG 的元凶!
🥪 经典设计模式:Unicode 三明治(Unicode sandwich)
书中提出一个非常经典的工程实践方案 ——Unicode 三明治。
🥪三明治结构:
好处:
业务逻辑不用关心输入到底是 Latin‑1、Shift JIS、Big5 哪一种编码,全部统一转为 Unicode 处理;
对外输出统一使用 UTF‑8 编码,规避大量编码兼容问题;
从根源减少 bytes 和 str 混用带来的莫名其妙异常。
简单说:边界处理字节,业务只玩字符串。
🛠️ 写两个万能转换工具函数
现实开发中,接口、文件读取经常会拿到混合类型,一会 bytes 一会 str。与其到处写 if 判断,不如封装两个工具函数,保证输入输出类型可控。
to_str:不管输入是 bytes 还是 str,返回 str
def to_str(bytes_or_str): """统一转为Unicode字符串str""" if isinstance(bytes_or_str, bytes): value = bytes_or_str.decode("utf-8") else: value = bytes_or_str return valueprint(repr(to_str(b'foo')))print(repr(to_str('bar')))
输出
to_bytes:不管输入是 bytes 还是 str,返回 bytes
def to_bytes(bytes_or_str): """统一转为原始字节bytes""" if isinstance(bytes_or_str, str): value = bytes_or_str.encode("utf-8") else: value = bytes_or_str return valueprint(repr(to_bytes(b'foo')))print(repr(to_bytes('bar')))
输出
💡小提示:项目可以把这两个工具放到 common 公共工具模块,哪里需要直接调用,避免到处重复写编解码逻辑。
⚠️大坑一:bytes 和 str 不能混用!看着像,实际水火不容
很多人以为二者都是字符串,可以随便拼接、比较。大错特错!两者类型不兼容,很多操作直接报错,甚至静默出错。
1. 加法拼接 +
✅ bytes + bytes ✅ str + str ❌ bytes + str 直接抛异常
print(b'one' + b'two') # b'onetwo'print('one' + 'two') # onetwo# 下面两行全部报错!# b'one' + 'two'# 'one' + b'two'
执行会得到:TypeError: Can't concat str to bytes
2. 大小比较 ><
同类型可以比,跨类型直接报错
assert b'red' > b'blue'assert 'red' > 'blue'# 下面会报错# assert 'red' > b'blue'
3. 相等判断 == 【最容易踩的隐形坑】
哪怕字面内容完全一样,bytes 和 str 互相比较永远 False!
print(b'foo' == 'foo')# >>> False
这个不会抛异常,会悄悄返回 False,业务逻辑出错很难排查!
4. 格式化 % 占位符
print(b'red %s' % b'blue') # ✔ b'red blue'# print(b'red %s' % 'blue') # ❌报错,不知道用什么编码把str转字节
- str 格式串填 bytes 不会报错,但结果离谱!
print('red %s' % b'blue')# 输出:red b'blue'
😱看到没有,输出直接带上了b''标记! 原理:Python 会调用 bytes 对象的__repr__(),打印对象的表示,而不是把字节解码成文本。这是静默 BUG,不会抛错,但是输出结果完全不符合预期。
✅总结:千万不要图省事 bytes 和 str 混着用,要么全部转 str,要么全部转 bytes。
⚠️大坑二:文件 open 模式,文本模式 vs 二进制模式
这是从 Python2 迁移过来的开发者高频踩坑点!open()打开文件,模式分两大类:
❌错误示范:文本模式写 bytes
with open("data.bin", "w") as f: f.write(b'xf1xf2xf3xf4xf5')
报错:TypeError: write() argument must be str, not bytes
“w” 是文本模式,只接受 str,字节数据请用wb!
✅正确二进制写入
with open("data.bin", "wb") as f: f.write(b'xf1xf2xf3xf4xf5')
❌错误示范:用文本模式读取二进制文件
withopen("data.bin", "r") as f: data = f.read()
报错 UnicodeDecodeError!r文本模式会拿系统默认编码(大多 UTF‑8)尝试把原始字节解码为字符串,而二进制数据根本不是合法 UTF‑8,直接解码失败。
✅正确二进制读取
with open("data.bin", "rb") as f: data = f.read()assert data == b'xf1xf2xf3xf4xf5'
💡重要小技巧:文本模式务必显式指定 encoding
如果你操作的是文本文件,不要依赖操作系统默认编码! 不同平台默认编码不一样,可以用这条命令查看本机默认编码:
python3 -c 'import locale; print(locale.getpreferredencoding())'
打开文件的时候,把encoding参数写死,彻底消除跨平台差异:
# cp1252 老Windows编码示例withopen("data.bin", "r", encoding="cp1252") as f: data = f.read()
📝记住: 读写图片、压缩包、音频、原始二进制文件:rb/wb 读写 txt、csv 等文本文件:r/w,务必带上encoding="utf-8"
📝本篇要点总结(摘抄原书精华)
bytes存储 8 位原始字节序列;str存储 Unicode 码点人类文本。
建议封装转换工具函数,保证输入类型可控,践行 Unicode 三明治原则:边界做编解码,业务内部只用 str。
bytes 与 str 不能混用+、>、==、%等运算符,混用要么报错,要么产生看不见的逻辑 bug。
读写二进制文件,使用rb/wb二进制打开模式。
读写文本文件,不要相信系统默认编码,open 函数显式传入encoding参数。
✍️写在最后
编码问题一直是 Python 里面很玄学的一块,很多人遇到报错就乱加.encode()、.decode()瞎试。 读完这篇希望大家记住核心逻辑:分清什么是字节,什么是文本,把编解码收敛在程序出入口,业务逻辑远离原始字节,就可以避开 90% 编码相关的坑。
后续继续更新 Effective Python 系列其他条款,欢迎一起交流踩坑经验~
这篇博客可以直接用于技术平台发布,工作任务模式还能帮你补充目录、文章标签、摘要以及拓展练习题,要不要使用?