
Python 3.15最终beta:frozendict等了十年,编码地狱终结,采样分析器快到离谱
7月18号晚上11点,Python 3.15.0b4发布了。最终beta,下一个就是RC了。
我在pyenv里装了一个,打算随便看看新特性。结果一测就到了凌晨3点。
不是夸张。这次更新的几个东西,确实让我有种"终于"的感觉。
frozendict:这个我等了十年
说真的,frozenset 2006年就有了。frozendict 硬是拖到了2026年。
二十年。
你知道Python里有个经典的坑吗?函数默认参数用可变对象:
# 经典翻车现场
def add_item(item, target={}):
target[item] = True
return target
print(add_item("a")) # {'a': True}
print(add_item("b")) # {'a': True, 'b': True} ← 不是 {'b': True}!
每个Python教程都会讲这个坑。解法一直是"用None当默认值,函数里再初始化"。但说实话,很多时候你就是想传一个不可变的默认配置字典进去。以前只能用 types.MappingProxyType 包一层,或者手动转tuple再转回来,丑得要命。
现在:
# Python 3.15
DEFAULTS = frozendict(
timeout=30,
retry=3,
encoding="utf-8"
)
def fetch(url, params=DEFAULTS):
# params 永远不会被修改,安全
return params["timeout"]
# 试图修改?直接报错
DEFAULTS["timeout"] = 60
# TypeError: 'frozendict' object does not support item assignment
而且它能哈希。能当字典的key,能放进set里:
config_a = frozendict(host="localhost", port=8080)
config_b = frozendict(port=8080, host="localhost")
# 顺序不同,但相等
print(config_a == config_b) # True
print(hash(config_a) == hash(config_b)) # True
# 能当set元素,自动去重
configs = {config_a, config_b} # 只有一个元素,因为相等
这里有个细节值得注意:frozendict 不是 dict 的子类,直接继承 object。所以你的代码里如果有 isinstance(x, dict) 这种检查,frozendict 不会通过。迁移的时候得改成 isinstance(x, (dict, frozendict)) 或者更宽泛的 collections.abc.Mapping。
我花了大概20分钟把项目里几个配置常量从 dict 改成 frozendict,跑了一遍测试,没出问题。标准库的 json、pickle、copy 都已经支持了。eval() 和 exec() 也接受 frozendict 当 globals。
sentinel:告别 object() 土办法
这个比较小,但我真的很想吐槽。
Python里写"可选参数,但None是合法值"的时候,你怎么办?比如一个搜索函数,limit=None 表示不限制,limit=10 表示返回10条,但万一用户就想传 None 当占位符呢?
以前的标准操作:
# 以前的土办法,每个模块都要来一遍
_MISSING = object()
def search(query, limit=_MISSING):
if limit is _MISSING:
limit = 10
...
每个模块各自定义各自的 _MISSING = object(),互相不兼容。类型检查器也头疼,得写一堆 Union 和 overload。
3.15 给了内置的 sentinel:
# Python 3.15
NOT_SET = sentinel("NOT_SET")
def search(query, limit=NOT_SET):
if limit is NOT_SET:
limit = 10
...
干净。而且 sentinel 支持类型表达式,能直接用在类型注解里,mypy 终于不用猜了。
推导式解包:一行干掉两层循环
这个特性看着小,但我实际用起来是真香。
以前要扁平化嵌套列表:
# 以前:两层循环,第一次看的人要愣一下
matrix = [[1, 2], [3, 4], [5, 6]]
flat = [x for row in matrix for x in row]
# [1, 2, 3, 4, 5, 6]
现在:
# Python 3.15
flat = [*row for row in matrix]
# [1, 2, 3, 4, 5, 6]
字典也能用。我项目里有个地方在做API响应合并,多个字典后面的覆盖前面的:
# 合并多个配置字典
configs = [{"host": "a"}, {"port": 8080}, {"host": "b"}]
merged = {**c for c in configs}
# {'host': 'b', 'port': 8080}
以前写 {k: v for d in dicts for k, v in d.items()},现在一行 {**d for d in dicts} 搞定。
不过有个事得提一嘴:这种写法对不熟悉的人来说需要适应。团队里有个刚来的实习生看到 [*row for row in matrix] 愣了10秒问我这是什么语法。所以如果你团队Python水平参差不齐,斟酌一下再大规模用。
lazy imports:启动速度直接起飞
这个是我测得最久的。
Python 3.15 加了 lazy 软关键字:
# 正常导入:模块立刻加载
import json
# 延迟导入:首次使用时才加载
lazy import json
print("启动中...") # json 还没加载
data = json.loads('{"key": "value"}') # 这里才加载
我拿一个内部工具试了一下。这个工具 import 了 47 个模块,冷启动 2.3 秒。把几个重模块改成 lazy 之后:
lazy import pandas as pd
lazy import numpy as np
lazy import matplotlib.pyplot as plt
lazy from sqlalchemy import create_engine
# ... 其他重模块
冷启动从 2.3 秒降到 0.8 秒。pandas 那堆东西占了大头,延迟到真正用的时候才加载。
但有几个坑你得知道。
lazy 只能在模块顶层用,函数体里写会直接
SyntaxError。而且模块加载失败的异常会延迟到首次使用时才抛出来——不是 import 的时候。所以如果你的 import 语句本身就是在做合法性检查(比如检测某个依赖是否装了),lazy 反而会把这个检测推迟到运行时。
还有,lazy from module import * 和 lazy from __future__ import ... 都不支持,写了就报错。
我建议只对启动时不一定用到的重模块加 lazy,像 os、sys 这种肯定要用的就别折腾了,反而增加心智负担。
UTF-8 默认编码:Windows 用户的春天
这个变化可能是影响面最广的。
以前在 Windows 上:
# Windows 上,open() 默认编码是 GBK(CP936)
with open("data.txt", "w") as f:
f.write("你好世界")
# 换台 Linux 机器,或者 Docker 容器里跑
# 编码不对,乱码
# 或者更惨:读一个 UTF-8 的文件,直接 UnicodeDecodeError
每个在 Windows 上写过 Python 的人都被这个坑过。解法一直是显式写 encoding="utf-8",但总有人忘。code review 里来回复这个问题,烦都烦死了。
3.15 开始,默认编码就是 UTF-8 了,不管你是什么系统。
# Python 3.15:所有平台默认 UTF-8
with open("data.txt", "w") as f:
f.write("你好世界") # UTF-8,没有悬念
如果你有老代码依赖 locale 编码(比如读系统配置文件),设 PYTHONUTF8=0 环境变量可以回退到旧行为。但我建议趁这个机会把所有 open() 都加上显式 encoding 参数,一劳永逸,跨版本也不会出问题。
Tachyon 采样分析器:快到不像话
这个是我觉得最被低估的特性。
以前做性能分析用 cProfile:
import cProfile
cProfile.run("my_function()")
问题在于 cProfile 是确定性追踪——每个函数调用都记录,开销巨大。我之前分析一个处理 50 万条数据的脚本,加 cProfile 后运行时间从 40 秒变成 2 分钟。分析器本身比程序还慢,这还分析个什么劲。
3.15 新增了 profiling 包,里面有个 Tachyon 采样分析器。不是追踪每次调用,而是周期性拍快照,采样率最高 1,000,000 Hz。
# Python 3.15 命令行直接用
# 运行并分析脚本
python -m profiling.sampling run --mode wall my_script.py
# 附加到正在运行的进程
python -m profiling.sampling dump <PID>
# 生成火焰图
python -m profiling.sampling run --flamegraph my_script.py
--mode 参数有几个选项:
wall 是挂钟时间(默认),
cpu 只看 CPU 时间,
gil 采样 GIL 持有时间。
--flamegraph 直接生成自包含的交互式 HTML 火焰图。
我拿那个 50 万条数据的脚本测了,Tachyon 的开销几乎感觉不到,运行时间还是 40 秒左右。而 cProfile 要 2 分钟。
输出格式除了火焰图还有 --pstats(兼容老格式)、--collapsed(折叠堆栈,配合火焰图工具用)、--gecko(Firefox Profiler 格式)。甚至有个 --live 模式,top 式 TUI 实时界面,类似 Linux 的 htop 但看的是 Python 函数。
要不要升级?我的建议
3.15 正式版秋季发布,现在是最终 beta。我的建议:
现在就在隔离环境里装一个测试。# 用 pyenv
pyenv install 3.15.0b4
pyenv virtualenv 3.15.0b4 test315
# 或者用 uv
uv python install 3.15.0b4
uv venv --python 3.15.0b4 test315
跑一遍你的测试套件,看看有没有被 break。特别注意几个点:
isinstance(x, dict) 的地方,如果开始接受 frozendict 输入,需要改成
(dict, frozendict)。默认编码变了,Windows 上的文件操作行为会变,赶紧加显式
encoding。
cProfile 还在,向后兼容别名,但
profile 模块标记弃用了,3.17 会移除。
别在生产环境用 beta 版。 等秋季正式版。但早点测,早点发现问题。
frozendict 等了十年,UTF-8 默认编码等了更久。Python 慢是慢了点,但这些特性确实在往对的方向走。
觉得有用的话,点个赞或者在看,下期继续分享实用的编程技巧。
作者:几行代码 | 公众号:几行代码