当前位置:首页>python>深入浅出 collections:Python 标准库里的“数据容器百宝箱”

深入浅出 collections:Python 标准库里的“数据容器百宝箱”

  • 2026-08-22 20:16:16
深入浅出 collections:Python 标准库里的“数据容器百宝箱”

深入浅出 collections:
Python 标准库里的"数据容器百宝箱"

还在用 dict 手动计数、用 list 自己写队列、为坐标点定义一堆字段头疼?collections 是 Python 标准库里最实用的容器模块,几行代码就能让计数、分组、队列、结构化数据变得优雅又高效。


一、为什么是 collections?

collections 是 Python 自 2.4 起就内置于标准库的高性能专用容器模块。它解决的不是"能不能做"的问题——毕竟你用原生 dict、list、tuple 也能搞定一切——而是"能不能做得更优雅、更快、更少出 bug"的问题。官方对它的一句话定位是:"高性能容器数据类型"(high-performance container datatypes)。

它里头的每一个类,都是对某个高频场景的精准抽象:计数要用 Counter、按 key 分组要用 defaultdict、两端进出要用 deque、带字段名的记录要用 namedtuple、需要记住顺序的字典曾经是 OrderedDict……这些需求几乎每个 Python 工程师每周都会撞上,而 collections 已经把最优实现造好了。掌握了它,你会发现很多本来要十几行的样板代码,一行就搞定了。

🔢 Counter — 一行完成计数统计,自带 most_common 排行榜。

📚 defaultdict — 访问不存在的 key 自动给默认值,告别 KeyError。

🔁 deque — 双端队列,头部插入/弹出比 list 快几个数量级。

🏷️ namedtuple - 轻量不可变对象,既能点访问又比 dict 省内存。

二、Counter:一行搞定计数统计

Counter 是 collections 里使用率最高、最让人惊艳的类。它本质是个"带计数的 dict":把可迭代对象(字符串、列表、文件行……)丢给它,它就自动统计每个元素出现的次数。以前你要写 for x in lst: d[x] = d.get(x, 0) + 1,现在一行就完事。

from collections import Counter

votes = ["苹果", "香蕉", "苹果", "橙子", "香蕉", "苹果"]
c = Counter(votes)
print(c)                  # Counter({'苹果': 3, '香蕉': 2, '橙子': 1})
print(c["苹果"])          # 3
print(c["葡萄"])          # 0(不存在的 key 不会报错,返回 0)

注意一个贴心细节:Counter 对不存在的 key 返回 0 而不是抛 KeyError,这点和 defaultdict(int) 很像。但它还额外送了你一堆超好用的方法。

most_common:直接出排行榜

most_common(n) 会按出现次数从高到低返回前 n 个 (元素, 计数) 元组。做热词、投票榜、Top-N 分析时简直是量身定制。

text = "abracadabra"
c = Counter(text)
print(c.most_common(3))   # [('a', 5), ('b', 2), ('r', 2)]
print(c.most_common(1))   # [('a', 5)]  最热门的那个

# 实战:统计一篇文章中出现最多的单词
import re
with open("article.txt", encoding="utf-8") as f:
    words = re.findall(r"\w+", f.read().lower())
top10 = Counter(words).most_common(10)

Counter 的"数学运算":加减合并

Counter 重载了 + 和 -,可以直接对两个计数做合并或差额,还会自动剔除结果为 0 或负数的项。做"两天投票变化""A/B 组差异"之类的分析特别顺手。

c1 = Counter(a=3, b=1)
c2 = Counter(a=1, b=2, c=4)
print(c1 + c2)   # Counter({'c': 4, 'a': 4, 'b': 3})
print(c1 - c2)   # Counter({'a': 2})  只保留正数部分
print(c2 - c1)   # Counter({'c': 4, 'b': 1})

💡 心智模型:把 Counter 想象成一个"会自动数数、还会做加减法的智能货架"——你往里丢东西它就记账,问它"谁最多"它立刻报排行榜,把两个货架合并它自动算总账。

三、defaultdict:再也不用判断 key 是否存在

写原生 dict 时,最烦的一件事就是访问一个还没创建的 key。比如要把一堆数据按城市分组,你得先 if city not in d: d[city] = [] 再 d[city].append(x)。defaultdict 把这套样板彻底消灭:你给它一个"工厂函数",它就在 key 缺席时自动调用工厂生成默认值。

from collections import defaultdict

# 按首字母把单词分组
groups = defaultdict(list)
for w in ["apple", "ant", "banana", "bag", "cat"]:
    groups[w[0]].append(w)

print(groups["a"])   # ['apple', 'ant']
print(groups["z"])   # []  不存在的 key 自动变成空列表,不报错

工厂函数可以是 list、int、set,甚至你自定义的 callable。int 作工厂时默认值是 0,于是它就摇身一变成了"计数版 dict",效果和 Counter 异曲同工。

嵌套 defaultdict:自动成长的字典树

最骚的用法是嵌套 defaultdict:让工厂函数返回另一个 defaultdict,于是任意深度的层级结构都能"凭空长出",完全不用一层层预判。做词频的二维统计、树形菜单、邻接表时极爽。

# 自动成长的二维计数表:行 -> 列 -> 次数
tree = defaultdict(lambda: defaultdict(int))
tree["用户A"]["点击"] += 1
tree["用户A"]["点击"] += 1
tree["用户A"]["购买"] += 1
print(tree["用户A"])        # defaultdict(, {'点击': 2, '购买': 1})
print(tree["用户B"]["点击"]) # 0,全自动补默认值

💡 何时用 defaultdict vs Counter? 如果只是"数数",Counter 更语义化、自带 most_common;如果需要"按 key 分组装列表/集合",defaultdict(list/set) 更合适。两者常常能互相替代,看哪个读起来更顺。

四、deque:双端队列,头部操作快几个数量级

deque(发音 "deck",double-ended queue 的缩写)是双端队列。它和 list 最大的区别在于:在两端添加/删除元素都是 O(1),而 list 在头部 insert(0, x) 或 pop(0) 要 O(n)——因为后面所有元素都得搬家。当数据量大、又频繁在头部操作时,deque 能快成百上千倍。

from collections import deque

dq = deque([1, 2, 3])
dq.append(4)        # 右侧入队  -> [1, 2, 3, 4]
dq.appendleft(0)    # 左侧入队  -> [0, 1, 2, 3, 4]
dq.pop()            # 右侧出队  -> 4
dq.popleft()        # 左侧出队  -> 0
print(dq)           # deque([1, 2, 3])

maxlen:天生的"滑动窗口"

deque 有个独门绝技参数 maxlen:一旦设定,队列永远只保留最近 N 个元素,满了再往里加,最老的那个自动被挤掉。做"最近 10 条日志""股价滑动窗口""限流器"时,比手写 list + 切片优雅太多。

recent = deque(maxlen=3)
for i in range(5):
    recent.append(i)
    print(list(recent))
# [0]
# [0, 1]
# [0, 1, 2]
# [1, 2, 3]   <- 超过 3 个,最老的 0 被挤掉
# [2, 3, 4]

rotate:循环移位小魔术

rotate(n) 把元素整体向右(n>0)或向左(n<0)循环移动,常用于轮询、循环调度。配合 maxlen 还能轻松实现"固定长度环形缓冲"。

dq = deque([1, 2, 3, 4, 5])
dq.rotate(2)    # 向右循环 2 位
print(dq)       # deque([4, 5, 1, 2, 3])
dq.rotate(-1)   # 向左循环 1 位
print(dq)       # deque([5, 1, 2, 3, 4])

五、namedtuple:轻量不可变对象,比 dict 省内存还能点访问

namedtuple 用一行就造出一个带字段名的元组子类。你既能像元组一样按索引取、又能像对象一样用 . 点访问字段。它不可变、内存占用极小(比 dict 省好几倍),特别适合表示"坐标、记录、配置项"这类结构化但不需要修改的数据。

from collections import namedtuple

Point = namedtuple("Point", ["x", "y"])
p = Point(3, 4)
print(p.x, p.y)    # 3 4  点访问
print(p[0])        # 3     也支持下标
print(p)           # Point(x=3, y=4)  自动的友好 repr

自带的好用方法:_make / _asdict / _replace / _fields

namedtuple 免费赠送了几个下划线方法,日常极好用:_make 从可迭代对象构造、_asdict 转成 OrderedDict、_replace 生成"改了某字段"的新副本(因为它不可变)、_fields 拿到字段名元组。

Point = namedtuple("Point", ["x", "y"])
p = Point(1, 2)
print(p._fields)            # ('x', 'y')
print(p._replace(x=10))     # Point(x=10, y=2)  返回新对象,原对象不变
print(p._asdict())          # {'x': 1, 'y': 2}
q = Point._make([7, 8])     # Point(x=7, y=8)  从列表构造

💡 namedtuple vs dataclass? 前面我们讲过 dataclasses——它是"可变的、功能更全的数据类"。区别一句话:不需要修改、追求极省内存、要当元组用 → namedtuple;需要默认值/方法/可变性 → dataclass。两者都是"少写样板"的利器,按需求取舍即可。

六、OrderedDict:记住插入顺序的字典(及 3.7+ 的变迁)

OrderedDict 是一个会记住键值插入顺序的字典。在 Python 3.6 以前,原生 dict 是无序的,想保序只能靠它;但从 Python 3.7 起,原生 dict 也保证插入顺序了,于是 OrderedDict 的存在感下降。不过它仍有独门价值:move_to_end(把某 key 移到首尾)、popitem(last=)(从头部或尾部弹出)、以及相等性比较时区分顺序(两个内容相同但插入顺序不同的 OrderedDict 不相等,而 dict 相等)。

from collections import OrderedDict

od = OrderedDict()
od["b"] = 2
od["a"] = 1
od["c"] = 3
od.move_to_end("a")        # 把 a 移到最后
print(list(od))            # ['b', 'c', 'a']
od.popitem(last=False)     # 从头部弹出
print(list(od))            # ['c', 'a']

实战里它常出现在LRU 缓存、需要"最近使用移到队尾"的场景——事实上 functools.lru_cache 的内部就是基于类似有序结构的。日常若只需"保序遍历",用原生 dict 足矣。

七、ChainMap:把多个字典"叠"成一个视图

ChainMap 把多个 dict 逻辑上拼成一个,查找时按传入顺序依次在各级字典里找,找到即返回。它不复制数据、只是视图,因此非常省内存。最经典的应用是"作用域/优先级":比如命令行参数 > 环境变量 > 默认配置,把三层叠起来,读值时自动取最高优先级的那层。

from collections import ChainMap

defaults = {"color": "红", "size": "M"}
user_cfg = {"size": "L"}
merged = ChainMap(user_cfg, defaults)   # 前面的优先级更高
print(merged["size"])    # 'L'  取用户配置
print(merged["color"])   # '红'  用户没配,回退到默认
print(merged.maps)       # [{'size': 'L'}, {'color': '红', 'size': 'M'}]

八、UserDict / UserList / UserString:自定义容器的正确姿势

想写自己的 dict/list 子类?千万别直接继承原生 dict——因为有些方法(如 update、__init__)会绕过你重写的 __setitem__,导致你的逻辑悄悄失效。collections 提供了 UserDict、UserList、UserString 作为专门用来被继承的"包装基类",所有操作都经过你可控的接口,扩展安全又干净。

from collections import UserDict

class UpperDict(UserDict):
    # data 是底层真实存储;重写 __setitem__ 自动对所有写入生效
    def __setitem__(self, key, value):
        self.data[str(key).upper()] = value

d = UpperDict()
d["name"] = "koo"
print(d)          # {'NAME': 'koo'}   key 被自动转大写
d.update({"age": 18})
print(d)          # {'NAME': 'koo', 'AGE': 18}  update 也走同一逻辑

九、实战:用 collections 写一个迷你日志分析器

综合前面的工具,写一个真实场景:分析访问日志,统计每个 IP 的访问次数、找出 Top 5、记录每个 IP 最近访问的 3 个路径。这里 Counter + defaultdict(deque) 组合拳,代码短到不可思议:

from collections import Counter, defaultdict, deque

logs = [
    ("10.0.0.1", "/home"), ("10.0.0.2", "/api"),
    ("10.0.0.1", "/login"), ("10.0.0.1", "/home"),
    ("10.0.0.2", "/home"), ("10.0.0.3", "/api"),
]

counts = Counter(ip for ip, _ in logs)          # 每个 IP 访问次数
recent = defaultdict(lambda: deque(maxlen=3))   # 每个 IP 最近 3 个路径
for ip, path in logs:
    recent[ip].append(path)

print("访问排行:", counts.most_common(5))
# [('10.0.0.1', 3), ('10.0.0.2', 2), ('10.0.0.3', 1)]
print("10.0.0.1 最近访问:", list(recent["10.0.0.1"]))
# ['/home', '/login', '/home']

这一小段把 collections 的三件套串起来了:Counter 出排行、defaultdict 自动分组、deque(maxlen=) 管住最近 N 条。放到真实项目里,这就是日志监控、用户行为分析的"标准姿势"。

十、组合拳:三个常见高阶套路

套路 A:Counter + most_common — 任何"Top-N 排行"需求(热词、热销、热门 IP)一行出榜。

套路 B:defaultdict(deque) - 每个 key 自带一个定长滑动窗口,做"每用户最近 N 条"。

套路 C:ChainMap 做优先级 - 命令行 > 环境 > 默认,三层配置叠成一个,读取自动回退。

十一、新手最常踩的 6 个坑

1. 误以为 Counter 不存在的 key 会报 KeyError:它返回 0,这点和普通 dict 不同,逻辑里别假设会抛异常。

2. defaultdict 遍历时"无中生有":哪怕只读取 d[key] 也会创建 key,导致遍历中出现本不存在的空值,注意别污染数据。

3. 把 deque 当 list 用全功能:deque 不支持切片、没有 list 的 insert(i) 任意位置插入,需要中间操作时还是用 list。

4. namedtuple 不可变却想改字段:直接用 p.x = 5 会报 AttributeError,记得用 _replace 生成新对象。

5. 直接继承原生 dict 扩展行为:update/__init__ 会绕过重写逻辑,改用 UserDict。

6. OrderedDict 与 dict 相等性混淆:内容相同顺序不同的 OrderedDict 不相等,而 3.7+ 的 dict 只看内容,比较前先想清楚要不要保序。

十二、collections 速查表

场景 collections 写法
计数 / Top-N 排行 Counter + most_common()
按 key 分组装列表 defaultdict(list)
两端频繁进出 / 滑动窗口 deque(可选 maxlen)
轻量结构化记录 namedtuple
需要移动/弹出顺序的字典 OrderedDict
多层配置优先级 ChainMap
安全地自定义 dict 子类 UserDict / UserList

一句话总结:collections 是 Python 工程师的"数据容器百宝箱"。Counter 让它秒出排行,defaultdict 让它告别判空,deque 让它两端飞快,namedtuple 让它又轻又清爽。和前面讲过的 functools、Pathlib、Typer 一样,它也是现代 Python "基础肌肉记忆"的一部分。下次写计数、分组、队列前,先问一句:这事,collections 一行能不能搞定?

🚀 立即行动

from collections import Counter, defaultdict, deque, namedtuple → 计数用 Counter.most_common → 分组用 defaultdict(list) → 滑动窗口用 deque(maxlen=N)。

collections 官方文档:https://docs.python.org/3/library/collections.html(含完整 API 与示例)

— END —
关注我们,每周一个 Python 热门技术实战教程

最新文章

随机文章