当前位置:首页>python>Python 基础知识:集合——去重只是它最简单的能力

Python 基础知识:集合——去重只是它最简单的能力

  • 2026-10-11 06:37:42
Python 基础知识:集合——去重只是它最简单的能力

新人公众号制作实属不易😭

希望有所收获的宝子们多多支持 

↓ ↓ ↓ ↓ 后续会更新更多干货内容


Python 基础知识:集合——去重只是它最简单的能力

一份名单里重复姓名越来越多,你会继续手动删,还是换一种数据结构?

假设你把报名名单、文件扩展名或用户标签保存在列表中。数据少时,重复一两项似乎不难处理;可一旦名单不断追加,手动判断“这个值是否已经出现过”就会变得麻烦,还容易漏掉。

Python 的 集合 set 正适合解决这类问题。它不仅会自动去除重复元素,还擅长进行成员判断,以及比较两组数据的共同项和不同项。

这篇文章会从集合的创建、增删和遍历讲起,再逐步掌握并集、交集、差集、子集、集合推导式、frozenset 与保序去重。读完后,你会知道集合什么时候特别好用,也会知道什么时候不该使用它。


一、集合是什么?

集合是一种保存唯一元素的容器。它最重要的三个特点是:无序、不重复、可变。

1tags ={"Python", "Excel", "Python", "AI"}

2

3print(tags)

4print(len(tags))

集合里虽然写了两次 "Python",最终只会保留一个。由于集合无序,第一行的显示顺序可能因运行环境而不同,但元素内容不变;第二行一定输出 3。

特点

含义

直接影响

无序

不按固定位置保存元素

不支持索引和切片

不重复

相等元素只保留一个

很适合去重

可变

可以增删元素

普通 set 不能作为字典键

元素必须可哈希

元素应具有稳定哈希值

列表、字典和普通集合不能放入集合

先判断是否适合 如果你只关心“有哪些唯一元素”和“某个元素是否存在”,集合通常非常合适;如果你还需要固定顺序、索引位置或保存重复次数,就应考虑列表或字典。


二、创建集合:花括号还是 set()?

1. 创建非空集合

最直观的写法是把多个元素放在花括号中:

1numbers ={1, 2, 3}

2colors ={"red", "green", "blue"}

3

4print(type(numbers))

1

2. 空集合必须写 set()

这里有一个非常容易混淆的细节:{} 创建的是空字典,不是空集合。

1empty_set =set()

2empty_dict ={}

3

4print(type(empty_set))

5print(type(empty_dict))

1

2

记忆方法 非空集合可以使用花括号,空集合只能使用 set()。看到单独的 {},应把它理解为空字典。

3. 将其他可迭代对象转换成集合

set() 可以接收列表、元组、字符串等可迭代对象,并把其中的元素逐个加入集合。

1print(sorted(set([3, 1, 3, 2, 1])))

2print(sorted(set("banana")))

3print(sorted(set(("red", "blue", "red"))))

1[1, 2, 3]

2['a', 'b', 'n']

3['blue', 'red']

这里使用 sorted() 只是为了让演示结果稳定。它返回的是排序后的列表,并不会让集合本身变成有序容器。


三、集合的增、删、查

1. add() 与 update()

add() 添加一个完整元素;update() 接收可迭代对象,把其中的元素逐个加入集合。

1skills ={"Python", "Excel"}

2

3skills.add("SQL")

4skills.update(["Git", "Python"])

5

6print(sorted(skills))

1['Excel', 'Git', 'Python', 'SQL']

重复加入 "Python" 不会报错,也不会产生第二份。要注意,skills.add(["Git", "SQL"]) 会报 TypeError,因为列表不可哈希;如果想加入多个值,应使用 update()。

2. 四种删除方式怎么选?

方法

作用

元素不存在时

remove(x)

删除指定元素

抛出 KeyError

discard(x)

删除指定元素

什么也不做

pop()

删除并返回任意元素

空集合抛出 KeyError

clear()

清空整个集合

不会报错

1numbers ={1, 2, 3}

2

3numbers.remove(1)

4numbers.discard(99)

5removed = numbers.pop()

6

7print(removed)

8print(numbers)

当元素必须存在时,可以使用 remove(),让异常及时暴露问题;当元素可能不存在时,discard() 更稳妥。

不要误解 pop() 集合没有“第一个”或“最后一个”元素,因此 set.pop() 删除的是任意元素。不要依赖它删除某个固定位置的值。

3. 使用 in 做成员判断

集合很适合需要频繁判断“某个值是否允许、是否出现过”的场景,例如扩展名白名单:

1allowed ={"jpg", "png", "gif"}

2

3print("png"in allowed)

4print("exe"notin allowed)

1True

2True

集合通常基于哈希进行成员查找。在数据量较大、需要重复执行 in 判断时,它一般比从头扫描列表更合适。不过,集合的优势是平均情形下的查找效率,不应把它理解为任何情况下都一定更快。

4. 遍历集合时不要依赖顺序

1colors ={"red", "green", "blue"}

2

3for color insorted(colors):

4print(color)

1blue

2green

3red

如果只是逐个处理元素,可以直接遍历集合;如果输出需要稳定、可预测,就先使用 sorted()。


四、四种核心集合运算

集合真正有趣的地方,是它能用非常短的表达式比较两组数据。假设 a 和 b 分别代表两门课程的报名学生编号,那么“所有学生、共同学生、只报一门课的学生”都可以直接计算。

关系

运算符

方法

含义

并集

a | b

a.union(b)

两边出现过的全部元素

交集

a & b

a.intersection(b)

两边共同拥有的元素

差集

a - b

a.difference(b)

左边有、右边没有的元素

对称差集

a ^ b

a.symmetric_difference(b)

只在其中一边出现的元素

1a ={1, 2, 3}

2b ={3, 4, 5}

3

4print(sorted(a | b))

5print(sorted(a & b))

6print(sorted(a - b))

7print(sorted(a ^ b))

1[1, 2, 3, 4, 5]

2[3]

3[1, 2]

4[1, 2, 4, 5]

其中最容易出错的是差集具有方向:a - b 表示只在 a 中的元素,b - a 表示只在 b 中的元素,两者通常不同。

1a ={1, 2, 3}

2b ={3, 4, 5}

3

4print(sorted(a - b))

5print(sorted(b - a))

1[1, 2]

2[4, 5]

运算符形式要求两边都是集合;union()、intersection()、difference() 等方法可以接受其他可迭代对象。这是阅读不同代码写法时值得留意的区别。


五、更新原集合与判断集合关系

|、&、-、^ 会返回一个新集合,不修改原集合;对应的 |=、&=、-=、^= 会更新左侧集合。

1current ={1, 2, 3}

2

3current |={3, 4}

4print(sorted(current))

5

6current &={2, 4, 6}

7print(sorted(current))

1[1, 2, 3, 4]

2[2, 4]

判断“某组是否完全包含在另一组中”,可以使用子集和超集运算:

1required ={"read", "write"}

2permissions ={"read", "write", "comment"}

3

4print(required <= permissions)

5print(required < permissions)

6print(permissions >= required)

1True

2True

3True

<= 判断子集,< 判断真子集;>= 判断超集,> 判断真超集。所谓“真”,就是两组不能完全相等。

如果只想判断两组是否完全没有共同元素,可使用 isdisjoint():

1weekend ={"Saturday", "Sunday"}

2workdays ={"Monday", "Tuesday", "Wednesday"}

3

4print(weekend.isdisjoint(workdays))

1True

关系判断的实用场景 权限检查、课程选课、标签匹配、黑白名单冲突检测,都可以先把数据转换成集合,再用子集、交集或差集表达业务规则。


六、集合推导式与 frozenset

1. 集合推导式

集合推导式与列表推导式相似,但使用单层花括号,而且结果会自动去重。

1even_squares ={

2number **2

3for number inrange(1, 11)

4if number %2==0

5}

6

7print(sorted(even_squares))

1[4, 16, 36, 64, 100]

它也适合统一文本大小写后去重:

1words =["Apple", "apple", "BANANA", "banana"]

2normalized ={word.casefold()for word in words}

3

4print(sorted(normalized))

1['apple', 'banana']

2. 不可变集合 frozenset

普通 set 可以增删元素,因此它本身不可哈希;frozenset 创建后不能再修改,在其元素都可哈希时,可以作为字典键或另一个集合的元素。

1group_a =frozenset({"Alice", "Bob"})

2group_b =frozenset({"Carol", "David"})

3

4groups ={group_a, group_b}

5print(len(groups))

12

可以把 frozenset 理解为“冻结后的集合”。它仍支持并集、交集和成员判断,但不支持 add()、remove() 等修改方法。


七、去重之后还要保留顺序怎么办?

set(values) 可以快速得到唯一元素,但不能保证保留原列表中第一次出现的顺序。

1values =[3, 1, 3, 2, 1]

2unique =set(values)

3

4print(unique)

如果需要得到 [3, 1, 2],可以同时使用一个集合记录“是否见过”,再用列表保存结果顺序:

1values =[3, 1, 3, 2, 1]

2seen =set()

3result =[]

4

5for value in values:

6if value notin seen:

7seen.add(value)

8result.append(value)

9

10print(result)

1[3, 1, 2]

这里集合负责快速成员判断,列表负责维持顺序。不同容器各做自己擅长的事情,通常比强行让一种数据结构承担全部需求更清晰。


八、两个综合案例

案例一:比较两个人的兴趣

1alice ={"Python", "music", "reading"}

2bob ={"Python", "sports", "reading"}

3

4print("共同兴趣:", sorted(alice & bob))

5print("全部兴趣:", sorted(alice | bob))

6print("Alice 独有:", sorted(alice - bob))

7print("只属于一人:", sorted(alice ^ bob))

交集回答“共同拥有”,并集回答“合起来有哪些”,差集回答“谁独有”,对称差集回答“只出现在一边的有哪些”。只要先明确问题中的集合关系,代码就会非常直观。

案例二:检查用户权限

1required ={"read", "write", "share"}

2actual ={"read", "write"}

3

4if required <= actual:

5print("权限满足")

6else:

7missing = required - actual

8print("缺少权限:", sorted(missing))

1缺少权限: ['share']

子集判断负责确认“必需权限是否全部具备”,差集负责指出“具体缺少什么”。这种写法比多层条件判断更接近问题本身,也更容易维护。


九、常见错误速查

问题

错误认识或写法

正确处理

空集合写成 {}

以为得到空集合

使用 set()

依赖打印顺序

认为某次显示顺序固定

需要稳定输出时使用 sorted()

对集合使用索引

values[0]

集合不支持索引;需要位置就使用列表

添加列表

items.add([1, 2])

元素必须可哈希,可改用元组或 update()

删除缺失元素

不确定存在却用 remove()

使用 discard() 或先判断成员

误解 pop()

以为删除最后一项

它删除任意元素

混淆差集方向

把 a - b 当成 b - a

先明确哪一组是基准

去重后期待保序

list(set(values))

使用 seen + result 等保序逻辑

遇到集合问题时,可以先问自己三个问题:我是否只关心唯一元素?是否不依赖顺序?我要比较的是共同项、左侧独有项,还是只出现于一侧的项?这三个问题通常能迅速帮助你选对写法。


本期总结

这一期,我们掌握了集合的创建、增删、成员判断和遍历,理解了它无序、不重复、元素必须可哈希的特点,也学会了使用并集、交集、差集、对称差集、子集和 isdisjoint() 描述两组数据之间的关系。

真正需要记住的主线是:集合不只是“去重工具”,它还是表达成员关系与集合关系的工具。只要问题关心的是“有没有、共同有哪些、不同有哪些”,就值得考虑集合。


END

今天的分享就到这里,感谢你耐心读到最后。希望这篇文章能帮助你真正理解集合的使用边界:需要唯一性和关系判断时大胆使用,需要顺序和位置时及时换回合适的数据结构。我们下一期再见!

最后也想听听你的意见:下一期你希望看到哪个 Python 基础知识点? 欢迎在推文下方投票,或者在评论区留言告诉我。

最新文章

随机文章