Python爬取智联招聘职位:监听接口+新Tab精准采集,拿全薪资与HR活跃状态
做Python爬虫的朋友,大多都写过招聘网站的数据采集。无论是做薪酬分析、人才流动研究,还是求职市场洞察,智联招聘的职位数据都是绕不开的一站。如果你还傻傻地在原页面监听接口,或者直接用 requests 模拟翻页,结果只有一个——数据抓不到,或者被反爬拦截。今天这篇,我只公开核心思路和关键字段的提取逻辑,至于新 Tab 绑定监听、翻页稳定性控制、职位标签清洗规则,属于付费级细节。想直接拿完整源码的,文末有入口。一、为什么智联招聘值得爬?
字段分析价值薪资(salary60)市场薪酬基准招聘人数岗位紧急程度发布时间招聘活跃度HR活跃状态HR响应概率职位标签JD关键词画像行政区 / 街道城市用工分布👉 这些数据,招聘平台不给你批量导出,但爬虫可以。二、核心难点
1️⃣ 新 Tab 监听(90%的人会踩坑)
首页输入关键词 → 点击搜索 → 新 Tab 打开列表页✅错误做法:在原页面 dp.listen.start()tab = dp.ele('css:.search-wrapper__button').click.for_new_tab()tab.listen.start('/c/i/search/positions')👉监听必须绑定到新 Tab,否则接口永远监听不到。2️⃣ 翻页的稳定性问题
next_btn = tab.ele('text=下一页', timeout=5)if next_btn: next_btn.click()👉不判断 class,直接尝试点击 + try/catch是最稳的方案。3️⃣ 职位标签的数组清洗
"showSkillTags":[{"tag":"五险一金"},{"tag":"年底双薪"}]✅解法:数组遍历 + 逗号拼接(完整清洗函数暂不公开)4️⃣ HR活跃状态的隐性价值
👉这是判断投递成功率的重要信号,很多爬虫直接忽略了。三、我能告诉你的
✅ 搜索框定位:css:.search-wrapper__input✅ 搜索按钮:css:.search-wrapper__button✅ 接口路径:/c/i/search/positions四、我故意不告诉你的
❌ for_new_tab() 后的Tab 生命周期管理(防止内存泄漏)五、这套数据能干什么?
爬虫不难,难的是在招聘网站这种强反爬环境下,稳定拿到干净数据。