很多人第一次学 Python 爬虫,都会直接从网上复制一段代码:配置请求头、发送请求、解析网页、提取链接,然后保存文件。代码看起来不长,真正运行时却经常遇到返回空数据、页面结构找不到、JSON 解析失败等问题。
其实,网页数据采集的核心并不是“背代码”,而是先弄清楚数据到底藏在哪里。
一套完整的处理流程,通常包括发送 HTTP 请求、获取网页源码、使用 XPath 定位脚本标签、解析 JSON 数据,以及提取目标资源地址。像 User-Agent、Referer、Cookie 这些参数,也不是随便复制进去的,它们分别承担浏览器标识、来源说明和登录状态传递等作用。
这篇内容会按照实际开发顺序,把 requests、lxml 和 json 三个核心库串起来,带你看懂网页请求、源码分析、数据定位和文件保存的完整逻辑。重点不是教你套模板,而是让你掌握一套可以迁移到不同公开网页的数据采集思路。
实际使用时应遵守网站服务协议、版权要求和 robots 规则,只采集获得授权或允许公开访问的数据。