很多新手写爬虫,时间都浪费在查语法、找选择器和处理报错上。现在更高效的方法不是让 AI“一键生成”,而是把需求说清楚,让 AI完成代码框架,你负责检查网页结构和运行结果。
下面用 Python 抓取网页中的文章标题和链接,并保存成 Excel。
一、先准备环境
打开终端执行:
二、直接把需求发给 AI
可以使用下面这段提示词:
三、完整爬虫代码
把这里的地址:
换成需要抓取的网页地址,然后运行:
运行完成后,当前目录会生成:
四、让爬虫抓得更准确
上面的代码会抓取网页中所有链接,数据可能比较杂。想精准抓取,需要找到目标内容的 CSS 选择器。
例如网页结构是:
就把代码中的:
修改为:
需要注意的是,requests 主要适合抓取服务器直接返回的静态网页。如果数据必须等待浏览器加载,通常需要寻找网页接口,或者改用 Playwright、Selenium。
1️⃣ 遵守目标平台的robots.txt协议;
2️⃣ 不爬取敏感/未公开数据(尤其是个人信息);
3️⃣ 控制请求频率,不影响平台正常运行;