先说下写爬虫最核心的思路,很多刚入门的新手一上手就想着直接学Scrapy框架,其实真没必要。市面上九成的静态网页,只用requests发送请求、再靠BeautifulSoup解析HTML页面就足够搞定了。整个过程就三个步骤:发送网络请求、获取网页源码、从中筛选提取需要的数据,方法看着简单,但特别实用。
我整理了一份上手门槛低、实用性强的Python爬虫教程。