为什么需要等待?
现代网页大量使用 AJAX 技术,页面元素不是一次性加载完的:
如果你用 browser.get() 打开页面后立刻去抓元素,很可能抓不到——因为元素还没加载出来!
三种解决方案:
延时等待的三种方式
1. 强制等待(time.sleep)
最简单粗暴的方式:让程序睡几秒,不管页面有没有加载完。
import timefrom selenium import webdriverfrom selenium.webdriver.chrome.service import Services = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 打开百度browser.get(r'https://www.baidu.com')# 强制等待5秒# 不管页面有没有加载完,都等5秒time.sleep(5)# 这时候再去操作元素browser.find_element(By.ID, 'kw').send_keys('python')browser.quit()
优点: 简单,不用动脑 缺点:
建议: 调试时临时用,正式代码尽量不用。
2. 隐式等待(implicitly_wait)
全局设置一个最大等待时间,Selenium 会在找元素时自动等待:
from selenium import webdriverfrom selenium.webdriver.chrome.service import Services = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 隐式等待:设置最大等待时间10秒# 找元素时,如果元素还没加载出来,会等一会儿再试# 直到元素出现,或者超过10秒才报错browser.implicitly_wait(10)# 打开百度browser.get(r'https://www.baidu.com')# 这行代码会智能等待:# - 如果搜索框已经加载出来了,立刻执行# - 如果没加载出来,每隔一段时间检查一次# - 最多等10秒,超时就报错input_box = browser.find_element(By.ID, 'kw')input_box.send_keys('python')print(f"当前网址: {browser.current_url}")print(f"页面标题: {browser.title}")browser.quit()
工作原理:
找元素 → 元素出现了吗? ↓ 是 立刻返回元素 ↓ 否 等一会儿(默认0.5秒)再试 ↓ 超过最大等待时间 抛出 NoSuchElementException 异常
优点:
缺点:
3. 显式等待(WebDriverWait)
最灵活、最强大的等待方式。设置一个等待条件,每隔一段时间检查一次,条件满足就立刻继续:
from selenium import webdriverfrom selenium.webdriver.chrome.service import Servicefrom selenium.webdriver.support.wait import WebDriverWaitfrom selenium.webdriver.support import expected_conditions as ecfrom selenium.webdriver.common.by import Byimport times = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 打开百度browser.get(r'https://www.baidu.com')# 创建显式等待对象# 参数:浏览器驱动、最大等待时间(秒)wait = WebDriverWait(browser, 10)# 设置等待条件:等待 id='kw' 的元素加载出来# presence_of_element_located:元素存在于 DOM 中即可(不一定可见)input_box = wait.until(ec.presence_of_element_located((By.ID, 'kw')))# 元素加载出来了,继续执行input_box.send_keys('Python')print("搜索框已找到并输入")time.sleep(2)browser.quit()
WebDriverWait 构造函数:
WebDriverWait(driver, timeout, poll_frequency=0.5, ignored_exceptions=None)
| | |
|---|
driver | | |
timeout | | |
poll_frequency | | |
ignored_exceptions | | |
两种等待方式:
# until:条件成立时继续执行wait.until(条件)# until_not:条件不成立时继续执行(相反逻辑)wait.until_not(条件)
4. 常用等待条件(expected_conditions)
Selenium 提供了很多内置的等待条件,不用自己写:
from selenium.webdriver.support import expected_conditions as ec
| | |
|---|
title_is('标题') | | |
title_contains('关键字') | | |
presence_of_element_located((By.ID, 'kw')) | | |
visibility_of_element_located((By.ID, 'kw')) | | |
invisibility_of_element_located((By.ID, 'loading')) | | |
element_to_be_clickable((By.ID, 'btn')) | | |
text_to_be_present_in_element((By.ID, 'msg'), '成功') | | |
alert_is_present() | | |
frame_to_be_available_and_switch_to_it('iframe') | | |
实战示例:
from selenium.webdriver.support import expected_conditions as ec# 等待标题包含"百度"wait.until(ec.title_contains('百度'))# 等待元素可见(不只是存在,还要显示出来)wait.until(ec.visibility_of_element_located((By.ID, 'kw')))# 等待按钮可点击wait.until(ec.element_to_be_clickable((By.ID, 'su')))# 等待加载动画消失wait.until(ec.invisibility_of_element_located((By.CLASS_NAME, 'loading')))
三种等待方式对比:
| | | |
|---|
| time.sleep(n) | implicitly_wait(n) | WebDriverWait() |
| | | |
| | | |
| | | |
| | | |
最佳实践:
运行 JavaScript
Selenium 可以直接在页面中执行 JavaScript 代码,这是它的一个强大功能:
1. 滚动页面
很多网页是懒加载的,需要滚动到页面底部才会加载更多内容:
from selenium import webdriverfrom selenium.webdriver.chrome.service import Serviceimport times = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 打开知乎发现页browser.get('https://www.zhihu.com/explore')time.sleep(2)# 执行 JavaScript:滚动到页面底部# document.body.scrollHeight 获取页面总高度browser.execute_script('window.scrollTo(0, document.body.scrollHeight)')print("已滚动到页面底部")# 弹出提示框browser.execute_script('alert("已滚动到页面底部")')time.sleep(5)browser.quit()
常用滚动操作:
# 滚动到页面底部browser.execute_script('window.scrollTo(0, document.body.scrollHeight)')# 滚动到页面顶部browser.execute_script('window.scrollTo(0, 0)')# 向下滚动 500 像素browser.execute_script('window.scrollBy(0, 500)')# 滚动到指定元素位置element = browser.find_element(By.ID, 'target')browser.execute_script('arguments[0].scrollIntoView();', element)
2. 获取页面信息
# 获取页面标题(和 browser.title 一样)title = browser.execute_script('return document.title;')# 获取页面 URL(和 browser.current_url 一样)url = browser.execute_script('return document.URL;')# 获取页面所有 cookiecookies = browser.execute_script('return document.cookie;')
3. 修改页面元素
# 修改元素属性browser.execute_script( 'arguments[0].setAttribute("value", "新值");', element)# 隐藏元素browser.execute_script( 'arguments[0].style.display = "none";', element)# 点击元素(某些元素用 Selenium 的 click() 点不了时)browser.execute_script('arguments[0].click();', element)
什么时候需要用 execute_script?
操作 Cookie
Cookie 是网站存储在用户浏览器里的小文件,用来记录登录状态、用户偏好等。Selenium 可以方便地操作 Cookie。
1. 获取 Cookie
from selenium import webdriverfrom selenium.webdriver.chrome.service import Serviceimport times = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 打开知乎browser.get('https://www.zhihu.com/explore')# 获取所有 Cookiecookies = browser.get_cookies()print(f'所有 Cookie:')for cookie in cookies: print(f" {cookie['name']}: {cookie['value'][:20]}...")# 获取单个 Cookiecookie = browser.get_cookie('name')browser.quit()
Cookie 包含的字段:
| |
|---|
name | |
value | |
domain | |
path | |
expiry | |
secure | |
httpOnly | |
2. 添加 Cookie
# 添加一个 Cookiebrowser.add_cookie({ 'name': 'my_cookie', 'value': 'my_value', 'domain': '.zhihu.com', 'path': '/'})# 添加后查看print(f'添加后的 Cookie:{browser.get_cookies()}')
注意: 添加 Cookie 前必须先访问过该域名,否则会报错!
3. 删除 Cookie
# 删除指定 Cookiebrowser.delete_cookie('name')# 删除所有 Cookiebrowser.delete_all_cookies()print(f'删除后 Cookie:{browser.get_cookies()}') # 空列表 []
4. Cookie 实战:保持登录状态
场景: 每次运行脚本都要重新登录,很麻烦。可以第一次手动登录后保存 Cookie,以后直接加载 Cookie 就能保持登录。
import jsonfrom selenium import webdriverfrom selenium.webdriver.chrome.service import Services = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 第一步:手动登录,保存 Cookiebrowser.get('https://www.zhihu.com')print("请手动登录...")input("登录完成后按回车继续...")# 保存 Cookie 到文件cookies = browser.get_cookies()with open('cookies.json', 'w') as f: json.dump(cookies, f)print("Cookie 已保存")# 第二步:下次运行时加载 Cookiebrowser.delete_all_cookies()with open('cookies.json', 'r') as f: cookies = json.load(f) for cookie in cookies: browser.add_cookie(cookie)# 刷新页面,此时应该是登录状态browser.refresh()print("已使用 Cookie 登录")browser.quit()
Cookie 的妙用:
实战案例:自动登录代理网站
案例背景
写爬虫时经常需要代理 IP,很多网站提供代理 IP 服务。我们以自动登录一个代理网站为例,展示完整的自动化流程。
完整代码
from selenium import webdriverfrom selenium.webdriver.chrome.service import Servicefrom selenium.webdriver.common.by import Byimport times = Service(r'D:\driver\chromedriver.exe')browser = webdriver.Chrome(service=s)# 设置隐式等待browser.implicitly_wait(10)# 打开登录页面browser.get('http://www.66daili.cn/UserManage/Login/')# 输入账号browser.find_element(By.ID, 'username').send_keys('youbafu')# 输入密码browser.find_element(By.ID, 'password').send_keys('youbafu123')# 勾选"记住账号"remember = browser.find_element(By.ID, 'remember')# 判断是否已勾选,没勾选就点击if not remember.get_attribute('checked'): remember.click()# 点击登录按钮browser.find_element(By.ID, 'submit').click()# 等待登录完成time.sleep(2)print("登录成功!")# 保持页面打开,方便查看browser.quit()
代码解析:
- 隐式等待
- 输入账号密码
- 勾选记住账号
- 点击登录
- 等待
文档总结
一、核心知识点回顾
1. 三种等待方式
| | | |
|---|
| 强制等待 | time.sleep(n) | | |
| 隐式等待 | implicitly_wait(n) | | |
| 显式等待 | WebDriverWait(driver, n) | | |
选择建议:
2. 显式等待的常用条件
from selenium.webdriver.support import expected_conditions as ec# 元素相关ec.presence_of_element_located((By.ID, 'kw')) # 元素存在于 DOMec.visibility_of_element_located((By.ID, 'kw')) # 元素可见ec.element_to_be_clickable((By.ID, 'btn')) # 元素可点击ec.invisibility_of_element_located((By.ID, 'loading')) # 元素消失# 页面相关ec.title_contains('百度') # 标题包含ec.title_is('百度一下,你就知道') # 标题完全匹配# 其他ec.alert_is_present() # 弹窗出现ec.text_to_be_present_in_element((By.ID, 'msg'), '成功') # 文本出现
记忆口诀:
presencevisibilityclickable
3. 运行 JavaScript
# 滚动页面browser.execute_script('window.scrollTo(0, document.body.scrollHeight)')# 滚动到元素element = browser.find_element(By.ID, 'target')browser.execute_script('arguments[0].scrollIntoView();', element)# 点击元素(Selenium 点不了时用)browser.execute_script('arguments[0].click();', element)
什么时候用?
4. Cookie 操作
# 获取browser.get_cookies() # 所有 Cookiebrowser.get_cookie('name') # 单个 Cookie# 添加browser.add_cookie({'name': 'xxx', 'value': 'yyy'})# 删除browser.delete_cookie('name') # 删除指定browser.delete_all_cookies() # 删除所有
Cookie 的妙用:
二、常见坑与解决方案
坑1:显式等待和隐式等待混用导致超时异常
原因:两者时间叠加,可能超过预期解决:优先只用显式等待,或注意时间设置
坑2:添加 Cookie 报错
原因:没先访问对应域名解决:先 browser.get('网址'),再 add_cookie()
坑3:execute_script 点击无效
原因:元素还没加载出来解决:先等待元素出现,再执行 JS
坑4:Cookie 保存后加载还是未登录
原因:Cookie 过期了,或缺少关键字段解决:检查 Cookie 的 expiry 时间,确保完整保存
三、学习建议
- 等待是重中之重 —— 80% 的 Selenium 问题都是等待问题
- 显式等待优先
- Cookie 是神器 —— 学会保存和加载 Cookie,省去大量登录时间
- JS 是兜底方案 —— Selenium 搞不定的,试试 execute_script
- 多写多调