我是靠谱客的博主 风中小蘑菇,最近开发中收集的这篇文章主要介绍针对懒加载如何实现selenium 滑动至页面底部page_source一次性包含全部网页内容,觉得挺不错的,现在分享给大家,希望可以做个参考。
概述
有时网站使用了懒加载技术:只有在浏览器中纵向滚动条滚动到指定的位置时,页面的元素才会被动态加载。注意,在加载之前,selenium的page_source是不会包含该页面的内容,page_source只包含加载出来的页面内容。那么如何实现加载全部内容了,就需要模拟人滚动滚动条的行为,实现页面的加载
from selenium.webdriver.chrome.options import Options
from selenium import webdriver
from selenium.common.exceptions import TimeoutException
from selenium.webdriver.support.wait import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC
def scroll_until_loaded(self):
check_height = self.browser.execute_script("return document.body.scrollHeight;")
while True:
self.browser.execute_script("window.scrollTo(0, document.body.scrollHeight);")
try:
self.wait.until(lambda driver: self.browser.execute_script("return document.body.scrollHeight;") > check_height)
check_height = self.browser.execute_script("return document.body.scrollHeight;")
except TimeoutException:
break
这里懒加载并不是一直有效,当网速不好时,加载超过self.wait()时间,页面还没加载出来时,会认为全部加载完成, page_source里面的代码就会是以前加载出来的,所以执行翻页操作后,要执行time.sleep(3),等待网页加载,更新html再获取网页源代码
最后
以上就是风中小蘑菇为你收集整理的针对懒加载如何实现selenium 滑动至页面底部page_source一次性包含全部网页内容的全部内容,希望文章能够帮你解决针对懒加载如何实现selenium 滑动至页面底部page_source一次性包含全部网页内容所遇到的程序开发问题。
如果觉得靠谱客网站的内容还不错,欢迎将靠谱客网站推荐给程序员好友。
本图文内容来源于网友提供,作为学习参考使用,或来自网络收集整理,版权属于原作者所有。
发表评论 取消回复