如何用 Python 抓取 javascript 网站？

WBOY

发布： 2024-02-10 15:40:04

转载

1203人浏览过

如何用 python 抓取 javascript 网站？

问题内容

我正在尝试抓取一个网站。我尝试过使用两种方法，但两种方法都没有为我提供我正在寻找的完整网站源代码。我正在尝试从下面提供的网站 url 中抓取新闻标题。

网址：“https://www.todayonline.com/”

这是我尝试过但失败的两种方法。

方法一：美汤

tdy_url = "https://www.todayonline.com/"
page = requests.get(tdy_url).text
soup = beautifulsoup(page)
soup  # returns me a html with javascript text
soup.find_all('h3')

### returns me empty list []

登录后复制

方法2：selenium + beautifulsoup

tdy_url = "https://www.todayonline.com/"

options = Options()
options.headless = True

driver = webdriver.Chrome("chromedriver",options=options)

driver.get(tdy_url)
time.sleep(10)
html = driver.page_source

soup = BeautifulSoup(html)
soup.find_all('h3')

### Returns me only less than 1/4 of the 'h3' tags found in the original page source

登录后复制

请帮忙。我尝试过抓取其他新闻网站，这要容易得多。谢谢。

易优cms汽车车辆租赁源码1.7.2

由于疫情等原因大家都开始习惯了通过互联网上租车服务的信息多方面，且获取方式简便，不管是婚庆用车、旅游租车、还是短租等租车业务。越来越多租车企业都开始主动把租车业务推向给潜在需求客户，所以如何设计一个租车网站，以便在同行中脱颖而出就重要了，易优cms针对租车行业市场需求、目标客户、盈利模式等，进行策划、设计、制作，建设一个符合用户与搜索引擎需求的租车网站源码。网站首页

查看详情

立即学习“Java免费学习笔记（深入）”；

正确答案

您可以通过 api 访问数据（查看“网络”选项卡）：

例如，

import requests
url = "https://www.todayonline.com/api/v3/news_feed/7"
data = requests.get(url).json()

登录后复制

以上就是如何用 Python 抓取 javascript 网站？的详细内容，更多请关注php中文网其它相关文章！

大家都在看：

Selenium Python中send_keys方法误用与正确实践指南使用Selenium和Python实现X (Twitter)自动化登录指南 Python爬虫怎样使用Selenium_Python爬虫结合Selenium模拟浏览器操作教程 Selenium WebDriver深入：高效定位Shadow DOM中的元素解决 Selenium WebDriver 运行时出现的 TypeError