0

0

如何使用 Beautiful Soup 从公共网络中提取数据

PHPz

PHPz

发布时间:2024-08-01 20:22:32

|

974人浏览过

|

来源于dev.to

转载

如何使用 beautiful soup 从公共网络中提取数据

beautiful soup 是一个用于从网页中抓取数据的 python 库。它创建用于解析 html 和 xml 文档的解析树,从而可以轻松提取所需的信息。

beautiful soup 为网页抓取提供了几个关键功能:

  1. 导航解析树:您可以轻松导航解析树并搜索元素、标签和属性。
  2. 修改解析树: 它允许您修改解析树,包括添加、删除和更新标签和属性。
  3. 输出格式: 可以将解析树转换回字符串,方便保存修改的内容。

要使用 beautiful soup,您需要安装该库以及解析器,例如 lxml 或 html.parser。您可以使用 pip 安装它们

#install beautiful soup using pip.
pip install beautifulsoup4 lxml

处理分页

在处理跨多个页面显示内容的网站时,处理分页对于抓取所有数据至关重要。

  1. 识别分页结构:检查网站以了解分页的结构(例如下一页按钮或编号链接)。
  2. 迭代页面: 使用循环迭代每个页面并抓取数据。
  3. 更新url或参数:修改url或参数以获取下一页的内容。
import requests
from bs4 import beautifulsoup

base_url = 'https://example-blog.com/page/'
page_number = 1
all_titles = []

while true:
    # construct the url for the current page
    url = f'{base_url}{page_number}'
    response = requests.get(url)
    soup = beautifulsoup(response.content, 'html.parser')

    # find all article titles on the current page
    titles = soup.find_all('h2', class_='article-title')
    if not titles:
        break  # exit the loop if no titles are found (end of pagination)

    # extract and store the titles
    for title in titles:
        all_titles.append(title.get_text())

    # move to the next page
    page_number += 1

# print all collected titles
for title in all_titles:
    print(title)

提取嵌套数据

有时,您需要提取的数据嵌套在多层标签中。以下是如何处理嵌套数据提取。

快剪辑
快剪辑

国内⼀体化视频⽣产平台

下载
  1. 导航到父标签: 查找包含嵌套数据的父标签。
  2. 提取嵌套标签:在每个父标签中,查找并提取嵌套标签。
  3. 迭代嵌套标签:迭代嵌套标签以提取所需的信息。
import requests
from bs4 import beautifulsoup

url = 'https://example-blog.com/post/123'
response = requests.get(url)
soup = beautifulsoup(response.content, 'html.parser')

# find the comments section
comments_section = soup.find('div', class_='comments')

# extract individual comments
comments = comments_section.find_all('div', class_='comment')

for comment in comments:
    # extract author and content from each comment
    author = comment.find('span', class_='author').get_text()
    content = comment.find('p', class_='content').get_text()
    print(f'author: {author}\ncontent: {content}\n')

处理 ajax 请求

许多现代网站使用 ajax 动态加载数据。处理 ajax 需要不同的技术,例如使用浏览器开发人员工具监视网络请求并在抓取工具中复制这些请求。

import requests
from bs4 import BeautifulSoup

# URL to the API endpoint providing the AJAX data
ajax_url = 'https://example.com/api/data?page=1'
response = requests.get(ajax_url)
data = response.json()

# Extract and print data from the JSON response
for item in data['results']:
    print(item['field1'], item['field2'])

网页抓取的风险

网络抓取需要仔细考虑法律、技术和道德风险。通过实施适当的保护措施,您可以减轻这些风险并负责任且有效地进行网络抓取。

  • 违反服务条款:许多网站在其服务条款 (tos) 中明确禁止抓取。违反这些条款可能会导致法律诉讼。
  • 知识产权问题:未经许可抓取内容可能会侵犯知识产权,导致法律纠纷。
  • ip 阻止:网站可能会检测并阻止表现出抓取行为的 ip 地址。
  • 账号封禁:如果在需要用户身份验证的网站上进行抓取,用于抓取的账号可能会被封禁。

beautiful soup 是一个功能强大的库,它通过提供易于使用的界面来导航和搜索 html 和 xml 文档,从而简化了网页抓取的过程。它可以处理各种解析任务,使其成为任何想要从网络中提取数据的人的必备工具。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

755

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

636

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

759

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

618

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1262

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

547

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

708

2023.08.11

C++ 单元测试与代码质量保障
C++ 单元测试与代码质量保障

本专题系统讲解 C++ 在单元测试与代码质量保障方面的实战方法,包括测试驱动开发理念、Google Test/Google Mock 的使用、测试用例设计、边界条件验证、持续集成中的自动化测试流程,以及常见代码质量问题的发现与修复。通过工程化示例,帮助开发者建立 可测试、可维护、高质量的 C++ 项目体系。

3

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 0.7万人学习

Django 教程
Django 教程

共28课时 | 3.1万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号