python中如何使用XPath爬取小说

尊渡假赌尊渡假赌尊渡假赌

发布时间：2025-11-16 23:37:02

816人浏览过

来源于php中文网

原创

答案：使用Python的requests和lxml库，通过发送请求、XPath解析提取小说标题和正文，可批量爬取并保存内容。需注意动态加载、反爬机制及版权问题。

python中如何使用xpath爬取小说

在Python中使用XPath爬取小说，主要是借助requests获取网页内容，再用lxml库解析HTML并使用XPath提取章节标题、正文等信息。下面是一个实用的流程说明。

安装所需库

你需要先安装requests和lxml：

pip install requests lxml

基本步骤与代码示例

以爬取某小说网站的一章内容为例（注意：仅用于学习，请遵守目标网站的robots协议和法律法规）。

1. 发送请求获取页面

立即学习“Python免费学习笔记（深入）”；

使用requests模拟浏览器访问小说章节页面：

import requests
from lxml import html

headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36'
}

url = 'https://www.php.cn/link/319bb7e0f80716c134117d14a22d461e' # 替换为实际网址
response = requests.get(url, headers=headers)
response.encoding = 'utf-8' # 根据网页编码调整，常见为 utf-8 或 gbk
tree = html.fromstring(response.text)

2. 使用XPath提取内容

通过浏览器开发者工具（F12）查看小说标题和正文所在的HTML标签，构造XPath表达式。

采风问卷

采风问卷是一款全新体验的调查问卷、表单、投票、评测的调研平台，新奇的交互形式，漂亮的作品，让客户眼前一亮，让创作者获得更多的回复。

下载

# 提取章节标题，假设标题在

中
title = tree.xpath('//h1[@class="title"]/text()')
title = title[0].strip() if title else '未知标题'

提取正文内容，假设段落在

内的 p 标签中

content_list = tree.xpath('//div[@id="content"]//p/text()')
content = '\n'.join([line.strip() for line in content_list if line.strip()])

3. 保存到本地文件

with open('chapter_1.txt', 'w', encoding='utf-8') as f:
f.write(f"{title}\n\n{content}")

批量爬取多章节

如果要爬整本小说，可先获取目录页的所有章节链接：

catalog_url = 'https://www.php.cn/link/a58269cb74a093b377cd217b72bd15b9/catalog'
response = requests.get(catalog_url, headers=headers)
tree = html.fromstring(response.text)

假设章节链接在

links = tree.xpath('//div[@class="list"]//a/@href')

for i, link in enumerate(links[:10]): # 先测试前10章
chapter_url = 'https://www.php.cn/link/a58269cb74a093b377cd217b72bd15b9' + link

重复上面的请求和提取逻辑

# ...

注意事项

使用XPath爬取小说时需注意以下几点：

部分网站使用JavaScript动态加载内容，requests + lxml无法获取，需改用Selenium或Playwright
频繁请求可能触发反爬机制，建议添加time.sleep()延时
尊重版权，仅限个人学习或测试，不要大规模传播或商用
检查robots.txt，避免抓取禁止内容

基本上就这些。掌握XPath语法和网页结构分析能力后，爬取小说会变得很直接。

Python爬虫解析HTML技巧_xpath与css选择器对比【教程】

Python表单自动填写_web驱动模拟操作技巧【指导】

解决Selenium无法向组合框发送文本的问题：精确XPath定位策略

Selenium自动化中精确元素定位与send_keys失效问题解析

Selenium中精确操作组合框元素的实践指南

小说app

丰富的小说app资源，提供海量正版小说。还有金币福利，看书能挣钱！有需要的小伙伴快来保存下载体验吧！

下载

相关标签:

javascript python java html windows 编码浏览器 app 工具 Python JavaScript html pip if for class href windows https

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：python整数和浮点数的常见用法下一篇：python的ide是什么

作者最新文章

雨课堂怎么发起签到_雨课堂签到发起二维码弹幕

2026-01-12 17:34

植物大战僵尸火影版无需下载地址_植物大战僵尸火影忍者mod版手机版无需下载

2026-01-12 17:37

长沙雨课堂网页版登录_长沙版雨课堂网页版官方入口地址

2026-01-12 17:38

植物大战僵尸2026中文版无需下载_植物大战僵尸融合版2026中文版手机版入口

2026-01-12 17:40

雨课堂怎么使用教程详解_雨课堂全功能使用手册指南

2026-01-12 17:40

植物大战植物图鉴怎么查看_植物大战僵尸全植物图鉴融合配方大全

2026-01-12 17:41

长江雨课堂在线登录入口_长江雨课堂网页版登录地址

2026-01-12 17:41

植物大战杂交版无需下载安装指南_植物大战僵尸杂交版最新手机版无需下载

2026-01-12 17:42

雨课堂网页版入口登录方法_雨课堂网页版账号登录快速教程

2026-01-12 17:44

植物大战僵尸砸罐子怎么玩_植物大战僵尸融合版砸罐子神秘模式攻略

2026-01-12 17:45

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

python开发工具

php中文网为大家提供各种python开发工具，好的开发工具，可帮助开发者攻克编程学习中的基础障碍，理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容，供大家免费下载使用。

749

2023.06.15

python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章，大家可以免费的下载体验。

634

2023.07.20

python能做什么

python能做的有：可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

758

2023.07.25

format在python中的用法

Python中的format是一种字符串格式化方法，用于将变量或值插入到字符串中的占位符位置。通过format方法，我们可以动态地构建字符串，使其包含不同值。php中文网给大家带来了相关的教程以及文章，欢迎大家前来阅读学习。

618

2023.07.31

python教程

Python已成为一门网红语言，即使是在非编程开发者当中，也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章，大家可以免费体验学习。

1262

2023.08.03

python环境变量的配置

Python是一种流行的编程语言，被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后，我们需要配置环境变量，以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

547

2023.08.04

python eval

eval函数是Python中一个非常强大的函数，它可以将字符串作为Python代码进行执行，实现动态编程的效果。然而，由于其潜在的安全风险和性能问题，需要谨慎使用。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别

scratch和python的区别：1、scratch是一种专为初学者设计的图形化编程语言，python是一种文本编程语言；2、scratch使用的是基于积木的编程语法，python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容，供大家免费下载体验。

705

2023.08.11

Java 项目构建与依赖管理（Maven / Gradle）

本专题系统讲解 Java 项目构建与依赖管理的完整体系，重点覆盖 Maven 与 Gradle 的核心概念、项目生命周期、依赖冲突解决、多模块项目管理、构建加速与版本发布规范。通过真实项目结构示例，帮助学习者掌握从零搭建、维护到发布 Java 工程的标准化流程，提升在实际团队开发中的工程能力与协作效率。

2026.01.12

热门下载

网站特效

网站源码

网站素材

前端模板