Python爬虫如何抓取政府公开数据_Python爬虫获取政府网站开放数据的实战教程

蓮花仙者

发布时间：2025-11-15 10:43:02

602人浏览过

来源于php中文网

原创

首先确认目标网站数据合法性并遵守robots协议，接着分析网页结构定位所需信息；使用Python的requests和BeautifulSoup库发送请求并解析HTML，提取标题、日期、链接等字段；通过设置请求头、延时和异常处理避免反爬；最后将多页数据保存为CSV文件，实现合规高效的数据采集。

python爬虫如何抓取政府公开数据_python爬虫获取政府网站开放数据的实战教程

政府网站上有很多公开数据，比如政策文件、项目招标、企业注册信息等，这些数据对研究、分析和商业决策很有价值。用Python爬虫抓取这些数据，既合法又有实际意义，前提是遵守网站的robots协议和使用规范。下面是一个实战教程，带你一步步实现如何用Python获取政府网站的开放数据。

确认目标网站与数据合法性

在动手写代码前，先明确你要抓取的是哪个政府网站，例如“国家企业信用信息公示系统”或“中国政府采购网”。查看网站根目录下的robots.txt文件（如：http://xxx.gov.cn/robots.txt），确认是否允许爬虫访问相关页面。

同时注意：

不抓取需要登录或权限认证的数据
避免高频请求，设置合理延时（如time.sleep(1~3)）
尊重版权，仅用于个人学习或合规用途

分析网页结构并定位数据

以“中国政府采购网”为例，假设你想抓取某类采购公告的标题、发布时间和链接。

立即学习“Python免费学习笔记（深入）”；

打开目标列表页，右键“检查”元素，找到包含公告信息的HTML结构。通常这类数据在

或/
中，每条记录有共同的class或标签。示例结构可能如下：

  
    某设备采购项目
    2024-05-01
  

你可以用BeautifulSoup或lxml解析HTML，提取所需字段。
编写爬虫代码示例
以下是一个简单的Python爬虫脚本，使用requests和BeautifulSoup抓取列表页数据：

							
								
								
									Artbreeder
									创建令人惊叹的插画和艺术
								
								下载 
							
						
import requests
from bs4 import BeautifulSoup
import time
import csv
url = "https://www.php.cn/link/3664940859edd8b28137801625a24524"
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36"
}
def scrape_page(url):
try:
response = requests.get(url, headers=headers, timeout=10)
response.raise_for_status()
response.encoding = 'utf-8'
soup = BeautifulSoup(response.text, 'html.parser')
    items = soup.select('.notice-list li')
    data = []
    for item in items:
        link_tag = item.find('a')
        title = link_tag.get_text(strip=True)
        href = link_tag['href']
        full_url = f"http://www.ccgp.gov.cn{href}" if href.startswith('/') else href
        date_tag = item.find('span', class_='date')
        date = date_tag.get_text(strip=True) if date_tag else '未知'

        data.append([title, date, full_url])
    return data
except Exception as e:
    print(f"抓取失败：{e}")
    return []
抓取一页测试
results = scrape_page(url)
保存为CSV
with open('government_data.csv', 'w', encoding='utf-8-sig', newline='') as f:
writer = csv.writer(f)
writer.writerow(['标题', '发布日期', '链接'])
writer.writerows(results)
print("数据已保存到 government_data.csv")
处理分页与反爬策略
政府网站常有分页，可通过观察URL变化模拟翻页，例如：
http://xxx.gov.cn/page/1
http://xxx.gov.cn/page/2
在代码中加入循环即可遍历多页。
如果遇到反爬（如验证码、IP限制）：

添加随机延迟：time.sleep(random.uniform(1, 3))

使用代理IP池（需谨慎选择合规服务）
模拟浏览器行为（可考虑Selenium，但效率较低）

基本上就这些。只要目标网站没有动态加载且未设强反爬，用requests + BeautifulSoup就能搞定大部分政府公开数据抓取任务。关键是耐心分析结构，控制请求频率，确保合规操作。

Python 中 match-case 语句的条件匹配正确写法

如何用Python高效生成三个互不重复的随机ID

Python 3 中为内置类型启用字节串格式化：替代方案详解

Python 3 中实现字节串格式化：替代 %b 的标准方法

Python 3 中如何为内置类型生成字节串格式化结果

相关标签:

python html go windows 浏览器 app csv ai win Python html beautifulsoup print 循环 class ul table li http

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：NumPy教程：高效矢量化处理2D数组，根据分隔符清零指定区域下一篇：Python Turtle模块：绘制垂直居中椭圆教程

作者最新文章

HTML5如何设置边框溢出隐藏_HTML5设置边框溢出隐藏途径【溢出】

2026-01-14 16:37

Excel条件格式突出极值怎么做_Excel极值突出设置法【窍门】

2026-01-14 16:49

Win11自动同步日期失败咋整_同步日期失败修复法【方法】

2026-01-14 16:51

Win11开机黑屏0x00000050怎么搞_0x00000050黑屏处理法【指引】

2026-01-14 17:04

Win7安装后开机进入安全模式反复重启为何_驱动冲突与系统还原法【说明】

2026-01-14 17:13

铁杆三国在线玩-铁杆三国h5网页版在线玩地址分享

2026-01-14 17:18

Win11关闭传递优化有何益_Win11传递优化关闭法【优化】

2026-01-14 17:18

PHP如何优化环境启动速度_PHP优化环境启动速度技巧【提速】

2026-01-14 17:32

HTML5如何对URL参数进行加密_HTML5URL参数加密处理方法【入门】

2026-01-14 17:47

HTML5怎样用HKDF提取加密密钥_HTML5HKDF密钥提取操作【贯通】

2026-01-14 17:47

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

python开发工具

php中文网为大家提供各种python开发工具，好的开发工具，可帮助开发者攻克编程学习中的基础障碍，理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容，供大家免费下载使用。

752

2023.06.15

python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章，大家可以免费的下载体验。

636

2023.07.20

python能做什么

python能做的有：可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

758

2023.07.25

format在python中的用法

Python中的format是一种字符串格式化方法，用于将变量或值插入到字符串中的占位符位置。通过format方法，我们可以动态地构建字符串，使其包含不同值。php中文网给大家带来了相关的教程以及文章，欢迎大家前来阅读学习。

618

2023.07.31

python教程

Python已成为一门网红语言，即使是在非编程开发者当中，也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章，大家可以免费体验学习。

1262

2023.08.03

python环境变量的配置

Python是一种流行的编程语言，被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后，我们需要配置环境变量，以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

547

2023.08.04

python eval

eval函数是Python中一个非常强大的函数，它可以将字符串作为Python代码进行执行，实现动态编程的效果。然而，由于其潜在的安全风险和性能问题，需要谨慎使用。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别

scratch和python的区别：1、scratch是一种专为初学者设计的图形化编程语言，python是一种文本编程语言；2、scratch使用的是基于积木的编程语法，python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容，供大家免费下载体验。

706

2023.08.11