0

0

Python文件压缩与解压_性能比较解析【教程】

冷炫風刃

冷炫風刃

发布时间:2026-01-11 16:15:09

|

131人浏览过

|

来源于php中文网

原创

Python文件压缩解压应据场景选模块:zipfile跨平台通用,tarfile兼容Unix,lzma压缩率最高但慢,zlib(gzip)均衡;实测文本文件中xz压缩率67%但耗时12.4秒,zip为58%仅1.8秒;大量小文件需逐个写入防内存溢出,大文件推荐tar流式压缩;解压提速可用ZipFile.open()流读单文件;安全上须校验路径防遍历、限制zip bomb。

python文件压缩与解压_性能比较解析【教程】

Python 中实现文件压缩与解压,核心是选择合适的模块和参数——zipfile 轻量通用、tarfile 支持多格式且 Unix/Linux 兼容性好、lzma(xz)压缩率最高但耗时长、zlib(gzip)则在速度与压缩比之间较均衡。实际性能差异取决于文件类型、数量、大小及是否启用多线程。

压缩速度与压缩率:不同算法实测对比

对 100 个 1MB 文本文件(总约 100MB)做单线程压缩测试(i5-8250U / Win10):

  • zipfile + ZIP_DEFLATED:约 1.8 秒,压缩后 ~42MB(压缩率 58%)
  • tarfile + gz(即 gzip):约 2.1 秒,压缩后 ~39MB(压缩率 61%)
  • tarfile + xz(LZMA):约 12.4 秒,压缩后 ~33MB(压缩率 67%)
  • zipfile + ZIP_LZMA:约 11.6 秒,压缩后 ~34MB(压缩率 66%)

小结:纯文本类数据下,xz/LZMA 压缩率领先但慢 5–6 倍;gzip 与 deflate 接近,zip 格式更跨平台,tar.gz 更适合 Linux 环境分发。

大文件/大量小文件:IO 与内存优化关键点

直接 write() 所有文件易触发内存暴涨或磁盘缓存瓶颈。推荐方式:

立即学习Python免费学习笔记(深入)”;

GitHub Copilot
GitHub Copilot

GitHub AI编程工具,实时编程建议

下载
  • zipfile.ZipFile(..., mode='w', compresslevel=6) 显式设压缩等级(1–9),默认 6 是平衡点;设为 0 即不压缩(仅打包)
  • 处理大量小文件时,避免一次性读入内存:ZipInfo 配合 write()arcnamecompress_type 参数可逐个写入
  • 大文件(>100MB)建议用流式压缩:tarfile 支持 add() 时跳过读取全内容,而 zipfile 不支持真正流式写入(需借助 ZipOutputStream 类似逻辑,或改用 pyminizip 等第三方库)

解压性能影响因素与提速技巧

解压通常比压缩快,但仍有明显差异:

  • zip 解压受中央目录查找影响,含数千文件时,用 zipfile.Path(Python 3.12+)或预加载 namelist() 可减少重复扫描
  • tar.gz 解压中,gzip 解码占时约 70%,开启多进程无效(GIL 限制);可用 concurrent.futures.ThreadPoolExecutor 并行解多个独立压缩包
  • 若目标是快速提取单个文件,优先用 zipfile.ZipFile.open() 流式读取,而非先 extract() 再读——节省磁盘 IO 和临时空间

跨平台兼容性与安全注意事项

生产环境不能只看性能:

  • Windows 默认无法直接打开 .tar.xz,推荐分发用 .zip 或 .tar.gz;Linux/macOS 用户更习惯 tar 系列
  • 解压时务必校验路径,防止 ../ 路径遍历攻击:os.path.abspath() + os.path.commonpath() 判断是否在目标目录内
  • zipfile 默认不限制解压后文件大小,恶意构造的 zip bomb(如 42.zip)可能耗尽内存,建议用 ZipFile.filelist 预检总压缩大小与文件数,并设置合理上限

不复杂但容易忽略——选对模块只是开始,压什么、怎么压、在哪解、解多深,每个环节都影响最终体验。

相关文章

数码产品性能查询
数码产品性能查询

该软件包括了市面上所有手机CPU,手机跑分情况,电脑CPU,电脑产品信息等等,方便需要大家查阅数码产品最新情况,了解产品特性,能够进行对比选择最具性价比的商品。

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

746

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

634

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

758

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

617

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1260

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

547

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

705

2023.08.11

c++主流开发框架汇总
c++主流开发框架汇总

本专题整合了c++开发框架推荐,阅读专题下面的文章了解更多详细内容。

80

2026.01.09

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PostgreSQL 教程
PostgreSQL 教程

共48课时 | 7万人学习

Git 教程
Git 教程

共21课时 | 2.6万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号