如何递归解压嵌套的 GZIP 文件(.gz 套 .gz)
如何递归解压嵌套的 GZIP 文件(.gz 套 .gz)

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
本文介绍使用 python 递归解压多层嵌套的 .gz 文件(即压缩包内含 .gz 文件,其内部又可能含 .gz),最终提取出原始 xml 等目标数据,并支持自定义输出路径。
处理网络路由数据、日志归档或是科研数据集时,你很可能遇到过一种让人头疼的“俄罗斯套娃”式压缩文件:一个顶层的 .gz 文件解压出来,里面躺着的居然还是 .gz 文件,一层套一层,非得剥开好几层“外壳”,才能见到真正的 XML 或文本数据。Python 自带的 gzip 模块虽然好用,但面对这种嵌套结构就束手无策了。不过别担心,通过“递归解压”配合“文件类型识别”,完全可以实现全自动的一键展开。
下面这个函数,就是一个兼顾健壮性与扩展性的解决方案:
import gzip
import shutil
import os
from pathlib import Path
def extract_gz_recursively(
gz_path: str,
output_dir: str = ".",
keep_intermediates: bool = False) -> None:
"""
递归解压嵌套 .gz 文件,直至获得非 .gz 文件(如 XML、TXT 等)。
Args:
gz_path: 输入 .gz 文件路径
output_dir: 最终解压内容存放目录(默认为当前目录)
keep_intermediates: 是否保留中间解压出的 .gz 文件(默认 False)
"""
gz_path = Path(gz_path)
output_dir = Path(output_dir)
output_dir.mkdir(exist_ok=True)
# 构造解压后的文件名(移除最外层 .gz)
stem = gz_path.stem if gz_path.suffix == ".gz" else gz_path.name
extracted_path = output_dir / stem
# 解压当前 .gz 文件
try:
with gzip.open(gz_path, "rb") as f_in:
with open(extracted_path, "wb") as f_out:
shutil.copyfileobj(f_in, f_out)
print(f"✓ Extracted: {gz_path.name} → {extracted_path.name}")
except Exception as e:
print(f"✗ Failed to extract {gz_path.name}: {e}")
return
# 若解压结果仍是 .gz 文件,则递归处理
if extracted_path.suffix == ".gz" and extracted_path.is_file():
extract_gz_recursively(
extracted_path,
output_dir=output_dir,
keep_intermediates=keep_intermediates
)
# 可选:清理中间 .gz(仅当不保留时)
if not keep_intermediates:
extracted_path.unlink(missing_ok=True)
else:
# 已到达最终数据(如 XML),可选重命名或分类
if extracted_path.suffix.lower() in (".xml", ".txt", ".csv"):
print(f"→ Final data found: {extracted_path.name}")
# ✅ 使用示例:批量处理指定目录下所有 .gz 文件
if __name__ == "__main__":
INPUT_DIR = "./archives" # 存放顶层 .gz 文件的目录
OUTPUT_DIR = "./extracted" # 所有最终 XML 数据将落在此目录
for gz_file in Path(INPUT_DIR).glob("*.gz"):
extract_gz_recursively(gz_file, output_dir=OUTPUT_DIR)
关键说明与注意事项:
要让这个流程跑得既稳当又高效,有几个细节值得琢磨:
- 安全终止机制:函数通过检查文件后缀是否为 “.gz” 来决定是否继续递归,这能有效避免因文件损坏或命名异常导致的无限循环。
- 路径健壮性:全程使用 pathlib.Path 对象而非字符串拼接,好处是自动兼容不同操作系统的路径分隔符,代码更清晰,也减少了低级错误。
- 错误防护:对核心的解压操作(gzip.open)进行了异常捕获。这样一来,即便某个嵌套文件损坏,也只会跳过该文件并打印错误,而不会让整个批量处理流程戛然而止。
- 资源管理:默认情况下,中间解压产生的 .gz 文件会被自动清理(keep_intermediates=False)。这对于处理大量深层嵌套文件尤其重要,能避免磁盘空间被一堆临时文件迅速占满。
- 扩展建议:如果你希望最终文件能按原始嵌套层级来组织(比如输出到 ./extracted/level1/level2/xmldata1.xml 这样的路径),可以在递归函数中增加一个“深度”参数,并根据它来动态创建对应的子目录。
运行起来之后,无论原先的结构有多复杂,比如 maingzfile/subgzfile1/xmldata1 这样的多层嵌套,所有目标 XML 文件都会被自动提取出来,并整齐地归集到你指定的输出目录(如 ./extracted/)。整个过程无需人工干预,真正实现了“一键穿透多层 GZIP”。
相关攻略
如何递归解压嵌套的 GZIP 文件( gz 套 gz) 本文介绍使用 python 递归解压多层嵌套的 gz 文件(即压缩包内含 gz 文件,其内部又可能含 gz),最终提取出原始 xml 等目标数据,并支持自定义输出路径。 处理网络路由数据、日志归档或是科研数据集时,你很可能遇到过一种让人
统信UOS推荐五种解压缩工具:一、系统自带归档管理器,开箱即用,支持主流格式;二、file-roller,兼容特殊路径与批量操作;三、p7zip,命令行全能,支持分卷与高压缩格式;四、unrar,专精RAR解压,速度快;五、deepin-wine版WinRAR,应对加密或定制化疑难包。 在统信UOS
Zombie ZIP漏洞披露:让WinRAR 7-Zip解压报错,已伪装绕过50款主流杀软 最近,网络安全圈被一项名为“Zombie ZIP”的新型攻击技术搅动。Bombadil Systems的研究员Chris Aziz最新披露的这项技术,利用了一个狡猾的漏洞,不仅能成功绕过VirusTotal平
极目新闻记者 张聪1月31日,网剧《年少有为》登陆腾讯视频全网独播,该剧改编自阅文集团旗下起点读书作家青衫取醉小说《亏成首富从游戏开始》,由彭昱畅、林允、刘冠麟领衔主演,王天放、何瑞贤、吴俊霆、姚一
热门专题
热门推荐
小米Note 3铃声管理全攻略:从定位到自定义,一步到位 手里拿着小米Note 3,想换个铃声却找不到地方?别急,这事儿其实比想象中简单。系统预置的铃声,都规规矩矩地躺在内部存储的一个特定文件夹里:SDcard MIUI ringtone 。这个目录就像MIUI系统的“声音仓库”,里面分门别类地存放
小米电饭煲重置网络提示失败怎么回事? 遇到小米电饭煲重置网络总是失败,先别急着怀疑是硬件坏了。这事儿本质上,是设备在配网流程中没能和路由器成功“握手”,建立通信授权。背后的原因,往往出在几个容易被忽略的细节上:比如Wi-Fi频段没选对、密码格式太复杂、App里还残留着旧配置,或者是路由器那边设置了“
按摩椅力度调小后依然有效,关键在于匹配个体身体状态与使用需求 现代中高端按摩椅普遍配备多级力度调节系统,但很多人心里犯嘀咕:力度调小了,是不是就变成隔靴搔痒,没什么实际作用了? 事实恰恰相反。实测数据显示,轻柔档位(比如30%—50%的输出强度)在缓解日常肩颈僵硬、改善浅层血液循环方面,有着明确的生
米家扫地机器人怎么用手机远程控制 想随时随地指挥家里的扫地机器人干活?这事儿其实很简单。米家APP就是你的万能遥控器,只要几步设置,无论你是在公司、在出差,还是躺在沙发上,都能稳定、便捷地通过手机远程掌控全局。操作逻辑很清晰:在手机上安装好官方米家APP并登录你的小米账号,让扫地机器人连上家里的Wi
PoE交换机好坏,普通测线仪说了不算 想用普通网线测线仪来判断一台PoE交换机的好坏?这个想法很危险。原因很简单:普通测线仪只能干些基础活儿,比如看看网线通不通、线序对不对、有没有短路断路。但对于PoE交换机的核心能力——供电电压是否达标、输出功率稳不稳定、是否兼容最新的IEEE标准、带载后电压会不





