来源:数据STUDIO
作者:云朵君
工作中,当你需要对某个文件夹或多个文件夹内的大量类似文件做相同操作(增删改查)时,你还在拼命加班做一个没有感情的工具人嘛?掌握以下几个操作,瞬间完成任务,然后你就可以摸鱼去了。
运用Python进行批量处理,无疑是减少了无限的工作量,将枯燥无味,重复性工作交给机器。你只需要花几分钟时间编写几行代码,轻松摆脱工具人,这就是办公自动化的魅力所在。
在介绍批量处理文件之前,先介绍下Python文件IO的一般操作。
import os
1.os.getcwd( )
方法获取代码当前工作路径
2.os.listdir(path)
获取当前工作文件夹内的文件夹或文件。
用于返回指定的文件夹包含的文件或文件夹的名字的列表。这个列表以字母顺序。它不包括 '.' 和'..'即使它在文件夹中。
3.os.makedirs(path, mode=0o777)
用于递归创建目录。
如果子目录创建失败或者已经存在,会抛出一个 OSError 的异常,Windows上Error 183 即为目录已经存在的异常错误。
如果第一个参数 path 只有一级,则 mkdir() 函数相同。
4.os.mkdir(path[, mode])
用于以数字权限模式创建目录。
默认的模式为 0777 (八进制)。如果目录有多级,则创建最后一级,如果最后一级目录的上级目录有不存在的,则会抛出一个 OSError。
5.os.walk(top[, topdown=True[, onerror=None[, followlinks=False]]])
是一个简单易用的文件、目录遍历器,可以帮助我们高效的处理文件、目录方面的事情。
可以创建一个生成器,用以生成所要查找的目录及其子目录下的所有文件。
用于通过在目录树中游走输出在目录中的文件名,向上或者向下。
6.os.chdir(path)
用于改变当前工作目录到指定的路径。
7.os.path.abspath(path)
返回绝对路径
8.os.path.dirname(path)
返回文件路径
9.os.path.join(path1[, path2[, ...]])
把目录和文件名合成一个路径
10.os.path.split(path)
把路径分割成 dirname 和 basename,返回一个元组
11.os.path.splitext(path)
分割路径中的文件名与拓展名
12.os.path.walk(path, visit, arg)
遍历path,进入每个目录都调用visit函数,visit函数必须有3个参数(arg, dirname, names),dirname表示当前目录的目录名,names代表当前目录下的所有文件名,args则为walk的第三个参数。
13.os.path.exists(path)
路径存在则返回True,路径损坏返回False。
当一个文件夹中含有多种类型的文件,以下列举几个,有时候实际情况比这更多更复杂,我们需要找到需要的格式文件比较困难,因此批量获取指定后缀名的文件显得尤其重要。
import os def find_file(work_dir, extension='jpg'): """
获取指定后缀名的文件
:param work_dir:传递当前目录
:param extension:指定的后缀名
:return: 返回所有目录下的文件
""" # 空列表用以存储获取到的文件名 lst = []
for filename in os.listdir(work_dir):
# 指定文件夹中的文件名逐一打印 print(filename)
# 获取得到文件后缀 splits = os.path.splitext(filename)
file_ext = splits[1] # 拿到扩展名 if file_ext == '.' + extension:
lst.append(filename)
return lst
函数运用
>>> In: find_file('./批处理')
.ipynb_checkpoints
Data STUDIO.jpg
logger.py
MySQL.zip
svm.pptx
test.csv
text.xls
text.xlsx
关注《数据STUDIO》.gif
成都市地图.html
批处理.ipynb
控规图.dwg >>> Out: ['Data STUDIO.jpg']
此方法是获取指定后缀名的文件的一个应用,获取到指定后缀名的文件后对相应文件作一个修改。
import os def batch_rename(work_dir, old_ext ='.xls', new_ext='.xlsx'): """
批量重命名后缀
:param work_dir:传递当前目录
:param old_ext:原来后缀名
:param new_ext:新的后缀名后
""" for filename in os.listdir(work_dir):
# 获取得到文件后缀 split_file = os.path.splitext(filename)
file_ext = split_file[1]
# 定位后缀名为old_ext 的文件 if old_ext == file_ext:
# 修改后文件的完整名称 newfile = split_file[0] + new_ext
# 实现重命名操作 os.rename(
os.path.join(work_dir, filename),
os.path.join(work_dir, newfile)
)
print("完成重命名")
print(os.listdir(work_dir))
如果将其中的file_ext = split_file[1]改为file_name = split_file[0],后面再做相应的修改,可以变成批量修改文件名称。
这里演示os.walk(path) 的应用。有时我们需要获取某个具有好几个层级的目录下的所有文件,根据条件筛选出某个目标文件,对其做相应的操作。这里演示获取文件的修改时间。
# 获取目录下文件的修改时间 import os
from datetime import datetime print(f"当前时间:{datetime.now().strftime('%Y-%m-%d %H:%M:%S')}")
def get_modify_time(indir):
for root, _, files in os.walk(indir): # 循环D:批处理目录和子目录 for file in files:
absfile = os.path.join(root, file)
modtime = datetime.fromtimestamp(os.path.getmtime(absfile))
now = datetime.now()
difftime = now-modtime
if difftime.days < 20: # 条件筛选超过指定时间的文件 print(f"""{absfile}
修改时间[{modtime.strftime('%Y-%m-%d %H:%M:%S')}]
距今[{difftime.days:3d}天{difftime.seconds//3600:2d}时
{difftime.seconds%3600//60:2d}]""" ) # 打印相关信息 get_modify_time('./批处理')
输出
当前时间:2021-02-05 19:21:48 ./MySQL.zip修改时间[2021-01-29 16:46:13]距今[ 7天 3时35]
./svm.pptx修改时间[2021-01-21 10:22:12]距今[ 15天 8时59] ./test.csv修改时间[2021-01-25 18:36:40]距今[ 11天 0时45] ./关注《数据STUDIO》.gif修改时间[2021-02-04 11:14:07]距今[ 1天 8时 7] ./批处理.ipynb修改时间[2021-02-05 19:21:44]距今[ 0天 0时 0] ./.ipynb_checkpoints批处理-checkpoint.ipynb修改时间[2021-02-05 19:57:42]距今[ 0天 0时24]
这里同样运用到os.path.walk(path) 。
另外一个用来做压缩和解压的Python模块--zipfile
压缩文件
zipfile.ZipFile(file[, mode[, compression[, allowZip64]]])
有如下常用方法
ZipFile.infolist()获取zip文档内所有文件的信息,返回一个zipfile.ZipInfo的列表
ZipFile.namelist() 获取zip文档内所有文件的名称列表
ZipFile.printdir()将zip文档内的信息打印到控制台上
import zipfile # 加载压缩文件,创建ZipFile对象 file_dir = './Data STUDIO.zip' zipFile = zipfile.ZipFile(file_dir) print('info:',zipFile.infolist()) print('name:',zipFile.namelist()) print('dir:',zipFile.printdir())
输出
info: [<ZipInfo filename='Data STUDIO.jpg' compress_type=deflate external_attr=0x20 file_size=791106 compress_size=336551>] name: ['Data STUDIO.jpg'] File Name Modified Size Data STUDIO.jpg 2020-11-03 10:01:00 791106 dir: None
解压文件
ZipFile.extract(member[, path[, pwd]])
将zip文档内的指定文件解压到当前目录。
下面一个例子将保存在程序根目录下的text.zip内的所有文件解压到D:/Work 目录
import zipfile import os
zipFile = zipfile.ZipFile(file_dir) for file in zipFile.namelist():
zipFile.extract(file, 'd:/Work')
zipFile.close()
另一种解压zip文档中的所有文件到当前目录:
ZipFile.extractall([path[, members[, pwd]]])
members的默认值为zip文档内的所有文件名称列表,也可以自己设置,选择要解压的文件名称
批量压缩文件
import zipfile # 导入zipfile,这个是用来做压缩和解压的Python模块; import os import time def batch_zip(start_dir): start_dir = start_dir # 要压缩的文件夹路径 file_news = start_dir + '.zip' # 压缩后文件夹的名字 z = zipfile.ZipFile(file_news, 'w', zipfile.ZIP_DEFLATED)
for dir_path, dir_names, file_names in os.path.walk(start_dir):
print(dir_path)
print(dir_names)
print(file_names)
# 这一句很重要,不replace的话,就从根目录开始复制 f_path = dir_path.replace(start_dir, '')
# 实现当前文件夹以及包含的所有文件的压缩 f_path = f_path and f_path + os.sep
for filename in file_names:
z.write(os.path.join(dir_path, filename), f_path + filename)
z.close()
return file_news
batch_zip('E:/批处理/test')
输出
E:/批处理/test []
['Data STUDIO.jpg', 'logger.py', 'MySQL.zip', 'svm.pptx', 'test.csv', 'text.xls', 'text.xlsx', '关注《数据STUDIO》.gif', '成都市地图.html', '控规图.dwg'] 'E:/批处理/test.zip'
检验压缩效果。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪 ...
2024-12-31数据分析,听起来好像是技术大咖的专属技能,但其实是一项人人都能学会的职场硬核能力!今天,我们来聊聊数据分析的核心流程,拆 ...
2024-12-31提到数据分析,你脑海里可能会浮现出一群“数字控”抱着电脑,在海量数据里疯狂敲代码的画面。但事实是,数据分析并没有你想象的 ...
2024-12-31关于数据分析师是否会成为失业高危职业,近年来的讨论层出不穷。在这个快速变化的时代,技术进步让人既兴奋又不安。今天,我们从 ...
2024-12-30数据分析师在现代企业中扮演着关键角色,他们的工作内容不仅丰富多样,还对企业的决策和发展起着重要的作用。正如一个经验丰富的 ...
2024-12-29数据分析师的能力要求 在当今的数据主导时代,数据分析师的角色变得尤为重要。他们不仅需要具备深厚的技术背景,还需要拥有业务 ...
2024-12-29随着技术的飞速发展与行业的持续变革,不少人心中都存有疑问:到了 2025 年,数据分析师还有前途吗?给你分享一篇阿里P8大佬最近 ...
2024-12-29如何构建数据分析整体框架? 要让数据分析发挥其最大效能,建立一个清晰、完善的整体框架至关重要。今天,就让我们一同深入探讨 ...
2024-12-27AI来了,数分人也可以很省力,今天给大家介绍7个AI+数据分析工具,建议收藏。 01酷表 EXCEL 网址:https://chatexcel.com/ 这是 ...
2024-12-26一个好的数据分析模型不仅能使分析具备条理性和逻辑性,而且还更具备结构化和体系化,并保证分析结果的有效性和准确性。好的数据 ...
2024-12-26当下,AI 的发展堪称狂飙猛进。从 ChatGPT 横空出世到各种大语言模型(LLM)接连上线,似乎每个人的朋友圈都在讨论 AI 会不会“ ...
2024-12-26数据分析师这个职业已经成为了职场中的“香饽饽”,无论是互联网公司还是传统行业,都离不开数据支持。想成为一名优秀的数据分析 ...
2024-12-26在数据驱动决策成为商业常态的今天,数据分析师这一职业正迎来前所未有的机遇与挑战。很多希望转行或初入职场的人士不禁询问:数 ...
2024-12-25数据分析师,这一近年来炙手可热的职业,吸引了大量求职者的注意。凭借在大数据时代中的关键作用,数据分析师不仅需要具备处理数 ...
2024-12-25在当今数字化变革的浪潮中,数据分析师这一职业正迎来前所未有的发展机遇。回想我自己初入数据分析行业时,那种既兴奋又略显谨慎 ...
2024-12-25在当今信息爆炸的时代,数据已经像空气一样无处不在,而数据分析则是解锁这些信息宝藏的钥匙。数据分析的过程就像是一次探险,从 ...
2024-12-25在职场上,拍脑袋做决策的时代早已过去。数据分析正在成为每个职场人的核心竞争力,不仅能帮你找到问题,还能提供解决方案,提升 ...
2024-12-24