
文章转载自:微信公众号 Python的乐趣
作者:一粒米饭
比如像电商行业,每月有上百万条订单发货数据需要与仓库的数据进行核对计算,涉及到数据计算,筛选,匹配等步骤,用excel表超级卡,并且经常卡死。
这时如果你会Python,十几行代码就可以搞定。
这里需要两个Python库,一个是os库,一个是pandas库。
os是Python内置库,不需要额外安装,只要用import导入就可以用了。os模块封装了常见的文件和目录操作,利用它可以轻松的对系统上的目录和文件进行各种操作,比如获取当前目录、列举当前文件夹中的所有文件和文件夹、判断文件或目录是否存在、删除文件等,具体见下图。
pandas是第三方库,需要手动安装才能使用。pandas是专门用来做数据分析的强大类库,可以方便地从csv、Excel和其他文本文件以及数据库中读取数据,然后对数据进行加和、求平均值、求方差、计算最大值最小值等数据分析,支持生成Excel等格式文件或进行可视化操作,函数如下:
其中读Excel需要依赖xlrd库,写Excel依赖openpyxl,pandas、xlrd和openpyxl安装命令如下:
$ pip install xlrd openpyxl pandas
下面开始进行数据处理...
这里假设数据是按日期命名的Excel文件并且放在excel_data文件夹中,每个Excel文件包含用户ID、商品ID、商品属性列表、购买数量这几列信息。
文件夹中的所有文件如下,在linux下用ls命令列举excel_data下所有文件:
$ ls excel_data
结果:
20120702.xlsx 20131018.xlsx 20150203.xlsx 20170416.xlsx 20120703.xlsx 20131019.xlsx 20150204.xlsx 20170417.xlsx 20120704.xlsx 20131020.xlsx 20150205.xlsx 20170418.xlsx 20120705.xlsx 20131021.xlsx 20160101.xlsx 20170419.xlsx ...
实现的思路是利用os库获取所有的Excel文件,然后用pandas依次读取所有文件并合并到一起进行数据,计算出每个商品的总量以及销量前十的商品。
1.列举所有Excel文件
import os files = os.listdir("excel_data")
2.用pandas读取所有数据并合并到一起
import pandas as pd df_list = [pd.read_excel(os.path.join("excel_data", f)) for f in files] data = pd.concat(df_list)
3.统计每个商品的数量
sum_of_product = data[["商品ID", "购买数量"]].groupby(["商品ID"]).sum() sum_of_product
结果
购买数量 商品ID 1662 1 201826 17 203319 67 203320 494 203322 332 ... ... 122680025 21 122680026 8 122690023 16 122692024 48 122696024 5
获取销量前十的商品
sum_of_product.sort_values('购买数量', ascending=False).head(10)
结果:
商品ID 购买数量 50018831 56632 50007016 8291 50011993 6351 50013636 6340 50003700 6325 211122 5823 50010558 5248 50016006 4948 50006602 4692 50002524 4123
完整代码如下:
import os import pandas as pd # 获取所有Excel文件并读取数据 files = os.listdir("excel_data") df_list = [pd.read_excel(os.path.join("excel_data", f)) for f in files] data = pd.concat(df_list) # 统计每个商品的数量,并输出到Excel文件中 sum_of_product = data[["商品ID", "购买数量"]].groupby(["商品ID"]).sum() sum_of_product.to_excel("各个商品数量统计.xlsx") # 统计销量前十的商品 sum_of_product.sort_values('购买数量', ascending=False).head(10)
结果:
商品ID 购买数量 50018831 56632 50007016 8291 50011993 6351 50013636 6340 50003700 6325 211122 5823 50010558 5248 50016006 4948 50006602 4692 50002524 4123
教程就到这里,不足之处欢迎交流指正
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
探索最优回归方程:数据背后的精准预测密码 在数据分析和统计学的广阔领域中,回归分析是揭示变量之间关系的重要工具,而回 ...
2025-07-02CDA 证书:银行招聘中的 “黄金通行证” 在金融科技飞速发展的当下,银行正加速向数字化、智能化转型,海量数据成为 ...
2025-07-02CDA 数据分析师报考条件全解析:开启数据洞察之旅 在当今数字化浪潮席卷全球的时代,数据已成为企业乃至整个社会发展的核心驱 ...
2025-07-01深入解析 SQL 中 CASE 语句条件的执行顺序 在 SQL 编程领域,CASE语句是实现条件逻辑判断、数据转换与分类的重要工 ...
2025-07-01SPSS 中计算三个变量交集的详细指南 在数据分析领域,挖掘变量之间的潜在关系是获取有价值信息的关键步骤。当我们需要探究 ...
2025-07-01CDA 数据分析师:就业前景广阔的新兴职业 在当今数字化时代,数据已成为企业和组织决策的重要依据。数据分析师作为负责收集 ...
2025-06-30探秘卷积层:为何一个卷积层需要两个卷积核 在深度学习的世界里,卷积神经网络(CNN)凭借其强大的特征提取能力 ...
2025-06-30探索 CDA 数据分析师在线课程:开启数据洞察之旅 在数字化浪潮席卷全球的当下,数据已成为企业决策、创新与发展的核心驱 ...
2025-06-303D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32% 编辑:LRST 【新智元导读】中科院自动化所提出BridgeVLA模型,通过将 ...
2025-06-30LSTM 为何会产生误差?深入剖析其背后的原因 在深度学习领域,LSTM(Long Short-Term Memory)网络凭借其独特的记忆单元设 ...
2025-06-27LLM进入拖拽时代!只靠Prompt几秒定制大模型,效率飙升12000倍 【新智元导读】最近,来自NUS、UT Austin等机构的研究人员创新 ...
2025-06-27探秘 z-score:数据分析中的标准化利器 在数据的海洋中,面对形态各异、尺度不同的数据,如何找到一个通用的标准来衡量数据 ...
2025-06-26Excel 中为不同柱形设置独立背景(按数据分区)的方法详解 在数据分析与可视化呈现过程中,Excel 柱形图是展示数据的常用工 ...
2025-06-26CDA 数据分析师会被 AI 取代吗? 在当今数字化时代,数据的重要性日益凸显,数据分析师成为了众多企业不可或缺的角色 ...
2025-06-26CDA 数据分析师证书考取全攻略 在数字化浪潮汹涌的当下,数据已成为企业乃至整个社会发展的核心驱动力。数据分析师作 ...
2025-06-25人工智能在数据分析的应用场景 在数字化浪潮席卷全球的当下,数据以前所未有的速度增长,传统的数据分析方法逐渐难以满足海 ...
2025-06-25评估模型预测为正时的准确性 在机器学习与数据科学领域,模型预测的准确性是衡量其性能优劣的核心指标。尤其是当模型预测结 ...
2025-06-25CDA认证:数据时代的职业通行证 当海通证券的交易大厅里闪烁的屏幕实时跳动着市场数据,当苏州银行的数字金融部连夜部署新的风控 ...
2025-06-24金融行业的大数据变革:五大应用案例深度解析 在数字化浪潮中,金融行业正经历着深刻的变革,大数据技术的广泛应用 ...
2025-06-24Power Query 中实现移动加权平均的详细指南 在数据分析和处理中,移动加权平均是一种非常有用的计算方法,它能够根据不同数据 ...
2025-06-24