作者 | CDA数据分析师
之前的文章写了Python的基础知识,从这部分内容开始正式进入到正式的数据分析过程中,主要讲述每个数据分析过程都会用到什么操作,这些操作用Excel是怎样实现的,如果用Python,那么代码又该怎么写。
接下来的几章我们会用到Pandas、NumPy、matplotlib这几个模块,在使用它们之前我们需要先将其导入,导入的方法在Python基础知识部分提到过,一个程序中只需要导入一次即可。
为了引用模块时书写方面,上面的代码中用as分别给这几个模块起了别名。所以在本文中见到pd就是代表Pandas,见到np就是代表NumPy,见到plt就是代表matplotlib . pyplot。
Series是一种类似于一位数组的对象,由一组数据及一组与之相关的数据标签(即索引)组成。
上面这样的数据结构就是Series,第一列数字是数据标签,第二列是具体的数据,数据标签与数据是一一对应的,上面的数据用Excel表展示如下表所示:
2、创建一个Series
创建一个Series利用的方法是pd.Series(),通过给Series()方法传入不同的对象即可实现
(1)传入一个列表
传入一个列表的实际如下所示:
如果只是传入一个列表不指定数据标签,那么Series会默认使用从0开始的数做数据标签,上面的0、1、2、3就是默认的数据标签。
(2)指定索引
直接传入一个列表会使用默认索引,也可以通过设置index参数来自定义索引。
(3)传入一个字典
也可以将数据与数据标签以key:value(字典)的形式传入,这样字典的key值就是数据标签,value就是数据值。
3、利用index方法获取Series的索引
获取一组数据的索引是比较常见的需求,直接利用index方法 就可以获取Series的索引值,代码如下图所示:
4、利用values方法获取Series的值
与索引值相对用的就是获取Series的值,使用的方法是values方法。
Series是由一组数据与一组索引(行索引)组成的数据结构,而DataFrame是由一组数据与一对索引(行索引和列索引)组成的表格型数据结构。之所以叫表格型数据结构,是因为DataFrame是数据形式和Excel的数据存储形式很相近,接下来的章节围绕DataFrame这种表格型数据结构展开。下面就是一个简单的DataFrame数据结构。
上面这种数据结构和Excel的数据结构很像,既有行索引又有列索引,由行索引和列索引确定唯一值。如果把上面这种结构用Excel表展示如下图所示。
2、创建一个DataFrame
创建DataFrame使用的方法是pd.Dataframe(),通过DataFrame()的方法传入不同的对象即可实现。
(1)传入一个列表
传入一个列表的实现如下图所示:
只传入一个单一列表时,该列表的值会显示成一列,且行和列都是从0开始的默认索引。
(2)传入一个嵌套列表
当传入一个嵌套列表时,会根据嵌套列表数显示成多列数据,行、列索引同样是从0 开始的默认索引。列表里面嵌套的列表也可以换成元组。
(3)指定行、列索引
如果只给DataFrame()方法传入列表,DataFrame()方法的行、列索引都是默认值,则可以通过设置columns参数自定义列索引,设置index参数自定义行索引。
(4)传入一个字典
传入一个字典的实现如下图所示。
直接以字典的形式传入DataFrame时,字典的key值就相当于列索引,这个时候如果没有设置行索引,行索引还是使用从0 开始的默认索引,同样可以使用index参数自定义行索引,代码如下:
3、获取DataFrame的行、列索引
利用columns方法获取DataFrame的列索引。
利用index方法获取DataFrame的行索引。
4、获取DataFrame的值
获取DataFrame的值就是获取DataFrame中的某些行或列,有关行、列的选择会在后面的内容说到。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
你是否被统计学复杂的理论和晦涩的公式劝退过?别担心,“山有木兮:统计学极简入门(Python)” 将为你一一化解这些难题。课程 ...
2025-03-31在电商、零售、甚至内容付费业务中,你真的了解你的客户吗? 有些客户下了一两次单就消失了,有些人每个月都回购,有些人曾经是 ...
2025-03-31在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的需求持续飙升。世界经济论坛发布的《未来就业报告》, ...
2025-03-28你有没有遇到过这样的情况?流量进来了,转化率却不高,辛辛苦苦拉来的用户,最后大部分都悄无声息地离开了,这时候漏斗分析就非 ...
2025-03-27TensorFlow Datasets(TFDS)是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API,允许用户从现有集合中 ...
2025-03-26"不谋全局者,不足谋一域。"在数据驱动的商业时代,战略级数据分析能力已成为职场核心竞争力。《CDA二级教材:商业策略数据分析 ...
2025-03-26当你在某宝刷到【猜你喜欢】时,当抖音精准推来你的梦中情猫时,当美团外卖弹窗刚好是你想吃的火锅店…… 恭喜你,你正在被用户 ...
2025-03-26当面试官问起随机森林时,他到底在考察什么? ""请解释随机森林的原理""——这是数据分析岗位面试中的经典问题。但你可能不知道 ...
2025-03-25在数字化浪潮席卷的当下,数据俨然成为企业的命脉,贯穿于业务运作的各个环节。从线上到线下,从平台的交易数据,到门店的运营 ...
2025-03-25在互联网和移动应用领域,DAU(日活跃用户数)是一个耳熟能详的指标。无论是产品经理、运营,还是数据分析师,DAU都是衡量产品 ...
2025-03-24ABtest做的好,产品优化效果差不了!可见ABtest在评估优化策略的效果方面地位还是很高的,那么如何在业务中应用ABtest? 结合企业 ...
2025-03-21在企业数据分析中,指标体系是至关重要的工具。不仅帮助企业统一数据标准、提升数据质量,还能为业务决策提供有力支持。本文将围 ...
2025-03-20解锁数据分析师高薪密码,CDA 脱产就业班助你逆袭! 在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的 ...
2025-03-19在 MySQL 数据库中,查询一张表但是不包含某个字段可以通过以下两种方法实现:使用 SELECT 子句以明确指定想要的字段,或者使 ...
2025-03-17在当今数字化时代,数据成为企业发展的关键驱动力,而用户画像作为数据分析的重要成果,改变了企业理解用户、开展业务的方式。无 ...
2025-03-172025年是智能体(AI Agent)的元年,大模型和智能体的发展比较迅猛。感觉年初的deepseek刚火没多久,这几天Manus又成为媒体头条 ...
2025-03-14以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-13以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/go ...
2025-03-12以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-11随着数字化转型的加速,企业积累了海量数据,如何从这些数据中挖掘有价值的信息,成为企业提升竞争力的关键。CDA认证考试体系应 ...
2025-03-10