交叉表显示了每个变量的不同类别组合中观察到的频率或计数。通俗地说,就是根据不同列的数据统计了频数
df = pd.DataFrame(
{ 'High': ["高", "高", "高", "中", "中", "中", "低", "低", "低", "高", "低"],
'Weight': ["重", "轻", "中", "中", "轻", "重", "重", "轻", "中", "重", "轻"]
})
df
pd.crosstab(df['High'], df['Weight'])
Weight | 中 | 轻 | 重 |
---|---|---|---|
High | |||
中 | 1 | 1 | 1 |
低 | 1 | 2 | 1 |
高 | 1 | 1 | 2 |
双层crosstab
df = pd.DataFrame(
{ 'High': ["高", "高", "高", "中", "中", "中", "低", "低", "低", "高", "低"],
'Weight': ["重", "轻", "中", "中", "轻", "重", "重", "轻", "中", "重", "轻"],
'Size': ["大", "中", "小", "中", "中", "大", "中", "小", "小", "大", "小"]})
df
High | Weight | Size | |
---|---|---|---|
0 | 高 | 重 | 大 |
1 | 高 | 轻 | 中 |
2 | 高 | 中 | 小 |
3 | 中 | 中 | 中 |
4 | 中 | 轻 | 中 |
5 | 中 | 重 | 大 |
6 | 低 | 重 | 中 |
7 | 低 | 轻 | 小 |
8 | 低 | 中 | 小 |
9 | 高 | 重 | 大 |
10 | 低 | 轻 | 小 |
pd.crosstab(df['High'], [df['Weight'], df['Size']], rownames=['High'], colnames=['Weight', 'Size'])
Weight | 中 | 轻 | 重 | |||
---|---|---|---|---|---|---|
Size | 中 | 小 | 中 | 小 | 中 | 大 |
High | ||||||
中 | 1 | 0 | 1 | 0 | 0 | 1 |
低 | 0 | 1 | 0 | 2 | 1 | 0 |
高 | 0 | 1 | 1 | 0 | 0 | 2 |
另一种 宽表转长表 pd.wide_to_long()
np.random.seed(123)
df = pd.DataFrame({"A1970" : {0 : "a", 1 : "b", 2 : "c"},
"A1980" : {0 : "d", 1 : "e", 2 : "f"},
"B1970" : {0 : 2.5, 1 : 1.2, 2 : .7},
"B1980" : {0 : 3.2, 1 : 1.3, 2 : .1},
"X" : dict(zip(range(3), np.random.randn(3)))
})
df["id"] = df.index
df
A1970 | A1980 | B1970 | B1980 | X | id | |
---|---|---|---|---|---|---|
0 | a | d | 2.5 | 3.2 | -1.085631 | 0 |
1 | b | e | 1.2 | 1.3 | 0.997345 | 1 |
2 | c | f | 0.7 | 0.1 | 0.282978 | 2 |
把id
列用作标识列
pd.wide_to_long(df, ["A", "B"], i="id", j="year")
X | A | B | ||
---|---|---|---|---|
id | year | |||
0 | 1970 | -1.085631 | a | 2.5 |
1 | 1970 | 0.997345 | b | 1.2 |
2 | 1970 | 0.282978 | c | 0.7 |
0 | 1980 | -1.085631 | d | 3.2 |
1 | 1980 | 0.997345 | e | 1.3 |
2 | 1980 | 0.282978 | f | 0.1 |
df = pd.DataFrame({
'famid': [1, 1, 1, 2, 2, 2, 3, 3, 3],
'birth': [1, 2, 3, 1, 2, 3, 1, 2, 3],
'ht1': [2.8, 2.9, 2.2, 2, 1.8, 1.9, 2.2, 2.3, 2.1],
'ht2': [3.4, 3.8, 2.9, 3.2, 2.8, 2.4, 3.3, 3.4, 2.9]
})
df
famid | birth | ht1 | ht2 | |
---|---|---|---|---|
0 | 1 | 1 | 2.8 | 3.4 |
1 | 1 | 2 | 2.9 | 3.8 |
2 | 1 | 3 | 2.2 | 2.9 |
3 | 2 | 1 | 2.0 | 3.2 |
4 | 2 | 2 | 1.8 | 2.8 |
5 | 2 | 3 | 1.9 | 2.4 |
6 | 3 | 1 | 2.2 | 3.3 |
7 | 3 | 2 | 2.3 | 3.4 |
8 | 3 | 3 | 2.1 | 2.9 |
把famid
, birth
两列用作标识列
l = pd.wide_to_long(df, stubnames='ht', i=['famid', 'birth'], j='age')
l
ht | |||
---|---|---|---|
famid | birth | age | |
1 | 1 | 1 | 2.8 |
2 | 3.4 | ||
2 | 1 | 2.9 | |
2 | 3.8 | ||
3 | 1 | 2.2 | |
2 | 2.9 | ||
2 | 1 | 1 | 2.0 |
2 | 3.2 | ||
2 | 1 | 1.8 | |
2 | 2.8 | ||
3 | 1 | 1.9 | |
2 | 2.4 | ||
3 | 1 | 1 | 2.2 |
2 | 3.3 | ||
2 | 1 | 2.3 | |
2 | 3.4 | ||
3 | 1 | 2.1 | |
2 | 2.9 |
数据质量对决策支持的重要性 高质量数据为企业提供可靠依据,帮助制定更有效战略,减少错误和风险。 影响客户信任和满意度 准 ...
2024-11-28优化数据治理沟通流程 明确沟通路径和制定计划 确定关键利益相关者,包括高层管理人员、数据所有者等。 制定详细的沟通计划,包 ...
2024-11-28数据治理在数据集成与共享中扮演着至关重要的角色。它通过确立规则、流程和标准来保障数据的质量、安全性和合规性,为数据整合和 ...
2024-11-28数据治理在数字化转型中扮演着至关重要的角色,其主要职责是确保数据的可用性、质量和安全性,从而支持企业的战略目标和业务需求 ...
2024-11-28政策推动与基础设施建设 - 许多国家的公共科研资助机构已经制定了数据管理与共享政策,如美国国立健康研究院、美国科学基金会、 ...
2024-11-28元数据管理的关键作用 元数据管理对于确保数据质量和有效性至关重要。通过描述数据的结构、含义、来源和使用方式等信息,元数据 ...
2024-11-28在电商行业中,指标数据分析扮演着业务优化的关键角色。企业通过深入分析各项业务指标,可以全面了解运营状况、客户行为模式以及 ...
2024-11-28在电商行业中,指标数据分析是业务优化的重要工具。通过对业务指标的深入分析,企业可以全面了解运营状况、客户行为以及市场趋势 ...
2024-11-28重要数据安全管理策略 制定全面的数据安全政策 中小企业在数字化时代面临着越来越多的数据安全挑战。为确保数据安全,企业应制 ...
2024-11-28大数据时代带来了巨大的机遇和挑战,准确而精确的数据分析变得至关重要。数据分析旨在从海量、多样化的数据中提取洞察,支持决策 ...
2024-11-28在进行行业分析时,了解和掌握常用的业务术语至关重要。这些术语涵盖了市场竞争、消费者行为、企业战略等多个方面,为分析师提供 ...
2024-11-28数据治理在企业战略中的关键作用 企业数据战略的成功实施离不开有效的数据治理,这是确保数据质量、一致性、可用性、安全性和合 ...
2024-11-28定义与用途 主数据(Master Data) 主数据是组织内多个系统、应用和流程共享的核心业务实体数据,例如客户、产品、员工信息。这 ...
2024-11-28中小企业数据安全管理挑战 在当今数字化时代,中小企业面临着越来越多的数据安全管理挑战。数据泄露可能导致灾难性后果,从信任 ...
2024-11-28在当今信息爆炸的时代,数据分析已经成为商业领域中至关重要的一环。从制定战略决策到优化运营流程,数据分析贯穿于各个层面,为 ...
2024-11-28数据治理技术在金融行业中扮演着至关重要的角色,不仅有助于保护敏感信息和遵守监管要求,还可以提升数据管理的效率和质量。优化 ...
2024-11-28数据在当今商业环境中扮演着至关重要的角色,而数据的质量则是保证这些信息资产有效利用的关键。数据质量检查流程旨在确保数据准 ...
2024-11-28企业文化和数据制度建设在当今数字经济时代扮演着至关重要的角色。随着政策指导的日益完善,构建数据基础制度已成为国家战略的一 ...
2024-11-28建立健全的数据治理框架 - 企业应建立明确的数据治理框架,包括数据质量标准、数据管理流程和责任分配,以确保数据的准确性、一 ...
2024-11-28数据运维的重要性在当今数字化时代日益凸显,而要确保数据系统稳定、高效运行,则需要遵循一系列最佳实践。这些实践涵盖了诸多方 ...
2024-11-28