
作者:丁点helper
来源:丁点帮你
回忆一下上一讲用到的例子:
输入数据的代码在上一讲详细讲解过,这里总结如下:
age <- c(25, 34, 59, 60, 20) #患者年龄type <- c(1, 2, 2, 2, 1) #糖尿病类型status <- c("poor", "improved", "excellent", "poor", "excellent") #病情comorbidity<- c(TRUE, FALSE, FALSE, TRUE, FALSE) #出现并发症
age、type、status、comorbidity中分别仅有一种数据类型,它们都是向量。本文介绍生成向量之后,如何对其进行简单的操作。
1. 查看与改变向量的数据类型
看到一个向量,首先要搞清楚其中包含的数据类型。就本例而言,从表面看也很容易区分,但实际上一项统计分析工作用到的向量可能很多,用函数class()可以快速知晓某向量的数据类型,例如:
class(age) [1] "numeric"class(type) [1] "numeric"class(status) [1] "character"class(comorbidity)[1] "logical"
不同类型的数据可以根据需要互相转换,用as.目标数据类型()函数:
as.numeric() #将括号中的内容转变为数值型数据 as.character() #转变为字符型as.logical() #转变为逻辑型as.factor() #转变为因子型
所以也可用as.character()将type中的数值型数据转变为字符型:
type[1] 1 2 2 2 1class(type) [1] "numeric" type <- as.character(type) # 注意要将新的结果赋值给typetype[1] "1" "2" "2" "2" "1"class(type)[1] "character"
之前讲过,将定性变量(即分类变量)以因子的形式输入会有助于后续的统计分析工作,factor()这个函数可以帮我们把数据转变为因子型:
type <- c(1, 2, 2, 2, 1) type <- factor(type) type[1] 1 2 2 2 1 Levels: 1 2class(type)[1] "factor"
用1和2这样的阿拉伯数字其实不太利于准确地表达数据内容,可以给原来的1和2加上标签:
type <- factor(type, levels = c("1", "2"), labels = c("Type 1", "Type 2")) type[1] Type 1 Type 2 Type 2 Type 2 Type 1 Levels: Type 1 Type 2
所以在输入定性变量(分类变量)时可以采用这种简便方法。
再看另一个例子:
status[1] "poor" "improved" "excellent" "poor" "excellent" status <- factor(status)status[1] poor improved excellent poor excellentLevels: excellent improved poorclass(status)[1] "factor"
由于status是一个有序分类变量,所以在转变为因子时还应体现其顺序:
status <- factor(status, levels = c('poor', 'improved','excellent'),ordered = TRUE) status[1] poor improved excellent poor excellentLevels: poor < improved < excellent
这里的顺序是根据levels这个命令中的内容生成的,可自行调整levels命令中的顺序:
status <- factor(status, levels = c('excellent','improved' ,'poor'),ordered = TRUE) status[1] poor improved excellent poor excellentLevels: excellent < improved < poor
2. 向量中的数据定位
以age这个向量为例:
age <- c(25, 34, 59, 60, 20) age [1] 25 34 59 60 20
输出向量中排在第3位的数据:
age[3] [1] 59
输出排在1,2,5位的数据:
age[c(1,2,5)] [1] 25 34 20
输出1至3位的数据:
age[c(1:3)] [1] 25 34 59
3. 向量中的数据计算
以age这个向量为例:
age <- c(25, 34, 59, 60, 20) # 仍以age为例age [1] 25 34 59 60 20 age+4 # 给向量中每个数都加4 [1] 29 38 63 64 24 sqrt(age) # 求平方根 [1] 5.000000 5.830952 7.681146 7.745967 4.472136 sort(age) # 给数据从低到高排序 [1] 20 25 34 59 60 sort(age, decreasing =T) # 给数据从高到低排序 [1] 60 59 34 25 20 age2 <- c(20,30,40,50,60) # 再生成一个向量 age+age2 # 将两向量中的元素相加 [1] 45 64 99 110 80
4. 生成特定形式的向量
生成重复数据。用rep(x, ……),x表示要重复的内容。
rep(1,times=5) #times表示重复的次数 [1] 1 1 1 1 1 rep(c(1,2),4) #times这个表达可以省略 [1] 1 2 1 2 1 2 1 2 rep(c(1,2),each=4) #each也是针对重复次数的命令 [1] 1 1 1 1 2 2 2 2
特定间隔的数据。用seq(from,to,by)这个函数,from为起始值,to为终止值,by为数据之间的间隔。
seq(1,100,19) #from,to,by都可以省略 [1] 1 20 39 58 77 96 seq(1,10) #如果不指定by的内容,则默认为1 [1] 1 2 3 4 5 6 7 8 9 10
下一篇介绍数据框的相关操作。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
SQL Server 中 CONVERT 函数的日期转换:从基础用法到实战优化 在 SQL Server 的数据处理中,日期格式转换是高频需求 —— 无论 ...
2025-09-18MySQL 大表拆分与关联查询效率:打破 “拆分必慢” 的认知误区 在 MySQL 数据库管理中,“大表” 始终是性能优化绕不开的话题。 ...
2025-09-18CDA 数据分析师:表结构数据 “获取 - 加工 - 使用” 全流程的赋能者 表结构数据(如数据库表、Excel 表、CSV 文件)是企业数字 ...
2025-09-18DSGE 模型中的 Et:理性预期算子的内涵、作用与应用解析 动态随机一般均衡(Dynamic Stochastic General Equilibrium, DSGE)模 ...
2025-09-17Python 提取 TIF 中地名的完整指南 一、先明确:TIF 中的地名有哪两种存在形式? 在开始提取前,需先判断 TIF 文件的类型 —— ...
2025-09-17CDA 数据分析师:解锁表结构数据特征价值的专业核心 表结构数据(以 “行 - 列” 规范存储的结构化数据,如数据库表、Excel 表、 ...
2025-09-17Excel 导入数据含缺失值?详解 dropna 函数的功能与实战应用 在用 Python(如 pandas 库)处理 Excel 数据时,“缺失值” 是高频 ...
2025-09-16深入解析卡方检验与 t 检验:差异、适用场景与实践应用 在数据分析与统计学领域,假设检验是验证研究假设、判断数据差异是否 “ ...
2025-09-16CDA 数据分析师:掌控表格结构数据全功能周期的专业操盘手 表格结构数据(以 “行 - 列” 存储的结构化数据,如 Excel 表、数据 ...
2025-09-16MySQL 执行计划中 rows 数量的准确性解析:原理、影响因素与优化 在 MySQL SQL 调优中,EXPLAIN执行计划是核心工具,而其中的row ...
2025-09-15解析 Python 中 Response 对象的 text 与 content:区别、场景与实践指南 在 Python 进行 HTTP 网络请求开发时(如使用requests ...
2025-09-15CDA 数据分析师:激活表格结构数据价值的核心操盘手 表格结构数据(如 Excel 表格、数据库表)是企业最基础、最核心的数据形态 ...
2025-09-15Python HTTP 请求工具对比:urllib.request 与 requests 的核心差异与选择指南 在 Python 处理 HTTP 请求(如接口调用、数据爬取 ...
2025-09-12解决 pd.read_csv 读取长浮点数据的科学计数法问题 为帮助 Python 数据从业者解决pd.read_csv读取长浮点数据时的科学计数法问题 ...
2025-09-12CDA 数据分析师:业务数据分析步骤的落地者与价值优化者 业务数据分析是企业解决日常运营问题、提升执行效率的核心手段,其价值 ...
2025-09-12用 SQL 验证业务逻辑:从规则拆解到数据把关的实战指南 在业务系统落地过程中,“业务逻辑” 是连接 “需求设计” 与 “用户体验 ...
2025-09-11塔吉特百货孕妇营销案例:数据驱动下的精准零售革命与启示 在零售行业 “流量红利见顶” 的当下,精准营销成为企业突围的核心方 ...
2025-09-11CDA 数据分析师与战略 / 业务数据分析:概念辨析与协同价值 在数据驱动决策的体系中,“战略数据分析”“业务数据分析” 是企业 ...
2025-09-11Excel 数据聚类分析:从操作实践到业务价值挖掘 在数据分析场景中,聚类分析作为 “无监督分组” 的核心工具,能从杂乱数据中挖 ...
2025-09-10统计模型的核心目的:从数据解读到决策支撑的价值导向 统计模型作为数据分析的核心工具,并非简单的 “公式堆砌”,而是围绕特定 ...
2025-09-10