数据分析中常见的七种回归分析以及R语言实现（四）---多项式回归-CDA数据分析师官网

热线电话：13121318867

首页精彩阅读数据分析中常见的七种回归分析以及R语言实现（四）---多项式回归

数据分析中常见的七种回归分析以及R语言实现（四）---多项式回归

2017-01-23

数据分析中常见的七种回归分析以及R语言实现（四）---多项式回归

在我们平时做回归的时候，大部分都是假定自变量和因变量是线性，但有时候自变量和因变量可能是非线性的，这时候我们就可能需要多项式回归了，多项式回归就是自变量和因变量是非线性所做的一个回归模型，其表达式：

Y=A0+A1X1+A2X2^2+ANXN^2+u

公式存手打，不是很好看，其特定就是右边的等式只有一个自变量，但却以不同的次幂出现，这时候在令Xn^n=XnJ,将模型转换成相应的多元线性回归模型

Y=A0+A1X1J+A2X2J+A3X3J....+u等，从而可以使用最小二乘法进行参数估计；

R语言代码，这里我使用R语言自带的身高体重的数据作为示例，也好久没做一个完整的分析了，这次稍微分析全一些，可以参考《R语言实战》回归篇

确定问题

首先我们要想知道升高和体重是否有什么关联，如果有关联那又是怎么样的关联呢？

数据说明

这里我们使用R语言自带的women数据集，这个不需要安装说明包，R语言自己就自带了，存在两个字段，体重和身高

height 身高

weight 体重

数据探索和可视化

首先我们先使用head()函数看看数据的前六行，因为这样我们可以大致确定数据集的字段名称和数据内容；然后在使用summary()得到数据集的总概括

head(women)

体重的数值大约是是身高的一半，这是我们的猜测；

summary(women)

体重的最小值是58，最大值是72，均值为65；这时候我们在使用看一下身高随体重的分布，因为数据集就两个列；可以直接使用Plot函数

plot(women)

可以看得出体重和身高大致呈现线性关系，略有非线性的因素；这时候我们在回归建模前先看看两个变量的相关系数，这时候我们使用cor函数得到他们的皮尔森相关系数矩阵

cor(women)

身高体重相关系数高达0.995，说明高度相关；接下来我们使用lm函数建模

fit <- lm(weight~height,data=women)

summary(fit)

截距项和体重都和身高高度显著，模型残差1.525，调整后的可决系数是0.9903；模型算是接近完美了，不过由于我们前面看到数据有些轻微的非线性分布，我们能否改进这个模型呢？

多项式回归

这里我们使用多项式回归去拟合数据，给它增加一个二次项，也就是height^2,这里不能增加过多的幂次项，因为有可能导致过拟合，I(height^2)，I函数具体用法可以查查；

fit2 <- lm(weight~height+I(height^2),data=women)

summary(fit2)

从上结果上三个项都高度显著，模型貌似更优了，模型残差0.384，调整后的可决系数0.999；

这里就说那么多

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

R语言字段最小二乘过拟合线性回归数据分析

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

数据分析中常见的七种回归分析以及R语言实现（四）---多项式回归

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

【CDA干货】Python HTTP请求工具类：从封装到实战的 ...

【CDA干货】标准差/均值＞0.5：数据高波动的实用判 ...

CDA数据分析师：以SQL为刃，精准挖掘数据价值 ...

一文讲清楚CDA数据分析师考试，2025年最新Q&A，你想 ...

【CDA干货】Excel柱形图背景色设置：从基础美化到数 ...

【CDA干货】t检验：小样本统计推断的核心工具——从 ...

CDA数据分析师：以数据库为基，筑牢数据洞察根基 ...

【CDA干货】神经网络最后一层：激活函数加还是不加 ...

【CDA干货】特征相对重要性：解锁模型鲁棒性与可解 ...

CDA数据分析师：指标体系搭建方法论，让数据驱动精 ...

【CDA干货】回归分析中调整后R方为负？本质、成因与 ...

【CDA干货】经纬度热力图：从离散坐标到空间密度的 ...

CDA数据分析师：用通用与场景指标，构建业务洞察双 ...

【CDA干货】季节分解法：解锁时间序列数据的“四季 ...

【CDA干货】大数据存储技术全景解析：从架构到选型 ...

CDA数据分析师：以指标为钥，解锁数据与业务的连接 ...

【CDA干货】神经网络损失函数：没有“最佳值”，但 ...

CDA数据分析师：用参数估计，让样本数据说出总体真 ...

【CDA干货】数据标准化后出现负值？别急！场景化解 ...

【CDA干货】数据驱动增长：三大行业A/B测试落地案例 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载