逻辑回归是最简单的机器学习模型,常常应用于各种简单的任务中。这里记录逻辑回归的背景以及学习方法,权当自己的学习记录总结。
逻辑回归:首先,它不是一个回归模型,而是一个分类模型,它是被用来做分类的。 之所以称之为回归,是因为它的学习的是模型模型的参数以最佳拟合已有的数据。(比如,根据已有的一些点,回归出它的直线参数的拟合过程,就称之为回归。)
学习方法:梯度上升法,随机梯度上升法。
模型特点:
1. 优点:训练快、易理解、易实现
2. 缺点:模型不够强大、拟合能力有限,欠拟合,对于复杂的任务效果不够好
在二分类的模型中,我们能最希望的函数是一个二值化函数,也就是
h(x) = 0 当 x > 阈值,h(x)=1 当 x < 阈值
函数下图所示:
然而,虽然这个函数是我们很想学习到的函数,但是由于它在阈值点处的跳跃性(不连续性),使得它变得不好处理(比如在该点处没有导数(梯度)的问题)。
幸好,自然是美好的,我们可以用其它的函数来近似这个函数,Sigmoid 函数就是一个很好的近似方法
其函数图形如下所示(值阈(0–>1))
函数表达式为:
相比于原始的二值化函数,sigmoid函数具有处处连续、可导的优点。
为了实现逻辑回归分类器,我们将每个特征都乘以一个回归系数wi,然后将结果相加得到一个值,并将这个值带入到sigmoid函数中,就会得到一个0–>1之间的数值,而大于0.5的值被分为1类,小于0.5的被分为0类。所以,逻辑回归也被称之为一个概率估计模型。
在已经确定了分类器模型的函数形式之后,问题就在于如何学习以获得最佳的回归系数?
主要是采用梯度上升及其变形的方法。
它的思想是:要找到某个函数的最大值,最好的方法就是沿着该函数的梯度方向进行寻找。(要有梯度就要求待计算的点有定义并且可导,所以二值化函数不能使用。)
权重更新:
其中alpha为步长,学习(训练)的停止条件一般为:迭代到达一定的次数,或者算法已经到达了一定的误差范围之内。
注意区别于梯度下降法:跟梯度上升法是相同的道理,加法变为减法。
随机梯度上升法:因为梯度上升法在每次更新回归系数的时候都需要遍历整个数据集合,当数据很多的时候,就不适用了,改进的方法为:一次只使用一个样本来更新回归系数,这种方法称之为随机梯度上升法。
只是它用来寻找最小值(一般是loss最小),而梯度上升法用来寻找最大值。
所以总的来说,逻辑回归的计算方法很简单,就分为两步:1,计算梯度,2,更新权值。
具体的权重更新方法为:
具体的代码如下(python):
def sigmoid(x):
'''
逻辑回归的判别函数
'''
return 1.0/(1.0+exp(-x))
def gradientAscent(datas,labels):
'''
输入参数datas:训练数据矩阵,每一行为一个数据
输入参数labels:标签数据,为一个值。
要求参数数据匹配
'''
dataX = mat(datas)
#每列代表一个特征,每行代表不同的训练样本。
dataY = mat(labels).transpose()
#标签,将行向量转置为列向量
m,n = shape(dataX)
alpha = 0.001
#步长,也就是学习率
itera_num = 1000
#迭代次数
W = ones((n,1))
for i in range(itera_num):
H = sigmoid(dataX * W)
# H 是一个列向量,元素个数==m
error = dataY - H
W = W + alpha * X.transpose()*error
return W
def stochasticGradientAscent(datas,labels):
dataX = mat(datas)
#每列代表一个特征,每行代表不同的训练样本。
dataY = mat(labels).transpose()
#标签,将行向量转置为列向量
m,n = shape(datas)
alpha = 0.01
W = ones(n)
for i in range(m):
h = sigmoid(sum(dataX[i]*W))
error = dataY[i] - h
W = W + alpha * error *dataX[i]
return W
总结: 逻辑回归的目的是为了寻找非线性函数Sigmoid的最佳拟合参数中的权值w,其w的值通过梯度上升法来学习到。随机梯度上升一次只处理少量的样本,节约了计算资源同时也使得算法可以在线学习。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析领域,Excel作为一种普及率极高且功能强大的工具,无疑为无数专业人士提供了便捷的解决方案。尽管Excel自带了丰富的功 ...
2025-01-17在这个瞬息万变的时代,许多人都在寻找能让他们脱颖而出的职业。而数据分析师,作为大数据和人工智能时代的热门职业,自然吸引了 ...
2025-01-14Python作为一门功能强大的编程语言,已经成为数据分析和可视化领域的重要工具。无论你是数据分析的新手,还是经验丰富的专业人士 ...
2025-01-10完全靠数据决策,真的靠谱吗? 最近几年,“数据驱动”成了商界最火的关键词之一,但靠数据就能走天下?其实不然!那些真正成功 ...
2025-01-09SparkSQL 结构化数据处理流程及原理是什么?Spark SQL 可以使用现有的Hive元存储、SerDes 和 UDF。它可以使用 JDBC/ODB ...
2025-01-09在如今这个信息爆炸的时代,数据已然成为企业的生命线。无论是科技公司还是传统行业,数据分析正在深刻地影响着商业决策以及未来 ...
2025-01-08“数据为王”相信大家都听说过。当前,数据信息不再仅仅是传递的媒介,它成为了驱动经济发展的新燃料。对于企业而言,数据指标体 ...
2025-01-07在职场中,当你遇到问题的时候,如果感到无从下手,或者抓不到重点,可能是因为你掌握的思维模型不够多。 一个好用的思维模型, ...
2025-01-06在现代企业中,数据分析师扮演着至关重要的角色。每天都有大量数据涌入,从社交媒体到交易平台,数据以空前的速度和规模生成。面 ...
2025-01-06在职场中,许多言辞并非表面意思那么简单,有时需要听懂背后的“潜台词”。尤其在数据分析的领域里,掌握常用术语就像掌握一门新 ...
2025-01-04在当今信息化社会,数据分析已成为各行各业的核心驱动力。它不仅仅是对数字进行整理与计算,而是在数据的海洋中探寻规律,从而指 ...
2025-01-03又到一年年终时,各位打工人也迎来了展示成果的关键时刻 —— 年终述职。一份出色的年终述职报告,不仅能全面呈现你的工作价值, ...
2025-01-03在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-03在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪 ...
2024-12-31数据分析,听起来好像是技术大咖的专属技能,但其实是一项人人都能学会的职场硬核能力!今天,我们来聊聊数据分析的核心流程,拆 ...
2024-12-31提到数据分析,你脑海里可能会浮现出一群“数字控”抱着电脑,在海量数据里疯狂敲代码的画面。但事实是,数据分析并没有你想象的 ...
2024-12-31关于数据分析师是否会成为失业高危职业,近年来的讨论层出不穷。在这个快速变化的时代,技术进步让人既兴奋又不安。今天,我们从 ...
2024-12-30