京公网安备 11010802034615号
经营许可证编号:京B2-20210330
协同过滤推荐算法是诞生时间最早,而且应用广泛的,著名的推荐算法。其最主要的功能进行是预测和推荐。协同过滤推荐算法可以通过对用户历史行为数据的挖掘,从而发现用户的偏好,并且基于不同的偏好,将用户划分为不同的群组,并推荐品味相似的商品。基于用户的协同过滤算法user-based collaboratIve filtering,是协同过滤推荐算法的极为重要的一个分类,今天小编主要给大家分享基于用户的协同过滤算法的原理和实现。
一、基于用户的协同过滤算法概念
基于用户(user-based)的协同过滤算法是通过,挖掘用户的历史行为数据,发现用户对商品或内容的偏好,并对这些偏好进行度量和打分。之后根据不同用户对相同商品或内容的态度以及偏好程度,来计算用户之间的相似度关系。基于用户的协同过滤,主要计算的是用户与用户之间的相似度,只需要找出相似用户喜欢的物品,并预测出目标用户对对应物品的评分,就能够找到评分最高的物品推荐给用户,这样能够挖掘用户的隐藏属性。
二、基于用户的协同过滤算法原理
基于用户的协同过滤算法主要包括以下两个步骤:
(1) 找到与目标用户兴趣相似的用户集合。
(2) 找到此集合中的用户感兴趣的,并且目标用户没有接触过的的物品推荐给目标用户。
基于用户User-CF算法的假设是目标用户和其他用户的兴趣、偏好相似,那么他们喜欢的东西都应该也相似,就是常说的人以群分。
基于用户的协同过滤算法适用于用户较少、用户个性化兴趣不太显著的情况,这样,在推荐过程中用户新的行为不一定会导致推荐结果的变化,但是如果用户过多,那么计算用户相似矩阵的代价就会太大。并且这一算法不能解决新用户进来的冷启动问题,新物品进来却可以较快地进行推荐。
三、算法实现
1.计算用户相似度
user-item:
movieId 1 2 3 4 5 6 7 8
userId
1 3.5 2.0 NaN 4.5 5.0 1.5 2.5 2.0
2 2.0 3.5 4.0 NaN 2.0 3.5 NaN 3.0
3 5.0 1.0 1.0 3.0 5.0 1.0 NaN NaN
4 3.0 4.0 4.5 NaN 3.0 4.5 4.0 2.0
5 NaN 4.0 1.0 4.0 NaN NaN 4.0 1.0
6 NaN 4.5 4.0 5.0 5.0 4.5 4.0 4.0
7 5.0 2.0 NaN 3.0 5.0 4.0 5.0 NaN
8 3.0 NaN NaN 5.0 4.0 2.5 3.0 4.0
# 构建共同的评分向量
def build_xy(user_id1, user_id2):
bool_array = df.loc[user_id1].notnull() & df.loc[user_id2].notnull()
return df.loc[user_id1, bool_array], df.loc[user_id2, bool_array]
#如此用户评分矩阵中用户1,和用户2的共同评分向量是
movieId
1 3.5
2 2.0
5 5.0
6 1.5
8 2.0
Name: 1, dtype: float64,
movieId
1 2.0
2 3.5
5 2.0
6 3.5
8 3.0
Name: 2, dtype: float64)
# 皮尔逊相关系数
def pearson(user_id1, user_id2):
x, y = build_xy(user_id1, user_id2)
mean1, mean2 = x.mean(), y.mean()
# 分母
denominator = (sum((x-mean1)**2)*sum((y-mean2)**2))**0.5
try:
value = sum((x - mean1) * (y - mean2)) / denominator
except ZeroDivisionError:
value = 0
return value
2.找到相似度最高的用户并进行推荐:
# 计算最相似的邻居
def computeNearestNeighbor(user_id, k=3):
return df.drop(user_id).index.to_series().apply(pearson, args=(user_id,)).nlargest(k)
#与用户3相似的前3个用户
userId
1 0.819782
6 0.801784
7 0.766965
Name: userId, dtype: float64
#推荐
def recommend(user_id):
# 找到最相似的用户id
nearest_user_id = computeNearestNeighbor(user_id).index[0]
print('最相似用户ID:')
print nearest_user_id
# 找出邻居评价过、但自己未曾评价的项目
# 结果:index是项目名称,values是评分
return df.loc[nearest_user_id, df.loc[user_id].isnull() & df.loc[nearest_user_id].notnull()].sort_values()
#对用户3进行推荐结果
最相似用户ID:
1
movieId
8 2.0
7 2.5
Name: 1, dtype: float64
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
机器学习的本质,是让模型通过对数据的学习,自主挖掘规律、实现预测与决策,而这一过程的核心驱动力,并非单一参数的独立作用, ...
2026-03-27在SQL Server数据库操作中,日期时间处理是高频核心需求——无论是报表统计中的日期格式化、数据筛选时的日期类型匹配,还是业务 ...
2026-03-27在CDA(Certified Data Analyst)数据分析师的能力体系与职场实操中,高维数据处理是高频且核心的痛点——随着业务场景的复杂化 ...
2026-03-27在机器学习建模与数据分析实战中,特征维度爆炸、冗余信息干扰、模型泛化能力差是高频痛点。面对用户画像、企业经营、医疗检测、 ...
2026-03-26在这个数据无处不在的时代,数据分析能力已不再是数据从业者的专属技能,而是成为了职场人、管理者、创业者乃至个人发展的核心竞 ...
2026-03-26在CDA(Certified Data Analyst)数据分析师的能力体系中,线性回归是连接描述性统计与预测性分析的关键桥梁,也是CDA二级认证的 ...
2026-03-26在数据分析、市场研究、用户画像构建、学术研究等场景中,我们常常会遇到多维度、多指标的数据难题:比如调研用户消费行为时,收 ...
2026-03-25在流量红利见顶、获客成本持续攀升的当下,营销正从“广撒网”的经验主义,转向“精耕细作”的数据驱动主义。数据不再是营销的辅 ...
2026-03-25在CDA(Certified Data Analyst)数据分析师的全流程工作中,无论是前期的数据探索、影响因素排查,还是中期的特征筛选、模型搭 ...
2026-03-25在当下数据驱动决策的职场环境中,A/B测试早已成为互联网产品、运营、营销乃至产品迭代优化的核心手段,小到一个按钮的颜色、文 ...
2026-03-24在统计学数据分析中,尤其是分类数据的分析场景里,卡方检验和显著性检验是两个高频出现的概念,很多初学者甚至有一定统计基础的 ...
2026-03-24在CDA(Certified Data Analyst)数据分析师的日常业务分析与统计建模工作中,多组数据差异对比是高频且核心的分析场景。比如验 ...
2026-03-24日常用Excel做数据管理、台账维护、报表整理时,添加备注列是高频操作——用来标注异常、说明业务背景、记录处理进度、补充关键 ...
2026-03-23作为业内主流的自助式数据可视化工具,Tableau凭借拖拽式操作、强大的数据联动能力、灵活的仪表板搭建,成为数据分析师、业务人 ...
2026-03-23在CDA(Certified Data Analyst)数据分析师的日常工作与认证考核中,分类变量的关联分析是高频核心场景。用户性别是否影响商品 ...
2026-03-23在数据工作的全流程中,数据清洗是最基础、最耗时,同时也是最关键的核心环节,无论后续是做常规数据分析、可视化报表,还是开展 ...
2026-03-20在大数据与数据驱动决策的当下,“数据分析”与“数据挖掘”是高频出现的两个核心概念,也是很多职场人、入门学习者容易混淆的术 ...
2026-03-20在CDA(Certified Data Analyst)数据分析师的全流程工作闭环中,统计制图是连接严谨统计分析与高效业务沟通的关键纽带,更是CDA ...
2026-03-20在MySQL数据库优化中,分区表是处理海量数据的核心手段——通过将大表按分区键(如时间、地域、ID范围)分割为多个独立的小分区 ...
2026-03-19在商业智能与数据可视化领域,同比、环比增长率是分析数据变化趋势的核心指标——同比(YoY)聚焦“长期趋势”,通过当前周期与 ...
2026-03-19