
协同过滤推荐算法是诞生时间最早,而且应用广泛的,著名的推荐算法。其最主要的功能进行是预测和推荐。协同过滤推荐算法可以通过对用户历史行为数据的挖掘,从而发现用户的偏好,并且基于不同的偏好,将用户划分为不同的群组,并推荐品味相似的商品。基于用户的协同过滤算法user-based collaboratIve filtering,是协同过滤推荐算法的极为重要的一个分类,今天小编主要给大家分享基于用户的协同过滤算法的原理和实现。
一、基于用户的协同过滤算法概念
基于用户(user-based)的协同过滤算法是通过,挖掘用户的历史行为数据,发现用户对商品或内容的偏好,并对这些偏好进行度量和打分。之后根据不同用户对相同商品或内容的态度以及偏好程度,来计算用户之间的相似度关系。基于用户的协同过滤,主要计算的是用户与用户之间的相似度,只需要找出相似用户喜欢的物品,并预测出目标用户对对应物品的评分,就能够找到评分最高的物品推荐给用户,这样能够挖掘用户的隐藏属性。
二、基于用户的协同过滤算法原理
基于用户的协同过滤算法主要包括以下两个步骤:
(1) 找到与目标用户兴趣相似的用户集合。
(2) 找到此集合中的用户感兴趣的,并且目标用户没有接触过的的物品推荐给目标用户。
基于用户User-CF算法的假设是目标用户和其他用户的兴趣、偏好相似,那么他们喜欢的东西都应该也相似,就是常说的人以群分。
基于用户的协同过滤算法适用于用户较少、用户个性化兴趣不太显著的情况,这样,在推荐过程中用户新的行为不一定会导致推荐结果的变化,但是如果用户过多,那么计算用户相似矩阵的代价就会太大。并且这一算法不能解决新用户进来的冷启动问题,新物品进来却可以较快地进行推荐。
三、算法实现
1.计算用户相似度
user-item: movieId 1 2 3 4 5 6 7 8 userId 1 3.5 2.0 NaN 4.5 5.0 1.5 2.5 2.0 2 2.0 3.5 4.0 NaN 2.0 3.5 NaN 3.0 3 5.0 1.0 1.0 3.0 5.0 1.0 NaN NaN 4 3.0 4.0 4.5 NaN 3.0 4.5 4.0 2.0 5 NaN 4.0 1.0 4.0 NaN NaN 4.0 1.0 6 NaN 4.5 4.0 5.0 5.0 4.5 4.0 4.0 7 5.0 2.0 NaN 3.0 5.0 4.0 5.0 NaN 8 3.0 NaN NaN 5.0 4.0 2.5 3.0 4.0 # 构建共同的评分向量 def build_xy(user_id1, user_id2): bool_array = df.loc[user_id1].notnull() & df.loc[user_id2].notnull() return df.loc[user_id1, bool_array], df.loc[user_id2, bool_array] #如此用户评分矩阵中用户1,和用户2的共同评分向量是 movieId 1 3.5 2 2.0 5 5.0 6 1.5 8 2.0 Name: 1, dtype: float64, movieId 1 2.0 2 3.5 5 2.0 6 3.5 8 3.0 Name: 2, dtype: float64) # 皮尔逊相关系数 def pearson(user_id1, user_id2): x, y = build_xy(user_id1, user_id2) mean1, mean2 = x.mean(), y.mean() # 分母 denominator = (sum((x-mean1)**2)*sum((y-mean2)**2))**0.5 try: value = sum((x - mean1) * (y - mean2)) / denominator except ZeroDivisionError: value = 0 return value
2.找到相似度最高的用户并进行推荐:
# 计算最相似的邻居 def computeNearestNeighbor(user_id, k=3): return df.drop(user_id).index.to_series().apply(pearson, args=(user_id,)).nlargest(k) #与用户3相似的前3个用户 userId 1 0.819782 6 0.801784 7 0.766965 Name: userId, dtype: float64 #推荐 def recommend(user_id): # 找到最相似的用户id nearest_user_id = computeNearestNeighbor(user_id).index[0] print('最相似用户ID:') print nearest_user_id # 找出邻居评价过、但自己未曾评价的项目 # 结果:index是项目名称,values是评分 return df.loc[nearest_user_id, df.loc[user_id].isnull() & df.loc[nearest_user_id].notnull()].sort_values() #对用户3进行推荐结果 最相似用户ID: 1 movieId 8 2.0 7 2.5 Name: 1, dtype: float64
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
LSTM 模型输入长度选择技巧:提升序列建模效能的关键 在循环神经网络(RNN)家族中,长短期记忆网络(LSTM)凭借其解决长序列 ...
2025-07-11CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-11数据透视表中两列相乘合计的实用指南 在数据分析的日常工作中,数据透视表凭借其强大的数据汇总和分析功能,成为了 Excel 用户 ...
2025-07-11尊敬的考生: 您好! 我们诚挚通知您,CDA Level I和 Level II考试大纲将于 2025年7月25日 实施重大更新。 此次更新旨在确保认 ...
2025-07-10BI 大数据分析师:连接数据与业务的价值转化者 在大数据与商业智能(Business Intelligence,简称 BI)深度融合的时代,BI ...
2025-07-10SQL 在预测分析中的应用:从数据查询到趋势预判 在数据驱动决策的时代,预测分析作为挖掘数据潜在价值的核心手段,正被广泛 ...
2025-07-10数据查询结束后:分析师的收尾工作与价值深化 在数据分析的全流程中,“query end”(查询结束)并非工作的终点,而是将数 ...
2025-07-10CDA 数据分析师考试:从报考到取证的全攻略 在数字经济蓬勃发展的今天,数据分析师已成为各行业争抢的核心人才,而 CDA(Certi ...
2025-07-09【CDA干货】单样本趋势性检验:捕捉数据背后的时间轨迹 在数据分析的版图中,单样本趋势性检验如同一位耐心的侦探,专注于从单 ...
2025-07-09year_month数据类型:时间维度的精准切片 在数据的世界里,时间是最不可或缺的维度之一,而year_month数据类型就像一把精准 ...
2025-07-09CDA 备考干货:Python 在数据分析中的核心应用与实战技巧 在 CDA 数据分析师认证考试中,Python 作为数据处理与分析的核心 ...
2025-07-08SPSS 中的 Mann-Kendall 检验:数据趋势与突变分析的有力工具 在数据分析的广袤领域中,准确捕捉数据的趋势变化以及识别 ...
2025-07-08备战 CDA 数据分析师考试:需要多久?如何规划? CDA(Certified Data Analyst)数据分析师认证作为国内权威的数据分析能力认证 ...
2025-07-08LSTM 输出不确定的成因、影响与应对策略 长短期记忆网络(LSTM)作为循环神经网络(RNN)的一种变体,凭借独特的门控机制,在 ...
2025-07-07统计学方法在市场调研数据中的深度应用 市场调研是企业洞察市场动态、了解消费者需求的重要途径,而统计学方法则是市场调研数 ...
2025-07-07CDA数据分析师证书考试全攻略 在数字化浪潮席卷全球的当下,数据已成为企业决策、行业发展的核心驱动力,数据分析师也因此成为 ...
2025-07-07剖析 CDA 数据分析师考试题型:解锁高效备考与答题策略 CDA(Certified Data Analyst)数据分析师考试作为衡量数据专业能力的 ...
2025-07-04SQL Server 字符串截取转日期:解锁数据处理的关键技能 在数据处理与分析工作中,数据格式的规范性是保证后续分析准确性的基础 ...
2025-07-04CDA 数据分析师视角:从数据迷雾中探寻商业真相 在数字化浪潮席卷全球的今天,数据已成为企业决策的核心驱动力,CDA(Certifie ...
2025-07-04CDA 数据分析师:开启数据职业发展新征程 在数据成为核心生产要素的今天,数据分析师的职业价值愈发凸显。CDA(Certified D ...
2025-07-03