Learn Beyond Limits

Mean Normalization|均值归一化

一、均值归一化简介 均值归一化(Mean Normalization) 是一种常见的数据预处理方法。它的核心思想是:将原始数据减去其均值,使得数据的中心值变为 0,从而消除不同数据之间的整体偏移。 在推荐系统中,用户的打分习惯差异很大:有些用户习惯给高分,有些用户则普遍打低分。如果不做处理,模型可能

bolin bolin 发布于 2025-08-25

Binary labels|二元标签

一、二元标签简介 在推荐系统中,并不是所有场景都会有用户的明确评分(比如 1 到 5 星)。更多时候,我们只能观察到用户是否产生了某种行为,例如是否点击、是否购买、是否点赞。这类数据往往用 二元标签(Binary labels) 来表示。 所谓二元标签,就是把用户的行为转化为 0/1 的结果: 1

bolin bolin 发布于 2025-08-24

Collaborative Filtering Algorithm|协同过滤算法

一、协同过滤算法简介 协同过滤算法是一种常见的推荐系统方法,它的核心思想是“物以类聚,人以群分”。也就是说,如果两个用户在过去对某些物品的兴趣相似,那么他们对其他物品的兴趣也很可能相似。换句话说,用户的行为和偏好可以相互参考。 通俗理解: 就像你会向朋友请教电影推荐:如果你和朋友过去喜欢的电影很接近

bolin bolin 发布于 2025-08-23

Using per-item Features|使用每项特征

一、用户—电影评分矩阵 在推荐系统中,最常见的任务就是预测用户对物品(这里是电影)的

bolin bolin 发布于 2025-08-22

Choosing what features to use|选择要使用的特征

一、概括 这篇文章主要围绕如何根据数据分布选择合适的特征展开。通过直方图和分布曲线对比,展示了非高斯分布的数据在经过对数、平方根、幂次等数学变换后,能够更接近高斯分布,从而提升模型的表现。文章强调了理解数据特征分布的重要性,并介绍了常见的特征变换方法,为构建更稳健的机器学习模型提供思路。 二、非高斯

bolin bolin 发布于 2025-08-21
bolin bolin 发布于 2025-08-20

Density Estimation in Anomaly Detection|异常检测中的密度估计

一、密度估计 图中说明了对多维特征向量进行密度估计的设定与公式。 训练集:{x(1),x(2),…,x(m)},每个样本 xi 有 n 个特征。右侧用列向量表示样本 xx由各维特征组成(x

bolin bolin 发布于 2025-08-18

Normal Distribution|正态分布

一、正态分布的定义 正态分布(Normal Distribution),又称高斯分布(Gaussian Distribution),是统计学和概率论中最经典、最重要的一种分布形式。它的曲线形状呈对称的钟形,中间高、两边低,且以均值为中心对称展开,数据大多集中在均值附近,越往两端越稀少。正态分布由均值

bolin bolin 发布于 2025-08-17