- 高维数据怎样压成几个方向?PCA 的最大方差、重构误差与 SVD
从相关传感器的冗余出发,统一 PCA 的最大方差与最小重构视角,手算主轴,并用 SVD 和 scikit-learn 1.9 实现可诊断降维。
17 分钟 中文 - 没有标签怎样自动分组?K 均值的分配—更新循环与失败几何
从无标签用户分群出发,推导 K 均值的簇内平方和,手算分配与中心更新,并解释初始化、尺度、选 K、调试方法和失败几何。
17 分钟 中文 - 两团高斯数据为何产生直线边界?从共享协方差到 LDA
从朴素贝叶斯忽略特征相关性出发,推导类高斯分布、马氏距离与共享协方差消去二次项,并实现可诊断的线性判别分析。
18 分钟 中文 - 只统计词频,朴素贝叶斯怎样判断垃圾邮件?从先验到对数似然
从小样本文本分类出发,手算类别先验、词频似然与拉普拉斯平滑,追踪对数空间推理,并实现可检查的多项式朴素贝叶斯。
19 分钟 中文 - 不显式增加维度,SVM 怎样画出弯曲边界?从核技巧到 RBF
从线性 SVM 无法分开同心圆出发,推导对偶表示与核技巧,手算 RBF 相似度,解释 C、gamma、支持向量和可扩展近似。
19 分钟 中文 - 能分开数据的直线有很多,SVM 为什么选择最大间隔?
从任意分界线对扰动不稳出发,推导硬间隔、软间隔与合页损失,手算 C 的作用,并用 PyTorch 和 scikit-learn 实现可诊断的线性 SVM。
17 分钟 中文 - XGBoost 为何要看二阶梯度?从叶权重到正则化分裂增益
从普通 GBDT 只看纠错方向的不足出发,手算二阶泰勒目标、叶权重与分裂增益,解释 XGBoost 的正则化和工程接口。
21 分钟 中文 - 后一棵树怎样修正前一棵?从残差到梯度提升树
从随机森林无法继续降低共同偏差出发,手算两轮残差拟合,推导负梯度与逐步加法模型,并实现可诊断的梯度提升回归。
19 分钟 中文
返回