- 网络加深后训练误差为何反而升高?残差连接的恒等捷径与梯度分流
从深层网络的退化问题出发,手算残差块的前向叠加与反向梯度分流,拆解投影捷径、预归一化和 PyTorch 2.13 实现。
20 分钟 中文 - 同一个张量究竟该沿哪条轴标准化?BatchNorm 与 LayerNorm 的训练/推理差异
从批量大小变化引发的预测漂移出发,手算 BatchNorm 与 LayerNorm 的统计轴,拆解运行统计量、仿射参数和 PyTorch 2.13 训练/推理语义。
19 分钟 中文 - 梯度方向反复横跳怎么办?Momentum 与 Adam 如何重塑更新步长
从狭长谷底中的 SGD 振荡出发,手算 Momentum 与 Adam 的状态更新、偏差修正和逐参数缩放,并用 PyTorch 2.13 构建可调试训练循环。
19 分钟 中文 - 网络加深后信号为何消失?Xavier 与 He 初始化如何守住方差
从深层网络的方差连乘出发,手算前向与反向信号尺度,推导 Xavier/He 初始化,并用 PyTorch 2.13 逐层诊断激活和梯度。
17 分钟 中文 - 一个标量误差怎样找到所有参数?计算图、链式法则与反向传播
从有限差分的高成本出发,手算微型计算图的反向传播,解释向量—雅可比积、梯度累加与 PyTorch 2.13 autograd 调试。
18 分钟 中文 - 叠得更深为何仍只是一条直线?激活函数如何让神经网络表达 XOR
从多层线性变换仍会折叠成一层出发,手算 ReLU 网络如何分开 XOR,追踪张量形状,并用 PyTorch 2.13 实现可调试的两层感知机。
14 分钟 中文
返回