- 注意力公式没变,为何还能快几倍?FlashAttention 的分块、在线 Softmax 与 IO
从显存读写瓶颈出发,手算分块在线 Softmax,解释 FlashAttention 如何不物化 L×L 矩阵、保持精确结果,并用 PyTorch 2.14 SDPA 验证后端与性能。
13 分钟 中文 - 长序列为何不必让每个 token 看见全部历史?滑动窗口、块稀疏与全局 token
从全注意力的平方成本出发,手算稀疏可见图,拆解局部窗口、块布局和全局 token,并用 PyTorch 2.14 验证掩码语义与输出。
16 分钟 中文 - 模型能接收 32K 就真的会用 32K 吗?RoPE 位置插值、频率缩放与长上下文验证
从训练长度外的 RoPE 相位失配出发,推导位置插值与非均匀频率缩放,并用长度、证据位置和任务复杂度分桶验证有效上下文。
25 分钟 中文 - 词相同但顺序不同,注意力怎样辨别位置?从正弦编码到 RoPE
从自注意力的置换等变性出发,比较正弦与学习式绝对位置,并推导 RoPE 如何把相对位移写进 Query–Key 点积。
24 分钟 中文 - 每生成一个词为何又重算全文?KV Cache 的增量解码
从自回归推理的重复前缀计算出发,追踪 Key/Value 缓存的张量生长、等价性、复杂度与工程边界。
22 分钟 中文 - 目标序列为何既要看过去又要看源文?Transformer Decoder 的三条信息流
从条件生成的信息边界出发,组装因果自注意力、交叉注意力与 FFN,并拆解并行训练和逐 token 生成。
18 分钟 中文 - 注意力之后为何还要逐位置变换?Transformer Block 的 FFN、残差与 Pre-LN
从注意力只负责位置混合的局限出发,拆解逐位置前馈网络、两条残差路径,并比较 Pre-LN 与 Post-LN 的数据流和梯度路径。
22 分钟 中文 - 所有词怎样一次看见彼此?Transformer 的缩放点积自注意力与掩码
从循环注意力的串行瓶颈出发,手算 Query、Key、Value 的缩放点积,解释多头分工、位置编码与两类掩码,并对齐 PyTorch 2.13 当前 API。
22 分钟 中文
返回