- 长序列为何不必让每个 token 看见全部历史?滑动窗口、块稀疏与全局 token
从全注意力的平方成本出发,手算稀疏可见图,拆解局部窗口、块布局和全局 token,并用 PyTorch 2.14 验证掩码语义与输出。
16 分钟 中文 - 模型能接收 32K 就真的会用 32K 吗?RoPE 位置插值、频率缩放与长上下文验证
从训练长度外的 RoPE 相位失配出发,推导位置插值与非均匀频率缩放,并用长度、证据位置和任务复杂度分桶验证有效上下文。
25 分钟 中文 - 词相同但顺序不同,注意力怎样辨别位置?从正弦编码到 RoPE
从自注意力的置换等变性出发,比较正弦与学习式绝对位置,并推导 RoPE 如何把相对位移写进 Query–Key 点积。
24 分钟 中文 - 每生成一个词为何又重算全文?KV Cache 的增量解码
从自回归推理的重复前缀计算出发,追踪 Key/Value 缓存的张量生长、等价性、复杂度与工程边界。
22 分钟 中文 - 目标序列为何既要看过去又要看源文?Transformer Decoder 的三条信息流
从条件生成的信息边界出发,组装因果自注意力、交叉注意力与 FFN,并拆解并行训练和逐 token 生成。
18 分钟 中文 - 注意力之后为何还要逐位置变换?Transformer Block 的 FFN、残差与 Pre-LN
从注意力只负责位置混合的局限出发,拆解逐位置前馈网络、两条残差路径,并比较 Pre-LN 与 Post-LN 的数据流和梯度路径。
22 分钟 中文 - 所有词怎样一次看见彼此?Transformer 的缩放点积自注意力与掩码
从循环注意力的串行瓶颈出发,手算 Query、Key、Value 的缩放点积,解释多头分工、位置编码与两类掩码,并对齐 PyTorch 2.13 当前 API。
22 分钟 中文 - 整句话为何不能只压成一个向量?Encoder–Decoder 的加性注意力与对齐
从定长上下文瓶颈出发,手算 Bahdanau 加性注意力的能量、掩码与加权和,并用 PyTorch 2.13 实现可检查的序列到序列训练和自回归推理。
17 分钟 中文
返回