返回
从 token id 的无序性出发,手算 Embedding 查表和重复行梯度,追踪 LM Head 的词表 logits,并用 PyTorch 2.14 正确实现权重绑定。
机器学习系统学习系列
机器学习
深度学习
语言模型
从原始 token 序列出发,手算标签错位与交叉熵,追踪 logits、padding 和文档边界,并用 PyTorch 2.14 写出可检查的语言模型训练步。