第 3 页,共显示 8 / 73 篇文章
按年份查看 →
- 十亿段语料怎样避免反复背诵?精确去重、MinHash 与评测污染
从重复网页造成的隐式加权出发,手算 Jaccard 与 MinHash,构造可审计的精确—近重复去重流水线,并处理数据切分、阈值和分布式工程陷阱。
12 分钟 中文 - 整数编号怎样变成可学习语义?Token Embedding、梯度累加与权重绑定
从 token id 的无序性出发,手算 Embedding 查表和重复行梯度,追踪 LM Head 的词表 logits,并用 PyTorch 2.14 正确实现权重绑定。
12 分钟 中文 - 词表装不下所有单词怎么办?BPE 的高频合并、字节回退与长度代价
从整词词表的未知词问题出发,手算 BPE 合并与编码顺序,解释字节级覆盖、词表—序列长度权衡,并用 Tokenizers 0.23.2 构建可复现流水线。
11 分钟 中文 - 一句文本怎样变成训练信号?因果语言模型的标签右移与 Next-Token Loss
从原始 token 序列出发,手算标签错位与交叉熵,追踪 logits、padding 和文档边界,并用 PyTorch 2.14 写出可检查的语言模型训练步。
14 分钟 中文 - 长序列为何不必让每个 token 看见全部历史?滑动窗口、块稀疏与全局 token
从全注意力的平方成本出发,手算稀疏可见图,拆解局部窗口、块布局和全局 token,并用 PyTorch 2.14 验证掩码语义与输出。
16 分钟 中文 - 模型能接收 32K 就真的会用 32K 吗?RoPE 位置插值、频率缩放与长上下文验证
从训练长度外的 RoPE 相位失配出发,推导位置插值与非均匀频率缩放,并用长度、证据位置和任务复杂度分桶验证有效上下文。
25 分钟 中文 - 词相同但顺序不同,注意力怎样辨别位置?从正弦编码到 RoPE
从自注意力的置换等变性出发,比较正弦与学习式绝对位置,并推导 RoPE 如何把相对位移写进 Query–Key 点积。
24 分钟 中文 - 每生成一个词为何又重算全文?KV Cache 的增量解码
从自回归推理的重复前缀计算出发,追踪 Key/Value 缓存的张量生长、等价性、复杂度与工程边界。
22 分钟 中文