关于
CS Student / Developer
你好,我是傑,一名关注大模型与 AI for Science 的计算机科学学生。我有前后端开发实践, 参加过计算机设计大赛、软件杯、华中杯等竞赛,并持续学习机器学习、深度学习与大模型应用开发。
了解更多
文章
- 生成 4 个 Token 为何不一定要跑 4 次大模型?Speculative Decoding 的提议、验证与接受
- 一个长 Prompt 为何让所有流式输出停顿?Chunked Prefill 的 Token 预算
- 请求不断到达时为何还要等整批结束?Continuous Batching 的逐轮调度
- KV Cache 还有空间为何新请求却进不来?PagedAttention 的块表与碎片控制
- 注意力公式没变,为何还能快几倍?FlashAttention 的分块、在线 Softmax 与 IO
- 模型按层切开后 GPU 为何仍在等待?GPipe、1F1B 与 Micro-batch 调度
- 一层 MLP 太宽而放不下时怎样切?列并行、行并行与块尾归约
- 每张卡为何还要保留完整模型?FSDP2 的参数全聚合、梯度归约分片与显存峰值
- 模型放不下一张卡时究竟该切什么?数据并行、张量并行与流水线并行的边界
- 大 Batch 放不进显存怎么办?梯度累积的精确归一化与 DDP no_sync
查看更多文章