夯实底层理论与架构
把 Transformer 从 API 名词还原为张量形状、计算图和概率分布;能解释每一步,也能独立写出最小实现。
- 手推 scaled dot-product attention 与反向传播
- 独立实现 tokenizer → logits → decoding 全链路
- 写出带 mask、残差、归一化的最小 Transformer
矩阵、概率与反向传播
梯度究竟如何从 loss 回到每一层参数?
学习- 矩阵乘法与广播的形状推导
- 链式法则、Jacobian 与计算图
- softmax、交叉熵与数值稳定性
QKV 与多头注意力
为什么 QKᵀ 要除以 √dₖ,多头到底分开了什么?
学习- Q、K、V 的投影与相似度空间
- causal/padding mask 的作用时机
- 多头拼接、输出投影与复杂度
- NumPy 实现单头注意力
- PyTorch 实现多头注意力并对齐官方模块
- 画出每个张量的 batch/head/sequence 维度
Transformer 最小闭环
残差、LayerNorm、FFN 和位置编码各解决什么问题?
学习- Pre-Norm 与 Post-Norm
- 位置编码和相对位置信息
- 参数初始化、dropout 与训练稳定性
- 实现一个 decoder-only Tiny Transformer
- 在字符级语料上过拟合一个小批次
- 观察移除残差或归一化后的训练曲线
Tokenizer 到文本生成
一段文本如何变成 token,又如何逐 token 回到文本?
学习- BPE/WordPiece/Unigram 的合并逻辑
- logits、temperature、top-k、top-p
- prefill、decode、EOS 与停止条件
- 拆解 Hugging Face pipeline 的每一步
- 不用 generate() 写贪心与采样循环
- 记录每步 token、概率、耗时和缓存长度