论文解剖与知识系统
把论文从线性笔记改造成“主张—机制—证据—复现”的可证伪知识图谱。
- 建议时长
- 6–8 小时
- 难度
- 研究方法
- 课程位置
- 9 / 12
学完这一课,你应该能:
- 能区分论文主张、机制与实验事实
- 能把一句摘要改写成可证伪假设
- 能检查基线公平性与实验是否支持主张
- 能建立可用于复现的结构化论文笔记
1. 读论文的目标不是复述
Problem 旧方案在什么约束下失败?
Claim 作者声称改善了什么?
Mechanism 哪个设计导致改善?
Evidence 哪些实验足以支持或推翻主张?
如果读完只能复述架构图,却无法说出“什么结果会证明作者错了”,还没有进入研究层。
2. 把摘要翻译成 Claim Card
以“方法 A 在长序列上更高效且保持质量”为例:
claim: A 在上下文增长时降低显存和延迟,同时保持任务指标
constraints:
- 相同模型规模
- 相同训练 token 与数据
- 相同精度和硬件
baseline: 标准 Transformer
metrics: [task_score, peak_vram, ttft, throughput]
falsifier:
- 质量下降超过预设阈值
- 优势仅来自更小 batch 或不同 kernel
一条 claim 混有多个子主张,就拆开验证。质量、速度、显存和扩展性不能用一个实验同时证明。
3. 三遍阅读法
第一遍:建立地图
读标题、摘要、图表、结论,回答问题、主张、基线和指标。不急着钻每个公式。
第二遍:追踪机制
从核心图或公式向前后追踪:输入输出、状态、复杂度、近似假设和实现约束。每个符号都写形状或物理含义。
第三遍:审计证据
检查数据、训练预算、参数量、硬件、精度、基线实现、seed 与误差条,寻找主张没有被直接测量的地方。
4. 复杂度表不能替代真实测量
论文写 (O(n)) 或 (O(n^2)),只描述渐近趋势。真实性能还受常数项、kernel 融合、内存带宽、batch、序列分布、硬件并行度和框架实现影响。
理论复杂度:作者推导
实现复杂度:代码实际执行
实测性能:特定硬件与负载
不能把理论线性直接等同于某张 GPU 上一定更快。
5. 基线公平性审计
| 条件 | 方法 A | Baseline | 是否对齐 |
|---|---|---|---|
| 参数量 | |||
| 训练 token | |||
| 优化器与 LR | |||
| 精度 | |||
| kernel | |||
| 硬件 | |||
| 调参预算 |
若新方法得到更多调参预算,基线却直接用默认参数,结果可能包含优化偏差。复现时至少说明无法对齐的条件。
6. Obsidian/Markdown 知识结构
不要按论文顺序抄笔记。建议每篇论文一个目录:
paper/
├── claim-card.md
├── mechanism.md
├── evidence-table.md
├── reproduction-plan.md
├── failure-log.md
└── links.md
再建立 KV Cache、segment recurrence、relative position 等概念节点,从 Transformer-XL、RetNet、RWKV 等论文双向链接。知识图谱围绕机制生长,不受论文顺序限制。
7. 从 Transformer-XL 到 RetNet
Transformer-XL
关注 segment-level recurrence:上一段隐藏状态成为下一段记忆;relative positional encoding 避免缓存状态的位置混乱。
RetNet
关注同一 retention 机制的三种计算形态:
- parallel:适合训练
- recurrent:适合逐 token 推理
- chunkwise recurrent:折中长序列
不要先问“谁替代谁”,先比较状态定义、训练并行性、推理复杂度、内存和实验规模。
8. 从论文到复现任务
- 选择一条核心 claim。
- 找最小公开数据与基线。
- 先重现 baseline。
- 只替换一个机制。
- 固定 seed、step、参数量与评测。
- 同时测质量和系统指标。
- 记录与论文环境的差异。
轻量复现可缩小模型,但要说明缩放假设:小规模不显现不能直接推翻大规模主张;小规模失败也要先判断实现和优化是否公平。
9. 本课练习:制作 Evidence Map
选择 Attention、Transformer-XL 或 RetNet:
- 提取 3 条 claim
- 每条 claim 找对应表格或图
- 标注缺失证据
- 写 baseline 公平性表
- 写可证伪的轻量复现计划
交付不是摘要,而是一张能指导代码和实验的证据图。
10. 完成检查
你应能回答:作者解决谁在什么约束下的问题?核心机制改变了哪个计算或状态?哪个实验支持哪个 claim?哪些条件没对齐?什么结果会推翻主张?你的算力能验证什么、不能验证什么?