从一篇论文到一组实验:可复现的调研清单
读完论文不要直接开训。先把问题、对照、变量和不做的事写成清单,实验才接得上文献。
很多人把「调研」理解成读了很多篇,把「实验」理解成终于开始跑。中间缺的是一张能对照的清单:这篇论文到底把什么问清楚了,你还要补哪一组对照,哪些变量你不碰。
读的时候只抓四件事
面对一篇目标论文,先不要做全面笔记。只回答四个问题:
- 任务与数据:它声称在哪个任务、哪个划分上成立?
- 方法的可替换部分:哪一块是贡献,哪一块只是工程默认值?
- 对照是否公平:baseline 是否同年、同数据、同训练预算?
- 失败模式:作者承认的限制里,哪一条会直接打到你的设定?
如果这四项写不下来,说明还没读到能做实验的程度。继续读,比先开一个「差不多」的训练脚本更便宜。
把论文翻译成实验卡片
一页就够。建议固定字段:
- 要验证的句子:用一句可证伪的话写,而不是「试试这个方法」。
- 最少对照:至少包括原设定复现、去掉关键模块、换一个更弱/更强的 baseline。
- 不变的东西:种子、数据划分、评价脚本,写死并版本化。
- 明确不做:例如先不换大模型、先不调学习率网格。范围收缩,结果才读得懂。
实验卡片应该能让两周后的你,不靠记忆就知道当时在比什么。它也是后面写实验部分的骨架。
跑之前先规定记录
训练曲线不是实验日志。日志至少要能回答:
- 这次运行对应哪张卡片、哪个 git commit、哪份配置。
- 和上一轮相比,只改了哪一个因素。
- 若失败,是数据、实现,还是假设本身。
「先跑起来再补记录」几乎总会变成不可复现的散点。清单看起来像额外手续,其实是把调研、实验和写作钉在同一条线上。等站点里的 checklist 生成器上线,会按这些字段自动起草一版;现在可以先用手写一张。