AI 科研 GPU 实验核验清单
训练任务结束,并不意味着研究问题已经得到回答。分配算力前和检查回传结果时,都可以使用这份清单。它用于辅助研究者核验,不代表任何具体实验已经通过检查。
开始运行前逐项核对
- 写明科研假设、预测目标,以及什么结果能够支持或反驳假设。
- 记录数据集版本、来源与使用许可,明确预测时真正可用的输入。
- 说明训练集、验证集和测试集的划分;根据任务考虑按设备、受试对象或时间分隔。
- 需要拟合的预处理仅在训练数据上学习,再一致地应用于其他划分。
- 确定主要指标、单位、汇总规则,以及数值越大还是越小更好。
- 查看最终测试结果前,确定可比的基线、调参规则与训练预算。
- 在可用算力预算内,明确消融条件、随机种子、运行次数和停止规则。
- 确认计划回传的配置、执行记录与结果,足以核验报告中的指标。
区分效果评估与模型选择
通过验证集选择模型设置,不让最终测试结果参与这一选择。对于同一设备或受试对象的重复测量,检查近似重复的观测是否跨越了数据划分。预测未来序列时,检查特征构造是否意外使用未来信息。划分方式应对应科研结论所描述的实际应用条件。
让每项比较回答一个具体问题
基线比较检验提出的方法是否在明确协议下优于相关替代方案;消融实验检验移除或替换某个组成部分后有什么变化。保持其他条件可比,并记录无法避免的差异。更多参数、额外训练数据或更大的调参预算,都可能改变对性能提升的解释。
记录波动,而不只保留最佳一次
计划进行多次运行时,保留每次结果并说明汇总方式。如果预算只允许一次运行,应如实说明,不能暗示已经重复验证。除随机种子外,还应记录软件版本与硬件;仅固定种子,不能保证不同运行环境得到完全一致的结果。
实验结束后的证据核对表
把下表作为交接清单,在项目记录中为每一行填写实际文件或记录的位置,以及尚未解决的问题。表中列出的是需要查找的证据类型,不是保证生成的文件,也不是示例实验结果。
| 核对项目 | 需要查找的证据 | 需要说明的问题 |
|---|---|---|
| 数据与划分 | 数据集版本、划分规则、样本或分组数量 | 实际使用了哪些观测,评估条件是否符合研究目标。 |
| 方法与基线 | 实际执行的代码版本、模型配置和调参协议 | 比较了什么,各方法的哪些设置存在差异。 |
| 执行过程 | 运行状态、日志、运行环境和保存的配置 | 训练与评估是否完成;完成运行本身不等于科研结论成立。 |
| 评价指标 | 回传的指标汇总及对应评估输出 | 指标定义、单位、数据划分、汇总方式和对应运行。 |
| 消融与重复运行 | 各条件、各次运行的结果,包括失败记录 | 声称的效果是否得到实际完成的比较支持。 |
| 图表 | 来源数值与绘图配置 | 图中数值、坐标轴、标签和图注是否与记录一致。 |
什么情况下还不能据此下结论
缺少输出、划分不明、配置不对应或对比尚未完成,都属于待解决的问题。将结果标记为未完成,并把结论限制在现有证据能够支持的范围内。不能用估计分数代替未执行的实验,也不能只选择有利结果。
在 AutoResearch 中使用这份清单
AutoResearch 将模型实现与 GPU 训练、评估、消融和可检查的回传产物衔接起来。研究者可以用清单检查这些产物,明确还需验证哪些问题。清单不能替代领域判断,也不对具体结果作认证。