AI 科研 GPU 实验核验清单

训练任务结束,并不意味着研究问题已经得到回答。分配算力前和检查回传结果时,都可以使用这份清单。它用于辅助研究者核验,不代表任何具体实验已经通过检查。

开始运行前逐项核对

  1. 写明科研假设、预测目标,以及什么结果能够支持或反驳假设。
  2. 记录数据集版本、来源与使用许可,明确预测时真正可用的输入。
  3. 说明训练集、验证集和测试集的划分;根据任务考虑按设备、受试对象或时间分隔。
  4. 需要拟合的预处理仅在训练数据上学习,再一致地应用于其他划分。
  5. 确定主要指标、单位、汇总规则,以及数值越大还是越小更好。
  6. 查看最终测试结果前,确定可比的基线、调参规则与训练预算。
  7. 在可用算力预算内,明确消融条件、随机种子、运行次数和停止规则。
  8. 确认计划回传的配置、执行记录与结果,足以核验报告中的指标。

区分效果评估与模型选择

通过验证集选择模型设置,不让最终测试结果参与这一选择。对于同一设备或受试对象的重复测量,检查近似重复的观测是否跨越了数据划分。预测未来序列时,检查特征构造是否意外使用未来信息。划分方式应对应科研结论所描述的实际应用条件。

让每项比较回答一个具体问题

基线比较检验提出的方法是否在明确协议下优于相关替代方案;消融实验检验移除或替换某个组成部分后有什么变化。保持其他条件可比,并记录无法避免的差异。更多参数、额外训练数据或更大的调参预算,都可能改变对性能提升的解释。

记录波动,而不只保留最佳一次

计划进行多次运行时,保留每次结果并说明汇总方式。如果预算只允许一次运行,应如实说明,不能暗示已经重复验证。除随机种子外,还应记录软件版本与硬件;仅固定种子,不能保证不同运行环境得到完全一致的结果。

实验结束后的证据核对表

把下表作为交接清单,在项目记录中为每一行填写实际文件或记录的位置,以及尚未解决的问题。表中列出的是需要查找的证据类型,不是保证生成的文件,也不是示例实验结果。

实验结束后的证据核对表
核对项目需要查找的证据需要说明的问题
数据与划分数据集版本、划分规则、样本或分组数量实际使用了哪些观测,评估条件是否符合研究目标。
方法与基线实际执行的代码版本、模型配置和调参协议比较了什么,各方法的哪些设置存在差异。
执行过程运行状态、日志、运行环境和保存的配置训练与评估是否完成;完成运行本身不等于科研结论成立。
评价指标回传的指标汇总及对应评估输出指标定义、单位、数据划分、汇总方式和对应运行。
消融与重复运行各条件、各次运行的结果,包括失败记录声称的效果是否得到实际完成的比较支持。
图表来源数值与绘图配置图中数值、坐标轴、标签和图注是否与记录一致。

什么情况下还不能据此下结论

缺少输出、划分不明、配置不对应或对比尚未完成,都属于待解决的问题。将结果标记为未完成,并把结论限制在现有证据能够支持的范围内。不能用估计分数代替未执行的实验,也不能只选择有利结果。

在 AutoResearch 中使用这份清单

AutoResearch 将模型实现与 GPU 训练、评估、消融和可检查的回传产物衔接起来。研究者可以用清单检查这些产物,明确还需验证哪些问题。清单不能替代领域判断,也不对具体结果作认证。

技术参考