跳到主要内容
Octopus Research Institute
状态: 活跃研究评估框架

模型评估工具集

一套可复现模型评估的框架,在结果旁记录数据集/模型版本、随机种子、硬件与指标定义。

说明

内部用于产出本站发布的评估。重点在于记录足够的上下文,使结果可被解释与复现。

亮点

  • 每个结果都记录数据集与模型版本、随机种子、硬件与指标定义
  • 任何数字都不脱离产生它的条件单独呈现
  • 本站发布的评测即由它产出——可查证,且原则上可复现
  • 指标定义与分数一并固定,使结果在时间上保持可比
  • Apache-2.0,发布版本 0.3.0

孤立的一个榜单数字说明不了太多:同一个模型,换一个略有不同的数据集切片、换一个随机种子,或换一套硬件,数字就会移动。Model Evaluation Harness 把这些周边条件视为结果的一部分,而不是事后补充。它运行的每一次评测,都会连同所用的数据集与模型版本、随机种子、运行的硬件,以及所采用的具体指标定义一并记录——因此读者拿到的不只是一个分数,还有这个分数成立的条件。

工作方式

该框架把评测的输入固定下来,并作为 provenance 与输出一同保存。由于指标定义是与结果一起记录、而非默认假定,两个数字只有在产生它们的条件确实一致时才可比较;若条件不同,记录会让这种差异显现出来。这与整个家族工作贯穿始终的治理取向一致:目标是不要自信地犯错,因此每一个结论都携带着可供他人核查的证据。

为何重要

我们在内部用它来产出本站发布的评测,正是这一点让读者能够解读它们,并在原则上加以复现。它的边界也值得坦白说明:指标覆盖仅限于已实现的任务,而复现依赖于所固定的数据集与模型版本持续可得。它与我们在 local-sovereign-inference 和 governed-agent-systems 上的工作相邻,同样的要求在那里反复出现——一个结果应当携带足够的上下文,好让它能够凭自身被信任,或被质疑。

局限

  • 指标覆盖仅限于我们已实现的任务。
  • 可复现性取决于所固定的数据集与模型版本是否可获取。

相关研究