跳到主要内容
Octopus Research Institute
状态: 内部评估评估类型: 私有评估

在「本地推理任务集」上的本地与托管推理对比

在固定硬件上,对本地与托管推理在摘要、抽取与分类任务上的小型内部对比。

研究问题

在哪些代表性任务上,本地推理在通用硬件上已经足够?

方法论

每个任务在固定的提示与解码配置下运行;本地与托管设置使用相同输入。结果说明的是我们的配置,而非排名。

指标定义

task-success
输出满足预先登记评分标准的任务比例,由作者判定。带主观性;见局限。

结果

结果
模型数据集指标数值样本量
local (illustrative)local-inference-task-suite v0.2task-successsufficient on the majority of extraction/classification tasksfew dozen tasks
hosted (illustrative)local-inference-task-suite v0.2task-successpreferred on the longer summarisation tasksfew dozen tasks
数值按原样报告,并在可得处附单位与不确定性。缺少置信区间意味着并未计算。

环境

单台工作站;细节记录于评估工具集中。

硬件

通用桌面级 GPU(具体型号内部记录)。

局限

  • 样本过小,不具统计显著性;不主张任何置信区间。
  • 成功判定具主观性,且由作者评定。
  • 与具体硬件相关;并非本地与托管推理的通用排名。

可复现性

任务、提示与配置可经评估工具集应需提供。托管供应商的确切行为可能随时间漂移。