状态: 内部评估评估类型: 私有评估
在「本地推理任务集」上的本地与托管推理对比
在固定硬件上,对本地与托管推理在摘要、抽取与分类任务上的小型内部对比。
研究问题
在哪些代表性任务上,本地推理在通用硬件上已经足够?
方法论
每个任务在固定的提示与解码配置下运行;本地与托管设置使用相同输入。结果说明的是我们的配置,而非排名。
指标定义
- task-success
- 输出满足预先登记评分标准的任务比例,由作者判定。带主观性;见局限。
结果
| 模型 | 数据集 | 指标 | 数值 | 样本量 |
|---|---|---|---|---|
| local (illustrative) | local-inference-task-suite v0.2 | task-success | sufficient on the majority of extraction/classification tasks | few dozen tasks |
| hosted (illustrative) | local-inference-task-suite v0.2 | task-success | preferred on the longer summarisation tasks | few dozen tasks |
环境
单台工作站;细节记录于评估工具集中。
硬件
通用桌面级 GPU(具体型号内部记录)。
局限
- 样本过小,不具统计显著性;不主张任何置信区间。
- 成功判定具主观性,且由作者评定。
- 与具体硬件相关;并非本地与托管推理的通用排名。
可复现性
任务、提示与配置可经评估工具集应需提供。托管供应商的确切行为可能随时间漂移。
