跳到主要内容
Octopus Research Institute
状态: 活跃研究评估框架

rocm-bench(HF-logits 一致性框架)

一个 logits 一致性框架:运行模型并导出逐词元 logits,在相同词元 id 上离线与 HuggingFace 参照比较。不使用厂商 BLAS。

说明

支撑 HF-logits 一致性语料:它产出用于离线比较的逐词元 logits,对照经验证的参照实现。

亮点

  • 从被测运行时导出逐 token logits,供离线比对
  • 在相同 token ids 上,与 HuggingFace 参考 oracle 校验 parity
  • 刻意不使用厂商 BLAS,隔离实现本身而非厂商数学库
  • 产出喂入 HF-logits parity 语料库的逐 token logits
  • 在固定 token ids 上比对,而非跑完整生成流程

rocm-bench 是一套 logits-parity 校验工具,面向任何需要跨芯片、跨后端移植或验证推理运行时的人。它运行模型并导出逐 token 的 logits,以便在相同的 token ids 上,离线地与 HuggingFace 参考实现——即 "oracle"——比对。它回答的问题很窄却很关键:一个非参考运行时,是否逐芯片地产出与已验证参考相同的数值?这是一个关于信任的问题,而答案靠证据,不靠感觉。

工作原理

工具将固定的 token ids 送入被测实现,记录每个位置上的 logits,再在离线状态下,针对相同的 ids 与 oracle 的 logits 比对。parity 被刻意限定在这种逐 token 比对,而非端到端生成——因为完整的生成循环会累积并掩盖偏差,在固定 ids 上比对能让信号保持干净、可归因。关键在于,工具不使用厂商 BLAS。抽掉厂商数学库,意味着任何差异都指向你真正要验证的实现,而不是它下面那个黑盒 kernel。

意义所在

跨后端的正确性,声称容易、证明很难。rocm-bench 把这一声称变成可复现的 artefact:它导出的这批逐 token logits,正是喂入 HF-logits parity 语料库的数据,于是每次验证都汇入共享证据,而非一次性的检查。它与 apple-silicon-inference 等相关工作并列,同属一项更大的努力——让跨芯片推理变得可验证:无论模型在何处运行,都能证明产出的是同一批数值。本工具以 Apache-2.0 许可发布。

局限

  • 一致性在固定词元 id 上离线检查,而非端到端。
  • 代码仓库正迁出即将下线的 Octoryn Research 域名。

相关研究