跳到主要内容
Octopus Research Institute
状态: 已发布数据所有权: 研究院所有许可: CC BY 4.0

跨芯片逐字节一致解码轨迹

逐词元轨迹,量化贪心解码在两块不同芯片间保持逐字节一致的程度——中途失效切换的依据。

用途

确定解码在芯片间切换时能多可靠地保持不发散。

来源

在同一量化模型的双芯片贪心解码运行中实时捕获。

构成

可下载 CSV——所测的跨后端一致性(backend、comparison、cosine、argmax),以及 CUDA↔ROCm 正面对比(Qwen2.5-0.5B,31/32 词元一致)。完整的逐词元轨迹集更大,可应需提供。

已知偏差

  • 仅贪心解码(非采样)。

局限

  • 单次双芯片会话。
  • 分歧残差集中于亚 f16-ULP 的平局,在 f16 下不可消除。

访问条件

所测的跨后端一致性表可在下方以 CC-BY-4.0 下载。(完整的逐词元轨迹集更大,可应需提供。)

数据预览
backendcomparisoncosineargmax_matchargmax_totalsovereignty
CUDA (AWS L4) MoE enginefp32 vs int8-KV teacher-forced0.9997611616ldd = libcudart only (no cuBLAS/cuDNN/cuTLASS)
Metal (Mac M-series) q4 residentprod fused-MoE vs CPU-glue ref0.999999999999441616runtime cBLAS count = 0
Metal single-encoder decode (short ctx)short 72-tok ctx0.99999999999989byte-identicalgreedy
Metal single-encoder decode (long ctx)long 72-tok ctx0.99999999999992byte-identicalgreedy
CUDA-Silicon directchip-to-chip 30B q40.99999999both sovereign
共 5 行,显示前 5 行。
下载 · CC BY 4.0