状态: 已发布数据所有权: 研究院所有许可: CC BY 4.0
跨芯片逐字节一致解码轨迹
逐词元轨迹,量化贪心解码在两块不同芯片间保持逐字节一致的程度——中途失效切换的依据。
用途
确定解码在芯片间切换时能多可靠地保持不发散。
来源
在同一量化模型的双芯片贪心解码运行中实时捕获。
构成
可下载 CSV——所测的跨后端一致性(backend、comparison、cosine、argmax),以及 CUDA↔ROCm 正面对比(Qwen2.5-0.5B,31/32 词元一致)。完整的逐词元轨迹集更大,可应需提供。
已知偏差
- 仅贪心解码(非采样)。
局限
- 单次双芯片会话。
- 分歧残差集中于亚 f16-ULP 的平局,在 f16 下不可消除。
访问条件
所测的跨后端一致性表可在下方以 CC-BY-4.0 下载。(完整的逐词元轨迹集更大,可应需提供。)
| backend | comparison | cosine | argmax_match | argmax_total | sovereignty |
|---|---|---|---|---|---|
| CUDA (AWS L4) MoE engine | fp32 vs int8-KV teacher-forced | 0.999761 | 16 | 16 | ldd = libcudart only (no cuBLAS/cuDNN/cuTLASS) |
| Metal (Mac M-series) q4 resident | prod fused-MoE vs CPU-glue ref | 0.99999999999944 | 16 | 16 | runtime cBLAS count = 0 |
| Metal single-encoder decode (short ctx) | short 72-tok ctx | 0.99999999999989 | byte-identical | greedy | — |
| Metal single-encoder decode (long ctx) | long 72-tok ctx | 0.99999999999992 | byte-identical | greedy | — |
| CUDA-Silicon direct | chip-to-chip 30B q4 | 0.99999999 | — | — | both sovereign |
