Skip to content

[Bench][SM70] Repair #377 without slowing GLM NVFP4 - #380

Merged
yangzhuxinyzx merged 25 commits into
codex/v100-glm53-fp16-quality-perf-20260828-040813from
agent/v100-repair-pr377-glm-bench-dynamic-latest-main-20260828-1242
Aug 28, 2026
Merged

yangzhuxinyzx merged 25 commits into
codex/v100-glm53-fp16-quality-perf-20260828-040813from
agent/v100-repair-pr377-glm-bench-dynamic-latest-main-20260828-1242

Conversation

@yangzhuxinyzx

@yangzhuxinyzx yangzhuxinyzx commented Aug 28, 2026

Copy link
Copy Markdown
Contributor

Purpose

Repair #377 from the latest audited main while retaining its useful GLM-5.3
and NVFP4 benchmark coverage without forcing production onto a slower
accumulation tree.

Audit decision

  • Keep the default-on measured NVFP4 selector for the exact GLM W13 shape.
  • Remove the shape-specific default-split override. On one V100 with identical
    random input/weights:
    • default split-8 median: 51.200 us;
    • measured split-12 median: 48.128 us (6.0% faster);
    • changed FP16 elements: 37/8192;
    • maximum absolute difference: 0.125;
    • relative L2: 1.642e-5;
    • cosine: 0.99999917.
  • Treat that accumulation-order delta as numerical diagnostics rather than
    task-quality evidence; retain a diagnostic tuning opt-out through the
    existing environment control.
  • Keep random-data, grouped-MoE, output-hash, and tensor-dump support in the
    existing NVFP4 microbenchmark.
  • Keep the new GLM FP16 Dense/Indexer candidate screen benchmark-only; it does
    not alter production dispatch.
  • Make the base and eviction-policy Triton candidates genuinely distinct,
    lazy-load the compiled SM70 wrapper so --help works in a clean checkout,
    and repair the accelerator/static-format gates.

Validation

  • Real V100 grouped-MoE shape ran successfully and reproduced seed-17 hash
    47836839b542fb73494caa64adc14cd660e38c535c4a5e67e16d3a763196dac7.
  • Corrected FP16 benchmark candidates ran on V100; the N32/K4096 smoke reported
    base/evict/cg at 5.530/6.656/7.270 us with exact outputs for that input.
  • Eight focused GLM ModelOpt NVFP4 admission tests passed.
  • Python compile and clean-checkout CLI help passed.
  • Changed-file pre-commit passed, including Ruff, formatting, clang-format,
    mypy, forbidden-import, and accelerator API gates.
  • The migration control document records the selector decision and exact
    numerical/performance evidence.
  • The repaired source is based on public main at
    b410e59eb9a1283bb20c239bac52c6ba88459ea2; [Bench][SM70] Add GLM NVFP4 quality and performance screens #377 head
    cd1bc99f0404dbac88c37272b0284916a07db373 is preserved as ancestry without
    changing the audited tree.
  • All repair commits are DCO signed.

Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
…n-latest-main-20260828-1205

[Bench][SM70] Repair #375 without disabling QPN8
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
…n-latest-main-v2-20260828-1228

[Core][SM70] Keep Qwen3.8 QPN8 default-on after #375 A/B
…ality-audit-20260828-025709

[Bench][SM70] Record Qwen3.8 QPN8 quality/performance A/B
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
Signed-off-by: yangzhuxinyzx <153831768+yangzhuxinyzx@users.noreply.github.com>
@yangzhuxinyzx

Copy link
Copy Markdown
Contributor Author

审计完成并锁定 bb68898c09c33f428c19a6616ee9a5d4a342aef0(tree 3395bf1b98f9d521e56b19d2488dfca3e80a2bbc)。

  • 远端完整 pre-commit 通过。
  • 8 个聚焦 GLM ModelOpt NVFP4 测试通过。
  • V100 实测动态选择器中位延迟 48.128 us,相比默认 split-8 的 51.200 us 快约 6.0%。
  • 数值差异为 37/8192 个 FP16 元素,max abs 0.125、relative L2 1.642256e-5、cosine 0.9999991655;重复动态输出哈希稳定。
  • 修复后的 PR 不再修改生产 C++ 路由,只增加可复现的性能/质量筛查与迁移记录。

按项目策略保留默认开启的性能路径,准备合并回 #377

@yangzhuxinyzx
yangzhuxinyzx merged commit 4a62e38 into codex/v100-glm53-fp16-quality-perf-20260828-040813 Aug 28, 2026
2 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant