vllm-loop model-improvement progress tracker junk-tokens
models / / #1
▲ MADE POSITIVE PROGRESS

Day-0 SM80 port complete, first boot in progress

Engine built for SM80 (vLLM dsv41-feat@e47aa780: Ampere sparse-MLA backend + fp8 shims); 475.25 GiB checkpoint SHA-verified; TP8 chosen (layers 20-39 share one KV group); weight-load tail running.

When (PT)2026-09-10 08:01 PT
ServingTP8 eager (planned)
Enginelocal/vllm-dsv41:sm80 @ dsv41-feat@e47aa780
KV

What was found

  • TP8 on 8x Gen2 x16; PP rejected at this stage - layers 20-39 are one KV-sharing group
  • Engram offloaded to pinned host RAM: 11.8 GiB/rank/table, ~49.8 GiB weights/GPU resident

What was fixed

  • PP cross-stage KV sharing blocker (chose TP8)
  • wo_a Marlin-repack shape (raw-weight stash)
  • CUTLASS-DSL fused_indexer_q NVVM failure on sm80 (gated has_cutedsl())

raw JSON: /api/reports/1