vllm-loop model-improvement progress tracker junk-tokens
models / / #8
▲ MADE POSITIVE PROGRESS

Benchmark #3 - arrangements + DSpark real-text correction

Random-token acceptance (4-8%) was misleading. Real prose (TP4xPP2, k=5): c1 43.1 tok/s (accept 41.2%), c4 111.0, c8 153.4 - c1 matches Schaka's 43.8. Arrangements: TP8xPP1 wins c1 (20.2), TP2xPP3 wins aggregate + TTFT. Long-context prefill 1,704 @8k to 2,873 tok/s @256k.

When (PT)2026-09-10 22:22 PT
ServingTP4xPP2, DSpark k=5, fp8_ds_mla, 1M ctx, CUDA graphs
Enginelocalhost/vllm-backport-v41:sm80 (vLLM 0.12.0-sm80 + PR#56201 + Ampere shims + PP relay)
KV

Benchmarks

MetricValueΔ vs previousUnitContextNote
agg_decode_c4_tok_s (agg_decode_c4_tok_s) 111 tok/s 52.3% tok/s real prose, TP4xPP2
agg_decode_c8_tok_s (agg_decode_c8_tok_s) 153.4 tok/s 105.6% tok/s real prose, TP4xPP2
c1_decode_tok_s (c1_decode_tok_s) 43.1 tok/s 98.5% tok/s real prose, TP4xPP2, DSpark k=5
prefill_tok_s (prefill_tok_s) 2280 tok/s 43.9% tok/s 32k ctx (1,704 @8k; 2,247 @128k; 2,873 @256k)

raw JSON: /api/reports/8