Benchmark of sequence packing and length-aware batching for variable-length LLM requests, measuring compute waste from padding and the latency-efficiency trade-off between offline and online grouping policies.
python performance-engineering benchmark simulation latency scheduler inference batching systems throughput padding serving event-driven-simulation llm sharegpt heavy-tail sequence-packing
-
Updated
Jul 25, 2026 - Python