request-scheduling

Tag

Cards List
#request-scheduling

AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving

arXiv cs.CL · 2026-07-13 Cached

AugServe introduces a state-aware request scheduling framework with dynamic batch-level token budgets to mitigate head-of-line blocking and improve effective throughput for augmented LLM inference serving, achieving up to 6.5x higher throughput than vLLM.

0 favorites 0 likes
#request-scheduling

@charliermarsh: Codex made uncached, complex resolutions (like Transformers) in uv >40% faster through more efficient request scheduling

X AI KOLs Following · 2026-07-01 Cached

Charlie Marsh reports that Codex improved request scheduling, making uncached complex resolutions (e.g., Transformers) in uv over 40% faster.

0 favorites 0 likes
← Back to home

Submit Feedback