llm-scheduling

标签

Cards List
#llm-scheduling

解耦准备与发布以实现尾部感知的代理LLM工作流调度

arXiv cs.AI · 16小时前 缓存

本文提出了一种尾部风险感知的调度方法,用于代理LLM工作流,通过优化回合发布决策减少尾部延迟,在争用条件下实现P95工作流流时间最高3.50倍的加速。

0 人收藏 0 人点赞
#llm-scheduling

迈向多模型LLM调度器:关于卸载和抢占的实证洞见

arXiv cs.AI · 2026-05-20

本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。

0 人收藏 0 人点赞
#llm-scheduling

用还是不用 2B?自定义 LLM 调度挑战赛 [P]

Reddit r/MachineLearning · 2026-04-23

一场 Kaggle 比赛要求选手构建调度器,针对 MMLU 问题决定是否运行 2B 参数模型,以在计算开销与准确率之间加权最小化总成本。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈