用还是不用 2B?自定义 LLM 调度挑战赛 [P]
摘要
一场 Kaggle 比赛要求选手构建调度器,针对 MMLU 问题决定是否运行 2B 参数模型,以在计算开销与准确率之间加权最小化总成本。
大家好,我对资源管理一直很感兴趣,尤其想降低获得答案所需的 token 开销。所以我刚在 Kaggle 发起了一场比赛,围绕一个简单问题:到底该不该跑小模型?我打算后续加入更多模型,让决策更精细。比赛地址:[https://www.kaggle.com/competitions/llm-scheduling-competition](https://www.kaggle.com/competitions/llm-scheduling-competition) 核心思路:
* 拿到 MMLU 基准里的题目
* 不直接作答,而是做选择:
* `2b` → 跑小模型
* `none` → 跳过
然后按**成本指标**计分:
* 跑模型要算力
* 模型答错代价高
* 能答对却跳过也会被罚
目标就是**最小化加权成本**。目前设定还比较简单,暂未计入你自己跑模型的真实开销,但算是朝正确方向迈了一小步。很好奇大家会拿出什么方案——规则、分类器,还是更创意的玩法?欢迎讨论、提问!
相似文章
避免想太多与想太少:面向课程感知的LLM预算调度
BACR通过自适应token预算与课程感知调度,防止LLM在简单题上想太多、在难题上想太少,token用量降低34%,准确率最高提升8.3%。
大语言模型搜索代理的推理时预算控制
本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。
R^3-Bench:大型语言模型在共享预算下的资源理性推理面临挑战
R^3-Bench 引入了一个基准测试,表明大型语言模型在跨数学、编程和抽象推理等多个推理任务分配共享计算预算时,难以维持性能表现。
Sim2Schedule:一种模拟器引导的LLM框架,用于自主露天矿调度
本文介绍Sim2Schedule,一种由模拟器引导的LLM框架,用于自主露天矿调度。该框架在计算时间线性扩展的情况下,能达到MILP最优净现值的94%-99%,且无需微调即可零样本运行。
LLM智能体的最优技能选择与可证明的双标准保证
本文介绍了最佳前缀选择(BPS),这是一种用于LLM智能体最优技能选择的算法,它提供了可证明的双标准保证,并在任务成功率上优于现有方法,同时减少了令牌使用量。