用还是不用 2B?自定义 LLM 调度挑战赛 [P]
摘要
一场 Kaggle 比赛要求选手构建调度器,针对 MMLU 问题决定是否运行 2B 参数模型,以在计算开销与准确率之间加权最小化总成本。
大家好,我对资源管理一直很感兴趣,尤其想降低获得答案所需的 token 开销。所以我刚在 Kaggle 发起了一场比赛,围绕一个简单问题:到底该不该跑小模型?我打算后续加入更多模型,让决策更精细。比赛地址:[https://www.kaggle.com/competitions/llm-scheduling-competition](https://www.kaggle.com/competitions/llm-scheduling-competition) 核心思路:
* 拿到 MMLU 基准里的题目
* 不直接作答,而是做选择:
* `2b` → 跑小模型
* `none` → 跳过
然后按**成本指标**计分:
* 跑模型要算力
* 模型答错代价高
* 能答对却跳过也会被罚
目标就是**最小化加权成本**。目前设定还比较简单,暂未计入你自己跑模型的真实开销,但算是朝正确方向迈了一小步。很好奇大家会拿出什么方案——规则、分类器,还是更创意的玩法?欢迎讨论、提问!
相似文章
避免想太多与想太少:面向课程感知的LLM预算调度
BACR通过自适应token预算与课程感知调度,防止LLM在简单题上想太多、在难题上想太少,token用量降低34%,准确率最高提升8.3%。
大语言模型搜索代理的推理时预算控制
本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。
Sim2Schedule:一种模拟器引导的LLM框架,用于自主露天矿调度
本文介绍Sim2Schedule,一种由模拟器引导的LLM框架,用于自主露天矿调度。该框架在计算时间线性扩展的情况下,能达到MILP最优净现值的94%-99%,且无需微调即可零样本运行。
GLM-5 拥有744B参数,但在MMLU-Pro上的得分却不如一个9B模型
GLM-5是一个拥有744B参数的模型,但在MMLU-Pro基准测试中的表现不如一个远小得多的9B模型,这引发了关于效率和扩展性的问题。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。