用还是不用 2B?自定义 LLM 调度挑战赛 [P]

Reddit r/MachineLearning 事件

摘要

一场 Kaggle 比赛要求选手构建调度器,针对 MMLU 问题决定是否运行 2B 参数模型,以在计算开销与准确率之间加权最小化总成本。

大家好,我对资源管理一直很感兴趣,尤其想降低获得答案所需的 token 开销。所以我刚在 Kaggle 发起了一场比赛,围绕一个简单问题:到底该不该跑小模型?我打算后续加入更多模型,让决策更精细。比赛地址:[https://www.kaggle.com/competitions/llm-scheduling-competition](https://www.kaggle.com/competitions/llm-scheduling-competition) 核心思路: * 拿到 MMLU 基准里的题目 * 不直接作答,而是做选择: * `2b` → 跑小模型 * `none` → 跳过 然后按**成本指标**计分: * 跑模型要算力 * 模型答错代价高 * 能答对却跳过也会被罚 目标就是**最小化加权成本**。目前设定还比较简单,暂未计入你自己跑模型的真实开销,但算是朝正确方向迈了一小步。很好奇大家会拿出什么方案——规则、分类器,还是更创意的玩法?欢迎讨论、提问!
查看原文

相似文章

大语言模型搜索代理的推理时预算控制

arXiv cs.AI

本文提出了一种用于大语言模型(LLM)搜索代理的两阶段推理时预算控制方法,利用信息价值(VOI)分数在多跳问答过程中优化工具调用和 Token 分配。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。