标签
COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。
本文介绍了Open-MOPD,这是一个通过平衡token级预算来诊断和修复多教师在策略蒸馏中能力不平衡的框架,通过动态分配和奖励刷新,将头空间恢复率从35.6%提高到83.4%。
AgonAlpha是一个全新的自主Alpha发现系统,它在经过验证的研究产物中进行搜索,并采用具有否决权的对抗性审核器以及考虑待处理任务的预算分配机制。在WorldQuant BRAIN上的部署取得了高适应度与夏普比率,同时保留了完整的溯源信息。
本文介绍了一种考试式评估方法,用于研究推理模型如何在多个问题之间分配共享的测试时计算预算。研究发现,模型无法战略性地分配计算资源,而是按照问题的呈现顺序进行优先级排序,忽略了问题的价值或难度。
本文介绍了RelayEvolve,一种无需训练的框架,用于成本高效的大语言模型驱动进化,该框架自适应地将种群从廉价模型交接给强模型,在固定推理预算下于各基准测试中取得高分。
OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。
本文将LLM推理预算分配形式化为一个约束优化问题,提出CLEAR方法,将资源从低效用查询重新分配到接近涌现阈值的查询,在预算紧张的情况下实现了高达3倍的准确率提升。
一种使用Qwen-35B-A3B动态分配计算预算给困难问题的方法,在HLE基准测试上达到了接近GPT-5.4-xHigh的性能。