标签
介绍了QDOS,这是一个用于离线到在线强化学习的统一流水线,采用优势加权质量-多样性预训练来提取多样且高价值的技能,显著提升了操作和移动任务的性能。
本文提出了CQD-ERL,一种面向热带商业建筑HVAC系统的情境化质量多样性进化强化学习控制器,并以ASHRAE指南36基线进行了评估。它通过安全屏蔽的多策略存档方法应对热带气候的独特挑战。
本文将PRM压力测试表述为使用MAP-Elites的质量-多样性搜索问题,刻画了存档覆盖可以证明和不能证明的内容。在Qwen2.5-Math-PRM-7B上的实验揭示了依赖聚合方式的漏洞,且LoRA修复协议降低了利用率。
IDEAgent 引入了一个多智能体框架,将研究构思视为质量多样性搜索,通过谱系演化联合优化想法的质量和多样性,在新的联合指标上以3.89倍的优势超越基线。
QDEvo将质量-多样性优化与LLM驱动的启发式搜索相结合,克服了自动启发式设计中的模态崩溃问题,在基准测试和真实世界应用中优于现有最先进方法。
本文应用MAP-Elites质量多样性算法来程序化生成多样化且高质量的第一人称射击游戏地图,并引入了新的地图表示方法和度量指标。
DEI引入了一种分布式质量-多样性搜索框架,使用异构大语言模型(LLMs)作为变异算子,表明模型多样性相比同构并行方法能提升性能。在Core War领域上的评估显示,一个四节点异构集成在QD-Score和覆盖率上取得了显著提升。