标签
本文提出了一种LLM增强的多智能体强化学习框架,用于同时优化电动汽车充电调度、站点盈利性和电网稳定性,使用LLM进行特征选择和自适应加权,在减少训练时间的同时超越了最先进的方法。
本文提出了一种'先收敛后多样化'的方法用于多目标贝叶斯优化,该方法将收敛与多样性解耦为两个阶段,展示了在紧缩评估预算和高维问题下性能的提升。
MOAE 提出了一种帕累托保留的进化搜索方法,能够在搜索过程中无需固定标量化,同时优化 LLM 代理的多个目标,包括任务性能、轨迹质量和安全性。
提出了一种物理信息图注意力网络作为TCAD模拟的代理模型,通过预测网格节点值并融入载流子输运物理,实现更快的设计空间探索。
论文提出了TRACE,一个用于多目标材料发现的过渡感知残差控制框架,利用LLM代理,相比最先进的基线提高了命中率。
本文比较了四种训练伦理强化学习智能体的方法,在每集违规分布而非平均率上进行评估,并证明了每集保证可以在不影响平均性能的情况下实现。
An encyclopedic overview of the Pareto front, the set of Pareto-efficient solutions in multi-objective optimization, commonly used in engineering to evaluate trade-offs.
提出了一种面向LLM的两阶段结构化剪枝框架,通过多目标深度剪枝和并行贝叶斯优化联合优化延迟与模型大小,在边缘部署中实现有利的权衡。
SCEPTER是一个框架,通过结合PubMed检索、PubMedBERT排序、大语言模型声明提取、矛盾检测和帕累托最优声明选择,将临床病例描述转化为基于证据的建议,实现了192:1的压缩比,同时保持了较高的证据多样性。
介绍RL-NSGA-II-GRC方法,该方法将强化学习与经灰关联系数增强的NSGA-II遗传算法相结合,用于多目标优化,应用于NASDAQ投资组合优化。实现了改进的收敛性和多样化的帕累托前沿。
QDEvo将质量-多样性优化与LLM驱动的启发式搜索相结合,克服了自动启发式设计中的模态崩溃问题,在基准测试和真实世界应用中优于现有最先进方法。
本文扩展了LLaMEA框架,利用大型语言模型作为进化策略中的变异和交叉算子,自动设计多目标贝叶斯优化算法,在合成和实际问题中以显著更低的计算成本实现了最先进的精度。
本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。
本文提出了一种多目标贝叶斯优化方法,用于自动化强化学习中的权重选择以实现节能控制,并在物理Quanser Aero 2测试平台上展示了优于网格搜索的样本效率。
本文提出了一种用于LLM服务路由的多目标优化框架,采用带出价-价格控制的在线线性规划来平衡延迟、吞吐量和尾部性能,并通过Vidur模拟器展示了相对于启发式方法的改进。
本文提出一个集成框架,用于在双边招聘市场中个性化免费价值阈值,以应对竞争性目标和受限实验。部署的系统在目标指标上实现了显著提升,同时遵守了参与度安全护栏。
介绍了A3M,一个结合自适应深度强化学习、对抗性推理和多目标奖励设计的框架,用于重复拍卖中的战略投标,实现了30-40%的遗憾降低。
Pepti-Agent是一个用于治疗性多肽设计的闭环AI框架,它利用MCP工具和LLM控制器,基于多属性配置文件迭代优化序列,解决了溶解度、溶血性和非特异性吸附等约束条件。
本文提出DOMOO,一种多样性驱动的离线多目标优化方法,通过累积风险控制和嵌套帕累托集学习来解决分布外问题,在基准测试中实现了优异的收敛性和多样性。
本文提出了一种决策支持框架,用于优化权益证明区块链中的验证者选择,通过多目标优化和交互式偏好学习,平衡投资组合的质量与分散化。