标签
本文介绍了Lexi-LowGLM,一种针对具有多个优先级目标的广义低秩矩阵老虎机的高效算法,利用在线牛顿更新来降低计算复杂度,并实现依赖于有效低秩维度的遗憾界。
本文介绍了 THV-UCB,一种用于带有板选择的多目标老虎机问题的算法,并建立了超体积遗憾的无间隙和依赖间隙的遗憾界。
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
本文引入了一种基于切比雪夫标量化的新颖偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明了该算子的收敛性及其在捕获完整帕累托前沿方面的有效性。
提出一种多目标强化学习框架,结合语义嵌入与Pareto-DQN,在推荐中平衡参与度、多样性和公平性,缓解过滤气泡问题。
介绍了一种基于强化学习的整体数据调度器(HDS),该框架利用多目标奖励函数在LLM预训练过程中动态调整数据混合策略,使达到目标困惑度所需的迭代次数减少44%,并在MMLU上提升7.2%。
本文提出了一种面向锂生产多目标决策的POMDP框架,处理地质、需求与定价不确定性,以优化矿山开采及提取方法选择。该方法通过信念状态规划动态适应价格机制变化,优于基于人类启发式的方法。
CRAFT 是一种帕累托前沿提示优化器,通过使用 NSGA-II 和预算感知验证,在准确率-成本权衡前沿上维持多样化的提示种群,从而联合优化准确率与 token 成本,同时避免加权求和方法所导致的"标量化坍塌"问题。
介绍WeCon,一种用于多目标组合优化问题的权重条件神经求解器,其超体积与现有最优方法相当,同时推理时间减少40%。
本文介绍了 MOCI,这是一种新颖的框架,能够从强化学习中的异构专家演示中推断共享约束和个体偏好,在预测性能和计算效率方面均优于现有基线。