标签
本文提出了带有背包约束的上下文老虎机的新的重优化算法,实现了平均遗憾界 O((ln T)^3 / T),并改进了现有结果。
本文研究了三种信息不对称机制下具有重尾奖励的多智能体多臂老虎机问题,提出了鲁棒的分布式算法,其遗憾保证几乎匹配集中式算法的速率,并在帕累托分布奖励环境中进行了验证。
本文介绍了一种针对具有精确最小曝光约束的随机赌博机问题的差异舍入框架,实现了由非强制性预算而非时间范围控制的公平遗憾。该框架提出了具有极小极大和实例依赖最优性保证的算法,可处理时变和重叠群体下限,并通过实验验证。
本文研究了一种随机线性赌博机问题,其中智能体仅能观测到动作坐标的随机子集,证明了当动作具有低本征维度时可以实现次线性遗憾,并提出了一种具有理论保证的TOFU-POV算法。
本文证明了贝叶斯更新和乘法权重更新的遗憾满足一个精确的信息核算恒等式,将学习者的额外损失分解为不确定性支付和到任意比较器的信息距离减少。累积支付定义了内在时间,从而得到了精确的自适应遗憾分解,统一了 Hedge、贝叶斯模型平均、在线凸优化等算法。
本文将嵌入模型路由形式化为具有低秩专家的对抗性上下文线性赌博机,提出了Hypentropy策略梯度(HPG)算法,该算法实现了O~(s√(MT))的策略遗憾,避免了维度灾难。
本文形式化了LLM维基的流式知识编译,引入了一个重要性信号,用于在token预算下从流式语料库中主动固定重要文档。它证明了O(√(T log K))的遗憾界,并在金融和维基百科领域验证了该方法,表明遗憾分析是一种可靠的评估指标。
本文介绍了一种面向自适应查询和选择LLM API的在线上下文Pandora's Box模型,提出了一种结合GMM估计与UCB风格置信区间的学习方法,并证明了维度相关的遗憾界。
提出了一种用于移动众包中LLM微调的真实在线偏好聚合机制,解决了策略性工人误报问题,并实现了次线性遗憾。
本笔记分享了一个研究瞬间,Codex 帮助找到了私有线性赌博机中一种新的稀有切换规则,利用广义瑞利商克服了因高斯噪声导致的行列式单调性失效问题。